EditPlus正则表达式替换字符串详解

作者:我就是个世界 发表于:2008-06-05
[color=#A0522D]     上万条的数据用EditPlus做批处理,原以为不能多行替换,结果累了两天,因为不懂得正则表达式,所以效率超低,今天找到了一些实例和教程,用之,真是太方便了,速度之快,好用,记录之~[/color]
    正则表达式是一个查询的字符串,它包含一般的字符和一些特殊的字符,特殊字符可以扩展查找字符串的能力,正则表达式在查找和替换字符串的作用不可忽视,它能很好提高工作效率。

首先贴出测试工具:
[url=http://regexpal.com/]Javascript正则表达式在线测试工具[/url]

[quote]
正则表达式是一个包含普通文本加上指示为扩展特殊字符的搜索字符串的搜索选项。正则表达式允许更多的高级搜索和替换。

例如,您可以使用正则表达式“[0-9]”查找任何的数字。同样地您可以使用正则表达式“[^0-9]”查找任何匹配的非数字的字符。

在查找、替换以及在文件中查找命令中,EditPlus 支持下列的正则表达式。

表达式 描述
\t 制表(跳格)字符。
\n 换行。
. 匹配任何字符。
| 在它的左边和右边的任何一个表达式匹配目标字符串。例如“a|b”匹配“a”和“b”。
[] 括号内的任何字符可能匹配目标字符。例如“[ab]”匹配“a”和“b”;“[0-9]”匹配任何数字。
[^] 括号内的没有任何字符可能匹配目标字符。例如“[^ab]”匹配“a”和“b”除外的所有字符;“[^0-9]”匹配任何非数字的字符。
* 在星号左边的字符在表达式中可能匹配 0 次或多次。例如“be*”匹配“b”,“be”和“bee”。
+ 在加号左边的字符在表达式中可能匹配 1 次或多次。例如“be+”匹配“be”和“bee”,但不匹配“b”。
? 在问号左边的字符在表达式中可能匹配 0 次或 1 次。例如“be?”匹配“b”和“be”,但不匹配“bee”。
^ 仅当 ^ 右边的表达式在行开始的位置时匹配。例如“^A”仅匹配在行开始位置的“A”。
$ 仅当 $ 左边的表达式在行结束的位置时匹配。例如“e$”仅匹配在行结束位置的“e”。
() 影响表达式的计算顺序同时也用来标记表达式。
\ 转义字符。若您要使用字符“\”本身,您必须使用“\\”。
已标记的表达式是由()围住的。标记的表达式可以被 \0、\1、\2、\3 等引用。\0 指示一个匹配完整子串的标记的表达式。\1 指示第一个标记的表达式,\2 是第二个,等等。查看下列的例子。

原文     搜索       替换        结果
abc     (ab)(c)    \0-\1-\2   abc-ab-c
abca    (b)(c)     \0-\1-\2   abc-b-c
abc     (a)b(c)    \0-\1-\2   abc-a-c
[/quote]
[color=#FF0000]Editplus中无法使用[b]{ }[/b] 标记限定符表达式的开始。如{n} 重复次[/color]


[strike]
EditPlus的查找,替换,文件中查找支持以下的正则表达式:

[code]Expression Description
\t Tab character.
\n New line.
. Matches any character.
| Either expression on its left and right side matches the target string.
For example, “a|b” matches “a” and “b”.
[] Any of the enclosed characters may match the target character.
For example, “[ab]” matches “a” and “b”. “[0-9]” matches any digit.
[^] None of the enclosed characters may match the target character.
For example, “[^ab]” matches all character EXCEPT “a” and “b”.
“[^0-9]” matches any non-digit character.
* Character to the left of asterisk in the expression should match 0 or more times.
For example “be*” matches “b”, “be” and “bee”.
+ Character to the left of plus sign in the expression should match 1 or more times.
For example “be+” matches “be” and “bee” but not “b”.
? Character to the left of question mark in the expression should match 0 or 1 time.
For example “be?” matches “b” and “be” but not “bee”.
^ Expression to the right of ^ matches only when it is at the beginning of line.
For example “^A” matches an “A” that is only at the beginning of line.
$ Expression to the left of $ matches only when it is at the end of line.
For example “e$” matches an “e” that is only at the end of line.
() Affects evaluation order of expression and also used for tagged expression.
\ scape character. If you want to use character “\” itself, you should use “\\”.[/code][/strike]

例子:[separator]

原始串

[code]str[1]abc[991];
str[2]abc[992];
str[11]abc[993];
str[22]abc[994];
str[111]abc[995];
str[222]abc[996];
str[1111]abc[997];
str[2222]abc[999];[/code]

目标串:

[code]abc[1];
abc[2];
abc[11];
abc[22];
abc[111];
abc[222];
abc[1111];
abc[2222];[/code]

处理:
查找串:
[code]str\[([0-9]+)\]abc\[[0-9]+\][/code]
替换串:
[code]abc[\1][/code]

【1】正则表达式应用——替换指定内容到行尾
原始文本如下面两行

[code]abc aaaaa
123 abc 444[/code]

希望每次遇到“abc”,则替换“abc”以及其后到行尾的内容为“abc efg”
即上面的文本最终替换为:

[code]abc efg
123 abc efg[/code]

解决:
① 在替换对话框,查找内容里输入“abc.*”
② 同时勾选“正则表达式”复选框,然后点击“全部替换”按钮
其中,符号的含义如下:
“.” =匹配任意字符
“*” =匹配0次或更多

注意:其实就是正则表达式替换,这里只是把一些曾经提出的问题加以整理,单纯从正则表达式本身来说,就可以引申出成千上万种特例。

【2】正则表达式应用——数字替换
希望把

[code]asdadas123asdasdas456asdasdasd789asdasd[/code]
替换为:

[code]asdadas[123]asdasdas[456]asdasdasd[789]asdasd[/code]

在替换对话框里面,勾选“正则表达式”复选框;
在查找内容里面输入“[0-9][0-9][0-9]”,不含引号
“替换为:”里面输入“[\0\1\2]”,不含引号
范围为你所操作的范围,然后选择替换即可。

实际上这也是正则表达式的使用特例,“[0-9]”表示匹配0~9之间的任何特例,同样“[a-z]”就表示匹配a~z之间的任何特例
上面重复使用了“[0-9]”,表示连续出现的三个数字
“\0”代表第一个“[0-9]”对应的原型,“\1”代表第二个“[0-9]”对应的原型,依此类推
“[”、“]”为单纯的字符,表示添加“[”或“]”,如果输入“其它\0\1\2其它”,则替换结果为:

asdadas其它123其它asdasdas其它456其它asdasdasd其它789其它asdasd

功能增强(by jiuk2k):
如果将查找内容“[0-9][0-9][0-9]”改为“[0-9]*[0-9]”,对应1 或 123 或 12345 或 …
大家根据需要定制

相关内容还有很多,可以自己参考正则表达式的语法仔细研究一下

【3】正则表达式应用——删除每一行行尾的指定字符
因为这几个字符在行中也是出现的,所以肯定不能用简单的替换实现
比如
12345 1265345
2345
需要删除每行末尾的“345”
这个也算正则表达式的用法,其实仔细看正则表达式应该比较简单,不过既然有这个问题提出,说明对正则表达式还得有个认识过程,解决方法如下
解决:
在替换对话框中,启用“正则表达式”复选框
在查找内容里面输入“345$”
这里“$”表示从行尾匹配

如果从行首匹配,可以用“^”来实现,不过 EditPlus 有另一个功能可以很简单的删除行首的字符串
a. 选择要操作的行
b. 编辑-格式-删除行注释
c. 在弹出对话框里面输入要清除的行首字符,确定

【4】正则表达式应用——替换带有半角括号的多行
几百个网页中都有下面一段代码:
\n
在替换对话框启用“正则表达式”选项,这时就可以完成替换了

【5】正则表达式应用——删除空行
启动EditPlus,打开待处理的文本类型文件。
①、选择“查找”菜单的“替换”命令,弹出文本替换对话框。选中“正则表达式”复选框,表明我们要在查找、替换中使用正则表达式。然后,选中“替换范围”中的“当前文件”,表明对当前文件操作。
②、单击“查找内容”组合框右侧的按钮,出现下拉菜单。
③、下面的操作添加正则表达式,该表达式代表待查找的空行。(技巧提示:空行仅包括空格符、制表符、回车符,且必须以这三个符号之一作为一行的开头,并且以回车符结尾,查找空行的关键是构造代表空行的正则表达式)。
直接在”查找”中输入正则表达式“^[ \t]*\n”,注意\t前有空格符。
(1)选择“从行首开始匹配”,“查找内容”组合框中出现字符“^”,表示待查找字符串必须出现在文本中一行的行首。
(2)选择“字符在范围中”,那么在“^”后会增加一对括号“[]”,当前插入点在括号中。括号在正则表达式中表示,文本中的字符匹配括号中任意一个字符即符合查找条件。
(3)按一下空格键,添加空格符。空格符是空行的一个组成成分。
(4)选择“制表符”,添加代表制表符的“\t”。
(5)移动光标,将当前插入点移到“]”之后,然后选择“匹配 0 次或更多”,该操作会添加星号字符“*”。星号表示,其前面的括号“[]”内的空格符或制表符,在一行中出现0个或多个。
(6)选择“换行符”,插入“\n”,表示回车符。
④、“替换为”组合框保持空,表示删除查找到的内容。单击“替换”按钮逐个行删除空行,或单击“全部替换”按钮删除全部空行(注意:EditPlus有时存在“全部替换”不能一次性完全删除空行的问题,可能是程序BUG,需要多按几次按钮)。

1.在汉化的时候,是否经常碰到这样的语句需要翻译:


[code]
“Error adding the post!”;
“Error adding the comment!”;
“Error adding the user!”;[/code]

如果有很多类似的文件一个一个翻译显然很累而且感觉很无聊。

其实可以这样处理,在Editplus里面用 替换 功能,在替换对话框选中“正则表达式”复选框:
查找原文件:


[code]“Error adding ([^!|”|;]*)[/code]

替换成:


[code]“在增加\1时发生错误[/code]

这样替换之后发生了什么?结果是:

[code]“在增加the post时发生错误!”;
“在增加the comment时发生错误!”;
“在增加the user时发生错误!”;[/code]

ok,接下来你会怎么做?当然再替换一次把the post、the comment、the user替换成你要翻译的词。得到最后的结果:

[code]“在增加帖子时发生错误!”;
“在增加评论时发生错误!”;
“在增加用户时发生错误!”;[/code]

2.要提取的单词在中间,比如:

[code]can not be deleted because
can not be added because
can not be updating because[/code]

可以用这种方式:
在Editplus里面用 替换 功能,在替换对话框选中“正则表达式”复选框:
查找原文件:

[code]can not be ([^ ]*) because[/code]

替换成:

[code]无法被\1因为[/code]

这样替换之后发生了什么?结果是:

[code]无法被deleted因为
无法被added因为
无法被updating因为[/code]

其余步骤如上。

在汉化量很大而且句式比较单调的情况下对效率的提高很明显!

解释一下:([^!|”|;]*) 的意思是 不等于 ! 和 ” 和 ; 中的任何一个,意思就是这3个字符之外的所有字符将被选中(替换区域);
\1 即被选中的替换区域所在的新位置(复制到这个新位置)。

3.经常手工清理一行一行地删除文本文件里面的空白行,其实可以交给Editplus更好的完成,在Editplus里面用替换功能,在替换对话框选中“正则表达式”复选框:
查找原文件:

[code]^[ \t]*\n[/code]

替换部分为空就可以删除空白行了,执行一下看看:)

[quote]abandon[2′b9nd2n]v.抛弃,放弃
abandonment[2′b9nd2nm2nt]n.放弃
abbreviation[2bri:vi’ei62n]n.缩写
abeyance[2′bei2ns]n.缓办,中止
abide[2′baid]v.遵守
ability[2′biliti]n.能力
able[’eibl]adj.有能力的,能干的
abnormal[9b’n0:m2l]adj.反常的,变态的
aboard[2′b0:d]adv.船(车)上[/quote]

1.
查找:
[code](^[a-zA-Z0-0\-]+)(\[*.*\]+)(.*)[/code]
替换:
[code] @@@@@”\1″,”\2″,”\3″,[/code]
效果:

[code]@@@@@”abandon”,”[2′b9nd2n]”,”v.抛弃,放弃”,
@@@@@”abandonment”,”[2′b9nd2nm2nt]”,”n.放弃”,
@@@@@”abbreviation”,”[2bri:vi’ei62n]”,”n.缩写”,
@@@@@”abeyance”,”[2′bei2ns]”,”n.缓办,中止”,
@@@@@”abide”,”[2′baid]”,”v.遵守”,
@@@@@”ability”,”[2′biliti]”,”n.能力”,
@@@@@”able”,”[’eibl]”,”adj.有能力的,能干的”,
@@@@@”abnormal”,”[9b’n0:m2l]”,”adj.反常的,变态的”,
@@@@@”aboard”,”[2′b0:d]”,”adv.船(车)上”,[/code]

2.
查找:
[code]\n[/code]
替换:

[code]注: 要次替换内容为空[/code]
效果:

[code]@@@@@”abandon”,”[2′b9nd2n]”,”v.抛弃,放弃”,@@@@@”abandonment”,”[2′b9nd2nm2nt]”,”n.放弃”,@@@@@”abbreviation”,”[2bri:vi’ei62n]”,”n.缩写”,@@@@@”abeyance”,”[2′bei2ns]”,”n.缓办,中止”,@@@@@”abide”,”[2′baid]”,”v.遵守”,@@@@@”ability”,”[2′biliti]”,”n.能力”,@@@@@”able”,”[’eibl]”,”adj.有能力的,能干的”,@@@@@”abnormal”,”[9b’n0:m2l]”,”adj.反常的,变态的”,@@@@@”aboard”,”[2′b0:d]”,”adv.船(车)上”,@@@@@”abolish”,”[2′b0li6]”,”v.废除,取消”,@@@@@”abolition”,”[9b2′li62n]”,”n.废除,取消”[/code]

3.
查找:
[code]@@@@@[/code]
替换:
[code]\n[/code]
效果:

[code]“abandon”,”[2′b9nd2n]”,”v.抛弃,放弃”,
“abandonment”,”[2′b9nd2nm2nt]”,”n.放弃”,
“abbreviation”,”[2bri:vi’ei62n]”,”n.缩写”,
“abeyance”,”[2′bei2ns]”,”n.缓办,中止”,
“abide”,”[2′baid]”,”v.遵守”,
“ability”,”[2′biliti]”,”n.能力”,
“able”,”[’eibl]”,”adj.有能力的,能干的”,
“abnormal”,”[9b’n0:m2l]”,”adj.反常的,变态的”,
“aboard”,”[2′b0:d]”,”adv.船(车)上”,
“abolish”,”[2′b0li6]”,”v.废除,取消”,[/code]

[quote]
-------------这部分是从网上引用过来的内容,并未全部亲测------------------

^[  \t]*\n
这个正则表达式代表所有的空行,指含有零个或零个以上空格或制表符、以换行符结尾、不含其它字符的行。

(^|(?<=中国)).*?(?=中国|$)
用正则表达式匹配特定字符串外的所有字符。指除“中国”外的所有其它字符,类似于反选功能。

^[  \t]+
查找以上字符,并替换为空,可删除行首空白(包括全半角空格和制表符)。

[  \t]+$
查找以上字符,并替换为空,可删除行末空白(包括全半角空格和制表符)。

^[  \t]+|[  \t]+$
查找以上正则表达式,并替换为空,可删除行首和行末所有空白(包括全半角空格和制表符)。


匹配中文字符的正则表达式: [\u4e00-\u9fa5]
评注:匹配中文还真是个头疼的事,有了这个表达式就好办了

匹配双字节字符(包括汉字在内):[^\x00-\xff]
评注:可以用来计算字符串的长度(一个双字节字符长度计2,ASCII字符计1)

匹配空白行的正则表达式:\n\s*\r
评注:可以用来删除空白行

匹配HTML标记的正则表达式:< (\S*?)[^>]*>.*?|< .*? />
评注:网上流传的版本太糟糕,上面这个也仅仅能匹配部分,对于复杂的嵌套标记依旧无能为力

匹配首尾空白字符的正则表达式:^\s*|\s*$
评注:可以用来删除行首行尾的空白字符(包括空格、制表符、换页符等等),非常有用的表达式

匹配Email地址的正则表达式:\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*
评注:表单验证时很实用

匹配网址URL的正则表达式:[a-zA-z]+://[^\s]*
评注:网上流传的版本功能很有限,上面这个基本可以满足需求

匹配帐号是否合法(字母开头,允许5-16字节,允许字母数字下划线):^[a-zA-Z][a-zA-Z0-9_]{4,15}$
评注:表单验证时很实用

匹配国内电话号码:\d{3}-\d{8}|\d{4}-\d{7}
评注:匹配形式如 0511-4405222 或 021-87888822

匹配腾讯QQ号:[1-9][0-9]{4,}
评注:腾讯QQ号从10000开始

匹配中国邮政编码:[1-9]\d{5}(?!\d)
评注:中国邮政编码为6位数字

匹配身份证:\d{15}|\d{18}
评注:中国的身份证为15位或18位

匹配ip地址:\d+\.\d+\.\d+\.\d+
评注:提取ip地址时有用

匹配特定数字:
^[1-9]\d*$    //匹配正整数
^-[1-9]\d*$   //匹配负整数
^-?[1-9]\d*$   //匹配整数
^[1-9]\d*|0$  //匹配非负整数(正整数 + 0)
^-[1-9]\d*|0$   //匹配非正整数(负整数 + 0)
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*$   //匹配正浮点数
^-([1-9]\d*\.\d*|0\.\d*[1-9]\d*)$  //匹配负浮点数
^-?([1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0)$  //匹配浮点数
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0$   //匹配非负浮点数(正浮点数 + 0)
^(-([1-9]\d*\.\d*|0\.\d*[1-9]\d*))|0?\.0+|0$  //匹配非正浮点数(负浮点数 + 0)
评注:处理大量数据时有用,具体应用时注意修正

匹配特定字符串:
^[A-Za-z]+$  //匹配由26个英文字母组成的字符串
^[A-Z]+$  //匹配由26个英文字母的大写组成的字符串
^[a-z]+$  //匹配由26个英文字母的小写组成的字符串
^[A-Za-z0-9]+$  //匹配由数字和26个英文字母组成的字符串
^\w+$  //匹配由数字、26个英文字母或者下划线组成的字符串
评注:最基本也是最常用的一些表达式

^.*John.*$
匹配包括“John”的整行。
[/quote]


--------   笔记 ------------------   使用Editplus对SQL数据进行整理 --------  HLL的分隔线 ----------------------------------------
Editplus对数据的处理能力是相当快的。几十万条数据的替换十几秒到几十秒就完成了。

替换SQL数据

原始串
[code]
(1, 1300000, '北京市', '联通GSM卡'),
(2, 1300010, '北京市', '联通GSM卡'),
(3, 1300011, '北京市', '联通GSM卡'),
(47, 1300198, '北京市', '联通GSM卡'),
(48, 1300199, '北京市', '联通GSM卡'),
(101454, 1517734, '广西省桂林市', '移动全球通卡'),
(101455, 1517735, '广西省桂林市', '移动全球通卡'),
(160235, 1897713, '广西省南宁', '电信天翼卡'),
(160236, 1897714, '广西省南宁', '电信天翼卡'),
[/code]

目标串
[code]
('', 1300000, '北京市', '联通GSM卡'),
('', 1300010, '北京市', '联通GSM卡'),
('', 1300011, '北京市', '联通GSM卡'),
('', 1300198, '北京市', '联通GSM卡'),
('', 1300199, '北京市', '联通GSM卡'),
('', 1517734, '广西省桂林市', '移动全球通卡'),
('', 1517735, '广西省桂林市', '移动全球通卡'),
('', 1897713, '广西省南宁', '电信天翼卡'),
('', 1897714, '广西省南宁', '电信天翼卡'),
[/code]

正则查找:
[code](\()([0-9]+)(\,)[/code]
替换:
[code]\1''\3[/code]

要替换上面的数据N条,中间间隔有这样的代码:
[code]INSERT INTO `mobile_copy` (`mid`, `mnum`, `City`, `MobileCard`) VALUES[/code]
替换掉且不能有空行,正则代码:
[code].*VALUES\n[/code]

---------------------------- HLL line ---------------------------------
Editplus中完美匹配一个IP地址
[code]((2[0-4]|25[0-5]|[01]?[0-9][0-9]?)\.)((2[0-4]|25[0-5]|[01]?[0-9][0-9]?)\.)((2[0-4]|25[0-5]|[01]?[0-9][0-9]?)\.)(2[0-4]|25[0-5]|[01]?[0-9][0-9]?))[/code]

可以使用以下的两种方法来替换中文或双字节字符
[code]
匹配中文字符的正则表达式: [\u4e00-\u9fa5]
评注:匹配中文还真是个头疼的事,有了这个表达式就好办了

匹配双字节字符(包括汉字在内):[^\x00-\xff]
评注:可以用来计算字符串的长度(一个双字节字符长度计2,ASCII字符计1)
[/code]

IP后面的多个空格可以使用[code] +[/code] [color=#FF0000]空格+[/color] 来匹配

[url=http://regexpal.com/]Javascript正则表达式在线测试工具[/url]

分享:

扫一扫在手机阅读、分享本文

请发表您的评论