第一版本可能比较潦草,这算是个备忘录的版本,之后有时间再回来修改
表示字符的:
. 表示除了换行符以外的任意字符
\d 匹配一位数字(0,或1,或2,或……)
-不是元字符,只匹配它本身——连字符或者减号
\s 匹配任意的空白符,包括空格,制表符(Tab),换行符,中文全角空格等
\w 匹配字母或数字或下划线或汉字等
通过[]可以自定义字符集合
如[0-9]代表的含意与\d就是完全一致的:一位数字
\(?0\d{2}[) -]?\d{8} 匹配几种格式的电话号码,像(010)88886666,或022-22334455,或0291234567
表示数量的:
* 重复零次或更多次
+ 重复一次或更多次
? 重复零次或一次
元字符 后面的{2}({8})的意思是前面 元字符 必须连续重复匹配2次(8次)
^ 匹配字符串的开始
$ 匹配字符串的结束
字符转义
如果你想查找元字符本身的话,比如你查找.,或者*,就出现了问题:你没办法指定它们,因为它们会解释成别的意思。这时你就得使用\来取消这些字符的特殊意义。因此,你应该使用.和*。当然要查找\本身,你也得用\.
例如:unibetter\.com匹配unibetter.com,C:\\ Windows匹配C:\Windows。
不知道为什么这好像要两条\才可以转义,不然就会报未知转义序列
cout<< regex_match("g",regex("\\.") );
分枝条件
每一组字符集合都视为一种规则, 分枝条件 具体方法是用 | 把不同的规则分隔开
//3到8个数字 或 字母开头,end结尾的字符串
\d|\w{3,8}.*end
分组
重复单个字符(直接在字符后面加上限定符就行了)
如果想要重复多个字符又该怎么办?
你可以用小括号来指定子表达式(也叫做分组), 然后你就可以指定这个子表达式的重复次数了
// 1到3个start开头,和一个end结尾
(start){1,3}.*end
反义
通过^来取字符集合的补集
例如:
| 代码/语法 | 说明 |
|---|---|
| [^x] | 匹配除了x以外的任意字符 |
| [^aeiou] | 匹配除了aeiou这几个字母以外的任意字符 |
后向引用
匹配这个子表达式的文本
默认情况下,每个分组会自动拥有一个组号,规则是:从左向右,以分组的左括号为标志,第一个出现的分组的组号为1,第二个为2,以此类推。
后向引用用于重复搜索前面某个分组匹配的文本。例如,\1代表分组1匹配的文本。难以理解?请看示例:
// 一个字母,一个数字,加两个和第一个字母相同的字母
\w\d\1\1
你也可以自己指定子表达式的组名。要指定一个子表达式的组名,请使用这样的语法:(?<Word>\w+)(或者把尖括号换成'也行:(?'Word'\w+) ),这样就把\w+的组名指定为Word了。要反向引用这个分组捕获的内容,你可以使用\k<Word>,所以上一个例子也可以写成这样:
\b(?<Word>\w+)\b\s+\k<Word>\b
零宽断言
用于查找在某些内容(但并不包括这些内容)之前或之后的东西
(?=exp)也叫零宽度正预测先行断言,它断言自身出现的位置的后面能匹配表达式exp。比如\b\w+(?=ing\b),匹配以ing结尾的单词的前面部分(除了ing以外的部分),如查找I'm singing while you're dancing.时,它会匹配sing和danc。
(?<=exp)也叫零宽度正回顾后发断言,它断言自身出现的位置的前面能匹配表达式exp。比如(?<=\bre)\w+\b会匹配以re开头的单词的后半部分(除了re以外的部分),例如在查找reading a book时,它匹配ading。
下面这个例子同时使用了这两种断言:(?<=\s)\d+(?=\s)匹配以空白符间隔的数字(再次强调,不包括这些空白符)
负向零宽断言
查找不是某个字符或不在某个字符类里的字符的方法(反义)
\b\wq[^u]\w\b匹配包含后面不是字母u的字母q的单词。但是如果多做测试(或者你思维足够敏锐,直接就观察出来了),你会发现,如果q出现在单词的结尾的话,像Iraq,Benq,这个表达式就会出错。这是因为[^u]总要匹配一个字符,所以如果q是单词的最后一个字符的话,后面的[^u]将会匹配q后面的单词分隔符(可能是空格,或者是句号或其它的什么),后面的\w*\b将会匹配下一个单词,于是\b\wq[^u]\w\b就能匹配整个Iraq fighting。负向零宽断言能解决这样的问题,因为它只匹配一个位置,并不消费任何字符。现在,我们可以这样来解决这个问题:\b\wq(?!u)\w\b。
零宽度负预测先行断言(?!exp),断言此位置的后面不能匹配表达式exp。例如:\d{3}(?!\d)匹配三位数字,而且这三位数字的后面不能是数字;\b((?!abc)\w)+\b匹配不包含连续字符串abc的单词。
同理,我们可以用(?<!exp),零宽度正回顾后发断言来断言此位置的前面不能匹配表达式exp:(?<![a-z])\d{7}匹配前面不是小写字母的七位数字。
一个更复杂的例子:(?<=<(\w+)>).*(?=</\1>)匹配不包含属性的简单HTML标签内里的内容。(<?(\w+)>)指定了这样的前缀:被尖括号括起来的单词(比如可能是<b>) ,然后是.(任意的字符串),最后是一个后缀(?=</\1>)。注意后缀里的/,它用到了前面提过的字符转义;\1则是一个反向引用,引用的正是捕获的第一组,前面的(\w+)匹配的内容,这样如果前缀实际上是<b>的话,后缀就是</b>了。整个表达式匹配的是<b>和</b>之间的内容(再次提醒,不包括前缀和后缀本身)。
注释
常用分组语法
| 分类 | 代码/语法 | 说明 | |
|---|---|---|---|
| 捕获 | (exp) | 匹配exp,并捕获文本到自动命名的组里 | |
| 捕获 | (?exp) | 匹配exp,并捕获文本到名称为name的组里,也可以写成(?'name'exp) | |
| 捕获 | (?:exp) | 匹配exp,不捕获匹配的文本,也不给此分组分配组号 | |
| 零宽断言 | (?=exp) | 匹配exp前面的位置 | |
| 零宽断言 | (?<=exp) | 匹配exp后面的位置 | |
| 零宽断言 | (?!exp) | 匹配后面跟的不是exp的位置 | |
| 零宽断言 | (?<!exp) | 匹配前面不是exp的位置 | |
| 注释 | (?#comment) | 这种类型的分组不对正则表达式的处理产生任何影响,用于提供注释让人阅读 |
我们已经讨论了前两种语法。第三个(?:exp)不会改变正则表达式的处理方式,只是这样的组匹配的容不会像前两种那样被捕获到某个组里面,也不会拥有组号。
贪婪与懒惰
处理选项
平衡组/递归匹配
还有些什么东西没提到
[[:alpha:]]等价于[a-zA-Z]
示例
/*
// 精确地查找hi这个单词
\bhi\b
// 先是一个单词hi,然后是任意个任意字符(但不能是换行),最后是Lucy这个单词
\bhi\b.*\bLucy\b
// 以0开头,然后是两个数字,然后是一个连字号“-”,最后是8个数字
0\d\d-\d\d\d\d\d\d\d\d 或
0\d{2}-\d{8}
// 匹配以字母a开头的单词
\ba\w*\b
// 匹配1个或更多连续的数字
\ba\w*\b
// 匹配刚好6个字母/数字的单词
\b\w{6}\b
// 5位到12位数字
^\d{5,12}$
//3到8个数字或字母开头,end结尾的字符串
\d|\w{3,8}.*end
// 1到3个start开头,和一个end结尾
(start){1,3}.*end
// 一个字母,一个数字,加两个和第一个字母相同的字母
\w\d\1\1
*/
文章参考自 正则表达式30分钟入门教程