
正则的口碑两极分化,多数是被教程里的大而全吓退的。实际写业务,常用的就是下面这些。
一、骨架元字符
d w s:数字、字母数字下划线、空白,加+表示一个或多个。.:任意字符(除换行);.*?是非贪婪通吃的万能懒惰组合。^ $:行首行尾锚点,日志匹配里常用。
二、捕获与引用
圆括号捕获分组,1 反向引用;替换时用 $1 拼新串。比如把日期 2026-08-27 换成 08/27,捕获两个数字组一替换就完事。
三、非贪婪是救命稻草
匹配 HTML 标签内容时 <p>.*</p> 会一路吃到最后一行,.*? 遇到第一个闭合就停,这正是大多数人正则”失控”的原因。
四、调试方法
把模式拆小逐段验证:先匹配锚点,再加分组,最后加量词。正则线上测试工具支持逐步高亮,排查错在哪一段非常直观。
五、边界提醒
正则解析嵌套结构(如多层括号、完整 HTML)是不可行的,别硬来,换解析器。


