什么是正则表达式中的非捕获组？

如何在正则表达式中使用非捕获组，即（？：），它们有什么好处？

当前回答

让我用一个例子来解释一下。

考虑以下文本：

http://stackoverflow.com/
https://stackoverflow.com/questions/tagged/regex

现在，如果我在上面应用下面的正则表达式。。。

(https?|ftp)://([^/\r\n]+)(/[^\r\n]*)?

…我会得到以下结果：

Match "http://stackoverflow.com/"
     Group 1: "http"
     Group 2: "stackoverflow.com"
     Group 3: "/"

Match "https://stackoverflow.com/questions/tagged/regex"
     Group 1: "https"
     Group 2: "stackoverflow.com"
     Group 3: "/questions/tagged/regex"

但我不在乎协议——我只想要URL的主机和路径。因此，我将正则表达式更改为包含非捕获组（？：）。

(?:https?|ftp)://([^/\r\n]+)(/[^\r\n]*)?

现在，我的结果如下：

Match "http://stackoverflow.com/"
     Group 1: "stackoverflow.com"
     Group 2: "/"

Match "https://stackoverflow.com/questions/tagged/regex"
     Group 1: "stackoverflow.com"
     Group 2: "/questions/tagged/regex"

看见第一组尚未捕获。解析器使用它来匹配文本，但稍后在最终结果中忽略它。

编辑：

根据要求，让我也尝试解释一下群体。

嗯，团体有很多目的。它们可以帮助您从更大的匹配（也可以命名）中提取准确的信息，让您重新匹配先前匹配的组，并可以用于替换。让我们来举几个例子，好吗？

假设您有某种XML或HTML（请注意，regex可能不是这项工作的最佳工具，但它是一个很好的示例）。你想解析标签，所以你可以这样做（我添加了空格以便于理解）：

   \<(?<TAG>.+?)\> [^<]*? \</\k<TAG>\>
or
   \<(.+?)\> [^<]*? \</\1\>

第一个正则表达式有一个命名组（TAG），而第二个正则表达式使用一个公共组。两个正则表达式都执行相同的操作：它们使用第一个组中的值（标记的名称）来匹配结束标记。不同之处在于，第一个使用名称来匹配值，第二个使用组索引（从1开始）。

让我们现在尝试一些替换。考虑以下文本：

Lorem ipsum dolor sit amet consectetuer feugiat fames malesuada pretium egestas.

现在，让我们在上面使用这个哑正则表达式：

\b(\S)(\S)(\S)(\S*)\b

此正则表达式匹配至少包含3个字符的单词，并使用组分隔前三个字母。结果是：

Match "Lorem"
     Group 1: "L"
     Group 2: "o"
     Group 3: "r"
     Group 4: "em"
Match "ipsum"
     Group 1: "i"
     Group 2: "p"
     Group 3: "s"
     Group 4: "um"
...

Match "consectetuer"
     Group 1: "c"
     Group 2: "o"
     Group 3: "n"
     Group 4: "sectetuer"
...

因此，如果我们应用替换字符串：

$1_$3$2_$4

…在它上面，我们尝试使用第一个组，添加下划线，使用第三个组，然后是第二个组，再添加另一个下划线，最后是第四个组。生成的字符串将与下面的字符串类似。

L_ro_em i_sp_um d_lo_or s_ti_ a_em_t c_no_sectetuer f_ue_giat f_ma_es m_la_esuada p_er_tium e_eg_stas.

您也可以使用命名组进行替换，使用${name}。

要玩正则表达式，我建议http://regex101.com/，提供了有关正则表达式工作方式的大量详细信息；它还提供了一些正则表达式引擎供选择。

2010-08-18 15:39:32

其他回答

?: 当您想对表达式进行分组，但不想将其保存为字符串的匹配/捕获部分时，使用。

一个例子是匹配IP地址：

/(?:\d{1,3}\.){3}\d{1,3}/

请注意，我不在乎保存前3个八位字节，但（？：…）分组允许我缩短正则表达式，而不会导致捕获和存储匹配项的开销。

2010-08-18 13:22:05

在复杂的正则表达式中，可能会出现这样的情况：您希望使用大量的组，其中一些组用于重复匹配，另一些组用于提供反向引用。默认情况下，匹配每个组的文本将加载到backreference数组中。如果我们有很多组，并且只需要能够从backreference数组中引用其中的一些组，我们可以重写此默认行为，告诉正则表达式某些组只用于重复处理，不需要捕获并存储在backreference阵列中。

2014-03-08 17:33:15

tl；dr非捕获组，顾名思义，是正则表达式中不希望包含在匹配中的部分，以及？：是一种将组定义为非捕获的方法。

假设你有一个电子邮件地址example@example.com.以下正则表达式将创建两个组，id部分和@example.com部分。（\p｛Alpha｝*[a-z]）（@example.com）。为了简单起见，我们提取了包括@字符在内的整个域名。

现在让我们假设，您只需要地址的id部分。您要做的是获取匹配结果的第一个组，在正则表达式中用（）包围，这样做的方法是使用非捕获组语法，即？：。因此，正则表达式（\p｛Alpha｝*[a-z]）（？：@example.com）将只返回电子邮件的id部分。

2018-05-11 05:27:03

历史动机：

非捕获组的存在可以用括号来解释。

考虑表达式（a|b）c和a|bc，由于串联优先于|，这些表达式分别表示两种不同的语言（{ac，bc}和{a，bc}）。

然而，括号也用作匹配组（如其他答案所解释的…）。

当您想有括号但不想捕获子表达式时，可以使用NON-CAPTURING GROUPS。在示例中，（？：a|b）c

2016-02-04 08:07:28

让我举个例子：

Regex代码：（？：animal）（？：=）（\w+）（，）\1\2

搜索字符串：

第1行-动物=猫、狗、猫、老虎、狗

第2行-动物=猫、猫、狗、狗、老虎

第3行-动物=狗、狗、猫、猫、老虎

（？：动物）-->未捕获组1

（？：=）-->未捕获组2

（\w+）-->捕获的组1

（，）-->捕获的组2

\1-->捕获组1的结果，即第1行是猫，第2行是猫、第3行是狗。

\2-->捕获组2的结果，即逗号（，）

因此，在这段代码中，通过给出“1”和“2”，我们在代码后面分别回忆或重复捕获的组1和组2的结果。

根据代码的顺序，（？：动物）应为第1组，（？=）应为2组，并继续。。

但通过给出？：我们使匹配组不被捕获（在匹配组中不计数，因此分组编号从第一个捕获的组开始，而不是未捕获的组），这样以后就不能在代码中调用匹配组（？：动物）结果的重复。

希望这能解释非捕获组的使用。

2017-01-19 11:36:40

什么是正则表达式中的非捕获组？

推荐文章

最新文章

标签