RegEx匹配除XHTML自包含标记之外的开放标记

我需要匹配所有这些开头标记：

<p>
<a href="foo">

但不是这些：

<br />
<hr class="foo" />

我想出了这个，想确保我做得对。我只是在捕捉a-z。

<([a-z]+) *[^/]*?>

我相信上面写着：

找到一个小于，然后查找（并捕获）a-z一次或多次，然后找到零个或多个空格，然后查找任何字符零次或多次，贪婪，除了/，然后查找大于

我有这个权利吗？更重要的是，你怎么看？

当前回答

您希望第一个>前面不带/。请查看此处了解如何执行此操作的详细信息。这被称为消极的后顾。

然而，在这个示例文档中，这一天真的实现最终将与<bar/></foo>匹配

<foo><bar/></foo>

你能提供更多关于你试图解决的问题的信息吗？您是否以编程方式遍历标签？

2009-11-13 22:47:17

其他回答

我认为这里的缺陷是HTML是Chomsky Type 2语法（上下文无关语法），正则表达式是ChomskyType 3语法（正则语法）。由于第2类语法从根本上比第3类语法更复杂（请参见乔姆斯基层次结构），因此不可能实现这一点。

但很多人会尝试，有些人甚至会声称成功，但直到其他人发现错误并将你彻底搞砸。

2009-11-18 18:42:40

我以前使用过一个名为HTMLParser的开源工具。它被设计为以各种方式解析HTML，并且很好地达到了目的。它可以将HTML解析为不同的树节点，您可以轻松地使用它的API从节点中获取属性。看看它，看看这对你有没有帮助。

2009-11-16 18:34:50

我想这可能有用

<[a-z][^<>]*(?:(?:[^/]\s*)|(?:\s*[^/]))>

这可以在这里进行测试。

根据W3学校。。。

XML命名规则

XML元素必须遵循以下命名规则：

名称可以包含字母、数字和其他字符名称不能以数字或标点字符开头名称不能以字母xml（或xml、xml等）开头名称不能包含空格可以使用任何名称，不保留任何单词。

我使用的模式将遵循这些规则。

2012-05-26 13:25:16

RegEx匹配除XHTML自包含标记之外的开放标记跳过所有其他标记（和内容）。

这个正则表达式就是这样做的。如果您只需要匹配特定的Open标记，请列出一个列表替换（？：p | br |＜whatever tags you want＞）并替换[\w:]+构造在下面的适当位置。

https://regex101.com/r/uMvJn0/1

 # Mix html/xml     
 # https://regex101.com/r/uMvJn0/1     
 
 <
 (?:
    
    # Invisible content gets failed
    
    (?:
       (?:
                               # Invisible content; end tag req'd
          (                    # (1 start)
             script
           | style
           | object
           | embed
           | applet
           | noframes
           | noscript
           | noembed 
          )                    # (1 end)
          (?:
             \s+ 
             (?>
                " [\S\s]*? "
              | ' [\S\s]*? '
              | (?:
                   (?! /> )
                   [^>] 
                )?
             )+
          )?
          \s* >
       )
       
       [\S\s]*? </ \1 \s* 
       (?= > )
       (*SKIP)(*FAIL)
    )
    
  | 
    
    # This is any open html tag we will match
    
    (?:
       [\w:]+ \b 
       (?=
          (                    # (2 start)
             (?:
                " [\S\s]*? " 
              | ' [\S\s]*? ' 
              | [^>]? 
             )*
          )                    # (2 end)
          >
       )
       \2 
       (?<! / )
    )
    
  | 
    # All other tags get failed
    
    (?:
       (?: /? [\w:]+ \s* /? )
     | (?:
          [\w:]+ 
          \s+ 
          (?:
             " [\S\s]*? " 
           | ' [\S\s]*? ' 
           | [^>]? 
          )+
          \s* /?
       )
     | \? [\S\s]*? \?
     | (?:
          !
          (?:
             (?: DOCTYPE [\S\s]*? )
           | (?: \[CDATA\[ [\S\s]*? \]\] )
           | (?: -- [\S\s]*? -- )
           | (?: ATTLIST [\S\s]*? )
           | (?: ENTITY [\S\s]*? )
           | (?: ELEMENT [\S\s]*? )
          )
       )
    )
    (*SKIP)(*FAIL)
 )
 >

2020-10-01 18:55:20

OP似乎没有说他需要用标签做什么。例如，他需要提取内部文本，还是只检查标签？

我坚定地认为正则表达式不是万能的文本解析器。我已经编写了大量的文本解析代码，包括用于解析HTML标记的代码。

虽然我确实对正则表达式不太在行，但我认为正则表达式太死板，很难维护这种解析。

2011-03-06 12:38:47

RegEx匹配除XHTML自包含标记之外的开放标记

推荐文章

最新文章

标签