RegEx匹配除XHTML自包含标记之外的开放标记

我需要匹配所有这些开头标记：

<p>
<a href="foo">

但不是这些：

<br />
<hr class="foo" />

我想出了这个，想确保我做得对。我只是在捕捉a-z。

<([a-z]+) *[^/]*?>

我相信上面写着：

找到一个小于，然后查找（并捕获）a-z一次或多次，然后找到零个或多个空格，然后查找任何字符零次或多次，贪婪，除了/，然后查找大于

我有这个权利吗？更重要的是，你怎么看？

当前回答

<?php
$selfClosing = explode(',', 'area,base,basefont,br,col,frame,hr,img,input,isindex,link,meta,param,embed');

$html = '
<p><a href="#">foo</a></p>
<hr/>
<br/>
<div>name</div>';

$dom = new DOMDocument();
$dom->loadHTML($html);
$els = $dom->getElementsByTagName('*');
foreach ( $els as $el ) {
    $nodeName = strtolower($el->nodeName);
    if ( !in_array( $nodeName, $selfClosing ) ) {
        var_dump( $nodeName );
    }
}

输出：

string(4) "html"
string(4) "body"
string(1) "p"
string(1) "a"
string(3) "div"

基本上，只需定义自关闭的元素节点名称，将整个html字符串加载到DOM库中，抓取所有元素，循环并过滤掉不自关闭的并对其进行操作。

我确信您现在已经知道不应该为此使用正则表达式。

2009-11-15 14:37:06

其他回答

无法使用正则表达式解析[X]HTML。因为正则表达式无法解析HTML。Regex不是一个可以用来正确解析HTML的工具。正如我之前多次在这里回答的HTML和正则表达式问题一样，正则表达式的使用不允许您使用HTML。正则表达式是一种不够复杂的工具，无法理解HTML所使用的构造。HTML不是一种正则语言，因此不能由正则表达式解析。Regex查询无法将HTML分解为有意义的部分。很多次，但我都不明白。即使是Perl使用的增强型不规则正则表达式，也无法完成解析HTML的任务。你永远不会让我崩溃。HTML是一种非常复杂的语言，它不能被正则表达式解析。甚至Jon Skeet也无法使用正则表达式解析HTML。每次你试图用正则表达式解析HTML时，这个邪恶的孩子都会痛哭流涕，而俄罗斯黑客则会在你的网络应用程序上进行攻击。用正则表达式解析HTML会将受污染的灵魂召唤到活人的领域。HTML和正则表达式就像爱情、婚姻和仪式性的杀婴。<center>无法保持它太晚了。正则表达式和HTML在同一概念空间中的合力会像水一样摧毁你的思想。如果你用正则表达式解析HTML，你就屈服于他们和他们的亵渎方式，这让我们所有人都要为一个名字无法在基本多语言平面中表达的人付出不人道的努力，他来了。HTML加正则表达式将使n当你观察时，你的心灵在恐惧的冲击中枯萎。基于x的HTML解析器是杀死StackOverflow的癌症，为时已晚，为时不晚，我们无法得救，因为一个chi͡ld的犯罪确保了regex将吞噬所有的活组织（除了它不能消耗的HTML，如前所预言的那样）亲爱的主，请帮助我们，任何人如何能在这场灾难中幸存下来，使用regex来解析HTML已经注定了人类将遭受永恒的可怕折磨使用正则表达式作为处理HTML的工具的安全漏洞在这个世界和c͒ͪo͛ͫ腐败实体（如SGML实体，但更腐败）的可怕领域之间建立了一个漏洞，这仅仅是对reg世界的一瞥用于HTML的ex解析器将他突然把一个程序员的意识带入了一个不断尖叫的世界，瘟疫般的slithy regex感染会我吞噬你的HTML解析器、应用程序和存在一直像Visual Basic一样，但更糟糕的是他来了，他来了就不来了对他来说s un̨hoğly radiańcé; destro҉ying all enli̍̈́س\836收紧，HTML标签lea͠ki̧n͘g fr ǫm̡yo͟我们的眼睛͢s̸̛l̕ik͏e liquid pain，re̸gular exp之歌压缩解析将退出用英语表达摩尔的声音来自sp的塔尔曼在这里我可以看到它，你可以看到它吗他终于揭穿了谎言人的全部都是LOS͖̩͇̗̪̏̈́T ALL I当他来的时候，他就失去了机会或渗透到我的脸上ᵒ天啊不不不O NΘ停止*̶͑̾̾ͫ͏̙̤g͛838̾ͫ;͇̫̑͆lot rȇͧ̌aͨl̘̝̙ͤ͂̾̆ZA̡͊͠LGΌISͮ;҉̛̯͈͕̹ͼ̱TO̶͇̺ͅƝȳ̳TH̘; Ë͖́̉\864 P͍̭O̚N̐Y̡Hͨ͊̽س̾̎801;̸̪̯E̾;̧̲̬͛ͪ̈́͘809;ͧ⁲̨̦̱̹̭̰C \877̙̝͖̏Oͮ͏7;͍M͊̒ͪ̚873; 876;Ỿ860;̲̖Ȇ∱̛̟͌S̨̥̫͎ͯ̿̔̀ͅ

您是否尝试过改用XML解析器？

主持人说明此帖子已锁定，以防止对其内容进行不当编辑。这篇文章看起来和它应该看起来完全一样——它的内容没有问题。请不要为我们的注意标记。

2009-11-13 23:04:30

我建议在PHP中使用QueryPath解析XML和HTML。它的语法与jQuery基本相同，只是在服务器端。

2009-11-13 23:44:50

我喜欢用正则表达式解析HTML。我不会试图解析故意破坏的白痴HTML。这段代码是我的主解析器（Perl版）：

$_ = join "",<STDIN>; tr/\n\r \t/ /s; s/</\n</g; s/>/>\n/g; s/\n ?\n/\n/g;
s/^ ?\n//s; s/ $//s; print

它被称为htmlsplit，将HTML拆分为多行，每行上有一个标记或文本块。然后可以使用其他文本工具和脚本（如grep、sed、Perl等）进一步处理这些行。

如果您希望处理巨大的网页，将我的slurp一切第一个Perl脚本重新设置为一个不错的流式处理就足够简单了。但这不是真的必要。

HTML拆分

一些更好的正则表达式：

/(<.*?>|[^<]+)\s*/g    # Get tags and text
/(\w+)="(.*?)"/g       # Get attibutes

它们适用于XML/XTML。

通过小的变化，它可以处理杂乱的HTML。。。或者先转换HTML->XHTML。

编写正则表达式的最佳方式是使用Lex/Yacc样式，而不是不透明的单行或注释的多行怪物。我还没有在这里这样做；这些人几乎不需要它。

2011-07-11 17:13:17

您希望第一个>前面不带/。请查看此处了解如何执行此操作的详细信息。这被称为消极的后顾。

然而，在这个示例文档中，这一天真的实现最终将与<bar/></foo>匹配

<foo><bar/></foo>

你能提供更多关于你试图解决的问题的信息吗？您是否以编程方式遍历标签？

2009-11-13 22:47:17

正如许多人已经指出的那样，HTML不是一种常规语言，这会使解析变得非常困难。我的解决方案是使用整洁的程序将其转换为常规语言，然后使用XML解析器来使用结果。有很多好的选择。我的程序使用Java和jtidy库编写，将HTML转换为XML，然后Jaxen将其展开为结果。

2010-02-04 16:22:00

RegEx匹配除XHTML自包含标记之外的开放标记

推荐文章

最新文章

标签