为什么正则表达式如此有争议?

在探索正则表达式(也称为正则表达式)时，有许多人似乎将正则表达式视为圣杯。看起来如此复杂的东西——一定是任何问题的答案。他们倾向于认为每个问题都可以用正则表达式解决。

另一方面，也有很多人不惜一切代价试图避免正则表达式。他们试图找到一种绕过正则表达式的方法，并仅仅为了它而接受额外的编码，即使正则表达式将是一个更紧凑的解决方案。

为什么正则表达式被认为如此有争议?关于它们的工作原理是否存在广泛的误解?或者正则表达式通常比较慢是一种普遍的看法?

当前回答

regex是一个很棒的工具，但是人们认为“嘿，多么棒的工具，我要用它来做X!”而X是另一个工具更适合做的事情(通常是解析器)。这是标准的使用锤子，你需要一个螺丝刀的问题。

其他回答

你可能会问为什么goto会有争议。

基本上，当你拥有这么多“显而易见”的权力时，人们倾向于在它们不是最佳选择的情况下滥用它们。例如，要求用正则表达式解析csv或XML或HTML的人的数量让我感到震惊。这不是做这项工作的合适工具。但是一些用户还是坚持使用正则表达式。

就我个人而言，我试图找到一个中庸之道——在正则表达式擅长的地方使用它们，在它们不是最优的时候避免使用它们。

请注意，正则表达式仍然可以用于解析csv、XML、HTML等。但通常不是在一个正则表达式中。

regex的最佳有效和正常用法是用于电子邮件地址格式验证。

这是一个很好的应用。

我曾经无数次在TextPad中一次性使用正则表达式来编辑平面文件、创建csv文件、创建SQL插入语句等等。

写得好的正则表达式不应该太慢。通常替代选项，比如大量的Replace调用，都是非常慢的选项。还不如一口气搞定。

许多情况只需要正则表达式，而不需要其他任何东西。

用无害字符替换特殊的非打印字符是另一种很好的用法。

我当然可以想象，有一些代码库过度使用正则表达式，从而损害了可维护性。我自己从来没见过。实际上，我因为没有充分使用正则表达式而被代码评审员避而远之。

问题是正则表达式潜在地非常强大，以至于可以使用它们做一些应该使用不同的东西来做的事情。

一个好的程序员应该知道在什么地方使用它们，在什么地方不使用。典型的例子是解析非常规语言(请参阅确定一种语言是否为常规语言)。

我认为如果一开始就限制自己使用真正的正则表达式(没有扩展)，就不会出错。一些扩展可以使您的工作更简单一些，但是如果您发现一些很难用真正的正则表达式来表达的东西，这很可能表明正则表达式不是正确的工具。

这是一个有趣的话题。许多regexp爱好者似乎混淆了公式的简洁性和效率。最重要的是，一个需要大量思考的regexp会给它的作者带来巨大的满足感，使它立即变得合法。

但是…当性能不是问题，并且需要快速处理文本输出时(例如在Perl中)，regexp非常方便。此外，虽然性能是一个问题，但人们可能不愿意尝试使用可能有bug或效率较低的自制算法来击败regexp库。

此外，还有许多原因导致regexp受到不公平的批评

regexp效率不高，因为构建顶部的regexp并不明显有些程序员“忘记”只编译一次要多次使用的regexp(就像Java中的静态模式) 有些程序员采用试错策略——regexp的效果更差!

我认为这是程序员中鲜为人知的技术。因此，它并没有被广泛接受。如果你有一个非技术经理来审查你的代码或工作，那么正则表达式是非常糟糕的。你会花几个小时写一个完美的正则表达式，而你会认为他/她写了这么少的代码，你会为这个模块得到很少的分数。此外，正如在其他地方所说，读取正则表达式是非常困难的任务。

推荐文章