我想用正则表达式从HTML页面中提取标题。目前我有这个:

title = re.search('<title>.*</title>', html, re.IGNORECASE).group()
if title:
    title = title.replace('<title>', '').replace('</title>', '') 

是否有正则表达式来提取<title>的内容,这样我就不必删除标签了?


当前回答

Try:

title = re.search('<title>(.*)</title>', html, re.IGNORECASE).group(1)

其他回答

Try:

title = re.search('<title>(.*)</title>', html, re.IGNORECASE).group(1)

尝试使用捕获组:

title = re.search('<title>(.*)</title>', html, re.IGNORECASE).group(1)
re.search('<title>(.*)</title>', s, re.IGNORECASE).group(1)

在regexp中使用(),在python中使用group(1)来检索捕获的字符串(re.search如果没有找到结果将返回None,所以不要直接使用group()):

title_search = re.search('<title>(.*)</title>', html, re.IGNORECASE)

if title_search:
    title = title_search.group(1)

我可以向您推荐美丽汤吗?Soup是一个解析所有html文档的很好的库。

soup = BeatifulSoup(html_doc)
titleName = soup.title.name