一日一技：如何提取网页中的日期？-编程学习网

最近我发现Python的一个第三方库，叫做htmldate，经过测试，它提取新闻的发布时间比较准确。我们来看看这个库怎么使用。首先使用pip安装：

python3 -m pip install htmldate

然后，我们使用Requests或者Selenium获得网站的源代码：

import requests
from htmldate import find_date
html = requests.get('https://www.kingname.info/2022/03/09/this-is-gnelist/').content.decode('utf-8')
date = find_date(html)
print(date)

运行效果如下图所示：

而这篇文章的发布时间，确实是3月9号：

我们再用网易新闻来看一下，相互激励增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示：

现在我们用Requests获得它的源代码，然后再提取发布时间：

发布日期确实对了，但是后面的时间怎么丢失了呢?如果想把时分秒保留下来，可以增加一个参数outputformat，它的值就是你在datetime.strftime里面输入的值：

find_date(html, outputformat='%Y-%m-%d %H:%M:%S')

运行效果如下图所示：

find_date的参数，除了网页源代码外，还可以传入URL，或者是lxml里面的Dom对象，例如：

from lxml.html import fromstring

selector = fromstring(html)
date = find_date(selector)

参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor

[2] 相互激励增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html

文章详情

一日一技：如何提取网页中的日期？

软考中级精品资料免费领

相关文章

猜你喜欢

一日一技：如何提取网页中的日期？

一日一技：爬虫如何正确从网页中提取伪元素？

sqlserver如何获取前一天的日期

一日一技：Pandas 中，如何分组再取 N项？

如何在MySQL中读取日期范围内的日期

一日一技：Selenium 如何获取鼠标指向的元素？

mysql中如何查询一段时间的日期

php如何获取指定日期是一周的第几天

php如何获取当前日期是一年的第几周

如何在 Java 中为日期增加一天

在 Java 中如何获取昨天的日期？(java怎么获取昨天的日期)

一日一技：如何实现带Timeout的Input？

VBS中怎么获取当前日期的前一天

我们如何从 MySQL 中的给定日期获取月份和日期？

chatgpt赋能python：如何使用Python获取前一天的日期

JS小技巧，如何在JavaScript中获取当前日期

一日一技：如何使用大模型提高开发效率

如何在 Java 中获取前 7 天的日期？(java怎么获取前7天日期)

一日一技：如何识别一张图片的格式

如何从 go 中的 jwt 令牌获取过期日期？