文章详情

短信预约-IT技能 免费直播动态提醒

请输入下面的图形验证码

提交验证

短信预约提醒成功

怎么用Python爬取2022春节档电影信息

2023-06-29 00:15

关注

这篇文章将为大家详细讲解有关怎么用Python爬取2022春节档电影信息,小编觉得挺实用的,因此分享给大家做个参考,希望大家阅读完这篇文章后可以有所收获。

实验环境

Python 3.x (面向对象的高级语言)
Resquest 2.14.2 (python第三方库)
Pandas 1.1.0(python第三方库)
Time (python标准库)
Lxml(python第三方库)

具体步骤

目标网站

https://movie.douban.com/cinema/later/shenzhen/

怎么用Python爬取2022春节档电影信息

分析网站

按F12打开浏览器操作台

怎么用Python爬取2022春节档电影信息

按Ctrl+Shift+C快捷键

怎么用Python爬取2022春节档电影信息

按Ctrl+F快捷键,控制台出现搜索框

怎么用Python爬取2022春节档电影信息

复制Xpath

Xpath为//*[@id=“showing-soon”]/div[1]/div/h4/a

怎么用Python爬取2022春节档电影信息

粘贴到搜索框,验证Xpath

怎么用Python爬取2022春节档电影信息

查看HTML,寻找共性

怎么用Python爬取2022春节档电影信息

发现目标元素都在一个div框里,修改Xpath

Xpath修改为//*[@id=“showing-soon”]/div/div/h4/a

怎么用Python爬取2022春节档电影信息

其余目标元素,以此类推

怎么用Python爬取2022春节档电影信息

最后,用Pandas保存为CSV文件

# 利用pandas保存文件df = pd.DataFrame()df['上映日期'] =  Ondatedf['片名'] =  namedf['类型'] =  movie_classdf['制片国家/地区'] = areadf['想看人数'] = numdf['超链接'] = href

怎么用Python爬取2022春节档电影信息

代码实现

# -*- coding: utf-8 -*-"""Created on Tue Jan 25 10:07:11 2022@author: TFX"""import timeimport requests # 请求库import pandas as pdfrom lxml import etree# 提取信息库# 日期today = time.strftime('%Y{y}%m{m}%d{d}',time.localtime()).format(y='年',m='月',d='日')# 网址url = 'https://movie.douban.com/cinema/later/shenzhen/'# 请求头headers = {        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.163 Safari/537.36'        }# 发送请求response = requests.get(url=url,headers=headers)# 数据解析,xpath可以用浏览器检查元素获得html = etree.HTML(response.text) #类型变换# 电影详细超链接href = html.xpath('//*[@id="showing-soon"]/div/div/h4/a/@href')# 上映日期Ondate =  html.xpath('//*[@id="showing-soon"]/div/div/ul/li[1]/text()')# 片名name = html.xpath('//*[@id="showing-soon"]/div/div/h4/a/text()')# 类型movie_class = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[2]/text()')# 制片国家 / 地区area = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[3]/text()')# 想看人数num = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[4]/span/text()')# 利用pandas保存文件df = pd.DataFrame()df['上映日期'] =  Ondatedf['片名'] =  namedf['类型'] =  movie_classdf['制片国家/地区'] = areadf['想看人数'] = numdf['超链接'] = hrefdf.to_csv('2022春节档电影_'+today+'.csv',mode='w',index=None,encoding='gbk')print('保存完成!')

输出结果

怎么用Python爬取2022春节档电影信息

怎么用Python爬取2022春节档电影信息

怎么用Python爬取2022春节档电影信息

关于“怎么用Python爬取2022春节档电影信息”这篇文章就分享到这里了,希望以上内容可以对大家有一定的帮助,使各位可以学到更多知识,如果觉得文章不错,请把它分享出去让更多的人看到。

阅读原文内容投诉

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

软考中级精品资料免费领

  • 历年真题答案解析
  • 备考技巧名师总结
  • 高频考点精准押题
  • 2024年上半年信息系统项目管理师第二批次真题及答案解析(完整版)

    难度     807人已做
    查看
  • 【考后总结】2024年5月26日信息系统项目管理师第2批次考情分析

    难度     351人已做
    查看
  • 【考后总结】2024年5月25日信息系统项目管理师第1批次考情分析

    难度     314人已做
    查看
  • 2024年上半年软考高项第一、二批次真题考点汇总(完整版)

    难度     433人已做
    查看
  • 2024年上半年系统架构设计师考试综合知识真题

    难度     221人已做
    查看

相关文章

发现更多好内容

猜你喜欢

AI推送时光机
位置:首页-资讯-后端开发
咦!没有更多了?去看看其它编程学习网 内容吧
首页课程
资料下载
问答资讯