文章详情

短信预约-IT技能 免费直播动态提醒

请输入下面的图形验证码

提交验证

短信预约提醒成功

python中如何爬取汽车之家网站上的图片

2023-06-14 15:49

关注

这篇文章主要介绍了python中如何爬取汽车之家网站上的图片,具有一定借鉴价值,感兴趣的朋友可以参考下,希望大家阅读完这篇文章之后大有收获,下面让小编带着大家一起了解一下。

python的数据类型有哪些?

python的数据类型:1. 数字类型,包括int(整型)、long(长整型)和float(浮点型)。2.字符串,分别是str类型和unicode类型。3.布尔型,Python布尔类型也是用于逻辑运算,有两个值:True(真)和False(假)。4.列表,列表是Python中使用最频繁的数据类型,集合中可以放任何数据类型。5. 元组,元组用”()”标识,内部元素用逗号隔开。6. 字典,字典是一种键值对的集合。7. 集合,集合是一个无序的、不重复的数据组合。

随着生活水平的提高和快节奏生活的发展。汽车开始慢慢成为人们的必需品,浏览各种汽车网站便成为购买合适、喜欢车辆的前提。例如汽车之家网站中就有最新的报价和图片以及汽车的相关内容,是提供信息最快最全的中国汽车网站。本文介绍python爬虫爬取汽车之家网站上的图片的思路和具体演示代码。

一、爬取汽车之家网站上的图片思路分析

分析页面,确认图片的url是否在网页源码。

确认是静态数据后,先找到总的ul标签,在找它里面的li标签,最后在img标签里面的src属性,即可获得想要的图片url地址。

通过切割图片url的方式获取图片名字。

完成图片命名后,使用os模块确定图片存放的路径。

二、设置爬虫代理IP

在做爬虫的过程中,如果你爬取的频率过快,不符合人的操作模式。有些网站的反爬虫机制通过监测到你的IP异常,访问频率过高。就会对你进行封IP处理。目前已有比较多的第三方平台专门进行代理IP的服务。

三、爬取汽车之家网站上的图片具体代码

# piplines管道代码from urllib import requestimport osclass VehicleHomePipeline:    def process_item(self, item, spider):        pic_url = item['pic_url']        # 得到图片名字        pic_name = pic_url.split('__')[-1]  # 得到xxx.jpg        # os.path.dirname(__file__) 结果 D:\PycharmProjects\spider\day21\vehicle_home\vehicle_home\        # 创建图片存放路径 xxx\vehicle_home\result_pic        pic_path = os.path.join(os.path.dirname(__file__), 'result_pic')        # 下载图片 xxx\vehicle_home\result_pic\xxx.jpg        request.urlretrieve(pic_url, pic_path + '/' + pic_name)        return item# 爬虫代码import scrapyfrom day21.vehicle_home.vehicle_home.items import VehicleHomeItemclass VehPicSpider(scrapy.Spider):    name = 'veh_pic'    allowed_domains = ['car.autohome.com.cn']    base_url = 'https://car.autohome.com.cn/photolist/series/18/p{}/'    start_urls = [base_url.format(1)]    def parse(self, response):        # 获取图片标签列表        pic_lists = response.xpath('//ul[@id="imgList"]/li')        for pic in pic_lists:            pic_url = pic.xpath('./a/img/@src').extract_first()            # 上述获取的url需要进一步补全            pic_url = response.urljoin(pic_url)            item = VehicleHomeItem()            item['pic_url'] = pic_url            print(item)            yield item        # 翻页逻辑        for page in range(2, 3):            next_url = self.base_url.format(page)            yield scrapy.Request(next_url)

感谢你能够认真阅读完这篇文章,希望小编分享的“python中如何爬取汽车之家网站上的图片”这篇文章对大家有帮助,同时也希望大家多多支持编程网,关注编程网行业资讯频道,更多相关知识等着你来学习!

阅读原文内容投诉

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

软考中级精品资料免费领

  • 历年真题答案解析
  • 备考技巧名师总结
  • 高频考点精准押题
  • 2024年上半年信息系统项目管理师第二批次真题及答案解析(完整版)

    难度     813人已做
    查看
  • 【考后总结】2024年5月26日信息系统项目管理师第2批次考情分析

    难度     354人已做
    查看
  • 【考后总结】2024年5月25日信息系统项目管理师第1批次考情分析

    难度     318人已做
    查看
  • 2024年上半年软考高项第一、二批次真题考点汇总(完整版)

    难度     435人已做
    查看
  • 2024年上半年系统架构设计师考试综合知识真题

    难度     224人已做
    查看

相关文章

发现更多好内容

猜你喜欢

AI推送时光机
位置:首页-资讯-后端开发
咦!没有更多了?去看看其它编程学习网 内容吧
首页课程
资料下载
问答资讯