node.js实现简单爬虫示例详解-编程学习网

node.js实现简单爬虫

工具：cheerio

cheerio 是 nodejs 特别为服务端定制的，能够快速灵活的对 JQuery 核心进行实现。它工作于 DOM 模型上，且解析、操作、呈送都很高效。更多 API 参看： github.com/cheeriojs/c…

我们以慕课网页面为例，爬取每个视频课程的标题和课程对应 id,期望结构如下：

titles = [{
  chapterTitle: chapterTitle,
  id: id
}]

第一步

我们用node写一个请求，获取想要爬虫的网站html,这里以慕课网为例:

var http = require('http')
var url = 'http://www.imooc.com/course/list?c=nodejs'
http.get(url, function(res){
  var html = ''
  res.on('data', function(data){
    html += data
  })
  res.on('end', function(){
    var result = filterHml(html)
    print(result)
  })
}).on('error', function(){
  console.log('获取数据错误！')
})

第二步

我们根据需求来编写过滤HTML的函数，将过滤后的数据打印在控制台。

function filterChapters(html) {
    var $ = cheerio.load(html)
    var chapters = $('.course-card-container')//以类名获取节点元素
    var titles = []
    chapters.each(function (item) {
        var chapter = $(this)
        var chapterTitle = chapter.find('h3').text()
        var id = chapter.find('a').attr('href').split('learn/')[1]
        titles.push({
            chapterTitle: chapterTitle,
            id: id
        })
    })
    return titles
}
function printCourseInfo(courseData){
    courseData.forEach(item => {
        console.log('【' + item.id + '】' + item.chapterTitle + '\n')
    });
}

爬虫结果

【935】Vue+Webpack打造todo应用
【882】基于websocket的火拼俄罗斯（单��版）
【861】基于Websocket的火拼俄罗斯（基础）
【866】前端性能优化-通用的缓存SDK
【773】AC2016腾讯前端技术大会
【728】创业公司的Nodejs工程师
【725】Roundtable前端分享专场
【637】进击Node.js基础（二）
【590】阿里D2前端技术论坛——2015融合
【564】去哪儿前端沙龙分享第三期
【556】慕课网技术沙龙之前端专场
【434】去哪儿前端沙龙分享第二期
【367】Qnext前端交互沙龙
【348】进击Node.js基础（一）
【221】D2前端技术论坛——2014绽放
【197】node建站攻略(二期)——网站升级
【75】node+mongodb 建站攻略（一期）

小结：

node.js使得JavaScript代码能够运行在服务端，从而进行一些操作，node.js的更多用法参看后续文章.

以上就是node.js实现简单爬虫示例详解的详细内容，更多关于node.js简单爬虫的资料请关注编程网其它相关文章！

文章详情

node.js实现简单爬虫示例详解

目录

node.js实现简单爬虫

第一步

第二步

爬虫结果

小结：

软考中级精品资料免费领

相关文章

猜你喜欢

node.js实现简单爬虫示例详解

Node.js 实现简单小说爬虫实例

java 爬虫详解及简单实例

python实现简单爬虫功能的示例

Java 使用maven实现Jsoup简单爬虫案例详解

Node.js简单实现爬虫代码怎么写

Python多线程爬虫简单示例

python实现简单爬虫--爬图片

java实现一个简单的网络爬虫代码示例

node.js做一个简单的爬虫案例教程

java编程实现简单的网络爬虫示例过程

JAVA超级简单的爬虫实例讲解

简单实现python爬虫功能

python简单爬虫--get方式详解

PHP实现简单爬虫的方法

go colly 爬虫实现示例

nodeJS实现简单网页爬虫功能的实例(分享)

怎么用.net core 实现简单爬虫

node.js实现博客小爬虫的实例代码

使用Python实现简单的爬虫框架