文章详情

短信预约-IT技能 免费直播动态提醒

请输入下面的图形验证码

提交验证

短信预约提醒成功

怎么用Python标准库修改搜索引擎获取结果

2023-06-17 16:29

关注

这篇文章主要讲解了“怎么用Python标准库修改搜索引擎获取结果”,文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习“怎么用Python标准库修改搜索引擎获取结果”吧!

我输入的关键字作为地址参数传递给某个程序,这个程序就会返回一个页面,上面包括顶部(logo和搜索UI)/结果部分/底部(版权信息部分),我们要得到的就是中间结果部分,这个可以用Python标准库的urllib中的urlopen方法得到整个页面的字符串,然后再解析这些字符串,完全有办法把中间结果部分抽取出来,抽出着串字符串,加上自己的头部和顶部和底部,那样搜索小偷的雏形就大概完成了,下面先写个测试代码。

[code]   # Search Thief   # creator: Singo   # date: 2007-8-24   import urllib   import re   class SearchThief:   " " "the google thief " " "   global path,targetURL   path = "pages\\ "   # targetURL = "http://www.google.cn/search?complete=1&hl=zh-CN&q= "   targetURL = "http://www.baidu.com/s?wd= "   def __init__(self,key):   self.key = key   def getPage(self):   webStr = urllib.urlopen(targetURL+self.key).read() # get the page string form the url   self.setPageToFile(webStr)   def setPageToFile(self,webStr):   rereSetStr = re.compile( "\r ")   self.key = reSetStr.sub( " ",self.key) # replace the string "\r "   targetFile = file(path+self.key+ ".html ", "w ") # open the file for "w "rite   targetFile.write(webStr)   targetFile.close()   print "done "   inputKey = raw_input( "Enter you want to search --> ")   obj = SearchThief(inputKey)   obj.getPage()   [/code]

这里只是要求用户输入一个关键字,然后向搜索引擎提交请求,把返回的页面保存到一个目录下,这只是一个测试的例子,如果要做真正的搜索小偷,完全可以不保存这个页面,把抽取出来的字符串加入到我们预先设计好的模板里面,直接以web的形式显示在客户端,那样就可以实现利用盗取某些搜索引擎的结果并构造新的页面呈现。

看一下百度搜索结果页的源码,在搜索结构的那个table标签前面有个 <DIV id=Div> </DIV> 的标签,我们可以根据这个标签得到下移两行的结果集,于是增加一个方法。

getResultStr()   [code]   def getResultStr(self,webStr):   webStrwebStrList = webStr.read().split( "\r\n ")   line = webStrList.index( " <DIV id=Div> </DIV> ")+2 # get the line from " <DIV id=Div> </DIV> " move 2 line   resultStr = webStrList[line]   return resultStr   [/code]

既然得到结果列表,那么我们要把这个结果列表放到自己定义的页面里面,我们可以说这个页面叫模板:

[code]   <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN " "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd ">   <html xmlns= "https://file.lsjlt.com/upload/202306/14/b2bk4fxbk0g.jpg " /> </div>   <div id= "searchUI ">   <input type= "text " style= "width:300px; " />   <input type= "submit " value= "Search " />   </div>   <div class= "clear "/>   </div>   <div id= "result_info ">   工找到:&times;&times;&times;条记录,耗时&times;&times;&times;秒   </div>   <div id= "result "> %result% </div>   <div id= "foot ">

这里搜索的结构全都是百度那里过来的哦!其中%title%和%result%是等待替换的字符,为了替换这些字符,我们再增加一个方法,

[b]reCreatePage():[/b]   [code]   def reCreatePage(self,resultStr):   demoStr = urllib.urlopen(demoPage).read() # get the demo page string   rereTitle = re.compile( "%title% ")   demoStr = reTitle.sub(self.key,demoStr) # re set the page title   rereResult = re.compile( "%result% ")   demoStr = reResult.sub(resultStr,demoStr) # re set the page result   return demoStr   [/code]

这样就可以把模板中的%title%和%result%替换成我们想要的标签了。

[code]   # the main programme   # creator: Singo   # date: 2007-8-24   import urllib   import re   class SearchThief:   " " "the google thief " " "   global path,targetURL,demoPage   path = "pages\\ "   # targetURL = "http://www.google.cn/search?complete=1&hl=zh-CN&q= "   targetURL = "http://www.baidu.com/s?wd= "   demoPage = path+ "__demo__.html "   def __init__(self,key):   self.key = key   def getPage(self):   webStr = urllib.urlopen(targetURL+self.key) # get the page string form the url   webStr = self.getResultStr(webStr) # get the result part   webStr = self.reCreatePage(webStr) # re create a new page   self.setPageToFile(webStr)   def getResultStr(self,webStr):   webStrwebStrList = webStr.read().split( "\r\n ")   line = webStrList.index( " <DIV id=Div> </DIV> ")+2 # get the line from " <DIV id=Div> </DIV> " move 2 line   resultStr = webStrList[line]   return resultStr   def reCreatePage(self,resultStr):   demoStr = urllib.urlopen(demoPage).read() # get the demo page string   rereTitle = re.compile( "%title% ")   demoStr = reTitle.sub(self.key,demoStr) # re set the page title   rereResult = re.compile( "%result% ")   demoStr = reResult.sub(resultStr,demoStr) # re set the page result   return demoStr   def setPageToFile(self,webStr):   rereSetStr = re.compile( "\r ")   self.key = reSetStr.sub( " ",self.key) # replace the string "\r "   targetFile = file(path+self.key+ ".html ", "w ") # open the file for "w "rite   targetFile.write(webStr)   targetFile.close()   print "done "   inputKey = raw_input( "Enter you want to search --> ")   obj = SearchThief(inputKey)   obj.getPage()   [/code]

这样我们就可以得到一个自己定义的风格而含有百度搜索出来的结果的页面,这里只做了标题和结果及的替换,同样道理,我们还可以把“百度快照”替换掉,我们还可以重新生成翻页控件,这样一个搜索小偷就基本完成啦。

用Python标准库向Google请求时,Google会返回一个不是我们希望得到的页面,上面的内容是提示无权访问,Google很聪明,这步已经被他们想到了,但百度没做这样的限制哦,于是成功截取百度的数据。同样道理,还可以尝试其他搜索引擎,比如yisou和soso。

感谢各位的阅读,以上就是“怎么用Python标准库修改搜索引擎获取结果”的内容了,经过本文的学习后,相信大家对怎么用Python标准库修改搜索引擎获取结果这一问题有了更深刻的体会,具体使用情况还需要大家实践验证。这里是编程网,小编将为大家推送更多相关知识点的文章,欢迎关注!

阅读原文内容投诉

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

软考中级精品资料免费领

  • 历年真题答案解析
  • 备考技巧名师总结
  • 高频考点精准押题
  • 2024年上半年信息系统项目管理师第二批次真题及答案解析(完整版)

    难度     807人已做
    查看
  • 【考后总结】2024年5月26日信息系统项目管理师第2批次考情分析

    难度     351人已做
    查看
  • 【考后总结】2024年5月25日信息系统项目管理师第1批次考情分析

    难度     314人已做
    查看
  • 2024年上半年软考高项第一、二批次真题考点汇总(完整版)

    难度     433人已做
    查看
  • 2024年上半年系统架构设计师考试综合知识真题

    难度     221人已做
    查看

相关文章

发现更多好内容

猜你喜欢

AI推送时光机
位置:首页-资讯-后端开发
咦!没有更多了?去看看其它编程学习网 内容吧
首页课程
资料下载
问答资讯