Python中有什么爬蟲框架

這篇文章給大家分享的是有關(guān)Python中有什么爬蟲框架的內(nèi)容。小編覺得挺實(shí)用的，因此分享給大家做個(gè)參考，一起跟隨小編過來看看吧。

創(chuàng)新互聯(lián)是專業(yè)的江華網(wǎng)站建設(shè)公司，江華接單;提供網(wǎng)站設(shè)計(jì)制作、網(wǎng)站設(shè)計(jì),網(wǎng)頁設(shè)計(jì),網(wǎng)站設(shè)計(jì),建網(wǎng)站,PHP網(wǎng)站建設(shè)等專業(yè)做網(wǎng)站服務(wù);采用PHP框架,可快速的進(jìn)行江華網(wǎng)站開發(fā)網(wǎng)頁制作和功能擴(kuò)展;專業(yè)做搜索引擎喜愛的網(wǎng)站,專業(yè)的做網(wǎng)站團(tuán)隊(duì),希望更多企業(yè)前來合作!

1、Scrapy：Scrapy是一個(gè)為了爬取網(wǎng)站數(shù)據(jù)，提取結(jié)構(gòu)性數(shù)據(jù)而編寫的應(yīng)用框架。可以應(yīng)用在包括數(shù)據(jù)挖掘，信息處理或存儲(chǔ)歷史數(shù)據(jù)等一系列的程序中。它是很強(qiáng)大的爬蟲框架，可以滿足簡(jiǎn)單的頁面爬取，比如可以明確獲知url pattern的情況。用這個(gè)框架可以輕松爬下來如亞馬遜商品信息之類的數(shù)據(jù)。但是對(duì)于稍微復(fù)雜一點(diǎn)的頁面，如weibo的頁面信息，這個(gè)框架就滿足不了需求了。它的特性有：HTML, XML源數(shù)據(jù) 選擇及提取的內(nèi)置支持；提供了一系列在spider之間共享的可復(fù)用的過濾器(即 Item Loaders)，對(duì)智能處理爬取數(shù)據(jù)提供了內(nèi)置支持。

2、Crawley：高速爬取對(duì)應(yīng)網(wǎng)站的內(nèi)容，支持關(guān)系和非關(guān)系數(shù)據(jù)庫，數(shù)據(jù)可以導(dǎo)出為JSON、XML等。

3、Portia：是一個(gè)開源可視化爬蟲工具，可讓使用者在不需要任何編程知識(shí)的情況下爬取網(wǎng)站！簡(jiǎn)單地注釋自己感興趣的頁面，Portia將創(chuàng)建一個(gè)蜘蛛來從類似的頁面提取數(shù)據(jù)。簡(jiǎn)單來講，它是基于scrapy內(nèi)核；可視化爬取內(nèi)容，不需要任何開發(fā)專業(yè)知識(shí)；動(dòng)態(tài)匹配相同模板的內(nèi)容。

4、newspaper:可以用來提取新聞、文章和內(nèi)容分析。使用多線程，支持10多種語言等。作者從requests庫的簡(jiǎn)潔與強(qiáng)大得到靈感，使用python開發(fā)的可用于提取文章內(nèi)容的程序。支持10多種語言并且所有的都是unicode編碼。

5、python-goose:java寫的文章提取工具。Python-goose框架可提取的信息包括：文章主體內(nèi)容、文章主要圖片、文章中嵌入的任何Youtube/Vimeo視頻、元描述、元標(biāo)簽。

6、Beautiful Soup:名氣大，整合了一些常用爬蟲需求。它是一個(gè)可以從HTML或XML文件中提取數(shù)據(jù)的Python庫。它能夠通過你喜歡的轉(zhuǎn)換器實(shí)現(xiàn)慣用的文檔導(dǎo)航,查找,修改文檔的方式.Beautiful Soup會(huì)幫你節(jié)省數(shù)小時(shí)甚至數(shù)天的工作時(shí)間。Beautiful Soup的缺點(diǎn)是不能加載JS。

7、mechanize:它的優(yōu)點(diǎn)是可以加載JS。當(dāng)然它也有缺點(diǎn)，比如文檔嚴(yán)重缺失。不過通過官方的example以及人肉嘗試的方法，還是勉強(qiáng)能用的。

8、selenium:這是一個(gè)調(diào)用瀏覽器的driver，通過這個(gè)庫你可以直接調(diào)用瀏覽器完成某些操作，比如輸入驗(yàn)證碼。Selenium是自動(dòng)化測(cè)試工具，它支持各種瀏覽器，包括 Chrome，Safari，F(xiàn)irefox 等主流界面式瀏覽器，如果在這些瀏覽器里面安裝一個(gè) Selenium 的插件，可以方便地實(shí)現(xiàn)Web界面的測(cè)試. Selenium 支持瀏覽器驅(qū)動(dòng)。Selenium支持多種語言開發(fā)，比如 Java，C，Ruby等等，PhantomJS 用來渲染解析JS，Selenium 用來驅(qū)動(dòng)以及與 Python 的對(duì)接，Python 進(jìn)行后期的處理。

9、cola:是一個(gè)分布式的爬蟲框架，對(duì)于用戶來說，只需編寫幾個(gè)特定的函數(shù)，而無需關(guān)注分布式運(yùn)行的細(xì)節(jié)。任務(wù)會(huì)自動(dòng)分配到多臺(tái)機(jī)器上，整個(gè)過程對(duì)用戶是透明的。項(xiàng)目整體設(shè)計(jì)有點(diǎn)糟，模塊間耦合度較高。

10、PySpider：一個(gè)國人編寫的強(qiáng)大的網(wǎng)絡(luò)爬蟲系統(tǒng)并帶有強(qiáng)大的WebUI。采用Python語言編寫，分布式架構(gòu)，支持多種數(shù)據(jù)庫后端，強(qiáng)大的WebUI支持腳本編輯器，任務(wù)監(jiān)視器，項(xiàng)目管理器以及結(jié)果查看器。python 腳本控制，可以用任何你喜歡的html解析包。

感謝各位的閱讀！關(guān)于“Python中有什么爬蟲框架”這篇文章就分享到這里了，希望以上內(nèi)容可以對(duì)大家有一定的幫助，讓大家可以學(xué)到更多知識(shí)，如果覺得文章不錯(cuò)，可以把它分享出去讓更多的人看到吧！

網(wǎng)頁名稱：Python中有什么爬蟲框架
分享路徑：http://muchs.cn/article20/jpjjjo.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián)，為您提供全網(wǎng)營銷推廣、網(wǎng)站策劃、網(wǎng)站導(dǎo)航、網(wǎng)站維護(hù)、自適應(yīng)網(wǎng)站、微信公眾號(hào)

聲明：本網(wǎng)站發(fā)布的內(nèi)容（圖片、視頻和文字）以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主，如果涉及侵權(quán)請(qǐng)盡快告知，我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng)，如需處理請(qǐng)聯(lián)系客服。電話：028-86922220；郵箱：631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載，或轉(zhuǎn)載時(shí)需注明來源：創(chuàng)新互聯(lián)

猜你還喜歡下面的內(nèi)容