python爬蟲用到庫有哪些

這篇文章將為大家詳細講解有關(guān)python爬蟲用到庫有哪些,小編覺得挺實用的,因此分享給大家做個參考,希望大家閱讀完這篇文章后可以有所收獲。

創(chuàng)新互聯(lián)建站于2013年成立,是專業(yè)互聯(lián)網(wǎng)技術(shù)服務(wù)公司,擁有項目做網(wǎng)站、網(wǎng)站制作網(wǎng)站策劃,項目實施與項目整合能力。我們以讓每一個夢想脫穎而出為使命,1280元施秉做網(wǎng)站,已為上家服務(wù),為施秉各地企業(yè)和個人服務(wù),聯(lián)系電話:18980820575

python爬蟲要用到的庫:

請求庫:實現(xiàn) HTTP 請求操作

  • urllib:一系列用于操作URL的功能。

  • requests:基于 urllib 編寫的,阻塞式 HTTP 請求庫,發(fā)出一個請求,一直等待服務(wù)器響應(yīng)后,程序才能進行下一步處理。

  • selenium:自動化測試工具。一個調(diào)用瀏覽器的 driver,通過這個庫你可以直接調(diào)用瀏覽器完成某些操作,比如輸入驗證碼。

  • aiohttp:基于 asyncio 實現(xiàn)的 HTTP 框架。異步操作借助于 async/await 關(guān)鍵字,使用異步庫進行數(shù)據(jù)抓取,可以大大提高效率。

解析庫:從網(wǎng)頁中提取信息

  • beautifulsoup:html 和 XML 的解析,從網(wǎng)頁中提取信息,同時擁有強大的API和多樣解析方式。

  • pyquery:jQuery 的 Python 實現(xiàn),能夠以 jQuery 的語法來操作解析 HTML 文檔,易用性和解析速度都很好。

  • lxml:支持HTML和XML的解析,支持XPath解析方式,而且解析效率非常高。

  • tesserocr:一個 OCR 庫,在遇到驗證碼(圖形驗證碼為主)的時候,可直接用 OCR 進行識別。

存儲庫:Python 與數(shù)據(jù)庫交互

  • pyMySQL:一個純 Python 實現(xiàn)的 MySQL 客戶端操作庫。

  • pymongo:一個用于直接連接 MongoDB 數(shù)據(jù)庫進行查詢操作的庫。

  • redisdump:一個用于 redis 數(shù)據(jù)導入/導出的工具?;?ruby 實現(xiàn)的,因此使用它,需要先安裝 Ruby。

爬蟲框架

  • Scrapy:很強大的爬蟲框架,可以滿足簡單的頁面爬?。ū热缈梢悦鞔_獲知url pattern的情況)。用這個框架可以輕松爬下來如亞馬遜商品信息之類的數(shù)據(jù)。但是對于稍微復雜一點的頁面,如 weibo 的頁面信息,這個框架就滿足不了需求了。

  • Crawley:高速爬取對應(yīng)網(wǎng)站的內(nèi)容,支持關(guān)系和非關(guān)系數(shù)據(jù)庫,數(shù)據(jù)可以導出為 JSON、XML 等。

  • Portia:可視化爬取網(wǎng)頁內(nèi)容。

  • newspaper:提取新聞、文章以及內(nèi)容分析。

  • python-goose:java 寫的文章提取工具。

  • cola:一個分布式爬蟲框架。項目整體設(shè)計有點糟,模塊間耦合度較高。

Web框架庫

  • flask:輕量級的 web 服務(wù)程序,簡單,易用,靈活,主要來做一些 API 服務(wù)。做代理時可能會用到。

  • django:一個 web 服務(wù)器框架,提供了一個完整的后臺管理,引擎、接口等,使用它可做一個完整網(wǎng)站。

關(guān)于python爬蟲用到庫有哪些就分享到這里了,希望以上內(nèi)容可以對大家有一定的幫助,可以學到更多知識。如果覺得文章不錯,可以把它分享出去讓更多的人看到。

當前文章:python爬蟲用到庫有哪些
分享地址:http://muchs.cn/article40/pishho.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供營銷型網(wǎng)站建設(shè)、云服務(wù)器、網(wǎng)站設(shè)計、Google外貿(mào)網(wǎng)站建設(shè)、電子商務(wù)

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)

成都網(wǎng)頁設(shè)計公司