這篇文章將為大家詳細(xì)講解有關(guān)Python如何爬蟲淘寶商品數(shù)據(jù),小編覺得挺實(shí)用的,因此分享給大家做個參考,希望大家閱讀完這篇文章后可以有所收獲。
成都創(chuàng)新互聯(lián)是專業(yè)的石嘴山網(wǎng)站建設(shè)公司,石嘴山接單;提供網(wǎng)站建設(shè)、成都網(wǎng)站設(shè)計(jì),網(wǎng)頁設(shè)計(jì),網(wǎng)站設(shè)計(jì),建網(wǎng)站,PHP網(wǎng)站建設(shè)等專業(yè)做網(wǎng)站服務(wù);采用PHP框架,可快速的進(jìn)行石嘴山網(wǎng)站開發(fā)網(wǎng)頁制作和功能擴(kuò)展;專業(yè)做搜索引擎喜愛的網(wǎng)站,專業(yè)的做網(wǎng)站團(tuán)隊(duì),希望更多企業(yè)前來合作!這次的主要的目的是從淘寶的搜索頁面獲取商品的信息。其實(shí)分析頁面找到信息很容易,頁面信息的存放都是以靜態(tài)的方式直接嵌套的頁面上的,很容易找到。主要困難是將信息從HTML源碼中剝離出來,數(shù)據(jù)和網(wǎng)頁源碼結(jié)合的很緊密,剝離數(shù)據(jù)有一定的難度。
然后將獲取的信息寫入excel表格保存起來,這次只爬取了前面10頁的內(nèi)容。
代碼如下:
import requests import re from xlwt import Workbook import xlrd import time def key_name( number ): #獲取頁面的內(nèi)容并返回 name = '手機(jī)' URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q=" URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s=" URL = ( URL_1 + name + URL_2 + str(number)) #print(URL) res = requests.get( URL ) return res.text def find_date( text): #根據(jù)整個頁面的信息,獲取商品的數(shù)據(jù)所在的HTML源碼并放回 reg = r',"data":{"spus":\[({.+?)\]}},"header":' reg = re.compile(reg) info = re.findall(reg, text) return info[0] def manipulation_data( info, N, sheet ): #解析獲取的HTML源碼,獲取數(shù)據(jù) Date = eval(info) for d in Date: T = " ".join([t['tag'] for t in d['tag_info']]) #print(d['title'] + '\t' + d['price'] + '\t' + d['importantKey'][0:len(d['importantKey'])-1] + '\t' + T) sheet.write(N,0,d['title']) sheet.write(N,1,d['price']) sheet.write(N,2,T) N = N + 1 return N def main(): book = Workbook() sheet = book.add_sheet('淘寶手機(jī)數(shù)據(jù)') sheet.write(0,0,'品牌') sheet.write(0,1,'價(jià)格') sheet.write(0,2,'配置') book.save('淘寶手機(jī)數(shù)據(jù).xls') #k用于生成鏈接,每個鏈接的最后面的數(shù)字相差48. #N用于記錄表格的數(shù)據(jù)行數(shù),便于寫入數(shù)據(jù) k = 0 N = 1 for i in range(10+1): text = key_name( k + i * 48 ) info = find_date(text) N = manipulation_data( info ,N, sheet ) book.save('淘寶手機(jī)數(shù)據(jù).xls') print('下載第' + str(i) + '頁完成') if __name__ == '__main__': main()
關(guān)于Python如何爬蟲淘寶商品數(shù)據(jù)就分享到這里了,希望以上內(nèi)容可以對大家有一定的幫助,可以學(xué)到更多知識。如果覺得文章不錯,可以把它分享出去讓更多的人看到。
分享題目:Python如何爬蟲淘寶商品數(shù)據(jù)-創(chuàng)新互聯(lián)
本文網(wǎng)址:http://muchs.cn/article22/doogjc.html
成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供用戶體驗(yàn)、建站公司、ChatGPT、網(wǎng)站內(nèi)鏈、Google、定制網(wǎng)站
聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)