Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

這篇文章主要介紹“Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么”,在日常操作中,相信很多人在Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么問題上存在疑惑,小編查閱了各式資料,整理出簡(jiǎn)單好用的操作方法,希望對(duì)大家解答”Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么”的疑惑有所幫助!接下來,請(qǐng)跟著小編一起來學(xué)習(xí)吧!

創(chuàng)新互聯(lián)建站長(zhǎng)期為1000多家客戶提供的網(wǎng)站建設(shè)服務(wù),團(tuán)隊(duì)從業(yè)經(jīng)驗(yàn)10年,關(guān)注不同地域、不同群體,并針對(duì)不同對(duì)象提供差異化的產(chǎn)品和服務(wù);打造開放共贏平臺(tái),與合作伙伴共同營(yíng)造健康的互聯(lián)網(wǎng)生態(tài)環(huán)境。為興山企業(yè)提供專業(yè)的做網(wǎng)站、成都網(wǎng)站制作,興山網(wǎng)站改版等技術(shù)服務(wù)。擁有十年豐富建站經(jīng)驗(yàn)和眾多成功案例,為您定制開發(fā)。

Nutch數(shù)據(jù)集的目錄具體內(nèi)容

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

#導(dǎo)出crawldb

bin/nutch readdb data/crawldb/ -dump data/crawldb_dump

#查看crawldb

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Crawldb內(nèi)容主要包括,抓取狀態(tài)、抓取此網(wǎng)頁的時(shí)間、對(duì)此網(wǎng)頁的重要度評(píng)分等url地址的詳細(xì)信息。

#查看linkdb

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

#查看segments

一次爬行會(huì)產(chǎn)生很多個(gè)段(segment),段存儲(chǔ)的是爬蟲在一次抓取過程中抓到的網(wǎng)頁以及這些網(wǎng)頁的索引。爬蟲爬行時(shí)會(huì)根據(jù)crawldb中的鏈接關(guān)系按照一定的爬行策略生成每次抓取循環(huán)所需的預(yù)取列表(fetch list),然后Fetcher類通過預(yù)取列表中的URL抓取這些網(wǎng)頁并索引,然后將其存入段中。

#查看segments目錄

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Content:保存的是 fetcher 所抓取回來的源內(nèi)容,html腳本

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Crawl_fetch:包含每個(gè)抓取頁面的狀態(tài)

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Crawl_generate:包含所抓取的網(wǎng)址列表

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Crawl_parse: 包含網(wǎng)址的外部鏈接地址,用于更新crawldb數(shù)據(jù)庫

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Parse_data: 包含每個(gè)頁面的外部鏈接和元數(shù)據(jù)

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

Parse_text: 包含每個(gè)抓取頁面的解析文本

Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么

到此,關(guān)于“Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么”的學(xué)習(xí)就結(jié)束了,希望能夠解決大家的疑惑。理論與實(shí)踐的搭配能更好的幫助大家學(xué)習(xí),快去試試吧!若想繼續(xù)學(xué)習(xí)更多相關(guān)知識(shí),請(qǐng)繼續(xù)關(guān)注創(chuàng)新互聯(lián)網(wǎng)站,小編會(huì)繼續(xù)努力為大家?guī)砀鄬?shí)用的文章!

當(dāng)前標(biāo)題:Nutch數(shù)據(jù)集的目錄具體內(nèi)容是什么
當(dāng)前網(wǎng)址:http://muchs.cn/article36/ihdpsg.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供ChatGPT、標(biāo)簽優(yōu)化做網(wǎng)站、品牌網(wǎng)站設(shè)計(jì)動(dòng)態(tài)網(wǎng)站、Google

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請(qǐng)盡快告知,我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如需處理請(qǐng)聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時(shí)需注明來源: 創(chuàng)新互聯(lián)

網(wǎng)站托管運(yùn)營(yíng)