golang中怎么抓取網(wǎng)頁并分析頁面包含的鏈接-創(chuàng)新互聯(lián)

golang中怎么抓取網(wǎng)頁并分析頁面包含的鏈接,相信很多沒有經(jīng)驗的人對此束手無策,為此本文總結(jié)了問題出現(xiàn)的原因和解決方法,通過這篇文章希望你能解決這個問題。

創(chuàng)新互聯(lián)專注為客戶提供全方位的互聯(lián)網(wǎng)綜合服務(wù),包含不限于網(wǎng)站制作、做網(wǎng)站、河曲網(wǎng)絡(luò)推廣、小程序開發(fā)、河曲網(wǎng)絡(luò)營銷、河曲企業(yè)策劃、河曲品牌公關(guān)、搜索引擎seo、人物專訪、企業(yè)宣傳片、企業(yè)代運營等,從售前售中售后,我們都將竭誠為您服務(wù),您的肯定,是我們大的嘉獎;創(chuàng)新互聯(lián)為所有大學(xué)生創(chuàng)業(yè)者提供河曲建站搭建服務(wù),24小時服務(wù)熱線:18980820575,官方網(wǎng)址:muchs.cn

1. 下載非標(biāo)準(zhǔn)的包,"golang.org/x/net/html"

2. 先安裝git,使用git命令下載

git clone https://github.com/golang/net

3. 將net包,放到GOROOT路徑下

比如:

我的是:GOROOT = E:\go\

所以最終目錄是:E:\go\src\golang.org\x\net

注意:如果沒有g(shù)olang.org和x文件夾,就創(chuàng)建

4. 創(chuàng)建fetch目錄,在其下創(chuàng)建main.go文件,main.go文件代碼內(nèi)容如下:

package main
 
import (
 "os"
 "net/http"
 "fmt"
 "io/ioutil"
)
 
func main() {
 for _, url := range os.Args[1:] {
 resp, err := http.Get(url)
 if err != nil {
  fmt.Fprintf(os.Stderr, "fetch: %v\n", err)
 }
 b, err := ioutil.ReadAll(resp.Body)
 resp.Body.Close()
 if err != nil {
  fmt.Fprintf(os.Stderr, "fetch: reading %s: %v\n", url, err)
  os.Exit(1)
 }
 fmt.Printf("%s",b)
 }
}

5. 編譯fetch

go build test.com\justin\demo\fetch

注意:test.com\justin\demo\ 是我的項目路徑,具體編譯根據(jù)自己項目路徑編譯。

6. 執(zhí)行fetch.exe 文件

fetch.exe https://www.qq.com

注意:https://www.qq.com是要爬的網(wǎng)址,配置正確的話,會打印出網(wǎng)址的HTML內(nèi)容。如果沒有,請檢查以上步驟是否正確。

7. 網(wǎng)頁已經(jīng)抓取了,那么剩下就分析頁面包含的鏈接了,創(chuàng)建findlinks目錄,在其下創(chuàng)建main.go文件,main.go文件代碼內(nèi)容如下:

package main
 
import (
 "os"
 "fmt"
 "golang.org/x/net/html"
)
 
func main() {
 doc, err := html.Parse(os.Stdin)
 if err != nil {
 fmt.Fprint(os.Stderr, "findlinks: %v\n", err)
 os.Exit(1)
 }
 for _, link := range visit(nil, doc) {
 fmt.Println(link)
 }
}
 
func visit(links []string, n *html.Node) []string {
 if n.Type == html.ElementNode && n.Data == "a" {
 for _, a := range n.Attr {
  if a.Key == "href" {
  links = append(links, a.Val)
  }
 }
 }
 for c := n.FirstChild; c != nil; c = c.NextSibling {
 links = visit(links, c)
 }
 return links
}

8. 編譯findlinks

go build test.com\justin\demo\findlinks

注意:test.com\justin\demo\ 是我的項目路徑,具體編譯根據(jù)自己項目路徑編譯。

9. 執(zhí)行findlinks.exe 文件

fetch.exe https://www.qq.com | findlinks.exe

> 10. 執(zhí)行后結(jié)果:獲取到各種不同形式的超鏈接

看完上述內(nèi)容,你們掌握golang中怎么抓取網(wǎng)頁并分析頁面包含的鏈接的方法了嗎?如果還想學(xué)到更多技能或想了解更多相關(guān)內(nèi)容,歡迎關(guān)注創(chuàng)新互聯(lián)成都網(wǎng)站設(shè)計公司行業(yè)資訊頻道,感謝各位的閱讀!

另外有需要云服務(wù)器可以了解下創(chuàng)新互聯(lián)scvps.cn,海內(nèi)外云服務(wù)器15元起步,三天無理由+7*72小時售后在線,公司持有idc許可證,提供“云服務(wù)器、裸金屬服務(wù)器、高防服務(wù)器、香港服務(wù)器、美國服務(wù)器、虛擬主機(jī)、免備案服務(wù)器”等云主機(jī)租用服務(wù)以及企業(yè)上云的綜合解決方案,具有“安全穩(wěn)定、簡單易用、服務(wù)可用性高、性價比高”等特點與優(yōu)勢,專為企業(yè)上云打造定制,能夠滿足用戶豐富、多元化的應(yīng)用場景需求。

本文題目:golang中怎么抓取網(wǎng)頁并分析頁面包含的鏈接-創(chuàng)新互聯(lián)
文章網(wǎng)址:http://muchs.cn/article44/dejeee.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供用戶體驗網(wǎng)站排名、定制網(wǎng)站、品牌網(wǎng)站設(shè)計、網(wǎng)站營銷、品牌網(wǎng)站建設(shè)

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)

成都做網(wǎng)站