如何解決php使用iconv中文截?cái)鄦栴}-創(chuàng)新互聯(lián)

這篇文章主要為大家展示了“如何解決php使用iconv中文截?cái)鄦栴}”,內(nèi)容簡(jiǎn)而易懂,條理清晰,希望能夠幫助大家解決疑惑,下面讓小編帶領(lǐng)大家一起研究并學(xué)習(xí)一下“如何解決php使用iconv中文截?cái)鄦栴}”這篇文章吧。

創(chuàng)新互聯(lián)公司10多年成都定制網(wǎng)頁(yè)設(shè)計(jì)服務(wù);為您提供網(wǎng)站建設(shè),網(wǎng)站制作,網(wǎng)頁(yè)設(shè)計(jì)及高端網(wǎng)站定制服務(wù),成都定制網(wǎng)頁(yè)設(shè)計(jì)及推廣,對(duì)成都玻璃貼膜等多個(gè)行業(yè)擁有多年的網(wǎng)站制作經(jīng)驗(yàn)的網(wǎng)站建設(shè)公司。

具體分析如下:

今天做了一個(gè)采集程序,原理很簡(jiǎn)單,使用curl方法把對(duì)方頁(yè)面的html獲取分析,然后正則提取需要的數(shù)據(jù)并保存在數(shù)據(jù)庫(kù)。

由于對(duì)方頁(yè)面是GB2312編碼,而本地使用的是UTF-8編碼。因此在采集后需要進(jìn)行編碼轉(zhuǎn)換。

使用了iconv方法進(jìn)行編碼轉(zhuǎn)換

iconv — 字符串按要求的字符編碼來(lái)轉(zhuǎn)換 
string iconv ( string $in_charset , string $out_charset , string $str )

將字符串 str 從 in_charset 轉(zhuǎn)換編碼到 out_charset 。

轉(zhuǎn)換的方法很簡(jiǎn)單,直接使用iconv方法就可以了

<?php 
$content = iconv('GB2312', 'UTF-8', $content); //$content為采集到的內(nèi)容 
?>

試驗(yàn)了幾個(gè)頁(yè)面,都能正常采集。但在之后的采集中,有幾個(gè)頁(yè)面采集不完整。
一開始考慮是否正則有錯(cuò),檢查后排除此問題。經(jīng)過排查,發(fā)現(xiàn)經(jīng)過iconv轉(zhuǎn)碼后的內(nèi)容比采集的內(nèi)容少了一大段。
查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。

翻查手冊(cè),看到以下說明

如果你在 out_charset 后添加了字符串 //TRANSLIT,將啟用轉(zhuǎn)寫(transliteration)功能。這個(gè)意思是,當(dāng)一個(gè)字符不能被目標(biāo)字符集所表示時(shí),它可以通過一個(gè)或多個(gè)形似的字符來(lái)近似表達(dá)。

如果你添加了字符串 //IGNORE,不能以目標(biāo)字符集表達(dá)的字符將被默默丟棄。 否則, str 從第一個(gè)無(wú)效字符開始截?cái)嗖?dǎo)致一個(gè) E_NOTICE 。

原來(lái)iconv遇到不能識(shí)別的內(nèi)容,會(huì)從第一個(gè)不能識(shí)別的字符開始截?cái)?,并生成一個(gè)E_NOTICE。因此后邊的內(nèi)容被丟棄了。

而在輸出字符集后加上//IGNORE則只丟棄不能識(shí)別的內(nèi)容,而不會(huì)截?cái)嗪蛠G棄后面的內(nèi)容。

修改程序后一切正常

<?php 
$content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內(nèi)容
?>

Tips:使用iconv時(shí),如果要使用UTF-8編碼的,請(qǐng)使用UTF-8而不要使用UTF8,因?yàn)閁TF8有些服務(wù)器會(huì)有問題。

以上是“如何解決php使用iconv中文截?cái)鄦栴}”這篇文章的所有內(nèi)容,感謝各位的閱讀!相信大家都有了一定的了解,希望分享的內(nèi)容對(duì)大家有所幫助,如果還想學(xué)習(xí)更多知識(shí),歡迎關(guān)注創(chuàng)新互聯(lián)行業(yè)資訊頻道!

新聞標(biāo)題:如何解決php使用iconv中文截?cái)鄦栴}-創(chuàng)新互聯(lián)
文章鏈接:http://muchs.cn/article30/eippo.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供外貿(mào)建站、靜態(tài)網(wǎng)站定制開發(fā)、網(wǎng)站改版、服務(wù)器托管、移動(dòng)網(wǎng)站建設(shè)

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請(qǐng)盡快告知,我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如需處理請(qǐng)聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時(shí)需注明來(lái)源: 創(chuàng)新互聯(lián)

成都seo排名網(wǎng)站優(yōu)化