您好, 欢迎来到 !    登录 | 注册 | | 设为首页 | 收藏本站

python处理抓取中文编码和判断编码的简单示例

5b51 2022/1/14 8:14:49 python 字数 1214 阅读 276 来源 www.jb51.cc/python

python处理抓取中文编码和判断编码的简单示例

概述

在开发自用爬虫过程中,有的网页是utf-8,有的是gb2312,有的是gbk,如果不加处理,采集到的都是乱码,解决方法是将html处理成统一的utf-8编码

版本python2.7


# @param python处理抓取中文编码和判断编码
# @author 编程之家 jb51.cc|jb51.cc 


#coding:utf-8
import chardet
#抓取网页html
line = "http://jb51.cc"
html_1 = urllib2.urlopen(line,timeout=120).read()
encoding_dict = chardet.detect(html_1)
print encoding
web_encoding = encoding_dict['encoding']
#处理,整个html就不会是乱码。
if web_encoding == 'utf-8' or web_encoding == 'UTF-8':
html = html_1
else :
html = html_1.decode('gbk','ignore').encode('utf-8')

# End www.jb51.cc

总结

以上是编程之家为你收集整理的python处理抓取中文编码和判断编码的简单示例全部内容,希望文章能够帮你解决python处理抓取中文编码和判断编码的简单示例所遇到的程序开发问题。


如果您也喜欢它,动动您的小指点个赞吧

除非注明,文章均由 laddyq.com 整理发布,欢迎转载。

转载请注明:
链接:http://laddyq.com
来源:laddyq.com
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。


联系我
置顶