python处理抓取中文编码和判断编码的简单示例

5b51 2022/1/14 8:14:49 python 字数 1214 阅读 276 来源 www.jb51.cc/python

概述

在开发自用爬虫过程中，有的网页是utf-8，有的是gb2312,有的是gbk，如果不加处理，采集到的都是乱码，解决的方法是将html处理成统一的utf-8编码

版本python2.7


# @param python处理抓取中文编码和判断编码
# @author 编程之家 jb51.cc|jb51.cc 


#coding:utf-8
import chardet
#抓取网页html
line = "http://jb51.cc"
html_1 = urllib2.urlopen(line,timeout=120).read()
encoding_dict = chardet.detect(html_1)
print encoding
web_encoding = encoding_dict['encoding']
#处理，整个html就不会是乱码。
if web_encoding == 'utf-8' or web_encoding == 'UTF-8':
html = html_1
else :
html = html_1.decode('gbk','ignore').encode('utf-8')

# End www.jb51.cc

总结

以上是编程之家为你收集整理的python处理抓取中文编码和判断编码的简单示例全部内容，希望文章能够帮你解决python处理抓取中文编码和判断编码的简单示例所遇到的程序开发问题。

如果您也喜欢它,动动您的小指点个赞吧

除非注明，文章均由 laddyq.com 整理发布，欢迎转载。

转载请注明：
链接：http://laddyq.com
来源：laddyq.com
著作权归作者所有。商业转载请联系作者获得授权，非商业转载请注明出处。

python处理抓取中文编码和判断编码的简单示例

概述

总结

分类汇总

您的鼓励是对我最大的支持