我是初学nodejs小白,参照群里的demo,尝试爬去页面上的一些数据; demo里是爬取cnodejs.org首页的数据,cnodejs.org的编码是utf-8,中文返回显示正常; 自己尝试去修改,爬去一些新闻网站(news.qq.com/news.baidu.com)的页面新闻数据,这些网站的编码是gb2312,运行爬虫脚本的时候,返回的指定元素在console打印出来如下:
<a href="http://lianghui.huanqiu.com/2016/roll/2016-03/8722543.html?from=bdwz\" target="_blank" class="a3" mon="ct=1&a=1&c=top&pn=0">ϰ��ƽ����ȫ��¼\n <a href="http://lianghui.huanqiu.com/2016bd/\" target="_blank" class="a3" mon="ct=1&a=1&c=top&pn=0">����ר��
PS:“ϰ”诸如这种代码,我查了下,叫做NCR,在浏览器这句中文显示如下:
ϰ��ƽ����ȫ��¼
所以想请教下前辈,这个gb2312的中文返回乱码的坑,应该问题是出在哪里了呢?