大家好,又见面了,我是你们的朋友全栈君。如果您正在找激活码,请点击查看最新教程,关注关注公众号 “全栈程序员社区” 获取激活教程,可能之前旧版本教程已经失效.最新Idea2022.1教程亲测有效,一键激活。
Jetbrains全系列IDE使用 1年只要46元 售后保障 童叟无欺
最近在搞人工智能的东东,玩了玩词云的东西,在编写代码时,出现了一个问题。
目的:统计西游记里出现的词的内容。
读取西游记整本小说的内容,然后进行统计分析。
代码如下:
text = open('西游记.txt').read()
但是在执行的时候一直报错:
UnicodeDecodeError: ‘gbk’ codec can’t decode byte 0x80 in position 2: illegal multibyte sequence
分析可能是由于小说里的内容不是标准的gbk的内容导致的。
查看小说内容截图:
于是乎查找了一番,分析可能是由于小说里还有特殊的符号等内容导致的。
想法:需要进行编码转换。
于是修改代码为,添加了编码范围为utf-8:
text = open('西游记.txt' ,encoding='utf-8').read()
若依然报错,可以添加属性忽略非法字符内容
text = open('西游记.txt', encoding='utf-8', errors='ignore' )
哦了!!问题解决!!成功显示出图如下!!!
发布者:全栈程序员-用户IM,转载请注明出处:https://javaforall.cn/194510.html原文链接:https://javaforall.cn
【正版授权,激活自己账号】: Jetbrains全家桶Ide使用,1年售后保障,每天仅需1毛
【官方授权 正版激活】: 官方授权 正版激活 支持Jetbrains家族下所有IDE 使用个人JB账号...