UnicodeDecodeError: 'gbk' codec can't decode byte 0x80 in position 2: illegal multibyte - 悦读

UnicodeDecodeError: 'gbk' codec can't decode byte 0x80 in position 2: illegal multibyte sequence

最近在搞人工智能的东东，玩了玩词云的东西，在编写代码时，出现了一个问题。

目的：统计西游记里出现的词的内容。

读取西游记整本小说的内容，然后进行统计分析。

代码如下：

text = open('西游记.txt'）.read()

但是在执行的时候一直报错：
UnicodeDecodeError: ‘gbk’ codec can’t decode byte 0x80 in position 2: illegal multibyte sequence

分析可能是由于小说里的内容不是标准的gbk的内容导致的。

查看小说内容截图：

在这里插入图片描述

于是乎查找了一番，分析可能是由于小说里还有特殊的符号等内容导致的。

想法：需要进行编码转换。

于是修改代码为,添加了编码范围为utf-8：

text = open('西游记.txt' ，encoding='utf-8'）.read()

若依然报错，可以添加属性忽略非法字符内容

text = open('西游记.txt', encoding='utf-8', errors='ignore' )

哦了！！问题解决！！成功显示出图如下！！！

在这里插入图片描述

悦读

道可道，非常道；名可名，非常名。无名，天地之始，有名，万物之母。故常无欲，以观其妙，常有欲，以观其徼。此两者，同出而异名，同谓之玄，玄之又玄，众妙之门。

Mapbox icon-image表达式

智能显示屏插座：能否成为家庭用电安全的守护天使？

一份你女朋友都能读懂的 Git 教程，还不赶紧学起来！

在TypeScript中使用React钩子

html网页制作代码大全——大学生影视主题网页制作——图图影视影院5页HTML+CSS+JavaScript

文章复现，代码改进，代码跑通，复杂网络辅导

中国手机往事

Linux 原生跟踪工具 Ftrace

JS控制结构（条件、循环）详解

HLS详解（看这个就够了）

;