![Python自然语言处理(微课版)](https://wfqqreader-1252317822.image.myqcloud.com/cover/869/44509869/b_44509869.jpg)
上QQ阅读APP看书,第一时间看更新
1.5.5 搜狗新闻语料库
搜狗新闻语料库,下载地址为http://www.sogou.com/labs/resource/cs.php,如图1-14所示。
搜狐新闻数据(SogouCS)请直接下载精简版,文件为SogouCS.reduced.tar.gz,解压到d:\SogouCS.reduced,共有128个文本文件,如图1-15所示。
每一个txt文件采用ANSI编码,内容是XML格式化,如图1-16所示。
将每个txt文件根据url、contenttitle、content进行拆分,具体含义如下。
· url:获取内容类别。
· contenttitle:获取内容标题,作为txt的文档名。
· content:正文内容。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2511.jpg?sign=1739598951-p2XtVi8rsKeH3cVeE1TNGrbLBJpJtfS1-0-573a949d86c3ef080bb015983efbf9cf)
图1-14 搜狗新闻语料库网页
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2514.jpg?sign=1739598951-hiDgshESTjR7lOJYsCrPy9I1JMeBbve7-0-5dd3873a480e53b120a1bf40853afbdd)
图1-15 下载搜狗新闻语料库
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2519.jpg?sign=1739598951-oBukNFfPj3LY0i6msLquP3Nzxa4Zgj7O-0-aecc67ed92cbf0299e806e4d7cf4e69b)
图1-16 文件内容
代码如下。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2522.jpg?sign=1739598951-mHWKlN7hlaZ0loIGCFXcRbKZGdnNO45x-0-0bb956071b50b1e7b73618736123d0c5)
最终数据集整理为15个类别,如图1-17所示。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P33_2527.jpg?sign=1739598951-mHeBXLarJVV6xmFCkekhPEv61QmTxmQs-0-709c4a28812114cf7c726728ca5e8ea3)
图1-17 语料集分类