关于数据挖掘:R语言SVM支持向量机文本挖掘新闻语料情感情绪分类和词云可视化

全文链接：http://tecdat.cn/?p=32032

原文出处：拓端数据部落公众号

反对向量机（SVM）是一种机器学习办法，基于构造危险最小化准则，即通过大量样本数据，失去尽可能多的样本数据。反对向量机对线性问题进行解决，能解决非线性分类问题。本文介绍了R语言中的 SVM工具箱及其反对向量机（SVM）办法，并将其利用于文本情感剖析畛域，结果表明，该办法是无效的。在此基础上，对文本开掘新闻语料进行情感分类和词云可视化，从视觉上对文本进行情感剖析。

语料是从yahoo Qimo上爬的新闻语料，一共49000篇，每篇蕴含题目、新闻内容、评论、读者投票后果（投票抉择顺次为：实用，感人、开心、超扯、无聊、胆怯、惆怅、火大）以及总投票个数。

数据概览

以第一个意料为例

对其分词提取关键词

library(jiebaR)
cutter = worker(type = "keywords", topn = 10)  
words = "1.txt"

查看工作目录下所有的文件

dir = list.files(".")

获取分类号

xx<-readLines(dir[i],encoding = "UTF-8")

## Warning in readLines(dir[i], encoding = "UTF-8"): 读'1.txt'时最初一行得逞

# xx<-readLines("2.txt",encoding = "UTF-8")  
  
class=strsplit(xx[length(xx)-1],split="#")[[1]][3]

词性分类

for(i in 1:10){
  cutter = worker(type = "keywords", topn = 10)

绘制词汇图

mycolors <- brewer.pal(8,"Dark2")#设置一个色彩系：

wordcloud(cutter_words,as.numeriter_words)),random.order=FAL

筹备训练集和测试集

ntrain <- round(n*0.8) # 训练集  
tindex <- sample(n,ntrain) # 筛选测试集样本  
xtrain<-textdata[tindex,]  
xtest<-textdata[-tindex,]

#可视化  
plot(textdata[,c("classlist","X1")] ,pch=ifelse(istrain==1,1,2))

训练SVM

当初咱们在训练集上应用来训练线性SVM

 svm(classlist ~ . , textdata)

预测数据

predictedY <- predict(model, textdata)

预测的数据

查看分类混同矩阵

最受欢迎的见解

1.Python主题建模LDA模型、t-SNE 降维聚类、词云可视化文本开掘新闻组

2.R语言文本开掘、情感剖析和可视化哈利波特小说文本数据

3.r语言文本开掘tf-idf主题建模，情感剖析n-gram建模钻研

4.游记数据感知游览目的地形象

5.疫情下的新闻数据察看

6.python主题lda建模和t-sne可视化

7.r语言中对文本数据进行主题模型topic-modeling剖析

8.主题模型：数据凝听人民网留言板的那些“网事”

9.python爬虫进行web抓取lda主题语义数据分析

关于数据挖掘:R语言SVM支持向量机文本挖掘新闻语料情感情绪分类和词云可视化

全文链接：http://tecdat.cn/?p=32032

原文出处：拓端数据部落公众号

数据概览

以第一个意料为例

查看工作目录下所有的文件

获取分类号

词性分类

绘制词汇图

筹备训练集和测试集

训练SVM

预测数据

预测的数据

查看分类混同矩阵

评论

发表回复取消回复

更多文章

DDN HPC 存储硬件架构设计深度分析

探秘IO500：从Lustre并行文件系统出发，开启HPC存储性能新征程

苹果iOS打包的ipa应用无法安装？一篇文章带你了解可能的原因及排查方法

图解Golang：从零开始实现简易版过期LRU缓存

关于数据挖掘:R语言SVM支持向量机文本挖掘新闻语料情感情绪分类和词云可视化

全文链接：http://tecdat.cn/?p=32032

原文出处：拓端数据部落公众号

数据概览

以第一个意料为例

查看工作目录下所有的文件

获取分类号

词性分类

绘制词汇图

筹备训练集和测试集

训练SVM

预测数据

预测的数据

查看分类混同矩阵

评论

发表回复 取消回复

更多文章

DDN HPC 存储硬件架构设计深度分析

探秘IO500：从Lustre并行文件系统出发，开启HPC存储性能新征程

苹果iOS打包的ipa应用无法安装？一篇文章带你了解可能的原因及排查方法

图解Golang：从零开始实现简易版过期LRU缓存

发表回复取消回复