SentiStorm: Echtzeit-Stimmungserkennung von Tweets

SentiStorm: Echtzeit-Stimmungserkennung von Tweets
复制标题

SentiStorm:Tweets 的 Echtzeit-Stimmungserkennung

DOI:
10.1365/s40702-016-0237-6
复制
发表时间:
2016
期刊:
HMD Praxis der Wirtschaftsinformatik
影响因子:
--
通讯作者:
G. Specht
G. Specht
中科院分区:
--
文献类型:
--
作者:
Eva Zangerle;Martin Illecker;G. Specht

文献摘要

被引文献

相似文献

ZusammenfassungDas automatisierkennen der stimung von Texten in den letzten Jahren stark and Bedeutung gewomnen。在社会媒介信息领域,在社会媒介信息领域,在信息技术领域,在信息技术领域,在信息技术领域,在信息技术领域,在信息技术领域,在信息技术领域,在信息技术领域,在信息技术领域。Der microblogging - dienst Twitter verzeichnet im Durchschnitt ber 8000 versendete Nachrichten pro Sekunde。在此之前,我曾在twitter上发表过一篇文章。Dabei erzeeugen wir in einem ersten Schritt Merkmalsvektoren fr die Tweets, die sowhhl linguistische Informationen ber den Tweet (wiichtigkeit der Wörter, Wortarten), die auch ber sentiment_lexika gewonnene stiminginginformationen beinhalten。在einem zweiten Schritt fhren wir mittelels der Merkmalsvektoren eine stiminggskclassiclassiation durch, die eineeinteilung In positive, negative oder neutral Tweets ermöglicht。1 .德国科学与技术研究所,德国科学与技术研究所,德国科学与技术研究所,德国科学与技术研究所,德国科学与技术研究所,德国科学与技术研究所。Weiter zeigen wir, dass der Ansatz mittelels在Apache Storm平台的问题,dass die Echtzeit-Stimmungserkennung von Tweets skaliert werden kann。摘要近年来,文本情感的自动检测变得越来越重要。特别是,社交媒体上信息传播速度的快速增长使得实时情感检测成为一项具有挑战性的任务。在微博平台推特上,每秒发送的消息超过8000条。在这项工作中,我们提出了SentiStorm方法,一种在tweet中进行情感检测的方法。我们基于特征向量的方法,这些特征向量包含了关于tweet内容的语言信息(词的权重,词的类别),以及我们基于情感词典收集的情感信息。随后,我们将这些特征向量用于情感分类任务,该任务允许区分积极,消极和中立的推文。我们进行的评估表明,所提出的方法具有较高的分类精度。同时,我们展示了利用Apache Storm平台,我们能够轻松地将方法扩展到tweets的实时情感分类。
ZusammenfassungDas automatisierte Erkennen der Stimmung von Texten hat in den letzten Jahren stark an Bedeutung gewonnen. Insbesondere durch die rapide Zunahme der Geschwindigkeit, mit der in sozialen Medien Informationen verbreitet werden, ist eine Echtzeit-Bestimmung der Stimmung von Texten ein herausforderndes Problem. Der Mikroblogging-Dienst Twitter verzeichnet im Durchschnitt über 8000 versendete Nachrichten pro Sekunde. In dieser Arbeit stellen wir mit dem SentiStorm-Ansatz einen Ansatz zur Stimmungserkennung von Tweets vor. Dabei erzeugen wir in einem ersten Schritt Merkmalsvektoren für die Tweets, die sowohl linguistische Informationen über den Tweet (Wichtigkeit der Wörter, Wortarten), wie auch über Sentiment-Lexika gewonnene Stimmungsinformationen beinhalten. In einem zweiten Schritt führen wir mittels der Merkmalsvektoren eine Stimmungsklassifikation durch, die eine Einteilung in positive, negative oder neutrale Tweets ermöglicht. Die durchgeführten Evaluationen zeigen, dass der präsentierte Ansatz bezüglich der Qualität der erkannten Stimmung sehr gute Erkennungsraten garantiert. Weiter zeigen wir, dass der Ansatz mittels der Apache Storm Plattform problemlos für die Echtzeit-Stimmungserkennung von Tweets skaliert werden kann.AbstractThe automatic detection of the sentiment of texts has become more and more important throughout the last years. Particularly, the rapid increase of the speed at which information is spread in social media makes real-time sentiment detection a challenging task. On the microblogging platform Twitter, more than 8,000 messages are sent every second. In this work, we present the SentiStorm approach, an approach for sentiment detection within tweets. We base the approach on feature vectors which contain linguistic information about the tweet content (weighting of words, word categories), as well as sentiment information which we gather based on sentiment lexica. Subsequently, we facilitate these feature vectors for a sentiment classification task which allows for distinguishing positive, negative and neutral tweets. Our conducted evaluations show that the proposed approach shows high classification accuracy. At the same time, we show that utilizing the Apache Storm platform we are able to easily scale the approach towards a real-time sentiment classification of tweets.