Análise de sentimento de mensagens do Twitter em português brasileiro relacionadas a temas de saúde

Exibir registro simples

dc.contributor.advisor Pisa, Ivan Torres
dc.contributor.author Araujo, Gabriela Denise
dc.date.accessioned 2017-09-20T14:18:49Z
dc.date.available 2017-09-20T14:18:49Z
dc.date.issued 2014-07-31
dc.identifier.citation ARAUJO, Gabriela Denise. Análise de sentimento de mensagens do Twitter em português brasileiro relacionadas a temas de saúde. 2014. 84 f. Dissertação (Mestrado) – Escola Paulista de Medicina, Universidade Federal de São Paulo. São Paulo, 2014.
dc.identifier.uri http://repositorio.unifesp.br/handle/11600/41280
dc.description.abstract Objetivo: Construir um método de classificação de sentimento, aqui denominado Sentiment Descriptor Indexing (SDI) ou Indexador de Descritores Sentimentais, para ser aplicado em mensagens do Twitter em português brasileiro relacionadas a temas de saúde possibilitando oferecer uma análise de sentimento com caracterização de aspectos da popularidade e repercussão dos temas. Métodos: A primeira etapa considerou a construção do algoritmo SDI que se baseia na coocorrência de termos do Twitter com descritores do vocabulário ANEW-BR. Emoticons e tratamento de negação foram incorporados no SDI. Na segunda etapa foi realizada uma avaliação do desempenho do algoritmo SDI para mensagens sobre o tema “câncer” de um pe-ríodo de três semanas. As mensagens foram classificadas por voluntários como sa-úde ou não saúde, e positiva, negativa ou neutra e em paralelo pelo SDI. As classifi-cações foram pareadas gerando uma avaliação de desempenho. Também foram geradas análise de sentimento e nuvem de termos. Na terceira etapa foi realizado um experimento de análise de sentimento para os temas “câncer” e “diabetes” em um período de seis meses, com análises de repercussão e popularidade. Resulta-dos: As classificações humana e SDI concordaram na classificação majoritária posi-tiva. Os valores de precisão e revocação resultaram 0,68 e 0,67 respectivamente, gerando melhor desempenho com f0,5-measure 0,68. No experimento coletou-se um total de 25.230 mensagens sobre o tema "câncer" com classificação de sentimento positiva (71%). Pela nuvem de palavras foi possível observar que celebridades, insti-tutos, hospitais, campanhas de saúde e tipos de câncer são assuntos populares so-bre o tema. Para o tema "diabetes" 3.328 mensagens foram coletadas com classifi-cação de sentimento positiva (78%). Para este tema as palavras mais frequentes, indicadas na nuvem de palavras, estavam relacionadas a alimentos e doenças como obesidade e hipertensão. Conclusão: Os resultados obtidos na etapa de avaliação do classificador SDI mostrou que o SDI teve um bom desempenho na tarefa de clas-sificar mensagens do Twitter sobre saúde comparada a classificação realizada por humanos. Entretanto, o tema escolhido retornou mensagens difíceis de serem rotu-ladas até mesmo pelos humanos, gerando discordâncias nas classificações. As con-tribuições deste trabalho visam suprir a falta de métodos de análise de sentimentos para a língua portuguesa brasileira bem como incentivar sua aplicação na melhoria de outras atividades em processamento de linguagem natural. pt
dc.description.abstract Objective: Build a sentiment classification method, named Sentiment Descriptor In-dexing (SDI), to be applied in Twitter’s messages in brazilian portuguese related to health topics, providing sentiment analysis with characterization of aspects of the popularity and impact of issues. Methods: The first step regarded the SDI algorithm construction that it is based on the cooccurence of Twitter's terms with descriptors of ANEW-BR vocabulary. Emoticons and deny treatment were embedded in the SDI. In the second step, an evaluation was performed in the algorithm SDI for messages related the topic "cancer" collected in a period of three weeks. The messages were classified by volunteers in topic about health or not health, and positive, negative or neutral and in parallel by the SDI. The ratings were paired generating a performance evaluation, sentiment analysis and cloud of terms. In the third step an experiment of sentiment analysis was performed for the topics "cancer" and "diabetes" in a period of six months, with analysis of impact and popularity. Results: The human and SDI classifications agreed in positive majority classification. The values of precision and recall resulted 0.68 and 0.67 respectively, the best performance was in f0,5-measure 0,68. In experiment, it was collected a total of 25,230 messages on "cancer" and the sentiment classification of these messages was positive (71%). Through the cloud of words was possible to observe that celebrities, institutes, hospitals, health campaigns and types of cancers are popular subjects on the topic. For the topic "diabetes", 3,328 messages were collected and the sentimental classification was positive (78%). For this topic the most frequent words, given the cloud of words were related to food and diseases such as obesity and hypertension. Conclusions: The results obtained in the evaluation step showed that the SDI had a good performance in the task of classifying Twitter’s messages about health topics compared the classification performed by humans. However, the topic chosen brought messages difficult to be labeled even by humans, causing disagreements in the classifications among them. The contributions of this work aims to meet the lack of sentiment analysis methods for the brazilian portuguese language and encourage its application in improving oth-er activities in natural language processing. pt
dc.description.sponsorship Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) pt
dc.language.iso por pt
dc.publisher Universidade Federal de São Paulo (UNIFESP) pt
dc.rights Acesso aberto pt
dc.subject Análise de Sentimento pt
dc.subject Twitter pt
dc.subject Classificação pt
dc.subject Câncer pt
dc.subject Diabetes pt
dc.subject Sentiment Analysis en
dc.subject Twitter en
dc.subject Classification en
dc.subject Health en
dc.subject Cancer en
dc.subject Diabetes en
dc.subject Saúde pt
dc.title Análise de sentimento de mensagens do Twitter em português brasileiro relacionadas a temas de saúde pt
dc.title.alternative Sentiment analysis of Twitter’s messages in brazilian portuguese about health topics. pt
dc.type Dissertação de mestrado pt
dc.contributor.institution Universidade Federal de São Paulo (UNIFESP) pt
dc.identifier.file Dissertação - Gabriela Denise de Araujo.pdf
unifesp.campus Escola Paulista de Medicina (EPM) pt
unifesp.graduateProgram Gestão e informática em saúde - São Paulo pt
unifesp.knowledgeArea Tecnologia em saúde pt
unifesp.researchArea Gestão e Informática em Saúde pt



Arquivo

Nome: Dissertação - Gabriela Denise de Araujo.pdf
Tamanho: 1.482MB
Formato: PDF
Descrição: Dissertação
Abrir arquivo

Este item está nas seguintes coleções

Exibir registro simples

Buscar


Navegar

Minha conta