scieee AI-readable full text Open interactive document viewer

Generación adaptativa de consultas para la recuperación temática de tweets

Cotelo Moya, Juan Manuel; Cruz Mata, Fermín; Troyano Jiménez, José Antonio

Abstract

Twitter se ha convertido en un recurso con gran potencial a la hora de analizar los estados de opinión acerca de temas de actualidad. En el presente trabajo mostramos la metodología utilizada para la obtención de un corpus de mensajes de Twitter relacionados con las elecciones generales españolas del 20 de noviembre de 2011. Dado que el acceso a los mensajes en Twitter se realiza mediante consultas, hemos estudiado diversas estrategias de construcción de dichas consultas, tratando de maximizar la cobertura obtenida. Tras experimentar con diversos acercamientos, se propone un método basado en grafos que permite la captura de tweets relacionados con una temática determinada, adaptando dinámicamente las consultas utilizadas para incorporar automáticamente los temas relacionados que eventualmente vayan surgiendo. El recurso obtenido, de gran utilidad, entre otros, en trabajos de análisis del sentimiento, está públicamente disponible para su utilización.

Full text

Generaci´on adaptativa de consultas para la recuperaci´on tem´atica de tweets Adaptive query generation for topic-based tweet retrieval Juan M. Cotelo, Ferm´ın L. Cruz, Jose A. Troyano Dep. de Lenguajes y Sistemas Inform´aticos Universidad de Sevilla Avda. Reina Mercedes s/n 41012 Sevilla {jcotelo,fcruz,troyano}@us.es Resumen: Twitter se ha convertido en un recurso con gran potencial a la hora de analizar los estados de opini´on acerca de temas de actualidad. En el presente trabajo mostramos la metodolog´ıa utilizada para la obtenci´on de un corpus de mensajes de Twitter relacionados con las elecciones generales espa˜nolas del 20 de noviembre de 2011. Dado que el acceso a los mensajes en Twitter se realiza mediante consultas, hemos estudiado diversas estrategias de construcci´on de dichas consultas, tratando de maximizar la cobertura obtenida. Tras experimentar con diversos acercamientos, se propone un m´etodo basado en grafos que permite la captura de tweets relacionados con una tem´atica determinada, adaptando din´amicamente las consultas utilizadas para incorporar autom´aticamente los temas relacionados que eventualmente vayan surgiendo. El recurso obtenido, de gran utilidad, entre otros, en trabajos de an´alisis del sentimiento, est´a p´ublicamente disponible para su utilizaci´on. Palabras clave: Recuperaci´on de informaci´on, Twitter, an´alisis de grafos Abstract: Twitter has become a resource of great potential for analyzing opinion about hot topics. In this paper we show the methodology used for obtaning a corpus of Twitter messages related to the Spanish general elections of November 20, 2011. Given that access to Twitter messages is done through querying, we have studied various strategies for building such queries, trying to maximize the coverage. After experimenting with several approaches, we propose a graph-based method that allows retrieval of tweets related to a specific topic, dynamically adapting the queries to automatically include related topics that eventually arise. The obtained resource, very useful for, among others, sentiment analysis tasks, is publicy available for use. Keywords: Information retrieval, Twitter, graph analysis 1. Introducci´on Twitter ha obtenido mucha atenci´on en el campo investigador en los ´ultimos a˜nos debido principalmente a dos factores:por un lado, un aumento exponencial en volumen tanto de usuarios como de mensajes; por otro lado, la disponibilidad de una API p´ublica para acceder a los datos. Este reciente inter´es se ha materializado en la creaci´on de multitud de aplicaciones web y trabajos de investigaci´on que abordan Twitter explotando las caracter´ısticas de red social, evoluci´on temporal y brevedad de los mensajes que exhibe. La captura de datos en Twitter no es trivial, permiti´endose ´unicamente el acceso a datos mediante consultas compuestas principalmente por t´erminos de b´usqueda. La estructura de la red es tan amplia y grande, que no es f´acil determinar los t´erminos o usuarios mas relevantes respecto a lo que se quiere capturar, siendo impracticable capturar todos los tweets por motivos t´ecnicos. Por ello, la construcci´on de consultas sobre Twitter que permitan la captura de datos relevantes con la suficiente cobertura es un problema interesante en s´ı mismo. A pesar de ello, la mayor´ıa de los trabajos de investigaci´on se conforman con la utiliProcesamiento de Lenguaje Natural, Revista nº 48 marzo de 2012, pp 57-64 recibido 11-01-12 revisado 06-03-12 aceptado 18-03-12 ISSN 1135-5948 © 2012 Sociedad Española para el Procesamiento de Lenguaje Natural zaci´on de consultas simples para obtener los datos. Dependiendo del problema abordado en cada caso, esto puede ocasionar la p´erdida de datos interesantes y por tanto la obtenci´on de resultados y conclusiones parcialmente incorrectos. En trabajos recientes relacionados con Twitter ((Agarwal et al., 2011) (Davidov, Tsur, y Rappoport, 2010a), (Davidov, Tsur, y Rappoport, 2010b), (Go, Bhayani, y Huang, 2009), (Jiang et al., 2011), (Kim et al., 2009) (Pak y Paroubek, 2010), (Silva et al., 2011), (Tan et al., 2011), (Tumasjan et al., 2010), (Hong y Nadler, 2011), (Pennacchiotti y Popescu, 2011), (Congosto, Fern´andez, y Egido, 2011)), se utilizan una serie de listas est´aticas de t´erminos decididas manualmente; esta aproximaci´on es demasiado simplista y no proporciona garant´ıas de cobertura, precisi´on y calidad. Una excepci´on sucede en el trabajo de Golbeck y Hansen (2011) en la que parten del conjunto de congresistas a modo de semilla y lo expanden a trav´es de sus seguidores para intentar determinar si existe alg´un enlace pol´ıtico entre los congresistas y los medios de comunicaci´on usando a dichos seguidores como enlace. Sin embargo, no es un m´etodo general y mucho menos din´amico. Creemos que es necesario investigar nuevos m´etodos de obtenci´on de datos de Twitter que mejoren la cobertura y sean capaces de adaptarse a la naturaleza din´amica de los mensajes de Twitter. 2. Estrategias iniciales Inicialmente, se abord´o el problema de la captura de datos de Twitter mediante una serie de aproximaciones b´asicas como parte del trabajo inicial exploratorio. Recordemos que estas aproximaciones son, en esencia, m´etodos para construir consultas sobre Twitter, pues es la forma en la que ´este permite el acceso a sus datos. 2.1. Etiqueta central y lista est´atica de t´erminos La primera aproximaci´on tomada durante la captura de tweets fue simple y directa. De manera intuitiva, se modela la existencia de un t´ermino “central” que representa la tem´atica en cuesti´on a ser explorada, siendo este t´ermino muy frecuente y utilizado por la comunidad para dicha tem´atica. En Twitter es com´un la utilizaci´on de etiquetas o hashtags, t´erminos ligeramente desambiguados que hacen referencia a alg´un tema determinado. Estos t´erminos comienzan por el car´acter ‘#’. La tem´atica objetivo utilizada en este trabajo son las elecciones generales espa˜nolas del 20 de noviembre de 2011. Para ello se decidi´o escoger como t´ermino central la etiqueta #20N, siendo esta la etiqueta recurrente para hablar de las elecciones en Twitter. Esta t´ecnica na¨ıve nos sirve como primera aproximaci´on al problema de explorar el espacio de datos y como punto central en dicho espacio. Sin embargo, a pesar de su prol´ıfico uso en Twitter, la cobertura es insuficiente. Si nos quedamos con solo los datos obtenidos de esa consulta, podemos perder informaci´on altamente relacionada con las elecciones que no est´a especificada de manera directa en los tweets de esta etiqueta. Por ejemplo, es posible que perdamos mensajes importantes de los candidatos o de los partidos pol´ıticos. Una opci´on para solventar el problema de la cobertura ser´ıa la generaci´on de una lista de t´erminos adicionales relacionados con la tem´atica en lugar de un solo t´ermino central, pero la cobertura depender´ıa exclusivamente del criterio del experto que genera la lista. Adem´as no se contemplar´ıan posibles t´erminos que har´ıan referencia a temas relacionados importantes que pueden aparecer a lo largo del tiempo. En la siguiente secci´on planteamos un m´etodo que pretende solucionar este problema. 2.2. Listas de t´erminos generadas din´amicamente La generaci´on de una lista est´atica no responde bien ante la naturaleza temporal de Twitter. El uso de los diferentes t´erminos y etiquetas var´ıa significativamente a lo largo del tiempo, reduciendo la capacidad de cobertura de una lista est´atica a lo largo de una ventana de tiempo relativamente grande. Sin embargo, lo mas grave es la incapacidad de adaptarse para capturar eventos impredecibles que afectan a la tem´atica explorada en cuesti´on. Para ilustrar esta situaci´on y tomando como ejemplo la tem´atica de las elecciones generales, supongamos que el gobierno actual decide instaurar una ley pol´emica o reacciona ante alg´un evento de forma igualmente pol´emica, lo que puede terminar afectando significativamente a la opini´on publica sobre las futuras elecciones. Es muy probable que Juan M. Cotelo, Fermín L. Cruz, Jose A. Troyano 58 surgiera una nueva etiqueta durante un tiempo que representara ese evento, por lo que los tweets usar´an esa etiqueta para referirse a ese evento. Estos eventos de alta relevancia pero relativa corta vida son muy importantes en Twitter y pueden ser de distinta naturaleza como debates, desastres naturales, ataques terroristas, crisis econ´omica o acciones pol´ıticas. Una estrategia para adaptarse al car´acter temporal de Twitter es la de generar las listas de t´erminos din´amicamente, analizando los resultados tal como se van capturando y pudiendo determinar qu´e t´erminos son los m´as relevantes en cada momento. Para el problema que se describe en este art´ıculo, la t´ecnica de bootstrapping nos permite ir actualizando el conjunto de t´erminos de b´usqueda de forma regular e iterativamente sobre s´ı mismo. Cada cierto periodo estipulado, se realiza un c´omputo del nuevo conjunto de t´erminos de b´usqueda a partir de los datos capturados anteriormente durante una ventana de tiempo determinada. A la t´ecnica descrita le falta un componente fundamental: el algoritmo o m´etodo que se aplica a cada iteraci´on para determinar qu´e t´erminos son m´as relevantes en cada momento. 2.2.1. Selecci´on usando heur´ısticas basadas en la frecuencia Para poder seleccionar los t´erminos m´as relevantes en cada momento, una de las ideas mas simples que surgen es la de utilizar heur´ısticas basadas en frecuencias, partiendo de la etiqueta central como semilla para la recogida de tweets y durante una ventana de tiempo razonable. Se realiz´o un an´alisis que consisti´o en la elaboraci´on de listas de t´erminos ordenadas por relevancia, calculada mediante distintas heur´ısticas basadas en frecuencia: logverosimilitud, la informaci´on mutua puntual y el test exacto de Fisher. Se realiz´o una limpieza de los datos de entrada para eliminar elementos no deseados como palabras huecas. El texto fue procesado para dejar s´olo nombres, adjetivos y verbos, adem´as de los constructos sint´acticos espec´ıficos de Twitter tales como las menciones(@) y las etiquetas (#). Se obtuvieron listas de unigramas, bigramas y trigramas (con una ventana de tama˜no 4 para bigramas y trigramas) ordenadas seg´un las heur´ısticas anteriores, comprob´andose los 100 primeros elementos de cada lista. La lista de unigramas fue bastante satisfactoria, encontrando en ella muchos elementos relacionados con las elecciones que, a priori, no se hubieran obtenido a trav´es de una elaboraci´on manual. Aunque de la lista de bigramas se obtuvieron asociaciones entre t´erminos muy interesantes y significativas con las elecciones como pueden ser hgobierno, crisisi,hP P, recortesio hcambio, gobiernoi, la lista se encontraba llena de bigramas que conten´ıan alg´un t´ermino de la lista de unigramas o que eran de escasa utilidad debido al ruido. La lista de trigramas no aport´o informaci´on realmente interesante. Simplemente tomando los t´erminos m´as relevantes de lista de unigramas (en este caso los 100 primeros) como una consulta combinada disyuntiva en Twitter, podemos capturar tweets relacionados con el tema representado por #20N (elecciones generales) con una gran cobertura y de forma autom´atica. 2.2.2. Selecci´on usando medidas de relevancia en grafos El m´etodo anterior tiene ciertas desventajas, siendo la mas importante el no aprovechar la estructura de grafo que exhibe Twitter, tratando a las etiquetas y menciones como simples t´erminos. Es m´as, un an´alisis detallado de las listas revel´o que la mayor´ıa de los t´erminos relevantes son etiquetas o menciones a usuarios importantes, por lo qu´e un an´alisis mediante algoritmos de grafos puede dar mejores resultados. Por ello, surge la necesidad de utilizar otras estrategias que analicen la estructura de grafos de Twitter, tomando como semilla o punto de referencia la etiqueta central. Dado que Twitter es en realidad un grafo inmenso con varios tipos de relaciones, usaremos PageRank como herramienta de an´alisis de enlaces para procesar dichas relaciones. PageRank nos permite obtener un ranking de nodos de un grafo en funci´on de su relevancia dentro del mismo. El grafo sobre el que se computa PageRank se construye a partir de los datos capturados de la ventana de tiempo especificada, generando nodos para las etiquetas y los usuarios (#y@). La aristas del grafo entre nodos de usuarios y etiquetas representan lo siguiente: Usuario −→ Usuario: menciones Usuario −→ Etiqueta: uso de etiqueta Etiqueta ←→ Etiqueta: coocurrencia Generación adaptativa de consultas para la recuperación temática de tweets 59 El grafo resultante tiene aristas tanto dirigidas como no dirigidas y el peso de cada una de esas aristas viene determinado por el volumen de tweets de la situaci´on representada. Con esta ponderaci´on que hace uso de las relaciones entre usuarios y etiquetas, se aplica PageRank sobre el grafo ponderado y se obtiene el ranking de nodos m´as relevantes en la red, siendo cada nodo un t´ermino que puede ser tanto etiqueta como usuario. La ventaja que tiene el an´alisis de grafos frente el an´alisis estad´ıstico es que al analizar las relaciones entre los nodos podemos descubrir elementos de alta relevancia pero de bajo volumen de ocurrencias que un an´alisis basado en frecuencia no captar´ıa. Este m´etodo detecta elementos como #anguitaporc´ordoba que tienen poder medi´atico pero no se incluir´ıan si tenemos en consideraci´on solamente el volumen; se incluyen porque al aplicar PageRank, estos coocurren o son mencionados por elementos que tienen una relevancia directa mayor. En pocas palabras, se favorecen los elementos que son referenciados por otros elementos ya relevantes. Al aplicar el m´etodo a intervalos de tiempo, utilizando en cada iteraci´on el conjunto completo de tweets obtenidos en el paso anterior, se observa un comportamiento no deseado: el conjunto de t´erminos diverge demasiado, separ´andose de la semilla inicial cada vez m´as. Para ilustrar este efecto, se muestran los 10 primeros t´erminos de las primeras cuatro iteraciones del m´etodo, ejecutadas cada 60 minutos y usando como semilla #20N: 1. #20n #15m @metroscopia @marianorajoy #15o #globalchange #occupyspain @llamamatrimonio @occupyspain @conrubalcaba 2. #fb @upyd @conrubalcaba #20n @anapastor tve #15m #t #15o #pp @marianorajoy 3. #fb #nowplaying #thaiflood #sumatealrosa #nf #20n @conrubalcaba @1dupdates #t #15o 4. #nowplaying #fb #sumatealrosa #nf #thaiflood #in #facebook @gllamazares @no al cancer @marianorajoy Se observa que cada iteraci´on se desv´ıa a´un mas de la tem´atica a explorar, pues elementos como #nowplaying o#thaiflood no est´an relacionados con lo que queremos capturar. Esto se debe a diversas causas: En las listas de t´erminos aparecen usuarios que adem´as de hablar de la tem´atica central (elecciones/pol´ıtica), pueden comentar sobre otras tem´aticas. Algunos temas de los que hablan los usuarios explorados son temas muy populares en ese momento: #thaiflood, #cancerdemama o#spotify. Dichos temas acumulan muchas menciones de manera temporal, entrando en la lista de t´erminos mas relevantes mediante puro volumen. Una vez que un t´ermino no relacionado con la tem´atica central gana una posici´on en la lista de los mas relevantes, se capturan los tweets relacionados con ese t´ermino provocando una “inundaci´on” de informaci´on no relacionada con la pol´ıtica. Para solucionar este problema, se propone una peque˜na variante del m´etodo en la cual se evita que la lista diverja con respecto a la semilla central. En lugar de utilizar todos los tweets recuperados en el ´ultimo paso para la construcci´on del grafo, se utilizan s´olo los tweets que contienen al t´ermino semilla (en nuestro caso, #20N). Para una mejor comprensi´on, la figura 1 muestra un diagrama intuitivo del m´etodo finalmente propuesto. Con este m´etodo se consigue, con un alto grado de satisfacci´on, solventar la problem´atica existente sobre la generaci´on de consultas para la captura de datos en Twitter, todo ello de forma iterativa, explotando la topolog´ıa de grafo que proporciona Twitter y controlando la inducci´on y cobertura de los t´erminos. 3. Recurso generado Realizando una captura en tiempo real de los tweets mediante el API de streaming que Twitter ofrece y usando el m´etodo de generaci´on de consultas expuesto en la secci´on 2.2.2 se gener´o un recurso que contiene informaci´on relevante a las actualizaciones de estado o status updates de ese periodo. Un status update es una actualizaci´on del estado del usuario ya sea mediante tweets,retweets o respuestas (replies). Juan M. Cotelo, Fermín L. Cruz, Jose A. Troyano 60 Figura 1: Diagrama del m´etodo finalmente propuesto Campo Descripci´on truncated Indica si el texto fue truncado por exceso de caracteres retweetCount Indica el node retweets respecto al original id Identificador num´erico del tweet createdAt Fecha y hora de creaci´on Tabla 1: Atributos del elemento <status> 3.1. Descripci´on del recurso El recurso es una colecci´on de archivos XML , cada uno de los cuales contiene los tweets capturados durante una hora, a lo largo de todo el periodo de las elecciones espa˜nolas de 2011 (precampa˜na, campa˜na, d´ıa de las elecciones y el d´ıa despu´es de las elecciones), comprendiendo del 21 de octubre al 21 de noviembre. Cada fichero posee la siguiente estructura general dividida en secciones: <filterQuery>: Consulta de filtrado usada (lista de t´erminos). <statuses>: Colecci´on de elementos <status> capturados a lo largo del periodo. El elemento <status> representa una actualizaci´on de estado. La lista de atributos del elemento <status> se muestra en la tabla 1 y la lista de subelementos se muestra en la tabla 2. Sub-elemento Descripci´on inReplyToStatusId Identificador del status al que este status hace una respuesta inReplyToUserId Identificador del usuario al que este status hace una respuesta hashtags Hashtags referenciados source Medio de origen text Texto procesado final urlEntities URL que aparecen user Usuario que realiza la actualizaci´on de estado userMentions Menciones a otros usuarios que aparecen Tabla 2: Descripci´on de los subelementos del elemento <status> En esencia, el recurso generado conforma un corpus de Twitter que engloba el periodo de las elecciones. En la tabla 3 se muestra una serie de m´etricas de inter´es sobre las caracter´ısticas m´as generales del recurso, siendo ´estas principalmente volum´etricas. En la gr´afica 2 se muestra de forma m´as intuitiva la distribuci´on global de los updates seg´un su naturaleza b´asica: retweets,replies (sean especificas a un update concreto o no) o “tweets sencillos”. 3.2. Utilidad del recurso A continuaci´on se muestran a modo de ejemplo una serie de resultados de an´alisis para dar ejemplo de la utilidad y la capacidad de Generación adaptativa de consultas para la recuperación temática de tweets 61 M´etrica Valor # de users 1.587.930 # de hashtags 195.985 # de updates 5.724.612 # de retweets 1.362.785 # de replies 202.778 # de status replies 683.305 Tabla 3: M´etricas generales del recurso Figura 2: Distribuci´on del volumen total de updates seg´un su naturaleza. explotaci´on del mismo. Una de las formas m´as simples y directas de analizar el recurso es mediante la comparaci´on de las diferentes listas de t´erminos utilizadas a lo largo del periodo. De esta forma, de un simple vistazo, podemos observar cu´ales son los t´erminos mas relevantes para la comunidad twittera, correspondientes a las elecciones. Hemos escogido tres momentos interesantes inicio de la precampa˜na, el debate de los candidatos del PSOE y el PP a presidente y el d´ıa de las elecciones. La tabla 4 muestra los 10 t´erminos mas relevantes de estos tres puntos temporales. La visualizaci´on expuesta en la figura 3 representa el grafo generado durante todo el debate de los candidatos a presidente tal y como se especifica en la secci´on 2.2.2. Se han etiquetado los nodos m´as relevantes, cada nodo est´a coloreado y escalado en funci´on de su puntuaci´on de PageRank y las aristas est´an coloreadas seg´un el promedio de los nodos que une. Twitter posee una naturaleza claramente temporal que puede ser explotada a trav´es del recurso. Para ilustrar un caso de an´alisis temporal, tomaremos la gr´afica de la figura 4 correspondiente al debate de los candidatos a Presidente del Gobierno por parte de los partidos PSOE y PP. Esta gr´afica muestra la evoluci´on temporal de la relevancia de los usuarios @conrubalcaba y@marianorajoy y las etiquetas #rubalcaba,#debate y#rajoy, donde las l´ıneas finas muestran el valor real mientras que las l´ıneas gruesas muestran la tendencia utilizando una media m´ovil de 6 valores. Una de las primeras cosas que podemos observar es la correcta detecci´on de la etiqueta #debate y su relevancia debido a la aplicaci´on del m´etodo expuesto basado en PageRank, siendo ´esta relevante solo en ese periodo y llegando a superar al resto de t´erminos durante el propio debate. Se detecta el auge de etiquetas como #rajoy o#rubalcaba que experimentan un claro aumento durante el debate y exhiben una interesante correlaci´on con respecto a #debate, mientras que los t´erminos @conrubalcaba y@marianorajoy no sufren alteraci´on alguna y mantienen su relevancia relativamente estable a lo largo del periodo. Como ´ultimo apunte, se observa que al final del periodo observado los t´erminos referentes al candidato Mariano Rajoy (@marianorajoy y#rajoy) quedan ligeramente por encima de los t´erminos referentes al candidato Rubalcaba (@conrubalcaba y#rubalcaba), tomando como referencia el valor absoluto (l´ınea fina) sobre la tendencia, coincidiendo con los resultados de las encuestas sobre el ganador del debate. Hay que tener en cuenta que ambas gr´aficas mostradas est´an en escala logar´ıtmica para una mejor observaci´on y presentaci´on. 4. Conclusiones El m´etodo propuesto permite recuperar los tweets relacionados con un tema determinado, incluyendo autom´aticamente en las consultas utilizadas las nuevas etiquetas y usuarios relevantes que vayan apareciendo en el periodo en el que se realice la captura. Se trata de una mejor soluci´on a la empleada en otros trabajos recientes relacionados con Twitter, especialmente en t´erminos de cobertura y adaptaci´on a posibles eventos novedosos relacionados. El recurso obtenido est´a disponible para su utilizaci´on p´ublica1. Actualmente, esta1http://www.lsi.us.es/~fermin/index.php/ Datasets Juan M. Cotelo, Fermín L. Cruz, Jose A. Troyano 62 Principio Debate Elecciones #20n #20n #20n @crparlamentaria #debate #elecciones20n #15m #eldebate #elecciones #nolesvotes #caraacara @antoniofraguas @psoe @conrubalcaba @kurioso @elconfidencial #reiniciaeldebate #votar @marta llorens @marianorajoy @el pais @gad3 com @ramonlobo #mesas20n @ppopular #seacaboelcirco @marianorajoy #pp @otrodiademierda @la ser Tabla 4: T´erminos relevantes en tres instantes temporales Figura 3: Visualizaci´on del grafo correspondiente al debate mos empleando el recurso para llevar a cabos experimentos de an´alisis de opini´on y detecci´on de comunidades. Bibliograf´ıa Agarwal, Apoorv, Boyi Xie, Ilia Vovsha, Owen Rambow, y Rebecca Passonneau. 2011. Sentiment analysis of twitter data. En Proceedings of the Workshop on Language in Social Media (LSM 2011), p´aginas 30–38, Portland, Oregon, Junio. Association for Computational Linguistics. Congosto, M. Luz, Montse Fern´andez, y Esteban Moro Egido. 2011. Twitter y pol´ıtica: Informaci´on, opini´on y ¿predicci´on? Cuadernos de Comunicaci´on Evoca, 4. Davidov, Dmitry, Oren Tsur, y Ari Rappoport. 2010a. Enhanced sentiment learning using twitter hashtags and smileys. En Proceedings of the 23rd Generación adaptativa de consultas para la recuperación temática de tweets 63 1 2 4 8 16 32 64 128 256 6-nov 6-nov 7-nov 7-nov 8-nov 8-nov 9-nov 9-nov 10-nov @conrubalcaba @marianorajoy #debate #rajoy #rubalcaba Figura 4: Evoluci´on temporal de los t´erminos @conrubalcaba, @marianorajoy, #debate, #rajoy y#rubalcaba antes y despu´es del debate de los candidatos. Escala logar´ıtmica en base 2 (y0=log2(y)) International Conference on Computational Linguistics: Posters, COLING ’10, p´aginas 241–249, Stroudsburg, PA, USA. Association for Computational Linguistics. Davidov, Dmitry, Oren Tsur, y Ari Rappoport. 2010b. Semi-supervised recognition of sarcastic sentences in twitter and amazon. En Proceedings of the Fourteenth Conference on Computational Natural Language Learning, CoNLL ’10, p´aginas 107–116, Stroudsburg, PA, USA. Association for Computational Linguistics. Go, Alec, Richa Bhayani, y Lei Huang. 2009. Twitter sentiment classification using distant supervision. En Processing. Golbeck, Jennifer y Derek Hansen. 2011. Computing political preference among twitter followers. En Proceedings of the 2011 annual conference on Human factors in computing systems, CHI ’11, p´aginas 1105–1108, New York, NY, USA. ACM. Hong, Sounman y Daniel Nadler. 2011. Does the early bird move the polls?: the use of the social media tool ’twitter’ by u.s. politicians and its impact on public opinion. En Proceedings of the 12th Annual International Digital Government Research Conference: Digital Government Innovation in Challenging Times, dg.o ’11, p´aginas 182–186, New York, NY, USA. ACM. Jiang, Long, Mo Yu, Ming Zhou, Xiaohua Liu, y Tiejun Zhao. 2011. Target-dependent twitter sentiment classification. En Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies - Volume 1, HLT ’11, p´aginas 151–160, Stroudsburg, PA, USA. Association for Computational Linguistics. Kim, E, S Gilbert, M J Edwards, y E Graeff. 2009. Detecting sadness in 140 characters: Sentiment analysis of mourning michael jackson on twitter. Pak, Alexander y Patrick Paroubek. 2010. Twitter as a corpus for sentiment analysis and opinion mining. En Proceedings of the Seventh International Conference on Language Resources and Evaluation (LREC’10), Valletta, Malta, may. European Language Resources Association (ELRA). Pennacchiotti, Marco y Ana M. Popescu. 2011. Democrats, republicans and starbucks afficionados: user classification in twitter. En Proceedings of the 17th ACM SIGKDD international conference on Knowledge discovery and data mining, KDD ’11, p´aginas 430–438, New York, NY, USA. ACM. Silva, Ismael Santana, Jana´ına Gomide, Adriano Veloso, Wagner Meira, Jr., y Renato Ferreira. 2011. Effective sentiment stream analysis with selfaugmenting training and demand-driven projection. En Proceedings of the 34th international ACM SIsGIR conference on Research and development in Information, SIGIR ’11, p´aginas 475– 484, New York, NY, USA. ACM. Tan, Chenhao, Lillian Lee, Jie Tang, Long Jiang, Ming Zhou, y Ping Li. 2011. User-level sentiment analysis incorporating social networks. En Proceedings of the 17th ACM SIGKDD international conference on Knowledge discovery and data mining, KDD ’11, p´aginas 1397–1405, New York, NY, USA. ACM. Tumasjan, Andranik, Timm O Sprenger, Philipp G Sandner, y Isabell M Welpe. 2010. Predicting elections with twitter: What 140 characters reveal about political sentiment. Word Journal Of The Intenational Linguistic Association, p´aginas 178– 185. Juan M. Cotelo, Fermín L. Cruz, Jose A. Troyano 64