Full text
Caracterizaci´ on de aplicaciones m´ oviles mediante el an´ alisis del tr´ afico DNS Andrea Jimenez-Berenguel, Marta Moure-Garrido, Carlos Garcia-Rubio, Celeste Campo Dpto Ingenier´ ıa Telem´ atica, Universidad Carlos III de Madrid, Avda. Universidad 30, E-28911 Legan´ es, Madrid, Spain [email protected], [email protected], [email protected], [email protected] Resumen—La privacidad del usuario sigue siendo vulnerable cuando se utilizan protocolos de comunicaci´ on cifrados, como HTTPS, cuando las consultas DNS se env´ ıan en texto claro a trav´ es del puerto UDP 53 (Do53). En este estudio, demostramos la posibilidad de caracterizar una aplicaci´ on m´ ovil que utiliza un usuario bas´ andonos en su tr´ afico Do53. Mediante el an´ alisis de un conjunto de datos de tr´ afico, formado por 80 aplicaciones m´ oviles Android, podemos identificar la aplicaci´ on que se est´ a utilizando bas´ andonos en sus consultas DNS con una precisi´ on del 88,75 %. Aunque los sistemas operativos modernos, incluido Android desde la versi´ on 9.0, admiten el tr´ afico DNS cifrado, esta funci´ on no est´ a activada por defecto y depende del soporte del proveedor de DNS. Adem´ as, incluso cuando el tr´ afico DNS est´ a cifrado, el proveedor de servicios DNS sigue teniendo acceso a nuestras consultas y podr´ ıa extraer informaci´ on de ellas. Index Terms—aplicaciones m´ oviles, privacidad, tr´ afico DNS Tipo de contribuci´ on: Investigaci´ on ya publicada en “Characterizing Mobile Applications Through Analysis of DNS Traffic” [1] I. INTRODUCCI´ ON El uso del tel´ efono m´ ovil ha alcanzado niveles sin precedentes, y se estima que m´ as del 70 % de la poblaci´ on mundial dispone de conectividad m´ ovil en 2023, lo que representa un crecimiento del 5% con respecto a 2018. Este crecimiento ha impulsado un significativo aumento en la cantidad y variedad de aplicaciones m´ oviles (denominadas apps) disponibles en el mercado. El tr´ afico generado por las aplicaciones Android en un dispositivo puede vulnerar la privacidad del usuario, revelando informaci´ on como el tipo de aplicaciones usadas. A su vez, puede inferir datos personales sensibles como sexo, edad, estado de salud o finanzas. A pesar de la percepci´ on de seguridad por el cifrado del tr´ afico de datos, la potencial extracci´ on de informaci´ on subraya un riesgo de privacidad persistente. Trabajos anteriores [2], se han basado en el tr´ afico cifrado generado por aplicaciones m´ oviles para identificar la aplicaci´ on espec´ ıfica en uso en un tel´ efono. Estos estudios extraen par´ ametros de las cabeceras de los paquetes para identificar la aplicaci´ on m´ ovil a partir del tr´ afico cifrado utilizando algoritmos de aprendizaje autom´ atico para la clasificaci´ on. Sin embargo, no todo el tr´ afico generado por las aplicaciones m´ oviles en nuestros tel´ efonos est´ a cifrado. Se puede encontrar tr´ afico DNS sin cifrar, la mayor parte del tr´ afico DNS m´ ovil utiliza actualmente el protocolo DNS sobre puerto 53 (Do53) sin cifrar. A pesar de la disponibilidad de alternativas cifradas, como DNS sobre TLS (DoT) y DNS sobre HTTPS (DoH); no son utilizadas ampliamente por defecto debido. Algunas razones son la priorizaci´ on de la velocidad de UDP o la falta de soporte de los servidores DNS, especialmente los configurados por defecto por los proveedores de red. Como resultado, explotar el tr´ afico DNS, espec´ ıficamente la versi´ on Do53, se hace posible para obtener informaci´ on sobre la aplicaci´ on m´ ovil en uso. En resumen, las contribuciones de [1] son las siguientes: (i) an´ alisis de las consultas DNS generadas, en particular las consultas Do53; (ii) caracterizaci´ on de las aplicaciones en base a los dominios DNS extra´ ıdos. Los resultados obtenidos demuestran que es posible clasificar las aplicaciones con una precisi´ on aceptable utilizando ´ unicamente los dominios de las consultas Do53 en el tr´ afico. II. CONJUNTO DE DATOS Este estudio usa el conjunto de datos capturado por los autores de MappGraph [2], recopilado en 2021; contiene tr´ afico cifrado y etiquetado de aplicaciones m´ oviles. El conjunto de datos original utilizado en [2] constaba de 101 aplicaciones m´ oviles, con una captura de 30 horas de tr´ afico por aplicaci´ on en archivos separados de captura de paquetes (PCAP). Sin embargo, debido a limitaciones de tama˜ no, la versi´ on del conjunto de datos utilizada incluye 81 apps con un tama˜ no total de 500GB aproximadamente. II-A. Preprocesado y curaci´ on del conjunto de datos Utilizando ´ unicamente el tr´ afico Do53 del tr´ afico capturado, se extrae la marca temporal, el nombre de dominio y el tipo de consulta de las peticiones DNS. Para formar los subconjuntos de entrenamiento y evaluaci´ on, seleccionamos dos capturas por aplicaci´ on, destinando la de mayor duraci´ on al entrenamiento y la otra a la evaluaci´ on. Para aplicaciones con una ´ unica captura, se divide en dos partes iguales. No obstante, una de las aplicaci´ on presenta una sola captura de 30 minutos, por lo que se excluye por insuficiencia de datos, reduciendo el n´ umero de aplicaciones analizadas a 80. A continuaci´ on, extraemos los subdominios relevantes para la caracterizaci´ on. A partir del nombre de dominio completo de cada consulta se obtiene el dominio efectivo, es decir, el que permite identificar a qu´ e organizaci´ on va dirigida la consulta. En la mayor´ ıa de los casos hemos extra´ ıdo los dos primeros niveles de dominio, por ejemplo: de e.reddit.com obtenemos reddit.com. Sin embargo, encontramos las siguientes excepciones de patrones de consultas: aquellos a dominios en CDNs, como mangatoon.akamaized.net, y los que incluyen un ccTLD, por ejemplo acdn.dantri.com.vn, reflejando sufijos espec´ ıficos como ‘com.vn’, como se especifica en la Lista P´ ublica de Sufijos, debido a que se trata de tr´ afico capturado en Vietnam. En ambos casos consideramos hasta el tercer nivel de dominio, identificando mangatoon.akamaized.net ydantri.com.vn como dominios efectivos. JNIC 2024 ISBN:978-84-09-62140-8 506
Matriz de dominios característicos Matriz de frequencias Matriz de dominios Clasificación App 1 App 2 App 3 A1 3 0 B2 0 0 C3 0 2 D0 1 0 E0 2 1 F0 0 3 App 1 App 2 App 3 A D E B E C C A F App Domain Weight App 1 B 2 App 2 D 1 App 3 F 3 Dataset Subconjunto entrenamiento Preprocesado Matriz de dominios (evaluación) App 1 App 2 App 3 A D F G E C B H E Preprocesado Comparación Ref. Dominio Clasificación App 1 B App 1 App 2 D App 2 App 3 F App 5 Subconjunto entrenamiento Figura 1. Metodolog´ ıa. III. CLASIFICACI ´ ON DE LAS APLICACIONES M ´ OVILES La metodolog´ ıa seguida para la caracterizaci´ on y clasificaci´ on de las apps m´ oviles se ilustra en Fig. 1. Primero se realiza un proceso de caracterizaci´ on basado en las consultas DNS usando el subconjunto de entrenamiento. A continuaci´ on, la clasificaci´ on de las trazas del subconjunto de evaluaci´ on se lleva a cabo comparando los dominios consultados con los dominios caracter´ ısticos obtenidos. III-A. Extracci´ on de los dominios caracter´ ısticos La caracterizaci´ on de las apps se ha realizado utilizando el subconjunto de entrenamiento. Construimos una matriz de dominios de entrenamiento almacenando los dominios de las apps que vamos a caracterizar, asignando un peso a cada uno. Se asigna un peso igual a 1 al dominio m´ as consultado y se incrementa secuencialmente hasta el dominio N. Seguidamente se elabora la matriz de frecuencia con una columna por app. En este caso el ´ ındice de las filas es una lista que incluye todos los dominios consultados en el subconjunto de entrenamiento. Esta matriz se rellena con los pesos asignados a cada dominio en su app correspondiente evaluando la unicidad de los dominios consultados. El dominio caracter´ ıstico de cada app es aquel dominio de menor peso consultado exclusivamente por una app. Para aquellas apps que no son caracterizadas con un solo dominio, hemos identificado una tupla de dos dominios llevando el mismo proceso que para los dominios ´ unicos. El resultado de la caracterizaci´ on es una matriz de dominios identificados como caracter´ ısticos. Se caracterizan las 80 apps analizadas, 68 mediante dominios ´ unicos y las 12 apps restantes mediante tuplas de dos dominios. III-B. Clasificaci´ on Para clasificar las apps del subconjunto de evaluaci´ on se aplica el siguiente procedimiento: (i) elaboraci´ on de una matriz de dominios de evaluaci´ on de manera similar a la matriz de dominios de entrenamiento; y (ii) comparaci´ on de los dominios de cada app con la matriz de dominios caracter´ ısticos. Si encontramos un dominio o tupla caracter´ ıstico en la traza de evaluaci´ on, la traza se clasifica con la app correspondiente. Si existe m´ as de una coincidencia, la app se clasifica con el dominio caracter´ ıstico de menor peso, es decir, con el dominio m´ as frecuente. III-C. Evaluaci´ on de los resultados El resultado final de la clasificaci´ on del subconjunto de evaluaci´ on usando los dominios caracter´ ısticos ´ unicos y las tuplas es el siguiente: se clasifican correctamente 71 de las 80 apps analizadas (88.75%), 3 apps han sido clasificadas err´ oneamente (3.75 %) y 6 apps no han sido clasificadas (7.5 %). Los factores que contribuyen a estos resultados err´ oneos son la similitud de patrones que existe entre ciertas apps debido a que pertenecen al mismo grupo corporativo y el n´ umero reducido de dominios consultados en algunas trazas. IV. CONCLUSIONES En este art´ ıculo presentamos la clasificaci´ on de aplicaciones m´ oviles bas´ andonos en el tr´ afico generado por las mismas, centr´ andonos espec´ ıficamente en las consultas DNS, en particular, las consultas Do53. El enfoque propuesto identifica los nombres de dominio caracter´ ısticos consultados por cada app a partir del an´ alisis del tr´ afico DNS. Estos dominios caracter´ ısticos permiten identificar la app que un usuario est´ a utilizando. Usamos un conjunto de datos de tr´ afico etiquetado de 80 aplicaciones m´ oviles Android. Los resultados experimentales demuestran que se clasifican las aplicaciones m´ oviles con una precisi´ on del 88.75 %, identificando con ´ exito 71 de las 80 aplicaciones m´ oviles. En comparaci´ on con trabajos anteriores, como MappGraph [2], que logr´ o una mayor precisi´ on (93%) usando todo el tr´ afico generado y aplicando redes neuronales para la clasificaci´ on, nuestro enfoque es computacionalmente menos costoso y requiere menos informaci´ on de entrada. Una limitaci´ on de esta metodolog´ ıa es que no se puede acceder al contenido de las consultas DNS generadas si se utiliza DoT o DoH. Sin embargo, incluso con tr´ afico DNS cifrado, estudios recientes han demostrado que la extracci´ on de par´ ametros del tr´ afico proporciona informaci´ on significativa [3]. Como trabajo futuro, se analizar´ an par´ ametros extra´ ıdos del tr´ afico en general. AGRADECIMIENTOS El trabajo ha sido financiado por el Gobierno espa˜ nol en el marco de los proyectos de investigaci´ on “Enhancing Communication Protocols with Machine Learning while Protecting Sensitive Data (COMPROMISE)”PID2020-113795RBC32, y “QUantum-based ReSistant Architectures and Techniques (QURSA)”TED 2021-130369B-C32 financiado por MCIN/AEI/10.13039/501100011033. REFERENCIAS [1] A. Jimenez-Berenguel, M. Moure-Garrido, C. Garcia-Rubio, and C. Campo, “Characterizing mobile applications through analysis of dns traffic,” in Proceedings of the Int’l ACM Symposium on Performance Evaluation of Wireless Ad Hoc, Sensor, & Ubiquitous Networks, 2023, pp. 69–76. [2] T.-D. Pham, T.-L. Ho, T. Truong-Huu, T.-D. Cao, and H.-L. Truong, “Mappgraph: Mobile-app classification on encrypted network traffic using deep graph convolution neural networks,” in Annual Computer Security Applications Conference, 2021, pp. 1025–1038. [3] M. Moure-Garrido, C. Campo, and C. Garcia-Rubio, “Real time detection of malicious doh traffic using statistical analysis,” Computer Networks, vol. 234, p. 109910, 2023. [Online]. Available: https: //www.sciencedirect.com/science/article/pii/S1389128623003559 Caracterizaci´on de aplicaciones m´oviles mediante el an´alisis del tr´afico DNS 507