Actas de las XV Jornadas de Ingeniería Telemática (JITEL 2021), A Coruña (España), 27-29 de octubre de 2021. This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) Detecci´ on de ataques de red mediante clasificaci´ on de flujos empleando L-momentos Jes´ us Galeano-Brajones∗, Jose J. Rico-Palomo∗, Mihaela I. Chidean†, Javier Carmona-Murillo∗ ∗Departamento de Ingenier´ ıa de Sistemas Inform´ aticos y Telem´ aticos. Universidad de Extremadura. 06006. †Departamento de Teor´ ıa de la Se˜ nal y Comunicaciones. Universidad Rey Juan Carlos. 28942.
[email protected],
[email protected], [email protected], [email protected] El incremento continuo de dispositivos conectados a Internet en los ´ ultimos a˜ nos, junto con el aumento de las aplicaciones y servicios, han propiciado que la tarea de clasificaci´ on del tr´ afico de red sea esencial en cualquier entorno, tanto para cuestiones de gesti´ on de red como de seguridad. Con la llegada de las redes 5G han aparecido nuevos retos relacionados con la seguridad debido a este gran volumen de tr´ afico y la diversidad de servicios disponibles para los usuarios. Adem´ as, tambi´ en han surgido nuevas tecnolog´ ıas basadas en software y virtualizaci´ on que permiten un control m´ as din´ amico de la red. En este contexto, este art´ ıculo propone una metodolog´ ıa novedosa para procesar los flujos de red mediante el c´ alculo de los L-momentos est´ andar y su posterior clasificaci´ on para la detecci´ on de anomal´ ıas y amenazas en la red. Adem´ as, se ha desarrollado un testbed con el que poder experimentar con cualquier conjunto de datos y estos estad´ ısticos. Los resultados obtenidos tras la experimentaci´ on con este testbed muestran que los L-momentos est´ andar resultan especialmente ´ utiles para procesar los flujos de red en tiempo real, consiguiendo que los algoritmos de clasificaci´ on obtengan unos resultados de calidad muy elevados. Palabras Clave—detecci´ on de ataques, L-momentos, ciberseguridad, clasificaci´ on, machine learning I. INTRODUCCI ´ ON En los ´ ultimos a˜ nos tanto los dispositivos conectados a Internet como el volumen de tr´ afico de red han crecido de manera significativa. La clasificaci´ on de flujos de red se ha convertido en una tarea fundamental con el avance de tecnolog´ ıas como la 5G y el aumento de dispositivos IoT (Internet of Things). Seg´ un Cisco Annual Internet Report 2020 [1], el 66% de la poblaci´ on global tendr´ a acceso a Internet en 2023, es decir, 5.3 mil millones de usuarios, lo que implica un crecimiento enorme de datos movi´ endose por la red. Adem´ as, el n´ umero de brechas de seguridad y el total de registros expuestos por brecha contin´ ua creciendo, pasando de 7.9 millones de ataques de denegaci´ on de servicio distribuidos (DDoS, Distributed Denial of Service) a los 15.4 millones previstos para 2023. 5G es la quinta generaci´ on de redes m´ oviles. Es un nuevo tipo de red dise˜ nada para conectar pr´ acticamente a todos y a todo, incluyendo m´ aquinas, objetos y dispositivos. 5G est´ a destinado a ofrecer velocidades de datos de hasta varios gigabits por segundo, latencias ultrabajas, una mayor fiabilidad, una capacidad de red masiva, mayor disponibilidad y una experiencia de usuario m´ as uniforme para m´ as usuarios. Un mayor rendimiento y una mayor eficiencia potencian nuevas experiencias de usuario y conectan nuevas industrias [2]. Con 5G se prev´ en m´ as casos de uso que en las generaciones de redes m´ oviles anteriores, pudiendo clasificarse en tres tipos de servicios: Enhanced Mobile Broadband (eMBB), Ultra-Reliable and Low Latency Communications (URLLC) y Massive Machine-Type Communications (mMTC). El primero busca ofrecer a los usuarios enlaces con tasas de datos m´ as uniformes, mayor capacidad y menor latencia, como por ejemplo en Realidad Virtual y Realidad Aumentada. El segundo est´ a m´ as relacionado con la Industria 4.0, ya que ofrece enlaces ultra-fiables y de baja latencia, como el control remoto de infraestructuras cr´ ıticas o veh´ ıculos, as´ ı como el apoyo a procedimientos m´ edicos a distancia. En el ´ ultimo, 5G pretende conectar un n´ umero masivo de dispositivos, como sensores embebidos y dispositivos IoT, gracias a la capacidad de adaptar la tasa de datos de los dispositivos para mejorar la eficiencia del ancho de banda, la eficiencia energ´ etica y para m´ ultiples escenarios de movilidad, proporcionando soluciones de conectividad de bajo coste. Sin embargo, la creciente popularidad de estos dispositivos los convierte en el objetivo de los atacantes. Por ello es necesario garantizar la seguridad de estos dispositivos y redes desarrollando mecanismos m´ as avanzados capaces de detectar amenazas de seguridad y mitigarlas. Este es un 196
Galeano-Brajones, Rico-Palomo, Chidean, Carmona-Murillo, 2021. reto importante para los dispositivos IoT, ya que manejan informaci´ on sensible y muchos no suelen implementar medidas de seguridad adecuadas [3], lo que los hace perfectos para integrarlos en botnets que realicen ataques DDoS a servicios de mayor envergadura. El desarrollo del 5G se basa en varias tecnolog´ ıas habilitadoras clave, como las redes definidas por software (SDN, Software-Defined Networking) y la virtualizaci´ on de funciones de red (NFV, Network Function Virtualization). SDN es un paradigma de red propuesto para acabar con las limitaciones de las infraestructuras de red actuales, rompiendo la integraci´ on vertical mediante la separaci´ on de la l´ ogica de control de la red (plano de control) de los routers yswitches subyacentes que reenv´ ıan el tr´ afico (plano de datos) e incrementa la flexibilidad de la red. NFV es una tecnolog´ ıa que desacopla las funciones de red del hardware subyacente, permitiendo el reemplazo de hardware dedicado, propietario y caro con dispositivos de red basados en software. NFV tambi´ en permite que instancias de funciones virtuales se compartan entre varios clientes [4]. Ambas tecnolog´ ıas permiten el desarrollo de nuevos mecanismos de seguridad y el despliegue de estas soluciones en redes de este tipo, como por ejemplo, el despliegue de algoritmos de clasificaci´ on de flujos de red en un controlador SDN. Este trabajo propone una metodolog´ ıa novedosa para la clasificaci´ on de flujos de red, espec´ ıficamente para la detecci´ on de anomal´ ıas en la red en base al procesamiento de flujos mediante los L-momentos est´ andar y posterior clasificaci´ on mediante algoritmos de Machine Learning (ML). Hasta donde conocemos, por el momento no se ha explorado en la literatura este m´ etodo para procesar los flujos. Tambi´ en se ha implementado esta metodolog´ ıa mediante el desarrollo de un testbed con el que se puede experimentar con cualquier dataset. Este testbed permite calcular los L-momentos y L-momentos est´ andar para cada una de las caracter´ ısticas de los flujos del dataset y aplicar diferentes algoritmos de clasificaci´ on con el fin de obtener resultados que indiquen la calidad de las clasificaciones. Adem´ as, este art´ ıculo es la evoluci´ on natural de los siguientes trabajos: en primer lugar, en el art´ ıculo [5] se caracterizan las amenazas del conjunto de datos UNSW-NB15 [6] mediante los diagramas de L-momentos est´ andar; en segundo lugar, en el art´ ıculo [7] se realiza la detecci´ on y mitigaci´ on de ataques DoS (Denial of Service) y DDoS utilizando la entrop´ ıa de caracter´ ısticas extra´ ıdas de los flujos de red. Adem´ as, se ha utilizado una stateful-SDN para gestionar la red y el conjunto de datos Bot-IoT [8]. El resto del art´ ıculo se organiza como sigue. En la Secci´ on II se proporciona una revisi´ on de la literatura relacionada con este trabajo. Los antecedentes te´ oricos y tecnol´ ogicos base para la metodolog´ ıa propuesta se describen en la Secci´ on III. La Secci´ on IV detalla la evaluaci´ on experimental realizada. Finalmente, la Secci´ on V incluye las principales conclusiones alcanzadas, as´ ı como las l´ ıneas de investigaci´ on futura que quedan abiertas. II. TRABAJO RELACIONADO En esta secci´ on se proporciona una revisi´ on de la literatura relacionada con este art´ ıculo. Por esta raz´ on, se ha dividido en dos subsecciones. La primera describe las principales l´ ıneas de investigaci´ on relacionadas con la aplicaci´ on de la teor´ ıa de los L-momentos en diferentes campos de conocimiento. La segunda muestra algunos de los trabajos m´ as relevantes relacionados con la clasificaci´ on de flujos de red, espec´ ıficamente de clasificaci´ on de anomal´ ıas de red. A. Aplicaci´ on de los L-momentos La teor´ ıa de los L-momentos ha sido ampliamente utilizada por la comunidad cient´ ıfica desde su propuesta en 1990 [9], aunque no ha sido explorada en el campo del tr´ afico de red y la telecomunicaci´ on. Recientemente, los L-momentos han tenido diferentes campos de aplicaci´ on, como climatolog´ ıa, aplicaciones de radar y bioingenier´ ıa. Los L-momentos han sido utilizados principalmente en la regionalizaci´ on del clima y para el c´ alculo del SPI (Standarized Precipitation Index) y SPEI (Standarized Precipitation Evapotranspiration Index) [10], dos ´ ındices clim´ aticos muy utilizados para el estudio de sequ´ ıas. Tambi´ en han sido utilizados para estimar par´ ametros de distribuciones de probabilidad que modelan la m´ axima velocidad del viento en escala temporal [11]. En el contexto de la teor´ ıa de redes complejas, los L-momentos de una distribuci´ on espec´ ıfica se han utilizado para crear un test multivariante de hip´ otesis para detectar la sutil degradaci´ on de nodos o aristas [12]. En los campos de ingenier´ ıa o bioingenier´ ıa, los L-momentos se han utilizados para clasificar objetivos en aplicaciones de radar [13] y tambi´ en para clasificar gl´ obulos blancos [14]. Por ´ ultimo, solo encontramos dos trabajos relacionados con la clasificaci´ on de tr´ afico. Por un lado, en [15], los trimmed L-moments [16] se utilizan para estimar la distribuci´ on generalizada de Pareto, la cual es utilizada para modelar distribuciones de colas pesadas, como el modelado de tr´ afico de red [17]; por el otro, la teor´ ıa de los L-momentos se utiliza para caracterizar flujos de red entre leg´ ıtimos y an´ omalos [5]. Este ´ ultimo puede ser considerado un trabajo preliminar al trabajo llevado a cabo en este art´ ıculo. B. Clasificaci´ on de flujos de red La clasificaci´ on de flujos de red se ha convertido en una tarea fundamental para la monitorizaci´ on de flujos, especialmente para la detecci´ on de anomal´ ıas y flujos pertenecientes a amenazas. Esta clasificaci´ on ha sido ampliamente estudiada desde las siguientes cuatro perspectivas: basada en puertos, inspecci´ on profunda de paquetes (DPI, Deep Packet Inspection), basados en el payload y enfoques estad´ ısticos (ver Fig. 1). La t´ ecnica basada en puertos es una t´ ecnica sencilla y r´ apida que utiliza la asociaci´ on de los puertos de la cabecera TCP/UDP con puertos bien conocidos asignados This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 197
Detecci´ on de ataques de red mediante clasificaci´ on de flujos empleando L-momentos Análisis de flujos de red Basado en puertos Enfoques estadísticos DPI Basados en payload ML / DL Teoría de los L-momentos Fig. 1. Taxonom´ ıa de la clasificaci´ on de flujos de red por la IANA (Internet Assigned Numbers Authority) [18]. Pero la amplia proliferaci´ on de nuevos servicios y aplicaciones que utilizan puertos no asignados por la IANA ha incrementado significativamente, como los dispositivos IoT que utilizan direcciones IP privadas o din´ amicas y n´ umeros de puertos variables [19], haciendo que esta t´ ecnica deje de ser ´ util. DPI emergi´ o como una alternativa a la t´ ecnica basada en puertos e incluso hoy en d´ ıa es una de las m´ as aceptadas y utilizadas. Esta t´ ecnica busca encontrar patrones o palabras clave en los paquetes de datos. Su mayor limitaci´ on es que solo es aplicable a paquetes que no est´ an encriptados, adem´ as de los problemas para la privacidad de los usuarios [20]. Como alternativa, muchos investigadores proponen el uso de t´ ecnicas de ML puesto que evita muchos de estos inconvenientes [21]. La t´ ecnica de clasificaci´ on de flujos basada en el payload solo utiliza la informaci´ on de la capa de aplicaci´ on. Esto solventa la dependencia de IP y puertos de la t´ ecnica basada en puertos. Normalmente se despliega junto a DPI [19], [22]. Junto con los enfoques estad´ ısticos y las t´ ecnicas basadas en el payload, en los ´ ultimos a˜ nos ha habido un aumento de las aplicaciones de Deep Learning (DL), incluso relacionadas con la clasificaci´ on de tr´ afico o flujos de red. Para ello, se han estudiado principalmente Stacked Auto-Encoders (SAE) [23], redes neuronales recurrentes (RNN, Recurrent Neural Networks) [24] y Redes Neuronales Convolucionales (CNN, Convolutional Neural Netowkrs) [25]. Las t´ ecnicas que emplean un enfoque estad´ ıstico utilizan par´ ametros independientes del payload como la duraci´ on de los flujos, el tiempo entre llegadas, la longitud de la cabecera de los paquetes, etc. Estos par´ ametros pueden utilizarse para alimentar diferentes modelos estad´ ısticos, de ML o de DL. La metodolog´ ıa propuesta en este art´ ıculo utiliza este enfoque, analizando estad´ ısticamente diferentes par´ ametros de los flujos mediante la teor´ ıa de los L-momentos y clasific´ andolos utilizando diferentes algoritmos de ML. III. METODOLOG´ IA En esta secci´ on se presenta la metodolog´ ıa propuesta para la clasificaci´ on de flujos, comenzando con la definici´ on de los L-momentos, incluidos los L-momentos est´ andar, y finalizando con la descripci´ on del testbed desarrollado y el conjunto de datos utilizado en la experimentaci´ on. A. L-momentos Al igual que otros momentos estad´ ısticos, los L-momentos caracterizan la geometr´ ıa de distribuciones y resumen muestras. Son directamente an´ alogos, es decir, tienen interpretaci´ on similar, a los momentos centrales (llamados product moments oC-moments en la literatura [26]). Los L-momentos son combinaciones lineales de diferencias de esperanzas de estad´ ısticos de orden. Esta es la principal diferencia con los momentos centrales, los cuales est´ an basados en potencias de diferencias con la media. Algunos beneficios de los L-momentos frente a los momentos centrales son: •Los L-momentos son m´ as robustos ante la presencia de datos at´ ıpicos, es decir, sufren menos por los efectos de la variabilidad de las muestras. •Necesitan menos datos para estimar con errores bajos, lo que los hace muy ´ utiles para estimaciones en tiempo real y para trabajar con L-momentos de orden alto. •En contraste a los momentos centrales, los L-momentos son insesgados, es decir, no dependen del tama˜ no de la muestra. •Est´ an m´ as cerca de su distribuci´ on normal asint´ otica en muestras finitas. A continuaci´ on, se definen los L-momentos te´ oricos y muestrales, finalizando con el diagrama de L-momentos est´ andar. 1) L-momentos te´ oricos: Los estad´ ısticos de orden de una variable aleatoria Xpara una muestra de tama˜ no n est´ an formados por el orden ascendente X1:n≤X2:n≤ ... ≤Xn:n. Los L-momentos te´ oricos quedan definidos por: λr=1 r r−1 X k=0 (−1)kr−1 kE[Xr−k:r],∀r≥1(1) donde res el orden del L-momento y E[Xr−k:r]es la esperanza del estad´ ıstico de orden r−kde una muestra de tama˜ no r. Los primeros L-momentos te´ oricos pueden definirse en funci´ on de las esperanzas de los estad´ ısticos de orden: λ1=E[X1:1](2) λ2=1 2E[X2:2]−E[X1:2] λ3=1 3E[X3:3]−2E[X2:3] + E[X1:3] λ4=1 4E[X4:4]−3E[X3:4]+3E[X2:4]−E[X1:4] λ1se denomina L-location yλ2es L-scale, una medida de la variabilidad de la distribuci´ on. Adem´ as, las distribuciones ´ utiles tienen una variabilidad distinta de This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 198
Galeano-Brajones, Rico-Palomo, Chidean, Carmona-Murillo, 2021. cero, por lo que λ2>0. Con λ2se definen los momentos est´ andar te´ oricos: τr=λr/λ2,∀r≥3(3) Algunos momentos est´ andar tienen un nombre definido: τ2=λ2/λ1=coeficiente de L-variation (4) τ3=λ3/λ2=L-skewness τ4=λ4/λ2=L-kurtosis τ2es ´ util para variables aleatorias positivas (X≥0) y est´ a acotado en 0< τ2<1. Para r≥3, todos los momentos est´ andar est´ an acotados en −1< τr<1. Y espec´ ıficamente, L-kurtosis est´ a acotada en 1 45τ2 3−1≤ τ4<1. Estas limitaciones hacen que los momentos est´ andar sean muy ´ utiles puesto que permiten comparar distribuciones cuyos rangos son diferentes sin la necesidad de normalizar o reescalar. 2) L-momentos muestrales: Los L-momentos muestrales se calculan para una muestra de estad´ ısticos de orden x1:n≤x2:n≤... ≤xn:n. La muestra de estad´ ısticos de orden se estiman simplemente ordenando los datos en orden ascendente. Los L-momentos muestrales se definen como: ˆ λr=1 rn r−1 n X i=1 r−1 X j=0 (−1)jr−1 j i−1 r−1−jn−i j xi:n,∀r≥1 (5) Y los L-momentos est´ andar muestrales son: ˆτr=ˆ λr/ˆ λ2,∀r≥3(6) ˆτ2=ˆ λ2/ˆ λ1=coeficiente de L-variation muestral ˆτ3=ˆ λ3/ˆ λ2=L-skewness muestral (7) ˆτ4=ˆ λ4/ˆ λ2=L-kurtosis muestral 3) Diagrama de L-momentos est´ andar: Como ya se ha mencionado, gracias a que los L-momentos est´ andar est´ an acotados, se pueden comparar directamente diferentes distribuciones. Un diagrama de L-momentos est´ andar (L-moments ratio diagram, a partir de ahora LmomRD por sus siglas en ingl´ es) es un gr´ afico que muestra los L-momentos est´ andar en cada dimensi´ on. Lo m´ as com´ un es utilizar τ3frente a τ4debido a que estos son los L-momentos est´ andar que tienen un mayor soporte te´ orico, pero los LmomRD no est´ an limitados a estos puesto que existen L-momentos est´ andar de mayor orden cuya definici´ on es mucho m´ as compleja. La Fig. 2 muestra el LmomRD por defecto con la representaci´ on de algunas distribuciones comunes. Las distribuciones con tres par´ ametros se representan como una l´ ınea, mientras que las distribuciones con dos par´ ametros se representan con un punto. Estas representaciones ayudan a interpretar los datos e identificar a qu´ e distribuci´ on puede ajustarse una muestra real. Esta herramienta visual es utilizada en este trabajo y, para facilitar comparaciones entre diferentes resultados, las representaciones de las distribuciones m´ as comunes estar´ an en todos los LmomRD. −1.00 −0.75 −0.50 −0.25 0.00 0.25 0.50 0.75 1.00 L-skewness (τ3) −1.00 −0.75 −0.50 −0.25 0.00 0.25 0.50 0.75 1.00 L-kurtosis (τ4) U E G L N U - Uniform E - Exponential G - Gumbel L - Logistic N - Normal GLO GEV GPA GNO PE3 WAK.LB ALL.LB WEI Fig. 2. Diagrama de L-momentos est´ andar de algunas distribuciones comunes (GLO: Generalized Logistic; GEV: Generalized Extreme Value; GPA: Generalized Pareto; GNO: Generalized Normal; PE3: Pearson Type 3 o Gamma; WEI: Weibull; WAK.LB: l´ ımite inferior de la distribuci´ on Wakeby; ALL.LB: l´ ımite inferior de cualquier distribuci´ on) [9] B. Testbed Con el objetivo de poder experimentar con los L-momentos y cualquier conjunto de datos disponible en la literatura, se ha desarrollado un tesbed que permite realizar esta experimentaci´ on de manera autom´ atica. La metodolog´ ıa seguida se muestra en la Fig. 3. Procesamiento de datos y cómputo de L-momentos Selección de algoritmos de clasificación 4-fold cross-validation y cálculo de métricas Análisis de resultados Fig. 3. Fases de la metodolog´ ıa En primer lugar, se procesan los conjuntos de datos y se calculan los L-momentos y L-momentos est´ andar. En segundo lugar, se seleccionan aquellos modelos de ML con los que se quiere experimentar. En tercer lugar, se realiza el entrenamiento con 4-fold cross-validation y se obtienen las m´ etricas de calidad de las clasificaciones para, por ´ ultimo, realizar un an´ alisis de los resultados. Desde un punto de vista m´ as pr´ actico, en la Fig. 4 se muestra el diagrama de flujo que define el comportamiento del testbed, donde los bloques de condici´ on se corresponden con flags que gu´ ıan el flujo en funci´ on de las necesidades del usuario: •compute_lmom. C´ omputo de los L-momentos y L-momentos est´ andar. Si se han calculado previamente, se cargan de los ficheros sin necesidad de volver a realizar el c´ omputo. This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 199
Detecci´ on de ataques de red mediante clasificaci´ on de flujos empleando L-momentos Sí Sí Sí Sí No No No No Inicio Fin Validación de la configuración compute_lmom Cómputo de los L-momentos y L-momentos estándar en paralelo parallel Cómputo de los L-momentos y L-momentos estándar secuencialmente Almacenamiento de los cálculos Carga los L-momentos precalculados plot_features save_features Visualización de los diagramas de Lmomentos estándar Guarda los diagramas de L-momentos estándar en formato PDF Almacenamiento de los resultados en formato JSON Cross-validation y obtención de métricas Cross-validation y obtención de métricas Fig. 4. Diagrama de flujo del testbed •parallel. C´ omputo de manera secuencial si false o en paralelo aprovechando todos los n´ ucleos de la CPU si true. •plot_features. Visualizaci´ on de los LmomRD en tiempo real. •save_features. Almacenamiento de los LmomRD si true. C. CSE-CIC-IDS2018 Este conjunto de datos es un proyecto colaborativo entre el Communications Security Establishment (CSE) y el Canadian Institute for Cybersecurity (CIC) [27]. Se trata de un conjunto de datos generado de manera experimental que incluye siete escenarios de ataque: fuerza bruta, Heartbleed,botnet, DoS, DDoS, ataques web e infiltraci´ on en la red. Adem´ as, los creadores del conjunto de datos ofrecen distintos tipos de ficheros para su utilizaci´ on: ficheros PCAP con todo el tr´ afico capturado, ficheros CSV etiquetados con 80 caracter´ ısticas de los flujos y logs del sistema de cada una de las m´ aquinas que intervienen en el escenario. IV. RESULTADOS En esta secci´ on se describen algunas pruebas realizadas con el testbed descrito en la Secci´ on III.B. En primer lugar, se muestra el efecto del valor n, es decir, el tama˜ no de la muestra, de manera visual mediante la utilizaci´ on de los LmomRD. En segundo lugar, se expone el comportamiento del algoritmo kNN para clasificar los L-momentos est´ andar para distintos valores de n. Todas las pruebas se han realizado con el conjunto de datos CSE-CIC-IDS2018, espec´ ıficamente con la captura del d´ ıa 20/02/2018, la cual contiene flujos leg´ ıtimos y flujos etiquetados como ataques DDoS LOIC HTTP. LOIC (Low Orbit Ion Cannon) es una aplicaci´ on desarrollada en C# para realizar ataques DoS y DDoS utilizando TCP, UDP y HTTP. Fue desarrollada durante el Proyecto Chanology, una serie de protestas en Internet promovidas por el grupo Anonymous contra la Iglesia de la Cienciolog´ ıa [28]. En este conjunto de datos, los ataques DDoS LOIC se realizan utilizando HTTP. Adem´ as, tras realizar un an´ alisis de las caracter´ ısticas de los flujos que se encuentran en el conjunto de datos, hemos concluido que el intervalo de llegada entre paquetes es una buena caracter´ ıstica para mostrar los resultados. A. Efecto de nen los LmomRD El tama˜ no de la muestra nes un par´ ametro muy importante a la hora de estimar los L-momentos y los L-momentos est´ andar. Si nes un valor bajo se necesitan menos valores en la muestra para calcular cada L-momento est´ andar, es decir, cada punto del LmomRD. Pero, aunque se necesitan menos valores para formar la muestra, los clusters generados por los L-momentos est´ andar de los flujos quedan menos concentrados, es decir, las etiquetas pueden quedar mezcladas. Desde el punto de vista de la monitorizaci´ on o muestreo de los flujos de la red, un nbajo implica mayor precisi´ on temporal para una misma frecuencia de muestreo y mayor rapidez en la detecci´ on de amenazas si los clusters no est´ an demasiado dispersos, un punto clave para la seguridad de las redes. Pero a su vez implica una mayor imprecisi´ on si nno tiene This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 200
Galeano-Brajones, Rico-Palomo, Chidean, Carmona-Murillo, 2021. un valor lo suficientemente elevado como para definir los clusters, es decir, se obtiene un n´ umero de falsos positivos y falsos negativos elevado. Esto se observa claramente en el LmomRD de la Fig. 5. En este caso se ha utilizado n= 50 y, para esta caracter´ ıstica del flujo en concreto, es un valor excesivamente bajo puesto que visualmente es dif´ ıcil diferenciar con buena precisi´ on los flujos leg´ ıtimos de los flujos de ataque. −1.00 −0.75 −0.50 −0.25 0.00 0.25 0.50 0.75 1.00 L-skewness (τ3) −0.25 0.00 0.25 0.50 0.75 1.00 L-kurtosis (τ4) Benign DDoS LOIC HTTP Fig. 5. Diagrama de L-momentos est´ andar para n= 50 Un aumento del tama˜ no de la muestra, como n= 200, implica una concentraci´ on m´ as definida de los clusters (ver Fig. 6), consiguiendo diferenciarlos visualmente para cada etiqueta de los flujos aunque se observan algunos L-momentos est´ andar que ser´ an falsos positivos y falsos negativos. −1.00 −0.75 −0.50 −0.25 0.00 0.25 0.50 0.75 1.00 L-skewness (τ3) −0.25 0.00 0.25 0.50 0.75 1.00 L-kurtosis (τ4) Benign DDoS LOIC HTTP Fig. 6. Diagrama de L-momentos est´ andar para n= 200 Por ´ ultimo, con un valor mucho mayor, n= 3200, los clusters quedan mucho m´ as definidos y concentrados (ver Fig. 7). Esto no tiene por qu´ e ser as´ ı para cualquier caracter´ ıstica de los flujos. Existen caracter´ ısticas que permiten diferenciar los flujos claramente y otras para las que los L-momentos est´ andar no son ´ utiles. Es por ello que cada tipo de amenaza y caracter´ ıstica de los flujos requiere un estudio exhaustivo, en primer lugar para conocer si la caracter´ ıstica puede clasificarse y, en segundo lugar, para obtener un valor de nque satisfaga las necesidades de tiempos de muestreo y precisi´ on de la detecci´ on. B. Efecto de nen la clasificaci´ on Como se ha comentado, el valor de ninfluye directamente en la precisi´ on de la estimaci´ on de los L-momentos est´ andar. Por lo tanto, mientras que un npeque˜ no implica mayor dispersi´ on, un nelevado conlleva una mejor concentraci´ on en clusters definidos, −1.00 −0.75 −0.50 −0.25 0.00 0.25 0.50 0.75 1.00 L-skewness (τ3) −0.25 0.00 0.25 0.50 0.75 1.00 L-kurtosis (τ4) Benign DDoS LOIC HTTP Fig. 7. Diagrama de L-momentos est´ andar para n= 3200 aumentando as´ ı la calidad de cualquier an´ alisis posterior. Tras esta explicaci´ on, a continuaci´ on se muestra el efecto de este par´ ametro en la posterior clasificaci´ on de los L-momentos est´ andar con el algoritmo kNN y dos tipos de funciones de coste: uniforme (la distancia entre todos los puntos se pondera igual) y distancia (pesos definidos por el inverso de la distancia entre puntos). Adem´ as, el valor de kqueda definido por √N/2, donde Nes el n´ umero total de datos de entrenamiento. En la Fig. 8 se muestra el resultado de la m´ etrica balanced accuracy para diferentes valores de n. La elecci´ on de esta progresi´ on geom´ etrica permite representar resultados para un rango amplio de na la vez que evita el comportamiento “ruidoso” de los mismos (p.e. se espera un resultado similar para n= 800 yn= 850 e incluir ambos en la figura dificultar´ ıa la visualizaci´ on) La m´ etrica accuracy es ampliamente utilizada en los problemas de clasificaci´ on, pero dado que el conjunto de datos est´ a claramente desbalanceado, se utiliza balanced accuracy como m´ etrica de calidad. Ambas m´ etricas son equivalentes ybalanced accuracy es m´ as adecuado para conjuntos de datos como el de este trabajo. 50 100 200 400 800 1600 3200 n 0.92 0.94 0.96 0.98 1.00 Balanced accuracy Uniforme Distancia Fig. 8. Balanced accuracy para distintos valores de n Para la caracter´ ıstica considerada se puede observar que la clasificaci´ on obtiene unos resultados muy buenos incluso desde n= 50. De hecho, el resultado para este valor de npuede parecer no concordar con los visto en su LmomRD, sin embargo un an´ alisis m´ as detallado de los datos y los resultados obtenidos en la clasificaci´ on permite comprobar que la mayor´ ıa de los L-momentos est´ andar leg´ ıtimos se encuentran en la zona de τ3>0y el n´ umero de falsos negativos y falsos positivos de la matriz de confusi´ on es m´ ınimo en comparaci´ on con la cantidad This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 201
Detecci´ on de ataques de red mediante clasificaci´ on de flujos empleando L-momentos de L-momentos est´ andar presentes en el LmomRD. V. CONCLUSIONES Debido al aumento del volumen de tr´ afico en la red y a la necesidad de clasificar los flujos, en este art´ ıculo se propone una novedosa metodolog´ ıa para realizar esta clasificaci´ on con el objetivo de detectar anomal´ ıas en la red y amenazas de seguridad. Esta metodolog´ ıa est´ a basada en el uso de los L-momentos est´ andar, una herramienta que ha demostrado ser muy ´ util para esta tarea y que, hasta donde sabemos, a´ un no ha sido explorada en la literatura para prop´ ositos similares a los nuestros. Tras la experimentaci´ on realizada, se puede concluir que los L-momentos son una herramienta muy apropiada para procesar los flujos de red y posteriormente entrenar algoritmos de clasificaci´ on con el fin de detectar ataques puesto que se obtiene una calidad de clasificaci´ on muy elevada. Adem´ as, esta metodolog´ ıa no solo diferencia entre flujos leg´ ıtimos y maliciosos, sino que tambi´ en diferencia entre tipos de ataques. Finalmente, este trabajo tiene una amplia investigaci´ on futura. En primer lugar, los resultados de los LmomRD muestran formas de los clusters que deben ser comprendidas y justificadas puesto que pueden ayudar a la comunidad a comprender mejor el comportamiento estad´ ıstico de los ataques. En segundo lugar, en este trabajo nos hemos limitado a investigar con τ3yτ4, pero como ya hemos mencionado, existen L-momentos est´ andar de mayor orden que tambi´ en pueden ser de utilidad en este tipo de problemas. En tercer lugar, es necesaria una experimentaci´ on futura sobre entornos pr´ acticos, como el despliegue de la metodolog´ ıa en un controlador SDN. Por ´ ultimo, los algoritmos de clasificaci´ on pueden ser estudiados con el objetivo de optimizar sus par´ ametros y as´ ı obtener la mayor calidad posible de los resultados. AGRADECIMIENTOS Este trabajo ha sido financiado parcialmente por el Ministerio de Ciencia, Innovaci´ on y Universidades con el proyecto RTI2018-102002-A-I00, y por la Consejer´ ıa de Econom´ ıa e Infraestructuras de la Junta de Extremadura con el proyecto IB18003 y la ayuda GR18141. REFERENCIAS [1] U. Cisco, “Cisco annual internet report (2018–2023) white paper,” 2020. [2] D. Lake, N. Wang, R. Tafazolli, and L. Samuel, “Softwarization of 5G Networks – Implications to Open Platforms and Standardizations,” IEEE Access, pp. 1–1, 2021. [3] F. Meneghello, M. Calore, D. Zucchetto, M. Polese, and A. Zanella, “IoT: Internet of threats? A survey of practical security vulnerabilities in real IoT devices,” IEEE Internet of Things Journal, vol. 6, no. 5, pp. 8182–8201, 2019. [4] Y. Li and M. Chen, “Software-Defined Network Function Virtualization: A survey,” IEEE Access, vol. 3, pp. 2542–2553, 2015. [5] M. I. Chidean, J. Carmona-Murillo, R. H. Jacobsen, and Q. Zhang, “Network Traffic Characterization Using L-moment Ratio Diagrams,” in 2019 Sixth International Conference on Internet of Things: Systems, Management and Security (IOTSMS), pp. 555–560, IEEE, 2019. [6] N. Moustafa and J. Slay, “UNSW-NB15: a comprehensive data set for network intrusion detection systems (UNSW-NB15 network data set),” in 2015 military communications and information systems conference (MilCIS), pp. 1–6, IEEE, 2015. [7] J. Galeano-Brajones, J. Carmona-Murillo, J. F. Valenzuela-Vald´ es, and F. Luna-Valero, “Detection and Mitigation of DoS and DDoS Attacks in IoT-Based Stateful SDN: An Experimental Approach,” Sensors, vol. 20, no. 3, p. 816, 2020. [8] N. Koroniotis, N. Moustafa, E. Sitnikova, and B. Turnbull, “Towards the development of realistic botnet dataset in the Internet of Things for network forensic analytics: Bot-IoT dataset,” Future Generation Computer Systems, vol. 100, pp. 779–796, 2019. [9] J. R. Hosking, “L-moments: Analysis and estimation of distributions using linear combinations of order statistics,” Journal of the Royal Statistical Society: Series B (Methodological), vol. 52, no. 1, pp. 105–124, 1990. [10] J. Hosking and J. Wallis, “Some statistics useful in regional frequency analysis,” Water resources research, vol. 29, no. 2, pp. 271–281, 1993. [11] M. Fawad, T. Yan, L. Chen, K. Huang, and V. P. Singh, “Multiparameter probability distributions for at-site frequency analysis of annual maximum wind speed with L-moments for parameter estimation,” Energy, vol. 181, pp. 724–737, 2019. [12] F. Mohd-Zaid, C. M. Schubert Kabban, and R. F. Deckro, “A test on the L-moments of the degree distribution of a Barab´ asi–Albert network for detecting nodal and edge degradation,” Journal of Complex Networks, vol. 6, no. 1, pp. 24–53, 2018. [13] R. Ginoulhac, F. Barbaresco, J.-Y. Schneider, J.-M. Pannier, and S. Savary, “Target Classification Based On Kinematic Data From AIS/ADS-B, Using Statistical Features Extraction and Boosting,” in 2019 20th International Radar Symposium (IRS), pp. 1–10, IEEE, 2019. [14] K. Al-Dulaimi, K. Nguyen, J. Banks, V. Chandran, and I. Tomeo-Reyes, “Classification of White Blood Cells Using L-Moments Invariant Features of Nuclei Shape,” in 2018 International Conference on Image and Vision Computing New Zealand (IVCNZ), pp. 1–6, IEEE, 2018. [15] J. Hosking, “Some theory and practical uses of trimmed L-moments,” Journal of Statistical Planning and Inference, vol. 137, no. 9, pp. 3024–3039, 2007. [16] E. A. Elamir and A. H. Seheult, “Trimmed L-moments,” Computational Statistics & Data Analysis, vol. 43, no. 3, pp. 299–314, 2003. [17] W. Willinger, V. Paxson, and M. S. Taqqu, “Self-similarity and heavy tails: Structural modeling of network traffic,” A practical guide to heavy tails: statistical techniques and applications, vol. 23, pp. 27–53, 1998. [18] IANA, “Service Name and Transport Protocol Port Number Registry.” https://www.iana.org/assignments/ service-names-port-numbers/service-names-port-numbers.xhtml. [Online, accessed 3 June]. [19] H.-K. Lim, J.-B. Kim, K. Kim, Y.-G. Hong, and Y.-H. Han, “Payload-based traffic classification using multi-layer LSTM in Software Defined Networks,” Applied Sciences, vol. 9, no. 12, p. 2550, 2019. [20] G. Li, M. Dong, K. Ota, J. Wu, J. Li, and T. Ye, “Deep Packet Inspection Based Application-Aware Traffic Control for Software Defined Networks,” in 2016 IEEE Global Communications Conference (GLOBECOM), pp. 1–6, IEEE, 2016. [21] F. Pacheco, E. Exposito, M. Gineste, C. Baudoin, and J. Aguilar, “Towards the Deployment of Machine Learning Solutions in Network Traffic Classification: A Systematic Survey,” IEEE Communications Surveys & Tutorials, vol. 21, no. 2, pp. 1988–2014, 2018. [22] J. Zhang, Y. Xiang, Y. Wang, W. Zhou, Y. Xiang, and Y. Guan, “Network traffic classification using correlation information,” IEEE Transactions on Parallel and Distributed systems, vol. 24, no. 1, pp. 104–117, 2012. [23] M. Lotfollahi, M. J. Siavoshani, R. S. H. Zade, and M. Saberian, “Deep packet: A novel approach for encrypted traffic classification using deep learning,” Soft Computing, vol. 24, no. 3, pp. 1999–2012, 2020. [24] T. Su, H. Sun, J. Zhu, S. Wang, and Y. Li, “BAT: Deep Learning Methods on Network Intrusion Detection Using NSL-KDD Dataset,” IEEE Access, vol. 8, pp. 29575–29585, 2020. [25] G. Aceto, D. Ciuonzo, A. Montieri, and A. Pescap´ e, “DISTILLER: Encrypted traffic classification via multimodal multitask deep This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 202
Galeano-Brajones, Rico-Palomo, Chidean, Carmona-Murillo, 2021. learning,” Journal of Network and Computer Applications, vol. 183, p. 102985, 2021. [26] W. H. Asquith, Univariate Distributional Analysis with L-moment Statistics using R. PhD thesis, Texas Tech University, 2011. [27] I. Sharafaldin, A. H. Lashkari, and A. A. Ghorbani, “Toward Generating a New Intrusion Detection Dataset and Intrusion Traffic Characterization,” in ICISSp, pp. 108–116, 2018. [28] M. Sauter, “”LOIC Will Tear Us Apart” The Impact of Tool Design and Media Portrayals in the Success of Activist DDOS Attacks,” American Behavioral Scientist, vol. 57, no. 7, pp. 983–1007, 2013. This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) 203