Big data. explicación, principales herramientas y su aplicación en Amazon
Abstract
Grado en Comercio
Full text
GRADO EN COMERCIO TRABAJO FIN DE GRADO “Big data: Explicación, principales herramientas y su aplicación en Amazon” Miguel García Vázquez FACULTAD DE COMERCIOVALLADOLID, Fecha: Junio 2023
UNIVERSIDAD DE VALLADOLID GRADO EN COMERCIO Curso académico 2022/2023 TRABAJO FIN DE GRADO “Big data. Explicación, principales herramientas y su aplicación en Amazon” Trabajo presentado por: Miguel García Vázquez Tutor: María Sol Velasco Sacristán FACULTAD DE COMERCIO Valladolid, Junio 2023
Índice de contenidos 1 . Introducción .................................................................................................................... 7 1.1 Justificación ............................................................................................................... 7 1.2 Objetivos: .................................................................................................................. 7 1.3 Metodología .............................................................................................................. 8 2 . Definición de Big data ...................................................................................................... 9 2.1.1 Evolución del Big data ...................................................................................... 11 2.1.2 Las Vs del Big data ............................................................................................ 13 2.2 Importancia del Big data .......................................................................................... 20 2.2.1 Ventajas del uso del Big data ............................................................................ 23 2.3 Venta de datos y usuario como producto ................................................................. 24 2.3.1 Corredores de datos......................................................................................... 25 2.3.2 Entidades que protegen al usuario ................................................................... 27 2.4 Pirámide DKIW ........................................................................................................ 28 3 . Manejo de los datos en el Big data ................................................................................ 30 3.1 Tipos de datos y fuentes de datos ............................................................................ 30 3.1.1 Forma de los datos ........................................................................................... 30 3.1.2 Origen de los datos .......................................................................................... 31 3.2 Bases de datos ......................................................................................................... 35 3.2.1 Data Warehouse .............................................................................................. 36 “ .......................................................................................................................................... 36 3.2.2 Data Lake ......................................................................................................... 37 3.2.3 Data Lakehouse ............................................................................................... 38 4 . Análisis de datos ............................................................................................................ 39 4.1 Análisis web ............................................................................................................. 40 4.1.1 KPI ................................................................................................................... 42 4.2 Análisis predictivo .................................................................................................... 43 4.3 Análisis de sentimientos .......................................................................................... 46 5 . El caso de Amazon y su integración del Big data ............................................................ 51 5.1 De donde obtiene los datos ..................................................................................... 51 5.1.1 Para que usa los datos ..................................................................................... 52 5.1.2 El enfoque de Amazon ..................................................................................... 53 6 . Conclusiones ................................................................................................................. 55 7 . Bibliografía .................................................................................................................... 57
Índice de ilustraciones Ilustración 1 Línea de tiempo de las fases del Big data.................. Error! Bookmark not defined. Ilustración 2 Las 7Vs del Big data: Volumen, Velocidad, Variedad, Variabilidad, Veracidad, Valor, y Visibilidad........................................................................ Error! Bookmark not defined. Ilustración 3 Cuanta información se genera en cada minuto.................................................... 16 Ilustración 4 Costes estimados, de las noticias falsas en billones de dólares ............................ 19 Ilustración 5 Principales ventajas del Big data. ........................................................................ 23 Ilustración 6 Estructura de paquetes de corredores de datos .................................................. 26 Ilustración 7 Estructura de la pirámide DKIW .......................................................................... 28 Ilustración 8 Forma de los datos .............................................................................................. 30 Ilustración 9 Origen de la mayoría de datos de Big data. ......................................................... 32 Ilustración 10 Número de conexiones M2M en el mundo desde el 2014 al 2020. .................... 33 Ilustración 11 Estructura de bases de datos............................................................................. 35 Ilustración 12 La analítica web2.0............................................................................................ 41 Ilustración 13 : KPI, más importantes en Google ...................................................................... 42 Ilustración 14 Proceso de creeación del análisis predictivo ...................................................... 45 Ilustración 15 Proceso de creación del análisis de opinión ....................................................... 48
Lista de acrónimos 1. IA: Inteligencia artificial 2. MIT: Massachusetts Institute of Technology/ Instituto de Tecnología de Massachusetts 3. IBM: International Business Machines 4. GPS: Global Positioning System/Sistema de Posicionamiento Global 5. GDPR: General Data Protection Regulation /Reglamento General de Protección de Datos 6. KPI: Key Performance Indicators/Indicadores Clave de Rendimiento
Resumen En el trabajo he hablado del significado del Big data, no solamente para las empresas sino qué opinan las organizaciones y diversas áreas económicas del mismo, como lo interpretan desde su posición, porque esté debería de importarnos y que peligros para los consumidores puede acabar acarreando sino se gestiona correctamente. He hablado sobre la forma y origen de los datos, cómo son clasificado dentro del Big data y dónde encontramos dichos datos almacenados. Con un enfoque centrado en Amazon, he hablado sobre las principales técnicas de análisis de datos, incluyendo el análisis web. He explicado algunas de las principales formas de análisis de las empresas, por qué son tan importantes estos métodos, qué ventajas les ofrecen a estas, y cómo se pueden aplicar al mundo real. Finalmente, he explicado sobre Amazon y su proceso de compra, cómo captura y qué datos le interesa obtener. Palabras clave: Big data, datos, Amazon, Web, análisis, organizaciones, información. Abstract In the paper I have talked about the meaning of Big data, not only for companies but also what organizations and different economic areas think about it, how they interpret it from their position, why it should matter to us and what dangers it can end up bringing to consumers if it is not managed correctly. I have talked about the form and origin of the data, how it is classified within Big data and where we find this data stored. With a focus on Amazon, I have talked about the main data analysis techniques, including web analytics. I have explained some of the main forms of analytics for companies, why these methods are so important, what advantages they offer to companies, and how they can be applied to the real world. Finally, I have explained about Amazon and its buying process, how it captures and what data it is interested in obtaining. Keywords: Big data, data, Amazon, Web, analytics, organizations, information.
7 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 1 . Introducción 1.1 Justificación La principal razón por la cual decidí elegir el tema del “Big data”, sería debido a que pese a ser un tema, que como veremos en este trabajo, no es tan nuevo como podría parecer, todavía resulta novedoso y refrescante al estar constantemente surgiendo diferentes tecnologías y técnicas, evolucionando e incluso resurgiendo con el pasar del tiempo, como puede ser el resurgimiento en 2022 de las IA. Esta es una de las razones, por las cuales, “Big data” es un campo tan rico y con tanta variedad de puntos de vista, todos válidos dependiendo de quien lo cuente. Mi objetivo es centrarme en aquellos aspectos que son más usados por las empresas, bases de datos, análisis avanzados de los datos y forma de gestionar el “Big data” haciendo énfasis en las técnicas y herramientas más utilizadas por las organizaciones, que centran sus actividades en el ámbito online. Otra razón por la cual he querido realizar este trabajo, es para aumentar mi propio conocimiento dentro de este tema, dado que muchos de los autores y entidades que veremos en el trabajo, Bernard Marr, Luis Aguilar Joyanes, MIT, IBM… predicen un aumento sustancial en los empleos relacionados con los datos y en la importancia de estos en el ámbito empresarial. 1.2 Objetivos: La cantidad de datos que generamos y destruimos en cada momento es gigantesca, tal es este volumen que resulta casi imposible de gestionar sin herramientas especializadas. Esto acaba resultando la razón, por la cual muchas empresas han querido aprovechar y gestionar este flujo de datos, para convertirlo en conocimiento útil que le servirá para la toma de decisiones dentro de la empresa. De las cuales podemos destacar, desde Uber hasta Google Mi objetivo principal, se podría resumir de la siguiente manera, comprender el “Big data”, pasando por sus principales técnicas y herramientas
8 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Asimismo como objetivos más específicos serán: Entender el concepto de “Big data”, sus diferentes definiciones. Comprender qué son los datos y cuáles trata el “Big data”. Identificar las principales herramientas dentro del “Big data”. Comprender cómo se analizan los datos para obtener valor de los mismos. Analizar el uso del “Big data” por parte de Amazon y cómo afecta a su empresa. 1.3 Metodología En primer lugar, se va a realizar una búsqueda y revisión de la bibliografía pertinente, incluyendo libros y trabajos escritos sobre el tema a tratar, los cuales mencionarán y después realizar un análisis cualitativo de las lecturas y conocimientos obtenidos, todo ello realizado con cohesión y coherencia. Esto se va a realizar con el objetivo de entender y aumentar mi conocimiento sobre “Big data”, comprender en más profundidad el tema, su teoría, las tecnologías y las metodologías más importantes. Seguidamente identificaré aquellas áreas que con el marco teórico de comercio, considero que son más importantes para comprender el tema. El análisis cualitativo, se va centrar en su mayoría en explicar, el concepto de “Big data” y sus principales herramientas y técnicas utilizadas. Con esto pretendo explicar tanto los conceptos básicos del tema, como su importancia y por qué la gente está usando estas herramientas y sus principales razones. Finalmente tomaré el ejemplo de una empresa que ha utilizado intensamente el “Big data”: Amazon, tanto en su Marketplace, como en su decisión de abrir un proveedor de servicios web centrados principalmente, en “Big data” y bases de datos.
9 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 2 . Definición de Big data Antes de hablar del tema, de dónde proviene el término “Big data”, o datos masivos, normalmente el origen del mismo se le atribuye a Francis Dievold, argumentando que surgió a mediados de la década de 1990 en conversaciones informales de la empresa Silicon Graphics. Sin embargo, en su documento (Diebold, 2012) el mismo argumenta que si bien fue de los primeros en mencionarlo, el concepto comenzó a surgir a finales de los noventa por parte de diversos autores, los cuales simplemente observaban el entorno añadiendo que fue (Laney, 2001) cuando se terminó de materializar el concepto. Una vez conocemos el término, me gustaría aclarar qué no es el Big data, según IBM (IBM, 2017). No es solo muchos datos No son solo herramientas, técnicas y una serie de tecnologías de la información, No es una moda actual No es una solución universal a todos los problemas, Sin embargo, el Big data si es un concepto muy extenso y variado, como veremos en este documento, abarca desde el marketing de las empresas, hasta la investigación genética (Rojas, 2022). Y si bien es cierto que muchas veces es utilizado por las empresas, todo tipo de organizaciones pueden hacer uso de sus capacidades. Esta heterogeneidad es la razón por la cual existe un debate entre muchos expertos sobre el tema, cada uno cuenta con una o varias versiones de su propio campo sobre que serían los daos masivos. De hecho, es tanto el problema, que diferentes trabajos y encuestas a profesionales han sido realizados para aclarar el problema. Yo mismo he encontrado dos de estas, una realizada por Harvard (McAfee & Brynjolfsson, 2012) y la otra por la universidad Bielefed en Alemania (Favaretto, 2020). La segunda, la de la universidad de Bielefed, es la más completa y la que más expone el tema. En la misma encontramos multitud de definiciones, dadas en su mayoría por ejecutivos anónimos de sectores de Big data, pero también
16 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Traducción, (Siegler, 2010) “Cada dos días creamos tanta información, como habíamos creado desde el principio de la civilización hasta 2003” 2003” “Cada dos días creamos tanta información, como habíamos creado desde el principio de la civilización hasta 2003” (Siegler, 2010). Como norma para el volumen, cuanto mayor sea la cantidad de datos mejor, debido a un aumento en la claridad y menos irregularidades dentro de la muestra sin embargo, esto también significa que estaremos limitando aspectos como la velocidad o la veracidad de los datos, dado que los dispositivos electrónicos, cuentan con capacidades limitadas (Keskar et al., 2020). Sin embargo en los últimos años, con el avance de la nube y las mejoras tecnológicas de los servidores, han permitido grandes niveles de almacenamiento a costes muy bajos ( Joyanes, 2013). Con todo esta cantidad de información no sería posible sin la capacidad actual de las empresas, de conseguir más información de sus transacciones en internet que de lo que serían capaces en cualquier operación física realizada (Laney, 2001). Imaginemos que una librería física quisiera conseguir información similar a la que consigue Amazon, tendría que apuntar todos los movimientos de los clientes por la tienda, cada libro que han ojeado y una vez vendido, realizar llamadas para que les diese su opinión del libro. Ilustración 3: Cuanta información se genera en cada minuto. Referencia Mimmo 2020
17 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Velocidad: La frecuencia de creación, almacenaje, tratamiento y visualización de los datos, casi tan importante como la cantidad es la calidad, tener información actualizada es necesario en cualquier decisión que se desee tomar. Si los bytes eran la forma de medida predilecta del Volumen, el tiempo es la variable más importante en la Velocidad, cuanto más consigamos reducir el tiempo y asemejarlo a la inmediatez, mejores resultados obtendremos en nuestras decisiones. Tomemos el ejemplo de las tarjetas de crédito, cuanto más rápidamente manden las transacciones, menos tiempo tardan en descubrirse fraudes y menos cola de un supermercado haremos (Marr,2014). Esta V es especialmente útil para la detección de estafas, monitorización de los flujos de datos y evitar los errores diarios que pueden ocurrir en el ejercicio de las actividades (Unir, 2020). Igualmente cuando abordemos esta V, debemos tener en cuenta que Velocidad va a necesitar la organización, si bien es cierto que como norma cuanto menor sea el tiempo mejor, esto no siempre es posible por lo tanto existen diferentes velocidades que usan las organizaciones (Keskar et al., 2020). Flujo de datos: se están recibiendo los datos en el mismo momento que se crean, sin necesidad de ningún tratamiento, tenemos las cámaras de vigilancia o los servicios de “streaming” como Twich, transmiten de forma continua información. Datos en tiempo real: los datos son creados y consumidos casi al momento por ejemplo, conversaciones telefónicas, videoconferencias o retiradas en cajeros. Datos casi en tiempo real: existe cierto retraso entre el envío y el recibimiento, recibir la confirmación por email de una compra. Procesamiento en Packs: los datos llegan periódicamente en grandes cantidades, como los emails diarios sobre novedades que suele mandar Aliexpress o resúmenes diarios en las empresas. Variedad: La diversidad de fuentes, formatos y tipologías de los cuales podemos obtener datos. Tenemos la capacidad de sacar información de diversos tipos, y de un gran número de fuentes, las más importantes veremos en el apartado 3.1 como pueden ser, archivos, blogs, bases de datos, sensores, webs
18 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon y similares. Esto provoca una gran diversidad de tipos de datos desde texto, vídeos, imágenes y diferencias en los formatos, desde Word, Access, Excel, JPG, PNG y similares (Unir, 2020). Asimismo los datos se pueden categorizar, en estructurados y no estructurados (Bernard Marr, 2014). Esta V cobra especial importancia, con la misma expansión de internet, cuantos más sitios sean creados más información saldrá y más variedad existirá, de hecho, cada persona resulta ser una fuente independiente de datos por sí misma (Rulanitee, 2018,). Un ejemplo de la importancia de la variedad, viene de investigadores de la escuela de medicina John Hopkins, donde encontraron que usando los datos de búsquedas en Google relacionados con la gripe, podían predecir aumentos en el flujo de enfermos de gripe. Asimismo Wallmart, usa geolocalización de los móviles, para predecir picos horarios en sus parkings de forma similar a como Google, ahora nos informa del tráfico o de cuánta gente se encuentra presente en una localización, basándose en cuantos móviles se encuentran allí (McAfee y Brynjolfsson, 2012). El principal problema de esta V para las empresas y los Marketplace, radica en como igualar, comparar y procesar todos estos datos de una sola vez. Dado que como ya hemos visto, datos que quizás no apreciásemos a simple vista, pueden acabar siendo determinantes para averiguar algo sobre la organización. Amazon por ejemplo, no solamente cuenta con la información recogida en sus páginas web, sino que suele utilizar censos, corredores de datos y GPS para mejorar sus recomendaciones (Marr, 2016). Veracidad: La fidelidad de la información que hemos obtenido, ya que si la información obtenida, no es fidedigna o representativa del mundo real, las aplicaciones de estos dato es casi nula. Sin embargo, la norma en el Big data, no suele ser una inexactitud tan completa de la información, normalmente suele ser el llamado ruido, lo que da más problemas. Esto es básicamente información inútil o incompleta, resultado en su mayoría de los procesos normales del procesamiento y recopilación de datos (Sohaib et al., 2019). Sin embargo, es una corriente ascendente el número de información falsa al que nos vemos expuestos, y esto sí que puede tener grandes impactos en la empresa.
19 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon A continuación, podemos ver los costes aproximados de la desinformación durante el año 2019, esto fue un estudio realizado por CHEQ, una empresa de ciberseguridad (CHEQ, 2019). Ilustración 4: Costes estimados, de las noticias falsas en billones de dólares. Fuente elaboración propia. Referencia CHEQ 2019 Otro ejemplo, de cómo la falta de veracidad afecta a las empresas, lo encontramos con un tweet, falso, realizado en nombre de la farmacéutica Eli Lilly, donde decía que su insulina sería en ese momento gratis, dando lugar a una bajada del 4,4% de sus acciones en bolsa (Lee, 2022). Valor: Da igual, la cantidad, variedad, veraces o con que velocidad los procesemos si los datos, no tienen valor para nosotros y para nuestra toma de decisiones. Por esto mismo, debemos de preguntarnos siempre antes de empezar con la recopilación de datos, si estos nos van a aportar lo necesario para justificar su coste (Maheshwari, 2015). Esta V gana mucha importancia, y autores como Maheshwari la colocan en la primera posición de las Vs (Maheshwari, 2015). En esta línea IBM plantea que mientras los datos disponible(volumen) aumentan en las organizaciones, el porcentaje de datos que se analiza está en disminución, y cada vez se extrae información importante de un porcentaje menor de los datos capturados (Joyanes, 2013). Es por esto que debemos de tener siempre en mente nuestro objetivo, la cultura y las necesidades de la organización, antes de realizar cualquier esfuerzo
20 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon de datos, razonar si estos se encuentran relacionados con lo anterior, y si pueden resultarnos beneficiosos, en especial para la toma de decisiones y para ganar información sobre nuestro entorno y nuestra organización. Si no tenemos esto en cuenta antes de realizar nuestros esfuerzos, estos pueden suponer una carga económica y temporal innecesaria. Visualización: “La visualización de datos es la representación gráfica de información y datos. Al utilizar elementos visuales como cuadros, gráficos y mapas” (Tableau, 2023, p 1) así define Tableau, una de las mayores empresas de visualización de datos, sobre su sector y sus actividades. Es gracias a esta visualización que conseguimos que miles de celdas de información, se conviertan en un formato legible y accesible, que proporcione valor para la organización encontrando patrones, o valores que no habrían sido posibles sin estas herramientas. La visualización es tremendamente variada, y depende en gran medida de los datos y de aquello que queremos averiguar, pueden ser desde gráficos de barras, hasta arboles de conceptos o histogramas. Por esto es importante que cuando se realice la visualización se elija correctamente el método para su mejor comprensión (Tableau,2023). Variabilidad: La capacidad de cambio de los datos, los datos en internet se encuentran en todo momento actualizándose o cambiando, esto normalmente significa que mucha de la información que podíamos haber recolectado, ha quedado obsoleta o que ya no es representativa, para cuando llega a nosotros (Sohaib et al., 2019). Por esto las empresas deben de buscar aquellos datos que sean más estables en el tiempo, y que sufran de menos actualizaciones, sin quedar obsoletos, a la hora de la recopilación de datos. 2.2 Importancia del Big data “El aumento del volumen y la velocidad de datos significa que las organizaciones tendrán que desarrollar herramientas para recopilar, analizar e interpretar los datos” (Davenport et al., 2012 p 23). Esta frase resume perfectamente la importancia del Big Data y porque las empresas, están haciendo tantos esfuerzos por adoptarla. Los métodos tradicionales de tratamiento de datos, como la estadística básica o los reportes ya no resultan suficientes para gestionar la información con la que se ven
21 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon bombardeada cada día las organizaciones (Manyika, 2011). Estos métodos tradicionales incluyen aspectos como estadística básica, como varianzas o regresiones, servidores y bases de datos físicos como papel, CD o disquetes. Para ver hasta qué punto, se pueden atascar los procesos por falta de necesidad, tenemos el curioso caso del gobierno Japones, donde unos 1.900 procesos gubernamentales todavía requerían de disquetes en el 2022, puesto que al no tener la necesidad de evolucionar junto al resto de la población, esta organización había acabo quedándose con procesos tan desactualizados, que usaban métodos de almacenaje que ya no se fabrican, esto sería similar a aceptar solamente reportes escritos a máquinas de escribir (BBC, 2022). Las empresas, cada vez obtienen una mayor cantidad de datos, tanto de sus transacciones, como de los consumidores a través del internet, cada uno de nuestros ordenadores es un pequeño punto que contribuye al tráfico global de datos (Manyika, 2011). Gracias a este aumento de los datos, el Big data tiene un impacto en casi todos los sectores de la sociedad, desde las empresas, gobiernos, salud o construcción, esta marea de datos que nosotros mismo creamos, cambia a quienes toca y les obliga a adaptarse a nuevas cotas de información que no dejan de aumentar (Aguilar,2013). Pese a la gran cantidad de datos que desde la antigüedad se han visto obligados a gestionar, organizaciones como gobiernos suelen apoyarse en extensas burocracias, métodos y sistemas desactualizados que nublan la visón que tienen del exterior y puede dar lugar a errores o estancamiento como paso en Japón. Con todo algunos de ellos han podido ver la importancia de estas nuevas técnicas y están invirtiendo en formas de poder adaptarlas a sus propias necesidades. En su mayoría realizan estos esfuerzos para compartirlos y crear una mayor transparencia con el exterior, esto permitiría tanto a empresas como a particulares, mejorar su opinión de los gobiernos y conseguiría un mercado más informado y por lo tanto más competitivo. Por ejemplo tenemos EEUU con su iniciativa Data.gov, en Europa encontramos hasta 183 iniciativas independientes, y muchos países de Sudamérica, Asia África están empezando a realizar esfuerzos similares (Joyanes, 2013). En cuanto a las empresas podemos encontrar técnicas de Big data en muchísimos campos y áreas laborales, puede ser usado, desde secuenciación de ADN, empresas como Myheritage que buscan reconstruir el pasado genético
22 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon de un individuo, usan estas técnicas para abaratar costes y disminuir el tiempo en algo que antes podía tardar años. (Mayer-Schnberger & Cukier, 2013). Tenemos el libro escrito por (Marr, 2016) el cual nos da un vistazo en 45 empresas de diferentes tamaños ya áreas que han podido de manera exitosa, utilizar aspectos del Big data en sus operaciones y como estas se han visto afectadas. Otro aspecto de vital importancia para las empresas, las ventas y el marketing se pueden ver muy beneficiadas por el uso de Big data, por ejemplo en las empresas de tarjetas de crédito, las cuales antes de la adopción de técnicas de Big data y análisis, tardaban semanas en extraer y analizar correctamente los datos que tenían sobre sus clientes para ofrecer un plan personalizado, ahora gracias a herramientas de análisis avanzadas, como el análisis de sentimientos o el predictivo, que veremos en el apartado 4, son capaces de en una llamada ofrecer ofertas personalizadas a las necesidades del cliente (Davenport et al., 2012). Finalmente, una razón que quizás no sea tan hablada, la encontramos en la evolución, como ya hemos visto el Big data es algo muy relacionado a la sociedad y a la cultura del momento, por lo tanto según estas avanzan han acabado forzando a muchas tecnologías a evolucionar y adaptarse. Por ejemplo, con el aumento del volumen de datos, a partir del 2010 con la llegada de los móviles inteligentes, forzó la aparición de nubes de almacenamiento masivas, y de métodos para poder contener y gestionar estos nuevos volúmenes incrementales de datos y en general trajeron una nueva forma de pensar sobre la información (Mayer-Schnberger & Cukier, 2013). En general los datos masivos son una revolución que está cambiando la forma de ver el mundo, el Big data ya nos permite realizar tareas que antes llevaban años en unos pocos días (Mayer-Schnberger & Cukier, 2013). Por ejemplo, ahora las empresas son capaces de recibir información en tiempo real del cliente según este se desplaza por su página web, los supermercados son capaces de predecir cuantas ventas tendrán y empresas como Uber son capaces de realizar estimaciones casi exactas de tiempo y precio en viajes en ciudades, todo esto resultaba algo imposible para las primeras empresas online (Marr,2016).
23 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 2.2.1 Ventajas del uso del Big data Como ya hemos visto, el Big data es muy importante para las empresas y puede ser un factor decisivo para su éxito en el mercado, por esto quiero destacar alguna de las ventajas más generales que ofrecen los datos masivos (McKinsey, 2011): Ilustración 5: Principales ventajas del Big data. Fuente elaboración propia. Referencia McKinsey, 2011 Crea transparencia: hemos visto que muchos gobiernos están adoptando programas de Big data, para crear visibilidad sobre los datos que estos recogen y mejorar la opinión del publico así como ayudar a las empresas a conocer mejor los mercados (Joyanes, 2013). Permite experimentar: antes de los datos masivos, las empresas necesitaban esperar a la generación de informes y reportes, para saber si sus estrategias habían resultado exitosas y en qué grado estas lo habían sido. Con el uso de los datos masivos, estos tiempos se ven acortados en gran medida, de forma similar a como IBM solución el problema del censo. Mejora la segmentación: segmentación es la principal razón por la cual existen los corredores de datos, que veremos en el siguiente apartado, el Big data permite separar de una forma mucho más exacta y eficaz, las poblaciones en sesgos.
24 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Toma de decisiones: la ventaja más importante, desde la recogida de datos, hasta la decisión final, encontramos técnicas de Big data en todo el proceso de decisión, sea automático o simplemente sirva como apoyo para la persona. La aparición de los datos masivos, ha creado una ventaja competitiva para aquellas organizaciones que la han adoptado frente al resto de estructuras que no lo han hecho, esta se puede apreciar especialmente con la competitividad de otras empresas que no usan el Big data en sus organizaciones, o que evitan el uso de datos masivos en general (Marr, 2016). Si bien es cierto que depende del sector al cual nos dirigimos, la inmensa mayoría de áreas se verán beneficiadas por la adopción de Big data en sus organizaciones. Por ejemplo las empresas de ventas al público y al por mayor, fueron estimadas que conseguirían una mejora en beneficios de un 60% al adoptar estas técnicas o una capacidad de decisión hasta dos veces más rápida y eficaz (McKinsey, 2011). Finalmente destacar que ventajas nos aporta a nosotros como usuarios, el Big data, no sirve solamente a las empresas, sino que su beneficio repercute en los usuarios también, primeramente obtenemos más información de nuestras compras, tenemos más opciones de compra, por ejemplo en 2003 Oren Etzioni un científico de computación, descubrió que había pagado mucho más por su asiento de avión que el resto de pasajeros, creo la empresa Farecast la cual podía predecir aumentos en los boletos de aviones en tiempo real. Los vendedores se pueden ajustar mejor al mercado y por lo tanto, pueden ofrecer precios y productos más personalizados a las personas (McKinsey, 2011). Por último tenemos algo clave, la comodidad al tener las empresas información de nuestros gustos y preferencias, pueden aportar una experiencia más completa a nuestra compra y hacerla de la forma que nos resulte más cómoda, desde la selección del producto hasta el pago (Mayer-Schnberger & Cukier, 2013). 2.3 Venta de datos y usuario como producto Uno de los principales lugares, de donde las empresas, pueden extraer información valiosa, son los mismos consumidores, todos esos cuadritos donde aceptamos los términos y condiciones, o cuando en una llamada a la compañía de internet nos avisan que la llamada puede ser grabada, están recopilando
25 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon nuestros datos para ser posteriormente recopilados y analizados. Todo esto ha dado lugar a una economía nueva, exclusiva de datos donde las empresas compran y venden la información de los consumidores. Esta información es tremendamente valiosa y útil para las empresas que lo compran, dado que normalmente les resultaría mucho más complicado y costoso conseguir información similar. Esta información puede ser usada en varios departamentos simultáneos, como ventas y marketing, pueden ser usados varias veces y dependiendo de qué datos tengamos, pueden tardar mucho en quedar obsoletos. El mayor beneficio lo encontramos en los corredores, puesto que estos datos pueden ser vendidos todas las veces que le sea necesario, pueden resultar activos económicos muy valiosos y alcanzan precios altos en los mercados (Latto, 2023). Finalmente existe otro peligro con esta recogida de datos, el de la sobreinformación y las noticias falsas, ya vimos en el apartado 2.3 los costes que tienen las noticias falsas globalmente, sin embargo estos costes se relacionan estrechamente con la sobreinformación este fenómeno es tan grande, que se podría decir que nos encontramos en la era de la sobreinformación, llegan tantos estímulos y datos a nuestro cerebro, que no somos capaces de filtrar adecuadamente, esto no es un fenómeno nuevo, desde que existen las noticias la gente ha buscado formas de ocultar la verdad que no sirva a sus intereses, sin embargo ahora con internet y la redes sociales, los usuarios se ven bombardeados para hacerles crear aquello que beneficie a las corporaciones (Garay, 2019). Ya en 2012, Intel realizó una encuesta sobre la información en las redes sociales, en las mayores potencias económicas del momento, y concluyo que casi la mitad de las personas preguntadas, se sentían sobrecargados de información (Joyanes, 2013). 2.3.1 Corredores de datos Aquellos encargados de la compra y venta de estos datos, son los llamados “data Brokers” o corredores de datos, “recopilan datos personales, los agrupan en paquetes y los venden a terceros” (Latto, 2023, p 1) los corredores, reúnen información tanto dentro como fuera de internet, desde búsquedas de gatitos, hasta impuestos y visitas al hospital. Estos paquetes también incluyen aparte de esta información, datos detallados de los gustos, preferencias, ideales
32 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Ilustración 9: Origen de la mayoría de datos de Big data. Fuente elaboración propia. Referencia Soares 2013 M2M o Máquina a máquina: estas son las tecnologías que permiten conectar dos o más dispositivos entre sí, normalmente estos dispositivos conectados siendo sensores o medidores, podemos encontrar estos medidores, en aparatos como las televisiones inteligentes, relojes inteligentes, automóviles y muchos otros dispositivos que usamos diariamente. Estos dispositivos, registran actividades o eventos, estos eventos pudiendo ser desde aumentos ambientales, señales GPS, indicadores de identidad, datos de acceso y similares. Una vez estos eventos son registrados, los dispositivos transmiten estos datos a otras máquinas, encargadas de su almacenaje y conversión en datos que puedan ser usados por las organizaciones, o en su defecto las mismas maquinas tomarán decisiones automáticas, este tipo de conexiones se encentran en auge, dado que sensores y medidores son ahora la norma para multitud de productos (Soares, 2013). Por ejemplo, cuando el termómetro enciende la caldera, dado que ha registrado ciertas temperaturas.
33 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Número de conexiones M2M en el mundo desde el 2014 al 2020 Ilustración 10 Referencia Statista 2016 Transacciones de grandes datos: esto incluye, datos generados durante transacciones, desde registros de llamadas, telecomunicaciones, registros de compras o datos de facturación, siendo normalmente no o semi estructurados. Este tipo de origen, suele tener problemas con la privacidad de los usuarios, dado que muchos de estos datos son personas para los consumidores y a veces son de difícil acceso. La web y las redes sociales: abarca la mayoría de contenido disponible en internet, desde publicaciones en redes, comentarios, noticias, secuencia de clics3, blogs o paginas especializadas, esta es normalmente la más extensa fuente de datos. Este origen captura multitud de datos las publicaciones de los usuarios, no solamente su contenido, sino que lugar, hora y fecha de la publicación y si existen antecedentes a esa publicación, haciendo este uno de los orígenes más completos y complejos, por esto encontramos mucha más información de la que podría parecer a primera vista, siendo la inmensa mayoría poco estructurados dado que usaremos comentarios y opiniones de los usuarios (Soares, 2013). Normalmente va a permitir, una comprensión más profunda de los consumidores sirviendo como base de muchas, de las grandes empresas centradas en internet, o de aquellas que usan el mismo para mejorar sus procesos (Marr, 2016). Amazon obtiene una inmensa cantidad de datos útiles, en especial de los comentarios sobre sus productos, tanto en su página web
34 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon como en las redes y luego, esta información puede ser usada para mejorar la experiencia de los consumidores y elegir las mejores recomendaciones. Estos datos suelen ser analizados, por herramientas de analítica web(Joyanes, 2013). Biometría: los datos biológicos, estos permiten identificar a cada ser humano como un individuo, dividiéndose en datos anatómicos y genéticos. Los datos genéticos, ADN, sangre y aquello que necesitaría un análisis más exhaustivo siendo casi imposibles de cambiar, por otro lado, tenemos los anatómicos, los cuales pueden ser fácilmente reconocibles, pero más fáciles de alterar, reconocimiento facial, huellas dactilares, ojos, voz (Soares, 2013). Un ejemplo de cómo las empresas están utilizando estas tecnologías, lo tenemos en los teléfonos, las últimas formas de desbloqueo, son la huella dactilar y el reconocimiento facial, lo cual permite personalizar aún más el producto para el consumidor. Estos datos son en su mayoría muy personales y extremadamente útiles para identificar personas, incluso de formas inesperadas. Para ver en qué grado pueden resultar útiles, tenemos el ejemplo de Shigeomi Koshimizu, profesor del Instituto Avanzado de Tecnología Industrial de Japón, colocó 360 sensores en el asiento de un coche, para ver si podía detectar entre un grupo de personas, quien se había sentado convirtiendo la presión en cada punto en datos, y el resultado acabó siendo de un acierto de un 98% (Mayer-Schnberger & Cukier, 2013, p 51). Por último, estos datos pueden resultar tremendamente útiles por una serie de razones, con una rápida búsqueda de Google podemos encontrar varios ejemplos de la utilización del Big data en la medicina. Desde hace unos años, se llevan usando técnicas de Big data para analizar individualmente las células de tumores y de otros tejidos cancerígenos, a un nivel genético, creando reportes mucho más específicos que permiten personalizar el tratamiento a cada paciente (Rojas, 2022). Datos generados por las personas: la información generada directamente por las personas. Siendo como ya hemos comentado, el principal problema de esta información la privacidad, puesto que esta fuente puede contener conversaciones privadas o registros que el consumidor no quería compartir en un principio del dentro de esta encontramos los emails, notas de voz, encuestas o registros médicos (Soares, 2013).
35 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 3.2 Bases de datos La capacidad de almacenar la mayor cantidad de información, en el menor espacio posible, es algo que lleva siglos siendo un obstáculo para la humanidad, encontramos como claros ejemplos las primeras bibliotecas, estos primero intentos de nuestros antepasados de crear un repositorio de datos4 unificado, fueron los primeros intentos del gobierno por unificar la mayor cantidad de conocimiento posible en el mismo lugar. Sin embargo estos primero intentos no tuvieron mucho éxito y las grandes bibliotecas, eran proclives a incendios y saqueos constantes (Mayer-Schnberger & Cukier, 2013). Las bases de datos no son muy diferentes des estos primeros intentos, buscan condensar la mayor cantidad de información útil en un formato datificable y permitir a los encargados de las organizaciones, usar esa información contenida para comprender mejor la situación de la empresa y en consecuencia mejorar la toma de decisiones. Sin embargo, las bases de datos sufren de problemas que las bibliotecas apenas si notan, las bases, deben de adaptarse al entorno en el cual se encuentran, deben estar siempre disponibles y deben de poder actualizarse cada poco (Nambiar & Mundra, 2022). Ilustración 11: Estructura de bases de datos. Fuente elaboración propia
36 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Traducción, (Nambiar & Mundra, 2022, p 1) “Es un gran repositorio de datos en el que se pueden almacenar e integrar datos de diversas fuentes de forma bien estructurada” 3.2.1 Data Warehouse “Is a large data repository wherein data can be stored and integrated from various sources in a well-structured manner” (Nambiar & Mundra, 2022, p 1). Este repositorio, fue una de las primeras bases de datos en surgir y su función principal sería la de realizar consultas, acceder y analizar los datos en tiempo real o ver la historia de los datos que contienen, quien ha sacado los datos y para que los ha sacado. Esto tiene como objetivo, ayudar a las organizaciones en la toma de decisiones, manteniendo un registro de la información más importante en las empresas (Talend, 2023). Los datos dentro de este se encuentran estructurados, dado que cuando estos surgen, la mayoría de información se encontraba en este formato, al ser las organizaciones las principales emisoras de información, mientras que internet y los contenidos creados por usuarios no eran todavía tan importantes. El hecho que estén estructurados, da la ventaja de fácil revisión, gestión y almacenaje, igualmente cada departamento cuenta con sus subapartados dentro estos repositorios, llamados “data Marts”, estos actúan como puertas con contraseña dentro del repositorio, para asegurar que solamente miembros del departamento asignado podrán acceder a la puerta de su departamento(Joyanes, 2013). Esto permite mejorar la organización del repositorio, al evitar repeticiones y almacenamiento innecesario en el mismo “data Mart”, igualmente al estar separados por claves, mejora la seguridad puesto que los ladrones solamente pueden acceder a una parte de la base de datos. Sin embargo este repositorio tiene algunos problemas, es más complicado compartir información entre departamentos, es poco flexible, difícil de actualizar, solo admite datos estructurados y su proceso de admisión de los datos es complejo (Nambiar & Mundra, 2022).
37 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Traducción, (Nambiar & Mundra, 2022, p 2) “Los lagos de datos son depósitos de almacenamiento centralizados que permiten a los usuarios almacenar datos sin procesar en su formato original” 3.2.2 Data Lake “Data lakes are centralized storage repositories that enable users to store raw, unprocessed data in their original format” (Nambiar & Mundra, 2022, p 2). Con el aumento de variedad y volumen de información en internet, se hacía necesaria una nueva forma de almacenamiento de datos, diferente de las “Warehouses” tradicionales esto serían los “data Lakes” o lago de datos, estos cuentan con mucha mayor flexibilidad y almacenamiento, ideales para un entorno donde no se paran de generar datos en ningún momento y que necesita actualización constante. Los lagos de datos son la alternativa moderna a los “Warehouses” y a diferencia de estos, pueden tener todo tipo de datos dentro de su repositorio (muy útiles cuando el 90% de los datos son no estructurados) (Marr, 2021) su proceso de integración de datos es más sencillo, solo etiquetándolos, para una posterior búsqueda. Esto permite que estos datos sean más maleables y flexibles, al ser su gestión mucho más sencilla que métodos más tradicionales, esto no vienen sin sus propios problemas sin embargo, da lugar a que exista un mayor número de datos inútiles al estar admitiendo en el sistema, estos datos que no se encuentran estructurados. Compensan este exceso de datos inútiles, con una capacidad de almacenamiento mucho mayor que las “Warehouses”, igualmente al encontrarse centralizados y sin barreras dentro del repositorio, permiten a los departamentos compartir datos y mejorar sustancialmente la comunicación interdepartamental. Sin embargo, esto significa, que la extracción de los datos es más complicada y suele dar lugar a retrasos, repeticiones de datos, inexactitudes en con la información adquirida y una menor seguridad, dado que si un hacker tiene acceso a la base, no existen barreras dentro de esta como en las “Warehouses”(Joyanes, 2013).
38 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Finalmente estos cuentan con un gran problema, cuando su mantenimiento no es el adecuado o es utilizado en exceso sin purgar datos innecesarios, el lago se convertirá en un llamado pantano de datos, siendo esto un lago de datos, que en lugar de contar con datos útiles para la empresa, se encuentra lleno de datos repetitivos, mal integrados y en su gran mayoría sin ningún valor real para la organización, cuando un lago se convierte en un pantano, significa que nos quedamos con una base de datos de capacidades reducidas, que entorpecerá el correcto funcionamiento de la organización(IBM, 2018). La última gran diferencia entre estos dos métodos de almacenamiento, sería que los lagos, permiten usar mucho mejor herramientas de ”data science” y “machine learning” frente a las “warehouses” (Nambiar & Mundra, 2022). 3.2.3 Data Lakehouse Finalmente existen los “data Lakehouse”, siendo estos la más moderna iteración de las bases de datos, su forma es la de un lago de datos, pero añade capacidades que le convierte en una versión mejorada de este buscando combinar las ventajas de las dos estructuras anteriores “Toma el almacenamiento flexible de datos no estructurados de un lago de datos y las funciones y herramientas de gestión de almacenes de datos" (Oracle, 2023, p 1). Las principales características del mismo, radican en combinar las ventajas de los “Warehouse”, buscando seguridad, estructura y fiabilidad con la de los lagos, gran capacidad de almacenamiento, flexibilidad y variedad de datos. Consigue esto a grandes rasgos, tomando un lago de datos al cual le añadimos elementos similares a las “Warehouse”, en especial su estructura y la forma de admisión de los datos, lo cual le permite ser flexible como los lagos pero mejora la extracción de datos, su seguridad y elimina repeticiones que podrían ocurrir al tener tantos datos, como ocurriría con un “Warehouse” (IBM, 2018).
39 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 4 . Análisis de datos En el apartado 2.1.2 hablamos sobre el Valor del Big data, como una de las Vs más importantes, no te sirve de nada tener 20.000 celdas de información sobre los mejores tejidos para invierno, cuando eres una empresa tecnológica. Ocurre algo similar con el Big data, de que nos sirven estas masivas cantidades de datos si no podemos usarlas en nuestra organización. Aquí entra el análisis de datos, esta faceta del Big data se centra en interpretar la información que hemos conseguido y transformarla de tal forma que podamos usarla en las organizaciones. Como el propio Big data, este campo es muy amplio y con los avances en IA, están potenciando las capacidades de estos análisis, a niveles nunca antes vistos (Marr, 2016). Como mencionamos al principio del trabajo, la toma de decisiones es la razón por la cual existe el Big Data, y nunca se llegaría hasta conocimiento práctico solamente observando estos datos, es necesario un proceso de análisis para conseguir el conocimiento que nos permita realmente mejorar la toma de decisiones. Antes de la digitalización, este proceso de análisis era extremadamente exhaustivo y normalmente requería de muchos recursos, para ser completado usando técnicas tradicionales, el mejor ejemplo lo tenemos con el nacimiento de IBM y el censo de los estados Unidos (Russom, 2011). Sin embargo, ahora tenemos nuevas técnicas de análisis que nos ayudan a reducir tanto el tiempo, cómo los recursos empleados. Es el conjunto de técnicas y estrategias centradas en optimizar el posicionamiento orgánico en buscadores de internet) cual es el mejor y te da su resultado. Otro ejemplo también quizás más claro, sería Shazam (aplicación utilizada para la identificación de música, basado en fragmentos de la misma)con su identificación de música (Marrs, 2016). Una encuesta realizada a 3.000 ejecutivos, muchos de ellos trabajando en las empresas más importantes de sus sectores, coincidían en como el uso de la información y el análisis les diferenciaba del resto de su sector. Estos a diferencia del resto, usaban analíticas en todos los niveles de su organización no solamente en las decisiones importantes, siendo esta la norma en muchas
40 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon empresas. Asimismo se descubrió que las empresas exitosas, usaban dos veces más análisis que el resto de empresas de su sector. En este estudio, se demostró que las empresas, cada vez cuentan con menos problemas para obtener datos, solamente dos de cada diez encuestados, tenía problemas en la recopilación en cambio cuatro de cada diez tenían problemas de cómo usar análisis con los datos. La mayoría expresaron su deseo de que las decisiones realizadas fueran dirigidas por os datos. Sin embargo para que estas decisiones relacionadas con los datos sean eficaces, deben de estar relacionadas con la estrategia de la empresa y coincidir con sus objetivos (LaValle, 2010). 4.1 Análisis web Es la rama de análisis de datos, con un enfoque en la información de páginas web, tanto su contenido como el tráfico y recorrido que pasa por ellas (Joyanes,2011). La analítica web, según la “digital analitics association” “It is the measurement, collection, analysis and reporting of Internet data in order to understand and optimize web usage” “Es la medición, recopilación, análisis y elaboración de informes de datos de Internet con el fin de comprender y optimizar el uso de la web.” (Digital analytics association, 2023) esta definición condensa los objetivos y la esencia de la analítica web en su conjunto, utiliza herramientas de análisis, para poder optimizar la experiencia web del usuario e ir mejorando el diseño y utilidades de la página. Una vez sabemos a qué se refiere, vamos a aclarar que existen dos analíticas web, la primera con un énfasis especial en la secuencia de clics o “clickstream”, esto el flujo de los clics realizados en la página, esto te da una gran parte de la información que necesitas sobre los usuarios, donde hacen más clics, que llama más la atención y los lugares más importantes de la página (Joyanes, 2013). Este enfoque tiene su base en el surgimiento de internet y los primeros portales de venta en Internet pese a esto, sobre el año 2010 y el avance da las páginas web, este análisis se vuelve más complejo y completo, cambiando hacia la analítica web 2.0 la cual cuenta con muchos más aspectos que su antecesor, como podemos ver en la imagen (Kaushik, 2011):
41 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Ilustración 12: La analítica web2.0 Elaboración propia. Referencia Kaushik, 2011 Este nuevo enfoque pese a que la secuencia de clics sigue siendo el aspecto central, toma más indicadores (Kaushik, 2011): Uso de la perspectiva, que sería realizar un juicio de valor de cómo le ha ido a nuestra página web. La inteligencia competitiva, cómo se comporta la competencia, que decisiones toma y como le ha ido económicamente. Los comentarios de los clientes, tiene en cuenta los comentarios de los clientes. Experimentación, permite ver los resultados de los cambios rápidamente, dado más flexibilidad al cambio en las páginas web. Análisis más exhaustivos y completos de los datos, dado que usamos muchas más métricas que antes, lo cual nos permite tener una visión más completa de la página (Kaushik, 2011).
48 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Ilustración 15 Proceso de creación del análisis de opinión Fuente elaboración propia. Referencia Mampel, 2023 1. Procesar el lenguaje natural: el programa recibe los datos que debe de analizar. 2. Elimina palabras innecesarias: el programa elimina aquellas palabras, como los conectores que solamente sirven para darle unidad a la frase. 3. Analiza la opinión recibida: El programa, “identifica, extrae y estudia los datos obtenidos” (Mampel, 2023, p 1). Usando los diversos tipos de clasificación, separa las palabras importantes y las agrupa según el tipo de clasificación que estemos usando. 4. Uso: una vez son clasificados, los datos servirán para realizar gráficas y otros procesos, para mejorar los procesos de la organización y finalmente serán archivados en la base de datos(Shulex, 2023). El proceso mediante el cual las IA consiguen extraer esta información, varía de modelo a modelo y de las necesidades de la empresa, para Microsoft, quizás un análisis basado en aspectos resulte lo más recomendable, pero Amazon prefiera uno emocional. A continuación explico a que se refieres esto (Mampel, 2023): Polarizado: el proceso más común, la base de muchos otros sistemas y el más usado por Amazon, divide las palabras o conjunto de palabras en, normalmente tres categorías, positivo, negativo y neutro ( así como sus diversos superlativos y diminutivos, como muy o poco).
49 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Asigna un puntaje emocional dentro a cada una de esas palabras, por ejemplo bueno podría tener un calificación de 2 en positivo mientras que maravilloso o muy bueno podría tener una de 4 y muy malo de -4, una vez se han calificados las palabras dependiendo de cuál es la suma general, la opinión se clasificara en una escala del 0 al 100, donde cada segmento será asignado una de las clasificaciones antes mencionadas, estas y la longitud del segmento dependerá de la empresa, por ejemplo, Amazon puede calificar muy positivo de 89 a 100 y Microsoft muy positivo de 95 a 100(Amazon AWS-O, 2023). Basado en aspectos: el modelo es similar al anterior, pero este busca opiniones sobre aspectos específicos del producto, por ejemplo “este bolígrafo es muy cómodo al escribir, pero se seca rápido”. Intención: divide las palabras en dos categorías en lugar de tres, interesados y no interesados en el producto. Emoción: se centra en identificar la emoción que el consumidor quería transmitir, en el momento de la realización del comentario, como pueden ser la alegría, tristeza o ira. Mixtos: Usamos más de una técnica, por ejemplo, usamos en el mismo análisis una mezcla entre polarizado y emoción, todo para obtener mejores conclusiones. Cuanto más sabes sobre el consumidor mejor puedes vender tu producto, esto es una máxima del comercio, debes de entender las necesidades y limitaciones de tus consumidores, para generar el ambiente de compra óptimo (Marr, 2016). Por esta razón es tan valioso este análisis, permite convertir todas esas opiniones y comentarios, en información para comprender a tus consumidores y cuáles son sus necesidades. Con todo este entendimiento no es la única ventaja que ofrece el análisis de opinión a las organizaciones, estas son algunas de las más comunes (Amazon AWS-O, 2023): Proporcionar información objetiva: cuando las personas leen un comentario, es más común que lo hagan de forma subjetiva, por ejemplo, si te encuentras de mal humor es más probable que
50 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon no seas imparcial en el análisis o un incluso encontrándote en tus plenas facultades, cuando un comentario empieza positivamente, es mucho más probable que la persona analizándolo lo clasifique como positivo, restándole importancia a la segunda parte lo era o no. Mejores productos y servicios: gracias a esta información objetiva, las organizaciones son capaces de centrarse en los problemas destacados por los clientes, mejor que con un analista humano. Análisis a escala: Resultaría físicamente imposible revisar la cantidad necesaria de comentarios con exactitud, para cubrir las necesidades de las empresas sin el uso de modelos de análisis de sentimientos. Resultados en tiempo real: con la aplicación de estos modelos, el tiempo necesario para el análisis se ve reducido, hasta la casi inmediatez. Si bien es cierto que cuenta con muchas ventajas, también cuenta con problemas y dificultades, en especial por parte de las IA, las cuales todavía necesitan intervención humana para ciertos aspectos (Shulex, 2023). Como pueden ser términos abstractos, palabras muy sentimentales o con muchas interpretaciones, sufren muchos problemas con sarcasmos, al no saber interpretarlos y tomarlos literalmente, igualmente sufren un problema similar con negaciones, por ejemplo “no esperaba que me gustase tanto”, sería percibido como algo negativo(Mampel, 2023) Finalmente me gustaría mencionar dos páginas web, las cuales me gustaría poner como ejemplo de utilización de este tipo de análisis, este primero usa análisis polarizado (Soper, 2023) y este otro, realiza uno más completo y complejo, tomando los datos de Twitter Csc2, 2023). Es importante que las empresas tengan en cuenta no solo los comentarios de sus páginas web, sino que los mensajes e interacciones de las redes sociales son muy importantes para ver cómo la gente percibe su marca, hacía que público o nicho deben de centrar sus esfuerzos y recibir “feedback” sobre sus acciones de marketing.
51 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 5 . El caso de Amazon y su integración del Big data Amazon es una empresa masiva en el sentido más literal de la palabra, el solo supuso la mitad del crecimiento online estadounidense en 2016 y un 21% del crecimiento del mercado minorista en este país. Su servicio de “Streaming” es el segundo del mundo por detrás de Netflix, con 200 millones de abonados y se encuentra disponible en la mayoría de países del mundo, todo esto sin contar la multitud de otros servicios que ofrece, como Kindle, Amazon Music, Twich y otros muchos. Por esto solo es lógico que maneje los datos en escalas gigantescas y que tenga que analizar estos datos en escalas gigantescas para poder mantener su posición global, frente a competidores, como Alibaba o diferentes páginas nacionales que han ido surgiendo con el avance del comercio digital (Galloway, 2018). 5.1 De donde obtiene los datos Ya hemos hablado de cómo Amazon utiliza una cantidad ingente de datos, en su modelo de negocio esto lo consigue recogiendo el máximo número de métricas y variables posibles de sus usuarios todo, con el objetivo de mejorar al máximo su servicio y proceso. Alguna de las métricas más importantes es: Interacciones con la tienda de Amazon, interacciones con otras páginas de Amazon (incluidas Kindle, Twich y paginas donde tengas que usar tu cuenta Amazon), los historiales de compra, secuencia de clics, carrito, lista de deseos, secciones visitadas, actividad en la página, fecha, hora, ubicación, corredores de datos y que han comprado personas similares a tu perfil. Estos serían los principales lugares de donde Amazon extrae su información de los usuarios (Ayudaley, 2020). Con todo estas métricas, se expanden aún más por ejemplo, la fecha y hora se utiliza para poder comparar con otros usuarios que hayan comprado en esa misma franja horaria y estacional, ofreciendo productos similares a estos. Asimismo, basándose en tu ubicación pueden intuir tu grupo demográfico general, e incluso tu nivel de ingresos aproximado.
52 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Finalmente usará datos de sus filiales, como Prime Video, Twich o Kindle para acotar aún más sus resultados, comparando tu tiempo y ocupación en estas plataformas con aquellos productos que has comprado y con los productos adquiridos por otras personas con gustos similares. Por ejemplo, si ocupas tu tiempo en estas plataformas, viendo películas o libros en inglés, la próxima vez que entres a Amazon te saldrán recomendados más producto en ingles que antes de realizar estas acciones. Amazon llama a esto, visión 360º dado que le permite tener una visión completa sobre sus usuarios(Marr, 2016). Destacar que este concepto se retroalimenta entre páginas, si recientemente has comprado la saga de libros del señor de los anillos, en KINDLE, tus próximas recomendaciones de la página principal de Amazon y de Prime Video tendrán que ver con este último. 5.1.1 Para que usa los datos Ya hemos introducido las métricas y el objetivo de Amazon como entidad, el cual es la personalización, ahora hablaré de sus usos prácticos, primeramente tenemos la filtración colaborativa, esta trata de identificar qué productos o servicios va a comprar basándose en las métricas y comparaciones antes mencionados, con especial énfasis en que han comprado personas similares a ti o en un franja y lugar similar al tuyo han comprado (Marr, 2016). Este sistema ha sido tan exitoso, que Amazon a decidió implementarlo directamente en su página, con “Mi Amazon” una página especializada en mostrarle a la persona recomendaciones de productos, llevando la personalización de la compra online al siguiente nivel, dado que es más probable que realices compras compulsivas (Ayudaley, 2020). Seguidamente tenemos el “recommendation engine” la cual actualmente utiliza elementos de “machine learning” y otros sistemas algorítmicos complejos, que le permiten mejorar, junto con la información obtenida del consumidor, esta básicamente te muestra las recomendaciones que cree que más te van a interesar, en la barra de recomendación, usando el máximo número de métricas. Permite un mejor uso de sus recursos, al darle la capacidad de optimizar la cadena de distribución y la logística general, dado que al poder predecir aunque sea de manera limitada lo que los consumidores van a demandar, supone ahorros en transporte y almacenaje.
53 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon Permite prevenir y detectar fraudes e irregularidades que puedan surgir, por ejemplo vemos una gran cantidad de pedidos realizados por un sola persona a un proveedor nuevo y sin otras ventas, esto puede ser un caso de lavado de dinero o algo similar. Permite optimizar los precios, como ya mencionamos, Amazon no coge en exclusiva datos de su página web, sino que complementa esta con corredores de datos, esto le permite tener una visión clara de la competencia y saber qué precios le permiten seguir siendo competitivo. Básicamente recoge datos de la competencia para ajustar sus precios a está (Ampofo, 2023). 5.1.2 El enfoque de Amazon Amazon ha conseguido tanto éxito empresarial, no solo por su modelo de negocio, el cual no deja de ser envidiable, sino que ha sabido capturar el instinto del consumidor, cuando usted compra en Amazon sin importar el producto o el precio, Amazon va a tratar de que tengas a mejor y más cómoda experiencia posible. Comprar no es siempre agradable, en especial cuando tienes que adquirir productos caros o delicados, con todo Amazon trata en todo momento de hacer esto fácil e intuitivo, dándote toda la información y opciones en una misma página, ya antes de meterlo en el carrito, y una vez se encuentra vas a realizar el pago, si está correctamente configurado bastará con dar un clic (Galloway, 2018). Esta es una forma de mejorar la experiencia web, la sencillez, sin embargo, existe otra más complicada pero mucho más eficaz por su dificultad, la personalización, está última solo es posible usando datos masivos en los sitios web. Las métricas de las que hablamos anteriormente tienen este uso, personalizar la experiencia del consumidor, conseguir gracias a los datos, la mejor experiencia de compra posible. Cuando un usuario entra en Amazon, la página se encuentra configurada casi exclusivamente para él, preferencias, gustos o situación estacional, similar a la huella dactilar no existen dos páginas de usuarios de Amazon exactamente iguales. Un ejemplo de esta personalización de la compra, la tenemos con un programa de IA en Alexa, el cual te elige la ropa que deberías de ponerte para cada ocasión, te tienes que sacar una foto con cada pieza de ropa que tengas, entonces Amazon se creará un modelo virtual tuyo y basado en la información,
54 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon que tenga recopilada sobre ti esta te recomendará que estilo de verías de llevar, así como sugerencias en las futuras compras (PuroMarketing, 2017). Finalmente el uso de los datos masivos se encuentra profundamente insertado en el modelo de negocio de Amazon, confía en este para gran parte de su proceso empresarial, y sin estas técnicas, no sería tan grande como lo es hoy.
55 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 6 . Conclusiones Los datos masivos son una parte ya de nuestra vida diaria y de los procesos de las organizaciones, si bien es cierto que cada sector y organización pueden tener su visón personal de los datos masivos, o de como estos deben de ser gestionados, entre ellos siguen compartiendo muchos de los usos y razones de sus utilización. Considero que este auge que han tenido en los últimos años, es el resultado de un cambio en la sociedad y en como esta funciona, antes eran las organizaciones las encargadas de informar y de crear información, la inmensa mayoría de ejemplo que tenemos de los primeros usos de Big data, como las bibliotecas, logística militar o las tarjetas de censo, eran creadas por y para los gobiernos y empresas, sin embargo con la llegada de internet esta corriente cambio totalmente y se dio paso a una nueva concepción de la información y de los datos. Las organizaciones empezaron a utilizar estas técnicas, dado que vieron que podían aprovechar un nuevo nicho casi inexplotado de valor, muchas de las grandes empresas digitales del momento usaron técnicas de Big data desde los inicios, tanto Google como Amazon capturaban los datos de sus usuarios y los de todo el internet, para poder generar valor a partir de estos datos (Marr, 2016). Los datos masivos supusieron y suponen una revolución gigantesca para todos los niveles de la sociedad, para las grandes organizaciones, como los gobiernos o Amazon les ha dado la oportunidad de Considero que el objetivo y conclusión del Big data en sus inicios, era ayudar a la toma de decisiones, en especial aquellas organizaciones grandes y con muchas transacciones, sin embargo, actualmente su uso se ha extendido a la mayoría de áreas de las empresas, especialmente en marketing y el uso de la publicidad, pero otras en áreas siguen dando ventajas frente a aquellas organizaciones que no la utilizan. El uso de los datos masivos debería de ser considerado obligatorio por las empresas, cada vez se obtiene más información de las transacciones y el correcto aprovechamiento de estos pueden suponer la diferencia entre una empresa líder del sector, y una bancarrota.
56 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon El uso de los datos masivos por parte de Amazon es uno de los mejores ejemplos, de cómo se deben de gestionar los flujos de información, desde sus inicios en 1994 han estado utilizando la información aportada por sus clientes, para mejorar todos los aspectos posibles de su proceso y método empresarial. Si Amazon hubiera simplemente tratado de vender la mayor cantidad de producto, sin centrarse en el porqué, como y quien está comprando, jamás sería el gigante que es hoy. Fue gracias a que usaron los datos masivos en todos los apartados de su empresa, desde lo más pequeño hasta la toma de decisiones de la junta directiva, que han conseguido adaptarse y crecer con el tiempo, sin importar en qué circunstancias se encontrasen. Finalmente, me tengo que destacar la capacidad de cambio del Big data, cada año surgen nuevas técnicas, tecnologías y herramientas que ayudan a las empresas a gestionar este flujo, con la llegada de las IA y de modelos de aprendizaje, estamos entrando en una nueva forma de gestionar y analizar los datos, que podría revolucionar la forma de ver la información, no diferente de la aparición de los números árabes.
57 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon 7 . Bibliografía Aguilar, L. J. (2013). Big Data, Análisis de grandes volúmenes de datos en organizaciones. Alfaomega Grupo Editor. Amazon AWS-O (2023). ¿Qué es el análisis de opiniones? Amazon.com. Recuperado el 13 de junio de 2023, de https://aws.amazon.com/es/whatis/sentiment-analysis/ Amazon AWS-P (2023). ¿Qué es el análisis predictivo? Amazon.com. Recuperado el 18 de junio de 2023, de https://aws.amazon.com/es/whatis/predictive-analytics/ Ampofo., M. (2023). How Amazon uses data science and analytics to drive E-commerce success. Linkedin.com. Recuperado de https://www.linkedin.com/pulse/how-amazon-uses-data-science-analytics-drive- success-michael-ampofo/ Anthes, G. (2014). Data brokers are watching you. Communications of The ACM, 58, 28-30. https://doi.org/10.1145/2686740 Ayudaley. (2020). Amazon y el Big Data. Una historia de éxito. AyudaLeyProteccionDatos. Recuperado el 18 de junio de 2023 https://ayudaleyprotecciondatos.es/big-data/amazon/ Bastidas, J. C. (2021). Datos Estructurados, Semiestructurados y No Estructurados. Linkedin.com. Recuperado el 20 de mayo, de 2023 https://acortar.link/BzRg1a BBC News Mundo. (2022). Japón declara la guerra a los disquetes y otros dispositivos obsoletos. BBC. Recuperado el 29 de mayo, de 2023 https://www.bbc.com/mundo/noticias-62758191 Beasley, K. (2022). Unlocking the power of predictive analytics with AI. Forbes. Recuperado de https://www.forbes.com/sites/forbestechcouncil/2021/08/11/unlocking-the- power-of-predictive-analytics-with-ai/ Big Data Framework. A short history of Big Data. (2021). Enterprise Big Data Framework. Recuperado de khttps://www.bigdataframework.org/knowledge/a-short-history-of-big-data/
64 García Vázquez, Miguel Big data. Explicación, principales herramientas y su aplicación en Amazon https://s3.amazonaws.com/media.mediapost.com/uploads/EconomicCostOfFak eNews.pdf Vive. (2020). Las tres V del Big Data: todo un reto por su volumen, variedad y velocidad. UNIR. https://www.unir.net/ingenieria/revista/3-v-big-data/ Waisberg, D., & Kaushik, A. (2009). Web Analytics 2.0: Empowering Customer Centricity. Psu.edu. Recuperado el 11 de junio de 2023, de https://citeseerx.ist.psu.edu/document?repid=rep1&type=pdf&doi=f804b8c0f66b 28220d64060e27892dbe0a7a3baa Walter. (2018). Amazon and big data. Digital Innovation and Transformation. Recuperado de https://d3.harvard.edu/platformdigit/submission/amazon-and-big-data/