scieee AI-readable full text Open interactive document viewer

Espectroscopía Raman y análisis multivariante de datos para la detección de fitosanitarios en aceituna entera

Pérez Muñoz, Gorka

Abstract

Gaur egun, analisi kimikoak erabiliz substantzien edukia edo materialen osaera aztertzeko metodoak existitzen dira jada. Baina, horretarako, laborategi espezializatuak eta egun batzuetako denbora behar da emaitzak lortzeko. Hala ere, gaur egun beste ikuspegi bat sortzen ari da, laginak azkarrago aztertzeko teknologia berria erabiltzea ahalbidetzen duena. Elikagaien industrian, adibidez, teknologia horrek kostuak merkatzeko aukera emango luke; izan ere, horren bidez, arriskutsua izan daitekeen lote oso bat osatzen duten lagin guztiak azter litezke. Horrela, arriskutsutzat jotzen diren laginak bakarrik baztertuko dira, eta ez da beharrezkoa izango lote osoa baztertzea. Teknologia horren bidez, espezialista kimikoetara jotzeko beharra saihestuko litzateke, eta emaitzak azkar lortzeko gai izango lirateke, laborategi gisako azpiegitura baten beharrik gabe. Teknologia horren bilaketan, dilema horiek konpon ditzaketen hainbat aukera agertu dira, zein industriatara bideratuta dagoenaren arabera. Dokumentu honen bidez, Raman teknologia laginen datuak lortzeko tresna gisa erabiltzearen inguruan lortutako garapena eta ondorioak erakutsi nahi dira. Kasu honetan, laginak landare-osasunerako produktuekin tratatutako olibak. Datuak sailkatzeko eta datu berriak zuzen aurreikusi eta sailkatzeko gai diren ereduak sortzeko, aldagai anitzeko datuen analisia erabili da, SIMCA softwarearen bidez. Dokumentuaren amaieran, teknologia hori proiektu honen inguruan erabiltzeari buruzko aurretiko ondorioak daude. Ondorio horiek atarikotzat hartzen dira, proiektuaren azterketak martxan jarraitzen baitu.

Full text

Curso: 2023-2024 Director: Ayesta Ereño, Igor Estudiante: Pérez Muñoz, Gorka Espectroscopia Raman y Análisis Multivariante de Datos para la detección de fitosanitarios en aceituna entera MÁSTER UNIVERSITARIO EN INGENIERÍA DE TELECOMUNICACIONES TRABAJO FIN DE MASTER Fecha: Bilbao, 27 de febrero de 2024 RESUMEN Hoy en día, existen métodos para analizar el contenido de substancias o la composición de materiales usando análisis químicos, los cuales requieren de un laboratorio especializado y un tiempo de varios días para obtener resultados. Sin embargo, actualmente está surgiendo un nuevo enfoque que permite el uso de nueva tecnología para el análisis de muestras de forma más rápida. En la industria alimentaria, por ejemplo, esta tecnología permitiría abaratar costes, ya que con ella sería posible hacer un análisis a cada una de las muestras que forman un lote potencialmente peligroso. De esta forma, solo las muestras detectadas como peligrosas serían descartadas, sin la necesidad de tener que prescindir de todo el lote. Mediante esta tecnología, se evitaría la necesidad de recurrir a especialistas químicos, siendo capaces de obtener resultados rápidamente sin la necesidad de una infraestructura como un laboratorio. En la búsqueda de esa tecnología han aparecido varias opciones que pueden resolver esos dilemas dependiendo de la industria a la que esté enfocada. Este documento, está enfocado en mostrar el desarrollo y conclusiones obtenidas en torno al uso de la tecnología Raman como herramienta para la obtención de datos de las muestras, en este caso olivas tratadas con fitosanitario. Para la clasificación de los datos y generación de modelos capaces de predecir y clasificar nuevos datos correctamente, se ha hecho uso de análisis de datos multivariante, mediante el software SIMCA. Al final del documento se hallan las conclusiones preliminares respecto al uso de esta tecnología en torno a este proyecto. Estas conclusiones se consideran preliminares ya que el estudio del proyecto sigue en marcha. LABURPENA Gaur egun, analisi kimikoak erabiliz substantzien edukia edo materialen osaera aztertzeko metodoak existitzen dira jada. Baina, horretarako, laborategi espezializatuak eta egun batzuetako denbora behar da emaitzak lortzeko. Hala ere, gaur egun beste ikuspegi bat sortzen ari da, laginak azkarrago aztertzeko teknologia berria erabiltzea ahalbidetzen duena. Elikagaien industrian, adibidez, teknologia horrek kostuak merkatzeko aukera emango luke; izan ere, horren bidez, arriskutsua izan daitekeen lote oso bat osatzen duten lagin guztiak azter litezke. Horrela, arriskutsutzat jotzen diren laginak bakarrik baztertuko dira, eta ez da beharrezkoa izango lote osoa baztertzea. Teknologia horren bidez, espezialista kimikoetara jotzeko beharra saihestuko litzateke, eta emaitzak azkar lortzeko gai izango lirateke, laborategi gisako azpiegitura baten beharrik gabe. Teknologia horren bilaketan, dilema horiek konpon ditzaketen hainbat aukera agertu dira, zein industriatara bideratuta dagoenaren arabera. Dokumentu honen bidez, Raman teknologia laginen datuak lortzeko tresna gisa erabiltzearen inguruan lortutako garapena eta ondorioak erakutsi nahi dira. Kasu honetan, laginak landare-osasunerako produktuekin tratatutako olibak. Datuak sailkatzeko eta datu berriak zuzen aurreikusi eta sailkatzeko gai diren ereduak sortzeko, aldagai anitzeko datuen analisia erabili da, SIMCA softwarearen bidez. Dokumentuaren amaieran, teknologia hori proiektu honen inguruan erabiltzeari buruzko aurretiko ondorioak daude. Ondorio horiek atarikotzat hartzen dira, proiektuaren azterketak martxan jarraitzen baitu. ABSTRACT Nowadays, there are methods for analyzing the content of substances or the composition of materials using chemical analysis, which require a specialized laboratory and a time of several days to obtain results. However, a new approach is now emerging that allows the use of new technology to analyze samples more quickly. In the food industry, for example, this technology would allow lower costs, since it would be possible to analyze each of the samples that make up a potentially hazardous batch. In this way, only the samples detected as hazardous would be discarded, without the need to dispense with the entire batch. Through this technology, the need to resort to chemical specialists would be avoided, being able to obtain results quickly without the need for an infrastructure such as a laboratory. In the search for such technology, several options have appeared that can solve these dilemmas depending on the industry that is focused on. This document is focused on showing the development and conclusions obtained from the use of Raman technology as a tool for obtaining data from samples, in this case olives treated with phytosanitary products. For the classification of the data and generation of models capable of predicting and classifying new data correctly, multivariate data analysis has been used, using SIMCA software. Preliminary conclusions regarding the use of this technology in this project can be found at the end of the document. These conclusions are considered preliminary as the study of the project is still in progress. Índice 1. Introducción .......................................................................................................................................... 1 2. Contexto ................................................................................................................................................ 1 2.1. Sector alimentario ......................................................................................................................... 1 2.1.1. Fraude alimentario .................................................................................................................... 2 2.1.2. Industria del aceite de oliva ....................................................................................................... 2 2.1.3. Productos fitosanitarios............................................................................................................. 3 2.2. Métodos de detección ................................................................................................................... 4 2.2.1. Cromatografía ............................................................................................................................ 5 2.2.2. Espectroscopía de masas ........................................................................................................... 5 2.2.3. Espectroscopía Raman ............................................................................................................... 6 2.3. Funcionamiento ............................................................................................................................. 8 2.4. Equipamiento .............................................................................................................................. 10 2.5. Análisis Multivariante (MVA) ....................................................................................................... 11 2.5.1. Variables de proceso ............................................................................................................... 11 2.5.2. PCA - Principal Component Analysis ........................................................................................ 11 2.5.3. Funcionamiento ....................................................................................................................... 12 2.5.4. PLS - Partial Least Squares regression ..................................................................................... 13 2.5.5. PLS-DA/OPLS-DA ...................................................................................................................... 14 3. Objetivos y alcance del trabajo ........................................................................................................... 15 4. Beneficios ............................................................................................................................................ 15 4.1. Beneficio tecnológico .................................................................................................................. 16 4.2. Beneficios en la salud .................................................................................................................. 16 5. Análisis de alternativas ........................................................................................................................ 16 5.1. Software ...................................................................................................................................... 16 5.2. Paquetes de Software de Análisis Multivariante ......................................................................... 17 5.2.1. Unscrambler ............................................................................................................................ 17 5.2.2. SIMCA ...................................................................................................................................... 18 5.2.3. PLS-Toolbox ............................................................................................................................. 19 5.2.4. MATLAB ................................................................................................................................... 20 6. Descripción de la solución propuesta .................................................................................................. 21 6.1. Equipamiento empleado ............................................................................................................. 21 6.2. Obtención de los datos ................................................................................................................ 22 6.3. Adaptación de los datos .............................................................................................................. 27 6.4. Preprocesado de los datos .......................................................................................................... 28 6.5. Generación del modelo ............................................................................................................... 30 6.6. Resultados obtenidos .................................................................................................................. 33 6.6.1. Deltametrina ............................................................................................................................ 34 6.6.2. Diflufenican .............................................................................................................................. 36 6.6.3. Lambda Cihalometrina ............................................................................................................ 41 6.6.4. Oxifluorfen ............................................................................................................................... 43 6.6.5. Tebuconazol ............................................................................................................................. 45 6.7. Resumen de resultados ............................................................................................................... 47 7. Metodología seguida en el desarrollo del trabajo .............................................................................. 49 7.1. Equipo de trabajo ........................................................................................................................ 49 7.2. Paquetes de trabajo .................................................................................................................... 49 7.2.1. PT1 Supervisión y administración del proyecto ...................................................................... 50 7.2.2. PT2 Documentación en Espectroscopía Raman ...................................................................... 50 7.2.3. Analizar muestras recibidas con el Espectrómetro ................................................................. 51 7.2.4. Instalar e investigar el software a utilizar ................................................................................ 51 7.2.5. Estudiar el funcionamiento del Análisis Multivariante de Datos ............................................ 52 7.2.6. Preprocesado de los datos ...................................................................................................... 52 7.2.7. Realización de modelos de prueba .......................................................................................... 53 7.2.8. Realización de modelos determinantes .................................................................................. 53 7.2.9. Comprobación de efectividad de los modelos ........................................................................ 54 7.2.10. Obtención de resultados óptimos ........................................................................................... 55 7.2.11. Documentación y entrega del proyecto .................................................................................. 55 7.3. Diagrama de Gantt/Cronograma ................................................................................................. 55 8. Aspectos económicos .......................................................................................................................... 58 8.1. Horas internas ............................................................................................................................. 58 8.2. Amortizaciones ............................................................................................................................ 58 8.3. Gastos .......................................................................................................................................... 58 8.4. Presupuesto total ........................................................................................................................ 59 BIBLIOGRAFÍA ........................................................................................................................................ 60 Lista de Tablas Tabla 1: lotes y su concentración. ................................................................................................................... 23 Tabla 2: tabla resumen de resultados. ............................................................................................................ 48 Tabla 3: equipo de trabajo. ............................................................................................................................. 49 Tabla 4: PT1 Supervisión y administración del proyecto. ............................................................................... 50 Tabla 5: PT2 Documentación en Espectroscopía Raman. .............................................................................. 50 Tabla 6: PT3 Analizar muestras recibidas con el Espectrómetro. ................................................................... 51 Tabla 7: PT4 Instalar e investigar el software a utilizar. .................................................................................. 51 Tabla 8: PT5 Estudiar el funcionamiento del Análisis Multivariante de Datos. .............................................. 52 Tabla 9: PT6 Preprocesado de los datos. ........................................................................................................ 52 Tabla 10: PT7 Realización de modelos de prueba. .......................................................................................... 53 Tabla 11: PT8 Realización de modelos determinantes. .................................................................................. 53 Tabla 12: PT9 Comprobación de efectividad de los modelos. ........................................................................ 54 Tabla 13: PT10 Obtención de resultados óptimos. ......................................................................................... 55 Tabla 14: PT11 Documentación y entrega del proyecto. ................................................................................ 55 Tabla 15: costes de las horas internas. ........................................................................................................... 58 Tabla 16: amortizaciones. ............................................................................................................................... 58 Tabla 17: gastos ............................................................................................................................................... 58 Tabla 18: presupuesto total. ........................................................................................................................... 59 Lista de Ilustraciones Ilustración 1: Imagen ilustrativa de como interacciona un haz de luz con una molécula. Las líneas amarillas, azules y rojas representan la línea Rayleigh, anti-Stokes y de Stokes, respectivamente ................................. 7 Ilustración 2: imagen de un espectro Raman tomada del software usado para la captura de datos con el microscopio Raman. .......................................................................................................................................... 8 Ilustración 3: ejemplo gráfico de la formación del primer componente principal (PC1). .............................. 12 Ilustración 4: proyección del plano formado por el conjunto de PC1 y PC2 .................................................. 13 Ilustración 5: fotografía del microscopio Raman Renishaw InVia. ................................................................. 21 Ilustración 6: Revólver del microscopio. ......................................................................................................... 22 Ilustración 7: Lote de olivas Diflufenican 4. .................................................................................................... 23 Ilustración 8: Lote de olivas Diflufenican 5. .................................................................................................... 24 Ilustración 9: ejemplo de oliva podrida. ......................................................................................................... 24 Ilustración 10: imagen de una muestra bajo el objetivo. ............................................................................... 25 Ilustración 11: imagen del microscopio enfocando una “piedra” en la superficie de la muestra. ................. 26 Ilustración 12: imagen del espectro obtenido como resultado de enfocar una “piedra”. ............................. 26 Ilustración 13: imagen del microscopio enfocando la superficie de la muestra aleatoriamente. .................. 27 Ilustración 14: imagen del espectro obtenido como resultado de enfocar la superficie de la muestra. ....... 27 Ilustración 15: espectro suavizado de la muestra Tebuconazol 5. ................................................................ 28 Ilustración 16: muestra parcial de la hoja de datos. ...................................................................................... 29 Ilustración 17: Espectros obtenidos de la totalidad de las muestras. ........................................................... 29 Ilustración 18: Espectros obtenidos de la totalidad de las muestras con zonas a excluir. ............................. 30 Ilustración 19: score plot del modelo PCA-X de todas las clases salvo Sin Tratar. ......................................... 31 Ilustración 20: score plot del modelo OPLS sin la clase Sin Tratar. ................................................................ 32 Ilustración 21: score plot del modelo OPLS-DA sin la clase Sin Tratar. .......................................................... 32 Ilustración 22: tabla de los modelos generados y sus características. .......................................................... 34 Ilustración 23: score plot del modelo OPLS-DA Delta vs Sin Tratar. .............................................................. 34 Ilustración 24: summary of fit del modelo OPLS-DA Delta vs Sin Tratar........................................................ 35 Ilustración 25: coefficients del modelo OPLS-DA Delta vs Sin Tratar .............................................................. 35 Ilustración 26: misclassification table de la validación modelo OPLS-DA Delta vs Sin Tratar........................ 36 Ilustración 27: lista de clasificación del modelo OPLS-DA Delta vs Sin Tratar. .............................................. 36 Ilustración 28: espectro de la muestra de Diflufenican excluida. .................................................................. 37 Ilustración 29: score plot del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. ................................ 37 Ilustración 30: summary of fit del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. ........................ 38 Ilustración 31: coefficients del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. .............................. 38 Ilustración 32: misclassification table del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. ............ 38 Ilustración 33: lista de clasificación del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. ............... 39 Ilustración 34: score plot del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. ............................... 39 Ilustración 35: summary of fit del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. ....................... 39 Ilustración 36: coefficients del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. ............................ 40 Ilustración 37: misclassification table del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. ........... 40 Ilustración 38: lista de clasificación del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. ............... 40 Ilustración 39: score plot predictivo del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. .............. 41 Ilustración 40: score plot del modelo OPLS-DA Laci vs Sin Tratar. ................................................................. 41 Ilustración 41: summary of fit del modelo OPLS-DA Laci vs Sin Tratar. ......................................................... 42 Ilustración 42: coefficients del modelo OPLS-DA Laci vs Sin Tratar. .............................................................. 42 Ilustración 43: misclassification table del modelo OPLS-DA LAci vs Sin Tratar. ............................................. 42 Ilustración 44: lista de clasificación del modelo OPLS-DA Laci vs Sin Tratar. ................................................. 43 Ilustración 45: score plot del modelo OPLS-DA Oxi vs Sin Tratar. .................................................................. 43 Ilustración 46: summary of fit del modelo OPLS-DA Oxi vs Sin Tratar. .......................................................... 44 Ilustración 47: coefficients del modelo OPLS-DA Oxi vs Sin Tratar. ............................................................... 44 Ilustración 48: misclassification table del modelo OPLS-DA Oxi vs Sin Tratar. .............................................. 44 Ilustración 49: lista de clasificación del modelo OPLS-DA Oxi vs Sin Tratar. ................................................. 45 Ilustración 50: score plot del modelo OPLS-DA Tebu vs Sin Tratar. ............................................................... 45 Ilustración 51: summary of fit del modelo OPLS-DA Tebu vs Sin Tratar. ....................................................... 46 Ilustración 52: coefficients del modelo OPLS-DA Tebu vs Sin Tratar. ............................................................ 46 Ilustración 53: misclassification table del modelo OPLS-DA Tebu vs Sin Tratar. ........................................... 46 Ilustración 54: lista de clasificación del modelo OPLS-DA Tebu vs Sin Tratar. ............................................... 47 Ilustración 55: espacio ROC y las parcelas de predicción de los 6 modelos desarrollados ........................... 48 Ilustración 56: Diagrama de Gantt (parte 1). .................................................................................................. 56 Ilustración 57: Diagrama de Gantt (parte 2). .................................................................................................. 57 6 finalmente se detectan por medio de un dispositivo adecuado. Un espectro de masas será, en consecuencia, una información bidimensional que representa un parámetro relacionado con la abundancia de los diferentes tipos de iones en función de la relación masa/carga de cada uno de ellos. Como ya se ha mencionado, los procesos que tienen lugar en un espectrómetro de masas son de naturaleza química, por lo que la presencia y abundancia en el espectro de determinados tipos de iones, identificables a partir de su masa, será función de la estructura química de cada compuesto. La información ofrecida por un espectro de masas es, de alguna forma, comparable a la obtenida mediante una gran cantidad de reacciones de las utilizadas para la determinación de estructuras por vía química, por lo que la espectrometría de masas puede ofrecer una enorme cantidad de información sobre un compuesto determinado. A pesar de ello, esta técnica presenta diversas desventajas. Tienen diferentes tipos de interferencias, lo que puede llegar a afectar la precisión y la exactitud de los resultados. En cuanto a las muestras, solo pueden analizar elementos de uno en uno y no se pueden analizar todos los elementos del Sistema Periódico. Además, por ser una técnica de absorción, sus curvas de calibrado sólo son lineales en un corto rango de concentración. 2.2.3. Espectroscopía Raman La espectroscopia Raman constituye una técnica fotónica de alta resolución no destructiva que proporciona información detallada acerca de la estructura química, fase y polimorfia, cristalinidad, así como las interacciones moleculares de un material. Esta técnica se fundamenta en la interacción entre la luz y los enlaces químicos presentes en el material. La técnica Raman se basa en la dispersión de la luz, en la cual se usa una fuente láser de alta intensidad para incidir en una molécula. Esta molécula dispersa la luz incidente. Sin embargo, existen diferentes formas en las que un material dispersa la luz. Si un haz de luz de un solo color incide y pasa a través de una sustancia, una fracción de la luz cambia de dirección respecto de la que provenía (técnicamente se dice que es dispersada) debido a la interacción con las moléculas de la sustancia. La nube de electrones que envuelve al núcleo en una molécula puede ser polarizada (y de esta forma deformada) de muy diversas maneras por un campo eléctrico. Si a una molécula se le aplica un campo eléctrico oscilante como el campo eléctrico de un haz de luz, la deformación de la nube de electrones oscilará con la frecuencia del haz de luz incidente. La oscilación de la nube produce lo que se llama como un dipolo oscilante que radia a la misma frecuencia de la luz incidente. Este proceso es llamado dispersión Rayleigh [9]. En realidad, en las moléculas no solo se realizan transiciones electrónicas (“saltos” de los electrones entre diferentes órbitas), sino que las moléculas vibran y rotan también. En esos movimientos también se realizan transiciones energéticas. Hay una pequeña probabilidad de que la radiación incidente sobre una sustancia transfiera parte de su energía a uno de los niveles energéticos de vibración o rotación de las moléculas que la conforman. Como resultado de ello la radiación dispersada tendrá una frecuencia menor comparada con la frecuencia con la que vibran las moléculas. De manera similar, hay 7 una pequeña probabilidad de que la molécula en algún estado energético excitado vibracional o rotacional aumente su energía luminosa, en este caso la radiación dispersada tendrá una frecuencia más alta que la del haz incidente. En ambos casos, la luz se dispersa en diversas longitudes de onda dependiendo de la estructura de la molécula o el analito. Cuando esto ocurre, se dice que ha ocurrido un intercambio de energía y a este fenómeno se le conoce como dispersión Raman. De esta manera, con la ayuda de la ilustración 1, observamos tres líneas de la radiación dispersada: una línea correspondiente a la dispersión Rayleigh de la misma longitud de onda (amarilla) y dos líneas Raman, una de frecuencia mayor (azul) llamada línea anti-Stokes y la otra de frecuencia menor (roja) llamada línea de Stokes. Las dos líneas Raman son extremadamente débiles comparadas con la intensidad Rayleigh de la luz dispersada. Solamente 1 10000 ⁄ de la intensidad dispersada corresponde a las líneas Raman. Es por esto que la intensidad Raman es mucho menor que la intensidad incidente de la luz y, por lo tanto, más difícil de detectar [10]. Ilustración 1: Imagen ilustrativa de como interacciona un haz de luz con una molécula. Las líneas amarillas, azules y rojas representan la línea Rayleigh, anti-Stokes y de Stokes, respectivamente. Un espectro Raman exhibe múltiples picos que indican la intensidad y posición de la longitud de onda de la luz dispersada. Cada pico corresponde a una vibración específica de enlace molecular, incluyendo enlaces individuales. Véase el ejemplo de la ilustración 2: 8 Ilustración 2: imagen de un espectro Raman tomada del software usado para la captura de datos con el microscopio Raman. Como se puede observar, el eje de abscisas representa la unidad inversa a la longitud de onda (número de onda) de la dispersión Raman recibida, en unidades de 𝑐𝑚−1. El eje de ordenadas representa la intensidad de la radiación recibida. Hay que tener en cuenta que en el gráfico aparece un offset debido a la fluorescencia del material irradiado que más adelante hay que eliminar mediante un algoritmo en el preprocesado de los datos. Si la fluorescencia es demasiado alta, puede provocar que la información de la dispersión Raman sea completamente camuflada debido a su baja intensidad. Incluso puede llegar a saturarlo, lo que provoca que los datos sean ilegibles. Este tema se abordará y se explicará con más detalle en próximos apartados. 2.3. Funcionamiento El comportamiento de la dispersión Raman se puede interpretar de forma diferente a nivel macroscópico y microscópico [11]. A nivel macroscópico, se entiende como la energía emitida por un dipolo oscilante producido por un campo electromagnético. Toda luz monocromática que se desplace en un eje z tendrá un campo eléctrico que oscila en el eje x. El valor de ese campo eléctrico (𝐸𝑥) en cualquier instante de tiempo (t) se puede expresar de la siguiente manera: 𝐸𝑥 = 𝐸𝑥 0cos(2𝜋𝑣0𝑡), 2.1) 9 Donde 𝐸𝑥 0 es la amplitud máxima del campo eléctrico y 𝑣0 es la frecuencia de la luz monocromática. El campo eléctrico de esta luz, es el causante de la polarización de la nube de electrones antes mencionada. Como se ha explicado en el anterior apartado, el desplazamiento de esos electrones oscilando junto con el campo eléctrico creará un dipolo eléctrico oscilante que emitirá luz dispersa a su vez. Por lo tanto, si la luz dispersada depende del dipolo oscilante eléctrico, las variaciones en la polarización del dipolo afectarán la frecuencia de la luz emitida. La polaridad del dipolo la determina el momento de su dipolo (μ). 𝜇 = 𝛼𝐸𝑥= 𝛼𝐸𝑥 0cos (2𝜋𝑣0𝑡), 2.2) Donde α es la polaridad tensora y describe el comportamiento de la nube de electrones pertenecientes a un campo eléctrico externo. Así mismo, cuando una molécula oscila en su frecuencia natural (𝑣𝑚), el desplazamiento ( q ) del núcleo de la molécula se describe de la siguiente forma: 𝑞 = 𝑞0cos(2𝜋𝑣𝑚𝑡), 2.3) Donde 𝑞0 es la amplitud de la vibración. Para amplitudes de vibración pequeñas, el valor de α se puede expresar en función de q mediante la serie de Taylor: 𝛼 = 𝛼0 + (𝜕𝛼 𝜕𝑞)0𝑞+⋯. 2.4) Si combinamos la fórmula 2.2 y 2.4, podemos explicar el momento del dipolo de la siguiente manera: 𝜇 = 𝛼0𝐸𝑥 0cos(2𝜋𝑣0𝑡)+ (𝜕𝛼 𝜕𝑞)0𝑞𝐸𝑥 0cos(2𝜋𝑣0𝑡) . Agregando la 2.3 obtenemos la siguiente expresión: = 𝛼0𝐸𝑥 0cos(2𝜋𝑣0𝑡)+ (𝜕𝛼 𝜕𝑞)0𝑞0cos(2𝜋𝑣𝑚𝑡)𝐸𝑥 0cos(2𝜋𝑣0𝑡) 2.5) = 𝛼0𝐸𝑥 0cos(2𝜋𝑣0𝑡)+ 1 2(𝜕𝛼 𝜕𝑞)0𝑞0𝐸𝑥 0{cos[2𝜋(𝑣0+𝑣𝑚)𝑡] + cos [2𝜋(𝑣0−𝑣𝑚)𝑡]} . De esta última expresión, se deduce que el primer elemento hace referencia al dipolo que oscila a la misma frecuencia que el campo electromagnético involucrado en esta interacción. Este irradia en la frecuencia 𝑣0 por lo que le corresponde a la dispersión Rayleigh. Por otra parte, el segundo y tercer elemento irradian en las frecuencias (𝑣0+𝑣𝑚) y (𝑣0−𝑣𝑚). Como estas son diferentes frecuencias a las del haz incidente, corresponden respectivamente a las líneas anti-Stokes y Stokes de la dispersión Raman, siguiendo con la explicación del apartado anterior. 10 Desde un punto de vista microscópico, en cambio, la dispersión Raman se puede analizar como transferencia de energía. En este caso, la luz se estudia en forma de materia centrándose en los propios fotones. La energía (𝐸) del fotón es proporcional a la frecuencia de la luz: 𝐸 =ℎ𝑣 , 2.6) Donde ℎ es la constante de Planck. Cuando un cúmulo de fotones inciden en la materia y soportan dispersión, las moléculas que forman la materia son excitadas a una situación de mayor energía. La cantidad de energía de esta excitación es igual a la energía de los fotones incidentes. Estas moléculas, vuelven a su estado anterior inmediatamente, emitiendo un fotón en el proceso. La energía de este fotón es la diferencia de energía que hay entre las dos situaciones energéticas. Por lo tanto, si la situación energética no ha cambiado, la energía del fotón irradiado será idéntica a la del fotón incidente. Cuando ocurre esto, se dice que se ha producido dispersión Rayleigh. Cuando ocurre lo contrario, el fotón irradiado tendrá mayor o menor energía, teniendo así una frecuencia diferente a la del fotón incidente. Este es el caso conocido como dispersión Raman. En el caso de la línea de Stokes, la molécula ha absorbido energía, por lo que el fotón resultante es de inferior frecuencia y se genera una línea de Stokes en el lado rojo del espectro incidente. En el caso de la línea anti-Stokes, en cambio, la molécula pierde energía por lo que los fotones incidentes son desplazados a frecuencias más elevadas (azul) del espectro. Sin embargo, con este último enfoque hay que tener en cuenta una característica importante, ya que, la frecuencia de la luz resultante de la dispersión Raman depende de la situación de las moléculas de la materia. Por lo que cualquier fenómeno que afecte a la situación de la materia, como la tensión o la temperatura, puede dar lugar a un cambio en la frecuencia de la dispersión Raman. 2.4. Equipamiento Un espectrómetro Raman consta de varios componentes básicos. Uno de ellos, el láser que sirve como fuente de excitación, se usa normalmente en instrumentos modernos Raman con longitudes de onda de 535 𝑛𝑚, 785 𝑛𝑚, 830 𝑛𝑚 y 1064 𝑛𝑚. Los láseres de longitud de onda más corta tienen secciones transversales de dispersión Raman más altas, por lo que la señal resultante es mayor. Sin embargo, la incidencia de fluorescencia también aumenta a una longitud de onda más corta. La energía del láser se transmite a la muestra, se dispersa en y es recogida de nuevo por el equipo. Se utiliza un filtro de hendidura o de borde para eliminar la dispersión de Rayleigh y anti-Stokes. La luz dispersa restante de la línea de Stokes, es transmitida a un elemento de dispersión, normalmente una rejilla holográfica. Finalmente, un detector CCD captura la luz, lo que da lugar al espectro Raman. Dado que la dispersión Raman produce una señal débil, es muy importante que en el espectrómetro Raman se usen componentes de alta calidad y ópticamente bien adaptados [12]. 11 2.5. Análisis Multivariante (MVA) El análisis multivariante se refiere a la utilización de técnicas estadísticas para analizar conjuntos de datos que incluyen más de una variable. Hoy en día, este tipo de análisis es de gran interés debido a que muchas de las investigaciones y aplicaciones que se realizan en diferentes campos de estudio dan lugar a bases de datos estadísticos que corresponden a muchas variables. La información que es posible obtener de estas bases de datos es más rica cuando se considera la extracción de patrones que pueden existir en conjunto entre ciertos valores de las variables. Con métodos analíticos multivariantes adecuados, como pueden ser Principal Component analysis (PCA) y Partial Least Squares regression (PLS regression), las masas de datos de proceso pueden proporcionar información gráfica fácil de comprender sobre el estado del proceso y las relaciones entre conjuntos importantes de variables de proceso. Estos métodos multivariantes hacen un uso eficiente de todos los datos pertinentes, con poca pérdida de información. 2.5.1. Variables de proceso Los datos medidos en un proceso suelen almacenarse en algún tipo de base de datos. Una base de datos de procesos que contiene los valores de K variables para N puntos de datos puede considerarse una tabla, o una matriz. A esta tabla se la denomina X. Cada columna de la tabla corresponde a una variable (𝑥𝑘), y una fila (𝑥𝑖) corresponde a los valores observados en un momento de tiempo o, en el caso de este proyecto, una medida o una muestra diferente. 2.5.2. PCA - Principal Component Analysis El Análisis de Componentes Principales, o PCA, es un procedimiento estadístico que permite resumir el contenido informativo de grandes tablas de datos mediante un conjunto más pequeño de "índices resumen" que pueden visualizarse y analizarse más fácilmente. Los datos subyacentes pueden ser mediciones que describan propiedades de muestras de producción, compuestos o reacciones químicas, puntos de tiempo de un proceso continuo, lotes de un proceso discontinuo, individuos biológicos o ensayos, por ejemplo. El Análisis de Componentes Principales es considerada una de las técnicas estadísticas multivariantes más populares hoy en día. Ha sido ampliamente utilizada en áreas de reconocimiento de patrones y procesamiento de señales. El PCA constituye la base del análisis de datos multivariantes basado en métodos de proyección. Los índices resumen generados por el PCA son denominados componentes principales y se crean con el fin de observar tendencias, saltos, conglomerados y valores atípicos. Esta visión de conjunto puede descubrir las relaciones entre observaciones y variables, y entre las variables. También permite analizar conjuntos de datos que pueden contener, por ejemplo, multicolinealidad, valores perdidos, datos categóricos y mediciones imprecisas [13]. 12 2.5.3. Funcionamiento Para la matriz de datos, se construye un espacio de variables con tantas dimensiones como variables. Cada variable representa un eje de coordenadas. Para cada variable, la longitud se ha normalizado según un criterio de escalado, normalmente escalando a la varianza unitaria. Cada observación (fila) de la matriz X se coloca en el espacio de variables de K dimensiones. En consecuencia, las filas de la tabla de datos forman un enjambre de puntos en este espacio, tal y como se puede ver en la Ilustración 3. Una vez colocados, se hace un centrado de la media. Para eso, se sustraen de los datos las medias de las variables. El vector de medias corresponde a un punto del espacio K. Con ese punto en mente, se hace un reposicionamiento del sistema de coordenadas trasladando todos los puntos de ese espacio junto con el punto que representa la media, de modo que el punto medio es ahora el origen [13] . Tras centrar la media y ajustar la escala a la varianza unitaria, el conjunto de datos está listo para el cálculo del primer índice resumen, el primer componente principal (PC1). Este componente es la línea en el espacio variable de K dimensiones que mejor se aproxima a los datos en el sentido de mínimos cuadrados. Esta línea pasa por el punto medio. Cada observación (punto amarillo) puede proyectarse ahora sobre esta línea para obtener un valor de coordenadas a lo largo de la línea PC. Este nuevo valor de coordenadas también se conoce como score. Ilustración 3: ejemplo gráfico de la formación del primer componente principal (PC1). Normalmente, un índice resumen o componente principal es insuficiente para modelizar la variación sistemática de un conjunto de datos. Por lo tanto, se suele calcular un segundo componente principal (PC2) el cual está representado por una línea en el espacio variable de K dimensiones, que es ortogonal al primer PC. Esta línea también pasa por el punto medio y mejora la aproximación de los datos X en la medida de lo posible. 13 Estos dos componentes principales juntos definen un plano, una ventana en el espacio de variables de K dimensiones. Al proyectar todas las observaciones en el subespacio de baja dimensión y representar gráficamente los resultados, es posible visualizar la estructura del conjunto de datos investigado (ver Ilustración 4). Los valores de las coordenadas de las observaciones en este plano se denominan scores, por lo que la representación gráfica de una configuración proyectada de este tipo se conoce como score plot. Ilustración 4: proyección del plano formado por el conjunto de PC1 y PC2. El score plot es la visión de conjunto de la cual se podrá descubrir cuáles son las relaciones entre observaciones y variables, y entre las variables. De esta forma, se obtiene una mejor visión del conjunto de datos con el que se está trabajando. Se tendrá un ejemplo más claro del funcionamiento del score plot en el apartado donde se detalla la descripción de la solución propuesta. 2.5.4. PLS - Partial Least Squares regression En pocas palabras, la regresión de Mínimos Cuadrados Parciales, o PLS como se conoce por sus siglas en inglés, se puede considerar una extensión del Análisis de Componentes Principales. Mientras que el PCA se utiliza para buscar un resumen o visión general de los datos, mediante PLS se trata de encontrar hiperplanos de máxima varianza entre la variable de respuesta y las variables independientes. Es por esto que PCA se utiliza mejor en casos en los que se busca un resumen o visión general de los datos [14]. La regresión de Mínimos Cuadrados Parciales se centra en encontrar una regresión lineal mediante la proyección de las variables de predicción y las variables observables a un nuevo espacio. Es una técnica 14 que reduce las variables a un conjunto más pequeño de componentes no correlacionados y realiza una regresión de mínimos cuadrados sobre estos componentes, en lugar de hacerlo sobre los datos originales. La regresión PLS resulta especialmente útil cuando las variables son muy colineales o cuando se tienen más variables que observaciones y la regresión de mínimos cuadrados ordinarios produce coeficientes con altos errores estándar o falla por completo. PLS no presupone que las variables sean fijas, a diferencia de la regresión múltiple. Esto significa que las variables pueden medirse con error, lo que hace que PLS sea más robusta a la incertidumbre de las mediciones. Por lo tanto, cuando se necesite analizar y modelizar un conjunto de datos muy amplio (es decir, un conjunto de datos con muchas más variables que observaciones), es probable que se plantee utilizar un método como PLS u OPLS. El OPLS es una variante del PLS, pero mientras que ambos métodos dividen la variabilidad de un conjunto de datos en lo sistemático (estructurado) y residual (ruido), el OPLS divide, además, la variabilidad de lo sistemático (la tabla de datos X) en dos componentes: predictivo (todo lo correlacionado con la respuesta, Y) y ortogonal (todo lo no correlacionado con la respuesta). Esto mejora la interpretabilidad del modelo. En el caso de una sola variable Y, sólo hay un componente predictivo, y todos los componentes más allá del primero reflejan una variación ortogonal. Sin embargo, con múltiples variables Y puede haber más de un componente OPLS predictivo [14]. En la situación de una única variable Y, un modelo PLS y un modelo OPLS ajustados a los mismos datos tendrán el mismo poder predictivo (siempre que se comparen modelos con el mismo número total de componentes). La gran ventaja del OPLS sobre el PLS reside en la interpretabilidad simplificada del modelo que surge con el OPLS, debido a la capacidad de separar la varianza explicada en compartimentos predictivos y ortogonales del modelo. Por lo tanto, OPLS ofrece una mejor visualización cuando hay una gran cantidad de estructura ortogonal Y en X y puede ayudar a aclarar y comprender la variación correlacionada y no correlacionada [14]. 2.5.5. PLS-DA/OPLS-DA PLS-DA/OPLS-DA son métodos basados en los métodos PLS/OPLS, como su nombre indica. DA significa Análisis Discriminante, o Discriminant Analysis por sus siglas en inglés. Con modelos anteriores, conceptualmente lo que se obtiene son modelos de clase para diferentes tipos de muestras y se define una envolvente alrededor de los puntos de datos - un tamaño del modelo o borde del modelo. Luego, en la clasificación, lo que interesa es saber si la nueva muestra que aparece en el conjunto de predicciones es similar a una u otra clase, o si no encaja en ninguna clase en absoluto. Como el objetivo principal es definir los límites de las clases e inferir la pertenencia a una clase de las futuras muestras del conjunto de predicción, no se centra tanto en por qué las clases son diferentes. Sin embargo, con el análisis discriminante lo que se plantea es la siguiente pregunta: ¿Cuál es la diferencia? Aquí en lo que se centra es en las variables. ¿Qué variables impulsan la separación entre los dos grupos? En el caso de tener un problema de dos grupos, el modelo OPLS-discriminante 15 resultante será muy fácil de interpretar porque sólo tendrá un componente predictivo que interpretar. Este componente se representa como el eje de abscisas en el gráfico de dispersión de scores resultante del modelo OPLS-DA [10]. De esa manera, la dirección horizontal del gráfico de dispersión de scores captará la variación entre los grupos. ¿Cuáles son las diferencias sistemáticas entre el grupo de la izquierda y el grupo de la derecha? Mientras, la dimensión vertical y cualquier componente superior de los denominados de tipo ortogonal captarán la variación dentro de los grupos. 3. Objetivos y alcance del trabajo El proyecto se centra en la obtención de datos de varios lotes de olivas y hojas de olivos, los cuales estarán diferenciados por tipo de fitosanitario y nivel de concentración aplicado en cada uno. El objetivo del proyecto no es otro que determinar si se es capaz de clasificar y diferenciar entre sí las distintas muestras en base a sus datos obtenidos mediante el desarrollo de un modelo predictivo desarrollado en base a las herramientas de Análisis Multivariante de Datos (MVDA). Para la obtención de los datos de las muestras se ha recurrido a la tecnología de espectroscopía Raman, mientras que para el desarrollo del modelo se ha hecho uso del software SIMCA, el cual permite el uso de una gran variedad de herramientas MVDA para la clasificación de los datos y la predicción usando datos nuevos. Para cumplir con el objetivo principal, el proyecto se ha dividido en objetivos secundarios más pequeños que permitan un mejor seguimiento del mismo: 1. Mediar con el socio encargado de facilitar las muestras de las olivas y hojas de los olivos para llegar a un acuerdo en cuanto a los diferentes grupos de muestras a enviar. Estas son separadas según el fitosanitario utilizado para rociar las olivas y la concentración utilizada. 2. Tratar de obtener resultados óptimos haciendo varias mediciones con cada muestra y descartando las que se salgan de la norma dentro de ese grupo de mediciones. 3. Elección del mejor método de análisis multivariante de datos, teniendo en cuenta el tipo de datos a tratar y el objetivo buscado. En este caso, el tipo de datos a tratar consta de menos observaciones que variables. 4. Desarrollar un modelo robusto y validar su eficacia mediante la predicción de nuevos datos. 4. Beneficios En este apartado se valorarán los beneficios que puede aportar el desarrollo de este proyecto. En este caso, el proyecto aportará beneficios en diferentes ámbitos, como son: 22 Ilustración 6: Revólver del microscopio. Además, como se puede apreciar en la imagen anterior, el microscopio también dispone de una plataforma motorizada que permite ajustar la muestra siguiendo los ejes 𝑋𝑌𝑍, permitiendo una mejor calibración de la muestra y la zona donde el láser debe incidir. 6.2. Obtención de los datos Para la obtención de los datos, el material usado como muestra han sido un conjunto de olivas separadas en varios lotes definidos por el fitosanitario y la concentración empleada en ellas. Las muestras fueron rociadas con los siguientes fitosanitarios: Deltametrina, Diflufenican, Lambda Cihalometrina, Oxifluorfen y Tebuconazol. Estas muestras fueron clasificadas por lotes de la siguiente manera (tabla 1). 23 Nombre del lote Concentración (mg/Kg) Deltametrina 1 37,2 Deltametrina 2 19,1 Deltametrina 3 0,77 Deltametrina 5 Muy baja (por debajo de 0.0010) Diflufenican 1 31,8 Diflufenican 2 3,42 Diflufenican 3 0,46 Diflufenican 4 0,015 Diflufenican 5 Muy baja (por debajo de 0.0010) Lambda Cihalometrina 1 84,8 Lambda Cihalometrina 2 11,4 Lambda Cihalometrina 3 0,95 Lambda Cihalometrina 4 0,014 Lambda Cihalometrina 5 Muy baja (por debajo de 0.0010) Oxifluorfen 1 72,3 Oxifluorfen 2 11,5 Oxifluorfen 3 1,12 Oxifluorfen 5 Muy baja (por debajo de 0.0010) Tebuconazol 1 116 Tebuconazol 2 19,2 Tebuconazol 3 1,29 Tebuconazol 4 Muy baja (por debajo de 0.0010) Tebuconazol 5 Muy baja (por debajo de 0.0010) Sin Tratar 0 Tabla 1: lotes y su concentración. La Ilustración 7 y la Ilustración 8 sirven como ejemplos de lote de olivas recibidos por parte del distribuidor. Ilustración 7: Lote de olivas Diflufenican 4. 24 Ilustración 8: Lote de olivas Diflufenican 5. Como se puede observar en las imágenes anteriores, se puede apreciar que dentro de cada lote se encuentran olivas de diferentes características. Esto es debido a que algunas se han conservado mejor que otras desde que empezó el proceso de recolección hasta llegar a nuestras manos y es un indicativo de que el tiempo es crucial para hacer las mediciones, ya que la composición del conjunto de muestras podría verse afectada. Sin ir más lejos, había casos en los que el lote ya había llegado con alguna aceituna podrida habiendo sido afectada por el moho, como se puede apreciar en la Ilustración 9. Ilustración 9: ejemplo de oliva podrida. En vista de estos casos, se decidió revisar todos los lotes como primer paso para deshacerse de las olivas más afectadas como medida preventiva para que estas no acelerasen el deterioro del resto de muestras. 25 Teniendo en cuenta lo anterior, se decidió establecer una ventana de tiempo para el proceso de obtención de datos de una semana para todos los lotes. Debido a esto, se calculó que teniendo en cuenta el tiempo limitado y el número de muestras por lote, hacer tres medidas por muestra a tres muestras diferentes por cada lote sería suficiente para tener un conjunto de datos aceptable. Habiendo recibido un conjunto de 5 lotes de diferente concentración por cada uno de los 5 grupos diferentes de fitosanitarios más un único lote de aceitunas sin tratar, se poseían un total de 26 lotes. Contando con que se estableció la norma de hacer 3 mediciones por cada muestra y 3 muestras diferentes por cada lote, se obtiene un total de 234 mediciones a realizar en una semana. Este proceso requirió de 4 horas diarias durante esos 5 días plenamente enfocadas en la obtención de los datos. Antes de empezar con el proceso de medición se establecieron algunas medidas de seguridad, como es el uso de guantes para la manipulación de las muestras. Esto es debido al fitosanitario con el que las olivas habían sido rociadas, pudiendo ser perjudicial para la salud. Para la medición, las muestras son colocadas en un recipiente rectangular transparente y se procede a enfocar la zona a irradiar. Para ello, se puede hacer uso de cada uno de los objetivos, enfocando con cada uno hasta lograr a un buen enfoque con el objetivo de deseado. En este caso, las mediciones se hicieron con un objetivo de 50𝑋. Se puede apreciar como la muestra es colocada y enfocada en la Ilustración 10. Ilustración 10: imagen de una muestra bajo el objetivo. Las mediciones fueron efectuadas con las siguientes características: • Laser de 785 𝑛𝑚 de potencia. • Rejilla de 1200 𝑙𝑖𝑛𝑒𝑎𝑠/𝑚𝑚. • 100% de intensidad del láser. • Objetivo de 50𝑋. • Tiempo de exposición 10𝑠. 26 En cuanto al número de medidas, en alguna ocasión excepcional se obtuvo alguna medida fuera de lo común por lo que se decidió repetir la medición en una zona diferente de la muestra, obteniendo resultados dentro de la norma de nuevo. Esto ocurría en casos muy aislados y se debía principalmente al hecho de haber enfocado directamente a una “piedra” de fitosanitario en la muestra. Estas “piedras” son una acumulación relativamente grande de fitosanitario cristalizado en la superficie de la muestra. A continuación, desde la Ilustración 11 hasta la Ilustración 14 se puede observar la diferencia en las lecturas cuando se efectúa una medida en una zona normal de la muestra frente a una hecha en una “piedra”. Ilustración 11: imagen del microscopio enfocando una “piedra” en la superficie de la muestra. Ilustración 12: imagen del espectro obtenido como resultado de enfocar una “piedra”. 27 Ilustración 13: imagen del microscopio enfocando la superficie de la muestra aleatoriamente. Ilustración 14: imagen del espectro obtenido como resultado de enfocar la superficie de la muestra. Así mismo, se tomó la decisión de excluir los resultados que se salían de la norma en cuanto a la forma del espectro obtenido. 6.3. Adaptación de los datos En esta parte del proceso es donde se tratan los datos obtenidos y se adaptan de una forma óptima para el desarrollo del modelo con el software elegido. Para ello, lo primero es eliminar el offset que aparece en el espectro obtenido por el microscopio Raman debido a la fluorescencia reflejada por la muestra. Para su eliminación se hace uso del algoritmo 4S Peak Filling que estima la línea de base mediante supresión iterativa de la media [19] . Tras el uso de dicho algoritmo, el espectro queda de la siguiente forma (ilustración15). En comparación a como estaba antes (ilustración 14), ahora se puede obtener mejor la información del espectro, sin la interferencia de la fluorescencia. 28 Ilustración 15: espectro suavizado de la muestra Tebuconazol 5. Una vez tratados los datos, lo siguiente es ordenarlos de la forma en la que el programa requiera, adecuándolos a un formato que pueda interpretar de forma correcta. En este caso, se hizo uso del software Excel para conseguir el formato adecuado de los datos. De esta forma, los datos se colocan de manera en la que la primera columna ocupa el nombre dado a cada observación (nombre de fitosanitario presente en la muestra y una numeración referente al lote y número de muestra) con el título de Primary ID, la longitud de onda ocupa la primera fila a partir del título de las observaciones y el resto de los datos son establecidos ocupando su respectivo lugar según la observación y la longitud de onda a la que corresponden. 6.4. Preprocesado de los datos Para este proyecto, se ha decidido el uso del software SIMCA como herramienta principal para el tratamiento de los datos. Este software permite importar los datos de un fichero directamente como puede ser una hoja de Excel en este caso. También permite la importación de datos desde una base de datos. Una vez importada, es importante establecer el significado de cada uno de los datos de forma correcta para que SIMCA pueda interpretarlos de forma correcta tal y como deseamos. En este caso, detecta automáticamente la columna que hemos denominado como Primary ID y el resto de los datos como variable X de forma correcta. Sin embargo, en este caso son añadidas 2 columnas más a la hoja de cálculo. Estas hacen referencia al Class ID, estableciendo a cada observación un identificador de clase haciendo referencia a la clase de fitosanitario al que pertenece, y a la concentración de fitosanitario presente en cada una de las muestras. Respecto a la concentración, algunas de las olivas de cada lote fueron enviadas a un laboratorio para que se determinara la concentración real de cada lote mediante un análisis químico. Sin embargo, los lotes de concentración más baja no pudieron ser correctamente analizados debido a que tenían una concentración demasiado baja para los análisis. Aunque siguiendo la regla en la que el fitosanitario fue adulterado para lograr concentraciones más bajas y los datos de concentración reales de los lotes que 29 sí pudieron ser analizados, se pudo estimar la concentración del resto de lotes de forma teórica, aunque aproximada. Estas dos columnas nuevas añadidas a la hoja de cálculo, servirán para determinar si los datos de las muestras guardan alguna relación perteneciendo al grupo del mismo fitosanitario o una tendencia en caso de compartir misma concentración. La hoja de datos quedaría de la siguiente manera, tal y como se muestra en la Ilustración 16, mostrando solo las primeras filas y columnas para que una visualización correcta del ejemplo sea posible. Ilustración 16: muestra parcial de la hoja de datos. Una vez guardada la hoja de cálculo y generado el proyecto, se tiene acceso a muchas herramientas que ofrece SIMCA, por lo que se podría empezar con la generación de los modelos. Sin embargo, como último paso en el preprocesado de los datos, se decide recurrir a las herramientas que permiten la manipulación de los datos, concretamente a la herramienta que permite generar un espectro basado en los datos. Mediante esa herramienta se obtiene el siguiente espectro, manteniendo la misma forma con la que se han visualizado los datos de las muestras en el espectrómetro, pero sin el offset. Ilustración 17: Espectros obtenidos de la totalidad de las muestras. 30 Como se puede apreciar en la ilustración 17, existen dos regiones de las cuales no se puede obtener información. Estas regiones se encuentran entre las longitudes de onda 100 𝑛𝑚 y 350 𝑛𝑚, y 1800 𝑛𝑚 y 2600 𝑛𝑚, aproximadamente. Por lo tanto, se determina que esas regiones no son determinantes para la generación de los modelos y se toma la decisión de excluir dichas zonas en los modelos a generar, tal y como se observa en la Ilustración 18. Ilustración 18: Espectros obtenidos de la totalidad de las muestras con zonas a excluir. 6.5. Generación del modelo Una vez terminado el preprocesado de los datos, lo siguiente es la generación del modelo [20]. Pero antes, es importante tener claros los objetivos a alcanzar con el desarrollo del proyecto, ya que este punto determinará el tipo de modelo predictivo a desarrollar. Tras varias pruebas y, teniendo en cuenta los datos disponibles, se decidió usar dichos datos para generar un modelo que tenga la capacidad de predecir si una nueva muestra ha sido tratada o no, independientemente de la concentración del tratamiento. De esta forma, toda aceituna no tratada será considerada saludable para el usuario, mientras que las catalogadas como tratadas podrán ser consideradas saludables o no según la legislación vigente, siendo descartadas para el consumo humano en caso de no serlo. En este punto, siguiendo la teoría sobre los modelos de análisis multivariante de datos explicada en apartados anteriores, se puede llegar a la conclusión de que el modelo más acertado para este proyecto es el OPLS-DA. Sin embargo, en este apartado se demostrará con resultados prácticos los pasos seguidos hasta llegar a dicha conclusión, confirmando así la teoría explicada. Como primer paso se decide generar un modelo PCA-X, ya que lo interesante al principio es ver un resumen o una visión general de todos los datos. Como se ha explicado con anterioridad, este modelo permite analizar conjuntos de datos que pueden contener, por ejemplo, multicolinealidad, valores perdidos, datos categóricos y mediciones imprecisas. De esta manera, se genera el siguiente score plot teniendo en cuenta todas las muestras salvo las pertenecientes a la clase de las olivas sin tratar. De esta forma, se intenta obtener una visión general de similitudes entre los diferentes fitosanitarios y concentraciones. 31 Ilustración 19: score plot del modelo PCA-X de todas las clases salvo Sin Tratar. Sin embargo, como se puede observar en la Ilustración 19, no existe ningún tipo de relación aparente entre fitosanitarios o diferentes concentraciones a simple vista, ya que no se percibe que sigan ningún patrón de organización y solo se muestran como una nube aleatoria de datos. Esto es una conclusión alcanzada teniendo en cuenta que las clases parecen estar distribuidas por toda la nube, a pesar de haber pequeñas agrupaciones. Además, estas agrupaciones no guardan relación alguna con la concentración, ya que están agrupadas a pesar de tener diferente concentración, así como cerca de otras agrupaciones de diferente clase y concentración aleatoria. Este modelo ha sido generado con 4 componentes principales y se han visualizado todas las combinaciones posibles de los componentes sin éxito. También se puede observar cómo algunas de las observaciones se salen fuera de lo considerado la norma dentro de esta nube, aunque este modelo no es lo suficientemente determinante como para excluir muestras. En vista de estos resultados, se puede llegar a la conclusión de que las variables son bastante colineales entre sí. Por lo tanto, siguiendo con la teoría anteriormente explicada, se valora la generación de un modelo PLS u OPLS como solución al problema. La regresión PLS u OPLS resulta especialmente útil cuando las variables son muy colineales o cuando se tienen más variables que observaciones. Extrayendo un fragmento de teoría anteriormente explicado, entendemos que en el caso de una sola variable Y solo hay un componente predictivo, y todos los componentes más allá del primero reflejan una variación ortogonal. Sin embargo, con múltiples variables Y puede haber más de un componente OPLS predictivo. En la situación de una única variable Y, un modelo PLS y un modelo OPLS ajustados a los mismos datos tendrán el mismo poder predictivo. Por lo tanto, se puede llegar a la conclusión de que, en este caso, no es relevante cuál de los dos modelos sea elegido para generar el modelo. Sin embargo, una parte importante que se puede pasar por alto y es determinante a la hora de elegir la mejor opción, es la gran ventaja que tiene OPLS frente a PLS. Volviendo a la teoría anteriormente explicada, esta reside en la interpretabilidad simplificada del modelo que surge con el OPLS, debido a la capacidad de separar la varianza explicada en compartimentos predictivos y ortogonales del modelo. Por lo tanto, OPLS ofrece una mejor visualización cuando hay una gran cantidad de estructura 38 Ilustración 30: summary of fit del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. El gráfico coefficients se puede observar en la ilustración 31. Ilustración 31: coefficients del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. La misclassification table y la lista de clasificación que acompañan a dicho modelo son las siguientes (ilustración 32 y 33). Ilustración 32: misclassification table del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. 39 Ilustración 33: lista de clasificación del modelo OPLS-DA Diflu vs Sin Tratar con outlier incluida. En comparación, tenemos los datos del modelo generado sin dicha outlier. El score plot, summary of fit, misclassification table y lista de clasificación de dicho modelo son las siguientes (ilustración 34, 35 36, 37 y 38 respectivamente). Ilustración 34: score plot del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. Ilustración 35: summary of fit del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. 40 Ilustración 36: coefficients del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. Ilustración 37: misclassification table del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. Ilustración 38: lista de clasificación del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. Como se puede apreciar en las ilustraciones 34 y 35, el modelo sí puede considerarse ligeramente superior después de excluir dicho outlier, ya que ambas clases están algo más separadas y su capacidad predictiva parece haber mejorado según los datos. Se puede observar también algo de mejoría en la lista de clasificación, concretamente en el ligero incremento del peso que tiene la primera muestra no tratada para ser clasificada como no tratada. Sin embargo, el peso de la siguiente muestra no tratada incrementa hacia la clasificación como tratada. Como conclusión, la predicción no ha mejorado mucho a pesar de una mejor separación de ambas clases, y esto sigue siendo debido a que al tener pocas muestras no tratadas el modelo no es lo suficientemente fuerte, y menos con este modelo ya que se 41 puede observar que las muestras de Diflufenican son bastante más similares a las no tratadas que otros fitosanitarios. En la ilustración 39 se puede apreciar como encajan las muestras de predicción en el modelo y por qué el modelo ha clasificado una muestra erróneamente. Ilustración 39: score plot predictivo del modelo OPLS-DA Diflu vs Sin Tratar con outlier excluida. 6.6.3. Lambda Cihalometrina En cuanto al modelo OPLS-DA generado con muestras de Lambda Cihalometrina y no tratadas, se obtienen mejores resultados. Dichos resultados se pueden observar en las ilustraciones de la 40 a la 45. Ilustración 40: score plot del modelo OPLS-DA Laci vs Sin Tratar. 42 Ilustración 41: summary of fit del modelo OPLS-DA Laci vs Sin Tratar. Ilustración 42: coefficients del modelo OPLS-DA Laci vs Sin Tratar. Ilustración 43: misclassification table del modelo OPLS-DA LAci vs Sin Tratar. 43 Ilustración 44: lista de clasificación del modelo OPLS-DA Laci vs Sin Tratar. Como se puede observar, en este caso la predicción es del 100%, por lo que se puede entender que hace una mejor clasificación de los datos. Esto puede ser debido a que los datos de las muestras del fitosanitario Lambda Cihalometrina no son tan parecidos a las muestras no tratadas como pasaba con el caso anterior. Aun así, se aprecia en la lista de clasificación que dicha clasificación, a pesar de ser certera, no tiene pesos tan altos a la hora de determinar la clasificación correcta con las muestras no tratadas. Volvemos a destacar la importancia de tener un número alto y equitativo de muestras para mejorar la calidad de la clasificación. 6.6.4. Oxifluorfen En cuanto al modelo OPLS-DA generado con muestras de Oxifluorfen y no tratadas, se obtienen los siguientes resultados observables en las ilustraciones de la 45 a la 49. Ilustración 45: score plot del modelo OPLS-DA Oxi vs Sin Tratar. 44 Ilustración 46: summary of fit del modelo OPLS-DA Oxi vs Sin Tratar. Ilustración 47: coefficients del modelo OPLS-DA Oxi vs Sin Tratar. Ilustración 48: misclassification table del modelo OPLS-DA Oxi vs Sin Tratar. 45 Ilustración 49: lista de clasificación del modelo OPLS-DA Oxi vs Sin Tratar. En este caso, el modelo parece diferenciar bien ambas clases, pero a la hora de clasificar falla de nuevo en una de las muestras no tratadas. Sin embargo, en esta ocasión la clasificación la hace con un peso ligeramente mayor que en anteriores casos, para bien y para mal. 6.6.5. Tebuconazol En cuanto al modelo OPLS-DA generado con muestras de Tebuconazol y no tratadas, se obtienen los siguientes resultados observables en las ilustraciones de la 50 a la 54. Ilustración 50: score plot del modelo OPLS-DA Tebu vs Sin Tratar. 46 Ilustración 51: summary of fit del modelo OPLS-DA Tebu vs Sin Tratar. Ilustración 52: coefficients del modelo OPLS-DA Tebu vs Sin Tratar. Ilustración 53: misclassification table del modelo OPLS-DA Tebu vs Sin Tratar. 47 Ilustración 54: lista de clasificación del modelo OPLS-DA Tebu vs Sin Tratar. En este caso, La clasificación vuelve a ser certera como en el caso de Lambda Cihalometrina. Pero, al igual que en ese caso, el peso de algunas muestras vuelve a ser bajo para determinarlo como una clasificación precisa para todos los casos futuros. Por lo tanto, se vuelve a destacar la importancia de contar con una mayor cantidad y mayor equidad entre las muestras. 6.7. Resumen de resultados Para tener una visión general de los resultados obtenidos existen parámetros calculables que los resume de manera efectiva, de manera que se puede percibir la precisión de los modelos fijándose solamente en estos tres parámetros. Los parámetros son los siguientes. • Sensibilidad o razón de verdaderos positivos: 𝑉𝑃𝑅=𝑉𝑒𝑟𝑑𝑎𝑑𝑒𝑟𝑜 𝑃𝑜𝑠𝑖𝑡𝑖𝑣𝑜 (𝑉𝑃) 𝑃𝑜𝑠𝑖𝑡𝑖𝑣𝑜𝑠 𝑡𝑜𝑡𝑎𝑙𝑒𝑠 (𝑃) =𝑉𝑃 𝑉𝑃+ 𝐹𝑎𝑙𝑠𝑜 𝑁𝑒𝑔𝑎𝑡𝑖𝑣𝑜 (𝐹𝑁) 6.1) • Especificidad: 𝐸𝑠𝑝𝑒𝑐𝑖𝑓𝑖𝑐𝑖𝑑𝑎𝑑 (𝑆𝑃𝐶)= 𝑉𝑒𝑟𝑑𝑎𝑑𝑒𝑟𝑜 𝑁𝑒𝑔𝑎𝑡𝑖𝑣𝑜 (𝑉𝑁) 𝑁𝑒𝑔𝑎𝑡𝑖𝑣𝑜𝑠 𝑡𝑜𝑡𝑎𝑙𝑒𝑠 (𝑁) = 𝑉𝑁 𝐹𝑎𝑙𝑠𝑜𝑠 𝑃𝑜𝑠𝑖𝑡𝑖𝑣𝑜𝑠 (𝐹𝑃)+𝑉𝑁 6.2) • Exactitud: 𝐸𝑥𝑎𝑐𝑡𝑖𝑡𝑢𝑑 (𝐴𝐶𝐶)= 𝑉𝑃+𝑉𝑁 𝑃+𝑁 6.3) 54 7.2.9. Comprobación de efectividad de los modelos Durante el desarrollo de esta tarea, se ponen a prueba los 5 modelos OPLS-DA generados en la tarea anterior en busca de mejorar y obtener una precisión alta de predicción. PT9 Descripción Fecha inicio Fecha fin Duración PT9.1 Comprobar capacidad predictiva del modelo 1: se comprueba la capacidad predictiva del modelo según el porcentaje de acierto obtenido durante la clasificación de nuevos datos. 19/1/24 19/1/24 1 día PT9.2 Adaptar modelo 1 según datos recopilados: se adapta el modelo con el fin de mejorar dicho porcentaje de predicción y lograr un porcentaje de acierto aceptable. 22/1/24 22/1/24 1 día PT9.3 Comprobar capacidad predictiva del modelo 2: se comprueba la capacidad predictiva del modelo según el porcentaje de acierto obtenido durante la clasificación de nuevos datos. 23/1/24 23/1/24 1 día PT9.4 Adaptar modelo 2 según datos recopilados: se adapta el modelo con el fin de mejorar dicho porcentaje de predicción y lograr un porcentaje de acierto aceptable. 24/1/24 24/1/24 1 día PT9.5 Comprobar capacidad predictiva del modelo 3: se comprueba la capacidad predictiva del modelo según el porcentaje de acierto obtenido durante la clasificación de nuevos datos. 25/1/24 25/1/24 1 día PT9.6 Adaptar modelo 3 según datos recopilados: se adapta el modelo con el fin de mejorar dicho porcentaje de predicción y lograr un porcentaje de acierto aceptable. 26/1/24 26/1/24 1 día PT9.7 Comprobar capacidad predictiva del modelo 4: se comprueba la capacidad predictiva del modelo según el porcentaje de acierto obtenido durante la clasificación de nuevos datos. 29/1/24 29/1/24 1 día PT9.8 Adaptar modelo 4 según datos recopilados: se adapta el modelo con el fin de mejorar dicho porcentaje de predicción y lograr un porcentaje de acierto aceptable. 30/1/24 30/1/24 1 día PT9.9 Comprobar capacidad predictiva del modelo 5: se comprueba la capacidad predictiva del modelo según el porcentaje de acierto obtenido durante la clasificación de nuevos datos. 31/1/24 31/1/24 1 día PT9.10 Adaptar modelo 5 según datos recopilados: se adapta el modelo con el fin de mejorar dicho porcentaje de predicción y lograr un porcentaje de acierto aceptable. 1/2/24 1/2/24 1 día Tabla 12: PT9 Comprobación de efectividad de los modelos. 55 7.2.10. Obtención de resultados óptimos Esta tarea incluye últimos ajustes en los modelos y obtención de resultados considerados óptimos. PT10 Descripción Fecha inicio Fecha fin Duración PT10.1 Realizar últimas pruebas para conseguir resultados óptimos: se realizan últimas comprobaciones para corroborar que los modelos logran resultados considerados lo suficientemente óptimos. 2/2/24 5/2/24 2 días H5 Resultados óptimos obtenidos: se consiguen resultados óptimos en todos los modelos generados y se da por terminado el desarrollo del práctico del proyecto. 5/2/24 5/2/24 0 días Tabla 13: PT10 Obtención de resultados óptimos. 7.2.11. Documentación y entrega del proyecto Esta tarea incluye la elaboración de toda la documentación referente al proyecto, su entrega y la posterior presentación oral ante un jurado. PT11 Descripción Fecha inicio Fecha fin Duración PT11.1 Documentación: se elabora la documentación que engloba el desarrollo completo del proyecto y se entrega para su revisión y evaluación. 5/2/24 1/3/24 20 días PT11.2 Presentación oral del proyecto: se prepara la presentación oral del proyecto y se presenta delante de un jurado 4/3/24 27/3/24 3 días H6 Proyecto finalizado: el proyecto ha finalizado con éxito. 27/3/24 27/3/24 0 días Tabla 14: PT11 Documentación y entrega del proyecto. 7.3. Diagrama de Gantt/Cronograma Con el fin de tener una visión más global y esquemática del proyecto, se ha hecho uso del diagrama de Gantt en el cual se visualizan las tareas realizadas y los hitos conseguidos. Se ha separado en 2 imágenes para poder tener mejor visión de los detalles. Estas son la ilustración 55 y 56. 56 Ilustración 56: Diagrama de Gantt (parte 1). 57 Ilustración 57: Diagrama de Gantt (parte 2). 58 8. Aspectos económicos En este apartado se desglosa el coste del proyecto, el cual se hace una vez acabado el proyecto y se conocen los costes necesarios para el desarrollo del mismo. Dichos costes se han diferenciado en horas internas, amortizaciones y gastos. 8.1. Horas internas Las horas internas se muestran en la siguiente tabla: Horas internas Trabajador Horas empleadas Coste/h Coste total Ingeniero senior 74 h 50 € 3.700 € Ingeniero junior 492 h 35 € 17.220 € Coste total de las horas internas 20.920 € Tabla 15: costes de las horas internas. 8.2. Amortizaciones En este apartado, se muestran los recursos utilizados para el desarrollo del proyecto. Estos aparecen listados en la siguiente tabla. Amortizaciones Producto Coste/Unidad Cantidad Vida útil Uso Coste total Ordenador 700 € 2 60 meses 4 meses 93,33 € Licencia SIMCA 150 € 2 12 meses 4 meses 100 € Espectrómetro Renishaw Invia Raman 84700 € 1 120 meses 4 meses 2.823,33 € Costo total de las amortizaciones 3.016,66 € Tabla 16: amortizaciones. 8.3. Gastos En este apartado se muestran los costes de los recursos los cuales no pueden ser aprovechados una vez acaba el proyecto, por lo que son considerados gastos. Gastos Concepto Coste Factura de energía 100 € Material de laboratorio 40 € Disco duro 25 € Coste total 165 € Tabla 17: gastos. 59 8.4. Presupuesto total Para obtener el presupuesto total del proyecto se deben sumar los costes totales de los apartados que conforman el presupuesto. Dichos apartados se muestran en la siguiente tabla. Presupuesto total Concepto Coste Horas internas 20.920 € Amortización 3.016,66 € Gastos 165 € Subtotal1 24.101,66 € Gastos indirectos 4% Subtotal 2 25.065,72 € Imprevistos 5% Presupuesto total 26.319 € Tabla 18: presupuesto total. 60 BIBLIOGRAFÍA [1] Comisión Europea, "Regulation (EC) no 1333/2008 of the european parliament and of the council of 16 december 2008 on food additives (text with EEA relevance)," 2023. [2] 20MINUTOS.ES, "Las claves del escándalo de la carne de caballo: qué productos contiene y cómo es el etiquetado," 2013. Available: https://www.20minutos.es/noticia/1736928/0/claveshallazgo/carne-caballos/productos-europa/ [3] BBC Mundo, "El escándalo de los huevos contaminados con pesticida: la alerta alimentaria que afecta a 17 países y millones de consumidores en Europa y Asia," 2017. Available: https://www.bbc.com/mundo/noticias-internacional-40893413 [4] elmundo.es, "La contaminación de leche en polvo en China afecta ya a 69 marcas diferentes," 2008. Available: https://www.elmundo.es/elmundosalud/2008/09/16/medicina/1221575585.html [5] R. Michael T., "International and national regulatory strategies to counter food fraud," School of Law Resnick Center for Food Law & Policy, 2022. [6] (s.f.). Aceite de oliva y aceituna de mesa. Available: https://www.mapa.gob.es/es/agricultura/temas/producciones-agricolas/aceite-olivay-aceituna-mesa/aceite.aspx [7] (s.f.). Registro de Productos Fitosanitarios. Available: https://www.mapa.gob.es/es/agricultura/temas/sanidad-vegetal/productosfitosanitarios/registro-productos/. [8] E. Nº et al, "Importaciones paralelas de productos fitosanitarios en españa," 2024. [9] J. C. Ramos, A. E. Villanueva and C. M. Ortiz Lima, "Raman spectroscopy and its applications," Opt. Pura Apl., vol. 46, (1), pp. 83, 2013. DOI: 10.7149/opa.46.1.83. [10] (s.f.). OPLS vs PCA: Explaining Differences or Grouping Data?. Available: https://www.sartorius.com/en/knowledge/science-snippets/explaining-differences-orgrouping-data-opls-da-vs-pca-data-analysis-507204%20 [11] M. Azkune Ulla, "Design and Development of Polymer Optical Fiber Based Platforms for Glucose Detection." 2019. [12] (s.f.). Espectroscopía Raman. Available: https://www.mt.com/es/es/home/applications/L1_AutoChem_Applications/RamanSpectroscopy.html%20 [13] (s.f.). What Is Principal Component Analysis (PCA) and How It Is Used?. Available: https://www.sartorius.com/en/knowledge/science-snippets/what-is-principalcomponent-analysis-pca-and-how-it-is-used-507186%20 [14] (s.f.). OPLS vs. PLS Modeling to Improve Bioprocess Yields of Batch Processes. Available: https://www.sartorius.com/en/knowledge/science-snippets/opls-vs-pls-modeling-toimprove-bioprocess-yields-of-batch-processes-602762%20 [15] (s.f.). UNSCRAMBLER. Available: https://www.tecnilab.es/analisismultivariante/#1557202990039-4884034d-9a64 61 [16] (s.f.). Multivariate Data Analysis Software That Turns Data Into Growth. Available: https://www.sartorius.com/en/products/process-analytical-technology/data-analyticssoftware/mvda-software/simca. [17] (s.f.). PLS_toolbox. Available: https://es.mathworks.com/products/connections/product_detail/pls-toolbox.html%20 [18] (). inVia™ confocal Raman microscope. Available: https://www.renishaw.com/en/inviaconfocal-raman-microscope--6260%20 [19] K. H. Liland, "4S Peak Filling – baseline estimation by iterative mean suppression," 2015. Available: http://hdl.handle.net/11250/2576468. DOI: 10.1016/j.mex.2015.02.009. [20] RF Fernández, AD Morales and EL Dennes, "Desarrollo De Un Modelo SIMCA De Reconocimiento De Patrones Para La Clasificación De Combustible Diesel." , Universidad de Oriente, Santiago de Cuba, Cuba, 2009.