scieee AI-readable full text Open interactive document viewer

Aplicación de KDSM en un dominio específico donde se presentan medidas seriadas muy cortas y repetidas con factor de bloque measures with a blocking factor are present

Rodas, Jorge,Alvarado, Gabriela,Vazquez, Fernando

Abstract

The present document reports an application process of the Knowledge Discovery in Serial Measurement (KDSM) methodology, the results obtained with it, KDSM is a methodology for the analysis of very short and repeated serial measures with blocking factor in a ill-structured domain pertaining of a labor field. KDSM methodology was applied to obtain knowledge from a training program evolution (PROBECAT), as well as its effectiveness through the information analysis related to: the positioning of enabled people, characteristics of the municipalities where the training program occurred and the necessities of the productive sector. The obtained information by KDSM allowed to know the effect of each training course done in municipalities where the PROBECAT is established. In addition, with this information the operation of PROBECAT can be modified in order to do it more opportune and effective. On the other hand, a particular solution and results to a problem of obtained attributes are not characterizing attributes is introduced.

Full text

Aplicaci´on de KDSM en un dominio espec´ıfico donde se presentan medidas seriadas muy cortas y repetidas con factor de bloque. Jorge Rodas. Departamento de Lenguajes y Sistemas Inform´aticos. Universidad Polit´ecnica de Catalu˜na. email: [email protected]c.es Gabriela Alvarado. Escuela Universitaria de Estudios Empresariales. Universidad de Barcelona. Fernando V´azquez. Departamento de Lenguajes y Sistemas Inform´aticos. Universidad Polit´ecnica de Catalu˜na. email: fv[email protected]c.es Julio, 2002 Resumen El presente documento reporta el proceso de aplicaci´on, resultados obtenidos, etc., de la metodolog´ıa KDSM1para el an´alisis de medidas seriadas muy cortas y repetidas con factor de bloque presentes en un dominio poco estructurado (DPE) perteneciente al ´ambito laboral. La metodolog´ıa KDSM se aplic´o para obtener conocimiento de la evoluci´on de un programa de capacitaci´on (PROBECAT), as´ı como de su efectividad a trav´es del an´alisis de la informaci´on relacionada con: la colocaci´on de la gente capacitada, caracter´ısticas de los municipios donde se dio la capacitaci´on y las necesidades del sector productivo. La informaci´on obtenida por KDSM permiti´o conocer el efecto que cada curso impartido aporta al municipio donde act´ua el PROBECAT y se pueda incidir en el funcionamiento del programa mismo de manera m´as oportuna y eficaz. Adem´as el presente documento muestra la resoluci´on del problema que surge cuando no se obtienen atributos caracterizadores—de los municipios—al aplicar la metodolog´ıa KDSM, pues con las t´ecnicas hasta ese momento usadas por KDSM no se obten´ıa ninguna descripci´on significativa de los municipios. Por lo que damos a conocer nuestra propuesta de soluci´on y los resultados obtenidos. Palabras Clave: Clasificaci´on, Clustering, Descubrimiento del Conocimiento, Medidas Seriadas, Dominios Poco Estructurados, Reglas Difusas, Caracterizaci´on e Interpretaci´on de Clases. 1Del ingl´es Knowledge Discovery in Serial Measurement i ´ Indice Resumen i 1 Introducci´on 1 1.1 DominiodeEstudio............................... 1 1.2 Estructuradelreporte ............................. 2 2 Metodolog´ıa KDSM 3 2.1 ConceptosB´asicos ............................... 3 2.2 Metodolog´ıaKDSM............................... 5 2.3 Aportaciones .................................. 8 2.4 Resumen..................................... 8 3 Aproximaci´on al ´ambito del dominio laboral 10 4 Descripci´on de los datos 12 4.1 Descripci´on de los atributos en la matriz X.................. 12 4.2 Descripci´on de los atributos en la matriz Y . . . . . . . . . . . . . . . . . . 13 4.3 Descripci´on de los atributos en la matriz Z . . . . . . . . . . . . . . . . . . 13 5 Aplicaci´on de KDSM al dominio laboral 14 5.1 Caracterizaci´on de los Municipios . . . . . . . . . . . . . . . . . . . . . . . 14 5.2 Proceso de Caracterizaci´on (usando CIADEC) . . . . . . . . . . . . . . . . 16 5.3 An´alisis del efecto de cada curso . . . . . . . . . . . . . . . . . . . . . . . . 19 5.4 Identificaci´on de las caracter´ısticas relevantes de los cursos . . . . . . . . . 21 6 Conclusiones 24 7 Trabajo Futuro 26 Bibliograf´ıa 27 ii 1 Introducci´on Hoy en d´ıa, es bien conocido por todos la gran ayuda que representan los avances tecnol´ogicos en la inform´atica, para realizar todo tipo de tareas, en una gran cantidad de ´areas como: econom´ıa, ingenier´ıa, etc. La utilizaci´on de la inform´atica para monitorizar un proceso, por ejemplo, el seguimien- to a un paciente que esta sometido a una terapia; ofrece una gran cantidad de informaci´on tanto del proceso como de los actores (individuos y los eventos que intervienen sobre los individuos) en el proceso. Con frecuencia encontramos que muchos datos, que provienen de monitorizar un proceso, son resultado de medidas seriadas en el tiempo de duraci´on de dicho proceso. Adem´as ´este proceso suele repetirse tantas veces sea necesario para lograr el objetivo esperado. Aparentemente, estas dos caracter´ısticas de las medidas seriadas yrepetidas en el tiempo, no ofrecen mucho problema para ser analizadas con t´ecnicas cl´asicas de series de tiempo. Sin embargo, ¿qu´e sucede cuando la cantidad de medidas es sumamente peque˜na? Por otra parte, en situaciones as´ı se cuenta con una gran cantidad de informaci´on adicional sobre los actores del proceso y el proceso mismo, que no son medidas seriadas, pero que s´ı guardan una estrecha relaci´on con lo que sucede en el proceso. Adem´as frecuentemente los actores conforman un factor de bloque sobre las medidas seriadas; entonces, ¿c´omo aprovechar esta informaci´on adicional? ¿c´omo se trabajar´ıa dicha informaci´on, en relaci´on a las medidas seriadas y repetidas, si ´esta no se conforma de medidas sino de caracter´ısticas de los actores en el proceso? Para dar respuesta a estas interrogantes hemos establecido la metodolog´ıa KDSM para el descubrimiento de conocimiento en dominios donde se presentan medidas seriadas muy cortas y repetidas con factor de bloque (conformado por los individuos) y donde se cuenta con informaci´on adicional de los actores en el proceso como lo son sus atributos caracter´ısticos. La metodolog´ıa KDSM cumple a grandes rasgos con 3 tareas principales: 1. la caracterizaci´on de la estructura de los individuos sobre la primera toma de medidas, es decir, el establecimiento de las condiciones iniciales; 2. el an´alisis del efecto de cada evento aislado eliminando el factor de bloque; y 3. la identificaci´on de las caracter´ısticas relevantes de los eventos, la descripci´on de su estructura y su interpretaci´on. El origen y fundamentos de la metodolog´ıa KDSM se encuentran debidamente documentados en [RGRC01]. Adem´as la utilidad de dicha metodolog´ıa se ve reflejada en su exitoso uso al aplicarla a un problema del ´ambito psiqui´atrico [RGR01]. En este documento presentamos la aplicaci´on de la metodolog´ıa KDSM a un ´ambito ajeno a la psiquiatr´ıa, como lo es el ´ambito laboral. 1.1 Dominio de Estudio El Servicio Estatal de Empleo surge a partir de la coordinaci´on de la Secretar´ıa del Trabajo y Previsi´on Social (Ejecutivo Federal) y los Gobiernos de los Estados (Ejecutivo 1 del Estado), para la realizaci´on de programas de sentido social que tienen por objetivo promover el dise˜no y aplicaci´on de pol´ıticas orientadas a la generaci´on de empleo. Las acciones del Departamento del Servicio Estatal de Empleo se dirigen a vincular a los demandantes de trabajo, con las necesidades de mano de obra del aparato productivo, promoviendo la inserci´on productiva de los trabajadores y la oportuna interacci´on entre ellos. Para lograr estos objetivos, entre otras actividades relevantes, se implement´o el Programa de Becas de Capacitaci´on para Trabajadores Desempleados (PROBECAT). Es as´ı que la metodolog´ıa KDSM se aplica para obtener conocimiento de la evoluci´on del PROBECAT, as´ı como de su efectividad a trav´es del an´alisis de la informaci´on relacionada con: la colocaci´on de egresados, caracter´ısticas de los municipios del Estado de Chihuahua y necesidades del sector productivo. La informaci´on obtenida por KDSM permitir´a a la Secretar´ıa de Trabajo y Previsi´on Social conocer el efecto que cada curso impartido aporta al municipio donde act´ua el PROBECAT en general para que a partir de las tendencias globales de los mercados laborales, dicha secretar´ıa de estado, pueda incidir en el funcionamiento del programa de capacitaci´on de manera m´as oportuna y eficaz. Adem´as el presente documento muestra un problema que surgi´o durante el desarrollo de la primera tarea de la metodolog´ıa, pues con las t´ecnicas hasta ese momento usadas por KDSM no se obten´ıa ninguna caracter´ıstica relevante que describiera la estructura de los individuos. Por lo que damos a conocer nuestra propuesta de soluci´on y los resultados obtenidos. 1.2 Estructura del reporte Para finalizar esta introducci´on aparece a continuaci´on la estructura del resto del reporte, que inicia con la metodolog´ıa KDSM secci´on §2 donde se introducen una serie de conceptos b´asicos para su mejor comprensi´on, seguidos de la descripci´on detallada de los pasos que la conforman. En la secci´on §3 se describe el ´ambito en el cual se encuentra situado el dominio de nuestro caso de estudio. La secci´on §4 contiene la informaci´on sobre las matrices de datos pertenecientes al caso de estudio. La informaci´on y resultados de la aplicaci´on de la metodolog´ıa KDSM al dominio de estudio del ´ambito laboral se encuentran en la secci´on §5 y, finalmente, en las secciones §6 y §7 se exponen las conclusiones obtenidas de la aplicaci´on de la metodolog´ıa KDSM y se distinguen una serie de trabajos por hacer que mejorar´ıan el desempe˜no de nuestra metodolog´ıa. 2 2 Metodolog´ıa para el descubrimiento de conocimien- to en medidas seriadas cortas y repetidas (KDSM) En esta secci´on se presentan en detalle los pasos de la metodolog´ıa propuesta KDSM, cuya justificaci´on se detalla en el reporte t´ecnico [RGRC01]. A continuaci´on se presentan una serie de conceptos b´asicos a fin de dar mayor claridad a la exposici´on de la metodolog´ıa KDSM. 2.1 Conceptos B´asicos Resumen de Dise˜no de Experimentos. El objetivo del dise˜no de experimentos es estudiar c´omo realizar comparaciones, lo m´as homog´eneas posibles, para aumentar la probabilidad de detectar cambios o identificar atributos relevantes sobre cierto fen´omeno de inter´es [Pn89]. Comprobar si un evento mejora un proceso requiere comparar los resultados antes y despu´es de la ocurrencia del mismo. Cuando existe una variabilidad alta entre los resultados—o, en otros t´erminos, un gran error experimental—s´olo se detectar´an como relevantes, aquellos eventos que produzcan cambios muy grandes con relaci´on al error experimental. El objetivo de un experimento es estudiar el efecto que sobre un atributo de inter´es tienen un conjunto de otros atributos, factores o eventos. En cualquier experimento en que se investiga el efecto de un evento, existen a priori un gran n´umero de atributos que pueden influir sobre los resultados y presentan lo que se conoce como confusi´on de los efectos. Conceptualmente existen tres caminos para eliminar el efecto de un atributo: 1. mantenerlo fijo durante toda la realizaci´on del experimento; 2. reorganizar la estructura del experimento de manera que las comparaciones de inter´es se efect´uen para valores fijos de este atributo, lo que supone eliminar estad´ısticamente su efecto y 3. evitar su influencia aleatorizando su aparici´on en eventos. Dadas las tareas de la metodolog´ıa, secci´on anterior, se debe reorganizar la estructura de datos del caso de estudio, de forma que se elimine el factor de bloque que ejerce el individuo sobre los eventos y poder estudiar s´olo el comportamiento de los mismos. Para m´as informaci´on sobre el dise˜no de experimentos ver [Pn89, WMS98]). Factor de bloque. Se denomina factor de bloque [Pn89] al factor (objeto o atributo) que tiene un efecto sobre la respuesta, que aunque no es directamente de inter´es, se debe considerar en el experimento para obtener comparaciones homog´eneas en los grupos de observaciones donde dicho factor se mantiene constante. Para dar un ejemplo haremos referencia al factor de bloque, presente en el caso de estudio del dominio de estudio de la secci´on §3. As´ı tenemos, 3 curvas del ´ındice de contrataci´on a lo largo de 3 meses tras la impartici´on de un curso, el municipio en donde se imparti´o el curso no es directamente de inter´es, pero influye en la representaci´on y hay que tenerlo en cuenta porque determina bloques de curvas—las de un mismo municipio—con influencia. Para evitar la influencia del factor de bloque que conforma el individuo sobre las medidas seriadas, se determin´o realizar la diferencia entre las medidas seriadas del evento actual y las medidas seriadas del evento anterior (o viceversa). As´ı, se puede medir el efecto per se de un evento dado sobre el atributo de inter´es, independientemente de las caracter´ısticas del individuo. Estos datos, s´olo toman en cuenta el incremento o decremento del atributo Ydebido a la ocurrencia del evento, comparando lo sucedido antes y despu´es de la ocurrencia del mismo. Prueba de Kruskal-Wallis. La mayor´ıa de los m´etodos estad´ısticos (m´etodos param´etricos) para la prueba de hip´otesis estad´ıstica2se basan en la suposici´on de que las muestras aleatorias se seleccionan de poblaciones normales. Sin embargo, en situaciones reales a menudo existe escasez de conocimiento acerca de las distribuciones de las poblaciones fundamentales. Adem´as en muchas aplicaciones, de la ciencia y la ingenier´ıa, los datos se reportan como una escala ordinal tal que es bastante natural asignar rangos a los datos. Es as´ı que, en este tipo de situaciones, los analistas de datos utilizan con frecuencia m´etodos estad´ısticos alternativos (m´etodos no param´etricos) ya que resultan atractivos por lo intuitivos que suelen ser. Uno de estos m´etodos no param´etricos es la prueba de Kruskal-Wallis, tambi´en conocida como prueba H de Kruskal-Wallis. Introducida en 1952 por W. H. Kruskal y W. A. Wallis, la prueba es un procedimiento no param´etrico para probar la igualdad de las medias en el an´alisis de la varianza de un atributo cuando el experimentador desea evitar la suposici´on de que las muestras se seleccionaron de poblaciones normales. Para probar la hip´otesis H0de que kmuestras independientes son de poblaciones id´enticas, calcular h=12 n(n+1) k Pi=1 r2 i ni−3(n+ 1) Si hes mayor o igual al valor cr´ıtico χ2 α, rechazar H0en el nivel de significancia α; en cualquier otro caso, aceptar H0. En otras palabras, la prueba de Kruskal-Wallis resulta de gran inter´es pues, permite determinar qu´e atributos son relevantes, estad´ısticamente hablando, en la conformaci´on de clases como las obtenidas en los casos de estudio de la secci´on §5 y el presentado en [RGR01]. Gracias a esta prueba, se logra optimizar la interacci´on con el experto ahorrando tiempo de an´alisis de los datos de estudio, pues s´olo trabaja con los atributos relevantes descartando aqu´ellos que no son de su inter´es para el objetivo que pretende lograr. Para m´as detalles sobre la prueba de Kruskal-Wallis ver [WMS98]. 2Una hip´otesis estad´ıstica es una aseveraci´on o conjetura con respecto a una o m´as poblaciones, m´as detalles en [WMS98] 4 CIADEC. El sistema CIADEC (Caracterizaci´on e Interpretaci´on Autom´atica de Descripciones Conceptuales en Dominios poco Estructurados usando atributos cuantitativos) es un sistema h´ıbrido (inteligencia artificial y estad´ıstica) que surge de la necesidad de automatizar la caracterizaci´on e interpretaci´on de clases en dominios poco estructurados[Gib94] previamente particionados. Mediante la automatizaci´on de la metodolog´ıa formal, denominada Generaci´on Autom´atica de Reglas Difusas en Dominios poco Estructurados con atributos cuantitativos [VG01a], se pretende reducir el tiempo para la caracterizaci´on e interpretaci´on de descripciones conceptuales usando atributos cuantitativos, dando agilidad tanto a las actividades asociadas al an´alisis de datos como a la obtenci´on de informaci´on relevante que posteriormente sea ´util en la gesti´on y toma de decisiones en esa clase de dominios. Adem´as, la automatizaci´on de esta metodolog´ıa ofrece un conjunto de herramientas que permiten: •Construir un sistema de reglas. •Visualizar funciones de pertenencia de un atributo Xka las distintas clases. •Evaluar un conjunto de objetos nuevos de acuerdo a las reglas generadas. •Validar la calidad de las clases resultantes. En resumen, CIADEC permite determinar qu´e atributos caracterizan, estad´ısticamente hablando, a las clases. Gracias a CIADEC, en combinaci´on con la prueba de Kruskal-Wallis, se mejora la actuaci´on del experto, ahorrando su tiempo de an´alisis, pues s´olo trabaja atributos relevantes y caracterizadores. Para m´as detalles sobre CIADEC ver [VG01b, V´ 02]. 2.2 Metodolog´ıa KDSM Los pasos que conforman la metodolog´ıa para el descubrimiento de conocimiento en medidas seriadas (KDSM) se describen a continuaci´on. Sea YT, una matriz de datos que contiene medidas seriadas cortas y repetidas en el tiempo, se puede representar como: YT=Y0|Y Obtenci´on de la matriz basal Y0.Se extrae una matriz de basales3Y0desde una base de datos que contiene medidas seriadas cortas y repetidas en el tiempo (tomando Y0= [Yt i0], i={1. . . n},t={0. . . r}). Esta matriz contendr´a los datos que representan las condiciones iniciales de los individuos (curvas a priori para cada individuo). 3La primera toma de medidas seriadas para cada individuo. Cabe la posibilidad de una excepci´on en situaciones donde siempre ocurren eventos; en estos casos el analista y el experto determinar´an que conjunto de medidas seriadas ser´an las basales para poder aplicar la metodolog´ıa KDSM. 5 Cluster Jer´arquico de Y0.Se realiza el cluster jer´arquico de la matriz de basales Y0, para encontrar la estructura a priori de los individuos, antes de la ocurrencia del primer evento E. Por ejemplo, con relaci´on al caso que se presenta en la secci´on §3, se identifican grupos de municipios que al iniciar la capacitaci´on tienen curvas parecidas relativas al atributo de inter´es Y. YP 0=P(Y0) = Y1 10 Y2 10 ... Yr 10 cP k Y1 20 Y2 20 ... Yr 20 cP l . . .. . .. . .. . .. . . Y1 n0Y2 n0... Yr n0cP m ∼[Y0|P] Interpretaci´on de YP 0a partir de la matriz X.Para la interpretaci´on de las clases obtenidas a partir del cluster de Y0se caracteriza el patr´on de curva t´ıpico de cada clase y se estudia la tendencia general de las clases y la variabilidad entre ellas (la curva media de cada clase), por medio del m´odulo generador de gr´aficos de COLUMBUS. Despu´es se lleva a cabo la proyecci´on en Pde los atributos caracter´ısticos de los individuos (matriz X) y se buscan aqu´ellos atributos que son relevantes y que determinan la estructura a priori. Sea SPun sistema de interpretaci´on que trabajar´a con la partici´on obtenida en el paso 2. Mediante dicho sistema (CIADEC), se obtiene la caracterizaci´on de la matriz X que permite la interpretaci´on de P. SP(X) = x11 x12 ... x1kcP k x21 x22 ... x2kcP l . . .. . .. . .. . .. . . xn1xn2... xnk cP m Obtenci´on del conjunto de reglas. La inducci´on de Reglas se realiza a partir de la comparaci´on entre clases, bas´andose en los atributos Xk. El an´alisis de la partici´on, del paso anterior, por medio de alg´un m´etodo o metodolog´ıa (M), permite obtener un conjunto de reglas R0, expresadas en l´ogica de primer orden. Donde M:X|YP 07→ R0, donde R0conforma la Base de Conocimiento obtenida de los basales, BC0. En este paso, actualmente trabajamos 2 formas de obtenci´on de reglas que reflejen la estructura de los datos: 1. boxplots m´ultiples de la proyecci´on de atributos sobre una partici´on. ´ Estos se presentan al experto para que ´el determine qu´e atributos son de su inter´es y 6 4.2 Descripci´on de los atributos en la matriz Y Atr. Etiqueta Descripci´on Tipo 1 ec Etiqueta del curso Num´erico 2 ic1 Medida seriada basal correspondiente al no. de personas colocadas Num´erico 3 ic2 1er Medida seriada correspondiente al no. de personas colocadas Num´erico 4 ic3 2da Medida seriada correspondiente al no. de personas colocadas Num´erico 5 ic4 3ra Medida seriada correspondiente al no. de personas colocadas Num´erico 6 ic5 4ta Medida seriada correspondiente al no. de personas colocadas Num´erico 7 ic6 5ta Medida seriada correspondiente al no. de personas colocadas Num´erico 4.3 Descripci´on de los atributos en la matriz Z Atr. Etq. Descripci´on Tipo 1 ec Etiqueta del curso1. Cadena 2 no.aut. N´umero de autorizaci´on de cada curso. Num´erico 3 c.por rama econ. Especificaci´on del ramo econ´omico de cada curso. Cadena 4 especialidad Actividad espec´ıfica en que se desarrolla el curso. Cadena 5 centro de capacitaci´on Lugar en donde se imparte el curso. Cadena 6 localidad Poblado en donde se desarrollan los cursos. Cadena 7 municipio Territorio que pertenece al Estado Cadena 8 u.op Oficina coordinadora de los cursos Num´erico 9 prog. Personas programadas presupuest´almente en cada Num´erico curso. 10 t.i. Total de personas inscritas en cada curso Num´erico 11 i.h. Hombres inscritos Num´erico 12 i.m. Mujeres inscritas Num´erico 13 t.e. Total de personas egresadas de cada curso. Num´erico 14 e.h. Hombres egresados Num´erico 15 e.m. Mujeres egresadas Num´erico 16 t.c. Total de personas colocadas2. Num´erico 17 c.h. Hombres colocados Num´erico 18 c.m. Mujeres colocadas Num´erico 19 f.inicio Fecha en que inicia el curso Cadena 20 f.termino Fecha en que termina el curso Cadena 21 duraci´on Tiempo de duraci´on de cada curso3. Cadena 22 horario Turno en que se lleva a cabo el curso4. Cadena 23 inversi´on Cantidad monetaria invertida en los cursos5. Num´erico 24 modalidad Modo de impartici´on del curso6. Cadena 1Define curso, municipio y orden consecutivo. 2Cantidad de personas que obtuvieron un puesto de trabajo dentro de una empresa o que se encuentran trabajando por su cuenta. 3M´ınimo un mes, m´aximo tres meses. 4Matutino, Vespertino o Mixto. 5Pago de las becas, instructores y material dependiendo de la modalidad de cada curso. 6Es el tipo de curso pudiendo ser: Mixta, Mixta en las Micro y Peque˜nas Empresas, Escolarizada, Autoempleo, Proyecto de modernizaci´on de la educaci´on t´ecnica y la capacitaci´on, e iniciativas locales de empleo. 13 5 Aplicaci´on de KDSM al dominio laboral Para el an´alisis de los datos del Gobierno de Chihuahua, se aplic´o la metodolog´ıa KDSM logr´andose sus 3 tareas principales: 1. la caracterizaci´on de la estructura conformada por los municipios sobre el primer ´ındice de contrataci´on, es decir, el establecimiento de las condiciones iniciales; 2. el an´alisis del efecto de cada curso aislado eliminando el factor de bloque que conforman los municipios; y 3. la identificaci´on de las caracter´ısticas relevantes de los cursos, la descripci´on de su estructura y su interpretaci´on. 5.1 Caracterizaci´on de los Municipios Al realizar los pasos 1–4 de la metodolog´ıa KDSM §2, obtuvimos como resultado una base de conocimiento conformada por reglas que describen la estructura de los municipios en relaci´on al primer ´ Indice de Contrataci´on (IC). A continuaci´on, figura 1, podemos ver el ´arbol jer´arquico obtenido al realizar la clasificaci´on de la matriz de basales Y0. Es decir la clasificaci´on de las primeras medidas seriadas del IC. 0 48.00 96.00 C1 C2 C3 Figura 1: Estructura de los Municipios. La figura 1 le sugiri´o a la experta que el corte m´as conveniente era en 3 clases: Clase C1 Municipios de Meoqui, Ocampo, Camargo, Rosario, Delicias, Guadalupe y Calvo, Aquiles Serdan, Valle de Zaragoza y Parral. Clase C2 Municipios de Madera, Santa Isabel y Ojinaga. Clase C3 Municipios de Cuaht´emoc, San Francisco del Oro, Balleza, Jimenez y Allende. 14 Para iniciar la interpretaci´on de dichas clases se analiz´o la figura 2 donde se puede visualizar la caracterizaci´on del patr´on de curva t´ıpico de cada clase (curva media de cada clase) adem´as de la tendencia general de las clases y la variabilidad entre ellas. IC Medida del IC 0 1 3 4 6 c1 c2.......... c3 123456 ............................................................................. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ....................... Figura 2: Curvas medias de las 3 clases. Podemos ver que la clase C1 (de 9 municipios) presenta atributos que le distinguen especialmente porque se encuentran dentro de rangos donde los l´ımites m´ınimos y m´aximos son los m´as peque˜nos y mayores de las 3 clases. Como ejemplo se citan algunos de los atributos que son de especial inter´es para la experta: extensi´on territorial oscila desde 335km2a 16066km2(ver figura 3), poblaci´on econ´omicamente activa (PEA) varia entre 702 hasta 44416 personas, PEA desocupada va desde 5 a 473 personas y las unidades de empresas manufactureras de 0 a 560 empresas. Adem´as se puede ver en la figura 2 (l´ınea continua) que la contrataci´on m´as elevada se realiza en la primera y segunda mediciones. Figura 3: Extensi´on territorial por clase. En la clase C2 (3 municipios) se presentan valores que en general se sit´uan m´as cerca del punto medio de los rangos citados anteriormente. Donde la extensi´on territorial varia desde 1040km2a 9500km2(figura 3), poblaci´on econ´omicamente activa (PEA) varia entre 1375 hasta 9935 personas, PEA desocupada va desde 18 a 235 personas y las unidades de empresas manufactureras de 9 a 110 empresas. Adem´as se puede ver en la figura 2 (l´ınea de puntos) que la contrataci´on se realiza de forma m´as equilibrada distribuyendo su grosor entre la segunda y la cuarta mediciones. Finalmente en la clase C3 (5 municipios) se tienen atributos con valores dispersos en rangos menores a la clase C1. La extensi´on territorial varia desde 695km2a 11074km2 15 (figura 3), poblaci´on econ´omicamente activa (PEA) va desde 1909 hasta 42671 personas, PEA desocupada de 18 a 532 personas y las unidades de empresas manufactureras de 16 a 452 empresas. Adem´as se puede ver en la figura 2 (l´ınea discontinua) que el comportamiento muestra que en la primera y segunda mediciones se colocan en promedio de 2 a 3 personas pero se aprecia que en la quinta medici´on hay un incremento considerable. 5.2 Proceso de Caracterizaci´on (usando CIADEC) En lo habitual cuando los individuos (en nuestro caso municipios) de un dominio complejo y real son descritos por atributos cuantitativos, no es com´un encontrar aquellas que caractericen a las distintas clases de una partici´on dada (o de referencia); as´ı para realizar su an´alisis se debe relajar este concepto al de atributos parcialmente caracterizadoras [VG01a], esto es, atributos que son compartidos por otras clases y que en un sistema de reglas, se representan con un grado de pertenencia difuso a cada una de las clases de la partici´on de referencia, es decir, reglas difusas (en el sentido de certeza a una clase). Esto plantea un problema serio en la determinaci´on de los atributos caracterizadores y en consecuencia en la caracterizaci´on y calidad de las clases resultantes de una clasificaci´on de referencia, considerando la calidad de una clasificaci´on, desde un punto de vista subjetivo como la utilidad o significado que las clases resultantes puedan tener para el experto, ya que no existe un criterio objetivo que determine esta calidad. Como una aproximaci´on al proceso de caracterizaci´on y en consecuencia a la obtenci´on de una clasificaci´on “´util” o de “calidad”para los prop´ositos del estudio se propone realizar los siguientes pasos: 1. una estad´ıstica descriptiva que nos proporcione informaci´on preliminar sobre la variabilidad de las mediciones, descripci´on gr´afica de los boxplot para identificar los atributos caracterizadores y algunos otros par´ametros ´utiles si los hubiera, 2. la inclusi´on del conocimiento a priori del experto para obtener las restricciones sem´anticas (reglas) sobre la clases resultantes de la partici´on que faciliten el significado de las clases, 3. la aplicaci´on de CIADEC para la obtenci´on del sistema de reglas que proporcionen las caracter´ısticas relevantes de ´estas para 4. determinar la calidad de las clases en t´erminos del “significado” o “utilidad”de ´estas, 5. ´estas clases a la vista y an´alisis de la experta decidir si la estructura descubierta es ´util, sino repetir el proceso; considerando otra clasificaci´on donde se puede o no incluir nuevas restricciones sem´anticas, nuevo conocimiento del experto o bien combinando atributos en forma de reglas difusas que permitan obtener una nueva estructura de forma que ´esta tenga significado para el objetivo del estudio. Si la clasificaci´on es ´util entonces continuamos con 6a el proceso de interpretaci´on de resultados y la estructura descubierta en los datos puede usarse como nuevo conocimiento para la toma de decisiones o para continuar con 16 6b la segunda tarea de la metodolog´ıa KDSM. En la figura 4 muestra este proceso de caracterizaci´on de la matriz de basales Y0a partir de la matriz X. Utilidad de las clases Estadística descriptiva Clustering con o sin reglas Calidad de las clases Medida? Descripciones conceptuales de las clases Interpretaciones 6a) 2a. Tarea de KDSM 6b) 1) 2) 3) 4)5) Figura 4: Diagrama del Proceso de Caracterizaci´on. Despu´es de haber realizado la estad´ıstica descriptiva sobre las medidas del IC para determinar la variabilidad de ´estas se realiz´o la prueba de Kruskal-Wallis [SC88] y el boxplot [VG01b, V´ 02] sobre todos los atributos de la matriz X, para identificar aqu´ellos relevantes y caracterizadores, estad´ısticamente hablando no se obtuvo ninguna informaci´on al respecto. Sin embargo, la experta determin´o que el atributo de extensi´on territorial (ET) es importante porque seg´un la infraestructura es una posibilidad abierta para el sector empresarial de establecer nuevas empresas o de mantener solamente el m´ınimo ya existente. Por lo que, es un indicador para la Secretar´ıa de Trabajo y Previsi´on Social de cu´antos y qu´e tipo de cursos es conveniente impartir. Los atributos de poblaci´on econ´omicamente activa (PEA) y, principalmente, la PEA desocupada, son determinantes porque los cursos de capacitaci´on de PROBECAT van dirigidos a este tipo de poblaci´on, concretamente la que esta sin empleo. La poblaci´on total es de inter´es porque es un indicador del costo social. El total de escuelas porque refleja la infraestructura para el soporte a los cursos y finalmente, el atributo de las unidades econ´omicas del sector manufacturero es de suma importancia pues, en este programa piloto, tiene relaci´on directa con el tipo de curso que se esta estudiando. En resumen los atributos de ET, poblaci´on total, PEA y PEA desocupada, total de escuelas y unidades econ´omicas del sector manufactura son importantes, de acuerdo a la experiencia de la experta, debido a que la impartici´on de cursos y su contenido est´an sumamente relacionados con la poblaci´on sin empleo y el territorio que ´este ocupa. En la figura 5 se pueden apreciar los boxplots de los atributos de inter´es para lograr el objetivo de la experta. A partir de estos atributos se aplic´o CIADEC para obtener el sistema de reglas que permitiera la caracterizaci´on de cada una de las clases. Sin embargo, no se obtuvieron atributos caracterizadores y por lo tanto la clasificaci´on obtenida no fue ´util para los prop´ositos del estudio. Como una aproximaci´on al problema de encontrar una clasificaci´on “´util”se decidi´o combinar los atributos m´as significativos para la experta: ET (extensi´on 17 (a) Extensi´on Territorial (km2)(b) Poblaci´on total (c) Pob. econ. activa (d) PEA desocupada (e) Total de escuelas (f) U. econ. del sector manufactura Figura 5: Boxplots de los atributos de inter´es para la experta. territorial) y PEAD (Pob. Econ. Act. Desoc.) e introducir conocimiento, a priori de la experta, a trav´es de reglas difusas que se utilizan como “sesgo”en la siguiente tarea de la metodolog´ıa KDSM. Para la “fuzificaci´on”de estos atributos se tomo la experiencia de la experta definiendo los rangos de valores de dichos atributos en tres etiquetas ling¨u´ısticas: peque˜no (p), mediano (m) y grande (g), as´ı se tiene: Para el atributo ET: •hasta 1,000 m2la etiqueta peque˜na (p) •entre 1,000 y 10,000 m2la etiqueta mediana (m) •m´as de 10,000 m2la etiqueta grande (g) 18 Para el atributo PEAD: •hasta 30 personas la etiqueta peque˜na (p) •entre 30 y hasta 270 personas la etiqueta mediana (m) •m´as de 270 personas la etiqueta grande (g) As´ı, considerando Ael conjunto de atributos, se tiene que A={NI,. . .,ET ,. . ., PEAD,. . .,P MA}6y el conjunto de reglas obtenidas son: 1. Si (xiET ←p∧xiP EAD ←p)−→ CR 2. Si (xiET ←p∧xiP EAD ←m)−→ CU 3. Si (xiET ←p∧xiP EAD ←g)−→ CU 4. Si (xiET ←m∧xiP EAD ←p)−→ CR 5. Si (xiET ←m∧xiP EAD ←m)−→ CD 6. Si (xiET ←m∧xiP EAD ←g)−→ CU 7. Si (xiET ←g∧xiP EAD ←p)−→ CR 8. Si (xiET ←g∧xiP EAD ←m)−→ CT 9. Si (xiET ←g∧xiP EAD ←g)−→ CU donde: xiET es el valor del atributo ET (extensi´on territorial) para el i-´esimo municipio y xiP EAD es el valor del atributo PEAD (poblaci´on econ. activa desocupada) para el i-´esimo municipio. Una vez obtenidas las reglas se ponen a consideraci´on de la experta para que ella valore la representaci´on que hacen de la estructura y determine cu´ales de ellas le son de utilidad. 5.3 An´alisis del efecto de cada curso Una vez que se llevaron a cabo los pasos de la metodolog´ıa KDSM correspondientes a la primera tarea y que se obtuvieron las reglas que representan el conocimiento que es de utilidad para el objetivo del an´alisis, se procede a realizar la segunda tarea de KDSM que comprende los pasos 5-7 correspondientes al an´alisis del efecto de cada curso aislado, a partir de las diferencias7de los ´ındices de contrataci´on IC, eliminando el factor de bloque que conforman los municipios sobre los cursos. El total de reglas fueron nueve, las cuales fueron evaluadas en el conjunto de objetos e indujeron una nueva clasificaci´on conformada por las clases: U, D, T y R. Donde U, D y T reflejan el conocimiento de la experta y R conforma la clase residual o de los objetos que no se contemplan en dicho conocimiento. 6Por razones de simplicidad reducimos la notaci´on de los atributos a etiquetas ling¨u´ısticas. 7Diferencias debido a que eliminan el factor de bloque establecido por los municipios 19 0 291.00 582.00 UD Figura 6: Estructura de los cursos. En la figura 6, podemos ver el ´arbol jer´arquico obtenido al realizar la ClBR de la matriz de las diferencias entre los´ındices de contrataci´on. Donde la experta determin´o que el corte m´as conveniente era en 13 clases debido a que 2 de ellas reflejan una situaci´on de gran inter´es y utilidad para los objetivos de su estudio de donde logr´o resultados importantes y novedosos que se ver´an m´as adelante. Clase U: COC-03-02, CCA-15-14, CCU-01-00, CMA-01-00, CD-05-04, CCA-10-09, CCA- 04-03, CMA-04-03, CCA-12-11, CMA-02-01, CCA-07-06, CCA-02-01, CCU-03-02, CCA-17-16, CCA-14-13, COC-04-03, CCA-08-07, COC-02-01, CCA-05-04, CD-03- 02, CD-04-03, CCU-02-01, CD-01-00, CCU-04-03, CCA-11-10, CCA-09-08, CD- 06-05, CCA-03-02, CCA-06-05, CCA-01-00, COC-01-00, CCA-16-15, CCA-13-12, CMA-03-02 y CD-02-01. 5 cursos se impartieron en el municipio de Ocampo. Su especialidad fue corte y confecci´on y su modalidad de autoempleo. 18 cursos en el municipio de Camargo, con especialidad de costura industrial y en modalidad mixta. 5 cursos en el municipio de Madera, con especialidad de corte y confecci´on en modalidad de autoempleo. 5 cursos en Cuaht´emoc de corte y confecci´on y en modalidad de autoempleo. 7 cursos en Delicias de corte y confecci´on y de modalidad autoempleo. Clase D: CPA-19-18, CGC-02-01, CRO-02-01, CPA-13-12, CJI-02-01, CPA-16-15, CGC- 01-00, CPA-05-04, CME-01-00, CPA-20-19, CPA-02-01, CME-04-03, CPA-06-05, CPA-01-00, CPA-17-16, CPA-10-09, CPA-04-03, CPA-11-10, CPA-08-07, CPA-14- 13, CME-02-01, CRO-01-00, CPA-15-14, CPA-03-02, CPA-07-06, CJI-04-03, CPA- 09-08, CPA-12-11, CJI-03-02, CPA-18-17, CME-03-02, CPA-21-20, CJI-05-04, CJI- 06-05, CGC-03-02 y CJI-01-00. 22 cursos en el municipio de Parral, con especialidad en costura industrial y modalidad de capacitaci´on mixta. 4 cursos en Guadalupe y Calvo de corte y confecci´on y de modalidad autoempleo. 20 5 cursos en Meoqui de corte y confecci´on y de modalidad autoempleo. 3 cursos en Rosales de corte y confecci´on y de modalidad autoempleo. 7 cursos en Jimenez de costura industrial y de modalidad capacitaci´on mixta. Residuales: CSF-04-03, CB-04-03, CSF-01-00, COJ-01-00, COJ-04-03, CA-03-02, CSI- 02-01, CVZ-03-02, CB-02-01, CA-02-01, CVZ-02-01, CA-04-03, CAS-01-00, CVZ- 04-03, CAS-03-02, CVZ-01-00, COJ-03-02, CSF-02-01, CA-01-00, CAS-02-01, CSI- 03-02, CB-01-00, CSF-03-02, CAS-04-03, CSI-01-00, CB-03-02 y COJ-02-01. La experta decidi´o omitir las clases residuales de su an´alisis debido a que no representan informaci´on de su inter´es. Por otra parte, representan s´olo el 20 % de los datos que para este caso de estudio en particular son irrelevantes. Para iniciar la interpretaci´on de ´estas clases se caracteriz´o el patr´on de curva t´ıpico de cada una de las 2 clases de inter´es para la experta (curva media de cada clase: Clase U y Clase D) figura 7 para visualizar la tendencia general de las clases as´ı como la variabilidad entre ellas. Se descartaron las clases residuales debido a que no tienen ning´un significado para la experta. Se puede observar como ambas clases presentan una tendencia inversa entre ellas, donde la Clase U (l´ınea continua) se encuentra entorno a valores negativos, con excepci´on de la 4ta medici´on, es decir que el grosor de la contrataci´on se presenta en esta medida, y la Clase D (l´ınea a puntos), entorno a valores positivos, que aunque discretos, indican que la contrataci´on en general es estable a lo largo del tiempo de monitorizaci´on del PROBECAT. IC (diferencia) Medida del IC -1 -0.5 0 0.5 1 U D 123456 Figura 7: Curvas medias de las 2 clases. 5.4 Identificaci´on de las caracter´ısticas relevantes de los cursos Para la identificaci´on de las caracter´ısticas relevantes de los cursos, la descripci´on de su estructura y su interpretaci´on se llevo a cabo la tercer y ´ultima tarea de la metodolog´ıa KDSM correspondiente a los pasos 8 y 9. Para ello se identificaron los atributos relevantes y caracterizadores de la proyecci´on de las caracter´ısticas de los cursos en las clases obtenidas de la ClBR en las diferencias de ICs, estad´ısticamente hablando, por medio de la prueba Kruskal-Wallis [SC88] y la metodolog´ıa CIADEC [VG01a, VG01b]. Una vez identificados los atributos relevantes de la proyecci´on de la matriz de caracter´ısticas de los cursos en las clases obtenidas con la ClBR de las diferencias—que 21 (a) Especialidades (b) Modalidades (c) Inversi´on Econ´omica (d) Total Inscritos (e) Total Egresados (f) Total Contratados Figura 8: Boxplots de los atributos relevantes y de inter´es para la experta. determinan en alg´un sentido el comportamiento de los municipios—la experta procedi´o a dar significado a los mismos. Se encontr´o que la clase U se compone de 40 cursos de los cuales 22 corresponden a la modalidad de autoempleo capacitando aproximadamente a 440 personas, en donde la inversi´on econ´omica oscil´o entre $4000 USD hasta $9500 USD por curso figura 8(c). La mayor´ıa de los cursos iniciaron al 100 % de su capacidad (20 personas) logrando que tiempo despu´es, al t´ermino del curso, se ocupara aproximadamente un 70 % de los participantes figura 8(f); ya sea trabajando por cuenta propia o bien, uni´endose en microempresas. Por otra parte, tenemos 18 cursos de modalidad mixta capacitando aproximadamente a 290 personas, en donde la inversi´on econ´omica oscila entre $2200 USD y $6500 USD por curso figura 8(c). Donde se logr´o una contrataci´on para un puesto de trabajo del 85 % 22