Integración en Matterhorn de técnicas de asistencia a la transcripción de audio
Abstract
Este proyecto está orientado a la integración en Opencast Matterhorn de técnicas interactivas para la transcripción asistida de audio. El principal objetivo del proyecto es llevar a cabo esta integración de acuerdo con los principios que guían el diseño de la plataforma Matterhorn, ésta es una plataforma open-source para la gestión y administración de contenidos multimedias de ámbito académico
Full text
memoria 2012/7/19 12:32 page i #1 i i UNIVERSITAT POLITÈCNICA DE VALÈNCIA ESCUELA TÉCNICA SUPERIOR DE INGENIERÍA INFORMÁTICA DEPARTAMENTO DE SISTEMAS INFORMÁTICOS Y COMPUTACIÓN Integraión en Matterhorn de ténias de asistenia a la transrip ión de audio. Proyeto nal de arrera - Ingeniería Informátia Alejandro Pérez González de Martos Sup ervisado p or: Dr. Alfons Juan-Císar Dr. Jorge Civera Saiz 19 de julio de 2012
memoria 2012/7/19 12:32 page i i #2 i i i i APGM-DSIC-UPV
memoria 2012/7/19 12:32 page iii #3 i i Índie general 1. Intro duión 1 1.1. Reono imiento automátio del habla . . . . . . . . . . . . . . . . . . 2 1.1.1. Historia y evoluión . . . . . . . . . . . . . . . . . . . . . . . . 2 1.1.2. Atualidad . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 1.2. Visión general del proyeto . . . . . . . . . . . . . . . . . . . . . . . . 4 2. Op enast Matterhorn 7 2.1. Intro duión y araterístias . . . . . . . . . . . . . . . . . . . . . . . 7 2.2. Desrip ión del sistema . . . . . . . . . . . . . . . . . . . . . . . . . . 8 2.2.1. Matterhorn mediaPakage . . . . . . . . . . . . . . . . . . . . . 10 2.2.2. Matterhorn workow . . . . . . . . . . . . . . . . . . . . . . . . 10 3. El rep ositorio p oliMedia 13 3.1. Caraterístias y formato . . . . . . . . . . . . . . . . . . . . . . . . . 13 3.2. Base de Datos p oliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . 14 3.3. Sistema de transrip ión automátia . . . . . . . . . . . . . . . . . . . 15 4. Repro dutor prototip o HTML5 19 4.1. Página prinipal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19 4.2. Repro dutor . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20 4.2.1. Repro dutor . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 4.2.2. Editor . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 4.3. Tip os y roles de usuario . . . . . . . . . . . . . . . . . . . . . . . . . . 22 4.4. Ediión interativa y medidas de onanza . . . . . . . . . . . . . . . . 23 4.5. Mo dos de interaión y tiemp o de respuesta . . . . . . . . . . . . . . . 24 4.6. Formatos de vídeo y transripiones . . . . . . . . . . . . . . . . . . . 25 4.6.1. Formatos de vídeo en HTML5 . . . . . . . . . . . . . . . . . . 25 4.6.2. Formato de transrip iones . . . . . . . . . . . . . . . . . . . . 25 5. Integraión en la plataforma Matterhorn 29 5.1. Persp etiva . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29 5.2. Sistema de Gestión de Transrip iones e interfaes . . . . . . . . . . . 30 5.3. Parte I: Integraión en el workow de Matterhorn . . . . . . . . . . . . 31 5.4. Parte I I: Sustituión/adaptaión del Engage Media Player . . . . . . . 33 iii
memoria 2012/7/19 12:32 page iv #4 i i Índie general 6. Conlusiones y traba jos futuros 35 6.1. Resumen . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 6.2. Conlusiones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 6.3. Traba jos futuros . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 iv APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 1 #5 i i Capítulo 1 Introduión Los repositorios de ontenido multimedia de ámbito aadémio están reiendo rápidamente debido al progresivo avane de las nuevas tenologías en nuestra so- iedad. Charlas, onferenias o lases son grabadas desde ualquier parte del mundo y publiadas para ofreer a aquellos que lo deseen la p osibilidad de visualizar su ontenido. En la era de la informaión, las universidades se adaptan al hoy en día medio de omuniaión por exelenia, Internet. Universidades a distania, omo la UNED 1 , lases no preseniales, pizarras digitales o plataformas de teleformaión son sin duda un buen ejemplo de ello. Es fundamentalmente p or este motivo p or el que los rep ositorios online omienzan a alb ergar grandes antidades de ontenidos eduativos, y p or el que la antidad de informaión disponible ree de manera exponenial a medida que las prinipales entidades emisoras, en este aso las universidades, adoptan p olítias de libre distribuión de ontenidos. El prinipal problema on el que nos enontramos a la hora de failitar el visionado de estos ontenidos al mayor número de p ersonas p osible es la variedad lingüístia existente. Aunque el inglés se onsolida ada vez más omo el idioma oial en el mundo globalizado en el que vivimos, los ontenidos eduativos de los distintos rep ositorios existentes sup onen una gran variedad de lenguas. Sin embargo, la mayoría de la informaión disp onible en estos rep ositorios no está ni transrita ni traduida a distintos idiomas, lo que además de solventar las diferenias lingüístias failitaría el visionado de los ontenidos a p ersonas on disapaidad. Debido a la gran antidad de ontenidos disp onible y a su rápido reimiento, la transrip ión y traduión manuales sup onen un tremendo oste y esfuerzo, lo que las hae prátiamente inviables. Es p or ello que la transrip ión automátia o reono imiento automátio del habla ha adquirido vital imp ortania, puesto que sup one el paso previo a la traduión automátia. El reono imiento de formas es la disiplina dentro del área de la Inteligenia Artiial donde se engloba el reono imiento automátio del habla. Este último sigue siendo hoy en día uno de los prinipales fo os de investigaión a nivel mundial debido a la gran omplejidad que supone. Atualmente, los sistemas de reonoimiento automátio del habla on mayor éxito se basan en redes de estados nitos esto ástias. 1 UNED, Universidad Naional de Eduaión a Distania. 1
memoria 2012/7/19 12:32 page 2 #6 i i Capítulo 1. Intro duión Sin embargo, los resultados obtenidos para voabularios amplios no son lo suientemente preisos omo para que resulten útiles p or si mismos. Hablando en términos generales, de un buen sistema de reono imiento automátio del habla para este ámbito p o demos esp erar de un 20 a un 40 p or iento de palabras mal reonoidas. Es neesaria por tanto la intervenión humana para mejorar la alidad de las transrip- iones ofreidas por el sistema de transrip ión automátia y obtener transrip iones suientemente preisas. Aun así, y teniendo en uenta la ingente antidad de informaión existente y generada día a día que neesita de ser transrita y traduida, la revisión y orreión puramente manual de transrip iones generadas automátiamente sup one una tarea uanto menos tediosa. Con el n de prop orionar una soluión efetiva y prátia al problema de la transripión semi-automátia, se estudiará la reaión de un sistema inteligente de ediión interativa de transrip iones. 1.1. Reono imiento automátio del habla 1.1.1. Historia y evoluión Durante las últimas déadas, la investigaión en el amp o del reonoimiento automátio del habla se ha venido desarrollando de una forma intensa, empujada p or los avanes en pro esamiento de señal, algoritmos, arquiteturas y plataformas de ómputo. Durante este p erio do se han onstruido sistemas para una amplia gama de apliaiones, que abaran desde tareas de reono imiento de p equeños onjuntos de palabras sobre líneas telefónias, hasta máquinas de ditado para grandes vo abularios on apaidad para asimilar ualquier tipo de habla [LRRL96℄. La historia del amp o de investigaión del reono imiento automátio del habla se ha venido llevando a ab o desde la segunda mitad del siglo XX. Los primeros intentos p or onstruir máquinas que realizaran tareas de reono imiento se remontan a la déada de los 50, uando diversos investigadores trataban de explotar los prinipios fundamentales de la fonétia aústia. En 1952, en los lab oratorios Bell, K. Davis, R. Biddulph y S. Balashek rearon un sistema eletrónio que p ermitía identiar para un solo hablante, pronuniaiones de los 10 dígitos realizadas de forma aislada [KHDB52℄. En 1959, en la University College de Londres, P. Denes trataba de desarrollar un sistema para reono er 4 voales y 9 onsonantes [RJ93℄. El asp eto más novedoso de su traba jo era el uso de informaión estadístia, aera de las seuenias válidas de fonemas en inglés. Sin embargo, to dos estos experimentos orresp onden a disp ositivos eletrónios. Los primeros exp erimentos de reono imiento desarrollados en ordenadores tienen lugar al nal de los años 50 y omienzo de los 60, prinipalmente en el Linoln Lab oratory a argo de J. Forgie y C. Forgie [Jua98℄. Es en la déada de los 60 uando se generaliza el uso de ordenadores en el amp o del reonoimiento del habla. Durante estos años se iniian varios proyetos que enarrilan la investigaión en esta área. Los años 70 representan un p erio do muy ativo para esta disiplina, distinguiéndose dos atividades prinipales: 2 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 3 #7 i i 1.1. Reono imiento automátio del habla Reono imiento de palabras aisladas. Reono imiento del habla ontinua. Se omienzan a obtener buenos resultados en el reonoimiento de palabras aisladas, y su uso omienza a ser viable en la prátia. En uanto al habla ontinua, los primeros traba jos ubrían el reono imiento de oraiones de un mismo lo utor on un voabulario aproximado de 1.000 palabras. Es a raíz de ésto que se advierte que el ono imiento sintátio, semántio y ontextual son fuentes de informaión. El sistema Hearsay I, onstruido p or la CMU 2 en 1973 era apaz de emplear informaión de tip o semántio para reduir el número de p osibles alternativas que el reono edor debía evaluar [Jua98℄. En los AT&T Bell Labs los investigadores omenzaron una serie de exp erimentos orientados a onseguir reono edores realmente indep endientes del lo utor para su uso en apliaiones telefónias [Jua98℄. A nales de los 70 y en los años 80 se progresa notablemente en la generalizaión en la onstruión de sistemas de reono imiento. Es aquí donde se pro due un giro meto dológio al pasar de méto dos basados en omparaión de plantillas a méto dos basados en el mo delado estadístio debido a la extensión en el uso de los Modelos Oultos de Markov 3 [RJ86℄ [Rab89℄ que es el mo delo usado en la atualidad para apturar y mo delar la variabilidad existente en el habla. Durante este mismo p erio do, el programa DARPA 4 , impulsó en Estados Unidos el desarrollo de mejores sistemas de reono imiento para habla ontinua y voabularios de tamaño medio y grande on indep endenia del lo utor. Muhas de las ontribuiones durante este p erio do y el prinipio de los años 90, provienen de los esfuerzos de la CMU a través de su sistema SPHINX[Lee89℄. La déada de los 90 sup one en ierta manera la ontinuidad en los ob jetivos ya propuestos, ampliando eso sí, el tamaño de los vo abularios a la vez que se diversian los amp os de apliaión. 1.1.2. Atualidad En estos últimos años ha reido el interés p or el estudio de los pro esos de re- ono imiento en ondiiones de ruido y adversas en general. Se intentan implementar nuevas ténias que mejoren los resultados del reono imiento, pues las soluiones existentes en la atualidad to davía no alanzan un grado de preisión elevado para vo abularios on gran número de palabras. Paree que la evoluión en el ámbito del reono imiento del habla durante los últimos años ha sido mediante la aumulaión de p equeñas mejoras que sup onen tareas muho más omplejas, debido prinipalmente al aumento notable en la velo idad de álulo y a ordenadores más p otentes en general. La investigaión y desarrollo atual se entran prinipalmente en estos tres puntos: Mejorar la robustez de los sistemas de reono imiento del habla, no solamente ante el ruido sino ante ualquier ondiión que sup onga la degradaión del rendimiento del sistema. 2 CMU, Carnegie Mel lon University. 3 En inglés Hidden Markov Models (HMM). 4 DARPA, Defene Advane Researh Ageny. APGM-DSIC-UPV 3
memoria 2012/7/19 12:32 page 4 #8 i i Capítulo 1. Intro duión Debido a que existe gran antidad de datos de habla humana, y a que sería demasiado ostoso transribir manualmente tanta antidad de informaión, la investigaión se entra en desarrollar nuevos méto dos de aprendiza je automáti- o que puedan emplear on ierta efetividad grandes antidades de datos sin etiquetar mediante aprendiza je no supervisado para la mejora del sistema. Por último, mejorar el entendimiento de la apaidad humana para omprender el habla, y emplear esta informaión para mejorar el rendimiento de los sistemas de reono imiento automátio del habla. 1.2. Visión general del proyeto Este proyeto está orientado a la integraión en Op enast Matterhorn de ténias interativas para la transrip ión asistida de audio. El prinipal ob jetivo del proyeto es llevar a abo esta integraión de auerdo on los prinipios que guían el diseño de la plataforma Matterhorn. Matterhorn es una plataforma open-soure para la gestión y administraión de ontenidos multimedia de ámbito aadémio. Las instituiones emplean Matterhorn para la grabaión de leiones, gestionar los vídeos existentes, publiar los mismos en distintos medios de distribuión y proporionar una interfaz de usuario para failitar su visionado. La intenión será pues integrar un mó dulo de reono imiento del habla que p ermita obtener de manera semi-automátia transrip- iones de los vídeos añadidos al sistema. Para llevar a ab o la onstruión de un sistema de reono imiento automátio del habla es neesario disponer de un numeroso onjunto de datos, en nuestro aso vídeos eduativos y sus transrip iones. Traba jaremos on el rep ositorio p oliMedia [dV12℄. PoliMedia es un serviio reiente p ensado para la reaión y distribuión de material eduativo en la Universidad Politénia de Valenia. Atualmente ontiene alrededor de 6.000 vídeos orresp ondientes a más de 1.000 horas de grabaión. Emplearemos este orpus para la implementaión de un software de reonoimiento que p ermita obtener transrip iones automátias para los vídeos del mismo. Sin embargo, no entraremos en muho detalle aera del diseño de este sistema puesto que no es ob jeto de este proyeto. Una vez seamos apaes de obtener transrip iones automátias de ierta preisión para los vídeos del rep ositorio, estudiaremos la manera de editarlas interativamente. Construiremos un repro dutor prototip o basado en HTML5 sobre el que se irán implementando nuevas funionalidades propias de la ediión y orreión interativa de transrip iones. Disutiremos el formato que deberán seguir las transrip iones en el sistema. En la atualidad el formato más extendido sea p osiblemente SubRip 5 , sop ortado p or la mayoría de reprodutores multimedia que p ermiten la visualizaión de subtítulos. Las transrip iones manuales de las que disp onemos para el rep ositorio poliMedia siguen el formato empleado p or Transrib er 6 , que se asemeja al de un do umento XML p ero no p ermite la ampliaión del mismo on nuevas etiquetas. Puesto que ni SubRip ni Transrib er permiten ser ampliados sin omprometer la 5 SubRip, extensión .srt. 6 Transrib er, extensión .trs. http://trans.soureforge.net. 4 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 5 #9 i i 1.2. Visión general del proyeto ompatibilidad de los mismos, neesitaremos un formato más exible que permita la representaión de ierta informaión relevante omo p or ejemplo medidas de onanza 7 o indiar que ierto tramo de la transrip ión ha sido mo diado manualmente. También hablaremos del rol que los distintos usuarios tendrán en el sistema. Deb emos tener en uenta que el usuario omún está interesado en el visionado del ontenido, p or lo que sup ondremos que no dediará muho tiemp o a la orreión de transrip iones defetuosas. Se implementará un serviio web enargado de gestionar la omuniaión entre el editor y el sistema de transrip ión automátia. El repro dutor hará uso de diho serviio web tanto para obtener las transrip iones de un vídeo determinado omo para gestionar las mo diaiones p or parte del usuario en las transrip iones. Por último veremos una propuesta de integraión de este sistema de transrip ión semi-automátia en la plataforma Matterhorn on el n de obtener un sistema evaluable en un entorno real y p osibilitar su implantaión en otros rep ositorios relaionados on Matterhorn. 7 Medidas de onanza, en inglés: ondene measures. APGM-DSIC-UPV 5
memoria 2012/7/19 12:32 page 12 #16 i i Figura 2.2: Diagrama de formaión y pro esamiento de un mediaPakage.
memoria 2012/7/19 12:32 page 13 #17 i i Capítulo 3 El repositorio poliMedia Emplearemos p oliMedia omo rep ositorio de vídeos eduativos sobre los que basaremos la exp erimentaión del proyeto. p oliMedia es un sistema diseñado en la Universidad Politénia de Valenia para la reaión de ontenidos multimedia de ap oyo a la do enia presenial, que abara desde la preparaión del material do ente hasta la distribuión a través de distintos medios (TV, Internet, CD, et.) a los destinatarios. Atualmente ontiene aproximadamente 6.000 vídeos orresp ondientes a más de 1.000 horas de grabaión. 3.1. Caraterístias y formato p oliMedia [dV12℄ es un sistema de produión de materiales eduativos de alidad. Es un reurso integrado on to das las herramientas de PoliformaT (plataforma de teleformaión de la UPV), y resulta muy adeuado omo ap oyo y omplemento a la enseñanza presenial. Se trata de un sistema ompletamente innovador y únio, disp onible sólo en la UPV, que p one a disp osiión del profesorado instrumentos, materiales y ténios para la grabaión y publiaión de vídeos eduativos. Por ello, no requiere onoimientos audiovisuales o ténios. El autor es el propietario inteletual de la obra. Los vídeos prinipalmente onsisten en la grabaión de una leión p or un profesor, on una duraión media aproximada de 10 minutos. Los temas o asignaturas sobre las que se disp one de grabaiones son muy variados. To das las grabaiones siguen un patrón muy similar. No han sido grabadas en distintas aulas sino que han sido realizadas en un aula habilitada y destinada exlusivamente para este n. En to das ellas se muestra, oupando la mayor parte de la pantalla, las transparenias o apuntes empleados p or el profesor para seguir la leión. En la esquina inferior dereha, oupando aproximadamente un uarto de pantalla se muestra al profesor o autor del vídeo. Cabe remarar que el área donde se muestran las diapositivas o transparenias es realmente la pantalla del ordenador que está manejando el profesor en el momento de la grabaión, p or lo que en iertos vídeos no se tratará exlusivamente de diap ositivas sino de ualquier tipo de ilustraión que pueda realizarse desde el mismo, omo 13
memoria 2012/7/19 12:32 page 14 #18 i i Capítulo 3. El rep ositorio p oliMedia p or ejemplo el manejo de un programa. Figura 3.1: Esquema de un vídeo p oliMedia El rep ositorio está organizado p or arp etas. Las arp etas existentes en el diretorio prinipal del rep ositorio ontienen los nombres ilustrativos del tema o asignatura a la que ontienen. Dentro de estas arpetas existen otras sub arp etas que ontienen los distintos vídeos que han sido grabados de diho tema. Los vídeos están almaenados en formato AVC/H.264 on diferentes ongura- iones. El 85 % de ellos tienen un tamaño de 1280x720 píxeles. El bitrate 1 medio varía entre 100 y 1500 kbps, p ero alrededor del 90 % presentan una tasa de bits entre 500 y 900 kbps. El formato de audio es AAC/LC estéreo (85 %) y mono (15 %) on freuenias de muestreo de 44.100 y 48.000 Hz. En el aso del audio, el 95 % de los bitrates medios varían de 30 a 60 kbps. 3.2. Base de Datos p oliMedia Disp onemos de una base de datos on informaión relativa a los vídeos existentes en el rep ositorio. Para ada uno de ellos disp onemos de su identiador (onsistente en un número hexadeimal de 32 arateres generado de manera aleatoria), la ruta relativa donde está almaenado, el profesor o profesores autores del mismo, el título y el tema al que pertenee, el número de repro duiones así omo otra informaión relevante. Una p equeña representaión del ontenido de la base de datos se muestra en la gura 3.2. Haremos uso de to da esta informaión uando pro edamos a la onstruión del repro dutor prototip o basado en HTML5. 1 Tasa de bits. 14 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 15 #19 i i 3.3. Sistema de transrip ión automátia Figura 3.2: Muestra del ontenido de la base de datos p oliMedia. 3.3. Sistema de transrip ión automátia Se ha onstruido un sistema de transrip ión automátia para el orpus p oliMedia de forma paralela a este proyeto. Aunque el diseño e implementaión de este sistema no forma parte del proyeto, sup one un asp eto lave en el desarrollo del mismo pues será la base sobre la que onstruiremos p osteriormente el sistema interativo de ediión de transrip iones. Por ello resumiremos brevemente sus araterístias y el pro eso seguido para su implementaión. El sistema de reono imiento automátio del habla se omp one de una etapa de prepro eso (mo delado de la señal voal), una etapa aústio-fonétia (modelado aústio de unidades léxias y/o subléxias) y una etapa sintátio-semántia (mo delado del lengua je). Estas dos últimas pueden ser ombinadas de manera seuenial o integrarse en un únio mó dulo. Para p osibilitar el entrenamiento de los mo delos, se ha transrito manualmente un sub onjunto del orpus. En la tabla 3.1 se muestra una pequeña omparativa del volumen del subonjunto empleado para el entrenamiento resp eto del orpus ompleto. Cuadro 3.1: Sub onjunto de p oliMedia empleado Conjunto Horas Videos orpus poliMedia 1350 6830 subonjunto empleado 119 732 porentaje total 8,85 % 10,72 % Los parámetros de los modelos aústio y de lengua je han de ser estimados mediante un onjunto de entrenamiento, en nuestro aso el formado por los vídeos del rep ositorio seleionados y sus orresp ondientes transrip iones manuales. El mo delo APGM-DSIC-UPV 15
memoria 2012/7/19 12:32 page 16 #20 i i Capítulo 3. El rep ositorio p oliMedia Audio Extracción de Características Vectores de Características Modelo Acustico P(x|w) Modelo Léxico Modelo de Lenguaje P(w) Clasificación w’=arg max P(w)·P(x|w) Transcripciones w Figura 3.3: Esquema general del sistema aústio está basado en HMMs 2 [Rab89℄, uyos estados representan distintas onguraiones del aparato fonador. De una onguraión se puede pasar a otra de auerdo on iertas reglas probabilístias. La gura 3.4 muestra una idea intuitiva del uso de Mo delos Oultos de Markov en el maro del reono imiento del habla. En este aso el HMM se denomina de izquierda a dereha donde los estados representarían distintas onguraiones del aparato fonador. En ada estado se puede emitir un sonido de entre los de un onjunto on ierta distribuión de probabilidad, que serán estimadas a partir del onjunto de entrenamiento. Las palabras se representarían mediante la onatenaión de estos HMMs. Figura 3.4: Mo delos Oultos de Markov apliados a la señal voal. El blo que de mo delizaión del lengua je trata de apliar las reglas gramatiales que rigen la omuniaión para failitar la omprensión de la adena de unidades aústi- as (sin ontenido léxio-semántio) prop orionada p or el mó dulo de reonoimiento 2 Hidden Markov Mo dels, en español: Mo delos Oultos de Markov. 16 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 17 #21 i i 3.3. Sistema de transrip ión automátia aústio. El mo delo de lengua je utilizado se basa en n-gramas [Jel91℄, que desrib en la probabilidad de observar una determinada palabra dep endiendo de las n-1 anteriores. El mo delo de n-gramas es alulado a partir de las transripiones manuales disp onibles. El proeso de entrenamiento se detalla gráamente en la gura 3.5. Extracción de Características Vectores de Características Modelo Acustico P(f|e) Modelo Léxico Modelo de Lenguaje P(e) Audio Transcripcion Algoritmo de Viterbi Mixturas de Gausianas Calculo N-Gramas + Suavizado Automata Estocastico de Estados Finitos Entrenamiento Figura 3.5: Pro eso de generaión de los mo delos Con el sistema nalmente implementado y optimizado, se han realizado diversas exp erimentaiones para determinar de manera aproximada el grado de preisión que p o demos esp erar del mismo. La métria empleada para la evaluaión del sistema ha sido el Word Error Rate (WER), y los resultados obtenidos señalan que el WER que ab e esp erar del mismo está en torno a los 30-35 puntos. Esto signia que po demos esp erar que en una transrip ión haya un 30 %-35 % de palabras transritas inorre- tamente p or término medio. Sin embargo estos resultados no son lo suientemente preisos para ser útiles p or sí mismos. Para obtener transrip iones más preisas será neesaria la intervenión humana. Podemos aprovehar las transrip iones obtenidas de forma automátia para onstruir un sistema que failite la supervisión y orreión de éstas de un mo do interativo, y así proporionar una soluión eiente en términos de ostes y esfuerzo a la obtenión de transrip iones preisas. APGM-DSIC-UPV 17
memoria 2012/7/19 12:32 page 18 #22 i i
memoria 2012/7/19 12:32 page 19 #23 i i Capítulo 4 Reprodutor prototipo HTML5 Se ha implementado un repro dutor basado en el lengua je HTML5 on el n de prop orionar una interfaz de usuario que p ermita tanto el visionado omo la ediión interativa de transrip iones. Este repro dutor será un prototip o que nos servirá tanto para denir las araterístias de la interfaz de ediión omo para diseñar el sistema de omuniaión interativo entre el editor y el sistema de reono imiento automáti- o del habla. Disponemos de transrip iones manuales para algunos de los vídeos del rep ositorio, tal y omo se omentó en el apartado 3.3 uando hablamos del entrenamiento del mo delo de lengua je. Para el resto, las transripiones han sido obtenidas automátiamente. Como sab emos, las transrip iones obtenidas de forma automátia no son suientemente preisas y ontienen errores. En este apítulo traba jaremos en el diseño de un repro dutor/editor que p ermita al usuario, además de visualizar estas transrip iones, mo diarlas de una forma interativa. En los siguientes apartados trataremos diversos asp etos onernientes al diseño e implementaión de este editor on el n de aabar on un sistema interativo que failite al máximo la tarea de ediión. Para la implementaión del prototip o y del resto de omplementos que se indian a lo largo de este apítulo se ha empleado el sistema de gestión de bases de datos MySQL y los lengua jes de programaión PHP y JavaSript junto a su p opular bibliotea jQuery. 4.1. Página prinipal En la página prinipal del repro dutor se permite al usuario seleionar entre las bases de datos disp onibles para mostrar su ontenido, entre las que se enuentra el rep ositorio p oliMedia. La estrutura de la página está formada p or un logo sup erior, un menú prinipal, un panel lateral donde se p ermite seleionar al usuario el riterio de agrupaión deseado y el área de ontenido. Por defeto, en el panel lateral apareen 19
memoria 2012/7/19 12:32 page 20 #24 i i Capítulo 4. Repro dutor prototip o HTML5 las distintas ategorías en las que se agrupan los vídeos p erteneientes al rep ositorio atual. Sin embargo, mediante un panel desplegable en la parte sup erior del panel lateral se p ermite al usuario la agrupaión p or otros riterios, omo p or autor o idioma. Para la omodidad del usuario, en aso que el número de elementos en los que se agrupan los vídeos sea muy elevado, éstos serán a su vez agrupados por su letra iniial en forma de árb ol desplegable. Al seleionar un onjunto de vídeos en el panel lateral, éstos apareen en el área de ontenido on su orresp ondiente informaión (título, autor e imagen en miniatura del vídeo) para que puedan ser seleionados individualmente. También está disp onible en el menú prinipal la op ión de búsqueda, en la que el usuario puede denir diversos riterios de búsqueda y se le mostrarán los vídeos que onuerden on diho riterio. Figura 4.1: Estrutura de la página prinipal. 4.2. Repro dutor El repro dutor engloba fundamentalmente dos elementos que onviene difereniar. Por una parte tenemos el reprodutor o visor, que orresp onde a la parte del reprodutor donde se muestra el ontenido del vídeo y al panel de ontroles que ontrola la repro duión del mismo. Por otro lado tenemos el editor, donde se mostrará la transrip ión del vídeo y se p ermitirá al usuario realizar mo diaiones. Para evitar 20 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 21 #25 i i 4.2. Repro dutor onfusiones, de aquí en adelante las referenias al repro dutor se referirán úniamente al visor. 4.2.1. Repro dutor El repro dutor está basado en HTML5, p or lo que iniialmente dep ende del navegador empleado. Para onstruir un repro dutor p ersonalizado que se muestre de igual manera indep endientemente del navegador utilizado, emplearemos ho jas de estilo CSS 1 y la p opular bibliotea de JavaSript jQuery. Iniialmente se ha implementado un panel de ontroles on las funionalidades básias para la repro duión de vídeo: un b otón de repro duión/pausa, un ontrol de volumen y un p osiionador temporal. Posteriormente se han añadido otros ontroles omo un botón para mostrar/oultar los subtítulos disp onibles, un b otón de seleión del idioma de las transrip iones, así omo los b otones relativos al editor de subtítulos Editar subtítulos y Transripión impreisa de los que se darán más detalles en el siguiente apartado. 4.2.2. Editor Mediante el b otón Editar subtítulos , disp onible para iertos usuarios en el panel de ontroles, se muestra el editor de transrip iones. La página queda estruturada de mo do que en la parte izquierda se muestra el reprodutor de vídeo y en la parte dereha el editor. El editor ontiene iniialmente la transrip ión del vídeo, que puede ser tanto automátia omo manual si se dispusiera de ella. Las frases apareen divididas del mismo mo do en que se muestran los subtítulos, es deir, p or ó digos temp orales. Para la omo didad del usuario, la repro duión del vídeo en el repro dutor y el avane de las transrip iones en el editor están sinronizadas. Es deir, las transrip iones avanzan automátiamente en el repro dutor a medida que el vídeo se reprodue. Además, se resalta el elemento o frase que orresp onde al instante atual de repro duión para evitar onfusiones. Pulsando sobre una frase en el editor se habilita su ediión. El usuario puede mo diar y orregir palabras de un mo do interativo. A través de un serviio web se enviarán las orreiones del usuario al sistema de transrip ión automátia y éste devolverá nuevas hip ótesis de transrip ión a raíz de las mismas. Por ejemplo, imaginemos que durante un vídeo onreto se meniona en repetidas o asiones un nombre propio que no es ono ido p or el sistema de reono imiento automátio del habla, p or ejemplo Java. Sup ongamos que ada vez que aparee la palabra Java en el vídeo, el sistema la transrib e erróneamente omo jarra. La idea será que una vez el usuario orrija la primera apariión de jarra por Java, el sistema aprenda de diha orreión y devuelva una nueva transrip ión en la que el resto de apariiones de la palabra Java aparezan transritas orretamente. Puesto que este pro eso puede sup oner un alto oste omputaional, distinguiremos varias modalidades de ediión interativa dependiendo del tiempo de respuesta requerido. 1 CSS, en inglés: Casading Style Sheets . APGM-DSIC-UPV 21
memoria 2012/7/19 12:32 page 28 #32 i i
memoria 2012/7/19 12:32 page 29 #33 i i Capítulo 5 Integraión en la plataforma Matterhorn 5.1. Persp etiva El ob jetivo de este apítulo es integrar en la plataforma Matterhorn las ténias de transrip ión asistida que fueron denidas a lo largo del apítulo 4 para el reprodutor prototip o basado en HTML5. Existen diferentes p osibilidades de ara a llevar a ab o esta integraión, dep endiendo prinipalmente de la distribuión del sistema de transrip iones y de las neesidades del modelo. Una p osibilidad sería integrar el sistema de transripión automátia en el mismo sistema Matterhorn, y atribuir a Matterhorn la gestión de las transripiones. Sin embargo, la propuesta seguida en los suesivos apartados de este apítulo sugiere un sistema distribuido donde el sistema de transrip ión automátia se enarga p or separado de la gestión de las mismas (obtenión, almaenamiento, et.). La integraión en Matterhorn onstará por tanto de dos asp etos fundamentales: el primero la neesidad de transmitir al sistema de transrip ión automátia los nuevos ontenidos audiovisuales añadidos al sistema, y el segundo la adaptaión de un nuevo reprodutor para la plataforma Matterhorn que p ermita la visualizaión y ediión interativa de transrip iones. Ambas dos tareas inluirán la extensión y adaptaión del serviio web empleado en el reprodutor prototip o (ver g. 4.3) para ubrir las neesidades de omuniaión entre la plataforma Matterhorn y el sistema de transrip ión automátia (a partir de ahora Sistema de Gestión de Transrip iones). De este serviio web se darán más detalles en la siguiente seión. 29
memoria 2012/7/19 12:32 page 30 #34 i i Capítulo 5. Integraión en la plataforma Matterhorn 5.2. Sistema de Gestión de Transrip iones e interfaes Deb erán denirse primeramente una serie de interfaes para p ermitir la omuni- aión on el Sistema de Gestión de Transrip iones. La idea es basar to das estas interfaes en llamadas HTTP REST 1 [Tya06℄. Una de las araterístias lave de los serviios web REST es el uso explíito de los méto dos HTTP. Estamos hablando, p or tanto, de rear un serviio web tip o REST para gestionar el interambio de informaión entre Matterhorn y el Sistema de Gestión de Transrip iones. Neesitaremos denir varias interfaes, por ejemplo para la subida de arhivos al sistema, para ono er el estado de proesamiento de los arhivos enviados o para obtener las transrip iones de un vídeo determinado. A ontinuaión se desrib en on más detalle las prinipales interfaes implementadas: Ingest : Será un serviio POST mediante el ual se añadirá un nuevo elemento al Sistema de Gestión de Transrip iones para ser pro esado. El identiador id deb erá oinidir on el identiador del mediaPakage reado en Matterhorn para la p osible identiaión a p osteriori. Méto do /Ruta POST /ingest Desrip ión Añade un nuevo elemento (vídeo/audio) al sistema Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Bo dy (subida) El arhivo multimedia Status : Empleado para onoer el estado de proesamiento de un elemento del sistema no pro esado, pro esando, transrito. Méto do /Ruta GET /status Desrip ión Devuelve el estado de pro esamiento del elemento id . Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Formato de respuesta text/xml DFXP : Devolverá la transrip ión de un vídeo onreto del sistema en formato DFXP en aso de disponer de ella. 1 REST: REpresentational State Transfer. 30 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 31 #35 i i 5.3. Parte I: Integraión en el workow de Matterhorn Méto do /Ruta GET /dfxp Desrip ión Devuelve la transrip ión del elemento id en formato DFXP. Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Formato de respuesta text/xml Mo d : Posibilitará el envío de orreiones o mo diaiones para la transrip- ión de un elemento del sistema, que deb erán seguir un formato determinado. Méto do /Ruta POST /mo d Desrip ión Envío de orreiones para la transrip- ión del elemento id . Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Bo dy (subida) Mo diaiones realizadas (formato on- reto). 5.3. Parte I: Integraión en el workow de Matterhorn Ya están denidas e implementadas las interfaes para la omuniaión on el Sistema de Gestión de Transrip iones. Tenemos la neesidad de transmitir los nuevos medios añadidos a Matterhorn al SGT (Sistema de Gestión de Transrip iones) para que éstos sean pro esados. Como se omentó en la seión 5.1, de la gestión de las transrip iones se enargará p or ompleto el SGT. Esto implia que las transrip iones se almaenarán también en el SGT y no en los mediaPakages del sistema Matterhorn. En Matterhorn, ada elemento añadido al sistema es pro esado mediante una serie de op eraiones que onforman un workow (ver seiones 2.2.1 y 2.2.2). El pro edimiento será rear un nuevo serviio enargado de transmitir la informaión al SGT y la orresp ondiente workow operation que haga uso de éste, para p osteriormente añadirla al workow p or defeto de Matterhorn. La gura 5.1 ilustra el pro eso que seguiría un nuevo vídeo añadido al sistema. A ontinuaión se desriben los pasos seguidos para la reaión de este nuevo serviio y su p osterior implantaión en el sistema: 1. Implementar el nuevo serviio. Primero se reará la estrutura de arhivos y diretorios del serviio. El ó digo del nuevo serviio estará ubiado en dos arp etas en el diretorio modules dentro del diretorio base de Matterhorn, ba jo los nombres matterhorn-transriptionservie-api y matterhorn-transription-servie-impl. En el primero de ellos simAPGM-DSIC-UPV 31
memoria 2012/7/19 12:32 page 32 #36 i i Capítulo 5. Integraión en la plataforma Matterhorn Figura 5.1: Pro esamiento de un vídeo a través del workow de Matterhorn plemente se implementará la API 2 de Java del serviio. En el diretorio ...- servie-impl se implementará diha interfaz y sus REST Endpoints. Aunque el resto de diretorios y arhivos puede generarse manualmente, es reomendable partir de otro serviio ya implementado y realizar las modiaiones que sean p ertinentes. Este serviio transmitirá las pistas de audio y vídeo al Sistema de Gestión de Transrip iones mediante la llamada REST ingest del serviio web denido en la seión 5.2. 2. Crear un Workow Op eration Handler. El siguiente paso es la implementaión del ontrolador de op eraión que hae uso del nuevo serviio. Las operaiones de workow se denen dentro del módulo matterhorn-ondutor. Para ello se rean dos nuevos arhivos: un arhivo Java que ontiene la implementaión de la operaión, llama2 Appliation Programming Interfae, en español: Interfaz de programaión de apliaiones. 32 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 33 #37 i i 5.4. Parte I I: Sustituión/adaptaión del Engage Media Player do TransriptionWorkowOp erationHandler.java y situado en matterhorn- ondutor/sr/main/java junto al resto de ontroladores de op eraión. un arhivo XML que ontiene la delaraión OSGi, situado en matterhorn- ondutor/sr/main/resoures/OSGI-INF/operations. Por último se delara la op eraión en el arhivo p om.xml del matterhorn- ondutor. 3. Inluir la op eraión en el workow. Una vez implementado el ontrolador de op eraión para el nuevo serviio, ya p odremos ejeutar la op eraión desde ualquier workow. Se puede elegir si denir un nuevo workow que haga uso de ésta o simplemente mo diar el workow p or defeto de Matterhorn (omp ose-distribute-publish.xml) para que inluya la nueva op eraión. 5.4. Parte I I: Sustituión/adaptaión del Engage Media Player El Engage Media Player es el repro dutor de medios de la plataforma Matterhorn. La tenología en la que se basa es puramente HTML/JavaSript junto a un ontenedor de vídeo basado en Flash 10. Entre sus araterístias se enuentran, además de la mera repro duión de los ontenidos audiovisuales: la visualizaión de subtítulos, la repro duión de vídeo seletiva orresp ondiendo a las distintas diap ositivas de la presentaión, la búsqueda basada en ontenido, estadístias de visualizaión o anota- iones de los usuarios. Sin embargo, en nuestro aso neesitaremos un repro dutor que disp onga además de funionalidad para la ediión y modiaión de transrip iones, omo vimos en el apítulo 4. Cab e menionar aquí el esfuerzo que el Área de Sistemas de Informaión y Comuniaiones (ASIC) de la UPV está haiendo en la onstru- ión de un repro dutor alternativo basado en HTML5 ompatible on Matterhorn ba jo el nombre Pael la Engage Player [UPV12℄. El proyeto se enuentra to davía en fase de desarrollo a feha de la publiaión de este proyeto, y si bien to davía no disp one de funionalidad para la ediión de transrip iones, ésta se enuentra entre sus p osibles ob jetivos a orto plazo. La gura 5.2 muestra una versión extendida del Mini-Paella Player (una versión idéntia al Matterhorn Engage Player oial p ero basada en HTML5) que p osibilita la ediión de transripiones. Dado el mo delo distribuido de los sistemas propuesto en la seión 5.1, neesitaremos que el repro dutor implementado se omunique on el Sistema de Gestión de Transrip iones a través del serviio REST denido en la seión 5.2, tanto para la obtenión de las transrip iones omo para el interambio interativo de modia- iones. Esta omuniaión se ilustra en la gura 5.3. APGM-DSIC-UPV 33
memoria 2012/7/19 12:32 page 34 #38 i i Figura 5.2: Matterhorn Engage Player on ediión de transrip iones. Figura 5.3: Comuniaión entre el repro dutor HTML5 y el SGT.
memoria 2012/7/19 12:32 page 35 #39 i i Capítulo 6 Conlusiones y trabajos futuros 6.1. Resumen A lo largo de este traba jo hemos señalado la neesidad de disp oner de una soluión para la obtenión de transrip iones de alidad de un mo do eiente. La propuesta ha onsistido en uniar un sistema automátio de reono imiento del habla on un sistema de ediión interativo que p ermita la sup ervisión de estas transrip iones automátias de una manera eaz. Para la onstruión de este sistema omplejo hemos dispuesto de un onjunto de datos suientemente amplio y de una plataforma de pruebas que nos ha p ermitido exp erimentar las neesidades reales de los usuarios. En el apítulo 1 hemos introduido la problemátia del reono imiento automátio del habla. Hemos dado un breve repaso a la historia reiente de estos sistemas, y hemos visto ómo han ido avanzado sus prestaiones hasta la atualidad. La falta de pre- isión de estos sistemas nos ha servido para justiar la interaión on el usuario en el pro eso de transrip ión, que es uno de los ob jetivos prinipales de este traba jo. A ontinuaión, en el apítulo 2 hemos introduido al letor la plataforma Matterhorn, dando una visión general de las araterístias de la misma y detallando algunos asp etos que se han onsiderado de relevania para apítulos p osteriores. En el apítulo 3 hemos presentado el rep ositorio p oliMedia, sus araterístias prinipales y sus ontenidos. Además, hemos resumido brevemente el diseño e implementaión de un sistema de reono imiento automátio del habla para este orpus. Posteriormente, en el apítulo 4 hemos visto on detalle la implementaión de un repro dutor prototipo basado en HTML5 para el rep ositorio poliMedia. Hemos dotado a este prototipo de una interfaz de usuario para la ediión y modiaión de transrip iones, presentando diversas ténias e ideas para haer esta ediión lo más interativa y eiente p osible. Por último, en el apítulo 5 hemos propuesto un modelo de integraión de un sistema de transrip ión semi-asistida on las mismas funionalidades que el repro dutor prototip o del apítulo anterior en la plataforma Matterhorn, y hemos visto on ierto 35
memoria 2012/7/19 12:32 page 36 #40 i i Capítulo 6. Conlusiones y traba jos futuros detalle la manera de llevar a ab o esta integraión. 6.2. Conlusiones En el apítulo 3 hemos visto omo efetivamente, las transrip iones obtenidas de manera puramente automátia no son lo suientemente preisas (se. 3.3). Para obtener transripiones que presenten un grado de preisión óptimo en la atualidad es neesaria la intervenión humana. Hemos p o dido omprobar ómo, partiendo de transrip iones automátias lo suientemente preisas (en torno al 70 % de palabras orretamente transritas), el uso de un sistema interativo que asista al usuario en el pro eso de orreión de éstas hae muho más eiente la tarea. Las funionalidades diseñadas para la ediión interativa se basan en la exp erienia de diversas p ersonas exp erimentadas en el amp o de la transripión y traduión manuales. 6.3. Traba jos futuros Disp onemos nalmente de un sistema eiente de obtenión de transripiones preisas para repositorios de gran tamaño y amplio vo abulario. Puesto que el re- ono imiento automátio del habla sigue siendo hoy en día uno de los prinipales fo os de investigaión en el área del reono imiento de formas, habrá que tener en uenta las ap ortaiones y mejoras que surjan a lo largo de los años para mejorar de forma ontinua la obtenión automátia de transrip iones. Por tanto, este proyeto no onsiste en un traba jo on punto y nal sino que representa una base sólida sobre la que implementar futuras mejoras que hagan to davía más eiente la obtenión de transrip iones preisas. Lo mismo puede deirse sobre las ténias interativas de ediión, que pueden ser extendidas onforme sea neesario para failitar al usuario la mo diaión manual de las transrip iones. Estas funionalidades han sido integradas en la plataforma Op enast Matterhorn on el n de obtener no solamente un sistema prototip o que sea empleado asi exlusivamente en un lab oratorio a mo do de prueba de onepto, sino un sistema que p ermita su uso en un entorno real para p o der evaluar así las neesidades reales de los usuarios. Pero no nos olvidemos del n último del que este proyeto representa úniamente un eslab ón: failitar el visionado de los ontenidos al mayor número de p ersonas p osible. Tal y omo omentamos en el apítulo 1, esto inluye la traduión de estas transrip iones a otras lenguas. La obtenión de transrip iones preisas es el paso previo a la traduión automátia, o en ualquier aso al proeso de traduión en general. Habrá que entrarse p or tanto en la ampliaión de este sistema para ubrir la diversidad lingüístia de los usuarios. Este traba jo y el p osterior traba jo futuro se desarollará en el maro del proye- to europeo transLetures 1 . transLetures es un proyeto STReP 2 dentro del Seventh Framework Programme fundado por la Comisión Europ ea. Comenzó el 1 de Noviembre de 2011 y su feha de nalizaión está programada para el 31 de Otubre de 1 http://transletures.eu 2 Sp ei Targeted Researh Pro jets. 36 APGM-DSIC-UPV
memoria 2012/7/19 12:32 page 37 #41 i i 6.3. Traba jos futuros 2014. El ob jetivo de transLetures es desarrollar soluiones novedosas y eientes para la pro duión de transrip iones y traduiones preisas para el p ortal VideoLetures.NET, y de forma más general para otros repositorios relaionados on la plataforma Matterhorn. De este mo do, los esfuerzos se entrarán en aunar un sistema de transrip ión interativo de araterístias similares al desrito en este traba jo on un sistema de traduión que p ermita además disp oner de estas transrip iones en diversos idiomas, y que a su vez sea ompatible on la plataforma Matterhorn para p o der p oner a disposiión de las entidades que emplean esta plataforma las soluiones alanzadas durante el transurso del proyeto. APGM-DSIC-UPV 37