scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

En los últimos años, la investigación en el campo de la Fotografía Computacional ha dado lugar a numerosos avances en las múltiples disciplinas que lo componen, rebasando los límites de la fotografía convencional. Uno de estos límites es la incapacidad de las cámaras fotográficas de representar toda la gama de luminancias presentes en una escena, y que se solucionó tras la aparición de la técnica del alto rango dinámico o HDR (High Dynamic Range). Esta técnica permite fusionar una serie de imágenes de una escena, capturadas con distintos parámetros de exposición, de modo que la imagen resultante recoge todo el rango dinámico conjunto de las imágenes empleadas para su obtención. En este proyecto se ha trabajado con imágenes HDR, y en particular con el problema de reenfocado de las mismas. El desenfoque, provocado por la limitada profundidad de campo o por una incorrecta elección de los parámetros de la cámara, es un problema clásico en fotografia. Se han implementado y analizado dos técnicas diferentes de reenfocado de imágenes HDR. La primera de ellas consiste en el empleo de aperturas codificadas, máscaras que se colocan en la lente de la cámara y que permiten codificar el desenfoque, facilitando su corrección a posteriori mediante técnicas computacionales. El empleo de aperturas codificadas es habitual en el reenfocado de imágenes convencionales de bajo rango dinámico o LDR (Low Dynamic Range), pero hasta la fecha estas técnicas no se habían extendido a las imágenes HDR y se desconocía su viabilidad. La segunda técnica que se estudia es la de generación y reenfoque de imágenes HDR con aperturas múltiples. Con esta técnica se emplean imágenes de una misma escena obtenidas variando el tamaño de la apertura, por lo que no sólo varía la exposición entre ellas, sino también el desenfoque. Gracias a ello, se permite obtener al mismo tiempo información sobre la luminancia y sobre la profundidad de la escena, permitiendo obtener fotografías HDR de la misma, que además pueden ser reenfocadas como se desee. García Girón, Luis; Presa Irazábal, Lara; Masiá Corcoy, Belén

Full text

Reenfocado de im´agenes de alto rango din´amico con aperturas codificadas y aperturas m´ultiples PROYECTO DE FIN DE CARRERA Autor: Luis Garc´ıa Gir´on Directora: Lara Presa Iraz´abal Codirectora: Bel´en Masi´a Corcoy Ponente: Dr. Diego Guti´errez P´erez Ingenier´ıa Superior de Telecomunicaciones Curso 2011-2012 Departamento de Inform´atica e Ingenier´ıa de Sistemas Escuela de Ingenier´ıa y Arquitectura Universidad de Zaragoza Julio de 2012 Resumen En los ´ultimos a˜nos, la investigaci´on en el campo de la Fotograf´ıa Computacional ha dado lugar a numerosos avances en las m´ultiples disciplinas que lo componen, rebasando los l´ımites de la fotograf´ıa convencional. Uno de estos l´ımites es la incapacidad de las c´amaras fotogr´aficas de representar toda la gama de luminancias presentes en una escena, y que se solucion´o tras la aparici´on de la t´ecnica del alto rango din´amico o HDR (High Dynamic Range). Esta t´ecnica permite fusionar una serie de im´agenes de una escena, capturadas con distintos par´ametros de exposici´on, de modo que la imagen resultante recoge todo el rango din´amico conjunto de las im´agenes empleadas para su obtenci´on. En este proyecto se ha trabajado con im´agenes HDR, y en particular con el problema de reenfocado de las mismas. El desenfoque, provocado por la limitada profundidad de campo o por una incorrecta elecci´on de los par´ametros de la c´amara, es un problema cl´asico en fotografia. Se han implementado y analizado dos t´ecnicas diferentes de reenfocado de im´agenes HDR. La primera de ellas consiste en el empleo de aperturas codificadas, m´ascaras que se colocan en la lente de la c´amara y que permiten codificar el desenfoque, facilitando su correcci´on a posteriori mediante t´ecnicas computacionales. El empleo de aperturas codificadas es habitual en el reenfocado de im´agenes convencionales de bajo rango din´amico o LDR (Low Dynamic Range), pero hasta la fecha estas t´ecnicas no se hab´ıan extendido a las im´agenes HDR y se desconoc´ıa su viabilidad. La segunda t´ecnica que se estudia es la de generaci´on y reenfoque de im´agenes HDR con aperturas m´ultiples. Con esta t´ecnica se emplean im´agenes de una misma escena obtenidas variando el tama˜no de la apertura, por lo que no s´olo var´ıa la exposici´on entre ellas, sino tambi´en el desenfoque. Gracias a ello, se permite obtener al mismo tiempo informaci´on sobre la luminancia y sobre la profundidad de la escena, permitiendo obtener fotograf´ıas HDR de la misma, que adem´as pueden ser reenfocadas como se desee. La primera parte del proyecto ha dado lugar a una publicaci´on que ha sido enviada al Congreso Espa˜nol de Inform´atica Gr´afica (CEIG 2012), y que a fecha de hoy est´a pendiente de aceptaci´on. 3 ´ Indice general 1. Introducci´on 8 2. Antecedentes 13 2.1. Fotograf´ıa Computacional . . . . . . . . . . . . . . . . . . . . 13 2.2. Fotograf´ıa de alto rango din´amico . . . . . . . . . . . . . . . . 13 2.2.1. Concepto del rango din´amico . . . . . . . . . . . . . . 13 2.2.2. Creaci´on de im´agenes de alto rango din´amico . . . . . 15 2.2.3. L´ıneas de investigaci´on en HDR . . . . . . . . . . . . . 16 2.3. Aperturas codificadas para correcci´on de desenfoque . . . . . 18 2.3.1. Desenfoque por profundidad de campo . . . . . . . . . 18 2.3.2. An´alisis frecuencial del desenfoque . . . . . . . . . . . 18 2.3.3. L´ıneas de investigaci´on con aperturas codificadas . . . 21 3. Aperturas codificadas para correcci´on de desenfoques en im´agenes HDR 22 3.1. Introducci´on............................ 22 3.2. Modelos de procesado . . . . . . . . . . . . . . . . . . . . . . 22 3.3. Simulaci´on de los modelos de procesado . . . . . . . . . . . . 25 3.3.1. Construcci´on de los priors . . . . . . . . . . . . . . . . 27 3.4. Resultados de simulaci´on . . . . . . . . . . . . . . . . . . . . 27 3.4.1. Modelo de procesado 1 . . . . . . . . . . . . . . . . . . 27 3.4.2. Modelo de procesado 2 . . . . . . . . . . . . . . . . . . 27 3.4.3. Modelo de procesado 3 . . . . . . . . . . . . . . . . . . 27 3.4.4. Comparativa de los modelos . . . . . . . . . . . . . . . 28 3.4.5. Comparativa de los priors . . . . . . . . . . . . . . . . 28 3.5. Validaci´on f´ısica de los modelos de procesado . . . . . . . . . 28 3.5.1. Captura de las im´agenes desenfocadas con apertura codificada......................... 29 3.5.2. Obtenci´on de las PSFs . . . . . . . . . . . . . . . . . . 30 3.5.3. Recuperaci´on de las im´agenes bien enfocadas . . . . . 31 3.6. Obtenci´on de patrones ´optimos . . . . . . . . . . . . . . . . . 33 3.6.1. Funci´on objetivo . . . . . . . . . . . . . . . . . . . . . 34 3.6.2. Algoritmo gen´etico . . . . . . . . . . . . . . . . . . . . 35 4 3.6.3. Evaluaci´on de los patrones obtenidos . . . . . . . . . . 36 3.7. Validaci´on f´ısica de los patrones obtenidos . . . . . . . . . . . 38 3.8. Resultados de la validaci´on f´ısica . . . . . . . . . . . . . . . . 39 4. Aperturas m´ultiples 45 4.1. Introducci´on............................ 45 4.2. Fotograf´ıa HDR con apertura variable . . . . . . . . . . . . . 45 4.3. Modelo de formaci´on de im´agenes . . . . . . . . . . . . . . . . 47 4.3.1. Modelo de exposici´on . . . . . . . . . . . . . . . . . . 47 4.3.2. Modelo de desenfoque . . . . . . . . . . . . . . . . . . 47 4.3.3. Modelo de luminancia por capas . . . . . . . . . . . . 48 4.3.4. Modelo completo de escena . . . . . . . . . . . . . . . 49 4.4. Optimizaci´on ........................... 50 4.4.1. Funci´on objetivo . . . . . . . . . . . . . . . . . . . . . 50 4.4.2. M´etodo de optimizaci´on . . . . . . . . . . . . . . . . . 50 4.4.3. Inicializaci´on . . . . . . . . . . . . . . . . . . . . . . . 50 4.5. Definici´on de los experimentos . . . . . . . . . . . . . . . . . . 51 4.5.1. Recuperaci´on de luminancia L en im´agenes sint´eticas . 51 4.5.2. Recuperaci´on de luminancia L y tama˜no de blur en im´agenesreales...................... 52 4.6. Resultados............................. 54 4.6.1. Im´agenes sint´eticas . . . . . . . . . . . . . . . . . . . . 54 4.6.2. Im´agenes reales . . . . . . . . . . . . . . . . . . . . . . 54 5. Conclusiones 59 5.1. Conclusiones del trabajo realizado . . . . . . . . . . . . . . . 59 5.2. Trabajofuturo .......................... 60 5.3. Conclusiones personales . . . . . . . . . . . . . . . . . . . . . 61 A. Software y procedimientos de fusi´on de im´agenes HDR 64 A.1. Adobe Photoshop CS5 . . . . . . . . . . . . . . . . . . . . . . 64 A.2.LuminanceHDR ......................... 65 A.3.PhotomatixPro.......................... 65 B. Inserci´on de aperturas codificadas en el objetivo Canon EF 50mm f/1.8 II 66 C. Art´ıculo: Analysis of Coded Apertures for Defocus Deblurring of HDR Images 69 5 ´ Indice de figuras 1.1. Diagrama de Gantt. . . . . . . . . . . . . . . . . . . . . . . . 11 2.1. Imagen HDR creada a partir de tres exposiciones. . . . . . . . 16 2.2. Modelo de lente delgada 2D. . . . . . . . . . . . . . . . . . . . 18 2.3. Tama˜no de la PSF en relaci´on a la distancia del plano focal. . 19 2.4. Objetivo con apertura codificada de Zhou y Nayar. . . . . . . 20 2.5. Respuesta frecuencial de la apertura de Zhou y Nayar y la circular. .............................. 20 3.1. Esquema del procesado 1. . . . . . . . . . . . . . . . . . . . . 24 3.2. Esquema del procesado 2. . . . . . . . . . . . . . . . . . . . . 24 3.3. Esquema del procesado 3. . . . . . . . . . . . . . . . . . . . . 24 3.4. Ejemplos de im´agenes usadas en simulaci´on. . . . . . . . . . . 26 3.5. Q media obtenida en simulaci´on. . . . . . . . . . . . . . . . . 28 3.6. Ejemplo de im´agenes HDR recuperadas con prior HDR y priorLDR. ............................ 29 3.7. Esquema de montaje para la captura de las exposiciones. . . 30 3.8. Detalle central de las im´agenes empleadas para obtener las PSFs. ............................... 31 3.9. PSFs recuperadas para la deconvoluci´on. . . . . . . . . . . . . 31 3.10. Q obtenida en el escenario real. . . . . . . . . . . . . . . . . . 32 3.11. Detalle de las im´agenes recuperadas empleando prior. . . . . 33 3.12. Resultados de los mejores procesados HDR y LDR. . . . . . . 34 3.13. Patrones de aperturas obtenidos. . . . . . . . . . . . . . . . . 36 3.14. Q media obtenida para cada apertura. . . . . . . . . . . . . . 37 3.15. Respuesta frecuencial de las aperturas obtenidas con prior HDR. ............................... 38 3.16. Respuesta frecuencial de las aperturas obtenidas con prior LDR................................. 38 3.17. Aperturas impresas en papel de transparencia. . . . . . . . . 39 3.18. Resultados con la apertura circular. . . . . . . . . . . . . . . 40 3.19. Resultados de ambos procesados para el detalle de la derecha. 41 3.20. Resultados de ambos procesados para el detalle de la izquierda. 43 6 3.21. M´etricas obtenidas para ambos detalles con cada una de las aperturas.............................. 44 4.1. Variaci´on de la profundidad de campo y de la exposici´on en funci´on del tama˜no de la apertura. . . . . . . . . . . . . . . . 46 4.2. Simulaci´on del desenfoque por profundidad con diferentes tama˜nosdeblur. .......................... 48 4.3. Esquema del modelo de creaci´on de la luminancia de la imagen por capas de profundidad. . . . . . . . . . . . . . . . . . . 49 4.4. Esquema de la optimizaci´on en el experimento con im´agenes sint´eticas. ............................. 51 4.5. Esquema de la optimizaci´on en el experimento con im´agenes reales. ............................... 52 4.6. Imagen sint´etica con exposici´on artificial y divisi´on en capas deprofundidad........................... 53 4.7. Simulaci´on de captura con tres tama˜nos de apertura diferentes. 54 4.8. Resultado de la optimizaci´on para recuperar la luminancia de la imagen sint´etica. . . . . . . . . . . . . . . . . . . . . . . 55 4.9. Luminancia recuperada de la imagen real, im´agenes de entrada y divisi´on en capas. . . . . . . . . . . . . . . . . . . . . 57 4.10. Luminancia HDR recuperada reenfocada en postcaptura a cada una de las capas. . . . . . . . . . . . . . . . . . . . . . . 58 4.11. Manipulaci´on de la exposici´on en postcaptura con la escena totalmente enfocada. . . . . . . . . . . . . . . . . . . . . . . . 58 4.12. Manipulaci´on del tama˜no de apertura en postcaptura. . . . . 58 B.1. Objetivo Canon EF 50mm f/1.8 II junto a los materiales empleados. ............................ 66 B.2. Objetivo montado, con la tapa trasera desenroscada. . . . . . 67 B.3. Objetivo con la tapa lateral despegada. . . . . . . . . . . . . 67 B.4. Objetivo desmontado en sus tres piezas principales. . . . . . . 68 B.5. Pieza central con la apertura codificada. . . . . . . . . . . . . 68 7 Cap´ıtulo 1 Introducci´on Uno de los objetivos de la Fotograf´ıa Computacional es obtener mejores representaciones de las escenas reales que las que se consiguen empleando t´ecnicas de fotograf´ıa convencionales. En este sentido, uno de los problemas que presentan las c´amaras fotogr´aficas comerciales es la limitaci´on del sensor a la hora de capturar im´agenes de escenas con un rango de luminancias, o rango din´amico, elevado. As´ı, cuando el fot´ografo se dispone a capturar una de estas escenas, debe escoger el rango de luminancias de inter´es y variar adecuadamente los par´ametros de exposici´on de la c´amara para realizar la captura seg´un su necesidad. Sin embargo, se da una p´erdida importante de informaci´on, ya que aquellas partes de la escena que presenten una luminancia fuera del rango seleccionado no podr´an ser representadas de forma correcta. A aquellos p´ıxeles que correspondan con las zonas de mayor luminancia, el sensor les asignar´a invariablemente el m´aximo valor, y al rev´es para aquellos que se correspondan con las zonas m´as oscuras, de modo que al tratar de representar escenas con un rango din´amico elevado la p´erdida de detalle ser´a muy alta. En este contexto, surge el concepto de im´agenes de alto rango din´amico o HDR (High Dynamic Range). Este tipo de im´agenes permiten representar un rango de luminancias m´as amplio que las fotograf´ıas convencionales o de bajo rango din´amico, LDR (Low Dynamic Range), permitiendo una mejor representaci´on de la extensa gama de niveles de intensidad presentes en las escenas reales. La obtenci´on de estas im´agenes se consigue capturando una serie de fotograf´ıas de una misma escena con distintos tiempos de exposici´on y fusion´andolas posteriormente, mediante t´ecnicas que se encuentran implementadas en la mayor´ıa del software fotogr´afico convencional [4]. 8 2.2.2. Creaci´on de im´agenes de alto rango din´amico En 1997, con la expansi´on de las c´amaras fotogr´aficas digitales en el mercado, y ante las limitaciones de rango din´amico comentadas anteriormente, surge la t´ecnica de creaci´on de im´agenes de alto rango din´amico a partir de una serie de fotograf´ıas de la misma escena realizadas con distintos par´ametros de exposici´on, desarrollada por Paul E. Debevec y Jitendra Malik [4]. Esta t´ecnica se basa en la recuperaci´on, a partir de esta serie de im´agenes, de la curva de respuesta del proceso de formaci´on de la imagen en la c´amara (g). Conociendo esta funci´on, se pueden procesar las distintas exposiciones y fusionarlas en una sola imagen de alto rango din´amico, cuyos p´ıxeles presentan valores proporcionales a los valores reales de luminancia presentes en la escena, atendiendo a la siguiente f´ormula: ln Ei=PP j=1 w(Zij)(g(Zij)−ln ∆tj) PP j=1 w(Zij)(2.3) Donde Pes el n´umero de fotograf´ıas empleadas, Zij es el valor del p´ıxel ien la fotograf´ıa j, ∆tjes el tiempo de exposici´on de la fotograf´ıa j, y w es una funci´on de pesos que se emplea para suavizar el resultado final. Habitualmente suele emplearse una funci´on triangular o una gaussiana para cumplir este objetivo. Para informaci´on m´as detallada sobre el proceso de recuperaci´on de la funci´on gy otras especificaciones matem´aticas de esta t´ecnica se recomienda consultar la publicaci´on original [4]. El rango din´amico de la imagen resultante comprende el rango din´amico total de las im´agenes que la conforman, y los valores de los p´ıxeles se almacenan en un vector de valores en coma flotante de 32 bits, en contraste con los 8 bits que se emplean habitualmente en las im´agenes convencionales de bajo rango din´amico, lo que supone un aumento del contraste m´aximo de 256:1 hasta 4.2950e9:1. En la Figura 2.1 se muestra un ejemplo de imagen de alto rango din´amico obtenida gracias a esta t´ecnica, a partir de una serie de im´agenes con distintos par´ametros de exposici´on. Puede verse claramente c´omo tanto las partes m´as luminosas como las m´as oscuras quedan perfectamente representadas en la imagen resultante, mientras que en cada una de las exposiciones individuales aparecen zonas subexpuestas, como la librer´ıa en 2.1(b) y sobreexpuestas, como la parte de la ventana en 2.1(d). A la imagen HDR se le ha aplicado una operaci´on conocida como reproducci´on de tono o tonemapping. Esta operaci´on consiste en una reducci´on del contraste global de la imagen, generalmente a cambio de un aumento de los contrastes locales. En HDR se emplea para obtener un registro completo de todos los niveles 15 de brillo de la escena original, y se hace necesaria a la hora de mostrar una imagen HDR en displays LDR o en papel. (a) Fusi´on HDR con reproducci´on de tono (b) Imagen subexpuesta (c) Exposici´on central (d) Imagen sobreexpuesta Figura 2.1: Imagen HDR (a) creada a partir de la fusi´on de tres exposiciones (b,c,d). N´otese c´omo se consigue representar correctamente todo el rango de luminancias de la escena, mientras que en las tres exposiciones aparecen inevitablemente zonas sobreexpuestas y subexpuestas. 2.2.3. L´ıneas de investigaci´on en HDR En la actualidad, la t´ecnica de creaci´on de im´agenes HDR desarrollada por Debevec y Malik sigue vigente y est´a implementada en gran parte del software fotogr´afico convencional (Photoshop, Luminance HDR, Photomatix Pro). Bas´andose en esta t´ecnica, una de las l´ıneas de investigaci´on actuales trata de analizar la secuencia ´optima de exposiciones que se deben tomar para emplearlas en la formaci´on de la imagen de alto rango din´amico y obtener los mejores resultados, como hicieron Grosberg y Nayar en 2003 [6]. En la misma l´ınea aparece en 2006 el trabajo de Aky¨uz y Reinhard [2], y el de Hasinoff et al. en 2010 [8], con el a˜nadido de que ambos consideran la 16 ISO2de la c´amara entre los par´ametros variables para optimizar la captura de las exposiciones. Otra l´ınea de investigaci´on se desarrolla en torno al an´alisis de las propiedades estad´ısticas de las im´agenes de alto rango din´amico. En este campo destaca el trabajo de Pouli et al. [16], que establece una serie de regularidades estad´ısticas en im´agenes LDR y HDR, observando claras diferencias entre ambas. La principal importancia de este estudio recae en que muchos procesos de optimizaci´on requieren del conocimiento de informaci´on a priori sobre las regularidades estad´ısticas de im´agenes naturales para obtener resultados adecuados. A esta informaci´on se la conoce como prior, y entre otras muchas aplicaciones se emplea, como se ver´a m´as adelante, en la obtenci´on de aperturas codificadas para correcci´on de desenfoques. El hecho de que existan estas claras diferencias entre las regularidades estad´ısticas de las im´agenes de bajo rango din´amico y las de alto rango din´amico implicar´ıa que los priors existentes para las primeras no ser´ıan ´optimos para usarse en aplicaciones HDR. Otra direcci´on a destacar es la que comenzaron Hasinoff y Kutulakos en 2007 [9, 10] que permite construir una imagen HDR a partir de fotograf´ıas tomadas variando el tama˜no de la apertura en lugar del tiempo de exposici´on, y que es uno de los objetos de estudio de este proyecto. En cuanto a hardware fotogr´afico tambi´en se han logrado varios avances importantes en los ´ultimos a˜nos. A la hora de aumentar el rango din´amico que son capaces de capturar las c´amaras en una sola fotograf´ıa, destaca el trabajo de Nayar y Branzoi [15], consistente una adaptaci´on individual de la exposici´on de cada p´ıxel en el sensor, permitiendo capturar im´agenes HDR con un solo disparo. Tambi´en aparecen nuevas t´ecnicas de hardware a la hora de facilitar la captura de las distintas exposiciones antes de fusionarlas en una imagen HDR. En este sentido, Aggarwal y Ahuja desarrollaron un dispositivo [1] para dividir el camino ´optico en la c´amara fotogr´afica empleando prismas, de modo que cada uno de los haces resultantes alcanza un sensor diferente, obteniendo distintas exposiciones de una misma imagen con un solo disparo y permitiendo incluso la captura de v´ıdeo de alto rango din´amico. 2Sensibilidad de la c´amara fotogr´afica. A mayor ISO, menor es la cantidad de luz que se requiere para realizar una fotograf´ıa, a costa de un aumento del nivel de ruido. 17 2.3. Aperturas codificadas para correcci´on de desenfoque 2.3.1. Desenfoque por profundidad de campo Seg´un el modelo de lente delgada, cuando un objeto est´a situado en el plano focal de la lente de la c´amara, todos los rayos provenientes de un mismo punto de ese objeto convergen en un mismo punto del sensor. Sin embargo, al alejar el objeto del plano focal, los rayos ya no convergen en un mismo punto sino en varios, que se corresponden con el llamado c´ırculo de confusi´on, dando lugar a una imagen desenfocada. En la Figura 2.2 se muestra un esquema del modelo de lente delgada. Tal como se ha dicho, el objeto situado en el plano focal, a una distancia F de la lente, da lugar a una imagen n´ıtida puesto que todos sus rayos convergen en un ´unico punto del sensor. En cambio, los objetos situados a distancias D1 y D2 dar´an lugar a im´agenes desenfocadas, puesto que los rayos que provienen de un mismo punto convergen en m´ultiples puntos del sensor de la c´amara, dando lugar al c´ırculo de confusi´on. Adem´as, cuanto mayor sea la distancia del objeto al plano focal, mayor ser´a el grado de desenfoque de la imagen, es decir, mayor ser´a el di´ametro del c´ırculo de confusi´on. Figura 2.2: Modelo de lente delgada en 2D mostrando el efecto de desenfoque por profundidad de campo. Cuanto mayor es la distancia del objeto al plano focal, mayor es el c´ırculo de confusi´on y, por tanto, el desenfoque. 2.3.2. An´alisis frecuencial del desenfoque Matem´aticamente, el proceso de creaci´on de la imagen fdesenfocada en la c´amara fotogr´afica se modela como una convoluci´on entre la escena perfectamente enfocada f0y un kernel kque representa la PSF (Point Spread Function) o respuesta del sistema ´optico a un impulso en la entrada, y que tiene la forma de la apertura con un tama˜no variable en funci´on de la profundidad, m´as un ruido ηque habitualmente se asume gaussiano: 18 f=f0∗k+η(2.4) Como puede verse en la Figura 2.3, cuanto m´as pr´oxima est´e la escena a la distancia focal, menor ser´a el tama˜no del kernel, y por tanto menor el desenfoque, de manera que para una fotograf´ıa bien enfocada el kernel se puede aproximar por un punto, de modo que el resultado de la convoluci´on entre f0ykser´a la propia f0. Figura 2.3: Tama˜no de la PSF en relaci´on a la distancia del plano focal. Cuanto mayor es esta distancia, mayor es el tama˜no. Adaptada de Levin et al. [11]. En el dominio frecuencial, la ecuaci´on se puede escribir como: F=F0·K+ζ(2.5) Donde F,F0yζson las transformadas discretas de Fourier de f,f0yη, respectivamente. Conociendo esto, puede parecer trivial recuperar una imagen enfocada a partir de otra desenfocada sin m´as que realizando la correspondiente deconvoluci´on. Sin embargo el resultado no es todo lo bueno que cabr´ıa esperar, dado que las aperturas circulares presentan una respuesta frecuencial muy desfavorable, introduciendo una atenuaci´on muy grande en las frecuencias m´as altas, as´ı como varios cruces por cero que imposibilitan la recuperaci´on de la informaci´on en esas componentes frecuenciales. A partir de este problema surge la idea del empleo de aperturas codificadas para la correcci´on de desenfoques. Se trata de m´ascaras que, colocadas delante de la lente de la c´amara (ver Figura 2.4), modifican la forma de la apertura, permitiendo codificar la luz que llega al sensor. As´ı se consigue una doble ventaja, ya que se obtiene un mayor control en la captura de la imagen codificando la forma del desenfoque, al tiempo que se resuelven los problemas de las aperturas circulares, creando patrones con respuestas frecuenciales m´as favorables para la correcci´on de desenfoque. 19 Figura 2.4: Objetivo con una de las aperturas codificadas desarrolladas por Zhou y Nayar [19]. Colocando una m´ascara en la lente del objetivo se consigue codificar el desenfoque, haciendo m´as sencilla su correcci´on. En la Figura 2.5 puede verse la respuesta frecuencial de una de las aperturas de Zhou y Nayar [19], la misma que aparece en la Figura 2.4, frente a la respuesta frecuencial de la circular. Figura 2.5: Logaritmo de la potencia espectral de una de las aperturas codificadas de Zhou [19] frente a la de la apertura circular. La apertura codificada ofrece una respuesta m´as favorable, al eliminar los cruces por cero y reducir la atenuaci´on en las frecuencias altas. Puede comprobarse c´omo esta apertura tiene una respuesta frecuencial mucho m´as favorable que la circular, ya que la atenuaci´on en las frecuencias altas es mucho menor y evita los cruces por cero. 20 2.3.3. L´ıneas de investigaci´on con aperturas codificadas El origen de las aperturas codificadas se remonta a los a˜nos 60. Habitualmente se empleaban en astronom´ıa para resolver los problemas de ruido en la formaci´on de im´agenes sin lentes a partir de rayos X y rayos γ[3]. En esta l´ınea aparecieron muchos trabajos y se desarrollaron numerosos patrones de aperturas, de entre los que destacan los patrones MURA (Modified Uniformly Redundant Array) [5]. Con el auge de la fotograf´ıa computacional, aparece el trabajo de Veeraraghavan et al., que emplea aperturas codificadas para obtener light fields 4D mediante una c´amara convencional modificada [17]. En lo referente al problema del desenfoque y su relaci´on con la profundidad (depth from defocus), Levin et al. consiguen una recuperaci´on simult´anea de la imagen enfocada y el mapa de profundidad, dise˜nando una apertura ´optima basada en un criterio de discriminaci´on de profundidad y explotando la caracterizaci´on estad´ıstica de las im´agenes [11]. Zhou et al. consiguen el mismo objetivo empleando pares de aperturas codificadas, obtenidas con algoritmos gen´eticos [18]. Zhou et al. tambi´en desarrollan una m´etrica para evaluar la calidad de las aperturas codificadas para recuperaci´on de enfoque, basada en la calidad de las im´agenes reenfocadas y teniendo en cuenta las estad´ısticas de im´agenes naturales, obteniendo aperturas ´optimas [19]. Masi´a et al. introducen las m´etricas perceptuales en el proceso de obtenci´on de aperturas ´optimas para correcci´on de desenfoques [14] y exploran el uso de valores no binarios en las aperturas codificadas [13]. 21 Cap´ıtulo 3 Aperturas codificadas para correcci´on de desenfoques en im´agenes HDR 3.1. Introducci´on En esta parte del proyecto se estudia la aplicaci´on de las t´ecnicas de aperturas codificadas para correcci´on de desenfoques en im´agenes HDR. En primer lugar se proponen tres modelos de procesado diferentes para adaptar estas t´ecnicas a las im´agenes HDR, y se estudia su viabilidad mediante una serie de simulaciones, contrastadas con la captura y procesado de una imagen HDR real con apertura codificada. A continuaci´on se estudia la obtenci´on de aperturas codificadas para HDR bas´andose en algoritmos gen´eticos y con priors estad´ısticos HDR y LDR. Finalmente se realiza una validaci´on por soporte f´ısico de las aperturas obtenidas, insertando el patr´on de la apertura codificada en el objetivo de la c´amara y capturando las im´agenes necesarias para su posterior procesado. 3.2. Modelos de procesado Para estudiar la viabilidad del empleo de aperturas codificadas en im´agenes HDR se simula el proceso de captura de las mismas y se trata de recuperar la imagen bien enfocada a partir de la imagen simulada. Como se ha comentado anteriormente, el proceso de creaci´on de una imagen fen la c´amara fotogr´afica, con un kernel ka partir de una escena f0viene dado 22 por la Ecuaci´on 2.4: f=f0∗k+η As´ı, para simular la captura de una imagen LDR desenfocada con una apertura codificada basta con realizar una convoluci´on entre una imagen bien enfocada y el patr´on de la apertura y a˜nadirle un ruido gaussiano η∼N(0, σ2). Sin embargo, esta simulaci´on que es v´alida para LDR s´olo ser´ıa v´alida para HDR en el caso de que pudi´eramos capturar la imagen de alto rango din´amico a partir de una sola fotograf´ıa. Aunque existen c´amaras capaces de capturar im´agenes con rangos din´amicos m´as altos que las c´amaras convencionales, como se ha comentado anteriormente en la mayor´ıa de los casos la obtenci´on de una imagen HDR se realiza capturando una serie de Nexposiciones de la escena y fusion´andolas posteriormente. As´ı, siendo fLDR 0n,(n= [1...N]) las distintas exposiciones de una escena fHDR 0 correctamente enfocada, podemos simular la captura de una fotograf´ıa HDR desenfocada de esa misma escena fHDRsimulando las capturas por separado de cada una de las exposiciones fLDR ncomo: fLDR n=fLDR 0n∗k+η(3.1) Y fusion´andolas posteriormente: fHDR =g(fLDR 1, fLDR 2, ..., fLDR N) (3.2) Una vez obtenida fHDR se recupera la imagen HDR enfocada ˆ fHDR 0 realizando una deconvoluci´on. Sin embargo, teniendo las im´agenes LDR desenfocadas de cada una de las exposiciones, tambi´en ser´a posible recuperar las exposiciones enfocadas ˆ fLDR 0n,(n= 1, ...N) por separado, realizando N deconvoluciones, y fusionarlas posteriormente para obtener la imagen HDR recuperada: ˆ fHDR 0=g(ˆ fLDR 01 ,ˆ fLDR 02 , ..., ˆ fLDR 0N) (3.3) A partir de lo anterior definimos tres tipos de procesado diferentes que se resumen de la siguiente manera: 1. Procesado de la imagen HDR obtenida a partir de una sola captura: ´ Este procedimiento s´olo es v´alido con c´amaras fotogr´aficas que permitan capturar im´agenes con un rango din´amico superior al de las c´amaras convencionales, por lo que s´olo podr´a ser validado en simulaci´on al no disponer del material necesario para realizar experimentos reales. Su esquema se muestra en la Figura 3.1. 23 Figura 3.1: Esquema del procesado 1. GWN representa el ruido gaussiano, K el kernel del desenfoque y * el operador de convoluci´on. 2. Procesado de la imagen HDR obtenida a partir de una serie de exposiciones: En primer lugar se simula la captura de una serie de exposiciones desenfocadas de la imagen (Ecuaci´on 3.1) para fusionarlas en una sola imagen HDR (Ecuaci´on 3.2) de la que se obtendr´a la imagen recuperada a partir de una deconvoluci´on. Su esquema se muestra en la Figura 3.2 Figura 3.2: Esquema del procesado 2. GWN representa el ruido gaussiano, K el kernel del desenfoque y * el operador de convoluci´on. 3. Procesado de las distintas exposiciones antes de obtener la imagen HDR: Se simula la captura de una serie de exposiciones desenfocadas (Ecuaci´on 3.1) a partir de las cuales se obtendr´an las exposiciones recuperadas mediante una serie de deconvoluciones. A continuaci´on se obtiene la imagen HDR recuperada fusionando las exposiciones recuperadas (Ecuaci´on 3.3). Su esquema se muestra en la Figura 3.3 Figura 3.3: Esquema del procesado 3. GWN representa el ruido gaussiano, K el kernel del desenfoque y * el operador de convoluci´on. Las operaciones necesarias para llevar a cabo cada una de las simulaciones se resumen en el Cuadro 3.1. Como puede verse, el procesado 1 es el que 24 Figura 3.8: Detalle central de las im´agenes empleadas para obtener las PSFs. De izquierda a derecha: imagen sobreexpuesta, exposici´on central e imagen subexpuesta se indica en el p´arrafo anterior6. Tanto las exposiciones como las im´agenes empleadas para recuperar las PSFs est´an tomadas en formato RAW con un tama˜no de 4752x3168, pero por motivos de coste computacional se les aplica un resize de factor 0.2, hasta un tama˜no de 951x634. En la Figura 3.9 pueden verse las cuatro PSFs recuperadas tras el resize. Su tama˜no aproximado es de unos 14x14 p´ıxeles. Figura 3.9: PSFs recuperadas tras el resize para la deconvoluci´on. De izquierda a derecha: PSF recuperadas de la imagen sobreexpuesta, de la exposici´on central y de la imagen subexpuesta, y PSF recuperada de la imagen HDR. 3.5.3. Recuperaci´on de las im´agenes bien enfocadas Una vez obtenidas las PSFs se recuperan las im´agenes bien enfocadas empleando los dos tipos de procesado. Para el procesado HDR se fusionan las tres exposiciones desenfocadas y se trata de recuperar la imagen bien enfocada a partir de ella con una sola deconvoluci´on (como se muestra en el esquema de la Figura 3.2), empleando la PSF obtenida especialmente para HDR. Para ello se emplea la deconvoluci´on de Wiener sin prior de im´agenes, con prior HDR y con prior LDR. 6El umbral empleado en este caso es de 0.2. 31 Para el procesado LDR se trata de recuperar las exposiciones bien enfocadas mediante una deconvoluci´on para cada una de ellas (como se muestra en el esquema de la Figura 3.3), empleando en cada caso la PSF correspondiente a su exposici´on. Se prueban la deconvoluci´on de Wiener sin prior y con prior LDR. Finalmente se fusionan las exposiciones recuperadas para obtener la imagen HDR resultante. Se utiliza la m´etrica HDR-VDP2[12] para obtener la medida de calidad Q en comparaci´on con la imagen de referencia. Esta medida puede observarse en la Figura 3.10. (a) Procesado HDR (b) Procesado LDR Figura 3.10: Q obtenida en el escenario real con la m´etrica HDR-VDP2 para cada tipo de procesado y deconvoluci´on. Aunque las simulaciones indican que el procesado LDR se comporta mucho mejor que el HDR, en la realidad ofrecen resultados similares. Lo m´as llamativo es que, aunque las simulaciones indican que el procesado LDR se comporta mucho mejor que el procesado HDR, en realidad ofrecen resultados de calidad muy semejante. Adem´as, mientras que las simulaciones indican que los resultados son bastante similares tanto empleando priors como sin ellos, en realidad ambos procesados se comportan mucho mejor cuando no se usa ning´un prior en la deconvoluci´on. Al observar detenidamente las im´agenes obtenidas con las deconvoluciones con prior se aprecia una clara distorsi´on en forma de rejilla en todas ellas, que no aparece en la simulaci´on, como se muestra en la Figura 3.11. Esta distorsi´on reduce sensiblemente la calidad visual de las im´agenes obtenidas tras deconvoluci´on con prior. No obstante puede verse c´omo, para el procesado HDR, la imagen recuperada con el prior HDR 3.11(a) ofrece mejor resultado que la recuperada con prior LDR 3.11(b), por lo que se confirma que el empleo de un prior de im´agenes HDR en la deconvoluci´on de una imagen HDR ofrece resultados de una calidad superior que empleando un prior de im´agenes LDR. 32 (a) Procesado HDR con prior HDR (b) Procesado HDR con prior LDR (c) Procesado LDR con prior LDR Figura 3.11: Detalle de las im´agenes recuperadas empleando prior en la deconvoluci´on. Como puede verse, aparece una distorsi´on en forma de rejilla que reduce la calidad de las im´agenes. En la Figura 3.12 puede observarse el resultado de los dos mejores procesados reales en t´erminos de Q, correspondientes a ambos modelos de procesado (HDR y LDR) empleando deconvoluci´on sin prior. Junto a ellos se presenta la imagen original HDR desenfocada, obtenida mediante la fusi´on de las tres exposiciones desenfocadas, y la imagen HDR de referencia perfectamente enfocada. Estas im´agenes son la muestra de que el empleo de aperturas codificadas para la captura de im´agenes HDR es viable, como se quer´ıa demostrar. Observando las partes aumentadas se ve claramente c´omo los detalles que en la original son imposibles de distinguir, en las recuperadas aparecen mucho m´as n´ıtidos. 3.6. Obtenci´on de patrones ´optimos Tras comprobar que el empleo de aperturas codificadas es viable en im´agenes HDR, debido a que la apertura que se ha empleado hasta ahora [19] est´a dise˜nada para ser usada con im´agenes LDR se va a tratar de obtener patrones de aperturas ´optimos para im´agenes de alto rango din´amico. Para ello se sigue el m´etodo empleado por Zhou y Nayar [19], basado en un algoritmo gen´etico y en el empleo de priors de im´agenes naturales. Se obtendr´an una serie de aperturas empleando el prior de im´agenes HDR descrito en el Apartado 3.3.1. Adem´as, para poder realizar una comparativa rigurosa, tambi´en se obtendr´an aperturas empleando el prior de im´agenes LDR (ver 3.3.1). Una vez obtenidos los patrones, ´estos se emplean para realizar una serie de simulaciones como las detalladas en el Apartado 3.2, siguiendo los esquemas de procesado HDR (Figura 3.2) y LDR (Figura 3.3). A los resultados obtenidos se les aplica nuevamente la m´etrica HDR-VDP2[12] para evaluar 33 (a) Referencia (b) Original (c) Recuperada proc. HDR (d) Recuperada proc. LDR Figura 3.12: Resultados de los mejores procesados HDR y LDR en t´erminos de Q: empleando deconvoluci´on de Wiener sin prior. Aunque en la imagen original desenfocada es imposible distinguir ciertos detalles, ´estos se aprecian correctamente en las im´agenes recuperadas, tanto con procesado HDR como con procesado LDR, a costa de un ligero ringing. su calidad, a fin de establecer una comparativa entre los patrones obtenidos con el prior HDR y el prior LDR. 3.6.1. Funci´on objetivo Para obtener patrones ´optimos es necesario conocer una funci´on que eval´ue la calidad de los mismos para guiar la optimizaci´on. Zhou [19] propone una m´etrica que permite evaluar, dado un patr´on K, la degradaci´on de la imagen recuperada en funci´on de la desviaci´on t´ıpica σdel ruido. Viene dada por la siguiente ecuaci´on: R(K) = X ξ σ2 |Kξ|2+σ2/Aξ ,(3.6) donde la matriz Aes un prior que promedia la potencia espectral de una serie de im´agenes naturales, como los que se han empleado en apartados anteriores. Una apertura Kser´a tanto mejor cuanto m´as peque˜no sea el valor de R(K). La m´etrica se obtiene a partir del m´etodo de deconvoluci´on de Wiener, cuya formulaci´on, como ya se ha comentado, responde a la ecuaci´on: ˆ F0=F·¯ K |K|2+|C|2, 34 donde ˆ F0es la imagen recuperada, ¯ Kes el complejo conjugado de K, |K|2=K·¯ Ky|C|2=|σ/F0|2es la matriz de relaci´on ruido a se˜nal NSR (Noise to Signal Ratio) de la imagen original. Esta matriz nos es desconocida, por lo que se sustituye por el prior antes mencionado |C|2=|σ/A|2. Para obtener una apertura ´optima es necesario resolver el problema de optimizaci´on dado por la Ecuaci´on 3.6. Para un patr´on de apertura dado por una matriz binaria de tama˜no N×Nel n´umero de soluciones posibles es de 2N×N, por lo que se propone el uso de un algoritmo gen´etico que emplea la Ecuaci´on 3.6 como funci´on de evaluaci´on. 3.6.2. Algoritmo gen´etico El algoritmo gen´etico es un algoritmo de optimizaci´on iterativo inspirado en la evoluci´on biol´ogica, y que funciona de la siguiente forma: 1. Inicializaci´on: Se genera aleatoriamente una poblaci´on inicial de Ssecuencias binarias de longitud L, siendo L=N×Nel tama˜no de las aperturas a generar. 2. Selecci´on: Se eval´ua cada una de las S secuencias empleando la m´etrica ya comentada: R(K) = X ξ σ2 |Kξ|2+σ2/Aξ De ellas se seleccionan las Mmejores, las que tienen menor R(K), y se eliminan todas las dem´as. 3. Reproducci´on: a partir de las Msecuencias seleccionadas, se obtienen S−Mnuevas secuencias para completar la poblaci´on hasta S secuencias. Estas secuencias se obtienen de la siguiente forma: Recombinaci´on: se escogen dos de las Msecuencias al azar y se intercambian sus bits con una probabilidad c1, obteniendo dos nuevas secuencias. Mutaci´on: para cada nueva secuencia generada mediante recombinaci´on, se cambia el valor de todos sus bits con una probabilidad c2. 4. Repetici´on: se repiten los pasos 2 y 3 hasta que se alcanza la ´ultima generaci´on G. 5. Finalizaci´on: se eval´uan todas las secuencias restantes y la mejor de ellas se selecciona como salida del algoritmo. Los par´ametros de ejecuci´on del algoritmo gen´etico fueron los siguientes: 35 L=121 (para un tama˜no de aperturas de 11 ×11). Poblaci´on inicial: S=4000. Poblaci´on final: M=400. Probabilidad de recombinaci´on: c1=0.2. Probabilidad de mutaci´on: c2=0.05. N´umero de generaciones: G=40. Se emplearon dos niveles de ruido diferentes, σ= 0,0005 y σ= 0,001 y se ejecut´o el algoritmo tres veces por cada combinaci´on de prior (HDR y LDR) y nivel de ruido, para un total de 12 aperturas. El tiempo total de ejecuci´on para la obtenci´on de los 12 patrones fue de 54296.32 segundos (15 horas aproximadamente), dando una media de 4524.69 segundos por patr´on (1 hora y cuarto)7. En la Figura 3.13 se muestran los patrones de las aperturas obtenidas. (a) H0.001 1 (b) H0.001 2 (c) H0.001 3 (d) H0.0005 1 (e) H0.0005 2 (f) H0.0005 3 (g) L0.001 1 (h) L0.001 2 (i) L0.001 3 (j) L0.0005 1 (k) L0.0005 2 (l) L0.0005 3 Figura 3.13: Patrones de aperturas obtenidos. N´otese que el tama˜no de los patrones es de 11x11 p´ıxeles, pero se les ha a˜nadido un marco negro para una mejor visualizaci´on. Notaci´on de las aperturas: PRIORσi (Prior empleado: PRIOR=L(DR),H(DR); σempleada: σ=0.001,0.0005; N´umero de ejecuci´on del algoritmo para cada combinaci´on: i=1,2,3). 3.6.3. Evaluaci´on de los patrones obtenidos Para evaluar los 12 patrones que se han obtenido tras la ejecuci´on del algoritmo gen´etico se simula para cada uno de ellos el proceso de captura8 y la posterior recuperaci´on con una serie de im´agenes HDR y se emplea la 7Procesador: Intel Core i7-950, 3.06GHz. Memoria RAM: 6GB 8La σempleada en la simulaci´on de cada apertura es la misma que la que se us´o en su obtenci´on con el algoritmo gen´etico. 36 m´etrica HDR-VDP2[12] para conocer la calidad de los resultados obtenidos. Se realizan estas simulaciones con los tipos de procesado HDR y LDR definidos en el Apartado 3.2. Finalmente se obtiene la media aritm´etica de los datos obtenidos para cada apertura. Adem´as se eval´ua de la misma forma la apertura de Zhou [19], la misma que ya se emple´o anteriormente, a fin de comparar la calidad de nuestros patrones con uno v´alido ya conocido. Para esta apertura se realizan las simulaciones con los dos niveles de ruido empleados en el algoritmo gen´etico. En la Figura 3.14 se muestra el valor medio de la medida de calidad Qobtenida para cada una de las aperturas, para los dos tipos de procesado. Figura 3.14: Q media obtenida para cada apertura, con procesado HDR (Q HDR) y procesado LDR (Q LDR). En general, las aperturas obtenidas con el prior HDR se comportan mejor que las obtenidas con prior LDR al realizar el procesado HDR. Z0.001 y Z0.0005 se corresponden con la apertura de Zhou empleando ruidos con σ= 0,001 y σ= 0,0005 respectivamente. Puede observarse c´omo, en general, las aperturas obtenidas con el prior de im´agenes HDR se comportan mejor que las obtenidas con el prior LDR al realizar el procesado HDR, aunque las aperturas L0.001 1 y L0.0005 2 ofrecen resultados comparables a las primeras. En cuanto al procesado LDR, se observa mayor disparidad, encontrando aperturas buenas y malas indistintamente para ambos priors. Adem´as de esta medida de calidad de las aperturas, se debe comprobar su respuesta frecuencial para asegurar que resuelven los problemas de la apertura circular descritos anteriormente. En la Figura 3.15 se muestra la representaci´on de los cortes centrales de las respuestas frecuenciales de las aperturas obtenidas con el prior HDR en comparaci´on con la apertura circular. La misma representaci´on, esta vez para las obtenidas con el prior LDR, se muestra en la Figura 3.16. 37 Figura 3.15: Logaritmo de la potencia espectral de las aperturas obtenidas con prior HDR frente a la apertura circular. Todos los patrones ofrecen respuestas frecuenciales m´as favorables al reducir la atenuaci´on en las altas frecuencias y eliminar los cruces por cero. Figura 3.16: Logaritmo de la potencia espectral de las aperturas obtenidas con prior LDR frente a la apertura circular. Todas las aperturas eliminan los cruces por cero presentes en la circular, e introducen una menor atenuaci´on en las altas frecuencias. Puede comprobarse que todas las aperturas obtenidas tienen una respuesta frecuencial m´as favorable que la circular, al evitar los cruces por cero e introducir una menor atenuaci´on en las frecuencias m´as altas. 3.7. Validaci´on f´ısica de los patrones obtenidos Una vez evaluada la calidad de los patrones se escoge el mejor de los obtenidos con cada prior para realizar experimentos con las aperturas f´ısicas. Concretamente se eligen las aperturas H0.001 1 y L0.001 1 por ofrecer un buen comportamiento para ambos tipos de procesado. Se imprimen ambas aperturas junto con la apertura de Zhou [19] (que ya ha sido validada en el Apartado 3.4) en papel de transparencia, como se muestra en la Figura 3.17. Con cada una de estas aperturas y con la apertura 38 circular se repite el proceso de captura ya descrito en el apartado 3.4. Se llevan a cabo nuevamente los procesados HDR y LDR, esta vez empleando tan s´olo la deconvoluci´on de Wiener sin ning´un prior de im´agenes, ya que de esta manera se obtienen mejores resultados, tal como se ha visto antes, y se obtiene una vez m´as la m´etrica HDR-VDP2[12]. Igualmente, se simulan los mismos procesos para comparar los resultados reales con los de simulaci´on. (a) Prior HDR (b) Prior LDR (c) Zhou Figura 3.17: Aperturas impresas en papel de transparencia. 3.8. Resultados de la validaci´on f´ısica En la Figura 3.18(a) se puede ver la imagen HDR de referencia de la escena bien enfocada. Pueden distinguirse dos zonas desafiantes, la zona de la carta de ajuste fotogr´afico a la izquierda y la zona de los libros a la derecha. Como ya se ha comentado, la apertura circular presenta cruces por cero y atenuaciones en las frecuencias altas. En una imagen las frecuencias altas se corresponden con gradientes altos entre p´ıxeles vecinos, ya sean bordes, cambios de color o de intensidad. En las dos zonas se˜naladas se producen este tipo de gradientes, a la izquierda, la carta de ajuste presenta muchas variaciones de blanco a negro, y a la derecha, en la zona de los libros, se puede apreciar una clara diferencia de exposici´on entre el pato amarillo, que est´a recibiendo una luz directa, y el fondo, que est´a en penumbra. En las Figuras 3.18(c) y 3.18(d) pueden apreciarse los resultados obtenidos con la apertura circular. Se observa que en las zonas de la imagen donde se producen estos gradientes aparece una fuerte distorsi´on en forma de ringing. Esto se debe, como se ha comentado, a la respuesta frecuencial desfavorable de la apertura circular. Los resultados para el detalle derecho con cada apertura testeada se muestran en la Figura 3.19, mientras los del detalle de la izquierda se mues- 39 (a) Referencia (b) Original desenfocada (c) Recuperada proc. HDR (d) Recuperada proc. LDR Figura 3.18: Resultados con la apertura circular. Todas las im´agenes se muestran tras una reproducci´on de tono. N´otese la incapacidad de recuperar correctamente las im´agenes enfocadas al emplear una apertura circular. tran en la Figura 3.20. Adem´as, en la Figuras 3.21(a) y 3.21(b) se detallan los resultados obtenidos al aplicar localmente la m´etrica HDR-VDP2[12] en ambos detalles. A la vista de las m´etricas se confirma una vez m´as, como ya se indica en el Apartado 3.5, que aunque la simulaci´on del procesado LDR ofrece unos resultados mucho mejores que la del procesado HDR, en los experimentos reales ofrecen resultados de calidad muy similar. Observando detenidamente las im´agenes obtenidas con uno y otro procesado, se puede comprobar c´omo, empleando un procesado HDR, aparece un ringing mayor que el que aparece al emplear el procesado LDR. Este problema est´a estrechamente ligado al rango din´amico de la imagen. Como ya se ha comentado, este ringing aparece en zonas donde las diferencias entre p´ıxeles vecinos son muy acentuadas. Una imagen de alto rango din´amico representa la imagen con m´as bits de profundidad, por lo que estas diferencias entre p´ıxeles vecinos correspondientes a bordes o a gradientes de intensidad se acent´uan. Dado que en el procesado HDR se est´a realizando la deconvoluci´on sobre una imagen HDR, el ringing que aparece es mayor, mientras 40 Esto se consigue gracias a un modelo de formaci´on de imagen robus- to a partir de las im´agenes de entrada que se emplear´a para formular un problema de optimizaci´on que permite recuperar la luminancia totalmente enfocada de la escena y el tama˜no del desenfoque en cada capa seg´un el tama˜no de la apertura. 4.3. Modelo de formaci´on de im´agenes El proceso de formaci´on de im´agenes en la c´amara, fijando la velocidad del obturador, depende del tama˜no de la apertura, de la distancia de los objetos a la c´amara y de la distancia focal. Por s´ı solo, el tama˜no de la apertura determinar´a la exposici´on de la imagen, y en conjunci´on con los otros par´ametros definir´a el desenfoque. 4.3.1. Modelo de exposici´on La exposici´on de la imagen, dejando fijo el tiempo de exposici´on, o lo que es lo mismo, la velocidad del obturador, depender´a exclusivamente del tama˜no de la apertura. As´ı, se define un factor de exposici´on eaque aumenta conforme aumenta el di´ametro de la apertura, de modo que, para una escena L, la imagen ¯ Lformada en la c´amara se podr´a aproximar por ¯ L=eaL. Adem´as de esto, hay que tener en cuenta que cuando el valor de un p´ıxel ¯ L(x, y) = eaL(x, y) sobrepase al valor m´aximo permitido por el sensor dar´a lugar a un p´ıxel sobreexpuesto, cuyo valor ser´a precisamente este valor m´aximo. Para simular correctamente el proceso de captura hay que tener en cuenta esta sobreexposici´on. El modelo completo de exposici´on responde a la ecuaci´on siguiente: ¯ L(x, y) = min[eaL(x, y),1] (4.1) 4.3.2. Modelo de desenfoque Como se ha visto en el Apartado 2.3.1, el desenfoque (blur) de una imagen es mayor conforme m´as alejada est´a la imagen del plano focal, ya que el c´ırculo de confusi´on aumenta. Suponiendo una escena situada en un plano paralelo al plano focal, siendo Lla imagen perfectamente enfocada, puede expresarse la imagen resultante ¯ L, para un tama˜no de apertura dado, como: ¯ L=L∗Bσ(4.2) Donde Bσes la PSF del desenfoque, dependiente del llamado blur diameter o di´ametro de blur σ, que viene dado por el di´ametro de la apertura D, la 47 distancia focal dy la distancia de la c´amara a la escena d’, siendo: σ=|d0−d| dD(4.3) En la pr´actica, se asume que Bσes una funci´on Gaussiana 2D, siendo σla desviaci´on t´ıpica de la PSF: Bσ(x, y) = 1 2πσ2e −(x2+y2) 2σ2(4.4) En la Figura 4.2 puede verse una imagen en la que se ha simulado un desenfoque por profundidad con distintos di´ametros de blur, siguiendo el modelo aqu´ı descrito. (a) σ=0 (b) σ=1 (c) σ=2 (d) σ=5 Figura 4.2: Simulaci´on del desenfoque por profundidad con diferentes tama˜nos de blur. 4.3.3. Modelo de luminancia por capas Como se ha visto en el apartado anterior, es sencillo simular el desenfoque en una escena situada en un s´olo plano. Sin embargo, cuando la escena est´a situada en varios planos o capas a diferentes profundidades, el di´ametro de blur para cada una de ellas ser´a distinto, y probablemente existir´an oclusiones. Para solucionar esto, en primer lugar se divide la escena en una serie de Kcapas binarias empleando una m´ascara A={A0 k}(k= 1,2, ..., K) para seleccionar los p´ıxeles no ocluidos en cada uno de los planos de profundidad. Esta m´ascara permite calcular por separado el desenfoque de cada una de las capas, que luego pueden sumarse para obtener la luminancia de la imagen desenfocada como se muestra en la siguiente ecuaci´on: ¯ L= K X k=1 [(Ak·L)∗Bσa] (4.5) Adem´as, se define una segunda m´ascara M={Mk}(k= 1,2, ..., K) que representa la oclusi´on presente en cada capa y producida por las que se 48 encuentran situadas m´as cerca de la c´amara. Para obtener esta m´ascara se emplea la ecuaci´on que se detalla a continuaci´on: Mk= K Y j=k+1 (1 −Aj∗Bσj) (4.6) Esta m´ascara se aplica sobre cada una de las capas despu´es de ser desenfocadas individualmente y antes de sumarlas para obtener la luminancia total de la imagen. El proceso completo se muestra en la Figura 4.3, y responde a la siguiente ecuaci´on: ¯ L= K X k=1 [(Ak·L)∗Bσa]·Mk(4.7) Figura 4.3: Esquema del modelo de creaci´on de la luminancia de la imagen por capas de profundidad. La escena se divide en capas de profundidad y ´estas son desenfocadas por separado. (Adaptada de Hasinoff et al [10]) 4.3.4. Modelo completo de escena Resumiendo los apartados anteriores, a partir de la luminancia de la escena perfectamente enfocada L, la segmentaci´on de la misma en capas de profundidad Ay el di´ametro de blur por capa σa, se obtiene la imagen que se forma en la c´amara como: ¯ L=min "ea K X k=1 [(Ak·L)∗Bσa]·Mk,1#(4.8) 49 4.4. Optimizaci´on Una vez descrito el modelo de formaci´on de las im´agenes en la c´amara, ´este se emplea para formular el problema inverso, mediante una funci´on objetivo que permite, tras una optimizaci´on, recuperar la luminancia HDR perfectamente enfocada Lde la escena y el tama˜no de blur de cada capa σk, a partir de una serie de nfotograf´ıas tomadas con distinto tama˜no de apertura y de la divisi´on en capas Ade la escena. 4.4.1. Funci´on objetivo Definimos el problema como la estimaci´on de las Lyσque mejor reproducen las im´agenes de entrada, para la divisi´on en capas A. As´ı, la funci´on objetivo queda como: O(L, A, σ) = 1 2 n X a=1 k∆ak2(4.9) Donde ∆aes el error residual existente entre las im´agenes sintetizadas mediante la Ecuaci´on 4.8, a partir de L,Ayσ, y las im´agenes de entrada Ia tomadas con cada una de las naperturas: ∆a=Ia−¯ L(L, A, σ) (4.10) Juntando las ecuaciones 4.8, 4.9 y 4.10 se obtiene la ecuaci´on completa de la funci´on objetivo: O(L, A, σ) = 1 2 n X a=1 Ia−min "ea K X k=1 [(Ak·L)∗Bσa]·Mk,1# 2 (4.11) 4.4.2. M´etodo de optimizaci´on Para resolver el problema de optimizaci´on se utiliza la funci´on lsqnonlin1. de Matlab, por tratarse de un problema de m´ınimos cuadrados no lineales. Dado el tama˜no del problema se le suministra al solver no s´olo la funci´on objetivo sino tambi´en la estructura de la matriz jacobiana asociada. 4.4.3. Inicializaci´on Inicializaci´on de la luminancia de la escena: La aproximaci´on inicial de la luminancia de la escena se obtiene directamente de las im´agenes de entrada, seleccionando sus p´ıxeles y escal´andolos por la inversa de su factor de exposici´on 1/ea. El objetivo es seleccionar el 1http://www.mathworks.es/help/toolbox/optim/ug/lsqnonlin.html 50 mayor n´umero de p´ıxeles posible de la imagen obtenida con la apertura m´as peque˜na, ya que es la que menos desenfoque presenta de todas. Sin embargo, no se pueden escoger los p´ıxeles que presenten valores muy bajos de intensidad (correspondientes a zonas mas oscuras), ya que muy probablemente estar´an dominados por el ruido de la imagen. Definimos un umbral k=0.1 de modo que para cada p´ıxel se selecciona la apertura m´as peque˜na para la cual la intensidad de la imagen est´a por encima del mismo, o la m´as grande de todas si no se cumple para ninguna de ellas. Asignaci´on de las capas: Aunque el m´etodo original [9, 10] incluye un m´etodo autom´atico de asignaci´on de capas, por simplicidad en este proyecto se asignan las capas manualmente, como input del usuario. 4.5. Definici´on de los experimentos Se realizan una serie de experimentos para comprobar la validez del m´etodo. En primer lugar se trata de recuperar la luminancia L a partir de un input de im´agenes sint´eticas, con divisi´on en capas y tama˜no de blur conocidos, como se muestra en la Figura 4.4. A continuaci´on se emplear´an im´agenes reales con luminancia y tama˜no de blur por capas desconocido y se tratar´a de recuperar ambas a partir de las im´agenes obtenidas con distintos tama˜nos de apertura y de una divisi´on por capas, como se ve en la Figura 4.5. Figura 4.4: Esquema de la optimizaci´on en el experimento con im´agenes sint´eticas. Se obtiene la luminancia totalmente enfocada de la escena a partir de las exposiciones obtenidas con distinto tama˜no de apertura, la divisi´on en capas de la escena y el tama˜no de blur por capas. 4.5.1. Recuperaci´on de luminancia L en im´agenes sint´eticas Para crear la imagen sint´etica, se escoge una imagen LDR en color de tama˜no 256x256 p´ıxeles y se le simula el alto rango din´amico dividi´endola en tres bandas verticales y exponi´endolas artificialmente, para obtener la 51 Figura 4.5: Esquema de la optimizaci´on en el experimento con im´agenes reales. Se obtiene la luminancia totalmente enfocada de la escena y el tama˜no de blur por capas a partir de las exposiciones obtenidas con distinto tama˜no de apertura y la divisi´on en capas de la escena. imagen Lque se muestra en la Figura 4.6(a). Adem´as, se divide la imagen en tres capas asignando diferentes profundidades en tres bandas horizontales (Figuras 4.6(b)-4.6(d)). Finalmente, se aplica el modelo de formaci´on de imagen para simular la captura de la escena con tres diferentes tama˜nos de apertura, situando el plano de enfoque en la capa central. Las im´agenes que se obtienen se muestran en la Figura 4.7. Puede observarse c´omo la exposici´on y el desenfoque en las capas posterior y frontal aumentan con el tama˜no de la apertura. Para obtener estas im´agenes se ha empleado un di´ametro de blur σA= 3 p´ıxeles en las capas desenfocadas para la apertura mayor. El di´ametro de blur σapara cada una de las otras dos aperturas se obtiene a partir del de la mayor y del factor de exposici´on de la apertura eacomo: σa=σArea eA ,(4.12) donde eAes el factor de exposici´on correspondiente a la mayor de las aperturas. Se emplean factores de exposici´on de 1, 4 y 16 para la apertura m´as peque˜na, la media y la m´as grande, respectivamente. A partir de estas tres im´agenes se obtiene una inicializaci´on de la luminancia como se ha indicado en el Apartado 4.4.3 y se procede a la optimizaci´on para recuperar la luminancia de la escena. 4.5.2. Recuperaci´on de luminancia L y tama˜no de blur en im´agenes reales Para validar el m´etodo con escenas reales, se monta un escenario compuesto por tres capas a distintas profundidades y se capturan tres im´agenes 52 (a) Imagen sint´etica (b) Capa posterior (c) Capa central (d) Capa frontal Figura 4.6: Imagen sint´etica con exposici´on artificial para simular el rango din´amico y divisi´on en capas de profundidad. Las tres bandas verticales se exponen artificialmente, y las tres bandas horizontales se corresponden con capas de distinta profundidad. Todas las im´agenes se muestran tras una reproducci´on de tono. de la escena, con tama˜nos de apertura de f/8, f/4 y f/2 stops. Para el resto de par´ametros de captura se escoge ISO=100 y tiempo de exposici´on de 1/20 segundos. Las im´agenes se capturan en formato RAW con un tama˜no de 4752x3168 p´ıxeles y se elimina la correcci´on gamma de las mismas para hacerlas lineales. Posteriormente se recortan y se les aplica un resize para obtener im´agenes de 256x256, con el objetivo de hacerlas m´as manejables y reducir el coste computacional. El factor de exposici´on para estas tres im´agenes es aproximadamente de 1, 1.8 y 3.5 respectivamente. Esta vez se desconoce el tama˜no de blur de cada capa, por lo que se recuperar´a simult´aneamente junto con la luminancia HDR enfocada de la escena, empleando las tres im´agenes capturadas con los tama˜nos de apertura y la divisi´on en capas obtenida manualmente. Para ello se alterna la opti- 53 (a) Apertura m´as peque˜na (b) Apertura media (c) Apertura m´as grande Figura 4.7: Simulaci´on de captura con tres tama˜nos de apertura diferentes. Puede observarse una variaci´on tanto en la exposici´on en toda la imagen como en el desenfoque de las capas frontal y posterior. mizaci´on para ambos par´ametros: en primer lugar se realizan 10 iteraciones dejando fijo el tama˜no de blur inicial σy optimizando para la luminancia L, y a continuaci´on otras 10 dejando fija la luminancia L y optimizando para σ. Este proceso se repite hasta la convergencia. 4.6. Resultados A continuaci´on, se exponen y discuten los resultados de los experimentos propuestos en el apartado anterior. 4.6.1. Im´agenes sint´eticas Empleando como entrada las im´agenes sint´eticas mostradas en la Figura 4.7, fijando el tama˜no de blur al mismo valor empleado en su obtenci´on (σ= 3 p´ıxeles) y empleando la divisi´on en capas de la Figura 4.6, se ejecuta la optimizaci´on de la funci´on objetivo. En la Figura 4.8 se muestran tanto la inicializaci´on de la luminancia como la recuperada al final del proceso. A la vista del resultado, se observa c´omo el algoritmo ha sido capaz de recuperar a la perfecci´on la luminancia de la escena sint´etica a partir de las tres im´agenes de entrada (Figura 4.7) a pesar de los errores claros presentes en la inicializaci´on. Aplicando la norma L2 a la luminancia recuperada con respecto a la luminancia sint´etica ideal se obtiene un resultado en tanto por ciento de L2=7,4521e−008, lo que se traduce en un error insignificante. 4.6.2. Im´agenes reales Se prueba el algoritmo en un escenario real, tratando de recuperar simult´aneamente la luminancia y el tama˜no de blur σpor capa, como se indica 54 (a) Inicializaci´on (b) Recuperada Figura 4.8: Resultado de la optimizaci´on para recuperar la luminancia de la imagen sint´etica. ´ Esta se obtiene correctamente y perfectamente enfocada, a pesar de una inicializaci´on claramente distorsionada. en el Apartado 4.4.2. El algoritmo converge a partir de la s´eptima repetici´on, y emplea un tiempo de 35373 segundos (aproximadamente diez horas) de media en cada una de ellas2. En la Figura 4.9 se muestra la luminancia resultante junto a las im´agenes de entrada y la divisi´on en capas de la escena. Se aprecia claramente c´omo el algoritmo es capaz de recuperar la escena totalmente enfocada, aunque aparece una leve distorsi´on en los bordes entre las capas debida a la oclusi´on. El m´etodo original resuelve este problema aplicando procedimientos de inpainting, pero por encontrarse fuera de los objetivos marcados se opt´o por no implementarlo. El tama˜no de blur recuperado tras la optimizaci´on para la imagen con apertura m´as grande es de 1.797 p´ıxeles en la capa frontal, 0 en la capa intermedia (ya que est´a en foco) y 1.678 en la posterior. N´otese que conociendo los valores de σse puede obtener una estimaci´on de la profundidad relativa entre capas. Una vez recuperada la luminancia totalmente enfocada y los tama˜nos de blur, aplicando el modelo de formaci´on de im´agenes se pueden manipular en postcaptura los par´ametros de captura de la escena de la forma que se desee. En el CD adjunto a la memoria se incluye un v´ıdeo en el cual se muestra una res´ıntesis completa de los par´ametros de la c´amara. En la Figura 4.10 2Procesador: Intel Core i5, 2.26GHz. Memoria RAM: 6GB 55 se muestra la escena con todo su rango din´amico, reenfocada en cada una de las capas. Tambi´en se puede manipular la exposici´on con toda la escena perfectamente enfocada, como se muestra en la Figura 4.11, o modificar al mismo tiempo el enfoque y la exposici´on como si se estuviera manipulando el tama˜no de la apertura, tal como se muestra en la Figura 4.12. Como puede verse en estos resultados, el sistema implementado permite recuperar correctamente la luminancia enfocada de la escena con ligeras distorsiones, as´ı como el tama˜no de blur correspondiente a cada capa, ofreciendo una gran versatilidad en postcaptura al permitir simular sint´eticamente la variaci´on de todos los par´ametros de la c´amara. 56 [12] Mantiuk R., Kim K.J., Rempel A.G., Heidrich W.: HDR-VDP-2: A calibrated visual metric for visibility and quality predictions in all luminance conditions. SIGGRAPH (2011). [13] Masi´a B., Corrales A., Presa L., Guti´errez D.: Coded apertures for defocus deblurring. Symposium Iberoamericano de Computaci´on Grafica (2011). [14] Masi´a B., Presa L., Corrales A., Guti´errez D.: Perceptually-Optimized Coded Apertures for Defocus Deblurring. Computer Graphics Forum (2012). [15] Nayar S.K., Branzoi V.: Adaptive Dynamic Range Imaging: Optical Control of Pixel Exposures over Space and Time. ICCV (2003). [16] Pouli T., Cunningham D., Reinhard E.: Statistical regularities in low and high dynamic range images. ACM Symposium on Applied Perception in Graphics and Visualization (APGV) (2010). [17] Veeraraghavan A., Raskar R., Agrawal A., Mohan A., Tumblin J.: Dappled photography: mask enhanced cameras for heterodyned light fields and coded aperture refocusing. ACM Trans. Graph. (2007). [18] Zhou C., Lin S., Nayar S.: Coded aperture pairs for depth from defocus. ICCV (2009). [19] Zhou C., Nayar S. K.: What are Good Apertures for Defocus Deblurring? IEEE International Conference on Computational Photography (2009). 63 Ap´endice A Software y procedimientos de fusi´on de im´agenes HDR En este ap´endice se muestran algunos ejemplos de software comercial que permiten fusionar im´agenes HDR a partir de una serie de exposiciones, as´ı como el procedimiento a seguir en cada uno de ellos para realizar esta fusi´on. A.1. Adobe Photoshop CS5 Precio: desde 1001.82 e(Actualizaci´on desde: 293.82 e) Descarga: http://www.adobe.com/es/products/photoshop.html Procedimiento de fusi´on de im´agenes HDR: 1. Seleccionar: ”Archivo →Automatizar →Combinar para HDR Pro...” 2. Hacer clic en ”Explorar...” y seleccionar las exposiciones correspondientes. Si se desea que el programa trate de alinear las exposiciones autom´aticamente, seleccionar la opci´on ”Intentar alinear autom´aticamente las im´agenes de origen”. A continuaci´on, hacer clic en ”OK”. 3. Si la imagen est´a en formato RAW o en alg´un otro que conserve la informaci´on de exposici´on, saltar al paso siguiente. En caso contrario aparecer´a una ventana para introducir los par´ametros de exposici´on de cada fotograf´ıa. Escribirlos y hacer clic en ”OK”. 4. Seleccionar ”Modo: 32 bits” y hacer clic en ”OK”. 64 A.2. Luminance HDR Precio: Gratuito. Descarga: http://qtpfsgui.sourceforge.net/ Procedimiento de fusi´on de im´agenes HDR: 1. Hacer clic en ”New HDR image”. 2. Seleccionar ”Cargar im´agenes” y escoger las exposiciones correspondientes. Hacer clic en ”Abrir”. 3. Introducir el valor de exposici´on en EVs de cada fotograf´ıa y hacer clic en ”Siguiente”. Si la imagen est´a en un formato que conserve los par´ametros de exposici´on no ser´a necesario introducirlos. 4. Alinear las im´agenes si es preciso y hacer clic en ”Siguiente”. 5. Seleccionar uno de los perfiles de creaci´on que determinan la funci´on de pesos, la curva de respuesta y el modelo de creaci´on, o seleccionar cada uno por separado escogiendo la opci´on ”Use custom configuration”. Hacer clic en ”Finalizar”. A.3. Photomatix Pro Precio: desde 39 $. Descarga: http://www.hdrsoft.com/download.html Procedimiento de fusi´on de im´agenes HDR: 1. Hacer clic en ”Load Bracketed Photos”. 2. Hacer clic en ”Browse” y escoger las exposiciones correspondientes. 3. Seleccionar la diferencia de EVs entre im´agenes consecutivas con ”Specify the E.V. spacing” o introducir manualmente el valor de EV de cada fotograf´ıa. Hacer clic en ”OK”. 4. Si se desea que el programa trate de alinear las im´agenes autom´aticamente, seleccionar ”Align source images” en la ventana ”Preprocessing Options”. Asimismo, se ofrecen opciones de reducci´on de ruido, aberraciones crom´aticas y efectos de ghosting. Seleccionarlas las que se deseen y hacer clic en ”OK”. 5. Seleccionar ”Process: Exposure Fusion” y hacer clic en el bot´on ”Process”. 65 Ap´endice B Inserci´on de aperturas codificadas en el objetivo Canon EF 50mm f/1.8 II En este ap´endice se detalla el procedimiento de inserci´on de una apertura codificada en el objetivo Canon EF 50mm f/1.8 II. Material necesario (ver Figura B.1) Destornillador peque˜no Pa˜no para limpiar lentes Contenedor para las partes peque˜nas Cinta aislante Figura B.1: Objetivo Canon EF 50mm f/1.8 II junto a los materiales empleados. Es importante trabajar en un espacio ordenado y limpio, y ser cuidadoso a la hora de manipular el objetivo, pues consta de varias piezas peque˜nas 66 susceptibles de extraviarse, as´ı como partes delicadas que pueden da˜narse irreversiblemente. Metodolog´ıa: 1. Desenroscar la tapa de atr´as. Como se muestra en la Figura B.2, aparecer´an dos peque˜nos tornillos que deber´an ser retirados. A continuaci´on, poner el objetivo en enfoque manual y girar hacia abajo el disco de enfoque. Empujar suavemente la parte met´alica hacia abajo con el destornillador, y hacer palanca contra la cubierta de pl´astico para sacarla. Es muy importante tener cuidado de no da˜nar la circuiter´ıa interior, la lente o los cables. Figura B.2: Objetivo montado, con la tapa trasera desenroscada. 2. Presionar desde el interior del objetivo para despegar la tapa lateral. Una vez que ´esta ceda, hacer palanca con el destornillador para soltarla del todo, como se muestra en la Figura B.3. Figura B.3: Objetivo con la tapa lateral despegada. 3. Quitar el ´ultimo tornillo y la pieza met´alica que sujeta, indicados en la Figura B.3. Una vez hecho esto, girar el disco de enfoque hacia arriba y el objetivo quedar´a desmontado en las tres piezas que se muestran en la Figura B.4. 67 Figura B.4: Objetivo desmontado en sus tres piezas principales. 4. En la pieza de la lente, colocar la apertura codificada como se muestra en la Figura B.5. Es importante colocarla bien centrada para que todo el patr´on est´e dentro del c´ırculo de la lente. Sujetarla con peque˜nas tiras de cinta aislante, con cuidado de no tapar el patr´on con ella. Figura B.5: Pieza central con la apertura codificada. 5. Limpiar bien las lentes y volver a ensamblar el objetivo, repitiendo a la inversa los pasos 1-4. 68 Ap´endice C Art´ıculo: Analysis of Coded Apertures for Defocus Deblurring of HDR Images En este ap´endice se adjunta el art´ıculo resultante de la primera parte del proyecto, correspondiente al an´alisis del empleo de aperturas codificadas para correcci´on de desenfoques en im´agenes HDR. El art´ıculo fue sometido al Congreso Espa˜nol de Inform´atica Gr´afica (CEIG 2012), y a d´ıa de hoy se encuentra pendiente de aceptaci´on. 69 CEIG - Spanish Computer Graphics Conference (2012), pp. 1–10 Isabel Navazo and Gustavo Patow (Editors) Analysis of Coded Apertures for Defocus Deblurring of HDR Images Abstract In recent years, research on computational photography has reached important advances in the field of coded apertures for defocus deblurring. These advances are known to perform well for low dynamic range images (LDR), but nothing is written about the extension of these techniques to high dynamic range imaging (HDR). In this paper, we focus on the analysis of how existing coded apertures techniques perform in defocus deblurring of HDR images. We present and analyse three different methods for recovering focused HDR radiances from an input of blurred LDR exposures and from a single blurred HDR radiance, and compare them in terms of the quality of their results, given by the perceptual metric HDR-VDP2. Our research includes the analysis of the employment of different statistical deconvolution priors, made both from HDR and LDR images, performing synthetic experiments as well as real ones. Categories and Subject Descriptors (according to ACM CCS): I.4.3 [Image Processing and Computer Vision]: Enhancement—Sharpening and deblurring 1. Introduction The field of computational photography has obtained impressive results in last years, improving conventional photography results. One well known problem that conventional cameras present is the limitation of the sensor to capture images with an extended dynamic or luminance range. In a conventional camera the luminance range is limited and parts of the scene which present luminance out of the range would not be correctly represented. In this context HDR imaging (High Dynamic Range imaging) [RWPD05] is a strategy to capture and represent the extended luminance range present in real scenes. Also in terms of defocus deblurring computational photography has reached important advances. Since image capture can be modelled as a convolution between the focused image and the blur kernel plus a noise function, recovering a sharp image is reduced to a deconvolution problem. However, traditional circular apertures present a very poor response in frequency domain with multiple zero-crossings and attenuation in high frequencies. Thus, recovered images present poor quality. Coded apertures are designed to have an appropriate frequency response to solve this problem, placing them in the camera lens in order to code light before it reaches the camera sensor. The defocus blur is encoded and high frequencies are better preserved in the original image, obtaining better deblurred images after deconvolution. This work turns around both approaches, analysing the use of coded aperture for defocus deblurring techniques in HDR imaging. While it is well known that the use of coded apertures for defocus deblurring offers good performance with LDR images [ZN09], we believe this is the first time that these techniques are extended to HDR imaging. For this purpose, we rely in a coded aperture specifically designed for defocus deblurring of LDR images by Zhou et al. [ZN09] and use it to analyse this problem in HDR images. The pattern of this aperture can be seen in Figure 1beside its power spectrum compared to that of a circular aperture. Note that this aperture offers a better frequency response for defocus deblurring than the circular aperture. We propose and analyse three different processing models for recovering focused HDR images, one from a single blurred HDR radiance and two from an input of blurred LDR exposures, and analyse them first in simulation environment and finally in real scenarios. We also analyse the use of deconvolution statistical priors, made both from HDR and from LDR images, taking into account the work of Pouli et al. [PCR10] and following the approach that, to solve HDR problems, the use of HDR priors instead of LDR ones would lead to better results due to the existing statistical differences between both types of images. submitted to CEIG - Spanish Computer Graphics Conference (2012) 2/ Analysis of Coded Apertures for Defocus Deblurring of HDR Images Figure 1: Power spectra of the coded aperture designed for defocus deblurring by Zhou et al. [ZN09] and a conventional circular aperture. Note how the coded aperture pattern offers better frequency response as it avoids zero-crossings and reduces the attenuation in high frequencies. 2. Previous Work Coded apertures have been traditionally used in astronomy since 1960s to address SNR problems related to lensless imaging, coding the incoming high frequency x-rays and γrays. One well known pattern for this purpose is MURA pattern (Modified Uniformly Redundant Array) [GF89]. More recently, in the field of computational photography, Veeraghavan et al. [VRA∗07] showed how coded apertures can be used to reconstruct 4D light fields from 2D sensor information. Also coded apertures have been used for solving defocus deblurring problem. The main idea is to obtain coded apertures with better frequency response than the conventional circular aperture. Levin et al. [LFDF07] designed an optimal aperture for depth from defocus and a novel deconvolution method in order to achieve all in-focus images and depth recovery simultaneously. Another approach to recover focus and depth information of a scene was developed by Zhou et al. [ZLN09], in this case obtaining a pair of apertures through genetic algorithms and gradient descent search. Also Zhou et al. presented a metric that evaluates the goodness of a coded aperture for defocus deblurring based on the quality of the resulting deblurred image and image statistics [ZN09]. Recently, Masia et al. [MCPG12] introduced perceptual metrics in the optimization process leading to an aperture design and proved the benefits of this perceptually optimized coded apertures. For more information about technical details of HDR imaging we refer the reader to Reinhard’s book. [RWPD05]. 3. Processing methods The capture process of an image fis given by Equation 1: f=f0∗k+η(1) where f0is the focused scene, ηis a gaussian white noise with standard deviation σand kis a convolution kernel determined by the aperture shape and the blur size. In order to study the viability of the employment of coded apertures for defocus deblurring in HDR images, we simulate the capture process and attempt to recover a sharp image from the simulated blurred image. Being fHDR 0an HDR scene, we can use the approximation given by Equation 2to simulate the capture of a High Dynamic Range radiance fHDR only if we are able to capture it in one single shot. fHDR =fHDR 0∗k+η(2) Some existing cameras allow the capture of extended dynamic range, but in most cases HDR images are obtained by capturing series of LDR exposures and merging them later. Then, being fLDR 0n,(n=1,...,N)a set of LDR exposures of the same focused HDR scene fHDR 0, we can simulate the capture of the defocused HDR radiance by first simulating the capture of each exposure following Equation 3, and second merging them into a single HDR defocused radiance as expressed in Equation 4, being gthe HDR merging operator. fLDR n=fLDR 0n∗k+η(3) fHDR =g(fLDR 1,fLDR 2,..., fLDR N)(4) Once fHDR is obtained, we can recover the focused HDR radiance ˆ fHDR 0by performing a single deconvolution. However, as we have the LDR defocused exposures, it is possible to deblur them separately with a set of Ndeconvolutions and merge them later to obtain ˆ fHDR 0, following Equation 5. ˆ fHDR 0=g(ˆ fLDR 01 ,ˆ fLDR 02 ,..., ˆ fLDR 0N)(5) According to this, we present three different methods for recovering focused HDR radiances: 1. Processing HDR radiance obtained with a single shot: Following Equation 2to model the capture and recovering the focused radiance with a single deconvolution, as seen in Figure 2(a). 2. Processing HDR radiance obtained by merging LDR exposures: Following Equations 3and 4and recovering the focused HDR with a single deconvolution. The pipeline of this processing is shown in Figure 2(b). 3. Processing LDR exposures separately before merging: Following Equation 3to model the Ncaptures, recovering the focused LDR exposures with Ndeconvolutions and merging them as in Equation 5to obtain the HDR focused radiance. This pipeline can be seen in Figure 2(c). submitted to CEIG - Spanish Computer Graphics Conference (2012) / Analysis of Coded Apertures for Defocus Deblurring of HDR Images 3 (a) Pipeline for processing model 1 (b) Pipeline for processing model 2 (c) Pipeline for processing model 3 Figure 2: Pipelines for all different processing models, where k is the convolution kernel, GWN is the Gaussian White Noise, g is the HDR merging operator and * is the convolution operator. 4. Simulation of processing models First we analyse these three models by performing simulations in order to study their viability before proceeding to real experiments. To carry out these, we use one of the coded apertures developed by Zhou et al. [ZN09], which is shown in Figure 1. This aperture is known to work well for defocus deblurring LDR images. For the simulations we use a set of seven HDR photographs with different dynamic ranges for the first model, and their three corresponding LDR exposures for the other two. One of them is shown in Figure 3. The main goal is to recover the focused HDR images with all three processing methods. We use the perceptual metric HDR-VDP2 [MKRH11] in order to assess the quality of the results. This metric compares a reference HDR image with its distorted version, providing quality and visibility (probability of detection) measures based on a calibrated model of the human visual system. In this work we focus in obtaining the quality factor Q, a prediction of the quality degradation of the recovered HDR image with respect to the reference HDR image, expressed as a mean-opinion-score (with values between 0 and 100). This metric can not only work with HDR images, but also with their LDR counterparts. We test four different noise levels, with standard deviations of σ=0.0005, 0.001, 0.005, 0.05, and three different deconvolution models based on Wiener deconvolution, which formulation in frequency is given by Equation 6. ˆ F0=F·¯ K |K|2+|C|2(6) Where ˆ F0is the Fourier Transform of the recovered image, ¯ Kis the complex conjugate of K,|K|2=K·¯ Kand |C|2=|σ/F0|2is the Noise to Signal Ratio (NSR) matrix of the original image. From this deconvolution, we study these three different variations: •Wiener Deconvolution without prior, with constant NSR matrix. Replacing |C|2in Equation 6by a constant NSR matrix. We tested several values and found that there is a trade-off between noise and ringing in resulting images. We finally decided to set |C|2=0.005 achieving good balance between both artifacts. •Wiener Deconvolution using natural HDR image prior. Replacing |F0|2in Equation 6by an statistical prior matrix averaging power spectra of a series of 198 HDR images. We construct the prior employing HDR images from the database of Tania Pouli (http://taniapouli. co.uk/research/statistics/). •Wiener Deconvolution using natural LDR image prior. Replacing |F0|2as in the previous, using a prior of 198 submitted to CEIG - Spanish Computer Graphics Conference (2012)