scieee AI-readable full text Open interactive document viewer

Internet invisible y web semántica : ¿el futuro de los sistemas de información en línea?

Codina Bonilla, Lluís

Abstract

Los cambios en la Web Invisible, cuyas fronteras no dejan de retroceder, y el desarrollo de la web semántica marcarán buena parte del futuro de los sistemas de búsqueda en línea de los próximos años. La Web Invisible es cada vez menos invisible porque, poco a poco, y de una forma u otra, sus contenidos se van incorporando a los motores de búsqueda. La web semántica es la más ambiciosa e importante apuesta tecnológica y científica del W3 Consortium y afectará en gran medida a los desarrollos futuros en sistemas de representación y acceso a la información.

Full text

Internet invisible y web semántica: ¿el futuro de los sistemas de información en línea? Lluís Codina, Universitat Pompeu Fabra Resumen Los cambios en la Web Invisible, cuyas fronteras no dejan de retroceder, y el desarrollo de la web semántica marcarán buena parte del futuro de los sistemas de búsqueda en línea de los próximos años. La Web Invisible es cada vez menos invisible porque, poco a poco, y de una forma u otra, sus contenidos se van incorporando a los motores de búsqueda. La web semántica es la más ambiciosa e importante apuesta tecnológica y científica del W3 Consortium y afectará en gran medida a los desarrollos futuros en sistemas de representación y acceso a la información Palabras Clave Web Invisible, Formatos de documentos, Motores de búsqueda, Web semántica --------------------------- Resum Els canvis a la Web Invisible, les fronteres de la qual no deixen de retrocedir, i el desenvolupament de la web semàntica, marcaran bona part del futur dels sistemes de cerca en línia en els propers anys. La Web Invisible és cada vegada menys invisible, perquè lentament i d’una o altra manera, els seus continguts es van incorporant als motors de cerca. La web semàntica és la més ambiciosa i important aposta tecnològica i científica del W3 Consortium, i afectarà en gran mesura els desenvolupaments futurs de sistemes de representació i accés a la informació Paraules clau: Web Invisible; Formats de documents; Motors de cerca; Web semàntica 0. Metodología Para este trabajo nos hemos basado ampliamente en los resultados obtenidos de un proceso de análisis sistemático de funciones de búsqueda y representación de la información en sistemas de información documental en línea, entre los que destacan los análisis realizados a motores de búsqueda, multibuscadores y bases de datos en línea. Este trabajo se ha beneficiado también de las discusiones de un grupo de expertos1 que se llevan a cabo en un seminario de sistemas de información documentales desarrollado a lo largo del año 2003 y coordinado por el autor en el seno de dos proyectos de investigación financiados que se llevan a cabo en el Instituto de Lingüística Aplicada (IULA) de la Universitat Pompeu Fabra (UPF). 1. Internet invisible Internet invisible es un nombre claramente inadecuado para referirse al sector de sitios y de páginas web que no pueden indizar los motores de búsqueda de uso público como Google o AltaVista. Pese al nombre, afortunadamente, la web invisible es perfectamente visible ya que los contenidos de tales páginas y sitios web pueden ser vistos o bien mediante un navegador 1 Participaron habitualmente en el Seminario de Documentación-IULA en el período cubierto por este trabajo (enero-junio 2003): Miquel Centelles, Mercè Lorente, Mari Carmen Marcos, Gemma Martínez, Maria del Valle Palma y Cristòfol Rovira. convencional o bien mediante un navegador complementado con algún programa adicional (plugin). Por tal motivo, debería denominarse, en realidad, la web "no indizable", lo cual es un término mucho más adecuado, pero claramente alejado de la capacidad sugeridora del término "invisible". Dado que, sin embargo, es el término más habitual incluso en la bibliografía técnica, usaremos en este trabajo el término Web o Internet invisible para referirnos a la información publicada en servidores Web que por diversos motivos no puede ser indizada y, por tanto, no puede ser encontrada por los motores de búsqueda convencionales. Veamos ahora por qué hay contenidos no indizables en la Web. Hay al menos tres motivos. En un orden no significativo, podemos decir que el primer motivo son los formatos de los documentos. Los motores de búsqueda fueron creados originalmente para descargar, leer e indizar páginas HTML. Cualquier otro formato era ilegible, es decir, invisible para tales motores. Todos sabemos de la proliferación de formatos no HTML en la Web (que sin embargo se integran con toda facilidad en el navegador). Es el caso, por ejemplo, de los cada vez más abundantes documentos en formato .pdf (documentos Acrobat) e incluso en formato .doc (documentos Word). En la medida en que una parte de los contenidos de la Web está formada por documentos no HTML, esa parte es candidata a ser Internet invisible. Figura 1. Parte de un documento en formato no HTML (svg) visto en un navegador (http://www.mapageweb.umontreal.ca/turner/meta/english/) El segundo motivo son las páginas que se generan de forma dinámica; típicamente, a través de la consulta a una base de datos. Por ejemplo, si usamos All Movie (www.allmovie.com) para buscar información sobre un film obtendremos una URL como la que indica la figura siguiente: Figura 2. URL de un documento de la web invisible http://www.allmovie.com/cg/avg.dll?p=avg&sql=A169 Los motores de búsqueda no pueden indizar contenidos que se generan de ese modo. Antes de lanzar la búsqueda, el contenido existe en el formato binario (y propietario) de alguna base de datos. Solamente después de la consulta, y como resultado de ejecutar una instrucción 2 como la que muestra la figura anterior, se creará una página en formato HTML. El lector puede hacer la prueba, si copia la URL de la figura anterior (que contiene una consulta a una base de datos), y la introduce como dirección en un navegador obtendrá una página HTML que le informará sobre un film determinado. Antes, sin embargo, esa página no existía. En la imagen siguiente puede ver el resultado. Figura 3. Resultado de la página generada dinámicamente con la URL anterior (http://www.allmovie.com/cg/avg.dll?p=avg&sql=A169) En el caso de bases de datos como la anterior, los motores de búsqueda pueden proporcionar acceso a la página de inicio (home page) de la misma. Si hacemos una consulta por el término movies obtendremos entre los resultados (aunque en este caso hemos necesitado llegar hasta la tercera página) una entrada que se refiere a AllMovie, como podemos ver en la ilustración siguiente: Figura 4: Uno de los resultados de buscar en Google por el término movies Es decir, podemos acceder a las páginas principales de los sitios web que proporcionan acceso a bases de datos, porque tales principales son páginas HTML convencionales, pero no podemos acceder al resto del sitio a través del motor de búsqueda; y el resto del sitio puede ser (en ocasiones) una enorme base de datos. Por ejemplo, si lanzamos la consulta 2001 en Google, en ninguno de los resultados obtenemos la ficha del film correspondiente de All Movie. De hecho, obtendremos una diversidad de resultados que refleja que el término 2001, fuera de contexto, tiene muchos significados y no necesariamente el de título principal de un film de Kubrick. 3 Figura 5: Resultado de una búsqueda en un motor por el término "2001". (Obsérvese, por encima del primer resultado, la remisión a una categoría del directorio) Por último, forma parte de la web invisible el conjunto de sitios o de páginas web que, de forma expresa, se excluyen de la actividad indicadora de los motores de búsqueda. Algunos servidores excluyen a los motores de búsqueda de todos o de parte de sus carpetas y directorios mediante el uso de un protocolo de exclusión que, en general, respetan los programas rastreadores (spiders o crawlers) de tales motores de búsqueda. Tal protocolo consiste en un pequeño número de valores que puede adquirir el atributo content como parte de una etiqueta meta cuyo otro atributo, name, obtiene el valor "robots". Estas indicaciones se guardan en un simple archivo de texto de nombre robots.txt que se sitúa en el servidor de página web y que se supone que leen y respetan los rastreadores (robots). La figura siguiente muestra el uso de tal protocolo para indicar a los robots de los motores que no indicen la página en cuestión ni sigan ninguno de los enlaces que pueda contener tal página. Figura 6: Ejemplo de exclusión de motores de búsqueda de un sitio web <meta name="ROBOTS" content="noindex,nofollow"> Además del protocolo que acabamos de ver, hay otras razones por las cuales los motores no pueden entrar en un sitio. En general, cualquier sitio web que requiera el uso de contraseñas o passwords quedará fuera de la capacidad indizadora de los motores. Estos sitios pueden ser extranets o servicios que requieren no solamente una suscripción previa, sino que exigen el pago de una cantidad en concepto de abono, etc. Los motores también tienen dificultades para interpretar los sitios que usan marcos (frames), aunque son de otro tipo y no las consideraremos aquí. La cuestión es que, en total, algunos analistas señalan que la Web Invisible puede ser hasta 500 veces más grande que la Web visible (Bergman, 2001). Desde el punto de vista del acceso al conocimiento y de la clase de búsqueda y obtención de la información que nos interesa aquí, no hay ningún problema con que una parte de la Web Invisible siga siendo invisible. 4 Por ejemplo, no es ninguna tragedia para el desarrollo de la ciencia o del conocimiento humanos que la extranet o la intranet de una corporación sea invisible a los motores de búsqueda. No solo no es un problema, sino que es deseable que siga siendo así. Nadie quiere que los motores de búsqueda puedan indizar documentos administrativos particulares o informaciones confidenciales. Por tanto, de las tres razones por las cuales tenemos una Internet Invisible, una de ellas no es ningún problema, pero las otras dos sí. Recordemos: documentos con formato no HTML y páginas generadas dinámicamente (típicamente a través de bases de datos). Con la imposibilidad de indizar documentos no HTML tenemos, efectivamente, un auténtico problema. Muchos informes y estudios que contienen información valiosa están publicados y disponibles en la web de forma pública y abierta; sin embargo, si no son indizados de forma adecuada, son inaccesibles a casi todo el mundo a casi todos los efectos prácticos. Por otro lado, no deja de ser un problema que, pese a disponer de un cliente universal de acceso a la información: el navegador web, no exista, en cambio, nada similar a una interfase universal de acceso a la información desde el momento en que, para cada una de las varias decenas de miles de bases de datos existentes en Internet sea necesario: primero, un acceso diferenciado y segundo un sistema de consulta (en parte) diferente. En este último caso, obsérvese que las barreras al conocimiento son dos: el conocimiento de las fuentes y el dominio de la interfase de usuario de cada fuente. En efecto, en primer lugar, para que un usuario pueda beneficiarse de los contenidos de una base de datos es necesario, al menos, que sepa de su existencia. Pero, suponiendo que sepa de su existencia, entonces deberá tener habilidades de uso de tal base de datos y cada base de datos no solamente presenta una interfase de usuario diferente, sino un conjunto de funciones distintas. 2. Acceder a los contenidos de Internet Invisible 2.1. Formatos no html Pese a todo, se puede acceder a cada vez mayores "porciones" de la Web Invisible. Examinemos primero el caso de los formatos de documentos. Afortunadamente, en este aspecto, las fronteras de la Web Invisible no hacen más que retroceder. La tabla siguiente ilustra los formatos que, en estos momentos, son capaces de indizar (o al menos de buscar) dos de los motores más potentes de la Web: Figura 7. Tabla de formatos "buscables" a través de Google y AllTheWeb (además de html) Motor Formatos Acrobat (pdf) Postscript (ps) Word (doc) Excel (xls) PowerPoint (ppt) Google www.google.com Texto Enriquecido (rtf) Acrobat (pdf) Flash (swf) AllTheWeb www.alltheweb.com Word (doc) Vemos que, en el momento de realizar este trabajo, Google busca (y probablemente indiza) 6 formatos distintos de documentos (además, claro, del formato HTML) y AllTheWeb (uno de los 5 alumnos no solamente aventajados, sino respondones de Google) busca y/o indiza 3 formatos distintos. En este sentido, parece que la tendencia es clara: poco a poco, la mayor parte de los formatos de documentos significativos en el mundo científico y cultural serán indizados por los motores de búsqueda y, por tanto, esa zona de la Web Invisible dejará de serlo pronto. Además, hay dos factores más que confluyen en este aspecto: por un lado, los navegadores cada vez incorporan con mayor facilidad documentos no HTML. Es ejemplar, en este sentido, la integración de las últimas versiones de los navegadores y el formato pdf. Por otro lado, el progresivo ancho de banda disponible en manos de los usuarios (ADSL, por ejemplo) hace que esa integración sea transparente. De este modo, si los motores tienden a lo que podríamos llamar una "indización universal" y los navegadores (o agentes de usuario) tienden a poder mostrar cualquier tipo de documento, podemos concluir que este aspecto de la Web Invisible está llamado a ser marginal. Ahora bien, a veces las soluciones a los problemas aportan también problemas nuevos. A medida que formatos como pdf y word se integran en la Web con mayor naturalidad, para beneficio de los usuarios, desciende el grado de conectividad general de la Web. Es decir, una de las virtudes de la Web es la facilidad con la cual se pueden publicar páginas web (o sitios enteros) ricamente interconectados de forma interna, así como la facilidad para conectar páginas y sitios web remotos. Sin embargo, parte de esas facilidades desaparecen con formatos como pdf y word. Es cierto que un documento pdf, por ejemplo, puede contener enlaces internos o externos, pero en la práctica, se publican documentos pdf como una forma fácil de obtener una publicación de calidad tipográfica con mínimo esfuerzo. En la práctica, por tanto, la inmensa mayoría de documentos pdf están muy pobremente interconectados. 2.2. Bases de Datos También tenemos indicios de solución al segundo gran "problema" de la Web Invisible: el acceso al contenido de las bases de datos, pero desde motores convencionales. La solución aquí proviene de este enfoque: si bien es difícil o imposible indizar por parte de los motores de búsqueda el contenido de bases de datos ajenas, no debería haber mucha dificultad en generar interfases de consulta unificadas que enviaran una misma consulta a diferentes bases de datos desde, por ejemplo, una misma página web. El modelo en este caso son los multibuscadores, también (mal) llamados metabuscadores. Un multibuscador es un sistema que acepta como entrada la pregunta de un usuario y devuelve en una respuesta unificada las respuestas de diversos motores de búsqueda. Un buen ejemplo de multibuscador es Vivísimo (www.vivisimo.com). Una búsqueda en Vivísimo por los términos future of information systems muestra como resultado una compilación de la información ofrecida por diversos buscadores. Figura 8: El resultado de una búsqueda en Vivísimo (www.vivisimo.com) 6 Compilar información, en el caso de Vivísimo significa que no se limita a volcar los resultados que envía cada buscador, sino que: (a) unifica resultados (o sea, elimina duplicados); (b) distribuye los resultados por grupos o pseudo categorías que el sistema de agrupación (clustering) de Vivísimo es capaz de generar de manera automática. Pero lo que nos interesa aquí examinar es la siguiente idea: Vivísimo no intenta explotar directamente los índices de los distintos motores de búsqueda. En su lugar, hace algo más viable: envía la pregunta a diversos motores y procesa los resultados antes de ofrecerlos al usuario. Esta operación le permite ofrecer un resultado unificado cuyas fuentes, sin embargo, tienen procedencias muy diversas. Figura 9: Opciones de búsqueda en Vivísimo (www.vivisimo.com) Ahora bien, si observamos con atención la figura n. 9 podremos ver que entre las fuentes que utiliza Vivísimo (tomamos este sistema solamente a título de ejemplo) vemos que hay, al menos tres clases de fuentes: (1) motores de búsqueda como AltaVista (hasta aquí ninguna novedad), (2) sitios web de noticias como Reuters y (3) sitios web de bases de datos como 7 PubMed. ¿Qué significa esto? Simplemente, que Vivísimo es solamente una muestra de cómo se están derribando parte de las fronteras de la Internet Invisible. 2.3. Sindicación de contenidos Otro ejemplo sumamente interesante y buena muestra de lo que, probablemente, nos espera en los próximos años es el motor de búsqueda Scirus (www.scirus.com). Es aún pronto para saber si Scirus será un experimento efímero, como tantos otros proyectos esperanzadores en la web (esperemos que esta vez no) o solamente un avance de una nueva generación de sistemas de búsqueda en línea que rompa de una vez por todas las barreras de la Web Invisible. Scirus es un proyecto de una importante editorial científica, Elsevier, que ha producido un motor que es capaz de enviar las preguntas de los usuarios a las bases de datos que indica la tabla de la Figura 8. Figura 10. Bases de datos que puede interrogar Scirus de forma simultánea • Medline • Sciencedirect • Uspto • Beilstein Abstracts • E-Print Arxiv • Nasa Technical Reports • Cogprints • Biomed Central • Mathematics Preprint Server • Chemistry Preprint Server • Computer Science Preprint Server Además, Scirus indiza casi 90 millones de páginas web, es decir, documentos en formato HTML publicados en servidores de páginas web convencionales, pero siempre vinculados con instituciones académicas o científicas. De este modo, el usuario de Scirus, típicamente un investigador o un profesional, cuando realiza una búsqueda en este motor obtiene dos tipos de resultados: (1) páginas o sitios web relacionados con la ciencia, la universidad, etc.; (2) artículos de revista o registros referenciales procedentes de bases de datos de ciencia y tecnología (o sea, una parte de la Web Invisible). Scirus, por tanto, es uno de los mejores ejemplos que tenemos ahora a nuestro alcance de lo que pueden ser los futuros sistemas de información en línea: una interfase unificada de información a fuentes diversas. Figura 11: Un típico resultado en Scirus puede incluir artículos en texto completo procedentes de diversas bases de datos 8 Podemos concluir, en relación a este apartado, que las barreras de la Internet Invisible probablemente van a ir cediendo, una a una, hasta que los contenidos no indizables de Internet sean exactamente los que deben ser: porciones de la web que sus administradores o propietarios, en uso legítimo de sus prerrogativas, no desean que sean indizados. En cambio, los contenidos de la Internet Invisible correspondientes a formatos no HTML y parte del contenido que se encuentra en el formato binario de distintas bases de datos, serán accesibles desde motores de búsqueda públicos, del tipo Google o Scirus. Lo que esto último significa es que los productores de bases de datos deberán comenzar a plantearse si desean, por así decirlo, sindicar sus contenidos a los motores de búsqueda. Un modelo puede ser el que representa Scirus. Los productores de bases de datos pueden decidir que entra en sus intereses permitir la recepción de consultas y el envío consiguiente de resultados a uno o más motores de búsqueda, conscientes que los usuarios finales siempre persiguen, de una forma u otra, la idea (en parte utópica) de la interfase de consulta universal. Naturalmente, sindicación de contenidos implica también un modelo de negocio. Implica que los motores de búsqueda como Google o bien estén dispuestos a retribuir a los productores de las bases de datos, o bien que, a partir de un momento dado, una parte de los resultados ofrecidos por el sistema sea de acceso libre y otra sea de acceso condicionado al pago de una cierta cantidad o la condición de ser abonado o suscriptor. Esto último es lo que hace Scirus. Cuando un usuario lanza una búsqueda en Scirus puede encontrar tres tipos de resultados: (1) documentos de acceso totalmente libre, por ejemplo, un estudio publicado como una página web en un servidor web convencional y de acceso libre; (2) documentos a los que tiene acceso debido a que su institución posee una suscripción a la publicación correspondiente, por ejemplo un artículo de una revista suscrita por la biblioteca de su institución; (3) documentos a los que tiene acceso mediante pago con tarjeta de crédito. 3. La web semántica 3.1. Definiciones Ante todo, veamos la definición oficial de web semántica (semantic web). Según el W3 Consortium (el organismo promotor de la idea): 9 PALMA, María del Valle (1999). "Integración de la gestión documental en la administración pública: un estudio de caso". En: Fuentes, M.E. (dir.). Anuari de biblioteconomia, documentació i informació. Barcelona: COBDC, 1999, p. 179-212 PALMA, María del Valle (2002). "Bases de datos y servicios de información disponibles en Internet". En: Curso de Documentación Digital (CD-ROM). Barcelona: UPF, 2002 NUNBERG, G. (comp.) (1998). El futuro del libro: ¿esto matará eso?. Barcelona: Paidós, 1998, 314 p. ROVIRA, Cristòfol (2001). "Herramientas de ayuda a la navegación". Temes de Disseny, n. 18, abril 2001, , p. 66-73 TRAMULLAS, Jesús; OLVERA, M. Dolores (2001). Recuperación de la información en Internet. Madrid: Ra-Ma, 232 p. SHERMAN, Chris (1999). "The future of web search". Online, v. 23, n. 3, May/June 1999, p. 5461, SHERMAN, Chris (2000). "The future revisited: what's new with web search". Online, May 2000, <http://www.onlineinc.com/onlinemag/OL2000/sherman5.html> 16