Mientras las grandes empresas de softwares desarrollan programas que calcen con el concepto de web 2.0, el arribo de la “Web Semántica” pretende mejorar la forma que internet tiene de identificar los requerimientos de búsqueda, interpretando los criterios otorgados por el usuario.
Hace un tiempo se celebraron los 30 años de la creación de internet, pero la red de redes no deja espacio a la inmovilidad, y mientras todavía se decantan las ponencias de la “Web 2.0 Expo” -realizada en Estados Unidos a mediados de abril de 2007, la super carretera de la información ya promete un nuevo giro: la Web 3.0.
Si la Web 2.0 puso en el centro al usuario, y le dio el poder sobre los contenidos publicados en internet a través de wikis, blogs, Really Simple Sindicate y tagging, la Web 3.0 quiere influir en los esquemas que tiene la red para identificar los requerimientos de los usuarios.
Hasta ahora, cuando un navegante requiere información debe ingresar criterios específicos de búsqueda, que arrojan resultados en los que aparece la palabra clave. Sin embargo, la “Web 3.0”, o “Web semántica”, promete que el sistema tendrá la capacidad de interpretar una oración y arrojar resultados específicos.
Por ejemplo, un hombre podría teclear: “busco un lugar para pasar las vacaciones con mi mujer y mis dos hijos de 5 y 2 años, que sea cálido y con un presupuesto máximo de 1000 dólares”. Y la “Web Semántica” le respondería con un paquete de vacaciones detallado, que le ahorraría al usuario horas frente al computador.
Hay algunas organizaciones que ya están desarrollando investigaciones orientadas a la “Web Semántica”. La Universidad de Washington, financiada por Google, trabaja en el proyecto KnowItAll, destinado a obtener y agregar información de usuarios y de productos.
Pero hay quienes argumentan que este sueño no se concretará. Y para sostener su incredulidad, afirman que quienes tienen la información no querrán compartirla o, simplemente, se producirán fenómenos como el “Spam Semántico”, que transformarán la idea en un proyecto inviable.
Pero la Web 2.0, siguiendo la línea del beta permanente, ya comienza a implmentar este sistema mediante “tagging”, Así, cuando los usuarios suben información a la web, clasifican el contenido mediante palabras claves que quedan como etiquetas (madre, Santiago de Chile, mar, Concepción), y de este modo los buscadores pueden identificar información que con las técnicas tradicionales hubiera sido imposible localizar.
¿Y la Web 2.0?
En la “Web 2.0 Expo”, el “padre” del término y organizador del evento, Tim O'Reilly, salió al paso de las múltiples dudas que han surgido sobre el concepto, y explicó las ideas centrales de éstas que se resumen en adquisición, gestión y control de la información, considerando a éstas características más importantes que otras asociadas al término, como las redes sociales o el dinamismo en el navegador, a las cuales calificó como propiedades pasajeras.
Según O’Reilly, la necesidad por el control de la información está dando paso a la creación de software para servicios, y al existir aún muchos datos por controlar, continúan apareciendo propuestas innovadoras, varias de las cuales se presentaron en la exposición realizada en California.
El organizador del evento destacó, entre todas las presentaciones, un servicio de búsqueda de personas denominado Spock, que reúne información de otros servicios, como Google, Wikipedia y blog, para crear perfiles con tags, los que pueden ser complementados por los usuarios con fotografías, más información y relación con otros usuarios.
Otra presentación muy comentada por los asistentes fue la de Amazon.com, que entre sus novedades cuenta con la habilitación de su infraestructura a través de los Amazon Web Services, que le ofrece a sus clientes la capacidad de almacenamiento, determinada por los precios. Adobe también expuso su nueva plataforma "Apollo", donde mostró un cliente para el escritorio, un player multimedia, un procesador de textos y un gestor de calendarios.
Google comentó la reciente adquisición de la empresa Tonic Systems, que le permitirá agregar una aplicación para presentaciones, que completa una propuesta orientada hacia la colaboración; y de DoubleClick para entregar las herramientas al mercado de la publicidad para que cuente con todas las opciones desde Google.
Otra plataforma que llamó poderosamente la atención fue la de Maplight.org la cual permite a los ciudadanos establecer las relaciones de políticos con sus fuentes de financiamiento, de manera de transparentar posibles influencias entre la procedencia de los recursos y las leyes que se aprueban. Sin embargo, por el momento sólo está circunscrita a California.
En dirección a profundizar los cambios en la WEb 2.0, Google promete hacer historia con un traductor idiomático. Así lo comentaba Gonzalo Alonso, el “hombre Google” para Latinoamérica, quien estuvo nuevamente en Chile hace unos días. Google, que actualmente es lejos el buscador más utilizado del mundo y que nació en el garage de un par de estudiantes universitarios, es hoy la marca más cara del mundo -por sobre empresas como General Electric, Microsoft y Coca Cola. En la visita, Alonso dio a conocer el proyecto que promete acabar con las fronteras idiomáticas y culturales, al menos en internet. Desde hace tiempo, funcionarios de Google trabajan en un traductor simultáneo de todos los idiomas y para todos los idiomas. La idea es, por ejemplo, que un norteamericano instalado en el living de su casa en New Jersey, pueda ver el canal Al Jazeera y entender en el contexto la noticia que se está transmitiendo. Lo mismo ocurrirá con quien desee ver Fox News, o nuestros programas en latinoamerícoa para ser vistos y entendidos desde cualquier punto del planeta.
¿Cómo? Según Alonso, existe una solución matemática de algoritmos que permite dar sentido y contexto literario a las frases, más allá de la traducción directa, eso sí es intercatividad idiomática.
Hasta el momento, y según el cálculo que hace Google, el 20% de la información disponible en el mundo (textos, fotos, audios y películas) están en Internet digitalizados para ser encontrados con el buscador. El otro 80%, está fuera. Esta misma proporción se mantendrá varios años más, porque aunque el gran objetivo de Google es digitalizar y organizar toda la información disponible en el mundo, pasarán varias generaciones antes que se logre. “Es tanta la cantidad de información disponible que también abruma a la gente que trabaja en Google”, dijo Alonso, consciente de que la meta es muy grande y agresiva, “seguramente demandará varias generaciones”.
Otra de las tareas que se ha autoimpuesto Google y que forman parte activa en la actual internet 2.0, es el llevar los libros a Internet. En Chile ya hay al menos tres editoriales dispuestas a digitalizar sus obras (Andrés Bello y Universitaria, entre ellos) y ya están en conversaciones con otras más y en lationoamérica de a poco las editoriales empiezan a perder sus prejuicios con la digitalización y el uso de información en carreteras cada vez más anchas empieza a ser una realidad.
Habrá que esperar los desafíos de esta internet 2.0 recargada mientras se siguen sucediendo los desarrollos de softwares y tecnologías que nos permitan soñar con una red de internet 3.0 que interprete lo más fielmente la sensibilidad y búsqueda de sus usuarios.
Fuente: Diario La Nacion - Santiago de Chile
martes, 8 de abril de 2008
martes, 1 de abril de 2008
EVOLUCION DE LA WEB HASTA LA WEB SEMANTICA
La aparición de la WWW se puede situar en 1989 [Abrams 1998, Connolly 2000],cuando Tim Berners-Lee presentó su proyecto de “World Wide Web” [Berners-Lee1989] en el CERN (Suiza), con las características esenciales que perduran en nuestrosdías. El propio Berners-Lee completó en 1990 el primer servidor web y el primer cliente,y un año más tarde publicó el primer borrador de las especificaciones de HTML y HTTP.El lanzamiento en 1993 de Mosaic, el primer navegador de dominio público, compatiblecon Unix, Windows, y Macintosh, por el National Center for SupercomputingApplications (NCSA), marca el momento en que la WWW se da a conocer al mundo,extendiéndose primero en universidades y laboratorios, y en cuestión de meses al públicoen general, iniciando el que sería su vertiginoso crecimiento. Los primeros usuariosacogieron con entusiasmo la facilidad con que se podían integrar texto y gráficos y saltarde un punto a otro del mundo en una misma interfaz, y la extrema sencillez paracontribuir contenidos a una web mundial.Por estas mismas fechas se define la interfaz CGI para la generación dinámica de páginasweb, con lo que se consigue ofrecer información actualizada en tiempo real, enlazar conbases de datos, o tener en cuenta entradas del usuario, y más aún, servir como punto deacceso y plataforma para la ejecución de aplicaciones distribuidas. En 1994 miembros delequipo que creó Mosaic desarrollan Netscape, un navegador con sensibles mejoras quecontribuye a impulsar la propagación de la web. Este mismo año se celebra el primercongreso internacional de la WWW, y unos meses más tarde se constituye el consorcioW3C, que desde entonces y presidido por Tim Berners-Lee, se ha hecho cargo deestandarizar las principales tecnologías web. En 1995 Sun lanza oficialmente la primeraversión del lenguaje Java, y un año más tarde Netscape presenta JavaScript. Estoslenguajes y otros posteriores permiten que las propias páginas web contengan programasenteros, dando opción a una mayor autonomía respecto del servidor, mayor eficiencia,capacidad dinámica y capacidad de interacción.
Actualmente aunque es sumamente difícil medir el tamaño de la web, se estima que hoy día unos 10^9 usuarios utilizan la web, y que ésta contiene del orden de 4 x 10^9 documentos, un volumen de información equivalente a entre 14 y 28 millones de libros [Bergman 2001]. Comodato comparativo, la asociación American Research Libraries, que agrupa unas 100bibliotecas en EE.UU., tiene catalogados unos 3.7 millones de libros. La biblioteca de laUniversidad de Harvard, la mayor de EE.UU., contiene en torno a 15 millones de libros.Estas cifras incluyen sólo lo que se ha dado en denominar la web superficial, formada porlos documentos estáticos accesibles en la web. Se ha calculado que la llamada webprofunda, constituida por las bases de datos cuyos contenidos, no directamenteaccesibles, se hacen visibles mediante páginas generadas dinámicamente, puede contenerun tamaño de información varios cientos de veces mayor, y de mucha mejor calidad, quela web superficial, y crece a un ritmo aún mayor que ésta [O’Neill 2003]. Se estima queel tamaño de la web profunda ha superado ya al volumen total de información impresaexistente en todo el planeta.Hoy casi todo está representado de una u otra forma en la web, y con la ayuda de un buenbuscador, podemos encontrar información sobre casi cualquier cosa que necesitemos. Laweb está cerca de convertirse en una enciclopedia universal del conocimiento humano.Por otra parte la web nos permite realizar diferentes actividades de nuestra vida diaria conuna comodidad, economía y eficiencia sin precedentes: sin movernos de casa podemoscomprar todo tipo de productos y servicios, gestionar una cuenta bancaria, buscar unrestaurante, consultar la cartelera, leer la prensa, localizar a una persona, matricularnos enla universidad, acceder a un callejero, o trabajar desde nuestro domicilio.No obstante, en este panorama tan favorable hay espacio para mejoras. Por ejemplo, elenorme tamaño que ha alcanzado la web, a la vez que es una de las claves de su éxito,hace que algunas tareas (por ejemplo encontrar la planificación óptima con transporte,alojamiento, etc., entre todas las posibles para un viaje bajo ciertas condiciones),requieran un tiempo excesivo para una persona o resulten sencillamente inabarcables.Desarrollar programas que realicen estas tareas en nuestro lugar es enormementecomplicado, ya que es muy difícil reproducir, y más costoso aún mantener, en unamáquina la capacidad de una persona para comprender los contenidos de la web tal ycomo están codificados actualmente.
La falta de capacidad de las representaciones en que se basa la web actual para expresar significados. Los contenidos y servicios en la web se presentan en formatos (p.e. HTML) e interfaces (p.e. formularios) comprensibles por personas, pero no por máquinas. La figura 1 ejemplifica esta situación con una versión simplificada de una página de información meteorológica. Mientras que la presentación de los datos en el navegador es inmediatamente comprendida por una persona, es muy difícil para el ordenador entender cuál es la temperatura, el estado del cielo, y demás semántica del documento, al estarentremezclada con las etiquetas de formato.
En estas condiciones es poco viable automatizar tareas mediante software en substitución
del humano. Un programa puede llevar al usuario hasta lugares en la web, generar, transportar, transformar y ofrecer la información a las personas, pero la máquina sencillamente no sabe lo que esta información significa, y por tanto su capacidad de actuación autónoma es muy limitada. Esta misma limitación expresiva hace que la noción de semántica que manejan los buscadores web se limite a palabras clave con pesos, pero planas e inconexas, lo que no permite reconocer ni solicitar significados más elaborados.
La web semántica
La web semántica [Berners-Lee 2001] propone superar las limitaciones de la web actual mediante la introducción de descripciones explícitas del significado, la estructura interna y la estructura global de los contenidos y servicios disponibles en la WWW. Frente a la semántica implícita, el crecimiento caótico de recursos, y la ausencia de una organización clara de la web actual, la web semántica aboga por clasificar, dotar de estructura y anotar los recursos con semántica explícita procesable por máquinas. La figura 2 ilustra esta propuesta. Actualmente la web se asemeja a un grafo formado por nodos del mismo tipo, y arcos (hiperenlaces) igualmente indiferenciados. Por ejemplo, no se hace distinción entre la página personal de un profesor y el portal de una tienda on-line, como tampoco se distinguen explícitamente los enlaces a las asignaturas que imparte un profesor de los enlaces a sus publicaciones. Por el contrario en la web semántica cada nodo (recurso) tiene un tipo (profesor, tienda, pintor, libro), y los arcos representan relaciones explícitamente diferenciadas (pintor – obra, profesor – departamento, libro – editorial).
La web semántica mantiene los principios que han hecho un éxito de la web actual, como son los principios de descentralización, compartición, compatibilidad, máxima facilidad de acceso y contribución, o la apertura al crecimiento y uso no previstos de antemano. En este contexto un problema clave es alcanzar un entendimiento entre las partes que han de intervenir en la construcción y explotación de la web: usuarios, desarrolladores y programas de muy diverso perfil. La web semántica rescata la noción de ontología del campo de la Inteligencia Artificial como vehículo para cumplir este objetivo. Gruber define ontología como “a formal explicit specification of a shared conceptualization” [Gruber 1993]. Una ontología es una jerarquía de conceptos con atributos y relaciones, que define una terminología consensuada para definir redes semánticas de unidades de información interrelacionadas. Una ontología proporciona un vocabulario de clases y relaciones para describir un dominio, poniendo el acento en la compartición del conocimiento y el consenso en la representación de éste. Por ejemplo, una ontología sobre arte podría incluir clases como Pintor, Cuadro, Estilo o Museo, y relaciones como autor de un cuadro, pintores pertenecientes a un estilo artístico u obras localizadas en un museo.
La idea es que la web semántica esté formada (al menos en parte) por una red de nodos tipificados e interconectados mediante clases y relaciones definidas por una ontología compartida por sus distintos autores. Por ejemplo, una vez establecida una ontología sobre cuadros y pintura, un museo virtual puede organizar sus contenidos definiendo instancias de pintores, cuadros, etc., interrelacionándolas y publicándolas en la web semántica. La adopción de ontologías comunes es clave para que todos los que participen de la web semántica, contribuyendo o consumiendo recursos, puedan trabajar de forma autónoma con la garantía de que las piezas encajen. Así por ejemplo varios museos podrían colaborar para dar lugar a un gran meta-museo que integre los contenidos de todos ellos. Un programa que navegue por una red como ésta puede reconocer las distintas unidades de información, obtener datos específicos o razonar sobre relaciones complejas. A partir de aquí sí podemos distinguir entre un cuadro pintado por un artista y un retrato de un artista.
Por último, la web no solamente proporciona acceso a contenidos sino que también ofrece interacción y servicios (comprar un libro, reservar una plaza en un vuelo, hacer una transferencia bancaria, simular una hipoteca). Los servicios web semánticos son una línea importante de la web semántica, que propone describir no sólo información sino definir ontologías de funcionalidad y procedimientos para describir servicios web: sus entradas y salidas, las condiciones necesarias para que se puedan ejecutar, los efectos que producen, o los pasos a seguir cuando se trata de un servicio compuesto. Estas descripciones procesables por máquinas permitirían automatizar el descubrimiento, la composición, y la ejecución de servicios, así como la comunicación entre unos y otros.
Fuente: Universidad Autónoma de Madrid
Nota: (Disponía de imagenes que el editor no me permitia publicar)
Actualmente aunque es sumamente difícil medir el tamaño de la web, se estima que hoy día unos 10^9 usuarios utilizan la web, y que ésta contiene del orden de 4 x 10^9 documentos, un volumen de información equivalente a entre 14 y 28 millones de libros [Bergman 2001]. Comodato comparativo, la asociación American Research Libraries, que agrupa unas 100bibliotecas en EE.UU., tiene catalogados unos 3.7 millones de libros. La biblioteca de laUniversidad de Harvard, la mayor de EE.UU., contiene en torno a 15 millones de libros.Estas cifras incluyen sólo lo que se ha dado en denominar la web superficial, formada porlos documentos estáticos accesibles en la web. Se ha calculado que la llamada webprofunda, constituida por las bases de datos cuyos contenidos, no directamenteaccesibles, se hacen visibles mediante páginas generadas dinámicamente, puede contenerun tamaño de información varios cientos de veces mayor, y de mucha mejor calidad, quela web superficial, y crece a un ritmo aún mayor que ésta [O’Neill 2003]. Se estima queel tamaño de la web profunda ha superado ya al volumen total de información impresaexistente en todo el planeta.Hoy casi todo está representado de una u otra forma en la web, y con la ayuda de un buenbuscador, podemos encontrar información sobre casi cualquier cosa que necesitemos. Laweb está cerca de convertirse en una enciclopedia universal del conocimiento humano.Por otra parte la web nos permite realizar diferentes actividades de nuestra vida diaria conuna comodidad, economía y eficiencia sin precedentes: sin movernos de casa podemoscomprar todo tipo de productos y servicios, gestionar una cuenta bancaria, buscar unrestaurante, consultar la cartelera, leer la prensa, localizar a una persona, matricularnos enla universidad, acceder a un callejero, o trabajar desde nuestro domicilio.No obstante, en este panorama tan favorable hay espacio para mejoras. Por ejemplo, elenorme tamaño que ha alcanzado la web, a la vez que es una de las claves de su éxito,hace que algunas tareas (por ejemplo encontrar la planificación óptima con transporte,alojamiento, etc., entre todas las posibles para un viaje bajo ciertas condiciones),requieran un tiempo excesivo para una persona o resulten sencillamente inabarcables.Desarrollar programas que realicen estas tareas en nuestro lugar es enormementecomplicado, ya que es muy difícil reproducir, y más costoso aún mantener, en unamáquina la capacidad de una persona para comprender los contenidos de la web tal ycomo están codificados actualmente.
La falta de capacidad de las representaciones en que se basa la web actual para expresar significados. Los contenidos y servicios en la web se presentan en formatos (p.e. HTML) e interfaces (p.e. formularios) comprensibles por personas, pero no por máquinas. La figura 1 ejemplifica esta situación con una versión simplificada de una página de información meteorológica. Mientras que la presentación de los datos en el navegador es inmediatamente comprendida por una persona, es muy difícil para el ordenador entender cuál es la temperatura, el estado del cielo, y demás semántica del documento, al estarentremezclada con las etiquetas de formato.
En estas condiciones es poco viable automatizar tareas mediante software en substitución
del humano. Un programa puede llevar al usuario hasta lugares en la web, generar, transportar, transformar y ofrecer la información a las personas, pero la máquina sencillamente no sabe lo que esta información significa, y por tanto su capacidad de actuación autónoma es muy limitada. Esta misma limitación expresiva hace que la noción de semántica que manejan los buscadores web se limite a palabras clave con pesos, pero planas e inconexas, lo que no permite reconocer ni solicitar significados más elaborados.
La web semántica
La web semántica [Berners-Lee 2001] propone superar las limitaciones de la web actual mediante la introducción de descripciones explícitas del significado, la estructura interna y la estructura global de los contenidos y servicios disponibles en la WWW. Frente a la semántica implícita, el crecimiento caótico de recursos, y la ausencia de una organización clara de la web actual, la web semántica aboga por clasificar, dotar de estructura y anotar los recursos con semántica explícita procesable por máquinas. La figura 2 ilustra esta propuesta. Actualmente la web se asemeja a un grafo formado por nodos del mismo tipo, y arcos (hiperenlaces) igualmente indiferenciados. Por ejemplo, no se hace distinción entre la página personal de un profesor y el portal de una tienda on-line, como tampoco se distinguen explícitamente los enlaces a las asignaturas que imparte un profesor de los enlaces a sus publicaciones. Por el contrario en la web semántica cada nodo (recurso) tiene un tipo (profesor, tienda, pintor, libro), y los arcos representan relaciones explícitamente diferenciadas (pintor – obra, profesor – departamento, libro – editorial).
La web semántica mantiene los principios que han hecho un éxito de la web actual, como son los principios de descentralización, compartición, compatibilidad, máxima facilidad de acceso y contribución, o la apertura al crecimiento y uso no previstos de antemano. En este contexto un problema clave es alcanzar un entendimiento entre las partes que han de intervenir en la construcción y explotación de la web: usuarios, desarrolladores y programas de muy diverso perfil. La web semántica rescata la noción de ontología del campo de la Inteligencia Artificial como vehículo para cumplir este objetivo. Gruber define ontología como “a formal explicit specification of a shared conceptualization” [Gruber 1993]. Una ontología es una jerarquía de conceptos con atributos y relaciones, que define una terminología consensuada para definir redes semánticas de unidades de información interrelacionadas. Una ontología proporciona un vocabulario de clases y relaciones para describir un dominio, poniendo el acento en la compartición del conocimiento y el consenso en la representación de éste. Por ejemplo, una ontología sobre arte podría incluir clases como Pintor, Cuadro, Estilo o Museo, y relaciones como autor de un cuadro, pintores pertenecientes a un estilo artístico u obras localizadas en un museo.
La idea es que la web semántica esté formada (al menos en parte) por una red de nodos tipificados e interconectados mediante clases y relaciones definidas por una ontología compartida por sus distintos autores. Por ejemplo, una vez establecida una ontología sobre cuadros y pintura, un museo virtual puede organizar sus contenidos definiendo instancias de pintores, cuadros, etc., interrelacionándolas y publicándolas en la web semántica. La adopción de ontologías comunes es clave para que todos los que participen de la web semántica, contribuyendo o consumiendo recursos, puedan trabajar de forma autónoma con la garantía de que las piezas encajen. Así por ejemplo varios museos podrían colaborar para dar lugar a un gran meta-museo que integre los contenidos de todos ellos. Un programa que navegue por una red como ésta puede reconocer las distintas unidades de información, obtener datos específicos o razonar sobre relaciones complejas. A partir de aquí sí podemos distinguir entre un cuadro pintado por un artista y un retrato de un artista.
Por último, la web no solamente proporciona acceso a contenidos sino que también ofrece interacción y servicios (comprar un libro, reservar una plaza en un vuelo, hacer una transferencia bancaria, simular una hipoteca). Los servicios web semánticos son una línea importante de la web semántica, que propone describir no sólo información sino definir ontologías de funcionalidad y procedimientos para describir servicios web: sus entradas y salidas, las condiciones necesarias para que se puedan ejecutar, los efectos que producen, o los pasos a seguir cuando se trata de un servicio compuesto. Estas descripciones procesables por máquinas permitirían automatizar el descubrimiento, la composición, y la ejecución de servicios, así como la comunicación entre unos y otros.
Fuente: Universidad Autónoma de Madrid
Nota: (Disponía de imagenes que el editor no me permitia publicar)
Suscribirse a:
Entradas (Atom)