Lingüística computacional 3 min de lectura

¿Qué es BabelNet y cómo combina la lingüística computacional con los grafos de conocimiento?

Descubra qué es BabelNet, una red semántica multilingüe creada por la Universidad de Roma La Sapienza mediante la integración de Wikipedia y WordNet.

En pocas palabras

  • BabelNet fue creada por la Universidad de Roma La Sapienza.
  • Combina la base de datos léxica WordNet con la enciclopedia Wikipedia.
  • La versión 3.7 de BabelNet cubre 271 idiomas e incluye más de 13 millones de synsets.

¿Qué es BabelNet y cómo combina la lingüística computacional con los grafos de conocimiento?

BabelNet es una red semántica multilingüe y una ontología lexicalizada desarrollada en la Universidad de Roma La Sapienza que funciona como un extenso diccionario enciclopédico. El sistema integra de manera automática fuentes de datos léxicos y enciclopédicos para conectar conceptos en cientos de idiomas a través de relaciones semánticas complejas.

Información general e interfaz de gestión de BabelNet
Tabla de información general sobre BabelNet, incluyendo su dominio, licencia y operador institucional.

¿Cómo se construye la red semántica de BabelNet a partir de Wikipedia y WordNet?

La arquitectura de BabelNet se edifica mediante la integración automatizada de la base de datos léxica WordNet del idioma inglés con la enciclopedia multilingüe Wikipedia. Este proceso de mapeo automático enlaza las entradas de ambas fuentes para formar conjuntos de sinónimos denominados Babel synsets. Cuando existen vacíos de información en lenguas de menores recursos, el sistema recurre a herramientas de traducción automática para enriquecer los contenidos. Para cada synset obtenido, la plataforma genera definiciones cortas o glosses recopiladas tanto de Wikipedia como de WordNet.

Esquema conceptual de la integración de WordNet y Wikipedia en BabelNet
Esquema gráfico que ilustra la creación de BabelNet mediante la combinación de bases de datos léxicas y enciclopédicas.

Qué volumen de idiomas, synsets y relaciones semánticas contiene BabelNet?

En su versión 3.7, publicada en agosto de 2016, BabelNet abarca un total de 271 idiomas, lo que incluye todas las lenguas europeas, diversos idiomas asiáticos y el latín. Esta edición almacena más de 13 millones de synsets y cerca de 745 millones de acepciones lingüísticas. En promedio, cada synset incorpora aproximadamente 5.5 sinónimos en cualquier idioma dado. Además, la red incorpora todas las relaciones léxicas tradicionales heredadas de WordNet, tales como la hiperonimia, la hipónimia, la meronimia, la holonimia y la antonimia, sumando alrededor de 364.000 relaciones, junto con aproximadamente 380 millones de conexiones subespecificadas obtenidas directamente de Wikipedia. Asimismo, la base de datos integra cerca de 11 millones de imágenes asociadas a los conceptos y se distribuye también en formato Lemon RDF.

¿Para qué se utiliza BabelNet en el campo del procesamiento del lenguaje natural?

Las aplicaciones prácticas de BabelNet se centran fundamentalmente en las tareas de procesamiento del lenguaje natural en entornos multilingües. El conocimiento lexicalizado y estructurado que proporciona el sistema ha permitido alcanzar avances significativos y altos niveles de rendimiento en áreas específicas de la investigación computacional, destacando de forma notable en el cálculo de la similitud semántica entre palabras o textos y en la desambiguación multilingüe de sentidos, donde los algoritmos determinan el significado correcto de un término según su contexto de uso.

Sources & Further Reading

R. Navigli and S. P. Ponzetto. 2012. BabelNet: The Automatic Construction, Evaluation and Application of a Wide-Coverage Multilingual Semantic Network. Artificial Intelligence, 193, Elsevier, pp. 217-250.

R. Navigli, S. P. Ponzetto. 2010. BabelNet: Building a Very Large Multilingual Semantic Network. Proc. of the 48th Annual Meeting of the Association for Computational Linguistics (ACL 2010), Uppsala, Sweden, pp. 216–225.

R. Navigli and S. P. Ponzetto. 2012. BabelRelate! A Joint Multilingual Approach to Computing Semantic Relatedness. Proc. of the 26th AAAI Conference on Artificial Intelligence (AAAI 2012), Toronto, Canada, pp. 108-114.

R. Navigli and S. P. Ponzetto. 2012. Joining Forces Pays Off: Multilingual Joint Word Sense Disambiguation. Proc. of the 2012 Conference on Empirical Methods in Natural Language Processing (EMNLP 2012), Jeju, Korea, pp. 1399-1410.

¿Te ha resultado útil esta respuesta?

Tu voto se guarda en este dispositivo.