Tecnología e Información 3 min de lectura

¿En qué consiste el proceso de archivado web y por qué es fundamental para la historia digital?

Descubra qué es el archivado web, sus métodos de recolección, su historia y los desafíos legales y técnicos que enfrentan las instituciones.

En pocas palabras

  • El archivado web recolecta y conserva páginas de internet para investigadores e historiadores utilizando herramientas automatizadas.
  • Internet Archive, fundado en 1996, introdujo la Wayback Machine en 2001 como un motor de búsqueda para contenidos archivados.
  • Instituciones como la Biblioteca Nacional de España y la Biblioteca Nacional de Chile desarrollan proyectos oficiales de preservación digital.

¿En qué consiste el proceso de archivado web y por qué es fundamental para la historia digital?

El archivado web es el proceso mediante el cual se recolectan fracciones o partes de la World Wide Web para garantizar que la información se conserve en un sistema accesible para futuros investigadores, historiadores y el público en general. Dado el enorme tamaño de internet, esta tarea requiere de herramientas automatizadas conocidas como rastreadores web.

¿Cómo se originó y evolucionó el archivado web a escala global?

La conservación sistemática de la web comenzó a ganar relevancia a mediados y fines de la década de 1990. Uno de los proyectos pioneros a gran escala fue Internet Archive, una organización sin fines de lucro fundada en 1996 por Brewster Kahle. En 2001, esta institución lanzó Wayback Machine, un motor de búsqueda que permite visualizar versiones pasadas de páginas web.

¿Qué papel desempeñan las bibliotecas nacionales y los consorcios internacionales?

Ante la creciente porción de la cultura humana registrada en internet, las bibliotecas y archivos nacionales han integrado el archivado web en sus prácticas de depósito legal y patrimonial. Instituciones como la Biblioteca Nacional de España, con su Archivo de la Web Española iniciado en 2009, y la Biblioteca Nacional de Chile, participan activamente en la preservación de contenidos digitales culturales.

¿Cuáles son los principales métodos técnicos utilizados para recolectar contenido web?

La técnica más común es la cosecha remota empleando rastreadores web automatizados. Estos programas navegan por los sitios de manera similar a un usuario humano para recopilar páginas en HTML, hojas de estilo, archivos multimedia y metadatos asociados que permiten certificar la autenticidad del material recopilado.

¿Qué desafíos técnicos y limitaciones enfrentan los rastreadores web?

Los archivos que dependen del rastreo automatizado se enfrentan a diversos obstáculos operativos. Entre ellos destacan el estándar de exclusión de robots, la existencia de contenidos ocultos en la internet profunda, las trampas de rastreadores y las modificaciones dinámicas que cambian los sitios antes de que finalice la captura.

¿Qué barreras legales y normativas afectan la preservación de los sitios de internet?

A pesar de su valor público, la mayor parte de la World Wide Web se encuentra protegida por derechos de autor, lo que en principio limita la capacidad legal de los archivos para copiar y redistribuir contenidos sin autorizaciones específicas o extensiones de depósito legal.

Sources & Further Reading

  • González Flórez, Jhon Alexander (2015). Archivamiento web: Conceptos básicos, estrategias y mejores prácticas. Archivo General de la Nación de Colombia.
  • Truman, Gail (2016). Web Archiving Environmental Scan. Harvard Library.
  • Toyoda, M.; Kitsuregawa, M. (2012). The History of Web Archiving. Proceedings of the IEEE, 100.
  • Costa, Miguel; Gomes, Daniel; Silva, Mário J. (2017). The evolution of web archiving. International Journal on Digital Libraries, 18(3).
  • Consalvo, Mia; Ess, Charles (Eds.) (2011). The Handbook of Internet Studies. Wiley.
¿Te ha resultado útil esta respuesta?

Tu voto se guarda en este dispositivo.