Estimated reading time: 7 minutos
Puntos Clave
- La digitalización mejora el acceso, pero no garantiza que se aproveche toda la información disponible.
- Preparar un archivo para IA implica conocer su contenido, calidad y metadatos antes de aplicar tecnologías.
- Los metadatos son esenciales para estructurar y facilitar la recuperación de documentos en entornos digitales.
- La elección de la tecnología adecuada varía según el tipo de documento y tarea, requiriendo supervisión profesional.
- El objetivo final es optimizar el uso de la información archivística mediante IA, aumentando su accesibilidad y análisis.
Tabla de contenidos
La digitalización fue el inicio de todo lo que vemos hoy. El paso de los documentos del formato analógico al digital ha permitido su mejor preservación y una facilidad de consulta impensable varias décadas atrás. Las barreras asociadas al soporte físico han desaparecido.
Pero disponer de millones de imágenes digitales no significa que estemos aprovechando toda la información que contienen.
Lo hemos visto muchas veces en proyectos que hemos acometido. Un expediente puede ser digital y seguir siendo de difícil acceso o consulta. Un fondo histórico puede ser consultado en línea, pero exigir a los archiveros o investigadores horas de revisión para localizar una referencia concreta o una colección puede disponer de información que nunca ha llegado a formar parte de sus metadatos.
La aplicación de inteligencia artificial a los archivos abre nuevas posibilidades para trabajar con esa información. Y desde nuestra posición, las empresas vinculadas al sector de la gestión de la información, tenemos el deber de aprovecharla.
Clasificar documentos, extraer datos, reconocer entidades, relacionar contenidos, generar resúmenes o realizar consultas en lenguaje natural son capacidades que empiezan a tener aplicaciones muy concretas.
El resultado, sin embargo, depende en gran medida del trabajo previo realizado con los fondos. Gran parte del peso de esta gran oportunidad que se nos brinda para trabajar con la IA recae en cómo está preparado el archivo sobre el que va a operar.
El conocimiento del fondo sigue siendo el punto de partida
La identificación de un fondo o una parte del fondo es primordial para entender qué documentación tenemos delante. Realizar ese trabajo nos va a decir qué series documentales existen, qué periodos abarcan, en qué soportes se encuentran, qué estructura presentan los documentos, qué nivel de descripción se ha alcanzado o qué problemas de conservación y legibilidad pueden afectar al tratamiento posterior.
Dos fondos con un volumen similar pueden exigir planteamientos completamente diferentes.
El tratamiento documental no es el mismo con expedientes administrativos relativamente homogéneos que con correspondencia histórica.
Ese conocimiento previo del fondo es el que nos va a permitir determinar qué información merece la pena extraer o qué tratamiento tecnológico puede aplicarse.
La imagen digital fue solo el comienzo.Y lacalidad de la digitalización condiciona buena parte de lo que podemos hacer después.
Para aplicar tecnologías de reconocimiento de texto, clasificación automática o extracción de información, aspectos como la resolución, el contraste o el estado del original influyen directamente en la calidad de los datos que podremos obtener.
Pero tan importante es partir de un archivo digital óptimo como tener claro qué queremos hacer con ese archivo.
Digitalizar para preservar un documento y digitalizar para someter posteriormente miles de páginas a procesos automáticos de análisis no plantea exactamente las mismas necesidades.
En nuestra propia experiencia hemos tenido proyectos con los que era suficiente disponer de una imagen de calidad y unos metadatos adecuados. Pero en otros (más recientes) hemos necesitado ir un paso más allá segmentando el contenido para determinar estructuras o sistemas capaces de tratar documentos con configuraciones muy distintas.
Por eso, la posterior explotación de la información tratada debería formar parte de la reflexión desde el comienzo del proyecto.
Los metadatos orientan a las máquinas
La mayoría ya conocéis la importancia que tienen los metadatos para ayudarnos a describir, ordenar, relacionar y recuperar documentos en entornos digitales. La incorporación de IA aumenta todavía más su importancia.
El tratamiento archivístico previo debe dar una estructura coherente y proporcionar contexto a los sistemas que van a intervenir en el fondo.
Como explicamos, al analizar el papel del cuadro de clasificación documental en los archivos híbridos, esta estructura permite mantener una lógica común entre documentos físicos, expedientes electrónicos y los distintos sistemas en los que se gestionan. También proporciona el contexto necesario para que las tecnologías posteriores no tengan que reconstruir por sí solas las relaciones existentes entre fondos, series y documentos.
Cuanto mejor conozcamos la estructura documental, menos tendremos que confiar en que una tecnología reconstruya por sí sola aquello que la organización ya sabe sobre su archivo.
Un ejemplo lo encontramos en nuestra propia experiencia con un importante archivo de Madrid. Durante los últimos años, Normadat ha trabajado en la descripción archivística e indización de fondos en los que buena parte de la información útil se encontraba dentro de los propios expedientes y debía ser localizada, interpretada y trasladada a registros estructurados por profesionales especializados.
Este tipo de proyectos permite entender bien dónde puede aportar valor la tecnología. Antes de plantear una extracción automática o aplicar inteligencia artificial, hay que saber qué información interesa recuperar, cómo aparece en los documentos, qué excepciones existen y qué grado de interpretación requiere. Ese conocimiento previo del fondo es el que permite decidir después qué tareas pueden automatizarse y cuáles necesitan validación profesional.
Preparar un archivo para IA requiere elegir la tecnología adecuada
Ahora bien, no todos los documentos ni todas las tareas necesitan la misma tecnología.
Estamos cayendo en el error de cobijar bajo el paraguas de “IA” herramientas y técnicas muy distintas.
En un mismo proyecto pueden intervenir reconocimiento de caracteres, modelos de visión, clasificación documental, procesamiento inteligente de documentos, extracción de entidades, modelos de lenguaje o sistemas de recuperación semántica.
Las empresas tenemos que ofrecer a nuestros clientes la combinación de las tecnologías más útil para cada fondo y para cada objetivo.
Habrá tareas muy repetitivas donde un proceso automático pueda alcanzar resultados consistentes. Otras requerirán establecer umbrales de confianza y enviar determinados documentos a validación humana.
Esta necesidad de preparación y supervisión también aparece en experiencias desarrolladas por instituciones archivísticas. En un estudio sobre el uso de inteligencia artificial para seleccionar documentos digitales, The National Archives del Reino Unido probó cinco soluciones tecnológicas y concluyó que la preparación cuidadosa de los datos, junto con un proceso continuado de prueba y ajuste, mejoraba significativamente los resultados frente al uso directo de las herramientas. El estudio también señala que estas tecnologías pueden apoyar el trabajo archivístico, pero no sustituir el conocimiento de los profesionales responsables de la documentación.
El objetivo final es poder utilizar mejor la información
La incorporación de IA es un antes y un después del mundo en el que vivimos. Archivísticamente permite localizar referencias que nunca formaron parte de una descripción, consultar grandes conjuntos documentales mediante preguntas, identificar personas y lugares, encontrar relaciones entre expedientes, resumir documentación compleja o facilitar nuevas formas de investigación y acceso.
En este nuevo escenario, debemos ser muy conscientes de que el archivo conserva su función esencial, pero amplía sus posibilidades de explotación.
Ahora la tecnología permite trabajar sobre información que anteriormente resultaba demasiado costosa de extraer de forma sistemática. Pero todo el tratamiento documental previo siempre va a ayudar a que los cimientos de un fondo tengan estructura, contexto y control.
Por eso nosotros abordamos este tipo de proyectos combinando gestión documental, profesionales especializados y las tecnologías más adecuadas para cada fase.
Nuestro punto de partida debe ser entender primero el fondo, determinar qué información queremos obtener y diseñar después el proceso que permita hacerlo con la calidad, seguridad y trazabilidad necesarias.
Si tienes dudas, podemos ayudarte a analizar tu situación y definir el enfoque más adecuado. Habla con nosotros aquí.
Preguntas frecuentes sobre la IA y su aplicación en el archivo
Antes de incorporar IA es necesario conocer el fondo, identificar sus series documentales, revisar la calidad de la digitalización y comprobar qué metadatos están disponibles. También debe definirse qué información se quiere extraer y qué uso se dará a los resultados.
No es lo ideal. La digitalización genera imágenes o archivos electrónicos, pero estos pueden seguir siendo difíciles de consultar y analizar. Para trabajar con IA también se necesita una estructura documental coherente, metadatos adecuados y una calidad de imagen que permita reconocer y procesar correctamente el contenido.
La IA puede automatizar tareas como la clasificación, la extracción de datos, el reconocimiento de entidades o la generación de resúmenes. Sin embargo, el conocimiento del fondo, la definición de criterios, el tratamiento de excepciones y la validación de resultados siguen requiriendo intervención profesional.
