paraguayhistory.net
Una historia de archivos, ingeniería e inteligencia artificial

De una página histórica a una fuente investigable

Durante décadas, estos periódicos solo podían consultarse página por página. Construimos un archivo que preserva cada imagen, le enseña a la IA a leerla, encuentra evidencia relacionada y devuelve respuestas que siempre llevan de vuelta a la fuente original.

Mesa de investigación del archivo
LA MESA DE INVESTIGACIÓN · 281.994 páginas a un clic
0
páginas fuente
0
páginas indexadas
0
títulos con contenido
1845–1904
seis décadas
Imagen original texto derivado (OCR) evidencia encontrada respuesta con citas verificar la página

Las transcripciones y las síntesis son ayudas derivadas y pueden contener errores; la imagen original sigue siendo la evidencia histórica.

La colección muestra de 142 títulos · 1845–1904
El Porvenir
El Porvenir
La Aurora
La Aurora
La Nación
La Nación
R001 F0011
R001 · F0011
R004 F0001
R004 · F0001
R006 F0001
R006 · F0001
R010 F0027
R010 · F0027
R016 F0022
R016 · F0022
R021 F0029
R021 · F0029
R032 F0473
R032 · F0473
R044 F0323
R044 · F0323
R062 F0063
R062 · F0063
R089 F0072
R089 · F0072
La Nación
La Nación
El desafío original

Un archivo de valor incalculable que nadie podía buscar

Las páginas sobrevivieron, pero como imágenes densas y deterioradas: columnas estrechas, tinta corrida, avisos, tablas, grabados y varios idiomas compartiendo una sola hoja. Eran visibles para el ojo, pero invisibles para la búsqueda.

Página escaneada — texto atrapado en imagen
TEXTO ATRAPADO EN IMÁGENES · LA DEMOCRACIA · R033 F1064
Antes

Leer estos periódicos significaba pasar carrete por carrete de microfilm a mano. Buscar un nombre en seis décadas era prácticamente inviable.

Después

281.994 páginas se investigan en segundos, en dos idiomas, con la fuente original siempre a un clic.

Camino manual
Microfilm

Avanzar rollo por rollo e inspeccionar cada cuadro.

Camino manual
Imágenes de páginas

Abrir escaneos uno por uno sin índice de texto completo.

Objetivo
Desbloquear texto

Extraer contenido buscable, estructurado y conectado a la fuente.

La prueba

Cada respuesta lleva de vuelta a la página original

No es un chatbot: es una herramienta de investigación. La respuesta ayuda a investigar; la página escaneada permite verificar.

Respuesta con evidencia

¿Cómo se vendieron las tierras públicas y creció la yerba mate tras la guerra?

Los periódicos muestran que el Estado no vendió los yerbales en mercado abierto: los mantuvo como propiedad fiscal y los arrendó por patentes departamentales, exigiendo plantación y mejoras. La exportación de yerba mate se quintuplicó, pero quedó concentrada en pocas empresas —incluida una compañía europea que la procesaba en Buenos Aires—, mientras 150.000 acres de tierra pública se concedían a una compañía ferroviaria británica.

LA REFORMA · 1877 · R064 F0834 LA DEMOCRACIA · 1881 · R031 F0499 LA REPÚBLICA · 1891 · R086 F0641 EL TIEMPO · 150.000 acres · R059 F0454

Respuesta real del archivo · síntesis de 12 pasajes · 5 periódicos · 1877–1897 — cada afirmación enlaza a su periódico, fecha y página.

escaneo citado · LA DEMOCRACIA · 1881 · R031 F0499Escaneo original citado — LA DEMOCRACIA 1881, R031 F0499
1Preservar la fuente

¿De dónde viene esta evidencia?

El primer desafío fue histórico, no computacional: identificar dónde seguían existiendo los periódicos — hablar con historiadores, revisar fondos de bibliotecas y documentar materiales como los archivos Cooney y otras copias raras.

Luego la preservación: archivos TIFF y JPEG de alta resolución, identificadores estables, metadatos y checksums convierten páginas frágiles en objetos digitales protegidos — la capa de evidencia que mantiene el OCR, los vectores y las respuestas conectados al periódico original.

Descubrimiento de fuentes: bibliotecas, historiadores y archivos Cooney
Paso 1–2 · descubrimiento de fuentes y preservación digital
2Enseñar a leer la página

¿Por qué no bastaba con el OCR?

Cada página era un problema visual diferente

No existía una plantilla estable. El orden de lectura, la tipografía, el número de columnas, los idiomas y el estado físico podían cambiar entre periódicos, ediciones e incluso páginas consecutivas.

Xilografía de guerra publicada en La Autografiada
Un tesoro de la colección

Xilografía de guerra — La Autografiada

Grabados como este comparten página con columnas de texto, avisos y varios idiomas. Un OCR de líneas los confunde con caracteres; un modelo multimodal los reconoce como ilustración y preserva el texto alrededor sin inventarlo.

OCR convencional — ve líneas, no una página

  • Mezcla columnas y rompe el orden de lectura.
  • Confunde grabados, bordes y manchas con caracteres.
  • Omite anuncios, firmas, precios y texto diminuto.
  • Corrige ortografía antigua y destruye evidencia histórica.

Gemini multimodal — interpreta estructura antes de copiar

  • Cuenta columnas y detecta límites visuales.
  • Distingue artículos, avisos, tablas y gráficos.
  • Conserva español histórico, guaraní, portugués y francés.
  • Devuelve JSON verificable conectado con la imagen original.

El laboratorio OCR: lo medimos página por página

Guardamos 370 resultados y comparamos modelos, resoluciones, niveles de razonamiento, estructuras JSON y familias de prompts. Cada candidato pasó cuatro pruebas:

1
Capacidad visual

Columnas, cabeceras, avisos, tablas, impresión dañada, multilingüe.

2
Disciplina del prompt

Inspeccionar la página completa antes de extraer.

3
Salida estructurada

JSON válido con segmentos y metadatos de fuente.

4
Prueba de benchmark

Sobrevivir diseños históricos duros.

370
resultados guardados
34
corridas documentadas
6
modelos comparados
5
páginas de desafío
ModeloPromedio (5 pág.)El Látigo InmortalJSON válidoTiempo medio
Gemini 3.1 Pro93,6%
90%5/5122 s
Gemini 2.5 Pro65,7%
10%4/5174,3 s
Gemini 2.5 Flash-Lite58,9%
10%3/583,4 s
Gemini 2.5 Flash57,8%
10%3/5169,1 s
GPT-4.1 Mini56,4%
10%3/5230,9 s
GPT-4.1 Nano25,7%
10%2/5137,7 s

Ningún modelo dominó todos los diseños. Flash-Lite ganó páginas concretas; Gemini 3.1 Pro fue el más estable del conjunto y recuperó diseños donde otros agotaron tokens o devolvieron JSON incompleto. La columna «El Látigo Inmortal» es la puntuación en esa página concreta; su escaneo original no está publicado. Claude se reserva para la síntesis, no para el OCR.

El prompt se convirtió en una especificación editorial

Decenas de experimentos mostraron que pequeños cambios de redacción alteraban la cobertura. La progresión: "Extrae el texto""Transcribe exactamente"inspeccionar · segmentar · transcribir · validar.

"Identifica el diseño de la página antes de extraer texto."

Límites de columnas, cabeceras y anuncios anchos se marcan antes de copiar una palabra.

"Preserva exactamente la redacción impresa."

La ortografía arcaica y la ausencia de acentos son evidencia, no errores que modernizar.

"Marca palabras dudosas en vez de inventarlas."

La incertidumbre revisable evita convertir tinta dañada en historia alucinada.

"Ejecuta el prompt en páginas difíciles reales, no en ejemplos limpios."

Las reglas nacieron de regresiones sobre páginas duras.

Una fábrica OCR que escala solo lo difícil

Nivel 1 · Volumen

Gemini Flash-Lite

Primera lectura rápida, temperatura cero, salida JSON estructurada.

Escala si extrae < 50 palabras o falla validación. ›
Nivel 2 · Complejidad

Gemini Pro

Páginas con poco texto, densidad extrema o controles fallidos.

La Democracia entra directo por complejidad conocida. ›
Nivel 3 · Rescate

Ruta de recuperación

Límites de salida, recitación o respuestas vacías.

Sobre patrones observados, no reemplazo universal.

Enseñar al modelo a leer una página compleja

Elige una página real y recorre los tres pasos para ver el problema y cómo el prompt lo resolvió. Cada periódico traía un diseño distinto — columnas y tablas en La Razón, xilografías y guaraní en Cabichuí— así que no había plantilla que reutilizar.

Página real segmentada por el modelo
El prompt que lo hizo posible inspeccionar · segmentar · transcribir · validar

"Identifica el diseño de la página antes de extraer texto."

Recuadros ilustrativos a partir de la segmentación real: el OCR devuelve el tipo y el rango de columnas de cada bloque, no coordenadas exactas.
Ver método completo (34 corridas, resoluciones, niveles de razonamiento)
La matriz completa de pruebas contra las cinco páginas de desafío se detalla en el informe técnico descargable.
3Hacer la historia encontrable

¿Cómo encuentro una idea si las palabras cambian en 160 años?

El texto OCR se divide en pasajes superpuestos y cada uno se transforma en un vector numérico (PostgreSQL + pgvector). La búsqueda combina coincidencias exactas y significado, equilibra décadas y periódicos, penaliza fragmentos comerciales débiles y vuelve a leer los mejores candidatos.

ferrocarrilcamino de hierrorailwaytransporteaduanacomerciobatallateatro
Embudo de recuperación
Paso 6–7 · embeddings y recuperación híbrida con reranking
4Responder con evidencia

¿Cómo sé que puedo confiar en la respuesta?

Es una herramienta de investigación, no un chatbot. Los pasajes mejor clasificados forman un paquete de evidencia; el modelo de síntesis (Claude) redacta con restricciones — citar fuentes, comparar evidencia y marcar incertidumbre.

Pregunta¿Qué decían del ferrocarril? Paquete de evidencia12–30 pasajes · periódico / fecha / página / OCR / enlace Síntesis Claudecitar · comparar · marcar incertidumbre Respuestacada afirmación vuelve a la fuente

La tecnología desaparece detrás de una experiencia de investigación

El resultado no es una base de datos: es un espacio para preguntar, explorar, verificar fuentes originales y convertir hallazgos en materiales que otros comprenden.

Chat con citas

Streaming, seguimiento y modo investigación profunda.

Archivo visual

Filtros por fecha, título y colección; acceso al escaneo.

Narrativas exportables

Infografías, presentaciones, biografías, comparaciones.

Tres profundidades

Rápida (12) · profunda (30+) · extracción total.

Resultado final: buscador, biblioteca, respuestas citadas, infografías
El resultado · cuatro clases de IA al servicio de la historia

Cuatro clases de inteligencia artificial trabajan juntas — pero el objetivo sigue siendo humano: preservar, comprender y compartir la historia.

visión (OCR)embeddingsrerankinggeneración
Alcance y límites

Qué puede y qué no puede este archivo

La honestidad sobre los límites es parte de la evidencia. Ante cualquier duda, la imagen original manda.

Cobertura

Representa el material conservado y procesado, no toda la prensa paraguaya que sobrevive.

Transcripción

El papel dañado o los diseños inusuales pueden dejar texto incierto o erróneo (marcado como dudoso).

Búsqueda

Un pasaje pertinente puede quedar sin encontrar o mal posicionado entre los resultados.

Síntesis y citas

La respuesta se limita al material recuperado; conviene comprobar el escaneo citado y reportar errores.

Método, pruebas y arquitectura

Para quien quiera profundizar

Enrutamiento por niveles y selección de modelos (benchmark completo)
Los 370 resultados, las 34 corridas centrales, las 6 familias de modelos y las 5 páginas de desafío, con puntuaciones por página. Detalle completo en el informe técnico.
Protocolo de prompts y esquema JSON
El contrato de extracción estructurada, las cuatro reglas editoriales y la validación de salida.
Índice, embeddings y recuperación híbrida
Fragmentación superpuesta, pgvector, filtros de metadatos, balanceo por década/título y reranking.
Generación fundamentada y reglas de citación
Cómo el paquete de evidencia restringe al modelo de síntesis y ata cada afirmación a la fuente.