Durante décadas, estos periódicos solo podían consultarse página por página. Construimos un archivo que preserva cada imagen, le enseña a la IA a leerla, encuentra evidencia relacionada y devuelve respuestas que siempre llevan de vuelta a la fuente original.
Las transcripciones y las síntesis son ayudas derivadas y pueden contener errores; la imagen original sigue siendo la evidencia histórica.
Las páginas sobrevivieron, pero como imágenes densas y deterioradas: columnas estrechas, tinta corrida, avisos, tablas, grabados y varios idiomas compartiendo una sola hoja. Eran visibles para el ojo, pero invisibles para la búsqueda.
Leer estos periódicos significaba pasar carrete por carrete de microfilm a mano. Buscar un nombre en seis décadas era prácticamente inviable.
281.994 páginas se investigan en segundos, en dos idiomas, con la fuente original siempre a un clic.
Avanzar rollo por rollo e inspeccionar cada cuadro.
Abrir escaneos uno por uno sin índice de texto completo.
Extraer contenido buscable, estructurado y conectado a la fuente.
No es un chatbot: es una herramienta de investigación. La respuesta ayuda a investigar; la página escaneada permite verificar.
¿Cómo se vendieron las tierras públicas y creció la yerba mate tras la guerra?
Los periódicos muestran que el Estado no vendió los yerbales en mercado abierto: los mantuvo como propiedad fiscal y los arrendó por patentes departamentales, exigiendo plantación y mejoras. La exportación de yerba mate se quintuplicó, pero quedó concentrada en pocas empresas —incluida una compañía europea que la procesaba en Buenos Aires—, mientras 150.000 acres de tierra pública se concedían a una compañía ferroviaria británica.
Respuesta real del archivo · síntesis de 12 pasajes · 5 periódicos · 1877–1897 — cada afirmación enlaza a su periódico, fecha y página.
¿De dónde viene esta evidencia?
El primer desafío fue histórico, no computacional: identificar dónde seguían existiendo los periódicos — hablar con historiadores, revisar fondos de bibliotecas y documentar materiales como los archivos Cooney y otras copias raras.
Luego la preservación: archivos TIFF y JPEG de alta resolución, identificadores estables, metadatos y checksums convierten páginas frágiles en objetos digitales protegidos — la capa de evidencia que mantiene el OCR, los vectores y las respuestas conectados al periódico original.
¿Por qué no bastaba con el OCR?
No existía una plantilla estable. El orden de lectura, la tipografía, el número de columnas, los idiomas y el estado físico podían cambiar entre periódicos, ediciones e incluso páginas consecutivas.






Grabados como este comparten página con columnas de texto, avisos y varios idiomas. Un OCR de líneas los confunde con caracteres; un modelo multimodal los reconoce como ilustración y preserva el texto alrededor sin inventarlo.
Guardamos 370 resultados y comparamos modelos, resoluciones, niveles de razonamiento, estructuras JSON y familias de prompts. Cada candidato pasó cuatro pruebas:
Columnas, cabeceras, avisos, tablas, impresión dañada, multilingüe.
Inspeccionar la página completa antes de extraer.
JSON válido con segmentos y metadatos de fuente.
Sobrevivir diseños históricos duros.
| Modelo | Promedio (5 pág.) | El Látigo Inmortal | JSON válido | Tiempo medio | |
|---|---|---|---|---|---|
| Gemini 3.1 Pro | 93,6% | 90% | 5/5 | 122 s | |
| Gemini 2.5 Pro | 65,7% | 10% | 4/5 | 174,3 s | |
| Gemini 2.5 Flash-Lite | 58,9% | 10% | 3/5 | 83,4 s | |
| Gemini 2.5 Flash | 57,8% | 10% | 3/5 | 169,1 s | |
| GPT-4.1 Mini | 56,4% | 10% | 3/5 | 230,9 s | |
| GPT-4.1 Nano | 25,7% | 10% | 2/5 | 137,7 s |
Ningún modelo dominó todos los diseños. Flash-Lite ganó páginas concretas; Gemini 3.1 Pro fue el más estable del conjunto y recuperó diseños donde otros agotaron tokens o devolvieron JSON incompleto. La columna «El Látigo Inmortal» es la puntuación en esa página concreta; su escaneo original no está publicado. Claude se reserva para la síntesis, no para el OCR.
Decenas de experimentos mostraron que pequeños cambios de redacción alteraban la cobertura. La progresión: "Extrae el texto" → "Transcribe exactamente" → inspeccionar · segmentar · transcribir · validar.
Límites de columnas, cabeceras y anuncios anchos se marcan antes de copiar una palabra.
La ortografía arcaica y la ausencia de acentos son evidencia, no errores que modernizar.
La incertidumbre revisable evita convertir tinta dañada en historia alucinada.
Las reglas nacieron de regresiones sobre páginas duras.
Primera lectura rápida, temperatura cero, salida JSON estructurada.
Páginas con poco texto, densidad extrema o controles fallidos.
Límites de salida, recitación o respuestas vacías.
Elige una página real y recorre los tres pasos para ver el problema y cómo el prompt lo resolvió. Cada periódico traía un diseño distinto — columnas y tablas en La Razón, xilografías y guaraní en Cabichuí— así que no había plantilla que reutilizar.
inspeccionar · segmentar · transcribir · validar
"Identifica el diseño de la página antes de extraer texto."
¿Cómo encuentro una idea si las palabras cambian en 160 años?
El texto OCR se divide en pasajes superpuestos y cada uno se transforma en un vector numérico (PostgreSQL + pgvector). La búsqueda combina coincidencias exactas y significado, equilibra décadas y periódicos, penaliza fragmentos comerciales débiles y vuelve a leer los mejores candidatos.
¿Cómo sé que puedo confiar en la respuesta?
Es una herramienta de investigación, no un chatbot. Los pasajes mejor clasificados forman un paquete de evidencia; el modelo de síntesis (Claude) redacta con restricciones — citar fuentes, comparar evidencia y marcar incertidumbre.
El resultado no es una base de datos: es un espacio para preguntar, explorar, verificar fuentes originales y convertir hallazgos en materiales que otros comprenden.
Streaming, seguimiento y modo investigación profunda.
Filtros por fecha, título y colección; acceso al escaneo.
Infografías, presentaciones, biografías, comparaciones.
Rápida (12) · profunda (30+) · extracción total.
Cuatro clases de inteligencia artificial trabajan juntas — pero el objetivo sigue siendo humano: preservar, comprender y compartir la historia.
La honestidad sobre los límites es parte de la evidencia. Ante cualquier duda, la imagen original manda.
Representa el material conservado y procesado, no toda la prensa paraguaya que sobrevive.
El papel dañado o los diseños inusuales pueden dejar texto incierto o erróneo (marcado como dudoso).
Un pasaje pertinente puede quedar sin encontrar o mal posicionado entre los resultados.
La respuesta se limita al material recuperado; conviene comprobar el escaneo citado y reportar errores.