932 435 179 /

info@orex.es

9 de septiembre de 2026

Koha ahora entiende el texto manuscrito

Koha ahora entiende el texto manuscrito

Un fondo digitalizado es, para el catálogo, una colección de fotografías: se ven, pero no se buscan. Quien quiere encontrar un documento por algo que dice dentro no lo encuentra, porque ese texto no existe en ninguna parte del sistema. Ya podemos crearlo: transcribimos el manuscrito con IA y lo metemos dentro de Koha, con su resumen, sus palabras clave y un visor que sabe dónde está cada línea.

Lo primero: encontrar las líneas

Antes de leer nada hay que saber dónde está escrito. Cada recuadro es una línea detectada sobre la imagen real, con sus coordenadas.

Carta manuscrita de 1887 con cada línea de escritura recuadrada

Carta de noviembre de 1887. Las once líneas, delimitadas automáticamente; en rojo, la que contiene «Ministros».

Y luego: leerlas

El texto queda ligado a esas coordenadas, así que se puede enseñar al lado de la imagen y resaltar la misma línea en los dos sitios a la vez.

Madrid 16 Nov.e 87
Excmo. é Ylmo. Sr.
D. Fr. Pedro Payo
Muy distinguido Sr y amigo
mio: Recibi su telegrama, y por acuer-
do del Consejo de Sres. Ministros
se autorizo, telegráficamente, al Sr.
Madrid 16 Nov.e 87
Excmo. é Ylmo. Sr.
D. Fr. Pedro Payo
Muy distinguido Sr y amigo
mio: Recibi su telegrama, y por acuer-
do del Consejo de Sres. Ministros
se autorizo, telegráficamente, al Sr.

Cómo queda el registro

Todo se incrusta en el propio registro bibliográfico y se indexa. No hay una herramienta aparte que mantener.

Resumen
Carta de noviembre de 1887 sobre la creación del Museo-Biblioteca de Ultramar tras la Exposición de Filipinas, la Junta encargada de gestionarlo y el destino de los objetos expuestos. — generado automáticamente a partir de la transcripción
Palabras clave
Museo-Biblioteca de Ultramar Exposición de Filipinas (1887) Comisaría Regia Gran Cruz de Carlos III Conde de Morphy Marqués de Comillas
Texto completo
Las 13 páginas de la carta, transcritas e indexadas para búsqueda a texto completo.
Error medido
4,8 %de error por carácter, medido contra la transcripción de referencia del archivero

Las cuatro piezas

  • Transcripción del manuscrito. Con un modelo de visión, no con un OCR clásico: el OCR sirve para texto impreso y fracasa con la letra a mano.
  • Resumen automático de dos o tres líneas por documento —remitente, destinatario, fecha y asunto—, en el campo de resumen del registro.
  • Palabras clave: personas, lugares e instituciones citados. Entran en el índice de materias que Koha ya tiene, así que se vuelven enlaces que agrupan el fondo por lo que menciona. Es el índice onomástico que con decenas de miles de documentos nadie iba a hacer a mano.
  • Visor con zoom y coordenadas, dentro de la ficha, junto al visualizador de imágenes de siempre y sin sustituirlo.
Lo honesto, por delante. Una transcripción automática sin revisar no es una edición crítica, y se publica marcada como tal. Cada letra es distinta: por eso, antes de comprometer nada, hacemos un piloto de treinta imágenes que mide el error real sobre ese fondo concreto. Con ese número sobre la mesa se decide si se transcribe entero, si conviene afinar antes un modelo propio, o si esa letra todavía no da la calidad suficiente.

Qué hace falta para empezar

Poco: treinta imágenes representativas del fondo y sus transcripciones de referencia hechas por el archivo. Nada más — el piloto no necesita tocar el servidor de nadie, porque treinta ficheros caben en un correo. Lo que sale es una tabla con el error medido por motor y una decisión con datos, no con intuición.

¿Tienes fondo manuscrito digitalizado?

Te decimos qué daría en tu caso antes de que te comprometas a nada.

Escríbenos y hacemos el piloto

← Todas las noticias