932 435 179 /

info@orex.es

30 de septiembre de 2026

Nueva versión del motor del Catálogo Colectivo: la inteligencia artificial decide los casos dudosos

Nueva versión del motor del Catálogo Colectivo: la inteligencia artificial decide los casos dudosos

OREX ha puesto a punto la versión 1.3 del motor que construye sus catálogos colectivos sobre Koha. La novedad principal es un juez de inteligencia artificial que resuelve los casos en los que las reglas no bastan para saber si dos registros describen el mismo libro. El primer catálogo que la estrenará es el Catálogo Colectivo de República Dominicana, que reúne los fondos del Archivo General de la Nación, la Biblioteca Nacional Pedro Henríquez Ureña, el Instituto Tecnológico de Santo Domingo y la Universidad Nacional Pedro Henríquez Ureña.

Portada del OPAC del Catálogo Colectivo de República Dominicana, con las cuatro instituciones participantes
El Catálogo Colectivo de República Dominicana, construido sobre Koha, será el primero en incorporar la nueva versión.

Un libro, una ficha

Un catálogo colectivo agrupa en una sola ficha los registros que varias bibliotecas tienen de un mismo libro. Debajo de la descripción, una tarjeta por biblioteca indica quién lo tiene y en qué edición, y enlaza con la ficha completa en el catálogo de origen. Las ediciones se agrupan a propósito: quien busca el Manual de historia dominicana ve en una sola pantalla las quince ediciones que conservan las cuatro instituciones y elige la que le interesa. Con la nueva versión, cada tarjeta indicará además el año de publicación.

Bloque «Disponible en» de una ficha del catálogo colectivo: quince tarjetas de cuatro bibliotecas, cada una con su edición y su enlace
Las quince ediciones del Manual de historia dominicana que conservan las cuatro instituciones, en una sola ficha.

Por qué agrupar bien es difícil

Tres de cada cuatro registros del Catálogo Colectivo de República Dominicana no llevan ISBN ni ISSN. Y cuando lo llevan, no siempre identifica el libro: en muchos volúmenes se ha anotado el ISBN de la colección, de modo que un solo número aparece en cientos de obras distintas. A esto se suma que cada centro cataloga a su manera: el mismo libro con el subtítulo en un campo o en otro, con la imprenta en lugar de la editorial, con una errata en el título o en el año. Agrupar solo por ISBN dejaba fuera a la mayor parte del catálogo; agrupar por parecido del título mezclaba obras distintas.

Tres capas: reglas, comparación y juez

Diagrama de las tres capas del motor: reglas, comparación difusa y juez de inteligencia artificial, con la auditoría posterior
Cada registro pasa por tres capas. Solo se une lo que coincide; lo dudoso lo decide la inteligencia artificial; lo indecidible queda separado.

La nueva versión trabaja en tres capas, cada una más exigente que la anterior.

La primera son las reglas. El motor detecta por sí mismo los ISBN de colección, porque aparecen en obras distintas de una misma biblioteca, y deja de usarlos como identidad. Tiene en cuenta lo que cada centro declara en el calificador del ISBN (020 $q): si es de la serie o de la obra. Y lee los números del título, en cifra o en letra: años, tomos, bienios, grados, meses. Un Informe anual 2009 nunca se junta con el de 2010, ni el tercer grado con el primero.

La segunda es la comparación difusa, para los registros sin ISBN. Compara autor, título y año, y además la editorial, la mención de edición y la paginación. Solo une por su cuenta cuando todo coincide y la similitud supera el 97 sobre 100. Lo que se parece pero no coincide del todo pasa a la tercera capa.

La tercera es el juez de inteligencia artificial. Es un modelo de lenguaje de 122.000 millones de parámetros que se ejecuta en la infraestructura propia de OREX, sin enviar ningún dato a terceros. Recibe la descripción completa de los dos registros (título, responsables, edición, publicación, descripción física, serie e identificadores) y responde, con un grado de confianza, si describen el mismo libro en cualquiera de sus ediciones. Aplica el criterio de un catalogador: un tomo distinto, otro número de la serie, una traducción o un resumen no son el mismo libro; una errata, la imprenta en lugar de la editorial o una edición posterior sí lo son. Solo se une cuando la confianza es de 0,9 o superior. En las pruebas con el catálogo dominicano ha revisado 46.000 parejas dudosas en un día. Sus veredictos se guardan, de modo que en cada actualización solo se juzgan los pares nuevos.

Auditoría en cada generación

Cada generación del catálogo deja constancia de todas las uniones que hace y de por qué las hace. De ellas se extrae una muestra por vía (ISBN, colección, comparación difusa y veredictos de la inteligencia artificial) que se revisa a mano, y se calcula la tasa de error de cada una con su intervalo de confianza. En las pruebas, las uniones incorrectas de la comparación difusa han bajado del 7 % al 1 % de la muestra revisada; de los veredictos afirmativos de la inteligencia artificial, uno de cada 59 era discutible.

La regla de oro no cambia: lo que no se puede decidir no se une. Es preferible una ficha de más a mezclar dos libros distintos. Los registros que solo traen título y autor, sin datos de publicación, ni se unen ni se juzgan.

Los resultados

Con los cuatro catálogos actuales, 339.462 registros, las fichas compartidas por varias instituciones pasan de 11.195 a más de 19.000, y el catálogo tiene más de 15.000 fichas duplicadas menos. La actualización del Catálogo Colectivo de República Dominicana se aplicará en las próximas semanas, tras la revisión final de la auditoría.

Qué pueden hacer las bibliotecas

La calidad de la agrupación depende también de los catálogos de origen. Tres cosas ayudan: indicar en el calificador del ISBN si el número es de la serie o de la obra (020 $q serie, 020 $q obra); incluir en las exportaciones todos los registros, también los que no tienen ejemplares asociados, porque muchas publicaciones propias están catalogadas así; y revisar el informe de ISBN de colección que el motor genera para cada centro, con la lista de registros que conviene corregir.

La nueva versión del motor está disponible para cualquier red de bibliotecas Koha que trabaje con OREX. Para más información, puede escribirnos a info@orex.es.

← Todas las noticias