← Volver a avances
Infografía A4Componente AEnero–junio de 2026

Selección de un modelo para búsqueda semántica multilingüe.

LA Referencia evaluó distintas alternativas para representar consultas y metadatos por su significado. La selección consideró la calidad de recuperación, pero también la ejecución local, el tamaño de los vectores y la integración con Solr y VuFind.

El punto de partida

¿Qué es un modelo de embeddings?

Es un modelo que transforma textos en representaciones numéricas. Esas representaciones permiten comparar una consulta con títulos o resúmenes por su significado, incluso cuando no comparten las mismas palabras.

Consulta en español“efectos del cambio climático”
modelo de
embeddings
Representación numérica[0,18 · −0,42 · 0,07 · …]
proximidad de
significado

Esto no traduce el documento. El modelo ubica textos relacionados dentro de un espacio matemático común para que puedan compararse.

Criterios de selección

La calidad era un criterio, pero no el único.

La alternativa seleccionada debía funcionar en una infraestructura regional y poder aplicarse a una colección de millones de registros.

01

Recuperación entre idiomas

Relacionar consultas y documentos expresados con distintas lenguas, vocabularios y sistemas de escritura.

02

Ejecución local

Operar con un modelo abierto y sin depender obligatoriamente de servicios comerciales externos.

03

Integración

Incorporarse a la arquitectura existente de Apache Solr, VuFind y los procesos de indexación.

04

Escala

Mantener un tamaño de modelo y una dimensión vectorial viables para generar, almacenar y consultar millones de representaciones.

Alternativas analizadas

De una exploración amplia a seis referencias comparables.

La evaluación inicial examinó aproximadamente treinta configuraciones de distintas familias, tamaños y cuantizaciones. La comparación consolidada reunió seis modelos con perfiles diferentes.

≈30configuraciones iniciales
34idiomas en el marco inicial
6referencias consolidadas
ModeloParámetrosDimensiónMRR cross-lingualLectura dentro del proceso

Ollama, LM Studio y OpenRouter se utilizaron como entornos o servicios para ejecutar y comparar configuraciones. No son modelos alternativos dentro de esta tabla.

Cómo se evaluaron

Dos escenarios para responder preguntas distintas.

Un piloto permitió observar el funcionamiento dentro de VuFind y Solr. Un corpus controlado permitió comparar modelos utilizando los mismos documentos, consultas y métricas.

A

Piloto aplicado

Índice de LA Referencia en VuFind

Registros
30.063
Idiomas
9
Consultas
36
Temas
4

Comparó búsqueda léxica, semántica e híbrida mediante hits@10 y nDCG@10.

B

Comparación controlada

Corpus multilingüe de OpenAlex

Documentos
50.000
Idiomas
10
Consultas known-item
19.200
Consultas temáticas
1.440

Comparó MRR, Recall@1, Recall@10 y nDCG@10 en condiciones homogéneas.

Resultados del piloto

La representación semántica amplió la recuperación entre idiomas.

En el índice piloto de 30.063 registros, la evaluación revisó cuántos documentos relevantes aparecían entre los primeros diez resultados. Estas cifras corresponden al corte evaluado, no a la colección completa.

Cuando las palabras no coinciden

El cambio fue especialmente visible al cruzar sistemas de escritura.

Para consultas en chino y japonés, la búsqueda léxica no encontró documentos relevantes en los primeros diez resultados del piloto; la búsqueda semántica recuperó 9,8 y 9,3 respectivamente. En árabe, la modalidad híbrida alcanzó 9,5.

Decisión de implementación

El modelo con mayor puntuación no fue automáticamente el seleccionado.

Qwen3-Embedding obtuvo la mayor calidad cross-lingual. Para la primera implementación también se consideraron el volumen de los vectores, el tamaño del modelo y la experiencia de integración.

Mayor puntuación cross-lingual

Qwen3-Embedding-8B

MRR cross-lingual
0,948
Dimensión
4096
Parámetros
8,8 mil millones
Componentes vectoriales
4× BGE-M3

Modelo seleccionado · primer año

BGE-M3

MRR cross-lingual
0,801
Recall@10
0,897
Dimensión
1024
Parámetros
568 millones

Una elección para comenzar y seguir midiendo.

BGE-M3 fue seleccionado por ofrecer una relación adecuada entre recuperación multilingüe, ejecución local, dimensión vectorial, tamaño del modelo e integración con Solr y VuFind. Qwen3-Embedding se mantiene como referencia de mayor calidad y EmbeddingGemma como alternativa compacta para evaluaciones posteriores.

De A4 a la Demo A2

El modelo seleccionado se aplicó luego a la colección completa.

El resultado de A4 se incorporó a la Demo A2 de búsqueda semántica multilingüe. Allí, BGE-M3 se utilizó sobre la colección completa disponible de LA Referencia y la beta se publicó para que los usuarios puedan explorarla y aportar comentarios sobre los resultados y la experiencia de búsqueda.

Cómo leer la evidencia

Metodología y alcance.

Corte de la evaluación: enero–junio de 2026. El marco inicial comprendió aproximadamente treinta configuraciones y 34 idiomas; los escenarios finales utilizaron 9 y 10 idiomas respectivamente.

MRR resume la posición del documento correcto; Recall@1 y Recall@10 indican si aparece en la primera posición o entre las diez primeras; hits@10 cuenta documentos relevantes en la primera página; nDCG@10 considera además la calidad del ordenamiento.

Relación con A2: la beta pública sobre la colección completa corresponde a la Demo A2 y muestra la aplicación posterior del modelo seleccionado en A4.