Selección de un modelo para búsqueda semántica multilingüe.
LA Referencia evaluó distintas alternativas para representar consultas y metadatos por su significado. La selección consideró la calidad de recuperación, pero también la ejecución local, el tamaño de los vectores y la integración con Solr y VuFind.
El punto de partida
¿Qué es un modelo de embeddings?
Es un modelo que transforma textos en representaciones numéricas. Esas representaciones permiten comparar una consulta con títulos o resúmenes por su significado, incluso cuando no comparten las mismas palabras.
Esto no traduce el documento. El modelo ubica textos relacionados dentro de un espacio matemático común para que puedan compararse.
Criterios de selección
La calidad era un criterio, pero no el único.
La alternativa seleccionada debía funcionar en una infraestructura regional y poder aplicarse a una colección de millones de registros.
Recuperación entre idiomas
Relacionar consultas y documentos expresados con distintas lenguas, vocabularios y sistemas de escritura.
Ejecución local
Operar con un modelo abierto y sin depender obligatoriamente de servicios comerciales externos.
Integración
Incorporarse a la arquitectura existente de Apache Solr, VuFind y los procesos de indexación.
Escala
Mantener un tamaño de modelo y una dimensión vectorial viables para generar, almacenar y consultar millones de representaciones.
Alternativas analizadas
De una exploración amplia a seis referencias comparables.
La evaluación inicial examinó aproximadamente treinta configuraciones de distintas familias, tamaños y cuantizaciones. La comparación consolidada reunió seis modelos con perfiles diferentes.
| Modelo | Parámetros | Dimensión | MRR cross-lingual | Lectura dentro del proceso |
|---|
Ollama, LM Studio y OpenRouter se utilizaron como entornos o servicios para ejecutar y comparar configuraciones. No son modelos alternativos dentro de esta tabla.
Cómo se evaluaron
Dos escenarios para responder preguntas distintas.
Un piloto permitió observar el funcionamiento dentro de VuFind y Solr. Un corpus controlado permitió comparar modelos utilizando los mismos documentos, consultas y métricas.
Piloto aplicado
Índice de LA Referencia en VuFind
- Registros
- 30.063
- Idiomas
- 9
- Consultas
- 36
- Temas
- 4
Comparó búsqueda léxica, semántica e híbrida mediante hits@10 y nDCG@10.
Comparación controlada
Corpus multilingüe de OpenAlex
- Documentos
- 50.000
- Idiomas
- 10
- Consultas known-item
- 19.200
- Consultas temáticas
- 1.440
Comparó MRR, Recall@1, Recall@10 y nDCG@10 en condiciones homogéneas.
Resultados del piloto
La representación semántica amplió la recuperación entre idiomas.
En el índice piloto de 30.063 registros, la evaluación revisó cuántos documentos relevantes aparecían entre los primeros diez resultados. Estas cifras corresponden al corte evaluado, no a la colección completa.
Cuando las palabras no coinciden
El cambio fue especialmente visible al cruzar sistemas de escritura.
Para consultas en chino y japonés, la búsqueda léxica no encontró documentos relevantes en los primeros diez resultados del piloto; la búsqueda semántica recuperó 9,8 y 9,3 respectivamente. En árabe, la modalidad híbrida alcanzó 9,5.
Decisión de implementación
El modelo con mayor puntuación no fue automáticamente el seleccionado.
Qwen3-Embedding obtuvo la mayor calidad cross-lingual. Para la primera implementación también se consideraron el volumen de los vectores, el tamaño del modelo y la experiencia de integración.
Mayor puntuación cross-lingual
Qwen3-Embedding-8B
- MRR cross-lingual
- 0,948
- Dimensión
- 4096
- Parámetros
- 8,8 mil millones
- Componentes vectoriales
- 4× BGE-M3
Modelo seleccionado · primer año
BGE-M3
- MRR cross-lingual
- 0,801
- Recall@10
- 0,897
- Dimensión
- 1024
- Parámetros
- 568 millones
Una elección para comenzar y seguir midiendo.
BGE-M3 fue seleccionado por ofrecer una relación adecuada entre recuperación multilingüe, ejecución local, dimensión vectorial, tamaño del modelo e integración con Solr y VuFind. Qwen3-Embedding se mantiene como referencia de mayor calidad y EmbeddingGemma como alternativa compacta para evaluaciones posteriores.
De A4 a la Demo A2
El modelo seleccionado se aplicó luego a la colección completa.
El resultado de A4 se incorporó a la Demo A2 de búsqueda semántica multilingüe. Allí, BGE-M3 se utilizó sobre la colección completa disponible de LA Referencia y la beta se publicó para que los usuarios puedan explorarla y aportar comentarios sobre los resultados y la experiencia de búsqueda.
Cómo leer la evidencia
Metodología y alcance.
Corte de la evaluación: enero–junio de 2026. El marco inicial comprendió aproximadamente treinta configuraciones y 34 idiomas; los escenarios finales utilizaron 9 y 10 idiomas respectivamente.
MRR resume la posición del documento correcto; Recall@1 y Recall@10 indican si aparece en la primera posición o entre las diez primeras; hits@10 cuenta documentos relevantes en la primera página; nDCG@10 considera además la calidad del ordenamiento.
Relación con A2: la beta pública sobre la colección completa corresponde a la Demo A2 y muestra la aplicación posterior del modelo seleccionado en A4.
