Seleção de um modelo para busca semântica multilíngue.
A LA Referencia avaliou diferentes alternativas para representar consultas e metadados por seu significado. A seleção considerou a qualidade da recuperação, mas também a execução local, o tamanho dos vetores e a integração com Solr e VuFind.
Ponto de partida
O que é um modelo de embeddings?
É um modelo que transforma textos em representações numéricas. Essas representações permitem comparar uma consulta com títulos ou resumos por seu significado, mesmo quando não usam as mesmas palavras.
Isso não traduz o documento. O modelo posiciona textos relacionados em um espaço matemático comum para que possam ser comparados.
Critérios de seleção
A qualidade era um critério, mas não o único.
A alternativa selecionada precisava funcionar em uma infraestrutura regional e poder ser aplicada a uma coleção de milhões de registros.
Recuperação entre idiomas
Relacionar consultas e documentos expressos em diferentes línguas, vocabulários e sistemas de escrita.
Execução local
Operar com um modelo aberto sem depender obrigatoriamente de serviços comerciais externos.
Integração
Incorporar-se à arquitetura existente do Apache Solr, do VuFind e dos processos de indexação.
Escala
Manter um tamanho de modelo e uma dimensão vetorial viáveis para gerar, armazenar e consultar milhões de representações.
Alternativas analisadas
De uma exploração ampla a seis referências comparáveis.
A avaliação inicial examinou aproximadamente trinta configurações de diferentes famílias, tamanhos e quantizações. A comparação consolidada reuniu seis modelos com perfis distintos.
| Modelo | Parâmetros | Dimensão | MRR cross-lingual | Papel dentro do processo |
|---|
Ollama, LM Studio e OpenRouter foram usados como ambientes ou serviços para executar e comparar configurações. Eles não são modelos alternativos nesta tabela.
Como foram avaliados
Dois cenários para responder perguntas diferentes.
Um piloto permitiu observar o funcionamento dentro do VuFind e do Solr. Um corpus controlado permitiu comparar modelos usando os mesmos documentos, consultas e métricas.
Piloto aplicado
Índice da LA Referencia no VuFind
- Registros
- 30.063
- Idiomas
- 9
- Consultas
- 36
- Temas
- 4
Comparou busca lexical, semântica e híbrida usando hits@10 e nDCG@10.
Comparação controlada
Corpus multilíngue do OpenAlex
- Documentos
- 50.000
- Idiomas
- 10
- Consultas de item conhecido
- 19.200
- Consultas temáticas
- 1.440
Comparou MRR, Recall@1, Recall@10 e nDCG@10 em condições homogêneas.
Resultados do piloto
A representação semântica ampliou a recuperação entre idiomas.
No índice piloto de 30.063 registros, a avaliação verificou quantos documentos relevantes apareciam entre os dez primeiros resultados. Esses números correspondem ao recorte avaliado, não à coleção completa.
Quando as palavras não coincidem
A mudança foi especialmente visível entre diferentes sistemas de escrita.
Para consultas em chinês e japonês, a busca lexical não encontrou documentos relevantes entre os dez primeiros resultados do piloto; a busca semântica recuperou 9,8 e 9,3, respectivamente. Em árabe, a modalidade híbrida chegou a 9,5.
Decisão de implementação
O modelo com a maior pontuação não foi automaticamente o selecionado.
O Qwen3-Embedding obteve a maior qualidade cross-lingual. Para a primeira implementação, também foram considerados o volume dos vetores, o tamanho do modelo e a experiência de integração.
Maior pontuação cross-lingual
Qwen3-Embedding-8B
- MRR cross-lingual
- 0,948
- Dimensão
- 4.096
- Parâmetros
- 8,8 bilhões
- Componentes vetoriais
- 4× BGE-M3
Modelo selecionado · primeiro ano
BGE-M3
- MRR cross-lingual
- 0,801
- Recall@10
- 0,897
- Dimensão
- 1.024
- Parâmetros
- 568 milhões
Uma escolha para começar e continuar medindo.
O BGE-M3 foi selecionado por oferecer uma relação adequada entre recuperação multilíngue, execução local, dimensão vetorial, tamanho do modelo e integração com Solr e VuFind. O Qwen3-Embedding permanece como referência de maior qualidade, e o EmbeddingGemma como alternativa compacta para avaliações posteriores.
Da A4 à Demo A2
O modelo selecionado foi posteriormente aplicado à coleção completa.
O resultado da A4 foi incorporado à Demo A2 de busca semântica multilíngue. Nela, o BGE-M3 foi aplicado à coleção completa disponível da LA Referencia, e a versão beta foi publicada para que os usuários possam explorá-la e enviar comentários sobre os resultados e a experiência de busca.
Como ler as evidências
Metodologia e escopo.
Período da avaliação: janeiro–junho de 2026. O marco inicial incluiu aproximadamente trinta configurações e 34 idiomas; os cenários finais usaram 9 e 10 idiomas, respectivamente.
MRR resume a posição do documento correto; Recall@1 e Recall@10 indicam se ele aparece na primeira posição ou entre as dez primeiras; hits@10 conta documentos relevantes na primeira página; nDCG@10 também considera a qualidade da ordenação.
Relação com A2: a versão beta pública sobre a coleção completa pertence à Demo A2 e mostra a aplicação posterior do modelo selecionado na A4.
