Injeção de prompt para LLMs de longo contexto como alternativa ao RAG?

Concordo, com certeza. Nenhuma resposta simples na minha opinião.

Acho que isso depende do caso de uso.

RAG funciona bem para alguns aplicativos, mas para outros casos de destino bastante determinísticos (por exemplo, perguntas e respostas de clientes, pagamentos, médicos, etc.), eu e outros tivemos problemas para obter boa precisão com a pesquisa vetorial RAG no último ano. Ou seja, o bot deixará de lado coisas ou inventará coisas (baixa recuperação, baixa precisão em termos de IR), o que é bem documentado por Stanford, Google, etc.

Então surge a questão… por que jogar um monte de pedaços no LLM se você pode dar a ele todo o corpus. Pelo menos com injeção de contexto, quando o LLM não é preciso, você tem menos coisas para ajustar.

Ok, não vai funcionar para vastas bibliotecas de documentos/código… mas para bases de conteúdo pequenas e moderadas, parece funcionar muito bem até agora… estou trabalhando em um projeto que está testando formalmente isso! Mais em breve… obrigado.

PS. → Para tornar as coisas ainda mais interessantes… tive sorte com a injeção de contexto + ajuste fino… e há abordagens emergentes que combinam RAG e injeção de contexto! … Etc etc.

Veja também: