Injection de prompt pour les LLM à long contexte comme alternative au RAG ?

Point juste, bien sûr… pas de réponse simple à mon avis

Je suppose que cela dépend du cas d’utilisation.

RAG fonctionne bien pour certaines applications, mais pour d’autres cas cibles assez déterministes (par exemple, questions/réponses clients, paiements, médical, etc.), moi et d’autres avons eu des problèmes pour obtenir une bonne précision avec la recherche vectorielle RAG au cours de la dernière année. Autrement dit, le bot manquera des choses ou en inventera (faible rappel, faible précision en termes de recherche d’information), ce qui est bien documenté par Stanford, Google, et autres.

La question se pose donc… pourquoi envoyer un tas de morceaux au LLM si on peut lui donner tout le corpus. Au moins avec l’injection de contexte, lorsque le LLM n’est pas précis, vous avez moins de choses à ajuster…

Ok, cela ne fonctionnera pas pour de vastes bibliothèques de documents/codes… mais pour des bases de contenu petites et modérées, cela semble très bien fonctionner jusqu’à présent… je travaille sur un projet qui teste cela formellement… ! Plus bientôt… merci

PS. → Pour rendre les choses encore plus intéressantes… j’ai eu de la chance avec l’injection de contexte + le fine-tuning… et il existe des approches émergentes qui combinent RAG et injection de contexte ! .. Etc etc.

voir aussi :