Iniezione di prompt per LLM a lungo contesto come alternativa a RAG?

Giusto, certo.. nessuna risposta semplice secondo me

Immagino che dipenda dal caso d’uso.

RAG funziona bene per alcune app, ma per altri casi target abbastanza deterministici (ad esempio, domande e risposte dei clienti, pagamenti, medicina, ecc.), io e altri abbiamo avuto problemi a ottenere una buona accuratezza con la ricerca vettoriale RAG nell’ultimo anno. Cioè, il bot o perde delle cose o inventa delle cose (scarsa recall, scarsa precisione in termini di IR), il che è ben documentato da Stanford, Google, ecc.

Quindi sorge la domanda.. perché dare un mucchio di chunk all’LLM se gli si può dare l’intero corpus. Almeno con l’iniezione di contesto, quando l’LLM non è accurato si hanno meno cose da ottimizzare..

Ok, non funzionerà per vaste librerie di documenti/codice.. ma per basi di contenuti piccole e moderate sembra funzionare benissimo finora… sto lavorando a un progetto che sta testando formalmente questo.. ! Altro presto.. grazie

PS. → per rendere le cose ancora più interessanti.. ho avuto fortuna con l’iniezione di contesto + il fine-tuning.. e ci sono approcci emergenti che combinano RAG e iniezione di contesto! .. ecc. ecc.

vedi anche: