確かに、もっともな点です。私の意見では、簡単な答えはありません。
これはユースケースによると思います。
RAGは一部のアプリケーションにはうまく機能しますが、他の比較的決定論的なターゲットケース(例:顧客のQ/A、支払い、医療など)では、過去1年間にRAGベクトル検索で良好な精度を得るのに苦労しました。つまり、ボットは物事を見逃すか、でっち上げます(IRの用語では、リコールが悪く、精度が悪い)。これは、スタンフォード、Googleなどによって広く文書化されています。
したがって、質問が生じます。LLMにコーパス全体を提供できるのに、なぜたくさんのチャンクをLLMに投げつけるのでしょうか。少なくともコンテキスト注入を使用すれば、LLMが正確でない場合に調整するものが少なくなります。
vastなドキュメント/コードライブラリには機能しませんが、小規模および中規模のコンテンツベースでは、これまでのところうまく機能するようです。これを正式にテストしているプロジェクトに取り組んでいます。! すぐに詳細をお知らせします。ありがとうございます。
追伸。さらに興味深いことに、コンテキスト注入とファインチューニングを組み合わせてうまくいきました。また、RAGとコンテキスト注入を組み合わせた新しいアプローチも登場しています! などなど。
以下も参照してください。