네, LLM이 허용하는 토큰 수에 따라 달라지는 절단(truncation) 로직이 있습니다. Gemini 1.5 모델의 경우 임계값을 상당히 높게(800k) 설정해 두었습니다.
동작은 해야 하지만, 모든 상호작용이 매우 비용이 많이 들 수 있습니다.
전반적으로 컨텍스트를 제한하면 모델이 더 집중하는 데 도움이 된다는 것을 발견했습니다. 하지만 장기적으로(2~5년 후) … RAG는 무의미해질 수 있으며, 우리는 충분한 토큰과 집중력을 갖추게 되어 그것이 중요하지 않게 될 것입니다.