結局、地道な作業は必要です。LLMを使って決定論的なツールを作成する場合でも、それらのツールが実際に正しい動作を行っているか、単に統計的に頻繁に正しい結果を返しているだけではないかを検証する必要があります。LLMを使って決定論的なツールを作成することは、MarkdownファイルをLLMに渡して同じ結果を期待するだけのプロンプト入力よりも良いです(ただし、法的・倫理的な問題点は依然として残っています)。しかし、その決定論的なツールをLLMだけに頼って盲目的にメンテナンスすると、新しいリリースで時間とともに決定論的な動作を失うリスクがあります。
SnykのVulnBenchレポートが示したように、LLMによる監査は実際には信頼性が低いです: