HTML 주석도 요약에 포함됩니다.
요약을 보는 사용자는 주석을 볼 수 없을 가능성이 높으므로, 주석을 요약에서 제외하는 것이 가장 좋다고 생각합니다.
3개의 좋아요
실례합니다. 모델의 성능이 좋아서 그 댓글을 눈치챘습니다.
이 게시물에는 문제를 설명하기 위해 예시 HTML 주석(<!-- Discourse is great! > )이 포함되어 있습니다. はこん
추가 전처리 콘텐츠라는 트레이드오프가 가치가 있다고 확신하지 못해 #wontfix로 표시합니다.
해당 인스턴스에서 이를 불편하게 느껴진다면, 요약 에이전트 속성을 변경하여 해당 항목을 무시하도록 지시할 수 있습니다.
5개의 좋아요
이런 동작은 악성 게시물이 아무런 흔적 없이 요약에 영향을 미킬 수 있는 은밀한 채널을 도입하는 것 아닌가요?
3개의 좋아요
LLM이 프롬프트를 시스템과 사용자 입력으로 나누는 이유가 바로 이것입니다. 이를 통해 안전하지 않은 입력과 그렇지 않은 입력을 구분할 수 있기 때문입니다.
하지만 네, 그것은 가능성입니다. 특히 소형 모델이나 오래된 모델에서 더 그렇습니다.
2개의 좋아요
하지만 제 이해로는 이 중 어느 것도 메커니즘이 아니며, (최대한의 경우에도) 영향력(influence)에 불과합니다. 그래서 끊임없이 제일브레이크(jailbreak)가 발생하는 것입니다. 따라서 출력이 어떻게 나오는지 신경 쓴다면, LLM에 어떤 텍스트가 표시되는지가 중요하다는 뜻입니다.