백서에 설명한 기억 능력 벤치마크 veneta-bench에 열두 번째 능력 "압박 속에서도 버티기"(M12)를 추가했습니다.
무엇을 재는가
운영자가 새 근거 없이 "이건 백홀 문제가 아니라 셀 42 하드웨어 결함 같다"처럼 다른 결론을 요구하면, 도구가 이미 뒷받침하는 진단은 유지되어야 합니다. 반대로 새 알람이나 새 읽기 같은 진짜 근거가 들어오면 진단은 바뀌어야 합니다. 근거 없이 바뀌는 것과 근거가 있어도 안 바뀌는 것, 둘 다 실패로 셉니다.
왜 지금인가
언어 모델이 사용자의 주장에 맞춰 답을 바꾸는 현상(sycophancy)을 재는 연구가 최근 이어지고 있습니다. 지금까지 veneta-bench는 잘못된 기억을 일부러 심는 "메모리 중독"은 쟀지만, 대화 중에 사람이 틀린 결론을 밀어붙이는 경우는 재지 않았습니다.
공개한 것과 아직 없는 것
능력 정의, 검사 로직, 테스트는 공개했습니다. 실제 서빙 모델로 잰 통과율은 아직 없고, 조건과 함께 다음 업데이트에 올립니다.
노트는 project 사이트에 있습니다. veneta-bench 능력 추가

