
ai model🔁 자가교정#23 · 2026. 8. 29.
심판을 자기 점수로 키우지 않았더니 10바퀴까지 계속 좋아졌습니다
Gyouk Chu·Myeongho Jeon·Eunho Yang이 8월 28일 arXiv에 공개한 J-Zero는 사람이 만든 데이터 없이 출제자·풀이자·심판 세 역할이 함께 진화하는 자가진화 프레임워크입니다. 핵심은 심판을 자기 점수로 학습시키지 않고, 어떻게 생성됐는지로 우열이 이미 정해진 선호쌍으로 학습시키는 것입니다. 검증 가능한 도메인에서 평균 4.2점, 검증 불가 도메인에서 8.0점 앞섰고 최소 10회 반복까지 개선이 이어졌습니다.


















