본문으로 건너뛰기
← 최신 피드
쉬운 데이터가 항상 정답은 아니다, 모델 크기가 기준을 바꾼다
ai model🙋 능동학습#16 · 2026. 8. 18.

쉬운 데이터가 항상 정답은 아니다, 모델 크기가 기준을 바꾼다

추론 능력을 가르치는 지도 미세조정(SFT)에서는 교사 모델이 만든 후보 응답 중 무엇을 학습에 쓸지 골라야 합니다. 최근 연구들은 학생 분포에 가까운, 즉 likelihood가 높은 응답이 더 좋은 지도라는 규칙을 사실상 보편 법칙처럼 써 왔습니다. 연구진은 1.5B~8B 학생 모델로 수학 추론 통제 실험을 돌려 그 규칙이 조건부임을 보였습니다. 결과는 용량에 따라 갈리는 'Fast-Fit / Slow-Gain' 패턴으로, 높은 likelihood 데이터는 특히 작은 모델에서 초반 개선이 빠르고 안정적이지만 큰 모델을 오래 학습시키면 낮은 likelihood 데이터가 갈수록 유리해집니다. COLM 2026 채택 논문입니다.

같은 날 발행된 호 · 2026-08-18