본문으로 건너뛰기
← 최신 피드
이 문제에 얼마나 생각할지 첫 토큰에서 스스로 정하는 모델
ai model🧬 메타학습#19 · 2026. 8. 22.

이 문제에 얼마나 생각할지 첫 토큰에서 스스로 정하는 모델

추론 모델은 대개 고정 토큰 예산으로 돌아 쉬운 문제엔 과잉 연산, 어려운 문제엔 연산 부족이 함께 생깁니다. 연구진은 응답 첫 토큰에서 NoThink·Short·Long 중 하나를 모델이 직접 고르게 하고, 별도 라우터 없이 GRPO 학습 안에 그 선택을 넣었습니다. 1.5B 증류 모델에서 MATH500 정확도 0.782(베이스 0.796)를 지키며 평균 응답을 4,796→2,811토큰으로 줄였고, 재학습 없이 GSM8K로 전이돼 토큰 76%를 아꼈습니다.

같은 날 발행된 호 · 2026-08-22