
난이도를 매 롤아웃마다 다시 잽니다 — 12개 지표 중 11개 개선한 커리큘럼
SFT 뒤에 GRPO를 얹는 표준 레시피가 트리 구조 과제에서 왜 무너지는지를 진단한 논문입니다. 동결된 SFT 체크포인트 기준으로 50-beam 제약 랭킹의 상위 16개 후보 안에 정답 Semantic-ID가 아예 없는 프롬프트가 많고, 이때 그룹이 비슷하게 타깃을 놓치면 아이템 단위 보상이 약하거나 퇴화된 변이만 만들어낼 수 있습니다. 제안 기법 DASO는 고정 난이도 버킷이나 정답 주입 대신, 매 롤아웃 그룹을 prefix-match depth로 프로파일링해 후보가 정답 경로를 이탈하는 병목 SID 레벨을 찾고 그룹의 제한된 비율만 prefix 유도 완성으로 재배분하며 나머지 원시 롤아웃은 대조군으로 남깁니다. 공개 벤치마크 12개 지표 중 11개에서 MiniOneRec식 GRPO를 앞섰고 9개에서 최고 성능을 냈습니다.














