
ai model📚 커리큘럼 학습#16 · 2026. 8. 18.
지금 실력에 맞는 과제를 씨앗마다 새로 빚었더니 40.0→49.2%
few-shot·Self-Instruct 같은 고정 레시피는 모든 씨앗 과제에 같은 프롬프팅 정책을 적용해, 지금 정책에 필요한 게 더 어려운 과제인지 더 쉬운 과제인지 아예 다른 과제인지를 구분하지 못합니다. Envs-FORGE는 검증기 보상을 씨앗별 환경 합성 액션으로 바꾸고, 씨앗별 통과율을 추정한 뒤 목표 학습 프런티어 주변 6개 방향을 점수화해 혼합정수선형계획(MILP)으로 액션을 고릅니다. 선택된 액션은 지시문·테스트·Docker 환경까지 함께 다시 쓰고, 검증을 통과한 번들만 강화학습에 투입됩니다. Qwen 3.5 35B 기준 tb-core 1회 통과율이 40.0→49.2%, tb-2.0이 23.0→29.4%, SWE-bench Verified가 73.4→77.1%로 올랐습니다.














