
ai model📚 커리큘럼 학습#15 · 2026. 8. 17.
5단계 커리큘럼 + 단계별 보상 이동으로 자율주행 RL 성공률 5~10%→100%
목표 지향 주행은 목표 도달·경로 추종·장애물 회피·신호 준수처럼 경쟁하는 행동을 한꺼번에 익혀야 하는데, 고정된 목적함수는 무엇을 먼저 배울지 순서를 주지 않습니다. CORAL은 경로를 늘리며 제약을 조이는 5단계 커리큘럼과, 초반 목표 도달에서 후반 안전·규칙 준수로 가중치를 옮기는 단계 인식 보상을 함께 굴립니다. 같은 프로토콜의 PPO 베이스라인이 최장 경로에서 5%·10%에 그친 반면 평가 20회를 전부 성공했고, 미학습 7개 도시로 zero-shot 전이해 68~98% 성공했습니다.















