
NVIDIA AVO, ARC-AGI-3 183개 레벨을 전부 클리어했습니다
NVIDIA가 범용 코딩 에이전트 시스템 AVO로 ARC-AGI-3 인터랙티브 추론 벤치마크에서 RHAE 100.00을 기록했다고 발표했습니다. 25개 공개 환경 183개 레벨을 지시·규칙·목표가 주어지지 않은 상태에서 전부 클리어했고, 환경 조작 횟수는 기존 VISTA 시스템보다 약 12% 적었습니다. 같은 벤치마크에서 Claude Opus 5 단독 성능은 약 30% 수준이었는데, AVO는 모델을 바꾸지 않고 지속 메모리(persistent memory), 탐색이 정체되면 방향을 트는 감독(supervision), 도구 통합 세 장치를 씌워 100%까지 올렸습니다. 블로그는 “장기 수행 능력은 시스템 전체의 속성”이라고 정리합니다.
💡같은 모델로 30%→100%. 모델 교체보다 하네스(메모리·감독·도구) 설계가 더 큰 레버였다는 근거입니다. 내 에이전트에도 정체 감지와 지속 메모리부터 붙여볼 만합니다.
- 누가
- NVIDIA (Terry Chen, Yeyin (Eva) Zhu, Zhifan Ye, Jean-Francois Puget, Humphrey Shi) — NVIDIA Technical Blog
- 무엇을
- NVIDIA의 범용 코딩 에이전트 시스템 AVO가 ARC-AGI-3 인터랙티브 추론 벤치마크에서 RHAE 100.00 을 기록, 25개 환경 183개 레벨을 전부 클리어했다고 발표
- 언제
- 2026-08-21T13:00:00Z
- 왜
- 프론티어 모델 단독으로는 ARC-AGI-3 같은 장기 과제(지시·규칙·목표가 주어지지 않은 환경 탐색)를 풀지 못한다. NVIDIA는 모델을 감싸는 하네스(지속 메모리 + 정체 시 방향을 트는 supervisor + 도구 통합)가 장기 수행 능력을 만든다는 가설을 검증하려 했다. 같은 벤치마크에서 Claude Opus 5 단독은 약 30% 수준이었다.
#agent-harness#ARC-AGI-3#NVIDIA#long-horizon#memory
이미지: AI 생성 이미지원문 →





