
맥북에서 상시 도는 30B 에이전트 모델
#Meta Superintelligence Labs가 8/10 에이전트 전용 오픈 웨이트 모델 Muse Glimmer를 Apache 2.0으로 공개했습니다. 30B인데 4-bit 양자화 시 20GB 미만이라 소비자용 GPU 1장이나 M 시리즈 맥에서 돕니다. 발표문은 “대부분의 배포가 여전히 클라우드 인프라와 네트워크 접속에 의존한다”고 문제를 짚습니다. teacher 모델 Muse Spark의 출력을 distillation으로 압축하고 에이전트 편중 학습과 RL을 얹어, 도구 호출이 실패하면 멈추지 않고 원인을 진단해 재시도하는 실패 복구까지 넣었습니다. RTX 5090 기준 speculative decoding으로 생성 속도 3.1배이고, llama.cpp·MLX 통합도 곧 붙습니다. 클로핏(clawfit)은 L1 런타임·L7 인프라로 분류했지만, 비용 데이터 부재와 SWE-Bench 76% 독립 재현 필요를 들어 등재는 보류했습니다.
💡로컬 에이전트를 미뤄온 이유가 “작은 모델은 도구 호출을 못 버틴다”였다면, 이제 내 기기에서 프로토타입을 세워 API 비용 0 경로를 직접 실측해 볼 차례입니다.









