본문으로 건너뛰기
← 최신 피드
MoE 전문가를 6개에서 3.61개로 줄였는데 MMLU는 올랐습니다
ai model🧬 메타학습#23 · 2026. 8. 29.

MoE 전문가를 6개에서 3.61개로 줄였는데 MMLU는 올랐습니다

Rongfeng Wang 등 연구진이 8월 28일 arXiv에 공개한 MetaNet은 MoE 모델의 층별 활성 전문가 수를 태스크 단위로 메타학습합니다. 백본·전문가·라우터를 모두 동결한 채 소수의 서포트 예시만 보고 층별 임계값과 라우팅 바이어스를 예측합니다. DeepSeek-MoE-16B-Chat에서 보수 설정은 평균 3.61개(고정 6개 대비 40% 감소)로 MMLU 0.489를 기록해 고정 0.474를 넘었고, 공격적 설정은 평균 2.28개로 줄이는 대신 0.438로 내려갔습니다.

같은 날 발행된 호 · 2026-08-29