본문으로 건너뛰기
← 최신 피드
GPU 368장과 3개월, 지속학습만으로 프런티어급 모델을 만들었습니다
ai model♾️ 지속학습#23 · 2026. 8. 29.

GPU 368장과 3개월, 지속학습만으로 프런티어급 모델을 만들었습니다

톰슨로이터와 임페리얼칼리지런던 공동 연구진 저자 26인이 8월 28일 arXiv에 공개했습니다. 공개 가중치 Qwen3.5-397B-A17B와 Qwen3.6-35B를 밑바탕으로 중간학습·후속학습 전 과정을 지속학습으로 돌려, B200 GPU 368장 이하와 엔지니어 36명 이하로 3개월(총 87,842 GPU 시간) 만에 Thomson 1.0을 만들었습니다. 법률·세무 등 목표 도메인은 크게 오르고 비목표 도메인은 베이스 모델 수준을 유지했으며, 코딩만 경미한 망각을 보였습니다.

같은 날 발행된 호 · 2026-08-29