본문으로 건너뛰기
vibecamp ai model 목록

vibecamp ai model · #19 · 2026-08-22

vibecamp ai model 2026-08-22 — 다 돌리지 말고 갈리는 것만 골라 평가하는 에이전트 튜닝

2026-08-22 AI 모델 일간 호 — 오늘 8개 카드를 정리했습니다.

8개 카드 · 적은 예제로 스스로 깨우치는 학습법 일간

📤 공유하기𝕏@inf💬B
🎯

퓨샷 학습

학습 0회, 컨텍스트만 갈아끼워 신규 설비 수요를 예측하다

학습 0회, 컨텍스트만 갈아끼워 신규 설비 수요를 예측하다

#
지역난방망은 망마다 수요 패턴이 달라 시스템별로 예측 모델을 새로 학습하고 유지해야 했습니다. 연구팀은 합성 데이터로만 사전학습된 제로샷 시계열 모델 TabPFN-TS를 재학습 없이 실제 열부하 예측에 투입해 다른 파운데이션 모델·전통 머신러닝과 비교했습니다. 최적 설정은 12주 롤링 컨텍스트로 24시간을 시간 단위 예측하는 것이었고, CVRMSE는 13.06%로 Chronos-2(12.48%)에 근소하게 뒤졌지만 확률 예측의 캘리브레이션은 오히려 더 좋았습니다.
💡과거 데이터가 부족한 신규 현장일수록 학습보다 컨텍스트 설계가 답일 수 있습니다. 정확도만 보지 말고 캘리브레이션도 같이 보라는 사례이기도 합니다.
원문 →#few-shot-learning#zero-shot#time-series#arxiv
📚

커리큘럼 학습

검색(RAG) 없이 사내 문서로 답하게 만드는 3단 사후학습

검색(RAG) 없이 사내 문서로 답하게 만드는 3단 사후학습

#
LLM은 추론 시점에 원문을 넣어주지 않으면 특정 문서 모음에 답하지 못합니다. IAR은 이를 문서 지식 내재화 문제로 봅니다. Inject는 원문을 이어쓰기·재작성·재구성 세 목표로 바꿔 주입하고, Align은 QA 지도학습으로 답변 행동을 맞추며, Recover는 적응된 모델을 원래 instruct 모델과 병합합니다. Llama·Qwen 등 8개 조합 중 7개에서 Vanilla SFT를 4개 지표 모두 앞섰고, 그 대비 도메인 QA +3.6%p, 일반 성능 +12.1%p입니다.
💡같은 재료도 한 단계에 섞지 않고 순서로 나누면 도메인 정확도와 일반 능력을 함께 가져갑니다. 커리큘럼 설계는 결국 무엇을 언제 가르치냐는 순서 설계입니다.
원문 →#curriculum-learning#post-training#retrieval-free#arxiv
🪞

자가수정 학습

포맷은 멀쩡한데 값이 틀린 툴 응답을 에이전트가 알아채게

포맷은 멀쩡한데 값이 틀린 툴 응답을 에이전트가 알아채게

#
툴이 타임아웃되면 에이전트는 실패를 보고 우회합니다. 위험한 건 캐시된 에러 페이지나 음수 가격처럼 기대한 포맷 그대로 도착해 사실로 소비되는 조용한 실패입니다. Outcome Monitors는 트레이스에서 채굴한 결과 계약(outcome contract) 위반을 탐지하고, 위반 속성명과 복구 툴 목록을 담은 비구속 영수증을 건네 에이전트가 복구 경로를 직접 고르게 합니다. ToolMaze 완료율은 10.9%→28.1%, tau-bench retail 두 티어는 14.0·12.0포인트 올랐습니다.
💡절제 실험에서 효과의 활성 성분은 복구 툴 목록이었습니다. 무엇이 틀렸는지 알려주는 것보다 고칠 수단을 함께 쥐여주는 쪽이 자기수정을 만듭니다.
원문 →#self-correction#tool-use#llm-agent#arxiv
기억할까 확인할까 되물을까, 메모리 커밋 직전의 자기판단

기억할까 확인할까 되물을까, 메모리 커밋 직전의 자기판단

#
영구 메모리는 에이전트를 개인화하지만 잘못된 업데이트 하나가 이후 행동을 조용히 왜곡합니다. 무엇을 영구히 남기고 무엇은 맥락에만 두며 무엇은 검증하거나 사용자에게 되물어야 하는지를 140개 시나리오로 채점하고, 행동 라벨과 실제 툴 호출을 함께 평가했습니다. 모델들은 바뀌는 사실을 검증하는 일은 곧잘 해내지만 모호함을 되묻는 일은 약했습니다. 퓨샷 프롬프트로 정확도 0.557→0.771, 정책 프롬프트로 잘못된 영구화 0.243→0.100 (Holm 보정 exact McNemar 검정 기준).
💡라벨과 툴 호출의 일치도가 Claude 계열 57%, Qwen 23%로 갈렸습니다. 말로는 검증하겠다면서 검증 툴은 안 부르는 괴리는 툴까지 봐야 잡힙니다.
원문 →#self-correction#agent-memory#benchmark#arxiv
🧪

액티브러닝

다 돌리지 말고 갈리는 것만 골라 평가하는 에이전트 튜닝

다 돌리지 말고 갈리는 것만 골라 평가하는 에이전트 튜닝

#
도쿄대 팀이 LLM 에이전트의 하네스(agent harness) 코드를 반복 개선할 때 매 회차 검증셋을 통째로 돌리던 관행을 바꿨습니다. 후보 하네스끼리 답이 엇갈리는 태스크가 항상 맞거나 항상 틀리는 태스크보다 변별력이 크다는 관찰에서, 과거 채점 이력 기반 분산 가중 샘플링으로 능력 경계의 태스크만 골라 평가합니다. 샘플링 확률을 보정해 부분 평가만으로 전체 점수를 추정합니다. Terminal-Bench 2.1 등에서 최종 성능은 전체 탐색과 동등하고 평가 횟수만 80% 줄었습니다.
💡액티브러닝의 본질은 무엇을 골라 평가할지 정하는 일입니다. 평가 예산이 곧 비용인 에이전트 튜닝에서, 고를 줄 아는 것만으로 5분의 1이 됐습니다.
원문 →#active-learning#llm-agent#evaluation-budget#arxiv
🔄

지속학습

언제 재학습할까보다 배포 모델이 증분 학습을 하느냐가 갈랐다

언제 재학습할까보다 배포 모델이 증분 학습을 하느냐가 갈랐다

#
스트리밍 ML의 재학습 타이밍을 두고 주기적 재학습·오차 임계 트리거·ADWIN 드리프트 트리거를 무재학습 기준선과 맞붙인 실증 연구입니다. 재학습 예산과 학습·배포 지연을 명시한 통일 시스템 모델 위에서 드리프트 유형 3개·예산 3단계·데이터셋 3개를 조합해 3,933회를 돌렸습니다. 결론은 반전이었습니다. 배포 모델이 샘플 단위 증분 갱신을 하면 54개 짝비교 전부에서 무재학습과 실질 차이가 없었고, 증분 갱신이 없을 때만 정책이 드리프트 후 정확도를 15~55%p 갈랐습니다.
💡재학습 주기를 튜닝하기 전에 배포 모델이 증분 학습을 하는지부터 확인하라는 이야기입니다. 지연·예산 큐잉이 실효 예산을 절반으로 깎는 함정도 함께 나옵니다.
원문 →#continual-learning#concept-drift#mlops#arxiv
🧬

메타러닝

모르는 클래스가 섞여도 무너지지 않는 배포 후 적응 기법

모르는 클래스가 섞여도 무너지지 않는 배포 후 적응 기법

#
테스트타임 적응(TTA)은 배포 모델이 라벨 없이 새 도메인에 스스로 맞춰가는 기법이지만, 학습 때 없던 클래스가 섞이면 잘못된 의사라벨을 먹고 무너집니다. 싱가포르 CFAR와 중산대 공동팀의 ReNC는 신경붕괴(neural collapse) 기하를 사전 삼아 사전학습 분류기 가중치를 프로토타입으로 쓰고, 유사도로 OOD를 걸러낸 뒤 신뢰 샘플로만 프로토타입을 목표 도메인에 근사시킵니다. 클래스 1,000개인 ImageNet-C에서 종합지표 ACC-H가 21.37%→31.02%로 올랐습니다.
💡현장 데이터에는 늘 모르는 것이 섞입니다. 재학습도 소스 데이터 접근도 없이 배포 후 적응만으로 10개 베이스라인을 앞섰다는 점이 운영 관점에서 큽니다.
원문 →#meta-learning#test-time-adaptation#out-of-distribution#arxiv
이 문제에 얼마나 생각할지 첫 토큰에서 스스로 정하는 모델

이 문제에 얼마나 생각할지 첫 토큰에서 스스로 정하는 모델

#
추론 모델은 대개 고정 토큰 예산으로 돌아 쉬운 문제엔 과잉 연산, 어려운 문제엔 연산 부족이 함께 생깁니다. 연구진은 응답 첫 토큰에서 NoThink·Short·Long 중 하나를 모델이 직접 고르게 하고, 별도 라우터 없이 GRPO 학습 안에 그 선택을 넣었습니다. 1.5B 증류 모델에서 MATH500 정확도 0.782(베이스 0.796)를 지키며 평균 응답을 4,796→2,811토큰으로 줄였고, 재학습 없이 GSM8K로 전이돼 토큰 76%를 아꼈습니다.
💡짧은 모드가 Long보다 정확했다는 건 정책이 난이도를 실제로 읽는다는 뜻입니다. 생각 예산을 배분하는 법을 배우면 재학습 없이 다른 벤치마크로 넘어갑니다.
원문 →#meta-learning#test-time-compute#grpo#arxiv

이 호가 도움됐다면 공유해 주세요 — 빌더 한 명이 더 알게 됩니다.

📤 공유하기𝕏@inf💬B
vibecamp ai model 2026-08-22 — 다 돌리지 말고 갈리는 것만 골라 평가하는 에이전트 튜닝 | vibecamp ai model