
ai model🔁 자가교정#16 · 2026. 8. 18.
재학습 없이, 안전 분류기가 자기 오판만 골라 뒤집는 법
실서비스 안전 분류기는 두 갈래로 무너집니다. 학습 당시 정책만 반영해 배포자가 실제 원하는 기준과 어긋나고, 트래픽이 변하면 성능이 서서히 떨어집니다. RCV는 분류기를 재학습하지 않고 감싸는 경량 래퍼로, 내부 표현에서 '이 예측이 배포자 정책과 어긋날 확률'을 스스로 추정해 틀릴 가능성이 높은 예측만 골라 뒤집습니다. 같은 추정치를 라벨 없는 분포 이동 감지 신호로도 재사용해, 평소에는 정정 레이어만 갱신하다 정말 안 되는 구간에서만 파인튜닝으로 넘어갑니다. 기성 분류기 3종과 벤치마크 2종의 모든 조합에서 배포자 정책 적합도가 올랐고, 놓치던 유해 콘텐츠의 최대 0.81을 회수했습니다.














