
LLM이 만든 합성 예문, 임베딩 거리로 걸러내 퓨샷 분류 +2.61%p
#라벨이 몇 개뿐일 때 LLM으로 데이터를 늘리는 건 흔한 수법이지만, 생성된 예문 품질이 들쭉날쭉해 오히려 분류기를 망치곤 했습니다. 이 연구는 합성 샘플을 문장 임베딩 공간에 놓고 실제 클래스 예시와의 유클리드 거리를 재, 일관된 샘플만 골라 가중치를 주고 학습시킵니다. 13개 데이터셋에서 SMOTE 대비 평균 +2.61%p, 개체명 인식(NER)에서는 +9.26%p 올랐습니다. 복잡한 다중 기준보다 단순한 거리 필터가 더 나았다는 점이 핵심입니다.
💡별도 모델 학습 없이 임베딩 거리 계산만 얹으면 되니, 라벨링 예산이 거의 없는 실무 분류·NER 파이프라인에 그대로 붙여볼 수 있는 저비용 개선책입니다.






