
예시에 점수를 붙이면 프롬프트가 작은 강화학습이 된다
#LLM에 생성 샘플과 평가 점수를 함께 예시로 넣으면 출력이 스스로 좋아진다는 현상은 그동안 실험적으로만 알려져 있었습니다. 이 논문은 점수 조건부 in-context learning이 policy gradient 최적화와 구조적으로 대응한다는 것을 이론으로 보였습니다. 특정 가중치 행렬 구성에서 self-attention이 REINFORCE의 보상 가중 집계를 구현할 수 있음을 구성적으로 증명했고, 제한된 어텐션 업데이트가 만드는 분포 이동의 정확한 상한을 유도해 KL 제약 정책최적화(trust region)와의 대응까지 정리했습니다.
💡가중치를 건드리지 않고 예시 몇 개로 태스크를 태우는 워크플로에서, 예시 선택·점수 스케일·예시 개수를 학습률과 trust region 관점으로 튜닝할 근거가 생깁니다.


