TRL은 선호 정렬을 위한 학습 도구를 모아 둬
trl은 SFT, DPO, PPO, KTO, IPO, ORPO, GRPO 같은 선호·강화학습 방식을 제공해. 2026년의 흔한 출발점은 별도 보상 모델과 PPO 루프 없이 선호 쌍을 직접 학습하는 DPO야.
DPO는 선택된 답과 거절된 답의 간격을 벌려
데이터 한 행은 (prompt, chosen, rejected)를 가져. DPO는 closed-form 목적함수로 같은 prompt에서 chosen의 확률을 rejected보다 높여. 구현 흐름은 손실 함수가 다른 SFT와 비슷하고 별도 보상 모델이 없어 비교적 단순하지만, 선호 데이터의 일관성과 기준이 곧 학습 품질이야.