핵심 요약
올리브영은 AI Pick 카드 생성을 위해 SFT 이후 정렬 학습(DPO/GRPO)을 도입해 형식 준수와 자연스러움·문맥적합을 함께 개선한 경험을 공유합니다.
주요 경험
- 형식 검증기와 NLL 지표로 후보 출력을 선호 쌍으로 구성하고, DPO로 학습시켜 출력의 형식과 품질을 동시에 개선했습니다.
- 더 복잡한 TPO 카드에 대해 formatmix와 GRPO 보정으로 형식과 품질의 절충점을 찾아냈습니다.
- 재시도(retry)와 재현 가능한 평가 체계를 통해 운영 비용과 품질 관리의 균형을 확보했습니다.
얻은 인사이트
- 학습 신호 설계가 성능에 가장 큰 영향을 주며 near-miss를 적정 비율로 포함하는 것이 효과적입니다.
- 형식-품질의 트레이드오프는 과제에 따라 다르게 작용하므로 두 제어 수단의 조합이 필요합니다.
- 재현 가능한 평가 체계는 모델 버전 간 비교와 배포 검증의 핵심 자산이 됩니다.



