Moait
홈인기 피드모든 블로그모든 태그
홈인기 피드모든 블로그모든 태그
측정할 수 없으면 개선할 수 없다 - AI Pick 추천 카드를 위한 sLLM 정렬 학습기 섬네일

측정할 수 없으면 개선할 수 없다 - AI Pick 추천 카드를 위한 sLLM 정렬 학습기

올리브영 favicon올리브영·AI/ML·
GRPOQLoRASFTAlignment LearningDPO
2026년 09월 18일0

AI 요약

이 글은 AI가 요약했어요. 정확한 내용은 꼭 원문을 확인해 주세요!

핵심 요약

올리브영은 AI Pick 카드 생성을 위해 SFT 이후 정렬 학습(DPO/GRPO)을 도입해 형식 준수와 자연스러움·문맥적합을 함께 개선한 경험을 공유합니다.

주요 경험

  • 형식 검증기와 NLL 지표로 후보 출력을 선호 쌍으로 구성하고, DPO로 학습시켜 출력의 형식과 품질을 동시에 개선했습니다.
  • 더 복잡한 TPO 카드에 대해 formatmix와 GRPO 보정으로 형식과 품질의 절충점을 찾아냈습니다.
  • 재시도(retry)와 재현 가능한 평가 체계를 통해 운영 비용과 품질 관리의 균형을 확보했습니다.

얻은 인사이트

  • 학습 신호 설계가 성능에 가장 큰 영향을 주며 near-miss를 적정 비율로 포함하는 것이 효과적입니다.
  • 형식-품질의 트레이드오프는 과제에 따라 다르게 작용하므로 두 제어 수단의 조합이 필요합니다.
  • 재현 가능한 평가 체계는 모델 버전 간 비교와 배포 검증의 핵심 자산이 됩니다.

연관 피드

%가 높을수록 이 글과 비슷할 가능성이 높아요!
T4 GPU 1장으로 일궈낸 올리브영의 Gemma 3 기반 sLLM 구축기 섬네일
73%

T4 GPU 1장으로 일궈낸 올리브영의 Gemma 3 기반 sLLM 구축기

올리브영 favicon올리브영·2026년 01월 21일
RLHF - 어떻게 LLM의 성능을 향상시킬 수 있을까? 섬네일
69%

RLHF - 어떻게 LLM의 성능을 향상시킬 수 있을까?

빅웨이브에이아이 favicon빅웨이브에이아이·2024년 01월 24일
AWS 환경에서 프로덕션-레디 확산 언어 모델(DLM) 검증하기 섬네일
68%

AWS 환경에서 프로덕션-레디 확산 언어 모델(DLM) 검증하기

AWS faviconAWS·2026년 07월 15일