핵심 요약
넷플릭스의 GenRec는 LLM 기반 랭커로, Netflix 데이터로 파운데이션 LLM을 후학습해 카탈로그 내 아이템에 대한 순위를 매겨 생산 시스템과 비교해도 손실 없이 경쟁 혹은 우수한 성능을 보였습니다.
구현 방법
- Verbalization: 사용자 이력, 아이템 메타데이터 및 컨텍스트를 텍스트로 변환
- Phase 1 — Netflix‑adapted foundation LLM: Netflix 전용 데이터로 백본 학습
- Phase 2 — ranking‑focused post‑training: 보상 신호 및 랭킹 목표 반영
- 카탈로그‑aware 스코어링 헤드로 대규모 카탈로그 점수화
- 컨텍스트 엔지니어링 및 프리필 인퍼런스로 비용 최적화
주요 결과
- 오프라인: Phase‑2 라벨링 예제가 약 40배 감소한 상태에서 MRR +1.6% 달성
- 온라인: 약 4주간 10% 트래픽 대상 대규모 A/B 테스트에서 단기·장기 지표 모두 유의미한 개선
- 데이터 확장 시 오프라인 지표도 지속 개선(Phase‑1 대비 Phase‑2 효과 증가)

