핵심 요약
토스가 Toss Benchmark를 활용해 한국어 서비스에 맞춘 LLM 도메인 성능과 정책 준수, 지식 능력을 평가하고 운영 태스크와의 상관관계를 분석했습니다.
주요 경험
- 한국어 도메인 벤치마크와 영어 벤치마크의 차이를 분석해 실무 필요 능력을 재확인했습니다.
- Toss IFBench(정책 준수)와 Toss Knowledge(도메인 지식)를 운영 태스크와 연결하는 상관관계를 확인했습니다.
- Reasoning 설정의 영향이 모델마다 크게 달라짐을 확인하고 운영 조건에 맞춘 구성이 필요함을 보았습니다.
얻은 인사이트
- 공개 벤치마크만으로는 모델 선택이 한계였고, 한국어 서비스 조건 재평가가 필요합니다.
- 커머스 태스크에서 도메인 지식 점수와 실제 성능 간 상관이 크게 나타났습니다.
- Reasoning 활성화 여부와 프롬프트 언어가 운영 성능에 큰 영향을 줍니다.


