핵심 요약
NAVER D2는 vLLM 모델 변환 및 배포를 AI-native 방식으로 자동화해, 7개 모델 유형에 같은 절차를 적용하고 토큰 호출을 6,900에서 170으로 대폭 감소시켰으며, Plan.md 승인 게이트와 독립 컨텍스트 검증으로 품질을 확보했습니다.
구현 방법
- convert-vllm Claude Code Skill을 활용해 setup-environment, convert-model, develop-io-processor, test-and-benchmark, finalize-and-publish의 5단계로 PR 생성까지 자동화
- plan.md 승인 게이트와 독립 검증 컨텍스트를 도입해 협업 안전성 강화
- vllm_version과 Source 메타데이터로 규칙의 버전 관리 및 근거 추적
주요 결과
- 7개 모델 유형에 동일 절차 적용 및 45개 규칙 축적으로 재사용성 증가
- 호출당 토큰 6,900→170(97% 감소) 및 지식 접근 방식 개선
- Issue 기반 E2E 배포 파이프라인과 GitOps 운영으로 배포 자동화 달성

