핵심 요약
여기어때가 LLM Observability와 평가 파이프라인을 도입하고 Langfuse로 질의 흐름과 비용을 추적하며 LLM-as-a-judge를 활용한 이중 평가로 RAG 품질을 검증했습니다.
주요 경험
- Langfuse 기반 트레이스로 프롬프트/응답/토큰/비용 흐름을 한 화면에서 확인
- Retriver 지표(Recall@5, Hit Rate, MRR)와 LLM-판정 두 층으로 평가 파이프라인 구성
- 1→2→3 흐름 구현: get_lightrag_kg → get_page_hierarchy → read_confluence_page/read_jira_issue; FastMCP로 도구 오케스트레이션 및 서빙
얻은 인사이트
- 프롬프트 축소가 경량 모델의 성능에 큰 영향
- 도구 명세와 프롬프트 설계가 모델 행동에 결정적 영향
- 고유 ID 도입으로 검색 정확도와 안정성 향상

