핵심 요약
AWS의 기술 블로그는 AWS OpenSearch Service 기반의 검색 품질 평가 시스템을 구축하고, BM25, 시멘틱(k-NN), 하이브리드(RRF) 각각의 성능을 BEIR 기반으로 비교했습니다. LLM Judge로 엔진 레벨 채점을 수행해 재현성과 신뢰성을 확보했습니다.
구현 방법
- BM25+시멘틱 하이브리드 검색 파이프라인 구성 및 RRF로 순위 결합
- BEIR 데이터셋(SciFact, NFCorpus, TREC-COVID, Touche-2020) 및 한국어 MIRACL로 벤치
- Cohere Embed Multilingual v3로 벡터화, Bedrock의 Claude로 LLM Judge 채점
- 인덱스와 벡터 검색의 운영 비용 및 지연 고려
주요 결과
- SciFact에서 시멘틱이 BM25를 앞섰고 Recall도 우수
- TREC-COVID는 시멘틱 우세이지만 Recall가 낮아 한계 주의
- NFCorpus/Touche-2020에서 하이브리드가 강세
- MIRACL 한국어에선 k-NN이 BM25를 앞서고, 하이브리드도 강력
- 한국어 BM25는 Nori 형태소 분석기 적용으로 87% 상승
- 데이터 특성에 따라 최적 방식이 달리며, 하이브리드가 안정적인 출발점으로 보임



