핵심 요약
AWS의 AI Agent를 위한 OpenSearch 검색 품질 개선 연구는 Rerank와 가중치 튜닝의 데이터셋별 효과를 측정해, BM25 단독에서 Rerank는 큰 이득을 주는 반면 이미 시멘틱을 활용한 하이브리드 구성에서는 역효과를 보이는 사례를 확인했고 자동화 및 운영 측면의 접근도 제시합니다.
구현 방법
- OpenSearch 기반 하이브리드 검색에서 상위 20개 후보에 Cohere Rerank를 적용하고, 재정렬된 상위 10개를 NDCG@10으로 평가
- 가중치 튜닝은 BM25:k-NN 비율을 Grid Search로 탐색, 12개 비율 중 기본값 0.50:0.50이 최고값으로 확인
- 자동화 루프: AI 코딩 어시스턴트를 활용한 실험 자동화 및 운영 환경에서의 지속적 평가 도입
주요 결과
- SciFact: BM25+Rerank 0.666 (+18.9%), 하이브리드 0.712, 하이브리드+Rerank 0.685 (-3.8%)
- Touche-2020: BM25+Rerank 0.737 (-5.3%), 하이브리드 0.732 (-8.9%)
- 가중치 튜닝: 기본값 0.50:0.50이 최적, 다른 조합은 -0.4% ~ -0.5% 하락
- 결론: Rerank는 낮은 품질에서 도움이 되나, 고품질에는 역효과 가능성 존재. 가중치 튜닝은 상황에 따라 효과가 없을 수 있으며, 평가 기반 의사결정이 필수.



