핵심 요약
하이퍼커넥트가 온디바이스 얼굴 식별 파이프라인의 응답 시간을 138.2 ms에서 86.8 ms로 약 37% 단축하고, 처리량을 7.2장/초에서 45.9장/초로 530% 개선했습니다.
구현 방법
- 디코딩 후보를 상위만 디코딩하는 PPD와 연산 융합으로 디코딩 양을 줄였습니다
- Top-K를 Min Heap으로 관리해 전체 정렬 비용을 제거했습니다
- TensorBuffer.floatArray 사용으로 JNI 호출을 최소화했습니다
- 스레드 풀 및 인터프리터 수를 조정해 인퍼런스 병렬화 및 처리량을 높였습니다
- 모델 인스턴스 병렬화를 통해 얼굴 탐지와 인식을 동시에 처리했습니다
주요 결과
- Latency 138.2 ms → 86.8 ms, 약 37% 감소
- Throughput 7.2 → 45.9 photos/s, 530% 증가


