핵심 요약
AWS가 Amazon Bedrock 기반 PolicyGuard를 도입해 프롬프트 입력 직후 민감 정보를 차단하는 Pre-Model DLP 프레임워크를 구현했습니다.
구현 방법
- Hook 연결 분류기가 프롬프트 제출 직후 모델 턴 시작 전 ALLOW/BLOCK/REVIEW 판단
- policy.txt를 시스템 프롬프트로 주입하는 Policy-as-Prompt 아키텍처
- Bedrock gpt-oss-safeguard-20b를 주 분류기로 사용하고 SageMaker 엔드포인트로 원문 미기록 보장을 구현
- Codex Hook 연동으로 프롬프트 경로를 차단하는 fail-closed 방식의 프롬프트 차단
주요 결과
- EBR 96.5%, FPR 3.0%, P50 latency 669ms
- 다국어 2,000건 합성 프롬프트 평가에서 4개 모델 이식성 확인, EBR 범위 64.1–96.5% (예: gpt-oss-safeguard-20b 96.5%, Llama 3.1 64.1%)
- Iterative Refinement로 15분 만에 83%→96.8% 달성, fail-closed 원칙 유지
- 원문 로그 비저장 유지 가능한 배포 구성



