WEBBOOK CHAPTER

AI 에이전트 보안: 3장 직접 프롬프트 인젝션

3장 직접 프롬프트 인젝션

사용자가 시스템 규칙을 바꾸려는 입력은 가장 눈에 띄는 공격이지만 방어는 문자열 금칙어만으로 끝나지 않는다. 권한 검사는 모델 밖에서 실행하고, 정책을 바꾸는 도구 자체를 제공하지 않는다. 탐지기가 놓쳐도 행동 게이트가 피해를 막아야 한다.

실습 3 금칙어 우회가 아니라 통제 확인

실습실에 명시적 공격 문장을 넣어 차단을 확인한다. 표현을 정상 문장으로 바꿔 탐지기가 놓칠 수 있음을 기록한다. 그 상태에서도 payment가 승인 없이 실행되지 않는지 별도로 확인한다.