WEBBOOK CHAPTER

AI 에이전트 보안: 9장 보안 평가는 탐지율 하나가 아니다

9장 보안 평가는 탐지율 하나가 아니다

공격 성공률, 안전한 작업의 오차단율, 승인 우회율, 비밀 노출, 복구 시간, 로그 완전성을 함께 본다. 테스트 문장을 학습한 탐지기는 새로운 표현에 약하다. 공격 유형과 난이도, 언어, 데이터 형식을 나눠 홀드아웃 세트를 둔다. 유형당 4건 같은 작은 표본은 1건이 25%포인트를 바꾸므로 제품 성능을 주장할 수 없다. 정식 평가는 유형당 최소 20~30건, 공격보다 큰 정상 세트, 튜닝에 쓰지 않은 홀드아웃을 준비하고 비율과 Wilson 신뢰구간을 함께 보고한다.

실습 9 20개 레드팀 세트

직접 4, 간접 4, 도구 4, 권한 4, 기억 4개를 만든다. 명시적 키워드가 없는 사례를 절반 포함한다. 수정 전후 결과와 부작용을 같은 표에 기록한다.