한 겹으로는 부족해
실제로 작동하는 방어는 여러 겹이 쌓여 있어. 각 층은 일부 공격만 잡고 어느 하나도 전부 막지는 못해. 함께 쓸 때 공격 비용을 높이고 피해가 번질 면적을 줄여.
쌓아 올릴 여섯 층
- 프롬프트의 신뢰 경계 — 믿지 않는 내용을 분명한 태그로 감싸고 자료 구역의 명령을 따르지 말라고 해.
- 권한 범위 제한 — 모델에는 필요한 도구만 주고 나머지는 닿지 못하게 해.
- 입력 필터 — 알려진 악성 패턴을 찾고 위험한 입력은 별도 경로로 보내.
- 출력 필터 — 민감정보 유출, 숨은 URL, 공격 징후를 모델 출력에서 검사해.
- 검증 반복 — 이메일 발송 같은 구조화 행동은 실행 전에 업무 규칙에 대조해.
- 감사 기록 — 모든 입력, 출력, 도구 호출을 만든 프롬프트 버전과 함께 남겨.
피해 반경에 맞춰 비용을 써
각 층은 지연 시간과 복잡성, 오탐 비용을 더해. 모든 곳에 전부 붙이지 말고 피해 반경에 맞춰 골라. 요약 끝점은 환불을 승인하는 에이전트보다 가벼운 방어로 충분할 수 있어.