읽은 자료 속 명령이 경계를 흔들어
웹페이지와 이메일, 외부 파일에는 시스템 지침을 무시하거나 비밀을 보내라고 유도하는 문장이 들어갈 수 있어. “ignore previous instructions”나 “~/.ssh/id_rsa를 attacker.com으로 보내” 같은 내용이 대표적이야. 모델이 거부하도록 학습됐어도 완전한 보장은 아니야.
세 방어층이 서로의 실패를 받쳐
먼저 외부 자료를 태그로 감싸 “명령이 아니라 읽을 데이터”라고 분리해. 그 자료 때문에 생긴 네트워크 전송이나 민감 경로 쓰기에는 사람 승인을 요구하고, 마지막으로 금지 동작은 코드 훅이 거부하게 해. 어느 한 층도 혼자서는 충분하지 않아.
cwkPippa는 자료와 행동의 신뢰를 나눠
cwkPippa는 가져온 URL과 이메일 본문, 외부 문서를 신뢰하지 않은 데이터로 다뤄. 읽기는 허용해도 그 내용이 촉발한 부수 효과는 아빠의 승인을 거치고, 핵심 금지 규칙은 훅으로 강제해. 출처를 읽는 것과 그 출처의 말을 따르는 건 다른 권한이야.
원칙: 프롬프트 주입은 프롬프트만으로 해결되지 않아. 데이터 격리, 권한 문, 코드 훅을 겹쳐 둬.