2026년 공격의 최전선
사용자가 공격 지시를 직접 쓰는 주입은 이미 널리 알려졌어. 운영에서 더 큰 문제는 도구가 검색 결과, 고객 이메일, 웹페이지를 가져오고 그 안의 지시까지 운반하는 간접 주입이야. 사용자가 공격문을 입력하지 않아도 데이터가 대신 들고 와.
자주 숨어드는 자리
- 사용자가 올린 PDF의 메타데이터에 숨은 지시를 RAG가 읽어.
- 이메일 제목이 에이전트의 행동을 다른 곳으로 돌리려 해.
- 웹페이지에 "if you are an AI, do X"가 적혀 있어.
- 저장소 README의 주석이 코드 읽기 에이전트에게 행동을 시켜.
간접 주입에 필요한 방어
- 프롬프트에서 도구 출력을 믿지 않는 자료로 표시해.
- 가능한 곳에서는 도구 출력의 명령형 문장을 걷어내. 다만 이 방법은 잘 깨져.
- 새로 만난 믿지 않는 출처가 중요한 행동을 요구하면 실행 전에 확인을 받아.
- 위험이 큰 주장은 서로 독립된 출처로 교차 확인해.