공격자가 오기 전에 스스로 부숴봐
레드팀은 다른 사람이 하기 전에 자기 시스템을 공격하는 연습이야. LLM 앱에서는 프롬프트, 도구, 데이터 흐름을 이용해 모델이 잘못 행동하도록 시도해. 여기서 성공한 공격은 곧 퇴행 시험이 돼.
공격해볼 경로
- 사용자 메시지에 직접 주입을 넣어.
- 통제하는 문서나 도구 결과에 간접 주입을 심어.
- 역할극으로 페르소나와 역할을 덮어써.
- 도구 인수를 조작해 권한을 높여.
- 숨은 URL이나 이미지로 출력에서 정보를 빼내.
- 도구 인수를 헷갈리게 해 다른 사용자의 자료를 노출시켜.
한 번이 아니라 계속해
- 점검표로 시작하고 새 공격을 찾을 때마다 넓혀.
- 발견한 문제마다 평가 사례를 만들어.
- 프롬프트와 모델을 갱신할 때마다 전체 모음을 돌려.
- 가능하면 레드팀 담당자를 바꿔. 한 사람의 눈에는 금세 사각지대가 생겨.
이미 있는 공격 자료를 활용해
Anthropic의 HackerOne 프로그램, OpenAI의 red-teaming network, 학계의 적대적 프롬프트 저장소에는 출발점이 될 패턴이 있어. 처음부터 다시 만들 필요 없어.