프롬프트가 옳아도 출력은 틀릴 수 있어
모델이 공격에 넘어가거나 드문 실패를 내거나 정책을 어긴 내용을 만들 수 있어. 출력 필터는 앞의 방어가 놓친 결과를 사용자에게 닿기 직전에 잡는 층이야.
검사할 항목
- 이메일, 전화번호, 주민번호, 신용카드, 내부 API 끝점 같은 민감정보.
- 이미지 src나 링크 href에 숨은 정보 반출 URL.
- 화면이 그려내고 사용자가 믿게 될 Markdown과 HTML 구조.
- 욕설, 혐오 표현, 해당 서비스 정책에서 제한한 주제.
- "ignore previous instructions"나 예상 밖 도구 호출 문법 같은 주입 흔적.
코드로 강제해
- 사용자에게 보내기 전 원본 출력에 정규식과 분류기를 돌려.
- HTML·Markdown 정화기로 위험한 구조를 걷어내.
- 위험도가 높은 내용은 두 번째 LLM 판정기로 검사해.
- 심각도에 따라 차단하고 가리거나 경고를 울려.