결정적인 경계는 단위 시험으로 잡아
모델이 언제나 같은 도구를 고르는지는 단위 시험으로 보장할 수 없어. 대신 도구 정의가 유효한 JSON Schema인지, 훅이 금지 패턴을 거부하는지, 권한 처리기가 올바르게 허용·거부하는지, 감사 기록이 정해진 형식인지 시험할 수 있어. 모델 주변의 결정적 경계를 촘촘히 확인해.
전체 행동은 고정 모델로 통합 시험해
에이전트가 과제를 해결하고 샌드박스 안에 머물며 올바른 출처를 내는지는 날짜 고정 모델을 대상으로 시나리오 시험을 돌려. “한 줄 요약을 만든다”, “Write를 한 번도 부르지 않는다”, “출처를 하나 이상 인용한다”처럼 관찰 가능한 행동으로 판정해.
방어가 실제로 작동하는 회귀 시험을 둬
알려진 프롬프트 주입 문자열을 자료에 넣고 에이전트가 행동으로 따르지 않는지 확인해. 금지한 Bash 명령을 유도하고 훅이 거부하는지도 봐. 시험이 실패한다는 이유로 누군가 안전장치를 지우는 순간을 CI에서 붙잡아야 해.
원칙: 모델의 세부 표현은 넓게 검사하고, 안전 불변 조건은 한 치도 양보하지 말고 시험해.