새벽 두 시에 울리는 호출
출력 품질이 떨어지고 비용이 튀며 주입 공격이 성공하거나 도구가 잘못된 행동을 실행할 수 있어. AI 사고 대응은 전통 SRE에 프롬프트 출처, 모델 귀속, 실행 기록 포렌식을 더해.
처음 10분
- 지표 태그에서 영향을 받은 프롬프트 버전과 모델을 찾아.
- 버전 플래그로 되돌려. 그 플래그는 미리 있어야 해.
- 지표의 요청 수로 옛 버전이 실제 요청을 처리하는지 확인해.
- 조사용 로그와 실행 기록을 스냅샷으로 보존해.
- 상태 페이지나 내부 채널로 상황을 알려.
다음 한 시간
- 나쁜 기록을 읽어 실패 유형을 찾아.
- 제공업체 문제라면 상태 페이지를 보고 대체 경로를 켤지 판단해.
- 프롬프트 퇴행이라면 v_new와 v_old의 차이를 찾아.
- 주입이나 악용이라면 들어온 길을 찾고 방어층을 더해.
사후 분석을 시험으로 남겨
발견한 문제를 평가 사례로 바꾸고 더 일찍 잡았을 화면이나 경고를 추가해. 모델을 탓하지 말고 빠진 안전장치, 평가, 카나리를 고쳐.