최종 답뿐 아니라 실행 과정도 평가해
LLM 에이전트는 반복해서 판단해. 도구를 선택하고 실행한 뒤 결과를 관찰하고, 다음 단계를 결정하지. 최종 답도 중요하지만 어떻게 도달했는지도 중요해. 올바른 도구를 사용했어? 불필요한 단계를 반복했어? 허용할 수 있는 비용 안에서 성공했어?
에이전트 전용 지표
- 과제 성공 — 에이전트가 목표를 달성했어? 이진 값이나 등급으로 평가할 수 있어.
- 도구 호출 정확도 — 올바른 도구를 올바른 인자와 함께 선택했어?
- 실행 과정 효율성 — 완료까지 거친 단계 수가 적절해?
- 비용 — 총 토큰 수, 총 도구 호출 수, 총 경과 시간을 측정해.
- 복구 — 초기 단계가 실패했을 때 에이전트가 복구해?
- 목표 일치 — 에이전트가 사용자의 실제 목표를 추구해, 아니면 도중에 빗나가?
실행 과정 평가 패턴
에이전트가 거치는 모든 단계를 기록해. 사고 과정, 도구 호출, 도구 결과, 다음 사고 과정을 차례로 남기고, (a) 최종 결과와 (b) 실행 과정의 품질을 각각 평가해. "불필요한 도구 호출을 47번 한 뒤 완벽한 답을 냈다"면 평가에서 통과가 아니라 실패로 처리해야 해.
원칙: 에이전트 평가는 반드시 실행 과정을 살펴야 해. 최종 출력만 채점하면 느리고, 비싸고, 실행 도중 혼란을 겪는 등 눈에 잘 띄지 않는 실패의 절반을 놓치게 돼.
안전한 실행을 위한 격리 환경
코드를 실행하거나, 탐색하거나, 상태를 변경하는 에이전트는 격리 환경이 필요해. Inspect AI의 Docker 격리 환경을 사용할 수도 있고, SWE-bench처럼 임시 저장소 복제본을 만들 수도 있어. 실제 인프라에 접근하는 시스템에서는 절대로 격리되지 않은 평가를 실행하지 마.