다중 턴에서는 모든 것이 달라져
단일 턴 평가에서는 "이 질문에 대한 답이 좋은가?"를 묻고, 대화 평가에서는 "이 대화가 잘 진행되고 있는가?"를 물어. 두 번째가 훨씬 어려워. 품질이 맥락, 기억, 일관성, 대화의 진행 경로에 따라 달라지기 때문이야.
대화 전용 지표
- 턴별 품질 — 각 응답을 독립적으로 평가해. 다중 턴에서도 여전히 유용해.
- 맥락 유지 — 봇이 대화 초반에 나온 내용을 기억해?
- 주제 일관성 — 뒤의 턴이 앞선 턴의 내용을 논리적으로 이어 가?
- 반복 — 봇이 같은 말을 반복해?
- 대화 완료율 — 다중 턴 대화 가운데 성공적인 종료 상태에 도달한 비율은 얼마야?
- 사용자 노력 신호 — 해결까지 걸린 턴 수, 상담원 전환율, 이탈률을 측정해.
두 가지 평가 패턴
- 고정 대화 평가 — 미리 기록한 대화를 새 시스템에서 다시 실행해. 빠르고 저렴하며 결정론적이지만, 봇의 실제 응답에 따라 달라지는 행동은 놓칠 수 있어.
- 실시간 시뮬레이션 평가 — 다른 LLM을 "사용자 시뮬레이터"로 삼아 봇과 대화하게 해. 예상치 못한 행동을 포착할 수 있고 더 현실적이지만, 속도가 느리고 비용도 더 들어.
원칙: 고정 대화 평가와 모의 대화 평가를 모두 실행해. 고정 평가는 적은 비용으로 회귀를 잡고, 모의 평가는 고정 평가가 보지 못하는 문제를 찾아내.
운영 환경의 대화 관측 자료
해결까지 걸린 턴 수, 이탈률, 상담원 전환율을 실시간 지표로 추적해. 모두 사용자 노력을 간접적으로 보여 주는 지표야. 이런 지표가 악화되면 턴별 품질 점수에 변화가 없어 보여도 실제 대화 경험은 나빠진 거야.