"깨끗해 보이는 transcript 도 완벽하고 유창하게 틀릴 수 있어."
품질 체크가 실제로 재는 것
Recall 이 transcript 를 받아들일 때 구조 품질 평가를 돌려. 진짜 쓸모 있어 — 망가진 전사의 특징적 모양을 잡아:
- 반복 segment — 같은 줄 40번, model 이 침묵에서 loop 도는 고전적 서명.
- 긴 반복 span — 어떤 사람도 멈출 지점을 한참 지나 이어지는 구절.
- 타임스탬프 역행 — 뒤로 가는 타임스탬프, projection 이 헷갈렸다는 뜻.
- 알려진 상투구 — 아무것도 안 들릴 때 model 이 내뱉는 boilerplate hallucination("시청해주셔서 감사합니다", 자막 크레딧 filler).
이건 진짜 신호야. severe 로 표시된 release 는 요약 생성이 막힐 수도 있어, 쓰레기를 요약하면 자신만만한 쓰레기가 나오니까. 그래서 품질 체크는 자기 자리를 벌어.
근데 그건 진실이 아니라 모양을 재
넘으면 안 되는 선이 여기 있어: 구조 품질은 텍스트의 모양을 재지, 절대 정확성을 재지 않아. 그 둘은 양방향으로 갈라져:
- transcript 가 구조적으로 티끌 하나 없이 — 반복 없음, 깨끗한 타임스탬프, 상투구 없음 — 이면서도 틀릴 수 있어. model 이 이름을 완벽하게 유창하게 잘못 들을 수 있어. 모양엔 그게 안 드러나.
- transcript 가 구조적으로 지저분 — 반복 몇 개, 이상한 span 하나 — 하면서도 네가 찾는 순간을 찾는 데는 완전히 쓸 만할 수 있어.
그래서 품질 점수는 조언이야. 사람 리뷰어에게 정보를 주고 비싼 파생 단계를 gate 할 수 있어. 절대 정확성의 증명이 아니고 — 이게 다음 트랙이 지어진 불변식인데 — transcript 를 '지식이 될 만큼 좋다' 로 절대 자동 승격 안 해. 깨끗한 구조 점수랑 '소스로서 믿을 만함' 은 다른 두 판단이고, 기계는 첫 번째만 내릴 수 있어.
이 자제가 왜 중요해
초록 품질 점수를 '승인' 으로 두고 싶어 죽겠지. 자동이고, 싸고, 객관적으로 느껴져. 그게 정확히 함정이야. proxy 지표가 승인 gate 가 되는 순간, '정확함' 을 '구조 체크 통과' 로 조용히 재정의한 거고 — 이제 모든 유창한 hallucination 이 곧장 통과해. Recall 은 지표를 자기 차선에 둬: 사람이 양방향으로 뒤집을 수 있는 도움되는 조언자지, 절대 재판관이 아냐. 그 구별을 붙잡아; 트랙 7 이 그걸 '완료' 와 '승인' 사이의 단단한 벽으로 바꿔.