숫자는 거짓보다 구도가 더 문제야
발표의 벤치마크 수치가 노골적인 거짓인 경우는 드물어. 대신 가장 좋아 보이는 구도를 만들도록 고르고 배치해. 다음 다섯 가지를 모든 주장에 적용해.
1. 골라 보여 주기
이긴 벤치마크는 크게 쓰고 진 것은 빼기 쉬워. 코딩 모델 발표에 HumanEval이 없거나 수학 모델 발표에 GSM8K가 없다면 그 누락 자체가 정보야.
2. 데이터 오염
인터넷을 긁은 사전 학습 데이터에는 벤치마크 시험 문제가 섞일 수 있어. 모델이 일부를 외우면 진짜 능력 향상처럼 보이므로, 오염에서 떨어진 별도 평가가 필요해.
3. 평가 절차 차이
0-shot과 5-shot, 생각의 사슬 프롬프트, 답을 추출하는 정규식과 구조화 출력, LLM 심판 같은 작은 선택이 점수를 크게 흔들어. 같은 이름의 벤치마크라도 절차가 다르면 바로 비교할 수 없어.
4. 포화
MMLU, HellaSwag, ARC-Easy에서는 상위 모델이 좁은 구간에 몰려 차이가 평가 잡음과 비슷해. 작은 점수 차이보다 Frontier Math, ARC-AGI, SWE-Bench Verified, GPQA, AIME처럼 아직 모델을 가르는 평가를 함께 봐.
5. 내 작업의 시험
공개 벤치마크는 실제 워크로드를 대신하지 못해. 후보 모델마다 실전 예시 10~50개로 작은 자체 평가를 돌리는 편이 더 값져. 리더보드 순위가 내 데이터에서는 뒤집힐 수 있고, 나에게 중요한 순서는 그쪽이야.
제3자 자료로 삼각 측량해
Artificial Analysis는 제공자별 지연 시간과 비용, 기본 능력을 비교하고 Hugging Face Open LLM Leaderboard는 오픈 모델 순위를 갱신해. LMSYS Chatbot Arena는 사람의 쌍대 선호를 사용해 단일 지표의 편향을 줄여. 어느 것도 자체 평가를 대체하지 않지만 서로 다른 각도에서 확인하는 데 좋아.