대부분의 작업에서 detail 은 품질을 무조건 올리는 설정이 아니라 필요한 시각 정보와 비용을 맞추는 설정이야. low 는 85 token 고정이고, high 는 이미지 크기에 따른 patch 수만큼 비용이 늘어. auto 는 모델이 골라서 batch eval 의 비용 예측을 어렵게 할 수 있어.
low 는 크기와 관계없이 85 token
사진에 무엇이 있는지 대략 파악하는 일반 UI 에는 low 로 충분한 경우가 많아. 빠르고 비용도 일정해.
high 는 patch 수에 따라 늘어
이미지를 32×32 patch 로 나눠 계산하므로 큰 이미지는 수천 token 을 쓸 수도 있어. OCR, 빽빽한 chart, 작은 세부 요소를 읽어야 할 때만 사용해.
비용을 재현해야 하면 auto 를 피해야 해
auto 는 모델이 low 와 high 중 하나를 고르는 편리한 기본값이야. 하지만 같은 종류의 입력에서도 비용이 달라질 수 있으므로 batch eval 처럼 예산을 비교할 때는 detail 을 명시해.