vision 모델은 이미지를 URL 또는 base64 로 받아. Responses API 에서는 input_image type 을, Chat Completions 에서는 image_url 을 사용해. 같은 픽셀과 detail 설정이라면 전달 방식이 달라도 비용은 같아.
이미 공개된 곳에 있다면 URL
이미지가 S3, R2, CDN 같은 공개 host 에 있다면 URL 이 간단해. request body 가 작고 모델이 URL 에서 직접 가져올 수 있어.
로컬이나 private 이미지라면 base64
로컬 개발 파일, 외부에서 접근할 수 없는 이미지, 방금 생성한 이미지는 base64.b64encode 로 encoding 하고 data:image/jpeg;base64,... URI 로 보내. 별도 공개 host 와 인증을 준비하지 않아도 돼.
detail 수준을 함께 정해
detail: 'low' | 'high' | 'auto' 중에서 골라. low 는 85 token 고정, high 는 32×32 patch 수에 따라 수백~수천 token 을 쓸 수 있고, auto 는 모델이 결정해. 대략적인 이미지 이해에는 low, OCR 이나 빽빽한 chart 에는 high 가 알맞아.