본문 바로가기
C.W.K.
Stream
Lesson 07 of 10 · published

매체 차이 — 이미지, 오디오, 파일

~14 min · providers, multimodal

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

텍스트 밖의 입력

요즘 프롬프트에는 이미지, 오디오, 파일이 자주 들어가고 연결 방식은 제공업체마다 크게 달라.

이미지

  • Anthropic — base64나 URL 이미지를 content block으로 넣어.
  • OpenAI — image_url 자료형을 쓰며 이미지 이해가 gpt-5.5 같은 여러 매체 모델에 들어 있어.
  • Gemini — mime_type이 있는 inline_data를 쓰고 계열 전체가 여러 매체를 기본 지원해.

오디오

  • OpenAI — 받아쓰기는 Whisper, 실시간 음성은 Realtime API를 써.
  • Gemini — 오디오를 요청 안에서 바로 이해해.
  • Anthropic — 2026년 공개 모델 대부분은 텍스트 중심이라 별도 받아쓰기와 짝지어.

파일

  • Anthropic — Files API에 한 번 올리고 ID로 가리켜.
  • OpenAI — Files API와 Assistants 첨부를 써.
  • Gemini — 큰 매체에는 Files API를 써.

프롬프트에서도 대상을 또렷이 가리켜

“두 번째 이미지”, “그림 3의 차트”처럼 어느 자료를 말하는지 분명히 적어. 이미지 토큰은 텍스트와 요금 방식이 다르므로 따로 추적해.

Code

이미지 콘텐츠 (Claude, OpenAI, Gemini)·python
# Claude
client.messages.create(model="claude-opus-4-7", messages=[
    {"role": "user", "content": [
        {"type": "image", "source": {"type": "base64", "media_type": "image/png", "data": b64}},
        {"type": "text", "text": "What's in this chart?"}
    ]}
])

# OpenAI
client.chat.completions.create(model="gpt-5.5", messages=[
    {"role": "user", "content": [
        {"type": "image_url", "image_url": {"url": data_url}},
        {"type": "text", "text": "What's in this chart?"}
    ]}
])

# Gemini
model.generate_content(["What's in this chart?", {"mime_type": "image/png", "data": img_bytes}])

External links

Exercise

같은 이미지 작업을 두 제공업체에 만들어봐. 이미지당 토큰, 지연 시간, 정확도를 재고 프롬프트에서 이미지를 가리키는 방식의 차이를 적어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.