Responses 의 input 은 두 가지 형태를 받아. 단순한 문자열을 보낼 수도 있고, type 이 붙은 content part 를 담은 message 목록을 보낼 수도 있어. 한 번 묻고 끝나는 텍스트 요청에는 문자열을, multimodal 또는 여러 turn 에 걸친 요청에는 목록을 써.
문자열이면 충분한 경우
이미지도 대화 기록도 없는 단일 user prompt 라면 input="What is 2+2?" 만으로 충분해. 불필요한 구조 없이 의도가 바로 보여.
message 목록에는 content type 을 밝혀
이미지, 파일, 여러 turn, 세분화된 role 이 필요하면 message 목록을 사용해. input_text, input_image, input_file 로 각 content part 의 type 을 명시하므로 multimodal 요청 구조가 분명해져.
system 성격의 지시는 instructions= 로
input 목록에 system role 메시지를 넣어도 기존 호환 동작이 남아 있을 수 있지만, Responses 의 새 구조는 최상위 instructions= parameter 를 사용해. 새 코드에서는 지시와 입력을 분리해.
작업에 맞는 input 형태를 골라
단순한 질문에 긴 message 구조를 강제할 이유도 없고, multimodal 입력을 문자열 하나에 욱여넣을 수도 없어. 두 형태 중 필요한 표현력을 가장 간단하게 주는 쪽을 선택해.