Background mode 와 reasoning effort 는 서로 다른 축을 조절해. background 는 요청을 제출하고 상태를 확인한 뒤 결과를 가져오는 전달 방식이고, reasoning effort 는 모델이 내부 추론에 쓸 token 양을 정해.
background=True 는 오래 걸리는 job 에 써
60 초 넘게 걸릴 수 있는 deep-research 호출은 background mode 가 알맞아. HTTP connection 을 끝까지 열어두는 대신 작업을 제출하고 상태를 polling 한 뒤 완료된 결과를 가져와. 즉시 대화가 필요한 chat 에는 맞지 않아.
reasoning_effort 는 비용과 바로 이어져
o-series 의 reasoning token 은 사용자에게 보이지 않지만 output 요율로 과금돼. 'high' 가 'low' 보다 5~10 배 많은 token 을 쓸 수도 있어. usage.reasoning_tokens 를 항상 기록해.
필요하면 두 설정을 함께 써
background=True 와 reasoning_effort='high' 를 함께 쓰면 몇 분 걸리는 깊은 조사 작업을 안정적으로 처리할 수 있어. 두 설정은 따로 쓸 수도 있으니 작업마다 품질과 비용이 균형을 이루는 지점을 찾아.