생성 parameter 는 한 번에 하나씩 바꿔. temperature 와 top_p 는 둘 다 출력의 무작위성에 영향을 줘서 동시에 움직이면 무엇 때문에 결과가 달라졌는지 알 수 없어. 한쪽은 고정하고 다른 쪽만 여러 값으로 시험해.
seed 는 재현을 돕지만 보장하지 않아
같은 seed, 같은 모델 snapshot, 같은 parameter 를 쓰면 결과가 거의 같아질 수 있어. 하지만 완전히 같은 출력을 보장하는 계약은 아니야. 테스트 결과를 좀 더 안정시키는 수단으로만 써.
max_completion_tokens 를 써
Responses 와 새 Chat Completions 에서는 max_tokens 가 점차 사라지고 있어. 새 코드에는 max_completion_tokens 를 써. 예전 이름을 그대로 둔 코드는 o-series 에서 기대와 다르게 동작할 수 있어.
reasoning_effort 는 o-series 의 추론 예산이야
reasoning_effort='high' 는 모델이 내부 추론에 더 많은 token 을 쓰게 해서 어려운 문제에 도움이 될 수 있지만 비용과 지연도 커져. 'low' 는 빠르고 저렴한 대신 복잡한 추론에서 성능이 떨어질 수 있어. 작업별로 품질과 비용이 균형을 이루는 지점을 찾아.