생성은 다음 토큰 예측의 반복이야
인과 언어 모델은 지금까지 주어진 내용으로 다음 토큰을 예측해. generate()는 토큰 예측 → 결과 붙이기 → 길어진 시퀀스 다시 입력하기를 max_length나 텍스트 종료 토큰까지 반복해. GemmaCausalLM.from_preset(...)으로 생성기를 불러오고 프롬프트 문자열을 넣으면 완성된 문자열을 받을 수 있어.
출력의 성격은 샘플러가 결정해
모델의 원시 출력은 매 단계에서 전체 어휘에 대한 확률 분포야. 그 분포에서 토큰을 고르는 샘플러가 결과의 성격을 크게 바꿔. temperature는 분포를 날카롭거나 평평하게 해. 0에 가까우면 가장 확률 높은 토큰을 반복해 결정론적이고 안전하지만 단조로울 수 있고, 1.0에 가까우면 낮은 확률의 토큰에도 기회를 줘 창의적이지만 산만할 수 있어. top_k는 상위 k개 후보만 남기고, 핵 샘플링인 top_p는 누적 확률 질량 p를 채우는 후보만 유지해. 샘플러는 compile()에 전달하거나 generate() 기본값을 쓸 수 있어. 운영 환경에서는 보통 temperature=0.7, top_p=0.9에서 조정을 시작해.