본문 바로가기
C.W.K.
Stream
Lesson 04 of 10 · published

원격 측정 — 운영에서 무엇을 잴까

~12 min · production, telemetry

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

모든 LLM 끝점에 필요한 세 화면

  • 건강 — 오류율, 거절률, p50·p95 지연 시간, 토큰 사용량, 호출당 비용을 보고 경고를 연결해.
  • 품질 — 평가 점수, 판정기가 표시한 출력, 불만 비율, 재생성 비율을 주마다 검토해.
  • 분기 — 어느 프롬프트 버전, 모델, 도구 경로가 어떤 요청을 처리했는지 보여 사고를 추적해.

특히 볼 지표

  • 스키마에 맞는 출력 검증 통과율.
  • 호출당이 아니라 해결된 요청당 토큰 비용.
  • 도구 호출 재시도율.
  • 추론 토큰 소비의 분포.
  • 프롬프트 버전별 p95 지연 시간.

당장 사람이 필요한 것만 경고해

비용 급증, 오류율, 검증 실패율처럼 지금 조치가 필요한 값에는 경고를 달고 나머지는 대시보드에 둬. 진짜 비상일 때만 사람을 깨워.

Code

요청별 지표 기록·python
metrics.timing("llm.latency_ms", elapsed_ms, tags=[f"prompt:{ver}", f"model:{model}"])
metrics.incr("llm.requests", tags=[f"prompt:{ver}", f"outcome:{outcome}"])
metrics.gauge("llm.input_tokens", usage.input_tokens, tags=[f"prompt:{ver}"])
metrics.gauge("llm.output_tokens", usage.output_tokens)
metrics.gauge("llm.thinking_tokens", usage.thinking_tokens or 0)

External links

Exercise

끝점 하나의 지표에 프롬프트 버전을 붙여봐. 버전별 통과율, 지연 시간, 비용을 보여주는 화면을 만들고 v_new 배포 때 갱신되는지 확인해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.