본문 바로가기
C.W.K.
Stream
Lesson 04 of 06 · published

에이전트도, 긴 컨텍스트도 새 아키텍처는 아니야

~10 min · agents, context, product

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

에이전트는 배선이 아니라 반복문이야

AI 에이전트는 관찰하고, 생각하고, 행동하고, 다시 관찰하는 반복문 안에 LLM을 넣은 시스템이야. LangChain, LangGraph, CrewAI, AutoGen, OpenAI Agents SDK, Claude Agent SDK는 표준 모델 호출 둘레에서 상태를 관리해. 매 회차는 잘 구성된 프롬프트와 평범한 모델 호출 하나이고, 모델은 자신이 에이전트 안에 있다는 사실을 따로 알지 못해.

짧은 오케스트레이션 코드로 만들 수 있어

에이전트 반복문을 수십 줄의 코드로 구현할 수 있다면 그 기능은 백본 아키텍처가 아니라 시스템 배관이야. 모델은 그대로고 바깥 코드가 상태와 행동을 이어 줘.

긴 컨텍스트도 보통 같은 백본 안의 확장이야

컨텍스트를 4K에서 128K나 1M 이상으로 늘릴 때는 다음 선택을 주로 써.

  • RoPE 주파수 스케일링: NTK 계열이나 YaRN으로 학습 범위 너머의 위치를 표현해.
  • 연속 학습: 새 위치 설정으로 긴 시퀀스를 더 학습해.
  • 어텐션 구현 개선: 긴 KV 캐시를 감당하도록 메모리와 커널을 다듬어.

트랜스포머 백본을 통째로 바꾸기보다 위치 인코딩과 학습 길이, 실행 구현을 조정하는 경우가 많아.

광고된 길이와 실제로 쓰는 길이는 달라

1M 토큰을 입력할 수 있다고 1M 전체에서 정보를 똑같이 잘 꺼내는 건 아니야. Needle in a Haystack, MECW, RULER 같은 평가는 광고 한계보다 훨씬 이른 지점에서 성능이 떨어지는 모델을 보여줘. 숫자는 받아들일 수 있는 용량이지 회상 능력의 보증서가 아니야.

가중치 안과 밖을 나눠

에이전트, RAG, 안전장치, 시스템 프롬프트처럼 고정된 모델을 소프트웨어로 감싸는 기능은 제품 계층에 있어. 긴 컨텍스트는 주로 위치 인코딩과 학습의 변화야. 네트워크의 뼈대는 가중치 파일에 있고 나머지는 그 주위를 둘러싼 시스템이야.

Code

스물다섯 줄짜리 에이전트: 모델은 그대로·python
def agent_loop(goal, llm, tools, max_steps=20):
    history = [{"role": "system", "content": f"You are an agent. Goal: {goal}"}]
    for step in range(max_steps):
        response = llm.generate(history)
        history.append({"role": "assistant", "content": response})
        if "FINAL_ANSWER" in response:
            return response
        tool_call = parse_tool_call(response)
        if tool_call is None:
            continue
        result = tools[tool_call["name"]](**tool_call["args"])
        history.append({"role": "tool", "content": str(result)})
    return "STOPPED: max_steps reached"
RoPE 주파수 스케일링: 긴 컨텍스트 기법·python
# Standard RoPE (training-time)
def rope_freqs(d_model, base=10000.0):
    return base ** (-torch.arange(0, d_model, 2) / d_model)

# YaRN-style scaling for extension
def yarn_scaled_freqs(d_model, base=10000.0, scale=4.0):
    return base ** (-torch.arange(0, d_model, 2) / d_model) / scale
# Position encoding adjustment, no architectural change.

External links

Exercise

비슷한 컨텍스트 길이를 내세우는 두 모델에 같은 장문 과제를 줘. 예를 들어 100K 토큰 문서의 뒤쪽에 숨긴 사실을 찾게 해. 결과를 비교하고, 차이가 입력 한계보다 긴 문맥 회상을 얼마나 잘 학습했는지에서 나오는지 살펴봐.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.