본문 바로가기
C.W.K.
Stream
Lesson 06 of 07 · published

Inspect AI: 에이전트 및 안전성 평가

~18 min · frameworks, inspect-ai, agents, safety

Level 0추측자
0 XP0/55 lessons0/10 achievements
0/150 XP to next level150 XP to go0% complete

영국 AISI의 에이전트 및 안전성 평가 프레임워크

Inspect AI는 영국 AI 안전 연구소(AISI)가 만든 오픈 소스 프레임워크로, LLM 에이전트와 안전성 속성을 평가하도록 설계됐어. 도구 사용, 다단계 추론, 적대적 시나리오가 포함된 과제를 전제로 만들어져 안전성 중심 조직에서 널리 채택하고 있어.

특히 잘하는 일

  • 에이전트 평가 — 도구 사용과 격리 환경을 지원하고, 상태를 유지하며 수행하는 과제도 다룰 수 있어.
  • 안전성 평가 — 역량 평가, 위험 역량 평가, 레드팀 평가에 쓸 수 있는 패턴이 내장돼 있어.
  • 재현성 — 모든 평가 실행을 스크립트로 완전히 정의해 같은 조건으로 다시 실행할 수 있어.
  • 멀티모달 — 텍스트, 이미지, 도구 출력을 지원해.
  • 제공업체 독립성 — OpenAI, Anthropic, Google, 로컬 모델을 모두 지원해.

가장 빛나는 상황

에이전트가 도구를 사용하고, 정보를 탐색하고, 코드를 실행하고, 여러 단계로 계획하는 능력을 평가한다면 Inspect AI가 잘 맞아. 다른 프레임워크는 에이전트 지원을 나중에 덧붙인 경우가 많지만, Inspect AI는 이를 처음부터 기본 전제로 삼았어.

잘 맞지 않는 상황

단순한 프롬프트-응답 평가에는 다소 과한 선택이야. 이런 경우에는 promptfoo나 DeepEval이 더 가벼워.

원칙: 평가에 도구 사용, 코드 실행, 다단계 계획이 포함된다면 Inspect AI를 선택해. 단순한 프롬프트-응답 평가라면 더 가벼운 도구를 선택해.

Code

설치와 최소 과제·python
# pip install inspect-ai
from inspect_ai import Task, eval, task
from inspect_ai.dataset import Sample
from inspect_ai.scorer import includes
from inspect_ai.solver import generate

@task
def country_capitals():
    return Task(
        dataset=[
            Sample(input="What is the capital of France?", target="Paris"),
            Sample(input="What is the capital of Japan?", target="Tokyo"),
        ],
        solver=generate(),
        scorer=includes(),
    )

# Run from CLI: inspect eval my_eval.py --model openai/gpt-4o-mini
도구를 사용하는 에이전트 과제·python
from inspect_ai.solver import use_tools, generate
from inspect_ai.tool import bash, python

@task
def code_task():
    return Task(
        dataset=[Sample(
            input="Find all .py files modified in the last 7 days, return count.",
            target="42",
        )],
        solver=[
            use_tools([bash(), python()]),
            generate(),
        ],
        scorer=includes(),
        sandbox="docker",  # tools run in a sandbox
    )

External links

Exercise

제품에 에이전트나 도구 사용 흐름이 있다면 Inspect AI로 해당 흐름을 평가하는 과제를 작성해. 격리 환경을 사용하고, 평가 프레임워크 없이 같은 에이전트를 실행한 결과와 비교해 봐. Inspect가 구조화해 기록한 실행 과정 덕분에 실패 원인을 훨씬 쉽게 읽을 수 있을 거야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.