일회성 분석은 document 블록이 간단해
PDF를 document 콘텐츠 블록으로 보내면 Claude가 텍스트와 표·그림 같은 시각 요소를 함께 읽어. 계약서나 논문, 설명서 한 권을 한 번 분석하는 작업에는 별도 전처리 없이 가장 마찰이 적은 길이야.
반복해서 쓸 문서는 Files API로
같은 PDF를 여러 턴 참조한다면 한 번 업로드해 file_id를 받고 다음 호출부터 ID로 불러와. 전송량과 지연을 줄이는 대신 업로드 상태와 오래된 파일 정리 책임이 생겨. 자산의 수명 주기를 함께 설계해야 해.
스캔 문서는 OCR 예비 경로를 둬
문자로 만들어진 PDF는 기본 읽기가 잘 되지만 오래된 스캔 문서는 텍스트 추출이 실패할 수 있어. Tesseract나 관리형 OCR로 먼저 처리하거나, 배치 자체가 중요하면 페이지를 이미지 블록으로 보내. 입력 문서의 성격을 검사해 경로를 바꾸는 게 안전해.
원칙: 한 번 읽기는 기본 PDF, 반복 자산은 Files API, 종이 스캔은 OCR 예비 경로로 나눠.