피파 한 줄 정리: 모델은 글자를 철자하지 않고 글자처럼 보이는 픽셀을 예측해. 짧고 흔한 단어는 잘 되지만 길고 낯선 문장은 쉽게 깨져.
멀리서 흐릿한 책 사진만 보고 모든 단어를 배운 spelling bee 참가자를 상상해봐. 단어의 윤곽은 알아도 alphabet 규칙은 몰라서 RESTAURANT를 RESTUARNT처럼 그럴듯하지만 틀리게 쓸 거야. 초기 이미지 생성기도 간판의 굵은 글자와 책 표지의 serif 모양은 배웠지만 철자 체계는 익히지 못했어.
Token에서 픽셀까지의 간극
“OPEN이라고 쓴 coffee shop 간판”의 OPEN은 text encoder에서 개방·영업·환영의 의미로 처리돼. 하지만 간판에 O-P-E-N을 정확히 놓는 일은 개별 glyph의 공간 배치를 요구해. 추상 의미 공간에서 정확한 픽셀 공간으로 건너가야 하는 거야.
Text Prompt Latent Space Pixels “OPEN”(tokens) → 개방·간판의 흐릿한 패턴 → O P E N(바라건대) 추상 의미 통계적 근사 정확한 glyph
구름은 모양이 조금 달라도 구름이지만 글자는 오차를 허용하지 않아. COFFE SHPO는 coffee shop이 아니야.
새 모델이 좋아진 방법
- DALL-E 3·Ideogram·Flux는 이미지 안 글자를 따로 학습하는 전용 경로를 더했어.
- 간판·poster·책 표지처럼 선명한 글자가 있는 자료를 더 잘 골라 학습했어.
- T5-XXL 같은 긴 encoder가 CLIP보다 개별 문자를 정밀하게 나타내.
- 일부 구조는 단어 token뿐 아니라 문자 단위까지 처리해 철자 정확도를 높여.
❌ 약한 요청
“모든 세부가 적힌 jazz festival poster”
✅ 나은 요청
“JAZZ NIGHT라는 굵은 글자의 vintage jazz poster, 따뜻한 orange, art deco, 글자는 최소한”
핵심 정리
- 글자 오류는 모델이 철자보다 픽셀 패턴을 예측하기 때문에 생긴다.
- 짧고 흔한 단어가 가장 안정적이고 길거나 드문 글은 불안정하다.
- 새 모델은 전용 글자 경로와 강한 encoder로 크게 좋아졌다.
- 정확성이 필요하면 이미지는 생성하고 글자는 후반 작업에서 넣어.