피파 한 줄 정리: 그럴듯해 보인다는 건 맞다는 뜻이 아니야. 숫자가 13개인 시계나 존재하지 않는 분자식도 첫눈에는 멀쩡할 수 있어.
머릿속 모형: 촬영용 병원 세트를 떠올려 봐. 카메라 앞에서는 흰 벽, 삐 소리를 내는 모니터, 수술복을 입은 의사까지 완벽한 병원처럼 보이지만, 벽 뒤에는 합판과 테이프와 노출된 전선이 있어. 이미지 생성기도 실제 건물을 짓기보다 정해진 각도에서 설득력 있는 세트를 만드는 쪽에 가깝다. 결과는 옳도록 최적화된 게 아니라 그럴듯해 보이도록 최적화돼 있어.
그럴듯함의 함정
확산 모델은 학습 데이터 분포에 들어 있을 법한 이미지를 만들어 내도록 훈련된다. 그래서 모델이 푸는 문제는 “이 장면이 사진이나 그림으로 존재할 법한가?”이지 “사실·해부학·물리·논리 면에서 맞는가?”가 아니다. 둘의 차이는 다음처럼 눈에 잘 띄지 않는 오류를 만든다.
- 아름다운 시계인데 숫자가 13개다.
- 전문가가 그린 듯한 화학 도표인데 분자 구조는 말이 안 된다.
- 진짜 지도처럼 보이지만 지형은 허구다.
- 출간된 책 표지처럼 보이지만 글자는 의미 없는 낙서다.
- 사진 같은 인물인데 손가락이 여섯 개거나, 양쪽 귀가 다르거나, 옷깃이 물리 법칙을 거스른다.
첫인상만으로 승인하면 위험한 이유
사람은 장면의 분위기와 구도를 먼저 보고, 그다음 사물과 얼굴을, 마지막에 글자·손가락·대칭 같은 미세 구조를 본다. 생성 이미지는 첫 단계인 전체 인상에 특히 강해서 작은 화면으로 스쳐 볼 때는 훌륭하다. 하지만 원본 크기로 확대하고 멈춰 살피면 균열이 드러난다. ‘썸네일 테스트’를 통과했다는 사실은 검사 시작점일 뿐 승인 근거가 아니다.
두 종류의 정확성
- 지각적 정확성: 빠르게 봤을 때 색, 질감, 조명, 구도가 자연스럽다. 생성 이미지 대부분이 이 단계는 잘 통과한다.
- 의미적 정확성: 내용이 사실·구조·논리에 맞다. 손가락은 다섯 개이고, 철자는 맞으며, 그림자와 물리가 일관된다.
생성 실패는 대개 이 둘 사이에 숨어 있다. 눈에는 합격하지만 생각해 보면 틀린 이미지인 셈이다.
핵심 정리
- 모델은 실제 정확성보다 학습 분포 안에서의 그럴듯함을 우선한다.
- 작은 화면에서 좋아 보여도 원본 해상도 검사를 통과한 것은 아니다.
- 지각적으로 자연스러운지와 의미적으로 옳은지를 따로 판단해야 한다.
- 전문 용도로 내보내기 전에는 반드시 전체 크기로 검사한다.
- 반복 가능한 확대 점검표를 만들어 흔한 오류를 빠르게 잡는다.