피파 한 줄 정리: 왼쪽·오른쪽·뒤·앞 같은 공간 전치사는 cross-attention에서 약하게 연결돼. 텍스트만으로 정확한 배치를 통제하려 하면 거의 언제나 흔들려.
전화로 거실 배치를 설명했다고 생각해봐. 친구는 sofa·TV·lamp·rug를 모두 제대로 그렸지만 좌우와 앞뒤는 뒤섞었어. 이미지 모델도 사물은 잘 잡으면서 사물 사이의 관계를 놓쳐.
좌우가 뒤집히는 이유
“왼쪽 고양이, 오른쪽 개”에서 cat과 dog는 강한 개념이지만 left와 right는 시점에 따라 달라지는 상대 개념이야. Text encoder가 이를 약하게 표현하고 cross-attention도 단어를 정확한 좌표가 아닌 확률적 영역에 연결하므로 어느 쪽에 놓일지 동전 던지기처럼 될 수 있어.
의도: [🐱 왼쪽 | 🐶 오른쪽] 가능 결과: [🐶 왼쪽 | 🐱 오른쪽]
앞뒤와 정확한 건축 배치
“울타리 뒤의 사람”은 울타리가 사람 일부를 가리는 깊이 순서까지 알아야 해. 모델은 둘을 나란히 놓거나 울타리를 뒤로 보낼 수 있어. “2층 창문 정확히 네 개”는 개수와 공간 정밀도 문제를 한꺼번에 요구해 세 개·다섯 개·불규칙한 네 개가 되기 쉽지.
구조적인 한계
Cross-attention은 token을 잠재 이미지 영역에 부드러운 확률 분포로 대응시켜. 좌표가 표시된 canvas가 아니라 어느 쪽에 무엇이 있을지 살짝 미는 안개 같은 attention weight야. 정확한 배치에는 말보다 sketch·depth map·layout guide 같은 시각 제어가 필요해.
“파란 cube 뒤 초록 cylinder의 왼쪽에 붉은 ball”
“나무 탁자 위 붉은 ball, 파란 cube, 초록 cylinder의 still life, studio lighting”
- 좌우·앞뒤 같은 관계는 약하게 인코딩되어 자주 무시된다.
- Cross-attention은 텍스트를 정확한 좌표가 아니라 확률적 영역에 연결한다.
- 개수와 배치를 함께 요구하면 두 실패가 곱해진다.
- 정밀한 배치에는 말보다 sketch·depth map 같은 시각 제어를 써.