피파 한 줄 정리: 고무 같은 몸, 녹는 물체, 표류, 순간이동, 물리 위반은 모델이 걷는 모습은 배웠지만 관절과 힘의 규칙은 갖고 있지 않아서 생겨.
머릿속 모형: 애니메이션을 배운 적 없는 사람이 장당 2초만 써서 걷는 사람의 서른 프레임을 그린다고 해 보자. 처음은 괜찮아도 다리가 늘어나고 팔의 박자가 어긋나며 머리가 이상하게 튀다가 고무 인간이 된다. 모델도 움직임의 전체 인상은 알지만 자연스러운 움직임을 지배하는 물리 규칙을 계속 유지하지 못할 수 있다.
흔한 움직임 실패
- 고무 몸 효과: 뼈대의 관절 한계를 모르고 핵심 자세 사이를 보간해 팔과 다리가 탄성처럼 늘고 줄어든다.
- 물체 녹음: 프레임이 흐르며 단단한 물체의 형태와 경계가 약해져 배경과 섞인다.
- 표류: 서 있는 사람이 왼쪽으로 밀리거나 탁자 위 꽃병이 가장자리로 이동하는 등 공간 기준이 서서히 풀린다.
- 순간이동: 대상을 놓친 모델이 다른 위치에 다시 만들어 팔다리나 물체가 한 프레임 사이에 튄다.
- 물리 위반: 머리카락이 위로 떨어지고, 천이 뜨며, 물이 거꾸로 흐르고, 던진 물체가 공중에서 멈춘다.
자연스러운 움직임: 프레임 1 프레임 2 프레임 3 프레임 4 프레임 5 🚶 🚶 🚶 🚶 🚶 (부드러운 보폭, 안정된 비율과 속도) 생성 움직임 실패: 프레임 1 프레임 2 프레임 3 프레임 4 프레임 5 🚶 🧍♂️ 🚶 🏃 🧟 (정상) (갑자기 멈춤) (복귀) (속도 변화) (고무 팔다리)
외형보다 움직임이 어려운 이유
모델은 영상에서 프레임 사이 픽셀 변화로 움직임을 암묵적으로 학습한다. 속도, 가속도, 힘을 명시적으로 계산하는 물리 엔진도 없고, 다리 관절의 가동 범위나 운동량 보존을 직접 이해하는 것도 아니다. 걷기가 어떤 픽셀 무늬로 보이는지는 알지만 왜 그렇게 움직여야 하는지는 모르는 셈이야.
4트랙의 손 문제를 시간 축으로 늘인 것과 비슷하다. 앞 프레임의 작은 불확실성이 다음 프레임에 더해져 큰 흔적으로 쌓인다.
안정성을 높이는 조건
- 단순하고 예측 가능한 움직임: 느린 고개 돌리기, 부드러운 걷기, 정적인 자세와 바람·물 같은 환경 움직임.
- 이미지-투-비디오 기준점: 강한 첫 프레임으로 가능한 움직임의 범위를 줄인다.
- 2–4초의 짧은 클립: 표류가 커지기 전에 샷을 끝낸다.
- 고정 카메라: 카메라 이동이라는 변수를 제거해 모델의 부담을 줄인다.
핵심 정리
- 움직임 실패는 고무 몸, 녹는 물체, 표류, 순간이동, 물리 위반으로 보인다.
- 모델은 움직임의 픽셀 패턴을 배우지만 뼈대나 힘을 시뮬레이션하지 않는다.
- 작은 오차가 프레임마다 누적되므로 긴 클립이 더 불안정하다.
- 단순한 움직임, 강한 첫 프레임, 짧은 클립이 흔적을 줄인다.