피파 한 줄 정리: “masterpiece, 8k, ultra-detailed”는 SD 1.5 시대에는 실제 신호였어. FLUX·Midjourney·DALL-E 3에서는 token 낭비거나 결과를 평범하게 만들 수 있어. 원하는 세부를 직접 써.
“masterpiece, best quality, ultra-detailed, 8k, cinematic, award-winning” 같은 품질 tag는 2022~2023년 Stable Diffusion 1.5 시대에 생겼어. 당시 학습 자료에는 “masterpiece”, “best quality”, “low quality” 같은 품질 꼬리표가 실제로 있었고, 긍정 tag와 negative prompt가 결과의 마감 수준을 바꿨어. 마법의 단어가 아니라 학습 데이터에 있던 진짜 신호였던 거야.
현대 모델에서는 왜 약해질까
“창턱 위 고양이, masterpiece, best quality, ultra-detailed, 8k, sharp focus, professional, award-winning”
“햇빛 드는 창턱에 몸을 말고 누운 tabby, 낡은 나무 마루에 길게 떨어진 오후 그림자, 창가의 허브 화분, 35mm Portra 400 film, 부드러운 자연색”
- SD 1.5·fine-tune: 품질 label로 학습했으므로 여전히 써.
- SDXL: 일부 품질 caption을 학습해 약간 도움이 될 수 있어.
- 품질 점수 자료로 명시적으로 학습한 모델: model card를 확인해.
- FLUX: token을 낭비하고 구체적인 시선보다 ‘평균적으로 좋은 이미지’ 쪽으로 밀어 평범해질 수 있어.
- Midjourney: 이미 미적 품질을 기본으로 최적화해 품질 tag가 잡음을 더해.
- DALL-E 3: GPT가 프롬프트를 다시 쓰므로 tag가 바뀌거나 사라져.
“A dragon, masterpiece, best quality, cinematic, ultra-detailed, 8k, epic, stunning, breathtaking”
“무너지는 성탑 위 거대한 dragon, 비늘에 걸린 마지막 노을, 콧구멍에서 말려 나오는 연기, 뒤로 모이는 먹구름, Greg Rutkowski풍 dark fantasy illustration”
비늘의 빛, 연기, 먹구름, 화풍처럼 눈에 보이는 목표가 “좋게 만들어”보다 훨씬 강한 품질 지시야.
- 품질 tag는 SD 1.5 학습 자료에서 실제 신호였기 때문에 그 모델에는 효과가 있었다.
- FLUX·Midjourney·DALL-E 3는 기본 품질이 높아 tag의 이득이 작거나 없다.
- 막연한 품질 단어를 원하는 세부의 구체적인 묘사로 바꿔.
- 모델이 품질 label로 학습했는지 model card를 확인해.