Text, Bilder, Video und Audio kombinieren
Text beschreibt das gewünschte Ergebnis, Bilder definieren Person, Produkt oder Stil, Video zeigt Bewegung und Kamerarhythmus, und Audio gibt Sprache, Musik oder Atmosphäre vor. Eine klare Aufgabe pro Eingabe reduziert Missverständnisse und macht die erste Generation leichter steuerbar.
