[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

22min hat es gedauert:

 
Kannst du jetzt bitte noch ein Spaghetti-Schmatz-EssenBeimReden-Klecker-Video machen? 👉👈 Ich krieg's einfach nicht hin...



Noch eine allgemeine technische Frage: Sind die Audiospuren eigentlich komplett separat und könnten theoretisch von einem ganz anderen Modell gemacht werden? Ich frage mich nur, ob es da nicht viel bessere Modelle geben müsste. Weil der rendert bei mir 45 Minuten für 5 Sekunden, aber die Audiospur in weniger als 1 Minute (das meiste der Zeit ist nur Modell laden)... oder ist die Audiospur so untrennbar mit den Tensoren, die aus dem Videomodell kommen, verbunden? Weil den Ton finde ich schon immer noch sehr optimierungsbedürftig... der klingt nach wie vor sehr AI-mäßig... (das ist ja hier voll der crunch sound, der bei Spaghetti überhaupt keinen Sinn ergibt)
 
Was denkt ihr, wo ist bei MiniMax eher das Nadelöhr mit meiner Hardware. Bei der länge oder Auflösung.
Mal vom Speicherproblem abgesehen, macht das Modell auch immer mehr Fehler wie die anderen bei mehr als 30s?
0,4 Megapixel und 10s scheint kein Problem zu sein, dauert aber auch schon fast 8 minuten. Alles darüber hinaus ist schwieriger und langwieriger zu testen. Deshalb frag ich hier erst mal so rum!🤔
Bei 1 megapixel und 10s schwitzt der schon gute 40 minuten mit demselben Prompt.

Wäre es sinnvoll erst mal mit niedriger Auflösung zu arbeiten und später das längere Video stückchenweise upscalen? 🤔

Edit:
2 MP und 10s = not enough GPU memory
2 MP und 5s geht auch durch mit 42 minuten

Ich schätze mal ohne viel trickserei sind längere Clips nicht drinn. Von der Kontinuität mal an abgesehen.
Da müsste man viel mehr mit Referenzmaterial oder LoRa's arbeiten.
Zb scheint bei mir der Protagonist öfters das gebiss zu wechseln weil auf dem referenzbild nur mit geschlossenem Mund zu sehen.
 
Zuletzt bearbeitet:
Ich hätte auch noch eine Frage: Habt ihr auch, dass Iterationen sehr stark variieren von der Länge her? Im selben Lauf wechselt das von 100 bis 900 Sekunden pro "step"..... liegt bei mir bestimmt an wenig RAM/VRAM (32 / 8) ...
 
samuelclemens schrieb:
Was denkt ihr, wo ist bei MiniMax eher das Nadelöhr mit meiner Hardware. Bei der länge oder Auflösung.
Mal vom Speicherproblem abgesehen, macht das Modell auch immer mehr Fehler wie die anderen bei mehr als 30s?
0,4 Megapixel und 10s scheint kein Problem zu sein, dauert aber auch schon fast 8 minuten. Alles darüber hinaus ist schwieriger und langwieriger zu testen. Deshalb frag ich hier erst mal so rum!🤔
Bei 1 megapixel und 10s schwitzt der schon gute 40 minuten mit demselben Prompt.

Wäre es sinnvoll erst mal mit niedriger Auflösung zu arbeiten und später das längere Video stückchenweise upscalen? 🤔

Edit:
2 MP und 10s = not enough GPU memory

schon ein nvfp4 model probiert und Sage Attention eingebaut im Workflow?
Und nimm unter 1mp. 2.0mp ist overkill.

Ich teste hier gerade REF2Video mit 0.5mp mit meiner 5090 und einen nvfp4 Model. Knapp 26GB VRAM verbrauch bei 10sekunden Videoclip länge. Bin gespannt wie es wird.
 
Zuletzt bearbeitet:
@blubberbirne Müsste in den beiden workflow templates zu MiniMax H3 mit referenzbild in comfy mit drin sein wenn ich das richtig verstehe.

1785872557338.png


Aber jetzt mach ich für heute erstmal schluss.
 
Zuletzt bearbeitet:
Nein, das Diffusion Model ist int8 convrot.
 
blubberbirne schrieb:
Bin gespannt wie es wird.
Ich hoffe doch, es ist mein lang ersehntes Spaghetti-Mampf-Klecker-Video?
 
Ja da bin ich auch dran. Baue mir da gerade etwas eigenes zusammen :D

Noch nicht ganz perfekt. Aber hey, es ist erst mein 5 MiniMax Video :daumen:

 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: WoisthierdasKlo
Ich frage mich ja schon den ganzen Tag: Wer hält denn die Gabel so komisch beim Spaghetti essen eigentlich? :D Vielleicht muss man im Prompt nochmal ganz exakt erklären, wie die Bewegungsabläufe eines echten Menschen beim Spaghetti essen sind... 🤔
Kleiner Side Note um diese Uhrzeit: Dieses Modell scheint nicht zensiert zu sein.... macht mit der Info was ihr wollt...
 
Wie bekommt ihr eigentlich die Stimme als Referenz da rein?
Ich kann leider noch nicht genug um das teplate Workflow so speziell abzuändern.
 
@samuelclemens Die Referenz Stimme bekommst Du über den REF2VID Workflow da rein ;)
 
Ich bin ja selbst erst seit ein paar Tagen mit ComfyUI/lokalen Modellen am Spielen und stelle gerade fest, wie stark und nichtlinear die Performance von Videolänge und -auflösung abhängt:
Gleicher Prompt:
Zeit [in s]Auflösung [in MP]grobe Dauer pro step [in s/it]Anmerkungen
10.12eignet sich natürlich extrem gut, um eine grobe Vorschau von einer Szenerie zu kriegen
10.415
11.075höhere Auflösung hat, zumindest bei der Videolänge, nicht dazu beigetragen, dass die Gesichter / Augen besser aussehen*
50.4100-900**stark variabel, bisher keine Regelmäßigkeit festgestellt
15+0.4OOM-Error
200.1210-1520**extremer AI slop mit komischen farbtupfern und anderen artefakten
[Tabelle wird laufend aktualisiert...]

Diese zeitlichen Ausreißer scheinen allesamt das Gesamtergebnis zu verschlechtern.
____________________
* Minimax H3 hat momentan noch das bekannte Problem mit Augen/Gesichtern bei geringen Auflösungen (und anscheinend auch bei hohen Auflösungen kombiniert mit kurzer Videolänge)
** anscheinend treten die hohen Sprünge bei den step-Dauern immer um den zehnten Iterationsschritt herum auf...
 
Zuletzt bearbeitet:
Zurück
Oben