Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)
Bei SwarmUI wäre beim GridGenerator (unten unter Tools), mit der Option "just images" möglich einfach unendlich viele Bilder mit Prompt a-z zu erzeugen, die werden dann nacheinander erstellt. Bei comfyUI gibts evtl (ich nehme es eigtl an) auch ne Option, dass wie bei einem random seed aus einer Liste Prompts genommen werden (also eine Node nach einem durchlauf auf den nächsten Prompt geht). Dann stellst du einfach die Batch Size oben hoch auf 100 oder was auch immer und dann müsste es ohne RAM Probleme durchgehen. (Ansonsten gibts Ram/VRam Cleanup Nodes, die auch bei diesem Minimax WF geladen werden, scheinen Standard Nodes in Comfyui zu sein, kann man an den letzten Bild/Video Output im WF anhängen und dann wird am Ende eines Durchgangs alles geleert):
Ist es in ComfyUI eigentlich möglich auf codingebene direkt komplexere programmabläufe zu bauen. So richtig mit Funktionen, Schleifen, Variablen, Bedingungen usw..!?🤔
Was hast du alles als Referenzen genommen? Charaktere und Orte und noch mehr? Hast Du aus dem Kontrollraum (Beam-Raum) rausgebeamt (2 shots) ? das ist auf jedenfall lustig als Idee Leute wohin beamen, teste ich heute Abend oder so auch mal ^^
btw: Der Sage Attention Patch in dem H3 Easy Workflow hat nen starken Effekt auch auf die Geschwindigkeit 98s für 5sek 720p mit Patch (er_sde sampler) vs 141s ohne Patch. (res_multistep 89s vs 146s).
Das hier muss ich unbedingt noch hier lassen ein zusammenhängendes Musik-Video erstellt mit H3, einem zuvor erstellten Song und 2 Referenzbildern:
Ne, relativ stumpf: Ich wollte eh testen, was das Ding kennt. Kirk und Pille waren... nicht getroffen aber Spock war 1a. Die habe ich ohne Referenz rein gehauen. Referenz war ein Video (Flug auf unseren Eingangsbereich zu).
Der Sage Attention Patch in dem H3 Easy Workflow hat nen starken Effekt auch auf die Geschwindigkeit 98s für 5sek 720p mit Patch (er_sde sampler) vs 141s ohne Patch.
Genau wegen dem teil wollte der Workflow bei mir nicht komplett laufen. ChatGPT hat mich über ne Stunde lang durch den Kaninchenbau gejagt. Irgendwas wegen der Blackwell Architektur meiner 5070TI.
Hab einfach wie damals in der Schule ab nem gewissen Punkt einfach auf durchzug gaschaltet und brav nur die anweisungen befolgt.
Scheint jetzt iwie zu laufen. Aber ich könnts nicht wiederholen! 👨🏫...😵
Allerdings hab ich das pruned Modell statt den im beigelegten Workflow eingestellten convrot Modell.
Eine wesentliche Leistungssteigerung sehe ich mit meinem Test dem ALF Video allerdings nicht.
Von etwa 8 auf 6 minuten für 5s.
Wäre interessant ob sich die leitungsverbesserung in der Länge und Qualität mehr bemerkbar macht. Also ob sie linear oder exponentiell ist. 🤔
Edit: Das Convrot Modell hat jetzt knapp 7 Minuten gebraucht. Qualitätsverbesserungen konnte ich nciht feststellen. Allerdings ist das Testvideo nicht das anspruchsvollste! 🤔
Triton und sage attention in der comfyui Umgebung zu installieren ist schon immer etwas umständlich gewesen, es gibt auch Tools, die einem die meiste Arbeit abnehmen, aber ich kenne das ^^
Du hast immerhin eine Steigerung von ca 25% wenn es von 8 auf 6 Minuten gefallen ist.
Wenn fp8 bei dir schneller ist, dann kannst du ja dabei bleiben, wenn die Qualität sich nicht unterscheidet. (Modell natürlich pruned, ist std. für consumer Karten) Modelle.
Hast Du Cuda13 laufen? Habe schon öfter gelesen, dass Minimax damit besser performt.
Ja. Ich Versuche alle Bestandteile des Setups immer aktuell zu halten. ChatGPT ist dabei erstaunlich hilfreich.
Es fasst am Ende sogar noch das wichtigste schnell zusammen wenn es merkt das meine free Tokens zur Neige gehen und ich mitten in ner kritischen Phase bin.👍
Allerdings ist der beigefügte Workflow bei Easy nicht so leicht anpassbar wie der letzte wo ich die Audioreferenz mit drin habe.
Da muss ich mich etwas mehr Reinfuchsen.
Aber so oder so. Mit Easy ist bei mir auch keine 30s möglich. Zumindest nicht ohne Augenkrebs auf sehr niedriger auflösung.
Das äuserste war noch 5s mit 1080p.
10s bei 1080p musste ich nach ner Stunde abbrechen weil sich der Fortschrittsbalken kaum vorwärts bewegte.
Interessieren würden mich derzeit aber eher Workflows um vorhandene Videos inhaltlich zu manipulieren.
Insbesondere solche wo man auch start und endframe bestimmen kann um das Material dann nahtlos in ein bestehendes längere Video zu integrieren.
Damit könnte man dann auch fehlerhafte stellen in ansonsten guten Ergebnissen reparieren.
Diese Dinge sind mitten in der Entwicklung ^^ Ich würde an Deiner Stelle auch ein Konzept verfolgen, das 3-5 sek maximale Clips erstellt und diese zusammenfügt, das dauert sonst viel zu lange und wenn es ja mal funktioniert, ist das eh besser, wenn Du dann auch noch über einzelne Teile Kontrolle hast. Da würde ich mal schauen, bei dem, wie gesagt und auch interessant (ebenfalls im Aufbau): https://github.com/ethanfel/ComfyUI-MiniMaxH3-Contex-Loop
Start und Endframe festlegen geht bei dem easy wf ganz einfach durch anhängen der Bilder im Modus "I2V or First Frame / Last Frame", die werden automatisch genommen als 1. und optional letztes, wobei man in advanced noch auswählen kann, welches Priorität hat. (natürlich kann man aber rein damit nur bedingt ein zusammenhängendes Video erstellen, dafür sind eher die obigen Ansätze gedacht.)
@MechanimaL Kannst mir auch verraten wie man einfach eine audio node in den Workflow einbindet wie in dem anderen MiniMax Workflow?
Das mit dem first/last Frame klappt übrigens super. Eine tolle zusätzliche Kontrollmöglichkeit über den inhalt.
Entferne ich zb Willie aus dem letzten Frame, arbeitet die KI den Inhalt so um das dieser nach links aus dem Bild geht.👍
Toll wären optional eine unbestimmte Anzahl an zwischenframes die man zur Kontrolle einfügen könnte.
https://github.com/ethanfel/ComfyUI-MiniMaxH3-Contex-Loop (damit würde ich starten, zeigt auch an, welchen WF für welchen Zweck man probieren sollte). Der Discord Thread zu diesem Tool ist hier zu finden. (Werde das im Laufe des WE auch mal testen ^^ ).
Das wäre jetzt eine weitere Baustelle die ich nicht zusätzlich eröffnen möchte. Heute bin ich erstmal an dem einfachen Easy Workflow dran!
Viellecht sehe ich mir das später irgendwann mal an! Das meinte ich mit Kaninchenbau. Man verliert sich sehr schnell darin.
Edit: Hm... im reference to video mode aktzeptiert der media eingang ein load audio node, im first/last frame modus aber nicht.
Also geht wohl nur eines von beidem!? 🤔
Ich bekomme Minimax H3 noch nicht zum Laufen, irgendwie stoße ich immer auf Hürden. Dynamic RAM ist anscheinend nicht für AMD Grafik direkt gedacht, aber ich habe ein Workaround gefunden, was es über ROCm ermöglichen soll. Die Einrichtung ist aber nicht ganz trivial und ich stoße dann beim Einrichten auf Fehlermeldungen und ich kann daher dort nichts abschließen.
Auch ein kleinere Modellvariante habe ich versucht, trotzdem bekomme ich Cuda-Speichermeldungen.
Ergänzung:
Auch mit Krea2edit habe ich Probleme, sodass in nach nur wenigen Durchläufen ein OOM bekomme, und das auch während ich VRAM cleanup eingebaut habe. Es scheint an Krea2edit zu liegen, denn text to image mit krea2 kann ich locker über 100 Durchläufe ausführen, ohne dass ich Probleme bekomme, selbst ohne Cleanup.
Mh schade, würde es gerne testen, aber habe ja kein entsprechendes System. Neuste Version nutzt du bereits von comfy (da gibts ja tägliche updates) und hast Du mal int8 vs fp8 gegengetestet?
Bei mir macht AI-Toolkit stress jedes mal wenn ich versuche eine LoRa für MiniMax Rev2v zu trainieren.
Job process exited unexpectedly. Last log line: Loading Qwen3-VL text encoder from K:\AI-Toolkit-Easy-Install\AI-Toolkit\models\text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Ich kapier nicht was da los ist. Die datei liegt seelenruhig im angegebenen Verzeichniss.
ChatGPT meint wieder es sei wegen der Blackwell Karte.
Was solls, früherr oder später klärt sich das....kein nerv sich damit rumzuärgern....
Bei comfyUI gibts evtl (ich nehme es eigtl an) auch ne Option, dass wie bei einem random seed aus einer Liste Prompts genommen werden (also eine Node nach einem durchlauf auf den nächsten Prompt geht). Dann stellst du einfach die Batch Size oben hoch auf 100 oder was auch immer
Bislang habe ich keine Liste gefunden, die nach jeden Durchlauf den nächste Eintrag verwendet. Meine Suche war allerdings noch nicht so ausführlich, habe zunächst durchsucht, was ich alles an Nodes habe.
Ein Workaround dazu habe ich schon zwischendurch verwendet. Ich leite einzelne Strings durch einen Umschalter und der Umschalter wird nach jeden Durchlauf mit ein +1 weiter geschaltet. Problem ist, dass der Umschalter nur 10 Anwählen kann (0-9), obwohl ich sogar mehr verbinden kann. Kann wohl nur einen einstelligen integral.
Ich könnte jetzt natürlich auch mehrere Umschalter mit Umschalter durchschalten, wird allerdings etwas komplizierter mit dem automatischen durchschalten, die logischen Funktionen müssten wahrscheinlich alle da sein, die ich dafür bräuchte.
Dann lieber Manuell verteilen.
Das Speicherproblem liegt wohl an Krea2edit, denn nur text-to-image läuft solide, auch mit Promptlisten.
Allerdings muss ich vielleicht mal die Node aus deinem Bild ausprobieren. Nutzte bisher zwei Nodes Cleanup VRAM und Clear Cache. Die bringen bei Krea2edit nichts, jedenfalls nicht in meinem Setup.
Da ich ein Workflow von einem Anderen runtergeladen habe, bei dem das Problem besonders sichtbar wird, hat eben bereits die Cleanup Nodes enthalten, vielleicht funktioniert es unter anderen Bedingungen ja. Für KI nehme ich hier ja einen etwas unüblichen Weg, so ohne Nvidia.
Ergänzung ()
MechanimaL schrieb:
Neuste Version nutzt du bereits von comfy (da gibts ja tägliche updates) und hast Du mal int8 vs fp8 gegengetestet?
Neueste Version habe ich, int8/fp8 muss ich mal schauen, was das kleine Modell eigentlich hatte.
GGUF scheint bei mir ja nicht zu laufen und abseits davon sind kleine H3-Checkpoints selten.