[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

Bei SwarmUI wäre beim GridGenerator (unten unter Tools), mit der Option "just images" möglich einfach unendlich viele Bilder mit Prompt a-z zu erzeugen, die werden dann nacheinander erstellt. Bei comfyUI gibts evtl (ich nehme es eigtl an) auch ne Option, dass wie bei einem random seed aus einer Liste Prompts genommen werden (also eine Node nach einem durchlauf auf den nächsten Prompt geht). Dann stellst du einfach die Batch Size oben hoch auf 100 oder was auch immer und dann müsste es ohne RAM Probleme durchgehen. (Ansonsten gibts Ram/VRam Cleanup Nodes, die auch bei diesem Minimax WF geladen werden, scheinen Standard Nodes in Comfyui zu sein, kann man an den letzten Bild/Video Output im WF anhängen und dann wird am Ende eines Durchgangs alles geleert):

1786701700553.png
1786701542239.png
 
Ist es in ComfyUI eigentlich möglich auf codingebene direkt komplexere programmabläufe zu bauen. So richtig mit Funktionen, Schleifen, Variablen, Bedingungen usw..!?🤔
 
das mit den Referenzen ist brutal gut. Die Crew der Enterprise ist hier vor dem Möbelladen gelandet / angebeamt worden... das sah brutal geil aus
 
Was hast du alles als Referenzen genommen? Charaktere und Orte und noch mehr? Hast Du aus dem Kontrollraum (Beam-Raum) rausgebeamt (2 shots) ? :D das ist auf jedenfall lustig als Idee Leute wohin beamen, teste ich heute Abend oder so auch mal ^^

btw: Der Sage Attention Patch in dem H3 Easy Workflow hat nen starken Effekt auch auf die Geschwindigkeit 98s für 5sek 720p mit Patch (er_sde sampler) vs 141s ohne Patch. (res_multistep 89s vs 146s).

Das hier muss ich unbedingt noch hier lassen ein zusammenhängendes Musik-Video erstellt mit H3, einem zuvor erstellten Song und 2 Referenzbildern:

Video.

https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef
 
Zuletzt bearbeitet:
Ne, relativ stumpf: Ich wollte eh testen, was das Ding kennt. Kirk und Pille waren... nicht getroffen aber Spock war 1a. Die habe ich ohne Referenz rein gehauen. Referenz war ein Video (Flug auf unseren Eingangsbereich zu).
 
MechanimaL schrieb:
Der Sage Attention Patch in dem H3 Easy Workflow hat nen starken Effekt auch auf die Geschwindigkeit 98s für 5sek 720p mit Patch (er_sde sampler) vs 141s ohne Patch.
Genau wegen dem teil wollte der Workflow bei mir nicht komplett laufen. ChatGPT hat mich über ne Stunde lang durch den Kaninchenbau gejagt. Irgendwas wegen der Blackwell Architektur meiner 5070TI.
Hab einfach wie damals in der Schule ab nem gewissen Punkt einfach auf durchzug gaschaltet und brav nur die anweisungen befolgt.
Scheint jetzt iwie zu laufen. Aber ich könnts nicht wiederholen! 👨‍🏫...😵
Allerdings hab ich das pruned Modell statt den im beigelegten Workflow eingestellten convrot Modell.

Eine wesentliche Leistungssteigerung sehe ich mit meinem Test dem ALF Video allerdings nicht.
Von etwa 8 auf 6 minuten für 5s.
Wäre interessant ob sich die leitungsverbesserung in der Länge und Qualität mehr bemerkbar macht. Also ob sie linear oder exponentiell ist. 🤔

Edit: Das Convrot Modell hat jetzt knapp 7 Minuten gebraucht. Qualitätsverbesserungen konnte ich nciht feststellen. Allerdings ist das Testvideo nicht das anspruchsvollste! 🤔
 
Triton und sage attention in der comfyui Umgebung zu installieren ist schon immer etwas umständlich gewesen, es gibt auch Tools, die einem die meiste Arbeit abnehmen, aber ich kenne das ^^

Du hast immerhin eine Steigerung von ca 25% wenn es von 8 auf 6 Minuten gefallen ist.

Wenn fp8 bei dir schneller ist, dann kannst du ja dabei bleiben, wenn die Qualität sich nicht unterscheidet. (Modell natürlich pruned, ist std. für consumer Karten) Modelle.

Hast Du Cuda13 laufen? Habe schon öfter gelesen, dass Minimax damit besser performt.

Code:
python.exe -c "import torch; print(torch.__version__, torch.version.cuda)"
(im python_embeded Verzeichnis von comfyui ausführen)
 
MechanimaL schrieb:
Hast Du Cuda13 laufen? Habe schon öfter gelesen, dass Minimax damit besser performt.
Ja. Ich Versuche alle Bestandteile des Setups immer aktuell zu halten. ChatGPT ist dabei erstaunlich hilfreich.
Es fasst am Ende sogar noch das wichtigste schnell zusammen wenn es merkt das meine free Tokens zur Neige gehen und ich mitten in ner kritischen Phase bin.👍

Allerdings ist der beigefügte Workflow bei Easy nicht so leicht anpassbar wie der letzte wo ich die Audioreferenz mit drin habe.
Da muss ich mich etwas mehr Reinfuchsen.
Aber so oder so. Mit Easy ist bei mir auch keine 30s möglich. Zumindest nicht ohne Augenkrebs auf sehr niedriger auflösung.
Das äuserste war noch 5s mit 1080p.
10s bei 1080p musste ich nach ner Stunde abbrechen weil sich der Fortschrittsbalken kaum vorwärts bewegte.

Interessieren würden mich derzeit aber eher Workflows um vorhandene Videos inhaltlich zu manipulieren.
Insbesondere solche wo man auch start und endframe bestimmen kann um das Material dann nahtlos in ein bestehendes längere Video zu integrieren.
Damit könnte man dann auch fehlerhafte stellen in ansonsten guten Ergebnissen reparieren.
 
Zuletzt bearbeitet:
Diese Dinge sind mitten in der Entwicklung ^^ Ich würde an Deiner Stelle auch ein Konzept verfolgen, das 3-5 sek maximale Clips erstellt und diese zusammenfügt, das dauert sonst viel zu lange und wenn es ja mal funktioniert, ist das eh besser, wenn Du dann auch noch über einzelne Teile Kontrolle hast. Da würde ich mal schauen, bei dem, wie gesagt und auch interessant (ebenfalls im Aufbau): https://github.com/ethanfel/ComfyUI-MiniMaxH3-Contex-Loop

Start und Endframe festlegen geht bei dem easy wf ganz einfach durch anhängen der Bilder im Modus "I2V or First Frame / Last Frame", die werden automatisch genommen als 1. und optional letztes, wobei man in advanced noch auswählen kann, welches Priorität hat. (natürlich kann man aber rein damit nur bedingt ein zusammenhängendes Video erstellen, dafür sind eher die obigen Ansätze gedacht.)
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: samuelclemens
@MechanimaL Kannst mir auch verraten wie man einfach eine audio node in den Workflow einbindet wie in dem anderen MiniMax Workflow?

Das mit dem first/last Frame klappt übrigens super. Eine tolle zusätzliche Kontrollmöglichkeit über den inhalt.
Entferne ich zb Willie aus dem letzten Frame, arbeitet die KI den Inhalt so um das dieser nach links aus dem Bild geht.👍
Toll wären optional eine unbestimmte Anzahl an zwischenframes die man zur Kontrolle einfügen könnte.
 
Zuletzt bearbeitet:
Zuletzt bearbeitet:
MechanimaL schrieb:
https://github.com/ethanfel/ComfyUI-MiniMaxH3-Contex-Loop (damit würde ich starten, zeigt auch an, welchen WF für welchen Zweck man probieren sollte). Der Discord Thread zu diesem Tool ist hier zu finden. (Werde das im Laufe des WE auch mal testen ^^ ).Anhang anzeigen 1753431
Das wäre jetzt eine weitere Baustelle die ich nicht zusätzlich eröffnen möchte. Heute bin ich erstmal an dem einfachen Easy Workflow dran!
Viellecht sehe ich mir das später irgendwann mal an! Das meinte ich mit Kaninchenbau. Man verliert sich sehr schnell darin.

Edit: Hm... im reference to video mode aktzeptiert der media eingang ein load audio node, im first/last frame modus aber nicht.
Also geht wohl nur eines von beidem!? 🤔
 
Zuletzt bearbeitet:
du kannst auch im ref mode ein start bild nutzen, einfach einfügen und als solches benennen ("start with @image1")
 
Zurück
Oben