[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

@Ozmog Es geht hier nicht um das Erlernen eines langfristigen Handwerkers sondern um die Nutzung eines Tools das sich so schnell verändert das es schon in einem Jahr komplett veraltet sein wird.
Und leider hab ich für ein nebenher Hobby, wie Keuleman erwähnte, weder Zeit noch die Energie dafür alles von Grundauf strukturiert zu erlernen was ich gern alles lernen würde.
Deshalb versuche ich nur das zu lernen was ich wirklich brauche.
Und ich lerne nunmal besser durch Reverse Engeneering. Das hat nichts mit auswendig lernen zu tun.
Aber wie du bereits erwähnt hast gibt es wohl aus gutem Grund noch keine guten funktionierenden Krea2 Image to Image Workflows aus denen ich lernen könnte.

Im Moment Versuche ich aber in erster Linie zu verstehen wie man mit dem Subgraph zurechtkommt.
Das Problem ist die grafische Bedienoberfläche nicht die Struktur oder Elemente.
Im Prinzip verhält es sich ähnlich wie Funktionen beim Coding denen man per variablen werte übergibt.
 
samuelclemens schrieb:
Aber wie du bereits erwähnt hast gibt es wohl aus gutem Grund noch keine guten funktionierenden Krea2 Image to Image Workflows aus denen ich lernen könnte.
Nein, so habe ich es nicht gemeint. Krea2 ist, so wie ich es verstanden habe, eigentlich nicht dafür gedacht gewesen, damit praktisch Bilder zu verarbeiten. Daher funktioniert Krea2 in dieser Hinsicht anders. Es ist mehr oder weniger ein inoffizieller Weg, weshalb es in ComfyUI direkt nichts dazu gibt.
Es gibt sicher Workflows zum Runterladen, bei CivitAI bestimmt. Ansonsten eben mal nach Krea2edit suchen. Da habe ich über Youtube-Videos innerhalb weniger Minuten einen Krea2 Workflow mit ein oder zwei Referenzbilder erstellt. Und es funktioniert.

Für Krea2 sind dann eben noch Zusatzbedingungen erforderlich, wie eben auch die Krea2edit-Nodes und vielleicht noch eine LoRA (Hab den Namen jetzt nicht im Kopf), je nachdem was man machen will. Ohne die Nodes wird dann auch kein Krea2 vernünftig mit Referenzen umgehen können (mWn)

Ich beschäftige mich mit dem Thema ComfyUI ja auch noch nicht lange und auch nicht durchgehend. Und mit den Tutorials, die ich zu ComfyUI gesehen habe, habe ich auch einige angeschaut, die auch schon ein Jahr alt waren. Das Grundlegende ändert sich nicht so schnell, es kommt aber immer mal was Neues hinzu. Daher bin ich schon der Meinung, dass es hilfreich ist, die Grundlagen auch zu verstehen, was man warum macht. Denn dann kann man auch eher erkennen, was man für seine Workflows weg lassen kann und wo man Änderungen vornehmen kann.
Aber das ist meine Meinung und mein System, muss keiner so machen. Jeder wie er will.
 
Ozmog schrieb:
Für Krea2 sind dann eben noch Zusatzbedingungen erforderlich, wie eben auch die Krea2edit-Nodes und vielleicht noch eine LoRA (Hab den Namen jetzt nicht im Kopf), je nachdem was man machen will. Ohne die Nodes wird dann auch kein Krea2 vernünftig mit Referenzen umgehen können (mWn)
Mit Krea2 LoRa's hab ich hervorragende Ergebnisse. Auch mit selbsttrainierten über AI-Toolkit. Sind aber bisher leider nur Einzelpersonen LoRa. Ich sag nur "Klone" ;)
Deshalb hätt ich auch gern Image to Image optional im Workflow mit drinn.

Aber besonders im Hinblick auf mein Cartoon Projekt scheint Krea2 außerordentlich gut zu funktionieren.
Zusammen mit Mehrpersonen, Style LoRa's und Image edit könnte es klappen konsistente reproduzierbare Cartoon Grafiken für längere Handlungsbögen zu generieren.

Edit:
Ozmog schrieb:
Die meinst das hier!? https://github.com/lbouaraba/comfyui-krea2edit


Anderes Thema, gibt es in ComfyUI ne Möglichkeit veraltete Modelle automatisch auszusortieren?
Mir ist aufgefallen das in den Workflows der Templates ab und zu die Modelle upgegradet werden. Also lädt man das dann aktuelle herunter. Leider hab ich es versäumt dann jedes mal das alte zu löschen und meine 2 TB auf der SSD gehen langsam zu neige.
Die alternative wäre alle zu löschen bis auf die mir geläufig sind. 🤔
Ob auslagern der models auf relativ günstigerem HDD Speicher nen Sinn macht wage ich zu bezweifeln. Neu runter laden dürfte unter Umständen genauso lang dauern wie hin und her-kopieren.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: WoisthierdasKlo und Ozmog
samuelclemens schrieb:
meinst das hier!?
Ja genau. Und dann brauchst du noch eine LoRA, die das ganze noch zusätzlich steuert. "Krea2 Identity Edit"
 
  • Gefällt mir
Reaktionen: samuelclemens
Das Video ist top. Allerdings komme ich sogar mit 12 GB VRAM erstaunlich gut aus. Bin aber auch kein Hardcore-Nutzer... gehe oft mit der Auflösung ziemlich runter.
 
Ich komme sogar mit 8 GB VRAM und vieeeeel Geduld klar. 😅
blubberbirne schrieb:
Aber MAik spricht endlich 5090 korrekt aus
Bei so Aussprache-Sachen schreib ich das immer aus. Zum Beispiel statt "KI" --> "Kaah Iiih". Oder "Fünfzig Neunzig". Funktioniert aber auch nicht immer.
 
LTX 2.5 holt wirklich schõnere Ergebnisse als MiniMax aus dem Prompt heraus.
Leider hängt sich LTX bei schon bei 0,4 MP und 10 Sekunden auf. Zumindest hab ich die beiden Versuche nach ner Stunde abgebrochen.

Iokale Video KI ist einfach eine Frage des Hardwareeinsatzes.
Auch wenn teilweise wirklich erstaunliches bei rauskommt. Produktiv mit gewerblicher Absicht seh ich da kein Land.
Man darf sich da nicht von den ganzen Influencern blenden lassen die ordentlich Kohle reinbuttern und durch Monetarisierung mehrfach wieder reingeholt wird.
Für kleine Freischaffende sehr ich da auch null Chancen.
Kollege wollte wissen ob ich ihm mal schnell nen 2-3 minütiges Video mit KI für seine Website machen kann. Unter FHD allerdings "Augenkrebs" und so...
Achja, zum Freundschaftspreis ;)...
Die Leute haben derzeit alle ihre Illusionen was KI angeht und meinen man braucht ja nicht viel zu zahlen weil KI eh alles von alleine und umsonst macht.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: WoisthierdasKlo
Ja, KI kann unheimlich viel, aber nur auf Supercomputer-Clustern...
 
  • Gefällt mir
Reaktionen: samuelclemens
Also das ist jetzt nur eine technische Machbarkeitsstudie ;).
Wenn es gegen irgendwelche Copyright Regeln des Forums verstößt. Ich hab kein Problem es runterzunehmen.

MiniMax H3, 7s bei 1 MP Auflösung in 21,5 minuten mit einem Frame als Referenzbild am Anfang.. Ich glaub da geht sogar noch was.
Ich hab das gleiche mit LTX 2.5 versucht. Aber ich glaub da wollt ihr die Ergebnisse nicht sehen. Anscheinend hat es schwierigkeiten mit der Darstellung der ALF Figur. 🤔




MiniMax H3, 10s bei 1,5 MP Auflösung in 77 minuten
Merklich mehr Fehler. Trotz identischem Prompt und seed.

 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: WoisthierdasKlo
Wie hast du die Stimme von Alf so hinbekommen?
 
Werbung mit KI? Kein Problem. Schon Videos gemacht für die Firma, Insta, top Werbung.

RTX 4070 und 64 GB RAM
 
WoisthierdasKlo schrieb:
Wie hast du die Stimme von Alf so hinbekommen?
Ich hab in den MiniMax Workflow ein "Load Audio" Node eingefügt und mit dem schon bestehenden "ref_audio_0" verbunden. Dann braucht man nur noch eine mp3 mit einer sauberen stimmprobe die möglichst alle besonderen charaktersitika, wie zb die Lache von ALF, beinhaltet nebst normalen Sätzen.
Das ganze wird dann im Prompt zb mit <Audio 1> vor jeder Aussage angesteuert.
Kann ziemlich kompliziert werden mit mehr als zwei Stimmen.
Deshalb habe ich Willie's Reaktion erstmal stumm gelassen.
Die saubere stimmprobe war im wesentlichen auch schon das schwerste an arbeit, relativ gesehen.
Man glaubt gar nicht wieviel störgeräusche diese alten Sitcoms nonstop drin haben. Ständig dieses nervtötende künstliche Publikumsgelache und dann andere Dialogfetzen rausschneiden usw...
Ich hätt wirklich gern ein KI Tool das mir in echtzeit dieses ständige gelache rausfiltert beim gucken. 🤔

Bei LTX 2.5 hab ich das Audio noch nicht raus.

Keuleman schrieb:
Werbung mit KI? Kein Problem. Schon Videos gemacht für die Firma, Insta, top Werbung.

RTX 4070 und 64 GB RAM
Kommt natürlich darauf an was genau gefordert wird. Je generischer und unspezifischer, umso besser/einfacher lässt sich KI einsetzen.
Wenn jetzt aber der Auftraggeber möchte das man zb einen Rundgang durch die Firmenräume zeigt wo überall auch Leute/ Mitarbeiter gemäß ihrer Tätigkeit das richtige tun im Hintergrund. Vielleicht sogar einige bekannte Gesichter auftauchen aus dem Mitarbeiterstab und der Chef die Roomtour selber begleitet und kommentiert, um 10 Jahre verjüngt!
In vielen Fällen würde ich dazu tendieren dann einfach herkömmliche Filmerei mit oldschooll VFX und KI aufzupolieren.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: WoisthierdasKlo
Hat jemand mal MinimaxH3-Easy benutzt? Wurde hier in diesem Video kurz vorgestellt.

(Edit: Macht nen guten Eindruck, Prompt Enhance und Experimentelles Sage Attention habe ich aber noch nicht probiert, werd ich aber noch.)

Bzgl. LTX2.5, was ich bisher gehört habe, soll es qualitativ eher schlechter als Minimax, dafür aber deutlich schneller sein, was sagen Eure Tests?

Flux3 ist ja veröffentlicht worden auf der BLF Seite, da müssten ja auch bald open weights zum Testen kommen... :)

Anbei noch ein custom gpt + weitere doks zum Futter für einen KI Prompt Generator. (vom banodoco discord Minimax H3 Ressources Thread, User "The Shadow (NYC)"). Kann auch hier mit chat gpt direkt genutzt werden. Das ganze beinhaltet neuste Erkenntnisse zum Prompting mit Minimax H3. Was macht es? --> "Turns rough creative briefs and reference media into precise MiniMax H3 audio-video prompts for ComfyUI, including T2VA, I2VA, FL2VA, L2VA, and Ref2VA"
 

Anhänge

Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: blubberbirne
LTX lädt gerade herunter, habe allerdings gerade H3 mit Turbo Lora im Test heute Abend...

Edit: 3 vs 13 Minuten für 8 Sekunden Video auf RTX 4070 (auf Sommer getunt)... ich denke...
 
  • Gefällt mir
Reaktionen: WoisthierdasKlo
hm. LTX 2.5... mit Prompt Enhancer an... es kommt... was ganz anderes raus als ich prompte. So komplett anders :-D Standard ComfyUI Workflow. Mal aus gemacht, dann geht es. Später mal gucken... ich habe direkt ein Prompt für LTX gemacht, vielleicht hängt es da dran. 0,3MP, 5 Sekunden in 143 Sekunden, nicht schlecht.

8 Sekunden:
LTX 2.5: 160 Sekunden
H3 mit Turbo Lora: 180 Sekunden

Hm. Mag bei anderen Längen anders aussehen aber für so kurze Clips wäre mir das bessere Promptverständnis von H3 schon das alles wert.

Edit:
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: MechanimaL
Das Minimax H3 Easy (Node+Workflow) funktioniert wirklich prima. Insbesondere das Einbinden und Ansprechen von Referenzmedien ist super easy, man verbindet alles, was man möchte einfach zu einem einzigen Eingang und kann im Promptfenster einfach mit "@" auswählen, auf was man sich bezieht. Ein lokales oder entferntes LLM kann (via API) auch noch verbunden werden und es sind bereits systemprompts usw. hinterlegt, dass ein einziger Knopfdruck reicht, um das Prompt entwickeln zu lassen (nachdem man sich mit LM Studio z.B. verbunden hat). Dann hat man außerdem noch alle wichtigen Settings zu Auflösung, Seitenverhältnis, Länge etc. in einem.

(Tipp für LM Studio: wenn kein API Schlüssel aktiv ist in LM Studio trägt man beim API Schlüssel in der Node ein "lm-studio").


Welche Turbo Lora(s) verwendet Ihr mit H3? Habe bisher die "fl2v_turbo_8step_v1.0_comfyui_resized_avg_rank_21_bf16" von DrBaph benutzt und konnte (bei meinem kurzen Test gestern) keinen nennenswerten Unterschied zu 20 steps ohne Lora sehen. Scheint auch mit Ref2V genauso gut zu gehen.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Keuleman
Müsste auch das sein, was ich daheim habe, ja. Echt top! Wie schon geschrieben, Generierung Zeit ungefähr LTX Niveau aber mit den bekannten Vorteilen von H3.

Am Wochenende muss ich aber noch den Flow mit Referenzen testen, gestern nur Text to Video gemacht tatsächlich.

Bin allerdings gerade auch an einem Punkt in meinem Metal Projekt, wo ich erst mal wieder Szenerie (also Bilder) mache :-)
 
das mit den Referenzen funktioniert erstaunlich gut :D
 
  • Gefällt mir
Reaktionen: Keuleman
Ach verdammt, ich muss wohl auch mal H3 ausprobieren. Ich habe mich zunächst auf Bilder fokussiert, in den paar Wochen, in den ich mich mit ComfyUI beschäftige. Mein letzter Workflow war mit zwei Referenzbilder und einer Prompt-Liste, mit der dann mehrere verschiedene Bilder in einem Run erstellt werden. Klappt recht gut, nur bei längeren Listen sollte man dann doch nach zwei Runs mal Comfy neu starten, ab den dritten Run wird es sehr behäbig mit gefahr, dass der Task gekillt wird oder Cuda-Speicherfehler gemeldet wird. Dann sind auch alle zuvor generierten Bilder weg, weil VAE erst am Ende ausgeführt wird. Also doch lieber kleinere Listen verwenden.
Dazu habe ich auch gleich mehrere Listen im Workflow, die ich dann nur durchschalten muss und einen Prompt-Anker, für Charakter-Generierung. Bisher nur Krea 2 verwendet.

Ich lasse ComfyUI übrigens mit Linux laufen, und mit einer RX9070XT über ROCm.
 
Zuletzt bearbeitet:
Zurück
Oben