[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

Das 2.1er fände ich für "character sheets" und freistellen vor transparentem Hintergrund richtig interessant. Bislang im Comfy aber nur ein text to image workflow... klar, ich könnte online weiter schauen aber habe auch noch nicht soo viel Gutes gelesen, dass ich sofort download geklickt habe :-)

Metal Film ist fertig, da kamen die Bilder aus Z-Image. Nun für das leichte Schlager-Projekt Z-Image Turbo... old but gold.
 
samuelclemens schrieb:
Nachträglich was an den Sprechblasen und einzelnen Panelen zu ändern geht fast immer schief.
Wie machst du das und was geht schief?
 
@Ozmog Ich versuch es über andere edit Modelle da krea 2, nicht gerade dafür gemacht ist zur Bildbearbeitung.
 
Rein theoretisch ist Ideogram4 für sowas ideal, Sprechblasen genau platzieren, Schriftart oder Stil bestimmen usw. und das kann auch am besten Text. Habe damit schon Plakate im chat-gpt-stil (bzgl. Textmenge) gemacht. Grade bei deutschem Text, wirds bei vielen Modellen schwierig. Allerdings braucht es je nach PC/Setting länger im Vergleich und je nach Zweck gibt es evtl. bessere Bildmodelle. Man kann auch einfach nachträglich mit nem externen Tool Sprechblasen machen, bevor man daran verzweifelt ;) Zum Editieren von kleineren Dingen komme ich immer nochmal auf das ältere Flux Fill zurück, weil es in der Regel z.B. die Schriftart im Bild gut erkennt und dann kleinere Änderungen auch passend umsetzt. Wie gut ist Qwen 2.1 bei Text? Teste es mal heute.

Bzgl. Character Sheets: Es gibt ja dedizierte Workflows und mittlerweile auch Nodes dafür (Krea2). Minimax H3 hat ein gutes Räumliches Verständnis, auch das wird mittlerweile für Charactersheets genutzt.

Edit: Text-Verständnis scheint besser als bei Krea2 zu sein.

1790009799607.png
1790009764344.png


Mit Qwen Sprechblase in ein Krea2-Bild gesetzt (Original fixen ging mal auf Anhieb nicht):

1790011043420.png


Krea2 scheint bessere Comic Stil Schrift zu haben, vll brauchts für Qwen ne LORA oder mehr Prompting als was ich jetzt auf die Schnelle reingehauen habe (comic book style, handwritten font)
 
Zuletzt bearbeitet:
MechanimaL schrieb:
Rein theoretisch ist Ideogram4 für sowas ideal
Kannst du mir mal ein funktionierendes Workflow dafür zeigen? So wie ich das überall lese ist Ideogram 4 eigentlich kein Image Edit Modell. 🤔
Im prinzip hab ich dann ein ähnliches Problem wie mit Krea2.
 
Ich meinte zum erstellen von Sachen, die ein gewisses Layout und Text haben. Aber ich würde auch selbst den Ansatz wählen, dass das was mir die besten Bilder gibt (je nach Wahl mit Character LORAs oder anhand von Referenzen) und dann die Textblasen mit was anderem bzw. extern dazu. Siehe Oben, mit Qwen2.1 gehts schonmal prinzipiell jetzt müsste man noch konsistente Schriftart haben.

Btw bei QWEN 2.1 sind noch 2 Dateien mit "9B" im Namen, wo ich zuerst dachte, das wären alternative Text-Encoder, aber die sind für Prompt-Enhancing (speziell für qwen 2.1 einmal für text2image und einmal für image2image). Also die Dateien in den CLIP ordner packen und dann noch drei Nodes laden und verbinden und man kann sich jeweils die Prompts verbessern lassen.
1790015774941.png
 
Hab mal mit Krea2edit kurz getestet

ComfyUI_04983_.png


Hier mit einem einfachen p2p Workflow. Text geändert und die Frau gleich wütend gemacht.
 
Nice, ist da irgendwas inkludiert, das das Krea2 Textverständnis verbessert? Kannst ja mal den WF verlinken oder schicken, ist vll was für @samuelclemens
 
  • Gefällt mir
Reaktionen: samuelclemens
Nun, eigentlich basiert es nur auf ein einfaches Krea2edit, also Krea2edit Nodes plus LoRA. Kein extra LoRA. Vielleicht ist es der Text-Encoder? Nutze qwen3vl_4b_fp8_scaled in diesem WF.
 
Ich glaube, es hat geklappt, weil es ein kürzerer Satz war. Bei mehr/ längerem Text oder bestimmten Wörtern hat Krea2 dann die üblichen Probleme, jedenfalls meine bisherige Erfahrung. Kannst ja mal mit dem Satz: "Und wann genau haben Sie Ihre Wohnung verlassen?" probieren. Was bei Edit-Modellen generell noch helfen kann, ist nur den bestimmten Bereich in höherer Auflösung machen/reparieren zu lassen, allerdings glaube ich es liegt da nicht an der Größe, sondern einfach daran, dass das Textverständnis nicht in ausreichendem Maße vorhanden ist.
 
Als ich hab krea2edit mit diesem Workflow probiert.
Einzige katastrophe. Hab alles Einstellugnen so belassen.
Qwen Edit 2511 hat als einziger überhaupt geschafft eine bestimmte Sprechblase korrekt zu erwischen. Aber das Textverständniss" auch katastrophe.

Am ende wär es wohl effizienter Sprechblasen leer zu lassen und auf herkömmliche oldschool art rein zu photoshoppen mit spezialisierten Tools! 🤔

Habe übrigens die selben Testreihen mit ChatGPT durchgeführt und ohne viel Anstrengung oder verkomplizierungen um ecken bessere Ergebnisse erhalten.
Aber wir wissen ja alle das die Online KIs in einer andere Liga spielen!
Ich wollte nur wissen ob es überhaupt machbar ist.
 
Zuletzt bearbeitet:
Musikalisch gibt es auch etwas neues. YuE2. Gefällr mir nach ersten Test echt gut :daumen:
 
Ich habe gestern Ace Step XL gelöscht :-)

Edit: anbei mal ein Beispiel, warum auf YUE2 gegangen... der Sound ist mega-clean. Es ist richtig fix.
 

Anhänge

  • 260923 Anfang.mp4
    2,2 MB
Zuletzt bearbeitet:
@Keuleman Hmm.. stand da vor der überblendung hinter ihr nicht ein Baum hinter dem rechten Fenster!? 🤔
Das mit der konstistenz ist echt eins der fiesesten Probleme bei KI!
 
Tscha. Ich würd' auch lieber mit meiner Frau im Urlaub in echt den Film drehen und die Sonne genießen. So muss ich auf KI zurück greifen und mit Fehlerchen leben :-D

Aber die Musik an sich, echt gut, noch mal deutliche Steigerung zu AceStep, gell?
 
Ich hab mir halt mal überlegt das man für dieses Problem am besten sowas wie ein 3D Animationsstudio mit integrierter KI bräuchte wo man die komplette Location mit Dummys aller Elemente ausstattet. 🤔

Schonmal versucht deine Akteure in ein Video mit echten Landschftsaufnahmen reinzufummeln!?
Das würde mich auch mal lokal interessieren!
 
Zuletzt bearbeitet:
Ich hab' da nicht genug Perfektionismus, sehe viele Sachen nicht bzw. übersehe die, weil der Rest passt... und... es ist alles kostenlos. Für lau. Ich bin einfach glücklich, wie es ist.

EDIT: Der Baum mit Gabelung ist aber in beiden Einstellungen, das passt schon :-)
 
Zuletzt bearbeitet:
Super Intelligence :daumen:
 

Anhänge

  • Gefällt mir
Reaktionen: Keuleman
Kein plan ob es an meinen In Ear Kopfhörern liegt, aber ich finde die Soundqualität von YuE2 einfach unglaublich klar. Kein Vergleich zu AceXL. Jeder Track einfach unfassbar clean vom Klang.

Habe mit Gemini was gebastelt falls jemand Testen mag: https://share.gemini.google/AgTelmIBd9jp
 
Zurück
Oben