[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

@blubberbirne Aber wo kann ich an den Einstellungen was drehen um das ganze auf unter 6h zu bringen? Jetzt ist der wieder auf über 46h. Das sind gute 2Tage auf voller auslastung.
CPU 24%
RAM 84%
GPU: maximal 25% in der spitze wobe VRAM voll ausgelastet.

Wobei die Anzeige "Assigned GPUs GPUs: 0" schon sorgen bereitet. Ist due Grafikkarte womöglich nicht richtig eingebunden?
 
samuelclemens schrieb:
Wobei die Anzeige "Assigned GPUs GPUs: 0" schon sorgen bereitet. Ist due Grafikkarte womöglich nicht richtig eingebunden?
0 ist die ID ;) Das ist richtig so.
Teste bitte erstmal weniger Bilder. 20 Vielleicht.
 
blubberbirne schrieb:
Hab ja nur 15 drin.
Wo könnte der Flaschenhalt am ehesten liegen?
Gut, meine Hardware ist um eine ganze Ecke leistungsärmer!
Aber KI meinte mit einer 5070TI müssten unter 6h drin sein bei einem Krea2 LoRA Training.
 
Mit welcher Lora Auflösung Trainierst Du? 512/768/1024 <- Da bitte 512 wählen.

Wenn ich zeit habe, schaue ich mir heute Abend nochmal die Config an.
 
@blubberbirne Da hab ich auch 512 stehen lassen. Ich hab bis auf das dataset und triggerwort nichts verändert.

Hab das Teil erstmal gestoppt. Ich hoff man kann es "fortführen" nach der "pause"
 
Gibt nen ersten Teaser zu Flux 3. Scheint neben Bild auch Video mit Ton zu können. Ich schätze mal, das wird ein Closed Ding...
https://bfl.ai/blog/flux-3

Edit: Flux ist bei mir bisschen stark ins Hinterzimmer gerutscht. Flux 2 war mir zu lahm (wenn auch gute Bildqualität). Einzig Flux 2 Klein Image Edit nutze ich noch gelegentlich. Sehr gute Qualität und auch recht fix. Für "Winkeländerungen" nehme ich mittlerweile einen QWEN image edit workflow (schnell, sehr gute Qualität mit "Vorschau"). Überlege, ob ich mal Richtung Gaussian Splatting gucke... noch keinen finalen richtig guten Workflow gefunden und keine Idee, ob Comfy mir da überhaupt vernünftig weiterhelfen kann. Einen Workflow gesehen, Bild zu Splat zu finalem Render, war mir aber bisschen suspekt.

Gefunden: https://blog.comfy.org/p/bringing-native-support-for-3d-gaussian
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: MechanimaL
Von den bisherigen Modellen gabs ja auch immer eine Pro und kleinere Versionen, von daher wäre es natürlich möglich, dass es auch hier was für die community gibt, aber warten wir's ab.. :)
 
Vor allem 1 Modell für alles, multimodal? Vermutlich kapier ich auch wieder was falsch. Ja, abwarten. Mal schauen, grad alle Workflows für LTX 2.3 einigermaßen am Start :-)
 
Nabend. Gesetz dem Fall jemand möchte mit der KI Bilderstellung beginnen und zwar mit SwarmUI (einfach weil es auf Seite 1 empfohlen wurde) gibt es einen Blog oder eine Seite die Euch sofort einfallen würde, damit sich jemand schlau lesen kann, der tatsächlich mit BabySteps beginnt?

Frage für einen Freund.
 
Also ich würde bei so umfangreichen und komplexen Tools einfach mit einem zielgerichteten Projekt beginnen. Etwas kleines und konkretes das man umsetzten möchte und dann erstmal ChatGPT oder andere KIs fragen wie man die Idee mit dem Tool am besten umsetzten könnte. Wenn es hakt dann hier im Forum nachfragen. Die KIs sind inzwischen erstaunlich gut darin einen bei so bekannten und aktuellen Tools zu beraten.
Ich selbst hab mit Pinokio angefangen. Die hälfte funktionierte aber nie so wie gewollt und kein Bock mich mit der Fehlersuche auf Scriptebene zu beschäftigen. Bin dann aber zu ComfyUi statt SwarmUI gewandert. Vielleicht hat mich das einfach intuitiv an Visual Script erinnert womit ich schon früher etwas in berührung kam.
SwarmUi verwendet ja unter der Haube auch ComfyUI wenn ich das richtig überblicke!?

Wie gesagt, ich bin kein Verfechter von der Pieke an aufwärts zu lernen. Das funktioniert bei dem schnellen technischen wandel heutzutage nicht mehr.
Einfach ein Ziel setzten und konkret verfolgen, dabei lernt man automatisch am besten weil man weiss wofür man es konkret braucht und nicht wie in der Schule das man es vielleicht irgendwann mal benötigt.

Was ich auch gern mache ist, mir fertige Projekte, Templates usw genauer anzusehen die dem nahekommen was ich machen möchte und dann nachzubauen oder anzupassen. Das geht sehr gut mit ComfyUI. Dabei lernt man auch automatisch vieles was so unter der Haube passiert.
 
Zuletzt bearbeitet:
Meinst du? Ich hatte vor ein zwei Jahren mit Stable Diffussion und A111 herumexperimentiert aber wirklich zufrieden war ich nie.

Ich bin auch bei Dingen wie Visual Script völlig unbefleckt und dachte tatsächlich eine Seite oder Blog zu finden, die zumindest die Grundfunktionen nachvollziehbar erklärt wäre ein sinnvoller erster Schritt. Aber OK, Chatty hat wirklich große Fortschritte gemacht.
 
@Noxiel Du musst selber erkunden welche Entwicklungsumgebung dir am besten zusagt.
Es ging dir ja eher um Tutorials. Und da halte ich heute nix mehr davon wie früher mit "Hello World" anzufangen.
Und ja, meistens hilft mir eine der kostenlosen online KIs weiter, sonst Forenmitglieder hier fragen.
Wie es bei sehr Codelastigen Geschichten funktioniert kann ich weniger sagen.

Aber im Prinzip kannst ChatGPT auch als Tutorialmaschine nutzen.
Frag einfach im Prompt sehr konkret nach. Trag dein konkretes Vorhaben vor und verlange eine ausführliche Schritt für Schritt Anleitung. Das hab ich auch schon öfters so gemacht.
Musst halt sehr genau sein was du willst sonst textet es einen komplett zu.
 
Bin mit BestFace ID Lora am rumtesten. So richtig überzeugt bin ich aber noch nicht. Könnte aber daran liegen das mein Input Bild nicht perfekt ist. Was aber direkt Positiv auffällt, der Charakter verändert sich nicht so stark im laufe des Videos.


 
Also ich bin vor kurzem mit ComfyUI eingestiegen und habe die ersten Schritte mit Youtube-Videos gelernt. Ich verstehe lieber, was ich mache, statt einfach was nachmachen und dann auswendig lernen. Ich merke mir so Dinge auch besser, wenn sie sich mir logisch eröffnet haben.

Ich habe mich allerdings auch noch nicht so richtig auf LLMs eingeschossen, sodass ich oft erst selbst suche, bevor ich auf die Idee komme, eine KI zu fragen. Schon komisch, wenn man sich gerade mit KI beschäftigt, liegt aber auch an den Unternehmen, die diese KIs betreiben, denen ich nicht über den Weg traue. Zudem, dass ihre Quellen vom Aussterben bedroht sind, wenn nur noch KIs befragt werden.
 
Ich habe Feuer gemacht! Oder "Hello World" programmiert. Je nachdem..... und alles mit Chatty zusammen. 😁 ComfyUI_00001_.pngComfyUI_00004_.pngComfyUI_00005_.png

ComfyUI gefällt mir schon voll gut. Besser als A1111.
 
  • Gefällt mir
Reaktionen: Ozmog, samuelclemens und MechanimaL
blubberbirne schrieb:
Bin mit BestFace ID Lora am rumtesten. So richtig überzeugt bin ich aber noch nicht. Könnte aber daran liegen das mein Input Bild nicht perfekt ist. Was aber direkt Positiv auffällt, der Charakter verändert sich nicht so stark im laufe des Videos.
Evtl findest Du hier noch ein paar brauchbare Tipps
 
Noxiel schrieb:
ComfyUI gefällt mir schon voll gut. Besser als A1111.
Sich in ComfyUI einzuarbeiten lohnt sich. Die Community arbeitet da sehr aktiv dran und der Support auch für neue Modelle ist super schnell.
Ist halt nur deutlich komplexer als ein altes A1111.

....
Mein LoRA habe ich jetzt noch einmal neu und ohne Grain trainiert. Ergebnis ist viel besser und den Film Korn füge ich einfach anschließend mit einem post-processing Node hinzu.

2026-07-16-213805_krea2TurboOfficialComfy_krea2TurboBf16_401278243437975.jpg
 
  • Gefällt mir
Reaktionen: Tr8or, Ozmog, Noxiel und eine weitere Person
Noxiel schrieb:
Nabend. Gesetz dem Fall jemand möchte mit der KI Bilderstellung beginnen und zwar mit SwarmUI (einfach weil es auf Seite 1 empfohlen wurde) gibt es einen Blog oder eine Seite die Euch sofort einfallen würde, damit sich jemand schlau lesen kann, der tatsächlich mit BabySteps beginnt?
Tatsächlich ist die Lage bzgl. aktueller Tutorials für SwarmUI nicht besonders gut, es gibt zwar welche, aber sie erklären häufig nicht alles im Detail, wie es für Leute, die noch nie mit Bild-KI gearbeitet haben, nötig wäre.

Das heißt, es ist für Neueinsteiger im Moment leichter, sich dank ausführlicher Tutorials, des WIKIs und Templates mit comfyUI zurecht zu finden. Deshalb ändere ich auch die Reihenfolge und ergänze die Empfehlung im Eingangspost. Sobald ich ein passendes Tutorial für SwarmUI gefunden oder erstellt habe, teile ich das auch nochmal gesondert mit, denn: Das lohnt sich für Bilderstellung und -bearbeitung aufgrund bequemerer Bedienbarkeit und integrierter Features auf jeden Fall.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Tr8or, Noxiel, samuelclemens und eine weitere Person
Ich habe mich an @samuelclemens Rat gehalten und habe zusammen mit Chatty (ChatGPT) die Installation und den Aufbau von ComfyUI umgesetzt. Ordnerstruktur, welcher Checkpoint, einen ersten Workflow eingerichtet.... und tatsächlich bin ich ziemlich zufrieden. "Wir" werden jetzt in der nächsten Zeit uns um die verschiedenen Prompts kümmern bzw. mein Verständnis schulen wie die KI den Input in Bilder umsetzt. Denn das ist mir wichtig. Klar könnte ich mir irgendwelche Tutorial anschauen um direkt gute Ergebnisse zu erhalten, aber wenn ich nicht verstehe WIESO dann fuchst mich das unfassbar.

Lirum larum, Chatty ist ungewöhnlich kompetent was das Erklären und Einrichten von ComfyUI angeht. Ich glaube tatsächlich, dass ich Ende kommender Woche bestimmt verstehe was ich da tue bzw. wo ich ansetzen kann um bessere Ergebnisse zu erhalten.
 
  • Gefällt mir
Reaktionen: Tr8or und samuelclemens
@Noxiel Hast du die normale installer Version oder die Portable? Letztere hat so seine Tücken bei der nachinstallation von Modellen usw. Die werden nämlich nicht automatisch ins richtige Verzeichnis runtergeladen.
Portable finde ich aber dennoch besser weil es weniger mit dem OS verzahnt ist. Bzw leichter austauschbar wenn irgendwas kaputt ist.
Was ich noch dazu sagen wollte, alles auf eine SSD packen und rechne mit mehreren TB an freiem Speicherplatz. Da kommt mit jedem Template gerne mal 20-30 GB an neuen Modellen dazu.
Vergiss das regelmäßige Updaten nicht. Da kommt regelmäßig interessantes dazu.
 
Zurück
Oben