[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

Ich habe die Desktop Version und (hat Chatty auch empfohlen) alles auf eine SSD gepackt. Wie erwähnt haben wir die Ordnerstruktur so angepasst, dass ich später auch übersichtlich SwarmUI hinzufügen könnte bzw. Sprach-KI-Modelle und es kein unübersichtlicher Wust wird.

Das war zum Beispiel heute morgen unsere kurze ein Stunden Session. Fand ich voll gut.

1785340680552.png
 
  • Gefällt mir
Reaktionen: Tr8or und samuelclemens
Apropos ComfyUI Problem.
Manchmal hab ich mit der Portaqblen version das Problem das diverse Dropdown Menüs nicht mehr reagieren in der Weboberfläche. Und zwar Browserunabhängig überall gleich.
Meist ist das Problem mit nem erneuten Update über die "update_comfyui_stable.bat" oder "update_comfyui_and_python_dependencies" behoben. Diesmal aber nicht.
Hat einer ne Idee?
ChatGPT ergießt sich mit tausend Möglichkeiten die diesmal keine lösung bringen.

Hier kommt dann halt wieder das "verstehen" ins Spiel. Da es immer wieder mal vorkommt würde ich gern wissen wieso sich das Frontend teilweise so verhält nach Updates.
Es ist jedenfalls kein Browserspezifisches Problem. Cache leeren bringt auch nix. Alle custon nodes die Fehler aufweisen hab ich auch deinstalliert.
 
Zuletzt bearbeitet:
Ich würde confyui ja immer in einer eigenen Umgebung laufen lassen.
Unter Win11 bietet sich da das WSL2 (Windows Subsystem for Linux 2) an. WSL läuft normal nur als Terminal ohne GUI, aber nach der Einrichtung muss man ja eh nur den confyui Server starten und dann geht es vom Browser unter Windows weiter.
Super Anbindung an die Hardware (was bei einer sandbox wohl Probleme machen soll) und man kann das per eingeschränktem User sehr gut abschotten.

ChatGPT ist auch hier bei der Einrichtung Gold wert :D
 
Warum ComfyUI mit WSL2 aus Sicherheitssicht sinnvoll sein kann

ComfyUI selbst ist Open Source und nicht grundsätzlich unsicher. Das größere Risiko entsteht durch die Umgebung: Custom Nodes, Python-Abhängigkeiten und unsichere Modellformate können theoretisch Schadcode ausführen.

Eine Installation in WSL2 schafft hier eine zusätzliche Trennung vom Windows-System:

  • eigenes Linux-Subsystem statt direkter Windows-Installation
  • deaktivierte Windows-Laufwerks-Mounts verhindern einfachen Zugriff auf persönliche Dateien
  • separater Benutzer ohne Root-/sudo-Rechte begrenzt mögliche Schäden
  • eigene Conda-Umgebung hält Abhängigkeiten isoliert
Besonders wichtig: möglichst nur .safetensors-Modelle verwenden. Alte Formate wie .ckpt können auf Pickle basieren und beim Laden theoretisch Code ausführen.

Das größte verbleibende Risiko sind weniger die Modelle selbst, sondern Custom Nodes, da diese normalen Python-Code ausführen dürfen. Deshalb sollte man nur Nodes aus vertrauenswürdigen Quellen installieren.

WSL2 macht ComfyUI also nicht "absolut sicher", reduziert aber die Auswirkungen eines möglichen Schadfalls deutlich. Für Nutzer, die viele Modelle, LoRAs und Erweiterungen aus der Community testen, ist diese zusätzliche Isolation eine sinnvolle Sicherheitsmaßnahme.
 
Generell würde ich die portable comfyUI-Version bevorzugen, da sie eine eigene Umgebung erzeugt:
  • Keine Python-Installation nötig – Python, Git und alle wichtigen Abhängigkeiten sind bereits enthalten.
  • Einfach zu installieren – Entpacken und starten, ohne die Systemumgebung zu verändern.
  • Isolierte Umgebung – Keine Konflikte mit anderen Python-Projekten oder KI-Tools.
  • Leicht zu sichern oder umzuziehen – Der komplette ComfyUI-Ordner kann kopiert oder auf einen anderen Rechner übertragen werden.
  • Einfachere Updates – Das integrierte Update-Skript aktualisiert ComfyUI und Abhängigkeiten, ohne das System zu beeinflussen.
  • Ideal für Einsteiger – Weniger typische Fehler durch fehlende Pakete, falsche Python-Versionen oder PATH-Probleme.
 
@zidius
Wieso dann nicht gleich direkt unter Linux auf ner externen SSD oder so!?
Hatte das zwar auch angedacht aber es scheint keine Portable Version für Linux zu geben!
Mal davon ab das ich keine lust habe ständig umzubooten wenn ich mal schnell was mit KI probieren will.

Aber so ein Stick/SSD mit ner kompletten abgespeckten Linux OS Umgebung mit vorinstalliertem ComfyUI wär schon was feines. Image draufpacken, booten und sofort loslegen mit KI. :daumen:


Edit: von .pt dateien hab ich erst neulich was im Zusammenhang mit AI-Toolkit bei den fertig trainierten LoRa saftensors ...gehört. Aber sonst sind die mir nie untergekommen. 🤔
 
Zuletzt bearbeitet:
Ergänzung: .pt-Modelle und Pickle-Risiko

Nicht nur .ckpt-Dateien können problematisch sein. Auch .pt-Modelle können – abhängig davon, wie sie gespeichert wurden – Pickle-basierte Inhalte enthalten.

Das .pt-Format ist kein reines Gewichtsformat wie .safetensors, sondern ein allgemeines PyTorch-Format. Es kann neben Tensor-Daten auch komplette Python-Objekte speichern. Werden solche Dateien mit unsicheren Ladefunktionen geöffnet, besteht theoretisch die Möglichkeit, dass beim Laden Code ausgeführt wird.

Deshalb gilt auch bei .pt-Dateien: Die Herkunft der Datei ist entscheidend.

In der Praxis ist das nicht immer vermeidbar. Beispielsweise habe ich für ein Gesichtserkennungs-Modell nur Modelle im .pt-Format gefunden. In solchen Fällen ist eine isolierte Umgebung wie WSL2 besonders sinnvoll, da ein möglicher Schadcode nicht direkt auf das Windows-System und persönliche Dateien zugreifen kann.

.safetensors bleibt das bevorzugte Format, aber bei spezialisierten Modellen kann man auf .pt angewiesen sein – dann sollte man besonders auf vertrauenswürdige Quellen achten.
Ergänzung ()

@samuelclemens viele Wege führen nach Rom :)
ich finde es so praktischer, ich habe Zugriff auf mein mainOS, auf meine Dateien, kann gleichzeitig an anderen Sachen arbeiten, muss nicht umbooten....
 
MechanimaL schrieb:
Evtl findest Du hier noch ein paar brauchbare Tipps

Ich sach mal so: 89 Nodes im Workflow, ist einer nicht kompatibel weil es updates gab, läuft der ganze Wortflow nicht mehr. Ich habe zwar den Fehler gefunden und beheben können, allerdings laufe ich mit meiner 5090 ins VRAM Limit. So das ich viel gedult mitbringen muss.

https://github.com/TenStrip/10S-Comfy-nodes
Hier ist der LTXLatentUpscaler mit den anderen aktuelle node nicht mehr kompatibel.

EDIT: Sehe gerade das vor 6 Stunden ein Update gekommen ist. Heute abend mal direkt testen.
 
Zuletzt bearbeitet:
Geht doch :daumen:




Info: Es macht durchaus sinn bei diesen Workflows Sage Attention zu aktivieren. Das spart ungemein an VRAM, was den Workflow aber gefühlt um das 100 fache beschleunigt. Der Qualitätsverlust der SA nachgesagt wird, fällt da aber nicht ins gewicht.

Aktuell scheinen die neuen Updates aber viele Workflows von mir zu killen. Bei meinen Qwen Edit Worklow, der seit Monaten funktioniert hat, musste ich echt den TextEncoder wechseln das sich die Tokens die dort verwendet werden, geändert haben sollen, bzw. die Node dahinter mehr Tokens benötigt.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: MechanimaL
Custom Audio funktioniert dann auch.


 
Heute "dropt" ein neues open-weights Video Model, Minimax H3, in ca. 4 Stunden. Dann mal schauen, wie es mit der comfyui Implentierung ist, wie groß es ist usw., denn es beherrscht zumindest in der API Version schnelle Bewegungen deutlich besser als LTX. Hier ein Vergleich (der evtl unfair ist wegen ungleicher Modelvarianten/Größen):

Edit: es wird recht groß :D, aber der comfyUI Support ist bereits in Arbeit (sie haben das Model schon 2 Tage vorab bekommen).

Btw: bei Krea2 kann man mit hilfe dieser VAE noch etwas mehr an Schärfe rausholen. Die erste VAE mit "sharp" im Namen ist aber kaum von der originalen zu unterscheiden. Bei der zweiten hatte ich einen positiven Effekt auf ein "Foto" im Medium-Shot Format.
 
Zuletzt bearbeitet:
Das Video ist aber keine gute Werbung. Keine der gezeigten Szenen würde ich mit diesen Open Source Modellen machen.
Da ist Kling der King. Aber anschauen werde ich es mir.
 
Hey Leute, echt coole Ergebnisse habt ihr da! Ich spiele erst seit 2 Tagen mit ComfyUI herum und habe leider nur 8 GB VRAM (RTX 2060 Super) und 32 GB RAM. Ich würde gerne Text-to-Video mit Audio erstellen. Was ist da so möglich? Mich würden mal (aktuelle) Beispielvideos interessieren und die dazugehörigen JSON-Workflows. Weil was ihr hier zeigt, ist sicher nicht möglich mit meiner Hardware, denke ich. :/
Ich frage auch hier, weil ChatGPT beim Thema ComfyUI nicht so viel Ahnung zu haben scheint. Das ist wohl ein Thema, wo man selbst viel Herumexperimentieren muss...
Ich habe LTX-2.3-22B-distilled-1.1-Q6_K.gguf mit einem Workflow von ChatGPT ausprobiert (weil ich bei der Auswahl im Netz zu überfordert war, was passendes zu finden), das sieht dann ungefähr so aus:
 

Anhänge

Zuletzt bearbeitet:
Das neue MiniMax H3 ist auf jeden Fall besser als LTX 2.3 und läuft sogar auf meiner RTX 2060 Super! 5 Sekunden gehen, bei 15 Sekunden bekam ich selbst mit geringster Auflösung einen OOM-Fehler. Nach OOM-Fehler muss man auf jeden Fall einen Neustart von ComfyUI machen, weil sonst nur noch OOM-Fehler kommen. 14 Minuten für 5 Sekunden:
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: MechanimaL
Echt nice, dass die int8 Modelle nun doch nicht ganz so riesig ausfallen und die Qualität ist echt schon nochmal eine Stufe über LTX, sowohl vom Gesamteindruck, als auch vom Promptverständnis. Man kann direkt mit [Shot 1] und [Shot 2] At 04.00 (zb) arbeiten und es macht viel eher das, was man erwartet :)
 
Wie Will Smith beim Spaghetti essen zum inoffiziellen Lackmus Test für die Fähigkeit von KI geworden ist, ist einfach typisch Internet. Alles Nerds, durch die Bank 😝
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: WoisthierdasKlo
Wegen den OOM-Fehlern bei mehr Sekunden habe ich in die Start-Datei --disable-async-offload hinzugefügt. Das hatte aber nur zur Folge, dass alles viel länger dauerte und ich am Ende zur Belohung fürs Warten ein komplett schwarzes Video erhielt. Zuerst scheiterte es aber an der Audiospur, die NaN-Werte erhielt, weswegen ich einen "Fix" einfügte, der NaN-Werte bei der Lautstärke auf 0 setzte. Aber kein Wunder, dass der Audio Decoder NaN-Werte kriegt, wenn das Video Schwarz ist. :D (Das wusste ich nicht, ich bekam ja gar kein Video zu sehen.) Naja, jedenfalls wieder entfernt und nun das erste Mal wieder ein Video als Ergebnis herausbekommen, doch ich musste 44 Minuten warten (statt 14 Minuten wie beim Erstversuch -- HÄÄ???) und eigentlich sollte Will Smith beim Essen reden.....:



Könnt ihr, mit euren viel besseren Grafikkarten, mal versuchen, diese Situation nachzustellen? Also Will Smith beim Spaghetti essen, der WÄHREND ER ISST REDET, und der am Ende kleckert? Das sieht ja hier nicht so realistisch aus... liegt vielleicht auch an der Videolänge oder schlechtem Prompt. :/
 
WoisthierdasKlo schrieb:
Das neue MiniMax H3 ist auf jeden Fall besser als LTX 2.3 und läuft sogar auf meiner RTX 2060 Super! 5 Sekunden gehen, bei 15 Sekunden bekam ich selbst mit geringster Auflösung einen OOM-Fehler. Nach OOM-Fehler muss man auf jeden Fall einen Neustart von ComfyUI machen, weil sonst nur noch OOM-Fehler kommen. 14 Minuten für 5 Sekunden:
Anhang anzeigen 1751202

Bau Sage Attention ein! Das bringt echt viel. Bin auch gerade etwas am Testen.
Scheint dann doch besser zu sein das in den Vorstellungsvideo welche ich oben kommentiert hat.
Denk es wird LTX2.3 ersetzen. Fehlen nur noch sachen wie Custom Audio und Reference Audio.
 
Zuletzt bearbeitet:
blubberbirne schrieb:
Bau Sage Attention ein!
Du hast eine 5090 du Glückspilz, ich leider nur eine 2060 Super :-( Uns trennen Welten. All diese coolen Dinge zur Optimierung , int8 , sageattention, flashattention funktionieren bzw. bringen bei mir nichts... :/ Hab schon viel mit ChatGPT zum Thema Optimierung gechattet....
Umso mehr würd mich interessieren, was du mit deiner Grafikkarte aus "meiner" Prompt-Idee (Will Smith redet und kleckert beim Spaghetti essen) machen kannst. :-)
 
Zurück
Oben