Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)
Ich habe die Desktop Version und (hat Chatty auch empfohlen) alles auf eine SSD gepackt. Wie erwähnt haben wir die Ordnerstruktur so angepasst, dass ich später auch übersichtlich SwarmUI hinzufügen könnte bzw. Sprach-KI-Modelle und es kein unübersichtlicher Wust wird.
Das war zum Beispiel heute morgen unsere kurze ein Stunden Session. Fand ich voll gut.
Apropos ComfyUI Problem.
Manchmal hab ich mit der Portaqblen version das Problem das diverse Dropdown Menüs nicht mehr reagieren in der Weboberfläche. Und zwar Browserunabhängig überall gleich.
Meist ist das Problem mit nem erneuten Update über die "update_comfyui_stable.bat" oder "update_comfyui_and_python_dependencies" behoben. Diesmal aber nicht.
Hat einer ne Idee?
ChatGPT ergießt sich mit tausend Möglichkeiten die diesmal keine lösung bringen.
Hier kommt dann halt wieder das "verstehen" ins Spiel. Da es immer wieder mal vorkommt würde ich gern wissen wieso sich das Frontend teilweise so verhält nach Updates.
Es ist jedenfalls kein Browserspezifisches Problem. Cache leeren bringt auch nix. Alle custon nodes die Fehler aufweisen hab ich auch deinstalliert.
Ich würde confyui ja immer in einer eigenen Umgebung laufen lassen.
Unter Win11 bietet sich da das WSL2 (Windows Subsystem for Linux 2) an. WSL läuft normal nur als Terminal ohne GUI, aber nach der Einrichtung muss man ja eh nur den confyui Server starten und dann geht es vom Browser unter Windows weiter.
Super Anbindung an die Hardware (was bei einer sandbox wohl Probleme machen soll) und man kann das per eingeschränktem User sehr gut abschotten.
ChatGPT ist auch hier bei der Einrichtung Gold wert
Warum ComfyUI mit WSL2 aus Sicherheitssicht sinnvoll sein kann
ComfyUI selbst ist Open Source und nicht grundsätzlich unsicher. Das größere Risiko entsteht durch die Umgebung: Custom Nodes, Python-Abhängigkeiten und unsichere Modellformate können theoretisch Schadcode ausführen.
Eine Installation in WSL2 schafft hier eine zusätzliche Trennung vom Windows-System:
deaktivierte Windows-Laufwerks-Mounts verhindern einfachen Zugriff auf persönliche Dateien
separater Benutzer ohne Root-/sudo-Rechte begrenzt mögliche Schäden
eigene Conda-Umgebung hält Abhängigkeiten isoliert
Besonders wichtig: möglichst nur .safetensors-Modelle verwenden. Alte Formate wie .ckpt können auf Pickle basieren und beim Laden theoretisch Code ausführen.
Das größte verbleibende Risiko sind weniger die Modelle selbst, sondern Custom Nodes, da diese normalen Python-Code ausführen dürfen. Deshalb sollte man nur Nodes aus vertrauenswürdigen Quellen installieren.
WSL2 macht ComfyUI also nicht "absolut sicher", reduziert aber die Auswirkungen eines möglichen Schadfalls deutlich. Für Nutzer, die viele Modelle, LoRAs und Erweiterungen aus der Community testen, ist diese zusätzliche Isolation eine sinnvolle Sicherheitsmaßnahme.
@zidius
Wieso dann nicht gleich direkt unter Linux auf ner externen SSD oder so!?
Hatte das zwar auch angedacht aber es scheint keine Portable Version für Linux zu geben!
Mal davon ab das ich keine lust habe ständig umzubooten wenn ich mal schnell was mit KI probieren will.
Aber so ein Stick/SSD mit ner kompletten abgespeckten Linux OS Umgebung mit vorinstalliertem ComfyUI wär schon was feines. Image draufpacken, booten und sofort loslegen mit KI.
Edit: von .pt dateien hab ich erst neulich was im Zusammenhang mit AI-Toolkit bei den fertig trainierten LoRa saftensors ...gehört. Aber sonst sind die mir nie untergekommen. 🤔
Nicht nur .ckpt-Dateien können problematisch sein. Auch .pt-Modelle können – abhängig davon, wie sie gespeichert wurden – Pickle-basierte Inhalte enthalten.
Das .pt-Format ist kein reines Gewichtsformat wie .safetensors, sondern ein allgemeines PyTorch-Format. Es kann neben Tensor-Daten auch komplette Python-Objekte speichern. Werden solche Dateien mit unsicheren Ladefunktionen geöffnet, besteht theoretisch die Möglichkeit, dass beim Laden Code ausgeführt wird.
Deshalb gilt auch bei .pt-Dateien: Die Herkunft der Datei ist entscheidend.
In der Praxis ist das nicht immer vermeidbar. Beispielsweise habe ich für ein Gesichtserkennungs-Modell nur Modelle im .pt-Format gefunden. In solchen Fällen ist eine isolierte Umgebung wie WSL2 besonders sinnvoll, da ein möglicher Schadcode nicht direkt auf das Windows-System und persönliche Dateien zugreifen kann.
.safetensors bleibt das bevorzugte Format, aber bei spezialisierten Modellen kann man auf .pt angewiesen sein – dann sollte man besonders auf vertrauenswürdige Quellen achten.
Ergänzung ()
@samuelclemens viele Wege führen nach Rom
ich finde es so praktischer, ich habe Zugriff auf mein mainOS, auf meine Dateien, kann gleichzeitig an anderen Sachen arbeiten, muss nicht umbooten....
Evtl findest Du hier noch ein paar brauchbare Tipps
YouTube
An dieser Stelle steht ein externer Inhalt von YouTube, der den Forumbeitrag ergänzt. Er kann mit einem Klick geladen und auch wieder ausgeblendet werden.
Ich sach mal so: 89 Nodes im Workflow, ist einer nicht kompatibel weil es updates gab, läuft der ganze Wortflow nicht mehr. Ich habe zwar den Fehler gefunden und beheben können, allerdings laufe ich mit meiner 5090 ins VRAM Limit. So das ich viel gedult mitbringen muss.
Info: Es macht durchaus sinn bei diesen Workflows Sage Attention zu aktivieren. Das spart ungemein an VRAM, was den Workflow aber gefühlt um das 100 fache beschleunigt. Der Qualitätsverlust der SA nachgesagt wird, fällt da aber nicht ins gewicht.
Aktuell scheinen die neuen Updates aber viele Workflows von mir zu killen. Bei meinen Qwen Edit Worklow, der seit Monaten funktioniert hat, musste ich echt den TextEncoder wechseln das sich die Tokens die dort verwendet werden, geändert haben sollen, bzw. die Node dahinter mehr Tokens benötigt.
Heute "dropt" ein neues open-weights Video Model, Minimax H3, in ca. 4 Stunden. Dann mal schauen, wie es mit der comfyui Implentierung ist, wie groß es ist usw., denn es beherrscht zumindest in der API Version schnelle Bewegungen deutlich besser als LTX. Hier ein Vergleich (der evtl unfair ist wegen ungleicher Modelvarianten/Größen):
YouTube
An dieser Stelle steht ein externer Inhalt von YouTube, der den Forumbeitrag ergänzt. Er kann mit einem Klick geladen und auch wieder ausgeblendet werden.
Btw: bei Krea2 kann man mit hilfe dieser VAE noch etwas mehr an Schärfe rausholen. Die erste VAE mit "sharp" im Namen ist aber kaum von der originalen zu unterscheiden. Bei der zweiten hatte ich einen positiven Effekt auf ein "Foto" im Medium-Shot Format.
Das Video ist aber keine gute Werbung. Keine der gezeigten Szenen würde ich mit diesen Open Source Modellen machen.
Da ist Kling der King. Aber anschauen werde ich es mir.
Hey Leute, echt coole Ergebnisse habt ihr da! Ich spiele erst seit 2 Tagen mit ComfyUI herum und habe leider nur 8 GB VRAM (RTX 2060 Super) und 32 GB RAM. Ich würde gerne Text-to-Video mit Audio erstellen. Was ist da so möglich? Mich würden mal (aktuelle) Beispielvideos interessieren und die dazugehörigen JSON-Workflows. Weil was ihr hier zeigt, ist sicher nicht möglich mit meiner Hardware, denke ich. :/
Ich frage auch hier, weil ChatGPT beim Thema ComfyUI nicht so viel Ahnung zu haben scheint. Das ist wohl ein Thema, wo man selbst viel Herumexperimentieren muss...
Ich habe LTX-2.3-22B-distilled-1.1-Q6_K.gguf mit einem Workflow von ChatGPT ausprobiert (weil ich bei der Auswahl im Netz zu überfordert war, was passendes zu finden), das sieht dann ungefähr so aus:
Das neue MiniMax H3 ist auf jeden Fall besser als LTX 2.3 und läuft sogar auf meiner RTX 2060 Super! 5 Sekunden gehen, bei 15 Sekunden bekam ich selbst mit geringster Auflösung einen OOM-Fehler. Nach OOM-Fehler muss man auf jeden Fall einen Neustart von ComfyUI machen, weil sonst nur noch OOM-Fehler kommen. 14 Minuten für 5 Sekunden:
Echt nice, dass die int8 Modelle nun doch nicht ganz so riesig ausfallen und die Qualität ist echt schon nochmal eine Stufe über LTX, sowohl vom Gesamteindruck, als auch vom Promptverständnis. Man kann direkt mit [Shot 1] und [Shot 2] At 04.00 (zb) arbeiten und es macht viel eher das, was man erwartet
Wie Will Smith beim Spaghetti essen zum inoffiziellen Lackmus Test für die Fähigkeit von KI geworden ist, ist einfach typisch Internet. Alles Nerds, durch die Bank 😝
Wegen den OOM-Fehlern bei mehr Sekunden habe ich in die Start-Datei --disable-async-offload hinzugefügt. Das hatte aber nur zur Folge, dass alles viel länger dauerte und ich am Ende zur Belohung fürs Warten ein komplett schwarzes Video erhielt. Zuerst scheiterte es aber an der Audiospur, die NaN-Werte erhielt, weswegen ich einen "Fix" einfügte, der NaN-Werte bei der Lautstärke auf 0 setzte. Aber kein Wunder, dass der Audio Decoder NaN-Werte kriegt, wenn das Video Schwarz ist. (Das wusste ich nicht, ich bekam ja gar kein Video zu sehen.) Naja, jedenfalls wieder entfernt und nun das erste Mal wieder ein Video als Ergebnis herausbekommen, doch ich musste 44 Minuten warten (statt 14 Minuten wie beim Erstversuch -- HÄÄ???) und eigentlich sollte Will Smith beim Essen reden.....:
Könnt ihr, mit euren viel besseren Grafikkarten, mal versuchen, diese Situation nachzustellen? Also Will Smith beim Spaghetti essen, der WÄHREND ER ISST REDET, und der am Ende kleckert? Das sieht ja hier nicht so realistisch aus... liegt vielleicht auch an der Videolänge oder schlechtem Prompt. :/
Das neue MiniMax H3 ist auf jeden Fall besser als LTX 2.3 und läuft sogar auf meiner RTX 2060 Super! 5 Sekunden gehen, bei 15 Sekunden bekam ich selbst mit geringster Auflösung einen OOM-Fehler. Nach OOM-Fehler muss man auf jeden Fall einen Neustart von ComfyUI machen, weil sonst nur noch OOM-Fehler kommen. 14 Minuten für 5 Sekunden: Anhang anzeigen 1751202
Bau Sage Attention ein! Das bringt echt viel. Bin auch gerade etwas am Testen.
Scheint dann doch besser zu sein das in den Vorstellungsvideo welche ich oben kommentiert hat.
Denk es wird LTX2.3 ersetzen. Fehlen nur noch sachen wie Custom Audio und Reference Audio.
Du hast eine 5090 du Glückspilz, ich leider nur eine 2060 Super :-( Uns trennen Welten. All diese coolen Dinge zur Optimierung , int8 , sageattention, flashattention funktionieren bzw. bringen bei mir nichts... :/ Hab schon viel mit ChatGPT zum Thema Optimierung gechattet....
Umso mehr würd mich interessieren, was du mit deiner Grafikkarte aus "meiner" Prompt-Idee (Will Smith redet und kleckert beim Spaghetti essen) machen kannst. :-)