[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

Tatsächlich selber noch nicht gemacht, ich bin... zu faul :-D Es reichen wohl ein paar BIlder aus verschiedenen Perspektiven, denen man noch eine Beschreibung anfügt ("von links" "von rechts")... Und dann dauert das eben seine Zeit.
 
Man muss das Material also vorher entsprechend vorbereiten und taggen!?
Das macht es aufwändiger. Ich dachte man könnte einfach da Videos und Bildersammlungen reinsemmeln.... 🤔
 
Was ich gelesen habe... ich hab's selber praktisch noch nicht gemacht. Ich bin halt faul und mache dann image to video, wenn es "konistent" sein soll :-P
 
samuelclemens schrieb:
Man muss das Material also vorher entsprechend vorbereiten und taggen!?
Das macht es aufwändiger. Ich dachte man könnte einfach da Videos und Bildersammlungen reinsemmeln.... 🤔
Es gibt schon Programme/Workflows die einiges an Arbeit automatisieren, aber du musst dennoch schon noch ein wenig selbst machen. Schau z.B. mal nach "AI Toolkit" (Lora Tutorial).
 
  • Gefällt mir
Reaktionen: qualle und samuelclemens
Templates für Boogu gibts noch nicht, aber es funktioniert (workflows)

1781818374536.png
 
  • Gefällt mir
Reaktionen: Keuleman und qualle
Es ist Freitag, meine Kerlinnen und Kerle.
 

Anhänge

  • Ideogram_4.0_00047_.png
    Ideogram_4.0_00047_.png
    876,6 KB · Aufrufe: 60
  • Gefällt mir
Reaktionen: qualle
qualle schrieb:
Wenn man auf https://civitai.com/models nach "nude" oder "uncensored" sucht, kommt ein Warnhinweis:

Anhang anzeigen 1735716

Also nein, ich denke, das geht mittlerweile nicht mehr. Zumindest nicht direkt.
Das heißt, man ist auf div. Seiten angewiesen, wo das geht. Aber halt mit Kosten (Abos bzw Einmalzahlungen)
Ergänzung ()

MechanimaL schrieb:
Am meisten (lokal) verwendet wird wohl aktuell LTX2.3, damit kannst Du schon so einiges erreichen. Tools: comfyui oder wangp. Es gibt auch viele zusätzliche Mittel und Methoden, um deutlich mehr rauszuholen, als die reine Anwendung des Basismodels hergibt. Ist halt etwas zeitaufwendiger sich in alles reinzufuchsen im Vergleich zu ner Website wie Kling und ein gewisses Maß, insb. an VRAM/RAM, sollte vorhanden sein, um Qualität bzw. einigermaßen schnell Ergebnisse zu erhalten. Mit was bist Du unterwegs?


Einfach .red statt .com eingeben bei civitai ;)
Du meinst, mit welcher Hardware?
Leider "nur" mit RTX 5090 + 9950X3D + mageren 32GB System-RAM (eine zweite 5090 habe ich auch noch, aber die reißt es wahrscheinlich nicht arg heraus). Für Gaming top, aber für AI-Kram auf Kling AI-Niveau nicht ausreichend bzw. zu langsam:(

Mit der viel niedrigeren Rechengeschwindigkeit könnte ich mich noch "anfreunden", insofern die Qualität der von Kling AI + uncensored Content entsprechen würde. Aber das wird wohl ein Wunschtraum bleiben, weil damit (uncensored Content) nen Haufen Geld zu machen wäre. Daran hätte ich nicht mal Interesse - mir reicht es für den Hausgebrauch

btw:
Was ich mit Kling AI machen konnte, ist in meinen Augen schon eindeutig 18+ Material. Also schon eindeutiger Content. Erschreckend, dass nicht mal ich - der das erstellt hat - erkennen kann, dass das alles nie wirklich passiert ist, aber alles bis ins Detail wahnsinnig real aussieht 🫤
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: qualle
Bin bei YT gerade über eine KI-Restaurierung gestoßen:


... ist tatsächlich so geschehen, wurde dann aber nachbearbeitet.

---

Casius.A schrieb:
Das heißt, man ist auf div. Seiten angewiesen, wo das geht. Aber halt mit Kosten (Abos bzw Einmalzahlungen)

https://civitai.red/ wurde doch schon genannt. Dafür muss man aber dort angemeldet sein und bestimmte Modelle kosten etwas... Habe das mal gemacht, und allem, außer Gewalt und Politik, zugestimmt. Auf bestimmte politische Symbole kann ich verzichten. Das Ganze wirkt täuschend echt.
 
  • Gefällt mir
Reaktionen: Casius.A
Also manchmal gibts Modelle, die erst nach einer Zeit freigeschaltet werden (zum kostenlosen Download), aber soweit ich weiß, sind Modelle auf civitai generell kostenlos, das Generieren damit auf der Seite kostet halt was. Es gibt neben huggingface noch
civarchive.com (verlinkt auf weitere seiten)
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: qualle
LTX Director 2.0
 
  • Gefällt mir
Reaktionen: Keuleman und chr1zZo
Jemand paar Tipps wie man zb beim generieren von Comicpanels oder Storyboards den Text in Sprechblasen korrekt hinbekommt?
 
KI nur für Dinge benutzen, die KI auch kann. Eine Sprechblase ist kein integraler Bestandteil eines Bildes, muss also nicht perspektivisch oder farblich in das Bild passen. Hier kann man das Gleiche tun, was man bei einem Foto auch machen würde. Mit einem normalen Malprogramm als letztem Bearbeitungsschritt die Sprechblasen hineinmalen. So kann man deren Größe, Font und Farbe einheitlich über alle Bilder hinweg passend gestalten. Man KANN im Winter draußen in Sandalen herumlaufen, man MUSS aber nicht.
 
ChatGPT schafft das mit dem Text und Sprechblasen inzwischen sehr gut.
Leider gelingt es mir offline mit ComfyUI bisher so gar nicht.
Die Sprechblasen an sich oder die Darstellung von Text ist dabei auch kein Problem. Nur anscheinend die Grammatik oder der Inhalt an sich nicht.
Selbst wenn ich den Inhalt der Sprechblasen exakt vorgebe kommt nur Kauderwelsch dabei raus das nur entfernt der Vorgabe ähnelt.
 
Ich hab länger nix mit Video gemacht, beobachte nur die Entwicklung. In nem anderen Video hieß es, der Director verschlechtere etwas die Qualität. Woran es liegt usw. konnte aber nicht rausgestellt werden. Ist auf jedenfall ein interessantes Tool, aber wie man das Optimum rausholt kann ich jetzt mangels praxiserfahrung dazu nicht sagen.

samuelclemens schrieb:
Die Sprechblasen an sich oder die Darstellung von Text ist dabei auch kein Problem. Nur anscheinend die Grammatik oder der Inhalt an sich nicht.
Womit versuchst Du es? Es gibt Modelle, die das eingermaßen können und andere garnicht. Wenn du eines benutzt, dass es eher gut kann, kannst Du mit Inpainting nur den Bereich markieren und dann den Text neu generieren lassen und beim inpainting muss man sagen, dass nur dieser Bereich betrachtet werden soll (das hat in verschiedenen Tools unterschiedliche Bezeichnungen), dann sieht das Modell mit der vollen Auflösung nur den kleinen Ausschnitt und kann den Text reparieren/neu erzeugen.

Wenn du magst kannst du mal ein Beispiel schicken, was du gemacht hast womit usw. (inkl. Bild).
 
Text liegt stark am verwendeten Modell. Flux oder so... paar Wörter können gehen, Ideogram 4... gestern noch eins gemacht mit mehreren Zeilen Text, kein Ding.
 

Anhänge

  • Einleitungskarte_1.png
    Einleitungskarte_1.png
    4,6 MB · Aufrufe: 58
  • Gefällt mir
Reaktionen: MechanimaL
👍Ideogram4 ist die aktuell beste Wahl bei Text und open weights/source. Für Überschriften tuns auch andere und bei englischem (oder ggf. chinesischem) Fließ-Text / extra Text mags auch mit manch anderen Modellen noch ganz gut klappen (zb Boogu, Qwen image).

Nur fürs Prompting braucht man bei Ideogram halt (idealerweise) Hilfsmittel wegen der erwarteten JSON Prompts, dafür bindet man z.B. direkt ein Sprachmodell ein, dass die Umwandlung direkt macht, wie in diesem Workflow (inkl. KJs Ideogram Prompt Builder).

Oder man nutzt außerhalb von comfyui eines, lokal oder online, das ein entsprechendes Systemprompt zur korrekten Umwandlung hat, fertig auch bspw. bei chatgpt zu finden.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Keuleman
Die besten Ergebnisse erzielte ich bisher mit Qwen Image 2512 was die Grafik und Bildkomposition angeht.
Z-Image Turbo hingegen macht erstaunlicherweise die wenigsten Textfehler, lässt aber hier und da Ganze Sprechblasen/ Dialogteile weg.

Ich versuche es mal mit Ideogram. Dauert aber ne weile alles runterzuladen.
Mit Inpaint und Masken hab ich bisher kaum gearbeitet.

Interessant an Storyboards oder Comicpanelen ist das die KI hier hier inzwischen die Konsistenz/Kontinuität gut beherrscht als wenn man versucht verschiedene zusammenhängende Einzelbilder zu generieren.
Ich habe es noch nie mit Fotorealsimus probiert aber auf diese art könnte man ganz gut auch Videos angehen. wobei dann jedes Panel als Zwischenframe fungiert im Workflow. Zumindest ist so ein Storyboard schneller generiert als ein ganzen Video und lässt sich beliebig anpassen.

MechanimaL schrieb:
Wenn du magst kannst du mal ein Beispiel schicken, was du gemacht hast womit usw. (inkl. Bild).
Leider lassen die Privatnachrichten keine Bilder oder andere Dateien zu und ich mag nicht Teile dieser Kurzgeschichte hier veröffentlichen.

Edit: Ideogram scheint wirklich sehr viel besser mit Text klarzukommen!
 
Zuletzt bearbeitet:
Ideogram 4 geht tatsächlich auch ohne .json Prompting! "Oben ein Text, "xyz", in Frakturschrift, rot und als Hintergrund ein Bild von xyz".
 
@Keuleman Im Grunde schon, aber man bekommt ohne json prompting halt häufig das, bzw. den Text. (ohne nsfw Inhalt)

1782165831566.png
 
  • Gefällt mir
Reaktionen: Keuleman
Zurück
Oben