[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

Zwischenzeitlich ist auch Seedance 2.5 rausgekommen, für alle, die Geld in die Hand nehmen wollen, um etwas zu realisieren, statt lokal zu arbeiten, wohl die aktuell beste Qualität (inkl. der Möglichkeit mit Referenzen zu arbeiten):
 
Habt ihr Glücklichen mit der 5090 schon mal TurboDiffusion ausprobiert? Damit könnt ihr faster-than-realtime KI-Videos produzieren... https://github.com/thu-ml/TurboDiffusion?utm_source=chatgpt.com
Da könnte man bestimmt spannende lustige Projekte mit bauen. Irgendein lokales LLM, das von Whisper o.ä. getragenen Transkriptionsprogramm live gesprochenes Wort in einen Prompt umwandelt und daraus direkt in Echtzeit ein Video macht.
Auch interessant: https://arxiv.org/html/2606.09150v1
Dort haben Forscher 10-30 fps Video in Echtzeit produzieren können. Okay, sie hatten auch eine B200. :D
 
Hmm... im Prinzip könnte man damit also jetzt schon Videoübertragungen in Echtzeit manipulieren!🤔

Wenn die Forschung nur genauso schnell vorangetrieben würde an der KI Echtzeiterkennung für den lokalen gebrauch.
 
  • Gefällt mir
Reaktionen: WoisthierdasKlo
Bin heute abend auf einen guten Systemprompt für Gemini/Claude/ChatGPT gestoßen. Habe mir daraus direkt in geminis Canvas eine kleine App gepromptet. Erste Tests laufen damit gerade.

1786304954364.png
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Keuleman
samuelclemens schrieb:
Hmm... im Prinzip könnte man damit also jetzt schon Videoübertragungen in Echtzeit manipulieren!🤔
Woher willst du wissen, ob das nicht schon längst passiert ist? Und woher wollen wir wissen, dass die groß angekündigten GPUs technologisch in irgendwelchen Hinterzimmern nicht schon längst genutzt werden? Okay, sorry, ich bremse mich lieber selbst, bevor ich einen strike kriege. :D
samuelclemens schrieb:
Wenn die Forschung nur genauso schnell vorangetrieben würde an der KI Echtzeiterkennung für den lokalen gebrauch.
Ja, das wird aber bestimmt bald kommen. Da denke ich irgendwie sehr optimistisch. Wenn die Vorhersagen (z.T. geradezu Prophezeiungen) mit "2029" und der "Singularität" zutreffen, werden wir in 3 Jahren eh alle mit offline-ChatGPT in der Hosentasche rumlaufen. ;) (Okay, stimmt nicht ganz, das mit der Singularität bezieht sich ja nicht auf Consumer-Hardware....) Auf YouTube bauen sich Leute schon für "wenig" Geld 96 GB VRAM-Racks:
 
Wird wohl eher darauf hinauslaufen das man das bei großen Anbieter KI Erkennung als Zusatzdienst so wie VPN, Malware oder Werbefilter usw als Abodienst buchen kann.
Vielleicht auch schon bei den hostern vorgeschaltet als freiwillige Option.
Es wäre ja auch in deren Interesse. KI Slop verhählt sich inzwischen ja wie unerwünschter Spammüll.
 
Zurück
Oben