[Sammelthread] AI - Bildgenerierung (Stable Diffusion, Midjourney & Co)

Habe ich noch nie verwendet.
 
Ich wollte mal fragen wie es hier mit dem posten von KI Bildern steht die, sagen wir mal, stark von bekannten Motiven inspiriert sind?
Beispielsweise probiere ich gerade mit Krea2 ein Akira Toriyama Lora aus in Zusammenhang mit den Star Trek Charakteren.
Schon allein der Stil von Akira Toriyama (Dragonball) ist extrem eigentümlich und leicht wiedererkennbar. Star Trek sowieso! Kann/Muss man hier schon mit Copyright Problemen rechnen?
 
Ich sehe da kein problem. Würde behaupten das 80% aller KI Bilder von irgendwelchen Motiven abgeleitet sind.
 
Da kannst du auch 100% draus machen. Die Modelle können nur damit arbeiten was sie beim Training als Input bekommen haben, also beeinflusst das jeden Output den sie machen in irgendeiner Art und Weise. Wirklich gänzlich neu erfinden können die so nichts.
 
Bitte nicht schon wieder diese Grundsatzdiskussion draus machen ob KI wirklich was neues erschaffen kann. Denkt daran das auch jeder menschliche Künstler sich aus einem bereits existierenden Repaurtoire anderer Künstler bedient.
Es geht hier nur um die Frage wie es das Forum handhabt wenn die Schöpfungshöhe nicht sonderlich ausgeprägt ist bei einem geposteten Bild oder Video.
Schließlich steht hier auch die technische Seite im Vordergrund weshalb auch bekannte Motive der gezielten Reproduzierbarkeit wegen eine Rolle spielen.
 
@samuelclemens
1783967249233.png



Bei nicht kommerziell genutzter "Fan-Art" sollte es normalerweise keine Probleme geben. Das ist Internet ist (und war schon vor KI) voll mit Fan-Art, selbst erstellten Dragonball Charakteren usw. Rein theoretisch könnte natürlich trotzdem ein bestehender Rechteinhaber jederzeit rechtliche Schritte einleiten. D.h. mindestens zur Löschung auffordern, oder evtl. sogar Abmahnung samt Rechnung schicken. Das heißt ein geringes Risiko für Dich als Poster bliebe immer vorhanden. Nach meiner kurzen Recherche, wird aber nicht kommerzielle Fan-Art i.d.R. toleriert, während Rechteinhaber z.B. gegen Shops auf Ebay, oder Verkäufer auf Temu o.ä. vorgehen, die ohne eine Lizenz zu besitzen geschützte Motive auf verkauften Shirts verwenden.

Die Verwendung eines bestimmten Stils besitzt auf jedenfall noch weniger Risiko in dem besagten Rahmen.


Die Forumsregeln sagen, "keine rechtswidrigen Inhalte". Fan-Art o.ä. Bilder, die hier zur Besprechung gepostet werden, sollten nicht automatisch rechtswidrig sein, wenn sie bestehende Charaktere beinhalten, sondern sich eher in einer rechtliche Grau-Zone bewegen. Ich werde mich dahingehend aber nochmal genauer erkundigen und ggf. entsprechende Regeln im Eingangsthread ergänzen.
 
  • Gefällt mir
Reaktionen: samuelclemens
Jetzt eine blöde Frage von mir. LTX 2.3 Kamerafahrten: Keyframing ja, geht, meistens... gibt es was zum "vorrendern" eines Kameraweges (bitte sagt nicht Blender :-D).

EDIT: Ich würde auch was aus Pappkartons aufstellen und mit dem Handy filmen, lieber das als Blender ;-D
 
Du kannst selbst aufnehmen oder was bestehendes mit ähnlich/gleichem Movement benutzen und diese LORA (inkl. Beispielworkflow) hier: https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-Cameraman_v2

Beim Prompting das Kamera Movement im richtigen Fachterminus benennen und das was am Ende der Kamerafahrt zu sehen ist auch zu beschreiben, soll außerdem helfen:

"5. Identify Camera Movement(s)

Specify how and when the camera moves. Describing how subjects appear after the movement helps the model complete the motion accurately."

aus: https://ltx.io/blog/ltx-2-3-prompt-guide
"What works well"/ Beispiele auch hier: https://docs.ltx.io/open-source-model/usage-guides/prompting-guide
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Keuleman
Camera Movement hilft. Also die Begrifflichkeiten von der Webseite. Außerdem weg vom Start-End bzw. Start-Middle-End Frame Workflow, hin zu mehr LTX Director 2.0. Da geht jetzt schon bedeutend mehr. Anbei ein kurzes Beispiel, was ich erreichen konnte heute! Bin sehr zufrieden. Auf jeden Fall lebendiger als vieles aus dem ersten Teil des Films. Aber egal, ich lerne und auch der erste Teil war schon ne Menge Arbeit und ich habe viel gelernt :-)

PS: Ich weiß, nur ein Snippet und nicht mal 4k. Aber ich bin mega angetan :-D
 

Anhänge

  • 05-01-10 - What was that noise.mp4
    1,2 MB
Zuletzt bearbeitet:
Mahlzeit. Ich habe vor kurzem auch mal angefangen mit lokaler KI-Bildgenerierung. Ich finde mich da in ComfyUI ein wenig ein. System läuft auf Ubuntu Studio 26.04 LTS, mit einer RX9070XT über ROCm. Soweit so gut.

Nur bin ich jetzt im Dilemma, dass mir der Arbeitsspeicher schon viel zu schnell ausgeht, habe nur 32GB zur Verfügung. Arbeitsspeicher ist bekanntlich zur Zeit extrem teuer und eine Entspannung eben auch noch nicht vor 2028 unbedingt ersichtlich. Ich habe ja noch gehofft, dass die KI-Blase platzt und sich damit die Nachfrage nach Speicher ein wenig entspannt.
Jetzt hätte ich immerhin noch die Qual der Wahl: 64GB als DDR4 zu kaufen, weil doch ne Ecke günstiger. oder eben doch 64GB in DDR5. haben nun mal sowohl ein AM4-System mit 5700G oder ein AM5-System mit 8700G zur Verfügung. Da beides ITX-Systeme sind, habe ich leider auch nur zwei Slots im System.

Ich weiß aber nicht so recht, welchen Weg ich nehmen will. Aussitzen möchte ich jetzt auch nicht unbedingt, da es durchaus noch zwei Jahre dauern könnte.
 
64 DDR 4: habe 2 DDR4 Systeme... merkt man den Unterschied? Vielleicht mit feiner Stoppuhr in der Hand. Ich denke aber auch Hauptsache kein OOM.
 
  • Gefällt mir
Reaktionen: Tr8or
Generell würde ich eher in das zukunftssichere Modell investieren, aber wenn die Preise zu krass und verschieden sind, ist das natürlich ne andere Frage. Aufgrund der erhöhten Preise erhältst Du für Deine 2x16 DDR5 natürlich auch mehr, als früher, das könnte die Ausgaben nochmal etwas kompensieren. Rein von der Performance wird es nicht viel ausmachen, da die Hauptarbeit auf den 16GB Deiner Grafikkarte passiert. Wäre also eher ein Kosten-/Strategisches Abwägen.
 
Ich tendiere eher zu DDR5, das wird ja auch noch eine Weile aktuell bleiben, der Preisunterschied ist aber schon recht ordentlich, über 300€ Delta. Die freiwerdenden Module kann ich natürlich früher oder später auch selbst brauchen, jedenfalls bei DDR5.
Später könnte natürlich noch eine neue Grafikkarte hinzu kommen, aber dazu will ich erst einmal sicher gehen, wie tief ich noch in die Geschichte eintauche. Durch gewisse Beschränkungen in der Größe und darin, dass ich bestimmte Dinge einfach nicht haben will, könnte es stand Heute eine R9700 werden.
 
Jo, Bilder gehen sogar super auf meinem i7-4770S mit 32GB DDR3 RAM und RTX 2060. Hab da auch schon Z-Image (non Turbo) laufen gelassen.
 

Den Kamera-Winkel bestehender Videos verändern, könnte auch für Dich interessant sein @Keuleman
 
INT8/4-ConvRot Modelle
Nicht jeder mag mitbekommen haben, dass innerhalb der letzten Wochen für nahezu alle gängigen Bildmodelle sogenannten INT8/4 Varianten in Convolution-Rotation (ConvRot) Quantisierung erschienen sind. Diese Methode erlaubt, dass die Qualität von INT8 den vorherigen FP8 Versionen nicht mehr nachsteht, ggf. sogar besser sein kann. Auf NVIDIA RTX 30/40 sowie AMD RX 6000/7000 kann INT8 ConvRot je nach Modell und Workflow gegenüber FP8 bis zu doppelt so schnell sein, da die optimierte Quantisierung die vorhandenen INT8-Beschleuniger effizienter nutzt und Speicherzugriffe reduziert.

Links zu INT8/4 convrot Versionen der aktuell beliebtesten Modellen:

Krea2 Offiziell
HF Supermind: Krea,Flux1/2/Klein,Qwen,Ideogram, LTX2.3
Boogu Offiziell
INT4 ConvRot der meisten Modelle

Nutzt ihr das bereits, bzw. was für Ergebnisse habt ihr dadurch erzielt in Sachen Qualität und Speed?
 
  • Gefällt mir
Reaktionen: zidius
Ich tatsächlich noch nicht, "es läuft"... aber definitiv interessant. Vielleicht mal auf dem i5-12500T/32GB RAM/RTX 4060 System interessant.
 
blubberbirne schrieb:
Nimm das diese Config. Die sollte mit 16GB funkionieren.

Code:
---
job: "extension"
config:
  name: "my_first_lora_v1_copy_copy_copy_copy_copy_copy_copy_copy_copy_copy"
  process:
    - type: "diffusion_trainer"
      training_folder: "R:\\pinokio\\api\\ai-toolkit.git\\output"
      sqlite_db_path: "./aitk_db.db"
      device: "cuda"
      trigger_word: "1gawker"
      performance_log_every: 10
      network:
        type: "lora"
        linear: 32
        linear_alpha: 32
        lokr_full_rank: true
        lokr_factor: -1
        network_kwargs:
          ignore_if_contains: []
      save:
        dtype: "bf16"
        save_every: 250
        max_step_saves_to_keep: 4
        save_format: "diffusers"
        push_to_hub: false
      datasets:
        - folder_path: "G:\\Training Datasets/Gawker_40_images"
          mask_path: null
          mask_min_value: 0.1
          default_caption: ""
          caption_ext: "txt"
          caption_dropout_rate: 0.05
          cache_latents_to_disk: false
          is_reg: false
          network_weight: 1
          resolution:
            - 512
          controls: []
          shrink_video_to_frames: true
          num_frames: 1
          flip_x: false
          flip_y: false
          num_repeats: 1
      train:
        batch_size: 1
        bypass_guidance_embedding: false
        steps: 2000
        gradient_accumulation: 1
        train_unet: true
        train_text_encoder: false
        gradient_checkpointing: true
        noise_scheduler: "flowmatch"
        optimizer: "automagic3"
        timestep_type: "sigmoid"
        content_or_style: "balanced"
        optimizer_params:
          weight_decay: 0.0001
        unload_text_encoder: true
        cache_text_embeddings: false
        lr: 0.0001
        ema_config:
          use_ema: false
          ema_decay: 0.99
        skip_first_sample: false
        force_first_sample: false
        disable_sampling: true
        dtype: "bf16"
        diff_output_preservation: false
        diff_output_preservation_multiplier: 1
        diff_output_preservation_class: "person"
        switch_boundary_every: 1
        loss_type: "mse"
      logging:
        log_every: 1
        use_ui_logger: true
      model:
        name_or_path: "krea/Krea-2-Raw"
        quantize: true
        qtype: "qfloat8"
        quantize_te: true
        qtype_te: "qfloat8"
        arch: "krea2"
        low_vram: true
        model_kwargs: {}
        compile: false
        layer_offloading: true
        layer_offloading_text_encoder_percent: 1
        layer_offloading_transformer_percent: 0.35000000000000003
      sample:
        sampler: "flowmatch"
        sample_every: 250
        width: 1024
        height: 1024
        samples:
          - prompt: "you shall not pass"
        neg: ""
        seed: 42
        walk_seed: true
        guidance_scale: 4
        sample_steps: 30
        num_frames: 1
        fps: 1
meta:
  name: "[name]"
  version: "1.0"
Hab das jetzt erstmals mit ieser config zum laufen gebracht. Jedoch sagt die Anzeige in der Kosole was von über 38h (76.38 sec/iter) Trainingsdauern bei dem Dataset mit 115 Bilder mit
Speed. Das geht schonmal garnicht. Ich beobachte das mal ein bis zwei Stunden ob sich das bessert.
Aber da muss man doch irgendwo noch dran drehen können!?

Kann ich die LoRa für das trainirte RAW Modell dann auch im Turbo Workflow in ComfyUI nutzen?
 
ja kannst Du. Ich trainiere auch mit dem RAW Model.
 
Zurück
Oben