Desktop

Lokale TTS für Obsidian

Pyrukar

Commodore
Registriert
Jan. 2013
Beiträge
4.414
Hallo zusammen,

ich möchte gerne eine TTS Erweiterung in Obsidian verwenden um mir meine Notizen vorlesen zu lassen. Diese Hier spricht auch von einer Lokalen Anwendung als Option, aber irgendwie werde ich daraus nicht ganz schlau. Wie kann ich ein lokales Modell darauf ansetzen und welche Art von Programmen funktionieren damit überhaupt.

Ich nutze Comfy UI für Bildgenerierung auf meiner 3060 12GB und wenn ich mich nicht irre kann ich darin auch grundsätzlich TTS Modelle Laufen lassen.

Kann mir da jemand ein bisschen unter die Arme greifen wie ich die Erweiterung korrekt lokal Nutzen kann. Optimaler weise mit Comfy UI, aber alternativ auch mit anderer KI Software und am besten wäre es wenn ein Modell verwendet werden kann das halbwegs mit deutscher Betonung funktioniert - Meine Notizen sind auf Deutsch :D

gruß
Pyrukar
 
kurz vorweg: comfy kannst du für den job vergessen ;) da laufen zwar mittlerweile auch tts-modelle drin (f5-tts nodes etc.), aber comfy ist workflow-basiert - du müsstest für jede notiz nen workflow anschmeißen und obsidian kann mit der comfy-api eh nicht reden. was du eigentlich willst ist ein kleiner tts-server der dauerhaft im hintergrund läuft und auf den das plugin zeigen kann.

der übliche weg: openedai-speech (github, läuft als docker oder direkt python). das ding stellt lokal eine openai-kompatible api bereit (/v1/audio/speech) - und im obsidian-plugin biegst du dann einfach die base url auf http://localhost:8000 um, api key kann irgendein quatsch sein. funktioniert mit jedem plugin das openai-tts mit custom endpoint kann.

modell für deutsch: piper mit der thorsten-stimme. klingt nach solider vorlese-stimme, betonung passt, und läuft sogar auf der cpu - deine 3060 langweilt sich dabei :D wenns edler sein soll: coqui xtts-v2, kann deutsch richtig gut + voice cloning, läuft auf 12gb locker. openedai-speech kann beide serven.

falls dein plugin keine custom url kann: edge-tts als fallback (microsoft neural-stimmen, gratis, sehr gutes deutsch) - ist dann aber cloud, nicht lokal.

hab mir selbst ne sprachassistentin mit elevenlabs (kostenpflichtig, aber referenz) gebaut, die für mein eigensentwickeltes jarvis-cockpit spricht. easy setup, nen abend gebastel ;)
 
Okay,

lazsniper schrieb:
es gibt tatsächlich FOSS von OpenAI ... ich dachte die haben auf Full closed gestellt nachdem sie bemerkt hatten, dass da geld mit verdient werden kann :D

Ich werde es mal ausprobieren, dass Comfy UI da eher schwierig ist, hatte ich mir schon gedacht, aber ich kenne mich da nicht sinnvoll mit aus.

@lazsniper kann diese API dann auch STT wenn du meintest, dass du einen Lokalen Sprachassistenten gebaut hast? Oder ist das nur über den angesprochenen Kostenpflichtigen Teil möglich?
 
  • Gefällt mir
Reaktionen: lazsniper
kleiner aber wichtiger punkt: openedai-speech ist NICHT von openai ;) das ist ein freies community-projekt, der name ist ein wortspiel - es baut nur die openai-api lokal nach, damit alle tools die "openai tts" können einfach drauf zeigen können. openai selbst gibt weiterhin nix her, da hattest du schon recht :D

und ne, da ist nix kostenpflichtig - läuft komplett lokal und komplett gratis. das sind aber zwei getrennte baustellen:

tts (vorlesen) = openedai-speech mit piper, wie oben beschrieben.

stt (also andersrum, sprache zu text) = whisper, konkret faster-whisper. das ist DAS lokale stt-modell, deutsch kann es hervorragend. bei mir läuft das small-modell und reicht dicke - auf deiner 3060 mit 12gb kannst du sogar medium oder large-v3 fahren, dann sitzt auch jedes genuschelte wort ;)

falls du stt auch als api brauchst (gleiche logik wie beim tts): schau dir "speaches" an (hieß früher faster-whisper-server) - openai-kompatibler endpoint für /v1/audio/transcriptions, lokal, gratis.

also: tts = openedai-speech + piper, stt = faster-whisper. beides foss, beides offline, deine graka macht das mit links. viel spaß beim basteln ;)
 
lazsniper schrieb:
openedai-speech ist NICHT von openai
Oh, da habe ich mich glatt verlesen ... aber gut, das war ja anscheinend absicht oder zumindest Billigend in Kauf genommen.

Ich probiere das mal heute abend aus, ob ich das zum laufen bekomme. Danke für die Infos

@lazsniper https://github.com/matatonic/openedai-speech ist anscheinend archiviert ... kannst du mir ein Github nennen, das noch maintained wird?
 
  • Gefällt mir
Reaktionen: Pyrukar
lazsniper schrieb:
hmm, irgendwie steig ich da nicht ganz durch ... gibts da auch irgendwie eine Installation für dummies? Ich bin hab nix wirklich mit IT zu tun und die angegebenen Installationsschritte funktionieren so nicht wirklich :(

Bei meinen Bisherigen Github Installationen gabs meistens eine Batch oder exe datei die die Installation erledigt hat.

also Geklont habe ich das Repository und eigentlich müsste Python von anderen KI Komponenten ja schon installiert sein, aber wie bekomme ich das ans laufen?
 

Ähnliche Themen

Zurück
Oben