Lokale KI statt Cloud? Was ein echter Praxistest mit Qwen 3.6 27B zeigt

@xxMuahdibxx Qwen 3.7 ist natürlich besser und via OpenRouter nutzbar. Das macht eben OpenWolf Enhanced + ein Harness den ich da laufen habe. Für Agenten habe ich noch etwas Spezielles entwickelt.. aber das hier nicht das Thema ^^

@samuelclemens ja Lokale bzw. EU Cloud Hosted AIs sind ja im Gewerblichen Pflicht, erst Recht richtung OnPremise bei HR/Kanzleien, Medizin usw. Da steckt noch ganz viel Potential, da gebe ich dir Recht.
 
chr1zZo schrieb:
Eine einzige Cron-Aufgabe hätte 95 % einer Wissensdatenbank überschrieben.
Sieht so aus als würde Qwen hier die codefehler finden, aber nicht die Probleme die bei der Ausführung des codes auftreten können. Vielleicht besser promoten?

@chr1zZo Richtig cooler Test und ein dickes Danke dafür! Hättest du Bock ein paar LLMs genau so zu vergleichen? Gerne auch die verschiedenen Qwen Modelle.
Und z.b. MoE vs. Densed

Dieser praktische Test ist wirklich gut und bestätigt meine Beobachtung, das prompt und damit Kontext deutlich wichtiger sind als das Modell.
ABER, ich glaube bei den großen arbeitet das Thinking genau an diesem Problem!

Vielen Dank nochmal für das teilen deiner Erkenntnisse
 
samuelclemens schrieb:
Ist es inzwischen auch für Laien möglich ein LLM ähnlich wie bei Bild und Videogeneratoren (LoRa) mit speziellen Datensätzen auszustatten.
easy. mit selbst gehostetem claude code in kürzester zeit einsatzbereit.
 
  • Gefällt mir
Reaktionen: chr1zZo
ich habe das lesen des initialen posts abgebrochen. sorry, aber diese formatierung geht gar nicht...
 
  • Gefällt mir
Reaktionen: duAffentier
@Der_Dicke82 Danke. Ich kann gerne mehrere Modelle Benchmarken auf dem gleichen Scope. Gerne auch bei Agentic Workflows falls das interessant ist.

@0x8100 ich werde es Anpassen.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Der_Dicke82
Jetzt wäre noch interessant, wie sich im Vergleich ein Cloud-Modell schlagen würde. Codex oder Claude Code. Hast das das auch mal gegeneinader verglichen?
 
@CM286 In dem Falle war sie ja gegen Opus 4.8 angetreten. Vom Speed müssen wir natürlich hier nicht reden, da ist Claude Code schneller.
 
chr1zZo schrieb:
@CM286 In dem Falle war sie ja gegen Opus 4.8 angetreten. Vom Speed müssen wir natürlich hier nicht reden, da ist Claude Code schneller.
Vom Speed her vielleicht schon.. Aber wie sieht es mit dem Finden aus? gibts da große Unterschiede?
 
@CM286 im Test können wir sagen je nachdem wie man die Lokalen Modelle auf das Problem schickt, kamen aktuell zwischen 60-85% raus was das finden betrifft. Das wird aber mit den nächsten Tests eindeutiger.
 
@chr1zZo Du meinst: zwischen lokal und cloud gibts keinen Unterschied beim Finden?
 
@CM286 na doch. Aktuell eben 20-40% Unterschied Cloud natürlich vorne dran, lokal dahinter. Fest steht, das wenn du selbst GPT 5.6 Sol oder Fable sagst "Baue mir", die machen ordentliche Sachen. Aber danach geht ja erst die richtige Arbeit los. Bugs Code, UI, UX, Customer Experience, Sicherheit, Performance, Libs usw. Ich finde, da kann man lokale oder schwächere Cloud Modelle nutzen die entspannt suchen. Es reicht ja wenn die aufdecken und du ein Frontier das gegenprüfen lässt, kostet weitaus weniger Tokens vom teuren Modell.

Was auch das A und O ist, teste deine eigene Software. Hol die paar Kollegen die mit prüfen. Gerade bei Websiten ist es das einfachste F12 zu drücken und in die Console zu schauen ob du Fehler findest, da muss man nicht zwingend eine AI drauf hetzen.
 
  • Gefällt mir
Reaktionen: CM286
Moin,

interessanter Test. Ich habe letztens in einem Forumspost gelesen, dass es weniger zu Halluzinationen (und Token spart) kommt, wenn man die Unterhaltungen kurz hält und nicht bis geht nicht mehr bzw. Erfolg weiter aufrecht erhält.

Ich kann nicht sagen ob das stimmt, oder warum wenn es so wäre.


Wäre aber interessant, sollte das stimmen. Bedeutet allerdings auch, dass man pro Aufgabe nach Etappen gestaffelt „neu“ anfängt - ohne wissen der alten Inhalte.

Könnte dann die Qualität ggf. Noch erhöhen.
 
Wie könnte man bei Belletristik/Unterhaltungsliteratur vorgehen? Über ein paar Seiten bin ich noch nie gekommen bevor es anfängt Probleme zu geben.
Selbst wenn man Projekte in Etappen aufteilt.
Ich rede nicht davon ein ganzes Buch vollautomatisch schreiben zu lassen. Aber um sich helfen zu lassen als unterstützung wäre es notwendig den Kontext hunderter Seiten zu behalten.
Besonders die inhaltliche Logik scheint bei lokalen Modellen ein großes Problem zu sein.
Aber gerade da benötigt man am meisten unterstützung beim Storyaufbau und Strukturierung.
Wenn dann auch noch ein fiktives Worldbuilding oder andere Zeitabschnitte (Anachronismen) dazukommen...
😵

Ich verstehe langsam wieso sich alle eher auf Coding, Werbetexte oder Wissenschftliche Texte beschränken. 🙄
 
Zuletzt bearbeitet:
d3nso schrieb:
Oder einfach den Text von vornerein als KI Text kennzeichnen, hilft anderen den schund gleich links liegen zu lassen. Man darf ruhig sehen wenn jemand zu faul ist sich ernsthaft mit anderen Individuen auszutauschen ;)

In ein paar Jahren nicht rumheulen, weil du dich abgehängt fühlst!

@chr1zZo Auf welcher Hardware genau lief das ganze?
 
thrawnx schrieb:
In ein paar Jahren nicht rumheulen, weil du dich abgehängt fühlst!
Darum gehts doch gar nicht. Wenn der Eröffnungspost mit KI geschrieben wird und demnächst dann die Faulen auch per KI antworten lassen, dann haben wir hier Threads wo sich die KI mit sich selbst unterhält. Ergibt null Sinn in einem Forum.
 
  • Gefällt mir
Reaktionen: Elderian und d3nso
@thrawnx CPU: AMD Ryzen 9 7950X3D MB: ASUS Crosshair X670E HERO RAM: 2 x 32GB GSkill Trident Z5 CL30 DDR5 5600 GPU: RTX 3090 EVGA FTW3 Ultra.

Habe hier extra nicht meine LLM Bomber genommen sondern Endverbraucher Hardware, um die Ergebnisse für andere "normal Nutzer" zu spiegeln. Morgen kommen dann weitere Benchmarks inkl. Gemma 4 Modell.
 
  • Gefällt mir
Reaktionen: WiP3R
Kuristina schrieb:
Darum gehts doch gar nicht. Wenn der Eröffnungspost mit KI geschrieben wird und demnächst dann die Faulen auch per KI antworten lassen, dann haben wir hier Threads wo sich die KI mit sich selbst unterhält. Ergibt null Sinn in einem Forum.

Nur weil der Post vielleicht mit KI geschrieben oder formatiert ist, heißt es nicht automatisch dass er schlecht ist. Wenn er nur hingerotzt ist, klar, aber wenn der Verfasser sich Gedanken gemacht hat, es aber schlichtweg sprachlich nicht so rüber bringen kann wie eine KI, dann ist daran absolut nichts verkehrt. Es per default zu verteufeln, zeugt nicht von Offenheit neuer Technik gegenüber. Die Arbeitswelt ändert sich, entweder man ändert sich mit, egal ob man es gut findet oder nicht, oder man geht unter.

@chr1zZo Danke
 
@thrawnx Mag ja sein, dass deine Arbeitswelt hier im Forum stattfindet, aber das ist halt nicht bei jedem so und KI wird auch nicht per Default verteufelt. Es gibt aus nachvollziehbaren Gründen Regeln für die Verwendung von KI im Forum. Thats it.
 
Zurück
Oben