News Analyse: Warum GPT-6 Astra im ChatGPT-Alltag enttäuscht

Also ich merke schon den Unterschied von leistungsfähigeren Pro-Modellen zu den Flash-Modellen. Wenn mein Kontingent aufgebraucht ist, könnte ich die KI regelmäßig aufgrund der dummen Antworten der Flash-Modelle an die Wand werfen. Ich nutze es eher für private Zwecke aber KI wird eben nicht nur von Informatikern benutzt. Nichts ist so komplex wie das echte Leben, denke ich.
 
SHARK5000bf2 schrieb:
Das fand ich sehr interessant
Das habe ich mir vor zwei Tagen auch angesehen. Die Art des Hosts finde ich zwar anstrengend, aber Dr. Bauckhage zuzuhören ist eine Freude und sehr interessant.
 
@Aerobraking

früher openrouter und dann eben Qwen 3.8 Flash Next. Aber dort kam es öfters zu Überlastungen.
Mittlerweile direkt Qwen 3.8 Flash Next über Qwencloud token account mit 68 Euro im Monat für 160000 Credits (40000 in der Woche). Bisher so kein einziges mal mehr ein Problem gehabt mit Überlastungen und lasse öfters mal 24/7 laufen und komme meistens nicht auf das Creditlimit pro Woche.


https://openrouter.ai/qwen/qwen3.8-flash#providers
https://openrouter.ai/anthropic/claude-opus-4.8

​

 
Ich hab aktuell neben dem 20x OpenAi Abo noch ein 100€ Kimi Abo, ein 20€ Anthropic Abo, ein 10€ open code go abo und ein 20€ abo bei Standart Compute. Locale Qwen X.X versuche starte ich auch immer mal wieder auf Strixpoint. Was brauchbares auf der 16GB GPU hab ich noch nicht gefunden. Auf dauer ist mir das viel zu teuer alles aber gerade sehe ich das als invest in die Zunkunft. Am Ball bleiben und Erfahrungen sammeln.

Wer ernsthaft behauptet Flash und co. ist nur annähernd irgdnewie mit den Top Modellen vergleichbar hat entweder einen völlig anderen Usecase oder lügt :D Sol/Fable und co war die erste Generation die meinen Kram ganz ordentlich gebacken kriegt wenn das Harness entsprechend konfiguriert ist. Astra ist das erste Modell das bezahlbaren Kontext bei ca. 512k Tokens pro Session ermöglicht und das auch über mehrere Stunden oder gar Tage. Der Unterschied bei komplexen Langszeitaufgaben ist gigantisch.
 
  • Gefällt mir
Reaktionen: Wichelmanni
Seit GPT 5.4 merkt man (also ich) im Alltag keinen Unterschied mehr. Ich fand sogar GPT 5.6 Terra (gleiche API Kosten wie 5.4) sehr sehr gut und habe Sol quasi nie benutzt. Astra ist krass für edge-Szenarien, aber für den Alltag komplett bescheuert teuer und wenn man keinen Unterschied merkt, einfach unnötig. Wer aber mit Sol zu wenig Capabilites hatte, wird jetzt vielleicht glücklicher. Persönlich sehe ich aber wenig Sinn hinter solchen Modellen für den normalen Benutzer, einfach zu teuer. Mit Qwen 3.8 Max kommt man via API (sofern man keine 2.4T Parameter selbst hosten kann) sehr viel günstiger an ein sehr ähnliches Ziel beim programmieren und bei auch sonst fast allem.
 
  • Gefällt mir
Reaktionen: B.Basilius
Hab mit Opus 5 Ultracode ein umfangreiches Audit + Refactoring versucht. Am Anfang war das Ergebnis extrem vielversprechend, aber irgendwann hat es sich komplett verheddert, dabei mit über 300 Agents (in mehreren Schritten) trotzdem zig Millionen Tokens verbrannt und viele Fehler gemacht.

Das Refactoring ist noch lange nicht abgeschlossen, aber mein wöchentliches Limit war trotz 50 % Aktions-Boost nach gerade einmal 3 Tagen (und Nächten) komplett erschöpft. Das 5h Limit vom 6.5x Team-Abo war übrigens nach ca. 10min aufgebraucht. Mal schauen wie es nächste Woche weitergeht. Aus dem eigentlichen Arbeitsauftrag ist inzwischen eher ein Forschungsprojekt geworden.

Hätte dafür eigentlich gerne Fable oder Astra genommen, aber ~500-1.000 € für solche "Experimente" finden dann doch keinen großen Anklang. Wobei das natürlich immer noch deutlich(!!!) günstiger wäre als menschliche Arbeitszeit - die ursprüngliche Arbeitslast vom Refactoring wurde auf 60-100 Entwicklungstage geschätzt.

Leistungsfähigkeit und Effizienz ist also noch lange nicht "ausreichend".
 
Ich dachte ich nutze KI schon intensiv, aber wenn ich sowas sehe 😮
piccolo85 schrieb:
Aus meiner Kiste und ein paar Vorgaben wurde ein komplett ausgearbeitetes Projekt mit fertigen Fertigungsunterlagen
und dann kommt jemand damit 🫣
SilverShadow schrieb:
Das erlebe ich schon bei scheinbar simplen Produktsuchen: Wenn ich nach einer aufklappbaren Notizhefthülle suche und mir stattdessen ein Klemmbrett vorgeschlagen wird,
 
  • Gefällt mir
Reaktionen: bobitsch, Zockmock und Tobi&
So beeindruckend das ganze ist, so ernüchternder ist dann immer noch der AI Slop, welcher dabei rumkommt.
Genau das hier ist ein gutes beispiel
Man kann die Erde in alle Richtungen drehen und dabei gibt es immer eine Sonnen und Nachtseite.
Die Schiefe der Ekliptik wird hierbei einfach komplett ignoriert. Und das obwohl es eigentlich alles Informationen sind, welche entweder im Modell gespeichert oder zumindest recherchierbar sind.
 
  • Gefällt mir
Reaktionen: usernamehere
@7H0M45 Als One-Shot-Prompt-Ergebnis trotzdem gut. Fehler oder Ungenauigkeiten lassen sich mit 1-3 weiteren Prompts normalerweise schnell ausbessern. Und selbst wenn man die Fehler selbst nicht erkennt, kann man 2-3 weitere KI-Agents verwenden, um solche Dinge ausfindig zu machen. Klappt erfahrungsgemäß ganz gut. Noch besser, wenn man zwischen Claude und Codex wechseln kann.
 
  • Gefällt mir
Reaktionen: bobitsch und FabianX2
Um mal den Artikel zu zitieren, i don’t get it.

Jetzt soll fehlende Personalisierung schuld daran sein, wenn KI weiterhin oft hoffnungslos versagt?
Es liegt am fehlenden Harnisch, wenn AI wiederholt falsche Quellen nennt, obwohl man sie darauf hingewiesen hat, dass unter der Domain nichts mehr zu Hardware zu finden ist, sondern ein Wettportal?
Suchergebnisse sollen besser ausfallen, wenn die KI mein Fahrprofil und Kinderzahl kennt, als wenn ich ihr konkrete Vorgaben nenne, was das Auto können soll?

Kann ich mir kaum vorstellen. Zudem kann AI für die breite Masse wenig Zukunft haben, wenn die sich für eine simple Produktsuche erst mal nackig machen und ein Umfeld schaffen muss. Die meisten kennen nicht mal Operatoren für Suchmaschinen.

Es stellt sich auch die Frage, ob die Entwicklung in die richtige Richtung geht, wenn KI zwar immer leistungsfähiger wird, diese Leistung aber nur für einen immer kleiner werdenden Nutzerkreis sinnvoll und abrufbar wird.
 
SilverShadow schrieb:
Das erlebe ich schon bei scheinbar simplen Produktsuchen: Wenn ich nach einer aufklappbaren Notizhefthülle suche und mir stattdessen ein Klemmbrett vorgeschlagen wird, merke ich einfach, wie wenig echtes Verständnis für das konkrete Produkt vorhanden ist. Ähnlich ernüchternd ist es, wenn ich beispielsweise nach einem Staubsauger suche, sortiert nach Lautstärke. Den Modellen fehlt meiner Erfahrung nach völlig die Logik, solche Kriterien verlässlich zu erfassen, sauber zu überprüfen und sinnvoll einzuschätzen.

Kann ich nur unter schreiben, ich hatte ein kroatisches Datenblatt eines Produkts vorliegen und dachte mir lad es mal der KI hoch und lass die mal die relevanten Infos rausstellen, die für eine Inbetriebnahme erforderlich sind, da ich kein kroatisch kann. Aber die KI hat es noch nicht mal hinbekommen, "abzuschreiben" aus "schaltet bei <5grad" wurde bei 0 grad. Das hätte ich selbst ohne kroatisch Kenntnisse verstanden, denn zumindest die Zahlen verstehe ich. Das war der absolute Tiefpunkt der Enttäuschung.

Bei einer suche nach einem möglichst langen USB-C Kabel dass NUR zum Laden verwendet werden soll und mindestens noch 65 Watt auf der Gegenseite ankommen sollen, wäre ich bald durchgedreht, ständig bekam ich Vorschläge für Kabel mit aktiven Verstärkerelementen zur besseren Datenübertragung oder hinweise, dass die dann besonders starr werden, bekam dann aber doch wieder nur Verlinkungen zu einem 0,8m Modell.

Ein weiters Beispiel betrifft eine langzeit Trainingsanalyse, mit einem Schüler von mir mache ich ein Langzeitprojekt, wir füttern die KI immer wieder mit Trainingsergebnissen und Infos über Ziele, Eindrücken Verletzungen etc. eben alles was ein Schüler auch seinem Trainer erzählen würde.
Am Anfang waren die Ergebnisse echt gut, aber je mehr Kontext die KI hat umso schlechter werden die Ergebnisse und es findet seit geraumer Zeit keine zeitliche Einordnung mehr statt. "Wie ihr vorhin besprochen habt..." - ja vorhin, das war im Februar. Irgendwelche aufgestellten Vermutungen des Schülers, werden auf einmal als wissenschaftliche Erkenntnisse eingestuft. Erst wenn man daran erinnnert wird korrigiert.

Ich kann die "entschuldigungen" mittlerweile nicht mehr zählen.

Beim programmieren, ich bin kein Entwickler und habe daher keine professionellen Code Ansprüche für mich muss es einfach nur funktionieren. Mit einem Syntax Fehler kann ich leben, das stelle ich beim ausprobieren fest und gut ist. Aber ich erwische die KI immer wieder dabei wie sie definierte Standards über den Haufen wirft.

In einem bestimmten Fenster (wurde Anfangs festgelegt) soll eine bestimmte Schriftart und Farbe verwendet werden. 4 Wochen später möchte man in dem Bereich eine Ergänzung machen und wieder wird die Standardschriftart genommen, es ist wirklich einfach nur nervtötend.

Ich würde mal gerne wissen was Leute die damit professionell arbeiten anders machen. Was muss ich so einer KI mitgeben, damit sie definierte Standards einhält, muss ich sie daran jedes mal erinnern? Dann brauch ich keine Standard definieren.
 
  • Gefällt mir
Reaktionen: SilverShadow
Da würde ich gerne erstmal wissen welche KI mit welchem Abo und welcher Leistungsstufe Du dafür nutzt. Und wie hat die KI Zugriff auf die Daten? Lädst du Dateien hoch oder C&P?
 
  • Gefällt mir
Reaktionen: fandre und FabianX2
senoyches schrieb:
Kann ich nur unter schreiben, ich hatte ein kroatisches Datenblatt eines Produkts vorliegen und dachte mir lad es mal der KI hoch und lass die mal die relevanten Infos rausstellen, ...
Also ich hatte gerade kein kroatisches Datenblatt da, hab irgendwas gegoogelt und was über Gemüse gefunden, das bei Gemini.google reingeladen und wollte eine Zusammenfassung. Zack hat es mir alle aufgelistet mit kroatischen, deutschen und dalmatinischen Dialekt, hätte bestimmt Claude.ai auch so gut gekonnt.
senoyches schrieb:
Bei einer suche nach einem möglichst langen USB-C Kabel dass NUR zum Laden verwendet werden soll und mindestens noch 65 Watt auf der Gegenseite ankommen sollen, wäre ich bald durchgedreht
Sowas hätte ich old-school gegooglt oder bei Idealo/Amazon geguckt.
senoyches schrieb:
Ein weiters Beispiel betrifft eine langzeit Trainingsanalyse, mit einem Schüler von mir mache ich ein Langzeitprojekt, wir füttern die KI immer wieder mit Trainingsergebnissen und Infos über Ziele, Eindrücken Verletzungen etc. eben alles was ein Schüler auch seinem Trainer erzählen würde.
Verseht ihr die Trainingsergebnisse auch brav mit Datum? Wenn ich KI Projekte auf Arbeit habe die historisch wachsen dann bekommt immer alles Datum ggf. Uhrzeit, sowohl solche Daten als auch Zusammenfassungen geführter Chats, da weiß es immer was länger her ist und was gestern war.
senoyches schrieb:
Ich würde mal gerne wissen was Leute die damit professionell arbeiten anders machen. Was muss ich so einer KI mitgeben, damit sie definierte Standards einhält, muss ich sie daran jedes mal erinnern? Dann brauch ich keine Standard definieren.
Ein Beispiel:
Auf Arbeit programmiere ich oft mit Antigravity, ein VSCode Klon zusammen mit Gemini 3 Abo. Das startet immer mit dem selben Code-Ordner geöffnet und da gibt es eine readme.md Datei.

Die readme verweist auf eine knowledge base, darin hab ich immer jede Tätigkeit jeden Tages dokumentieren lassen, wurde lang und mühsam, also hab ich ihm gesagt es soll alles in ne Doku passen die es bei der nächsten Sitzung kapiert, hat es gemacht. Jetzt steht in der knowledge_base:
## Dokumentation
  • [Aktueller Stand](docs/aktueller-stand.md): Der verbindliche Ist-Zustand von Produktion, Testsystem, Architektur und bekannten Einschraenkungen.
  • [Betriebsrunbook](docs/betriebsrunbook.md): Sichere Arbeitsablaeufe, Zugriffsregeln, Werkzeuge und Checklisten.
  • [Offene Punkte](docs/offene-punkte.md): Aktive Aufgaben, Entscheidungen und Abhaengigkeiten.
  • [Aenderungshistorie](docs/aenderungshistorie.md): Chronologisches Journal von Aenderungen, Incidents und deren Ergebnissen.
Bei Widerspruechen gilt diese Reihenfolge: Aktueller Stand, dann Betriebsrunbook, dann Offene Punkte, dann Aenderungshistorie. Die Historie erklaert, warum etwas so ist; sie beschreibt nicht automatisch den heutigen Zustand.

## Verbindliche Leitplanken
  • Das Verzeichnis shop/ ist nur ein Teilspiegel des Live-Systems. Fehlende Core-Dateien sind erwartbar; daraus darf nicht auf den Zustand des Live-Systems geschlossen werden.
  • Produktionsserver und Datenbanken werden grundsaetzlich nur lesend untersucht. Jede Aenderung an Produktion, Datenbank oder Remote-Dateien erfordert eine ausdrueckliche Einzelfreigabe.
  • Fuer Standardabfragen und Log-Analysen die vorhandenen Universal-Werkzeuge verwenden. Keine neuen Hilfsskripte anlegen, wenn ein vorhandenes Werkzeug ausreicht.
  • Operative Zugangsdaten, konkrete interne Hosts oder Umgehungsadressen gehoeren nicht in diese Dokumentation. Sie werden in den dafuer vorgesehenen lokalen Konfigurationen verwaltet.
  • Beim Aendern dieser Dokumentation immer das Pruefdatum aktualisieren und die bearbeitete Datei anschliessend erneut lesen.

Jeden neuen Tag wo ich das starte beginne ich eine neue Unterhaltung darin und tippe nur "check readme, thema heute: mach mir das und das..." und dann wacht es jeden Tag auf und weiß gleich frisch Bescheid.
Zum Feierabend bedanke ich mich wenn es was gut gemacht hat und wenn ich schreibe Feierabend dann weiß es Fortschritt erledigter Punkte in die entsprechenden Dokumentationen schreiben und immer alles mit Datum.

Würde man statt dessen alles in eine lange Conversation packen (z.B. in Copilot Sidebar im Edge Browser) kann es freilich nicht wissen was gestern und was vor Wochen war. Außerdem führen zu lange Conversation zu schnell an Limits, weil jeder neue Prompt bekommt immer wieder frisch die komplette Konversation ins sog. context-window, aber mit immer frischen Unterhaltungen reicht da ein 8-20€ Abo im Monat.

Ich weiß nicht ob das als "professionell" gilt, aber so funktioniert das ganz gut seit über einem halben Jahr.
 
  • Gefällt mir
Reaktionen: HolySkillet
Micha- schrieb:
Ich dachte ich nutze KI schon intensiv, aber wenn ich sowas sehe 😮

und dann kommt jemand damit 🫣
Ich habe eine körperliche Behinderung und bediene mein Tablet per Spracheingabe (Google Voice Access) – daher bitte nicht immer gleich so schnell urteilen! 😉
 
Also nicht geistig. Warum sollte ich nun Rücksicht nehmen?
 
Ich bin halt emotional behindert.
 
@Micha- Ich glaube, du hast meine Aussage nicht verstanden. Es geht einfach nur darum, dass eine für dich scheinbar sehr simple Suche für mich, der ein Tablet nur mit Sprachbedienung bedienen kann, tatsächlich sehr schwierig ist.
Versuche doch mal, eine Notizbuchhülle, die ganz viele bestimmte Eigenschaften erfüllt, auf Amazon mit Google Voice Access und Sprachbedienung zu recherchieren. Webseiten sind auch nicht dafür ausgelegt, mit Sprachbedienung navigiert zu werden – das merkt man an allen Ecken und Enden. Du wirst sehr schnell merken, dass das überhaupt nicht einfach, sondern ein langwieriger Prozess ist – weil Sprachbedienung einfach viel komplizierter ist und vor allem, wenn man seine Stimme schonen muss und nicht überlasten darf, um keinen rauen Hals zu bekommen.
Da ist eine KI eine enorme Erleichterung, wenn sie für einen etwas recherchieren kann. Und deswegen ist das, was für dich scheinbar eine sehr merkwürdige Aufgabe für eine KI ist, für mich im Alltag extrem praxisrelevant. Wenn ich keine körperliche Behinderung hätte, würde ich so etwas natürlich einfach schnell selbst suchen – also ohne KI.
 
  • Gefällt mir
Reaktionen: HolySkillet
Für Sprachsteuerung vielleicht teilweise interessant das hier:

 
Zurück
Oben