derbe
Lt. Commander
- Registriert
- Aug. 2013
- Beiträge
- 1.894
@schumischumi
Sorry für die späte Antwort. Also meine QA hat Zugang zu der Anforderungsstory. Damit weis es was gewünscht ist und kennt die Akzeptanzkirterien, somit kann er da draus die Blackboxtest generieren.
Das habe ich so gebaut, weil ich selbst QA bin gefühlt mein halbes leben. Ich muss kein Code kennen und Software zu testen ich muss nur wissen was gefordert wird und wo drauf geachtet werden muss.
Zum Thema Kontextfenster, da habe ich auch stark dran gearbeitet ich habe ein Kontextfenster für alle Agenten (max 7 Aktiv) von ca 1,3 Mio. Aber ich versuche das jeder immer unter der 100k grenze bleibt.
Bei meinen aktuellen Setup von 2x 3090 bin ich gerade aktuell nach der Reise von Qwen 3.8 27B (Unfassbar gutes Model) zurück auf Qwen 3.6 35B A3B, weil ich damit peak ca 450 Token/s generieren kann, das ist unfalls krank schnell. Und wenn man die Tasks klein genug bekommt, schafft das Model fast alle Aufgaben.
Zur Not habe ich mir eine Eskalations Pipeline gebaut, heißt wenn ein Task 3x nicht erfüllt wird, dann wird es auf den 2 Server geroutet der hat Platz für 1x Qwen 3.8 27B (ist Lahm mit ca 10 Token/s) aber der Schafft das zu 99%. Und die letzten 0,5% gehen dann falls es Qwen nicht packt in die Cloud.
Puh das war glaub ich viel Input. Btw bin mit dem Test von Deepseek Harness fertig, ist speziel, auch sehr gut aber der unterhält sich mir zu viel ähnlich wie BMAD. Daher zurück bei Hermes und recht happy damit.
Protip: falls ihr Hermes benutzt hostet (notfalls auf der CPU) ein gutes AUX Model mit 4B reicht es meist (ich nutze hier auch eins von qwen) für kleines Toolcalling und nimmt dafür nicht die Shotgun wie Qwen 3.6 35B A3B z.B das mach den Workflow ca 200% schneller, das war heftig was das für ein speed boost war!
Sorry für die späte Antwort. Also meine QA hat Zugang zu der Anforderungsstory. Damit weis es was gewünscht ist und kennt die Akzeptanzkirterien, somit kann er da draus die Blackboxtest generieren.
Das habe ich so gebaut, weil ich selbst QA bin gefühlt mein halbes leben. Ich muss kein Code kennen und Software zu testen ich muss nur wissen was gefordert wird und wo drauf geachtet werden muss.
Zum Thema Kontextfenster, da habe ich auch stark dran gearbeitet ich habe ein Kontextfenster für alle Agenten (max 7 Aktiv) von ca 1,3 Mio. Aber ich versuche das jeder immer unter der 100k grenze bleibt.
Bei meinen aktuellen Setup von 2x 3090 bin ich gerade aktuell nach der Reise von Qwen 3.8 27B (Unfassbar gutes Model) zurück auf Qwen 3.6 35B A3B, weil ich damit peak ca 450 Token/s generieren kann, das ist unfalls krank schnell. Und wenn man die Tasks klein genug bekommt, schafft das Model fast alle Aufgaben.
Zur Not habe ich mir eine Eskalations Pipeline gebaut, heißt wenn ein Task 3x nicht erfüllt wird, dann wird es auf den 2 Server geroutet der hat Platz für 1x Qwen 3.8 27B (ist Lahm mit ca 10 Token/s) aber der Schafft das zu 99%. Und die letzten 0,5% gehen dann falls es Qwen nicht packt in die Cloud.
Puh das war glaub ich viel Input. Btw bin mit dem Test von Deepseek Harness fertig, ist speziel, auch sehr gut aber der unterhält sich mir zu viel ähnlich wie BMAD. Daher zurück bei Hermes und recht happy damit.
Protip: falls ihr Hermes benutzt hostet (notfalls auf der CPU) ein gutes AUX Model mit 4B reicht es meist (ich nutze hier auch eins von qwen) für kleines Toolcalling und nimmt dafür nicht die Shotgun wie Qwen 3.6 35B A3B z.B das mach den Workflow ca 200% schneller, das war heftig was das für ein speed boost war!