Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
NotizFür RTX mit 24+ GB: 1-Click-Installer für OpenClaw, Hermes und Perplexity PC
Ollama ist insgesamt für die verfügbaren Modelle einfacher zu handeln, bei VLLM hast du immer wieder irgendwelche neuen Bugs die dann erst mit ner neuen Version gefixt werden müssen. VLLM muss in Linux laufen (auf Windows also WSL und Docker), hat dafür aber einfach den höchsten Durchsatz. VLLM braucht echt lange zum Laden der Modelle. Ich sehe eher wenig Anwendungsgebiet für Ollama und würde wenn dann eher LM Studio zum Ausprobieren nutzen.
Für concurrency ist Ollama komplett ungeeignet und wenn man die Modelle gezielt konfigurieren möcht m.W.n.
Das schnelle Umschalten ist bei Ollama der größte Vorteil.
Ich bin aber jetzt aber auf llama.cpp umgestiegen und kann GGUF und viele andere modifizierte Modelle nutzen und bei Bedarf auch concurrency.
Ich weiß nicht ob ich vllm noch nutzen werde.
Ich denke bei richtigen rigs 4-8 GPUs lohnt sich vllm wieder.
Bin aber noch am Lernen damit umzugehen.
An dieser Stelle möchte ich allen danken, die Strom verbraten und/oder ganzen Landstrichen das Wasser entziehen, damit so atemberaubende Use Cases wie Bilderkennung durch Kameras, die bei euch Zeug überwachen, das euch sowieso
Nicht immer von den eigenen fehlerhaften Annahmen oder mangelnder Ahnung von einem energiesparenden Setting auf andere schließen. Es bedeutet noch lange nicht, dass andere für angebliche Umweltzerstörung verantwortlich gemacht werden können. Bilderkennung funktioniert mit geeigneten Hardware-Settings von 10 bis 25 Watt – das ist wahrscheinlich genauso wenig oder viel wie das, aus welchem vermutlich dein eigenes Setting besteht, und zudem weniger als einmal Wäschewaschen, nur mal um die Dimensionen zu verdeutlichen.
Und selbst die Bilderzeugung z.B. mit Stable Diffusion funktioniert auch auf solchen Settings !
Ich bezog mich auf das Coden der Anwendung an sich, das ganz offensichtlich über Claude, Codex o.ä. gelaufen ist und da muss ich nicht raten, das ist auf jeden Fall Energieverschwendung.