Was bedeutet dieser Fehler?
Langsame lokale Inferenz kann durch Modellgröße, verfügbaren RAM/VRAM, CPU/GPU-Nutzung, Kontextlänge, parallele Last oder Runtime-Konfiguration entstehen.
Das solltest du zuerst prüfen
- 1
Vergleiche Modellgröße mit verfügbarem RAM und GPU-Speicher.
- 2
Prüfe, ob die Runtime die erwartete Hardwarebeschleunigung nutzt.
- 3
Reduziere die Kontextlänge oder teste ein kleineres Modell, um Ressourcenprobleme einzugrenzen.
- 4
Schließe konkurrierende schwere Prozesse und wiederhole denselben Prompt.
- 5
Messe vor und nach jeder Änderung, damit eine Verbesserung verifiziert wird.
Wichtig: Verifizieren
Ändere immer nur eine Sache auf einmal und wiederhole danach denselben Test. Eine erfolgreiche Änderung ist erst dann eine Lösung, wenn der ursprüngliche Fehler nicht mehr reproduzierbar ist.
Teile niemals vollständige API-Keys, Passwörter, Seed Phrases oder private Schlüssel in Screenshots, Logs oder Support-Anfragen.
Hinweis: Provider-Funktionen, Limits und Versionen können sich ändern. Prüfe bei versionsspezifischen Fragen immer die aktuelle Hersteller-Dokumentation.