Welche lokale KI läuft auf meinem PC?

Wähle deine Hardware – der Rechner zeigt sofort, welche KI-Modelle wie ChatGPT-Alternativen bei dir flüssig laufen, wie viel Speicher sie brauchen und wie schnell sie antworten.

Deine Hardware
Wofür willst du die KI nutzen?

Mehr KI mit mehr Speicher

Diese Upgrades würden mit deinen aktuellen Einstellungen zusätzliche Modelle flüssig laufen lassen.

* Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.

So funktioniert der Rechner

Ob ein KI-Modell auf deinem Rechner läuft, hängt vor allem von zwei Dingen ab: wie viel Speicher es braucht und wie schnell dieser Speicher ist.

1. Speicherbedarf

Ein Sprachmodell besteht aus Milliarden Zahlen („Parameter“). Ein Modell mit 8 Milliarden Parametern (8B) braucht in der verbreiteten Q4-Quantisierung rund 5 GB. Dazu kommen der Kontext – also der Text, den die KI gerade verarbeitet – und etwas Puffer für die Software. Der Rechner probiert die beste Quantisierung, die noch komplett in deinen Grafikspeicher passt.

2. Tempo

Für jedes erzeugte Wort-Teil (Token) muss die Grafikkarte das ganze Modell einmal aus dem Speicher lesen. Deshalb bestimmt die Speicherbandbreite das Tempo. Ab etwa 15 Tokens pro Sekunde fühlt sich eine KI flüssig an – das ist schneller, als die meisten Menschen lesen.

3. Wenn es nicht passt

Programme wie Ollama oder LM Studio können Teile des Modells in den normalen Arbeitsspeicher auslagern. Das funktioniert, ist aber oft fünf- bis zehnmal langsamer. Macs sind hier im Vorteil: Ihr Arbeitsspeicher ist gleichzeitig Grafikspeicher.

So startest du

Installiere Ollama (kostenlos für Windows, Mac und Linux), öffne ein Terminal und füge den Befehl ein, den du oben per Klick auf ein Modell kopierst – fertig.

Häufige Fragen

Wie viel VRAM brauche ich für lokale KI?

Als Faustregel braucht ein Modell in der üblichen Q4-Quantisierung etwa 0,6 GB pro Milliarde Parameter plus 1–2 GB für Kontext und Laufzeit. Ein 8B-Modell läuft also ab ca. 6–8 GB VRAM, ein 14B-Modell ab ca. 10–12 GB und ein 32B-Modell ab ca. 20–24 GB.

Kann ich lokale KI ohne Grafikkarte nutzen?

Ja, kleine Modelle bis etwa 8B laufen auch auf der CPU mit ausreichend Arbeitsspeicher. Sie sind dann aber deutlich langsamer, weil normaler RAM eine viel geringere Bandbreite hat als Grafikspeicher.

Ist ein Mac gut für lokale KI?

Macs mit M-Chip teilen sich den Arbeitsspeicher zwischen CPU und GPU. Mit viel Speicher (z. B. 64 GB oder mehr) laufen dadurch auch große Modelle, die auf keine einzelne Gaming-Grafikkarte passen. Die Pro-, Max- und Ultra-Chips sind dank höherer Bandbreite deutlich schneller.

Was bedeutet Quantisierung (Q4, Q8)?

Quantisierung speichert die Gewichte eines Modells mit weniger Bits. Q4 braucht etwa ein Viertel des Speichers der Originalversion bei nur geringem Qualitätsverlust und ist der übliche Standard. Q8 ist nahezu verlustfrei, braucht aber fast doppelt so viel Speicher.

Wie genau ist der Rechner?

Der Rechner liefert eine fundierte Schätzung auf Basis von Modellgröße, Quantisierung, Kontextlänge und Speicherbandbreite. Je nach Software (Ollama, LM Studio, llama.cpp), Treiber und Einstellungen kann der tatsächliche Wert um 10–20 % abweichen.