KI auf Diät: Wie Forscher 70 Milliarden Parameter in 4 GB quetschen

Ein 70-Milliarden-Parameter-Modell braucht normalerweise rund 140 GB RAM. Das entspricht dem Arbeitsspeicher von acht High-End-Servern. Mit Quantisierung schrumpft dasselbe Modell auf unter 40 GB — ohne dass die meisten Nutzer in der Praxis einen Qualitätsunterschied bemerken.

Hier erkläre ich, wie das funktioniert, wo die Grenze liegt und was das konkret für Kanzleien und KMU bedeutet.

Was Quantisierung bedeutet

Ein neuronales Netz besteht aus Gewichten — Zahlen, die während des Trainings erlernt wurden. Standardmäßig werden diese Gewichte als 32-Bit-Fließkommazahlen gespeichert (float32). Jeder Parameter belegt 4 Bytes. Bei 70 Milliarden Parametern ergibt das 280 GB — nur für die Gewichte.

Quantisierung reduziert die Bittiefe dieser Zahlen. Statt 32 Bit pro Gewicht werden nur noch 8, 4 oder sogar 2 Bit verwendet. Damit sinkt der Speicherbedarf drastisch:

Faustformel: 70B-Modell × Bytes pro Parameter = RAM-Bedarf
Float32: 70B × 4 Byte = 280 GB  |  Q8: 70B × 1 Byte = 70 GB  |  Q4: 70B × 0,5 Byte = 35 GB

Die Quantisierungsstufen im Überblick

Die Praxis hat sich auf einige Standard-Stufen eingespielt. Die folgende Tabelle zeigt, was Sie von jeder Stufe erwarten können:

Format Bits/Parameter RAM-Reduktion Qualitätsverlust Typischer Einsatz
Q8 8 Bit ~50% Kaum merkbar Goldstandard wenn Speicher vorhanden
Q4 4 Bit ~75% Gering Standardkorrespondenz, Zusammenfassungen
Q3 3 Bit ~80% Merkbar Ressourcenknappe Umgebungen
Q2 2 Bit ~87% Erheblich Selten empfehlenswert

Warum es funktioniert: Nicht alle Gewichte sind gleich wichtig

Das Geheimnis liegt darin, dass Sprachmodelle extrem redundant sind. Viele Gewichte tragen nur marginal zur Ausgabe bei. Die meisten Informationen stecken in wenigen, besonders einflussreichen Parametern.

Das GGUF-Format (entwickelt von Georgi Gerganov, dem Schöpfer von llama.cpp) nutzt dies durch selektive Präzision: Wichtige Schichten — etwa die Attention-Heads — behalten höhere Bittiefe. Weniger kritische Schichten werden aggressiver komprimiert.

Das ist der Kernunterschied zu naiver Rundung. Naive Quantisierung würde alle Gewichte gleichmäßig abrunden — was zu erheblichem Qualitätsverlust führt. GGUF analysiert die Wichtigkeit jedes Gewichts und entscheidet dann, wie stark es komprimiert wird.

Q4_K_M: Was der Name bedeutet

Im Alltag begegnet Ihnen oft die Bezeichnung Q4_K_M. Das ist kein Zufall:

Die K-Quantisierung ist die aktuell beste Methode für den Alltag: Sie gibt besonders wichtigen Gewichten mehr Bits und komprimiert unwichtige aggressiver. Das Ergebnis ist ein Modell, das bei gleichem RAM-Bedarf deutlich besser abschneidet als frühere Methoden.

Was das in der Praxis kostet

Konkrete Hardware-Anforderungen für gängige Modellgrößen:

Der Vergleich: Dieselben Modelle über Cloud-API zu betreiben kostet bei intensiver Nutzung schnell 300–800 EUR pro Monat. Die Hardware amortisiert sich bei kontinuierlichem Betrieb in 6–18 Monaten.

Qualitätsschwelle: Welche Stufe für welche Aufgabe?

Nicht jede Aufgabe braucht die gleiche Präzision. Eine pragmatische Einschätzung:

Für die meisten KMU-Anwendungsfälle ist ein 8B-Modell in Q4_K_M der Sweet Spot: Es läuft auf günstiger Hardware, ist schnell genug für Echtzeitanwendungen und liefert für Standardaufgaben zuverlässige Ergebnisse.

Praktisches Beispiel: Llama 3.1 mit Ollama starten

Mit Ollama lassen sich quantisierte Modelle in zwei Befehlen lokal betreiben:

# Modell herunterladen und starten (Q4_K_M, ~5 GB)
ollama pull llama3.1:8b-instruct-q4_K_M

# Modell lokal ausführen
ollama run llama3.1:8b-instruct-q4_K_M

Nach dem Download (einmalig) startet das Modell vollständig lokal — keine Cloud-Verbindung, keine API-Kosten, keine Datenweitergabe an externe Server. Ideal für sensible Kanzleidaten, die das Haus nicht verlassen dürfen.

Die Grenzen: Was Quantisierung nicht löst

Quantisierung löst das Speicherproblem. Sie löst nicht das Geschwindigkeitsproblem.

Ein lokales 70B-Modell auf Consumer-Hardware produziert 5–15 Token pro Sekunde. Ein Cloud-Dienst liefert 50–100 Token pro Sekunde. Bei einer langen Antwort bedeutet das: lokal 2–3 Minuten Wartezeit, in der Cloud 10–20 Sekunden.

Die Entscheidung hängt damit vom Anwendungsfall ab:

Für viele Kanzleien und KMU ist ein hybrider Ansatz die pragmatische Lösung: Sensible Langzeitanalysen laufen lokal, interaktive Dienste nutzen die Cloud.

Fazit

Quantisierung hat die Zugangsschwelle zu leistungsfähiger KI drastisch gesenkt. Ein Modell, das vor zwei Jahren einen dedizierten Rechenzentrumsserver brauchte, läuft heute auf zwei Gaming-Grafikkarten.

Für Kanzleien und KMU ist das relevant: Lokale KI-Infrastruktur ist keine Zukunftsmusik mehr. Die Frage ist nicht ob, sondern für welche Workloads sich der Eigenbetrieb rechnet — und für welche die Cloud die bessere Wahl bleibt.


KI-Automatisierung konkret umsetzen

Im Claude Code Mastery-Kurs zeigen wir, wie Sie KI-Modelle — lokal und in der Cloud — für reale Kanzlei- und KMU-Workflows einsetzen: Dokumentenanalyse, automatisierte Korrespondenz, interne Wissensabfragen.

Kein Entwickler-Hintergrund nötig. Praxisbeispiele aus dem deutschen Unternehmensalltag.

Zum Kurs →