Elf lokale KI-Modelle im Praxistest – plus Cloud-Referenz
Elf lokale KI-Modellvarianten in sieben Textaufgaben und einem Rechnungstest – plus Cloud-Referenz. Mit Notenmatrix, CSV, Methodik und transparenten Grenzen.
Die meisten Vergleiche von KI-Sprachmodellen messen dasselbe: Logikrätsel, Mathe-Aufgaben, Wissensfragen. Interessant für die Forschung – aber sie beantworten nicht die Frage, die sich ein Betrieb wirklich stellt: Kann dieses Modell meinen Montagmorgen übernehmen?
Also haben wir genau das getestet. An einem einzigen Tag haben wir elf unterschiedliche lokale Modellvarianten und eine separat ausgewiesene Cloud-Referenz anhand von sieben Textaufgaben und einem Rechnungstest aus unserem eigenen Arbeitsalltag geprüft. Zehn lokale Varianten stehen in der Textmatrix; eine weitere lokale Vision-Variante erscheint im separaten Rechnungstest. Nicht jede Variante wurde bei jeder Aufgabe ausgewiesen. Das Ergebnis ist eine Entscheidungsmatrix, aus der wir seither ableiten, welches Modell welche Aufgabe bekommt.
Die lokalen Modellläufe liefen auf unserer eigenen Hardware: einer Workstation mit NVIDIA RTX 5090 (32 GB Grafikspeicher) sowie einem einfachen Zweitrechner für Hintergrund-Jobs. Für diese lokalen Läufe wurde keine externe Modell-API oder Cloud-KI verwendet. Die separat gekennzeichnete Claude-Sonnet-Referenz ist davon ausdrücklich ausgenommen. Der Test zeigt damit, was diese konkrete Hardware-Konfiguration im untersuchten Aufgabenmix geleistet hat; er ist keine allgemeine Hardware-Empfehlung.
Der Aufbau: acht echte Jobs statt Benchmark-Rätsel
Für jede Aufgabe wurde derselbe eingefrorene Testfall verwendet, damit die ausgewiesenen Noten vergleichbar sind. Die acht Aufgaben deckten typische Abläufe eines kleinen Betriebs ab:
- den Tagesüberblick am Morgen aus Mails, Kalender und Notizen zusammenstellen
- 20 E-Mails nach Wichtigkeit sortieren
- aus verstreuten, teils widersprüchlichen Projektnotizen einen sauberen Projektstand zusammenfassen – inklusive der Fähigkeit, die Widersprüche zu erkennen
- den Papierkorb sichten (retten / später ansehen / endgültig löschen)
- einen langen Arbeitstag zusammenfassen
- einen Angebotsentwurf schreiben, ohne Preise zu erfinden
- eine echte Rechnung vom Foto ablesen und in eine saubere Tabelle übertragen
- Anweisungen exakt befolgen: Befehle wörtlich aus einer Doku bilden, ohne sich etwas auszudenken
Bewertet wurde nach Schulnoten von 1 (sehr gut) bis 5 (unbrauchbar). Eine Regel war hart: Wer Fakten erfindet, fällt durch.
Methodik und Grenzen des veröffentlichten Stands
| Merkmal | Dokumentierter Stand |
|---|---|
| Benchmark-Version | Veröffentlichungsstand 0.9, Testmonat Juli 2026; der genaue Testtag ist im veröffentlichten Material nicht ausgewiesen |
| Aufgaben | Sieben Textaufgaben und ein Rechnungstest; nicht jede Modellvariante ist bei jeder Aufgabe ausgewiesen |
| Hardware | Workstation mit NVIDIA RTX 5090 und 32 GB Grafikspeicher; zusätzlicher Zweitrechner ohne veröffentlichte Detailkonfiguration |
| Testfälle | Pro Aufgabe ein eingefrorener interner Testfall; Kunden-, Personen- und interne Systemdetails wurden für die Veröffentlichung entfernt oder neutralisiert |
| Bewertung | Schulnoten 1 bis 5; erfundene Fakten führen zum Durchfallen. Eine detaillierte Rubrik für Halbnoten ist nicht veröffentlicht |
| Wiederholungen und Varianz | Anzahl der Läufe und Umgang mit Varianz sind im veröffentlichten Stand nicht dokumentiert |
| Software und Einstellungen | Inferenzsoftware, Versionen, Kontextlänge, Systemprompt und Samplingparameter sind nicht veröffentlicht |
| Modellstände | Die Bezeichnungen werden unten so wiedergegeben wie in den Grafiken. Vollständige Checkpoint-IDs und Quantisierungen fehlen noch |
| Cloud-Referenz | Claude Sonnet ist ein separat gekennzeichneter Cloud-Vergleich. Genaue Modellversion und Datenbehandlung des Referenzlaufs sind im veröffentlichten Stand nicht dokumentiert |
| Datenquelle der Tabellen | Verlustfreie Transkription der bereits veröffentlichten Notengrafiken; keine zusätzlichen Messwerte und keine Rekonstruktion unbeschrifteter Diagrammpunkte |
Das Ergebnis: kein Modell gewinnt alles
Die vollständige Matrix zeigt auf einen Blick, worauf es ankommt – Modelle in den Spalten, Aufgaben in den Zeilen, grün ist gut, rot ist schlecht.

Hinweis zu den historischen Grafiken: Die pauschale Fußzeile „kein Byte in die Cloud“ bezieht sich nur auf die lokalen Modellläufe. Die ausgewiesene Claude-Sonnet-Referenz ist ein Cloud-Vergleich.
Noten als CSV herunterladen: maschinenlesbares Langformat mit Textmatrix und separatem Vision-Vergleich.
Maschinenlesbare Zusammenfassung
| Modellbezeichnung wie veröffentlicht | Typ | Textmittel | Rechnungstest |
|---|---|---|---|
| Qwen3.6 27B-64k | lokal | 1,4 | – |
| Qwen3.6 35B MoE | lokal | 1,9 | – |
| Gemma4 26B | lokal | 2,4 | 2,0 |
| Mistral-S. 3.2 24B | lokal | 2,7 | 1,5 |
| Qwen3-VL 8B | lokal | 2,9 | 3,0 |
| Qwen3 14B | lokal | 3,0 | – |
| Mistral-S. alt | lokal | 3,3 | – |
| Granite 4.1 8B | lokal | 3,4 | – |
| Gemma4 latest | lokal | 3,4 | 5,0 |
| Qwen3 8B | lokal | 3,7 | – |
| Claude Sonnet | Cloud-Referenz | 1,1 | 1,0 |
Ein Gedankenstrich bedeutet: In der veröffentlichten Grafik ist für diese Kombination keine Note ausgewiesen.
Alle Einzelnoten als HTML-Tabelle anzeigen
| Aufgabe | Modell | Typ | Note |
|---|---|---|---|
| Tagesüberblick am Morgen | Qwen3.6 27B-64k | lokal | 1,5 |
| Tagesüberblick am Morgen | Qwen3.6 35B MoE | lokal | 3,0 |
| Tagesüberblick am Morgen | Gemma4 26B | lokal | 2,5 |
| Tagesüberblick am Morgen | Mistral-S. 3.2 24B | lokal | 2,5 |
| Tagesüberblick am Morgen | Qwen3-VL 8B | lokal | 3,5 |
| Tagesüberblick am Morgen | Qwen3 14B | lokal | 3,0 |
| Tagesüberblick am Morgen | Mistral-S. alt | lokal | 2,5 |
| Tagesüberblick am Morgen | Granite 4.1 8B | lokal | 3,0 |
| Tagesüberblick am Morgen | Gemma4 latest | lokal | 3,5 |
| Tagesüberblick am Morgen | Qwen3 8B | lokal | 3,5 |
| Tagesüberblick am Morgen | Claude Sonnet | Cloud-Referenz | 1,0 |
| Anweisungen exakt befolgen | Qwen3.6 27B-64k | lokal | 2,0 |
| Anweisungen exakt befolgen | Qwen3.6 35B MoE | lokal | 3,0 |
| Anweisungen exakt befolgen | Gemma4 26B | lokal | 3,5 |
| Anweisungen exakt befolgen | Mistral-S. 3.2 24B | lokal | 3,0 |
| Anweisungen exakt befolgen | Qwen3-VL 8B | lokal | 3,0 |
| Anweisungen exakt befolgen | Qwen3 14B | lokal | 3,0 |
| Anweisungen exakt befolgen | Mistral-S. alt | lokal | 5,0 |
| Anweisungen exakt befolgen | Granite 4.1 8B | lokal | 3,5 |
| Anweisungen exakt befolgen | Gemma4 latest | lokal | 4,0 |
| Anweisungen exakt befolgen | Qwen3 8B | lokal | 3,5 |
| Anweisungen exakt befolgen | Claude Sonnet | Cloud-Referenz | 2,0 |
| Projektstand zusammenfassen | Qwen3.6 27B-64k | lokal | 1,0 |
| Projektstand zusammenfassen | Qwen3.6 35B MoE | lokal | 2,0 |
| Projektstand zusammenfassen | Gemma4 26B | lokal | 2,0 |
| Projektstand zusammenfassen | Mistral-S. 3.2 24B | lokal | 2,5 |
| Projektstand zusammenfassen | Qwen3-VL 8B | lokal | 3,0 |
| Projektstand zusammenfassen | Qwen3 14B | lokal | 3,0 |
| Projektstand zusammenfassen | Mistral-S. alt | lokal | 2,5 |
| Projektstand zusammenfassen | Granite 4.1 8B | lokal | 3,5 |
| Projektstand zusammenfassen | Gemma4 latest | lokal | 4,5 |
| Projektstand zusammenfassen | Qwen3 8B | lokal | 4,0 |
| Projektstand zusammenfassen | Claude Sonnet | Cloud-Referenz | 1,0 |
| E-Mails sortieren | Qwen3.6 27B-64k | lokal | 1,0 |
| E-Mails sortieren | Qwen3.6 35B MoE | lokal | 1,0 |
| E-Mails sortieren | Gemma4 26B | lokal | 3,5 |
| E-Mails sortieren | Mistral-S. 3.2 24B | lokal | 2,5 |
| E-Mails sortieren | Qwen3-VL 8B | lokal | 3,0 |
| E-Mails sortieren | Qwen3 14B | lokal | 3,0 |
| E-Mails sortieren | Mistral-S. alt | lokal | 3,0 |
| E-Mails sortieren | Granite 4.1 8B | lokal | 3,5 |
| E-Mails sortieren | Gemma4 latest | lokal | 3,0 |
| E-Mails sortieren | Qwen3 8B | lokal | 4,0 |
| E-Mails sortieren | Claude Sonnet | Cloud-Referenz | 1,0 |
| Papierkorb sichten | Qwen3.6 27B-64k | lokal | 1,5 |
| Papierkorb sichten | Qwen3.6 35B MoE | lokal | 1,5 |
| Papierkorb sichten | Gemma4 26B | lokal | 2,0 |
| Papierkorb sichten | Mistral-S. 3.2 24B | lokal | 4,0 |
| Papierkorb sichten | Qwen3-VL 8B | lokal | 2,5 |
| Papierkorb sichten | Qwen3 14B | lokal | 3,5 |
| Papierkorb sichten | Mistral-S. alt | lokal | 4,0 |
| Papierkorb sichten | Granite 4.1 8B | lokal | 5,0 |
| Papierkorb sichten | Gemma4 latest | lokal | 3,5 |
| Papierkorb sichten | Qwen3 8B | lokal | 5,0 |
| Papierkorb sichten | Claude Sonnet | Cloud-Referenz | 1,0 |
| Arbeitstag zusammenfassen | Qwen3.6 27B-64k | lokal | 1,0 |
| Arbeitstag zusammenfassen | Qwen3.6 35B MoE | lokal | 1,5 |
| Arbeitstag zusammenfassen | Gemma4 26B | lokal | 2,0 |
| Arbeitstag zusammenfassen | Mistral-S. 3.2 24B | lokal | 2,5 |
| Arbeitstag zusammenfassen | Qwen3-VL 8B | lokal | 3,0 |
| Arbeitstag zusammenfassen | Qwen3 14B | lokal | 3,5 |
| Arbeitstag zusammenfassen | Mistral-S. alt | lokal | 3,0 |
| Arbeitstag zusammenfassen | Granite 4.1 8B | lokal | 2,5 |
| Arbeitstag zusammenfassen | Gemma4 latest | lokal | 2,5 |
| Arbeitstag zusammenfassen | Qwen3 8B | lokal | 3,0 |
| Arbeitstag zusammenfassen | Claude Sonnet | Cloud-Referenz | 1,0 |
| Angebot entwerfen | Qwen3.6 27B-64k | lokal | 1,5 |
| Angebot entwerfen | Qwen3.6 35B MoE | lokal | 1,5 |
| Angebot entwerfen | Gemma4 26B | lokal | 1,5 |
| Angebot entwerfen | Mistral-S. 3.2 24B | lokal | 2,0 |
| Angebot entwerfen | Qwen3-VL 8B | lokal | 2,5 |
| Angebot entwerfen | Qwen3 14B | lokal | 2,0 |
| Angebot entwerfen | Mistral-S. alt | lokal | 3,0 |
| Angebot entwerfen | Granite 4.1 8B | lokal | 3,0 |
| Angebot entwerfen | Gemma4 latest | lokal | 2,5 |
| Angebot entwerfen | Qwen3 8B | lokal | 3,0 |
| Angebot entwerfen | Claude Sonnet | Cloud-Referenz | 1,0 |
| Rechnung vom Foto ablesen | Qwen3.6 27B-64k | lokal | – |
| Rechnung vom Foto ablesen | Qwen3.6 35B MoE | lokal | – |
| Rechnung vom Foto ablesen | Gemma4 26B | lokal | 2,0 |
| Rechnung vom Foto ablesen | Mistral-S. 3.2 24B | lokal | 1,5 |
| Rechnung vom Foto ablesen | Qwen3-VL 8B | lokal | 3,0 |
| Rechnung vom Foto ablesen | Qwen3 14B | lokal | – |
| Rechnung vom Foto ablesen | Mistral-S. alt | lokal | – |
| Rechnung vom Foto ablesen | Granite 4.1 8B | lokal | – |
| Rechnung vom Foto ablesen | Gemma4 latest | lokal | 5,0 |
| Rechnung vom Foto ablesen | Qwen3 8B | lokal | – |
| Rechnung vom Foto ablesen | Claude Sonnet | Cloud-Referenz | 1,0 |
| Gesamtnote (Ø sieben Textaufgaben) | Qwen3.6 27B-64k | lokal | 1,4 |
| Gesamtnote (Ø sieben Textaufgaben) | Qwen3.6 35B MoE | lokal | 1,9 |
| Gesamtnote (Ø sieben Textaufgaben) | Gemma4 26B | lokal | 2,4 |
| Gesamtnote (Ø sieben Textaufgaben) | Mistral-S. 3.2 24B | lokal | 2,7 |
| Gesamtnote (Ø sieben Textaufgaben) | Qwen3-VL 8B | lokal | 2,9 |
| Gesamtnote (Ø sieben Textaufgaben) | Qwen3 14B | lokal | 3,0 |
| Gesamtnote (Ø sieben Textaufgaben) | Mistral-S. alt | lokal | 3,3 |
| Gesamtnote (Ø sieben Textaufgaben) | Granite 4.1 8B | lokal | 3,4 |
| Gesamtnote (Ø sieben Textaufgaben) | Gemma4 latest | lokal | 3,4 |
| Gesamtnote (Ø sieben Textaufgaben) | Qwen3 8B | lokal | 3,7 |
| Gesamtnote (Ø sieben Textaufgaben) | Claude Sonnet | Cloud-Referenz | 1,1 |
Die in der Grafik als Qwen3.6 27B-64k bezeichnete lokale Variante erreichte über die sieben Textaufgaben eine Durchschnittsnote von 1,4. In diesem Test war sie die einzige lokale Variante, die Widersprüche in den Notizen markierte und Befehle fehlerfrei bildete. Dahinter folgte eine schnellere Schwester-Variante mit Note 1,9, die bei Befehls-Details Fehler machte. Für vollständige Reproduzierbarkeit fehlen noch die genauen Checkpoint-IDs und Quantisierungen; deshalb bleiben die Modellnamen in Tabelle und CSV bewusst auf dem veröffentlichten Bezeichnungsstand.
Die Kernbotschaft steckt nicht in einer einzelnen Zahl, sondern im Muster: Die richtige Frage ist nicht „Welches Modell ist das beste?”, sondern „Welches Modell für welchen Job?” Ein Modell, das brillante Zusammenfassungen schreibt, kann bei Löschentscheidungen gefährlich danebenliegen.
Cloud gegen lokal: der Abstand ist kleiner, als viele denken
Das oft gehörte Argument lautet: „Lokale KI ist doch viel schlechter.” Unser Test zeichnet ein anderes Bild.

Die Cloud-Referenz Claude Sonnet kam in diesem Test auf eine Durchschnittsnote von 1,1, die beste lokale Variante auf 1,4. Bei den untersuchten Routineaufgaben wie E-Mail-Sortierung und Angebotsentwurf lagen die Noten nah beieinander. Vorteile zeigte die Cloud-Referenz in den hier geprüften Urteilsfällen – etwa bei einer verstrichenen Frist oder der Einordnung eines versehentlich gelöschten Entwurfs.
Für den hier untersuchten Aufgabenmix ist das ein ermutigendes Ergebnis. Bei korrekt konfigurierten lokalen Läufen bleibt die Modellverarbeitung in der eigenen Infrastruktur. Für geeignete, zuvor geprüfte Aufgaben kann eine Cloud-Referenz ergänzend sinnvoll sein. Welche Daten dafür verwendet werden dürfen, muss separat rechtlich, vertraglich und technisch geklärt werden.
Drei Geschichten, die zeigen, worauf es im Betrieb ankommt
„Löschen? Alles!” Wir gaben den ausgewiesenen Textmodellen einen Papierkorb-Testfall mit 15 Mails. Eine kleine, schnelle Variante stufte alle 15 als „endgültig löschen” ein – einschließlich eigener Vertragsentwürfe und einer Zahlungsbestätigung. Die Lehre aus diesem Test: Ein schnelles Modell sollte Entscheidungen mit Folgen nicht ohne zusätzliche Schutzmaßnahmen treffen. Wir verteilen Aufgaben seither nach Risiko; löschen, senden und bezahlen erfordert eine stärkere Prüfung und menschliche Freigabe.
Der 8-Sekunden-Fix. Um 07:13 Uhr stürzte an einem Morgen unser automatischer Tagesüberblick ab. Nicht wegen eines Servers, sondern weil ein Modell sich einen Befehl ausgedacht hatte, den es so nicht gibt. Die Lösung dauerte am Ende acht Sekunden: der KI den Befehl wörtlich vorgeben, statt sie ihn „sinngemäß” bilden zu lassen. Die unterschätzte Eigenschaft eines KI-Modells ist nicht Intelligenz – es ist Disziplin.
Vier Tage Amnesie. Ein Routine-Audit deckte auf, dass fünf unserer Assistenten nach einer Server-Umstellung vier Tage lang auf einen eingefrorenen Gedächtnisstand zugriffen. Das Tückische: Sie liefen weiter, ohne Absturz, ohne Fehlermeldung – nur mit stillem Qualitätsverlust. Der gefährlichste Fehler ist selten der, der laut kracht. Es ist der, der leise weiterläuft. Deshalb prüfen wir Automatisierungen Ende-zu-Ende, von der Anfrage bis zur Datenquelle.
Und die Rechnung? Ein Allrounder schlägt den Spezialisten
Beim Auslesen einer echten Rechnung – Bild rein, strukturierte Daten raus – gewann nicht das teure Spezialmodell für Bilderkennung, sondern ein universelles Modell, das wir eigentlich für Text geholt hatten (Note 1,5).

Rechnungstest als HTML-Tabelle
| Modellbezeichnung wie veröffentlicht | Typ | Note |
|---|---|---|
| Claude Sonnet | Cloud-Referenz | 1,0 |
| Mistral-Small 3.2 24B | lokal | 1,5 |
| Gemma4 26B | lokal | 2,0 |
| Qwen2.5-VL 7B | lokal | 3,0 |
| Qwen3-VL 8B | lokal | 3,0 |
| Gemma4 latest | lokal | 5,0 |
Qwen2.5-VL 7B ist die elfte lokale Modellvariante des Gesamtvergleichs und erscheint nur in diesem separaten Vision-Vergleich, nicht in der Textmatrix.
Ein Warnschild gab es trotzdem: Ein anderes Modell verfälschte in einer Adresse einen Firmennamen – aus einem echten Domainnamen wurde ein täuschend echt aussehender erfundener. KI kann das Auslesen enorm beschleunigen, aber bei Zahlen, Namen und Adressen bleibt das Vier-Augen-Prinzip Pflicht. Automatisieren ja, blind vertrauen nein.
Was der Mittelstand daraus mitnehmen kann
Aus einem Tag Testen und Aufräumen wurde mehr als eine Tabelle – es wurde ein bereinigtes, klar organisiertes KI-System, in dem jedes Modell eine definierte Rolle hat.

Die drei Erkenntnisse, die sich als Prüffragen auf andere Betriebe übertragen lassen:
- Die Matrix zeigt, welche KI welchen Job bekommt. Nicht „das beste Modell” zählt, sondern die belegte Zuordnung: die gründliche Version für alles mit Urteil und Folgen, die schnelle für Routine, kleine Versionen für Hintergrund-Jobs. Genau diese Zuordnung liefert der Test schwarz auf weiß – und sie lässt sich für jeden Betrieb neu vermessen.
- KI-Automatisierung im Mittelstand kann klein und konkret beginnen. Statt eines Großprojekts können Werkzeuge zuerst einen wiederkehrenden Handgriff unterstützen – etwa geschäftsrelevante Mails im Papierkorb zur Prüfung markieren.
- Lokal war in diesem Test für viele Alltagsaufgaben ausreichend. Die untersuchte Workstation bewältigte einen großen Teil der Bürotests ohne externe Modell-API. Ob das auf einen anderen Betrieb übertragbar ist, hängt von Aufgaben, Datenmenge, Modell und Hardware ab.
Datenbasis und Quellen
- Eigene Primärdaten: interner GTSH-Praxistest, veröffentlicht im Juli 2026. Die Noten sind in der Hauptmatrix und im Vision-Vergleich dokumentiert und wurden ohne Ergänzungen in die HTML-Tabellen und die CSV übertragen.
- Hardware-Spezifikation: NVIDIA weist für die GeForce RTX 5090 32 GB GDDR7-Speicher aus. Das belegt die Gerätespezifikation, nicht die intern vergebenen Noten.
- Abgrenzung: Externe Modellkarten können die internen Testergebnisse nicht belegen. Vollständige Checkpoints, Quantisierungen, Prompts, Rohantworten und Laufzeitprotokolle werden deshalb erst ergänzt, wenn die ursprünglichen Testartefakte vorliegen.
Über GTSH Engineering
Wir helfen kleinen und mittleren Betrieben, KI dort einzusetzen, wo sie echten Alltag abnimmt – datenschutzfreundlich, auf Wunsch vollständig auf eigener Hardware. Von der ehrlichen Standortbestimmung über Schulung bis zur laufenden Automatisierung.
Neugierig, was lokale KI in Ihrem Betrieb leisten kann? Sprechen Sie uns an – wir zeigen es Ihnen an Ihren echten Aufgaben.
Hinweis: Alle Zahlen stammen aus einem internen Benchmark. Kunden- und Personendaten sowie interne Systemdetails wurden für diese Veröffentlichung entfernt beziehungsweise neutralisiert. Die maschinenlesbaren Tabellen bilden ausschließlich die bereits veröffentlichten Noten ab.