Zum Hauptinhalt springen
· 10 Min. Lesezeit · von Randolf Hahn

Elf lokale KI-Modelle im Praxistest – plus Cloud-Referenz

Elf lokale KI-Modellvarianten in sieben Textaufgaben und einem Rechnungstest – plus Cloud-Referenz. Mit Notenmatrix, CSV, Methodik und transparenten Grenzen.

Lokale KIPraxistestMittelstandDatenschutz

Die meisten Vergleiche von KI-Sprachmodellen messen dasselbe: Logikrätsel, Mathe-Aufgaben, Wissensfragen. Interessant für die Forschung – aber sie beantworten nicht die Frage, die sich ein Betrieb wirklich stellt: Kann dieses Modell meinen Montagmorgen übernehmen?

Also haben wir genau das getestet. An einem einzigen Tag haben wir elf unterschiedliche lokale Modellvarianten und eine separat ausgewiesene Cloud-Referenz anhand von sieben Textaufgaben und einem Rechnungstest aus unserem eigenen Arbeitsalltag geprüft. Zehn lokale Varianten stehen in der Textmatrix; eine weitere lokale Vision-Variante erscheint im separaten Rechnungstest. Nicht jede Variante wurde bei jeder Aufgabe ausgewiesen. Das Ergebnis ist eine Entscheidungsmatrix, aus der wir seither ableiten, welches Modell welche Aufgabe bekommt.

Die lokalen Modellläufe liefen auf unserer eigenen Hardware: einer Workstation mit NVIDIA RTX 5090 (32 GB Grafikspeicher) sowie einem einfachen Zweitrechner für Hintergrund-Jobs. Für diese lokalen Läufe wurde keine externe Modell-API oder Cloud-KI verwendet. Die separat gekennzeichnete Claude-Sonnet-Referenz ist davon ausdrücklich ausgenommen. Der Test zeigt damit, was diese konkrete Hardware-Konfiguration im untersuchten Aufgabenmix geleistet hat; er ist keine allgemeine Hardware-Empfehlung.

Der Aufbau: acht echte Jobs statt Benchmark-Rätsel

Für jede Aufgabe wurde derselbe eingefrorene Testfall verwendet, damit die ausgewiesenen Noten vergleichbar sind. Die acht Aufgaben deckten typische Abläufe eines kleinen Betriebs ab:

  • den Tagesüberblick am Morgen aus Mails, Kalender und Notizen zusammenstellen
  • 20 E-Mails nach Wichtigkeit sortieren
  • aus verstreuten, teils widersprüchlichen Projektnotizen einen sauberen Projektstand zusammenfassen – inklusive der Fähigkeit, die Widersprüche zu erkennen
  • den Papierkorb sichten (retten / später ansehen / endgültig löschen)
  • einen langen Arbeitstag zusammenfassen
  • einen Angebotsentwurf schreiben, ohne Preise zu erfinden
  • eine echte Rechnung vom Foto ablesen und in eine saubere Tabelle übertragen
  • Anweisungen exakt befolgen: Befehle wörtlich aus einer Doku bilden, ohne sich etwas auszudenken

Bewertet wurde nach Schulnoten von 1 (sehr gut) bis 5 (unbrauchbar). Eine Regel war hart: Wer Fakten erfindet, fällt durch.

Methodik und Grenzen des veröffentlichten Stands

MerkmalDokumentierter Stand
Benchmark-VersionVeröffentlichungsstand 0.9, Testmonat Juli 2026; der genaue Testtag ist im veröffentlichten Material nicht ausgewiesen
AufgabenSieben Textaufgaben und ein Rechnungstest; nicht jede Modellvariante ist bei jeder Aufgabe ausgewiesen
HardwareWorkstation mit NVIDIA RTX 5090 und 32 GB Grafikspeicher; zusätzlicher Zweitrechner ohne veröffentlichte Detailkonfiguration
TestfällePro Aufgabe ein eingefrorener interner Testfall; Kunden-, Personen- und interne Systemdetails wurden für die Veröffentlichung entfernt oder neutralisiert
BewertungSchulnoten 1 bis 5; erfundene Fakten führen zum Durchfallen. Eine detaillierte Rubrik für Halbnoten ist nicht veröffentlicht
Wiederholungen und VarianzAnzahl der Läufe und Umgang mit Varianz sind im veröffentlichten Stand nicht dokumentiert
Software und EinstellungenInferenzsoftware, Versionen, Kontextlänge, Systemprompt und Samplingparameter sind nicht veröffentlicht
ModellständeDie Bezeichnungen werden unten so wiedergegeben wie in den Grafiken. Vollständige Checkpoint-IDs und Quantisierungen fehlen noch
Cloud-ReferenzClaude Sonnet ist ein separat gekennzeichneter Cloud-Vergleich. Genaue Modellversion und Datenbehandlung des Referenzlaufs sind im veröffentlichten Stand nicht dokumentiert
Datenquelle der TabellenVerlustfreie Transkription der bereits veröffentlichten Notengrafiken; keine zusätzlichen Messwerte und keine Rekonstruktion unbeschrifteter Diagrammpunkte

Das Ergebnis: kein Modell gewinnt alles

Die vollständige Matrix zeigt auf einen Blick, worauf es ankommt – Modelle in den Spalten, Aufgaben in den Zeilen, grün ist gut, rot ist schlecht.

Noten-Matrix: 11 Modelle x 8 Jobs

Hinweis zu den historischen Grafiken: Die pauschale Fußzeile „kein Byte in die Cloud“ bezieht sich nur auf die lokalen Modellläufe. Die ausgewiesene Claude-Sonnet-Referenz ist ein Cloud-Vergleich.

Noten als CSV herunterladen: maschinenlesbares Langformat mit Textmatrix und separatem Vision-Vergleich.

Maschinenlesbare Zusammenfassung

Modellbezeichnung wie veröffentlichtTypTextmittelRechnungstest
Qwen3.6 27B-64klokal1,4
Qwen3.6 35B MoElokal1,9
Gemma4 26Blokal2,42,0
Mistral-S. 3.2 24Blokal2,71,5
Qwen3-VL 8Blokal2,93,0
Qwen3 14Blokal3,0
Mistral-S. altlokal3,3
Granite 4.1 8Blokal3,4
Gemma4 latestlokal3,45,0
Qwen3 8Blokal3,7
Claude SonnetCloud-Referenz1,11,0

Ein Gedankenstrich bedeutet: In der veröffentlichten Grafik ist für diese Kombination keine Note ausgewiesen.

Alle Einzelnoten als HTML-Tabelle anzeigen
Transkription der veröffentlichten Hauptmatrix
AufgabeModellTypNote
Tagesüberblick am MorgenQwen3.6 27B-64klokal1,5
Tagesüberblick am MorgenQwen3.6 35B MoElokal3,0
Tagesüberblick am MorgenGemma4 26Blokal2,5
Tagesüberblick am MorgenMistral-S. 3.2 24Blokal2,5
Tagesüberblick am MorgenQwen3-VL 8Blokal3,5
Tagesüberblick am MorgenQwen3 14Blokal3,0
Tagesüberblick am MorgenMistral-S. altlokal2,5
Tagesüberblick am MorgenGranite 4.1 8Blokal3,0
Tagesüberblick am MorgenGemma4 latestlokal3,5
Tagesüberblick am MorgenQwen3 8Blokal3,5
Tagesüberblick am MorgenClaude SonnetCloud-Referenz1,0
Anweisungen exakt befolgenQwen3.6 27B-64klokal2,0
Anweisungen exakt befolgenQwen3.6 35B MoElokal3,0
Anweisungen exakt befolgenGemma4 26Blokal3,5
Anweisungen exakt befolgenMistral-S. 3.2 24Blokal3,0
Anweisungen exakt befolgenQwen3-VL 8Blokal3,0
Anweisungen exakt befolgenQwen3 14Blokal3,0
Anweisungen exakt befolgenMistral-S. altlokal5,0
Anweisungen exakt befolgenGranite 4.1 8Blokal3,5
Anweisungen exakt befolgenGemma4 latestlokal4,0
Anweisungen exakt befolgenQwen3 8Blokal3,5
Anweisungen exakt befolgenClaude SonnetCloud-Referenz2,0
Projektstand zusammenfassenQwen3.6 27B-64klokal1,0
Projektstand zusammenfassenQwen3.6 35B MoElokal2,0
Projektstand zusammenfassenGemma4 26Blokal2,0
Projektstand zusammenfassenMistral-S. 3.2 24Blokal2,5
Projektstand zusammenfassenQwen3-VL 8Blokal3,0
Projektstand zusammenfassenQwen3 14Blokal3,0
Projektstand zusammenfassenMistral-S. altlokal2,5
Projektstand zusammenfassenGranite 4.1 8Blokal3,5
Projektstand zusammenfassenGemma4 latestlokal4,5
Projektstand zusammenfassenQwen3 8Blokal4,0
Projektstand zusammenfassenClaude SonnetCloud-Referenz1,0
E-Mails sortierenQwen3.6 27B-64klokal1,0
E-Mails sortierenQwen3.6 35B MoElokal1,0
E-Mails sortierenGemma4 26Blokal3,5
E-Mails sortierenMistral-S. 3.2 24Blokal2,5
E-Mails sortierenQwen3-VL 8Blokal3,0
E-Mails sortierenQwen3 14Blokal3,0
E-Mails sortierenMistral-S. altlokal3,0
E-Mails sortierenGranite 4.1 8Blokal3,5
E-Mails sortierenGemma4 latestlokal3,0
E-Mails sortierenQwen3 8Blokal4,0
E-Mails sortierenClaude SonnetCloud-Referenz1,0
Papierkorb sichtenQwen3.6 27B-64klokal1,5
Papierkorb sichtenQwen3.6 35B MoElokal1,5
Papierkorb sichtenGemma4 26Blokal2,0
Papierkorb sichtenMistral-S. 3.2 24Blokal4,0
Papierkorb sichtenQwen3-VL 8Blokal2,5
Papierkorb sichtenQwen3 14Blokal3,5
Papierkorb sichtenMistral-S. altlokal4,0
Papierkorb sichtenGranite 4.1 8Blokal5,0
Papierkorb sichtenGemma4 latestlokal3,5
Papierkorb sichtenQwen3 8Blokal5,0
Papierkorb sichtenClaude SonnetCloud-Referenz1,0
Arbeitstag zusammenfassenQwen3.6 27B-64klokal1,0
Arbeitstag zusammenfassenQwen3.6 35B MoElokal1,5
Arbeitstag zusammenfassenGemma4 26Blokal2,0
Arbeitstag zusammenfassenMistral-S. 3.2 24Blokal2,5
Arbeitstag zusammenfassenQwen3-VL 8Blokal3,0
Arbeitstag zusammenfassenQwen3 14Blokal3,5
Arbeitstag zusammenfassenMistral-S. altlokal3,0
Arbeitstag zusammenfassenGranite 4.1 8Blokal2,5
Arbeitstag zusammenfassenGemma4 latestlokal2,5
Arbeitstag zusammenfassenQwen3 8Blokal3,0
Arbeitstag zusammenfassenClaude SonnetCloud-Referenz1,0
Angebot entwerfenQwen3.6 27B-64klokal1,5
Angebot entwerfenQwen3.6 35B MoElokal1,5
Angebot entwerfenGemma4 26Blokal1,5
Angebot entwerfenMistral-S. 3.2 24Blokal2,0
Angebot entwerfenQwen3-VL 8Blokal2,5
Angebot entwerfenQwen3 14Blokal2,0
Angebot entwerfenMistral-S. altlokal3,0
Angebot entwerfenGranite 4.1 8Blokal3,0
Angebot entwerfenGemma4 latestlokal2,5
Angebot entwerfenQwen3 8Blokal3,0
Angebot entwerfenClaude SonnetCloud-Referenz1,0
Rechnung vom Foto ablesenQwen3.6 27B-64klokal
Rechnung vom Foto ablesenQwen3.6 35B MoElokal
Rechnung vom Foto ablesenGemma4 26Blokal2,0
Rechnung vom Foto ablesenMistral-S. 3.2 24Blokal1,5
Rechnung vom Foto ablesenQwen3-VL 8Blokal3,0
Rechnung vom Foto ablesenQwen3 14Blokal
Rechnung vom Foto ablesenMistral-S. altlokal
Rechnung vom Foto ablesenGranite 4.1 8Blokal
Rechnung vom Foto ablesenGemma4 latestlokal5,0
Rechnung vom Foto ablesenQwen3 8Blokal
Rechnung vom Foto ablesenClaude SonnetCloud-Referenz1,0
Gesamtnote (Ø sieben Textaufgaben)Qwen3.6 27B-64klokal1,4
Gesamtnote (Ø sieben Textaufgaben)Qwen3.6 35B MoElokal1,9
Gesamtnote (Ø sieben Textaufgaben)Gemma4 26Blokal2,4
Gesamtnote (Ø sieben Textaufgaben)Mistral-S. 3.2 24Blokal2,7
Gesamtnote (Ø sieben Textaufgaben)Qwen3-VL 8Blokal2,9
Gesamtnote (Ø sieben Textaufgaben)Qwen3 14Blokal3,0
Gesamtnote (Ø sieben Textaufgaben)Mistral-S. altlokal3,3
Gesamtnote (Ø sieben Textaufgaben)Granite 4.1 8Blokal3,4
Gesamtnote (Ø sieben Textaufgaben)Gemma4 latestlokal3,4
Gesamtnote (Ø sieben Textaufgaben)Qwen3 8Blokal3,7
Gesamtnote (Ø sieben Textaufgaben)Claude SonnetCloud-Referenz1,1

Die in der Grafik als Qwen3.6 27B-64k bezeichnete lokale Variante erreichte über die sieben Textaufgaben eine Durchschnittsnote von 1,4. In diesem Test war sie die einzige lokale Variante, die Widersprüche in den Notizen markierte und Befehle fehlerfrei bildete. Dahinter folgte eine schnellere Schwester-Variante mit Note 1,9, die bei Befehls-Details Fehler machte. Für vollständige Reproduzierbarkeit fehlen noch die genauen Checkpoint-IDs und Quantisierungen; deshalb bleiben die Modellnamen in Tabelle und CSV bewusst auf dem veröffentlichten Bezeichnungsstand.

Die Kernbotschaft steckt nicht in einer einzelnen Zahl, sondern im Muster: Die richtige Frage ist nicht „Welches Modell ist das beste?”, sondern „Welches Modell für welchen Job?” Ein Modell, das brillante Zusammenfassungen schreibt, kann bei Löschentscheidungen gefährlich danebenliegen.

Cloud gegen lokal: der Abstand ist kleiner, als viele denken

Das oft gehörte Argument lautet: „Lokale KI ist doch viel schlechter.” Unser Test zeichnet ein anderes Bild.

Qualität vs. Tempo der lokalen Modelle

Die Cloud-Referenz Claude Sonnet kam in diesem Test auf eine Durchschnittsnote von 1,1, die beste lokale Variante auf 1,4. Bei den untersuchten Routineaufgaben wie E-Mail-Sortierung und Angebotsentwurf lagen die Noten nah beieinander. Vorteile zeigte die Cloud-Referenz in den hier geprüften Urteilsfällen – etwa bei einer verstrichenen Frist oder der Einordnung eines versehentlich gelöschten Entwurfs.

Für den hier untersuchten Aufgabenmix ist das ein ermutigendes Ergebnis. Bei korrekt konfigurierten lokalen Läufen bleibt die Modellverarbeitung in der eigenen Infrastruktur. Für geeignete, zuvor geprüfte Aufgaben kann eine Cloud-Referenz ergänzend sinnvoll sein. Welche Daten dafür verwendet werden dürfen, muss separat rechtlich, vertraglich und technisch geklärt werden.

Drei Geschichten, die zeigen, worauf es im Betrieb ankommt

„Löschen? Alles!” Wir gaben den ausgewiesenen Textmodellen einen Papierkorb-Testfall mit 15 Mails. Eine kleine, schnelle Variante stufte alle 15 als „endgültig löschen” ein – einschließlich eigener Vertragsentwürfe und einer Zahlungsbestätigung. Die Lehre aus diesem Test: Ein schnelles Modell sollte Entscheidungen mit Folgen nicht ohne zusätzliche Schutzmaßnahmen treffen. Wir verteilen Aufgaben seither nach Risiko; löschen, senden und bezahlen erfordert eine stärkere Prüfung und menschliche Freigabe.

Der 8-Sekunden-Fix. Um 07:13 Uhr stürzte an einem Morgen unser automatischer Tagesüberblick ab. Nicht wegen eines Servers, sondern weil ein Modell sich einen Befehl ausgedacht hatte, den es so nicht gibt. Die Lösung dauerte am Ende acht Sekunden: der KI den Befehl wörtlich vorgeben, statt sie ihn „sinngemäß” bilden zu lassen. Die unterschätzte Eigenschaft eines KI-Modells ist nicht Intelligenz – es ist Disziplin.

Vier Tage Amnesie. Ein Routine-Audit deckte auf, dass fünf unserer Assistenten nach einer Server-Umstellung vier Tage lang auf einen eingefrorenen Gedächtnisstand zugriffen. Das Tückische: Sie liefen weiter, ohne Absturz, ohne Fehlermeldung – nur mit stillem Qualitätsverlust. Der gefährlichste Fehler ist selten der, der laut kracht. Es ist der, der leise weiterläuft. Deshalb prüfen wir Automatisierungen Ende-zu-Ende, von der Anfrage bis zur Datenquelle.

Und die Rechnung? Ein Allrounder schlägt den Spezialisten

Beim Auslesen einer echten Rechnung – Bild rein, strukturierte Daten raus – gewann nicht das teure Spezialmodell für Bilderkennung, sondern ein universelles Modell, das wir eigentlich für Text geholt hatten (Note 1,5).

Vision-Vergleich: Rechnung als Bild zu JSON

Rechnungstest als HTML-Tabelle

Modellbezeichnung wie veröffentlichtTypNote
Claude SonnetCloud-Referenz1,0
Mistral-Small 3.2 24Blokal1,5
Gemma4 26Blokal2,0
Qwen2.5-VL 7Blokal3,0
Qwen3-VL 8Blokal3,0
Gemma4 latestlokal5,0

Qwen2.5-VL 7B ist die elfte lokale Modellvariante des Gesamtvergleichs und erscheint nur in diesem separaten Vision-Vergleich, nicht in der Textmatrix.

Ein Warnschild gab es trotzdem: Ein anderes Modell verfälschte in einer Adresse einen Firmennamen – aus einem echten Domainnamen wurde ein täuschend echt aussehender erfundener. KI kann das Auslesen enorm beschleunigen, aber bei Zahlen, Namen und Adressen bleibt das Vier-Augen-Prinzip Pflicht. Automatisieren ja, blind vertrauen nein.

Was der Mittelstand daraus mitnehmen kann

Aus einem Tag Testen und Aufräumen wurde mehr als eine Tabelle – es wurde ein bereinigtes, klar organisiertes KI-System, in dem jedes Modell eine definierte Rolle hat.

Vorher/Nachher: Aufgeräumtes Line-up und Logs

Die drei Erkenntnisse, die sich als Prüffragen auf andere Betriebe übertragen lassen:

  1. Die Matrix zeigt, welche KI welchen Job bekommt. Nicht „das beste Modell” zählt, sondern die belegte Zuordnung: die gründliche Version für alles mit Urteil und Folgen, die schnelle für Routine, kleine Versionen für Hintergrund-Jobs. Genau diese Zuordnung liefert der Test schwarz auf weiß – und sie lässt sich für jeden Betrieb neu vermessen.
  2. KI-Automatisierung im Mittelstand kann klein und konkret beginnen. Statt eines Großprojekts können Werkzeuge zuerst einen wiederkehrenden Handgriff unterstützen – etwa geschäftsrelevante Mails im Papierkorb zur Prüfung markieren.
  3. Lokal war in diesem Test für viele Alltagsaufgaben ausreichend. Die untersuchte Workstation bewältigte einen großen Teil der Bürotests ohne externe Modell-API. Ob das auf einen anderen Betrieb übertragbar ist, hängt von Aufgaben, Datenmenge, Modell und Hardware ab.

Datenbasis und Quellen

  • Eigene Primärdaten: interner GTSH-Praxistest, veröffentlicht im Juli 2026. Die Noten sind in der Hauptmatrix und im Vision-Vergleich dokumentiert und wurden ohne Ergänzungen in die HTML-Tabellen und die CSV übertragen.
  • Hardware-Spezifikation: NVIDIA weist für die GeForce RTX 5090 32 GB GDDR7-Speicher aus. Das belegt die Gerätespezifikation, nicht die intern vergebenen Noten.
  • Abgrenzung: Externe Modellkarten können die internen Testergebnisse nicht belegen. Vollständige Checkpoints, Quantisierungen, Prompts, Rohantworten und Laufzeitprotokolle werden deshalb erst ergänzt, wenn die ursprünglichen Testartefakte vorliegen.

Über GTSH Engineering

Wir helfen kleinen und mittleren Betrieben, KI dort einzusetzen, wo sie echten Alltag abnimmt – datenschutzfreundlich, auf Wunsch vollständig auf eigener Hardware. Von der ehrlichen Standortbestimmung über Schulung bis zur laufenden Automatisierung.

Neugierig, was lokale KI in Ihrem Betrieb leisten kann? Sprechen Sie uns an – wir zeigen es Ihnen an Ihren echten Aufgaben.

Hinweis: Alle Zahlen stammen aus einem internen Benchmark. Kunden- und Personendaten sowie interne Systemdetails wurden für diese Veröffentlichung entfernt beziehungsweise neutralisiert. Die maschinenlesbaren Tabellen bilden ausschließlich die bereits veröffentlichten Noten ab.

Was lokale KI in Ihrem Betrieb leisten kann?

Wir zeigen es Ihnen an Ihren echten Aufgaben, kostenlos und unverbindlich.

Kostenloses 30-Minuten-Gespräch sichern