Sprachmodelle lokal: Was auf dem Notebook läuft
Zwischen dem Eindruck, lokal gehe ohnehin nichts, und der Hoffnung, es ersetze alles, liegt eine schmale, aber brauchbare Klasse von Modellen. Hier stehen ihre Grenzen.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Die Entscheidung fällt am Speicher, nicht am Modellnamen
Die Frage kommt fast immer aus einer Datenschutzdiskussion. Ein Fachbereich will mit Verträgen, Bewerbungen oder Protokollen arbeiten, und diese Texte sollen das Haus nicht verlassen. Der erste Reflex ist, ein Modell herunterzuladen und auszuprobieren. In der Vorführung mit drei Sätzen sieht das gut aus, beim ersten echten Dokument mit zwanzig Seiten wird es zäh, und danach gilt das Thema als erledigt.
Zäh wird es aus einem nachvollziehbaren Grund: Nicht das Erzeugen der Antwort dauert, sondern das Einlesen der Eingabe. Wer diesen Unterschied nicht kennt, testet mit kurzen Fragen und plant mit langen Dokumenten.
Beide voreiligen Entscheidungen kosten. Wer zu früh festlegt, dass nur lokal gearbeitet wird, treibt die Leute zurück in den privaten Zugang auf dem Handy, und dort landen dann genau die Texte, die geschützt werden sollten. Wer zu früh festlegt, dass alles in die Cloud geht, verschenkt eine ganze Klasse von Aufgaben, die auf vorhandener Hardware ohne zusätzliche Rechnung gelaufen wären.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Der direkte Vergleich
Kleines Modell lokal
läuft auf dem Arbeitsgerät, auch ohne Netzverbindung
Großes Modell als Dienst
über eine Schnittstelle bei einem Anbieter
Weiche zwischen beiden
Alltag lokal, schwere Fälle beim Dienst
| Entscheidungsfrage | Kleines Modell lokal | Großes Modell als Dienst | Weiche zwischen beiden |
|---|---|---|---|
| Was passiert mit einem vertraulichen Text? | Stärke Der Text bleibt auf dem Gerät, kein Anbieter sieht ihn, dafür wird das Notebook selbst zum schutzbedürftigen Ort. | Kommt darauf an Mit Auftragsverarbeitung und abgeschaltetem Training ist das vertretbar, die Prüfung und die Dokumentation musst du aber führen. | Kommt darauf an Vertrauliches bleibt da, wo es hingehört, allerdings nur so zuverlässig, wie die Einstufung der Texte funktioniert. |
| Wie lange dauert die Antwort auf ein langes Dokument? | Kommt darauf an Das Einlesen dominiert die Wartezeit, mit genug schnellem Speicher bleibt es erträglich, ohne wird es zäh. | Stärke Auch bei langen Eingaben kommt die erste Ausgabe in Sekunden, weil im Hintergrund ganz andere Hardware steht. | Stärke Lange Eingaben lassen sich gezielt über den Dienst schicken, kurze bleiben lokal und kosten nichts. |
| Wie zuverlässig sind mehrstufige Aufgaben? | Schwäche Über mehrere Schritte hinweg verliert das Modell den Faden und liefert plausibel klingende, aber falsche Zwischenergebnisse. | Stärke Analysen über mehrere Schritte und Änderungen an Code über Dateigrenzen hinweg sind heute die klare Domäne der großen Modelle. | Stärke Anspruchsvolle Fälle landen dort, wo sie funktionieren, vorausgesetzt, jemand hat die Kriterien vorher aufgeschrieben. |
| Wie entwickeln sich die Kosten mit der Nutzung? | Stärke Nach der Hardware kostet der zusätzliche Durchlauf nichts, du kannst also ohne Rechnung im Kopf experimentieren. | Kommt darauf an Die Rechnung wächst mit der Nutzung, das ist planbar, aber nur wenn jemand den Verbrauch misst und begrenzt. | Kommt darauf an Der Grundverbrauch sinkt spürbar, dafür kommt der Aufwand für die Weiche selbst dazu. |
| Wie viel Betriebsaufwand entsteht im Team? | Kommt darauf an Installation, einheitlicher Modellstand und Rückfragen der Kollegschaft binden regelmäßig Zeit einer Person. | Stärke Es gibt nichts zu betreiben, dafür bist du an Preis, Verfügbarkeit und Modellwechsel des Anbieters gebunden. | Schwäche Zwei Wege bedeuten zwei Fehlerquellen und eine Regel, die gepflegt und erklärt werden muss. |
| Wie stabil bleibt das über zwei Jahre? | Stärke Die Gewichte ändern sich nicht ohne dein Zutun, ein Ergebnis von heute lässt sich in einem Jahr reproduzieren. | Kommt darauf an Modelle werden abgelöst, und Anweisungen, die auf ein bestimmtes Verhalten gebaut waren, müssen nachgezogen werden. | Kommt darauf an Die lokale Seite bleibt stabil, die Dienstseite folgt dem Anbieter, du pflegst also beides. |
Was passiert mit einem vertraulichen Text?
Der Text bleibt auf dem Gerät, kein Anbieter sieht ihn, dafür wird das Notebook selbst zum schutzbedürftigen Ort.
Mit Auftragsverarbeitung und abgeschaltetem Training ist das vertretbar, die Prüfung und die Dokumentation musst du aber führen.
Vertrauliches bleibt da, wo es hingehört, allerdings nur so zuverlässig, wie die Einstufung der Texte funktioniert.
Wie lange dauert die Antwort auf ein langes Dokument?
Das Einlesen dominiert die Wartezeit, mit genug schnellem Speicher bleibt es erträglich, ohne wird es zäh.
Auch bei langen Eingaben kommt die erste Ausgabe in Sekunden, weil im Hintergrund ganz andere Hardware steht.
Lange Eingaben lassen sich gezielt über den Dienst schicken, kurze bleiben lokal und kosten nichts.
Wie zuverlässig sind mehrstufige Aufgaben?
Über mehrere Schritte hinweg verliert das Modell den Faden und liefert plausibel klingende, aber falsche Zwischenergebnisse.
Analysen über mehrere Schritte und Änderungen an Code über Dateigrenzen hinweg sind heute die klare Domäne der großen Modelle.
Anspruchsvolle Fälle landen dort, wo sie funktionieren, vorausgesetzt, jemand hat die Kriterien vorher aufgeschrieben.
Wie entwickeln sich die Kosten mit der Nutzung?
Nach der Hardware kostet der zusätzliche Durchlauf nichts, du kannst also ohne Rechnung im Kopf experimentieren.
Die Rechnung wächst mit der Nutzung, das ist planbar, aber nur wenn jemand den Verbrauch misst und begrenzt.
Der Grundverbrauch sinkt spürbar, dafür kommt der Aufwand für die Weiche selbst dazu.
Wie viel Betriebsaufwand entsteht im Team?
Installation, einheitlicher Modellstand und Rückfragen der Kollegschaft binden regelmäßig Zeit einer Person.
Es gibt nichts zu betreiben, dafür bist du an Preis, Verfügbarkeit und Modellwechsel des Anbieters gebunden.
Zwei Wege bedeuten zwei Fehlerquellen und eine Regel, die gepflegt und erklärt werden muss.
Wie stabil bleibt das über zwei Jahre?
Die Gewichte ändern sich nicht ohne dein Zutun, ein Ergebnis von heute lässt sich in einem Jahr reproduzieren.
Modelle werden abgelöst, und Anweisungen, die auf ein bestimmtes Verhalten gebaut waren, müssen nachgezogen werden.
Die lokale Seite bleibt stabil, die Dienstseite folgt dem Anbieter, du pflegst also beides.
Was passt wann
- Wenn deine Aufgaben aus Zusammenfassen, Umformulieren und Einsortieren bestehen und die Texte vertraulich sind
- reicht die kleine lokale Klasse, und zwar auf Hardware, die vermutlich schon im Haus steht
- Wenn Analysen über viele Schritte laufen oder Code über mehrere Dateien entsteht
- bleib beim großen Dienst, das Notebook holt diesen Abstand nicht auf
- Wenn beide Fälle regelmäßig vorkommen
- schreib die Weiche als Regel auf, sonst entscheidet sie jede Person nach Gefühl und meist gegen den Datenschutz
Fünf Größen, die über den lokalen Betrieb entscheiden
- 01 Die Parameterzahl legt fest, wie viel Speicher die Gewichte belegen.
- 02 Die Quantisierung senkt diesen Bedarf, sichtbar auf Kosten der Genauigkeit.
- 03 Die Länge der Eingabe treibt den Speicherbedarf zusätzlich nach oben.
- 04 Der schnelle Speicher entscheidet, ob das Modell komplett hineinpasst.
- 05 Passt es nicht, wandern Teile auf den Prozessor und die Antwort wird zäh.
Was du nach dieser Seite entscheiden kannst
Die Frage ist nicht, ob lokale Modelle gut genug sind, sondern für welche deiner Aufgaben sie es sind. Dafür brauchst du eine Überschlagsrechnung für den Speicher, eine ehrliche Liste deiner tatsächlichen Aufgaben und eine Regel, die im Team gilt.
Speicherbedarf überschlagen
Du rechnest aus Parameterzahl und Quantisierung, ob ein Modell auf ein vorhandenes Gerät passt. Und du weißt, dass die Länge der Eingabe zusätzlich Speicher frisst.
Aufgaben richtig zuschneiden
Du trennst die Fälle, in denen der Text mitgeliefert wird, von denen, die Wissen aus dem Modell brauchen. Genau an dieser Linie verläuft die Qualitätsgrenze.
Eigene Fälle statt Ranglisten
Du baust dir zwanzig Testfälle aus dem eigenen Alltag und entscheidest damit. Diese Sammlung überlebt jeden Modellwechsel und macht den nächsten Vergleich zur halben Stunde Arbeit.
Die Weiche festlegen
Du formulierst eine Regel, welche Art von Text lokal bleibt und welche zum Dienst darf. Ohne diese Regel entsteht die dritte Variante, nämlich der private Zugang auf dem Handy.
Betriebsaufwand einplanen
Du benennst eine Person, die Modellstand und Oberfläche im Team gleich hält. Uneinheitliche Stände sind die häufigste Ursache für widersprüchliche Ergebnisse.
Lizenzlage prüfen
Du liest die Nutzungsbedingungen des Modells, bevor es breit ausgerollt wird. Offene Gewichte und freie kommerzielle Nutzung sind zwei verschiedene Dinge.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Was die Hardware wirklich begrenzt
Der Speicherbedarf setzt sich aus zwei Teilen zusammen. Die Gewichte belegen bei 4-Bit-Quantisierung gut ein halbes Gigabyte je Milliarde Parameter, weil die gängigen Verfahren einen Teil der Gewichte feiner auflösen als vier Bit. Ein Modell der 8-Milliarden-Klasse landet damit bei etwa fünf Gigabyte. Dazu kommt der Zwischenspeicher für die Eingabe, und der wächst mit ihrer Länge. Deshalb passt dasselbe Modell für eine kurze Frage bequem in den Speicher und stolpert beim langen Vertrag.
Die zweite Größe ist die Geschwindigkeit, und die zerfällt ebenfalls in zwei Vorgänge. Das Einlesen der Eingabe läuft rechenintensiv am Stück, das Erzeugen der Antwort Wort für Wort. Auf einem Notebook ohne Grafikbeschleunigung merkst du vor allem das Einlesen: Nach dem Absenden passiert erst einmal lange gar nichts. Bei Geräten mit gemeinsam genutztem Speicher zwischen Prozessor und Grafikeinheit fällt das deutlich milder aus, weil das Modell dort nicht in einen kleinen separaten Grafikspeicher gezwängt werden muss.
Passt das Modell nicht vollständig in den schnellen Speicher, werden Teile ausgelagert und bei jedem Wort nachgeladen. Das ist der Punkt, an dem aus zwei Sekunden Wartezeit zwei Minuten werden. Die Regel dahinter ist einfach: Ein kleineres Modell, das ganz hineinpasst, schlägt ein größeres, das nur zur Hälfte hineinpasst.
Wofür die kleine Klasse reicht, und wofür nicht
Verlässlich sind Aufgaben, bei denen der Text mitgeliefert wird: zusammenfassen, umformulieren, den Ton ändern, in vorgegebene Felder extrahieren, in Kategorien einsortieren, eine erste Übersetzungsfassung erzeugen. Das Modell muss dabei nichts wissen, es muss nur umgehen können mit dem, was vor ihm liegt.
Unzuverlässig wird es, sobald Wissen aus dem Modell selbst kommen soll. Ein kleines Modell hat weniger gespeichert und füllt Lücken trotzdem bereitwillig auf. Ebenfalls schwach: Aufgaben über viele Schritte hinweg, Änderungen an Code, der über mehrere Dateien verteilt liegt, und alles, was auf exakte Zahlen aus einer Tabelle hinausläuft.
Statt Ranglisten zu lesen, leg dir zwanzig eigene Fälle an, drei davon absichtlich schwer, und lass sie durch zwei Modelle derselben Größenklasse laufen. Diese halbe Stunde sagt dir mehr über deinen Alltag als jeder Vergleichstest, und du kannst sie in einem halben Jahr wiederholen, wenn eine neue Generation erscheint.
Der Datenschutzvorteil hat Bedingungen
Dass keine Daten das Gerät verlassen, ist das stärkste Argument für den lokalen Betrieb. Es verschiebt aber nur den Ort des Risikos. Das Notebook wird damit zu dem Platz, an dem vertrauliche Texte liegen, samt Gesprächsverlauf. Festplattenverschlüsselung, ein Chatverlauf außerhalb synchronisierter Ordner und eine Regel für die Rückgabe des Geräts gehören deshalb dazu.
Prüfen solltest du außerdem, was die Software selbst nach außen schickt. Modelle werden über das Netz nachgeladen, und manche Oberflächen bringen optionale Nutzungsstatistiken mit. Das ist schnell abgeschaltet, aber nur, wenn jemand hinschaut.
Und die Verarbeitung verschwindet nicht dadurch, dass sie auf dem eigenen Gerät stattfindet. Wenn personenbezogene Daten im Spiel sind, ändert der lokale Betrieb nur, wer beteiligt ist, nicht aber, ob eine Bewertung nötig ist. Das ist keine Hürde, es ist nur ein Punkt, den du früh mit der zuständigen Stelle klärst statt hinterher.
Was der Betrieb im Team kostet, auch ohne Rechnung
Eine Person installiert es, zwanzig stellen danach Fragen. Der häufigste Ärger entsteht nicht durch die Technik, sondern durch Uneinheitlichkeit: Jede Person hat einen anderen Modellstand, die Ergebnisse unterscheiden sich, und niemand kann nachvollziehen, warum. Einigt euch auf einen Modellstand und eine Oberfläche je Team und schreibt beides auf, mitsamt der Version.
Ein echter Vorteil offener Gewichte ist, dass sie sich nicht unter der Hand ändern. Was heute funktioniert, funktioniert in sechs Monaten genauso, weil niemand im Hintergrund ein Modell ablöst. Die Kehrseite: Verbesserungen kommen auch nicht von allein, ein Wechsel ist eine Entscheidung mit Test dahinter.
Ein letzter Punkt, der oft übersehen wird: Offene Gewichte heißen nicht automatisch freie kommerzielle Nutzung. Die Bedingungen unterscheiden sich je Modellfamilie deutlich. Bevor ein Modell unternehmensweit ausgerollt wird, gehört die Lizenz gelesen, nicht danach.
Dazu passende Kurse
Wie du Modell, Oberfläche und Zugriffsrechte so aufsetzt, dass ein ganzes Team damit arbeiten kann, zeigen die Weiterbildungen für den Betrieb eigener Modelle .
Ob sich eigene Hardware gegenüber laufenden Abrufgebühren rechnet, gehst du in den Kurse zur Kostenseite von KI-Vorhaben mit eigenen Zahlen durch.
Wie sicher bist du beim Thema wirklich?
Lesen fühlt sich schnell nach Können an. Ein kurzer Test zeigt dir, was davon schon sitzt und wo sich ein Kurs lohnt. Kostenlos, ohne Anmeldung, mit einer Erklärung zu jeder Antwort.
Die Inhalte wurden sehr gut vermittelt und Fragen wurden perfekt beantwortet.
Marco ist ein extrem guter Trainer, der mit seinem Fachwissen zum Thema KI sehr viel Expertise mitbringt.
Seminarleiter war sehr gut vorbereitet, Den Lehrstoff hat er ausführlich und praxisorientiert vorgetragen.
Häufige Fragen
Reicht ein Notebook ohne dedizierte Grafikkarte?
Welches Modell soll ich nehmen?
Kann ich unser internes Wissen einbauen?
Deine Ansprechpartner
Du bist dir nicht sicher, welcher Kurs oder welches Level zu dir passt? Wir beraten dich persönlich und kostenlos.
Yves Hoppe
Weiterbildung & Beratung
Hilft dir, aus dem KI-Programm den passenden Kurs für deinen Stand zu finden.
Norbert Jansen
Beratung & Inhouse
Plant mit dir Inhouse-Trainings, die auf eure Abläufe und euren Datenbestand zugeschnitten sind.
Vom Versuch auf dem eigenen Rechner zum belastbaren Aufbau
In den Kursen richtest du Modell, Oberfläche und Rechte so ein, dass mehr als eine Person damit arbeiten kann und die Ergebnisse vergleichbar bleiben.