Modelle ohne Cloud

Sprachmodelle lokal: Was auf dem Notebook läuft

Zwischen dem Eindruck, lokal gehe ohnehin nichts, und der Hoffnung, es ersetze alles, liegt eine schmale, aber brauchbare Klasse von Modellen. Hier stehen ihre Grenzen.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Seit 1997 am Markt Kleine Gruppen Präsenz und Live-Online Zertifizierte Trainer
Worum es geht

Die Entscheidung fällt am Speicher, nicht am Modellnamen

Die Frage kommt fast immer aus einer Datenschutzdiskussion. Ein Fachbereich will mit Verträgen, Bewerbungen oder Protokollen arbeiten, und diese Texte sollen das Haus nicht verlassen. Der erste Reflex ist, ein Modell herunterzuladen und auszuprobieren. In der Vorführung mit drei Sätzen sieht das gut aus, beim ersten echten Dokument mit zwanzig Seiten wird es zäh, und danach gilt das Thema als erledigt.

Zäh wird es aus einem nachvollziehbaren Grund: Nicht das Erzeugen der Antwort dauert, sondern das Einlesen der Eingabe. Wer diesen Unterschied nicht kennt, testet mit kurzen Fragen und plant mit langen Dokumenten.

Beide voreiligen Entscheidungen kosten. Wer zu früh festlegt, dass nur lokal gearbeitet wird, treibt die Leute zurück in den privaten Zugang auf dem Handy, und dort landen dann genau die Texte, die geschützt werden sollten. Wer zu früh festlegt, dass alles in die Cloud geht, verschenkt eine ganze Klasse von Aufgaben, die auf vorhandener Hardware ohne zusätzliche Rechnung gelaufen wären.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Der direkte Vergleich

Der direkte Vergleich

Kleines Modell lokal

läuft auf dem Arbeitsgerät, auch ohne Netzverbindung

Großes Modell als Dienst

über eine Schnittstelle bei einem Anbieter

Weiche zwischen beiden

Alltag lokal, schwere Fälle beim Dienst

Was passiert mit einem vertraulichen Text?

Kleines Modell lokal

Der Text bleibt auf dem Gerät, kein Anbieter sieht ihn, dafür wird das Notebook selbst zum schutzbedürftigen Ort.

Großes Modell als Dienst

Mit Auftragsverarbeitung und abgeschaltetem Training ist das vertretbar, die Prüfung und die Dokumentation musst du aber führen.

Weiche zwischen beiden

Vertrauliches bleibt da, wo es hingehört, allerdings nur so zuverlässig, wie die Einstufung der Texte funktioniert.

Wie lange dauert die Antwort auf ein langes Dokument?

Kleines Modell lokal

Das Einlesen dominiert die Wartezeit, mit genug schnellem Speicher bleibt es erträglich, ohne wird es zäh.

Großes Modell als Dienst

Auch bei langen Eingaben kommt die erste Ausgabe in Sekunden, weil im Hintergrund ganz andere Hardware steht.

Weiche zwischen beiden

Lange Eingaben lassen sich gezielt über den Dienst schicken, kurze bleiben lokal und kosten nichts.

Wie zuverlässig sind mehrstufige Aufgaben?

Kleines Modell lokal

Über mehrere Schritte hinweg verliert das Modell den Faden und liefert plausibel klingende, aber falsche Zwischenergebnisse.

Großes Modell als Dienst

Analysen über mehrere Schritte und Änderungen an Code über Dateigrenzen hinweg sind heute die klare Domäne der großen Modelle.

Weiche zwischen beiden

Anspruchsvolle Fälle landen dort, wo sie funktionieren, vorausgesetzt, jemand hat die Kriterien vorher aufgeschrieben.

Wie entwickeln sich die Kosten mit der Nutzung?

Kleines Modell lokal

Nach der Hardware kostet der zusätzliche Durchlauf nichts, du kannst also ohne Rechnung im Kopf experimentieren.

Großes Modell als Dienst

Die Rechnung wächst mit der Nutzung, das ist planbar, aber nur wenn jemand den Verbrauch misst und begrenzt.

Weiche zwischen beiden

Der Grundverbrauch sinkt spürbar, dafür kommt der Aufwand für die Weiche selbst dazu.

Wie viel Betriebsaufwand entsteht im Team?

Kleines Modell lokal

Installation, einheitlicher Modellstand und Rückfragen der Kollegschaft binden regelmäßig Zeit einer Person.

Großes Modell als Dienst

Es gibt nichts zu betreiben, dafür bist du an Preis, Verfügbarkeit und Modellwechsel des Anbieters gebunden.

Weiche zwischen beiden

Zwei Wege bedeuten zwei Fehlerquellen und eine Regel, die gepflegt und erklärt werden muss.

Wie stabil bleibt das über zwei Jahre?

Kleines Modell lokal

Die Gewichte ändern sich nicht ohne dein Zutun, ein Ergebnis von heute lässt sich in einem Jahr reproduzieren.

Großes Modell als Dienst

Modelle werden abgelöst, und Anweisungen, die auf ein bestimmtes Verhalten gebaut waren, müssen nachgezogen werden.

Weiche zwischen beiden

Die lokale Seite bleibt stabil, die Dienstseite folgt dem Anbieter, du pflegst also beides.

Was passt wann

Wenn deine Aufgaben aus Zusammenfassen, Umformulieren und Einsortieren bestehen und die Texte vertraulich sind
reicht die kleine lokale Klasse, und zwar auf Hardware, die vermutlich schon im Haus steht
Wenn Analysen über viele Schritte laufen oder Code über mehrere Dateien entsteht
bleib beim großen Dienst, das Notebook holt diesen Abstand nicht auf
Wenn beide Fälle regelmäßig vorkommen
schreib die Weiche als Regel auf, sonst entscheidet sie jede Person nach Gefühl und meist gegen den Datenschutz

Fünf Größen, die über den lokalen Betrieb entscheiden

  1. 01 Die Parameterzahl legt fest, wie viel Speicher die Gewichte belegen.
  2. 02 Die Quantisierung senkt diesen Bedarf, sichtbar auf Kosten der Genauigkeit.
  3. 03 Die Länge der Eingabe treibt den Speicherbedarf zusätzlich nach oben.
  4. 04 Der schnelle Speicher entscheidet, ob das Modell komplett hineinpasst.
  5. 05 Passt es nicht, wandern Teile auf den Prozessor und die Antwort wird zäh.
Was du mitnimmst

Was du nach dieser Seite entscheiden kannst

Die Frage ist nicht, ob lokale Modelle gut genug sind, sondern für welche deiner Aufgaben sie es sind. Dafür brauchst du eine Überschlagsrechnung für den Speicher, eine ehrliche Liste deiner tatsächlichen Aufgaben und eine Regel, die im Team gilt.

Speicherbedarf überschlagen

Du rechnest aus Parameterzahl und Quantisierung, ob ein Modell auf ein vorhandenes Gerät passt. Und du weißt, dass die Länge der Eingabe zusätzlich Speicher frisst.

Aufgaben richtig zuschneiden

Du trennst die Fälle, in denen der Text mitgeliefert wird, von denen, die Wissen aus dem Modell brauchen. Genau an dieser Linie verläuft die Qualitätsgrenze.

Eigene Fälle statt Ranglisten

Du baust dir zwanzig Testfälle aus dem eigenen Alltag und entscheidest damit. Diese Sammlung überlebt jeden Modellwechsel und macht den nächsten Vergleich zur halben Stunde Arbeit.

Die Weiche festlegen

Du formulierst eine Regel, welche Art von Text lokal bleibt und welche zum Dienst darf. Ohne diese Regel entsteht die dritte Variante, nämlich der private Zugang auf dem Handy.

Betriebsaufwand einplanen

Du benennst eine Person, die Modellstand und Oberfläche im Team gleich hält. Uneinheitliche Stände sind die häufigste Ursache für widersprüchliche Ergebnisse.

Lizenzlage prüfen

Du liest die Nutzungsbedingungen des Modells, bevor es breit ausgerollt wird. Offene Gewichte und freie kommerzielle Nutzung sind zwei verschiedene Dinge.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt

Was die Hardware wirklich begrenzt

Der Speicherbedarf setzt sich aus zwei Teilen zusammen. Die Gewichte belegen bei 4-Bit-Quantisierung gut ein halbes Gigabyte je Milliarde Parameter, weil die gängigen Verfahren einen Teil der Gewichte feiner auflösen als vier Bit. Ein Modell der 8-Milliarden-Klasse landet damit bei etwa fünf Gigabyte. Dazu kommt der Zwischenspeicher für die Eingabe, und der wächst mit ihrer Länge. Deshalb passt dasselbe Modell für eine kurze Frage bequem in den Speicher und stolpert beim langen Vertrag.

Die zweite Größe ist die Geschwindigkeit, und die zerfällt ebenfalls in zwei Vorgänge. Das Einlesen der Eingabe läuft rechenintensiv am Stück, das Erzeugen der Antwort Wort für Wort. Auf einem Notebook ohne Grafikbeschleunigung merkst du vor allem das Einlesen: Nach dem Absenden passiert erst einmal lange gar nichts. Bei Geräten mit gemeinsam genutztem Speicher zwischen Prozessor und Grafikeinheit fällt das deutlich milder aus, weil das Modell dort nicht in einen kleinen separaten Grafikspeicher gezwängt werden muss.

Passt das Modell nicht vollständig in den schnellen Speicher, werden Teile ausgelagert und bei jedem Wort nachgeladen. Das ist der Punkt, an dem aus zwei Sekunden Wartezeit zwei Minuten werden. Die Regel dahinter ist einfach: Ein kleineres Modell, das ganz hineinpasst, schlägt ein größeres, das nur zur Hälfte hineinpasst.

Wofür die kleine Klasse reicht, und wofür nicht

Verlässlich sind Aufgaben, bei denen der Text mitgeliefert wird: zusammenfassen, umformulieren, den Ton ändern, in vorgegebene Felder extrahieren, in Kategorien einsortieren, eine erste Übersetzungsfassung erzeugen. Das Modell muss dabei nichts wissen, es muss nur umgehen können mit dem, was vor ihm liegt.

Unzuverlässig wird es, sobald Wissen aus dem Modell selbst kommen soll. Ein kleines Modell hat weniger gespeichert und füllt Lücken trotzdem bereitwillig auf. Ebenfalls schwach: Aufgaben über viele Schritte hinweg, Änderungen an Code, der über mehrere Dateien verteilt liegt, und alles, was auf exakte Zahlen aus einer Tabelle hinausläuft.

Statt Ranglisten zu lesen, leg dir zwanzig eigene Fälle an, drei davon absichtlich schwer, und lass sie durch zwei Modelle derselben Größenklasse laufen. Diese halbe Stunde sagt dir mehr über deinen Alltag als jeder Vergleichstest, und du kannst sie in einem halben Jahr wiederholen, wenn eine neue Generation erscheint.

Der Datenschutzvorteil hat Bedingungen

Dass keine Daten das Gerät verlassen, ist das stärkste Argument für den lokalen Betrieb. Es verschiebt aber nur den Ort des Risikos. Das Notebook wird damit zu dem Platz, an dem vertrauliche Texte liegen, samt Gesprächsverlauf. Festplattenverschlüsselung, ein Chatverlauf außerhalb synchronisierter Ordner und eine Regel für die Rückgabe des Geräts gehören deshalb dazu.

Prüfen solltest du außerdem, was die Software selbst nach außen schickt. Modelle werden über das Netz nachgeladen, und manche Oberflächen bringen optionale Nutzungsstatistiken mit. Das ist schnell abgeschaltet, aber nur, wenn jemand hinschaut.

Und die Verarbeitung verschwindet nicht dadurch, dass sie auf dem eigenen Gerät stattfindet. Wenn personenbezogene Daten im Spiel sind, ändert der lokale Betrieb nur, wer beteiligt ist, nicht aber, ob eine Bewertung nötig ist. Das ist keine Hürde, es ist nur ein Punkt, den du früh mit der zuständigen Stelle klärst statt hinterher.

Was der Betrieb im Team kostet, auch ohne Rechnung

Eine Person installiert es, zwanzig stellen danach Fragen. Der häufigste Ärger entsteht nicht durch die Technik, sondern durch Uneinheitlichkeit: Jede Person hat einen anderen Modellstand, die Ergebnisse unterscheiden sich, und niemand kann nachvollziehen, warum. Einigt euch auf einen Modellstand und eine Oberfläche je Team und schreibt beides auf, mitsamt der Version.

Ein echter Vorteil offener Gewichte ist, dass sie sich nicht unter der Hand ändern. Was heute funktioniert, funktioniert in sechs Monaten genauso, weil niemand im Hintergrund ein Modell ablöst. Die Kehrseite: Verbesserungen kommen auch nicht von allein, ein Wechsel ist eine Entscheidung mit Test dahinter.

Ein letzter Punkt, der oft übersehen wird: Offene Gewichte heißen nicht automatisch freie kommerzielle Nutzung. Die Bedingungen unterscheiden sich je Modellfamilie deutlich. Bevor ein Modell unternehmensweit ausgerollt wird, gehört die Lizenz gelesen, nicht danach.

Dazu passende Kurse

Wie du Modell, Oberfläche und Zugriffsrechte so aufsetzt, dass ein ganzes Team damit arbeiten kann, zeigen die Weiterbildungen für den Betrieb eigener Modelle .

Ob sich eigene Hardware gegenüber laufenden Abrufgebühren rechnet, gehst du in den Kurse zur Kostenseite von KI-Vorhaben mit eigenen Zahlen durch.

Wissen prüfen

Wie sicher bist du beim Thema wirklich?

Lesen fühlt sich schnell nach Können an. Ein kurzer Test zeigt dir, was davon schon sitzt und wo sich ein Kurs lohnt. Kostenlos, ohne Anmeldung, mit einer Erklärung zu jeder Antwort.

Die Inhalte wurden sehr gut vermittelt und Fragen wurden perfekt beantwortet.
LLM Security: Injections erkennen & abwehren
Marco ist ein extrem guter Trainer, der mit seinem Fachwissen zum Thema KI sehr viel Expertise mitbringt.
KI Data Science: Datenanalyse Grundkurs
Seminarleiter war sehr gut vorbereitet, Den Lehrstoff hat er ausführlich und praxisorientiert vorgetragen.
ChatGPT Aufbaukurs: Datenanalyse, Automatisierung und Workflows

Häufige Fragen

Reicht ein Notebook ohne dedizierte Grafikkarte?
Für die kleine Klasse ja, wenn genug Arbeitsspeicher da ist. Du merkst den Unterschied vor allem beim Einlesen langer Dokumente, dort wartest du spürbar länger. Geräte, bei denen sich Prozessor und Grafikeinheit denselben Speicher teilen, sind hier deutlich im Vorteil. Der schnellste Weg zur Antwort: Nimm dein längstes echtes Dokument und stoppe die Zeit.
Welches Modell soll ich nehmen?
Entscheide nicht über den Namen, sondern über Größenklasse und Lizenz. Nimm zwei Modelle aus derselben Klasse, lass deine eigenen Testfälle durchlaufen und behalte das, das seltener danebenliegt. Diese Entscheidung veraltet schnell, halte den Aufbau deshalb austauschbar und schreib auf, welcher Stand gerade gilt.
Kann ich unser internes Wissen einbauen?
Ja, und zwar über Suche statt über Training: Die passenden Abschnitte aus euren Dokumenten werden gesucht und dem Modell mitgegeben. Das funktioniert lokal genauso wie beim Dienst und spielt der kleinen Klasse in die Hände, weil der Text dann mitgeliefert wird. Ein eigenes Nachtraining ist selten der richtige erste Schritt, die Qualität der Suche bestimmt am Ende die Qualität der Antwort.
Persönlich für dich da

Deine Ansprechpartner

Du bist dir nicht sicher, welcher Kurs oder welches Level zu dir passt? Wir beraten dich persönlich und kostenlos.

Yves Hoppe

Yves Hoppe

Weiterbildung & Beratung

Hilft dir, aus dem KI-Programm den passenden Kurs für deinen Stand zu finden.

Norbert Jansen

Norbert Jansen

Beratung & Inhouse

Plant mit dir Inhouse-Trainings, die auf eure Abläufe und euren Datenbestand zugeschnitten sind.

Vom Versuch auf dem eigenen Rechner zum belastbaren Aufbau

In den Kursen richtest du Modell, Oberfläche und Rechte so ein, dass mehr als eine Person damit arbeiten kann und die Ergebnisse vergleichbar bleiben.