Anpassen oder anbinden

Fine-Tuning oder RAG: was dein Fall wirklich braucht

Der eine Weg verändert das Modell, der andere versorgt es mit deinen Dokumenten, und die Entscheidung zwischen beiden fällt lange vor dem ersten Trainingslauf.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Seit 1997 am Markt Kleine Gruppen Präsenz und Live-Online Zertifizierte Trainer
Worum es geht

Die falsche Wahl kostet Monate und liefert trotzdem falsche Antworten

Der typische Ablauf sieht so aus: Eine Fachabteilung wünscht sich einen Assistenten, der die eigenen Handbücher kennt. Im Projekt fällt schnell das Wort „Training“, es wird ein Datensatz zusammengetragen, ein Lauf gestartet, und das Ergebnis klingt hervorragend. Beim Prüfen zeigt sich, dass Paragrafennummern nicht stimmen und Zuständigkeiten frei erfunden sind.

Der Aufwand ist dann bereits ausgegeben, und die eigentliche Arbeit steht noch an: Dokumente aufräumen, Fassungen entwirren, eine Suche aufbauen, die den richtigen Absatz findet. Wer umgekehrt startet und zuerst die Wissensanbindung baut, hat nach wenigen Wochen etwas, das man Fachleuten zeigen kann, und weiß danach genau, welche Lücke ein Training überhaupt schließen müsste.

Teuer wird es auch andersherum. Manche Teams stapeln immer längere Kontexte und immer aufwendigere Prompts, um ein Ausgabeformat zu erzwingen, das ein kleines angepasstes Modell zuverlässig und günstiger liefern würde.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Der direkte Vergleich

Der direkte Vergleich

RAG

Wissen wird zur Laufzeit gesucht und dem Modell vorgelegt

Fine-Tuning

Das Modell selbst wird auf Beispielpaare angepasst

Beides kombiniert

Ein angepasstes Modell arbeitet auf gesuchten Quellenauszügen

Wie schnell landet eine geänderte Richtlinie in den Antworten?

RAG

Neues Dokument in den Index, und der nächste Aufruf nutzt bereits die aktuelle Fassung.

Fine-Tuning

Jede inhaltliche Änderung verlangt neue Trainingsdaten und einen weiteren Lauf.

Beides kombiniert

Die Fakten kommen aus dem Index, die Anpassung betrifft nur Form und Sprache.

Lässt sich nachvollziehen, worauf eine Antwort beruht?

RAG

Die verwendeten Textstellen lassen sich mit ausgeben und stichprobenartig prüfen.

Fine-Tuning

Das Gelernte steckt in Gewichten, eine Herkunft einzelner Aussagen gibt es nicht.

Beides kombiniert

Die Belegkette bleibt erhalten, weil die Inhalte weiterhin aus Dokumenten stammen.

Wie gut lässt sich ein festes Ausgabeformat erzwingen?

RAG

Über Prompt und Nachprüfung machbar, bei langen Vorgaben aber teuer und wackelig.

Fine-Tuning

Genau dafür ist es gedacht, Gliederung und Ton sitzen nach dem Training verlässlich.

Beides kombiniert

Das angepasste Modell hält das Format, die Quellen liefern den Inhalt.

Was kostet der Einstieg an Vorbereitung?

RAG

Der Aufwand steckt im Aufräumen der Dokumente und im Aufbau einer brauchbaren Suche.

Fine-Tuning

Ohne kuratierte Beispielpaare und eine Auswertung geht nichts, und beides fehlt meist.

Beides kombiniert

Du brauchst beide Bausteine, das lohnt erst, wenn der Fall stabil beschrieben ist.

Wie teuer wird der laufende Betrieb pro Anfrage?

RAG

Jeder Aufruf trägt die gefundenen Auszüge mit, der Kontext wird dadurch länger.

Fine-Tuning

Kurze Prompts genügen, oft reicht ein kleineres Modell. Den Betrieb eines angepassten Modells lassen sich Anbieter allerdings meist extra bezahlen.

Beides kombiniert

Kürzere Anweisungen senken die Kosten, die Quellenauszüge bleiben aber im Kontext.

Was passiert beim Wechsel auf ein neues Basismodell?

RAG

Der Index bleibt, du tauschst das Modell und prüfst mit dem vorhandenen Testset nach.

Fine-Tuning

Die Anpassung ist an das alte Modell gebunden und muss vollständig wiederholt werden.

Beides kombiniert

Der Wissensteil überlebt den Wechsel, der Trainingslauf ist erneut fällig.

Was passt wann

Wenn deine Antworten aus Dokumenten stammen sollen, die sich regelmäßig ändern
bau zuerst die Wissensanbindung und miss, wie weit sie trägt.
Wenn die Inhalte stabil sind, aber Aufbau, Ton und Ausgabeformat ständig nachgeschärft werden
bau das Training auf sauberen Beispielpaaren.
Wenn ein großes Modell nur wegen langer Formatanweisungen im Einsatz ist
prüf ein kleineres, angepasstes Modell auf denselben Testfällen.

Fünf Fragen, die die Entscheidung tragen

  1. 01 Ändern sich die Inhalte häufiger als das gewünschte Antwortformat?
  2. 02 Muss jede Antwort belegen, aus welchem Dokument sie stammt?
  3. 03 Gibt es hunderte saubere Beispielpaare aus Eingabe und Wunschausgabe?
  4. 04 Soll ein kleineres Modell die Arbeit eines großen übernehmen?
  5. 05 Wer pflegt das Ergebnis, wenn das Basismodell ausgetauscht wird?
Was du mitnimmst

Was du nach dieser Seite entscheiden kannst

Die Frage lässt sich beantworten, ohne vorher ein Modell zu trainieren. Du brauchst dafür eine ehrliche Beschreibung deines Falls, ein kleines Testset und ein paar Kriterien, an denen die Entscheidung wirklich hängt.

Wissen von Verhalten trennen

Du erkennst an einer Anforderung, ob es um Fakten oder um Form geht. Fakten gehören in den Index, Ton und Aufbau lassen sich antrainieren.

Aktualität einplanen

Du schätzt ab, wie oft sich die Inhalte ändern, und leitest daraus ab, welcher Weg überhaupt wartbar bleibt.

Belege verlangen

Du weißt, warum Antworten mit Quellenangabe prüfbar sind und wie sich das mit einem angepassten Modell verbinden lässt.

Kosten realistisch rechnen

Du vergleichst nicht nur den Trainingslauf, sondern auch die laufenden Kosten pro Anfrage und den Aufwand bei jedem Modellwechsel.

Datenlage prüfen

Du erkennst früh, ob im Haus überhaupt Beispielpaare in gleichbleibender Qualität existieren oder ob sie erst entstehen müssten.

Kombination aufsetzen

Du kannst beschreiben, wie ein angepasstes Modell und eine Wissensanbindung zusammenspielen, ohne sich gegenseitig in die Quere zu kommen.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt

Die beiden Wege lösen unterschiedliche Probleme

RAG beantwortet die Frage, woher das Wissen kommt. Vor jeder Antwort sucht ein Retrieval-Schritt passende Textstellen aus deinem Bestand, hängt sie an den Prompt und lässt das Modell daraus formulieren. Ändert sich eine Richtlinie, tauschst du das Dokument im Index aus, und die nächste Antwort nutzt bereits die neue Fassung.

Fine-Tuning beantwortet die Frage, wie das Modell antwortet. Du zeigst ihm hunderte bis tausende Beispielpaare aus Eingabe und gewünschter Ausgabe, und es übernimmt Muster daraus: die Gliederung eines Prüfberichts, den Ton der Kundenkommunikation, das Ausgabeformat für ein nachgelagertes System. Fakten, die in den Trainingsdaten nur beiläufig vorkamen, kann es danach trotzdem nicht zuverlässig abrufen.

Warum Fine-Tuning keine Wissensdatenbank ist

Der teuerste Irrtum ist die Annahme, ein Modell ließe sich mit Firmenwissen füttern. Beim Training werden keine Dokumente abgelegt, sondern Gewichte verschoben. Das Modell wird dadurch nicht nachschlagefähig, es wird nur sicherer darin, Text zu erzeugen, der wie deine Dokumente klingt. Genau das erhöht das Risiko, weil falsche Aussagen anschließend im richtigen Fachjargon daherkommen.

Dazu kommt der Wartungsaufwand. Jede inhaltliche Änderung bedeutet neue Trainingsdaten und einen neuen Lauf, während der Austausch einer PDF-Datei im Index Minuten dauert. Wer Wissen im Modell verankert, baut sich einen Stand, der ab dem Tag der Fertigstellung veraltet.

Was RAG an Arbeit verlangt

RAG ist nicht der bequeme Weg, es verschiebt die Arbeit nur an eine andere Stelle. Die Qualität hängt fast vollständig daran, ob der Suchschritt die richtigen Stellen findet. Schlecht zerlegte Dokumente, fehlende Angaben zu Gültigkeit und Zuständigkeit, zwei Fassungen derselben Richtlinie nebeneinander: das alles schlägt direkt auf die Antwort durch und lässt sich nicht durch einen besseren Prompt reparieren.

Dafür bekommst du etwas, das Fine-Tuning nicht liefert, nämlich Belege. Wenn jede Antwort die verwendeten Quellen mitführt, kann die Fachabteilung stichprobenartig prüfen, und im Streitfall ist nachvollziehbar, worauf sich das System gestützt hat.

Wann beides zusammengehört

Die Kombination ist der Normalfall in reiferen Projekten: RAG liefert die Fakten, Fine-Tuning sorgt für die Form. Typisch ist ein kleineres, angepasstes Modell, das gelernt hat, aus vorgelegten Auszügen knapp und im richtigen Aufbau zu antworten, statt jeden Aufruf mit seitenlangen Formatanweisungen an ein großes Universalmodell zu bezahlen.

Ein zweiter Fall ist die Fachsprache. Wenn dein Gebiet Abkürzungen und Begriffe nutzt, die ein Allgemeinmodell falsch auflöst, hilft eine Anpassung auf Sprachebene, während die eigentlichen Inhalte weiter aus dem Index kommen.

Die Entscheidung vorbereiten

Bevor du dich festlegst, lohnt ein Testset aus mehreren Dutzend echten Fragen mit abgestimmten Musterantworten. Damit misst du zuerst, was ein Standardmodell mit gutem Prompt und angebundenen Quellen schon schafft. Erst die Lücke, die danach bleibt, begründet den Aufwand für ein eigenes Training.

Der zweite Punkt ist die Datenlage. Für ein Training brauchst du Beispielpaare in gleichbleibender Qualität, und die entstehen selten nebenbei. Wenn niemand im Team benennen kann, woher diese Paare kommen und wer sie fachlich freigibt, ist die Frage nach dem Verfahren noch nicht die richtige Frage.

Dazu passende Kurse

Wie ein Training vorbereitet, durchgeführt und ausgewertet wird, zeigen die vertiefenden Kurse zum Anpassen von Sprachmodellen an konkreten Modellen.

Warum belegbare Antworten in regulierten Bereichen den Ausschlag geben, vertiefen die Trainings zur Nachvollziehbarkeit von KI-Antworten .

Wissen prüfen

Wie sicher bist du beim Thema wirklich?

Lesen fühlt sich schnell nach Können an. Ein kurzer Test zeigt dir, was davon schon sitzt und wo sich ein Kurs lohnt. Kostenlos, ohne Anmeldung, mit einer Erklärung zu jeder Antwort.

Die Inhalte wurden sehr gut vermittelt und Fragen wurden perfekt beantwortet.
LLM Security: Injections erkennen & abwehren
Marco ist ein extrem guter Trainer, der mit seinem Fachwissen zum Thema KI sehr viel Expertise mitbringt.
KI Data Science: Datenanalyse Grundkurs
Seminarleiter war sehr gut vorbereitet, Den Lehrstoff hat er ausführlich und praxisorientiert vorgetragen.
ChatGPT Aufbaukurs: Datenanalyse, Automatisierung und Workflows

Häufige Fragen

Reicht ein längeres Kontextfenster nicht statt RAG?
Für kleine, stabile Wissensbestände ja. Sobald der Bestand wächst, zahlst du bei jedem Aufruf für Text, der zur Frage nichts beiträgt, und die Trefferqualität sinkt, weil das Modell Relevantes zwischen viel Beiwerk finden muss. Ein Suchschritt, der zehn passende Absätze vorlegt, ist meist besser und günstiger als hundert Seiten im Prompt.
Wie viele Beispiele braucht ein Fine-Tuning?
Das hängt stark vom Ziel ab. Für Format und Ton reichen oft einige hundert sehr sauber gepflegte Paare, für fachlich anspruchsvolles Verhalten wird es deutlich mehr. Entscheidend ist nicht die Menge, sondern die Einheitlichkeit. Widersprüchliche Beispiele bringen dem Modell bei, sich beliebig zu verhalten.
Was passiert mit einem Fine-Tuning, wenn ein neues Basismodell erscheint?
Die Anpassung hängt am jeweiligen Basismodell und lässt sich nicht übertragen. Beim Wechsel wiederholst du das Training auf dem neuen Modell und prüfst mit demselben Testset, ob die Ergebnisse mindestens gleichwertig sind. Wer das einplant, hält Trainingsdaten und Auswertung versioniert, statt sie jedes Mal neu zusammenzusuchen.

Passt thematisch dazu

Falls an dieser Stelle noch offen ist, was beim Nachtrainieren im Modell passiert , findest du die Antwort im eigenen Eintrag zum Begriff.

Persönlich für dich da

Deine Ansprechpartner

Du bist dir nicht sicher, welcher Kurs oder welches Level zu dir passt? Wir beraten dich persönlich und kostenlos.

Yves Hoppe

Yves Hoppe

Weiterbildung & Beratung

Hilft dir, aus dem KI-Programm den passenden Kurs für deinen Stand zu finden.

Norbert Jansen

Norbert Jansen

Beratung & Inhouse

Plant mit dir Inhouse-Trainings, die auf eure Abläufe und euren Datenbestand zugeschnitten sind.

Den Weg wählen, bevor das Budget entscheidet

In den Kursen zu Anpassung und Wissensanbindung arbeitest du beide Varianten an echten Modellen durch und siehst, wo die jeweilige Grenze liegt.