Was ist ein Embedding?
Vektoreinbettung
Ein Embedding ist die Übersetzung eines Textes, Bildes oder Codeabschnitts in eine Liste von Zahlen, also einen Vektor. Inhalte mit ähnlicher Bedeutung landen dabei nah beieinander, sodass sich Ähnlichkeit rechnerisch über den Abstand zwischen zwei Vektoren bestimmen lässt.
Eine Volltextsuche findet den Urlaubsantrag nicht, wenn im Dokument von Freistellung die Rede ist, ein Vergleich über Vektoren dagegen schon.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
- Wandelt um
- Text, Bild oder Code in Zahlenvektoren
- Misst
- Ähnlichkeit über den Abstand
- Feste Regel
- Ein Modell für Bestand und Anfrage
- Verwechselt mit
- Vektordatenbank
Wie aus Text Zahlen werden
Ein Embedding-Modell bildet jede Eingabe auf einen Vektor fester Länge ab, je nach Modell einige hundert bis einige tausend Zahlen. Die einzelne Zahl bedeutet nichts, die Lage im Raum bedeutet alles. Verglichen wird meist über den Kosinus des Winkels zwischen zwei Vektoren, der auf einer Skala von völlig unähnlich bis praktisch gleich landet.
Der Nutzen zeigt sich dort, wo Wortgleichheit versagt. Rechnung und Faktura haben keinen gemeinsamen Wortstamm, liegen als Vektoren aber dicht beieinander, ebenso Kündigungsfrist und Vertragsende. Eine Suche über Embeddings findet deshalb Dokumente, die kein Stichwort aus der Anfrage enthalten.
Wofür Embeddings im Betrieb taugen
Der häufigste Fall ist die semantische Suche, oft als Zulieferung für eine Antwort aus dem Sprachmodell. Daneben eignen sich Embeddings zum Erkennen von Dubletten, zum Gruppieren von Tickets nach Themen ohne vorgegebene Kategorien und als Merkmale für eine Klassifikation.
Vor der Vektorbildung steht das Zerlegen der Texte, und daran entscheidet sich die Qualität. Zu große Abschnitte mischen mehrere Themen in einem Vektor, der dann zu allem ein bisschen passt und zu nichts richtig. Zu kleine verlieren den Zusammenhang, etwa wenn eine Tabellenzeile ohne ihre Überschrift landet. Bewährt hat sich, an inhaltlichen Grenzen zu schneiden, also an Absätzen und Zwischenüberschriften, mit etwas Überlappung.
Drei Fehler, die teuer werden
Erstens: Vektoren aus verschiedenen Modellen oder Modellversionen lassen sich nicht miteinander vergleichen. Sie liegen in unterschiedlichen Räumen, auch wenn die Zahlenlänge zufällig passt. Ein Modellwechsel bedeutet, den kompletten Bestand neu zu berechnen, deshalb gehört die Modellversion in die Metadaten jedes Eintrags.
Zweitens: Für exakte Zeichenketten sind Embeddings das falsche Werkzeug. Artikelnummern, Aktenzeichen oder Fehlercodes findet eine Stichwortsuche zuverlässig, die semantische Suche liefert dagegen etwas Ähnliches. In der Praxis kombiniert man beides und gewichtet die Trefferlisten zusammen.
Drittens: Ein Embedding ist kein anonymisierter Hash. Aus Vektoren lassen sich Inhalte in Teilen rekonstruieren, deshalb gelten für den Vektorbestand dieselben Schutzanforderungen wie für die Quelltexte, samt Zugriffskontrolle und Löschkonzept.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Embedding und was oft damit gleichgesetzt wird
Das Embedding ist der Inhalt, die Vektordatenbank der Ort, an dem er liegt. Sie sorgt über Indizes für schnelle Nachbarschaftssuche in großen Beständen und verwaltet Filter und Metadaten dazu.
Tokens sind die Einheiten, in die ein Modell Text zum Verarbeiten zerlegt. Sie sind eine technische Zwischenstufe und tragen für sich genommen keine Bedeutung im Sinne einer Ähnlichkeitsmessung.
Der Abruf aus einer Wissensbasis ist das gesamte Verfahren aus Suche, Auswahl und Antwortgenerierung. Embeddings sind darin der Schritt, mit dem passende Textstellen gefunden werden.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Der teuerste Fehler ist der Modellwechsel im laufenden Betrieb
Vektoren aus verschiedenen Modellen lassen sich nicht miteinander vergleichen, auch dann nicht, wenn die Zahlenreihen gleich lang sind. Wechselst du das Modell, musst du den kompletten Bestand neu berechnen, und bis das durch ist, liefert die Suche stillschweigend Unsinn statt einer Fehlermeldung. Schreib deshalb von Anfang an Modellname und Version zu jedem Eintrag, sonst kannst du später nicht unterscheiden, welche Vektoren noch aus dem alten Lauf stammen.
Ähnlich heißt nicht richtig. Zugriff erlaubt und Zugriff verboten stehen sprachlich dicht beieinander und landen deshalb nah beieinander, obwohl sie das Gegenteil bedeuten. Artikelnummern, Aktenzeichen und Versionsstände werden schlecht abgebildet, weil an ihnen nichts Bedeutungstragendes hängt. Für solche Kennungen bleibt die klassische Suche unschlagbar. Meist kombiniert man deshalb beide Verfahren und mischt die Trefferlisten.
Sprache und Länge werden unterschätzt. Liegen deutsche und englische Dokumente in einem Bestand und das Modell kann nur eine Sprache, gruppieren sich die Treffer nach Sprache statt nach Thema. Und je länger ein Abschnitt ist, desto mehr verwischt sein Vektor zu einem Mittelwert aus allem, was darin vorkommt, bis er zu jeder Frage ein bisschen passt und zu keiner richtig.
Embedding lernen
Wie du Texte sinnvoll zerlegst, ein Modell auswählst und Treffer bewertest, behandeln die Schulungen zur Arbeit mit Vektorrepräsentationen an eigenen Beständen.
Die Modelle dahinter kommen aus dem maschinellen Lernen, den Einstieg dazu geben die Kurse zum maschinellen Lernen mit Python .
Sitzt Embedding schon?
Lesen fühlt sich schnell nach Können an. Ein kurzer Test zeigt dir, was davon schon sitzt und wo sich ein Kurs lohnt. Kostenlos, ohne Anmeldung, mit einer Erklärung zu jeder Antwort.
Häufige Fragen
Was ist der Unterschied zwischen Embedding und Vektordatenbank?
Kann ich das Embedding-Modell später wechseln?
Warum findet meine Suche exakte Artikelnummern nicht?
Deine Ansprechpartner
Du willst das Thema nicht nur nachschlagen, sondern anwenden können? Wir beraten dich persönlich und kostenlos.
Yves Hoppe
Weiterbildung & Beratung
Ordnet mit dir ein, welcher Kurs zu deinem Vorwissen passt.
Norbert Jansen
Beratung & Inhouse
Plant Inhouse-Trainings, die an euren eigenen Daten und Abläufen ansetzen.
Embedding im Kurs statt im Lexikon
Nachschlagen bringt dich bis zum Verstehen. Anwenden lernst du an echten Aufgaben.