Embedding Ein Embedding ist die Darstellung eines Textstücks als Zahlenfolge, in der inhaltliche Ähnlichkeit als räumliche Nähe abgebildet wird. Verwandte Inhalte liegen dicht beieinander, unverwandte weit auseinander. Auf dieser Eigenschaft beruhen semantische Suche, Empfehlungen und die Trefferauswahl in Systemen mit Quellenabruf.
Kurz-Fakten
Übliche Größen zwischen 384 und 3072 Dimensionen
Ähnlichkeit wird meist über den Kosinus gemessen
Embeddings verschiedener Modelle sind nicht vergleichbar
Ein Modellwechsel erfordert die Neuberechnung des gesamten Index
Bedeutung in der Praxis
Embeddings bilden Ähnlichkeit ab, nicht Wahrheit. Zwei Sätze mit gegenteiliger Aussage können sehr nah beieinanderliegen – ein häufiger Grund für schlechte Treffer in Systemen mit Quellenabruf.
Für die inhaltliche Arbeit heißt das: Eindeutigkeit hilft. Ein Absatz, der klar sagt, was gilt und was nicht, ist leichter richtig einzuordnen als einer, der abwägt, ohne zu entscheiden.
Inhaber von SEO NW in Bertingen, Sachsen-Anhalt. Optimiert seit 2012 Websites für Suchmaschinen und arbeitet seit dem Aufkommen generativer Antwortsysteme an derselben Frage für Sprachmodelle: unter welchen Bedingungen ein Inhalt übernommen und der richtigen Quelle zugeschrieben wird. Schwerpunkt: technisches SEO, strukturierte Daten und Generative Engine Optimization.