Agentic Relations

Embedding

Dichte Vektor-Repräsentation von Text, Bild oder anderen Modalitäten in einem hochdimensionalen Raum, in dem semantische Ähnlichkeit durch geometrische Nähe ausgedrückt wird.

Definition

Ein Embedding ist eine dichte Vektor-Repräsentation eines Inhalts in einem hochdimensionalen Vektorraum. Die zentrale Eigenschaft: semantisch ähnliche Inhalte liegen geometrisch nahe beieinander. Statt diskrete Symbole oder Wörter zu vergleichen, wird über reelle Zahlen-Vektoren gerechnet, was differenzierbares Lernen, Clustering, Suche und Klassifikation ermöglicht.

Embeddings sind die Brücke zwischen Sprache und Geometrie und damit die unverzichtbare Vorstufe praktisch jeder modernen NLP-Pipeline. Sie sind das Rückgrat von RAG-Systemen, semantischer Suche, Empfehlungssystemen, Klassifikation und Clustering.

Mechanismus

Embeddings werden in mehreren Schritten erzeugt:

  • Tokenisierung: Text wird in Sub-Wort-Tokens zerlegt (BPE, WordPiece, SentencePiece).
  • Encoder-Forward: Tokens durchlaufen einen Transformer-Encoder (meist bidirektional).
  • Pooling: Token-Repräsentationen werden zu einem einzelnen Sequenz-Vektor aggregiert, typisch via Mean Pooling oder CLS-Token.
  • Normalisierung: L2-Normalisierung sorgt dafür, dass Cosine Similarity und Dot Product äquivalent werden.

Trainiert werden Embedding-Modelle via Contrastive Learning: Positive Paare (z. B. Frage und korrekte Antwort) werden im Vektorraum näher zusammengezogen, Negative weiter auseinander. InfoNCE-Loss und MultipleNegativesRankingLoss sind die gängigen Verfahren.

Architektur moderner Embedding-Modelle

Moderne Embedding-Modelle basieren auf Transformer-Encodern, oft mit speziellen Modifikationen:

  • Sentence-BERT (SBERT): Pionier 2019, BERT mit Siamese Network und Mean Pooling.
  • OpenAI text-embedding-3: Architektur nicht offengelegt, Matryoshka Representation Learning, 256 bis 3072 Dimensionen.
  • Voyage AI voyage-3: Spezialisiert auf Retrieval-Qualität, Domain-spezifische Varianten verfügbar.
  • Cohere embed-v4: Multimodale Embeddings für Text, Bild und einfaches Layout.
  • BGE (BAAI General Embedding): Open Source aus Beijing, MTEB-Spitzenposition.
  • E5 mistral: Open Source, hochwertig im Retrieval.

Multi-Modal Embeddings

Embeddings beschränken sich nicht auf Text:

  • CLIP (OpenAI, 2021): Pionier-Modell für Text-Bild-Embeddings, trainiert auf 400M Bild-Text-Paaren.
  • SigLIP (Google): Verbesserte CLIP-Variante mit Sigmoid-Loss.
  • ImageBind (Meta): Sechs Modalitäten in einem Embedding-Raum (Text, Bild, Audio, Tiefe, Wärme, IMU).
  • Cohere und Voyage multimodal: Produktive Multi-Modal-Embeddings für Enterprise-Suche.

Diese Modelle ermöglichen Cross-Modal-Suche: Suche nach Bildern mit Text-Anfragen, Audio-zu-Text-Retrieval, Video-Indexierung.

Praxis und Anwendung

Embeddings sind das Rückgrat zahlreicher KI-Anwendungen:

  • RAG-Systeme: Dokument-Chunks werden embedded, indexiert und bei Anfragen via Cosine Similarity abgerufen.
  • Semantische Suche: Statt Keyword-Match wird konzeptuelle Ähnlichkeit gefunden.
  • Empfehlungssysteme: Nutzer- und Item-Embeddings für personalisierte Vorschläge.
  • Klassifikation: Embeddings als Features für leichtgewichtige Klassifikatoren.
  • Clustering: Topic Modeling, Duplicate Detection, Anomaly Detection.
  • Entity Linking: Texterwähnungen werden auf Knowledge-Graph-Entitäten gemappt.

In RAG-Pipelines bestimmt die Wahl des Embedding-Modells die Retrieval-Qualität stärker als die Wahl der Vektor-Datenbank.

Häufige Fehler

  • Falsches Embedding-Modell für die Sprache: Englisch-optimierte Modelle scheitern oft an Deutsch oder Mehrsprachigkeit. Multilingual-spezifische Varianten wählen.
  • Chunking ignorieren: Embeddings ganzer Dokumente sind zu grob, einzelner Sätze zu fragmentiert. Semantic Chunking oder Sliding Window sind Standard.
  • Embedding-Modell mischen: Vektoren aus unterschiedlichen Modellen sind nicht vergleichbar. Konsistente Verwendung beim Indexieren und Anfragen.
  • Nur Cosine Similarity verlassen: Hybrid Retrieval mit BM25 verbessert Ergebnisse bei Eigennamen und Zahlen deutlich.
  • Embeddings nicht versionieren: Modell-Updates ändern Vektoren, was Re-Indexing nötig macht.

Abgrenzung

  • One-Hot-Encoding: klassische, sparse Repräsentation. Embeddings sind dicht und semantisch.
  • TF-IDF und BM25: statistische Term-Repräsentationen ohne Semantik. Komplementär zu Embeddings via Hybrid Retrieval.
  • Hidden States im LLM: interne Zwischen-Repräsentationen sind keine produktiven Embeddings, brauchen Pooling und ggf. Fine-Tuning.
  • Knowledge-Graph-Embeddings: spezialisiert auf Entitäten und Relationen, unterscheiden sich strukturell von Text-Embeddings.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist ein Embedding?+

Ein Embedding ist eine dichte Vektor-Repräsentation von Text, Bild oder einer anderen Modalität in einem hochdimensionalen Raum (typisch 256 bis 4096 Dimensionen). Semantisch ähnliche Inhalte liegen geometrisch nahe beieinander, was Vergleich, Suche und Clustering via Cosine Similarity oder Dot Product ermöglicht.

Wie werden Embeddings erzeugt?+

Klassisch via Word2Vec, GloVe oder FastText auf Wortebene. Moderne Embeddings stammen aus speziell trainierten Transformer-Encodern: Sentence-BERT, OpenAI text-embedding-3, Voyage AI voyage-3, Cohere embed-v4 oder BGE und E5 als Open-Source-Alternativen. Trainiert wird typischerweise via Contrastive Learning auf Positive-Negative-Paaren.

Welche Dimension hat ein Embedding?+

Übliche Dimensionen sind 384, 768, 1024, 1536, 3072 oder 4096. Moderne Embedding-Modelle bieten Matryoshka Representation Learning an, das erlaubt, denselben Vektor in unterschiedlichen Längen zu nutzen. Höhere Dimensionen erfassen feinere semantische Unterschiede, kosten aber mehr Speicher und Rechenzeit bei der Vektorsuche.

Was ist Cosine Similarity?+

Cosine Similarity misst den Winkel zwischen zwei Vektoren und liegt zwischen minus 1 und 1, oft normalisiert auf 0 bis 1. Sie ist die Standardmetrik für Embedding-Vergleiche, weil sie unabhängig von der Vektor-Magnitude ist. Bei normalisierten Vektoren ist Cosine Similarity mathematisch äquivalent zu Dot Product, was Implementierungen vereinfacht.

Welche Embedding-Modelle dominieren 2026?+

Im proprietären Bereich: OpenAI text-embedding-3-large, Voyage AI voyage-3-large und Cohere embed-v4. Open Source: BGE M3, E5 mistral 7B, Nomic embed text v2 und das schnell wachsende Stella-Modell. Im MTEB-Benchmark (Massive Text Embedding Benchmark) führen Voyage und Cohere bei Englisch, Open-Source-Modelle schliessen schnell auf.

Was sind Multi-Modal Embeddings?+

Multi-Modal Embeddings projizieren unterschiedliche Modalitäten (Text, Bild, Audio, Video) in denselben Vektorraum. CLIP (OpenAI, 2021) ist das Standard-Beispiel für Text-Bild, neuere Modelle wie Cohere embed-v4 und Voyage multimodal kombinieren Text, Bild und teils Video. Das ermöglicht Cross-Modal-Suche und multimodale RAG-Systeme.

Was ist Hybrid Retrieval?+

Hybrid Retrieval kombiniert dichte Embedding-Suche (semantisch) mit klassischer Keyword-Suche (BM25). Beide Verfahren ergänzen sich, weil Embeddings bei exakten Begriffen, Eigennamen und Zahlen oft scheitern, während Keyword-Suche keine semantische Ähnlichkeit erkennt. Score-Fusion-Methoden wie Reciprocal Rank Fusion kombinieren beide Signale.

Wie viel kostet eine Embedding-API?+

Stand 2026 kostet ein OpenAI text-embedding-3-small Token etwa 0.02 Dollar pro 1M Tokens, large etwa 0.13 Dollar. Voyage AI und Cohere bewegen sich in ähnlicher Spannweite. Open-Source-Modelle (BGE, E5) sind kostenlos einsetzbar, benötigen aber GPU-Ressourcen für Hosting und sind bei sehr hohen Volumen oft günstiger als API-Aufrufe.

Verwandte Begriffe

Quellen

  • Mikolov et al. (2013) Word2Vec
  • Reimers and Gurevych (2019) Sentence-BERT
  • OpenAI Embeddings Documentation
  • Cohere Embeddings Documentation
  • Voyage AI Documentation

Wikidata: Q18395344 · Zuletzt geprüft: 2026-07-02