6 A B C D E F G H I K L M N O P Q R S T U V W Z

1) Einfach erklärt

Semantic Search bedeutet: Eine Suche versteht die Bedeutung einer Anfrage – nicht nur die exakten Schlüsselwörter. Statt ausschließlich Wortgleichheit (z. B. BM25) nutzt sie semantische Ähnlichkeit, häufig über Embeddings (Vektorrepräsentationen) und Vektor-Suche. So findet die Suche auch passende Ergebnisse, wenn andere Wörter benutzt wurden (Synonyme, Paraphrasen, mehrsprachige Varianten).

Warum nützlich? Bessere Treffer bei natürlichen Fragen, Synonymen und langen, ungenauen Anfragen. In der Praxis wird semantische Suche oft mit klassischer Stichwortsuche hybrid kombiniert, um beides zu nutzen: exakte Treffer und Bedeutungsnähe.

Weiterführende Basis-Einträge:
Embedding/Vektorraum ·
Hybride KI / RAG ·
Große Sprachmodelle (LLMs) ·
Prompt


2) Professionelle Definition

Semantic Search ist Information Retrieval, das lexikale Signale (z. B. BM25) mit semantischen Signalen (z. B. dichte Embeddings aus Sentence-BERT oder DPR) kombiniert oder ersetzt. In einem typischen Pipeline-Entwurf:

  1. Einbettung von Dokumenten/Passagen (offline) und der Benutzeranfrage (online) in einen Vektorraum.
  2. Annähernde Nächste-Nachbarn-Suche (ANN) über einen Vektorindex (z. B. HNSW, Faiss) liefert die Top-K Kandidaten.
  3. Optional: Hybrid – parallele BM25-/lexikale Suche; anschließend Score-Normalisierung und Rank-Fusion (z. B. RRF) zu einer gemeinsamen Ergebnisliste.
  4. Optional: Re-Ranking mit Cross-Encodern oder Late-Interaction-Modellen (z. B. ColBERT), um die fein-granulare Relevanz zu bestimmen.

Einsatzfelder: Unternehmenssuche, FAQ/QA, E-Commerce, Multimedia-Suche, sowie als Retriever in Retrieval-Augmented Generation (RAG) für LLM-Antworten mit Quellen.


Begriffsabgrenzungen

  • Lexikale Suche (BM25): wertet Wortüberlappung und Termgewichtung aus; robust für exakte Begriffe und Filter.
  • Vektor-Suche: sucht über Ähnlichkeit von Embeddings; bildet die technische Basis vieler semantischer Suchen.
  • Hybrid Search: kombiniert beides (BM25 + Vektor) und fusioniert die Ergebnisse.

Verwandte interne Einträge

Embedding/Vektorraum · ·
CLIP ·
ViT


Quellen

Lexikalische Basis (BM25)
Robertson & Zaragoza (2009): The Probabilistic Relevance Framework: BM25 and Beyond
https://www.staff.city.ac.uk/~sbrp622/papers/foundations_bm25_review.pdf

Dichte/semantische Retriever
Karpukhin et al. (2020): Dense Passage Retrieval (DPR)
https://arxiv.org/abs/2004.04906 ·
PDF: https://arxiv.org/pdf/2004.04906 ·
ACL Anthology: https://aclanthology.org/2020.emnlp-main.550/
Reimers & Gurevych (2019): Sentence-BERT
https://arxiv.org/abs/1908.10084 ·
PDF: https://arxiv.org/pdf/1908.10084

ANN-Indizes (Vektor-Suche)
Malkov & Yashunin (2016): HNSW
https://arxiv.org/abs/1603.09320 ·
PDF: https://arxiv.org/pdf/1603.09320
FAISS – Paper (2024): https://arxiv.org/abs/2401.08281 ·
Doku: https://faiss.ai/ ·
GitHub: https://github.com/facebookresearch/faiss

Re-Ranking / Late-Interaction
Khattab & Zaharia (2020): ColBERT
https://arxiv.org/abs/2004.12832 ·
PDF: https://arxiv.org/pdf/2004.12832

Hybrid Search (BM25 + Vektor)
Elastic – Überblick/Leitfaden: https://www.elastic.co/what-is/hybrid-search ·
Labs-Blog (RRF/Scoring): https://www.elastic.co/search-labs/blog/hybrid-search-elasticsearch
OpenSearch – Doku (Hybrid Search): https://docs.opensearch.org/latest/vector-search/ai-search/hybrid-search/index/

RAG (Retriever in LLM-Systemen)
Lewis et al. (2020): Retrieval-Augmented Generation
arXiv: https://arxiv.org/abs/2005.11401 ·
NeurIPS PDF: https://proceedings.neurips.cc/paper/2020/file/6b493230205f780e1bc26945df7481e5-Paper.pdf