Definitionen Künstliche Intelligenz – KI Glossar, Lexikon & Begriffe
-
Multi‑Head Attention
Einfach erklärt Mehrkopf‑Aufmerksamkeit bedeutet: Das Modell schaut gleichzeitig auf mehrere Arten nach wichtigen Stellen – so, als ob mehrere „Blicke“ parallel über den Text/Bild laufen. Jeder „Kopf“ achtet auf andere Beziehungen (z. B. Nähe, Fernbezug, Wortart). Am Ende werden die Ergebnisse kombiniert, damit die Vorhersage genauer wird. Ganz einfache Beispiele: • Satzbezug: Ein Kopf achtet auf…
-
Multi‑shot
Einfach erklärt Multi‑shot heißt: Man gibt einem Sprach‑ oder KI‑Modell mehrere Beispiele (mehr als eins) direkt im Prompt mit. So sieht das Modell Muster und Format und kann die Aufgabe genauer lösen. Ganz einfache Beispiele: • Text klassifizieren: Zeige 3–5 kurze Beispiele (Text → „positiv/neutral/negativ“). Danach soll das Modell neue Texte gleich einordnen.• Format lernen:…
-
Multimodal Embeddings
1) Einfach erklärt Multimodale Embeddings sind gemeinsame Vektordarstellungen für verschiedene Datenarten (z. B. Bild, Text, Audio, Video). Ziel: Inhalte modalitätsübergreifend vergleichbar machen – sodass z. B. ein Foto und die passende Textbeschreibung nah beieinander im selben Vektorraum liegen. So werden Zero-shot-Klassifikation, Bild↔Text-Suche, Audio↔Text-Suche oder Cross-Modal-RAG möglich. Warum nützlich? Ein einziger gemeinsamer Bedeutungsraum erlaubt Suche, Clustering, Klassifikation über…
-
Multimodale KI
Einfach erklärt Multimodale KI kann verschiedene Arten von Informationen gemeinsam verstehen und nutzen – z. B. Text, Bild, Audio, Video, Sensor‑/Tabellendaten. So kann sie Fragen zu einem Bild beantworten, Text zu einem Diagramm erklären oder aus Sprache und Kamerabild gemeinsam schließen. Beispiele: Warum nützlich? Viele Aufgaben sind nicht nur Text. Durch das Zusammenführen mehrerer Sinne wird…
-
Multimodale Modelle
Einfach erklärt Multimodale Modelle – Text+Bilder, Video+Audio. Multimodale Modelle können mehrere Arten von Daten gleichzeitig verstehen und verknüpfen – zum Beispiel Text mit Bildern, Video mit Audio oder Sensor‑Daten mit Sprache. So beantworten sie Fragen zu einem Bild, beschreiben ein Video in Text oder suchen passende Bilder zu einer Textanfrage. Kurz: Verschiedene „Sinne“ kombinieren →…