Definitionen Künstliche Intelligenz – KI Glossar, Lexikon & Begriffe
-
Multimodal Embeddings
1) Einfach erklärt Multimodale Embeddings sind gemeinsame Vektordarstellungen für verschiedene Datenarten (z. B. Bild, Text, Audio, Video). Ziel: Inhalte modalitätsübergreifend vergleichbar machen – sodass z. B. ein Foto und die passende Textbeschreibung nah beieinander im selben Vektorraum liegen. So werden Zero-shot-Klassifikation, Bild↔Text-Suche, Audio↔Text-Suche oder Cross-Modal-RAG möglich. Warum nützlich? Ein einziger gemeinsamer Bedeutungsraum erlaubt Suche, Clustering, Klassifikation über…
-
Multimodale KI
Einfach erklärt Multimodale KI kann verschiedene Arten von Informationen gemeinsam verstehen und nutzen – z. B. Text, Bild, Audio, Video, Sensor‑/Tabellendaten. So kann sie Fragen zu einem Bild beantworten, Text zu einem Diagramm erklären oder aus Sprache und Kamerabild gemeinsam schließen. Beispiele: Warum nützlich? Viele Aufgaben sind nicht nur Text. Durch das Zusammenführen mehrerer Sinne wird…
-
Multimodale Modelle
Einfach erklärt Multimodale Modelle – Text+Bilder, Video+Audio. Multimodale Modelle können mehrere Arten von Daten gleichzeitig verstehen und verknüpfen – zum Beispiel Text mit Bildern, Video mit Audio oder Sensor‑Daten mit Sprache. So beantworten sie Fragen zu einem Bild, beschreiben ein Video in Text oder suchen passende Bilder zu einer Textanfrage. Kurz: Verschiedene „Sinne“ kombinieren →…