Multimodale KI
KI, die mehrere Arten von Inhalten zugleich verarbeitet oder erzeugt – etwa Text, Bild, Ton und Video.
Einfach erklärt
Multimodale KI verarbeitet oder erzeugt mehrere Arten von Inhalten. Du kannst etwa ein Foto zeigen und dazu eine Frage stellen oder mit einem Assistenten sprechen. Welche Kombinationen möglich sind, steht in der Beschreibung des jeweiligen Modells.
Prüfe das Ergebnis am Ausgangsmaterial: Hat die Bildbeschreibung eine Zahl vertauscht? Steht im Transkript der richtige Name? Kontrolliere vor dem Hochladen auch, welche persönlichen Angaben auf dem Bild zu sehen oder in der Aufnahme zu hören sind.
Beispiel aus dem Alltag
Du fotografierst ein Diagramm und lässt es beschreiben. Danach kontrollierst du Achsen und Werte selbst, weil die Beschreibung eine Zahl vertauscht hat.
Häufige Fragen
Ist die Bildanalyse zuverlässig?
Nur begrenzt. Kleine Details werden übersehen, Diagramme falsch abgelesen, Handschrift verwechselt. Prüfe wichtige Werte selbst nach.
Gibt es besondere Datenrisiken?
Ja. Bilder und Audiodateien können Metadaten, Gesichter oder versteckte Anweisungen enthalten. Prüfe vor dem Hochladen, was auf dem Material zu sehen und zu hören ist.
