Multimodale KI verstehen: Text, Bild, Audio und Video in einem Modell
Herausgegeben von der Tanagra Akademie · Zuletzt aktualisiert am
Alle Inhalte sind mit Hilfe von KI entstanden.
Stellen Sie sich vor, Sie sitzen in einem Meeting und halten ein Foto eines Whiteboards hoch. Ein Kollege kann das Foto ansehen, den handschriftlichen Text lesen, die Diagramme interpretieren und Ihnen eine Zusammenfassung geben. Genau das kann multimodale KI heute auch. Der Begriff "multimodal" beschreibt KI-Systeme, die nicht nur Text verarbeiten, sondern gleichzeitig mit Bildern, Audio...
Auf einen Blick
| Kategorie | Vertiefung |
|---|---|
| Niveau | Einsteiger |
| Dauer | 40 Min |
| Sprache | Deutsch |
| Zugang | im Abo enthalten |
| Zuletzt aktualisiert |
Inhalt des Kurses
- Lektion 1: Was bedeutet "multimodal" und warum ist es ein Paradigmenwechsel?
- Lektion 2: Die großen multimodalen Modelle im Vergleich
- Lektion 3: Multimodale KI im Arbeitsalltag: Fünf sofort umsetzbare Anwendungen
- Lektion 4: Grenzen und Risiken: Was multimodale KI (noch) nicht kann
- Lektion 5: Ihr Einstieg: Multimodale KI in drei Schritten im Unternehmen einführen
Quellen und weiterführende Links
Worauf sich dieser Kurs stützt:
- openai.com (openai.com)
- cloud.google.com/gemini (cloud.google.com)
- anthropic.com/claude (anthropic.com)
- OpenAI 2026 (openai.com)
- Anthropic 2026 (anthropic.com)
Vollständiger Kurs
Dieser Kurs ist Teil des Akademie-Abos. Enthalten sind alle Kurse des Katalogs, laufende Aktualisierungen und neue Kurse während der Laufzeit.