Multimodale KI verstehen: Wie moderne Modelle Text, Bild, Audio und Video verarbeiten
Herausgegeben von der Tanagra Akademie · Zuletzt aktualisiert am
Bis 2023 waren die meisten KI-Systeme auf eine einzige Art der Verarbeitung spezialisiert. Sprachmodelle verarbeiteten Text, Bildgeneratoren erzeugten Bilder, und Spracherkennungssysteme verstanden Audio. Jedes System war ein Spezialist, aber keines konnte verschiedene Medientypen gleichzeitig verstehen und miteinander in Beziehung setzen.
Auf einen Blick
| Kategorie | Vertiefung |
|---|---|
| Niveau | Einsteiger |
| Dauer | 45 Min |
| Sprache | Deutsch |
| Zugang | im Abo enthalten |
| Zuletzt aktualisiert |
Inhalt des Kurses
- Lektion 1: Was multimodale KI bedeutet und warum sie wichtig ist
- Lektion 2: Wie multimodale Modelle technisch funktionieren
- Lektion 3: Die großen Modelle im Vergleich
- Lektion 4: Praktische Anwendungen der multimodalen KI
- Lektion 5: Grenzen, Risiken und verantwortungsvoller Einsatz
Vollständiger Kurs
Dieser Kurs ist Teil des Akademie-Abos. Enthalten sind alle Kurse des Katalogs, laufende Aktualisierungen und neue Kurse während der Laufzeit.