Wat is multimodale AI?
De eerste chatassistenten werkten alleen met tekst. Tegenwoordig kunnen veel AI-tools ook afbeeldingen bekijken, spraak verstaan en beelden maken. Dat heet multimodale AI.
Meerdere soorten informatie
Een modaliteit is een soort informatie: tekst, beeld, geluid of video. Multimodale AI kan met meerdere modaliteiten tegelijk werken. Je kunt bijvoorbeeld een foto van een whiteboard uploaden en vragen om er een actielijst van te maken.
Praktische toepassingen
- Een foto van handgeschreven aantekeningen omzetten naar tekst.
- Een grafiek of tabel laten uitleggen.
- Een gesproken memo laten uitwerken tot een verslag.
- Een afbeelding laten beschrijven, bijvoorbeeld als alternatieve tekst voor een website.
- Een schets of idee laten omzetten in een eerste ontwerp.
Waar let je op?
- Privacy: foto’s en opnames bevatten vaak meer informatie dan je denkt, zoals gezichten, namen of schermen op de achtergrond.
- Nauwkeurigheid: ook bij beeld en spraak kan AI zich vergissen. Controleer cijfers en namen.
- Toestemming: neem geen gesprekken op of analyseer geen beelden van anderen zonder dat zij dat weten.
- Gegenereerde beelden: wees transparant als een afbeelding met AI is gemaakt. Lees ook deepfakes en desinformatie herkennen.
Meer uit de kennisbank
- Wat is AI? Kunstmatige intelligentie in gewone taal
- Wat is generatieve AI?
- Hoe werkt een taalmodel (LLM)?