Multimodal AI

AI-systemen die meerdere soorten input combineren en er samen over redeneren, zoals geometrie, tekst en beelden, in plaats van slechts één.

Definitie

Multimodal AI verwijst naar AI-systemen die meerdere afzonderlijke soorten input combineren en er samen over redeneren, zoals tekst, beelden, geometrie of andere datamodaliteiten, in plaats van slechts één soort te verwerken. In de productie zou een multimodale benadering de 3D-geometrie van een onderdeel kunnen combineren met tekstgebaseerde eisen of historische productiedata, in plaats van elk apart te behandelen.

Waarom modaliteiten combineren moeilijker is dan elk apart verwerken

Modaliteiten effectief combineren is moeilijker dan elk apart verwerken, aangezien verschillende modaliteiten verschillende soorten informatie dragen en verschillende technieken kunnen vereisen om weer te geven en uit te lijnen, wat verklaart waarom multimodal AI een actief onderzoeksgebied blijft in plaats van een volledig opgelost probleem.

Waar multimodal AI van toepassing is

Niet op de tekening; multimodal AI is een techniek gebruikt binnen software die samen redeneert over meerdere soorten input die een onderdeel kan hebben (geometrie, tekst, historische data), niet iets gespecificeerd door eisen.

Veelgemaakte fouten

Aannemen dat elk systeem dat toevallig meer dan één soort data gebruikt automatisch 'multimodaal' is in betekenisvolle zin; de term impliceert specifiek dat het systeem samen redeneert over modaliteiten, niet alleen dat er ergens in de pijplijn meerdere datatypes bestaan.

Wat het betekent voor uw calculatie

Modaliteiten effectief combineren is moeilijker dan elk apart verwerken, aangezien verschillende modaliteiten verschillende soorten informatie dragen en verschillende technieken kunnen vereisen om weer te geven en uit te lijnen, wat verklaart waarom multimodal AI een actief onderzoeksgebied blijft in plaats van een volledig opgelost probleem.

Lees het onderzoek

Veelgestelde vragen

Wat telt als een 'modaliteit' in deze context?

Een afzonderlijk soort data, zoals tekst, beelden, 3D-geometrie, of tabeldata, elk met zijn eigen structuur en kenmerken.

Is het combineren van geometrie- en tekstdata multimodal AI?

Dat kan, als het systeem ontworpen is om samen over beide te redeneren in plaats van elk volledig apart te verwerken.

Waarom is multimodal AI moeilijker dan single-modality AI?

Omdat verschillende modaliteiten verschillende soorten informatie dragen en vaak verschillende technieken vereisen om weer te geven, die vervolgens betekenisvol gecombineerd of uitgelijnd moeten worden.

Noten en bronnen

  1. Baltrušaitis, T., Ahuja, C. & Morency, L.-P. (2019). Multimodal Machine Learning: A Survey and Taxonomy. IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(2), 423–443. https://doi.org/10.1109/TPAMI.2018.2798607 De standaard fundamentele survey en taxonomie voor multimodal machine learning, hier gebruikt als onderbouwing van deze definitie.