Map and compare multimodal model capabilities.
Unified AI across text, vision, audio, video and actions.