Generate video from an image and audio file
Reference for Wan 2.2, Alibaba's open video models
Generate tags for images using Waifu Diffusion models
A Generalist Diffusion Model for Vision Perception