{ "Image Generation": [ [ "Text to Image", "Image to Text", "Image-to-Image", "Image-to-Video", "Unconditional Image Generation", "Video Classification", "Text-to-Video", "Zero-Shot Image Classification", "Mask Generation", "Zero-Shot Object Detection", "Text-to-3D", "Image-to-3D", "Image Feature Extraction", "Keypoint Detection", "Video-to-Video" ] ], "Natural Language Processing": [ [ "Text Classification", "Token Classification", "Table Question Answering", "Question Answering", "Zero-Shot Classification", "Translation", "Summarization", "Feature Extraction", "Text Generation", "Fill-Mask", "Sentence Similarity", "Text Ranking" ] ], "Audio": [ [ "Text-to-Speech", "Text-to-Audio", "Automatic Speech Recognition", "Audio-to-Audio", "Audio Classification", "Voice Activity Detection" ] ], "Tabular": [ ["Tabular Classification", "Tabular Regression", "Time Series Forecasting"] ], "Reinforcement Learning": [["Reinforcement Learning", "Robotics"]], "Other": [["Graph Machine Learning"]] }