-
Large Language Models as Optimizers
Paper • 2309.03409 • Published • 79 -
Mixture-of-Depths: Dynamically allocating compute in transformer-based language models
Paper • 2404.02258 • Published • 107 -
OpenELM: An Efficient Language Model Family with Open-source Training and Inference Framework
Paper • 2404.14619 • Published • 126 -
Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
Paper • 2404.14219 • Published • 262
Collections
Discover the best community collections!
Collections trending this week
-
Nougat: Neural Optical Understanding for Academic Documents
Paper • 2308.13418 • Published • 42 -
mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding
Paper • 2307.02499 • Published • 16 -
Text Rendering Strategies for Pixel Language Models
Paper • 2311.00522 • Published • 11
-
LLaSM: Large Language and Speech Model
Paper • 2308.15930 • Published • 34 -
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
Paper • 2308.06873 • Published • 27 -
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
Paper • 2308.05734 • Published • 37 -
JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models
Paper • 2308.04729 • Published • 33
-
VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation
Paper • 2309.00398 • Published • 23 -
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
Paper • 2307.04725 • Published • 65 -
LEDITS: Real Image Editing with DDPM Inversion and Semantic Guidance
Paper • 2307.00522 • Published • 33 -
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
Paper • 2309.15091 • Published • 35
-
Large Language Models as Optimizers
Paper • 2309.03409 • Published • 79 -
Mixture-of-Depths: Dynamically allocating compute in transformer-based language models
Paper • 2404.02258 • Published • 107 -
OpenELM: An Efficient Language Model Family with Open-source Training and Inference Framework
Paper • 2404.14619 • Published • 126 -
Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
Paper • 2404.14219 • Published • 262
-
Nougat: Neural Optical Understanding for Academic Documents
Paper • 2308.13418 • Published • 42 -
mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding
Paper • 2307.02499 • Published • 16 -
Text Rendering Strategies for Pixel Language Models
Paper • 2311.00522 • Published • 11
-
LLaSM: Large Language and Speech Model
Paper • 2308.15930 • Published • 34 -
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
Paper • 2308.06873 • Published • 27 -
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
Paper • 2308.05734 • Published • 37 -
JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models
Paper • 2308.04729 • Published • 33
-
VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation
Paper • 2309.00398 • Published • 23 -
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
Paper • 2307.04725 • Published • 65 -
LEDITS: Real Image Editing with DDPM Inversion and Semantic Guidance
Paper • 2307.00522 • Published • 33 -
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
Paper • 2309.15091 • Published • 35