SPES Pretrained models for paper "Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm" zjr2000/SPES-9B Text Generation • 9B • Updated May 6 • 36 zjr2000/SPES-7B Text Generation • 7B • Updated May 6 • 23 zjr2000/SPES-2B Text Generation • 2B • Updated May 6 • 24
SPES Pretrained models for paper "Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm" zjr2000/SPES-9B Text Generation • 9B • Updated May 6 • 36 zjr2000/SPES-7B Text Generation • 7B • Updated May 6 • 23 zjr2000/SPES-2B Text Generation • 2B • Updated May 6 • 24