File size: 790 Bytes
639f52b 482a196 639f52b 482a196 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 | ---
license: mit
datasets:
- bigcode/the-stack-smol
- bigcode/the-stack-v2
- codeparrot/codeparrot-clean
language:
- en
tags:
- moe
- text-generation-inference
---
Ce modèle est un mini-Transformer de **50 Millions de paramètres** utilisant une architecture **Mixture of Experts (MoE)** avec un routage **Top-1**. Chaque jeton n'active qu'un seul expert parmi 4 à chaque couche, permettant d'avoir la rapidité d'exécution d'un modèle ultra-léger tout en conservant une grande capacité d'apprentissage.
## Performances
- **Loss Moyenne Globale** : 2.6492
- **Perplexité Finale (PPL)** : 14.14
- **Contexte** : 256 tokens
## Architecture
- Couches : 5
- Têtes d'attention : 8
- Experts par couche : 4
- Dimension du modèle : 512
- Taille du vocabulaire : 16 000 (BPE Tokenizer) |