File size: 790 Bytes
639f52b
 
 
 
 
 
 
 
482a196
 
 
639f52b
 
 
 
 
 
 
 
 
 
 
 
 
 
 
482a196
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
---
license: mit
datasets:
- bigcode/the-stack-smol
- bigcode/the-stack-v2
- codeparrot/codeparrot-clean
language:
- en
tags:
- moe
- text-generation-inference
---


Ce modèle est un mini-Transformer de **50 Millions de paramètres** utilisant une architecture **Mixture of Experts (MoE)** avec un routage **Top-1**. Chaque jeton n'active qu'un seul expert parmi 4 à chaque couche, permettant d'avoir la rapidité d'exécution d'un modèle ultra-léger tout en conservant une grande capacité d'apprentissage.

## Performances
- **Loss Moyenne Globale** : 2.6492
- **Perplexité Finale (PPL)** : 14.14
- **Contexte** : 256 tokens

## Architecture
- Couches : 5
- Têtes d'attention : 8
- Experts par couche : 4
- Dimension du modèle : 512
- Taille du vocabulaire : 16 000 (BPE Tokenizer)