anlp-a2-MoE-var1

Advanced NLP (Monsoon 2026), Assignment 2.

Part 1, FFN variant 1. 8.8M total / 8.8M active params, trained on 120001234 tokens. Best checkpoint by validation loss; test loss 2.017, ppl 7.517, acc 0.629, bleu 23.587.

Run

item value
parameters 8.8M
training step 89074
wandb https://wandb.ai/winterdew-iiit-hyderabad/anlp-a2-part1/runs/borq3eja

Hyperparameters

setting value
FFN variant 1 — dense 2-layer MLP
params (total / active) 8.8M / 8.8M
FFN hidden width 1024
MoE aux weight n/a
d_model / n_layers / n_heads 256 / 6 / 8
context length 256
positional encoding RoPE (base 10000)
tokenizer sentencepiece unigram, vocab 16000, character coverage 0.9995, byte fallback
optimizer AdamW(betas=(0.9, 0.95), eps=1e-8)
learning rate 0.0003
lr schedule linear warmup 1740 steps, cosine to 0.1x
weight decay 0.1 (matrices only)
gradient clip 1.0
batch size 32 x 1 accum
dropout 0.1
precision fp16
token budget 120,000,000 (120,001,234 seen)
seed 26

Model config

{
  "vocab_size": 16000,
  "n_ctx": 256,
  "rope_base": 10000.0,
  "d_model": 256,
  "n_heads": 8,
  "n_layers": 6,
  "d_ff": 1024,
  "dropout": 0.1,
  "tie_embeddings": true,
  "use_moe": false,
  "n_experts": 4,
  "n_active": 1,
  "n_shared": 0,
  "match_active": false,
  "moe_aux_weight": 0.01
}
Downloads last month
19
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train winterdewdev/anlp-a2-MoE-var1