Commit History

fix: restore grad_ckpt and safe micro 8 accum 8 for zero-OOM guarantee on T4
96be75f
verified

ViuAI commited on

perf: disable grad_ckpt on T4 and enlarge loss chunk_size to 2048 for 10k+ tok/s
7d4c3f5
verified

ViuAI commited on

config: update Stage 1 batch_size to 16 for micro=16 accum=8 per GPU
20ebd23
verified

ViuAI commited on

refactor: consolidate pure 32L Dense architecture, purge MoE files, audit hardening
3a5d3e5
verified

ViuAI commited on

Fix model/scripts/train.py: batch math comments and find_unused_parameters=False
ef65129
verified

ViuAI commited on

Audit fix: Update model/scripts/train.py for ViuMini-Dense-360M
e52f2b4
verified

ViuAI commited on

Update model/scripts/push_to_hf.py for ViuMini-Dense-360M
d9702de
verified

ViuAI commited on

Update model/scripts/train.py for ViuMini-Dense-360M
dedfdc7
verified

ViuAI commited on

Upgrade architecture to ViuMini-Dense-350M (100% Dense, 360M active)
94036c7
verified

ViuAI commited on

Restore find_unused_parameters=True: prevent MoE DDP reducer freeze
97157cf
verified

ViuAI commited on

Speed optimization: set DDP find_unused_parameters=False
fb9d88c
verified

ViuAI commited on

Add UTF-8 stdout support to train.py
660f01e
verified

ViuAI commited on

P0 fix: ensure train.py targets viu1_moe 242M with updated defaults
f83bc48
verified

ViuAI commited on

P0 fix: gradient checkpointing, chunked cross-entropy, and vectorized MoE dispatch
3c7f390
verified

ViuAI commited on

Vectorize MoE dispatch (argsort+bincount): eliminate 2,688 CUDA kernel launches per pass
4fa70d5
verified

ViuAI commited on

Add live elapsed time counter (fmt_duration) and step pace (s/step, step/h) to console logs
da6a53b
verified

ViuAI commited on

Optimize chunk_size to 2048 on 24GB+ GPUs (cuts head projections from 64 to 8 per micro-batch)
a8f7b02
verified

ViuAI commited on

Fix MoE Muon lag: route 4032 sparse expert weights to PagedAdamW8bit (eliminates 68,000 matmuls per step, 15x faster)
10f435d
verified

ViuAI commited on

RTX 3090 Max Speed: Zero-sync GPU loss accum, pinned-memory batch slicing, Muon in VRAM, 262k tok/step curriculum
fe763fa
verified

ViuAI commited on

RTX 3090 Max Speed: Zero-sync GPU loss accum, pinned-memory batch slicing, Muon in VRAM, 262k tok/step curriculum
063b0de
verified

ViuAI commited on

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
f3fe7af
verified

ViuAI commited on

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
e1a12dc
verified

ViuAI commited on

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
f5cccb7
verified

ViuAI commited on

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
61b414e
verified

ViuAI commited on

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
a30bdca
verified

ViuAI commited on

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
9d0f9ca
verified

ViuAI commited on

Sync model/scripts/viu_moe.py with 3-stage sequence length curriculum (512->1024->2048)
7e89caa
verified

ViuAI commited on

Sync model/scripts/train.py with 3-stage sequence length curriculum (512->1024->2048)
e100ee7
verified

ViuAI commited on

Sync model/scripts/train.py with adult erotica stories priority integration
35480b2
verified

ViuAI commited on

Sync model/scripts/train.py with adult erotica stories priority integration
9d0207c
verified

ViuAI commited on

feat: step-1 priority queue integration for real Indian history & cricket shards
26fdf05
verified

ViuAI commited on

feat: 100% zero-exclusion streaming architecture (2,081 shards) and updated docs
a8f8457
verified

ViuAI commited on

Add 42-layer Viu-1.5B-MoE verification test suite
fa717d7
verified

ViuAI commited on

perf: free logits immediately in forward pass to release 3.1GB VRAM for mt_loss
79836a1
verified

ViuAI commited on

feat: add CLI overrides and manual batch lock support
f16d6ac
verified

ViuAI commited on

fix: auto-download tokenizer.json if LFS pointer detected
b8da5cc
verified

ViuAI commited on

fix: mute DDP barrier and find_unused_parameters stderr warnings
e2b2d3d
verified

ViuAI commited on

feat: add RTX 5090 & 4090 configs (model/scripts/train.py)
8fadd89
verified

ViuAI commited on

feat: smart auto-download Hugging Face checkpoint resume
d83067a
verified

ViuAI commited on

fix: add --hf_split argument and remove invalid attribute access in streaming logger
b690d1d
verified

ViuAI commited on

fix: pass token to list_repo_files and HfFileSystem to eliminate unauthenticated warnings
d3005b5
verified

ViuAI commited on

feat: non-blocking asynchronous checkpoint upload and local disk pruning
46b3eaf
verified

ViuAI commited on

Add --hf_safety argument and default full
a485427
verified

ViuAI commited on

Replace load_dataset with direct PyArrow streaming generator: Eliminate CastError permanently
f1beed2
verified

ViuAI commited on

Clean pretraining logging: Streamlined single-line logs (loss, lr, speed, ETA) with zero console clutter
848dc17
verified

ViuAI commited on

Fix CastError permanently: Direct parquet loader via hf:// paths + clean step 1-20 logging with pbar.write
dc649d2
verified

ViuAI commited on

Fix CastError permanently: exclude code/ prefix + print every step for first 10 steps
eee7156
verified

ViuAI commited on

Speed optimizations: no_sync DDP communication + cuDNN/TF32 + 10k ckpt sync
58dee8c
verified

ViuAI commited on

Enhance live training logs: print at step 1 and show all 8 MoE expert percentages
88658cf
verified

ViuAI commited on

Update model/scripts/train.py: Exclude distilled/ from streaming + set log_every to 10
d75aebc
verified

ViuAI commited on