fix: restore grad_ckpt and safe micro 8 accum 8 for zero-OOM guarantee on T4 96be75f verified ViuAI commited on about 14 hours ago
perf: disable grad_ckpt on T4 and enlarge loss chunk_size to 2048 for 10k+ tok/s 7d4c3f5 verified ViuAI commited on about 14 hours ago
config: update Stage 1 batch_size to 16 for micro=16 accum=8 per GPU 20ebd23 verified ViuAI commited on about 15 hours ago
refactor: consolidate pure 32L Dense architecture, purge MoE files, audit hardening 3a5d3e5 verified ViuAI commited on about 15 hours ago
Fix model/scripts/train.py: batch math comments and find_unused_parameters=False ef65129 verified ViuAI commited on about 16 hours ago
Audit fix: Update model/scripts/train.py for ViuMini-Dense-360M e52f2b4 verified ViuAI commited on about 17 hours ago
Update model/scripts/push_to_hf.py for ViuMini-Dense-360M d9702de verified ViuAI commited on about 18 hours ago
Update model/scripts/train.py for ViuMini-Dense-360M dedfdc7 verified ViuAI commited on about 18 hours ago
Upgrade architecture to ViuMini-Dense-350M (100% Dense, 360M active) 94036c7 verified ViuAI commited on about 19 hours ago
Restore find_unused_parameters=True: prevent MoE DDP reducer freeze 97157cf verified ViuAI commited on 1 day ago
Speed optimization: set DDP find_unused_parameters=False fb9d88c verified ViuAI commited on 1 day ago
P0 fix: ensure train.py targets viu1_moe 242M with updated defaults f83bc48 verified ViuAI commited on 1 day ago
P0 fix: gradient checkpointing, chunked cross-entropy, and vectorized MoE dispatch 3c7f390 verified ViuAI commited on 1 day ago
Vectorize MoE dispatch (argsort+bincount): eliminate 2,688 CUDA kernel launches per pass 4fa70d5 verified ViuAI commited on 2 days ago
Add live elapsed time counter (fmt_duration) and step pace (s/step, step/h) to console logs da6a53b verified ViuAI commited on 2 days ago
Optimize chunk_size to 2048 on 24GB+ GPUs (cuts head projections from 64 to 8 per micro-batch) a8f7b02 verified ViuAI commited on 2 days ago
Fix MoE Muon lag: route 4032 sparse expert weights to PagedAdamW8bit (eliminates 68,000 matmuls per step, 15x faster) 10f435d verified ViuAI commited on 2 days ago
RTX 3090 Max Speed: Zero-sync GPU loss accum, pinned-memory batch slicing, Muon in VRAM, 262k tok/step curriculum fe763fa verified ViuAI commited on 2 days ago
RTX 3090 Max Speed: Zero-sync GPU loss accum, pinned-memory batch slicing, Muon in VRAM, 262k tok/step curriculum 063b0de verified ViuAI commited on 2 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm f3fe7af verified ViuAI commited on 3 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm e1a12dc verified ViuAI commited on 3 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm f5cccb7 verified ViuAI commited on 3 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm 61b414e verified ViuAI commited on 3 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm a30bdca verified ViuAI commited on 3 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm 9d0f9ca verified ViuAI commited on 3 days ago
Sync model/scripts/viu_moe.py with 3-stage sequence length curriculum (512->1024->2048) 7e89caa verified ViuAI commited on 3 days ago
Sync model/scripts/train.py with 3-stage sequence length curriculum (512->1024->2048) e100ee7 verified ViuAI commited on 3 days ago
Sync model/scripts/train.py with adult erotica stories priority integration 35480b2 verified ViuAI commited on 5 days ago
Sync model/scripts/train.py with adult erotica stories priority integration 9d0207c verified ViuAI commited on 5 days ago
feat: step-1 priority queue integration for real Indian history & cricket shards 26fdf05 verified ViuAI commited on 5 days ago
feat: 100% zero-exclusion streaming architecture (2,081 shards) and updated docs a8f8457 verified ViuAI commited on 5 days ago
perf: free logits immediately in forward pass to release 3.1GB VRAM for mt_loss 79836a1 verified ViuAI commited on 10 days ago
fix: auto-download tokenizer.json if LFS pointer detected b8da5cc verified ViuAI commited on 10 days ago
fix: mute DDP barrier and find_unused_parameters stderr warnings e2b2d3d verified ViuAI commited on 10 days ago
feat: add RTX 5090 & 4090 configs (model/scripts/train.py) 8fadd89 verified ViuAI commited on 10 days ago
feat: smart auto-download Hugging Face checkpoint resume d83067a verified ViuAI commited on 10 days ago
fix: add --hf_split argument and remove invalid attribute access in streaming logger b690d1d verified ViuAI commited on 10 days ago
fix: pass token to list_repo_files and HfFileSystem to eliminate unauthenticated warnings d3005b5 verified ViuAI commited on 10 days ago
feat: non-blocking asynchronous checkpoint upload and local disk pruning 46b3eaf verified ViuAI commited on 10 days ago
Replace load_dataset with direct PyArrow streaming generator: Eliminate CastError permanently f1beed2 verified ViuAI commited on 10 days ago
Clean pretraining logging: Streamlined single-line logs (loss, lr, speed, ETA) with zero console clutter 848dc17 verified ViuAI commited on 10 days ago
Fix CastError permanently: Direct parquet loader via hf:// paths + clean step 1-20 logging with pbar.write dc649d2 verified ViuAI commited on 10 days ago
Fix CastError permanently: exclude code/ prefix + print every step for first 10 steps eee7156 verified ViuAI commited on 10 days ago
Speed optimizations: no_sync DDP communication + cuDNN/TF32 + 10k ckpt sync 58dee8c verified ViuAI commited on 10 days ago
Enhance live training logs: print at step 1 and show all 8 MoE expert percentages 88658cf verified ViuAI commited on 10 days ago
Update model/scripts/train.py: Exclude distilled/ from streaming + set log_every to 10 d75aebc verified ViuAI commited on 10 days ago