fix: restore grad_ckpt and safe micro 8 accum 8 for zero-OOM guarantee on T4 96be75f verified ViuAI commited on about 12 hours ago
perf: disable grad_ckpt on T4 and enlarge loss chunk_size to 2048 for 10k+ tok/s 7d4c3f5 verified ViuAI commited on about 12 hours ago
config: update Stage 1 batch_size to 16 for micro=16 accum=8 per GPU 20ebd23 verified ViuAI commited on about 13 hours ago
refactor: consolidate pure 32L Dense architecture, purge MoE files, audit hardening 3a5d3e5 verified ViuAI commited on about 13 hours ago
Fix model/scripts/train.py: batch math comments and find_unused_parameters=False ef65129 verified ViuAI commited on about 14 hours ago
Audit fix: Update model/scripts/train.py for ViuMini-Dense-360M e52f2b4 verified ViuAI commited on about 15 hours ago
Update model/scripts/train.py for ViuMini-Dense-360M dedfdc7 verified ViuAI commited on about 16 hours ago
Upgrade architecture to ViuMini-Dense-350M (100% Dense, 360M active) 94036c7 verified ViuAI commited on about 17 hours ago
Restore find_unused_parameters=True: prevent MoE DDP reducer freeze 97157cf verified ViuAI commited on 1 day ago
Speed optimization: set DDP find_unused_parameters=False fb9d88c verified ViuAI commited on 1 day ago
P0 fix: ensure train.py targets viu1_moe 242M with updated defaults f83bc48 verified ViuAI commited on 1 day ago
Add live elapsed time counter (fmt_duration) and step pace (s/step, step/h) to console logs da6a53b verified ViuAI commited on 2 days ago
Fix MoE Muon lag: route 4032 sparse expert weights to PagedAdamW8bit (eliminates 68,000 matmuls per step, 15x faster) 10f435d verified ViuAI commited on 2 days ago
RTX 3090 Max Speed: Zero-sync GPU loss accum, pinned-memory batch slicing, Muon in VRAM, 262k tok/step curriculum fe763fa verified ViuAI commited on 2 days ago
RTX 3090 Max Speed: Zero-sync GPU loss accum, pinned-memory batch slicing, Muon in VRAM, 262k tok/step curriculum 063b0de verified ViuAI commited on 2 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm f3fe7af verified ViuAI commited on 2 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm e1a12dc verified ViuAI commited on 2 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm f5cccb7 verified ViuAI commited on 2 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm 61b414e verified ViuAI commited on 2 days ago
Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm 9d0f9ca verified ViuAI commited on 3 days ago
Sync model/scripts/train.py with 3-stage sequence length curriculum (512->1024->2048) e100ee7 verified ViuAI commited on 3 days ago
Sync model/scripts/train.py with adult erotica stories priority integration 35480b2 verified ViuAI commited on 5 days ago
Sync model/scripts/train.py with adult erotica stories priority integration 9d0207c verified ViuAI commited on 5 days ago
feat: step-1 priority queue integration for real Indian history & cricket shards 26fdf05 verified ViuAI commited on 5 days ago
feat: 100% zero-exclusion streaming architecture (2,081 shards) and updated docs a8f8457 verified ViuAI commited on 5 days ago
fix: auto-download tokenizer.json if LFS pointer detected b8da5cc verified ViuAI commited on 10 days ago
fix: mute DDP barrier and find_unused_parameters stderr warnings e2b2d3d verified ViuAI commited on 10 days ago
feat: add RTX 5090 & 4090 configs (model/scripts/train.py) 8fadd89 verified ViuAI commited on 10 days ago
feat: smart auto-download Hugging Face checkpoint resume d83067a verified ViuAI commited on 10 days ago
fix: add --hf_split argument and remove invalid attribute access in streaming logger b690d1d verified ViuAI commited on 10 days ago
fix: pass token to list_repo_files and HfFileSystem to eliminate unauthenticated warnings d3005b5 verified ViuAI commited on 10 days ago
feat: non-blocking asynchronous checkpoint upload and local disk pruning 46b3eaf verified ViuAI commited on 10 days ago
Replace load_dataset with direct PyArrow streaming generator: Eliminate CastError permanently f1beed2 verified ViuAI commited on 10 days ago
Clean pretraining logging: Streamlined single-line logs (loss, lr, speed, ETA) with zero console clutter 848dc17 verified ViuAI commited on 10 days ago
Fix CastError permanently: Direct parquet loader via hf:// paths + clean step 1-20 logging with pbar.write dc649d2 verified ViuAI commited on 10 days ago
Fix CastError permanently: exclude code/ prefix + print every step for first 10 steps eee7156 verified ViuAI commited on 10 days ago
Speed optimizations: no_sync DDP communication + cuDNN/TF32 + 10k ckpt sync 58dee8c verified ViuAI commited on 10 days ago
Enhance live training logs: print at step 1 and show all 8 MoE expert percentages 88658cf verified ViuAI commited on 10 days ago
Update model/scripts/train.py: Exclude distilled/ from streaming + set log_every to 10 d75aebc verified ViuAI commited on 10 days ago
Fix train.py argparse: Support --max_steps alias and --resume flag 169741c verified ViuAI commited on 10 days ago
feat: wipe-proof HF persistence (full ckpt + live log + newest-2 cleanup) fb5d414 verified ViuAI commited on 10 days ago
feat: full-ckpt HF push every 10k steps (resume safety net) + docs b5c4924 verified ViuAI commited on 10 days ago
feat: hf_round corpus-slice rotation (Option A full-data: file rotate + row skip + per-round seed) fdf24d2 verified ViuAI commited on 10 days ago
fix: exclude non-5col schema paths from HF stream (wikipedia/grammar/gsm8k CastError on shuffle) ca926e4 verified ViuAI commited on 11 days ago
fix: probe OOM reserve 4GB + expandable_segments + natural-mode stream shuffle (Hindi-only trap) 06e08fa verified ViuAI commited on 11 days ago
fix: DDP auto_tune probe-before-wrap + broadcast micro/accum, R0-only logs, empty-shard guard, safety import path 804855f verified ViuAI commited on 11 days ago
DDP multi-GPU support (torchrun, stride-shard, rank0 ckpt, ckpt without module prefix) 58b8147 verified ViuAI commited on 11 days ago