Commit History

Fix CUDA OOM on T4: cast model to amp_dtype directly, batch_size=2, safe RMSNorm
9d0f9ca
verified

ViuAI commited on

Sync data/scripts/ingest_large_cinema_mythology.py with massive Mythology and Bollywood Cinema corpora expansion
c183e8d
verified

ViuAI commited on

feat: wipe-proof HF persistence (full ckpt + live log + newest-2 cleanup)
fb5d414
verified

ViuAI commited on

fix: exclude non-5col schema paths from HF stream (wikipedia/grammar/gsm8k CastError on shuffle)
ca926e4
verified

ViuAI commited on

fix: probe OOM reserve 4GB + expandable_segments + natural-mode stream shuffle (Hindi-only trap)
06e08fa
verified

ViuAI commited on

sync local: enforce_mix sampler, tokenizer v2 (mask fix + 35/30/35), mix optional docs, repair scripts
991af26
verified

ViuAI commited on

feat: 100% overnight-resilient batch repair with 999 retries and persistent rate-limit handling
338f372
verified

ViuAI commited on

feat: batch upload shards (10 at once) in 1 commit to permanently bypass 128 commits/hr rate limit
6085120
verified

ViuAI commited on

fix: add smart 429 rate limit backoff and retry to repair scripts
e1c1d38
verified

ViuAI commited on

refactor: clean repo, fix cross-platform paths, update progress
6591c1c
verified

ViuAI commited on

docs: add official comprehensive data audit report (145.93GB/105.1B tokens - 100% PASS)
51b7902
verified

ViuAI commited on

docs & scripts: add dedicated grammar stream milestone (145.93GB/105.1B tokens)
2001a4e
verified

ViuAI commited on

docs & scripts: add full-scale 5-domain milestone (145.93GB/105B tokens)
8d7554c
verified

ViuAI commited on

docs & scripts: add dedicated science stream milestone (128.75GB/92B tokens)
7ac6a19
verified

ViuAI commited on

docs & scripts: add dictionary, expanded stories, and massive uncensored datasets milestone (117GB/83B tokens)
46c2986
verified

ViuAI commited on

feat/docs: sync stories & uncensored scripts & docs for data/scripts/add_stories_and_uncensored.py
bfdbc0f
verified

ViuAI commited on

feat/docs: sync open-source toxicity datasets & docs for data/scripts/add_open_source_toxicity.py
a69d2b9
verified

ViuAI commited on

feat/docs: sync dedicated toxicity folder script & docs for data/scripts/generate_toxicity_lexicon.py
2c8f401
verified

ViuAI commited on

docs/feat: sync translation & hinglish expansion for data/scripts/add_curated_hinglish.py
30b674c
verified

ViuAI commited on

docs/feat: sync translation & hinglish expansion for data/scripts/add_samanantar.py
bc2430b
verified

ViuAI commited on

docs/feat: sync deep domains, wikipedia ingestion & docs for data/scripts/add_wikipedia.py
205a575
verified

ViuAI commited on

docs/feat: sync deep domains, wikipedia ingestion & docs for data/scripts/generate_deep_domains.py
2020c90
verified

ViuAI commited on

feat: add Google Colab userdata secrets support to collector
2629527
verified

ViuAI commited on

fix: Hinglish column key mapping and streamline stream execution order
c8521a2
verified

ViuAI commited on

feat: upgrade collector to 1GB shards with smart auto-resume
1072676
verified

ViuAI commited on

Add Single-Cell All-in-One Cloud Ingestion runner to Kaggle runbook
4234e9e
verified

ViuAI commited on

Add Pillar 26 Grammar & Language Mechanics (Hindi Vyakaran, English Grammar, Hinglish Syntax)
cc255c6
verified

ViuAI commited on

Add 25 Pillars: Stories, Movie Plots, Songs, Mobile Tech, Jokes & Street Roasts
7812c7f
verified

ViuAI commited on

Add Pillar 21 Translation & Global Cuisines expansion to data pipeline
5c80566
verified

ViuAI commited on

Add Step 4 30B-50B+ Kaggle data collection suite & 20-pillar knowledge matrix
25bc372
verified

ViuAI commited on

feat: SDPA FlashAttention, language tags conditioning, probe safety, slim checkpoints, and streaming clean
57f2f3e
verified

ViuAI commited on

step4: clean_dedup.py + pull status
798598c
verified

ViuAI commited on

init: 28L MoE 241M audit-fixed, smoke pass
140f9f6
verified

ViuAI commited on