Raw data pools, pre-mixed ready-to-train datasets and checkpoints for DataComp-VLM.
ML Foundations
non-profit
AI & ML interests
None defined yet.
Recent Activity
Training, eval suite, and model from the paper "Large Scale Transfer Learning for Tabular Data via Language Modeling" https://arxiv.org/abs/2406.12031
Raw pools for use in DCLM competition
From Data Curation to Reinforcement Learning: Building a Strong Grounding Model for Computer-Use Agents
Data for "MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens"
-
MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
Paper • 2406.11271 • Published • 22 -
mlfoundations/MINT-1T-HTML
Viewer • Updated • 623M • 164k • 97 -
mlfoundations/MINT-1T-ArXiv
Viewer • Updated • 5.6M • 3.88k • 60 -
mlfoundations/MINT-1T-PDF-CC-2024-18
Updated • 84.7k • 30
DCLM Models + Datasets
Raw data pools, pre-mixed ready-to-train datasets and checkpoints for DataComp-VLM.
From Data Curation to Reinforcement Learning: Building a Strong Grounding Model for Computer-Use Agents
Training, eval suite, and model from the paper "Large Scale Transfer Learning for Tabular Data via Language Modeling" https://arxiv.org/abs/2406.12031
Data for "MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens"
-
MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
Paper • 2406.11271 • Published • 22 -
mlfoundations/MINT-1T-HTML
Viewer • Updated • 623M • 164k • 97 -
mlfoundations/MINT-1T-ArXiv
Viewer • Updated • 5.6M • 3.88k • 60 -
mlfoundations/MINT-1T-PDF-CC-2024-18
Updated • 84.7k • 30
Raw pools for use in DCLM competition
DCLM Models + Datasets