Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening Paper • 2609.18708 • Published 12 days ago • 82
Continual Learning Mechanisms Compose for Long-Horizon Memorization Paper • 2609.06986 • Published 21 days ago • 374
DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF Image-Text-to-Text • 27B • Updated 3 days ago • 1.68M • 1.23k
Studying Image Tokenizers as Visual Languages in Unified Multimodal Models Paper • 2609.09143 • Published 20 days ago • 29
Scaling Automatic Research Agents via World Models Paper • 2608.12564 • Published about 1 month ago • 481
DriveZero: End-to-End Driving Beyond Human Demonstrations Paper • 2609.06055 • Published 23 days ago • 57
RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning Paper • 2609.03199 • Published 26 days ago • 31
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 265
GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization Paper • 2608.01492 • Published Aug 2 • 15
DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces Paper • 2608.03451 • Published Aug 4 • 34
Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models Paper • 2608.04349 • Published Aug 5 • 13
StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field Paper • 2608.01954 • Published Aug 3 • 13
DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF Image-Text-to-Text • 9B • Updated 4 days ago • 1.78M • 852