SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion Paper • 2503.11576 • Published Mar 14, 2025 • 166
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model Paper • 2510.14528 • Published Oct 16, 2025 • 129
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing Paper • 2509.22186 • Published Sep 26, 2025 • 177
facebook/mask2former-swin-base-coco-instance Image Segmentation • 0.1B • Updated Sep 7, 2023 • 2.12k • • 4
gaunernst/convnext_nano.cosface_ms1mv3 Image Feature Extraction • 15.3M • Updated Apr 25, 2024 • 34 • 2
facebook/mask2former-swin-small-ade-semantic Image Segmentation • 68.8M • Updated Sep 11, 2023 • 16.9k • • 8