OCR llama.cpp
https://huggingface.co/blog/ggml-org/using-ocr-models-with-llama-cpp Critères : Licence libre Tourne sur CPU Document FR ROI Full-document JSON/md
Collection11 items • Updated • 20Note GGUF de modèles pouvant faire de l'OCR (GGLM)
GLAM Extraction Leaderboard
📊4GLAM document extraction leaderboard (POC)
Note Benchmark autour des capacités d'extraction en JSON
numind/NuExtract3-GGUF
Image-Text-to-Text • 4B • Updated • 6.97k • 42Note Licence : apache-2.0 + Complétion de template plus poussée que les autres modèles + Peut formater en JSON les résultats .md d'autres modèles - Lent sur CPU (4B)
lightonai/LightOnOCR-2-1B
Image-Text-to-Text • 1B • Updated • 228k • • 834Note Licence : apache-2.0
-
mradermacher/LightOnOCR-2-1B-GGUF
0.6B • Updated • 441 • 7
Note Licence : apache-2.0 x Modèle générique pouvant réaliser des tâches d'OCR (pas fait pour cet usage) - Beaucoup trop gros pour tourner sur CPU (24B)
Note Licence : Modified MIT x Modèle générique pouvant réaliser des tâches d'OCR (pas fait pour cet usage) - Beaucoup trop gros pour tourner sur CPU (128B)
tencent/HunyuanOCR
Image-Text-to-Text • 1B • Updated • 911k • 827Note Licence : Tencent⚠️
ggml-org/HunyuanOCR-GGUF
0.5B • Updated • 8.78k • 14Note Licence : Tencent⚠️
prithivMLmods/HunyuanOCR-1.5-GGUF-Updated
Image-Text-to-Text • 0.5B • Updated • 3.3k • 4Note Licence : apache-2.0 (différente du modèle source ???)
baidu/Unlimited-OCR
Image-Text-to-Text • 3B • Updated • 1.38M • 4.33kNote Licence : MIT - Lit assez mal le texte manuscrit testé
sahilchachra/Unlimited-OCR-GGUF
Image-Text-to-Text • 3B • Updated • 8.49k • 147Note Licence : MIT
baidu/Qianfan-OCR
Image-Text-to-Text • 5B • Updated • 187k • 1.21kNote Serait meilleur que Unlimited-OCR sur la capacité de lecture
-
Reza2kn/Qianfan-OCR-GGUF
Image-Text-to-Text • 4B • Updated • 1.17k • 16 -
ATH-MaaS/OvisOCR2
Image-Text-to-Text • 0.9B • Updated • 239k • • 480
Abiray/OvisOCR2-GGUF
Image-Text-to-Text • 0.8B • Updated • 4.49k • 28Note à tester à nouveau
-
deepseek-ai/DeepSeek-OCR-2
Image-Text-to-Text • 3B • Updated • 786k • 1.11k
SandLogicTechnologies/DeepSeek-OCR-2-GGUF
Image-to-Text • 3B • Updated • 1.3k • 2Note Licence : MIT + Très rapide sur CPU + Meilleur en ROI - Mauvais sur la complétion d'un JSON de document complet
Form Field VLM Demo
📋3Detect and understand fields in a form page
Note Détection de champs (demo)
jbarrow/FFDetr
Updated • 5Note Détection de champs
pdf-net/ffdetr-filled
Object Detection • UpdatedNote Détection de champs (vides et remplis)
-
dots-studio/dots.ocr
Image-Text-to-Text • 3B • Updated • 1.12M • 1.33k
polymer/dots.mocr-GGUF
Image-to-Text • 2B • Updated • 68Note Licence : apache-2.0 + Résultats full-document .md comparables à LightOnOCR + bbox + Typage des zones du document (ex: image / tableau / liste / titre)
mradermacher/dots.ocr-i1-GGUF
Image-to-Text • 2B • Updated • 745 • 3Note tests infructueux avec llama.cpp
-
Qwen/Qwen3-VL-4B-Instruct-GGUF
Image-Text-to-Text • 4B • Updated • 169k • 66
unsloth/Qwen3-VL-2B-Instruct-GGUF
Image-Text-to-Text • 2B • Updated • 64.5k • 45Note Licence : apache-2.0 + Bon en ROI + Bon .md full-document - Très inconsistant sur la complétion de JSON d'un document entier
-
Qwen/Qwen3-VL-2B-Instruct-GGUF
Image-Text-to-Text • 2B • Updated • 133k • 60
FireRedTeam/FireRed-OCR
Image-to-Text • 2B • Updated • 2.36k • 167Note à tester
tiiuae/Falcon-OCR
Image-to-Text • 0.3B • Updated • 6.48k • 158Note à tester
PaddlePaddle/PaddleOCR-VL-1.6-GGUF
0.5B • Updated • 102k • 77Note Licence : apache2.0 + Très rapide / léger (0.5B) + Performant en full-document .md + Meilleur en ROI (0.4s pour lire un identifiant manuscrit) + Lit très bien le manuscrit - Pas fiable sur les cases à cocher
infly/Infinity-Parser2-Pro
Image-Text-to-Text • 35B • Updated • 13.8k • 97Note Licence : apache-2.0 - Beaucoup trop gros pour tourner sur CPU (128B)
-
prithivMLmods/Infinity-Parser2-Flash-GGUF
Image-Text-to-Text • 2B • Updated • 1.45k • 2
Note Modèles Datalab, spécialisés dans le traitement de document
datalab-to/chandra-ocr-2
Image-Text-to-Text • 5B • Updated • 1.98M • 531Note Licence : openrail
-
prithivMLmods/chandra-ocr-2-GGUF
Image-Text-to-Text • 5B • Updated • 11.2k • 42
datalab-to/surya-ocr-2-gguf
Image-Text-to-Text • 0.6B • Updated • 787k • 21Note Licence : openrail + Taux de confiance - Utilisation prévue avec un SDK → modèle pas vraiment générique
datalab-to/lift
Image-Text-to-Text • 10B • Updated • 156k • • 198Note Licence : openrail + Sortie JSON structurée (similaire à NuExtract3) - Trop lourd pour du CPU (10B)
prithivMLmods/lift-GGUF
Image-Text-to-Text • 9B • Updated • 3.71k • 7Note Licence : openrail + Sortie JSON structurée (similaire à NuExtract3) - Trop lourd pour du CPU (9B)
LiquidAI/LFM2.5-VL-450M-GGUF
Image-Text-to-Text • 0.4B • Updated • 20.5k • 71Note Licence : lfm1.0 (limite certaines utilisations commerciales) + Ultra rapide sur CPU (instantané sur une ROI) - Mauvais en full-document .md / JSON
LiquidAI/LFM2.5-VL-1.6B-GGUF
Image-Text-to-Text • 1B • Updated • 38.4k • 109Note Licence : lfm1.0 (limite certaines utilisations commerciales) + Toujours rapide même si plus gros que la version 450M (document complet traité en 26s sur CPU) + Plus de capacités que la version 450M (exemple : renvoyer un JSON complet) - Le JSON n'est pas consistant (tous les critères ne sont pas respectés) - Toujours mauvais pour lire un champ complet LightOnOCR-2-1B (modèle de taille équivalente) semble plus efficace
ggml-org/GLM-OCR-GGUF
0.9B • Updated • 32k • 107Note Licence : MIT - Ne relève pas les cases à cocher