TurboOCR Docs
TurboOCR est un parseur de documents GPU auto-hébergé — pas seulement de l’OCR. Il exécute la détection et la reconnaissance de texte PP-OCRv6, plus la mise en page, les tableaux (→ HTML), les formules (→ LaTeX) et le Markdown dans l’ordre de lecture, dans un seul pipeline C++/CUDA/TensorRT, et expose HTTP et gRPC depuis un unique binaire. Envoyez une image ou un PDF en POST, vous recevez du JSON structuré en retour — texte, score de confiance, polygones englobants et, en option, régions de mise en page, tableaux et formules. Tout s’exécute en local ; aucun VLM, aucune API.
Sur un seul RTX 5090, il soutient l’OCR pleine page jusqu’à 559 img/s sur des reçus (~520 img/s sur des formulaires), et le parsing structuré complet (mise en page + tableaux + formules) à ~20 pages/s — là où les parseurs de documents VLM comme PaddleOCR-VL tournent à ~1 page/s. Linux et n’importe quel GPU NVIDIA Turing ou plus récent, licence MIT, livré comme image Docker sur ghcr.io/aiptimizer/turboocr.
Points forts
Section intitulée « Points forts »- Jusqu’à 559 img/s sur des reçus / 520 img/s sur des formulaires — le plus rapide par défaut, sur un seul RTX 5090
- 15 à 90× plus rapide que les moteurs OCR classiques sur formulaires et reçus — FUNSD 92 % / CORD 93 % de F1 par mot sur le palier
medium(anglais/latin ; le palier par défaut esttinypour un débit maximal) - Parsing de documents complet — 0,90 Overall sur un sous-ensemble OmniDocBench de 125 documents à ~20 pages/s, entièrement en local (PaddleOCR-VL obtient 0,95 sur le même sous-ensemble à ~1 page/s)
- PP-OCRv6 — un seul modèle couvre latin + chinois + japonais ; choisissez
tiny(défaut) /small/mediumviaOCR_MODEL. Plus d’écritures (arabe, cyrillique, coréen, thaï, grec) via les reconnaisseurs PP-OCRv5 conservés - Tableaux → HTML — modèle de structure SLANet-Plus, activable avec
TABLE_BACKEND=slanext+?tables=1 - Formules → LaTeX — PP-FormulaNet-S en pur C++ in-process, activable avec
FORMULA_BACKEND=ppformulanet_s+?formulas=1 - Mise en page + ordre de lecture — PP-DocLayoutV3 (RT-DETR-L, 25 classes de régions), chargé par défaut, exécuté par requête via
?layout=1 - Export Markdown —
POST /ocr/markdowntransforme une page en Markdown fidèle (tableaux et formules en ligne) - PDF natif — pages rendues par un pool de workers PDFium puis injectées dans le même pipeline GPU, avec export d’images de page et auto-rotation en option
- HTTP + gRPC depuis un seul binaire, partageant le même pool de pipelines GPU ;
GET /capabilitiesindique quelles étapes sont chargées - Déploiement Docker en une ligne — les moteurs TensorRT se compilent au premier démarrage, puis sont mis en cache dans un volume nommé
- Métriques Prometheus sur
/metrics— compteurs de requêtes, histogrammes de latence, utilisation VRAM - Licence MIT, code source sur GitHub