TurboOCR Docs
TurboOCR ist ein selbstgehosteter GPU-Dokumentparser – nicht nur OCR. Er führt PP-OCRv6-Textdetektion und -erkennung sowie Layout, Tabellen (→ HTML), Formeln (→ LaTeX) und Markdown in Lesereihenfolge in einer einzigen C++/CUDA/TensorRT-Pipeline aus und stellt HTTP und gRPC aus einem einzigen Binary bereit. Senden Sie ein Bild oder PDF per POST und Sie erhalten strukturiertes JSON zurück – Text, Konfidenz, Begrenzungspolygone und optional Layout-Bereiche, Tabellen und Formeln. Alles läuft lokal; kein VLM, keine API.
Auf einer einzelnen RTX 5090 erreicht er Ganzseiten-OCR mit bis zu 559 Bildern/Sek. auf Belegen (~520 Bilder/Sek. auf Formularen) und vollständiges strukturiertes Parsing (Layout + Tabellen + Formeln) mit ~20 Seiten/Sek. – wo VLM-Dokumentparser wie PaddleOCR-VL mit ~1 Seite/Sek. laufen. Linux und jede NVIDIA-GPU ab Turing, MIT-Lizenz, ausgeliefert als Docker-Image auf ghcr.io/aiptimizer/turboocr.
Highlights
Abschnitt betitelt „Highlights“- Bis zu 559 Bilder/Sek. auf Belegen / 520 Bilder/Sek. auf Formularen – standardmäßig am schnellsten, auf einer einzelnen RTX 5090
- 15–90× schneller als klassische OCR-Engines auf Formularen und Belegen – FUNSD 92 % / CORD 93 % Wort-F1 auf der
medium-Stufe (Englisch/Latein; Standardstufe isttinyfür maximalen Durchsatz) - Vollständiges Dokumentparsing – 0,90 Overall auf einem 125-Dokumente-OmniDocBench-Subset bei ~20 Seiten/Sek., vollständig lokal (PaddleOCR-VL erreicht 0,95 auf demselben Subset bei ~1 Seite/Sek.)
- PP-OCRv6 – ein Modell deckt Latein + Chinesisch + Japanisch ab; wählen Sie
tiny(Standard) /small/mediumüberOCR_MODEL. Weitere Schriften (Arabisch, Kyrillisch, Koreanisch, Thai, Griechisch) über die beibehaltenen PP-OCRv5-Erkenner - Tabellen → HTML – SLANet-Plus-Strukturmodell, aktivierbar mit
TABLE_BACKEND=slanext+?tables=1 - Formeln → LaTeX – PP-FormulaNet-S in reinem C++ in-process, aktivierbar mit
FORMULA_BACKEND=ppformulanet_s+?formulas=1 - Layout + Lesereihenfolge – PP-DocLayoutV3 (RT-DETR-L, 25 Bereichsklassen), standardmäßig geladen, pro Anfrage über
?layout=1ausgeführt - Markdown-Export –
POST /ocr/markdownverwandelt eine Seite in originalgetreues Markdown (Tabellen und Formeln inline) - Nativer PDF-Endpoint – Seiten werden von einem PDFium-Worker-Pool gerendert und in dieselbe GPU-Pipeline eingespeist, mit optionalem Seitenbild-Export und Auto-Rotation
- HTTP + gRPC aus einem Binary, mit gemeinsamem GPU-Pipeline-Pool;
GET /capabilitiesmeldet, welche Stufen geladen sind - Ein-Befehl-Docker-Deploy – TensorRT-Engines werden beim ersten Start gebaut und dann in einem Named Volume zwischengespeichert
- Prometheus-Metriken auf
/metrics– Anfragezähler, Latenz-Histogramme, VRAM-Nutzung - MIT-Lizenz, Quellcode auf GitHub