Zum Inhalt springen

TurboOCR Docs

TurboOCR ist ein selbstgehosteter GPU-Dokumentparser – nicht nur OCR. Er führt PP-OCRv6-Textdetektion und -erkennung sowie Layout, Tabellen (→ HTML), Formeln (→ LaTeX) und Markdown in Lesereihenfolge in einer einzigen C++/CUDA/TensorRT-Pipeline aus und stellt HTTP und gRPC aus einem einzigen Binary bereit. Senden Sie ein Bild oder PDF per POST und Sie erhalten strukturiertes JSON zurück – Text, Konfidenz, Begrenzungspolygone und optional Layout-Bereiche, Tabellen und Formeln. Alles läuft lokal; kein VLM, keine API.

Auf einer einzelnen RTX 5090 erreicht er Ganzseiten-OCR mit bis zu 559 Bildern/Sek. auf Belegen (~520 Bilder/Sek. auf Formularen) und vollständiges strukturiertes Parsing (Layout + Tabellen + Formeln) mit ~20 Seiten/Sek. – wo VLM-Dokumentparser wie PaddleOCR-VL mit ~1 Seite/Sek. laufen. Linux und jede NVIDIA-GPU ab Turing, MIT-Lizenz, ausgeliefert als Docker-Image auf ghcr.io/aiptimizer/turboocr.

  • Bis zu 559 Bilder/Sek. auf Belegen / 520 Bilder/Sek. auf Formularen – standardmäßig am schnellsten, auf einer einzelnen RTX 5090
  • 15–90× schneller als klassische OCR-Engines auf Formularen und Belegen – FUNSD 92 % / CORD 93 % Wort-F1 auf der medium-Stufe (Englisch/Latein; Standardstufe ist tiny für maximalen Durchsatz)
  • Vollständiges Dokumentparsing0,90 Overall auf einem 125-Dokumente-OmniDocBench-Subset bei ~20 Seiten/Sek., vollständig lokal (PaddleOCR-VL erreicht 0,95 auf demselben Subset bei ~1 Seite/Sek.)
  • PP-OCRv6 – ein Modell deckt Latein + Chinesisch + Japanisch ab; wählen Sie tiny (Standard) / small / medium über OCR_MODEL. Weitere Schriften (Arabisch, Kyrillisch, Koreanisch, Thai, Griechisch) über die beibehaltenen PP-OCRv5-Erkenner
  • Tabellen → HTML – SLANet-Plus-Strukturmodell, aktivierbar mit TABLE_BACKEND=slanext + ?tables=1
  • Formeln → LaTeX – PP-FormulaNet-S in reinem C++ in-process, aktivierbar mit FORMULA_BACKEND=ppformulanet_s + ?formulas=1
  • Layout + Lesereihenfolge – PP-DocLayoutV3 (RT-DETR-L, 25 Bereichsklassen), standardmäßig geladen, pro Anfrage über ?layout=1 ausgeführt
  • Markdown-ExportPOST /ocr/markdown verwandelt eine Seite in originalgetreues Markdown (Tabellen und Formeln inline)
  • Nativer PDF-Endpoint – Seiten werden von einem PDFium-Worker-Pool gerendert und in dieselbe GPU-Pipeline eingespeist, mit optionalem Seitenbild-Export und Auto-Rotation
  • HTTP + gRPC aus einem Binary, mit gemeinsamem GPU-Pipeline-Pool; GET /capabilities meldet, welche Stufen geladen sind
  • Ein-Befehl-Docker-Deploy – TensorRT-Engines werden beim ersten Start gebaut und dann in einem Named Volume zwischengespeichert
  • Prometheus-Metriken auf /metrics – Anfragezähler, Latenz-Histogramme, VRAM-Nutzung
  • MIT-Lizenz, Quellcode auf GitHub