跳转到内容

TurboOCR Docs

TurboOCR 是一个自托管的 GPU 文档解析器——不只是 OCR。它在一条 C++/CUDA/TensorRT 流水线里同时运行 PP-OCRv6 文本检测与识别,外加版面分析、表格(→ HTML)、公式(→ LaTeX),以及按阅读顺序导出的 Markdown,并用单个二进制同时提供 HTTP 和 gRPC。POST 一张图片或一个 PDF,立刻拿到结构化 JSON——文本、置信度、边界多边形,外加可选的版面区域、表格与公式。一切都在本地运行;无需 VLM,无需任何 API。

单卡 RTX 5090 上,整页 OCR 可达 收据约 559 张/秒(表单约 520 张/秒),完整结构化解析(版面 + 表格 + 公式)约 20 页/秒——而 PaddleOCR-VL 这类 VLM 文档解析器只有约 1 页/秒。运行环境:Linux + 任意 Turing 及更新架构的 NVIDIA GPU;MIT 协议;Docker 镜像位于 ghcr.io/aiptimizer/turboocr

  • 收据最高 559 张/秒 / 表单 520 张/秒——默认即最快,单卡 RTX 5090
  • 在表单与收据上比传统 OCR 引擎快 15–90×——medium 档位 FUNSD 92% / CORD 93% 词级 F1(英文/拉丁文;默认档位为 tiny 以追求最高吞吐)
  • 完整文档解析——125 篇 OmniDocBench 子集上 Overall 0.90,约 20 页/秒,全本地(PaddleOCR-VL 在同一子集上为 0.95,约 1 页/秒)
  • PP-OCRv6——单个模型覆盖拉丁文 + 中文 + 日文;通过 OCR_MODELtiny(默认)/ small / medium。更多文字(阿拉伯文、西里尔文、韩文、泰文、希腊文)由保留的 PP-OCRv5 识别模型提供
  • 表格 → HTML——SLANet-Plus 结构模型,通过 TABLE_BACKEND=slanext + ?tables=1 按需开启
  • 公式 → LaTeX——进程内纯 C++ 的 PP-FormulaNet-S,通过 FORMULA_BACKEND=ppformulanet_s + ?formulas=1 按需开启
  • 版面 + 阅读顺序——PP-DocLayoutV3(RT-DETR-L,25 类区域),默认加载,按请求通过 ?layout=1 运行
  • Markdown 导出——POST /ocr/markdown 把整页转成忠实的 Markdown(表格、公式内联)
  • 原生 PDF——由 PDFium 工作池渲染页面,送入同一条 GPU 流水线,可选页图导出与自动旋正
  • HTTP + gRPC——同一个二进制,共用同一条 GPU 流水线池;GET /capabilities 报告已加载哪些阶段
  • 一行 docker 部署——首次启动构建 TensorRT 引擎,随后缓存到命名卷
  • Prometheus 指标——/metrics 暴露请求计数、延迟直方图、显存使用情况
  • MIT 协议,源码托管在 GitHub