GLM-OCR

面向复杂文档理解的多模态OCR模型,可把图片中的文字转换为文本,强调准确与快速。

分享到 X许可证: Apache-2.0

概述

GLM-OCR 是面向复杂文档理解的多模态 OCR 模型。它结合视觉编码器、轻量跨模态连接器和 GLM-0.5B 语言解码器,采用先版面分析、再并行识别的两阶段流程。可把含公式和表格的文档图像转成文本,并支持用 vLLM、SGLang 或 Ollama 部署。

主要特点

  • 版面分析加并行识别的两阶段流程
  • 支持公式、表格和信息抽取
  • 仅 0.9B 参数
  • 可用 vLLM、SGLang、Ollama 部署
  • 面向复杂表格、代码类文档和印章

适用场景

适合需要把真实复杂文档转成文本、又想自行部署小体量模型的团队。

上游仓库
zai-org/GLM-OCR
GitHub 上的 fork
Guo-astro/GLM-OCR
上游 Star 数
7.5k
分类
文档、媒体与内容
编程语言
Python
许可证
Apache-2.0
Fork 时间
2026-03-17
同步状态
已同步上次同步 2026-09-29