GLM-OCR
面向复杂文档理解的多模态OCR模型,可把图片中的文字转换为文本,强调准确与快速。
分享到 X许可证: Apache-2.0
概述
GLM-OCR 是面向复杂文档理解的多模态 OCR 模型。它结合视觉编码器、轻量跨模态连接器和 GLM-0.5B 语言解码器,采用先版面分析、再并行识别的两阶段流程。可把含公式和表格的文档图像转成文本,并支持用 vLLM、SGLang 或 Ollama 部署。
主要特点
- 版面分析加并行识别的两阶段流程
- 支持公式、表格和信息抽取
- 仅 0.9B 参数
- 可用 vLLM、SGLang、Ollama 部署
- 面向复杂表格、代码类文档和印章
适用场景
适合需要把真实复杂文档转成文本、又想自行部署小体量模型的团队。
- 上游仓库
- zai-org/GLM-OCR
- GitHub 上的 fork
- Guo-astro/GLM-OCR
- 上游 Star 数
- 7.5k
- 分类
- 文档、媒体与内容
- 编程语言
- Python
- 许可证
- Apache-2.0
- Fork 时间
- 2026-03-17
- 同步状态
- 已同步上次同步 2026-09-29
同分类更多: 文档、媒体与内容
基于Markdown的排版系统,可把文本转成论文、演示文稿、网站、书籍和知识库,并为Markdown增加脚本能力。
可将Word、PowerPoint、Excel、PDF等多种文档转换为干净Markdown的高速库,提供Node.js和Python接口。
在你的仓库中生成完整Astro文档站点的脚手架,文件可直接编辑,让人和AI代理都能方便使用文档。
PowerPoint的替代品,整个演示文稿就是一个HTML文件,内含查看、演示和编辑功能,任何浏览器都能打开。