zpdf
用Zig编写、注重速度和少拷贝的PDF文本提取库,目前处于早期alpha阶段,用于从PDF文件中提取文字。
分享到 X许可证: CC0-1.0
概述
zpdf 是用 Zig 编写的 PDF 文本提取库。它通过内存映射读取文件,尽可能避免复制数据,并以流式方式配合 arena 分配器提取文本。它支持多种压缩过滤器和字体编码,能解析交叉引用表和流,也能读取带标签 PDF 的结构树。README 将其标注为早期 alpha 版本。
主要特点
- 内存映射读取,尽可能零拷贝
- 支持 FlateDecode、ASCII85、ASCIIHex、LZW、RunLength
- 支持 WinAnsi、MacRoman 和 ToUnicode 字体编码
- 提取结构树,并可将结构化 PDF 导出为 Markdown
- 可选严格或宽松的错误处理
适用场景
适合需要快速提取 PDF 文本的 Zig 开发者。目前处于早期 alpha 阶段,功能可能不完整。
- 上游仓库
- Lulzx/zpdf
- GitHub 上的 fork
- Guo-astro/zpdf
- 上游 Star 数
- 922
- 分类
- 文档、媒体与内容
- 编程语言
- Zig
- 许可证
- CC0-1.0
- Fork 时间
- 2025-12-31
- 同步状态
- 已同步上次同步 2026-09-29
同分类更多: 文档、媒体与内容
基于Markdown的排版系统,可把文本转成论文、演示文稿、网站、书籍和知识库,并为Markdown增加脚本能力。
可将Word、PowerPoint、Excel、PDF等多种文档转换为干净Markdown的高速库,提供Node.js和Python接口。
在你的仓库中生成完整Astro文档站点的脚手架,文件可直接编辑,让人和AI代理都能方便使用文档。
PowerPoint的替代品,整个演示文稿就是一个HTML文件,内含查看、演示和编辑功能,任何浏览器都能打开。