zpdf

用Zig编写、注重速度和少拷贝的PDF文本提取库,目前处于早期alpha阶段,用于从PDF文件中提取文字。

分享到 X许可证: CC0-1.0

概述

zpdf 是用 Zig 编写的 PDF 文本提取库。它通过内存映射读取文件,尽可能避免复制数据,并以流式方式配合 arena 分配器提取文本。它支持多种压缩过滤器和字体编码,能解析交叉引用表和流,也能读取带标签 PDF 的结构树。README 将其标注为早期 alpha 版本。

主要特点

  • 内存映射读取,尽可能零拷贝
  • 支持 FlateDecode、ASCII85、ASCIIHex、LZW、RunLength
  • 支持 WinAnsi、MacRoman 和 ToUnicode 字体编码
  • 提取结构树,并可将结构化 PDF 导出为 Markdown
  • 可选严格或宽松的错误处理

适用场景

适合需要快速提取 PDF 文本的 Zig 开发者。目前处于早期 alpha 阶段,功能可能不完整。

上游仓库
Lulzx/zpdf
GitHub 上的 fork
Guo-astro/zpdf
上游 Star 数
922
分类
文档、媒体与内容
编程语言
Zig
许可证
CC0-1.0
Fork 时间
2025-12-31
同步状态
已同步上次同步 2026-09-29