megaparse

文件解析器,把PDF、Word、PowerPoint转换为适合LLM的格式并尽量不丢失信息,用于向AI模型输入文档。

分享到 X许可证: Apache-2.0

概述

MegaParse 是 Python 文件解析器,把文档转换成适合 LLM 摄取的格式,并力求不丢失信息。它支持 PDF、PowerPoint 和 Word,也列出了文本、Excel 和 CSV。可处理表格、目录、页眉、页脚和图片。项目开源,需要 Python 3.11 或更高版本,用 pip 安装。

主要特点

  • 解析 PDF、PowerPoint 和 Word 文档
  • 还列出 Excel、CSV 和纯文本支持
  • 处理表格、页眉、页脚和图片
  • 解析时力求不丢失信息
  • Python 3.11 及以上用 pip 安装

适用场景

适合把办公文档送入 LLM 或 RAG 流程、希望保留文档结构的开发者。需要 Python 3.11 或更高版本。

上游仓库
The-Vibe-Company/megaparse
GitHub 上的 fork
Guo-astro/megaparse
上游 Star 数
7.4k
分类
文档、媒体与内容
许可证
Apache-2.0
Fork 时间
2026-02-22
同步状态
已同步上次同步 2026-09-29