Skip to main content

什么是 SoPDF

SoPDF 是一个面向 Python 的开源 PDF 处理库,覆盖从渲染、文本提取到结构编辑的完整流程。你可以用它构建文档解析、检索、拆分合并、批处理等生产级能力。
SoPDF 使用 Apache 2.0 许可证。你可以在个人项目、商业产品和开源项目中直接使用。

为什么选择 SoPDF

  • 高性能:在官方基准中,相比 PyMuPDF,SoPDF 在多个核心场景下表现更快(如渲染最高约 2.82x、纯文本提取约 2.74x、全文搜索约 3.17x)。
  • 能力完整:同时支持渲染、文本提取、搜索、拆分、合并、压缩保存、元数据与目录读取等。
  • API 直观:面向日常工程场景设计,学习成本低。
  • 许可友好:Apache 2.0,便于企业与开源社区使用和分发。

核心能力

技术架构

SoPDF 采用双引擎协同架构:
  • pypdfium2(Google PDFium):负责渲染、文本提取与搜索。
  • pikepdf(libqpdf):负责结构读取、写入与保存压缩。
通过脏标记与热重载机制,写操作后可自动同步到读路径,避免你手动维护双引擎状态。

快速开始

环境要求:Python 3.10+

资源与生态

  • 项目仓库:SoMarkAI/SoPDF
  • PyPI 包:sopdf
  • 示例代码:仓库 examples/ 目录
  • 性能基准:仓库 tests/benchmark/ 目录

开源协议

Apache License 2.0