返回项目浏览

文档解析服务

把 PDF、Word、HTML 统一转成结构化文本,保留标题层级与表格。

限时免费
  • Python
  • FastAPI
  • Celery
  • MinIO

限时免费,之后会收费

这是示例项目,用来填充项目列表以便演示分页,请替换成你自己的项目介绍。

为什么需要它

做检索增强时,解析质量决定了上限。解析丢掉了标题层级,后面的切分就只能按固定长度硬切;表格被拆成散落的文字,模型再也读不出行列关系。

这个服务专门解决这一段。

输出的结构

每个文档解析成带层级的块,而不是一坨纯文本:

{
  "type": "table",
  "level": 2,
  "section": "性能对比",
  "rows": [["方案", "延迟"], ["A", "12ms"]]
}

块上带着它在原文里的位置,检索命中后可以回溯到具体页码。

支持情况

格式文本标题层级表格图片说明
PDF(文本层)按字号推断
PDF(扫描件)走 OCR
Word
HTML

扫描件的标题层级只能从版面位置推断,准确率明显低于有文本层的 PDF,这是格式本身的限制。

异步与重试

解析是慢操作,走 Celery 队列。大文件拆成页级任务并行,失败只重试失败的那几页,不必整份重来。