文档解析服务
把 PDF、Word、HTML 统一转成结构化文本,保留标题层级与表格。
限时免费
限时免费,之后会收费
这是示例项目,用来填充项目列表以便演示分页,请替换成你自己的项目介绍。
为什么需要它
做检索增强时,解析质量决定了上限。解析丢掉了标题层级,后面的切分就只能按固定长度硬切;表格被拆成散落的文字,模型再也读不出行列关系。
这个服务专门解决这一段。
输出的结构
每个文档解析成带层级的块,而不是一坨纯文本:
{
"type": "table",
"level": 2,
"section": "性能对比",
"rows": [["方案", "延迟"], ["A", "12ms"]]
}
块上带着它在原文里的位置,检索命中后可以回溯到具体页码。
支持情况
| 格式 | 文本 | 标题层级 | 表格 | 图片说明 |
|---|---|---|---|---|
| PDF(文本层) | 是 | 按字号推断 | 是 | 是 |
| PDF(扫描件) | 走 OCR | 弱 | 是 | 否 |
| Word | 是 | 是 | 是 | 是 |
| HTML | 是 | 是 | 是 | 是 |
扫描件的标题层级只能从版面位置推断,准确率明显低于有文本层的 PDF,这是格式本身的限制。
异步与重试
解析是慢操作,走 Celery 队列。大文件拆成页级任务并行,失败只重试失败的那几页,不必整份重来。