← 全部场景
文档与数据处理
主要面向:通用
把一堆格式混乱的文档变成能用的结构化数据——这是 AI 落地里最实在、也最容易被低估的一类活。
说它实在,是因为效果好衡量:提取出来的信息对不对,一看就知道。说它被低估,是因为大家的注意力都在对话机器人上,反而忽略了这类不起眼但每天都在耗人力的工作。
典型场景
- 从合同、发票、报告里提取关键字段
- 把 PDF、扫描件转成能检索的文本
- 给大批文档打标签、分类、写摘要
- 把非结构化的描述整理成表格
决定成败的是文档状态,不是模型
这是这个场景最反直觉的一点:换更强的模型,通常不如把文档整理干净有用。
扫描件是第一道坎。 扫描版 PDF 本质是图片,没有文字层。判断方法很简单:用阅读器打开,试着选中一段文字,选不中就是扫描件。这类文件要先做 OCR,而 OCR 的错误往往是隐蔽的——数字识别错一位,后面全错,还查不出来。
表格是第二道坎。 二维表被拉平成文字后,行列对应关系就丢了。这不是模型能力问题,是信息在预处理阶段就没了。
版式混乱是第三道坎。 页眉页脚、水印、分栏排版,都会让解析出来的文本顺序错乱。
批量处理必须自己设计的三件事
质量门要可机械校验。 「提取得准不准」没法自动判断,但「该有的字段是不是都有」「日期格式对不对」「金额是不是数字」可以。把要求翻译成能跑脚本检查的规则,批处理才有意义。
失败要能单独重来。 跑一百份文档,失败几份是常态。要能知道哪几份失败了、为什么失败,单独重跑,而不是整批重来。
抽样人工复核不能省。 机械校验能拦住格式问题,拦不住「格式对但内容错」。第一批跑完务必人工抽查一部分。
什么时候该上,什么时候不该
该上:量大、重复、有明确的对错标准。人做这件事纯属消耗。
不该上:量很小(几十份手工做完了)、或者每份都需要专业判断(法律条款审查、医疗报告解读)。后者可以让 AI 做初筛,但结论必须有人负责。