# 多维表格批量处理 PDF/Word 文档：附件列内容提取与要点总结

> 在飞书多维表格里批量处理文档：用字段捷径对附件列的 PDF、Word、Excel 批量做内容提取、OCR 识别与要点总结，覆盖合同、发票、简历场景，附提取提示词模板。

分类：办公与业务流程　
发布：2026-08-05　
原文：https://apibobo.com/content/posts/bitable-document-ai-processing/

---

法务收了一批合同要登记关键条款、财务攒了一沓发票要录金额税号、HR 邮箱里几十份简历要筛——这些文件躺在附件里就是「死数据」：不能筛选、不能统计、不能提醒到期。人工一份份打开、找字段、抄进表格，既慢又容易抄错。

这篇教程的做法是：**把文档理解做成飞书多维表格的一个字段**。PDF、Word 等文件作为附件传进表格，新增一列文档处理字段，写好「要提取什么」，选中整列批量运行——多维表格 PDF 提取的结果直接写回同一行，扫描件也能靠模型的 OCR 能力识别。

## 准备工作

1. 一个飞书账号，能创建多维表格；
2. 一个 [波波 API](https://apibobo.com) 的 Key：注册即送体验额度，一个 Key 通用于多模态理解、生图、语音转写等各类字段捷径；
3. 表格里建一个附件字段，把要处理的文件传进去，一行一份文档；文件来源（对接人、收件日期等）放同行其他列。

## 第一步：安装文档处理字段捷径

在多维表格中新建字段，字段类型选择「字段捷径」，在捷径市场搜索「波波」找到文档理解捷径，安装后在配置面板粘贴 API Key。

## 第二步：配置文档来源和提取指令

- **文档来源**：引用附件列，PDF、Word 等常见格式都可以，扫描版 PDF 和图片同样能识别（多模态模型自带 OCR 能力）；
- **提取指令**：写清楚要什么、按什么格式输出。这一步决定结果好不好用，比如：

```
从以下合同中提取：甲方、乙方、合同金额、签署日期、到期日期。
输出 JSON，缺失的字段填 null，金额只输出数字。
```

**输出格式一定要写死**——规定 JSON 字段名或「每项一行」，提取结果才能被后续公式、筛选和到期提醒自动化直接消费。

## 第三步：批量运行

先选几行试跑，确认提取字段齐全、格式稳定，再选中整列批量运行。每行独立处理、独立落库，某份文件损坏或识别失败不影响其他行，单独重传重跑即可。跑完之后整批文件就从「附件堆」变成了可筛选、可统计的结构化数据。

## 三类高频场景与提取模板

| 场景 | 提取指令模板 |
| --- | --- |
| 合同登记 | `提取甲方、乙方、合同金额、签署日期、到期日、违约条款要点，输出 JSON` |
| 发票录入 | `提取发票号码、开票日期、销售方名称、价税合计、税额，只输出 JSON，金额为数字` |
| 简历初筛 | `提取姓名、工作年限、最近公司与职位、核心技能（最多 5 个），并用一句话评价与「{岗位要求}」的匹配度` |

简历场景可以再加一列 AI 字段，引用提取结果批量打「优先约面 / 待定 / 不匹配」标签，配合筛选视图直接出初筛名单。AI 字段的提示词写法详见[多维表格 AI 字段教程](/content/posts/bitable-llm-ai-field/)。

## 常见问题

**扫描件、拍照上传的文件能识别吗？**
可以。多模态模型对扫描件和照片自带 OCR 能力，印刷体识别效果好；手写内容识别率取决于字迹清晰度，关键单据建议抽查复核。

**提取结果偶尔缺字段或格式跑偏怎么办？**
在指令里给一个完整的输出示例，并规定「缺失填 null，不要解释」。仍不稳定的行单独重跑一次通常就正常了。

**上百页的大文件能处理吗？**
可以，但费用和耗时都随文档长度增加。只关心其中某一部分（如合同正文而非附件清单）时，在指令里点明范围，结果更准也更省。

**合同、发票是敏感数据，怎么控制风险？**
按次调用、不留档订阅；表格侧用权限最小化管理原表，对外只共享脱敏后的提取结果视图。关键金额、日期字段建议保留人工抽查环节，AI 负责录入、人负责复核。

## 延伸阅读

- [多维表格 AI 字段教程：批量调用大模型做摘要、翻译与打标签](/content/posts/bitable-llm-ai-field/)
- [国内使用 OpenAI 兼容 API 的实用方案：一个 Key 调多家模型](/content/posts/openai-compatible-api-china/)