PDF 是”按页定位”的文件,理论上能从 1000 页里精确抽第 738 页。但实际做这件事的工具链经常出岔子:页码到底是 0 开始还是 1 开始?、怎么表示”1 到 3 加 7 到 9”?、抽完以后原文件还在不在?
本文不讲理论,直接给方法 + 5 个实战会用到的页码表示法。所有操作在浏览器本地完成,文件不上传。
30 秒总览
提取 PDF 页面有两种路线:
- 范围模式 — 输入
1-3,5,7-9,输出一份只含这些页面的新 PDF,适合”取几页拼一份”。 - 每页拆分 — 输出一个 ZIP 包,里面是 N 个单页 PDF,适合”批量分发章节各自归档”。
两者技术实现一样,只是输出打包策略不同。选哪个取决于你怎么用 — 发给同事的微信文件用模式 1(单文件),归档到网盘用模式 2(每页一个文件便于检索)。
5 个真实的页码表示法
1. 简单区间 — 1-3
抽 1 到 3 页(共 3 页),输出 report-pages-1-3.pdf。
坑: 部分 PDF 编辑器会把”1-3”理解成”1、2、3”(包含两端),但有些会把”1-3”理解成”1、2”(左闭右开)。规范是两端都包含,我们的工具遵守这个规范。
2. 多区间 — 1-3,5,7-9
抽 1-3 页,加第 5 页,加 7-9 页(共 7 页)。
坑: 逗号必须是英文半角。如果写 1-3,5,7-9(全角逗号),会报”无效语法”。
3. 倒序 — 5,1-3
抽 5 页放第一个,然后 1、2、3 页依次跟在后面。这在”提取摘要 + 单独放致谢”的场景很有用。
坑: 部分 PDF 工具会把 5,1-3 自动排序成 1-5(升序),丢失了用户的”倒序”意图。我们的工具保留用户输入的顺序。
4. 反向区间 — 3-1
工具会自动归一化为 1-3。即使你写错了,也不会报错。
5. 重复区间 — 1-3,2
工具会自动去重为 1-3。重复内容不会让输出翻倍。
3 个实战场景
场景 1:从合同 PDF 里抽出”签字页”发给法务
典型输入: 30 页合同,签字页在第 28 页。
操作: 用 PDF 工具的拆分模式,输入 28,输出 contract-page-28.pdf。
坑: 合同的”页码”和”物理页号”经常对不上 — 封面、目录可能用罗马数字 (i, ii, iii),正文用阿拉伯数字 (1, 2, 3)。工具按物理页号操作,不管 PDF 显示的页码标签。所以你要的第 28 页,可能就是工具理解的第 30 页。验证方法:用 PDF 阅读器翻到签字页,记下物理页号(通常显示在底部的”3 / 30”)。
场景 2:把 200 页的论文按章节拆成 ZIP 分发给合作者
典型输入: 200 页论文,要按章节分发给 5 个合作者(每个章节 30-50 页)。
操作: 用「每页拆分」模式,输出 paper-pages-001.pdf … paper-pages-200.pdf 一个 ZIP,丢给合作者各自挑自己那部分。
坑: 单页 PDF 文件名零填充位数 — 100 页以内的 PDF 输出 001.pdf,超过 100 页输出 001.pdf 到 200.pdf (3 位数)。避免 1.pdf, 2.pdf, ..., 10.pdf, 11.pdf 这种字典序混乱(10 会排在 2 前面)。
场景 3:从 5 份 PDF 里提取第 1 页拼成”目录页”
典型输入: 5 份 PDF,各取首页 → 一份 5 页的目录页 PDF。
操作: 这个其实是合并 + 拆分的组合 — 用我们的工具先逐份提取 1(每份输出 1 页),再合并 5 份。或者直接用 pdf-lib 写脚本,但手动用工具也行,只是多两步。
坑: 如果原始 PDF 是”扫描件型 PDF”(每页是一张图),提取页能成功,但搜索文字会丢失。这种场景要 OCR 才行,提取 PDF 页面解决不了。
5 个常见错误和避免方法
错误 1:以为页码 = “PDF 顶部写的那个数字”
避免: 用 PDF 阅读器底部状态栏的”3 / 30”,那个是物理页号。
错误 2:输入超长范围(比如 10000 页)
避免: 输入前检查 PDF 实际页数。范围超过实际页数会报”超出范围”,不会偷偷给你空文件。
错误 3:拆分加密 PDF
避免: PDF 加密保护需要解密密码,工具不支持。如果是你的 PDF,先在生成它的软件里解除加密;如果是别人的,要求对方提供。
错误 4:拆分超大 PDF(超过 100 MB)
避免: 我们设的 100 MB 限制是防止浏览器 tab 崩溃。如果你的 PDF 确实大,先用别的工具(比如桌面版 pdftk)切成 50 页的块,再上传到我们这里精细拆分。
错误 5:拆分前忘了检查”每页拆分”输出多少文件
200 页 PDF 用「每页拆分」会输出 200 个文件 + 1 个 ZIP。下载前要心里有数 — 浏览器下载 200 个小文件没问题,但如果你的网盘限速,要预留时间。
推荐做法
- 先看页数 — 用 PDF 阅读器一眼就能看出总页数。拆 50 页以上的 PDF 先想一下输出大小。
- 测试 1 页 — 第一次拆一个新 PDF 时,先抽第 1 页验证,确认页号系统和命名规则对了,再批量拆。
- 保留原文件 — 拆分输出新的 PDF,原文件不动。如果原文件是源 PDF,放心拆。
- 命名规范 — 拆出来的文件按
原文件名-pages-1-3.pdf的格式,看一眼就知道是哪份的哪几页。
试试我们的 PDF 工具 — 拆分模式,范围输入框直接接受 1-3,5,7-9 这种格式。