批量收集讲义时,最容易混淆的是“页面上提到了 PDF”与“页面直接提供 PDF 地址”。Simple Mass Downloader 能处理可访问的资源链接,但不会把整页转换为 PDF,也不会合并文档或读取 PDF 正文。
先确认一份 PDF 能正常打开
手动打开一个链接。如果看到登录、购买或交互阅读器,先确认网站允许你取得实际文件。能够浏览文章摘要不等于拥有附件的下载权限。课程平台和资料库还可能限制请求频率。

收集本页文档
- 打开文件目录页,在插件中选择 PDF。
- 点击 Scan,查看收集到的地址。
- 按年份、文件名片段或域名过滤。
- 勾选目标文件,确认选中数量。
- 查看名称与保存方式,先下载少量样本。
如果标题只出现在 PDF 正文中,输入该标题不会匹配。换成网址或文件名中确实存在的词。两个不同网址也可能返回同一份文档,URL 去重不等于内容去重。
目录链接指向详情页怎么办
先打开需要的详情页,用多标签页流程收集;也可以选择详情页链接后使用 Find files in pages,并指定 PDF 扩展名或搜索条件。
Find files in pages 只向下一层抓取 HTML,不会执行子页面完整交互脚本,不是全站爬虫。必须点击按钮才生成的下载地址可能仍然无法发现。已有真实文件地址时,直接导入清单更合适。
保存前解决命名问题
报告文件可能只有编号。使用序号、来源域名和原文件名,比全部改成“报告”更容易溯源。例如 {host}-{ccc}-{name}.{ext} 可以保留出处。使用标题字段前要检查预览,不能假设每条资源都带有完整标题。
检查保存内容与失败项
选择文件夹可直接写入你授权的目录,免费积分也可使用。保存完成前请保持 Dashboard 打开。20 份成功保存进 ZIP 的 PDF 会计为 20 个积分。
如果文件打不开,直接访问源链接,检查是否过期或跳回登录页。先处理权限和限流,再重试失败项,不必把成功文件全部重新下载。进一步参考文件命名与故障排查。

