Auto Paper Digest (APD) 是一个自动化AI论文处理流水线,它能从Hugging Face抓取热门论文、下载PDF、通过NotebookLM生成视频讲解
Auto Paper Digest (APD) 详细部署教程
Auto Paper Digest (APD) 是一个自动化AI论文处理流水线,它能从Hugging Face抓取热门论文、下载PDF、通过NotebookLM生成视频讲解,并最终发布到HuggingFace Dataset和抖音平台。以下是完整的部署与使用教程。
📋 目录
- 前提准备
- 安装步骤
- 配置环境变量
- 登录认证
- 核心工作流:三阶段操作
- 按日处理(可选)
- 高级功能与缓存机制
- 命令大全与常用参数
- 故障排除
- 架构与目录结构
🔧 前提准备
在开始之前,请确保你的系统满足以下要求:
- Python 3.11+
- Git
- HuggingFace账号(用于发布视频和创建门户网站)
- Google账号(用于登录NotebookLM)
- 抖音创作者账号(可选,用于发布到抖音)
🚀 安装步骤
1. 克隆仓库
1 | git clone https://github.com/brianxiadong/auto-paper-digest.git |
2. 安装Python依赖
1 | pip install -e . |
这会以可编辑模式安装项目及其所有依赖。
3. 安装Playwright浏览器
1 | playwright install chromium |
APD使用Playwright进行浏览器自动化操作(如登录NotebookLM和抖音),因此必须安装Chromium。
⚙️ 配置环境变量
1. 复制配置模板
1 | cp .env.example .env |
2. 编辑 .env 文件
使用任意文本编辑器打开 .env,填入以下关键信息:
1 | HF_TOKEN=hf_你的HuggingFace访问令牌 |
如何获取HuggingFace Token?
- 登录 HuggingFace官网
- 点击右上角头像 → Settings → Access Tokens
- 点击 New token,选择 Write 权限,生成并复制令牌
🔑 登录认证
APD需要登录两个平台,登录状态会被持久化保存,后续使用无需重复登录。
1. 登录Google(用于NotebookLM)
1 | apd login |
浏览器会自动打开NotebookLM登录页面,请完成Google账号登录。会话状态会保存在本地 data/profiles/ 目录中。
2. 登录抖音(可选,用于发布视频)
1 | apd douyin-login |
浏览器会打开抖音创作者中心,使用抖音APP扫码登录即可。
📖 核心工作流:三阶段操作
APD的核心流程分为三个阶段,分别对应三条命令。建议按顺序执行。
Phase 1: 上传论文并触发视频生成
1 | apd upload --week 2026-01 --headful --max 10 |
该命令会自动完成:
- 获取HuggingFace指定周的论文列表
- 从arXiv下载论文PDF(已下载的会跳过)
- 将PDF上传到NotebookLM
- 在NotebookLM中触发视频生成(不等待完成)
参数说明:
--week 2026-01:指定处理2026年第1周的论文(格式为YYYY-WW)--headful:显示浏览器窗口,方便观察操作过程(建议首次使用添加)--max 10:最多处理10篇论文
Phase 2: 下载生成的视频
视频生成通常需要几分钟时间,请耐心等待后执行:
1 | apd download-video --week 2026-01 --headful |
缓存机制:已下载的视频会自动跳过,如需强制重新下载,添加 --force 参数。
Phase 3a: 发布到HuggingFace
1 | apd publish --week 2026-01 |
该命令会:
- 上传视频文件到HuggingFace Dataset
- 更新
metadata.json文件 - 生成Markdown格式的周报摘要
Phase 3b: 发布到抖音(可选)
1 | apd publish-douyin --week 2026-01 --headful |
该命令会:
- 自动上传视频到抖音创作者平台
- 填写视频标题(使用论文标题)
- 添加话题标签(如 #AI #论文解读)
- 自动点击发布
💡 建议:首次使用抖音发布时添加
--headful参数,观察发布过程是否正常。
📅 按日处理(可选)
除了按周处理,APD也支持按具体日期处理论文:
1 | # 获取指定日期的论文 |
⚠️ 注意:周末和节假日通常没有论文更新,系统会提示错误而非继续处理。
文件夹结构区分
- 按周处理:
data/pdfs/weekly/2026-01/、data/videos/weekly/2026-01/ - 按日处理:
data/pdfs/daily/2026-01-08/、data/videos/daily/2026-01-08/
🧠 高级功能与缓存机制
状态追踪与断点续传
APD使用SQLite数据库(data/apd.db)追踪每篇论文的处理状态:
1 | NEW → PDF_OK → NBLM_OK → VIDEO_OK |
可通过以下命令查看状态:
1 | apd status --week 2026-01 # 查看所有论文状态 |
如果处理中断,重新运行命令即可从断点继续,无需重头开始。
缓存机制详解
| 缓存类型 | 机制 | 强制刷新参数 |
|---|---|---|
| PDF缓存 | SHA256校验,相同文件自动跳过 | --force |
| 视频缓存 | 文件名前缀匹配({paper_id}_*.mp4) |
--force |
| 发布缓存 | metadata.json记录已发布论文 |
重复发布自动跳过 |
门户网站
视频发布后,可通过Gradio门户网站在线观看:
1 | https://huggingface.co/spaces/你的用户名/paper-digest |
📚 命令大全与常用参数
所有命令一览
| 命令 | 说明 |
|---|---|
apd login |
Google登录(NotebookLM) |
apd douyin-login |
抖音登录 |
apd fetch |
仅获取论文列表 |
apd download |
仅下载PDF |
apd upload |
Phase 1:获取+下载+上传+触发生成 |
apd download-video |
Phase 2:下载视频 |
apd publish |
Phase 3a:发布到HuggingFace |
apd publish-douyin |
Phase 3b:发布到抖音 |
apd digest |
生成本地周报 |
apd run |
完整一键流程(需等待视频生成) |
apd status |
查看论文处理状态 |
常用参数
| 参数 | 说明 |
|---|---|
--week, -w |
指定周ID(如 2026-01),默认当前周 |
--date |
指定日期(如 2026-01-08) |
--max, -m |
最大论文数量 |
--headful |
显示浏览器窗口(调试用) |
--force, -f |
强制重新处理(忽略缓存) |
--debug |
开启调试日志 |
🔧 故障排除
1. 登录问题
如果登录状态失效或出现认证错误,重新执行:
1 | apd login |
2. 视频未生成
视频生成通常需要几分钟,请稍后重试下载命令:
1 | apd download-video --week 2026-01 --headful |
3. NotebookLM界面变化
如果NotebookLM界面更新导致自动化失败,可查看截图辅助调试:
1 | ls data/profiles/screenshots/ |
4. HuggingFace Token无效
检查 .env 文件配置是否正确:
1 | cat .env |
🏗️ 架构与目录结构
系统架构图
1 | ┌─────────────────────────────────────────────────────────────┐ |
核心目录结构
1 | auto-paper-digest/ |
🎯 快速上手总结
对于首次使用,建议按照以下顺序操作:
克隆项目 →
git clone ... && cd auto-paper-digest安装依赖 →
pip install -e . && playwright install chromium配置环境 →
cp .env.example .env并填入HF Token登录认证 →
apd login和apd douyin-login三阶段运行:
1
2
3
4
5apd upload --week 当前周 --headful --max 5
# 等待5-10分钟
apd download-video --week 当前周 --headful
apd publish --week 当前周
apd publish-douyin --week 当前周 --headful # 可选查看门户 → 访问
https://huggingface.co/spaces/你的用户名/paper-digest
完成以上步骤,你就能拥有一个自动化的AI论文视频解读流水线



