Auto Paper Digest (APD) 详细部署教程

Auto Paper Digest (APD) 是一个自动化AI论文处理流水线,它能从Hugging Face抓取热门论文、下载PDF、通过NotebookLM生成视频讲解,并最终发布到HuggingFace Dataset和抖音平台。以下是完整的部署与使用教程。


📋 目录

  1. 前提准备
  2. 安装步骤
  3. 配置环境变量
  4. 登录认证
  5. 核心工作流:三阶段操作
  6. 按日处理(可选)
  7. 高级功能与缓存机制
  8. 命令大全与常用参数
  9. 故障排除
  10. 架构与目录结构

🔧 前提准备

在开始之前,请确保你的系统满足以下要求:

  • Python 3.11+
  • Git
  • HuggingFace账号(用于发布视频和创建门户网站)
  • Google账号(用于登录NotebookLM)
  • 抖音创作者账号(可选,用于发布到抖音)

🚀 安装步骤

1. 克隆仓库

1
2
git clone https://github.com/brianxiadong/auto-paper-digest.git
cd auto-paper-digest

2. 安装Python依赖

1
pip install -e .

这会以可编辑模式安装项目及其所有依赖。

3. 安装Playwright浏览器

1
playwright install chromium

APD使用Playwright进行浏览器自动化操作(如登录NotebookLM和抖音),因此必须安装Chromium。


⚙️ 配置环境变量

1. 复制配置模板

1
cp .env.example .env

2. 编辑 .env 文件

使用任意文本编辑器打开 .env,填入以下关键信息:

1
2
3
HF_TOKEN=hf_你的HuggingFace访问令牌
HF_USERNAME=你的HuggingFace用户名
HF_DATASET_NAME=paper-digest-videos # 可自定义数据集名称

如何获取HuggingFace Token?

  1. 登录 HuggingFace官网
  2. 点击右上角头像 → SettingsAccess Tokens
  3. 点击 New token,选择 Write 权限,生成并复制令牌

🔑 登录认证

APD需要登录两个平台,登录状态会被持久化保存,后续使用无需重复登录。

1. 登录Google(用于NotebookLM)

1
apd login

浏览器会自动打开NotebookLM登录页面,请完成Google账号登录。会话状态会保存在本地 data/profiles/ 目录中。

2. 登录抖音(可选,用于发布视频)

1
apd douyin-login

浏览器会打开抖音创作者中心,使用抖音APP扫码登录即可。


📖 核心工作流:三阶段操作

APD的核心流程分为三个阶段,分别对应三条命令。建议按顺序执行

Phase 1: 上传论文并触发视频生成

1
apd upload --week 2026-01 --headful --max 10

该命令会自动完成

  • 获取HuggingFace指定周的论文列表
  • 从arXiv下载论文PDF(已下载的会跳过)
  • 将PDF上传到NotebookLM
  • 在NotebookLM中触发视频生成(不等待完成

参数说明

  • --week 2026-01:指定处理2026年第1周的论文(格式为 YYYY-WW
  • --headful:显示浏览器窗口,方便观察操作过程(建议首次使用添加)
  • --max 10:最多处理10篇论文

Phase 2: 下载生成的视频

视频生成通常需要几分钟时间,请耐心等待后执行:

1
apd download-video --week 2026-01 --headful

缓存机制:已下载的视频会自动跳过,如需强制重新下载,添加 --force 参数。

Phase 3a: 发布到HuggingFace

1
apd publish --week 2026-01

该命令会

  • 上传视频文件到HuggingFace Dataset
  • 更新 metadata.json 文件
  • 生成Markdown格式的周报摘要

Phase 3b: 发布到抖音(可选)

1
apd publish-douyin --week 2026-01 --headful

该命令会

  • 自动上传视频到抖音创作者平台
  • 填写视频标题(使用论文标题)
  • 添加话题标签(如 #AI #论文解读)
  • 自动点击发布

💡 建议:首次使用抖音发布时添加 --headful 参数,观察发布过程是否正常。


📅 按日处理(可选)

除了按周处理,APD也支持按具体日期处理论文:

1
2
3
4
5
6
7
8
9
10
11
# 获取指定日期的论文
apd fetch --date 2026-01-08 --max 10

# 上传并生成视频
apd upload --date 2026-01-08 --headful --max 10

# 下载视频
apd download-video --date 2026-01-08 --headful

# 发布到抖音
apd publish-douyin --date 2026-01-08 --headful

⚠️ 注意:周末和节假日通常没有论文更新,系统会提示错误而非继续处理。

文件夹结构区分

  • 按周处理:data/pdfs/weekly/2026-01/data/videos/weekly/2026-01/
  • 按日处理:data/pdfs/daily/2026-01-08/data/videos/daily/2026-01-08/

🧠 高级功能与缓存机制

状态追踪与断点续传

APD使用SQLite数据库(data/apd.db)追踪每篇论文的处理状态:

1
NEW → PDF_OK → NBLM_OK → VIDEO_OK

可通过以下命令查看状态:

1
2
apd status --week 2026-01           # 查看所有论文状态
apd status --week 2026-01 --status ERROR # 查看处理失败的论文

如果处理中断,重新运行命令即可从断点继续,无需重头开始。

缓存机制详解

缓存类型 机制 强制刷新参数
PDF缓存 SHA256校验,相同文件自动跳过 --force
视频缓存 文件名前缀匹配({paper_id}_*.mp4 --force
发布缓存 metadata.json记录已发布论文 重复发布自动跳过

门户网站

视频发布后,可通过Gradio门户网站在线观看:

1
https://huggingface.co/spaces/你的用户名/paper-digest

📚 命令大全与常用参数

所有命令一览

命令 说明
apd login Google登录(NotebookLM)
apd douyin-login 抖音登录
apd fetch 仅获取论文列表
apd download 仅下载PDF
apd upload Phase 1:获取+下载+上传+触发生成
apd download-video Phase 2:下载视频
apd publish Phase 3a:发布到HuggingFace
apd publish-douyin Phase 3b:发布到抖音
apd digest 生成本地周报
apd run 完整一键流程(需等待视频生成)
apd status 查看论文处理状态

常用参数

参数 说明
--week, -w 指定周ID(如 2026-01),默认当前周
--date 指定日期(如 2026-01-08
--max, -m 最大论文数量
--headful 显示浏览器窗口(调试用)
--force, -f 强制重新处理(忽略缓存)
--debug 开启调试日志

🔧 故障排除

1. 登录问题

如果登录状态失效或出现认证错误,重新执行:

1
2
apd login
apd douyin-login

2. 视频未生成

视频生成通常需要几分钟,请稍后重试下载命令:

1
apd download-video --week 2026-01 --headful

3. NotebookLM界面变化

如果NotebookLM界面更新导致自动化失败,可查看截图辅助调试:

1
ls data/profiles/screenshots/

4. HuggingFace Token无效

检查 .env 文件配置是否正确:

1
2
cat .env
# 确认 HF_TOKEN 和 HF_USERNAME 已正确填写

🏗️ 架构与目录结构

系统架构图

1
2
3
4
5
6
7
8
9
10
11
12
13
┌─────────────────────────────────────────────────────────────┐
│ Auto Paper Digest │
├─────────────────────────────────────────────────────────────┤
│ Phase 1: Upload Phase 2: Download Phase 3: Publish │
│ ┌─────────┐ ┌─────────┐ ┌──────────┐ ┌────────────┐ │
│ │HF Papers│─▶│ arXiv │─▶│NotebookLM│─▶│HF Dataset │ │
│ │ │ │ PDFs │ │ Videos │ │ + Douyin │ │
│ └─────────┘ └─────────┘ └──────────┘ └────────────┘ │
│ │ │ │ │ │
│ └────────────┴────────────┴──────────────┘ │
│ SQLite Database │
│ (NEW → PDF_OK → NBLM_OK → VIDEO_OK) │
└─────────────────────────────────────────────────────────────┘

核心目录结构

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
auto-paper-digest/
├── apd/ # 主程序包
│ ├── cli.py # 命令行入口
│ ├── db.py # SQLite数据库操作
│ ├── hf_fetcher.py # HuggingFace论文抓取
│ ├── pdf_downloader.py # arXiv PDF下载
│ ├── nblm_bot.py # NotebookLM自动化
│ ├── douyin_bot.py # 抖音自动化
│ ├── publisher.py # HuggingFace发布
│ └── ...
├── portal/ # HuggingFace Spaces门户网站
│ └── app.py # Gradio应用
├── data/
│ ├── apd.db # SQLite状态数据库
│ ├── pdfs/ # PDF缓存目录
│ ├── videos/ # 视频缓存目录
│ └── profiles/ # 浏览器登录态
├── .env # 环境变量配置
└── pyproject.toml # 项目配置与依赖

🎯 快速上手总结

对于首次使用,建议按照以下顺序操作:

  1. 克隆项目git clone ... && cd auto-paper-digest

  2. 安装依赖pip install -e . && playwright install chromium

  3. 配置环境cp .env.example .env 并填入HF Token

  4. 登录认证apd loginapd douyin-login

  5. 三阶段运行

    1
    2
    3
    4
    5
    apd upload --week 当前周 --headful --max 5
    # 等待5-10分钟
    apd download-video --week 当前周 --headful
    apd publish --week 当前周
    apd publish-douyin --week 当前周 --headful # 可选
  6. 查看门户 → 访问 https://huggingface.co/spaces/你的用户名/paper-digest

完成以上步骤,你就能拥有一个自动化的AI论文视频解读流水线