我用了一下豆包工作 APP,真的有点屌啊。

它终于解决了一个一直困扰我的问题:怎么把抖音视频的逐字稿批量拉下来。(PS:真不是广告嗷,是真的屌,豆包快给我打钱!)

以前想干这件事,基本就两条路。一条是自己把视频下载下来,提取音频,再转成文字,整条链路很重。另一条是打开豆包 APP,一条一条获取逐字稿,再手动复制下来,没法批量自动化。

现在豆包工作已经可以把这整套流程自动跑完。 给它一个抖音博主主页,它能批量获取视频的公开信息和逐字稿,再配合飞书多维表格直接入库。这一下就太高效了。

我顺手把这套流程做成了一个 Skill,现在已经开源了。

开源地址:

https://github.com/jinchenma94/social-media-data-tools

我自己实测,采集 10 条视频的逐字稿大概需要 5 分钟。 我还试过一次性采集某个博主的几十条视频,也跑通了。

这个 Skill 能导出什么

给它一个抖音博主主页链接,它可以批量整理这个账号的视频信息,包括:

  • 账号名称
  • 标题和介绍
  • 完整逐字稿
  • 点赞、评论和转发数
  • 发表日期
  • 视频链接

采集完成后,还可以让 AI 根据标题、介绍和逐字稿,自动生成选题方向和一句话主题总结。

这些数据可以直接写入飞书多维表格。后面需要研究某个账号、找选题或者筛内容,在表格里查就可以了。如果不需要飞书,也可以让它保存到本地。

使用前准备

开始前准备好豆包工作 APP,注意嗷,只能是豆包工作APP,其他 Agent 没这么丝滑,因为用到了豆包内置的一个获取逐字稿的能力。

以及一个能登录抖音网页版的账号。如果要把结果同步到飞书,再准备一个飞书多维表格。

安装 Skill

打开豆包工作,把下面这句话发给 Agent:

1
2
3
4
5
请打开下面的 GitHub 仓库,找到其中的 douyin-transcript-exporter Skill,阅读相关文件并完成安装:

https://github.com/jinchenma94/social-media-data-tools

安装完成后,请告诉我安装结果。

豆包工作会自动读取仓库并安装这个 Skill。

采集第一批视频

安装完成后,需要给 Agent 四项信息:抖音博主主页或单条视频链接、采集数量、是否需要逐字稿,以及数据写到哪里。

公开版 Skill 默认采集最新 5 条。想要 10 条或更多,直接在提示词里写清数量就可以了。

比如可以这样发:

1
2
3
4
5
6
请采集这个抖音博主最新 10 条视频的公开数据和完整逐字稿,并写入下面的飞书多维表格。

抖音主页:<抖音博主主页链接>
飞书表格:<飞书多维表格链接>

请同时根据标题、介绍和逐字稿,生成选题方向和主题总结。

Skill 会从表格已有的选项中选择 1—3 个选题方向,再给每条视频生成一句话主题总结。其他基础字段如果缺失,Skill 会自动创建。

第一次运行时,豆包工作会打开内置浏览器。如果抖音还没有登录,它会让你接管浏览器完成登录。登录完成后,把控制权交还给 Agent,它就会继续采集。

豆包工作会用内置浏览器读取公开信息,再调用内置工具获取逐字稿,最后完成 AI 总结并写入飞书。逐字稿可以直接从内置工具获取,省掉了下载视频、提取音频和 ASR 转写这几步。

我也大概测算了一下额度消耗。目前我已经获取了 100 多个视频的逐字稿,大概用了月额度的 6%,这个还是挺香的。 现在新用户登录会送一个月标准版额度。

按这个消耗速度看,就算以后正常开通标准版,个人用来拉取自己关注的博主数据,一个月的额度基本也够用了,每个月拉1000多个视频逐字稿轻轻松松。

感兴趣的朋友快去试一试。