先看这个关于 Navier-Stokes 千禧难题的视频:
OpenAI 宣称解决千禧年难题 · 署名争议四起
这个视频讲的是前几天 OpenAI 宣称攻克 Navier-Stokes 千禧难题、然后署名争议四起的这件事。视频里有分镜、有动效、有旁白、有字幕,还有一堆小火柴人。
而这条视频,从采集素材、写脚本、做动画、配音到合成,全部是豆包工作的 Agent 在云电脑上自己跑出来的。我做了的只有两件事:早上在手机上回了个「1」,看完初版后提出了三条意见。
我之前就有想,如何把最新的论文、技术报告,转成更适合大体容易消费的文章或视频形式,之前偶尔也发过一些短篇文章进行论文的解读,比如:字节新论文:别扔掉草稿纸、AWS 最近发了一篇论文,研究了一个使用...
说回视频。由于我 AGI Hunt 的许多数据和文档都在飞书里,以便于我远程在各种设备上(比如手里没电脑时)方便地进行数据同步和继续处理任务。而且制作视频我当然得实现自动化,不由全程都由我自己来盯着。我希望我就审一下选题、说一下思路、给一些反馈,最后做审核就和发布就好了。
还有一点较为重要的是,我这个 human 一旦在这个流程里,就得保持可以随时介入这个流程,不能出个门就不行了,电脑一关它就没了,甚至会为了盯 AI 而晚出门、晚回家……
这么一想,干这事儿最趁手的,好像就非豆包工作不可了啊。而就在我打开豆包工作之时,它还很大方地弹了个升级提示:给我送上了 30 天的免费订阅!

不是 token 用不起,白嫖更有性价比!
这里说明一下,豆包工作是豆包新出的一个独立端,功能上和豆包 PC 版里的工作任务模式是一样的。上个月我就用那个工作任务模式分析学习过一次宇树上市,所以这次 Agent 升级后,我就计划把上面说的论文/技术报告解读的工作流,交给它来完成。
豆包工作让我最心动的一件事是:云电脑。即使我在地铁上正刷着视频,云端的 Agent 工作完成后会通过手机给我弹出推送,所以我完全不需要打开我的电脑,就可以完成我设定的定时任务的执行。
这是因为,任务是跑在云端的。手机、电脑、网页打开的都是同一个对话,不管我人在哪都能随时查看进度或安排任务。
注意:这和手机远程连回家里那台开着的电脑完全不是一件事,别弄混了。

使用参考见上图,左边是电脑,右边是手机,同一个对话,同一台云电脑。
另外就是,豆包工作还把飞书文档、Skill、TTS、定时任务这些东西全都塞在了一个环境里,我不用再往电脑上装一堆 Agent,也不用再去配什么 API 就可以拎包入住,随时开工了。
好了,开始干活!
第一步,先给豆包接上数据源。
数据接入上的第一步是安装 AGI Hunt 的 SKILL,我便直接让豆包在云电脑里装了一下。本地的技能也是一样的,把文件传上去就行了。

安装、授权、验证,一次就完成了,API key 考虑到敏感性它自己存到了一个配置文件里的。最后还拉了一份最新的 AI 日报回来以确认接口是通的。之后我就可以直接问它「最近 3 天最热的 AI 研究论文」了。
来,先简单试一下:

豆包工作给我拉来了网站上近三天 research 频道的 Top 10,还画了张热度柱状图,并附上了明细表。末尾还总结了一下当期的主线:AI 数学证明。Claude 形式化费马大定理、GPT-6-Astra 用 Lean 证素数间隔,接连霸榜。
好了,数据源搞定了。
接下来的问题是:论文,怎么变成视频呢?
我其实已经有了个初步想法,用 Manim + Remotion(我一直很喜欢 3Blue1Brown 的数学动画引擎,不过还没来得及研究)应该还行?但具体怎么来,我其实也没想清楚,索性就直接把问题抛给了豆包(没想清楚的也可以先问 AI):
“ 我现在有个思路是,将论文转化为视频,使用 Manim、remotion 等工具,当然,也可以使用其他工具配合,一起来输出一个通俗易懂的视频。给我一个可以落地的思路和方案
其实我的预期并不高,我也就只是让他帮我来评估一下思路的可行性。
结果它先是读了一遍我之前的文件,然后给了我这个:

一张四阶段的流水线总览图:内容工程、素材生产、装配合成、成片发布,每个阶段用什么工具、产出什么全都标好了。下面还有一张工具分工表,Manim 承担什么、不做什么、理由是什么,一目了然。
开头还有一句很好的总结:论文是高密度的非线性信息,视频是线性的时间流,转化的本质是提炼故事线,再拆成逐镜脚本。
它还建议我先做个 1 分钟的 MVP 跑通流水线后,再扩到全片,避免一次性返工。
那就先来搞个——
在我同意 MVP 的思路后,它便开始在云电脑上装环境了:Manim、FFmpeg、Node,用到的全部装上。装完后它便开始跑了,不久之后,第一支视频出炉:

一共 27 秒的视频,片头卡、核心对比镜、收尾引用,三个 Manim 场景,配了中文旁白,还在视频中烧录了字幕。最后,它甚至还自己核对了一遍时长、分辨率和音轨,并抽了五帧来做字幕位置检查的抽样。
从出方案到跑通 MVP,全程都在云电脑上,我本机什么都没装。
到这里我就出门吃饭去了。
后面的事,我就全都是在手机上来搞了。
打开豆包 APP,就是刚才电脑上那个对话,能看到哦进度、文件、云电脑状态都还在。
路上我先问了个问题:现在的配音是用的什么,免费吗?

答案是豆包自己内置的 TTS,不需要走任何第三方的 API 在订阅额度里直接就用了,也不额外收费。音色是可以换的,单次最长 120 秒,所以全片得按镜分段生成了再拼(本来也该是按镜配音的)。
这就等于省下了一个配音工具,还有一个 API key(之前还在本地部署过一些开源 TTS 模型,效果得调半天,现在都不需要了)。
然后我便在手机上下了正式的指令:按刚才的方案,把 GlossoGen 这篇论文做成一条完整的视频。
它先是委派了一个 OrganizeAgent 来统筹全片,把分镜表统一掉,然后拆出 4 个子代理并行去干,一个负责生成 TTS 旁白,另外三个则分别渲染 Manim 场景。

终于,全片完成:

时常长 5 分 26 秒,1280×720,共 10 镜叙事结构。
我一边吃饭一边在手机上认认真真看完了一遍视频:

片头、涌现曲线、结论卡,说到的部分都有体现。分镜表、旁白稿和质检报告也都一起交付了,每一镜的画面描述、旁白文本、字幕时间轴都写好了:

当然,第一版往往很难是完美的。
视频里有一镜,字幕和画面底部的内容叠在了一起。我截了张图,发给它,只说了一句「感觉字幕跟内容还是有点重叠,有办法优化吗」。

它先看图,然后定位到了镜 02 的底部:字幕压在右栏第三个气泡上,同时底部的红色结论条也挤在一起,三层重叠。根因是这一镜底部铺得太满,而字幕又固定在底部 8% 且没有底框。
然后它唤醒了子代理,去改全片的字幕安全区。
整个过程我没有说问题在哪一帧、哪个位置,就发了一张截图过去……
手动流程跑通了,接下来是我最想要的部分:让它每天自动跑。
当天晚上,我又给它下了这个:
“ 创建一个定时任务,每天自动获取热门论文,整理到云文档表格中,方便记录和筛选,每天一个文档。然后给我筛选最适合转视频的 10 个选题,发给我,让我选,等我选后,开始执行转视频的流程,沉淀 skill,稳定执行

它把这事拆成了三个子任务来做:先搭每日采集的流水线,今天先跑一次把选题产出来,等我选完了再做视频、沉淀 Skill。
搭建的过程,我是在手机上看完的(录屏不知道为啥看不到多维表格的内容,囧):

它自己建了一张叫「AI 热门论文日报」的飞书多维表格,一共 11 个字段,视频潜力评分、状态管理这些都有。然后拉了 3 天的数据,300 条去重之后剩 287 条,取了 Top 30 写进表格里,再给最值得做视频的 10 个打了分,推荐理由和可视化方向也都写好了。

定时任务定在了每天北京时间 8 点,在云电脑上跑,我这边什么都不用开着。
然后是试运行。我从当天的 10 个选题里挑了那条「Claude 11 天形式化费马大定理」,让它把完整的流程先跑上一遍看看。
出来的是一条 5 分钟的视频,同样是 Manim 做的 3Blue1Brown 风格。
开场,先把 350 年的未解之谜和 AI 的 11 天攻克摆在一起对比,接着讲什么是形式化证明,中间那条 11 天的定理增长曲线是带动效的,一点一点长上去,最后落在 1300 万行 Lean 代码、29511 条定理这些数字上。

看下来确实还可以,动效和讲解的节奏都在线,拿来当 AGI Hunt 视频版的底稿是够用的。只是也还有些细节要调,音画对齐、字幕样式之类的,暂时先放着。
跑完这一遍之后,它便把整条流程沉淀成了一个叫 paper-to-video 的 Skill:

初始化项目、字幕生成、单镜合成、全片拼接、质检,全都在这一套脚本里了。以后每天 8 点跑的,就会直接用到它。
看过 AGI Hunt 文章的朋友应该有印象,我有个火柴人。
我之前专门做了一个插图技能,用来生成火柴人风格的图解文章。既然视频流水线跑通了,那火柴人是不是也可以进视频?
于是我把技能文件直接扔给了它:

它先读 SKILL.md,再读火柴人组件和模板,理解完风格方案,然后开始往 Manim 里移植。
第一次渲染出来,火柴人是倒立的……

原因是截图的时候坐标 y 向下为正,Manim 的 y 向上为正,直接移植就头朝下了。这个倒是它自己抽帧看出来的,然后就重写了组件库、把坐标修了过来。
第二次渲染,又发现坐标大了几十倍,火柴人整个被裁到画面外面去了……于是再缩 40 倍。
到第三次,它干脆用视觉模型(seed 模型的多模态理解能力很强)给自己验收了一遍:

圆头点眼、平直嘴、竖线躯干、分叉的手臂和腿,品牌绿配深色底。它自己的结论是:火柴人渲染完美,符合原有规范。
全程我没有任何干预,就看着它倒立、出画、扶正、点评。
最后,它把这套东西沉淀成了一个火柴人的 Manim 组件库,站立、指向、困惑、领悟这些姿态一共 7 种,画序、抬手净空这几条画法上的铁律也是从原 Skill 里原样搬过去的。paper-to-video 里的角色、配色、文案规则,它也一并按原 Skill 的思路给改了一遍:

所以以后视频里的火柴人,和文章里的算是同一个人了。
定时任务跑起来之后,每天早上 8 点,手机上就会收到它的推送了。比如一天早上这条,当天的 #1 是英矽智能那篇 AI 药物的论文,选定之后它便开始拉全文和背景资料,连进度都是一条一条推到手机上的:

这天早上,选题列表又发了过来:

300 条去重到 287 条,Top 30 写进了表格,10 个视频选题按潜力评分排好了。#1 是「OpenAI 宣称攻克 Navier-Stokes 千禧难题,署名争议四起」,评分 10.0。
它还特意提醒说今天 10 个选题里有 6 个都是 Navier-Stokes,建议选 #1(争议视角最完整)或者 #7(时间线最清晰)。
正好这事我在《ChatGPT Images 2.5 发布,但更火爆的是:一万个 agent 给出的千禧年难题的解答》里写过,所以我在手机上回了个「1」。
收到指令后,它便开始拉论文全文和背景资料,然后按 paper-to-video 的流程走:分镜、Manim 场景、火柴人、TTS、字幕、合成。
首版出来后我进行了 review,并提三条不足之处:
“ 有几个问题:1. 语速慢,并且多个场景,音色变了,需要统一一下 2. 出现了配音和字幕甚至画面不同的情况,需要优化 3. 字幕位置,还是固定在底部固定的位置区域吧,不要一直变来变去的

它唤醒之前的视频制作 Organizer,把三条拆给了子代理:重新生成 10 镜旁白,同一音色、正常偏快;字幕按实际音频时长对齐,抽帧验证;字幕统一距底 12% 到 15%,底部有内容的镜调整画面布局上移。
修完后的成片(截图)如下:

Strogatz 上班路上用 ChatGPT 理清奇点的物理意义、陶哲轩发长文回应、美国数学会确认里程碑式进展,三方观点并排,旁边是火柴人的解读。
开头的视频,就是这么来的。
视频这条线跑顺了之后,我又把一件拖了很久、一直懒得弄的琐事也扔给了它:发票。
我的发票之前是零散在各种地方的:微信里转发给自己的、小程序卡包里的、邮箱里的……到了要报销的时候,再手动一张张找出来整理,很麻烦,而且经常会忘。

我现在的做法是,专门用一个邮箱收发票,票通、云票这些平台开的电子发票,全部往这一个邮箱里发:

然后让豆包工作在云电脑上建一个定时任务,每天自动处理。

它建了一个叫「发票每日自动同步」的任务,每天 8:30 天跑:连接邮箱,拉最近 3 天的邮件(回溯 3 天是容错设计,某天没跑也不会漏),识别发票邮件,解析 XML 附件或正文,按发票号码去重,然后追加写入飞书表格「AGI Hunt_发票管理台账」的「发票明细」,同时更新「月度统计」。
表格也是它自己建的,三个 sheet:发票明细、员工配置、月度统计。我看了一下,它已经搞了 20 多张发票到里面了。
定时任务的配置页里,能看到豆包工作把整条流水线写成了一条可以反复执行的指令,还沉淀成了一个 invoice-auto-processor 的技能:

报销的时候,打开表格就好。
最后,来说说一些制作感受。
最大刚需是云电脑 + 手机
任务在云电脑上跑着,我出门吃饭也好、睡觉也好、电脑关机了也好,都不会影响它的执行。
手机上打开的还是同一个对话,截图反馈、选选题、追加要求,全都在手机上做完的。
一个豆包就够了
抓论文也好,写分镜、做动画、配音也好,包括后面的飞书表格和定时任务,全都是在这一个入口合和环境里做完的。
由我来配置过的东西只有 AGI Hunt 的 API key 和那个发票邮箱的账号,本机上甚至都不需要去装 Manim、FFmpeg 这些需要用到的软工具。
内置 TTS 非常省事
不用再找单独的配音工具了,可以直接用在订阅额度使用。
但也有些需要注意的限制:TTS 单次最长是 120 秒,长片视频得分段生成了再拼,不过这个它自己会处理,不用你实际操作了解下就好。
而首版视频的字幕和音色呢,一般是要一两轮反馈才找到你想要的,我因为懒,就只是简单调了一下
最后,记得去薅豆包工作的免费会员,在网页中搜索「豆包工作」,下载电脑版,便可领取限时免费的 30 天订阅权益,目前正在进行中,手慢就无了。
而文中用到的几个 Skill(paper-to-video、火柴人的 Manim 组件库、发票自动处理),我计划再跑上几天,打磨得效果更稳定一些后,再开源出来。