国哥来了·开源工具手记2026.08.19
一段普通口播,如何变成动画视频?
我把完整方法开源了:从内容理解、人物避让到横竖屏交付。
AGENT SKILL
拍完口播只是开始,真正费时间的是后面的包装与返工。
开源 Agent Skill动画视频总控
EDITOR'S NOTE
开场
拍完一条口播,往往只是开始。真正耗时间的,是后面的字幕、配图、截图、动画、图表、横竖屏适配,以及一遍又一遍的检查和返工。
如果是一个人做,要在文案、拍摄、剪辑、找素材、做动画之间来回切换;如果交给助理,又需要把自己的判断拆成很多步骤。真正麻烦的,常常不是缺某个工具,而是没有一个角色把所有工具和步骤统筹起来。
这段时间,我把自己实际测试的一套流程整理成了一个开源 Agent Skill:animated-video-workflow,中文可以叫它“动画视频总控”。
它不是一个新的剪辑软件,也不是只能替换文字和图片的固定模板。它更像是装在 Codex 或其他 Agent 里的视频制作总控流程:先理解内容,再安排人物、动画和素材,先做试片,确认后再完成全片。
现在,我把它放到了 GitHub,采用 MIT 许可证开源。
**你可以从中拿到三样东西:**公开的源码、一套可复用的视频制作流程,以及可以直接复制给 Agent 的安装和使用提示词。
动画视频总控 Skill 总览图
01
PART
先别讲功能,先看同一条视频的前后变化
同一段声音·同一段内容·相同总时长
为了验证这套流程,我用一段 52.23 秒的《纳瓦尔宝典》真人口播做了完整测试。
包装前后使用的是同一段声音、同一段内容和相同总时长,区别主要来自画面的重新组织。
包装前
信息主要依靠语言表达
vs
包装后
真人信任感与视觉解释并存
CASE A
包装前:原始真人口播
ORIGINAL · 52.23 秒
原片我只是让ai给我随便出一个书单推荐的短视频文案,我就直接OBS录制保存,其他啥也没做。画面以真人口播为主,视觉上可以看下面视频,没有任何信息,都是黑屏。
包装前原始真人口播,52.23 秒
CASE B
包装后:动画包装成片
ANIMATED · 52.23 秒
包装后保留了真人带来的信任感,同时在重点段落加入标题动画、人物素材、书封和信息图表。动画区域会根据人物位置安排,让内容更容易被看懂和记住,其实这是第一版的效果,我就直接保存了,后面优化低版本是把整个特效往左移动了一些,但是我不想等她再包装一遍,就没有生成,不过现在看,已经很厉害了,一次性输出,一刀未动。
包装后完整动画成片,52.23 秒
这次处理并不是给视频套一个固定模板,而是依次完成了内容分析、人物位置判断、分镜规划、素材组织、代表性试片、全片渲染和成片检查。
画面的作用也不是单纯“显得更炫”,而是在需要解释和强调的地方切入视觉内容,帮助观众更快抓住重点。
案例中的 纳瓦尔人物图采用 CC BY 3.0 许可并保留署名;书封画面仅用于本次演示,正式公开或商业发布前仍需确认相应使用权限。
02
PART
为什么需要一个“动画视频总控”
工具越多,越需要统一的判断顺序
口播包装不是“加一点动画”,而是一连串相互影响的判断:哪里保留真人、动画如何避开人物、缺少素材时先搜索还是生成、横竖屏如何分别构图,以及什么时候先看试片。
**如果这些判断没有顺序,工具越多,流程反而越乱。**这个 Skill 的价值,是把它们变成一套可以检查、确认和复用的工作流。
03
PART
它具体怎么工作
从输入检查到双画幅交付
检查输入与时间轴:
支持真人视频、配音、SRT 和文稿;只有明确要求时才先粗剪。
分析人物与安全区:
按镜头采样人物活动范围,为字幕、动画和图表安排位置。
编排视觉素材:
先用用户素材,再搜索图片、视频或网页截图,仍缺失时才生成,并登记外部来源。
选择制作引擎:
根据项目和本机能力,在原视频、HyperFrames、Remotion 与 FFmpeg 之间选择。
适配横竖屏:
共享内容和时间轴,分别设计 16:9 与 9:16 构图,不做简单居中裁切。
输入素材、制作能力与交付物示意图
04
PART
使用者最后能获得什么
方案·试片·成片·来源与质检记录
一套典型项目可以交付:
-
动画分镜与素材方案
-
2~3 个代表性试片
-
16:9 横屏成片
-
9:16 竖屏成片
-
外部素材来源记录
-
版权待审核清单
-
渲染与质检结果
它适合口播知识内容、课程讲解和商业 IP,也方便个人、助理、团队或工作室按统一流程执行和验收。
从素材检查到横竖屏交付的流程图
05
PART
不会编程,怎么安装
把仓库链接直接交给 Agent
最简单的方式,不是自己下载文件,也不是打开终端敲命令,而是把仓库链接直接交给你的 Agent。
打开 Codex、Claude Code、Cursor、OpenCode,或者其他能够安装 Agent Skill 的工具,把下面整段发给它:
prompt
请帮我安装这个 Agent Skill,并在安装后验证它是否可用:
安装过程中,Agent 可能会询问是否允许访问网络、下载公开仓库、写入 Skills 目录或安装必要依赖。确认这是你刚刚发起的操作后,再点击允许。
正常安装这个公开仓库,不需要把 GitHub 密码、Token 或验证码交给任何人。
一句话安装步骤图
06
PART
第一次使用,我更建议半自动
先看方案·再看试片·最后渲染全片
安装完成后,把真人视频、音频、SRT 或文稿交给 Agent,再发送:
prompt
请使用 animated-video-workflow 处理我提供的素材。
使用半自动模式:
1. 先检查素材并告诉我是否缺少必要文件;
2. 先识别人脸和人物活动范围,不要让字幕、动画和图表遮挡人物;
3. 先输出分镜和素材方案,等我确认;
4. 先制作 2~3 段代表性试片,等我确认;
5. 确认后再渲染全片;
6. 同时输出 16:9 横屏版和 9:16 竖屏版;
7. 不要覆盖我的原始素材。
我不建议第一次使用时一上来就渲染完整视频。
**先看分镜,再看 2~3 个有代表性的片段。**人物有没有被挡住、字幕是否清楚、素材是否准确、节奏是否合适,这些问题在试片阶段解决,返工成本最低。
等风格和模板稳定后,再切换到全自动模式处理相似内容。
07
PART
开源不等于没有使用边界
源码开放,但依赖与素材仍有各自规则
这套 Skill 的源码采用 MIT 许可证开源,但它调用的模型、渲染工具、搜索服务和外部素材,仍然可能有各自的费用、许可和使用规则。
当前的人物跟踪属于“镜头级采样检测”,主要用于让动画避开常见口播人物,并不是逐帧抠像。低置信度、多人画面和未知构图,仍然应该人工确认。
本机通常需要 Python 3.10 以上、FFmpeg 和 ffprobe;人物检测会用到 OpenCV。HyperFrames 和 Remotion 是可选引擎,不是每台电脑都必须安装。依赖不齐时,可以让 Agent 自动检查和补齐,但它可能会要求你确认系统权限。
我更愿意把它看成一个持续迭代的开源起点,而不是一个已经解决所有视频问题的“万能按钮”。
///
END
写在最后
FROM CHAT TO WORK
说实话,我做这个 Skill,不是为了再造一个看起来很厉害的“万能按钮”。我只是想把那些拍完视频以后,最磨人、最靠经验、也最容易反复返工的事情,一点点交给 Agent。
当一个小白只需要给出素材、说清楚自己想要什么,剩下的识别人、找素材、做试片和适配横竖屏,都能被一套流程接住,AI 才算真正从“会聊天”走到了“能干活”。
想试的话,直接把这篇文章丢给你的 Codex 或其他 Agent,让它安装文中的 Skill 并验证是否可用。你不用研究命令,下载、安装和检查都交给它。
我是国哥,持续分享 AI 工具、内容生产和可以真正落地的自动化实践。
如果这篇内容对你有用,欢迎点赞、在看、转发三连。你们的支持,会让我继续分享更多能直接拿来用的 AI 工具和工作流。
赞
在看
转发
THANKS FOR READING