依托于 Grok Bot 最近的给力更新,Opus 5.5、Midjourney、Suno 等层层叠加下,他做视频的迎来了重大升级。
无论是炫酷的 Motion Video、广告视频还是口播视频都不在话下。
我把自己做视频的整套流程打包成了一个公开的 Grok Bot 模板,名字叫「故事视频生成」。
今天给共享下我的口播视制作 Bot,你领一个回去,只需要把故事文字丢给它,十几分钟就给你一个带声音、带画面的的视频。
它替你做什么
这个 bot 只做一件事:把一篇文章变成 1080×1920 的竖屏演绎片(默认尺寸,可以在输入时修改),也就是常说的口播动画。它按导演的顺序推进:
⚬ 剧本:多语言原中文简体,文中的引用逐条核对出处。 ⚬ 分镜与角色:先拆出镜头表,再设计主角,然后把同一个画面画成三种美术方向,由你挑一个。 ⚬ 画面:AI 生成绿幕上的角色姿势图,抠像后和代码画出的场景、道具、动画合成,渲染用的是 Canvas 和 Playwright。 ⚬ 声音:配音用可商用的 CosyVoice3,许可证是 Apache-2.0,音色来自一段合成的提示音,片尾标注「AI 配音」。配乐由它自己合成,字幕直接烧进画面。 ⚬ 把关:自动质检跑完,再交给一个独立的审片员挑错。审片员提的每一条,它都先截成片里的真实画面核对,确认属实才动手改。
画面是代码动画加 AI 生成的角色图,它不是视频生成模型,所以角色从头到尾长一个样,每个镜头都可控,风格偏绘本和手作。
它站在两个 MIT 开源技能的肩膀上:
- 负责手绘风格图片制作的 hand-drawn-styles (强推安装)
- 负责渲染转场一致艺术动画的 huashu-art-motion
- 负责导演、审美和终审的 omniailab-ai-director
注意:之所以本 Bot 没有包含过多的 Skill,原因是锦上添花的 Skill 您可以随时扩展,打包过多反而对您是一种限制。
怎么领,第一次聊什么
打开模板分享链接【模板链接】,把它导入成你自己的 bot,然后直接和它聊天。
第一次对话,它会先从 GitHub 装好这两个技能,再装好配音模型。装完它一次只问一个问题,把你的习惯摸清楚:
⚬ 称呼与语言:它该怎么称呼你,你们用什么语言交流。 ⚬ 平台与画幅:视频发在哪个平台,用什么比例。 ⚬ 配音类型:你想要什么样的声音。 ⚬ 繁简转换:原文是繁体时,要不要转成简体。 ⚬ 写作禁忌:文案里有哪些词和写法你不想看到。
问完它会生成两到三段试听,你挑一段作为默认音色。接着它就会向你要第一篇文章。
案例一:《烂梨效应》
我交给它的第一篇是一篇繁体长文,讲「烂梨效应」:人为什么明知不划算,还要继续往里投入。文章拆了损失厌恶、沉没成本、认知失调和情绪补偿四种心理,落到感情、工作、消费三个场景,最后给出破局的四步。
它先出了三个方向:剪纸绘本、皮影戏、水墨留白,同一个划船的镜头画了三遍。我选了剪纸绘本。
主角叫阿梨,齐肩短发,头上别着一枚小梨子,穿一件墨绿色开衫。它给阿梨做了 16 张素材的姿势库,有站、走、坐、抱膝、跳跃,还有三组表情和一套手臂。
成片一共 74 个镜头。阿梨先把烂梨吃完,用帘子遮住镜子里过去的自己,最后从漏水的船上跳下来,咬下一颗好梨。
第一版用的是 edge-tts 配音,我嫌声音差了一些,让它换用 VoiceStudio,配一个甜美学姐的声音。它查过发现 VoiceStudio 推荐的模型不能商用,于是换成 CosyVoice3 重新出了几段试听,我挑了 3 号。
审片时它修掉了几处真问题。镜子那场有一只手臂是镜像翻过去的;「二度」「划桨」的声调读错了,它用拼音标注纠正了读音;片尾的音乐被一刀切断,它补上了淡出。最终版时长 3 分 29 秒,它推荐的标题是「你总先吃烂梨,所以一辈子都在吃烂梨」。
案例二:《边界》
第二篇也是繁体文章,讲成年子女怎样和父母保持健康的边界,结语落在一句话上:「我们来自父母,但不属于他们」。
这一次的三个方向是水彩彩铅绘本、一笔线描配红线、羊毛毡微缩。三张图演的是同一场戏:妈妈坐在扶手椅上织毛线,爸爸站在她身后,儿子站在门口,一根红毛线从妈妈手里拖到地上。我选了羊毛毡。
主角阿远 31 岁,戴圆框眼镜,穿一件石板蓝的外套。它先做出阿远和父母的参考设定图,再照着设定生成了 14 个姿势:接电话、走路、跪地按掌、摊手、缩肩,穿红条纹毛衣的童年阿远,织毛线的妈妈,背着手的爸爸,还有扶着爸爸散步的阿远。
红毛线是全片的隐喻。红色只出现在两处:童年阿远的毛衣,和妈妈手里的毛线。毛线从妈妈手里织出去,缠成一张困住母子俩的网,到片尾变成阿远跪在地上按住的一条分界线。
成片 4 分 11 秒,58 个镜头,177 条字幕。
核对引用在这篇里派上了用场。原文有一句话署名曾国藩,它查出这句话出自《孟子》,讲的是曾子,就照出处改了过来。另外三处引用找不到可靠来源,它保留原话,拿掉了署名。
最值得一说的是审片。独立审片员打了 6.5 分,列出 9 个问题。bot 没有照单全改,它逐条去成片里截图核对。妈妈少了一只手臂、阿远的头和身子分了家、绿幕边缘发光,这几条在画面里根本不存在。真问题有 4 个:跪地的阿远被挤到画面边缘,身子被切掉一截;分屏里阿远的头顶被格子切掉;袖子上多出一圈红毛线;爸爸坐下时,拐杖自己笔直地立在一旁。改完之后,阿远回到了画面里,拐杖斜靠在椅子上。
这一篇它推荐的标题是「你越懂事,父母越放不下你」。
喂给它什么样的文章
⚬ 一条主线:一个核心观点加上几个具体场景,最容易演成故事。纯数据和清单式的文章,画面很难撑起来。 ⚬ 具体的场景:一段感情、一个项目、家里打来的一通电话,这些都能直接变成镜头。 ⚬ 带出处的引用:它会逐条核对,查错的会改正,查不到的会拿掉署名,原话保留。 ⚬ 合适的篇幅:片长跟着文稿走,《边界》的文稿配完音是 4 分 11 秒。想要更短的片子,先把文章删短,或者直接告诉它。 ⚬ 认真挑方向:风格一旦选定,角色设定、姿势库和整片都会照着这个方向做。
你也该知道它交出来的是什么:一条代码动画加 AI 角色图的竖屏短片,配音是标注过的 AI 声音,每一版都经过自动质检和独立审片。
打开【x.ai/bot/9L9I-cD… Grok Bot,把收藏夹里那篇文章发给它。