一条参考视频,让 AI 改出三个新版本:我把 Hypit 的六步流程完整跑了一遍

0 阅读9分钟

给你一条视频,能不能让 AI 顺手改出三条新的?

不是换配音、不是剪掉几秒那种”改”,是三个层面各动一刀:换产品、换场景、换人物。三条新片都要重新组织卖点、重新安排镜头、重新对齐字幕和动画出现的时机。

Hypit 是一套给 AI Agent 用的视频制作框架。这篇按它的官方六步流程走一遍,从装环境到验收,把每一步要准备什么、原话怎么下指令、钱怎么算,都摊开讲。

本文有涉及的提示词、工具模版和完整操作步骤SOP,我放在附件中。

附件:Darry | Link3


01 先搞清楚 Hypit 到底是个什么东西

它不是一个”输入一段话出视频”的在线工具,而是一套让 Codex、Claude Code 这类 Agent 按固定方法去调用工具做视频的框架。分工是这样的:

角色负责什么
Codex、Claude Code 等 Agent理解需求、分析参考片、规划并执行制作
Hypit Skill提供制作方法和工具使用说明
Hypit 软件工具处理素材、编排字幕和画面、渲染视频
接入的生成模型生成图片、视频、人物表演和声音

你说话,Agent 按 Hypit 定好的方法去调工具,最后交出片子。

一句话概括:Skill 是说明书,软件工具是手脚,Agent 是那个照着说明书干活的人。

别急着装。安装 Skill 只是准备的一半——真正做片子还得有可执行程序和模型服务,那部分要另外接。


02 开工前:一条参考片 + 三份素材

第一轮建议挑一条结构清晰的短视频,比如”人物口播+产品特写+使用演示”。结构越清楚,后面越容易对比改前改后差在哪。

这次三个版本都从同一条原片出发:

版本主要改动尽量保留的部分
A:换产品产品、卖点、使用演示人物设定、场景风格、叙事结构
B:换场景环境、行为和场景相关台词产品、人物设定、核心信息
C:换人物出镜者形象、声音和表演产品、场景方向、核心信息

有个词要先讲清楚:官方说的”保留”是制作目标,不是结果。素材重新生成一遍都得自己检查,不等于画面一定跟原来一模一样。

除了参考视频,还得准备:

  • 换产品版:新产品的多角度图片、品牌名、真实卖点、使用说明
  • 换场景版:目标场景的描述或参考图,以及产品在这个场景里合理怎么用
  • 换人物版:目标人物照片或角色描述;有声音要求时另附声音参考
  • 三版共同:目标受众、英语口音偏好、画幅、大致时长

另外,如果 B、C 两版要”准确保留原产品”,最好也把原产品的清晰图和资料一起给。只靠参考视频里那几秒一闪而过的露出,Agent 大概率凑不齐细节。


03 装 Skill:一行命令 + 一句自检

在装了 Node.js/npx 的终端里执行:

npx skills add hypit-ai/hypit -g

按提示选你自己用的 Agent,然后在 Codex 或 Claude Code 里打开视频项目文件夹,输入这段让它自检环境:

请使用 Hypit 检查当前项目环境。

确认 Hypit 可执行程序、参考视频分析工具和渲染能力是否可用。

列出缺少的依赖、可选服务,以及需要我完成的配置。

暂不调用付费服务。

注意官方说明里的一句:Skill 和可执行程序是分别安装、分别更新的。 还有个容易误解的点——”安装成功”不包含任何视频生成额度,装上只是能用,不能开始烧钱。


04 让 AI 先”看懂”原片,别直接开做

这一步很多人跳过了,结果后面全是返工。先让 Agent 把原片拆开,再提改编方案。这段可以直接复制:

请使用 Hypit 分析我提供的参考视频。

重点说明:

1. 开头怎样吸引注意,后面如何展开内容。

2. 人物、产品和场景分别承担什么作用。

3. 口播、字幕、产品特写和图形如何配合。

4. 哪些画面变化对应具体词语或句子。

5. 分别换产品、换场景、换人物时,

哪些关系可以保留,哪些内容需要重写。

请结合具体时间点说明。

先做分析,不生成新素材。

如果分析需要付费转录,请先说明费用。

Hypit 给了抽帧、裁切、转录、带台词的画面网格这些工具,就是给 Agent 用来核对视频里各种关系的。

怎么判断这份分析够不够细? 看它有没有落到具体时间点。”视频节奏快、字幕醒目”这种等于没说;像”说出第二个卖点时切入产品特写,同时放大关键词”,才谈得上下一步的制作安排。


05 一次把三个版本的要求说清楚

这里最关键的一句:三版都从原片出发,别逐版叠加改。 先出一版再在它基础上改,对比就没意义了,而且错误会累积。

完整提示词如下(方括号里的内容换成你自己的):

基于刚才的参考片分析,设计三个独立的新版本。

三个版本都从原片出发,不要逐版叠加修改。

共同要求:

- 使用自然的英文口播和英文字幕。

- 面向【填写目标受众】。

- 使用9:16竖屏,目标时长约20—30秒。

- 保留参考片适合复用的叙事结构和视觉节奏。

- 英文表达可以为自然度重写,但不能改变事实。

- 时长、镜头或素材要求不可行时,先提出调整方案。

A版:换产品

将原产品换成【新产品名称】。

以我提供的图片和说明为准,重写卖点、

产品特写、使用演示和结尾引导。

尽量沿用原片的人物设定和场景风格。

不要把原产品专属功能移植到新产品上。

B版:换场景

保留原产品和人物设定,

将场景改成【目标场景】。

同步调整人物行为、道具、台词和使用演示,

使内容符合这个环境。

C版:换人物

保留原产品、场景方向和核心信息,

将出镜者改成【目标人物或角色】。

参考我提供的人物素材,重新设计声音和表演。

涉及原出镜者个人经历的台词,需要重新处理。

请先分别提交:

英文脚本及中文对照、镜头安排、素材需求、

计划保留与修改的部分,以及费用估算。

暂不调用付费生成服务。

发完这句,Agent 会先交一份方案而不是直接开渲——脚本、镜头、素材清单、改动点和费用估算分开列。趁着这个窗口把要求捋顺,比渲废了再重来便宜得多。

三个版本各自最容易翻车的地方:

  • 换产品:产品会同时出现在人物手里、补充镜头、图形卡片、结尾好几个位置,这些位置必须一起核,漏一个就是画面里残留旧产品的 Logo。
  • 换场景:动作合不合理。原片是坐在办公桌前操作产品,搬到户外就得重新安排支撑物、持握方式和镜头角度,不可能一个人凭空站着用。
  • 换人物:角色和台词的关系。原出镜者讲的个人故事,不能直接变成新人物的经历。

06 选生成服务,先算预算再开工

框架本身免费,生成素材收费。两条路:官方推荐的 HypiHub,或者接自己的 Provider(用 API Key 时要说明服务名和接口文档,部分接口可能要额外适配)。

开始前先让 Agent 列三件事:

  • 哪些素材需要新生成
  • 哪些素材可以复用
  • 每个版本计划调什么模型

按官方给的示例算一下:3 段视频 × 每段 10 个片段 × 4.2 积分 ≈ 126 积分。这只是视频素材的示例算法,图片、声音、托管处理和重新生成可能另计,分辨率和参考输入条件也会影响,下单前以官方定价页为准。


07 三版分开验收,别只看”像不像”

Hypit 有个浏览器里的 Studio:能播放、逐帧看、拖时间线,还能改组件开放出来的属性;Comments 视图支持按时间点留反馈。

三个版本的检查重点不一样:

版本重点检查
换产品外观、Logo、功能描述是否准确,原产品是否还有残留
换场景光线、道具、人物行为和使用方式是否合理
换人物形象是否一致,声音和动作是否自然,台词是否符合角色

三版都要再过一遍的:英文发音、字幕、画面节奏、结尾信息。

反馈要带时间点和具体动作,别写”这里不对”。参考这三条:

A 版第 8 秒的产品颜色不对。请先判断是素材问题还是后期处理问题,说明修改方式及是否增加费用。
B 版户外场景里仍有办公室相关台词,请重写对应句子,并检查配套画面。
C 版的字幕挡住人物下巴,请调整位置,沿用现有表演素材。

第三条尤其有用——”沿用现有表演素材”能避免 Agent 为了挪字幕把整段人像重生成一遍,省不少钱。


08 一个我觉得设计得挺关键的点:画面跟着台词走

换完语言、换了声音之后,最麻烦的是时序:原片说到”第二个优点”时产品卡片弹出来,你改成英文、换了人声,这句话出现的时间就可能偏了。

Hypit 的做法是把视觉事件绑定到剧本里的词语或语义位置,再根据实际生成的声音去对齐,倒推字幕、卡片、补充画面该在什么时候出现。

这套机制保住的是”讲到这里,画面应该做什么”这个关系。不过最终效果还是得看片——尤其是停顿、重音和人物动作之间的配合,机器算得再准也还得人工盯一眼。


最后

把原片和三个版本并排放,记录每版的费用、耗时、修改次数,这三个数比”好不好看”更能说明问题:

  • 换产品准不准
  • 换场景合不合理
  • 换人物后表达自不自然

这三个具体结果,才是判断 Hypit 适不适合你自己那条视频产线的依据。

最后,这篇教程涉及的提示词、工具模版和完整操作步骤SOP,我整理成了一份附件

附件: Darry | Link3