给你一条视频,能不能让 AI 顺手改出三条新的?
不是换配音、不是剪掉几秒那种”改”,是三个层面各动一刀:换产品、换场景、换人物。三条新片都要重新组织卖点、重新安排镜头、重新对齐字幕和动画出现的时机。
Hypit 是一套给 AI Agent 用的视频制作框架。这篇按它的官方六步流程走一遍,从装环境到验收,把每一步要准备什么、原话怎么下指令、钱怎么算,都摊开讲。
本文有涉及的提示词、工具模版和完整操作步骤SOP,我放在附件中。
01 先搞清楚 Hypit 到底是个什么东西
它不是一个”输入一段话出视频”的在线工具,而是一套让 Codex、Claude Code 这类 Agent 按固定方法去调用工具做视频的框架。分工是这样的:
| 角色 | 负责什么 |
|---|---|
| Codex、Claude Code 等 Agent | 理解需求、分析参考片、规划并执行制作 |
| Hypit Skill | 提供制作方法和工具使用说明 |
| Hypit 软件工具 | 处理素材、编排字幕和画面、渲染视频 |
| 接入的生成模型 | 生成图片、视频、人物表演和声音 |
你说话,Agent 按 Hypit 定好的方法去调工具,最后交出片子。
一句话概括:Skill 是说明书,软件工具是手脚,Agent 是那个照着说明书干活的人。
别急着装。安装 Skill 只是准备的一半——真正做片子还得有可执行程序和模型服务,那部分要另外接。
02 开工前:一条参考片 + 三份素材
第一轮建议挑一条结构清晰的短视频,比如”人物口播+产品特写+使用演示”。结构越清楚,后面越容易对比改前改后差在哪。
这次三个版本都从同一条原片出发:
| 版本 | 主要改动 | 尽量保留的部分 |
|---|---|---|
| A:换产品 | 产品、卖点、使用演示 | 人物设定、场景风格、叙事结构 |
| B:换场景 | 环境、行为和场景相关台词 | 产品、人物设定、核心信息 |
| C:换人物 | 出镜者形象、声音和表演 | 产品、场景方向、核心信息 |
有个词要先讲清楚:官方说的”保留”是制作目标,不是结果。素材重新生成一遍都得自己检查,不等于画面一定跟原来一模一样。
除了参考视频,还得准备:
- 换产品版:新产品的多角度图片、品牌名、真实卖点、使用说明
- 换场景版:目标场景的描述或参考图,以及产品在这个场景里合理怎么用
- 换人物版:目标人物照片或角色描述;有声音要求时另附声音参考
- 三版共同:目标受众、英语口音偏好、画幅、大致时长
另外,如果 B、C 两版要”准确保留原产品”,最好也把原产品的清晰图和资料一起给。只靠参考视频里那几秒一闪而过的露出,Agent 大概率凑不齐细节。
03 装 Skill:一行命令 + 一句自检
在装了 Node.js/npx 的终端里执行:
npx skills add hypit-ai/hypit -g
按提示选你自己用的 Agent,然后在 Codex 或 Claude Code 里打开视频项目文件夹,输入这段让它自检环境:
请使用 Hypit 检查当前项目环境。
确认 Hypit 可执行程序、参考视频分析工具和渲染能力是否可用。
列出缺少的依赖、可选服务,以及需要我完成的配置。
暂不调用付费服务。
注意官方说明里的一句:Skill 和可执行程序是分别安装、分别更新的。 还有个容易误解的点——”安装成功”不包含任何视频生成额度,装上只是能用,不能开始烧钱。
04 让 AI 先”看懂”原片,别直接开做
这一步很多人跳过了,结果后面全是返工。先让 Agent 把原片拆开,再提改编方案。这段可以直接复制:
请使用 Hypit 分析我提供的参考视频。
重点说明:
1. 开头怎样吸引注意,后面如何展开内容。
2. 人物、产品和场景分别承担什么作用。
3. 口播、字幕、产品特写和图形如何配合。
4. 哪些画面变化对应具体词语或句子。
5. 分别换产品、换场景、换人物时,
哪些关系可以保留,哪些内容需要重写。
请结合具体时间点说明。
先做分析,不生成新素材。
如果分析需要付费转录,请先说明费用。
Hypit 给了抽帧、裁切、转录、带台词的画面网格这些工具,就是给 Agent 用来核对视频里各种关系的。
怎么判断这份分析够不够细? 看它有没有落到具体时间点。”视频节奏快、字幕醒目”这种等于没说;像”说出第二个卖点时切入产品特写,同时放大关键词”,才谈得上下一步的制作安排。
05 一次把三个版本的要求说清楚
这里最关键的一句:三版都从原片出发,别逐版叠加改。 先出一版再在它基础上改,对比就没意义了,而且错误会累积。
完整提示词如下(方括号里的内容换成你自己的):
基于刚才的参考片分析,设计三个独立的新版本。
三个版本都从原片出发,不要逐版叠加修改。
共同要求:
- 使用自然的英文口播和英文字幕。
- 面向【填写目标受众】。
- 使用9:16竖屏,目标时长约20—30秒。
- 保留参考片适合复用的叙事结构和视觉节奏。
- 英文表达可以为自然度重写,但不能改变事实。
- 时长、镜头或素材要求不可行时,先提出调整方案。
A版:换产品
将原产品换成【新产品名称】。
以我提供的图片和说明为准,重写卖点、
产品特写、使用演示和结尾引导。
尽量沿用原片的人物设定和场景风格。
不要把原产品专属功能移植到新产品上。
B版:换场景
保留原产品和人物设定,
将场景改成【目标场景】。
同步调整人物行为、道具、台词和使用演示,
使内容符合这个环境。
C版:换人物
保留原产品、场景方向和核心信息,
将出镜者改成【目标人物或角色】。
参考我提供的人物素材,重新设计声音和表演。
涉及原出镜者个人经历的台词,需要重新处理。
请先分别提交:
英文脚本及中文对照、镜头安排、素材需求、
计划保留与修改的部分,以及费用估算。
暂不调用付费生成服务。
发完这句,Agent 会先交一份方案而不是直接开渲——脚本、镜头、素材清单、改动点和费用估算分开列。趁着这个窗口把要求捋顺,比渲废了再重来便宜得多。
三个版本各自最容易翻车的地方:
- 换产品:产品会同时出现在人物手里、补充镜头、图形卡片、结尾好几个位置,这些位置必须一起核,漏一个就是画面里残留旧产品的 Logo。
- 换场景:动作合不合理。原片是坐在办公桌前操作产品,搬到户外就得重新安排支撑物、持握方式和镜头角度,不可能一个人凭空站着用。
- 换人物:角色和台词的关系。原出镜者讲的个人故事,不能直接变成新人物的经历。
06 选生成服务,先算预算再开工
框架本身免费,生成素材收费。两条路:官方推荐的 HypiHub,或者接自己的 Provider(用 API Key 时要说明服务名和接口文档,部分接口可能要额外适配)。
开始前先让 Agent 列三件事:
- 哪些素材需要新生成
- 哪些素材可以复用
- 每个版本计划调什么模型
按官方给的示例算一下:3 段视频 × 每段 10 个片段 × 4.2 积分 ≈ 126 积分。这只是视频素材的示例算法,图片、声音、托管处理和重新生成可能另计,分辨率和参考输入条件也会影响,下单前以官方定价页为准。
07 三版分开验收,别只看”像不像”
Hypit 有个浏览器里的 Studio:能播放、逐帧看、拖时间线,还能改组件开放出来的属性;Comments 视图支持按时间点留反馈。
三个版本的检查重点不一样:
| 版本 | 重点检查 |
|---|---|
| 换产品 | 外观、Logo、功能描述是否准确,原产品是否还有残留 |
| 换场景 | 光线、道具、人物行为和使用方式是否合理 |
| 换人物 | 形象是否一致,声音和动作是否自然,台词是否符合角色 |
三版都要再过一遍的:英文发音、字幕、画面节奏、结尾信息。
反馈要带时间点和具体动作,别写”这里不对”。参考这三条:
A 版第 8 秒的产品颜色不对。请先判断是素材问题还是后期处理问题,说明修改方式及是否增加费用。
B 版户外场景里仍有办公室相关台词,请重写对应句子,并检查配套画面。
C 版的字幕挡住人物下巴,请调整位置,沿用现有表演素材。
第三条尤其有用——”沿用现有表演素材”能避免 Agent 为了挪字幕把整段人像重生成一遍,省不少钱。
08 一个我觉得设计得挺关键的点:画面跟着台词走
换完语言、换了声音之后,最麻烦的是时序:原片说到”第二个优点”时产品卡片弹出来,你改成英文、换了人声,这句话出现的时间就可能偏了。
Hypit 的做法是把视觉事件绑定到剧本里的词语或语义位置,再根据实际生成的声音去对齐,倒推字幕、卡片、补充画面该在什么时候出现。
这套机制保住的是”讲到这里,画面应该做什么”这个关系。不过最终效果还是得看片——尤其是停顿、重音和人物动作之间的配合,机器算得再准也还得人工盯一眼。
最后
把原片和三个版本并排放,记录每版的费用、耗时、修改次数,这三个数比”好不好看”更能说明问题:
- 换产品准不准
- 换场景合不合理
- 换人物后表达自不自然
这三个具体结果,才是判断 Hypit 适不适合你自己那条视频产线的依据。