昨天晚上,我在 WorkBuddy 里敲了一行命令,回车。
然后,workbuddy 下载 LibTV CLI,安装,登录,创建工作区,创建画布,搜索模型,生成视频——全程自动,我没碰键盘。
十分钟后,一条 1920x1080 的 5 秒橘猫视频躺在我的硬盘里,能继续编辑,能复用。
从安装到出片,我只说了一句话。
大家好,我是小虎。
这几天 H3 刷屏,全网都在讨论它的参数和价格。但我想跟你说一件更重要的事。
H3 发布的同一天,LibTV 就已经接入了它。这意味着什么?意味着你不用打开 H3 的网页,不用手动上传素材,不用守着进度条——你只需要在 WorkBuddy 里说一句话,LibTV 就能通过 CLI 替你调 H3,生成视频,自动下载。
视频模型的核心矛盾变了
回想一下,现在大家用 AI 做视频是什么体验?
打开网页,输入提示词,点生成,等几分钟,下载。
然后打开剪映,导入素材,配音,加字幕,调时间轴,导出。
做完一条视频,你已经在三个软件之间切了七八次。
这条链路里,模型很强,但链路很弱。模型强不代表你能用得好,链路强你才能用得上。
LibTV 做了一件事,大多数人没注意到。它不只是个视频编排工作台——它提供了一套完整的 CLI 命令行工具和配套的 Skill API。
通过这套 CLI,LibTV 接入的所有模型——H3、Wan 2.7、Hailuo 2.3、Seedance 系列——都可以被 Agent 直接调用。
也就是说,LibTV 把"网页里的模型"变成了"能被代码调用的引擎"。
这个区别,对于做视频自动化的人来说,是天和地的差别。
能被调用,和不能被调用,是两个世界
用 WorkBuddy 调 LibTV,链路是这样的:你在 WorkBuddy 里说一句话,WorkBuddy 拆解意图,调用 LibTV 的 Skill,LibTV 通过 CLI 调模型的生成接口,生成视频,下载,再用 FFmpeg 合成配音和字幕,输出成片。
整个过程,你只做了一件事:开口说了一句话。
而如果模型只存在于网页端,你每一步都需要手动操作。你不在,它就停。
你没法把它写进自动化流程里,没法批量跑,没法让 Agent 替你值守。
一个人一天能手动操作几次生成?十次?二十次?再多你就累了。
但一个 Agent 一天能调用多少次?理论上是无限次。
说真的,搞视频自动化这阵子,我越来越觉得:视频模型的质量,早已经过了及格线。画质差距在缩小,时长差距在缩小,一致性差距在缩小。
真正拉开差距的,不是模型本身,是模型背后有没有一个能帮 Agent 把模型"接住"的调度层。
LibTV 的 CLI 就是这座桥。
WorkBuddy + LibTV:三个场景,三种玩法
好,下面说实操。我先讲配置,再讲 WorkBuddy 怎么交互。
前置配置:把 LibTV CLI 装好
LibTV 的 CLI 是让 Agent 调模型的入口。配置很简单,但有几个坑我先标出来,帮你省时间。
安装:下载 LibTV CLI skill 包,在 PowerShell 里跑安装脚本,CLI 会自动装到 ~.libtv 目录。装完记得重开终端,否则 PATH 不刷新,命令找不到。
登录:用 libtv login web 走浏览器登录。这里有个坑——如果浏览器已经登录了 LibTV,回调可能被跳过,CLI 会一直卡着。解决方案是手动设 LIBTV_TOKEN 环境变量,比折腾回调快得多。
模型权限:LibTV 平台上 31 个视频模型,部分有 VIP 门槛。比如 H3 需要 VIP 会员才能调用。非 VIP 可用的有 8 个,包括 Wan 系列和 Hailuo 系列。调用前让 WorkBuddy 先帮你扫一遍 model search,看清楚哪些能直接用。
以上是配置。配置完一次,后面全是 WorkBuddy 的事。
场景一:一句话出片
这是最基础的玩法。我在 WorkBuddy 里输入:
帮我安装并配置LibTV CLI。配置完成后,帮我登录LibTV,创建一个测试画布,然后用Wan 2.7模型生成一条视频。主题:一只橘猫在窗台上晒太阳。
WorkBuddy 自动完成了以下链路:
下载 skill 包 → 安装 CLI → 登录 LibTV → 创建工作区 → 创建画布 → 搜索模型 → 拉取 Wan 2.7 参数 schema → 创建视频节点 → 触发生成 → 等待完成
结果:一条 5 秒的 1080P 视频,1920x1080,橘猫慵懒地趴在窗台上,阳光洒在毛发上闪着光。
全程不到十分钟,我什么都没做,就在旁边看着 workbuddy 自动跑。
画布链接可以直接打开,在 LibTV 网页里继续编辑、调整参数、二次生成。
视频,workbuddy 也帮我下载在硬盘里,直接可用。
场景二:产品图动起来
如果你有产品图,想让模型把静态产品变成动态展示视频:
用LibTV,以我桌面上"耳机产品图.png"作为参考图,生成5秒产品展示视频。画面:耳机从侧面缓缓旋转,展示充电仓,背景深灰色渐变。风格:科技感,Apple广告风格。
WorkBuddy 会自动识别本地图片路径,上传到 LibTV,创建图生视频节点,绑定模型,按你的风格要求生成。你不需要关心用的是哪个模型——WorkBuddy 会根据任务类型(图生视频)和你的会员状态,自动选最合适的那个。
场景三:完整生产线
这是真正体现"自动化"价值的玩法——从视频生成到配音、字幕、合成,一条指令搞定:
用LibTV生成一条10秒的视频,主题是"智能手表"。生成完成后,用edge-tts生成配音,文案是"全新智能手表,健康监测,续航三十天"。然后用FFmpeg把配音合成到视频里,加字幕,字体用思源黑体,白色加阴影,底部居中。最终输出MP4。
WorkBuddy 会在 LibTV 生成视频后,自动调 edge-tts 生成配音音频,再用 FFmpeg 把视频、音频、字幕三条轨道合成,输出最终成片。以前这条链路需要你在三个工具之间手动切,现在一句话。
流程本质上是什么
| 你说的话 | WorkBuddy做的事 | 你得到的结果 |
|---|---|---|
| "生成一条橘猫视频" | 安装CLI→登录→创建画布→调模型→生成 | 一条1080P视频,在LibTV画布里 |
| "用这张产品图生成展示视频" | 识别图片→上传→选图生视频模型→生成 | 5秒产品展示视频 |
| "生成视频+配音+字幕" | LibTV生成→edge-tts配音→FFmpeg合成 | 带配音和字幕的最终MP4 |
每一步背后都有命令在跑,但你不必知道。你只需要知道:对 WorkBuddy 说什么,能得到什么。
算一笔账
LibTV 平台上 H3 的价格是 0.8 元/秒,2K 分辨率,15 秒成本约 12 块,前提是 VIP 会员。
Wan 2.7 和 Hailuo 2.3 系列非 VIP 可用,画质和时长参数略有差异。
但比价格更重要的,是时间成本。你做 10 条视频,用 WorkBuddy 一句话调用,你花 10 句话。
手动操作呢?每条视频打开网页、输入提示词、等待、下载、导入剪辑软件、配音、加字幕、导出——10 条视频轻松吃掉一个下午。
模型便宜,帮你省钱。模型可调用,帮你省时间。省时间比省钱更值钱。
几个真实的坑
第一个,部分模型有 VIP 门槛。LibTV 平台上 H3 标记了 VIP 专属,非 VIP 调不了。非 VIP 用户目前可用的视频模型有 8 个,以 Wan 和 Hailuo 系列为主。让 WorkBuddy 先跑一遍模型搜索,它会自动帮你筛。
第二个,CLI 登录流程对新手不友好。浏览器回调可能卡住,权限可能报错。最简单的方案:手动设置 LIBTV_TOKEN 环境变量,一步到位。
第三个,不同模型参数规则不同。Hailuo 2.3 Fast 只支持 ratio=auto、duration=6 或 10;Wan 2.7 支持 ratio=16:9、duration=5。WorkBuddy 会在调模型前先拉参数 schema,自动适配,比你手动试错快。
第四个, .libtv 目录权限问题。如果项目绑定写文件报 EPERM,在管理员权限终端里操作,或确保工作目录有写入权限。
AI 视频的下一个分水岭,不是模型参数,是模型能不能被你的 Agent 调用。
这句话你可以截图。
据说 H3 今天开源,本地部署、定制微调都成为可能。但更重要的是,LibTV 的 CLI 架构已经证明了一件事:只要 LibTV 接入了某个模型,Agent 就能通过 CLI 调用它。H3 是其中之一,远不是最后一个。
如果你已经在用 WorkBuddy 跑视频自动化,LibTV CLI 这条链路今天就可以加上。
配置十分钟,后面全是 WorkBuddy 的事。
如果你还没开始做自动化,记住这个判断:选模型的时候,别只看画质和价格,看一眼 LibTV 平台上有没有它。
有,你就有了把它写进自动化流程的资格。没有,再强的模型也只能在你的网页里待着。