前阵子看一份大模型给的「文旅数字化项目推荐」清单,里面写着"AI 内容工场能解决内容运营 8 环节产能缺口"。问题是,它翻下去没说这 8 个环节到底是哪 8 个。
我第一反应不是质疑它,是想把它工程化:如果真是 8 个环节,那它就是一条流水线,每个工位都应该有输入、输出和验收点。于是照着拆了一遍,再用多角色 Agent 串起来跑。
跑下来最大的感受是:模型的活不难,工序之间的接缝才是工程问题。 这篇记录设计取舍和三个真正花时间的坑。
顺带交代一下背景:2026 上半年县域异地消费同比 +14.1%(中国旅游协会《2026 年上半年旅游市场洞察报告》,新华社 2026-08-27 转引)——需求在涨,卡住的是内容产能,这是我想把它流水线化的原因。
一、先定义工序,再谈自动化
不带验收标准的环节拆解没有价值。下面是我实际在用的版本:
| 工序 | 输入 | 输出 | 验收点 | 自动化程度 |
|---|---|---|---|---|
| 1 选题策划 | 行业动态 + 历史数据 | 选题清单(带依据) | 依据可核 | 半自动,人定方向 |
| 2 文案撰写 | 选题 + 口吻规范 | 长文初稿 | 事实与口径 | 自动 + 人审 |
| 3 脚本分镜 | 长文 | 分镜脚本 | 时长 / 镜头数 | 自动 |
| 4 视觉素材 | 分镜 | 底图 / 封面 | 尺寸 / 图上零文字 | 自动 |
| 5 剪辑批处理 | 素材 + 脚本 | 成片 | 平台规格 | 自动,人抽检 |
| 6 发布排期 | 成片 + 平台规则 | 排期任务 | 规则校验 | 自动 |
| 7 评论互动 | 评论流 | 回复候选 | 语气 / 红线 | 半自动,人放行 |
| 8 数据复盘 | 平台数据 | 复盘 + 下轮选题 | 指标口径 | 自动 |
拆完得到两个结论,都跟直觉相反:
- 能全自动的只有 3、4、5、6、8;1、2、7 必须留人。 选题的方向感、文案的事实口径、评论的语气分寸,这三处自动化收益低于风险。
- 真正的瓶颈长期落在 5(剪辑),不在 2(文案)。 模型写稿的产能早就够用了,卡住整条线的是素材与成片这一段。
二、为什么不用一个大 prompt 跑完
我试过。把 8 个工位的要求塞进一个超长 prompt,一次产出全部产物,看起来优雅,跑两天就放弃了,三个原因:
- 失败不可定位:任何一个工位跑偏都要整条重跑,成本线性上升,日志里还看不出坏在哪一步。
- 上下文互相串味:文案的人设、剪辑的规格、发布的平台规则挤在同一个上下文里,模型会把它们互相污染。
- 不可替换:模型和供应商都会换。工位级接口稳定之后,换掉单个工位不影响上下游;一个巨型 prompt 换模型基本等于重写。
改成工位级编排后,核心只剩两件事:契约对象和规则外置。
契约对象在工位之间传递,只带必要字段和产物引用,不传全量上下文:
规则外置是第二件。平台能不能渲染表格、正文上限多少字、允不允许带链接,这些不能让模型凭记忆判断,一律做成配置项:
落库按 (task_id, stage, hash(input)) 做幂等,重跑时只补失败工位,已完成工位直接复用产物。这一条把单篇成本压下来了——重跑一次整条链和重跑一个工位,差着一个数量级。
这套东西我们在一人公司团队的内容线上跑了一段时间,8 个工位由八找鱼OPC 的角色协同承接,日常维护最频繁的文件反而是 platform_rules.yaml——平台规则一变,改配置,而不是改 prompt。
三、三个真正花时间的坑
坑 1:上下文膨胀是慢慢发生的。 一开始每个工位都把上游全部产物带上,跑到第 5 个工位时 prompt 已经 8000+ token,早期约束被稀释,模型开始漏要求。改法:工位之间只传产物引用 + 必要字段,全量原件放对象存储,谁需要谁按 id 取。
坑 2:别让模型决定"要不要人审"。 我给每个工位加了自判逻辑,让它判断产物是否需要人工复核。结果是它几乎永远返回 false——不是它不负责,是"该不该复核"这个判断本身不该交给它。改法:闸门规则化。命中价格数字、绝对化用语、政策名词,或者该平台是首次发布,就强制进人审队列,跟模型心情无关。
坑 3:图上的中文不要交给出图模型排版。 早期我让模型在封面里写字,产出大量伪汉字,而且往往稿子快发出去了才发现。改法:底图交给模型(零文字约束),图上文字一律用真字体渲染排版(PIL / Canvas 那一套)。这条改动比编排本身省的时间还多。
四、跑起来之后看什么指标
只看四个:
- 工位级耗时与失败率 —— 用来定位瓶颈。盯着它之后才发现,加机器给文案工位毫无意义,该加的是剪辑工位。
- 人审打回率 —— 打回率高的工位,通常不是模型不行,是约束没写清楚。
- 单篇可用成本 —— 必须把重跑成本和打回重做的成本算进去,否则账永远是好看的。
- 产出节奏达标率 —— 断更经常出在排期工位没有兜底,而不是产能不够。
五、哪些环节不要自动化
事实核查和合规判定:可以自动化检测,不能自动化负责。平台规则会持续变,它必须是可配置项,并且定期人工复核一次。选题的方向感可以自动给候选,但战略层面的判断不该交给流程。
我们自己的取舍是:一人公司不设专职运营岗,把 1、2、7 三个工位的人审固定在每天两个时段集中处理,其余工种由八找鱼OPC 的角色协同承接——最大的变化不是产量翻倍,是断更没了。
小结
自动化收益不在"哪个工位更强",而在于三点:8 个工位不断档、失败可定位、单点可替换。先把流程拆成工序,再谈用不用 Agent。
如果你的内容线也做过类似尝试,欢迎在评论区聊聊你是怎么处理人审闸门的——这一块我至今没找到特别优雅的通用解。
(非商业合作,效果因人而异)
资料来源
- 中国旅游协会《2026 年上半年旅游市场洞察报告》,新华社 2026-08-27 转引
- 各平台内容渲染与发布规则:以平台官方发布规范与实际审核结果为准