问题定义
8 月 13 日,DeepSeek 开源 Agent 底座 DeepSeek Harness(DSH),一周 GitHub 16 万 star,第三方插件破 4000。各路盘点集中在"万物皆插件"的架构理念:模型、工具、会话、沙箱、界面全部可插拔。
本文从另一个角度切入:把这 4000 多个插件按品类摊开,看生态实际把模型能力用在了哪里。结论有两个:插件作者们已把同一家模型平台自发用在了三个位置上;而多模态生成的位置还空着,且存在一个不走插件路线的补法:DSH 自带的 Shell 工具 + 一个命令级生成 CLI,认证层零成本复用。
(与本文作者其他多模态内容互相独立:Agent skill 那篇讲"产出侧空白"的观察,这篇讲"DSH 生态位 + 接入工程",无阅读依赖。)
生态数据:品类分布与百炼的三个占位
截至 8 月中旬的品类结构:
品类
职责
代表插件
工作台
侧边栏改造为 VS Code 风工作台
DSH-better-sidebar
长期记忆
跨会话记忆(Markdown 真相源 + 本地索引)
dsh-memory-evolve、EverOS、dsh-persist
视觉(读图)
为纯文本主模型补视觉输入
ModLens、dsh-tool-describe-image
文件引用
输入框 @ 引用文件
dsh-at-file
多 Agent 编排
会话内拉起子 Agent 团队
dsh-agent-teams
Claude Code 迁移
配置、skills、会话历史整体迁移
dsh-claude-move
娱乐玩梗
电子宠物、小游戏、礼貌回复
deepseek-manners
上线三天 4300 个插件。拆品类后有一个值得注意的分布特征:输入侧补齐,输出侧空白。读图、记忆、文件引用都在解决"信息进得来",没有任何一个品类解决"产物出得去"(Agent 自主产出图片、视频、音频文件)。
三个位置上社区不约而同做了同一选择,证据链如下:
- 读图位:dsh-tool-describe-image 的配置项就是
DASHSCOPE_API_KEY,默认模型 qwen-vl-plus,cordis.patch.yml 一行可换 qwen-vl-max;ModLens 的 OpenAI 兼容通道示例 base URL 即百炼 compatible-mode 地址,示例模型 qwen3-vl-plus。两个头部插件互不相识,默认引擎同为 qwen-vl 系 - 记忆位:EverOS 的
[llm]配置段是标准 OpenAI 兼容三项(model、api_key、base_url),默认 OpenRouter,指向上述兼容地址即可运行 - 主模型位:DSH 本体不锁模型,设置中支持自定义提供方、Base URL、协议、模型列表;DeepSeek V4 Pro 缓存命中价上调后,多 provider 备份正在变成常规操作
这不是平台侧的安排,是插件作者用配置文件投出来的票。
接入设计:为什么不用写插件
给 DSH 写插件是正经开发活(需要了解插件结构、生命周期、配置格式)。补"生成"这个位置有一条更短的路径,架构上成立的原因有三层:
1. DSH 标准模式自带 Shell 工具。 Agent 能直接执行命令行,任何 CLI 都天然是它的"工具",不需要经过插件协议的封装。
2. 百炼 CLI(bl)把多模态生成做成了命令级操作。 生图、改图、生视频是子命令 + 参数,Agent 拼命令的成本和写一行函数调用相当,且可自发现(跑 --help 就知道有什么参数)。
3. 认证层同名复用。 bl 读取的环境变量就是 DASHSCOPE_API_KEY,与 dsh-tool-describe-image 等视觉插件要求的同一个变量。已为读图插件配过 key 的环境,bl 零额外配置直接可用。
安装与 key 存储各一条命令:
npm install -g bailian-cli
bl auth login --api-key sk-你的key
Node.js 18+;API Key 在控制台这里签发;安装详情见CLI 安装文档。
装好后给 Agent 一句约定:本项目所有出图、改图、出视频需求用 bl 完成。它会自己试命令、读帮助、组织参数。以下三个场景的命令形态,全部来自实测(Agent 拼装,参数已对照 CLI 文档核验)。
三个场景的命令级实现
示例项目:一个本地番茄钟小网页 FocusTick,需求是"对外交付物料"。
场景一:项目分享卡(文生图)
bl image generate --prompt "深色背景的产品分享卡,画面中央一个扁平风格的番茄钟图形标志,下方一行简洁的英文工具名 FocusTick,大量留白,克制的设计风格" --size 1280*720 --model qwen-image-3.0-pro --watermark false --out-dir ./assets --out-prefix focustick-card
关键参数:
--size 1280*720:宽高用*连接,产物直接命中分享场景比例--out-prefix:产物文件名前缀(缺省值是image),让 Agent 能自主管理多版本产物,下一张叫focustick-card-light,可读性来自命名而非目录结构--watermark false:关闭水印,正式交付物料需要
实测细节:第一版提示词缺"大量留白"约束,产出元素过满;补三个字重跑即修复。改提示词的成本远低于改流程,迭代放在提示词层做。
场景二:风格迭代(图生图编辑)
bl image edit --image ./assets/focustick-card.png --prompt "将深色背景替换为米白色浅色背景,保持番茄钟图形、文字内容与整体构图完全不变" --out-dir ./assets --out-prefix focustick-card-light
image edit 与重新 generate 的本质区别:edit 在原图上做局部修改,已确定的构图原样保留;重新生成则整体重抽。版本管理上两图并排(focustick-card / focustick-card-light)靠 --out-prefix 天然成立。edit 的 --image 参数可重复传入做多图合成,本场景未用到。
场景三:产品演示视频(图生视频)
bl video generate --image ./screenshots/home.png --prompt "镜头缓慢向界面推进,界面上的卡片元素依次轻轻浮现,干净的产品演示风格,节奏舒缓" --duration 5 --download ./assets/focustick-demo.mp4
技术要点:
- 带
--image参数时自动切换图生视频模型,无需显式指定 - 视频生成是异步任务,等待模式下命令自行轮询;Agent 会话中表现为"卡住",实际在等任务完成
--download <路径>让产物完成后直接落盘,省一步bl video download --task-id
成本控制
生成类调用按次计费,且 Agent 是自动执行,一口气出三张图就是三次调用费用。两个治理动作放在动手前:
bl usage freetier --all # 免费额度用尽自动停,防意外扣费
bl usage free --expiring 30 # 查各模型剩余额度(需先 bl auth login --console)
免费额度口径(以官方文档为准):新人有效期 90 天、每模型独立、仅北京地域、用尽不自动切换。第三方汇总文"100 万 tokens 永久有效"的说法是错的。
适用边界
- 图形类标志、分享卡、轻动效演示视频:稳,本文三个场景即实测范围
- 精确到色号的品牌规范物料:生成结果当草稿,终稿交给设计
- 大幅风格修改:与其在 edit 里描述一堆"不要什么",不如重新 generate
- 真实交互操作演示:生成视频是"演示感"不是"操作实录",录屏更合适
插件数据截至 2026 年 8 月中旬,生态迭代快,以 GitHub 实况为准;命令形态已对照 CLI 官方文档核验。