我把一个 DeepSeek Harness 生图插件,慢慢做成了 AI 图像创作工作台

0 阅读4分钟

image.png 一开始做 dsh-image-gen 的想法其实很简单。

DeepSeek Harness 本身已经能很好地跑 Agent,但如果想在对话里顺手生成一张图,体验还是有点割裂:要么切去别的平台,要么自己调 API,再把结果拿回来。

所以最早我只是想补一个很小的能力:

直接在 DSH 对话里说一句话,就能生成图片。

后来做着做着,需求越来越多。

现在回头看,它已经和第一版完全不是一个东西了。

目前项目已经更新到 v0.4.x,从最早的“对话生图插件”,逐渐变成了一套围绕 DSH 的 AI 图像创作工作流。

GitHub:

github.com/shanliuling/dsh-image-gen


最开始,只解决一个问题:别让我来回切网站

最早的使用方式非常简单。

在 DSH 里直接说:

帮我生成一张雨夜霓虹街头的赛博朋克猫咪。

Agent 调用图片生成能力,图片直接出现在当前对话里。

后面继续说:

给它戴上一副墨镜。

它会基于上一张图继续修改。

这个体验其实是我一直想保留的核心:

生成图片不应该是一个独立工具,而应该成为 Agent 对话的一部分。

image.png


但纯对话很快就不够用了

实际用下来会发现,有些事情适合“聊天”,但有些事情明显更适合工作台。

比如:

同一个 Prompt 我想一次生成 4 张。

我想上传多张参考图。

我想精确调整比例、模型、清晰度。

我只想保存其中满意的结果。

所以后来加了 Studio。

image.png

现在 Studio 里可以完成:

一次生成多张候选图、最多 5 张参考图、Provider / 模型切换、比例和清晰度控制,以及结果筛选和保存。

我不太想把它做成 ComfyUI 那种节点编辑器,而是更希望它保持一个比较轻量的创作工作台。


然后又遇到了另一个问题:模型这么多,到底哪个好?

现在生图模型越来越多。

同一个 Prompt,在 Gemini、OpenAI Images、Seedream 或其他兼容接口上,结果可能差别非常大。

如果自己一个个切 Provider、复制 Prompt、重新生成,其实挺麻烦。

所以又加了一个我自己很常用的功能:

多模型横向对比。

同一组 Prompt 和参考图,可以并发交给多个模型,然后把结果放在同一个画布里看。

它不是什么模型排行榜。

更多是解决一个实际问题:

我现在这个 Prompt,到底哪个模型最适合?

直接看结果,比看参数有用。


500+ Prompt 灵感库,也是后来才加的

还有一个挺现实的问题。

很多时候不是不会生图,而是:

不知道该生什么。

或者看到一张不错的图,却不知道这种构图、风格应该怎么描述。

所以最近又加了一个 Prompt 灵感库。

目前内置了 500+ 案例,可以搜索、筛选、收藏、复制 Prompt,也可以直接带到 Studio 继续生成。

image.png


图库现在也不只是“看看以前生成了什么”

第一版图库其实真的就只是 Gallery。

后来生成越来越多以后,才发现图库本身也得认真做。

现在可以做搜索、筛选、收藏、下载、重新生成、继续编辑、批量管理,以及不同工作区之间的数据隔离。

这也是我最近越来越明显的感受:

AI 生图工具真正用久以后,生成本身反而不是最难的,管理结果才是。


本地 ComfyUI 也接进来了

之前发项目的时候,就有人提过:

既然是 DSH 插件,能不能把本地 ComfyUI 也接进来?

后来确实做了。

现在可以配置多个命名工作流,导入 ComfyUI 的 API Format Workflow JSON,然后让 Agent 在对话里按名称调用。


现在支持哪些模型?

目前主要支持:

Google Gemini、OpenAI Images / OpenAI Compatible、ByteDance Seedream、Aliyun DashScope / Qwen Image,以及本地 ComfyUI。

整个项目还是 BYOK 模式。

也就是插件本身不卖额度、不做中转,用户填自己的 API Key。


从一个“小插件”到现在

这次 README 也重新做了一遍。

因为旧 README 已经完全跟不上现在的项目了。

以前一句:

在 DSH 里生成图片。

基本就能介绍完。

现在更接近:

对话生图 → 连续编辑 → Studio 批量创作 → 多模型对比 → 找 Prompt 灵感 → 图库管理 → 本地 ComfyUI。

image.png

虽然功能多了不少,但我现在反而更想控制它不要继续变得太重。

而是希望:

如果你本来就在用 DSH,那么图片生成这件事可以自然地融进 Agent 工作流里。

项目目前还在继续更新。

GitHub:

github.com/shanliuling/dsh-image-gen

如果你本身也在用 DeepSeek Harness,欢迎试试。

有觉得别扭或者缺的功能,也可以直接提 Issue。