一开始做
dsh-image-gen 的想法其实很简单。
DeepSeek Harness 本身已经能很好地跑 Agent,但如果想在对话里顺手生成一张图,体验还是有点割裂:要么切去别的平台,要么自己调 API,再把结果拿回来。
所以最早我只是想补一个很小的能力:
直接在 DSH 对话里说一句话,就能生成图片。
后来做着做着,需求越来越多。
现在回头看,它已经和第一版完全不是一个东西了。
目前项目已经更新到 v0.4.x,从最早的“对话生图插件”,逐渐变成了一套围绕 DSH 的 AI 图像创作工作流。
GitHub:
github.com/shanliuling/dsh-image-gen
最开始,只解决一个问题:别让我来回切网站
最早的使用方式非常简单。
在 DSH 里直接说:
帮我生成一张雨夜霓虹街头的赛博朋克猫咪。
Agent 调用图片生成能力,图片直接出现在当前对话里。
后面继续说:
给它戴上一副墨镜。
它会基于上一张图继续修改。
这个体验其实是我一直想保留的核心:
生成图片不应该是一个独立工具,而应该成为 Agent 对话的一部分。
但纯对话很快就不够用了
实际用下来会发现,有些事情适合“聊天”,但有些事情明显更适合工作台。
比如:
同一个 Prompt 我想一次生成 4 张。
我想上传多张参考图。
我想精确调整比例、模型、清晰度。
我只想保存其中满意的结果。
所以后来加了 Studio。
现在 Studio 里可以完成:
一次生成多张候选图、最多 5 张参考图、Provider / 模型切换、比例和清晰度控制,以及结果筛选和保存。
我不太想把它做成 ComfyUI 那种节点编辑器,而是更希望它保持一个比较轻量的创作工作台。
然后又遇到了另一个问题:模型这么多,到底哪个好?
现在生图模型越来越多。
同一个 Prompt,在 Gemini、OpenAI Images、Seedream 或其他兼容接口上,结果可能差别非常大。
如果自己一个个切 Provider、复制 Prompt、重新生成,其实挺麻烦。
所以又加了一个我自己很常用的功能:
多模型横向对比。
同一组 Prompt 和参考图,可以并发交给多个模型,然后把结果放在同一个画布里看。
它不是什么模型排行榜。
更多是解决一个实际问题:
我现在这个 Prompt,到底哪个模型最适合?
直接看结果,比看参数有用。
500+ Prompt 灵感库,也是后来才加的
还有一个挺现实的问题。
很多时候不是不会生图,而是:
不知道该生什么。
或者看到一张不错的图,却不知道这种构图、风格应该怎么描述。
所以最近又加了一个 Prompt 灵感库。
目前内置了 500+ 案例,可以搜索、筛选、收藏、复制 Prompt,也可以直接带到 Studio 继续生成。
图库现在也不只是“看看以前生成了什么”
第一版图库其实真的就只是 Gallery。
后来生成越来越多以后,才发现图库本身也得认真做。
现在可以做搜索、筛选、收藏、下载、重新生成、继续编辑、批量管理,以及不同工作区之间的数据隔离。
这也是我最近越来越明显的感受:
AI 生图工具真正用久以后,生成本身反而不是最难的,管理结果才是。
本地 ComfyUI 也接进来了
之前发项目的时候,就有人提过:
既然是 DSH 插件,能不能把本地 ComfyUI 也接进来?
后来确实做了。
现在可以配置多个命名工作流,导入 ComfyUI 的 API Format Workflow JSON,然后让 Agent 在对话里按名称调用。
现在支持哪些模型?
目前主要支持:
Google Gemini、OpenAI Images / OpenAI Compatible、ByteDance Seedream、Aliyun DashScope / Qwen Image,以及本地 ComfyUI。
整个项目还是 BYOK 模式。
也就是插件本身不卖额度、不做中转,用户填自己的 API Key。
从一个“小插件”到现在
这次 README 也重新做了一遍。
因为旧 README 已经完全跟不上现在的项目了。
以前一句:
在 DSH 里生成图片。
基本就能介绍完。
现在更接近:
对话生图 → 连续编辑 → Studio 批量创作 → 多模型对比 → 找 Prompt 灵感 → 图库管理 → 本地 ComfyUI。
虽然功能多了不少,但我现在反而更想控制它不要继续变得太重。
而是希望:
如果你本来就在用 DSH,那么图片生成这件事可以自然地融进 Agent 工作流里。
项目目前还在继续更新。
GitHub:
github.com/shanliuling/dsh-image-gen
如果你本身也在用 DeepSeek Harness,欢迎试试。
有觉得别扭或者缺的功能,也可以直接提 Issue。