Hermes 用什么模型最划算?2026 实测:国内首选 Qwen3.7-Max,省钱配置这样搭
数据快照:2026 年 7 月 18 日。 本文所述成绩来自 PinchBench 近期公开榜单;模型版本、供应商路由与价格都会变化,请将结论作为 Hermes 的候选配置,再用自己的任务复测。
对于 Hermes 用户,真正的问题通常不是“最强模型是谁”,而是:每天让 Agent 写代码、查资料、跑工具,究竟用哪个模型能把任务做完,又不会把账单跑爆?
先给结论:如果你希望优先使用国内模型,且需要一个能长期作为 Hermes 主力的云端选择,当前应先试 Qwen3.7-Max。它在 PinchBench 的平均成功率为 92.5%、排名第二;公开运行记录中,一次完整基准约 159.60。在这一套测试里,Qwen 用大约八分之一的成本,换来只约 1 个百分点的平均成功率差距。
这不是说 Qwen 在所有任务上都胜过 Claude,而是对大多数个人与小团队的 Hermes 工作流,它给出了目前很难忽略的质量—成本平衡点。
图:人工智能、云端推理与模型连接的科技视觉。图片来源:Pixabay,依据 Pixabay Content License 使用。
一、先选答案:Hermes 应该怎么配模型?
| 使用场景 | 推荐模型 | 原因 | 是否建议做默认模型 |
|---|---|---|---|
| 代码、网页调研、多步工具调用、复杂文档 | Qwen3.7-Max | 国内模型中当前公开 Agent 成绩最靠前,综合能力强 | 建议 |
| 简单问答、格式整理、初稿、批量低风险任务 | Qwen3.6-Flash | 成本与延迟优先,PinchBench 平均成功率 88.1% | 作为分流层 |
| 创意内容、中文内容改写 | MiMo-V2.5 或 GLM-5.2 | 榜单分别有创意、写作/会议分析的任务标签 | 按任务测试 |
| 高风险生产变更、疑难代码、关键交付 | Claude Opus 4.8 Fast | 当前可靠性上限参考,适合升级兜底 | 不建议全量默认 |
| 本地隐私任务、离线试验 | 本地 Qwen 3.6 级模型 | 没有按量 API 成本,但需要足够显存并接受质量下降 | 视硬件而定 |
如果你只想设置一个模型:先把 Hermes 默认模型设为 qwen3.7-max,连续跑一周真实任务,再根据日志决定是否增加便宜模型分流。 Qwen Cloud 的 Hermes 官方接入文档也直接给出了 hermes config set model.default qwen3.7-max 的配置示例。
二、为什么不是“榜首 Claude”,而是 Qwen3.7-Max?
PinchBench 测的不是单轮聊天,而是 Agent 在统一环境中完成真实任务的能力,包括日历文件创建、调研、脚本生成、文档摘要、邮件处理、技能安装、表格分析、PDF 理解和跨步骤 API 工作流等。评分混合了自动检查与 LLM Judge,因此更接近 Hermes 的日常使用方式:模型必须调用工具、处理过程状态,并交付能验收的结果。
近期榜单的关键数字如下:
| 模型 | 平均成功率 | 选型意义 |
|---|---|---|
Claude Opus 4.8 Fast | 93.5% | 可靠性标杆,但成本最高 |
Qwen3.7-Max | 92.5% | 与榜首差距很小,国内主力首选 |
Nemotron 3 Ultra 550B | 89.9% | 开放权重中表现突出 |
MiMo-V2.5 | 89.7% | 创意任务候选 |
Qwen3.6-Flash | 88.1% | 适合低风险、高频分流 |
GLM-5.2 | 87.0% | 会议分析、内容写作候选 |
对 Hermes 用户而言,92.5% 与 93.5% 的差别,往往不值得让所有任务承担接近八倍的公开基准运行成本。更合理的做法是让 Qwen3.7-Max 覆盖绝大多数工作,把 Claude 留给“失败代价很高”的那一小部分任务。
三、国内最好的选择,到底该怎么理解?
“国内最好”至少有三个维度,不能混为一谈:
- 综合 Agent 能力: 当前优先选
Qwen3.7-Max。它在这份公开 Agent 榜单上最接近前沿闭源模型,且 Hermes 原生支持 Qwen Cloud 与 Qwen OAuth 接入。 - 极致性价比: 先试
Qwen3.6-Flash。它不是强任务的替代品,但对摘要、改写、抽取、分类和简单脚本等可回退任务非常合适。 - 按任务取胜: 创意内容可比较 MiMo,会议纪要与内容工作可比较 GLM。不要因为都是“国内模型”就认为它们在 Hermes 的工具调用、长链路规划和错误恢复上等价。
因此本文的实际建议不是“所有请求都走 Qwen3.7-Max”,而是:Qwen3.7-Max 做主 Agent,Qwen3.6-Flash 做廉价执行层,必要时再把 Claude 设为升级通道。
四、给 Hermes 的一套省钱配置
配置 A:只用一个国内云端模型
适合刚开始使用 Hermes、希望少折腾的人。
默认模型:Qwen3.7-Max
适用:编码、调研、文件操作、工具调用、复杂中文任务
原则:外部发送、删除、付款、生产变更仍要求人工确认
优点是行为一致、调试简单;缺点是简单任务也会消耗强模型额度。
配置 B:最推荐的“两层路由”
低风险任务 → Qwen3.6-Flash
复杂、多步、需工具验证 → Qwen3.7-Max
高风险或连续失败 → Claude Opus 4.8 Fast(按需)
低风险任务包括格式转换、邮件草稿、短摘要、标签分类、信息提取和重复性内容初稿。涉及代码修改、网页调研、多个文件、API 调用、技能安装或关键事实核验时,直接交给 Qwen3.7-Max。连续失败两次、任务影响生产或必须一次交付时,再升级到 Claude。
配置 C:本地 + 云端混合
有本地 GPU、同时关注隐私或固定成本时,可以让本地 Qwen 处理不敏感且低难度的前置任务,云端 Qwen3.7-Max 负责最终执行。注意:本地模型的上下文长度、量化方式、工具调用格式和显存都会显著影响 Hermes 表现,不能把云端榜单成绩直接外推到本地部署。
五、不要只看分数:Hermes 里还要验证这四件事
- 工具调用是否稳定。 模型是否会真的运行命令、读取文件、检查结果,而不是只在回复里声称完成?
- 中文长上下文是否可靠。 用你的真实需求、企业文档和代码仓库测试,不要只跑英文演示题。
- 失败后是否会恢复。 观察它是否会重复同一个错误、是否知道何时停下来向你求助。
- 单任务真实成本。 记录每类任务的 token、耗时、重试次数与人工返工时间。便宜模型反复失败,未必真的便宜。
建议从最近 20~30 个真实任务中建立一个小型测试集:为每条任务写清“成功的可验证标准”,让 Qwen3.7-Max、Qwen3.6-Flash 和一个外部强模型各重复运行。你最终要选的不是排行榜第一,而是单位成本下、在你自己的工具和权限环境里,返工最少的模型。
六、最终建议
- 想要国内云端主力、兼顾能力与成本:选 Qwen3.7-Max。
- 想进一步压低日常支出:为简单任务加入 Qwen3.6-Flash 分流。
- 遇到不可出错的复杂任务:保留 Claude Opus 4.8 Fast 作为按需升级,而不是全量默认。
- 不论选谁:对外部写入、删除、发送和生产环境操作都保留验证与人工确认。
模型更新会很快,但这套路由思路不会过时:让便宜模型承担可逆工作,让强模型承担关键决策,把模型升级建立在失败信号上。