Qwen Code 深度剖析:通义开源的“终端 Agent“,如何用 77.8% SWE-bench 证明开源编程智能体真的能打

0 阅读6分钟

通义开源了"模型 + 框架"双开源的终端 Agent:开箱即用的 Agentic 能力、多协议可切模型、SWE-bench_Verified 77.8%。本文深挖代码架构,并给出从安装到 headless 修 bug 的完整实战。

引子:开源 Agent 的"通义时刻"

2026 年 AI 编程智能体江湖:闭源阵营有 Claude Code、Gemini CLI;开源阵营有 OpenClaw、dsh。而 9 月,通义千问(Qwen)家族的一张牌正在改变天平——

Qwen Code:"The open-source AI coding agent that lives in your terminal"[1]。

它最特别:模型和框架双开源——Agent 是开源框架,驱动它的 Qwen 模型也开源,无 vendor lock-in[1]。官方 SWE-bench_Verified 77.8% 证明:开源编程智能体真的能打

一、一个"住在终端里的开源 AI 编程 Agent"

1.1 一句话定位与起源

Qwen Code 是 QwenLM 开源的终端 AI 编程 Agent。最初基于 Google Gemini CLI v0.8.2,从 v0.1 起停止同步上游,独立开发成多协议、多平台 Agent 框架[1]。

1.2 四大特性

  1. Agentic out of the box:Auto-Memory / Auto-Skills / SubAgents / Agent Teams / MCP,动态工作流零配置

  2. Open-source, inside and out:框架 + Qwen 模型双开源,无厂商锁定

  3. Multi-protocol:OpenAI/Anthropic/Gemini/Qwen 四协议,本地 Ollama/vLLM,运行时切换

  4. Beyond the terminal:IDE 插件 / Desktop / Daemon / SDK / IM 机器人

二、与 Claude Code 的能力对照

2.1 对齐清单

官方声称"如果你会 Claude Code,你就已经会 Qwen Code——甚至更多"[1]:

| 能力 | Qwen Code | Claude Code | | --- | --- | --- | | SubAgents / Agent Teams / Dynamic Workflows | ✓ | ✓ | | Auto-Memory / Auto-Skills / Hooks | ✓ | ✓ | | 内置 Skills(/review /batch /loop /bugfix) | ✓ | ✓ | | MCP / Plan Mode / LSP 集成 | ✓ | ✓ | | Auto Mode / Sandbox / Git Worktrees | ✓ | ✓ | | Computer Use(桌面自动化) | ✓ | ✓ | | IDE 插件 / SDK / Headless | ✓ | ✓ | | 开源(模型+框架) | ✓ | — | | 多协议(OpenAI/Anthropic/Gemini/Qwen) | ✓ | — | | Agent Arena(多模型同任务对打) | ✓ | — | | Daemon Mode(qwen serve 多客户端) | ✓ | — | | IM 通道(Telegram/钉钉/微信/飞书) | ✓ | — |

2.2 独有卖点

多协议最性感:同一个 Agent 跑在 Claude/OpenAI/本地 Ollama 上都行——运行时切换 provider,告别模型锁定[1]。

三、代码架构深度剖析

基于官方 README 的包结构与能力描述[1]。

3.1 总体架构:monorepo

monorepo:packages/ 下 SDK(TS/Python/Java),CLI 核心独立包,IDE 插件分别维护——每个入口复用统一 Agent 内核[1]。

3.2 核心模块

  • Agent 循环:规划-执行-验证闭环做成了默认行为

  • 工具调用与 MCP:MCP 标准协议挂外部工具 + 内置 Shell/文件

  • 记忆与技能:Auto-Memory 跨会话记忆;Auto-Skills 自动发现复用;内置 /review /batch /loop /bugfix

  • 子智能体:SubAgents / Agent Teams 复杂任务并行拆解

3.3 多协议适配层

内核与协议解耦:Agent 逻辑(记忆/工具/规划)与"调用哪个模型"完全分离。模型只是"大脑提供方",框架提供全部能力——这是运行时切换 provider 的底层原因。

3.4 从 Gemini CLI 到独立框架

Qwen Code 承认源自 Gemini CLI v0.8.2,v0.1 起独立开发[1]。

开源的意义:fork 不是被锁住,而是获得积累后自由长出全新物种。Qwen Code 从"Gemini 衍生"长成"多协议多平台、深度集成通义的独立框架"。

四、性能实证:SWE-bench_Verified 77.8%

4.1 评测配置(官方透明公开)

| 配置项 | 值 | | --- | --- | | 数据集 | SWE-bench_Verified,500 例 | | 运行 | 每版本 3 trials,共 1500 jobs | | 模型 | Qwen 3.7 Max | | 上下文 | 1M(model_context_length=1,000,000) | | 迭代上限 | max_iterations=500 |

4.2 版本趋势

| 版本 | 平均分 | pass@1 | pass@3 | pass^3 | | --- | --- | --- | --- | --- | | 0.0.14 | 77.80% | 84.6% | 84.6% | 69.2% | | 0.5.0 | 76.60% | 83.0% | 83.0% | 68.4% | | 0.15.0 | 77.67% | 84.6% | 84.6% | 68.6% | | 0.22.0 | 77.33% | 84.4% | 84.4% | 68.0% |

4.3 如何正确看待

77.8% 是"模型 + 框架"组合拳——既测 Qwen 3.7 Max 代码能力,也测 Qwen Code 的 Agent 能力(真实 repo 里规划/改码/跑测试)。接近 80% 已进入第一梯队,开源方案在长周期工程上已能与闭源旗舰掰手腕[1]。

五、生态与热点:从 Qwen Code 看"开源 Agent 军备竞赛"

5.1 通义千问模型生态

Qwen Code 是通义生态一环:深度集成 Qwen 模型(Qwen 3.7 Max),打通阿里云 Model Studio,官方 bailian-cli 扩展图像/视频生成、知识检索、应用编排、模型部署[1]。

5.2 开源 Agent 格局

Qwen Code 补上"模型 + 框架双开源"这一极:别的开源 Agent 靠闭源模型驱动时,它连大脑都开源。

5.3 自举开发:"用自己造自己"

官方 README:"Qwen Code is actively iterating on itself——用它自己的 Agent 和模型提 issue、提交 PR、review 代码、跑测试"[1]。

用自己造自己,是开源项目最高级的自我证明:不是"我们相信它行",而是"我们每天都在用它"。

六、实战环节:安装、跑任务、多客户端

命令均来自官方 README[1]。Node 22+。

6.1 安装

# Linux / macOS
curl -fsSL https://qwen-code-assets.oss-cn-hangzhou.aliyuncs.com/installation/install-qwen-standalone.sh | bash

# Windows(PowerShell)
irm https://qwen-code-assets.oss-cn-hangzhou.aliyuncs.com/installation/install-qwen-standalone.ps1 | iex

# NPM(Node 22+)
npm install -g @qwen-code/qwen-code@latest

6.2 快速开始

qwen          # 交互式终端 UI
# 会话内 /auth 配置 provider 和 API key

多协议切换:运行时切换 provider——先 Qwen,再 Anthropic 或本地 Ollama,同一会话同一套 Agent 能力[1]。

6.3 Headless 实战:让 Qwen Code 修一个 bug

qwen -p "修复 src/todo.py 中删除已完成任务时可能抛 KeyError 的 bug,并运行 pytest 验证"

6.4 项目讲解:qwen serve 多客户端 / Agent Arena

qwen serve(Daemon):HTTP+SSE(ACP 协议)共享 Agent 会话,多客户端连同一个 Agent——团队共享长上下文工作空间[1]:

qwen serve

Agent Arena:让多个模型在同一任务上"头对头"对打,直观比较表现——模型选型神器,免搭评测框架[1]。

Python SDK 集成进工具链[1]:

import asyncio
from qwen_code_sdk import is_sdk_result_message, query

async def main():
    result = query(
        "Summarize the repository layout.",
        {"cwd": "/path/to/project", "path_to_qwen_executable": "qwen"},
    )
    async for message in result:
        if is_sdk_result_message(message):
            print(message["result"])

asyncio.run(main())

七、我的观点

7.1 三条判断

判断一:双开源是最锋利的武器。OpenClaw 开源平台、dsh 开源工具,但"模型 + 框架"双开源、且能驱动任意模型(含本地)的 Agent,Qwen Code 是标杆。"本地模型 + 开源框架"的组合第一次真正可行

判断二:77.8% 是组合拳,不是单点。同时验证了 Qwen 3.7 Max 代码能力和 Qwen Code 的 Agent 能力。但仍是官方 harness 下的数字——真实项目的稳定性、长会话漂移需自己实测。

判断三:从 Gemini CLI fork 到独立框架,是开源最动人的叙事。开源不是复制粘贴,而是"站在巨人肩膀上长出全新物种"。这正是"开源 Agent 军备竞赛"里最值得关注的一条线。

如果你在找"没有天花板"的编程 Agent——模型可换、本地可跑、框架开源——Qwen Code 值得今天装上试试。

参考资料

  • [1] 官方 README(raw.githubusercontent.com/QwenLM/qwen-code/main/README.md)(一级)2026

  • [2] 官方文档 qwenlm.github.io/qwen-code-docs(一级)2026

  • [3] 官方对比报告 codeagents improvement report(二级)

  • [4] 生态仓库:acpx(Qwen Code Claw)、modelstudioai/cli(二级)

  • [5] npm 包页 @qwen-code/qwen-code(一级)