TL;DR — 2026年6月底,DeepSeek同时放出两个技术信号:V4正式版7月中旬上线,引入峰谷定价机制,非高峰API成本降至高峰的1/2;所有部门扩招至少一倍,新增Agent Harness和Agent Infra两大技术方向。本文整理了DSpark推理加速框架的设计思路、峰谷定价背后的算力调度逻辑、Agent Harness(Model+Harness=Agent范式)的架构分层,以及Agent Infra在千万级并发沙箱方向的技术挑战。个人认为Agent工程领域接下来值得重点关注的三个方向:KV Cache管理、Tool Use编排和MCP协议。
一、峰谷定价:算力资源调度的一种工程解法
6月29日,多位开发者确认收到DeepSeek升级通知——V4正式版计划7月中旬上线,同步引入峰谷定价机制:
| 时段 | 价格倍率 |
|---|---|
| 高峰 (9:00-12:00, 14:00-18:00) | 2x |
| 非高峰 (其余时段+周末) | 1x |
| V4-Pro旗舰版:总参1.6万亿、激活参数490亿;V4-Flash轻量版:总参2840亿、激活参数130亿。两者均支持100万token上下文窗口,MIT开源协议。 |
从工程角度看,峰谷定价本质上是一套资源调度策略。DeepSeek当前月活超过1.27亿,白天工作时段算力集群负载接近红线,夜间和周末却有大量算力闲置。通过价格杠杆引导任务调度,比纯粹的硬件层负载均衡更灵活——开发者可以自主决定哪些任务值得在高峰执行,哪些可以延后。
一个简单的调度判断逻辑,用于批处理任务的成本优化
import datetime
def should_execute_now():
now = datetime.datetime.now()
is_peak = (
(now.hour >= 9 and now.hour < 12) or
(now.hour >= 14 and now.hour < 18)
) and now.weekday() < 5
return not is_peak
技术选型上的一些记录:高峰简单任务优先走V4-Flash(高峰输出4元 vs Pro的12元/百万Token);缓存命中场景下,Pro的缓存命中价高峰仅0.05元/百万Token,在设计API调用链路时值得把缓存命中率纳入架构考量。如果峰谷价差进一步拉大,豆包Seed 2.0 Pro(输入3.2元/百万Token)和通义Qwen3.7(输入2.5元/百万Token)在高峰时段可能成为备选方案。
二、DSpark推理加速框架
DeepSeek联合北京大学发布了推理加速框架DSpark,梁文锋本人署名。实测加速数据:
| 模型 | 生成速度提升 |
|---|---|
| V4-Pro | 57%-78% |
| V4-Flash | 60%-85% |
DSpark的核心思路(具体架构待论文正式发布):通过对自注意力机制的稀疏化优化和KV Cache的智能预取策略,在不牺牲生成质量的前提下显著降低推理延迟。
此前V4已在6月1日将API价格永久降至原定价的四分之一。结合DSpark的加速效果,单位推理成本进一步下探。峰谷定价的引入,本质上是在技术降本的基础上,通过价格策略做负载再分配——对开发者来说,理解这套机制有助于在工程层面做更精细的成本控制。
三、Agent Harness架构:整理的一些笔记
同日,DeepSeek官方公众号宣布所有部门规模扩大至少一倍。Boss直聘上挂出121个岗位,覆盖全栈开发、AI核心系统、Agent Harness等8大类。我特别关注了其中两个新设岗位的JD,它们清晰地勾勒出了当前Agent工程的技术天花板。
Agent Harness
核心范式很简单:Model + Harness = Agent。
但Harness远不止是Prompt Engineering的另一种叫法。从JD描述来看,它是一个完整的技术中间层,覆盖以下模块:
- 上下文管理:KV Cache策略、长上下文裁剪与压缩算法
- 长期记忆:向量存储方案选型、会话状态持久化与回放
- 工具调用编排:Tool Use链式调用、错误回退与自动重试
- 子Agent协调:多Agent间通信协议设计、任务分解与结果聚合
- 规划与自进化:任务规划图生成、执行路径在线优化
三个子方向(研究/工程/产品)完整覆盖了当前Agent技术栈的核心概念:KV Cache、Agent Loop、MCP、Prompt Engineering、Context Engineering。
Agent Infra
为Agent定制的云基础设施(内部代号DSec)。核心挑战非常明确:千万级并发沙箱。每个Agent在执行任务时都可能需要执行代码、读写文件、访问网络——这就要求沙箱毫秒级启动、严格资源隔离、且支持大规模并行。这个方向的技术难度不亚于操作系统内核开发。
整理完这些信息后我个人的理解是:Agent不是大模型的"上层应用",而是将推理能力转化为可执行任务的必要中间层。如果把大模型比作CPU,Agent Harness就是操作系统——管理资源、调度任务、暴露接口。不能把推理能力有效转化为Agent产品的大模型公司,在API收入层面可能面临结构性劣势。
四、GEO到Agent可调用性:一个值得关注的技术演进
最近在跟进生成引擎优化(GEO)的技术趋势。一个越来越清晰的方向是:GEO的焦点正在从"内容被AI搜索时引用"转向"被Agent主动调用"。当Agent执行用户任务时,"引用"不再是搜索结果页的一段摘要——而是Agent主动调用API、读取结构化数据、使用工具链完成指令。
从技术实现角度,三个基础设施值得关注:
- llms.txt:参考llmstxt.org规范,在站点根目录提供结构化内容索引,供AI爬虫获取站点地图级别的导航信息
- JSON-LD Schema:通过FAQPage、Organization等结构化标记,为AI引擎提供可解析的事实数据
- MCP Server:将高频查询或操作封装为MCP协议接口,Agent可直接通过标准协议调用
这三者本质上构成AI时代的"可被机器理解"基础设施层。技术上不复杂,但工程上需要持续维护和迭代。Agent生态的接入规则仍在形成期,早做技术储备的意义在于有机会参与标准方向的定义。
本文信息整理于2026年6月。DeepSeek V4正式版具体上线日期以官方公告为准。数据来源:DeepSeek官方通知、Boss直聘公开岗位信息、DSpark论文预告。