做 Agent 应用的应该都有同感:模型不贵,上下文贵。小米刚公布的 MiMo-V3 核心架构 HySparse2 就是冲着这个来的,100 万 Token 下预填充算力砍 5 倍,KV 缓存从 12GB 压到 2.7GB,思路是把模型切成前后两段,后半段的 KV 全部复用前半段的计算结果。Agent 应用能不能跑通商业模式,拼的就是这种成本结构。这类模型和工具动态我一般在 ai345 上追,中文 AI 资讯更新挺快。
展开
评论