稀土掘金 稀土掘金
    • 首页
    • 沸点
    • 课程
    • APP
      • 搜索历史 清空
        • 写文章
        • 发沸点
        • 写笔记
        • 写代码
        • 草稿箱
        创作灵感 查看更多
排行榜
综合
后端
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
综合
后端
排行榜
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
  • 全部
  • 人工智能
  • AI编程
  • Agent
  • 后端
  • 前端
  • LLM
  • AIGC
  • OpenAI
  • Claude
  • 展开
  • 全部
  • 人工智能
  • AI编程
  • Agent
  • 后端
  • 前端
  • LLM
  • AIGC
  • OpenAI
  • Claude
  • 架构
  • LangChain
  • 算法
  • JavaScript
  • 开源
  • GitHub
  • 暂无数据
    • 推荐
    • 最新
  • PagedAttention 与 Continuous Batching
    vLLM 两项关键升级:Continuous Batching 吃满 GPU,PagedAttention 治内存碎片。从系统角度拆解实现。
    • ltl
    • 25
    • 点赞
    LLM
  • VLA 落地先签动作合同:从视觉语言输入到可执行控制指令
    VLA 落地先签动作合同:从视觉语言输入到可执行控制指令 摘要 VLA 能输出动作,不代表它已经能接到真实机器人。输入必须带时间和版本,动作必须声明坐标、单位、范围、频率、归一化与有效期,执行层还要核
    • 武子康
    • 37
    • 1
    人工智能 Agent LLM
    VLA 落地先签动作合同:从视觉语言输入到可执行控制指令
  • 用 Prompt 做 NLP 任务开发:几分钟构建一个推理系统
    仅用几分钟,我们就可以构建多个用于对文本进行**推理**的系统,而以前这需要熟练的机器学习人员数天到数周的时间。这就是 Prompt 工程带来的效率革命。
    • 溴化钾
    • 19
    • 点赞
    NLP LLM
  • LLM Streaming 背压工程实践:慢客户端、断流重连与服务端缓冲区的生产设计
    生产 LLM 应用中 SSE streaming 的背压问题全解析:慢客户端缓冲区管理、客户端断开 abort 上游、Nginx proxy_buffering 配置、断流重连与 last-event-id 机制,附完整 TypeScript 代码与监控 checklist。
    • AINative软件工程
    • 34
    • 点赞
    LLM Node.js
    LLM Streaming 背压工程实践:慢客户端、断流重连与服务端缓冲区的生产设计
  • 在 DigitalOcean 如何提示词缓存:降低 AI 推理成本与延迟
    在调用大模型 API 时,很多成本其实花在了“重复阅读”上。 例如,一个企业知识库应用可能会在每次请求中重复发送相同的系统提示词、工具定义和业务规则;一个 Coding Agent 也会不断把项目说明
    • DigitalOcean
    • 39
    • 点赞
    Agent LLM
  • LLM 应用的依赖注入工程实践:解耦 Client、Prompt 和 Tool Registry,让 AI 系统真正可测试可替换
    --- 传统 Web 应用的依赖注入(DI)已经是标配——Spring、NestJS、FastAPI 都内置 DI 容器。但 LLM 应用开发者往往从"快速原型"出发,把大模型 SDK 的调用直接写进业务逻辑,或者把 prompt 字符串硬编码在函数里。几个月后,这些决定会让你付出代价:
    • AINative软件工程
    • 25
    • 点赞
    LLM 前端工程化 后端
    LLM 应用的依赖注入工程实践:解耦 Client、Prompt 和 Tool Registry,让 AI 系统真正可测试可替换
  • SWE-1.7 的提升究竟来自哪里?接受大量强化学习后训练的 Kimi K2.7 为起点,继续进行大规模 RL
    SWE-1.7 的提升究竟来自哪里? TL;DR 场景:Agent 模型从 A 换成 B 任务成功率上升时,团队常把增益直接记到新模型权重;SWE-1.7 是少有的"训练在 Devin Harness
    • 武子康
    • 36
    • 1
    人工智能 Agent LLM
    SWE-1.7 的提升究竟来自哪里?接受大量强化学习后训练的 Kimi K2.7 为起点,继续进行大规模 RL
  • 开放权重不是唯一控制权:Kimi K3、Tencent Hy3 与 ByteDance Seed 的九项交付比较
    开放权重不是唯一控制权:Kimi K3、Tencent Hy3 与 ByteDance Seed 的九项交付比较 企业评估模型时,最容易问错的一个问题是:它到底开放还是闭源? 这个二分法对软件许可证有
    • 武子康
    • 148
    • 4
    人工智能 LLM Agent
    开放权重不是唯一控制权:Kimi K3、Tencent Hy3 与 ByteDance Seed 的九项交付比较
  • kimi-code 深度掌握系列文章-工具系统:从注册到执行(六)
    1. 工具系统概述 ToolManager 是 Agent 与外部世界交互的桥梁。它位于 packages/agent-core/src/agent/tool/,是 Agent 类的核心成员之一。在一
    • Neil_Carmack
    • 40
    • 点赞
    Agent LLM
  • kimi-code 深度掌握系列文章-对话循环TurnFlow(五)
    如果 Agent 类是一个乐团的指挥,那么 TurnFlow 就是指挥挥动的手臂 — 它负责将乐谱上的每个音符变为实际的演奏。从用户按下回车那一刻起,到 Agent 吐出最后一个字,TurnFlow
    • Neil_Carmack
    • 53
    • 点赞
    Agent LLM
  • Hermes Agent Token 机制深度解析
    从一个简单的问题出发,逐层深入 Hermes Agent 的源码,完整拆解 LLM Agent 框架如何管理 token 预算、上下文窗口、自动压缩、图片处理与 API 请求构建的全流程。
    • 罗高
    • 51
    • 点赞
    Agent LLM
  • DeepSeek V4-Flash 正式版深度解读:一行 changelog 里的暗涌与野心
    为什么这次发布值得你放下手头的事?(Why) 2026 年 7 月 31 日下午,DeepSeek 的 API 更新日志里多了一行字:「DeepSeek-V4-Flash 正式版 API 上线公测」。
    • 土豆1250
    • 1.0k
    • 4
    人工智能 LLM
  • 一个超级简单的 coding agent,100 行就可以做任何事
    0. 项目是什么 bun-bot 是一个自我认知为 Bun.js 运行时的 coding agent。它只有大约 100 行有效代码(index.ts 去掉注释和空行约 162 行,核心逻辑约百行),
    • Bolt
    • 78
    • 点赞
    Agent Bun LLM
  • Skill-α:教 Agent 学会自己'改说明书'
    🎯 导语:做 Agent 的,都被 skill 折磨过吧 先问一个可能戳到你的问题:你给 agent 配的那份 skill(或者叫工具说明、操作手册、SOP,叫啥都行),你真的确定它"有用"吗? 我猜
    • lucas_AI
    • 60
    • 点赞
    Agent LLM
    Skill-α:教 Agent 学会自己'改说明书'
  • Knowledge Studio 本地开源版:对标百炼 RAG 控制台的架构、重难点与差异
    Knowledge Studio 本地开源版:对标百炼 RAG 控制台的架构、重难点与差异 阿里云百炼把 Knowledge Studio 做成了企业级「知识管理 → 知识检索 → 知识问答」闭环。用
    • 牧艺
    • 34
    • 点赞
    Agent LLM Next.js
    Knowledge Studio 本地开源版:对标百炼 RAG 控制台的架构、重难点与差异
  • LLM 多租户 Quota 工程实践:Token 配额、用量预警与自动熔断的生产设计
    从大客户 CTO 发怒邮件说起:Provider rate limit 不等于 Tenant Quota,本文设计多租户 Token 配额系统,涵盖两阶段计数、三层配额架构、分级告警熔断与软降级策略,附完整 Redis 实现代码与 5 个生产踩坑。
    • AINative软件工程
    • 73
    • 点赞
    AI编程 LLM 后端
    LLM 多租户 Quota 工程实践:Token 配额、用量预警与自动熔断的生产设计
  • MiniMax H3 的多模态参考为什么比 2K 更重要?
    MiniMax H3 的多模态参考为什么比 2K 更重要 视频模型发布时,最容易传播的数字通常是分辨率和时长。MiniMax H3 支持最长 15 秒、最高 2K,自然会被概括成“更长、更清晰的视频模
    • 武子康
    • 98
    • 2
    人工智能 LLM Agent
    MiniMax H3 的多模态参考为什么比 2K 更重要?
  • 七月,一个德国开发者在评论区甩了个链接
    AI agent 在长会话里会"漂移"。你说过的规则它忘了,约定的检查它跳过,输出的文件它说写了其实没有。这不是某一个模型的问题。
    • YuhaoLin2005
    • 2.9k
    • 19
    架构 LLM
  • 2026 年 7 月 AI 模型发布复盘:真正被比较的是整套工作系统
    2026 年 7 月 AI 模型发布复盘:真正被比较的是整套工作系统 TL;DR 场景:按官方发布页、模型卡和平台文档去重,并区分首次发布 / 正式 GA / 产品内可用 / API 可用 / 开放权
    • 武子康
    • 190
    • 2
    人工智能 LLM Agent
    2026 年 7 月 AI 模型发布复盘:真正被比较的是整套工作系统
  • 从 0 到 1:Milvus + 大模型打造私人记忆知识库
    从一个笨想法开始 最开始我想的很简单:日记存在 MySQL 里,不就完了? 标题、内容、日期、心情标签,全是结构化的,CRUD 一把梭。然后用户问 "我最近做了什么让我感到快乐的事情",我就…… 我就
    • To_OC
    • 162
    • 18
    人工智能 Node.js LLM
    从 0 到 1:Milvus + 大模型打造私人记忆知识库
  • 晚上好!
    点亮在社区的每一天
    • 用户协议
    • 营业执照
    • 隐私政策
    • 关于我们
    • 使用指南
    • 友情链接
    • 更多人工智能文章
    • 举报邮箱: juejin@bytedance.com
    • 座机电话: 010-83434395
    • 京ICP备18012699号-3
    • 京ICP证:京B2-20191272
    • police 京公网安备11010802026719号
    • ©2026 稀土掘金