首页
沸点
课程
APP
搜索历史
清空
创作者中心
写文章
发沸点
写笔记
写代码
草稿箱
创作灵感
查看更多
登录
注册
关注
综合
后端
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
排行榜
综合
后端
排行榜
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
全部
人工智能
Agent
AI编程
后端
前端
LLM
AIGC
OpenAI
Claude
展开
全部
人工智能
Agent
AI编程
后端
前端
LLM
AIGC
OpenAI
Claude
架构
算法
LangChain
JavaScript
开源
GitHub
暂无数据
推荐
最新
AI 核心技术解析|OPD:大模型开始复制的不再是知识,而是判断力
本文探讨了大模型技术从传统知识蒸馏(KD)向在线偏好蒸馏(OPD)的演进过程。传统KD仅能传递"答案是什么"的知识,而无法教授"哪个答案更好"的判断力。随着大模型知识储备趋同,对齐(Alignment
LLM 应用的 Eval 数据工程实践:Golden Set 构建、版本管理与生产 Trace 回放
测试数据腐烂比评估逻辑错误更危险。本文讲解如何从生产 Trace 构建 Golden Set,用 DVC 做版本控制,检测数据集漂移,并周期性回放生产流量填补覆盖盲区。
vLLM-05|MLA、Compressor、Indexer 与 SWA:Flash 注意力栈在 vLLM 里怎么落地
协议层把 prompt 编成 token ids 之后,计算进入 DeepseekV4ForCausalLM.forward。Flash 的注意力实现不是标准多头注意力(MHA)单路径:在 DeepS
【图】一图理解LLM、LangChain、RAG、AI Agent、MCP、token、context、prompt、tool概念
AI 核心概念全景大图:一张图看懂九大行话 如果你刚接触 AI,一定会被一堆名词砸得有点晕:token、prompt、RAG、Agent、MCP……它们各自听起来都很厉害,但彼此之间到底是什么关系?今
长命令运行时,Agent 怎样继续处理其他工作
设想 Agent 正在初始化一个前端项目。 它需要执行依赖安装,还要检查 package.json、阅读构建脚本、确认环境变量。依赖安装可能需要几分钟,读取配置文件只需要几毫秒,若所有工具调用都同步执
炮轰SDD:Spec驱动开发为何不适合绝大多数项目
好的上下文工程追求的是:当前任务需要什么事实,证据在哪里,哪些结论仍可撤销,什么时候应该忘掉。好的传统工程产出物追求的是:谁拥有它,服务什么决策,如何验证,何时失效。SDD 如果不能回答这些问题,就只
RAG 全链路调优指南:从 Chunking 到 Reranker
从一次沉默的失败开始。 你的 RAG 系统上线了,用户问了一个你确定知识库里有答案的问题。系统返回了一段流畅的没有错误的回答,但仔细看,答案并不正确。它引用了正确的文档片段,但忽略了文档里最关键的一句
DeepResearchSystem 0x03:HITL
这一章主要为 DeepRearchSystem 增加 HITL 功能,让人来在 Agent 运行过程中参与进来。进而使 Agent 行为更可控,最终得到更符合人类意图。
GAIA、Cosmos、Genie 等视频模型纷纷自称"世界模型",为什么说视觉逼真度不构成决策证据?
从视频模型到决策世界模型:进入 Agent 与机器人闭环前的证据门槛 TL;DR 场景:视频模型能生成逼真、连贯、可控的画面,但要把它放进 Agent / 自动驾驶 / 机器人决策闭环并称为"可用于决
LangChain学习背景
LangChain是LLM应用复杂之后的一套工程化框架;当LLM逐渐开始应用的发现:LLM应用不是一次API调用,而是一条由模型、prompt、工具、数据、记忆、流程控制、观测评估组成的链路
1M Context 也会失忆:Coding Agent 为什么需要 Context Ledger
1M Context 也会失忆:Coding Agent 为什么需要 Context Ledger TL;DR 场景:1M Context 解决容量上限,却不能自动保证 compact 后约束不丢、仓
拆解海博 AI-Native 落地保障:Harness、双 Loop、知识库与技能自主迭代实践
当下 AI 编程助手已成研发标配,但多数团队仅用对话式外挂 AI,靠人适配模型,存在行为不可控、流程不固定、规范难统一、知识难沉淀等问题,产出不稳、返工多,难以规模化。 AI Native 研发则让流
推荐系统体验的数字化突破:得物自动化评测平台的技术实践|AICon 文章整理
「得物推荐 AI Harness 工程化实践系列」的末篇内容,本系列共三篇连载。本篇(末篇)详解得物推荐评测平台的完整技术体系:从主观体验量化到大模型自动化评测流水线,涵盖多维度指标设计、人机协作提示
Video VAE 不是末端编解码器:5 维-潜网格-主模型 Token 的“表示合同“
Video VAE 不是末端编解码器:它如何定义视频模型的系统边界 TL;DR 场景:在潜空间视频生成系统里,Video VAE 决定时空网格、信息损失、Token 数量和流式语义,但常被误当成末端解
今天我们讲讲大模型的“核心”技术:蒸馏(Model Distillation)
文章摘要: 大模型蒸馏技术已成为AI公司的核心竞争力之一。随着模型参数规模指数级增长,推理成本、部署难度等问题日益突出,蒸馏能够在几乎不损失能力的前提下,将大模型能力迁移到更小、更高效的模型上。几乎所
大模型界的“高考状元”可信吗?一文带你读懂Benchmark的潜规则 📚🤖
新模型天天号称“榜单第一”,Benchmark分数到底可信吗?MMLU、GPQA、HumanEval分别考什么?厂商的数字游戏有哪些套路?一文读懂大模型“高考”的潜规则。
还在追顶配模型?GPT 5.6 已经把玩法彻底改了
本来我只是随便刷个更新热闹,结果越看越觉得有意思,索性顺着自己之前踩过的坑,把这点思考整理出来。 三个挡位的模型,本质是让你别再 “杀鸡用牛刀” 这次 GPT 5.6 直接拆成了 Sol、Terra、
从"AI写代码我喝咖啡"到 Harness Engineering:Vibe Coding 不翻车的工程化生存指南
🎢 从"AI写代码我喝咖啡"到 Harness Engineering:Vibe Coding 不翻车的工程化生存指南 一、那个"甜蜜陷阱":为什么 Vibe Coding 项目总是"先甜后苦"? 想
七月,一个德国开发者在评论区甩了个链接
AI agent 在长会话里会"漂移"。你说过的规则它忘了,约定的检查它跳过,输出的文件它说写了其实没有。这不是某一个模型的问题。
别再被跑分骗了:大模型 Benchmark 到底在考什么?
Benchmark 到底是个啥? 先掰扯最基础的:benchmark 本质上就是一套标准化的考试题。 给所有大模型做同一套题,统一打分规则,最后出来一个多维度的分数集合。就像我们上学时的全省统考,大家