螺旋上升:计算机发展八十年

2 阅读1小时+

一部以“核心突破—奠基逻辑”为主线的技术演化史

计算机这八十年,本质上是一条 “硬件换器件 → 系统做抽象 → 应用扩场景 → 新瓶颈反推硬件” 的螺旋。每一次真正的跃迁,都不是简单地“把东西做快一点”,而是换了一个成本结构:把上一代最贵、最稀缺、最难扩展的那一环,用新的器件或新的抽象藏起来,从而让下一代应用得以生长。而每一次跃迁留下的新瓶颈,又会反推下一轮硬件与系统的重构。

这本书要讲的,就是这条螺旋的来路与去处。


关于这本书:如何阅读

这不是一部按年份平铺直叙的编年史,而是一部因果史。全书沿着八个决定性的“转折点”推进,每一个转折点都试图回答三个层层递进的问题:

  • 突破是什么(What):这一代究竟引入了什么新的器件、新的组织方式或新的抽象,它和上一代的分野在哪里。
  • 它带来了什么(What it unlocked):因为这个突破,哪些原本“做不到”或“贵到没人用得起”的事情,突然变得可行、变得廉价、变得可以规模化。
  • 它为后来奠定了什么(What it set up):这一代把系统推进到哪一层,同时又留下了什么新的瓶颈——而这个瓶颈,正是下一章登场的理由。

把这三问串起来,就能看到一条清晰的因果链:电子管的不可靠催生了晶体管,晶体管的“定制之贵”催生了集成电路与兼容性,昂贵的机房催生了微处理器与个人电脑,孤立的个人电脑催生了网络与服务,单台服务器的浪费催生了虚拟化与云,CPU 的通用算力天花板催生了 GPU 与大模型,人工写程序的瓶颈催生了端侧 AI 与 Agent——而大模型的能耗、数据与信任瓶颈,正在反推后摩尔时代的下一轮器件革命。

每一章的结尾都有一张 “核心突破 / 解锁了什么 / 奠定了什么” 的三栏表,方便你随时抓住承前启后的枢纽;全书末尾配有八里程碑总表、一条贯通式编年史和一份术语速查。你可以从第一章顺序读到尾,体会因果的层层咬合;也可以直接翻到某一张表,快速定位某一世代的历史位置。

一个提醒:书中所有关键数字(器件数量、功耗、价格、参数规模、带宽等)都取自业界公开史料,个别数据在不同来源略有出入,已在表述中尽量标注为“约 / 量级”。历史细节偶有争议,但因果主线是确定的——请把它当作理解“计算机为什么会长成今天这个样子”的骨架,而不是一句一锤定音的教科书定义。


序论:一条螺旋,四股力量,一个总规律

一、为什么是“螺旋”,而不是“直线”

如果只用一句话概括八十年,最常见的说法是“计算机越来越快、越来越小、越来越便宜”。这话没错,但它掩盖了真正重要的东西。速度、体积、价格只是表象,底层驱动力是“成本结构”的一次次迁移。

摩尔定律常被当作“性能每 18—24 个月翻一倍”的引擎盖标语,但它更深刻的含义是:当某一个成本要素(晶体管单价)以可预期的速度塌陷时,整个工程界就有动力把“原本不划算”的事情重新算一遍账。 于是过去只能军方用的实时弹道解算,变成了商用的事务处理;过去只能在机房跑的图形,变成了桌面上的游戏;过去只有 Google 养得起的搜索索引,变成了任何一个团队调用的 API;过去只有顶级实验室能训练的模型,变成了端侧手机上的助手。

但每一次“成本塌陷”都会把瓶颈往别处推。晶体管便宜了,于是瓶颈从“造不出足够多的门”变成“软件写不过来”;于是抽象登场,用编译器、操作系统、库来摊薄人力。软件便宜了,于是瓶颈从“算不动”变成“连不上”,网络登场。连接便宜了,瓶颈从“买不起机器”变成“机器闲置浪费”,虚拟化与云登场。算力便宜了,瓶颈从“跑不起模型”变成“人写不出这么多程序、也管不住这么多概率输出”,于是 AI 与 Agent 登场。每一代都在把上一代最贵的那件事藏起来,同时暴露出新的、更贵的那件事。 这就是螺旋。

二、贯穿全书的四股力量

八十年看似庞杂,其实是四股力量在相互咬合、彼此牵引。把它们当作贯穿全书的四条“经线”,每一个转折点都是它们的一次重新组合。

第一股是“器件(Device)”——计算被物理实现的方式。 从电子管、晶体管、集成电路、微处理器,到今天 CPU/GPU/NPU/TPU 的异构并存,再到未来的 chiplet、存算一体、硅光、神经形态与量子。器件决定了“单位能量和单位面积能换来多少次逻辑操作”,是整条螺旋的物理地板。

第二股是“抽象(Abstraction)”——人如何与计算打交道的方式。 从接线板和穿孔卡片,到机器码、汇编、高级语言、操作系统、编译器、库、API、框架、容器、声明式基础设施,一直到今天的自然语言意图。抽象的目的是把底层细节“藏起来”,让上层的人不必再关心它,从而把稀缺的智力从繁琐中解放出来。软件层每一次抽象升级,本质上都是在“降低某一类人的心智负担”。

第三股是“组织(Organization)”——计算如何被切分、共享和调度。 从一台独占的整机,到批处理、分时、多任务,到多处理器、集群、虚拟化、容器编排,到万卡训练集群的分布式调度。组织方式决定了同一批器件能被多少人、多少任务、以多大并发共同享用,是规模化的关键。

第四股是“场景(Use Case)”——计算被用来解决什么问题的疆域。 从弹道、密码、科学计算,到事务处理、办公、游戏、通信、搜索、社交、流媒体,到今天的生成内容、辅助决策与自主智能体。场景既被前三股力量解锁,又反过来提出前三股力量必须回应的新需求与新瓶颈。

器件换掉了物理的地板,抽象降低了人的负担,组织放大了共享的规模,场景界定了价值的疆域——四股力量每一次同步跳一档,就形成一个转折点。

三、一个总规律

全书反复验证的规律,可以压缩成一句话:

每一代革命,不是单纯让机器“更快”,而是把上一代最贵的那件事“藏起来”;而它藏不住、又新暴露出来的那一件事,就成为下一代的主战场。

机器码贵,于是出汇编;汇编贵,于是出高级语言;单机孤立贵,于是出网络;每台服务器各自养一套贵,于是出云;人工调参、人工写代码贵,于是出 AI 训练与自动编程;模型部署、推理成本贵,于是出自动编译与端侧加速。

沿着这条规律往前看,下一阶段最贵的,不再是“算力”,而是数据、能耗、信任、以及意图对齐这四件事。理解了这一点,你就理解了为什么未来的技术——机密计算、形式化验证、模型水印、评测驱动的工程、异构调度、存算一体、光互联——会围绕它们打转。螺旋还在上升,只是最贵的那件事,从“物理”悄悄挪到了“信息”与“信任”。


第一章 · 从电子管到晶体管:把“能算”变成“可靠地算”

1.1 起点:一台会烧管子的巨兽

现代计算机的故事,通常从 1946 年 2 月宾夕法尼亚大学公布的 ENIAC(电子数字积分计算机) 讲起。它不是一台“更快的算盘”,而是人类第一次用纯电子的方式,把逻辑与算术跑得比任何机械装置都快。

ENIAC 的规格至今仍带着一种近乎神话的色彩:约 1.8 万个电子管(真空三极管)、约 7200 个晶体二极管、上千个继电器与开关,整机重约 30 吨,占地一百多平方米,功耗约 150 千瓦——据说不敢和居民用电走同一条线,一开机附近的灯都会变暗。它能做每秒约 5000 次加法、约 357 次乘法,比当时任何机电设备快上千倍。它的任务很“硬核”:为美国陆军计算火控弹道表,也参与过早期氢弹的可行性运算。

但真正值得注意的,不是这些数字,而是 ENIAC 暴露出的那个结构性缺陷——它没有我们今天意义上的“程序”。它的“编程”,是靠重新拧开关、插拔缆线、设置成千上万个拨动开关来完成的:为了算一道新题,几位女操作员(Kay McNulty、Betty Snyder 等,最早的“程序员”其实是她们)要花几天甚至几周去接线和配置。计算是电子的、飞快的;而“告诉计算机要算什么”这件事,却是物理的、缓慢的、易错的。速度革命在算的一侧,瓶颈却卡在了“可编程”的一侧。

而更致命的,是电子管本身。ENIAC 的两万只管子,平均每 1—2 天就要烧掉一只。电子管像一个微型白炽灯泡:靠加热灯丝发射电子来导通,天生怕过热、寿命短、体积大、发热惊人。维护一台 ENIAC,意味着一支专门的检修队随时巡线,一发现暗掉的灯泡就冲上去替换。可靠性,是这个第一代电子计算机最贵、最脆弱的命门。

1.2 两条并行的思想线:存储程序与二值逻辑

真正让计算机从“一台会算的机器”升维为“一台通用的机器”的,是两条几乎同时浮现的思想。

第一条是 “存储程序”(Stored-program) 概念。以 冯·诺依曼(John von Neumann) 为核心、并结合 J. Presper Eckert 与 John Mauchly(ENIAC 的设计者)等人工作的 EDVAC 报告(1945) 提出:既然数据和指令都可以表示成数字,那就把程序也放进存储器里,让计算机能够像处理数据一样处理指令——包括修改自己的执行序列。这一想法的落地,使“编程”从插缆线变成“改存储器里的内容”,是从 ENIAC 到现代计算机最关键的一跃。今天我们把“CPU + 存储程序 + 顺序执行 + 统一内存存数据与指令”这一范式称为冯·诺依曼架构,它统治了此后八十年的绝大多数计算机。

第二条是 “用二值逻辑实现通用计算” 的数学根基。早在电子管时代之前,乔治·布尔的布尔代数就把“逻辑推理”变成了“符号运算”;1938 年,贝尔实验室的 克劳德·香农 在硕士论文里证明:开关电路可以一一对应布尔逻辑——开关闭合是 1,断开是 0,于是逻辑与、或、非可以用物理开关实现。再往前,阿兰·图灵(1936) 的“图灵机”和 阿隆佐·邱灵 的 λ 演算,从数学上划定了“可计算”的边界。这三条线合起来给出一个惊人的结论:只要能用电子开关实现二值逻辑,一台足够快的机器原则上就能执行任何可计算的算法。 电子管,就是第一批够快的“电子开关”。

1.3 早期商用与科学计算:把实验室搬进机构

ENIAC 之后,第一代电子管计算机迅速从军用走向科研与部分商业。

1951 年问世的 UNIVAC I 是美国第一台商用计算机,由 Eckert–Mauchly 公司制造。它最有名的一幕,是 1952 年为 CBS 电视台成功预测了美国总统大选结果——这是计算机第一次以“能预测现实”的姿态进入公众视野。同年,英国的 Ferranti Mark 1、IBM 的早期机型也相继投入运行。IBM 则在 1953 年推出 701、1950 年代中期推出 704 / 709 系列,把科学计算带入了建制化的时代。

在这个阶段,出现了两类奠基性的软件雏形。一是 汇编器:1940 年代末到 1950 年代初,A-0 系统(1952)、以及后来的 IBM 汇编程序,第一次让程序员用助记符(ADD、MOV)而非 0/1 或接线来表达指令,把“编程成本”从拧螺丝挪到了写文本。二是最早的“库”与自动编程思想:Grace Hopper(“编译器之母”、COBOL 之父) 提出了用接近自然语言的语句写程序、再由程序翻译成机器指令的设想,为几年后的 FORTRAN、COBOL 铺路。

这一代计算机的形态,可以概括为 “一次一人”(one-at-a-time):一台巨大的机器前,排队等着上机的是一群科学家与穿孔卡片。“计算”是一种需要预约的稀缺资源,而不是一种随时可得的能力。 记住这个画面——后面整整一部历史,都是在这个画面上,把“稀缺”一点点稀释成“普惠”。

1.4 转折:晶体管登场,物理层的第一次换代

真正把这条螺旋推向下一档的,是 1947 年冬天贝尔实验室的一间实验室。William Shockley、John Bardeen、Walter Brattain 研制出了第一只能工作的点接触晶体管,用一个锗片、金箔触点和精巧的偏置,实现了对电流的放大与开关。三年后的 1951 年,贝尔实验室公开宣布晶体管的发明;1956 年,三人因此获诺贝尔物理学奖。

晶体管的革命性,不在于它当时比电子管“快”多少——早期晶体管其实并不快,也不算便宜——而在于它从物理原理上改变了导通方式:电子管靠加热灯丝“烧”出电子(热阴极),天生高温、易损、耗电;晶体管靠半导体里载流子的运动来开关,冷工作、无灯丝、体积小、功耗低、寿命长。香农证明的“开关=逻辑”这条线,终于有了一种既可靠又紧凑的物理载体。

于是那台“会烧管子”的巨兽的时代,被一种“常年可以开着”的机器取代了。可靠性这个 ENIAC 最贵的命门,被一次器件换代藏了起来。

1.5 从实验室到产品线:第一波晶体管计算机

晶体管走向实用,靠的不只是发明本身,还有材料工艺的接力。1950 年代,贝尔实验室做出结型晶体管;1959 年,Jean Hoerni 发明平面工艺,为后来整个集成电路工业打下制造基础;Kilby 与 Noyce 的故事在下一章——但请注意,晶体管的“平面化”正是集成电路得以被“画”出来的工艺前提。

第一批全晶体管计算机带有鲜明的时代印记:

  • 1953 年,曼彻斯特大学的 实验性晶体管计算机 是世界上最早运行的晶体管计算机之一,规模很小,却是概念验证。
  • 1955 年,TRADIC(贝尔实验室,用于美国空军)成为第一台投入实际部署的晶体管计算机,装了近 700 只晶体管和 1 万只能流二极管,功耗与体积相较电子管巨降,被送去测试军用环境下的可靠性。
  • 1956—1960 年间,商用晶体管机扎堆出现:IBM 7090(1960,科学计算主力,帮 NASA 做了大量轨道计算)、1401(1959,中端商用、销量惊人)、DEC 的早期机型等。日本、欧洲也相继推出晶体管机。第三代计算机(业界以器件划代:电子管为第一代、晶体管为第二代、集成电路为第三代)的轮廓由此成形。

这一波的意义,是把计算机从“必须专人看护的实验装置”变成“可以常年运行、可以批量出厂的工业产品”。工厂开始像造机床一样造计算机,机房可以 24 小时运转而不必每小时换灯泡。计算机第一次具备了规模化生产与规模化使用的物理前提。

1.6 承前启后:这一章改变了什么,又留下了什么

值得强调的是:晶体管革命并没有改变计算范式本身。冯·诺依曼的存储程序结构、二值逻辑、顺序执行——这些在电子管时代确立的骨架,晶体管原封不动地继承了下来。这一代的突破在“物理实现层”,而不在“组织抽象层”。 它把“算得动”升级成“能常年开机、能批量制造”,为下一章的两个大件——集成电路与 System/360——铺好了地面:只有当单个器件便宜、可靠、可以大量焊接时,“把很多晶体管做在一片硅上”和“把整机做成一条产品线”才在经济上成立。

但晶体管把瓶颈往两个方向推了出去,成了下一章登场的原因:

其一,“定制之贵”。 每一台晶体管计算机,仍然是为一类任务、一套指令、一群客户手工设计和配线制造的。IBM 卖一台机器,用户就得为这台机器写软件、买外设、养操作员;换一台别的型号,一切推倒重来。硬件的可靠性上来了,但“生态的复用性”极差——计算机仍是“项目制的定制品”,而不是“系列化的标准品”。

其二,“焊接与走线之繁”。 一台机器由分立的晶体管、二极管、电阻、电容焊成一整块一整块的逻辑板,接线与焊接本身成了新的成本和良率瓶颈。当晶体管数量继续上升,人工焊接越来越成为规模的上限——这正是促使 Kilby 与 Noyce 把整个电路“做进一块材料”的那份焦虑。

于是历史把接力棒交给了集成电路(解决分立元件的组装之贵)和统一指令集的 System/360(解决生态定制的复用之贵)。

维度电子管时代(约 1946—1954)晶体管时代(约 1955—1963)
核心突破用电子开关实现高速二值逻辑;确立“存储程序”范式用半导体开关替代热阴极电子管,实现冷工作、长寿命、低功耗
解锁了什么第一次“算得比人快千倍”的科学计算;最早的商用机与汇编器常年不关机的可靠机器;可批量制造的工业产品;进入科研、军工、银行、政府
遗留瓶颈编程靠接线、可靠性差、体积功耗惊人定制机型生态割裂、分立元件焊接繁复——为 IC 与兼容性让路
奠基了什么冯·诺依曼架构 + 图灵/香农的理论地基,八十年不变的骨架器件可靠性与成本的可控,为集成电路和系列化产品线铺路

第二章 · 集成电路与 System/360:从“定制机”到“系列兼容”

2.1 一个共同的焦虑:把电路“长”出来,而不是“焊”出来

1950 年代末,整个行业撞上了同一堵墙:分立元件太多了,接不过来了。 晶体管让单只开关变得便宜可靠,但一台功能强大的机器需要成千上万只晶体管,外加数量同样惊人的二极管、电阻、电容,和把它们连起来的密密麻麻的走线与焊点。这个被称为 “数字 tyranny(数字暴政)” 的问题很直白:器件本身越来越便宜,可把它们组装成一个系统的成本、体积、重量和失效率却越来越高。 可靠性不再取决于单只管子,而取决于上万个焊点中最弱的那一个。

1958 年 9 月 12 日,德州仪器的 Jack Kilby 展示了一种全新的做法:不再把电阻、电容、晶体管分别造好再连线,而是把整组元件做在同一小条半导体材料上,用一层蒸镀的金属线把它们连起来。第一块集成电路其实很粗糙——一根锗棒,上面挂着几只晶体管——但它证明了**“功能电路可以在一块半导体上一次性长出来”** 这个概念。

一年后(1959),仙童半导体的 Robert Noyce 独立提出了更工程化的版本:基于 Hoerni 的平面工艺,把整块电路制作在一片硅上,并用蒸镀的金属互连取代飞线,从而可以批量光刻、批量生产。Kilby 与 Noyce 分别持有集成电路的关键专利,后来两家公司交叉授权、共同分享荣誉——Kilby 于 2000 年因 IC 获诺贝尔物理学奖。今天业界公认:Kilby 发明了概念,Noyce 发明了可制造的形态。

集成电路(IC)的意义,是给摩尔定律提供了物理载体。1965 年,仙童/Noyce 的联合创始人、Intel 后来的缔造者之一 Gordon Moore 观察到一个经验规律:同一芯片上可容纳的晶体管数目,大约每隔一段时间就翻一倍(后来被通俗化为“每 18—24 个月翻一倍、单位成本持续下降”的摩尔定律)。摩尔定律不是一条物理定律,而是一份工程与经济的自我实现的预言:整个行业按它的节奏规划研发、定价与产能,于是它真的在很大程度上兑现了。正是 IC 让“晶体管便宜”这个趋势,从线性变成了指数。

2.2 从 SSI、MSI 到“小规模—中规模”的普及

1960 年代,集成电路沿着集成度(每片门数) 逐级爬升:SSI(小规模集成,几十个晶体管/门)→ MSI(中规模,几百个)→ 稍后的 LSI、VLSI。早期的 IC 并没有一下子取代分立元件,而是先替代那些最费接线、最容易出错的部分——逻辑门阵列、计数器、移位寄存器一类。到 1960 年代中期,IBM 的 System/360 正是靠自研的、统一设计的 SLT(Solid Logic Technology) 混合模块把 IC 与分立/混合组件标准化封装,才第一次在整机尺度上大规模用上了集成电路。

集成度每上升一档,都同时带来三重红利:体积更小、功耗更低、单功能成本骤降;而最深刻的一重是——同一份设计可以被复制生产。设计一旦“固化”进硅片,第二片、第一万片的边际成本几乎为零。“设计一次、制造无数次” 从此成为半导体工业的经济学根基,也为软件生态的复用埋下伏笔。

2.3 转折点:IBM System/360——把计算机从“设备”变成“产品线”

如果说 IC 解决了“器件组装”的成本,那么 IBM System/360(1964 年 4 月发布) 则解决了“定制生态”的成本——它是整部计算机史上最重要的商业决策之一,其意义堪比后来 PC 的产业分工。

背景:被兼容性割裂的行业。 在 360 之前,每一台大型机都是孤立的物种:指令集不同、I/O 不同、外设不通用、操作系统和应用程序互不兼容。客户从 IBM 7090 升级到更新的机器,几乎等于重写所有软件、重买所有外设、重训所有人。而 IBM 当时的处境很尴尬:它同时维护着科学计算的 7090 系列和商用的 1401 系列等多条互不兼容的产品线,研发重复、成本高企、客户被锁死在错误的型号上。行业最贵的东西,不是硬件,而是“不兼容”带来的重复建设。

360 的破局思路:一族机器,一套逻辑。 IBM 首席工程师 Gene Amdahl(后来 Amdahl 定律、Amdahl 架构的提出者)主导设计了 System/360 的核心哲学——指令集架构(ISA)与具体硬件实现分离。六(后扩至更多)档从低到高的机器——从 20K 到 75 乃至 91/95 高性能型号——共享同一套机器指令、同一套编程接口,差别只在性能、容量和价格上。低档用微程序实现,高档用硬连线高速实现,但对程序员和软件而言,它们“长得一样”。这就是 “向上兼容 / 系列兼容(backward & upward compatibility)”:你今天为某档 360 写的程序,明天换一台更高档的 360 就能直接跑,而且更快。

代价与豪赌。 为了这个赌注,IBM 下了血本:约 50 亿美元(是同期曼哈顿计划的数倍)的研制投入,一次性推出六款机型、四十多种新外设,采用统一设计的 SLT 模块、全新的通道与 I/O 体系、以及为全系列服务的 OS/360。发布当天,IBM 宣布全系列可交付——这是一次前所未有的、把整个产品目录“推倒重来”的豪赌。

为什么它成了转折点: 因为从此计算机不再是一件“买一台就是一台”的定制品,而是一条可以按预算选型、可以随业务成长平滑升级、软件与外设可复用的产品线 + 生态。客户被牢牢锁进 IBM 的架构,竞争对手(所谓“七个小矮人”)则被迫要么去兼容 IBM 的接口、要么另立生态。“架构”(ISA)第一次成为一个可以脱离具体硅片、独立存在、被整个行业围绕的核心资产。 这个思想,会在十年后被微处理器和 IBM PC 的开放兼容机产业、再后被 x86 与 ARM 的授权模式反复重演。

2.4 软件的另一场革命:操作系统从“每台重写”走向“可移植的公共层”

360 的另一半功劳,在于它把“软件生态复用”这件事推到了台前——而其中最厚重的一层,就是操作系统。

在 1950 年代,每台机器都配一套手写的控制程序,管理磁带、作业调度、输入输出。批处理系统先出现:把一批作业攒起来顺序跑,减少昂贵 CPU 的空等。通用作业监控系统 IBSYS / OS/360 是这一时期的代表。而 OS/360 的故事,也成了软件工程史上最著名的一课:它功能空前强大,却因规模失控、Bug 泛滥、交付严重延期而声名狼藉。1975 年,Fred Brooks 基于这段经历写出了《人月神话(The Mythical Man-Month)》,留下那句被引用了半个世纪的名言:“往一个已经延期的软件项目里增加人手,只会让它更延期。” Brooks 由此提炼出软件复杂性的本质——概念完整性(conceptual integrity)、沟通成本随人数平方增长、以及“没有银弹”。软件第一次被证明,它的“制造成本”和硬件一样可以失控。

与此同时,两条思想线在学术界生长,塑造了此后所有操作系统的骨骼:

  • 多道程序(multiprogramming):让内存里同时驻留多个作业,一个等待 I/O 时 CPU 去跑另一个,把“单任务串行”的空洞填满,大幅提升昂贵主机的利用率。这是后来所有并发调度的雏形。
  • 分时(time-sharing):让多个用户同时通过终端交互式地使用一台机器,CPU 以毫秒级在各用户间轮转,快到人以为机器是“独享”的。MIT 的 CTSS(1961) 是第一个有影响力的分时系统;随后的 Multics(MIT/贝尔实验室/GE 合作项目)则试图构建一个“公用计算设施”——像用电一样随取随用的计算服务。Multics 商业上算不上成功,但它的设计思想直接催生了下一章的 UNIX。

分时的出现,标志着一种全新的观念:计算机可以从“一次一人的预约设备”,变成“一次服务多人、人人都觉得独占”的共享系统。 “组织”这条经线,第一次被认真地重新编织。

2.5 承前启后:这一章改变了什么,又留下了什么

这一代的三块基石——集成电路(器件组装)、System/360(架构与生态兼容)、操作系统(多道/分时的公共软件层)——合起来完成了一次升维:计算机从“项目制的昂贵设备”,变成了“产品线 + 软件生态 + 可共享系统”。 它把上一代最贵的两件事同时藏了起来:分立元件的组装之贵(IC 藏)和生态定制的不兼容之贵(360 的 ISA 藏)。

而它留下的新瓶颈,同样清晰:

其一,“还是只有大机构用得起”。 无论 IC 让器件多便宜,一台 360 系列仍是动辄数十万美元、需要专门空调机房、专职操作员和系统程序员的大家伙。分时系统提高了利用率,但**“使用权”仍集中在大学、政府、大企业的机房里**。计算机对普通个人、小公司而言,仍是天方夜谭。“谁能拥有一台计算机”这个问题,还远远没有被回答。

其二,“中央化”。 分时意味着所有人围着一台中心主机转,主机一倒,全楼瘫痪;数据、程序、算力都被锁在那间上着锁的机房里。这种**“计算必须去中心找主机”** 的模式,与后来“计算必须来到人身边”的诉求,构成了根本张力。

解决这份张力的钥匙,藏在这一代刚刚诞生、 yet 尚未爆发的东西里:当一整套 CPU 的逻辑可以被集成到一小片硅上,成本塌陷到个人可以负担时,“机房里的公用电”就会变成“书桌上的私有灯”。 这就是下一章:微处理器与个人电脑。

维度分立晶体管时代集成电路 + System/360 时代
核心突破手工焊接的分立元件、彼此不兼容的定制机型把电路做进一片硅(IC);把硬件做成一条产品线(360 的 ISA/兼容);多道程序与分时 OS
解锁了什么——摩尔定律式指数降本;软件外设复用;一次服务多人的分时;大型机/小型机产品族;软件工程这门学科
遗留瓶颈组装之贵、定制之贵只有大机构用得起、机房中央化——为微处理器与 PC 让路
奠基了什么——“架构与实现分离”这一范式;操作系统作为公共层;批量制造与生态复用的经济学

第三章 · 微处理器与 PC:计算从机房走进书桌

3.1 从“一间房”到“一片硅”:LSI/VLSI 与摩尔定律的兑现

到 1960 年代末,集成电路从 SSI/MSI 跨入 LSI(大规模集成),一片硅上可以放几千到几万个晶体管。这带来一个越来越诱人的想法:既然逻辑门可以集成,为什么不能把一整颗 CPU——运算器、控制器、寄存器组——也集成到一片(或几片)硅上?

问题卡在设计方法与互连密度上。1960 年代末,Federico Faggin(后来 Intel 4004 的主要设计者)在仙童发明了硅栅 MOS 技术与自对准工艺,大幅提升密度与速度;他带来的随机逻辑设计方法,让“把任意复杂电路画进硅里”第一次变得可行。与此同时,加州理工的 Carver Mead(“VLSI”一词的提出者)与 Ivan Sutherland 等人在 1970 年代末—1980 年代初确立了 VLSI 设计方法学(尤其是 Mead–Conway 的可教学、可复用的设计流程),把芯片设计从“手艺”变成“工程学科”,引爆了后来整个 ASIC/微处理器产业。

于是,当摩尔定律提供的晶体管预算多到“一整个 CPU 也只是其中一小部分”时,微处理器的诞生只是时间问题。

3.2 1971:Intel 4004,第一颗“计算机于一片硅”

1971 年 11 月,Intel 发布了 4004——世界上第一款商用单片微处理器。它源于一份日本计算器厂商 Busicom 的订单:原本客户想要一套定制芯片组,Intel 的 Marcian “Ted” Hoff 提出了一个反直觉的简化设想——与其做一堆专用芯片,不如做一颗通用的、靠软件编程的 CPU,把“专用逻辑”从硅里搬到“程序”里。Federico Faggin 用他独创的硅栅技术和随机逻辑设计把它落地成真实芯片,Stanley Mazor 参与架构。4004 集成约 2300 个晶体管,4 位宽,约 108 kHz 时钟,能执行约 9 万条指令/秒,加上配套的 ROM、RAM 和 I/O 芯片,构成一个完整的“一片式微型计算机”。

4004 的历史意义,不在于它的性能(它比当时很多专用芯片还弱),而在于它第一次证明:一台可编程计算机的大脑,可以被集成在一片小硅上,可以批量生产、以极低单价出售。 计算,从此具备了“白菜价的通用算力”这一属性。1972 年的 8008、以及随后被广泛用于早期微型计算机的 Intel 8080(1974)、Zilog Z80(1976,广泛用于 CP/M 时代)、摩托罗拉 6800/6809、MOS Technology 6502(1975,便宜得惊人,撑起了 Apple II、Commodore、NES),把这场革命推向 mainstream。1978 年 Intel 的 8086 则开启了 16 位时代——它的后代 8088 会被 IBM 选中,定义此后五十年的 x86 帝国。

3.3 微型计算机浪潮:从套件到爱好再到产业

微处理器一旦存在,“自己动手造一台计算机” 的极客文化就被点燃了。

1975 年,《大众电子》封面刊登的 MITS Altair 8800(基于 Intel 8080)引爆了 Hobbyist(爱好者)市场。它只是一块带一堆拨动开关和指示灯的板子,没有键盘显示器,但成千上万的人买套件回家组装。家酿计算机俱乐部(Homebrew Computer Club) 在硅谷成立,成为这场革命的孵化器。正是在 Altair 上,两位年轻人 Bill Gates 与 Paul Allen 为它写了 BASIC 解释器,并由此创立了微软——他们第一次意识到:“软件可以独立于硬件,作为一种商品出售”,这个洞察将重塑整个产业。几乎同时,俱乐部里的 Steve Wozniak 用便宜的 MOS 6502 设计了 Apple I,与 Steve Jobs 一起创立苹果,认定“应该把套件变成一台开箱即用的成品”。

这一阶段还有一个被低估的关键人物 Gary Kildall:他为 Intel 4004 编写监控程序,后来为 8080 写出 CP/M——第一个广泛使用的微型机操作系统,靠一张软盘启动、屏蔽底层差异、让软件可移植。当 IBM 来找微软谈 PC 的操作系统时,才有了那笔传奇交易——微软从 Seattle Computer 的一家小公司手里买下 QDOS/86-DOS,改造成 PC-DOS/MS-DOS 授权给 IBM。Kildall 与 CP/M 的错失,成为产业史上最著名的一次“卖掉了未来”。

3.4 IBM PC 与“开放架构”:兼容机产业的诞生

1981 年 8 月 12 日,IBM 推出 IBM PC(型号 5150),采用 Intel 8088 CPU 和微软 MS-DOS。它并不是第一台个人电脑——Apple II(1977)、TRS-80、Commodore PET 早已在路上——但它是主流商业世界对“个人电脑”的正式背书,并且做了一个改变产业格局的决定:采用开放、模块化的架构。

IBM PC 用了大量市售标准件、公开的总线规格和技术参考手册,甚至把 BIOS 之外的软硬件细节都摊开。这带来一个始料未及的后果:别人可以合法地“照着做一台一模一样的、还能运行同一套软件的机器”——这就是 “IBM 兼容机 / PC 克隆” 产业。Compaq 等公司靠反向工程 BIOS(洁净室实现)合法生产兼容机,台湾、韩国、美国的厂商把主板、机箱、外设做成大宗商品。PC 迅速从“IBM 的单一产品”变成一个“由 x86 CPU + 微软 OS + 无数硬件厂商组成的开放生态”。

这里发生了本书反复出现的模式:架构的开放与复用,胜过单一厂商的封闭垄断。 System/360 靠“IBM 一家兼容自己”锁定生态;PC 靠“全世界都能兼容它”把成本打到地板、把产量推到千万级。到 1980 年代中期,美国个人电脑市场早已越过百万台量级(Apple II 系列全生命周期销量数百万台),到 1990 年代末,PC 年销量已达数千万乃至上亿台。计算的成本门槛,第一次降到了个人和家庭的承受范围。

而苹果则走了另一条同样影响深远的路线:垂直整合、以体验与图形界面为王牌。1977 年的 Apple II(第一台大规模成功的整机 PC)、1984 年的 Macintosh——后者把 GUI 带进了大众视野。

3.5 图形用户界面:从命令行到“桌面隐喻”

微处理器解决了“买得起”,但**“用得了”** 仍是天堑。早期的 PC 面对的是命令行——用户必须记住一串串命令和语法。让人“谁都能用”的那一跃,是图形用户界面(GUI)。

GUI 的思想源头在 Xerox PARC(施乐帕洛阿尔托研究中心):Alan Kay 等人早在 1970 年代初就从 Ivan Sutherland 的 Sketchpad 和 Douglas Engelbart 1968 年那场著名的“所有演示之母”(首次公开鼠标、超文本、窗口)汲取灵感,做出 Alto 工作站与 Smalltalk,确立了窗口、图标、菜单、鼠标指针(WIMP) 这套范式。但 Xerox 没能把它变成大众产品。1979 年乔布斯造访 PARC,看到 Alto 的那一刻被点燃,苹果据此做出 Lisa(1983) 和真正成功的 Macintosh(1984)——后者用一台相对平价的机器,把图形界面、鼠标、所见即所得的排版带给了普通人。微软则从 Windows 1.0(1985) 一路打磨,靠 Windows 3.0/3.1(1990/1992) 和 Windows 95(1995) 在 PC 克隆海洋里普及了图形界面。

“桌面隐喻”(文件夹、文档、垃圾桶、指针抓取)的意义,是把计算机从“需要专业训练的机器”变成“会看图画就会用的工具”。人机交互的成本,被图形界面藏了起来。

3.6 软件抽象的三重重力:语言、可移植内核、生产力套件

这一章的软件侧转折,是高级语言、可移植操作系统、套装应用软件三条线同时发力,共同决定了 PC 能干什么。

其一,高级语言与编译器:屏蔽机器细节。 前面提过 FORTRAN(1957,世界上第一个广泛使用的高级语言,让科学计算可以用接近公式的方式书写,其优化编译器令“机器自动把高层代码编成高效指令”)、COBOL(1959,Grace Hopper 奠基,面向商业数据处理)、LISP、ALGOL、以及后来 Algol 的子孙(Pascal、C)。编译器的本质,就是一次“抽象降本”:把稀缺的、昂贵的“懂机器的人”,替换成廉价的“懂算法的人 + 一段自动翻译程序”。

其二,UNIX 与 C 语言:可移植操作系统的诞生。 在 Multics 项目散伙后,贝尔实验室的 Ken Thompson 与 Dennis Ritchie 用一台闲置的 PDP 机器,做出了 UNIX(1969/1971)。真正的革命性一步是:Ritchie 发明了 C 语言(约 1972—1973),并用 C 重写了整个 UNIX 内核。 在此之前,操作系统几乎都用汇编写,换一台机器就得重写一遍。而“用 C 写的 UNIX 可以相对容易地移植到新硬件上”——这是第一次,一个成熟操作系统可以跨不同机器复用。 UNIX 的哲学(一切皆文件、小工具组合、管道、可移植)与 C 一起,成了此后半个世纪几乎所有类 UNIX 系统(BSD、Linux、macOS、乃至服务器上的绝大多数基础设施)的源头。“可移植性”从此成为软件工程的核心美德。

其三,生产力套件:让 PC 从极客玩具变成办公工具。 真正让企业和个人掏钱买 PC 的,不是硬件参数,而是能立刻提高产出的软件。三大件缺一不可:

  • 电子表格:VisiCalc(1979,Apple II 平台) 是第一个“杀手级应用”,被公认是“人们买 Apple II 的理由”——它让会计师和普通人第一次能在电脑上建模、做预算。随后的 Lotus 1-2-3(1983,IBM PC 平台的杀手级应用)、再到 Microsoft Excel(1985 起),把“表格 + 图表 + 宏”变成办公标配。
  • 字处理:WordStar、WordPerfect,再到 Microsoft Word,把打字、排版、修订从打字机和复印机里解放出来。
  • 关系数据库:1970 年 IBM 的 Edgar Codd 发表关系模型论文,把数据从“程序里硬编码的指针迷宫”抽象成“表 + 关系运算”;E.F. Codd 的理论经由 IBM 研究院的 Donald Chamberlin & Raymond Boyce 发展出 SQL,并在 1970 年代末由 Larry Ellison(Oracle)、以及 IBM DB2、Sybase、Informix 等商用化,1980 年代成为企业数据的事实标准。“数据库”让非程序员也能以声明式的方式问数据、管数据。

这三件合起来,把 PC 从“一台能编程的机器”变成了“一台能干活的生产力工具”。 硬件廉价(微处理器)+ 人人会用(GUI)+ 立刻有用(套装软件)——三者缺一不可,也正是它们合起来,才让后来“人手一台、连成一片”的互联网终端成为可能。

3.7 承前启后:这一章改变了什么,又留下了什么

把这一章浓缩成一句话:微处理器解决了“廉价通用计算”,GUI 和套装软件解决了“谁都能用”,两者相加,才让计算从机房、从机构专属资源,扩散到了每一个个人和家庭的书桌上。 它把上一代最贵的那件事——“只有大机构用得起、只有专家用得了”——彻底藏了起来。

但 PC 普及之后,一道新的、前所未有的墙浮现出来:每台 PC 都是一座孤岛。

你能在自己的机器上做表格、写文档、跑程序,但你没法轻易把自己的能力伸向别人,也没法把别人的能力接进自己。数据被锁在单机的软盘和硬盘里,程序各自为战,人与人之间的协作仍然要退回纸张、电话和软盘传阅。“个人计算”成功了,但“个人之间”的连接还不存在。

而世界另一端,一套诞生于冷战军方、生长于大学科研网的分组交换与 TCP/IP 技术,已经为“把机器连起来”准备了二十年。当这个连接的标准成熟、成本降下来,孤岛就会连成群岛。计算机的下一个瓶颈,不再是算不动、不再是买不起、不再是不会用,而是——连不上。

这就是下一章:网络、互联网与 Web。

维度大型机/分时时代微处理器 + PC 时代
核心突破机房里的中央主机,一次服务多人但需预约把整颗 CPU 集成到一片硅(4004/8080/6502/8086);GUI 桌面隐喻;高级语言与可移植 UNIX/C;生产力套件
解锁了什么分时提高主机利用率白菜价通用算力;人人买得起、人人用得了;开放兼容机产业;软件作为独立商品(微软/苹果两条路线);办公生产力
遗留瓶颈只有大机构用得起、机房中央化每台 PC 都是信息孤岛、协作与数据无法流动——为网络与 Web 让路
奠基了什么——“架构开放与复用胜过封闭垄断”的产业规律;可移植性成为软件核心美德;PC 作为互联网的终端底座

第四章 · 网络、互联网与 Web:从“单机软件”到“服务软件”

4.1 分组交换:把“通信”这件不可能的事拆开

在个人电脑把算力送上书桌的同时,另一条完全不同的线索正在悄悄生长——如何把分散的机器连起来。

这个想法的最初动机不是商业,而是冷战。1960 年代初,RAND 的 Paul Baran 研究的是“如何让指挥控制在核打击后仍不被一击摧毁”;他得出的答案是:不要把信息走一条固定的中心线路,而是把它切成一个个标准的“小块(packet)”,每块独立选路、各自到达目的地再重组。 几乎同时,英国的 Donald Davies 在 NPL 独立提出了同样的“分组交换(packet switching)”概念并第一个用了 “packet” 这个词。分组交换的意义,是抛弃了传统电话网那种“先建立一条独占端到端电路”的模型,改用“存储—转发”的分布式路由——网络里没有任何一条线路是专属的,任何一块数据都可以走任何一条当前空闲的路。 鲁棒、高效、去中心,三个词一次性拿到。

4.2 ARPANET 与“互联”的哲学

1969 年 10 月 29 日,ARPANET 在 UCLA、斯坦福研究院、UCSB 和犹他大学四个节点之间发出了第一条消息——据说只成功传出了 “LO” 两个字母(本想打 “LOGIN”,系统就崩了)。但这声蹒跚的啼哭,是互联网的前身。

ARPANET 真正的思想贡献,来自 Bob Kahn(BBN) 和 Vint Cerf(斯坦福) 在 1973—1974 年提出的一系列设计,最终凝练成 TCP/IP 协议。它回答了一个比“怎么连两台机器”更根本的问题:当世界上已经存在许多种互不兼容的网络(ARPANET、分组无线电网、卫星网……)时,如何把它们“互联(internet-work)”成一个统一的网? 他们给出的答案,奠定了此后所有网络工程的元规则:

  • 用“网关(gateway,即今天的路由器)”把异构网络缝合起来,主机不必知道底层每一跳是什么物理网络。
  • TCP 负责端到端的可靠传输(拆包、编号、重传、重组),IP 负责把包尽力送到目的地——这个 分层(layering) 设计,把“传输可靠性”与“路由寻址”这两件正交的事分开处理。
  • 由此产生了著名的 “端到端原则(end-to-end)” 与 “沙漏模型”:底层只管 dumb 地把 IP 包送到对端,智能都放在网络两端的主机上。这个“中间简单、两端聪明”的架构,是互联网能野蛮生长、任何新应用都能不加改动地架在其上的根本原因——电话公司后来懊悔没能在互联网里插入“智能”,恰恰是因为互联网从一开始就没打算听它的。

1983 年 1 月 1 日,ARPANET 从旧的 NCP 协议全面切换到 TCP/IP,这一天被视为互联网的诞生日。此后,NSFNET 等学术骨干网把 TCP/IP 铺向全美大学,网络从军方—科研的小圈子,稳步扩向整个学术与 eventual 的商业世界。

4.3 DNS、WWW 与 Mosaic:让网络人人可及

TCP/IP 解决了“机器之间怎么传”,但普通人还要面对两道门槛:难记的 IP 数字,和没有统一的内容访问方式。

  • DNS(域名系统,1983—1984,Paul Mockapetris) 把 example.com 这样的名字翻译成 IP,是网络走向大众的必备基础设施。1990 年代 .com/.net/.org 等通用顶级域和各国ccTLD相继开放,1998 年成立的 ICANN 接手了全球域名与地址资源的协调。
  • 万维网(World Wide Web) 才是真正的引爆点。1989—1990 年,在欧洲核子研究中心 CERN 工作的 Tim Berners-Lee,把“超文本”的思想与 TCP/IP、DNS 结合,发明了 HTML(描述文档)、URI/URL(定位资源)、HTTP(传输文档) 这三件套,并写出了第一个网页服务器和第一个浏览器。1991 年 8 月 web 向公众开放;1993 年,Berners-Lee 决定放弃 Web 的专利权、将其永久免费开放——这一步和 IBM PC 的开放架构一样,让一个标准得以被全世界无门槛地采纳。
  • Mosaic(1993,NCSA,Marc Andreessen 等) 第一个把图片直接嵌进文字流里渲染,让 web “看得见”;它迅速演化为 Netscape Navigator,点燃了 1990 年代中期的浏览器大战与“.com 狂热”。Andreessen 后来创办 Netscape,把开放源码运动带入业界,也再后来与 Jim Clark 创办 Mosaic Communications(改名 Netscape)。

Web 的革命性,不在于网速变快了多少,而在于它改变了“软件的交付与组织单元”。

4.4 真正转折的不是网速,而是“软件的形态”

在 Web 之前,软件的商业模式是 “把程序刻进一张光盘、装进一台机器”:你买的是本地磁盘上的一堆字节,版本固化、更新困难、数据只活在你这一台机器里。Web(以及更早的客户—服务器架构)把这件事彻底重构了:

其一,从“单机程序”到“客户—服务器—数据库”三件套。 应用被一分为三:前端(浏览器/客户端)负责呈现与交互,后端(服务器)负责业务逻辑与状态,数据库负责持久化。这是现代一切的“App”的祖型。你不再“拥有”一个程序,而是访问一个远端提供的服务。

其二,从“分发安装包”到“访问一个 URL”。 软件更新不再需要用户重装——服务器改一行代码,全球用户下次刷新就拿到新版本。软件的迭代速度第一次脱离了物理分发的束缚。

其三,从“卖软件”到“卖服务”,最终演化为 SaaS、API 经济。 服务器端的持续运行让“按使用付费”成为可能(Salesforce 在 1999 年喊出 “No Software”,标志着 SaaS 模式成熟);API 则让一个服务能像积木一样被别的服务调用,催生了搜索、电商、社交、云服务等一整套平台型商业。搜索引擎(AltaVista、Yahoo,以及 1998 年用链接分析 PageRank 让结果质量碾压对手的 Google)本身就成了那个时代最重要的软件。

于是硬件侧的关注点,也随之从“单纯提升主频”转向:网卡带宽、交换与路由、大内存、磁盘与存储阵列、机房制冷与冗余——因为瓶颈已从“一颗 CPU 算多快”挪到了“成千上万客户端同时访问时,服务如何扛得住、扩得开”。软件侧则从进程线程走向 并发服务器、缓存(CDN、反向代理、内存缓存)、消息队列、负载均衡。

4.5 承前启后:这一章改变了什么,又留下了什么

这一代把上一代最贵的事——“个人之间无法共享算力与数据”——藏进了网络。计算第一次成为一种可以跨越物理距离流动的公共能力。

但它同时留下了两个新瓶颈,正是这两者催生了下一章的云:

其一,“服务端要有人扛”。 网页服务需要真实的、常年在线的服务器。要做一个能扩容的网站,你得自己买机架、配网络、雇运维、备冗余、算流量峰值——这是一笔沉重且高度浪费的固定投入:为了应付偶发的流量高峰,你买的服务器在 95% 的时间里是闲置的。互联网把算力从“终端侧”赶到了“服务侧”,但服务侧的机器仍由每家创业公司各自购买、各自闲置。

其二,“身份与数据要能全局一致”。 当软件变成了跨越地理的服务,一个老问题尖锐起来:这个用户是谁?他的数据在哪台机器上?不同服务之间如何互认? 分布式系统的第一课——一致性、可用性、分区容错(后来被 CAP 定理形式化)——开始浮现。

于是历史把接力棒交给了 虚拟化与云:既然每家公司的服务器 95% 时间在闲置,那为什么不把它们集中起来、切碎了按需出租,让“买一台机器”变成“买一份算力”?

维度PC 单机时代网络与 Web 时代
核心突破廉价的本地通用算力分组交换、TCP/IP 分层与端到端原则、DNS、HTML/HTTP/URL 三件套、浏览器
解锁了什么个人生产力全球互联;软件从“安装包”变成“访问服务”;客户/服务器/数据库三件套;SaaS 与 API 经济;搜索引擎
遗留瓶颈信息孤岛、协作断裂服务端需自建自养、闲置浪费严重;分布式身份与一致性——为云与虚拟化让路
奠基了什么互联网终端“架构开放、标准免费”再次击败封闭;“抽象分层”成为工程元规则;云所依赖的客户端与全局身份前提

第五章 · 多核、虚拟化与云:从“买服务器”到“买算力”

5.1 主频撞墙:一条物理定律终结了“唯频率论”

1990 年代,Intel 靠着 Pentium(1993)、Pentium Pro/II/III/4(至 2000—2004) 一路把主频从 60 MHz 拉到 3 GHz 以上,整个行业的信仰就是“下一代一定更快、更高主频”。这套打法依赖的直觉是:主频越高 → 单位时间指令越多 → 越快;而更高的主频,靠更密的晶体管(摩尔定律给)和更高的电压来维持。

但 2000 年代初,这堵墙被物理撞碎了。主频越高,动态功耗随频率与电压平方上升,发热急剧失控;当芯片功率密度逼近乃至超过火箭喷管,散热成了不可逾越的坎——这就是所谓 功耗墙(Power Wall) / 频率墙(Frequency Wall)。标志性的转折是 Intel 在 2004 年放弃了冲到 4 GHz 的 Tejas 计划;2005 年前后,“唯频率论”破产。性能的增长,从此不能再靠一颗核跑得更快,只能靠让多颗核同时跑。

2005—2006 年,双核从高端走向主流:AMD 率先推出面向台式/服务器双核(Athlon 64 X2、Opteron,2005),Intel 的 Core 2 Duo(2006) 则一改 Prescott 的高热形象,用更聪明的微架构在更低功耗下提供更强性能,重新定义了主流多核时代。多核,从此成为默认形态,一路走向四核、八核乃至今天的几十核、上百核。

而多核只是“单机内并行”的一部分,更宏大的趋势是 并行计算的民主化:过去昂贵的超级计算机技术——MPI 消息传递、GPU 通用计算、MapReduce/Hadoop 式的数据并行——被下沉到普通集群,让成千上万台廉价 x86 机器能像一台超级计算机那样协作。“如何组织大量算力”这件事,正在变成比“如何造一颗更快的 CPU”更重要的问题。

5.2 虚拟化:把一台物理机,切成多份可租用的“机器”

早在大型机时代,虚拟化的雏形就已出现——IBM 在 System/370 的 CP/CMS(VM,1967 年代) 上,就把一台主机切成多个虚拟机,供不同用户分时使用。但虚拟化真正引爆,要等到 x86 服务器“一家公司一人一台、大片闲置”的时代。核心动机只有一个经济账:既然多数自建服务器的 CPU 平均利用率只有个位数百分比,那么把 N 台物理机虚拟化成可以动态分配、按租户隔离的池子,就能把浪费变成钱。

现代 x86 虚拟化的商业引爆点是 VMware(1998 年成立,靠宿主机上运行多个未修改客户机 OS 的技术起家),随后 Xen(2003,剑桥起源) 和 Linux 内核自带的 KVM(2007) 把开源虚拟化推向主流。硬件厂商也补上了虚拟化所需的指令支持(Intel VT-x / AMD-V)。虚拟机的本质,是在硬件与操作系统之间插入一层“虚拟硬件抽象(Hypervisor)”,让每个客户以为自己独占一台完整机器。

虚拟化还带来了一个后来价值连城的副作用:“一台机器”不再绑定在一块物理硅上,它变成了一个可以复制、快照、迁移、秒级启停的软件对象。 一旦“机器”成了软件,它就可以被自动化地按需创建和销毁——这正是云的底层前提。

5.3 云计算:把硬件变成一种公共资源池

2006 年 8 月,Amazon 先后推出 S3(存储) 和 EC2(弹性计算云)——这被公认为现代公有云的开端。它的商业天才在于:亚马逊为应对每年一次、峰值高达平时数倍的“黑色星期五”购物潮,不得不自建庞大的数据中心;而一年里其余 360 天这些机器都在闲置。于是它把这堆闲置的、已经虚拟化的机器,像水电一样切片出租出去。 从此,“买一台服务器”变成了“租一份算力”,你不再为峰值预投资本,而是为实际用量按小时付费。

云计算的抽象,本质上是把前面几十年积攒的技术件组装成一种新的服务形态:

  • 基础设施即服务(IaaS):出租虚拟机、存储、网络(AWS EC2/S3、后来的各类云)。
  • 平台即服务(PaaS):出租“不用你管机器”的运行环境(Heroku、Google App Engine、各类托管数据库/消息队列)。
  • 软件即服务(SaaS):把上一章萌芽的订阅软件做成主流(Salesforce、Office 365、以及无数垂直 SaaS)。

到 2009—2010 年,Google、Microsoft(Azure,2010) 相继入场,云成为巨头标配;2010 年代初“Netflix 全面退出自建机房、迁上 AWS”成为传统企业转向云的标志性事件。数据、身份、合规、多租户隔离、区域容灾——上一章遗留的那些“全局一致”问题,在云的架构里被系统地解决,也第一次让任何一个小团队,都能调用起曾经只有国家级机构才负担得起的基础设施。

5.4 抽象再升一级:容器、微服务与基础设施即代码

云上跑起来之后,新的摩擦出现了:在成百上千台虚拟机上部署一个应用,仍然要靠人手动装环境、配依赖、排故障。 软件抽象于是继续“把机器包得更厚”。

其一,容器:比虚拟机更轻的“打包与隔离”。 虚拟机的代价是每份都要跑一个完整 OS,启动慢、资源重。容器(Container) 换了一条路:不虚拟硬件,而是虚拟操作系统层面——多个容器共享宿主内核,却各自拥有隔离的文件系统、网络与进程空间(靠 Linux 的 cgroups 与 namespace 实现)。Docker(2013) 用极致的开发者体验(一次 docker build 出一个随处可跑的镜像、docker run 秒级启动)引爆了容器革命。“部署单元”从笨重的虚拟机,变成了秒级启停、镜像一致、密度极高的容器。

其二,编排:当有上万个容器要一起管。 容器多了就需要调度器。Google 内部十余年运维经验的 Borg 系统被总结成论文,孵化出开源的 Kubernetes(K8s,2014),成为容器编排的工业标准。至此,“机器”这个概念彻底消失了:开发者只声明“我要几个副本、多少 CPU/内存、什么网络策略”,K8s 负责在集群里找地方跑起来、挂了自动重启、流量大了自动扩容。

其三,基础设施即代码(IaC)与声明式运维。 服务器、网络、数据库这些曾经要人手动在云控制台点选的“基础设施”,现在都用 Terraform / CloudFormation 之类的代码声明出来,可以版本化、可重复、可自动化。“配置一台机器”变成了“描述一种期望状态”,让机器自己去收敛。

其四,微服务与服务网格。 随着弹性基础设施成熟,应用架构从“一个大而全的单体”拆成 “许多小服务,各自独立部署、独立扩容、通过 API 通信”的微服务(Microservices,Martin Fowler 2014 命名,Netflix 等实践),而服务间通信、鉴权、观测则交给 服务网格(Service Mesh,Istio/Envoy 等)。

其五,Serverless 与 FaaS。 抽象更进一步——连“有没有机器在跑”都不必操心了:你只上传一个函数,云平台按需触发、按调用计费(AWS Lambda,2014 是里程碑)。计算的计量单位,从“包月的机器”,细到“每一次函数调用”。

5.5 承前启后:把硬件越包越厚的那条线,通向哪里

回顾这一章,一条清晰的“抽象层层加厚”的线浮现出来:批处理 → 分时 → 多任务 → 虚拟机 → 容器 → 编排 → 声明式基础设施 → Serverless。 每一层都在把下一层的存在“藏起来”,让开发者关心得越来越少:先是不用关心别人的作业,再是不用关心机器归谁,再是不用关心进程调度,最后连“有没有一台机器在替我跑”都不用管。

这条线留下的新瓶颈,恰恰指向下一章:

其一,通用算力的天花板。 云和多核解决了“组织与弹性”,但当 AI 需要几万次并行的浮点乘加时,以“通用、分支密集、单线程极致优化”为设计目标的 CPU 结构,效率极低。并行密度不够,成了拦在大模型面前的第一道墙。

其二,但云也提供了两件大模型赖以生存的礼物: 一件是海量、可弹性扩容的存储与集群资源池,另一件是处理分布式数据与调度的整套工程范式。没有云提供的“万卡可调度”与“数据湖”,就没有后来动辄上千张 GPU 的大模型训练场。云是 AI 的摇篮——尽管它自己最初并不知道。

于是,当**图形处理器(GPU)**这种为像素而生的并行器件,被 CUDA 变成通用并行加速器、并被证明能高效跑神经网络时,下一章的“为张量而算”的器件革命,就在这片已经备好的云上蓄势待发。

维度Web 服务时代多核·虚拟化·云时代
核心突破全球互联、访问服务多核(撞功耗墙)、x86 虚拟化、公有云、容器/编排/IaC/微服务/Serverless
解锁了什么分布式应用与 SaaS 起步把“买服务器”变“买算力”;弹性按需、秒级启停;小团队可用国家级的基础设施;分布式系统成熟
遗留瓶颈服务端自建自养、闲置浪费通用 CPU 并行密度不足、单核性能撞墙——为 GPU/异构/大模型让路
奠基了什么全局身份与一致性“硬件越包越厚”的抽象范式;为 AI 训练提供的万卡调度底座与数据规模

第六章 · GPU、深度学习与大模型:从“通用算”到“为张量算”

6.1 一台为游戏而生的机器,意外拥有了并行算力

要理解这一章,得先回到一个看似与科学无关的地方:电子游戏。

现代计算机从上一章开始,图形显示就逐渐从 CPU 里分离出去,交给专门的图形处理器(GPU)。因为渲染一帧画面,本质上是对屏幕上几百万个像素做几乎相同的矩阵/向量运算——像素之间彼此独立,天然可以并行。于是从 NVIDIA 的 RIVA 128(1997)、GeForce 256(1999,第一款自称 GPU、把“变换与光照”做进硬件),到 GeForce 3 / Ti,GPU 走上了一条与 CPU 截然相反的进化路线:不追求单线程极致快,而是堆成千上万个小而简单的计算核心,用海量并行和巨大内存带宽,专攻“同时算很多东西”。 这种结构在体系结构分类里叫 SIMT(单指令多线程)——一种为大规模数据并行优化的器件。

到 2000 年代中期,有人意识到:图像渲染只是这种并行能力的一个特例。任何“对海量独立数据做相同运算”的问题(物理模拟、金融、图像处理……)都能借它来加速。 于是出现了用图形 API(OpenGL/DirectX 的着色器)“曲线”跑通用计算的 hack。真正把它变成一门严肃技术的,是 2006 年 NVIDIA 发布的 CUDA(Compute Unified Device Architecture):它给开发者一套直接用 C/C++ 等语言给 GPU 上万核编程的正规工具链,把 GPU 从“图形卡”正式升格为“通用并行加速器”。这是本书器件主线上的重大一跳:从“通用算(CPU 什么都干一点)”,到“为并行张量而算(GPU 专攻大规模数学)”。 稍后 AMD 的 OpenCL、DirectCompute 与各类 GPGPU 框架跟进,形成生态。

6.2 深度学习:一次被算力点燃的旧想法

神经网络的思想其实很老——从 1943 年 McCulloch–Pitts 神经元、1958 年 Rosenblatt 感知机、到 1986 年 Rumelhart/Hinton 等普及的反向传播(BP),人工神经网络研究已断断续续进行了几十年。“深度学习的寒冬”之所以反复出现,根本原因就是上一章遗留的那堵墙:在 CPU 上训练一个大网络,慢到不切实际。

转折发生在 2012 年。在多伦多大学,Geoffrey Hinton 的两个学生 Alex Krizhevsky 与 Ilya Sutskever 做出 AlexNet——一个卷积神经网络(CNN),在图像识别权威竞赛 ImageNet 上把 top-5 错误率从传统方法的 26% 一举砍到 15.3%,碾压所有对手。它的成功秘诀并不神秘:用两块 NVIDIA GPU(GTX 580)和 CUDA,把原本要算几个月的训练压缩到几天。 这是“GPU 并行密度”与“深度神经网络算法”第一次决定性会师。AlexNet 之后,整个 AI 界迅速转向深度学习,因为大家发现:过去行不通,只是因为算力不够;现在够了。

此后数年,CNN 一路刷新认知:VGGNet(2014)、GoogLeNet/Inception(2014,把错误率压到人眼水平)、ResNet(2015,Kaiming He 等,用残差连接让网络能堆到上百层,ImageNet 首次超越人类)。在语音上,深度模型取代了传统方法;在博弈上,DeepMind 的 AlphaGo(2016 击败李世石) 用深度网络 + 强化学习 + 蒙特卡洛树,宣告了“从数据中学出直觉”的威力。

而工具链的成熟,让这一切得以民主化:Theano、Torch/Lua 早期开路;Caffe(2013) 在学界流行;2015—2017 年,TensorFlow(Google,2015/2017)与 PyTorch(Facebook,2016/2017) 先后开源——它们提供自动微分 + 张量运算 + 设备抽象,让研究员不必手写 CUDA 就能在 GPU 上训练。稍后 JAX(Google,2018)、国内百度的飞桨 PaddlePaddle(2016/2018)、华为的昇思 MindSpore(2020) 等框架跟进。框架,成了 GPU 时代的“编译器 + 轻量级操作系统”。

6.3 Transformer(2017):让模型“可并行、可扩展”的那一跳

真正把“大模型”变成今天这种规模的,是 2017 年 Google《Attention Is All You Need》论文提出的 Transformer 架构。它的核心贡献,是用 自注意力机制(self-attention) 取代了此前主流 recurrent(RNN/LSTM)结构中“逐词顺序处理”的做法。为什么这是决定性的?因为顺序处理天然无法并行(第 t 个词依赖第 t−1 个),而自注意力让序列里所有词两两之间可以直接建立关联、可以一次性并行计算。 于是:

  • 训练可以在 GPU/TPU 的海量并行上一次吞掉整个句子乃至整个批次,训练吞吐暴涨;
  • 由于并行,模型可以放心地加大规模——加参数、加数据、加算力,性能就跟着涨(这被形式化为 Scaling Laws 缩放定律:损失随参数量 N、数据量 D、算力 C 幂律下降,OpenAI 2020 年系统阐述)。

Transformer 之后,AI 进入了 “预训练 + 微调 / 提示” 的范式:先在海量无标注数据上预训练一个通用的大模型,再用少量数据适配到具体任务。Google 的 BERT(2018,双向编码器,横扫 NLP 榜单)、OpenAI 的 GPT 系列(2018 GPT、2019 GPT-2、2020 GPT-3 的 1750 亿参数) 相继登场,把模型参数从亿级推向千亿级。“注意力就是全部所需”,成了这一章的算法基石——而它之所以能兑现,全靠下面这些硬件把它撑住。

6.4 硬件异构化:一场为“矩阵乘法”展开的军备竞赛

大模型的训练与推理,本质上是海量稠密/稀疏矩阵乘法的堆叠。于是整个硬件产业围绕“更快、更省、更大地做矩阵运算”重新分工,形成了异构计算格局:

其一,训练加速卡本身在狂奔。 NVIDIA 用每代翻倍的张量吞吐定义了这场竞赛的节奏:Tesla V100(2017) 首发专用 Tensor Core(张量核心);A100(2020,7nm) 用 MIG 切分、TF32 与第三代张量核心成为训练主力;H100(2022,Transformer 引擎、FP8) 专为大模型优化;到 Blackwell / GB200(2024) 更是把整机柜做成一台“超级芯片”。每一代背后,都是一条为 AI 定制的架构路线。

其二,把数据“喂”给芯片的三条路成了生死线。 大模型的真正瓶颈,很快从“算”挪到了“搬数据”——这就是所谓的 “内存墙 / 带宽墙”:算力涨得比内存带宽快得多,芯片经常空等数据。三条解法成为焦点:HBM(高带宽内存) 把 DRAM 用硅通孔(TSV)3D 堆叠在计算芯片旁,带宽是普通 GDDR 的数倍乃至十几倍;NVLink / NVSwitch 让 GPU 之间以远超 PCIe 的带宽互联、当成“一台大机器”协同;RDMA / InfiniBand 把集群里的机器网络做到极低延迟、近乎直接读写对方内存,支撑起万卡训练的分布式同步。没有这三堵墙的突破,就没有今天动辄上千卡并行训练的大模型。

其三,专用与开放算力入场。 Google TPU(张量处理单元,2016 内部、2017 对外) 是为自家 Transformer 定制、以极致的矩阵吞吐和能效为唯一目标的领域专用架构(DSA);华为 昇腾(Ascend) 系列在国内提供替代生态,并配套 CANN + MindSpore 软件栈。RISC-V 因其开放、可自定义指令集的特性,成为定制 AI 加速器的热门底座。异构,从此是常态:CPU 管通用与控制、GPU 管大规模并行、TPU/NPU 专攻张量、FPGA 提供可重构、以及后来的各种 DSA。

其四,推理侧的“软件降算力”。 训练是一次性的大投资,而推理要海量、长期地跑,成本更痛。于是软件层拼命帮硬件减负:训练框架(PyTorch/TensorFlow) 之上,出现 TVM(2018,开源编译栈)、XLA(Google)、TensorRT(NVIDIA) 等自动调优编译器,根据具体模型和具体芯片,自动选择算子融合、内存布局、并行切分策略;量化(把权重/激活从 FP32 压到 FP16/INT8 乃至 INT4)、蒸馏、剪枝、KV Cache 优化、MoE(专家混合)路由等技术,让“能跑得起、跑得省”成为一等公民。自动编译,成了 AI 时代的新“操作系统级”问题。

6.5 承前启后:这一章改变了什么,又留下了什么

把第五、六章连起来读,因果链格外清晰:云提供了数据规模与可弹性调度的大集群,GPU/CUDA 提供了并行密度,Transformer 提供了可并行、可放大的算法——三者会师,才催生了今天的生成式 AI。 这一代把上一代最贵的事——“通用 CPU 跑不动大规模并行数学”——用异构加速 + 为张量而算的架构藏了起来。

到 2020 年后,这条线冲出了公众视野:OpenAI 的 GPT-3(2020,1750 亿参数,展示了“给个例子就会做”的少样本能力) 之后,2021 年 DALL·E 与 Codex 把大模型推向图像与代码生成;2022 年 11 月 ChatGPT 上线,两个月用户破亿,成为人类科技史上最快的大众化产品之一,也把生成式 AI 彻底推向主流;随后 2023 年 GPT-4、Llama 开放权重模型、Claude、Gemini 等相继登场,模型从“会聊天”走向“能读图、能调工具、能多步推理”的多模态与智能体方向。“参数即能力、数据即燃料、算力即上限”——Scaling Laws 成了这段时间的技术宪法。

但它留下的新瓶颈,也正是下一章登场的理由:

其一,能耗。 训练与推理的电力、冷却、碳足迹惊人;“智能的边际成本”主要由电费与折旧决定。把最贵的“算力”藏起来之后,新的最贵变成了“能耗”。

其二,数据。 高质量文本语料即将耗尽,“合成数据 + 数据质量”成为新战场。当模型不再是瓶颈,喂给它的“数据”成了瓶颈。

其三,算力被少数巨头垄断。 千亿模型训练是资本密集型游戏,能否把大模型“搬到本地、搬到端侧”,让个人和小组织也能用得起、且低延迟、保隐私,成为强烈的需求。

其四,软件形态变了,运维与信任没跟上。 大模型输出是概率的、可能出错的、难复现的;权限、幻觉、审计、可观测性——这一整套“如何管理一个非确定性的软件”的方法论,尚待建立。

于是,下一章:把智能下沉到设备与 Agent,用端侧推理、检索增强与自动编排去回应“能耗、数据、算力、信任”四堵新墙。

维度云·多核时代GPU·深度学习·大模型时代
核心突破组织通用算力(多核、虚拟化、容器)GPU/CUDA 通用并行、深度学习、Transformer 自注意力、HBM/NVLink/RDMA、TPU/NPU 专用架构、自动微分框架
解锁了什么弹性资源池、微服务从图像/语音/博弈到语言与生成——机器开始“学会”;参数从亿级到千亿级;ChatGPT 现象
遗留瓶颈并行密度不足、单核撞墙能耗、数据、算力集中、概率软件的可观测/可信——为端侧 AI 与 Agent 让路
奠基了什么“硬件越包越厚”范式异构计算成为默认;框架与编译器成为新 OS;AI 软件新范式(评测/检索/权限)之起点

第七章 · 端侧 AI 与 Agent:从“人写程序”到“人给意图”

7.1 把智能搬回设备:NPU 与端侧推理的兴起

上一章留下的第一个瓶颈是能耗与算力集中:如果每一次推理都要把数据打包、走网络、送进远端数据中心的大 GPU 再传回来,那不仅延迟高、成本高,还涉及隐私与离线可用。于是产业沿着一条似曾相识的路线突围——把最常用的一部分算力,从中心搬回到设备身边。 这条路线,正是当年“从机房搬到书桌”的重演,只是这次搬的不是通用计算,而是AI 推理。

答案是给每一类设备加一颗“专门做神经网络运算”的低功耗单元:NPU(神经网络处理器)。

  • 移动端:从 2017 年前后,手机 SoC 陆续内置 AI 加速单元——苹果的 Neural Engine、高通骁龙的 Hexagon/ AI Engine、华为麒麟的 达芬奇 NPU、三星与联发科的对应模块,以及 Google 的 Edge TPU 等。它们用低精度的乘加阵列,在手机功耗预算内跑起语音唤醒、计算摄影、实时翻译、本地小模型。
  • PC 端:2020 年苹果以 M 系列 SoC(Apple Silicon,从 M1 起) 把手机的高能效思路搬进电脑,用统一内存(CPU/GPU/ANE 共享一大块内存)架构,让笔记本能在电池供电下本地跑较大的模型;随后 Intel(Core Ultra /Meteor Lake 起集成 NPU)与 AMD(Ryzen AI)跟进,2024 年前后“AI PC”把 NPU 变成标配,主打本地推理、隐私与省电。
  • 模型侧的配合:光有芯片不够,还得有能在小芯片上跑的小模型。量化(INT8/INT4)、蒸馏、剪枝、稀疏化让大模型瘦身;** llama.cpp(Georgi Gerganov,2023,靠精心优化的 CPU/Metal 推理让大模型在普通硬件上跑起来)、苹果的 MLX、MLC-LLM 等推理引擎,把开源权重模型(Meta Llama 系列,2023 起;Mistral、以及国内 Qwen、ChatGLM、DeepSeek 等)带到了笔记本和手机上。“大模型只能在云端”这个前提,被端侧生态一点点打破。**

端侧 AI 的意义,是第一次让“智能”成为一种设备本地、常时在线、低延迟、护隐私的能力,而不必每次都远程求援。它回应了第六章的“能耗与算力集中”两堵墙,也把整部历史那条“算力下沉”的螺旋,重新转了一圈——只是这一圈,下沉的是推理,而非通用计算。

7.2 从“确定逻辑”到“概率输出”:软件形态的范式转移

但真正深刻的转折,不在芯片,而在**“软件”这件事本身的定义变了**。

过去八十年的软件,是**“确定性的逻辑”:程序员把规则写死,输入相同则输出必然相同,可复现、可单测、可形式化验证。而以大模型为核心的 AI 软件,是“概率性的输出”**:给定输入,模型输出的是对下一个词(或动作)的概率采样,同一个 prompt 可能得到不同结果,正确与否没有保证,边界情形可能“一本正经地胡说八道”(幻觉)。这个差异看似只是技术细节,实则撼动了软件工程的地基:你无法再用“写完就固定”的方式管理一个会随机、会漂移、会出错的系统。

于是围绕概率软件,一整套新的工程要素被迫切出来,它们共同定义了“AI 原生软件”的骨架:

其一,检索增强生成(RAG)。 大模型的知识冻结在训练截止那一刻,还容易记错事实。RAG(Retrieval-Augmented Generation) 的思路是:回答前,先从外部知识库/文档里检索相关内容,连同问题一起喂给模型,让它“看着资料作答”。这把模型的“参数化记忆”和“外部可更新的知识”解耦,让幻觉大幅下降、知识可实时刷新、来源可追溯——这是解决第六章“数据与信任”瓶颈的关键工程手法,从 2020 年前后由 Facebook(现 Meta)、DeepQA 等提出,2022—2023 随大模型应用爆发而成为标配。

其二,评测(Evaluation)。 既然不能靠单元测试断言“输出必然正确”,那就要用**基准测试集、评分量表、人工与模型打分(LLM-as-a-judge)**来给一个“会概率输出”的系统定质量。评测,正在取代传统测试,成为 AI 软件的“编译器报错”——它决定了一个模型/一次改动到底“行不行”。

其三,提示工程(Prompt Engineering)与自然语言编程。 编程的抽象,历史上一直在“往上走”:机器码 → 汇编 → 高级语言 → API/库 → 框架。而大模型把这层抽象推到了极限——用自然语言直接描述“我要什么”,由模型去翻译成“怎么做”。GitHub Copilot(2021 起)让“用自然语言 + 注释生成代码”成为日常,程序员从“逐行写实现”转向“描述意图 + 审阅与编排生成结果”。

其四,Agent 与编排。 这是本章的顶点。Agent(智能体) 不再满足于“一问一答地生成文本”,而是让模型规划、调用工具、观察结果、迭代修正,自主完成一个多步骤任务。其思想源头可追溯到 2022—2023 年的 ReAct(推理 + 行动交替)、Reflexion(自我反思) 等研究,以及 2023 年 AutoGPT/BabyAGI 掀起的自主智能体热潮;随后 函数调用/工具使用(function calling/tool use)成为模型的内置能力,LangChain、LlamaIndex 等框架把“模型 + 检索 + 工具 + 记忆 + 规划”编排成可控的流水线。编程范式,从‘人写逻辑’变成了‘人给目标与约束,模型去编排执行,人负责验收与边界’。

7.3 系统层的新问题:谁来管理“模型 + 数据 + 权限 + 幻觉”

当软件从“确定的程序”变成“概率的智能体”,一个尴尬的现实浮现:操作系统和整套基础设施,是为“确定程序”设计的,它们不会管模型版本、不会防幻觉、不认识“提示注入”这种新式攻击。

于是一系列“AI 原生的系统级需求”开始成形,它们是下一章要展开的主线:

  • 模型即一种需要版本管理、灰度、回滚的运行时资产——今天你在管理一个 Docker 镜像,明天你要管理一个模型 + 一份权重 + 一套 prompt + 一个评测基线。
  • 数据管道成为一等公民——训练与 RAG 的质量,取决于清洗、标注、去重、检索的数据工程,而非算法本身。
  • 权限与沙箱成为刚需——当一个 Agent 能自主调工具、读写文件、发起交易,“它能碰什么、不能碰什么”就是新的安全边界;提示注入(用恶意文本劫持模型行为)成了新的攻击面。
  • 可观测与审计成为底线——每一步推理、每一次工具调用、每一个决策依据,都需要被记录,才能追责、复现和改进。

7.4 承前启后:这一章改变了什么,又留下了什么

这一代把上一代最贵的事——“人得亲手把逻辑一行行写出来、且系统无法处理概率性智能”——用**端侧算力(搬回设备)+ RAG/评测/Agent(管理概率软件)**藏了起来。计算的抽象层级,第一次抵达了“自然语言意图”这一层:这几乎是人类能设想的、心智负担最低的编程方式。

但它留下的,恰恰是四个更硬的、无法靠“写更好的代码”解决的新瓶颈——它们将是未来二十年技术迭代的主战场:

  1. 数据:高质量、可信赖、合规的数据越来越稀缺,成为智能的天花板。
  2. 能耗:训练与推理的电力与碳足迹,正在成为物理与经济的双重约束。
  3. 信任:一个会幻觉、可被注入、决策不透明的系统,如何在医疗、金融、法律、政务里被安全地信任?
  4. 意图对齐:如何让一个强大到能自主行动的系统,始终按人类真正的(往往是没说出口的)意图行事?

下一章,就沿着这四堵墙,去看后摩尔时代的硬件与系统会往哪走。

维度云端大模型时代端侧 AI 与 Agent 时代
核心突破云端训练的大模型 + API 服务NPU/端侧推理、量化蒸馏、RAG、评测体系、Agent 编排、自然语言编程
解锁了什么通用语言智能与生成本地、低延迟、护隐私的推理;软件从“确定逻辑”转向“概率输出 + 可观测 + 评测闭环”;自主多步任务
遗留瓶颈能耗、数据、算力集中、可信数据、能耗、信任、意图对齐——后摩尔时代的主战场
奠基了什么异构 + 编译器“意图层”成为编程抽象顶点;AI 原生系统(模型运行时/权限/审计)之起点

第八章 · 未来 10—20 年:后摩尔时代的几轮迭代

如果说前七章讲的是“晶体管变小推动了什么”,那么第八章讲的,是当晶体管不再能便宜地变小时,人类改用什么来继续推进这条螺旋。

8.1 大背景:缩放放缓,重心从“物理”转向“架构与系统”

摩尔定律作为经济规律,正在逼近它的物理与经济极限。先进制程(3nm、2nm)的晶圆厂投资动辄数百亿乃至上千亿美元,良率与设计成本急剧上升;晶体管微缩到几纳米后,量子隧穿、漏电、互连延迟与功耗让“每代更便宜”的老节奏不再自动成立。 这就是所谓 “登普定律(Dennard Scaling)终结 / 摩尔定律放缓”——不是说摩尔观察失效了,而是说性能增长不再主要靠“同一块芯片里塞更多更小的晶体管”,而要靠架构创新、系统组合和专用化。

于是,未来十年的技术迭代,会沿三条战线同时展开:器件层(怎么把计算物理地做出来)、系统软件层(怎么把异构资源组织调度起来)、应用与工程层(人和 AI 怎么协作造软件、并对它负责)。

8.2 硬件层:从“一颗大芯片”到“一套拼装系统”

其一,先进封装与 Chiplet(小芯片 / 小芯片)。 既然单片做大良率会崩、成本会爆,那就别死磕单片:把 CPU、GPU、NPU、I/O、内存拆成若干小芯片(chiplet),用 2.5D 硅中介层(interposer)、3D 堆叠、混合键合(hybrid bonding) 等先进封装技术,像拼乐高一样拼成一个系统,各部分还能用最适合它的工艺节点。AMD 的 EPYC / Ryzen 靠 chiplet 翻身、其 MI300 系列把 CPU 与 GPU 用 3D 堆叠集成是标志性案例;UCIe 等行业互连标准,正把“芯片级复用与分工”推向像当年“主板级分工”一样的常态。“摩尔定律的延续,从‘缩小晶体管’转向了‘聪明地拼装’。”

其二,统一内存与互连(CXL)。 CXL(Compute Express Link) 基于 PCIe 物理层,让 CPU、加速器、内存之间可以缓存一致地共享内存池——目标是打破每台机器内存“绑死在自己主板上、用不完也借不出”的孤岛,构建可解耦、可池化的内存与算力资源。这与大模型“内存墙”直接相关:谁能让成千上万张卡像共享一大块内存那样协作,谁就掌握了训练的钥匙。

其三,存算一体 / 近存计算。 数据搬运本身在浪费能量与时间(数据从内存读到计算单元再写回,能耗可能远高于运算本身)。近存计算(把计算搬到离内存更近) 与 存内计算 / 存算一体(PIM/PNM,直接在存储器里做运算,尤其是模拟域矩阵乘) 试图从根子上拆掉“冯·诺依曼的内存墙”。三星 HBM-PIM 等已把简单运算塞进 HBM 堆栈。这一路线对推理和端侧尤其对症——因为推理多是权重固定的矩阵运算,正适合在数据所在处就地计算。

其四,光计算与硅光互连。 光的天然强项,恰是大模型最核心的运算:矩阵乘法。 用光的干涉与衍射做模拟矩阵运算(光计算/光神经网络),理论上可实现高吞吐、低功耗;而硅光(用光取代电做片内与片间互连)、尤其是 CPO(共封装光学,把光模块封装到芯片旁),正被数据中心用来突破铜互连的带宽与功耗天花板(Broadcom、Marvell、NVIDIA 均已布局)。光计算在专用与边缘推理上亦有储备,但它受限于精度、可编程性与规模,短期更多是“协处理器”而非主角。

其五,类脑 / 神经形态计算。 Intel Loihi、IBM TrueNorth 等神经形态芯片模仿大脑:用事件驱动(spiking,只在有脉冲时计算)、把存储与计算深度融合、极低功耗,天然适合感知、机器人、常时在线的边缘推理——不需要高频跑通用程序,只需安静地、省电地处理传感流。它是“能效”这堵墙的一个激进答案。

其六,量子计算。 它不会在十年内取代你的 PC。它的真正战场,是经典计算做不动的窄问题:分子与材料的量子化学模拟、特定的组合优化、以及威胁现有密码的算法(如 Shor)——现实路线是 “经典 + 量子混合”,量子机作为加速器被经典系统调用。IBM、Google(含其纠错进展)等已展示了“错误缓解/纠错”从原理走向工程的苗头,但通用容错量子机仍是远期目标。 量子更深远的影响,或许在于倒逼后量子密码(PQC)与整个安全体系的重建。

8.3 系统软件层:为异构与 AI 而生的新操作系统

其一,异构操作系统与统一调度。 未来机器里同时住着 CPU、GPU、NPU、各种 DSA 和内存池。谁来统一调度它们、统一管理这片异构内存、统一划分功耗与故障域? 今天的 K8s 只会管“容器”,而它要开始管“模型 + 加速卡 + 内存池”。一个能感知异构算力、按数据局部性和能耗优化调度的新系统层,是必争之地。

其二,AI 原生操作系统与中间件。 未来的 Windows/Android/Linux 可能把“模型运行时、检索、权限、评测、日志”做进系统本身:系统自带一个能调用本地模型的运行时,自带 RAG 检索管道,自带对 Agent 行为的沙箱与权限模型,自带对概率输出的可观测。Agent 会成为操作系统的一等公民,正如当年“进程”“文件”“容器”先后成为一等公民。

其三,编译器与自动调优的深化。 当芯片种类爆炸、模型结构各异,人肉给每种组合手写高性能算子已不可能。面向 AI 的编译栈(TVM、XLA、MLIR、Triton、OpenXLA 等) 会向“给定一个模型,自动选出最合适的芯片、自动量化、自动切片与流水、自动生成近最优 kernel”演进——编译器和自动调优,就是后摩尔时代的‘新制程红利’,它靠榨取软件层的效率,补上硬件微缩放缓的缺口。RISC-V 等开放指令集则降低了定制加速器的门槛,让“为某个模型/某类任务定制一颗芯片”变得可行,呼应了“专用化”的大势。

8.4 应用与工程层:人机协作的新范式,与安全可信的底座

其一,云—边—端协同。 大模型在云端训练、在边缘侧做聚合与低时延推理、在端侧做轻量常驻推理,5G-A/6G 把时延和带宽再压一个数量级,让“计算该在哪一层做”变成一个可以按能耗、隐私、时延动态决策的问题。这是全书“算力下沉/上浮”螺旋在空间维度上的延续。

其二,软件工程变成“评测驱动 + Agent 编排”。 工程师的价值正在从“亲手实现逻辑”迁移到 “定义目标、划定边界与约束、设计验收(评测)、编排智能体、审查生成结果、兜住合规”。人负责架构、意图、责任;AI 负责大量的实现性产出。 软件工程的重心,从“写”转向了“对齐与验证”。

其三,安全与可信从“补丁”变成“出厂属性”。 面对能耗、数据、信任、对齐四大瓶颈,安全可信不再是事后附加:

  • 机密计算(Intel SGX/TDX、ARM TrustZone、各类 TEE 与云端机密 VM/CONFIDENTIAL COMPUTING) 让数据即使在处理中也处于加密飞地里,回应“数据与隐私”。
  • 形式化验证与可证明安全 被引入关键系统,回应“如何信任一个不可完全预测的系统”。
  • 模型水印、来源溯源(如内容凭证/C2PA)、对抗样本检测、红队评测 成为对抗滥用与幻觉的工具箱,回应“信任”。
  • 对齐研究(RLHF、宪法式 AI、可解释性、评测即护栏) 直面“意图对齐”这堵最难的墙——它已不只是技术问题,而是治理问题。

8.5 承前启后:未来把什么藏起来,又会暴露出什么

如果延续全书的总规律,未来这一代要“藏起来”的最贵的事,是能耗(靠存算一体/光计算/专用化)、数据(靠 RAG/合成数据/机密计算下的可用不可见)、信任与对齐(靠评测/形式化/水印/权限沙箱)。而它必然又会暴露出新的、我们此刻还难以命名的瓶颈——正如 1950 年的人无法预见“分布式一致性”会成为 2010 年的头号难题。螺旋还在上升,只是最贵的那件事,已经彻底从“造不出足够快的开关”,变成了“如何安全、可信、节能地把智能对齐到人的意图上”。

维度缩放为王时代后摩尔时代(未来 10—20 年)
核心突破靠晶体管微缩自动降本chiplet/先进封装、CXL、存算一体、硅光/CPO、神经形态、量子;异构 OS、AI 原生 OS、AI 编译栈;云边端协同、评测驱动工程、机密计算
解锁了什么通用算力的持续变便宜用架构/系统/专用化继续提升有效算力;把能耗、数据、信任、对齐变成可工程化的对象
主攻瓶颈单位成本、微缩极限数据、能耗、信任、意图对齐——四大新主战场
奠基了什么摩尔定律红利从“拼物理器件”转向“拼系统与安全对齐”的新范式

结语:一条总规律,和它指向的下一个瓶颈

回望这八十年,八次转折并非八段互不相干的故事,而是同一条螺旋上升曲线上的八个拐点。把它们并排放在一起,规律会自己浮现出来:

电子管让人类第一次“能算”,却因为不可靠而贵;晶体管把可靠性藏了起来,却因为定制与分立组装而贵;集成电路 + System/360 把组装与不兼容的成本藏了起来,却因为只有大机构用得起而贵;微处理器 + PC 把“买不起、不会用”藏了起来,却因为每台机器是孤岛而贵;网络与 Web 把“连不上”藏了起来,却因为服务端自建闲置而贵;虚拟化与云 把“买服务器”的成本藏了起来,却因为通用 CPU 跑不动大规模并行而贵;GPU 与大模型 把“算不动智能”的成本藏了起来,却因为能耗、数据、算力集中、不可信而贵;端侧 AI 与 Agent 正把“人得手写逻辑、系统不懂概率智能”藏起来——而它接下来要面对的,是数据、能耗、信任、意图对齐这四堵最硬的墙。

于是可以给出全书最后、也是对未来最有用的那句总结:

每一代革命,本质上都不是把机器做“更快”,而是把上一代最贵的那件事“藏起来”;而它藏不住、又新暴露出来的那一件事,就成为下一代的主战场。

在器件层,这条规律表现为“成本结构的一次次塌陷与瓶颈的一次次外移”:从物理器件的可靠性,到组装与兼容,到普及与交互,到连接、组织、共享,再到并行密度与能耗。在抽象层,它表现为“心智负担的一次次卸载”:机器码 → 汇编 → 高级语言 → 操作系统与库 → API 与服务 → 声明式基础设施 → 自然语言意图——每一次抽象,都在让“更少的人、用更低的专业门槛、指挥更多的算力”。在产业层,它表现为“架构的开放与复用,一次次击败封闭的定制”:System/360 的 ISA、IBM PC 的开放总线、免费开放的 Web 标准、开源的 Linux/UNIX 血脉、容器与 K8s、乃至今天开放的权重模型与 RISC-V——谁把某一层做成人人可用的公共底座,谁就赢得了下一个生态时代。

理解了这条规律,你就不仅能读懂过去八十年“为什么计算机会长成今天这个样子”,也能预判下一步:既然未来最贵的是数据、能耗、信任、对齐,那么真正的突破性技术,就不会是“又一种更快的芯片”,而是能系统性地降低这四者成本的东西——一个能安全池化内存与算力的系统,一套能把知识从“参数里”解耦到“可更新检索里”的方法,一种能证明“这个概率系统是可信的”的工程学,一种能让庞大智能始终对齐人类真实意图的机制。

八十年前,人类造出的第一台电子计算机,为的是更快地算出炮弹会落在哪里。八十年后,人类造的计算机,已经开始代替我们去想“该往哪里去”。这条螺旋还在上升——只是它抬升的,已不再只是速度,而是智能本身,以及我们信任、驾驭并善用这份智能的能力。 而下一道瓶颈是什么、谁先把它藏起来,正是这部历史尚未写完、也正等待你们去书写的那一章。


附:全书因果链一览(一图读懂八十年)

能算(电子管,不可靠) ──► 可靠地算(晶体管,定制贵)
      │                        │
      ▼                        ▼
 [痛点:烧管/接线]        [痛点:分立组装/生态割裂]
                          藏起来 ──► 器件+生态(集成电路+System/360,机构专属)
                                          │
                                          ▼
                                  [痛点:只有大机构用得起/孤岛]
                                  藏起来 ──► 人人可用(微处理器+PC+GUI,信息孤岛)
                                                  │
                                                  ▼
                                          [痛点:连不上/协作断裂]
                                          藏起来 ──► 万物互联(网络+Web+服务,服务端闲置浪费)
                                                          │
                                                          ▼
                                                  [痛点:自建自养/单核撞墙]
                                                  藏起来 ──► 买算力(多核+虚拟化+云,通用算力跑不动并行)
                                                                  │
                                                                  ▼
                                                          [痛点:并行密度/单点性能不足]
                                                          藏起来 ──► 为张量算(GPU+深度学习+Transformer+大模型,能耗/数据/算力/信任)
                                                                          │
                                                                          ▼
                                                                  [痛点:人写逻辑贵/系统不懂概率智能]
                                                                  藏起来 ──► 人给意图(端侧AI+NPU+RAG+评测+Agent)
                                                                                  │
                                                                                  ▼
                                                                        [下一主战场:数据·能耗·信任·对齐]
                                                                        ──► 后摩尔(chiplet/存算一体/硅光/量子/异构OS/AI原生OS)

一句话贯穿始终:把上一代最贵的事藏起来,就是这一代的突破;藏不住又暴露出的那件事,就是下一代的战场。


附录 A · 八里程碑总表:突破 · 解锁 · 奠基

#转折点大致年代核心突破(What)解锁了什么(Unlocked)奠定了什么 / 遗留瓶颈(Set up)
一电子管 → 晶体管1946—1963半导体冷开关替代热阴极电子管;确立“存储程序 + 二值逻辑”范式常年可靠运行、可批量制造的工业计算机可靠性与成本可控;遗留“定制之贵 + 分立组装之繁”
二集成电路 + System/3601958—1970s把电路做进一片硅;ISA 与实现分离、系列兼容;多道/分时 OS摩尔定律式降本;软件外设复用;产品线 + 生态;软件工程学“架构与实现分离”范式;遗留“只有大机构用得起、机房中央化”
三微处理器 + PC1971—1980s整颗 CPU 集成到一片硅;GUI 桌面隐喻;高级语言/可移植 UNIX-C/生产力套件白菜价通用算力、人人买得起用得了;开放兼容机产业开放复用胜过封闭垄断;遗留“每台 PC 是信息孤岛”
四网络 + 互联网 + Web1969—1990s分组交换、TCP/IP 分层与端到端、DNS、HTML/HTTP/URL、浏览器全球互联;软件从“安装包”变“访问服务”;客户/服务器/数据库;SaaS 与 API;搜索引擎标准免费开放击败封闭;遗留“服务端自建闲置浪费、分布式一致性”
五多核 + 虚拟化 + 云2005—2010s撞功耗墙转多核;x86 虚拟化;公有云;容器/编排/IaC/微服务/Serverless“买服务器”变“买算力”;弹性按需;小团队可用国家级基础设施“硬件越包越厚”抽象范式;遗留“通用 CPU 跑不动大规模并行”
六GPU + 深度学习 + 大模型2006—2020sGPU/CUDA 通用并行;AlexNet;Transformer 自注意力;HBM/NVLink/RDMA;TPU/NPU;自动微分框架机器开始“学会”;参数从亿级到千亿级;生成式 AI 现象异构计算 + 编译器成新 OS;遗留“能耗/数据/算力集中/可信”
七端侧 AI + Agent2020s—NPU/端侧推理、量化蒸馏;RAG、评测、Agent 编排、自然语言编程本地低延迟护隐私的推理;软件从“确定逻辑”转向“概率 + 可观测 + 评测闭环”;自主多步任务“意图层”成编程抽象顶点;遗留四大主战场:数据·能耗·信任·对齐
八后摩尔时代未来 10—20 年chiplet/先进封装、CXL、存算一体、硅光/CPO、神经形态、量子;异构 OS、AI 原生 OS、AI 编译栈;云边端协同、评测驱动、机密计算用架构/系统/专用化继续提升有效算力;把能耗·数据·信任·对齐工程化从“拼物理器件”转向“拼系统与安全对齐”;新瓶颈仍待命名

附录 B · 贯通式编年史:八十年关键节点速览

说明:个别年份在不同来源略有出入,取业界较通行之说。

年份关键事件所属转折
1936图灵提出图灵机,划定“可计算”边界理论地基
1938香农证明开关电路对应布尔逻辑理论地基
1945EDVAC 报告提出“存储程序”思想一
1946ENIAC 公布:第一台通用电子计算机一
1947贝尔实验室发明晶体管一
1951UNIVAC I:美国首台商用计算机一
1953/56IBM 701/704;晶体管计算机 TRADIC 部署一
1957FORTRAN:第一个广泛使用的高级语言三(软件线)
1958Kilby 演示第一块集成电路二
1959Noyce 硅基可制造 IC;COBOL;平面工艺二
1961MIT CTSS:早期分时系统二
1964IBM System/360:ISA 与实现分离、系列兼容二
1965Moore 提出摩尔定律二
1967IBM VM/CP:大型机虚拟化雏形五(前史)
1969ARPANET 首次通信;DEC PDP 系列带动小型机;Unix 起源三/四
1971Intel 4004:第一颗单片微处理器;Unix;Feed-in 存储三
1972–748008/8080;结型/CMOS;Ethernet 命名三/四
1973–74TCP/IP 设计成形(Cerf & Kahn)四
1975Altair 8800 引爆爱好者市场;家酿俱乐部;Microsoft 成立三
1976Z80;Apple 公司成立三
1977Apple II;CP/M;C 语言成熟三
1978Intel 8086:x86 家族起点三
1979VisiCalc:第一个杀手级应用;Xerox PARC 的 Alto/GUI 启发乔布斯三
1981IBM PC(5150)+ MS-DOS:开放兼容机产业诞生三
1983ARPANET 切换到 TCP/IP(互联网诞生日);DNS;Apple Lisa三/四
1984Macintosh 普及 GUI;关系数据库商用化(Oracle/DB2)三
1989–91Tim Berners-Lee 发明 WWW;web 向公众开放四
1991Linux 诞生(Linus Torvalds);万维网公开三/四
1993Mosaic 浏览器;Pentium;GPU 前夜三/四
1994–98互联网商业化;Netscape;Google(PageRank);ICANN四
1997–99NVIDIA RIVA 128 / GeForce 256(GPU 之名);Salesforce 提出 SaaS五/六
2001Wikipedia;云计算概念萌芽四
2004Intel 放弃 Tejas,撞功耗墙;“唯频率论”破产五
2005双核走向主流(AMD X2 / Core 微架构)五
2006Amazon EC2/S3:现代公有云开端;NVIDIA 发布 CUDA五/六
2007–09iPhone 应用生态开启;深度学习社区复兴;“云”术语普及五/六
2010Microsoft Azure 上线;Netflix 迁云示范五
2012AlexNet 引爆深度学习;Docker 前身理念成形六
2013Docker 引爆容器;Caffe五/六
2014Kubernetes(K8s);AWS Lambda 开启 Serverless;GAN五/六
2015ResNet 超越人类;TensorFlow 开源;AlphaGo 前身六
2016AlphaGo 击败李世石;Google TPU 对外六
2017Transformer《Attention Is All You Need》;PyTorch 流行;V100 张量核心六
2018BERT、GPT-2;TVM;HBM 成主流六
2020GPT-3(1750 亿参数);Scaling Laws;Apple M1(Apple Silicon)六/七
2021Copilot(自然语言编程);A100 主力六/七
2022ChatGPT 上线两月破亿;DALL·E/Stable Diffusion;扩散模型夺诺奖级关注;H100六/七
2023GPT-4;Llama 开放权重;llama.cpp 端侧推理;ReAct/AutoGPT 带火 Agent;昇腾生态七
2024AI PC 普及 NPU;AMD MI300 chiplet+3D;多模态与 Agent 走向产品化七/八
未来chiplet/UCIe、CXL 内存池、存算一体、硅光/CPO、神经形态、量子混合;异构与 AI 原生 OS;机密计算与对齐八

附录 C · 术语速查表

术语一句话解释
电子管(Vacuum Tube)靠加热灯丝发射电子来开关的早期器件,速度够快但发热大、易烧、寿命短
晶体管(Transistor)靠半导体载流子开关的器件,冷工作、低功耗、长寿命——现代一切电子的基石
集成电路(IC)把整组晶体管/电阻/电容做进一片硅并互连,实现“设计一次、制造无数次”
摩尔定律经验规律:单位芯片上晶体管数约每 18—24 个月翻番、单位成本下降;行业按它规划
冯·诺依曼架构存储程序 + 顺序执行 + 数据与指令同存一内存的经典计算机结构
指令集架构(ISA)硬件对软件暴露的“指令契约”,可与具体硅实现分离——System/360、x86、ARM、RISC-V 之分野
分时(Time-sharing)CPU 在多个用户间快速轮转,让每人以为独占机器的早期共享方式
微处理器(Microprocessor)把整颗 CPU 集成到一片硅上,带来廉价通用算力
GUI / WIMP图形用户界面;窗口/图标/菜单/指针——把交互从命令行的专业门槛里解放出来
分组交换(Packet Switching)把数据切成标准小包、各自选路、到端重组;互联网通信模型
TCP/IP分层网络协议:IP 尽力送达、TCP 保证端到端可靠;“互联异构网络”的答案
端到端原则网络中间保持简单(dumb),智能放在两端主机——互联网可野蛮生长的根因
WWW(HTML/URL/HTTP)Berners-Lee 的三件套,把信息分发变成浏览器访问统一资源
SaaS / API以订阅方式提供软件服务;以接口方式供别的服务调用的软件单元
CAP 定理分布式系统在一致性、可用性、分区容错间不能三者兼得
功耗墙(Power Wall)频率/电压升导致功耗与发热失控,终结“唯主频论”的物理天花板
多核(Multicore)一颗芯片放多个处理核,用并行而非高主频提升性能
虚拟化 / Hypervisor在硬件与 OS 间插入抽象层,把一台物理机切成多份可租用的虚拟机
云计算 / IaaS-PaaS-SaaS把算力做成像水电一样按需付费的公共资源池的三层服务形态
容器 / K8s共享内核的轻量隔离打包单元;及其大规模编排调度系统
基础设施即代码(IaC)用可版本化的代码声明“期望的基础设施状态”,自动收敛
Serverless / FaaS连“有没有机器在跑”都不用管,按函数调用触发与计费
GPU / SIMT / CUDA为海量并行而生的加速器;单指令多线程结构;NVIDIA 的通用并行编程平台
深度学习 / CNN / RNN用多层神经网络从数据中自动学特征;卷积网络擅长图像、循环网络擅长序列
Transformer / 自注意力用注意力让序列所有元素两两并行关联,取代顺序处理——大模型可并行、可扩参的关键
Scaling Laws模型损失随参数、数据、算力按幂律下降——“加规模即涨能力”的经验宪法
HBM / NVLink / RDMA / CXL缓解“内存墙/带宽墙”的三条路径与统一内存互连标准
TPU / NPU / DSA / FPGA面向张量/神经网络的专用或可重构加速器(领域专用架构)
自动微分 / 编译器(TVM/XLA/TensorRT/MLIR/Triton)框架帮你算梯度;编译器帮你把模型自动优化到具体芯片上
量化 / 蒸馏 / 剪枝 / MoE让模型更小更省、可端侧部署的推理优化手段
RAG(检索增强生成)回答前先检索外部知识,把知识与“参数化记忆”解耦,降幻觉、可更新、可溯源
评测(LLM-as-a-judge)用基准集与打分给概率系统定质量,取代传统单元测试的角色
Agent(智能体)能规划、调工具、观察、迭代,自主完成多步任务的概率系统;ReAct/Reflexion/function calling
提示注入(Prompt Injection)用恶意文本劫持模型行为的新式攻击,是 Agent 时代的核心安全面
机密计算 / TEE(SGX/TrustZone)数据即使处理中也在加密飞地里,回应“数据与隐私”
chiplet / 先进封装 / CPO / 硅光把系统拆成小芯片再拼装;用光取代电做互连以破带宽/功耗天花板
存算一体 / PIM把计算搬到数据所在处、甚至在存储器内直接运算,拆掉内存墙
神经形态计算事件驱动、存算融合、极低功耗、类脑的芯片范式
量子计算 / 后量子密码(PQC)用叠加/纠缠解特定窄问题;以及抵御量子破解而重建的密码体系
对齐(Alignment / RLHF)让强大系统始终按人类真实意图行事——从技术问题上升为治理问题