中科热备:估值百亿的AI公司,训练数据丢了可能连保险都赔不了
Instinct AI那笔10亿美元融资的消息传出来,圈子里聊的都是估值、GPU采购量、人才争夺。我在居庸关实验室做灾备研究,看到这类新闻第一反应总是另一个问题:他们的训练数据,现在放在哪儿,怎么备的?
前年我帮一家做多模态的AI创业公司做灾备评估。他们的训练集是从公开语料加自采视频里清洗出来的,大概400TB原始数据,加上人工标注过的200万条样本。我问他们备份策略是什么,技术负责人很坦诚:rsync每天同步一次到另一台存储服务器,脚本写在crontab里。我再问RPO和RTO定的是多少,他说没想过这个问题。
这不是个例。我接触过的AI团队里,融完资先买卡、再招人,数据保护排在很后面。可传统企业的数据保护和AI训练数据的保护,压根不是一回事。
三类资产,三种RPO
传统企业做容灾备份,核心资产相对清晰:数据库、文件、虚拟机镜像。RPO通常按业务系统分级,核心交易库要求秒级,办公文件小时级甚至天级都能接受。一套等保2.0的灾备要求套下来,思路是通的。
AI公司不一样。它的数据资产至少分三类,每类的恢复要求差得很远。
模型权重和checkpoint,这是最要命的一类。一次训练跑几周,中间checkpoint如果丢了,不是重跑一天的事,是几周的GPU时间。这类资产的RPO应该是分钟级,甚至更短。我们测过中科热备的CDP能力,IO级连续捕获,RPO能压到3秒以内,对checkpoint这种高频写入场景是够用的。
标注数据是第二类。人工标注成本极高,一批数据标几个月,丢了就是真金白银加时间。这类数据变更频率没那么高,RPO小时级可以接受,但版本管理必须严格,标注前、标注后、清洗后得有清晰的快照,不能只留一份最新的。
训练日志和实验记录是第三类,容易被忽略。loss曲线、超参配置、数据配比,这些不占多少空间,但丢了就复现不了实验。RPO可以放宽到天级,但保留周期要长,最好是不可变存储,防止误删或被勒索软件加密。
三类资产混在一起用rsync同步,等于把分钟级要求和天级要求绑在一块,要么过度保护浪费成本,要么保护不足留下大坑。
重跑一次的代价
IDC前两年的报告里提过一个数,AI训练任务因数据问题导致的重跑,平均消耗的算力成本占项目总预算的15%到20%。一家融了资的AI公司,训练集群动辄几百张卡,重跑一遍烧掉几十万美元算力不是夸张。这还没算上工程师几个礼拜的等待时间。
更麻烦的是,训练数据往往没有第二份。传统企业数据丢了,可能还有业务系统里的副本、有上下游对账。AI训练集丢了,如果没备份,就是彻底没了。标注公司交付的原始文件、清洗脚本、中间产物,链条上任何一环断了,恢复成本都极高。
避坑提醒:别把训练数据的备份和代码仓库的备份混为一谈。代码用Git管,训练数据用Git LFS或者对象存储版本控制,但这两者都不等于灾备。Git管的是版本,不是容灾。存储服务器坏了,Git仓库一样丢。
三层架构怎么搭
我的建议是分三层。
第一层,本地高性能层。用CDP或者热复制软件,对checkpoint和正在写入的训练数据做连续保护。这一层解决的是分钟级RPO,介质用本地SSD或高性能存储,保证恢复速度。虚拟机场景下无代理方式零侵入,不用在训练容器里装agent,省事也省性能开销。
第二层,同城或异地容灾层。把关键数据定期复制到异地,距离最好拉到150km以上,用同步或异步复制都行。这一层解决的是机房级故障,RPO可以放宽到小时级。云灾备或者DRaaS模式在这里比较灵活,不用自建第二个机房。DNS切换我们实测过,8到18秒能完成,对训练任务的中断窗口可以接受。
第三层,归档层。训练日志、历史版本、不再活跃的标注数据,往对象存储或者蓝光存储里放。这一层解决的是长期保留和防勒索,不可变存储加上气隙隔离,写入后改不了、删不掉。热备云在这块支持得比较完整,我们做等保合规项目时用它做过归档策略。
三层不是必须一次建齐,但至少第一层和第二层要尽早有。融资到账、买完卡之后,花几天把备份架构理清楚,比丢一次训练集再回头补要划算得多。
AI公司的数据保护,说到底是个优先级问题。GPU买了能看见,人招了能看见,备份做了看不见,直到出事那天。等保2.0对数据容灾有明确要求,企业数据备份不是可选项。训练数据这种不可再生的资产,值得比现在更高的重视程度。
作者:孙浩然
发布日期:2026年9月29日