Claude 不行了?最新的 ChatGPT Work 如何让医学研究员躺着把活干了

0 阅读1分钟

 写在前面:我在编程和量化这行干了不到十年,主业是把一堆脏数据、脏脚本、脏流程拼成一条能自动跑的流水线。这两年我发现,医学研究员的日常和我们做因子回测的日常,本质上是同一种痛苦——80% 的时间花在搬运,20% 的时间花在思考。所以这波 Agent 产品我盯得比较紧。
本文数据截至 2026 年 8 月初,来源均标注在图注和文末。

一、先把结论放前面,省得你们划到底

标题是标题党,我认。所以第一段就把话说清楚:

  1. Claude 没有不行。 恰恰相反,7 月 24 日发布的 Claude Opus 5 在多项公开榜单上是当前第一梯队,生命科学内部评测每一项都碾压上一代。
  2. 但 OpenAI 这一轮的打法确实更狠。 7 月 9 日的 ChatGPT Work + GPT‑5.6,7 月 29 日的「ChatGPT for Academic Researchers」,一个解决”能不能干完”,一个解决”研究员用不用得起”。后者才是杀招。
  3. “躺着把活干了”是真的,但只能躺一半。 具体躺到哪一步,我在文末第四节画了张图,那张图比前面三千字都重要。

行,展开说。

考虑到国内订阅ChatGPT Work确实有点困难,可以参考一下这里:chatgptpro.shop

二、这一个月到底发生了什么

先看时间线。过去十个月,两家不约而同地把”科研”从一个使用场景,升级成了一条独立产品线。

OpenAI 这边,7 月 9 日发布的 ChatGPT Work 是它憋了很久的所谓”超级 App”。核心变化不是模型变聪明了,而是三件事:

  • Codex 被塞进了 ChatGPT。 桌面端把 Codex app 和 ChatGPT app 合并了。以前”写代码”和”聊天”是两个入口,现在是一个。
  • 它能操作你的电脑。 读本地文件、开内置浏览器、跨 App 挪数据,产出 sheets / slides / docs / web apps 这种成品,而不是一段可以复制的文本。
  • 它能排期,能跑几个小时。 手机上派活,它在后台自己拆步骤、自己执行,你回到工位再看进度。

驱动它的是同日发布的 GPT‑5.6 家族:Sol(最强)、Terra(日常)、Luna(轻量快)。顺带一提,这个模型的发布上个月因为美国政府出于国家安全考虑的要求被推迟过一次——这个细节值得记住,后面讲监管的时候会用到。

产品定位上,OpenAI 自己都没藏着:这就是冲着 Anthropic 今年 1 月的 Claude Cowork 去的。两家做的是同一件事——让不会写代码的白领,用上编码 Agent 那套更强的能力。

但真正让我坐直了的,是 7 月 29 日的第二枪。

OpenAI 推出「ChatGPT for Academic Researchers」:给 10 万名科研人员免费开前沿模型。今年夏天先放 1 万个名额,2027 年铺到 10 万。首批机构里有普林斯顿高等研究院(IAS)和巴黎高师(ENS)这种货色。拿到名额的人得到的是一整套:

  • GPT‑5.6 Sol Pro(当前旗舰)+ ChatGPT + ChatGPT Work + Codex
  • 扩容的 Deep Research、更高的调用额度、更大的上下文窗口
  • 75 项以上的生命科学技能:遗传、基因组、测序、单细胞分析、蛋白建模、药物发现
  • 一堆连接器:科研文献、公共基因组与临床数据库、卫星影像、计算笔记本、数据平台、文献管理器(Zotero、GitHub 这些直接接)
  • 企业级隐私与安全,数据默认不用于训练
  • 还能再拉 4 个同机构的合作者进来

这套组合拳背后是 OpenAI 承诺到 2027 年投入超过 2.5 亿美元支持外部科研,其中包括 5000 万的 NextGenAI,以及和美国能源部 Genesis Mission 的合作。

从工程角度看,这一步的分量在哪?

在于它把”接线”这件事替研究员做完了

我做量化的时候最深的体会是:模型强不强,往往不是瓶颈;瓶颈是数据源的 schema 各不相同、文件格式要写专门的 parser、工具链散在 Jupyter、R、集群终端、文献软件里,你一天有一半时间在这些窗口之间反复横跳。医学科研的碎片化程度只会更严重——PubMed、GEO、TCGA、ClinicalTrials.gov、实验室的 ELN、组里那个只有师兄会用的 Perl 脚本。

75 个技能 + 一堆官方连接器 + 免费额度,等于有人把这些线全给你接好了,还替你付了电费。

三、所以”躺着把活干了”,具体是怎么个躺法

我拿一个医学研究员最典型的活来拆:一篇 Meta 分析,或者一次公共数据集的二次挖掘。

传统流程(保守估计 3–6 周):

定题 → PubMed/Embase 检索 → 去重 → 双人筛标题摘要 → 全文筛     → 提取数据到 Excel → 质量评价(NOS/Cochrane RoB)     → 导进 R 跑 metafor → 森林图/漏斗图 → 敏感性分析     → 写正文 → 调格式 → 投稿 → 返修

现在这套流程在 Agent 里长什么样:

环节

交给谁

说明

检索式构建、跨库去重

Agent(连接器直连文献库)

它写 query、跑、合并,比你手搓 MeSH 快

初筛

Agent 出候选 + 你定纳排

纳排标准必须你写,它执行

数据提取

Agent 填表,逐条标原文位置

关键:要求它回链到 PDF 页码/段落

统计分析

Agent 写 R/Python,你审代码

它跑得动,但统计方法的选择是你的责任

图表

Agent 全包

森林图、漏斗图这种,它做得比大多数人好

手稿/基金本子

Agent 出初稿

能按你的模板和参考文件走

应答审稿意见

Agent 出草稿 + 你逐条改

这是最不能撒手的一步之一

关键差别不在于”AI 会写论文”——这个 2023 年就会了。关键在于”它能自己跑几个小时,并且交付的是文件而不是聊天记录”。

对我们做工程的人来说,这个区别叫 从 REPL 到 CI/CD。以前你是坐在旁边一句句喂它;现在你写一份需求,它自己拆任务、执行、验证、交件。ChatGPT Work 那个 Sites beta 甚至能直接给你产出交互式的 dashboard——组会上给 PI 演示的东西,不用再手搓 PPT 了。

这个转变在数据上非常明显。

OpenAI 自己披露的统计(2026 年 6 月 21 日至 7 月 20 日窗口):AI 使用强度排在本领域前 20% 的研究者,把”预计需要 4 小时以上人工”的任务丢给 AI 的比例接近 7%,而同领域其他研究者只有 3.5%——差不多两倍。

我觉得这是全篇最值得琢磨的一个数字。它说明分水岭已经不是”会不会用 AI”了,而是”你敢把多大的活整块丢出去”。 还在拿它改错别字的人,和敢把一整条分析流水线丢给它的人,产出差距不是线性的。

顺便,OpenAI 说每周约有 130 万人在用 ChatGPT 处理高阶科学和数学问题,产生约 840 万条消息。这个体量意味着它已经不是一个”尝鲜”行为了。

四、那 Claude 到底行不行?

行。而且在某些维度上更行。我把话说完整。

Anthropic 的时间线其实比 OpenAI 更早。 2025 年 10 月就发了 Claude for Life Sciences,接进各类实验室平台。真正的重锤是 2026 年 6 月 30 日的 Claude Science——一个独立的科研工作台 App,整合研究员最常用的工具和包、产出可审计的 artifact、提供弹性算力。

Anthropic 把它放在了和 Claude Code、Claude Cowork 同一级别上。他们生命科学负责人 Eric Kauderer‑Abrams 的原话大意是:这体现了这件事对公司使命有多重要。更狠的是,Anthropic 还自己开了个内部药物发现项目,专攻传统药企不愿碰的”被忽视疾病”——理由是要做出对的工具,得自己先下场用。客户名单里有 Genentech 和 Garvan Institute。

模型这边,7 月 24 日的 Claude Opus 5 也不含糊。

  • 定价 5 /25 每百万 token,和上一代 Opus 4.8 持平,1M 上下文
  • 官方口径是”接近 Claude Fable 5 的前沿智力,价格只要一半”
  • 生命科学评测每一项都优于 4.8:有机化学(从波谱推分子结构)+10.2 个百分点,蛋白功能预测(序列变异如何影响功能)+7.7 个百分点
  • Anthropic 称它是自家最强的、通用可获取的科研模型——注意这个措辞,因为更强的 Fable 5 在生物方向的安全限制更严格,反而不如 Opus 5 好用
  • 在 Artificial Analysis 的智能指数和 Agentic 指数上排第一,编码指数并列第一

当然也不是通吃:公开整理显示 GPT‑5.6 Sol 在 DeepSWE v1.1 上仍然领先,Mythos 5 在法律和漏洞开发方向更强,Fable 5 在 health 类任务上仍是领先的。

所以”Claude 不行了”这个说法,站不住。

真实情况是两家在打不同的仗:

  • Anthropic 的路子是”专业工作台”:Claude Science 是给科学家做的独立 App,强调可审计、接实验室工具链、企业和药企级别的深度。它想要的是”全世界相当比例的生命科学工作跑在 Claude 上”,对标的是自己在编程领域已经做成的事。
  • OpenAI 的路子是”通用 Agent + 免费铺量”:ChatGPT Work 不是给科学家做的,是给所有白领做的,科研只是其中一个 vertical。然后用 10 万个免费名额,把整整一代博士生和青椒的使用习惯买下来。

从我做量化的经验看,第二条路的杀伤力被低估了。 你可以理解成券商 API 之争:功能强不强重要,但谁的接口成了新人入行时默认打开的那个,才决定十年后的格局。免费给 IAS 和 ENS 的研究员用,图的从来不是这一万个人的订阅费。

五、躺不平的部分:这张图我建议你截下来

好,前面吹完了,现在讲我作为工程从业者最想说的部分。

Agent 能”跑完”一个任务,和这个任务”能交付”,是两回事。 在金融里跑错一个回测,亏的是钱;在医学里跑错一次分析,可能进的是别人的治疗方案。

这张图是我自己的主观打分,不是厂商基准。读法很简单:第一列越深,越适合整块丢给 Agent;后两列越深,越不能撒手。

几条具体的、我踩过坑的经验:

1. 引用核验不是”要不要做”,是”用什么级别的流水线做”。 关于”AI 必然疯狂编造引用”这个说法,其实有点过时了。AAAI 2026 首次实装 AI 辅助审稿时做过大规模核验,1346 处引用被证实完全真实(发表渠道、作者、原标题全部匹配),仅有 2 例被工具误判,人工排查后一个是引了企业未公开说明书、一个是会议缩写搞混。

但注意,这个结果是靠一条多环节嵌套的工业级流水线跑出来的,不是把 PDF 丢给大模型祈祷。同一批研究里也明确指出:图省事直接丢文档要综述意见,得到的通常是浮于表面的废话或者满篇幻觉。

所以落地建议:要求 Agent 的每一条事实性陈述都回链到原文位置(页码、段落、DOI),然后抽样人工验。这个要求写进 prompt 里的成本,远低于返修的成本。

2. GeneBench Pro 只有 31.5%。 这是 OpenAI 自己报的数字:在这个考察复杂生物数据分析和科学推理的基准上,最强的 GPT‑5.6 Sol Pro 解出 31.5% 的题。最难的三分之二,它还做不对。 你在 FrontierMath 上看到 83% 很爽,但那是数学;生物数据分析这种脏活,AI 的天花板还很低。

3. 统计方法的选择永远是人的责任。 Agent 写 R 代码的能力很强,强到你不看也能跑通。但”该不该用固定效应模型”、”这个亚组分析是不是 p-hacking”、”这个协变量该不该调整”——这些不是代码问题,是学术判断。它写得越流畅,你越容易忘记去审。这是我在量化里被教训过很多次的事:能跑通的回测最危险。

4. 数据合规是硬红线。 患者数据、受试者数据、未公开的临床试验数据——在往任何云端 Agent 里丢之前,先过一遍你机构的 IRB 和数据管理规定。OpenAI 的学术计划确实提供企业级隐私、默认不训练,Anthropic 的商用条款也类似,但**“厂商承诺不训练”和”你有权把这份数据传出去”是两个独立问题**。前者厂商负责,后者你负责。

5. 期刊政策要看清楚。 学术出版界的通行原则至今没变:大语言模型不能作为论文作者;如果在写作中使用了这类工具,作者需要在”方法”、”致谢”或适当位置明确声明。别在这种地方翻车。

六、给医学研究员的落地清单

如果你看到这,想今天就动手,我的建议是这个顺序:

  1. 先查你的机构在不在名单里。 ChatGPT for Academic Researchers 目前只对选定的、有较高研究活跃度的学位授予机构开放,需要验证机构身份并说明你的在研课题和预期用途。免费额度不用白不用,还能带 4 个人。
  2. 不要一上来就丢整篇论文。 先拿一个”你已经知道正确答案”的历史任务去测。比如你去年做过的一次数据清洗,让它重跑一遍,对比结果。这是校准信任度最便宜的方式。
  3. 两家都开一个号。 目前的差异是真实存在的:Claude Science 在可审计产出和实验室工具链整合上更专业,ChatGPT Work 在跨 App 的通用操作和免费额度上更划算。这个阶段花钱买”不站队”是值得的。
  4. 把纳排标准、统计方案、引用核验规则写成一份固定的文档,每次作为参考文件喂进去。这两个产品都强调能按你的模板和参考文件产出——但前提是你得先有模板。这一步的收益是复利的。
  5. 给自己定一条”绝不外包”的线。 我的建议是:任何会写进论文结论、影响临床解释的判断,必须过你自己的脑子。 其余的搬运工作,随便躺。

七、最后

回到标题。

“Claude 不行了吗”——不行。这个问题问错了。

真正在发生的事情是:AI 产品的竞争,从”谁的模型分数高”,转向了”谁能把一整条工作流端到端接管,并且让最缺钱的那群使用者用得起”。 前者是 benchmark 之争,后者是交付形态和分发渠道之争。医学研究员刚好站在这场转向的正中央,因为他们的活儿——碎片多、工具杂、重复劳动重、但每一步的正确性要求又极高——正是这一代 Agent 最想啃、也最难完全啃下的骨头。

所以”躺着把活干了”这句话,我的完整版本是:

搬运的部分,尽管躺;判断的部分,一寸都别让。

至于哪家赢——说实话,作为一个用工具吃饭的人,我更希望它们打得久一点。

数据来源

  • OpenAI,《Accelerating scientific discovery with ChatGPT for Academic Researchers》,2026‑07‑29
  • OpenAI,GPT‑5.6 及 ChatGPT Work 发布信息,2026‑07‑09;相关报道见 Reuters、Engadget、Forbes、Thurrott
  • Anthropic,《Claude Science, an AI workbench for scientists》,2026‑06‑30;相关报道见 MIT Technology Review、STAT、CNBC
  • Anthropic,Claude Opus 5 发布材料,2026‑07‑24,及第三方基准整理
  • Anthropic,Claude for Life Sciences 发布信息,2025‑10
  • AAAI 2026 AI 辅助审稿的引用核验与 SPECS 基准相关报道
  • 图 1–3 数据来自上述公开来源;图 4 为作者主观评估,非厂商基准数据