用AI能写出高考满分作文吗?

0 阅读32分钟

每年高考语文考完,全网都会玩同一个游戏:把作文题原样丢给 AI,比谁写得快、写得好。今年当然也不例外。

我花了几天把这件事从头到尾扒了一遍——包括近两年各路媒体做过的 AI 同题作文实测、高考作文评分细则原文、阅卷的组织流程,以及大模型在这类任务上为什么会稳定卡在同一个位置。结论有点反直觉:AI 写高考作文的水平,比多数人想的强得多;但它离满分,也比多数人想的远得多。

而且这两句话之间的距离,恰好能解释一件事——高考作文到底在考什么。

先说结论

  • AI 现在写高考作文,稳定落在一类下到二类上这个区间。按 60 分制大致是 48–56 分,按 50 分制(北京卷)大致是 40–47 分。这个分数放在真实考生里,是很能打的。
  • 拿不到满分的根本原因不是文笔不够好,而是评分标准里最值钱的那 20 分——发展等级的"深刻、丰富、有文采、有创意"——要的是"你",而 AI 没有"你"。
  • 想靠 AI 在考场上作弊这条路,物理层面已经封死了:手写、信号屏蔽、AI 平台高考期间关停涉考功能,三重锁。
  • 至于"AI 检测器",它根本撑不起实锤——就连 OpenAI 自己做的检测器,也因为准确率太低在 2023 年 7 月下线了,官方自评只抓到 26% 的 AI 文本。

下面展开讲。

一、满分作文到底是个什么难度的事

讨论"AI 能不能拿满分"之前,得先把"满分"这两个字的含金量定死。很多人对高考作文的想象,还停留在"写得好就能拿 60 分",这跟真实的评卷机制差了十万八千里。

1.1 60 分是怎么拆出来的

教育部教育考试院的《作文等级评分标准》把 60 分切成两大块、三小块:

层级项目分值一等标准(20–16 分)
基础等级内容20 分符合题意、中心突出、内容充实、思想健康、感情真挚
基础等级表达20 分符合文体要求、结构严谨、语言流畅、字迹工整
发展等级特征20 分深刻、丰富、有文采、有创意

发展等级不是"全面达标才给分",评分说明写得很清楚:"不求全面,可依据'特征' 4 项 16 点中若干突出点按等评分" 。这 16 个点是——

  • 深刻:透过现象看本质 / 揭示事物内在的关系 / 观点具有启发性
  • 丰富:材料丰富 / 论据充足 / 形象丰满 / 意境深远
  • 有文采:用词贴切 / 句式灵活 / 善于运用修辞手法 / 文句有表现力
  • 有创意:见解新颖 / 材料新鲜 / 构思新巧 / 推理想象有独到之处 / 有个性特征

请盯住最后那五个字:有个性特征

这张表是理解全文的钥匙。基础等级的 40 分考的是"入格"——写没写对、通不通顺、像个文章不像。发展等级的 20 分考的是"出格"——有没有属于你自己的东西。AI 能轻松啃下前 40 分里的大部分,恰恰在第 41 分开始卡住。

顺便说几条容易被忽略的细则,后面会用到:

  • 套作:与材料内容及含意范围沾边的套作,在第三等及以下评分,发展等级不给分
  • 抄袭:整体构思、主要情节,或主要观点、论证模式、重要论据、70% 以上文字雷同视为抄袭,基础等级在第四等内评分,发展等级不给分,抄袭作文最多给 10 分。
  • 文体不明:评分说明里写着"套作或文体不明确的,适当扣分"。表达项一等标准的第一条就是"符合文体要求",四等则是"不符合文体要求:不能辨认文体类型"。
  • 论据真实性:评分细则原文写着"考生的考卷中所述论据的真实性要特别注意,如果是编造,或者有明显错误,或者不能佐证文章观点的,要适当扣分"。

倒数第二条和倒数第一条,我会在第三节专门讲,AI 在这两条上吃过大亏。

1.2 满分不是"写得好",是"两个人背靠背都挑不出毛病"

高考作文实行双评制:一篇作文随机分给两位老师,背靠背独立打分;分差在阈值内取平均,超过阈值自动推给第三位老师三评;三人分歧仍大的,交学科专家组仲裁。

这个机制的含义是:拿满分不是打动一位老师,而是让两位互不认识的阅卷老师,在同一套细则下,都找不到扣分点

浙江大学中文系教授、博导吴秀明曾连续八年担任浙江省高考语文评卷大组组长。他在接受采访时说过一句很能说明问题的话:"要打 60 分的作文,就是无可挑剔的了。其实,作文要打到 57 分以上,就要谨慎了,需要复评。"

也就是说,从 57 分往上,每加一分都在往"零缺陷"逼近。而 AI 生成的文本里,恰恰充满了"看起来完美、细看能挑"的东西——一个张冠李戴的年份、一句似是而非的名言、一个放之四海皆准的过渡句。这些东西在 50 分区间不会致命,在 57 分以上就是硬伤。

1.3 满分到底有多稀缺

先看几个有明确出处的数据。

吴秀明在同一篇采访里说,他参与阅卷的那些年,浙江满分作文每年都有,最少的一年出现 10 份,最多的一年 40 多份。注意,这是全省几十万考生的量级。

华南师范大学语文科评卷组组长柯汉琳在 2008 年通报广东情况时说:当年全省作文满分 18 个(2007 年 26 个,2006 年 50 多个),平均分 40.37 分,一类卷(48 分以上)约占 10%,四类卷约占 1%,约 80% 的考生集中在二、三类卷。他还特意补了一句:广东从 2007 年开始采取二评、三评做法,"一篇作文两个老师同时打到 60 分是很少见的,满分自然比往年要少了"。

把这两个数据放在一起看:满分作文是一个"全省个位数到几十位数"的事件。2026 年全国高考报名人数是 1290 万(人民网报道),即便按最乐观的省份比例推算,满分作文的占比也是一个趋近于零的小数。

所以,"AI 能不能写出高考满分作文"这个问题的真正难度,不在于 AI 强不强,而在于满分本身就是一个几乎不发生的事件。讨论 AI 能不能做到一件人类考生每年只有几十个人做到的事,本身就需要换一种问法。

二、AI 现在究竟能考多少分——把实测数据摆在一起

近两年,多家媒体在高考当天做过同一件事:把真题原封不动喂给主流大模型,再请有高考阅卷经验的老师按高考标准匿名打分。我把能查到出处的几份结果摊开看看。

2.1 2025 年:AI 集体没审出"爱国"

2025 年全国一卷的作文题给了三段材料——老舍《鼓书艺人》里"心里直翻腾,开不了口"的艺人、艾青"用嘶哑的喉咙歌唱"、穆旦"以带血的手和你们一一拥抱,因为一个民族已经起来"。

极目新闻找了 7 款模型,请武汉二中高级教师、武汉市江岸区学科带头人谢先丽(2009、2012、2021 年参与高考阅卷,获评优秀评卷员)打分。结果(60 分制):

模型得分阅卷老师的核心批语
GPT-4o47三则材料解读不错,但中心论点落在"文艺的作用"上,没落在爱国
腾讯元宝(混元)44抓住了"声音"这个共同要素,但没解出材料内在的"爱国"关键词,仍属跑题
文心一言43三个论点强行融合,内在联系不紧密,没有审出三则材料共同的爱国精神
Kimi40侧重"寻找表达方式",偏离三则材料主要意思更多
豆包、通义千问前三名未公开逐篇分数

这份数据最刺眼的不是分数,是批语的重复率。四篇不同模型的作文,被同一个阅卷老师用几乎同一句话判了刑:没审出"爱国"。

七个模型各自生成、互不知情,却在同一个地方集体失足。这不是巧合,后面会解释原因。

2.2 2026 年:分数上来了,批语几乎没变

到 2026 年,模型强了一代,分数也确实涨了。但阅卷老师的批语,读起来有种强烈的既视感。

南方产业智库(南方+) 把全国 I 卷("你对哪一个词语的理解发生了变化")投给千问、豆包、DeepSeek、讯飞星火、智谱、Kimi、Minimax、Gemini、ChatGPT 九款模型,请全国语文特级教师王大绩(连续十余年参与北京市高考阅卷,负责《阅卷纵横》编纂)和海南省名校校本教材编者曹越打分。九款模型全部拿到 50 分以上

排名模型平均分(60 分制)
1讯飞星火55.5
2Gemini53.5
3(并列)豆包 / DeepSeek52.5
紧随Kimi、智谱

榜首作文《重释"闯荡":以青春之我拓时代之疆》的评语相当正面:完成了从"闯荡 = 远走漂泊"到"闯荡 = 突破边界、扎根时代"的认知蜕变,成长印记清晰、逻辑闭环完整。

但同一篇报道里,专家也点出了共性问题,这几句话值得抄下来:

由于大模型均广泛采用互联网信息进行训练,其选取的案例存在雷同现象、语言表达也失之个人化,也有部分存在堆砌词藻的现象。例如,敦煌飞天壁画、航天人乃至环卫工等论据案例,在各大模型的作文中高频出现,而对个体事件细节的呈现则少之又少。

北京青年报做的是北京卷《做规划与下功夫》(50 分制),请北京中学语文特级教师李朝晖匿名评阅 5 款模型:

模型得分(50 分制)批语要点
Gemini 3.1 Pro Preview47审题精准、结构经典递进式、论据扎实;"整体偏规矩,没有特别新颖、深刻的表现,所以不能给到一类上"
豆包44符合一类文标准;"论证方法和思路均较单一,思考深度不够"
GPT-5.542有思维推进;"字数太多,应在语言上再求简练"
通义千问40
DeepSeek未公布单篇分5 款总分区间为 38–47 分

这两段批语里有句话,我觉得是全部测评里信息量最大的一句——"不能给到一类上"。

注意它的措辞:老师先承认了文章"审题精准""论据扎实""结构经典递进式",然后说不给一类上。而给豆包(44 分)的批语更直接:"总体而言符合一类文的标准",紧接着一个"不足处在于"。

这几句话合起来的意思是:AI 的作文已经站到了一类文的门槛上,然后被拦在门外。拦住它的不是基础等级那 40 分——那部分老师基本都给了认可——而是发展等级里"新颖、深刻、个性"那几个词。

香港文汇报/大公报的报道则提到上海卷(70 分制)的测评:9 款模型得分在 61–65.5 之间。报道引用专家的总结也很精准:

决定分分数高低的往往不只是"写出来了没有",而是"想明白了没有"。有的文章立意稳妥,却缺乏进一步推进;有的语言流畅华丽,却始终停留在相对安全的表达区间。

2.3 从这两年的数据里能读出什么

把上面几组数字换算成百分位,会得到一个很稳定的图景:

img

img

三个结论:

  1. AI 的分数在涨,从 2025 年的 40–47(60 分制)涨到 2026 年的 50–55.5。模型代际升级确实有效。
  2. AI 的天花板很稳。所有测评里,没有任何一款模型被阅卷老师判为"可以给到一类上"。最高分 55.5 分,距离 60 分还差 4.5 分,而那 4.5 分恰好全在发展等级里。
  3. 批语两年没变:材料雷同、语言失之个人化、缺少个体细节、停留在安全的表达区间、思考深度不够。

第三点才是关键。模型换了一代,分数涨了五六分,但老师的观感一个字没改。这说明卡住 AI 的不是能力,是结构。

三、卡在哪儿:AI 上不去的四个结构性死穴

这一节是全文的技术核心。我会尽量讲透底层机制,而不是停在"AI 没有感情"这种正确的废话上。

3.1 死穴一:审题能过,"题眼"抓不住

先说一个容易被误读的事实:AI 的审题能力其实很强。上面几份测评里,阅卷老师反复用了"审题精准""立意准确"这类评价。让 AI 复述材料、归纳角度,它做得比多数考生好。

问题出在下一层——材料背后那个命题组没说出来、但阅卷细则里写死的东西

回到 2025 年那道题。三段材料分别来自老舍、艾青、穆旦,命题背景是抗战胜利 80 周年。阅卷细则把"爱国"定为核心立意。AI 干了什么?它从"开不了口"里读出"沉默中的蓄力",从"嘶哑的喉咙"里读出"破碎中的歌唱",从"带血的手"里读出"阵痛中的新生"——每一条单独看都成立,组合起来却完美地绕开了"爱国" 。

这在技术上完全说得通。大模型的训练目标是预测下一个 token,它的"归纳"本质上是在语义空间里找概率最高的那个共同特征。"沉默—歌唱—拥抱"这三个意象的最大公约数是"表达",不是"爱国"。而"爱国"是一个需要读命题背景、读教材语境、读出题人意图才能锁定的东西——它属于"言外之意",不属于"统计共性"。

实战经验:这里能推出一个挺关键的判断——媒体测评给出的分数,其实是 AI 的下限,不是上限。因为这些测评是"裸测":原题原样丢进去,不加任何引导。如果事先告诉模型"这三则材料的共同指向是爱国主义",它大概率能绕过去。

但那个分数已经不能算"AI 自己写的"了,那是"人 + AI"的成绩——人负责审题,AI 负责行文。而这恰恰是我在第六节要给出的建议:把审题留给考生,因为审题本身就是要考的东西。

3.2 死穴二:RLHF 把模型的"个性"磨平了

这是我想重点讲的一条,因为它解释了那个最刺眼的现象:为什么七款不同的模型,会犯一模一样的错误、用一模一样的素材。

先看现象。南方+ 的报道里列举了 2026 年九款模型作文里的高频论据:敦煌飞天壁画、航天人、环卫工。北京卷测评里,五篇《做规划与下功夫》不约而同地用了《读书分年日程》、陈景润/曹雪芹、中国航天"三步走"。

九家公司、不同的训练数据、不同的架构,写出来的论据库高度重叠。这不是抄袭,这是收敛

收敛的根源在 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。这是 ChatGPT 之后所有主流对话模型的标准后训练流程:收集人类对多条输出的偏好排序 → 训一个奖励模型 → 用 PPO 之类的算法让模型去最大化这个奖励。

2024 年 ICLR 上,Kirk 等人发表了一篇很有分量的论文《Understanding the Effects of RLHF on LLM Generalisation and Diversity》(arXiv:2310.06452),系统对比了 SFT、Best-of-N、RLHF 三种后训练方式,结论是一体两面的:

  • RLHF 显著提升了分布外(OOD)泛化能力。测试数据和训练数据的分布差异越大,RLHF 相对 SFT 的优势越明显。
  • RLHF 显著降低了输出多样性,也就是发生了 mode collapse(模式坍缩) 。而且这个坍缩是双重的:per-input diversity(对同一个 prompt 多次采样,输出趋同)和 across-input diversity(对不同的 prompt,输出也趋同)。

第二点才是致命的。论文的原话大意是,RLHF 后的模型倾向于无论输入怎么变,都输出相似的东西——这正是"模式坍缩"的典型表现。研究还发现一个反直觉的结果:加大 KL 惩罚系数(本意是让模型别跑太远、保留多样性)不但没能挽回多样性,反而让 per-input diversity 进一步下降,同时性能也变差了

另一项研究(Mohammadi, 2024,《Creativity Has Left the Chat》)从 token 层面给出了佐证:对齐后的模型在 token 预测上熵更低,在嵌入空间里聚成明显的簇,趋向于所谓的"吸引子状态"——换句话说,模型更容易走进几条被反复强化过的"高奖励路径",更少探索别的地方

把这些翻译成高考作文的语言:

技术现象在作文里的表现对应扣分点
输出熵降低,趋向高奖励路径结构永远是"引材料—三个分论点—联系青年—升华"构思新巧 ✗
across-input 多样性下降不同题目写出相似的气质与节奏有个性特征 ✗
素材收敛到高频安全项敦煌、航天、袁隆平、环卫工材料新鲜 ✗
停留在"安全的表达区间"观点正确但无推进见解新颖 ✗

请回头看发展等级那 16 个点:构思新巧、有个性特征、材料新鲜、见解新颖——这四个点,恰好是 RLHF 的系统性副作用精确命中的四个点

这不是工程优化能解决的问题,这是一个目标函数层面的取舍:我们用人类偏好对齐换来了一个更好用、更安全、泛化更强的助手,代价是它在需要"出格"的地方出不了格。论文自己给出的缓解方案是 Best-of-N 采样(保持多样性)或者干脆用 SFT 模型——但对于工业级部署的对话模型,没有哪家会为了创意写作放弃 RLHF。

如果你一定要用 AI 辅助写作,想绕开这个收敛,最有效的办法不是换模型,而是给它"反例约束"。比如明确写"禁止使用敦煌、航天、袁隆平、司马迁、屈原这五个素材,禁止使用'君不见''揆诸当下''诚哉斯言'这类过渡词"。负向约束能强制模型跳出高概率吸引子,效果立竿见影。

3.3 死穴三:没有经历,"感情真挚"写不出来

内容项 20 分的一等标准是"符合题意、中心突出、内容充实、思想健康、感情真挚"。注意是"真挚",不是"充沛"。

2026 年全国 I 卷的题目,值得把原文抄一遍:

词语是表达思想情感的载体,也是展现社会生活变化的窗口。当前,世界之变、时代之变、历史之变正以前所未有的方式展开。青年是常为新的,在你的成长过程中,你对哪一个词语的理解发生了变化?这变化有你成长的印记,对你有特殊的意义……

教育部教育考试院公布的命题思路里,专门点出了这道题的限制性设计:

四个"你"字提出明确的限制性写作要求,考生要聚焦于"理解"、写出"变化",且这种变化承载着成长印记和特殊意义。……试题紧扣学生成长经历,直面真实的情感体验……呼唤"走心"的写作。

四个"你"。 这道题从设计上就是冲着"不可替代的个人经验"去的。

AI 怎么处理?2026 年南方产业智库的测评里有一句观察很到位:这些文章"引用的故事也非常有细节感,比如'奶奶剥莲子',如同亲历一般"。

但问题在于:这类细节不是任何一个人亲身经历过的,它是从海量语料里统计出来的"最像真实经历的经历"。

这两者的差别,在 50 分区间看不出来,在 55 分以上会暴露得很彻底。阅卷老师为什么能感觉到?因为真实的个人经验有不规整性——它会有突兀的转折、有不合逻辑的情绪、有说不清楚的暧昧地带、有没有交代完的细节。而 AI 生成的"经历"太完整了:有起因、有转折、有顿悟、有升华,严丝合缝地服务于中心论点。

真实的人生经历不会这么听话。

这一点对正在用 AI 辅导孩子写作的家长尤其重要。AI 生成的"感人细节"是一面完美的镜子——它照出来的不是你的孩子,是"最平均的那个孩子"。长期照着这个模板写,孩子的作文会越来越流利,也越来越没有自己。这个损失在高考分数上看不出来,但在别的方面看得出来。

3.4 死穴四:论据会造假,而评卷细则专门盯着这条

评分细则对内容项有一句很硬的话:

考生的考卷中所述论据的真实性要特别注意,如果是编造,或者有明显错误,或者不能佐证文章观点的,要适当扣分。

而大模型有一个公开的、至今没解决的顽疾:幻觉(hallucination)。它会生成听起来完全合理、结构上完全正确、但事实上不存在的内容——人名、书名、年份、名言出处,都能一本正经地编出来。

这不是危言耸听,有同行评议的数据。2026 年 8 月发表在 Critical Care Explorations 上的一项研究(PMID: 42640622),让 GPT-5.3、DeepSeek-V3、Grok-4 在关闭联网检索的条件下,就 10 个神经重症护理主题各生成 10 条参考文献,共 300 条,由两位盲法专家逐条核对。结果是:

  • 165/300(55.0%)存在引用不准确
  • 85/300(28.3%)是完全捏造的文献
  • 分模型看:DeepSeek-V3 幻觉率 23%(捏造 8%)、GPT-5.3 为 69%(捏造 27%)、Grok-4 为 73%(捏造 50%)

另一项更大规模的研究 GhostCite(arXiv:2602.06718,预印本,未经同行评议)测了 13 个主流模型、33 万余条引用,整体失效率 50.29%,且模型间差距高达 6.7 倍(最低 14.23%,最高 94.93%)。研究还发现一个反常识的结论:开启联网搜索、使用思维链提示,都没有稳定降低幻觉率——作者认为这说明幻觉是模型书目知识的根本性缺陷,不是提示策略的副产品。

需要严谨说明:这两项研究测的是学术引用,不能直接等价为"高考作文名言引用错误率"。但它们共同验证了一件事:大模型在生成"看起来权威的具体引用"时,有一个不低的、结构性的错误率

而高考作文恰恰是一个鼓励引经据典、但不允许出错的场景。考生写一句"鲁迅曾说",如果记错了,扣的是一两分;如果 AI 编出一句不存在的话,被阅卷老师认出来,扣的就不止是"论据真实性"那一项了——它会连带打击"内容充实"和"思想健康"。

我自己的做法是,凡是要写进正式稿件的引用,一律走"AI 生成 → 交叉验证 → 人工确认"三步。具体到高考作文,能不用冷僻引用就不用——司马迁、屈原、苏轼这类高频素材虽然"不新鲜",但胜在不会错,而且阅卷老师不会怀疑。用 AI 写的冷门名言,风险收益比极差。

3.5 一个额外的技术视角:评测分数其实被高估了

前面几份测评的分数,我认为存在一个系统性的高估,值得单独指出(这是推断,不是定论):

媒体测评拿到的,本质是 Best-of-N 的结果。 记者通常会开"深度思考模式"、跑多次、挑最好的一篇送去打分。而 Kirk 等人的论文里恰恰验证过:Best-of-N 采样在保持更高多样性的同时,性能能追平甚至超过 RLHF。也就是说,测评里那个 55.5 分,是模型"多次采样后择优"的成绩。

而真实考场是单次采样(one-shot) :一次机会,不能重来,不能拒绝采样,没有温度参数的第二次机会。一个考生坐在考场里,写下的就是他要交的那一份。

再加上两个物理层面的折损:

  • 字迹。表达项 20 分里明确包含"字迹工整"。AI 生成的文本必须由人抄写到答题卡上,抄写会引入错别字(每 1 个扣 1 分)、字数误差(不足 800 字每少 50 字扣 1 分)、以及无法量化的卷面观感损失。
  • 文体。评分说明里"文体不明确的,适当扣分"这条,AI 撞得也不轻。大模型默认爱写一种"四不像"——抒情、议论、记叙各来一段,文体特征模糊。而表达项一等标准的第一条就是"符合文体要求:文体特征明显"。

把这几层折损叠上去,AI 在真实考场条件下的等效分数,大概率要再往下走一截。

四、顺带辟个谣:AI 检测器的准确率,撑不起"实锤"

既然 AI 写得这么好,另一个焦虑就来了:老师能不能查出来?市面上的 AI 检测器靠谱吗?

答案可能会让两拨人都失望:现有 AI 文本检测器,没有一家达到了可以作为证据的准确率。

先看最有说服力的一个案例——做模型的人自己都做不出来

OpenAI 在 2023 年 1 月 31 日上线了自家的 AI Classifier,半年后的 2023 年 7 月 20 日悄悄下线,官方页面上的原话是:"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy."

更关键的是官方自己公布的性能数字(出自 OpenAI 官网该工具的介绍页):

  • 在英文文本的"挑战集"上,该分类器只正确识别了 26% 的 AI 写作文本(真正例)
  • 同时把 9% 的人类写作文本误判为 AI 写作(假正例)

抓不到四分之三,还要误伤将近一成。OpenAI 自己也在页面上写明:"It should not be used as a primary decision-making tool."

再看第三方独立评测:

  • Weber-Wulff 等人 2023 年的研究评估了包括 Turnitin、GPTZero 在内的 14 个检测工具,结果是全部低于 80% 的准确率,只有 5 个超过 70%;且这些工具倾向于把文本判为"人类",改写之后准确率进一步下降
  • Liang 等人 2023 年发表于 Patterns 的研究测了 7 个主流检测器,样本是 91 篇非英语母语者的 TOEFL 作文和 88 篇美国八年级学生作文。结果是:非母语作文被误判为 AI 的平均误判率超过 61%,而美国八年级学生的作文几乎全部被正确判为人类;7 个检测器一致判定为 AI 的 TOEFL 作文占 19.8%,至少有一个检测器判为 AI 的占 97.8%。更有意思的是后续实验:把这些 TOEFL 作文改用更多样的词汇改写之后,误判率大幅下降。作者的结论由此而来——这些检测器反应的其实是文本的复杂度(低困惑度、用词单一) ,而不是"是否由 AI 生成"。
  • Sadasivan 等人(马里兰大学) 的工作表明,通过递归释义(recursive paraphrasing)攻击,可以让高准确率的检测器失效。

把这些数字放到高考场景里,结论非常明确:在一篇 800 字的手写作文上,任何检测器的输出都不构成有效证据。 尤其危险的是 Liang 那篇研究揭示的偏差——写得规整、用词稳妥、句式工整的考生,反而更容易被误判。这恰好是优等生的写作特征。

如果家长或老师正在考虑用检测器"排查"孩子的作文,我建议直接放弃这个想法。误判的代价是信任崩塌,而收益基本为零。判断一篇作文是不是 AI 写的,目前最可靠的办法依然朴素得多——就文章内容当面聊十分钟。你随便挑文中一个具体细节追问下去,比如"那天你为什么是骑车去的""后来呢",真经历过的人答得上来的东西,AI 编的故事接不住。这比任何检测器都准。

五、那 AI 到底该怎么用

说了这么多"不行",这一节讲"怎么用"。我对这件事的态度很明确:AI 是极好的陪练,最差的枪手。

5.1 给考生:当陪练,不当枪手

基于前面拆出来的四个死穴,可以设计一套针对性的流程。核心原则一句话:凡是 AI 的强项(发散、穷举、挑错、反驳)都交给它,凡是评分标准里最值钱的东西(审题、立意、个人经验)都留给人。

第一步:用它做素材拓展,不做全文生成

不要上来就说"帮我写一篇作文"。改成这样问:

我要写高考作文,题目是【原题材料】。
请给我 10 个可能的立意角度,每个角度附一句"为什么这个角度成立"。
要求:角度之间必须有实质差异,不要都是"个人—社会—国家"的套层。

这一步利用的是 AI 的强项——发散和穷举。你要的是备选池,不是答案。

第二步:用它做结构诊断,而不是结构生成

自己写完初稿之后,把它丢给 AI:

这是我的作文初稿和题目。请只做诊断,不要改写:
1. 我的中心论点是什么?你能在第几段找到它?
2. 三个分论点之间,是并列、递进,还是重复?
3. 有没有哪一段的材料不能支撑它所在的论点?
4. 按高考评分标准,最可能扣分的是哪一项?

这一步的价值在于,AI 能扮演一个"不会疲倦的阅卷老师",帮你发现自己的逻辑断层。注意要显式禁止它改写——改写会立刻触发前面说的收敛,把你的文章拉回平均态

第三步:用它做反向质询,逼出深度

发展等级要的是"深刻"和"见解新颖"。最有效的训练是让 AI 攻击你的观点:

我的论点是【一句话】。
请给出 3 个最强的反驳,每个反驳要能站得住脚。
再针对每个反驳,提示我可以怎样回应。

这一步直接对冲了 AI 自己的弱点——它不会主动反驳你,但如果你要求它反驳,它做得很称职。

img

img

绿色是 AI 做的,灰色是你自己做的,红色是必须人工兜底的。注意 AI 只在发散、诊断、质询三个环节出场,"写"这个动作始终在人手里。 这不是保守,这是把 AI 的能力优势和高考的评分规则对齐之后的最优解。

顺带说三个我已经验证有效的操作技巧:

  • 负向约束:明确列出禁止使用的素材和过渡词,强制模型跳出高概率吸引子。
  • 要求"不规整" :可以直接要求 AI 在生成素材时保留一处没交代完的细节、一处不合逻辑的情绪。这是对抗"AI 味"最直接的手段,因为真实的经历本来就不规整。
  • 引用必须人工核:凡是 AI 给出的名言、年份、书名,一律自己查一遍。

5.2 给家长和老师:别买"AI 满分作文"的课

市面上现在有一类课程,卖点是"用 AI 帮你家孩子写出满分作文"。根据前面的分析,这类课的问题一目了然:

  1. 它教的恰恰是评分细则要扣的东西。AI 最擅长的是结构工整、语言流畅、立意稳妥——这些能把你送到 50 分左右,但发展等级那 20 分要的是"新巧、个性、新鲜、新颖",AI 是反向的。
  2. 它会训练出"套作"的特征。评分细则对套作的处罚极重:与材料沾边的套作在第三等及以下评分,发展等级不给分。而 AI 生成文本的高度可预测性,正是套作识别系统最容易捕捉的信号。
  3. 最大的损失在分数之外。孩子如果习惯了用 AI 的"平均经验"替代自己的真实经历,丢掉的是"感情真挚"这项能力本身。这项能力在作文分数上的权重大概只有几分,但在别的地方,权重高得多。

反过来,真正值得投入的方向是用 AI 做大量的、低成本的反馈循环:写完就诊断,诊断完就改,改完再质询。这个循环以前要靠一位愿意花时间的老师,现在一个学生自己就能跑起来。这才是 AI 在这件事上最大的价值——它把"写作反馈"这件事的边际成本打到了接近于零

六、回到那个问题

所以,用 AI 能写出高考满分作文吗?

直接回答:几乎不能,而且这个"不能"不是能力问题,是结构问题。

2025、2026 两年实测给出的分数区间是一致的:AI 稳定在 48–56 分(60 分制),或者 40–47 分(50 分制)。这是很好的成绩,超过八成考生——毕竟 2008 年广东的数据里,约 80% 的考生集中在二、三类卷,一类卷只有约 10%。

但满分的门槛在 57 分以上那个"需要复评"的区间,而那里站着发展等级的四个关键词:深刻、丰富、有文采、有创意。具体到 16 个点里,AI 精确地在"构思新巧、有个性特征、材料新鲜、见解新颖"这四个点上集体失分——而这四个点,恰好是 RLHF 的 mode collapse 精确命中的地方。

这不是某家公司的 bug,是目标函数的取舍。我们为了让模型更好用、更安全、泛化更强,用人类偏好去对齐它,代价就是它会在所有需要"出格"的地方,稳稳地待在格子里。

于是这个问题最终会变成另一个更有意思的问题:高考满分作文,到底在奖励什么?

从命题思路里能找到答案。2026 年全国 I 卷的官方解析里写着,试题"呼唤'走心'的写作,促使其真诚面对、主动审视个人成长轨迹";全国 II 卷的解析里写着,"若仅满足于阐释'守本固源之重要',通过堆砌人物事例泛泛而论,则只停留在材料表面……终因缺乏问题意识与独立思考能力而流于平庸"。

这两段话,几乎是在点名 AI 的弱点。

高考作文考的从来不只是"写得对不对、好不好",它考的是你是不是一个有独立经历、能独立思考、能用自己的话把事情说清楚的人。AI 能模仿这件事的所有外部特征——结构、辞藻、论据、升华——唯独模仿不了那件事本身,因为它没有经历过任何一天。

这其实是个好消息。在一个 AI 能把所有"平均水平的产出"都做到 80 分的时代,"你是谁、你经历过什么、你怎么想"正在变成唯一无法被外包的东西。高考作文的评分标准,歪打正着地把这件事标好了价格——20 分,占总分的整整三分之一

最后留一个我觉得更值得琢磨的问题:如果满分作文的本质是"不可替代的个人性",那我们是不是该重新审视一下,过去那些教孩子背万能素材、套通用结构的作文课,其实一直在教他们变成 AI