AI写作的黄金时代正在崩塌。随着模型一代代更迭,能力越来越强,但文章质量却每况愈下。它知道何时列出建议、何处插入小标题,也知道在结尾加上总结,但通篇读完,却让人记不住任何一句话。
一、模型越强,文字越缺乏灵魂
近期,剑桥大学博士后Adam Hunt也注意到了这一现象。作为演化精神病学与人类演化领域的研究者,Hunt过去一直对AI持乐观态度,但7月28日的一篇长帖中,他却坦言自己正变得越来越悲观。
此前,业界常将模型能力比作一个带尖峰的圆:首先是在代码和数学上超越人类,随后随着规模扩大,各方面能力逐步增长,最终实现通用人工智能。然而现实是,代码和数学那根“刺”确实越来越长,而语言表达和简单推理的能力却并未同步提升。
从强化学习的角度来看,这一现象几乎是必然的。早期几代大语言模型看似“全面变聪明”,是因为训练语料涵盖了全领域,从诗歌到论文应有尽有。但这其实是语料的副产品,并非模型真正的“理解力”。思维链和网页搜索的引入,曾为模型续了一波命。但这条路终究是撞了墙。随后,急于翻盘的AI公司将火力集中在代码上。原因很简单,代码拥有源源不断的训练数据——GitHub上的提交、审查和PR请求全是现成的。此外,与数学类似,代码有明确的反馈信号:能跑通就是好代码。
那写文章呢?如何给“一段散文写得好不好”自动打分?没有奖励,强化学习就不会往那个方向优化。于是,所有的训练火力都转移到了代码上,语言表达只能吃预训练阶段留下的“老本”。老本只会越吃越薄,甚至为了配合其他领域的提升,还会出现退化。这正是古德哈特定律容易显现的地方。当一项指标成为训练目标时,它就不再准确反映真实能力。实验室用基准测试优化模型,再用同类测试证明其变强,榜单上的准确率或许会继续上涨,但实际使用体验却可能停滞,甚至下降。
二、风格模仿能力的限制
在能力退化的同时,另一件事也在发生。一位Reddit用户抱怨称,他使用ChatGPT写了几个月的书,并订阅了高级模型。中间休息了一阵后,当他回来时,那条一直能用的提示词突然返回了拒绝信息。
提示词本身并不复杂:指定一位作家,要求增加对话、丰富细节、避免碎句。过去只要写出作家名字,模型就能生成接近其文风的内容,无需额外解释句长、节奏或视角。而现在,这类提示词已经失效了。
Ars Technica测试了斯蒂芬·金、J.K. 罗琳、谭恩美、狄更斯、海明威,Engadget则测试了阿加莎·克里斯蒂,ChatGPT全都拒绝模仿。如果不点名,只要求“悬念强度”、“叙事节奏”、“对话密度”等抽象特征,倒是可以输出内容。但味道,却已经完全变了。
三、AI写作时代的终结
如今,这场争议已经动摇了用户对AI写作的基本预期。模型未必越写越好,提示词也不再长期有效。平台一旦更改规则,围绕特定模型搭建的整条写作流水线,说塌就塌。
不过,AI写作不会消失,它只是退回到了自己该在的位置:工具。它可以查资料、理结构、改句子,却无法替作者决定写什么、为什么写。换句话说,人的经验、判断和表达欲,正变得越来越珍贵。
