AI写作的“黄金时代”正在走向终结。尽管新一代模型的能力日益增强,产出的文章质量却每况愈下。模型似乎懂得如何列出建议、插入小标题,也能在结尾进行总结,但通读全文后,大脑却留不下任何深刻印象。
“模型越强,文章越不像人话”,这一现象引起了剑桥大学博士后Adam Hunt的注意。作为演化精神病学与人类演化领域的研究者,Hunt过去一直看好AI,但在7月28日的一篇长文中,他坦言自己正变得日益悲观。
之前有一种流行的比喻,是将模型能力描绘成一个带尖峰的圆:先是代码和数学超越人类,随后随着规模扩大,各项能力逐步增长,最终实现AGI。然而现实中,代码和数学这根“刺”确实越来越长,而语言表达和简单推理的能力却未同步提升。
从强化学习的角度看,这几乎是必然的。早期大语言模型之所以看起来“全面变聪明”,是因为训练语料涵盖了全领域(从诗歌到论文),但这只是语料的副产品,并非模型真正的“理解力”。思维链和网页搜索曾短暂续了命,但这条路终究撞上了墙。
紧接着,急于翻盘的AI公司将目光投向了代码。原因很简单:代码拥有源源不断的训练数据(GitHub上的提交、审查、PR),且像数学一样有明确的反馈信号——跑得通就是好。相比之下,文章写作缺乏自动评分机制,强化学习便无法对其进行优化。
于是,训练火力全部集中在代码上,语言表达只能消耗预训练阶段积累的“老本”。为了配合其他领域的提升,语言能力甚至可能出现退化。这正是古德哈特定律的体现:当某项指标成为训练目标,它就不再准确反映真实能力。实验室通过基准测试优化模型,再用同类测试证明变强,榜单上的准确率或许还在上涨,但实际体验却可能停滞甚至下降。
更令人震惊的是,模仿能力也受到了限制。一位Reddit用户发现,之前能用的提示词突然失效,ChatGPT开始拒绝模仿特定作家的风格。无论是斯蒂芬·金、J.K.罗琳,还是海明威,只要指定名字,模型就会拒绝。即便不点名,只要求“悬念强度”“叙事节奏”等抽象特征,虽然能生成内容,却失去了原本的“味道”。
AI写作的黄金时代,确实已经崩塌。这动摇了用户的基本预期:模型未必越写越好,提示词也不再长期有效。一旦平台调整规则,基于特定模型的写作流程便会瞬间崩塌。不过,AI写作不会消失,它只是回归了工具的本质:它可以查资料、理结构、润色句子,却无法替作者决定写什么、为何而写。简而言之,人的经验、判断力和表达欲,正变得愈发珍贵。
