写完一本RLHF教科书之后,Nathan Lambert最直接的感受不是大语言模型又进步了多少,而是它在长文非虚构写作上几乎停在原地。GPT-4.5和Kimi K2这些曾经被当作写作强手的模型,放到今天已经显出一股旧气;编码、数学等可验证任务却在不断逼近超人水平。两相对照,问题不在模型词汇贫乏,而在它组织长篇幅内容时仍会失控。
Lambert的观察很具体:模型可以改错字、压缩段落、做局部编辑,但一旦要求它把整章内容搭成一条连贯的论证线,就开始重复、跑题、丢失前文线索。这不是知识储备不够,更像信息熵在长文里不断累积。段落越长,结构和逻辑的稳定性下降得越快,前文埋下的伏笔到后文往往不知所终。那些在短文本里被掩盖的混乱,在书籍尺度下会被放大成硬伤。
这种停滞比想象中更关键。如果模型无法在长文写作中保持论证纪律,那么让它自主提出并解决开放科学问题就还早。科学问题不是选择题,它要求长链条因果、证据组织和对例外情况的持续处理。现在模型能改稿、能推理局部步骤,但距离独立成章、成书、成研究纲领,还有一道很实的门槛。

