动态语言帮大模型省 token?这则流传甚广的说法,被一场硬核实验撕开了口子。作者直接把 GPT-5.6 Sol 塞进一个非琐碎任务——让智能体从零实现 zstd 解码器,用真实代码编译运行来检验两类语言的 token 效率。结果够打脸。在 medium 努力度设定下,动态语言的确表现更好,仿佛印证了流行观点;可一旦推到 ultra 努力度,静态语言逆势翻身,整体表现反而更优。节奏感就是这么残酷:微基准里赢得漂亮的选手,进了大战场立刻露怯。
实验中还扒出不少此前评测的硬伤。部分结论建立在错误的测试路径上,好比量尺本身就是弯的,量出的优势自然不可信。作者毫不客气地指出,那些在玩具问题或短脚本上积累的所谓“动态语言省 token”优势,根本无法线性外推到大型工程里。编译器严格类型检查带来的结构信息,反而在模型疯狂迭代、反复搜索时压低了修正成本。这个发现几乎是在抽那些盲目鼓吹动态语言 AI 编程优势的人一记耳光。
说白了,这是一堂关于规模敏感性的课。小任务里取巧的技巧,到了需要深度推理和长期维护的任务面前,往往变成债务。团队如果正纠结于 AI 辅助开发该押注哪种语言,别只看烤小饼干的能耗,得看它在后厨大战时能不能撑住灶火。主流静态语言沉淀数十年的工程底蕴,没那么容易被短平快的 Token 账单推翻。

