方汉在那场WAIC圆桌上抛出的第一个判断,就把行业里心照不宣的那层窗户纸捅破了——堆Token根本衡量不了AI的价值。不是“暂时衡量不了”,是方向上就错了。这很像当年移动互联网早期,所有人都在比谁的App安装包更大。现在回头看,那几乎等于自曝其短。这位昆仑万维的CEO说话不绕弯,他点出的不止是算力崇拜的荒谬,更甩出了一个更尖锐的问题:如果模型能力不靠堆料,那靠什么?他的答案是,得靠Claude Code这类Coding Agent所代表的工程框架,只有把模型塞进能干活、能交付、能被审查的生产流程里,能力才不再是演示视频里的炫技,而是银行账户上能算出来的ROI。这番话,值得每个正在为AI预算发愁的技术决策者一听。
Token堆得再多,也堆不出工程能力
燃料论为什么正在失效
圈子里一度流行一个粗糙的换算公式:消耗的Token越多,模型越强。这背后藏着一个更隐蔽的假设——智能是可以被“喂”出来的。但现实打了所有人的脸。一个在榜单上屠榜的模型,丢进真实业务流里可能连一个API调用的异常重试都处理不好。方汉的观察很直接:Token只是燃料,不是引擎。你给一辆没有方向盘的汽车加满油箱,它仍然哪里都去不了。当下的困局恰恰在于,很多团队把精力全耗在“找更多原油”上,却忘了先把车子组装起来。他提到的Claude Code非常有代表性。Anthropic推出这个东西时,兴奋点并不在它多能写代码,而在于它展示了一种把模型能力固定为工程化工具链的路径。模型可以生成一段漂亮的SQL,但如果每次执行前都要人类去核对表结构、权限、数据漂移,那这个模型的“生产力”就是个伪概念。Coding Agent的价值,是把这些核对、回滚、上下文记忆整个链路都自动化了。能力不是从模型里长出来的,是从工程的夹缝里挤出来的。这一点,国内很多还在拼千亿参数、万亿Token的团队,该醒醒了。
为什么你总觉得模型“不好用”
答案可能让人不太舒服:因为你从来没把它当做一个工程组件来用。绝大多数企业引入大模型的方式都像在拆盲盒——灌一堆文档进去,期待它能自己变成业务专家。结果要么幻觉满天飞,要么输出风格飘忽不定。方汉在交流中透露,昆仑万维至今仍在持续训练模型,但他们同时在做一件很多人忽略的事:为模型搭建可度量、可编排的工程脚手架。模型不置于这样的框架里,能力就是散的。就像一个数学天才,你不给他纸笔、不教他符号规范,他脑子里再强的定理也落不了地。衡量AI的价值,真正应该看的指标不是训练时烧了多少卡、产出多少Token,而是这个模型能在多少次人工干预下完成一个端到端的业务动作。干预从100次降到3次,那才是生产力。从这个角度讲,所有脱离工程框架谈论模型能力的做法,都像在谈论浮在空中的地基。方汉甚至没给“模型无关论”留什么面子,他直接说,模型和算力仍是长期立足的基础,但基础之上若无建筑,所谓基础只是一片昂贵的水泥地。
模型公司还在牌桌上,但筹码变了
持续训练不是信仰,是生存本能
有人可能会问:既然工程这么重要,模型还训不训?方汉的回答干脆:训,必须训。昆仑万维不仅没停,还准备发一系列新模型——音乐、具身世界、游戏世界。这听起来很不“收敛”,在一个到处喊应用落地的年份,还在扩模态、铺场景,似乎有点逆势而为。但仔细琢磨,这恰恰是一种务实的清醒。模型能力不持续迭代,工程框架再精巧也很快触及天花板。就像Claude Code这个框架再强,如果底层模型不懂代码语义,它也只能机械地匹配模式,无法处理需要抽象推理的任务。持续训练之所以是基础,不是因为表演需要,是因为AI公司唯一不该外包的就是对模型行为的深度控制权。而只有自己训练,才能拿到这个控制权。方汉没有明说的一点是:现在市面上很多所谓“应用层AI公司”,其实早已把模型内核托付给了第三方API。短期跑得快,但长期看,一旦场景需要微调、需要领域对齐,它们立刻陷入被动。昆仑万维选择在音乐和具身世界这些方向上押注,显然是在下一盘更大的棋——它要的不止是通用基座,更是能直接嵌入特定物理或创作环境的领域原生能力。这些模型生来就带着工程接口的基因,比通用模型再包装出来的应用结实得多。
算力的护城河,正在被重新定义
方汉还重申了一个老话题:算力是基础。但结合他前面的论述,这句话的语境已经截然不同。过去说算力,聊的是集群规模、单卡效率、万卡互联。现在算力的价值必须通过工程化利用率来体现。你有一万张卡,但模型推理请求的调度延迟波动巨大,有效算力利用不到百分之三十,那这一万张卡就是成本中心,不是护城河。相反,能通过Coding Agent、自动化编排层把每一瓦算力都精确导向业务价值,五千张卡可能比一万张卡更具杀伤力。方汉透露的模型发布计划,本身就隐含了对算力的重新定位:具身世界模型需要的不仅是浮点运算,还有仿真环境下的实时交互算力调度;音乐模型需要的是对长时音频超低延迟推理的优化。这些不是堆GPU就能解决的,要靠面向特定模态的算力架构设计。说到底,算力护城河不在你买了多少卡,而在你多快能把一张卡的算力变成用户可感知的体验。这层意思,方汉说得不重,但听进去的人应该会背后一凉。
AI编程提速了,也把事故率抬上去了
当代码写得比人快十倍,技术债就来了
这才是方汉整场分享里最扎心的一段。他明确警示,AI编程带来的技术债,可能让生产事故增幅达到数倍。这不是危言耸听。已经有头部互联网公司的内部数据佐证了这个趋势:引入AI辅助编码后,代码提交量翻了三倍,但线上事故中与逻辑错误相关的占比也翻了近两倍。原因并不复杂。人类工程师写代码时,天然会带着对上下游系统的恐惧——因为怕出错,所以会反复检查边界条件、异常处理、资源释放。而AI生成的代码,对这些“恐惧”毫无感知,它只会完美地完成你给的提示,不多想一步。一句“帮我写一个支付回调处理函数”,AI绝不会主动追问:如果重复回调怎么办?如果金额超出限额呢?如果数据库连接中断,重试策略是什么?它只交付你要求的那块砖,至于这块砖能不能砌进整座大厦,它不负责。这直接导致代码量暴增与代码健壮性的严重脱节。方汉说的技术债,正是这种脱节的利息。一开始你可能只欠了几处松散的代码块,但半年后,整个系统会被这些看似独立、实则相互引用的脆弱逻辑啃得千疮百孔。
代码审查再不做,就要付出几倍的代价
更可怕的是,很多团队在用上AI编程之后,悄无声息地弱化了审查机制。理由很“说得通”:AI生成的代码看起来规整、注释齐全、符合编码规范,比刚入行的初级工程师写得还漂亮,干嘛还要逐行盯?方汉的回应可以总结为一句话:不要被表面的整洁迷惑。AI代码的隐患往往蛰伏在语义层面,而不是语法层面。它能写出完全没有编译错误的逻辑,但这个逻辑可能在业务上恰好是反的。我见过一个真实案例:AI把用户权限的白名单和黑名单逻辑完全写反了,代码整洁得无可挑剔,测试用例也全部通过——因为测试用例也是同一个模型生成的。这种自我循环的正确,最终在生产环境里炸出一个安全漏洞,修复成本是人工编写时代的五倍。所以方汉强调,责任机制必须同步加强。不是简单地要求“人要看一遍”,而是要把代码审查设计成对抗性流程:用另一个模型去审查AI生成的代码,再用第三个模型对审查结果做反审查,最终由人类做裁定。听起来很复杂,但比起半夜爬起来回滚数据,这套机制的成本可以忽略不计。技术债的可怕之处在于它不立即伸手要账,而是在你完全放松警惕时,直接抽走你脚下的梯子。AI编程给了我们前所未有的速度,但如果不把这些速度拴在安全带上,翻车的场面可不会太好看。
组织吃进去的AI,迟早要消化
中层为什么首当其冲
方汉的圆桌还扯出了一个非技术线索——AI引发的组织重构。他谈到考核中层,谈到用群聊Agent当秘书。听起来像是管理技巧分享,实则暗含一个冷酷的逻辑:当AI把执行层的效率拉满,决策层的瓶颈就赤裸裸地暴露了。过去中层之所以存在,很大一部分价值在于信息中转、进度协调、风险预判。这些东西恰好是Agent最擅长吞噬的。群聊Agent当秘书不是一个玩具功能,它意味着以前需要三五个中层来回拉通的信息,现在模型实时归纳、分发给所有人。当中层的信息差优势被削平,他们的价值就必须重新定锚。方汉的“考核中层”绝不是在教HR优化绩效,而是在释放一个信号:组织架构如果不跟着AI的生产节奏调整,技术带来多少提速,管理就会带来多少内耗。很多公司引入AI后,一线员工的生产力确实翻倍了,但最后一统计团队总产出,竟然没怎么变。因为增加的输出都堵在了审批、协调、跨部门拉齐上。Ai生产力最终检验的,不是工程师写的代码行数,而是整个组织的吞吐率。这个吞吐率,卡就卡在中层的再造能力上。
Agent不是工具,是新型同事
把Agent仅仅看作秘书还低估了它的冲击力。当代码审查Agent、需求分析Agent、运维告警Agent等一系列体量轻却专业度极高的数字角色进驻工作群,它们实际在重新定义“谁算团队成员”。这些Agent没有情绪,不会请假,24小时在线,而且随着模型升级,专业判断力持续爬升。未来一个部门的核心能力,很可能不再取决于有几个十年经验的老专家,而取决于你能把多少隐性知识注入到Agent的提示工程和知识库里。方汉说“这些招可以照搬”,其实这背后藏着一个人事难题:你怎么给一个没有工号的Agent定级、定薪、定责?当它犯了错,责任链怎么追溯?这不是未来学课题,今天的AI编程事故已经敲了警钟。要想让组织真吃透AI,光把模型挂进工作流不够,必须重建一套人机协同的责任伦理和绩效体系。这件事不性感,却比任何榜单上的准确率都决定生死。方汉在这场圆桌没有给出全部答案,但他给出了足够刺痛人的问题。技术债可以借,别欠到破产的那天才想起还。

