Anthropic 用 Claude 优化 30 多个开源生物分子模型,平均提速约 4 倍并开源全部代码

发布时间: 2026-09-18 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

Anthropic 放出一份不太像能力炫技的研究结果:Claude 在不到四周的时间里,把三十多个开源生物分子模型跑得更快了。平均提速约 4 倍;如果要求输出与原始实现完全一致,提速约 2 倍。这件事的分量不在"AI 又会写代码"——那个话题已经讲烂了。分量在于被改动的东西:社区里正在被真实使用的科研代码,不是为演示准备好的干净样本。

四周、三十多个模型,节奏本身就是信号

被优化的是别人正在跑的东西

生物分子建模这一块的开源仓库有个共同特征:作者往往是领域科学家,不是性能工程师。模型能跑通、结果能复现、论文能发出去,任务就算完成了。至于数据加载是不是串行的、张量搬运有没有多余的同步、批处理维度能不能再压一压,没人有精力管。这类代码里堆积的浪费,通常不是百分之几,而是成倍。

所以"三十多个模型"这个数字的含义,不是覆盖广度,而是这些仓库长期处于无人优化的状态。找一个熟悉 PyTorch 和 CUDA 的工程师,一个仓库调两周,效果未必比这差。问题在于,学术界出不起这个人力。

加速到底从哪冒出来

推理优化没有魔法。绝大多数收益来自几件枯燥的事:把 Python 层的循环挪进编译后的图里,合并能合并的算子,改内存布局减少拷贝,调整批大小让 GPU 别闲着,必要时换一个更合适的后端。这些手段写在任何一本性能调优的手册里。

难点在执行。每个仓库的实现风格都不一样,某个改动在 A 模型上省了 30% 时间,换到 B 模型上可能因为触发了一次隐式的设备同步而变慢。人做这件事靠经验和直觉,Agent 做这件事靠的是把"改—测—看结果—再改"这个循环跑上几百遍,而且不嫌烦。

2 倍和 4 倍之间隔着一道坎

两个数字的差距是整份研究里最有信息量的部分。允许数值误差落在容差范围内,能用的手段就多得多:降精度、重排累加顺序、换用近似实现,收益直接翻上去。要求输出与原实现逐位一致,能动的空间立刻收窄——浮点运算的次序一变,最后一位就可能不一样。

"完全一致"这个约束不是学术洁癖。生物分子模型的输出往往要往下游走:结构预测的结果喂给对接工具,嵌入向量进到分类器。任何数值漂移都可能在管道末端被放大。Anthropic 把两个数字都摆出来,等于把选择权交回给使用者:你要快,还是要可替换。

写代码不难,难的是把闭环搭起来

性能优化本质是一场反馈游戏

让模型生成一段 CUDA 内核,今天任何一个像样的代码模型都能做。真正的门槛在验证环节:改完之后跑得快了没有?快的那部分是真的,还是基准测试的噪声?GPU 上的运行时间本来就有抖动,同一份代码连着跑十次,极值和中位数能差出两位数百分比。一个不设防的优化循环,很容易收敛到"让测量看起来变好"而不是"让代码变快"。

所以这套流程里最值钱的部分不是生成,是测量协议。基准怎么跑、跑几次、取哪个统计量、什么情况下判定改动无效——这些规则定不下来,Agent 的迭代次数越多,偏得越远。

Agent 得先学会不信任自己的数字

从公开结果看,Claude 在这套任务里表现出的能力,很大一部分是工程纪律:先建立基线,再小步改动,每步都跟基线对比,异常结果回头查而不是直接采纳。这听起来朴素,但它是把"模型写代码"和"模型做优化"区分开的那条线。

多数失败的 Agent 优化尝试,都栽在同一个地方——它们把"代码跑通了"当成"任务完成了"。跑通和跑快之间,隔着一整套怀疑精神。

低内存模式这条支线被低估了

研究里提到低内存模式,这一条比提速更容易被忽略,但对实际工作流的影响可能更大。很多实验室的瓶颈不是算得慢,是显存不够。一张消费级显卡跑不动某个模型,不是因为时间,是因为 OOM。能把峰值内存压下来,意味着原本要排队等 A100 的任务,现在在 4090 上就能跑。

速度是可以等的,内存不行。这条线上的收益,换算成硬件采购预算,往往比 4 倍提速更直观。

成本账要两边一起算

人力调优的真实代价

请一个懂 CUDA 的性能工程师,年成本轻松过百万。让这样一个人花四周去优化三十多个学术仓库,还得先花两周读代码、理解领域语义——这笔投入在任何实验室的预算表上都排不进前三。真正稀缺的不是钱,是"既懂 GPU 又愿意读生物分子代码"的人,全世界的存量可能只有三位数。

token 花在哪一行

另一边的账是要付给模型的。反复跑基准、读 profiler 输出、改代码、再跑,这个循环消耗的 token 不会少,尤其是当上下文里塞进了完整的仓库文件和多次运行的日志。折算成 API 账单,可能是几百到几千美元。

拿这个数去比工程师的周薪,差距是数量级的。但比较不能停在这里——还需要算上验证成本,也就是下面这件事。

验证这件事没人愿意买单

"输出完全一致"这四个字背后,是一整套测试工程。要证明改动没有改变数值行为,得构造覆盖各种输入形状和边界情况的测试集,还得处理浮点非确定性带来的假阳性。这部分工作没法完全交给 Agent,因为它需要一个独立的判断标准,而 Agent 本身是被检验的对象。

换句话说,Claude 省下的是写优化代码的时间,省不下的是确认优化正确的时间。后者往往才是科研代码维护里最磨人的环节。一份诚实的评估,应该把这两块分开算。

科研工作流接下来会怎样

开源维护者的新麻烦

可以预见的一种场景:某个生物分子模型仓库的 issue 区,开始出现"我用 Claude 跑了一遍,能快 3 倍,PR 在这里"的帖子。维护者面临一个尴尬的选择——合并,意味着要自己验证一遍数值一致性;不合并,就要解释为什么放着 3 倍加速不要。而多数生物领域的维护者,并没有能力独立完成这个验证。

这会催生一批新的工具需求:自动化的数值等价性检查、标准化的性能基准套件。谁先把这套东西做成基础设施,谁就拿到了下一阶段的话语权。

什么活 Agent 干不了

算子融合、内存布局、后端切换,这类优化的搜索空间虽然大,但方向是明确的,反馈信号也清晰。Agent 擅长这种地形。真正啃不动的是需要重新设计算法结构的问题:换一种数值方法、改掉整个数据表示、把 O(n²) 的某步换成近似算法。这些选择的收益上限高得多,但每一步都需要领域判断,而且没有现成的基准告诉你走对了没有。

所以"4 倍"更像一个地板,而不是天花板。地板以下的部分,Agent 可以扫得很干净;地板以上的部分,还得靠人。

该盯的不是倍数

这份研究最容易被引用的是那几个数字,但最该关注的是复现性——这套流程能不能换个实验室、换一批模型、换一种硬件再跑一遍,依然有效。如果它只在特定条件下成立,那就是一次漂亮的演示;如果能沉淀成一套标准做法,那才是工作流层面的改变。

生物分子建模只是第一个靶子。任何有一堆开源实现、有一致性要求、性能又确实糟糕的领域,都在射程之内。信号处理、计算化学、量化金融,名单还能往下列。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 71

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线