让 AI 干活最让人搓火的,不是它不够聪明,而是你得把同一件事翻来覆去解释三遍。DAIR.AI 的 Elvis Saravia 直接点破这个痛点:别再跟单个提示词较劲了,真正该升级的是交互单元本身。他提出把颗粒度从“提示”拉升到“任务”——一次扔过去的不再是一行字,而是一个打包好的上下文包裹。语音备忘、屏幕截图、标注文本、甚至随手划拉的几条红线,全部作为前端信息一次性加载,让智能体在对话一开始就拿到接近人脑的理解材料。这个念头不凭空,是受了 Karpathy 最近关于长语音会话可以成为一种超级提示的启发,Saravia 把它从语音扩展成了多模态的实战框架。
效果立竿见影。过去你得先发指令,等 AI 跑偏再修正,再跑偏再修正,像一个不断掉头的网约车。现在整个任务上下文预先打满,智能体等于上车前已经看了地图、听了行程口述、扫了一眼你的日程表,单次会话里就能直接驶向终点。这背后藏着一个朴素的真理:智能体的瓶颈早就不是模型能力,而是上下文注入的效率。把语音、屏幕和文本几条河流汇进同一个入口,减少的不是推理时间,是那种“你根本没听懂我”的反复摩擦。做 agent 的人一看就懂,方法算不上重,但恰好打在最吃劲的关节上。与其继续在提示词模板里卷,不如把力气花在让机器第一次就拿到完整的故事。
值得留一手的,是这种前端加载上下文的思路几乎不挑模型。你手里已经有语音转写、有截图工具、有笔记软件,把它们拼成一个任务包的成本远低于训练一个新代理。Saravia 没说这是银弹,但给出了一个极其实用的转向:别总想着让 AI 猜你的心,直接把心掏给它看。这件事听起来简单,做出来却足以改变你和智能体之间的每一回合。

