别再指望 AI 一键生成完美幻灯片了。Vista 在 bento PPT 上动的手脚,把一个原本安静躺着的开源项目,变成了一个可以直接吃进主题、吐出可编辑 HTML 幻灯片的 Skill。安装指令就一行:npx skills add joeseesun/qiaomu-bento-ppt。配上一个前端审美在线的模型,比如 Kimi K3 或者 Opus 4.8+,几分钟之内你就能拿到一套结构清晰、视觉不拉垮的演示页面。但这不代表你可以把“设计感”三个字外包给机器。事实刚好相反——这个工具越顺手,你越容易看清一件事:审美这件事,模型只是替你执行,不是替你决策。
一个 Skill 是怎么长出来的
从 bento 到乔木,一个前端开发者的简笔
bento PPT 原本就是一个轻量的 HTML 幻灯片框架,讲究模块化、栅格感,天生带着一股“开发者做演示”的冷淡审美。Vista 把它改造成 Skill,核心动作不是加功能,而是搭了一座桥——让大模型可以直接通过自然语言指令,把内容、布局、风格一次性地编译成 HTML。你输入的可以是产品方案、周报总结、课程大纲,也可以是一句模模糊糊的“帮我做一个关于远程协作文化的分享”。Skill 调起模型,模型生成代码,代码渲染成幻灯片。整个过程里没有 PPT 文件,没有模板市场,没有拖拽对齐。这很优雅。但也因此,把压力全都推到了模型的审美判断上。
指令进去,HTML 出来,中间隔着什么
表面上看,你只给了模型一段话,它还了你一整套网页幻灯片。实际上,这个 Skill 在中间塞进了一层约束:bento 的网格系统、配色变量、组件风格,都被提前打包成 prompt 里的上下文。模型不是从零画布,而是带着一套“设计基因”在拼积木。所以结果很少出现灾难级的丑陋,但也不轻易抵达惊艳。它更像一个水平稳定的 intern 设计师,永远给你 70 分的东西——能用,甚至体面,但缺口气。而这种缺的那口气,恰好是你个人的叙事节奏和视觉意图。模型不会替你把“我们为什么做这个”翻译成一张有张力的对比图,它只会忠实地把要点排进卡片。
Kimi K3 和 Opus,谁更懂排版
为什么 Vista 推荐这两个模型
Skill 的作者很清楚:工具只是锅,模型才是那个炒菜的人。不同的模型对 HTML 和 CSS 的语感差距极大。Kimi K3 在中文排版和页面节奏上的表现被点名表扬,尤其是处理大量文字内容时,段落的呼吸感、留白和卡片圆角,都更贴近一个人类设计师的直觉。Opus 4.8+ 则胜在结构感更强,配色更克制,不会动不动就上渐变色和阴影,适合偏正式的企业内部汇报。但两者的共同点是——都能产出“让人愿意继续改下去”的初稿。你没看错,只是初稿。真正能让幻灯片活起来的,依然是你在那个可编辑的 HTML 页面上动手调文案、换比喻、删掉多余的那三页。
审美天花板依然是人
我把同一个“新消费品牌增长复盘”的主题分别喂给 Kimi K3 和 Opus,结果出片都很快,一个偏叙述风,一个偏数据仪表盘风。但两者都犯了一个同样的毛病:每一页都像信息容器,却没有叙事势能。幻灯片被做成了排版精美的知识百科,而不是一个会说话的演讲者辅助工具。这恰恰暴露了当前模型的最大盲区——它理解“信息”,却不理解“说服”。它会把你的结论加粗,但不知道在前一页埋一个伏笔,也不知道在关键转折页用留白制造停顿。这些,是 Skill 装不进去的,得靠你自己。
协作与在线演示,PPT 终于从文件变成地址
URL 一发,演示厅就绪
生成的 HTML 幻灯片天然可在线访问,无需导出、转码、上传云盘。直接部署到 GitHub Pages 或任何静态服务器上,一个链接就能完成演示。对远程团队来说,这份轻便感杀伤力极强。你不再需要忍受“版本 3.1 最终版(绝不改).pptx”这种文件命名灾难,也不用担心接收方没有安装对应字体。更关键的是,协作的门槛被打下来了——任何人都可以在浏览器里查看源码、修改文字、调整顺序,甚至 fork 一个自己的版本。这比共享 PowerPoint 实时协作要灵活得多,也危险得多。
团队协作的想象力与尴尬
正因为生成出来的是纯前端页面,理论上整个团队都可以在同一个 HTML 文件上“动手动脚”。但现实中,这种自由反而放大了内容生产的老问题:谁有权拍板?谁的品味算数?当每个人都能改一下标题颜色、挪动一张图表时,幻灯片就不再是表达工具,而变成了权力博弈场。Skill 解决了技术层面的协作,却没有——也不可能——解决人与人之间对“好看”的认知鸿沟。76 分的评价里,有 10 分我扣在这里。
给 76 分,不是因为不够好
缺失的那 24 分去了哪里
Vista 这个作品,我给 76/100。不是因为功能缺胳膊少腿,而是它诚实得有点残酷。它让你看清楚:当一个 AI 工具把生成成本压到近乎为零之后,剩下的比拼全在于人的判断力。审美决策、叙事结构、情绪节奏,这些才是区分一场平庸汇报和一次精彩分享的关键。Skill 把这部分留给你自己去填,这是对的。但也意味着,如果你本身对“怎样才算一套好幻灯片”没有体感,那你最终得到的,不过是一套格式更漂亮的平庸。
开源生态的下一步,不该只是更多模板
bento PPT + Skill 的组合已经跑通了“主题 → 可编辑 HTML”的链路。接下来最值得期待的,不是再出一百套模板,而是有人在 prompt 层面做出叙事引擎——让模型学会设置悬念、掌握节奏、懂得什么时候该沉默。同时,也需要更好的评测标准,不是只看页面美观度,而是看幻灯片作为沟通载体的说服效率。这才是这个赛道剩下的硬骨头。
不要把你的表达能力外包给模型
Skill 是镜子,不是拐杖
我用这个 Skill 生成了不下二十套幻灯片,最深的感触是:它模仿不了你的语气,也猜不到你的临场发挥。它可以帮你快速搭建骨架,却没办法替你决定哪一页讲得慢一点、哪一句话该删掉。如果你习惯性地把内容全部丢给它,然后不加修改地拿去做演示,听众会察觉到的——那种微妙的“不对劲”,就像在听一个没有语调起伏的朗读机器人。所以,把它当作一个高水平的草稿生成器,而不是成品交付工具。这才是对它最好的尊重。
我们真正需要的是叙事能力
不客气地说,大多数人做不好幻灯片,不是因为工具不够聪明,而是因为自己没想清楚要讲什么。一键生成解决的是排版焦虑,不是认知焦虑。如果你连“今天这场汇报的核心冲突是什么”都答不上来,任凭模型审美再高级,也只是给你一个更贵的水晶棺。乔木这个 Skill 真正的价值,是帮你快速越过技术门槛,把省下来的时间,拿去打磨那个真正值得被听到的故事。

