Unsloth 这次没去卷通用对话,而是把 LLM 微调成决策模型。它发布了一套教程和开源仓库,能把 Qwen3.8、Gemma 4 这类模型改造成输出选项概率的决策器。最扎眼的数据是 Qwen3.5 0.8B:在三个决策基准上,合计准确率从 20.7% 拉到 74.3%,显存只要 4GB。小模型干决策,不是噱头,是算得过账。
决策模型和聊天机器人是两回事。聊天模型追求说得像人,决策模型要的是在多个选项里给出概率分布,让不确定性变得可计算。Unsloth 的做法把微调目标从“生成文本”扭到“输出概率”,这正好戳中很多业务场景的痛点:路由器、推荐、风控、自动化工作流,它们不需要一段漂亮回答,只需要一个靠谱的倾向值。4GB 显存意味着普通显卡、甚至部分边缘设备都能跑,部署成本被压到极低。
当然,三个基准的 74.3% 不能直接等同于真实世界表现。基准任务、数据分布、评测方式都会影响结果,泛化能力还得看后续复现。但 Unsloth 释放的信号很明确:把 LLM 当决策引擎,小参数模型也能交出漂亮答卷。如果这套仓库和教程把门槛降到人人可试,接下来会冒出一批轻量决策应用。别只盯着千亿参数了,方向对了,0.8B 也能打硬仗。

