大语言模型(LLM)统治 AI 世界两年多之后,一类全新的模型正在快速崛起——决策模型(Decision Model)。它们不再生成文字,而是专门做一件事:从几个预设选项里挑出最该做的那一个,并给出置信度。就在本周,Amazon 开源了自家第一款决策模型 Strands Decider 2B,同周 OpenAI 也发布了类似产品。加上最早提出这个概念的 TypeSafe「Jev」,一场围绕「AI 到底该不该用大炮打蚊子」的军备竞赛正式开打。
什么是决策模型?和 LLM 到底差在哪
普通 LLM 的工作方式是「生成文本」:你问它一句,它逐字逐词地把答案写出来。而决策模型的工作方式是「做选择」:你给它一组已经确定的选项(比如「下一步是查数据库、调 API、还是等用户输入」),它直接返回一个选择,并附上一个置信度分数。
这背后其实是一个很朴素的工程判断:AI Agent(智能体)在跑工作流时,很多步骤根本不需要「想一段话」,只需要「选一个下一步」。让一个几百上千亿参数的 LLM 去判断「该不该重试」是巨大的浪费——又慢又贵,还容易在开放生成里跑偏。
- 输出是封闭的:只在预设选项里选,不会胡编乱造
- 带置信度:能告诉你它对自己这个选择有多确定,方便上层做兜底
- 又小又快:通常只有几十亿参数,本地就能跑,延迟和成本都低一个量级
本站此前已经深度评测过这一品类的开创者——Jev 深度评测,那篇文章解释了 Jev 如何「用概率取代幻觉」。简单说,幻觉是生成式模型的天性,而决策模型的封闭输出从根上把幻觉这条路径堵死了。
Amazon Strands Decider 2B:能跑在本地的开源决策模型
Amazon 这次发布的 Strands Decider 2B 来自 AWS 内部的一个小项目。据 TechCrunch 报道,AWS 杰出工程师 Marc Brooker 在看到 Jev 之后,试着「自己造一个」,结果这个业余项目一度冲上了 Jevbench 排行榜同尺寸模型的第一名,于是被 Amazon 正式收编、清洗后开源发布。
和 Jev 一样,Strands Decider 2B 也是「站在 LLM 肩膀上」的模型——它基于 Qwen3.5 的 2B 版本作为「躯干」,但训练目标从生成文字改成了输出校准过的选择。这意味着它保留了 LLM 的语言理解和常识,却专精于「判断下一步做什么」。
对开发者来说,它有几个实打实的好处:
- 完全开源,现在就能下载使用
- 小到能本地运行,不需要云 GPU
- 延迟低、成本低,适合嵌进高频调用的 Agent 循环
- 置信度输出,让工作流可以「不确定就回退到大模型」
Jev 之后,巨头为何集体下场
TypeSafe 用经济学家 William Stanley Jevons 的名字为模型命名,别有用意:Jevons 悖论说的是「某样东西的成本下降,反而会刺激它的需求暴增」。放在 AI 语境里就是——当「智能」的边际成本降到足够低,对它的消耗会指数级增长。而决策模型,正是把 Agent 里高频、重复的「小决策」从昂贵的大模型里剥离出来,用便宜的专用模型承接。
自 TypeSafe 推出 Jev 以来,研究者们已经复刻出了几十个同类模型。OpenAI 本周也跟进发布了类似产品(据称是为了给自己的「蜂群式 Agent」降本)。Brooker 坦言,真正的难点在于在不牺牲通用智能的前提下,把决策速度和校准精度推到极限——这是个微妙的平衡。
不过他也认为,这块市场未必是巨头通吃。因为决策模型的训练成本远低于大模型,做出一个有意思的东西可能只要几百到几千美元,中小团队完全有机会。TypeSafe CEO Diogo Almeida 则更直接:「现在这批更像是 ML 工程师想复现一个酷架构,而不是真心想把智能做有用。」
决策模型对开发者意味着什么
如果你在搭 AI Agent,决策模型最实用的场景是工作流路由:把「下一步该调用哪个工具」「这个任务要不要重试」「结果是否可信」这类判断,从主模型里抽出来交给决策模型。主模型只负责需要真正「动脑」的环节,决策模型负责高频、廉价的「选路」。
这和本站之前报道的 NVIDIA 失控智能体管控平台 思路一脉相承——Agent 越普及,越需要一层轻量、可靠的「控制层」。决策模型,正是这层控制层里的核心零件。想看更多这类基础设施型 AI 工具,可以逛逛我们的 AI 模型库 和 工具对比引擎。
常见问题(FAQ)
决策模型和大语言模型有什么区别?
大语言模型生成文本,决策模型从预设选项里做选择并给出置信度分数。决策模型输出是封闭的、带校准概率,因此几乎没有幻觉,而且参数小、速度快、成本低,适合嵌入 AI Agent 的高频工作流。
Amazon Strands Decider 2B 免费吗?
完全免费开源,现在就能下载使用。它只有 20 亿参数,基于 Qwen3.5-2B 构建,小到可以在本地电脑运行,不需要云 GPU 或 API 费用。
Jev 是什么?
Jev 是 TypeSafe 公司推出的首个决策模型,名字取自经济学家 William Stanley Jevons。它是这类模型的鼻祖,本站有详细的 Jev 深度评测,解释了它如何用概率取代幻觉。
决策模型能替代 GPT、Claude 这类大模型吗?
不能,它们是互补关系。决策模型擅长高频的「小决策」,真正需要深度理解、写作、推理的环节仍然要靠大模型。实际工程里通常让决策模型当路由,遇到不确定时回退到 Claude 或 GPT 这类大模型兜底。
普通人用得上决策模型吗?
决策模型主要面向开发者搭建 AI Agent。普通用户不用直接接触它,但它会以「更便宜、更快、更稳定的智能体」的形式,间接改善你使用的 AI 产品体验。
想发现更多好用的 AI 工具?查看我们的 AI 模型库 与 工具对比引擎,或继续阅读:Jev 深度评测 · GLM 5.2 评测 · DeepSeek V4 Pro 评测。
