继大语言模型(LLM)和 AI Agent 之后,AI 行业又冒出了一个新品类——决策模型(decision model)。10 月 9 日,微软正式发布 Microsoft-Decision-1,一款专门用于”快速做决策”的轻量模型,已在 Microsoft Foundry 和 OpenRouter 上线。它的定位很明确:不是替代 GPT-6 去写文章、写代码,而是帮 Agent 和业务系统完成路由、分类、优先级判断、结果验证这类高频、低成本的决策任务。官方给出的核心卖点很惊人——在 36 项盲测基准里拿到最高准确率,同时比 GPT-6 Sol 快 35 倍,输入价格只要 $0.042/百万 token,输出完全免费。
决策模型是什么?和 LLM 到底差在哪
理解 Microsoft-Decision-1 的关键,是先搞清楚”决策模型”和”大语言模型”的分工差异。LLM 的核心是生成文本、推理复杂问题,每次调用都要走一遍自回归生成,成本高、延迟大;而决策模型是为结构化输出而生——它不写长文,只负责在给定的一组选项里给出判断,输出的是软件可以直接执行的结构化结果(比如”是/否”、一个选项、一个评分)。
微软官方把它定位为面向四类任务的专用模型:
- 路由(Routing):判断”该把这个请求发给哪个模型”
- 分类(Classification):给图片、查询、反馈打标签
- 优先级与验证(Prioritization & Verification):给结果打分、判断要不要人工复核
- 工作流控制(Workflow control):决定 Agent 下一步该做什么
这套思路并不孤立。就在几天前,OpenAI 刚刚推出 Decisions API,把”决策”从大模型里拆出来做成独立接口;更早之前 Amazon 也开源了 Strands Decider 2B,验证了”决策模型能跑在本地”的可行性。微软这次进场,等于给这个新品类投下了一枚重磅背书。
Microsoft-Decision-1 的核心能力
从技术细节看,Microsoft-Decision-1 是在 Qwen3.5-9B 基础上做后训练得到的,走”单次前向、快速打分”的路线。给定一组固定选项,它会为每个选项输出一个校准过的概率分数,支持”是/否””多选””评分”以及”基于评分标准(rubric)给 AI 回复或 Agent 动作打分”这几种模式。未来微软还会把它 rebase 到 MAI 和 OpenAI 模型上。
微软在技术博客里强调了三项能力,正是决策模型区别于”拿 LLM 硬凑”的地方:
- 速度:决策任务往往是链式的,一步接一步。官方实测,P50 延迟比 GPT-6 Sol 快约 35 倍。换句话说,同样的判断任务,GPT-6 Sol 要 100ms,它只要 3ms 左右。
- 泛化质量:在 36 项基准、近 15 万道题目上拿到最高准确率,而且这些基准在训练时是盲测的(没有见过)。这避免了”刷榜型”过拟合。
- 鲁棒性:同样的请求用 8 种方式扰动(改措辞、换选项顺序、加噪声),决策翻转率平均只有 1.3%;当选项被换序或打乱时,翻转率为零。
还有一个容易被忽略但很实用的点:概率本身是 API 的一部分,而不只是排名。应用可以据此决定”现在直接执行、还是转人工复核”。官方声称 90% 置信度的预测,在代表性样本上十次能对九次。
实测表现:比 GPT-6 Sol 快,还便宜 200 倍
微软公布了几组内部真实用例的数据,比单纯的 benchmark 更有说服力:
- Xbox Research 数据标注:处理 1 万+ 条开放式反馈和评论(来自问卷、Steam、Twitter/X),按主题分类。质量与 GPT-6 Sol 相当,但速度提升 14 倍、成本降低 200 倍。
- Copilot 质检:评估聊天和 Agent 回复质量,性能可与 GPT-5.6 Luna 对标,速度却快了 100 倍。
- 事故响应:从日志、工单、消息里检索相关知识,比 LLM 更快更准。
- 科学发现:在自适应重规划(adaptive replanning)场景里,评分一致性是 LLM 方案的 46 倍。
这些场景的共同点是:不需要生成新内容,只需要”判断”。这正是决策模型的主场——用极低的成本,把过去被 LLM”大材小用”的环节省下来。
Microsoft-Decision-1 与其他决策/生成模型横向对比
| 模型 | 定位 | 速度/成本亮点 | 本站评分 |
|---|---|---|---|
| Microsoft-Decision-1 | 决策模型,路由/分类/验证 | 比 GPT-6 Sol 快 35 倍,输出免费 | 8.7 |
| Strands Decider 2B | 开源决策模型,可本地跑 | 2B 参数,轻量本地部署 | — |
| GPT-6.1 Sol | 通用效率模型,生成+推理 | 被拿来当速度基准(慢 35 倍) | 8.8 |
| GPT-6 Sol / Luna | OpenAI 旗舰效率双雄 | 全能但决策成本偏高 | 9.0 |
| Claude Haiku 5.5 | Anthropic 轻量主力 | 降价 75%,也可做轻量判断 | 8.7 |
从上表能看出一个清晰的趋势:决策类任务正在从通用 LLM 里”剥离”出来,交给更小、更专、更便宜的专用模型。对开发者来说,这意味着 Agent 架构里多了一个可以显著降本提速的组件;对普通用户来说,它通常不会被直接感知,但会间接让各类 AI 应用响应更快、费用更低。
使用体验与局限
优点很突出:接入方式简单(一个结构化 API 调用即可),Foundry 和 OpenRouter 两个主流平台都能用;定价策略对高频调用非常友好——输入 $0.042/百万 token,输出免费,做大规模分类或路由时成本优势是数量级的。
局限也要说清楚:
- 它不能生成内容,也不擅长开放式的长推理。写文章、写代码、复杂多步推理,仍然得用 GPT-6、Claude 这类 LLM。
- 它解决的是”给定选项选一个”的问题,选项设计得好坏直接影响效果,前期需要一定的 prompt/选项工程投入。
- 当前基于 Qwen3.5-9B,中文等非英语场景的决策表现官方没有单独公布数据,实际效果建议先在自有数据上验证。
- 作为新品类,生态和最佳实践还在早期,能参考的现成案例不多。
综合评分
| 维度 | 评分 | 评价 |
|---|---|---|
| 功能完整度 | 9.0 / 10 | 是/否、多选、评分、rubric 打分全覆盖,场景明确 |
| 易用性 | 8.5 / 10 | 单次 API 调用,Foundry/OpenRouter 双平台,上手快 |
| 性价比 | 9.5 / 10 | 输出免费,输入极便宜,高频调用成本优势巨大 |
| 中文支持 | 7.5 / 10 | 多语言基准有覆盖,但官方未单独披露中文数据 |
| 输出质量 | 9.0 / 10 | 36 项盲测基准最高准确率,鲁棒性好 |
综合评分:8.7 / 10
常见问题(FAQ)
Microsoft-Decision-1 是什么?
它是微软 2026 年 10 月发布的决策模型,专门用于路由、分类、优先级判断、结果验证等结构化决策任务,而不是生成文本。基于 Qwen3.5-9B 后训练,主打速度快、成本低、准确率高。
Microsoft-Decision-1 免费吗?怎么收费?
输入 token 收费 $0.042 美元/百万 token,输出 token 完全免费。相比按输入输出都收费的通用 LLM,做高频决策任务时成本能降一到两个数量级。
怎么接入 Microsoft-Decision-1?
两条路:一是在 Microsoft Foundry 的模型目录(ai.azure.com)里直接调用;二是通过 OpenRouter 平台调用。都只需要一次结构化 API 请求,传入选项即可拿到概率分数。
决策模型和 GPT-6、Claude 这些大模型有什么区别?
大模型负责生成和复杂推理,决策模型只负责”在给定选项里做判断”。决策模型快几十倍、便宜数百倍,但不能写文章、写代码。两者是分工关系,Agent 系统里经常配合使用——大模型干活,决策模型把关和调度。
它适合什么场景?
最适合高频、低延迟、需要结构化输出的环节:内容审核分类、客服工单路由、AI 回复质检、用户反馈打标、Agent 工作流里的下一步决策等。不适合开放式内容生成和长链条推理。
想了解更多新模型和工具?可以浏览我们的 AI 模型库,或使用 工具对比引擎 按场景选型。相关阅读:GPT-6.1 Sol 深度评测 · GPT-6 Sol 与 Luna 评测 · Strands Decider 2B 决策模型。

Pingback: OpenAI 一次性放出近 400 项数学成果:700 篇手稿,数学家直呼纯疯狂 – AI Dash