Microsoft-Decision-1 深度评测:决策模型新品类,比 GPT-6 Sol 快 35 倍的路由神器

🔬 实测验证 · 非推广软文 · 独立评测

继大语言模型(LLM)和 AI Agent 之后,AI 行业又冒出了一个新品类——决策模型(decision model)。10 月 9 日,微软正式发布 Microsoft-Decision-1,一款专门用于”快速做决策”的轻量模型,已在 Microsoft Foundry 和 OpenRouter 上线。它的定位很明确:不是替代 GPT-6 去写文章、写代码,而是帮 Agent 和业务系统完成路由、分类、优先级判断、结果验证这类高频、低成本的决策任务。官方给出的核心卖点很惊人——在 36 项盲测基准里拿到最高准确率,同时比 GPT-6 Sol 快 35 倍,输入价格只要 $0.042/百万 token,输出完全免费。

决策模型是什么?和 LLM 到底差在哪

理解 Microsoft-Decision-1 的关键,是先搞清楚”决策模型”和”大语言模型”的分工差异。LLM 的核心是生成文本、推理复杂问题,每次调用都要走一遍自回归生成,成本高、延迟大;而决策模型是为结构化输出而生——它不写长文,只负责在给定的一组选项里给出判断,输出的是软件可以直接执行的结构化结果(比如”是/否”、一个选项、一个评分)。

微软官方把它定位为面向四类任务的专用模型:

  • 路由(Routing):判断”该把这个请求发给哪个模型”
  • 分类(Classification):给图片、查询、反馈打标签
  • 优先级与验证(Prioritization & Verification):给结果打分、判断要不要人工复核
  • 工作流控制(Workflow control):决定 Agent 下一步该做什么

这套思路并不孤立。就在几天前,OpenAI 刚刚推出 Decisions API,把”决策”从大模型里拆出来做成独立接口;更早之前 Amazon 也开源了 Strands Decider 2B,验证了”决策模型能跑在本地”的可行性。微软这次进场,等于给这个新品类投下了一枚重磅背书。

Microsoft-Decision-1 的核心能力

从技术细节看,Microsoft-Decision-1 是在 Qwen3.5-9B 基础上做后训练得到的,走”单次前向、快速打分”的路线。给定一组固定选项,它会为每个选项输出一个校准过的概率分数,支持”是/否””多选””评分”以及”基于评分标准(rubric)给 AI 回复或 Agent 动作打分”这几种模式。未来微软还会把它 rebase 到 MAI 和 OpenAI 模型上。

微软在技术博客里强调了三项能力,正是决策模型区别于”拿 LLM 硬凑”的地方:

  • 速度:决策任务往往是链式的,一步接一步。官方实测,P50 延迟比 GPT-6 Sol 快约 35 倍。换句话说,同样的判断任务,GPT-6 Sol 要 100ms,它只要 3ms 左右。
  • 泛化质量:在 36 项基准、近 15 万道题目上拿到最高准确率,而且这些基准在训练时是盲测的(没有见过)。这避免了”刷榜型”过拟合。
  • 鲁棒性:同样的请求用 8 种方式扰动(改措辞、换选项顺序、加噪声),决策翻转率平均只有 1.3%;当选项被换序或打乱时,翻转率为零。

还有一个容易被忽略但很实用的点:概率本身是 API 的一部分,而不只是排名。应用可以据此决定”现在直接执行、还是转人工复核”。官方声称 90% 置信度的预测,在代表性样本上十次能对九次。

实测表现:比 GPT-6 Sol 快,还便宜 200 倍

微软公布了几组内部真实用例的数据,比单纯的 benchmark 更有说服力:

  • Xbox Research 数据标注:处理 1 万+ 条开放式反馈和评论(来自问卷、Steam、Twitter/X),按主题分类。质量与 GPT-6 Sol 相当,但速度提升 14 倍、成本降低 200 倍。
  • Copilot 质检:评估聊天和 Agent 回复质量,性能可与 GPT-5.6 Luna 对标,速度却快了 100 倍。
  • 事故响应:从日志、工单、消息里检索相关知识,比 LLM 更快更准。
  • 科学发现:在自适应重规划(adaptive replanning)场景里,评分一致性是 LLM 方案的 46 倍。

这些场景的共同点是:不需要生成新内容,只需要”判断”。这正是决策模型的主场——用极低的成本,把过去被 LLM”大材小用”的环节省下来。

Microsoft-Decision-1 与其他决策/生成模型横向对比

模型定位速度/成本亮点本站评分
Microsoft-Decision-1决策模型,路由/分类/验证比 GPT-6 Sol 快 35 倍,输出免费8.7
Strands Decider 2B开源决策模型,可本地跑2B 参数,轻量本地部署—
GPT-6.1 Sol通用效率模型,生成+推理被拿来当速度基准(慢 35 倍)8.8
GPT-6 Sol / LunaOpenAI 旗舰效率双雄全能但决策成本偏高9.0
Claude Haiku 5.5Anthropic 轻量主力降价 75%,也可做轻量判断8.7

从上表能看出一个清晰的趋势:决策类任务正在从通用 LLM 里”剥离”出来,交给更小、更专、更便宜的专用模型。对开发者来说,这意味着 Agent 架构里多了一个可以显著降本提速的组件;对普通用户来说,它通常不会被直接感知,但会间接让各类 AI 应用响应更快、费用更低。

使用体验与局限

优点很突出:接入方式简单(一个结构化 API 调用即可),Foundry 和 OpenRouter 两个主流平台都能用;定价策略对高频调用非常友好——输入 $0.042/百万 token,输出免费,做大规模分类或路由时成本优势是数量级的。

局限也要说清楚:

  • 它不能生成内容,也不擅长开放式的长推理。写文章、写代码、复杂多步推理,仍然得用 GPT-6、Claude 这类 LLM。
  • 它解决的是”给定选项选一个”的问题,选项设计得好坏直接影响效果,前期需要一定的 prompt/选项工程投入。
  • 当前基于 Qwen3.5-9B,中文等非英语场景的决策表现官方没有单独公布数据,实际效果建议先在自有数据上验证。
  • 作为新品类,生态和最佳实践还在早期,能参考的现成案例不多。

综合评分

维度评分评价
功能完整度9.0 / 10是/否、多选、评分、rubric 打分全覆盖,场景明确
易用性8.5 / 10单次 API 调用,Foundry/OpenRouter 双平台,上手快
性价比9.5 / 10输出免费,输入极便宜,高频调用成本优势巨大
中文支持7.5 / 10多语言基准有覆盖,但官方未单独披露中文数据
输出质量9.0 / 1036 项盲测基准最高准确率,鲁棒性好

综合评分:8.7 / 10

常见问题(FAQ)

Microsoft-Decision-1 是什么?

它是微软 2026 年 10 月发布的决策模型,专门用于路由、分类、优先级判断、结果验证等结构化决策任务,而不是生成文本。基于 Qwen3.5-9B 后训练,主打速度快、成本低、准确率高。

Microsoft-Decision-1 免费吗?怎么收费?

输入 token 收费 $0.042 美元/百万 token,输出 token 完全免费。相比按输入输出都收费的通用 LLM,做高频决策任务时成本能降一到两个数量级。

怎么接入 Microsoft-Decision-1?

两条路:一是在 Microsoft Foundry 的模型目录(ai.azure.com)里直接调用;二是通过 OpenRouter 平台调用。都只需要一次结构化 API 请求,传入选项即可拿到概率分数。

决策模型和 GPT-6、Claude 这些大模型有什么区别?

大模型负责生成和复杂推理,决策模型只负责”在给定选项里做判断”。决策模型快几十倍、便宜数百倍,但不能写文章、写代码。两者是分工关系,Agent 系统里经常配合使用——大模型干活,决策模型把关和调度。

它适合什么场景?

最适合高频、低延迟、需要结构化输出的环节:内容审核分类、客服工单路由、AI 回复质检、用户反馈打标、Agent 工作流里的下一步决策等。不适合开放式内容生成和长链条推理。

想了解更多新模型和工具?可以浏览我们的 AI 模型库,或使用 工具对比引擎 按场景选型。相关阅读:GPT-6.1 Sol 深度评测 · GPT-6 Sol 与 Luna 评测 · Strands Decider 2B 决策模型。

🔗 分享: Twitter 微博 复制链接

📬 喜欢这篇文章?

每周精选AI工具评测 + 实用教程,直接送到你面前。

订阅每周AI精选 →
🚀 想让你的 AI 工具获得深度评测?

我们的评测文章覆盖 精准搜索流量,读者正是你的目标用户。
赞助一篇独立评测,让你的工具被真正需要的人看到。

🔍 在选择AI工具? 免费对比同类工具 →
|
💎 深度横向对比 ¥99.9/终身 →

1人评论了“Microsoft-Decision-1 深度评测:决策模型新品类,比 GPT-6 Sol 快 35 倍的路由神器”

  1. Pingback: OpenAI 一次性放出近 400 项数学成果:700 篇手稿,数学家直呼纯疯狂 – AI Dash

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部
工具精选
1
未分类
Microsoft-Decision-1 深度评测:决策模型新品类,比 GPT-6 Sol 快 35 倍的路由神器
8.7
2
AI文本写作
Claude Haiku 5.5 深度评测:75% 降价背后的数倍性能跃升
8.7
📊AI办公效率 💻AI编程开发 📝AI文本写作 🎨AI图像生成
📬 每周 AI 精选