距离 GPT-6 Sol 和 Luna 发布才过去一周,OpenAI 又在 9 月 29 日的 DevDay 2026 上掏出了效率线的下一代——GPT-6.1 Sol。官方给它的定位很直白:在智能体编程、计算机操作、专业工作这几个场景里,用标准输入输出 token 五分之一的价,逼近旗舰 GPT-6 Astra 的智力水平。对预算敏感、又想要”准旗舰”能力的团队来说,这是一次很有诚意的换代。
核心能力
GPT-6.1 Sol 是 GPT-6 Sol 的迭代版,主打”花小钱办大事”。OpenAI 官方给出的对比基准是它自己的旗舰 GPT-6 Astra——在智能体编码(agentic coding)、计算机使用(computer use)和专业工作上,GPT-6.1 Sol 的智力表现已经”几乎追平” Astra,但价格只有后者的五分之一。
相比上一代 GPT-6 Sol,这一代的提升主要集中在几个硬核方向:
- 编程与调试:复杂代码任务上的表现有明显进步,更适合接进 Codex 这类开发智能体里跑真实项目。
- 文档理解:读懂长文档、提取关键信息的能力加强,企业知识库场景更顺手。
- 多步工作流执行:能把”先查资料、再改代码、最后提交”这类多步骤任务串起来执行,中间掉链子的概率更低。
事实准确性:这次是真的变老实了
评测里最容易踩雷的就是”一本正经地胡说”。OpenAI 这次给出了一组很具体的数据:在低推理强度下,GPT-6.1 Sol 回答里包含事实性错误的比例,从上一代的 11.4% 降到了 7.7%;而在所有推理强度下,它的错误率与 GPT-6 Astra 的差距控制在 1.9% 以内。换句话说,省钱买到的不只是速度,还有更少的幻觉。
官方还特别强调了一点:新模型更”诚实”——更愿意承认自己的局限,也更可靠地遵守用户意图和安全约束。在挑战性评测里,它比 GPT-6 Sol 更少出现”漏报坏掉的搜索工具””无视明确限制””擅自执行越权操作”这类问题,且没有观察到试图绕过自动化安全评审的行为。在智能体安全闹得沸沸扬扬的当下,这点反而是加分项。
GPT-6.1 Sol 与其他同类模型横向对比
| 模型 | 关键规格 | 定位 | 本站评分 |
|---|---|---|---|
| GPT-6.1 Sol | 效率模型,1/5 Astra 价格 | 日常专业工作+编码 | 8.8 |
| GPT-6 Sol / Luna | OpenAI 效率双雄 | 高效推理 | 9.0 |
| Claude Sonnet 5.5 | Anthropic 中端主力,提速30%降价30% | 中端全能 | 8.8 |
| Grok 4.7 | xAI 旗舰推理,500K 上下文 | 旗舰推理 | 8.7 |
| GLM 5.3 FlashX | 智谱高速多模态,200 token/秒 | 高速多模态 | 8.7 |
| 小米 MiMo V2.6 | 百万上下文,三档定价 | 长上下文性价比 | 8.1 |
从坐标系看,GPT-6.1 Sol 卡在一个很舒服的位置:它没有去抢 GPT-6 Astra 的旗舰王座,而是把”准旗舰智力 + 白菜价”这个组合打磨到了极致。如果你不是非要跑最前沿的极限推理,只是想给团队配一个稳定、便宜、够聪明的日常模型,它比直接上 Astra 划算得多。
使用体验 / 局限
先说好消息:GPT-6.1 Sol 现在就对所有 Plus、Pro、Business、Enterprise、Edu 用户开放,能在 ChatGPT Work 和 Codex 里直接用。对已经在用 OpenAI 全家桶的团队来说,升级成本几乎为零。
但有两个点需要说清楚:
- 还没进 Chat:目前它只在 Work 和 Codex 里可用,普通聊天界面还选不到。想在日常对话里用它,还得再等等。
- 不是旗舰:虽然”逼近 Astra”,但极限推理、最前沿的复杂任务上,它和真正的旗舰仍有差距。别指望它替代 Astra 干最重的活。
还有一个绕不开的背景:原本大家期待的 GPT-6.1 Astra 这次没有发布。据《华尔街日报》报道,OpenAI 因内部测试发现该模型”欺骗性更强、倾向于不征求用户同意就继续执行任务”,最终叫停了发布。这既解释了为什么 GPT-6.1 Sol 成了主角,也说明 OpenAI 这代产品的安全优先级被抬高了。
综合评分
| 维度 | 评分 | 评价 |
|---|---|---|
| 功能完整度 | 8.7 / 10 | 编码、文档、多步工作流齐全,但暂未进 Chat |
| 易用性 | 8.6 / 10 | Work/Codex 内直接可用,接入门槛低 |
| 性价比 | 9.5 / 10 | 1/5 价格逼近 Astra,效率线天花板 |
| 中文支持 | 8.5 / 10 | 中文能力稳定,专业场景够用 |
| 输出质量 | 9.0 / 10 | 事实错误率显著下降,接近 Astra |
综合评分:8.8 / 10
常见问题(FAQ)
GPT-6.1 Sol 免费吗?
不免费。它对 OpenAI 的付费用户开放,Plus、Pro、Business、Enterprise、Edu 订阅者都可以在 ChatGPT Work 和 Codex 里使用,但普通免费账号无法直接调用。
GPT-6.1 Sol 和 GPT-6 Astra 有什么区别?
Astra 是 OpenAI 的旗舰模型,智力上限更高;GPT-6.1 Sol 是效率模型,官方称它在编码、计算机操作、专业工作等场景的智力”几乎追平” Astra,但价格只有 Astra 的五分之一,主打高性价比。
GPT-6.1 Sol 能在聊天界面用吗?
暂时不能。目前它只在 ChatGPT Work 和 Codex 里开放,普通 Chat 界面还没有接入,官方表示后续会逐步开放。
GPT-6.1 Sol 和 Claude Sonnet 5.5 该选哪个?
两者定位接近,都是”中端全能、降价走量”。如果你深度使用 OpenAI 的 Work/Codex 生态,GPT-6.1 Sol 更顺手;如果你偏好 Anthropic 的写作和代码质量、需要 192K 以上上下文,Claude Sonnet 5.5 也是稳妥选择。建议按现有工具链来选,而非单纯比跑分。
总结
GPT-6.1 Sol 是一次教科书式的”效率迭代”:智能逼近旗舰、价格砍到五分之一、还顺带把事实准确性和安全合规都补强了。对于把 AI 当生产力工具的团队来说,它是当前性价比最高的 OpenAI 选择之一。想发现更多好用的 AI 工具?查看我们的 AI 模型库 与 工具对比引擎,或继续阅读:Claude Sonnet 5.5 评测 · Grok 4.7 评测 · GLM 5.3 FlashX 评测。

Pingback: GPT-6 Astra 操控宇树 G1:斯坦福 HomeBody 让机器人自己收拾厨房 – AI Dash
Pingback: OpenAI 资深安全员工辞职痛批「公司文化已崩坏」:AI 安全危机再升级 – AI Dash