Jev 深度评测:ChatGPT 发明者打造的非大语言模型,用概率取代幻觉

🔬 实测验证 · 非推广软文 · 独立评测

Jev 是 TypeSafe AI 本周发布的一款全新 AI 模型,创始人是 Diogo Almeida——他曾是 OpenAI 研究员,参与打造了 ChatGPT,并共同发明了 RLHF(基于人类反馈的强化学习)这项奠定当前大模型时代的关键技术。而 Jev 最特别的地方在于:它不是一个大语言模型(LLM),它不输出文本,而是输出概率。

核心能力

Almeida 在离开 OpenAI 后创办了 TypeSafe AI,目标只有一个:让 AI 真正「有用」,而不是只会说人话。他观察到,过去四年行业一直在优化「人类语言」,但计算机实际需要的是另一种语言——结构化的决策。Jev 正是为此而生。

  • 输出概率而非文本:Jev 输出的是「校准决策」(calibrated decisions),即附带置信度的判断结果,而不是一段文字
  • 不会幻觉:因为输出空间由用户预先定义,模型无法「编造」不存在的答案
  • 极低的成本:输出 token 完全免费,输入 token 按「十亿」计费,而非行业通行的「百万」
  • 极快:去掉了语言生成这一步,推理速度大幅提升
  • 「System One」模型:专注于直觉式判断,而非逐步推理

技术上,Jev 采用纯合成数据训练,用的是 Almeida 称之为「从校准决策中强化学习」(RLCD)的方法。公司对架构守口如瓶,外界猜测它可能构建在一个开源权重 LLM 之上。

使用体验 / 局限

Jev 目前通过 API 提供服务,主要面向开发者,用来做分类、路由、安全校验这类自动化任务。上线初期需求一度高到公司 API 短暂无法服务用户。

实测数据很亮眼:Vercel 的工程师用它替换 OpenAI 的 ChatGPT Luna 5.6 做命令安全分类,速度提升 5 到 18 倍,准确率反而更高;Bryo AI 的 CTO 拿它和 Gemini 比邮件分类,Gemini 准确率略高,但成本贵了 10 到 20 倍。

局限也很明确:Jev 不能生成文本,只适合「做判断」而非「写内容」;同时,它把「幻觉」问题部分转移给了用户——当模型返回 50% 的置信度时,你需要自己决定是否采信。它更像是 LLM 的「智能校验器」或「低成本路由器」,而非替代品。

综合评分

维度评分评价
功能完整度7.5 / 10专注决策/分类,非通用模型,能力单一
易用性7.0 / 10开发者导向,需预先定义输出结构
性价比9.5 / 10输出免费、输入按十亿计费,成本极低
中文支持8.0 / 10语言无关,中文场景同样适用
输出质量8.0 / 10校准概率可靠、零幻觉,部分任务略逊于 LLM

综合评分:8.0 / 10

Jev 是一款「反潮流」的产品:在大模型越做越大、越做越贵的当下,它用「放弃语言」换来了速度、成本和可靠性。对需要海量自动化判断的开发者来说,它可能是比 LLM 更务实的选项。想发现更多好用的 AI 工具,欢迎访问 AI Dash。

🔗 分享: Twitter 微博 复制链接

📬 喜欢这篇文章?

每周精选AI工具评测 + 实用教程,直接送到你面前。

订阅每周AI精选 →
🚀 想让你的 AI 工具获得深度评测?

我们的评测文章覆盖 精准搜索流量,读者正是你的目标用户。
赞助一篇独立评测,让你的工具被真正需要的人看到。

🔍 在选择AI工具? 免费对比同类工具 →
|
💎 深度横向对比 ¥99.9/终身 →

1人评论了“Jev 深度评测:ChatGPT 发明者打造的非大语言模型,用概率取代幻觉”

  1. Pingback: 决策模型爆发:Amazon 开源 Strands Decider 2B,能跑本地的 AI 选路神器 – AI Dash

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部
工具精选
1
AI文本写作
GPT-6.1 Sol 深度评测:OpenAI 效率模型再进化,五分之一价格逼近 Astra
8.8
📊AI办公效率 💻AI编程开发 📝AI文本写作 🎨AI图像生成
📬 每周 AI 精选