Jev是分类器吗?今天向所有人开放,送1.2亿token

作者:机器之心 发布:2026-09-21 15:24 收录:2026-09-21 18:17 2 次阅读 约 1648 字
摘要:简单把 Jev 看成一个分类器,很容易低估它。
推荐理由:本文涵盖「JEV」、「GPT-6 Astra」、「开源」等多个主题,重点关注 JEV。
机器之心编辑部


最近大火的 Jev 模型正式公开可用了,还送起步额度。


一大早,Jev 公司 TypeSafe AI 发布官方公告,Jev 现已向所有人开放,无需候补名单。


他们还补充说:所有用户初始都有 5 美元额度,大约相当于 1.2 亿 token。



体验链接:https://console.typesafe.ai/login


过去几天,Jev 在社交平台引发了大量讨论。它是一款专门处理结构化判断的 AI 模型,开发者提供一段上下文,再提出一个范围明确的问题,Jev 就会返回可供程序直接使用的答案和概率。



有网友拿它和 GPT-6 Astra 在 Minecraft 里打赢了末影龙,只用了 8 分 43 秒。



据该网友介绍,总成本不到 1 美元,其中 Jev 花了 0.01 美元,Astra 花了 0.96 美元。目前已开源完整代码。



开源地址:https://github.com/rmalde/minecraft-agent


一个专门做判断的模型


TypeSafe AI 将 Jev 称为「System One model」,也就是系统一模型。


这个概念来自人类的快速思考机制。面对一个问题,我们往往会先凭经验作出直觉判断,再决定是否需要深入分析,Jev 扮演的就是这个快速判断角色。


使用时,开发者先提供一段背景信息,也就是 state,随后定义需要回答的问题,以及允许选择的答案,Jev 会返回结构化结果,并给出相应概率。



以客服工单为例,开发者可以让 Jev 判断工单应该交给哪个团队、是否需要人工审核,以及问题的严重程度。


这些问题对应三种主要输出形式。


Choice 用于选择一个答案,例如支付、账户或前端;Noul 返回某件事发生的概率,例如需要人工审核的可能性;Score 则将结果放入一个有序区间,例如低、中、高。



同一段信息可以同时提交多个问题,Jev 会分别回答,前一个结果不会影响后一个结果,这让它很适合嵌入现有软件,代码继续控制业务流程,Jev 只负责其中一个范围明确的判断。


真正的亮点在泛化能力


大模型研究工程师 Sebastian Raschka 认为,简单把 Jev 看成一个分类器,很容易低估它。



传统 encoder 分类器通常服务于固定任务,模型训练完成后,标签集合也随之确定,一旦场景变化、类别增加,往往需要重新准备数据并训练。


Jev 可以在运行时接收自然语言标签,再结合上下文对不同选项进行评分,开发者更换类别或调整描述时,无需为每套标签单独训练一个模型。


Raschka 判断,Jev 的关键可能更多来自数据和 API 设计,训练算法本身未必复杂。


有网友表示,创始人曾暗示过 Jev 使用了完全合成的数据集,并在已有模型上进行后训练,没有重新进行大规模预训练,这样能省下不少钱。



Jev 的技术归类也引发了争论。


一些开发者认为,标签已经可以在运行时变化,它就不再属于传统的封闭式分类器,更接近 cross-encoder 评分模型或 LLM ranker。




还有人猜测,Jev 会分别处理上下文、问题和候选答案,再输出每个选项的分数。



它究竟该叫什么,目前没有统一答案,但争论也说明,Jev 的产品形态已经超出了传统分类器的使用方式。


它想成为 Agent 的决策层


Jev 最适合处理答案范围明确、需要反复执行的判断任务。


例如在模型路由中,它可以判断一个请求应该交给低成本模型还是高能力模型;在内容审核中,它可以识别风险等级;在 Agent 系统中,它可以检查一次工具调用是否需要人工确认,也可以判断模型输出是否通过质量门槛。


它返回的不只有最终标签,还有完整的概率分布。


当两个选项的概率非常接近时,开发者可以看到模型的犹豫程度。面对 Noul 结果,还可以通过调整阈值改变系统策略。阈值提高后,系统触发某项操作的次数会减少;阈值降低后,策略会更加谨慎。最终决定仍由代码完成,开发者可以设置阈值、加入硬性规则,并规定哪些情况必须交给人工处理。


这种设计让 Jev 更像一个可复用的判断模块,它可以放在 Agent 循环外围,负责模型路由、工具风险检查、结果筛选和质量控制。


它的概率靠谱吗?


Jev 的泛化能力获得了不少认可,它的概率是否足够可靠,也受到质疑。


有网友认为 Jev 模型并没有真正做到「确定性」和「无幻觉」,同样的提示词多次运行会给出不同的概率,而且选项的顺序会大幅改变输出概率。


例如,同一个客户消息,只是把「信息咨询」和「bug 报告」的顺序调换,模型就从偏向选 bug_report 变成偏向选 information。



网友 @predict_addict 称,自己在贷款违约、企业破产和医疗诊断等八个真实数据集上进行了测试,结果显示,Jev 的概率校准明显落后于 CatBoost,并且经常高估负面结果。经过简单的后处理后,部分误差就能得到修正。



还有网友感叹 Jev 简直疯了,自己只用一个晚上加一个早上就搭建了一个全自动实时交易机器人,该机器人会同时处理链上和链下数据来快速做出买卖决策,结果目前已经亏损了 31680 美元。😂



TypeSafe AI 也在 Jev 1.13 的能力说明中提醒,模型在算术、计数、日期、字面匹配、无关信息干扰、对抗性输入和矛盾条件等任务上表现并不稳定。


参考链接:

https://x.com/rasbt/status/2101672304358948992

https://x.com/typesafeai/status/2101786156572823624?s=20

https://x.com/omarsar0/status/2101774405521301681

https://x.com/rronak_/status/2101544156757950697?s=20


图片


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

转载声明:本文转载自原发布平台 (作者:机器之心), 原文标题《Jev是分类器吗?今天向所有人开放,送1.2亿token》, 查看原文。 版权归原作者及原发布平台所有,本站仅作收录与展示,未对正文内容作实质性修改; 若涉及侵权请联系本站处理。