GPT、Claude靠边站?一个“哑巴”AI成了硅谷大明星
2 小时前 / 阅读约10分钟
来源:36kr
Jev是一款不生成自由文本的AI模型,以快速反应和决策为特点,在游戏中表现流畅,还能过滤帖子、查询航班。其开发团队注重简单判断,速度快成本低,未来或成Agent标配能力。

如果你千辛万苦接入了一个AI模型,它却无法生成代码、生成图片、编辑Skill,甚至不能像聊天机器人一样,直接回答你“1+1等于几”,你大概率会迫不及待地想把它丢到垃圾桶里。 

但现实是,一款不生成任何自由文本的“哑巴”AI,最近却在海外社交媒体上火了。 不仅热度远超GPT和Claude,连话题性超强的Gemini 4 Pro疑云都被抛到一边。

它叫Jev,来自一家名为TypeSafe AI的公司 。 

热度有多夸张?介绍它的发布推文, 浏览量已经超过3000万 ,收获了超过6万次点赞。甚至另一位开发者制作的45秒解说视频,也被看了超过100万次。 

拥有约38万粉丝的开发者博主ThePrimeagen,也忍不住表示想马上用起来,准备把它接入自己的服务器自动化工具。Dan Shipper则说,团队已经测试了大约一周,并预测 再过6—12个月人们就会觉得这东西不可或缺 。 

一个连话都不跟你聊的AI,究竟有什么好围观的? 

但一段同样获得了百万次浏览的游戏演示,或许足以说明它热度爆表的理由: 

这个“哑巴”AI,流畅、自然、全自动地打起了美国国民“CS”——《毁灭战士》来。 

Jev,人狠话不多 

其实《毁灭战士》是什么游戏并不重要,大家只需要把它当成美国佬专属的《CS:GO》就行,游戏玩法也差不多: 

同样是第一人称射击游戏,既要瞄准开枪,也要绕过障碍、移动角色,最终目的也是要把敌人干掉。 

这个也是演示里的Jev正在忙活的事情。遇到敌人了,赶紧转向、开枪;前面堵住了,那就换个方向继续走。而从演示的结果来看, Jev在《毁灭战士》这款游戏里一路的移动、设计、绕障都相当流畅丝滑。

值得注意的是,根据Jev创作团队的说法,演示里的所有操作,都是Jev自己动手的。它虽然也是一个AI模型,但是不会像传统推理模型一样动不动就“深度思考”,对于现状能快速进行反应和决策。 

毕竟在紧张刺激的枪战游戏中,哪怕“深度思考”了1秒,就有可能被敌人干掉。 

而Jev之所以能反应如此快速,据说是因为它每秒能作出大约10次选择。 即便画面快速地进行转变,它也能快速反应过来并马上决定下一步。而像这样流畅地完成游戏的游玩、决策,每小时的花费只有7美元,大概就是50元人民币不到。 

更有意思的是,能做到这么惊艳的效果,这款用来打游戏的Jev, 甚至不是游戏特化的版本,还只是一个通用型的Jev。

而开发团队所做的,也只有教会了它一些游戏“秘诀”,比如会有程序专门告诉它角色位置、附近敌人的情况,并整理成文字和数据。 

最终Jev在玩游戏的时候,会根据这些情报的提示前进、转向和射击。 

不过,相比起官方提供的演示意味非常浓郁的打游戏演示,一些受到邀请的开发者们用它玩出了五花八门的玩法,才真正体现出了它的强大之处。 

比如,帮你少看点让人血压升高的帖子。

有的开发者做了一个叫Barrunto的浏览器插件。你刷X等社媒平台时,它就在后台检查帖子有没有故意引战、骗互动,或者包含有用的信息,再按设置打标签、淡化或隐藏。 

这在龙蛇混杂的社媒平台就显得相当有用了。要是过去刷到一条钓鱼帖,可能骂完、回复完,才发现自己又给人家贡献了流量。现在可以让AI先去踩一脚,直接眼不见为净,也不用浪费口舌给钓鱼贴增添热度。 

还有人让Jev操控浏览器,查询苏黎世到伦敦的航班,演示全程只花了7.1秒。

Jev负责从页面上的按钮、输入框中选择下一步操作。碰到需要填城市名称的时候,再请一个小语言模型代笔。一个负责选,一个负责写,分工倒挺清楚。 

这时候,大家才发现,这个“哑巴” AI,原来真正的杀招,是极其聪明利索的干活好手。它就像我们平时办公室中的某些同事:人狠话不多,一句废话也不多说,却用火箭般的速度把事情干完了。 

而且它的内核还极其聪明。在打游戏的这个案例中,它能精准识别开发者的意图和指令,把程序转译的“报点”输出为精准的射击和走位; 

在踩引战贴的案例中,它也可以根据用户的要求,精准识别哪些帖子的哪些点,达到了引战贴的标准,并精准点踩; 

还有帮忙找航班的案例。对普通人来说,要核对时间,核对航班,核对机场,一连串流程下来很容易手忙脚乱。但是Jev却能把整个流程干得一气呵成,还不会搞错任何事情。 

不过也有个令人好奇的地方。现在大模型的主流都是能输出自由文本的大语言模型,或者是多模态模型。Jev的开发团队,怎么就想到了搞一个“哑巴”却能干的产品出来? 

AI“少说两句”,是好事啊 

Jev的创始人Diogo Almeida,可能是最有资格让AI闭嘴的人之一。 

这哥们以前在OpenAI工作,还是InstructGPT论文的作者之一。后来ChatGPT能听懂人话,按照人类的要求办事,InstructGPT正是重要基础。 

结果在OpenAI教了几年AI怎么好好说话以后,他跑出去创业,花了两年时间,做出的第一款产品居然不会说话了。 

原因其实很简单。Almeida发现,很多软件找大模型帮忙时, 压根没有准备跟它聊天。

比如公司收到一封客户邮件,对方气冲冲地表示,自己的信用卡被重复扣了两次钱。在过去,系统把邮件交给大模型,只想知道应该把它转给账单部门、技术部门,还是售后部门。 

但传统大模型收到邮件以后,更可能会先分析客户遭遇了什么,情绪有多激动,再解释为什么应该交给账单部门。洋洋洒洒写了一堆, 

但是系统想要的,不就只有“这事归谁管”吗? 根本不需要在这长篇大论分析一番。

于是,Almeida鼓捣出来的Jev,核心诉求就是能简单明了地做选择、做判断,删去八百字的废话。 

有了Jev之后,还是同样的场景,开发者可以先把可能出现的答案列好。账单、技术、售后,三选一。 而Jev在读完邮件之后,马上输出选择,然后再把判断交差。

而且省掉写作文这一步,AI的速度和价格马上就变了。 

按照TypeSafe公布的数据,在适合Jev的任务中, 它比参加对比的大模型快20至200倍,成本低40至400倍。目前每百万输入Token只收0.042美元,输出干脆免费。

最终,对比起传统的大语言模型,在别人还在组织语言时,Jev已经交卷走人了。 

不过,这类重视判断的模型还有个核心问题要解决:怎么证明你的判断是准确的。 

毕竟Jev的处理速度足够快,许多场景中都可能在一瞬间处理成百上千个需求。这时加入判断正确率只有90%,都意味着有几百个需求被误判。 

所以Jev还要经过专门训练,尽量把自己的把握报准。这套方法叫RLCD,翻译过来就是 面向校准决策的强化学习 。 

开发者可以自己定规矩。比如把握超过90%,软件直接执行。把握在70% 到90% 之间,再叫一个更强的大模型过来看看。连70% 都没有,那就别逞强了,赶紧摇真人。 

这种方式,和一些车企主推的智驾“快慢模型”很接近。在《思考,快与慢》这本书里把人的思考分成了快慢两套系统。看到“1+1”,人几乎不用想就能回答2。真要做一道数学证明,才需要坐下来慢慢琢磨。 

所以,Jev实际上更像坐在窗口后面的办事员。当我们递过去材料,它马上就可以判断该盖哪个章。 碰到自己拿不准的,再把人叫回来补材料。

不过,这种系统也有一个毛病:得有人把规则提前写好。 

开发者必须提前告诉Jev,这道题可以有哪些答案。要是这个信封明明应该转给法务,选项里却只有账单、技术和售后,那Jev就有可能当场宕机, 或者非常麻利地选择错误的答案。

所以,Jev虽然也叫“AI模型”,还能在几百毫秒里完成的选择题,但实际上还挺笨的。 

那么,为什么Dan Shipper还说,“再过6—12个月,人们就会觉得这东西不可或缺”? 

电脑会被Jev们占领吗 

其实Dan Shipper所说的“不可或缺”,并不是说未来每个人都要下载一个Jev,更不是说它会取代ChatGPT、Claude这些大语言模型。 

恰恰相反,Jev真想进入软件和智能体,还得靠这些大模型帮忙。 因为Jev再会做选择,也得先有人把题目出明白。

同样是过滤帖子的场景,开发者肯定不能只丢给Jev一句“帮我过滤垃圾内容”,然后指望它自己领悟。什么叫垃圾内容?硬广算不算?标题党算不算?带脏话,但确实说了点有用东西的帖子,又该不该留下? 

最终,不还是得开发者把规则写得明明白白。 

其实Jev能发挥最大用处的方式,还是先让更强的大语言模型查看实际数据,分析Jev经常错在哪里,再帮开发者修改问题、补充选项、完善判断标准。

比如Jev总把吐槽当成恶意攻击,大模型就可以从误判的帖子里找出原因,告诉它什么是正常抱怨,什么才是故意引战。 

规则改好以后,再把成千上万条帖子交给Jev处理。 

从这个角度来看,它虽然不会成为每个人都要花费时间去单独下载回来的工具,但却非常有可能成为日后每个Agent标配的一项能力,跟在大语言模型身后,把那些数量多、重复高,又没必要每次都认真思考的小判断“稳稳地接过去”。 

毕竟一家公司,肯定需要缺一个主导方向、负责深度思考的大脑;但应该也没有人会嫌弃一个不说废话、还能一天到晚帮忙干活的同事。