平时我和很多朋友折腾智能体时,最常遇到的折磨就是太慢,还容易莫名其妙卡死。比如我让 AI 点击某个提交按钮,大模型不是抬手就点,而是在后台默默写下一长串文本。从页面分析到状态确认,它非得逐字把作文写完整,系统再从文字里抠出动作去执行。只要打字时少打了一个闭合括号,后面的自动化流程就会当场报错瘫痪。

这就像你开车快要撞上障碍物了,副驾驶坐着一位慢条斯理的军师。他看到危险没有立刻踩刹车,而是掏出信纸写几百字心得,论证撞车是不明智的,结论是应当立刻制动。等他把这篇长文写完念完,车早就撞碎了。我们动辄调用上千亿参数的语言模型逐字往外蹦,耗费数秒就为了在几个按钮里选一个,既慢又贵,极其脆弱。

写文与按键

传统大模型写作文与 Jev 强类型决策模型的机制对比

前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe 团队,推出了名为 Jev 的新模型。这个模型的核心思路极其直接,要决策,不要长篇大论。

在认知心理学里,人的思考分为快思考与慢思考。大脑里既有慢吞吞的逻辑推理,也有不过脑子的肌肉反射。飞来小虫你会本能闭眼,碰到开水瞬间缩手,这些反应不需要在大脑里写说明文。现在的很多智能体之所以让人抓狂,根本原因就在于缺失了肌肉反射。哪怕是最基础的按钮选择,都要唤醒慢吞吞的大脑重新写一遍作文。

Jev 做的事情,就是给 AI 补齐这套肌肉反射神经。它根本不生成自然语言文本,不是传统的自回归打字模型。当你把当前的状态塞给它时,它直接在一次计算里输出强类型的结构化结果。考试做选择题时,普通大模型非要在答题纸上写满心得体会才写出选项,而 Jev 就像你手里的铅笔,扫一眼题目就直接在答题卡上涂黑。

海外技术社区对 Jev 工业化决策特性的讨论与原声评价

在技术社区里,大家最推崇这种务实的工业化取向。Diogo Almeida 曾留下一句被广泛讨论的话,「我们在做工业级的产品,不是在造全知全能的上帝」。由于它不需要逐字生成长文本,不仅将单次微观决策延迟压缩到了几十毫秒,更把计费打了下来,输入每百万 Token 仅需零点零四二美元,而输出完全免费。更重要的是,它先天杜绝了格式幻觉,不会出现字段缺失或括号未闭合的问题。

实测见真章

日常业务中最头疼的是客诉分流与风险识别。当用户发来一段满是怒火的信息,「手机屏幕到手就碎了,客服两天不理!再不退款我立刻去 12315 投诉并报警!」,系统必须在极短时间内完成精准判断。在实际测试中,我无需让模型写长篇分析,而是在一次请求中并发抛出四个强类型决策问题。

import requests

# 单次请求并发抛出 4 个强类型决策问题
payload = {
'state': '手机屏幕收到就碎了,客服两天不理,不退款就投诉报警!',
'model': 'jev-latest',
'questions': {
'dept': {'type': 'choice', 'criteria': ['售后纠纷', '物流查件', '技术咨询']},
'anger': {'type': 'score', 'criteria': ['平和', '着急', '极度愤怒']},
'legal_risk': {'type': 'noul', 'instructions': '是否包含法律监管与投诉风险'},
'action': {'type': 'choice', 'criteria': ['紧急加塞主管', '常规排队', '自动安抚']}
}
}

headers = {'Authorization': 'Bearer YOUR_API_KEY'}
res = requests.post('https://api.typesafe.ai/v1/systemone', headers=headers, json=payload).json()

# 代码可直接根据确定性的布尔值或枚举做 if 分支
if res['answers']['legal_risk']['noul'] > 0.85:
escalate_to_manager(res)

真实客诉多维度分类与打分终端实测效果

Jev 在一次前向计算里给出了笃定的答案,部门归属以满分置信度命中退款纠纷,愤怒情绪打出两分满分,法律监管风险概率高达百分之九十八,处置策略则毫不犹豫地选择了紧急加塞人工主管。整个判定过程没有出现任何格式错乱,代码拿到结果可以直接通过 if 做分支路由,彻底告别了文本解析报错的噩梦。

肌肉与大脑

从这组实测可以看出,未来的 AI 智能体架构正在发生一场极其关键的分工变革。

顶层大脑深度思考与底层手脚执行的三层协同架构图

真正高效的智能体,绝不该把所有琐碎任务都压在庞大模型身上。宏观规划依靠擅长深度思考的大模型,但在环境感知、按钮选取与状态校验上,理应由 Jev 这类具备肌肉反射特性的决策模型接管,最终由底层的浏览器或自动化驱动器完成具体的点击与输入。

当 AI 不再被迫为了按一个按钮而去绞尽脑汁写作文,智能体才算真正拥有了灵敏的神经系统与健步如飞的四肢。