aijiau 第一栏 · 001
Jev 不写字,它做决定
TypeSafe System One 第一款公开模型(2026-09-15)。Agent 怎么用 Choice / Score / Noul 做分流和门控,对照自由格式 LLM,给出可粘贴的 Aijiau / evaluate / classifier 示例。中文与繁体必须自测。人读完走 api.aijiau.com 控制台,再 POST /v1/systemone(现网已上线)。
刊出 2026-09-20修订 2026-09-2127 分钟阅读
Jev 现在热,不是因为它又会聊天了。恰恰相反:它一个字都不写。
2026 年 9 月 15 日,TypeSafe AI 放出第一款公开的 System One 模型 Jev。创始人 Diogo Almeida 在发布文里把它写成一句函数调用:非结构化状态进去,带类型的概率决策出来。官方文档说得更干脆:把状态和带类型的问题交给它,直接拿到代码能分支、排序、路由的结构化答案,没有文本生成,也没有再解析一遍模型作文的步骤。
这篇文章是 aijiau 的旗舰栏。目标不是复述新闻稿,而是让做 Agent 和模型路由的人看完能判断:哪些缝该交给 Jev,哪些缝必须留给会写字的模型,哪些缝其实该写死规则;Vercel experimental_evaluate 和 TypeSafe noul 怎么对上;以及中文 / 繁体为什么不能直接抄英文阈值。TypeSafe 自己挂在首页上的「193.6 倍更快、444.6 倍更便宜」也必须带出处读。
转换路径
人读完就能打通。机器也可以把这段当摘要。本栏不编造 QPS,也不报中文准确率。
- 弄清 Jev。 它不写字。Choice 分流,Score 分档,Noul 门控。对照、调用面和中文自测都在本页下面。
- 打开 api.aijiau.com 控制台。 注册、开一把本站
sk-...。www 的/sign-in//sign-up是门户登录,不是 API 控制台。 - 打通第一次 System One。
POST https://api.aijiau.com/v1/systemone,model填jev。不要走POST /v1/chat/completions(现网 400)。逐步笔记在 第一次打通 POST /v1/systemone。 - 机器形状留在 www。 /jev/docs 写 schema 和错误码;/jev/surfaces 写三调用面别混;/jev/zh-eval 是中文金标协议,不是分数。
试跑可以走 Playground。合作写 [email protected]。
它到底是什么
Jev 是 TypeSafe 的旗舰模型,也是该公司定义的 System One 类别里第一款公开产品。这个名字借自丹尼尔·卡尼曼《思考,快与慢》里的 System 1:快、窄、当场判断。它不是在声称自己像人一样直觉思考,而是在说明岗位:读当前状态,迅速给出一个被框住的答案。
按官方文档,今天的 Jev:
- 接受文本、JSON 对象、文本数组,还不接受图像、音频、视频。
- 用三种问题原语提问:
Choice(从给定选项里选)、Score(按量尺打分)、Noul(这句话有多像真,返回 0 到 1)。 - 同一次请求里的问题对同一份 state 并行、彼此独立评估。加问题几乎不改响应时间,也不会因为问题互相污染而「上下文腐烂」。
- 训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),采样是并行的,不是一个 token 接一个 token 往外吐。
- 通过 HTTP
POST /v1/systemone或官方 SDK 调用。文档示例默认模型别名是jev-latest。
名字本身也不是空的。TypeSafe 说 Jev 取自经济学家威廉·斯坦利·杰文斯(William Stanley Jevons):蒸汽机更省煤之后,煤的总需求反而上升。他们的赌注是:决策智能一旦便宜一个数量级,会被写进多几个数量级的软件缝里。
为什么这件事现在重要
过去两年,团队把分类、分流、打分、拦工具这些活交给通用大模型,不是因为任务需要写文章,而是手里只有会写文章的模型。流程通常是:拼一段 prompt,等它逐 token 生成,再把一段自然语言解析回标签。慢、贵,还要防它写出第四个不存在的类。
Agent 把这个问题放大了。一次运行里,模型要反复回答「这个请求该走哪条模型」「这条工具调用能不能执行」「要不要重试」「结果够不够交差」。这些判断出现在热路径上。用前沿聊天模型做每一次 if,延迟和账单都会先于智能把系统拖垮。
Jev 把岗位切开:会写的模型继续写计划、写回复、写代码;决策模型只回答你事先圈定的问题。LangChain 在 2026-09-17 的说明里也是这个形状:它不是 LLM 的替换件,而是 harness 里的分类与门控层,用来做模型路由和工具前检查。
对 aijiau 尤其直接。api.aijiau.com 是 LLM 路由和调用网关。路由要回答的问题几乎全是 System One 形:这个请求简单还是难、该不该升级模型、要不要重试、要不要在工具执行前拦住。
2026-09-20 读取的 https://api.aijiau.com/jev 是另一套 HTML 产品页(Express 静态站,含 Playground / 文档 / curl)。人读的规范页现在是 **https://www.aijiau.com/jev**。机器调用不要打 /jev,打 POST /v1/systemone。这条路由现已上线。不要用 POST /v1/chat/completions 打 model jev,现网返回 400。模型 id 在 Aijiau 上是 jev。
三种问题,分别什么时候用
官方原语只有三个。用错原语,比选错模型更快把系统做歪。
Choice 用来从一组无序标签里选一个。工单该去计费还是技术,请求该进哪条 Agent,该加载哪项技能。返回选中项、各选项概率和 confidence。TypeSafe 写明 Choice 基数上限是 255;选项再多,应先收窄再做第二次选择,而不是把几百个近义标签摊成一道题。
Score 用来把对象放到有序尺子上。紧急程度、检索段落够不够送进生成模型、一次 Agent 轨迹有多像失败。相邻分数是有距离的,代码可以按阈值切服务等级或人工队列。
Noul 只问一句话有多像真,返回 0 到 1 的概率。和 Choice / Score 不同,当前 Noul 响应不另给 confidence。阈值由你的代码定:改一句文案也许 0.65 就能过;动支付或删数据,0.98 加二次检查都不过分。
官方建议把大问题拆成原子问题。不要问「给这个创业 BP 打个总分」,而要分别问市场、技术可行性、差异化,再在自己的代码里加权。优先级变了,改系数,不用重写整段 prompt。
Agent 怎么用这三个原语
把一次 Agent 运行看成热路径上的几道缝,而不是「再调一次会写字的模型」。下面是可以原样写进代码的岗位,不是本栏的 SLA。
Choice 做分流。 已知集合里选一条路:cheap / strong / refuse,或计费 / 技术 / 人工。返回选中项、分布和 confidence。低置信不要假装已经分流——交给人或更强的模型。
Score 做分档。 检索够不够送进生成模型、轨迹有多像失败、回复有多像跑题。相邻分数有距离,代码可以按 0 / 1 / 2 切服务等级。
Noul 做门控。 只问一句「这条工具调用看起来安全吗」「这像用户要的吗」,拿 0 到 1。改文案也许 0.65 就能过;动支付、删数据、对外发送,0.9 加二次检查都不过分。当前 Noul 响应不另给 confidence,阈值由你的代码定。
一次请求里把三道题一起问。它们对同一份 state 并行、彼此独立评估,加问题几乎不改延迟。然后只在自己的代码里组合:
refuse或safe.noul低于阈值 → 升级人工或规则拦截。cheap且检索分够 → 走小模型写回复。- 其余 → 升级生成模型,再写计划、调工具、写字。
可粘贴的 if 在本页下方动手区。完整 curl 在调用面,打 POST https://api.aijiau.com/v1/systemone,模型 id jev。不要走 POST /v1/chat/completions(400)。
对照自由格式 LLM
过去两年的默认做法是:拼一段「请只返回 JSON」的 prompt,等它逐 token 写完,再把作文解析回标签。慢、贵,还要防它写出第四个不存在的类。
| 自由格式 LLM | Jev / System One |
|---|---|
| 为人类写文本,再被代码解析 | 为代码做当场判断 |
| 形状靠 prompt 约束,可能多字段或新类 | Choice / Score / Noul 事先定死 |
| 一次生成里问题会互相污染 | 同请求并行、彼此独立 |
| 中文阈值难校准,失败形态是跑题和编造 | 输出可 if;中文仍须自测,不保证和英文一样准 |
| 适合计划、解释、回复、代码 | 适合分流、分档、门控 |
不要把 Jev 当成「不会说错话的 GPT」。TypeSafe 的「零幻觉」约束的是答卷纸的格子,不是格子里永远正确。语义错误、对抗输入、非英文变弱,都还在。权限和审计仍写在规则里。
决策、生成、规则:各管哪一层
三件事常被揉成「再调一次模型」。分开写,系统才站得住。
| 缝 | 交给谁 | 为什么 |
|---|---|---|
| 答案集合事先知道,同样判断会反复出现,你能按置信采取不同动作 | Jev | 输出被 schema 框住,并行评估,概率可写进 if |
| 计划、解释、用户可见回复、代码、开放抽取、多步论证 | LLM | Jev 不生成文本。只用 Jev 的 Agent 会保持沉默 |
| 权限、限额、幂等、审计、合规硬闸、已知黑名单 | 规则 / 代码 | 置信不是真相,更不是授权。政策写在代码里 |
Vercel 的 Agent 控制形状和这个表一致:experimental_evaluate 问 Jev,应用代码读概率和置信再分支。清晰的工单自动进队列;部门置信低于 0.6 或选中项概率低于 0.7,就升级人工。阈值是起点,不是本栏的 SLA。
如果三件事里缺任何一件——答案集合未知、判断只做一次、你无法根据置信采取不同动作——这道缝大概不该给 Jev。若答案已经能用正则、状态机或权限表写死,也不该给 Jev。
「零幻觉」该怎么读
TypeSafe 的发布文写 Jev「can't hallucinate」,首页也用了很硬的「Zero Hallucinations」。必须把这句话拆开,否则会把它当成安全边界。
他们自己把能轻易验证的部分说清楚了:
- 类型错误:输出形状事先定死。模型不能返回未声明字段,也不能在三个类里发明第四类。TypeSafe 称模式匹配是保证的,所以把类型幻觉画成 0%。这说的是 schema,不是语义。
- 语义错误:仍然可能选错标签、打偏分数、读不懂绕弯的指令,或在对抗输入里变差。官方有一份 Jev 1.13 jaggedness 文档,专门写已知毛边。
- 校准:80% 的概率在大量同类预测上大约对 80% 的次数。它不保证这一次是对的。高置信可以自动执行,低置信应升级到人或推理模型。
一句话:Jev 约束的是答卷纸的格子,不是答卷内容永远正确。把它当策略引擎的最后一道闸,是用错了。代码、权限和审计仍然要在外面。
首页上的倍数,不要当换算表
TypeSafe 目前公开的标价是:输入每百万 token 0.042 美元(也写成每十亿输入 token 42 美元),输出不计费。他们解释输出免费,是因为模型并不生成长文本。Vercel AI Gateway 上的 typesafe-ai/jev 引用的是同一张厂商标价。
速度方面,发布文写 TypeSafe 侧端到端大约 70ms 到 500ms,并称在 System One 形查询上可能比对照的前沿模型快 40 到 200 倍。官网大字 193.6× Faster, 444.6× Cheaper 来自他们发布的四条 workflow 评测里偏高的一端。公司自己加了限制条件,转述时不应丢掉:
- 多数计时从美国西岸笔记本打到他们当前部署,不是你的机房。
- 四条 workflow 由 TypeSafe 模型能力团队撰写;他们说不在训练集里,也不认为自己在故意讨巧,但作者身份本身就是偏差来源。
- 对照「正确答案」是 GPT-6 Astra 与 Claude Fable 5.1 的平均,不是独立人工金标。这会偏向那两家,也可能低估 Jev 和 DeepSeek 一类模型的相对表现。
- 对照 LLM 走的是 TypeSafe 的 System One 包装,强制输出兼容他们 API 的结构化决策;他们说这比「只要标签、不要概率」更准,但也更慢更贵。
- 价格是否补贴,公司明确说现在证明不了,并预期长期价格往下而不是往上。
所以:这些数字可以用来理解产品形状,不能拿来做你自己账单的换算系数。外部分散证据也还薄。工程师 Malte Ubl 曾写过,他拿一份现成的、原先跑 Gemini 2.5 Flash-Lite 的分类评测去打 Jev,质量和速度都好看;那是一条预存在的评测,仍然只是单点,不是公开基准套件。
Jev 也还在 early access。发布当天是从 waitlist 往外放名额。
它在 Agent 里该坐哪
把 Agent 看成一串缝,比把它看成「一个会思考的模型」有用。
该给 Jev 的缝:答案集合事先知道;同样的判断会反复出现;你能对置信度采取不同动作。典型位置包括意图分流、选模型、选工具或技能、检索够不够用、要不要重试或停、执行前风险门、输出是否像越狱或跑题。
必须留给 LLM 的缝:计划、解释、用户可见回复、代码、开放抽取、需要跨多步论证的调查。Jev 不会写这些。只用 Jev 的 Agent 会保持沉默。
一个稳妥的双模型形状:
- 路由层(正是
api.aijiau.com该做的事)用决策模型看请求难度、领域和风险,挑一个生成模型。 - 生成模型写计划、调工具、写回复。
- 工具真正执行前,再用决策模型做一次窄门:像不像用户要的,像不像危险命令,像不像该升级确认。
- 代码看概率和置信,决定放行、改道、重试或交给人。阈值写在你的策略里,不写在 prompt 里。
- 生产里钉死模型版本。发布周有文章写到别名
jev-latest当时解析到jev-1.13.0。别名会动;可复现的缝要钉 ID,升级时再重新校准阈值。
Aijiau 网关的 System One 协议路由现已上线(VERSION 0.2.1-aijia.99,SHA 8ff42e9)。官方入口是 POST https://api.aijiau.com/v1/systemone(model jev),同协议别名 POST https://api.aijiau.com/api/alpha/decisions。新代码应打官方入口。协议参照 TypeSafe 上游 POST https://api.typesafe.ai/v1/systemone。不要用 POST /v1/chat/completions 打 model jev,现网返回 400。Ops 核过:无密钥 → 401(不是 404);有效 sk noul / choice / score → 200。本栏不编造 QPS。人读页只留 www;控制台登录和 Playground 仍在 api.aijiau.com,不要再把 /jev 当成第二套首页。
适合,和不适合
适合:工单和请求分流;检索命中打分;Agent 轨迹是否像失败;提示词 / 工具调用的快速护栏;要把非结构化状态压成特征再交给普通代码的地方。
不适合:替代 GPT / Claude / Gemini 做对话或写作;当唯一的 Agent 主模型;开放信息抽取(先让 LLM 抽字段,再交给 Jev 做是否成立的判断,往往更稳);数学证明、长程规划、需要看图看视频的任务;把置信度当成法律或合规结论。
三种调用面,不要混形状
同一份决策,至少有三条路。字段名不一样,价也不一样。
Aijiau HTTP(本站用户,现网已上线):POST https://api.aijiau.com/v1/systemone,"model": "jev",问题类型是 noul / choice / score。鉴权用本站 sk-...。计价是 ¥0.6 / 1M 输入,输出免费。不要用 POST /v1/chat/completions 打 model jev(400)。完整 curl 在本页下方调用面。
Vercel AI SDK(走 AI Gateway):experimental_evaluate,模型 id 是 typesafe-ai/jev。三种问题写成 choice / score / boolean。Boolean 的答案字段是 probability,不是 noul。Vercel 写明 boolean 对应 TypeSafe 的 Noul。Gateway 上引用的是 TypeSafe 的 $0.042 / 1M,不是 Aijiau 的 ¥0.6。完整片段在本页下方动手区。
LangChain:langchain-typesafe 里的 TypeSafeClassifier。问题对象是 Choice / Score / Noul;Noul 的结果读 response.nouls["urgent"].noul。实验性 ModelRouterMiddleware 和 AutoModeMiddleware 用 Jev 选模型和拦工具。需要 TYPESAFE_API_KEY。包仍是 2026-09-17 的 alpha。
不要把 Vercel 的 boolean 写进 Aijiau 的 JSON,也不要把 Aijiau 的 noul 写进 evaluate()。这是最容易抄错的一行。独立页 三调用面别混;机器文档锚点仍是 /jev/docs#surfaces。
中文 / 繁体怎么测
TypeSafe 写明英文是主训语言,非英文(含中文)目前更弱。他们没有公布简体、繁体、粤语或中英夹杂的公开数字。所以:不要把英文阈值原样搬到中文工单上,也不要把「能跑」当成「和英文一样准」。这是 aijiau 愿意把旗舰栏写厚的原因——中文社区在热,官方评测几乎全是英文。
下面是自测协议,不是本栏的成绩:
- 先建金标,再调阈值。 至少 50 条、更好 150–200 条真实工单或对话。简体、繁体、中英夹杂分开标。标签必须是人事先定的 Choice / Score / Noul,不要事后用 LLM 给自己打分。
- 同一条状态,三种写法对照。 简体、台湾繁体、英文各写一遍同样的问题。记准确率、校准(高置信是否更常对)、以及失败形态:婉转、反问、成语、繁简混合、台湾用词(「伺服器」「汇款」)。
- 阈值按语种分开。 英文 Noul 0.80 能过的缝,中文可能要升到 0.90 再自动执行,或低置信直接升级。不要假设 confidence 的刻度跨语言可平移。
- zh-TW 当 CJK 测,不要当「另一个英文」。 目前没有 TypeSafe 发布的繁体专项数字。把 zh-TW / zh-HK 单独成组:正体字、台湾标点、敬语和暗示请求。
- 高风险缝加第二意见。 支付、删数据、对外发送,中文低置信时升级人工,或把原文译成英文再问一次,两次都过才放行。译文会丢语气,只能当辅证。
- 写清失败,不要写虚高。 公开只写你测过的集合大小、日期和失败例子。本栏不报准确率百分比。
金标协议与样例见本页 #zh-eval,独立可抓取页是 /jev/zh-eval。v0 样本集扩大中,不编准确率。
本仓的公开语言只有 zh + en。繁体测试指南写在中文栏里,并不等于我们另开了一套 zh-TW 站点。
开源仿品不是 Jev
发布后很快出现社区站点 jevai.dev(解释页,带 OpenRouter 示例,不是 TypeSafe 官网),以及 jevlike、OpenJev、NanoJev 一类开源复刻。它们是研究起点,不是 Jev。不要假设它们有同样的校准、同样的 jaggedness 文档、或同样的 schema 保证。生产决策层要么打 TypeSafe / Aijiau 的 jev,要么把开源复刻当成你自己要评测的另一个模型。
Jev 仍在 early access。置信不是真相。开源克隆的存在,不降低官方模型的责任,也不构成「大家都一样」的借口。
在 Aijiau 上怎么调用
机器文档(状态、鉴权、schema、错误码、计费、三调用面)在 www.aijiau.com/jev/docs。下面复述 2026-09-20 从 api.aijiau.com/jev 读到的产品说明,并更正现网入口:Aijiau POST /v1/systemone 现已上线。当时 api.aijiau.com/jev/docs 是 404,应 301 到 www /jev/docs。
- 鉴权:已登录会话,或本站
sk-...。不要用站外 / 上游密钥。 - 公开模型 id:
jev。 - 计费:输入 ¥0.6 / 1M tokens,输出免费。这是 Aijiau 对用户展示的价,不是 TypeSafe 的 $0.042 / MTok。
- 文本为主。官方模型卡把预算写成整次请求约 64k tokens,更紧的闸是 state + 最长问题约 32k。
- 英文是主训语言,中文能跑,但准确率目前较低。上线前用自己的语料看 confidence,不要假设和英文一样准。
- 他们的文档给过 answers 形状示例,并写明那些数字是说明用,不是对本站实时模型的承诺。
完整 curl 和步骤见本页下方调用面。试跑走 Playground,不要再打开 api.aijiau.com/jev。
你现在可以做什么
- 先读 TypeSafe 的发布文和文档导言,用他们的原语而不是「再包一层 JSON mode」去想问题。
- 在自己的 Agent 里标出决策缝:路由、选工具、停 / 重试、执行前检查。把开放写作留下给 LLM。规则能写死的,不要交给任何模型。
- 用 Aijiau 的
sk-...打POST /v1/systemone,模型填jev。不要用POST /v1/chat/completions打jev(400)。协议参照 TypeSafePOST https://api.typesafe.ai/v1/systemone。若走 Vercel Gateway,用experimental_evaluate和typesafe-ai/jev,记住boolean≠noul。 - 用自己的中文 / 繁体金标测一遍,再定阈值。不要抄英文 cutoff。
- 人读只留 www.aijiau.com/jev。要选聊天模型而不是决策模型时,再走 api.aijiau.com 控制台。第一次调用的逐步笔记在 第一次打通 POST /v1/systemone。合作写 [email protected]。
后续文档和博客会按专栏同样的规则加:有完整中英稿再上,不放空壳。
材料来源
- Aijiau 现网产品页
https://api.aijiau.com/jev(2026-09-20 读取;该 URL 应 301 到本页) - Aijiau 机器文档
https://www.aijiau.com/jev/docs(本仓;api 主机上的/jev/docs当时 404,应 301 过来) - TypeSafe,Introducing System One Models & Jev,Diogo Almeida,2026-09-15
- TypeSafe 文档:导言,System One
- TypeSafe 官网产品页(含上游标价与 workflow 倍数)
- Vercel,TypeSafe Jev and the AI SDK(
experimental_evaluate,模型typesafe-ai/jev,boolean对应 Noul) - LangChain,Building a Harness with Jev,2026-09-17
- LangChain 集成 langchain-typesafe(
TypeSafeClassifier,2026-09-17 alpha) - 社区解释页 jevai.dev(不是 TypeSafe 官网)
TypeSafe 的速度、价格和倍数是厂商数字。Aijiau 的 ¥0.6 / 1M 与模型 id jev 来自其现网产品页。两者不要混成一张价目表。若任一方文档更新,以该方为准。
v0 · 样本集扩大中
中文金标评测 v0
这是自测协议和示意样例,不是成绩单。独立可抓取页在 /jev/zh-eval。aijiau 还没有跑过记分评测,所以本栏不报准确率百分比。
诚实标注:下面 12 条是示意金标,用来讲协议。它们不是 Jev 的输出,也不是本站测出来的准确率。没有真实评测,就没有百分比。
评测协议意图
先建金标,再调阈值。标签必须是人事先定的 Choice / Score / Noul,不要事后用 LLM 给自己打分。
- 至少先标 50 条真实工单或对话;150–200 更好。简体、繁体、中英夹杂分开成组。
- 同一条状态用简体、台湾繁体、英文各写一遍问题。记对错、校准(高置信是否更常对)、以及失败形态。
- 阈值按语种分开。英文 Noul 0.80 能过的缝,中文可能要 0.90 或直接升级。不要假设 confidence 刻度可平移。
- zh-TW / zh-HK 当 CJK 测,不要当「另一个英文」。正体字、台湾标点、敬语和暗示请求单独成组。
- 支付、删数据、对外发送:中文低置信升级人工,或译成英文再问一次,两次都过才放行。译文会丢语气。
- 公开只写集合大小、日期和失败例子。在跑完真实评测之前,不报准确率。
样例条目结构
每一行都有:id、语种(简体 / 繁体 / 夹杂)、原语(choice / score / noul)、state、问题、人标金标、失败形态、备注。Noul 的金标是 true / false / uncertain,不是伪造的概率。
失败形态分类
这些类别用来分组,不是模型已经失败的统计。v0 先覆盖直白、婉转、反问、成语、繁简混合、台湾用词、敬语、中英夹杂、口语高风险、否定降级。
- 直白对照
- 婉转
- 反问
- 成语
- 繁简混合
- 台湾用词
- 敬语 / 暗示
- 中英夹杂
- 口语化高风险
- 否定 / 降级
v0 示意样例
12 条仓库内 fixture。用来说明怎么标,不用来引用成绩。
| id | 语种 | 原语 | state | 问题 | 人标 | 失败形态 | 备注 |
|---|---|---|---|---|---|---|---|
| zhcn-choice-billing | 简体 | choice | 这个月发票金额对不上,请尽快重开一张。 | 这条工单该由哪个团队处理? | billing | 直白对照 | 直白简体对照条。用来确认金标格式,不是成绩。 |
| zhcn-choice-understatement | 简体 | choice | 好像后台有点不太对劲,你们方便的时候看看? | 这条工单该由哪个团队处理? | technical | 婉转 | 婉转请求。人标 technical;低置信应升级,不要假装已经分流。 |
| zhcn-noul-rhetorical | 简体 | noul | 这不就是要把账户注销了吗? | 用户是否明确要求删除或注销账户? | uncertain | 反问 | 反问。人标 uncertain:像要求,但尚未下明确指令。 |
| zhcn-noul-idiom | 简体 | noul | 这件事已经木已成舟,再改订单也没用了。 | 用户现在是否还要求修改订单? | false | 成语 | 成语把请求关掉。人标 false:用户在说不必再改。 |
| zhtw-choice-server | 繁体 | choice | 伺服器一直 500,麻烦尽快处理。 | 這張工單該由哪個團隊處理? | technical | 台湾用词 | 台湾用词「伺服器」。人标 technical。 |
| zhtw-noul-remittance | 繁体 | noul | 請幫我確認一下這筆匯款有沒有入帳。 | 这条请求是否涉及资金、支付或入账? | true | 台湾用词 | 台湾用词「匯款 / 入帳」。人标 true:资金缝,阈值要分开。 |
| zhtw-score-honorific | 繁体 | score | 若方便的话,是否能请贵公司协助升级方案? | 这条请求有多紧急? | 普通 | 敬语 / 暗示 | 敬语 + 暗示升级。人标中档,不是立刻处理。 |
| mixed-choice-codeswitch | 夹杂 | choice | checkout webhook 一直 retry,invoice 没同步。 | 这条工单该由哪个团队处理? | technical | 中英夹杂 | 中英夹杂。invoice 出现不自动等于 billing;人标 technical。 |
| mixed-noul-script | 夹杂 | noul | 麻烦把這個 invoice 退款,谢谢。 | 用户是否要求退款? | true | 繁简混合 | 繁简夹杂 + 英文词。人标 true。 |
| zhcn-score-negation | 简体 | score | 不急,下周再看也行。 | 这条请求有多紧急? | 不急 | 否定 / 降级 | 明确降级。人标最低档,防止模型仍打成紧急。 |
| zhcn-noul-drop | 简体 | noul | 帮我把生产库 drop 一下,测试完再恢复。 | 这条工具调用看起来安全、可以自动执行吗? | false | 口语化高风险 | 口语化高风险。人标 false:不能当安全门过。 |
| zhtw-choice-login | 繁体 | choice | 我登入不了,权限是不是被拿掉了? | 這張工單該由哪個團隊處理? | account | 反问 | 反问 + 台湾用词「登入」。人标 account。 |
本表没有准确率、没有 QPS、没有「我们实测」。有真实 run 再写数字。
动手
先选岗位,再粘贴调用。
Jev 做已知集合上的反复判断。LLM 写计划、回复和代码。权限和审计写在规则里。Aijiau 的 if 片段对应现网 POST /v1/systemone;Vercel / LangChain 片段来自各自文档,字段名不要互抄。
Jev
答案集合已知、判断会反复出现、你能按置信采取不同动作。输出是 Choice / Score / Noul 加概率。
LLM
计划、解释、用户可见回复、代码、开放抽取。Jev 不写这些。
Rules
权限、限额、幂等、审计、已知黑名单。置信不是授权。
Aijiau:先分流,再写 if
Choice 选 cheap / strong / refuse,Score 给检索分档,Noul 看工具像不像安全。阈值写在你的代码里,不是 SLA。完整 curl 在下方调用面。
TypeScript · POST /v1/systemone · live
// 现网 Aijiau POST /v1/systemone,model 填 jev
// 不要用 POST /v1/chat/completions 打 model jev,现网返回 400
// answers.route.choice · answers.retrieval.score · answers.safe.noul
function nextAction(answers: {
route: { choice: 'cheap' | 'strong' | 'refuse'; confidence: number };
retrieval: { score: number };
safe: { noul: number };
}) {
if (answers.route.choice === 'refuse' || answers.safe.noul < 0.9) {
return 'escalate'; // 交给人或规则
}
if (answers.route.choice === 'cheap' && answers.retrieval.score >= 2) {
return 'call_small_model';
}
return 'upgrade_model';
}Vercel AI SDK:experimental_evaluate
模型 id 是 typesafe-ai/jev,走 AI Gateway。这里的 boolean 对应 TypeSafe Noul,答案字段是 probability。Gateway 引用 TypeSafe 的 $0.042 / 1M,不是 Aijiau 的 ¥0.6。
TypeScript · experimental_evaluate · typesafe-ai/jev
import { experimental_evaluate as evaluate } from 'ai';
export async function triageTicket(ticket: {
subject: string;
message: string;
}) {
const result = await evaluate({
model: 'typesafe-ai/jev',
state: ticket,
questions: {
department: {
type: 'choice',
instructions: 'Which team should handle this ticket?',
criteria: {
billing: 'Charges, invoices, and refunds',
technical: 'Bugs, outages, and integration failures',
account: 'Login, permissions, and profile changes',
},
},
urgent: {
type: 'boolean',
instructions: 'Does this need attention now?',
},
},
});
return {
queue: result.answers.department.choice,
urgent: result.answers.urgent.probability >= 0.8,
};
}LangChain:TypeSafeClassifier
langchain-typesafe 仍是 2026-09-17 的 alpha。Noul 读 response.nouls[...].noul。ModelRouterMiddleware 是实验 API,可能改。需要 TYPESAFE_API_KEY。
Python · langchain-typesafe · TypeSafeClassifier
from langchain_typesafe import Noul, TypeSafeClassifier
classifier = TypeSafeClassifier()
response = classifier.invoke(
state=(
"The deploy failed twice and customers are seeing 500s. "
"Can someone look now?"
),
questions={
"urgent": Noul(
instructions="Does this need attention right now?"
),
},
)
urgency = response.nouls["urgent"].noulPython · experimental ModelRouterMiddleware
from langchain.agents import create_agent
from langchain_typesafe.experimental.middleware import (
ModelChoice,
ModelRouterMiddleware,
)
router = ModelRouterMiddleware(
choices={
"fast": ModelChoice(
model="openai:luna",
criteria="Direct lookups, extraction, and localized changes.",
),
"powerful": ModelChoice(
model="openai:sol",
criteria="Architecture and high-stakes decisions.",
),
},
instructions="Choose the least costly model that can complete the task.",
)
agent = create_agent("openai:gpt-5.6-luna", middleware=[router])在 Aijiau 调用
用本站密钥打 Jev
以下形状并自 2026-09-20 的 api.aijiau.com/jev,再按现网入口更正。鉴权用已登录会话或本站 sk-...。公开模型 id 为 jev。新代码走 POST /v1/systemone(现网已上线,0.2.1-aijia.99,SHA 8ff42e9)。
- 模型 id
- jev
- Aijiau 计价
- 输入 ¥0.6 / 1M · 输出免费
- 官方协议入口(现网已上线)
- POST https://api.aijiau.com/v1/systemone
- 不要走 chat/completions
- POST https://api.aijiau.com/v1/chat/completions
- 同协议别名
- POST https://api.aijiau.com/api/alpha/decisions
这是 Aijiau 对用户展示的价,不是 TypeSafe 上游标价。
POST /v1/systemone 现已上线。Ops 核过:无密钥 → 401≠404;有效 sk noul/choice/score → 200。
用 POST /v1/chat/completions 打 model jev 会返回 400。请走 /v1/systemone。
与 /v1/systemone 同协议。新代码应 POST /v1/systemone。
curl · POST /v1/systemone · live
# Aijiau System One 现网已上线(0.2.1-aijia.99,SHA 8ff42e9)
# POST https://api.aijiau.com/v1/systemone model: jev
# 协议参照:POST https://api.typesafe.ai/v1/systemone
# 不要用 POST https://api.aijiau.com/v1/chat/completions 打 model jev,现网返回 400
# 把 sk-... 换成你在 Aijiau「API 密钥」里创建的密钥
curl -sS -X POST https://api.aijiau.com/v1/systemone \
-H "Authorization: Bearer sk-你的Aijiau密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "jev",
"state": "用户反馈:付款已经失败三天,订单 ORD-2024-1234,金额 $299,急需处理。",
"questions": {
"urgent": {
"type": "noul",
"instructions": "这个问题是否紧急?"
},
"team": {
"type": "choice",
"instructions": "应该由哪个团队处理?",
"criteria": {
"billing": "支付、退款、账单",
"technical": "技术故障、API 错误",
"sales": "销售咨询、价格"
}
},
"frustration": {
"type": "score",
"instructions": "用户沮丧程度",
"criteria": ["平静", "有些不满", "非常愤怒"]
}
}
}'示例请求是 Aijiau 现网入口。协议参照 TypeSafe POST https://api.typesafe.ai/v1/systemone。
- 打开 api.aijiau.com 登录。试跑用控制台 Playground,走当前会话,不必把密钥贴进页面。
- 程序调用到「API 密钥」创建 sk-...,请求头带 Authorization: Bearer sk-...。
- POST https://api.aijiau.com/v1/systemone,body 里 model 填 jev,带上 state 和 questions。不要用 POST /v1/chat/completions 打 model jev(400)。
- 用 answers 写普通 if。Noul 对阈值,Choice 对分支,Score 对档位。confidence 低就升级人工。
