持续报道 · 1dFEATUREDAI HOT 精选· aihot-apiZH00:00 · 09·19
OpenRouter 基准测试 Jev 与大模型:客服分类便宜百倍但无法生成文本
OpenRouter 拿 TypeSafe 的 Jev 1.13 跟 GPT Luna、Claude Opus 跑了 60 张客服工单。Jev 做分类和判断要不要升级,每 1000 张票只要 0.025 美元,中位延迟 194 毫秒;Luna 要 0.09 美元,Opus 要 2.88 美元。Jev 直接返回带概率的类型化结果,不用再解析 JSON。但...
#OpenRouter#TypeSafe#Jev
精选理由
精选 · 重要度 82 · 吸引力 + 知识量
一句话点评
OpenRouter 拿 Jev 和 Claude Opus 5 跑客服分类,Jev 每千张工单成本 2.5 美分、延迟 194 毫秒,比 Opus 便宜百倍、快十倍,但它不会写回复。
锐评
这篇博客最实在的地方是给了具体数字:Jev 1.13 做客服工单分类,每千张只要 0.0248 美元,中位延迟 194 毫秒;对比之下 Claude Opus 5 要 2.88 美元、近两秒,GPT Luna 也要 0.09 美元、一秒多。便宜和快是实打实的,但 Jev 只能输出你预设好的选项和概率,没法生成回复文本。所以作者给的方案很实际——用 Jev 做路由和分类,把结果交给代码逻辑,最后让大模型写回复。
不过要冷静看:测试只有 60 加 40 个样本,跑了一天,一套提示词。样本量太小,没法说这个准确率能稳定复现。Jev 本身也有明确短板——不会算数、不会比日期、输入里夹带无关信息时准确率会掉。正文没披露分类准确率的具体对比数字,只说“形状是这么个形状”,所以别把它当排行榜看。
如果你业务里大量工作是“把用户问题分到 N 个桶里”,Jev 这类决策模型确实值得试。但前提是你的分类边界清晰、输入干净,而且你接受它只做选择题。
HKR 分解
hook ✓knowledge ✓resonance —