FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 07·29
多模型路由进了 Agent 会话,省钱的路子突然不灵了
多模型路由在单轮问答里能省钱省延迟,但一进多轮 Agent 会话就容易翻车。vLLM Semantic Router 的 issue #1439 记录了一个真实案例:用户在做 Go 重构,前几轮强模型跑得好好的,第四轮用户只说了句“looks good, commit it”,路由一看就四个词、难度低,直接切给一个 0.5B 小模型,结果小模型回了通客...
#Agent#vLLM#Anthropic#Cursor
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
多模型路由进 Agent 会话后容易翻车,因为路由器只看当前消息,看不到任务进度。vLLM 团队自己定的基线是:多模型系统得在同等预算和延迟下跑赢固定强模型,否则别折腾。
锐评
这篇文章把多模型路由在 Agent 场景下的尴尬讲得很透。核心矛盾在于,单轮问答里靠语义难度切模型能省钱,但多轮会话里,一句“looks good, commit it”被切给 0.5B 小模型后直接掉链子——路由器只看四个词,不知道前面几轮强模型已经搭好了代码重构的上下文。
文章梳理了四个工程硬伤:历史格式不兼容、Prompt Cache 失效、隐式思维链无法迁移、多模态产物缝合成本高。这些不是算法问题,是物理限制。目前业界的应对分三路:Cursor 和 Claude Code 用子任务隔离上下文;vLLM 的 SAAR 让路由器记住会话状态并在工具调用期间锁模型;大多数生产环境干脆固定用一个强模型,省心。
信息源主要来自 vLLM Semantic Router 的 issue 和官方博客,案例具体,但缺少第三方生产环境的对比数据。文章没披露固定强模型方案在实际业务中的成本占比,也没给出子任务方案在复杂工作流里的失败率。这些缺口让“最佳固定模型”基线听起来合理,但缺乏量化支撑。
HKR 分解
hook ✓knowledge ✓resonance ✓