ax@ax-radar:~/daily/2026-07-18 $ cat newsletter/daily/2026-07-18.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-07-18性价比与落地真相

今天 AI 圈在拼性价比,不是模型

今天 AI 圈最有意思的不在某个模型又刷新了榜单,是两张账本同时翻动:Kimi K3 在写代码上跟 Claude 打平了,价格却只要三分之一;企业 AI 项目被曝成功率接近零,问题不在模型不行,是公司文档太烂。先来看 Kimi 这一笔。

Kimi K3 在写代码上跟 Claude 打平了,价格却便宜一大截

这条我会先打个折——不是官方跑分,是一个开发者日常写代码的实测。但正因为是日常实测,反而比跑分更有参考价值。

作者把 Kimi K3Claude 放在日常写代码里对比,发现输出质量和消耗的 token 数几乎一样,分不出区别。但价格差很远:K3 API 每百万输入 token 收 3 美元,输出收 15 美元;Claude 是 10 美元50 美元。订阅更夸张,Kimi 39 美元的编程套餐比 Claude 同价位大方得多,而 Claude 20 美元的套餐限制很紧。

这不是第一次有模型在代码质量上逼近 Claude。但之前的追赶者要么速度慢,要么不稳定。K3 这次的特点是"稳"——不是偶尔打平,是日常使用中持续打平。如果这个结论能复现,对个人开发者和中小团队来说,月费从 100 美元降到 39 美元,一年能省下不少。

不过有一点要注意:这只是一个人的日常测试,不是系统评测。K3 在边缘 case、长上下文推理、复杂重构上的表现还没看到数据。另外,Kimi 的 API 稳定性和速率限制也没提。先别急着切,但值得自己跑一下试试。

企业 AI 项目成功率接近零,问题不在模型

这条说实话我有点怀疑——"成功率 0%"这个数字太绝对了。但作者的说法有细节支撑,不是空喊。

作者过去一年半经手公司销售和技术项目,并和全球约 三百位从业者聊过,结论很直接:他看到的企业 AI 项目成功率是 0%。内部聊天机器人没人用,因为公司文档质量差,模型读不到没写下来的东西。对外客服机器人说话自然,但会悄悄丢掉请求——作者找 三菱汽车求助,机器人答应回电,六个月过去毫无音讯。

更尖锐的判断是:管理层回避追踪真实用量,对外却宣称生产力大幅提升。核心问题不全是 AI 不行,是公司内部的知识根本没被写下来,模型读不到。RAG(检索增强生成)听起来美好,但前提是你有东西可检索。

这个判断跟 HashiCorp 联合创始人 Mitchell Hashimoto 之前的说法对得上——他离开 HashiCorp 后也说过,企业 AI 落地的最大障碍不是模型能力,是数据质量和流程改造。

我会给"0%"这个数字打个折——三百人样本不算大,而且作者接触的可能是问题最严重的那批公司。但"文档质量差导致 RAG 失效"这个点,是真实的、普遍的、被严重低估的问题。

Claude Code 修了一堆权限漏洞,还加了新工具

这条不算大新闻,但对用 Claude Code 的人来说很实用。

Claude Code v2.1.214 修复了 Windows PowerShell 5.1 中的权限检查绕过漏洞,以及 Bash 权限检查对超长命令(超过 10,000 字符)和 zsh 变量下标比较的误判问题。同时新增了 EndConversation 工具和多处 Bash 权限检查改进。

权限检查绕过这个漏洞挺要命的——Claude Code 能直接执行 shell 命令,如果权限检查有洞,等于给模型开了不该开的门。这次修复说明 Anthropic 在安全上没松懈,但反过来也说明之前的权限模型确实有盲区。

编程助手的周配额最近老被偷偷重置

这条有点意思——不是技术问题,是产品策略问题。

Max Woolf 发现 Claude CodeCodex 最近疯狂送免费周配额,OpenAI 两周内重置了六次。他觉得这不像福利,更像是一种策略:趁你配额还没用完就重置,让你没空去试别家的产品。他自己从每月 20 美元升级到 100 美元,结果配额经常还剩一半就被重置,感觉像白扔了 12 美元,反而被逼着赶紧想新点子把额度花掉,搞得有点烦。

这个观察挺敏锐的。配额重置时机如果刚好卡在你快用完的时候,那是福利;如果卡在你还剩一半的时候,那是打断你的使用节奏,防止你切到竞品。OpenAI 和 Anthropic 在编程助手这块的竞争已经白热化,这种"软性锁定"策略不意外,但被用户直接点出来还是有点尴尬。

Fable 5 对战 GPT-5.6 Sol:/goal 命令到底有没有用?

这条测试设计得挺聪明——拿一个未公开的 NP-hard 光纤网络优化问题,让 Claude Fable 5GPT-5.6 Sol 各跑了三轮 30 分钟测试,对比普通模式和 /goal 模式。

Fable 5 的普通模式平均得分 32,386,比 Sol 的 34,261 低了 1,875 分(分数越低越好),而且三次普通跑分只差了 319 分,稳得离谱。/goal 模式赢了多数局却拉低了平均分——说明这个模式不该当默认开关用,只在特定场景下有用。

这个结论跟很多人的直觉相反。/goal 模式听起来像是"给模型一个明确目标,它会表现更好",但实际效果是:它在某些局里确实能赢,但整体稳定性下降。如果你在做一个不能接受翻车的任务,普通模式反而是更安全的选择。

把闲置 Mac 变成 Claude Code 的远程遥控机器

这条是实用教程,不算新闻,但思路挺巧。

教程教你如何把一台闲置 Mac 清空、建一个不绑 Apple ID 的本地账户、开 SSH 并设置免密码 sudo,然后从主力 Mac 或手机上的 Claude App 远程控制它跑 Claude Code。相比跑在容器里,这套方案能让 Claude 直接操控 macOS 原生应用(比如 Unity),而且网络请求走的是闲置机,不污染主力机。

对个人开发者来说,这相当于用一台旧 Mac 当 Claude Code 的专属"干活机"。成本几乎为零(旧机器本来就在吃灰),但能隔离环境、避免主力机被 Claude 的实验性操作搞乱。唯一需要注意的是安全——开了 SSH 和免密码 sudo,这台机器最好只跑 Claude Code,别放敏感数据。

今日小信号

  • transcribe.cpp 发布:Handy 维护者基于 ggml 做了个跨平台语音转文字库,支持 16 个模型族(60 多个模型),能用 Vulkan、Metal、CUDA 加速。每个模型都跟原版实现做过数值校验和词错率测试。目标是近乎直接替换 whisper.cpp。对需要在本地跑语音识别的开发者来说,多了一个经过严格验证的选项。

  • Kimi K3 在 SpreadsheetBench 2 上超过 Claude Fable 5:拿了第一,但 Reddit 帖子被屏蔽,看不到分数、评测方法和模型细节。先别太激动,等评测细节出来再说。

  • Index Ventures 联合创始人 Neil Rimer 说 AI 财富将面临"再分配":他呼吁科技领袖在推动自愿再分配中发挥主导作用。背景是加州正考虑对亿万富翁征收 5% 的一次性财富税。这个表态在风投圈不多见,但"自愿"两个字让整件事的可行性打了个折扣。

  • Lean 证实望月新一 ABC 猜想证明有漏洞:数学家 加藤文春发推说,形式化验证工具 Lean 找到了望月新一 ABC 猜想证明里的一个缺口。没说是哪一步出问题,但 Lean 能跑出这个结果,说明证明目前不完整。这条跟 AI 关系不大,但形式化验证工具在数学证明里的应用越来越多了。

更多

频道

后台