今天 AI 圈在拼落地,不是拼参数
今天 AI 圈最有意思的不在某个模型又刷榜了,是几件事同时指向同一个方向:把 AI 塞进真实工作流。Anthropic 让 Claude 在 Slack 里当同事,内部 65% 的代码已经是它写的;豆包专业版能直接操控你的电脑和浏览器干活,月费 68 元起;京东开源了一个会盯着视频流自己决定什么时候说话的模型。先来看 Claude Tag 这一笔。
Anthropic 把 Claude 塞进 Slack 当同事,内部 65% 的代码已经是它写的
这条我今天看了两遍。Anthropic 推出了 Claude Tag,不是新模型,是一个新用法:在 Slack 频道里 @Claude,它就像一个同事一样接活。
具体来说,Claude 会记住频道里的上下文,把任务拆成几步异步执行,还能主动提醒你哪些讨论没下文了。在 Anthropic 内部,产品团队 65% 的代码已经是内部版 Claude Tag 写的,这个用法还扩展到了查指标、处理工单和找 bug。今天起对 Enterprise 和 Team 客户开放 beta。
有意思的地方不在技术本身,在于这个产品形态。它不是给你一个聊天窗口让你跟 AI 对话,而是把 AI 塞进你已经在用的协作工具里。你不需要切换上下文,不需要专门去"用 AI",它就在那儿,跟其他同事一样。
Anthropic 还配套发了一篇博客讲 agent identity 访问模型:Claude 在共享频道里以独立身份工作,不是模拟某个用户。管理员可以精细控制工具和渠道访问权限、设置 token 消耗限额,私有频道拥有独立身份,记忆和访问不跨频道流转。这个权限设计比"给 AI 开个账号"要细得多。
我会先打个折:65% 这个数字是 Anthropic 自己说的,外部团队能不能复现这个比例还不好说。但方向是对的——AI 进工作流,不是进聊天框。
豆包专业版能直接操控你的电脑,月费 68 元起
字节这步走得挺快。豆包今天推出了专业版,把能执行任务的 豆包 2.1 Pro 模型塞进了办公场景。它能直接操控你的本地电脑和浏览器,调用各种技能插件、设置定时任务,还内置了 Office 套件,甚至能生成带后端数据库的在线应用。
价格分三档:标准套餐每月 68 元(连续包月),加强套餐 200 元,高级套餐 500 元。免费用户只能用豆包 2.1 Turbo 版的办公模式,专业版才解锁 Pro 模型。
跟 Claude Tag 比,豆包走的是另一条路:不是嵌入已有工具,而是自己当操作系统。它能操控你的电脑,这个权限比在 Slack 里接活要大得多。但反过来,用户信任门槛也高得多——你愿意让一个 AI 直接操控你的电脑吗?
字节同时发了 Seed2.1 系列,面向真实生产力场景的智能体。Seed2.1 Pro 在 GDPval 基准获最高分,MobileWorld 手机 GUI 任务最高分,代码能力上开发者评测相比 Claude Opus 4.
6 获 59.1% 胜率。模型已在豆包、TRAE 上线,API 通过火山方舟提供。
上下文窗口和并发限制正文没提,性能先别急着下结论。但 68 元的定价,如果真能稳定操控电脑干活,对个人用户来说不算贵。
京东开源了一个会"边看边说"的模型,监控场景胜率 100%
京东放出了一个全栈开源的交互模型 JoyAI-VL-Interaction,能盯着视频流看,自己判断什么时候该开口说话。不像传统模型一问一答,它是边看边说,碰到复杂任务还能甩给后台 agent 处理。
在 58 个人的盲测里,对比豆包视频通话助手赢了 77.6%,对比 Gemini 赢了 87.9%,监控预警场景直接 100% 胜率。开源包里给了模型权重、交互数据集、训练方案和一套能直接部署的系统,支持摄像头、直播流等视频输入。
58 个人的样本确实太小,这个胜率不能直接当性能指标看。但"主动看视频流、自己决定什么时候说话"这个能力本身值得关注。传统模型是被动等指令,这个是主动感知环境变化。监控、老人看护、直播讲解这些场景,确实需要一个能自己判断"现在该说话了"的模型。
网易有道开源语音克隆:3 秒录音,14 种语言,不带口音
网易有道把语音克隆的门槛打下来了。Confucius4-TTS 模型,给它听 3 秒钟的录音,就能克隆你的音色,然后用你的声音流利地说出包括中、英、日、韩、法、德等在内的 14 种语言,而且没有那种一听就是老外在说话的奇怪口音。
官方给出的数据是克隆相似度超过 85%,任务准确度 97%。代码和模型全开源,Apache 协议,商用也不限制。底层采用 GPT 式语义大模型、SSL 预训练特征与 Flow Matching 框架。
这个数字得打个折看——测试集规模和具体评测条件正文没提。另外 54GB 的完整包对本地部署来说不算小,显存和硬盘需求也没说,想跑起来得自己试。但对做配音、数字人、短剧出海的人来说,这是个现成的工具。
Mistral OCR 4 加了定位和分类,但自称 SOTA 没放跑分
Mistral 今天发了 OCR 4,主要加了两样东西:bounding boxes(告诉你文字在页面哪个位置,不只是把字提出来)和 block classification(把段落、表格、图片分好类)。支持 170 种语言,定价每 1000 页 4 美元,Batch API 享 50% 折扣。
在 OlmOCRBench 上得分 85.20,独立标注者偏好率平均 72%。这个跑分是发稿后才补上的,之前官方只说自己是 SOTA 但没放数据。现在有了,但 72% 的偏好率不算碾压级。
对发票、合同、扫描件这类版面解析场景,bounding boxes 确实实用——定位后可以直接做布局还原。但价格和延迟跟竞品比怎么样,还得等第三方实测。
FastWan-QAD:单卡 5090 跑 5 秒视频只要 1.8 秒
Sky Computing Lab 放出了 FastWan-QAD,一个用"量化感知蒸馏"压缩过的视频生成模型。在单张 RTX 5090 上,端到端生成一段 5 秒 480P 视频只要 1.8 秒。模型权重、代码和博客都公开了。
这个速度确实快,比很多同类方案快一个数量级。但 480P 分辨率偏低,正文没提画质和动作连贯性,也没说量化后质量掉了多少。如果只是速度快但画面糊,实用性就打折扣了。
今日小信号
- Oracle 一年裁了 2.1 万人,省下的钱拿去还债和砸 AI 数据中心。信号很清楚:云基础设施比人贵,大厂没得选,只能砸钱抢算力。
- 五眼联盟发报告说 AI 让网络攻击门槛大降,几个月内普通用户也会遭殃。攻击者用 AI 批量生成逼真钓鱼邮件、伪造领导声音视频。但缺少具体攻击案例,更像预警信号。
- GitHub 联合开源联盟要求修改加州 AI 透明度法案 SB 942,现行草案要求开发者在下游用户未履行义务时撤销开源许可证,这与开源许可证永久不可撤销的性质冲突。联盟主张把义务放在部署模型的服务商身上。
- IBM 开源 CUGA 智能体框架,一个文件就能跑一个应用,附带二十多个现成例子。在 AppWorld 和 WebArena 两个基准上都拿了第一。
- Runway 一口气发了三个视频模型:Seedance 4K、Mini 和 Kling 3.0 Turbo。官方自称"全球最佳模型合集",但缺少任何基准测试,新用户用优惠码 30RUNWAY 前三个月七折。