Kimi Work 这次加了两个东西:一个是目标模式,你定个终点,Agent 自己循环推进,最长能跑 24 小时,中间随时可以打断调整。另一个是插件中心,能接百度网盘、飞书、WPS、Notion、钉钉、Canva 和 Cloudflare 这些外部应用。6 月有个限时福利,电脑客户端 Work 模式的任务额度消耗从 0.02% 降到 0.01%,相当于...
#Moonshot AI#Kimi#Baidu Netdisk
一句话点评
Kimi Work 这次更新让 Agent 能自己跑任务了,最长 24 小时,中间随时能打断。插件中心接入了百度网盘、飞书、WPS 等常用工具,实用性不错。6 月额度消耗打五折,从 0.02% 降到 0.01%,用起来确实便宜了。但正文没具体说目标模式能处理什么类型的任务,也没讲插件是怎么调用的,是自动识别还是手动选择。这些细节缺了,实际好不好用还得自己试。
MAME 开发者 Arbee 用 Claude Code 和 GPT 5.5 Pro 调试 Power Macintosh 模拟器。大约一周内,AI 在 Pippin 和 Power Mac 7200 模拟中发现了十几个 Bug,包括 6522 VIA 芯片的通信故障、PowerPC DRC 的缓存值污染(执行时用了生成时缓存的旧值而非当前机器状态),...
#Code#MAME#Claude Code#GPT 5.5 Pro
一句话点评
MAME 开发者 Arbee 用 Claude Code + GPT 5.5 Pro 一周内找出十几个 Power Mac 模拟器 Bug,包括 6522 VIA 通信故障、PowerPC DRC 缓存值污染(执行时用了生成时缓存的旧值而非当前状态)、原子加载/存储指令问题。修复后 Pippin 能播放启动音并显示 Logo,Power Mac 7200 亮屏并显示软盘图标。AI 还帮忙逆向...
微软研究员 Adrian de Wynter 用《帝国时代2》的地图编辑器造出了 NAND 门、感知机和训练电路。山羊当信号载体,草地和桥梁分别代表 0 和 1。他先证明了游戏是图灵完备的,然后说:如果把大语言模型的底层载体换成游戏逻辑,我们对它“像人”的感知也会变。论文和代码都给了链接,但正文没披露发在哪。
Alex Ellis 用一块 RTX 6000 Pro 跑本地模型,两三个月就回本了。Qwen 27B 在 SWE-Bench 上只比 Claude Opus 4.8 低 12%,但一到他写的 Go 分布式系统里,量化后的模型就会陷入死循环和幻觉——他仍然不敢让它无人值守干活。正文没披露 token 速度和延迟数据。
#Code#Benchmarking#Alex Ellis#OpenFaaS
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Alex Ellis 用一块 RTX 6000 Pro 跑本地模型,两三个月回本,但量化后的 Qwen 在他写的 Go 分布式系统里会死循环和幻觉,他仍不敢让它无人值守干活。
锐评
Alex Ellis 的这篇长文不是跑分报告,而是一个小软件公司创始人的真实账本。他花 6000 美元买了块 RTX 6000 Pro 跑本地 Qwen 27B,两三个月就靠替代云端 API 调用回了本。在 SWE-Bench 基准上,Qwen 27B 只比 Claude Opus 4.8 低 12%,看起来差距不大。但一到他实际写的 Go 分布式系统代码里,量化后的模型就会陷入死循环和幻觉,生成不可用的代码。所以他现在的用法很明确:本地模型干粗活、处理非关键任务,核心代码和无人值守的 agent 工作流还是交给云端旗舰模型。
文章最大的信息缺口是没给任何 token 生成速度和延迟数据,只说量化后问题变多,但没量化到底慢了多少、卡在哪个环节。另外,他的场景高度集中在 Go 语言和底层基础设施代码,这个结论能不能迁移到 Python、前端或者 CRUD 业务代码上,正文没讨论。回本速度也跟他的 API 调用量强相关,如果你用量没他大,回本周期会拉长不少。
Tine 不是聊天窗口,而是直接嵌在 Mac 刘海里的 AI 光标。它会实时读取你当前在用什么软件、选中了什么、上一步做了什么,你不用再复制粘贴背景信息。下个指令,它就能跨软件帮你干活:往 Slack 发消息、写笔记、跑调研、填表单。早期版本会误读界面元素或行为不稳定,团队后来围绕三条规则重做:让你看清它看到了什么、动手前必须获得明确许可、你一碰鼠标就...
#Tine#hritvik Gupta
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
一个住在 Mac 刘海里的 AI 光标,能跨软件帮你干活,但正文没披露模型、定价和延迟数据,先别太激动。
锐评
Tine 把 AI 从聊天框里拽了出来,直接做成一个能看懂你屏幕、接管鼠标的“第二光标”。它实时读取你当前在用什么软件、选中了什么、上一步做了什么,你不用再复制粘贴背景信息。下个指令,它就能跨软件帮你发 Slack、写笔记、跑调研、填表单。团队说早期版本会误读界面元素或行为不稳定,后来围绕三条规则重做:让你看清它看到了什么、动手前必须获得明确许可、你一碰鼠标就立刻交还控制权。默认在设备本地运行,每一步都有日志。
但这是一条 Product Hunt 发布帖,不是技术报告。正文没提用了什么模型、响应延迟多少、收费怎么算,也没给出真实场景下的稳定性数据。跨软件操控对屏幕识别和操作可靠性要求极高,早期版本已经翻过车,新版修到什么程度完全未知。如果它真能在复杂界面里稳定干活,确实省事;但在看到实测之前,我会先打个折。
Anthropic 扒了 40 万次 Claude Code 会话,发现修 bug 的活少了近一半,运维和写作翻了一倍。人定方向,AI 干执行的分工已经成型。
锐评
这份报告最值钱的地方不是趋势判断,而是把“会用 AI 写代码”这件事拆出了可量化的台阶。新手验证成功率 15%,中级以上跳到 28%-33%,但遇到硬骨头,新手成功率只有 4%,专家是 15%。差距不在顺风局,在卡住以后怎么解套。报告给的解法很实在:别推倒重来,回到对话记录里找到第一次跑偏的那一步,从那里修正。这比大多数人“删了重问”的习惯聪明得多,因为已有的上下文对齐是沉没成本,不该扔。
另一个被反复跳过的技能是拆任务。单条指令让 AI 一口气跑到底,出错了你都不知道在哪一步歪的。拆成三到五步,每步有独立产出和验证点,跑熟了再把检查点变成规则让 AI 自己验。这不算新技能,但报告用数据说明了一个事:会写 prompt 的人多,会设计多步流程的人少,而后者才是把成功率从 15% 拉到 28% 的关键。
报告的限制也得说清楚。数据只来自交互式会话,不含 CI 管道自动调用,成功信号只看 CI 过没过、测试绿不绿、用户点没点确认,没量长期维护成本。七个月的时间跨度里模型版本在迭代,用户熟练度在涨,这些变化是多种力量共同作用的结果,不能全算在用法迁移上。
xAI 发了一个免费的微软 Word 插件,装完就能在文档里直接使唤 Grok。你可以让它把零散笔记扩写成结构完整的正文,或者帮你起草提案、手册这类东西。它还能统一多个作者的文风、改语法和润色。插件支持联网搜索和搜 X 上的内容,也能生成图表。如果你连上了 Grok 的“连接器”,它还能从你最近的邮件、SharePoint 或 Google Drive...