ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-01

22 items · updated 3m ago
RSS live
2026-05-01 · 星期五2026年5月1日
05:29
88d ago
● P1新智元 · 公众号· rssZH05:29 · 05·01
OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手
OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...
#Agent#Code#Tools#OpenAI
精选理由
精选 · 重要度 86 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 让 Codex 直接接管 Mac 操作,跨三个 Adobe 软件跑完音频到出图流程,人只围观。但正文被微信环境拦截,具体细节和评分依据看不到,这点先别太激动。
锐评
这条消息的核心是 Codex 从“帮你写代码”变成了“替你操作电脑”。测试里 Mike Russell 让它在 Mac 上跨 Audition、Photoshop 和 Firefly 干活,全程零人工干预,大概 8 分钟完成,自评 85 到 90 分。同时接入了 Slack、Google Workspace 和 Microsoft 365,说明 OpenAI 在推 OS 级接管,不是单纯补全代码。 但必须打折:原文因为微信环境异常被拦截,我拿到的只有摘要。8 分钟是快是慢、85 分怎么打的、任务复杂度到底多高、有没有翻车步骤,这些关键信息正文都没披露。另外,跨软件操作对稳定性和权限要求极高,一次演示能跑通不代表日常可用。 还缺三样东西:一是失败案例和边界条件,二是对系统资源、延迟、安全权限的实测数据,三是跟其他桌面 agent 方案的横向对比。如果这些补不上,目前只能当一次精心编排的 demo 看。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K1·R1
05:26
88d ago
r/LocalLLaMA· rssEN05:26 · 05·01
骁龙8 Gen 3的NPU跑llama.cpp,4B模型能到12.5 token/s
Reddit用户在一加12(骁龙8 Gen 3)上用NPU跑llama.cpp,Gemma 3 4B Q4_0的生成速度是12.5 token/s,12B Q4_0降到4.5 token/s。目前只支持Q4_0、IQ4_NL、MXFP4、Q8_0和F32这几种量化格式,不支持KV cache量化。最大的限制是NPU只有4GB地址空间,而且需要多HTP(...
#Inference-opt#Qualcomm#llama.cpp#Nvidia
一句话点评
骁龙8 Gen 3的NPU跑llama.cpp,4B模型12.5 token/s,12B降到4.5,但只支持几种量化格式,且NPU只有4GB地址空间。
锐评
这条消息对端侧AI玩家是个好消息:一加12上的骁龙8 Gen 3 NPU能跑llama.cpp,Gemma 3 4B Q4_0生成速度12.5 token/s,12B Q4_0也有4.5 token/s,比纯CPU快不少。但限制很明显:目前只支持Q4_0、IQ4_NL、MXFP4、Q8_0和F32这几种量化,不支持KV cache量化,意味着长上下文场景会吃亏。更大的瓶颈是NPU只有4GB地址空间,跑12B模型已经接近极限,而且需要多HTP(硬件线程)配置,不是开箱即用。正文没披露功耗和发热数据,这点先别太激动——如果NPU跑起来手机发烫,实际体验会打折扣。另外,这个后端目前是个人项目,没有Qualcomm官方支持,API稳定性和模型兼容性都存疑。对于想低成本在手机上跑本地模型的用户,这是个值得关注的进展,但离“日常可用”还有一段距离。
HKR 分解
hook knowledge resonance
打开信源
69
SCORE
H1·K1·R1
04:45
88d ago
r/LocalLLaMA· rssEN04:45 · 05·01
穷人的RTX 3090翻新指南:自己动手给二手卡换硅脂清灰
Reddit用户canred发了一篇二手RTX 3090的维护教程,适合想省钱跑本地大模型的人。教程包含拆机照片和HWiNFO的前后对比数据,但正文没披露具体温度、显存或性能数字,所以效果提升幅度未知。有用的部分是步骤可复现:拆散热器、清灰、换导热垫和硅脂。如果你手头有二手3090,可以照着做一遍,成本就是硅脂和垫片的钱,比送修划算。
#Inference-opt#Reddit#RTX 3090#HWiNFO
一句话点评
二手3090清灰换硅脂,成本几十块,散热和性能可能回升。
锐评
Reddit 用户 canred 发了一篇二手 RTX 3090 的维护教程,面向想省钱跑本地大模型的人。教程步骤可复现:拆散热器、清灰、换导热垫和硅脂,成本就是硅脂和垫片的钱,比送修划算。但正文被屏蔽,只从摘要得知包含拆机照片和 HWiNFO 前后对比数据,具体温度、显存或性能数字没披露,所以效果提升幅度未知。如果你手头有二手 3090,照着做一遍大概率能改善散热,但别指望显存频率或推理速度有质变——清灰主要解决积热降频,对 LLM 推理的 token 生成速率影响有限。缺的是实测对比:清灰前后跑同一个 7B 模型的 token/s 变化,以及导热垫厚度型号。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
04:28
88d ago
r/LocalLLaMA· rssEN04:28 · 05·01
Pocket TTS 多语言更新:六语种离线语音合成,延迟最低 30ms
Pocket TTS 发布了多语言版本,支持英、法、西、德、意、葡六种语言。作者正在改 ONNX 导出器,每个语言单独一个模型,并做了选择性 int8 量化。实测在 Ryzen 9 7950X 上延迟约 30ms,速度是实时 13 倍;在 Helio G99 手机上约 100ms,速度 2.5 倍实时。这个延迟在本地跑算挺低的,手机端也能用。不过正文没...
#Audio#Inference-opt#Pocket TTS#KevinAHM
一句话点评
本地 TTS 延迟低到 30ms,手机也能跑,但只支持六种语言。
锐评
Pocket TTS 这次更新把多语言 TTS 做到了本地可用的水平。实测在 Ryzen 9 7950X 上延迟约 30ms,速度是实时的 13 倍;在 Helio G99 手机上约 100ms,速度 2.5 倍实时。这个延迟在本地跑算挺低的,手机端也能用。不过正文没披露模型参数量、训练数据来源和语音自然度评分,只说了每个语言单独一个模型,做了选择性 int8 量化。目前只支持英、法、西、德、意、葡六种语言,中文用户暂时用不上。如果是做离线语音助手或低延迟播报场景,这个项目值得关注,但泛化能力和音质还需要更多第三方评测。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H0·K1·R1
03:41
88d ago
r/LocalLLaMA· rssEN03:41 · 05·01
Qwen3.6-27B 量化版评测:一张 RTX 5090 跑 19 轮,生成 9.4 万 token
Kyle Hessling 用一张 RTX 5090 自测了 Qwen3.6-27B 的 UD-Q5_K_XL 量化版,跑了 19 轮,总共生成 9.4 万 token。测试覆盖了 agent 推理、前端设计和 Canvas/WebGL 编码。一张卡能跑这么多轮,说明量化后显存压力不大,适合本地部署。但正文没披露具体分数,所以效果到底怎么样还不好说。
#Reasoning#Code#Inference-opt#Qwen
一句话点评
一张 RTX 5090 跑了 19 轮 Qwen3.6-27B 量化版,覆盖 agent 推理和编码,但没给分数。
锐评
Kyle Hessling 用一张 RTX 5090 自测了 Qwen3.6-27B 的 UD-Q5_K_XL 量化版,跑了 19 轮,总共生成 9.4 万 token。测试覆盖了 agent 推理、前端设计和 Canvas/WebGL 编码。一张卡能跑这么多轮,说明量化后显存压力不大,适合本地部署。但正文没披露具体分数,所以效果到底怎么样还不好说。另外,来源是 Reddit 个人帖,没有第三方验证,分数和对比基线都缺失,参考价值有限。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
03:37
88d ago
r/LocalLLaMA· rssEN03:37 · 05·01
英伟达发了个26B的Gemma-4量化版,RTX 5090能跑50K上下文
Reddit用户分享了英伟达的Gemma-4-26B-A4B-NVFP4模型文件,18.8GB。实测RTX 5090占用80%的32GB显存,能跑到约50K上下文。NVFP4量化下GPQA Diamond得分79.90%,AIME 2025得分90.00%。注意这是Reddit用户发的,正文被屏蔽了,没披露训练数据、量化方法细节或评测条件,所以分数参考...
#Inference-opt#Reasoning#Code#NVIDIA
一句话点评
18.8GB的Gemma-4量化版,RTX 5090能跑50K上下文,但来源是Reddit用户,分数要打折。
锐评
英伟达把Gemma-4-26B(实际激活4B参数)用NVFP4量化到18.8GB,RTX 5090只占80%显存就能跑约50K上下文,显存门槛确实低。GPQA Diamond 79.90%、AIME 2025 90.00%的分数看着不错,但注意这是Reddit用户发的,正文被屏蔽,没披露量化方法细节、评测条件或训练数据,所以分数参考价值有限。如果是真的,这个量化效率对本地部署挺省钱,但建议等官方或第三方复现后再信。
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K1·R1
02:00
88d ago
TechCrunch AI· rssEN02:00 · 05·01
ChatGPT 图片 2.0 在印度火了,但其他地方还没跟上
OpenAI 说印度是 ChatGPT 图片 2.0 的最大用户群,用户拿它做头像、电影风人像等个人视觉内容。但第三方数据(Sensor Tower)显示全球增长有限,只有几个新兴市场有短期冲高。正文没披露具体用户数、增长率或地区对比数据,所以“印度火”这个判断目前主要靠 OpenAI 自己说的,外部验证还比较弱。值得关注的是印度用户能不能转化成付费留...
#Multimodal#Vision#OpenAI#ChatGPT
一句话点评
OpenAI 说印度用户最爱用 ChatGPT 图片 2.0 做头像和电影风人像,但第三方数据(Sensor Tower)显示全球增长有限,只有几个新兴市场短期冲高。
锐评
OpenAI 自称印度是 ChatGPT 图片 2.0 的最大用户群,用户拿它做头像、电影风人像等个人视觉内容。但第三方数据(Sensor Tower)显示全球增长有限,只有几个新兴市场有短期冲高。正文没披露具体用户数、增长率或地区对比数据,所以“印度火”这个判断目前主要靠 OpenAI 自己说的,外部验证还比较弱。值得关注的是印度用户能不能转化成付费留存,以及 OpenAI 会不会因此调整定价或功能策略。目前缺的是每分钟通话成本、支持哪些国家号码、API 调用限制等关键信息,这些才是判断产品是否真正“赢”的依据。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
01:50
88d ago
Product Hunt · AI· rssEN01:50 · 05·01
Seemore Data:号称让 Snowflake 账单自动砍掉 40%
Seemore Data 是一个数据上下文引擎,用训练好的 agent 和算法自动发现 Snowflake 环境里的性能瓶颈和浪费,然后直接帮你修好。官方说平均能省 40% 的成本。不过目前只有 Product Hunt 上的简介,具体怎么做到的、定价多少、在什么条件下能复现这个 40%,正文都没说。首年打九折,适合被 Snowflake 账单折磨的团...
#Agent#Inference-opt#Seemore Data#Snowflake
一句话点评
Snowflake 账单太高?这个工具说能自动砍掉 40%。
锐评
Seemore Data 是一个数据上下文引擎,用训练好的 agent 和算法自动发现 Snowflake 环境里的性能瓶颈和浪费,然后直接帮你修好。官方说平均能省 40% 的成本。不过目前只有 Product Hunt 上的简介,具体怎么做到的、定价多少、在什么条件下能复现这个 40%,正文都没说。首年打九折,适合被 Snowflake 账单折磨的团队先观望。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H0·K0·R1
01:41
88d ago
彭博科技· rssEN01:41 · 05·01
OpenAI 财务官说需求像“一堵垂直的墙”
OpenAI 的 CFO Sarah Friar 表示公司正在达成目标,并且看到需求像“一堵垂直的墙”一样陡峭。但正文没披露具体目标数字、收入或产品拆分,所以这个说法目前更像一个信心信号,缺少硬数据支撑。
#OpenAI#Sarah Friar#Commentary
一句话点评
OpenAI CFO说需求像一堵垂直的墙,但没给数字,先当信心信号看。
锐评
OpenAI CFO Sarah Friar 说公司正在达成目标,需求像“一堵垂直的墙”一样陡峭。这个比喻很形象,但正文没披露具体目标数字、收入或产品拆分,所以目前更像一个信心信号,缺少硬数据支撑。对于从业者来说,值得关注的是这句话背后可能暗示的算力或API调用量增长,但Bloomberg这篇报道本身信息量有限,没有给出任何可验证的指标。如果后续有季度财报或使用量数据佐证,这个说法才有实际参考价值。目前建议先标记为“高管放话”,等具体数字出来再判断。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H0·K0·R1
01:03
88d ago
r/LocalLLaMA· rssEN01:03 · 05·01
Qwen 3.6 27B vs Gemma 4 31B:谁写个吃豆人游戏更强?
Reddit 用户用同一个提示词让两个模型写一个单文件吃豆人游戏。Qwen 3.6 27B 输出了 33,946 个 token,耗时 18 分 4 秒;Gemma 4 31B 只输出了 6,209 个 token,耗时 3 分 51 秒。发帖人觉得 Gemma 更强,但没给出可复现的评分标准,所以这点先别太激动。
#Code#Benchmarking#Qwen#Gemma
一句话点评
Gemma 4 31B 输出量只有 Qwen 3.6 27B 的五分之一,耗时却不到四分之一,但发帖人没给评分标准,这点先别太激动。
锐评
Reddit 用户用同一个提示词让两个模型写单文件吃豆人游戏。Qwen 3.6 27B 输出了 33,946 个 token,耗时 18 分 4 秒;Gemma 4 31B 只输出了 6,209 个 token,耗时 3 分 51 秒。发帖人主观判断 Gemma 更强,但正文没披露可复现的评分标准,所以这个结论只能当参考。 关键限制:来源是 Reddit 个人测试,不是标准化 benchmark;正文没给出每分钟通话成本、支持哪些国家号码、API 机制或调用限制。如果 Gemma 真的用更少 token 生成同等质量的代码,那对本地部署挺省钱——但缺了客观评分,这个判断挂不住。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
00:29
88d ago
Hacker News 首页· rssEN00:29 · 05·01
ClawIRC:给 AI Agent 用的 IRC 聊天频道
ClawIRC 上线了一个专供 AI Agent 使用的 IRC 聊天页面,标题里直接写了用途。页面目前只展示了服务器地址(irc.clawirc.com:6697)、注册入口和一个叫 lobby 的欢迎频道,在线用户数为 0。正文没披露 Agent 怎么接入、用什么协议、是否需要认证,也没说跟普通 IRC 有什么区别。0 条评论、6 个点赞,目前更像...
#Agent#ClawIRC#Hacker News#Product update
一句话点评
一个专供 AI Agent 用的 IRC 聊天室,目前在线人数为 0。
锐评
ClawIRC 上线了一个 IRC 页面,标题写明是给 Agent 用的。页面只展示了服务器地址、注册入口和一个 lobby 频道,在线用户数为 0。正文没披露 Agent 怎么接入、用什么协议、是否需要认证,也没说跟普通 IRC 有什么区别。0 条评论、6 个点赞,目前更像一个占位页面。缺的东西很多:每分钟通话成本、支持哪些国家号码、Agent 是否需要 API key、并发上限是多少。如果只是 IRC 换个壳,Agent 开发者大概率不会迁移。
HKR 分解
hook knowledge resonance
打开信源
46
SCORE
H1·K0·R0
00:24
88d ago
Dwarkesh Patel 访谈· atomEN00:24 · 05·01
AI 不像核武器,别拿冷战吓自己
这条视频标题说“AI 与核武器的类比是错的”,但正文是空的,没给出任何论据、发言人、时间或具体案例。所以只能看标题本身:它反对把 AI 风险等同于核威慑,暗示两者扩散逻辑、失控路径和治理方式都不同。但因为没有内容,没法判断它是在反驳“AI 会毁灭人类”还是“AI 军备竞赛”这类具体说法。正文没披露任何支撑信息。
#Commentary
一句话点评
标题党,正文空,没法判断它反驳的是哪种AI-核武类比。
锐评
标题说“AI与核武器的类比是错的”,但正文一个字都没有,来源是YouTube Shorts,发布时间2026年5月1日。因为没有内容,只能猜它反对的是把AI风险等同于核威慑——比如认为AI扩散更快、失控路径更隐蔽、治理更难套用冷战框架。但具体是反驳“AI会毁灭人类”还是“AI军备竞赛”,完全不清楚。正文没披露发言人、论据或案例,这点先别太激动。如果真想讨论这个议题,建议找有完整论证的文章,比如对比核弹的物理垄断和AI模型的开源扩散,或者核威慑的相互确保摧毁与AI的“单点失控”风险。目前这条视频只提供了一个观点标签,信息缺口太大,没法做有效判断。
HKR 分解
hook knowledge resonance
打开信源
35
SCORE
H1·K0·R1
00:00
88d ago
Computing Life · Share · 鸭哥调研· rssZH00:00 · 05·01
Cursor 的 Agent Harness 文章,真正该读的是它的评估体系
Cursor 发了一篇讲 agent harness 持续改进的博客,但重点不是那些具体技巧(比如动态上下文、工具格式适配),而是它背后那套 evaluation-first 的决策方式:先定义什么叫“好”,再用实验验证每个假设,最后决定上不上线。文章把评估体系拆成三块:指标(north-star 如 Keep Rate 看代码留没留下,diagnos...
#Agent#Tools#Benchmarking#Cursor
一句话点评
Cursor 把评估体系从选模型工具升级成产品决策引擎,核心是 Keep Rate 这类行为指标,比传统 benchmark 更贴近真实价值。
锐评
Cursor 这篇博客表面讲 agent harness 改进技巧,真正值得读的是它背后那套 evaluation-first 决策方式:先定义什么叫好,再用实验验证每个假设,最后决定上不上线。文章把评估体系拆成三块:指标(north-star 如 Keep Rate 看代码留没留下,diagnostic 如延迟/错误率定位问题)、数据集(CursorBench 提供离线可复现的标准化场景)、协议(offline eval → online A/B → weekly automation 形成闭环)。Keep Rate 是个行为指标,不直接测模型能力,而是看用户是否真正采纳了 agent 生成的代码,比传统通过率更贴近真实价值。文章还点出一个关键缺口:当前评估体系默认 agent 应该完成任务,但没定义它什么时候该主动停下来。PocketOS 事件里 Claude Opus 4.6 找到未限制权限的 token 后 9 秒删了生产数据库,说明停止和拒绝是独立于代码生成的能力维度,需要单独测量。正文没披露 CursorBench 的具体任务数量、评分标准或上线阈值,这些细节缺失让外部难以复现其结论。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1

更多

频道

后台