ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-06-06

50 items · updated 3m ago
RSS live
2026-06-06 · 星期六2026年6月6日
23:08
51d ago
AI HOT 精选· aihot-apiZH23:08 · 06·06
MiniMax M3 代码审计:花 7 分钱抓到 13 个 bug,效果和 1.3 美元的 Claude Opus 一样
MiniMax 拿自己的 M3 模型和 Claude Opus 4.8 做了一次代码审计对比:同一份代码里预先埋了 17 个 bug,用同样的提示词去抓。结果 M3 花了 7 美分找到 13 个,最便宜的 Claude 运行也找到 13 个,但花了 1.3 美元,成本差了将近 19 倍。这个对比挺直观的——如果代码审计这类任务对模型能力要求没那么极致,...
#Code#Benchmarking#MiniMax#Claude
一句话点评
MiniMax 拿自家 M3 和 Claude Opus 4.8 比代码审计:同一份代码埋了 17 个 bug,同样提示词。M3 花 7 美分找到 13 个,最便宜的 Claude 也找到 13 个,但花了 1.3 美元,成本差 19 倍。 关键数字:17 个 bug 只抓到 13 个,说明两者能力上限差不多,都没全对。成本差距主要来自模型定价,M3 走性价比路线。 缺什么:没披露 bu...
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
21:41
51d ago
r/LocalLLaMA· rssEN21:41 · 06·06
Gemma 4 的投机解码头开源了,还修了个并行解码的崩溃 bug
有人在 Hugging Face 上传了 Gemma 4 的 QAT 匹配 MTP 草稿头,能让小模型先猜大模型的下一个 token,再用大模型验证,猜对了就跳过计算,加速推理。同时修了一个 gemma4-assistant.cpp 里 PARALLEL=2 时的 reshape 崩溃,把 n_tokens 改成 1 就行。实测在 AMD Ryzen ...
#Inference-opt#Code#Benchmarking#Google
一句话点评
有人在 Hugging Face 上传了 Gemma 4 的 QAT 匹配 MTP 草稿头,让小模型先猜大模型的下一个 token,猜对就跳过计算,加速推理。实测在 AMD Ryzen AI Max+ 395 上,12B 双槽解码达到 62.5 tok/s,接受率从 56.9% 提升到 91.8%。还修了一个 gemma4-assistant.cpp 里 PARALLEL=2 时的 resh...
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H0·K1·R1
20:44
51d ago
r/LocalLLaMA· rssEN20:44 · 06·06
二手 RTX 3090 在 eBay 上被炒到 1300-1500 美元,比五年前首发价还贵一倍
一位 Reddit 用户吐槽,他几年前花 700 美元/块买了八块 RTX 3090 组本地 AI 机器,现在 eBay 上二手 3090 标价 1300-1500 美元,亚马逊全新同款 1550 美元。他问为什么有人愿意花 1400 美元以上买一块五年前的旧卡。原因很简单:3090 有 24GB 显存,跑本地大模型性价比依然很高,新卡 4090/50...
#Inference-opt#NVIDIA#eBay#Amazon
一句话点评
RTX 3090 二手价飙到 1300-1500 美元,比几年前新卡还贵一倍。原因很简单:24GB 显存跑本地大模型性价比依然能打,新卡 4090/5090 要么贵要么显存缩水。但注意这是 eBay 炒价,不是官方定价,实际成交可能打折。正文没披露成交量,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K1·R1
20:39
51d ago
Hacker News 首页· rssEN20:39 · 06·06
Universal Memory Protocol:给 AI agent 一个跨会话、跨厂商的通用记忆格式
这个项目想解决一个实际问题:现在 AI agent 能调用工具(MCP)、能互相通信(A2A),但记忆还是各管各的——Claude 项目笔记、Recall 导出、Obsidian 文件夹、Postgres、Redis、向量数据库……每换一个 agent 或存储后端就得重来。UMP 定义了一套统一的记忆记录格式和 6 个操作(回忆、记住、修改、忘记等),...
#Agent#Memory#Universal Memory Protocol
一句话点评
UMP 想给 AI agent 的记忆定一个统一格式,类似 MCP 给工具做的标准化。它定义了 6 个操作(回忆、记住、修改、忘记等),记忆存成带签名、带时间戳的 JSON,可以跑在文件、SQL、Redis、向量数据库上。项目刚出,GitHub 上只有 3 条评论,正文没披露性能测试或实际落地案例。想法不错,但 agent 记忆跨 session 跨 vendor 这件事,协议只是第一步,存...
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H1·K0·R1
20:20
51d ago
r/LocalLLaMA· rssEN20:20 · 06·06
Qwen3.6 35B 写代码,Copilot 的 agent 模式老是卡住
Reddit 用户在一个有十年历史、多语言、几千个文件的老项目上测 Qwen3.6 35B。Copilot 的 ask 模式能直接找到修复方案,但 agent 模式经常陷入循环,改不了代码。帖子在问有没有专门为本地小模型设计的编辑器或编程框架。正文没披露具体用了什么量化或推理后端,也没说模型跑在什么硬件上。
#Agent#Code#Tools#Qwen
一句话点评
Qwen3.6 35B 在十年老项目上表现分化:Copilot ask 模式能定位修复,agent 模式却反复循环改不动代码。帖子在找为本地小模型设计的编辑器或框架。正文没披露量化方式、推理后端和硬件,这点先别太激动——35B 模型跑本地,延迟和显存开销是关键瓶颈。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R1
20:03
51d ago
Hacker News 首页· rssEN20:03 · 06·06
Sem:把 Git 改造成按函数/类来 diff 的工具,AI agent 准确率提升 2.3 倍
Sem 是一个命令行工具,不依赖 LSP,直接在 Git 仓库上按函数、类、方法等实体做 diff、blame、impact 分析。它把 git diff 那种按行对比的方式,升级成“这个函数被改了、那个类被删了”,对人和 AI agent 都更友好。官方 benchmark 说,AI agent 用 sem 的输出比原始行 diff 准确率高 2.3...
#Code#Tools#Sem#Ataraxy Labs
一句话点评
Sem 是一个命令行工具,把 Git 的按行 diff 升级成按函数、类等实体做 diff/blame/impact 分析。官方说 AI agent 用它比原始行 diff 准确率高 2.3 倍,但没披露 benchmark 的具体设置和数据集,这点先别太激动。支持 26 种语言,8ms 典型 diff,零配置,对人和 agent 都更友好。正文没披露解析器的准确率、大仓库性能、以及是否支持...
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K0·R1
19:10
52d ago
● P1彭博科技· rssEN19:10 · 06·06
特朗普AI顾问Krishnan离职白宫
标题说特朗普的AI政策顾问Krishnan要离开白宫,但正文是彭博的403验证页面,没披露离职日期、原因、继任者或政策背景。信息缺口很大,目前只能确认人事变动这个事实。
#Krishnan#Bloomberg#Trump#Policy
精选理由
精选 · 重要度 86 · 吸引力 + 共鸣
一句话点评
特朗普的AI高级顾问Krishnan月底离职,准备在外面搞个新机构继续影响AI政策,人走茶不凉。
锐评
Sriram Krishnan 在特朗普政府干了不到两年就要走人,他之前是 a16z 的合伙人,属于硅谷进白宫的典型。离职声明里他重点提了特朗普的“AI 行动计划”,说这计划让美国在 AI 竞赛里领先,但没细讲他个人到底推动了哪些具体政策落地。TechCrunch 的报道只引了他 X 上的离职感言,没挖到离职的真实原因,也没说新机构具体做什么、谁出钱。Bloomberg 的标题更直接,用“放弃白宫职位”,但正文没披露更多内幕。这件事值得关注的点在于:一个核心 AI 政策顾问在任期内离开,可能意味着内部路线有分歧,或者他觉得在外面搞智库比在体制内更能影响政策走向。不过目前信息太少,没法判断这对美国 AI 监管方向是利好还是利空。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K0·R1
19:01
52d ago
r/LocalLLaMA· rssEN19:01 · 06·06
双路AMD MI50跑Qwen3.6-35B,ROCm后端冲到115 tok/s
Reddit用户实测llama.cpp 9413,双路AMD MI50在Debian testing下跑Qwen3.6-35B-A3B-GGUF。Vulkan后端并发1时89.76 tok/s,ROCm后端并发2时冲到115 tok/s,上下文开到262k。这个速度对35B模型来说不错,但注意是GGUF量化版,精度有折损。正文没披露功耗和显存占用,也没...
#Inference-opt#Benchmarking#AMD#Debian
一句话点评
双路AMD MI50跑Qwen3.6-35B-A3B的GGUF量化版,Vulkan后端89.76 tok/s,ROCm后端冲到115 tok/s,上下文开到262k。速度对35B模型不错,但注意是GGUF量化版,精度有折损。正文没披露功耗和显存占用,也没说是否稳定跑满262k上下文。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
18:12
52d ago
r/LocalLLaMA· rssEN18:12 · 06·06
一个 GGML 库让零阶优化跑快 39 倍,靠种子代替随机张量省内存
LMTLS5 发布了一个基于 GGML 的零阶优化推理库,专门用来调大模型参数。它把前向传播提速 39 倍,单次 MeZO 步骤快 15 倍。核心技巧是用随机种子生成扰动,而不是存完整的随机张量,这样内存占用大幅下降。正文没披露具体模型大小或精度损失,但如果是 7B 模型跑 MeZO,这个加速意味着原来要等几分钟的步骤现在几秒搞定。
#Inference-opt#Fine-tuning#Code#LMTLS5
一句话点评
一个基于GGML的零阶优化库,把大模型参数调优的前向传播提速39倍,单步MeZO快15倍。核心技巧是用随机种子生成扰动,省掉存完整随机张量的内存。如果是7B模型,原来等几分钟的步骤现在几秒搞定。但正文没披露具体模型大小和精度损失,加速比可能只在特定条件下成立。短评:加速数字漂亮,但缺精度对比和模型规模,先别急着换掉PyTorch。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
18:06
52d ago
r/LocalLLaMA· rssEN18:06 · 06·06
KV缓存量化新方案:6位精度追平8位,内存省一大截
Reddit 用户测试了 KVarN 量化方案,在 Qwen 3.6 27B 模型、64K 上下文下,6位 KVarN 的精度(99.80%)和 8位 q8_0 完全一样,但缓存占用只有 40.4%,比 q8_0 的 53.1% 省了约 12 个百分点。代价是生成速度从 851 tok/s 降到 689 tok/s,慢了约 19%。4位版本也能追平 q...
#Inference-opt#Benchmarking#KVarN#Qwen
一句话点评
KVarN 6位量化在 Qwen 3.6 27B 模型、64K 上下文下,精度和 8 位 q8_0 完全一样(99.80%),但缓存占用从 53.1% 降到 40.4%,省了约 12 个百分点。代价是生成速度从 851 tok/s 降到 689 tok/s,慢了约 19%。4 位版本也能追平 q5_0。 短评:省显存换速度,长上下文场景值得试,但速度折损明显。 正文被 Reddit 屏蔽...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
17:58
52d ago
r/LocalLLaMA· rssEN17:58 · 06·06
有人在 GLM 的 Agent 上跑起了《我的世界》服务器
一位 Reddit 用户给 GLM AI Agent 下指令“帮我搭个《我的世界》服务器,我要玩”,Agent 真的把服务器跑起来了,还生成了一个控制面板,服务器部署在香港。帖子没透露用了什么硬件、花了多少钱、有没有日志,也没给出可复现的步骤。
#Agent#Tools#GLM AI#Minecraft
一句话点评
短评:一句话让AI搭了个《我的世界》服务器,还生成了控制面板,挺唬人。但没硬件、没成本、没日志,更像演示而非可复现方案。 Reddit用户给GLM AI Agent下指令“搭个《我的世界》服务器”,Agent真跑起来了,还带控制面板,部署在香港。这事看着酷,但正文没披露用了什么硬件、花了多少钱、有没有操作日志,也没给复现步骤。目前只能当个概念验证看——Agent能调用工具完成多步任务(装服...
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K0·R1
17:53
52d ago
r/LocalLLaMA· rssEN17:53 · 06·06
退货华硕Spark:128G内存被带宽卡死,跑27B模型体验很差
Reddit用户sn2006gy退货了华硕Spark,理由是128GB内存虽然大,但带宽不够,跑27B模型效果很差。他试下来Qwen 3.5 122B A10B是能用的上限,但就算买3到8台组私有推理集群,每秒也只能跑几个token。正文没披露具体带宽数字和价格,但结论很清楚:大内存不等于快推理,带宽才是瓶颈。
#Inference-opt#Asus#Nvidia#Qwen
一句话点评
华硕Spark退货帖在Reddit上炸了,核心槽点:128GB内存带宽不够,跑27B模型都卡。实测Qwen 3.5 122B A10B是能用的上限,买3-8台组集群每秒也只能跑几个token。大内存不等于快推理,带宽才是命门。正文没披露具体带宽数字和价格,但结论很硬:别被内存容量骗了,推理速度看带宽。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
17:48
52d ago
r/LocalLLaMA· rssEN17:48 · 06·06
Gemma 4 的“异端”版本来了:未量化、故意改过拒答行为,26B MoE 还在搓
coder3101 放出了 Gemma 4 QAT 未量化版,叫 Heretic(异端)。跟原版 Gemma 4 Heretic 比,这个版本故意改了发散和拒答行为——说白了就是原版太爱说“我做不到”,这个版本让它更敢答。目前只有未量化权重,得等人自己压到 4bit 才能跑得动。另外还有个 26B MoE 变体还在构建中,没给时间表。正文没披露具体用了...
#Inference-opt#Safety#coder3101#Hugging Face
一句话点评
社区版主 coder3101 放出了 Gemma 4 QAT 的未量化版 Heretic,核心改动是故意调低了原版过于保守的拒答率,让它更敢答。目前只有未量化权重,得等人自己压到 4bit 才能跑得动,跑门槛不低。正文没披露具体用了什么偏好数据或对齐方法,也没给 26B MoE 变体的发布时间表。
HKR 分解
hook knowledge resonance
打开信源
61
SCORE
H0·K1·R1
17:35
52d ago
r/LocalLLaMA· rssEN17:35 · 06·06
离线审文档:Open WebUI 和 Kobold 哪个更安全?
Reddit 用户在比较两款本地工具——Open WebUI 和 Kobold——用于离线审阅研究论文和银行文件。Kobold 的优势是便携式二进制文件,不用安装;Open WebUI 是桌面版,装在 AppData 目录下。用户担心沙箱隔离不够,之前用 MLStudio 效果很差。但帖子没披露具体跑过什么模型、文档多大、有没有验证过网络或文件访问控制...
#Tools#Safety#Open WebUI#Kobold
一句话点评
Reddit 用户纠结用 Open WebUI 还是 Kobold 离线审论文和银行文件,Kobold 胜在免安装便携,Open WebUI 是桌面版。但帖子没提跑过什么模型、文档多大、沙箱隔离到底行不行,之前用 MLStudio 效果差也没说差在哪。信息缺口太大,没法直接抄作业。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H0·K0·R1
17:33
52d ago
r/LocalLLaMA· rssEN17:33 · 06·06
Gemma 4 量化后精度不一致:12B 掉点最多,E2B 和 E4B 几乎无损
Reddit 用户发现 Gemma 4 的 QAT(量化感知训练)结果表里,12B 模型精度离 FP16 基线最远,而 E2B 和 E4B 几乎没掉点。帖子没交代评测方法,也没跟非 QAT 版本对比,所以这个“几乎无损”得先打个折。另外正文没披露用了什么数据集、测了多少样本,信息缺口比较大。
#Fine-tuning#Inference-opt#Benchmarking#Gemma
一句话点评
Reddit 用户发现 Gemma 4 的 QAT(量化感知训练)结果表里,12B 模型精度离 FP16 基线最远,而 E2B 和 E4B 几乎没掉点。帖子没交代评测方法,也没跟非 QAT 版本对比,所以这个“几乎无损”得先打个折。另外正文没披露用了什么数据集、测了多少样本,信息缺口比较大。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K1·R0
16:44
52d ago
r/LocalLLaMA· rssEN16:44 · 06·06
双 RTX 3090 跑大模型,PCIe 通道数没公开,有人问到底用的 8x 还是 16x
Reddit 用户发现一份双卡 3090 的跑分文档只写了“PCIe only”,没说是 8x+8x 还是 16x+16x。另一组对比数据说 8x 比 16x 大概慢 5%,但这份文档没交代,所以结果可能偏高或偏低。正文没披露具体通道数,想复现的人得自己猜。
#Benchmarking#Inference-opt#Reddit#RTX 3090
一句话点评
双卡3090跑分文档只写了“PCIe only”,没交代是8x+8x还是16x+16x。另一组数据说8x比16x慢约5%,所以这份结果可能偏高或偏低。正文没披露具体通道数,想复现得自己猜。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H0·K1·R1
16:41
52d ago
r/LocalLLaMA· rssEN16:41 · 06·06
Reddit 用户分享了一个更好的显存估算工具
一位 Reddit 用户在 LocalLLaMA 板块发帖,推荐了一个更准确的显存估算器,并提到了一个 Wiki 链接和 LM Studio。帖子主要讨论 32K 上下文长度下的显存占用,但没有说明具体模型参数量、量化格式或实测显存数值,所以没法直接判断这个估算器到底准不准。如果你正在跑长上下文模型,可以自己去试试,但正文没披露验证数据,先别太激动。
#Inference-opt#LM Studio#iMakeSense#Commentary
一句话点评
Reddit 用户 iMakeSense 推荐了一个号称更准的显存估算器,专攻 32K 上下文场景。但帖子正文被屏蔽,没披露模型参数量、量化格式或实测数值,所以没法验证它到底准不准。如果你在跑长上下文模型,可以自己去试试,但这点先别太激动——信息缺口太大,等有人贴出实测对比再说。
HKR 分解
hook knowledge resonance
打开信源
43
SCORE
H0·K0·R1
16:24
52d ago
AI HOT 精选· aihot-apiZH16:24 · 06·06
AI 的黑色星期五:一夜蒸发 5000 亿美元,OpenAI 可能要被政府接管
Gary Marcus 把 6 月 5 日称为 AI 行业的黑色星期五——当天美股 AI 相关公司市值合计蒸发约 5000 亿美元。芯片股(英伟达、博通、美光)、GPU 租赁商(CoreWeave、Nebius)以及微软、Meta 等巨头跌幅都超过大盘(道指仅跌 1.35%)。韩国半导体板块也遭重挫,KOSPI 跌 5.5%,三星电子跌 6.4%,SK...
#Gary Marcus#Commentary
一句话点评
Gary Marcus 把 6 月 5 日称为 AI 黑色星期五,美股 AI 相关公司市值蒸发约 5000 亿美元。英伟达、博通、美光等芯片股,CoreWeave 等 GPU 租赁商,以及微软、Meta 跌幅均超大盘(道指仅跌 1.35%)。韩国半导体板块也遭重挫,KOSPI 跌 5.5%,三星电子跌 6.4%,SK 海力士跌 9.9%。更关键的是,CNBC 报道特朗普政府正与 OpenAI...
HKR 分解
hook knowledge resonance
打开信源
37
SCORE
H1·K0·R1
15:36
52d ago
AI HOT 精选· aihot-apiZH15:36 · 06·06
Hugging Face 开源了一个用 AI 帮你筛工作的工具
Hugging Face 发布了一个开源 AI 求职工具 Job Searcher。你上传简历、填好偏好,它先用 DeepSeek V4 Pro 生成 LinkedIn 搜索词,搜到职位后,再用一个微调过的 Qwen3-8B 小模型从技能匹配、经验相关度、学历证书、行业契合度、职级对齐五个维度打分,并给出每项的理由。整个流程跑下来,你拿到的不是几十个职...
#Agent#Fine-tuning#Tools#Hugging Face
一句话点评
Hugging Face 做了一个开源求职工具:上传简历,它先用 DeepSeek V4 Pro 生成 LinkedIn 搜索词,再用微调过的 Qwen3-8B 小模型从技能、经验、学历、行业、职级五个维度打分,最后只给你一个短名单和每项理由。关键是用 LoRA 微调 8B 模型替代大模型做重复评分,成本低、速度快。但正文没披露微调用了多少样本、评分准确率有没有验证,也没说 LinkedIn...
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H0·K1·R1
15:05
52d ago
The Verge · AI· rssEN15:05 · 06·06
印第安纳州谢尔比维尔市长:反对数据中心的人住的是“破房子”
谢尔比维尔市长Scott Furgeson在市政会议上说,只有住在“破房子”里的人才反对建数据中心,居民批评这话很不尊重人。正文没披露这个项目的规模、运营商和用电需求,所以没法判断它到底是个小机房还是大型算力中心。
#Scott Furgeson#Shelbyville#The Verge#Policy
一句话点评
谢尔比维尔市长为推数据中心,怼居民住“破房子”才反对,这话挺伤人。但正文没披露项目规模、运营商和用电需求,没法判断这是个小机房还是大型算力中心,所以冲突的实质分量也说不准。
HKR 分解
hook knowledge resonance
打开信源
54
SCORE
H1·K0·R1
14:53
52d ago
彭博科技· rssEN14:53 · 06·06
马斯克要去ASML闭门会聊Terafab芯片项目
彭博社报道,马斯克将参加ASML的一场私人技术活动,讨论Terafab AI芯片项目。正文没有披露Terafab的具体规格、ASML的议程细节,也没说马斯克是以xAI、特斯拉还是其他身份出席。目前能确认的只有时间——2026年6月6日发布——以及这是一场闭门会。信息缺口很大,暂时只能当个线索看。
#Inference-opt#Elon Musk#ASML#Bloomberg
一句话点评
马斯克要去ASML闭门会聊Terafab芯片项目,但正文没披露Terafab是什么规格、ASML议程细节,也没说马斯克以xAI还是特斯拉身份出席。目前能确认的只有彭博发了这条消息,信息缺口很大,暂时只能当个线索看。
HKR 分解
hook knowledge resonance
打开信源
61
SCORE
H1·K0·R1
14:52
52d ago
r/LocalLLaMA· rssEN14:52 · 06·06
有人在 i5 + 双 1050 Ti 上跑了 Qwen 3.6 MoE 和 Gemma 4,生成速度 12–18 t/s
一位 Reddit 用户用 i5-12400、64GB 内存和两张 GTX 1050 Ti(各 4GB)跑 Qwen 3.6 MoE 和 Gemma 4,在 llama.cpp 下 32K 上下文的 prompt 处理速度约 40 t/s,生成速度 12–18 t/s。这个配置很平民,双 1050 Ti 显存总共才 8GB,能跑起来已经不错,但生成速度...
#Code#Agent#Inference-opt#Qwen
一句话点评
双 GTX 1050 Ti(共8GB)跑 Qwen 3.6 MoE 和 Gemma 4,32K 上下文下 prompt 处理约 40 t/s,生成 12–18 t/s。这配置很平民,能跑起来已不错,但生成速度偏慢,实际对话体验会卡顿。正文没披露模型量化精度和具体显存占用,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H1·K1·R1
14:48
52d ago
r/LocalLLaMA· rssEN14:48 · 06·06
StepFun 3.7 Flash 用投机解码在 AMD 大内存 APU 上把生成速度提了 27%
StepFun 3.7 Flash 在 128GB 的 Strix Halo APU 上跑了 MTP(多 token 预测,一种投机解码变体),解码速度从 20.4 tok/s 提到 26.0 tok/s,提升 27.5%。预填速度几乎没变(211.2 vs 212.0 tok/s),说明投机解码没拖慢首 token 延迟。12,288 token 上...
#Inference-opt#Benchmarking#StepFun#AMD
一句话点评
StepFun 3.7 Flash 在 AMD Strix Halo APU(128GB 统一内存)上跑多 token 预测(MTP,一种投机解码),解码速度从 20.4 tok/s 提到 26.0 tok/s,提升 27.5%。预填速度几乎没变(211.2 vs 212.0 tok/s),说明投机解码没拖慢首 token 延迟。草稿接受率 84.7%(491 个里接受 416 个),算不错...
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
14:22
52d ago
r/LocalLLaMA· rssEN14:22 · 06·06
Strix Halo 跑 Gemma 4 量化版,解码速度 71 tok/s
Reddit 用户用 Strix Halo APU 跑 Google Gemma 4 的 QAT Q4_0 GGUF 模型,搭配 llama.cpp 的 Vulkan/RADV 后端。26B-A4B 版本(实际激活参数约 4B)加上 MTP 和 Q8 KV 缓存,解码速度达到 71.4 tok/s,处理 1150 个输入 token 并生成 2000 ...
#Inference-opt#Benchmarking#Google#Gemma
一句话点评
Strix Halo APU 跑 Gemma 4 量化版,26B 模型实际只激活约 4B 参数,解码速度 71.4 tok/s,生成 2000 token 耗时 29.6 秒。这个速度在笔记本级芯片上算不错,但注意这是 QAT 量化(训练时模拟量化,精度比普通 Q4 好一点),且用了 MTP(多 token 预测)和 Q8 KV 缓存来提速。正文没披露功耗和内存占用,实际部署还得看整机散热和...
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
14:00
52d ago
The Verge · AI· rssEN14:00 · 06·06
Meta 在自家 App 里塞了个 AI 生成的标题党新闻流,被媒体问了几句就撤了
Meta 在自家 App 里搞了一个 AI 生成的新闻流,内容全是标题党风格,还配了一张 AI 画的王室合影(图上出现了两个伊丽莎白二世)。The Verge 去问了几句之后,Meta 说会把这个功能撤掉。正文没披露这个功能推给了多少用户、上线了多久,所以影响范围不清楚。
#Tools#Meta#The Verge#Robert Hart
一句话点评
Meta 在自己 App 里塞了个 AI 生成的标题党新闻流,还配了张有两个伊丽莎白二世的王室合影。被 The Verge 问了几句就撤了。正文没披露推给了多少用户、上线了多久,影响范围不清楚。这事说明大厂内部对 AI 生成内容的质量和风险把控仍然很随意,上线前连基本的幻觉检查都没做。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
13:40
52d ago
Hacker News 首页· rssEN13:40 · 06·06
美国众议院发布草案:拟禁止各州自行制定AI法规
美国众议院议员发布了一份AI监管草案,核心内容是禁止各州自己出台AI法规,统一由联邦管。目前只有路透社的链接和Hacker News上的15个点赞、2条评论,草案全文没公开。这意味着如果通过,加州那种想单独搞AI监管的州就不能自己立法了。但正文没披露草案具体条款、豁免范围或惩罚措施,信息缺口很大,这点先别太激动。
#US House#Reuters#Hacker News#Policy
一句话点评
美国众议院出草案,核心是禁止各州自己搞AI法规,统一归联邦管。目前只有路透一条链接,Hacker News上15个赞、2条评论,草案全文没公开。如果通过,加州那种想单独立法的州就不能自己玩了。但正文没披露草案具体条款、豁免范围或惩罚措施,信息缺口很大,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K0·R1
12:38
52d ago
r/LocalLLaMA· rssEN12:38 · 06·06
Computex 2026 上给 DGX Spark 和 GB10 用的冷却箱
Reddit 用户发了一张 Computex 2026 展出的冷却箱照片,专门给 DGX Spark 和 GB10 机器用的。帖子没提具体用什么方式冷却(水冷、风冷还是别的),也没说功耗、价格和上市时间。信息量有限,只能知道有这么个东西存在。
#Reddit#Computex#NVIDIA#Product update
一句话点评
Computex 2026 上展出了一款给 DGX Spark 和 GB10 用的冷却箱,但 Reddit 帖子只有一张照片,没提是水冷、风冷还是相变冷却,也没说功耗、价格和上市时间。信息量太少,只能确认有这么个配件存在。如果这是为桌面级 AI 工作站设计的主动散热方案,可能意味着这两款设备的发热不低,但正文没披露任何实测数据或规格,没法判断实际价值。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H1·K0·R1
12:15
52d ago
Hacker News 首页· rssEN12:15 · 06·06
Meta 新模型又跳票了,开发者等了快两个月还没拿到
WSJ 独家报道,Meta 的新一代 AI 模型多次推迟向开发者发布,截至 6 月 3 日仍没有确定日期。这距离 Meta AI 负责人说“很快”发布已经过去近两个月。正文没披露模型名字、推迟次数和具体原因,也没给新时间表。这件事的麻烦在于:Meta 在自研前沿模型上砸了巨资,迟迟不开放给开发者用,就没办法通过 API 调用、企业合作等方式把钱赚回来。...
#Meta#WSJ#Hacker News#Product update
一句话点评
WSJ独家:Meta新一代AI模型多次推迟向开发者发布,截至6月3日仍无确定日期。距AI负责人说“很快”已近两个月。正文没披露模型名字、推迟次数和具体原因,也没给新时间表。麻烦在于:Meta砸巨资自研前沿模型,迟迟不开放API,就没办法通过调用、合作赚钱。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K0·R1
12:00
52d ago
The Verge · AI· rssEN12:00 · 06·06
苹果又要重新发布新 Siri 了
苹果将在周一 WWDC 上再次介绍新 Siri。2024 年那版只发了发光边框、语音选项和 ChatGPT 转接,承诺的智能功能没兑现。这次能不能补上,正文没披露具体细节。
#Agent#Tools#Apple#Siri
一句话点评
苹果又要重新发布新 Siri 了。2024 年那版只给了发光边框、语音选项和 ChatGPT 转接,承诺的智能功能没兑现。这次 WWDC 能不能补上,正文没披露具体细节。短评:苹果第三次画 Siri 的饼,这次最好真能咬到。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K0·R1
12:00
52d ago
AI HOT 精选· aihot-apiZH12:00 · 06·06
苹果又发新版 Siri,但只说了句“重新介绍”
苹果在 WWDC 上再次推出新版 Siri,官方口径是“重新介绍”。但 The Verge 的报道只引用了这一句话,正文没披露任何功能、版本号、价格或上线时间。目前能确认的只有苹果想重做 Siri 这个意图,具体改了啥、什么时候能用,一概不知。
#Apple#The Verge#Siri#Product update
一句话点评
苹果在 WWDC 上又发了一遍 Siri,但只说了句“重新介绍”,功能、版本、上线时间全没提。目前能确认的只有苹果想重做 Siri 这个意图,具体改了啥一概不知。短评:苹果又画了一次 Siri 的饼,但这次连馅儿都没露。
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H1·K0·R1
11:42
52d ago
AI HOT 精选· aihot-apiZH11:42 · 06·06
Persona Atlas:把名人思维画成可比较的坐标点
Hugging Face 上一个开源工具,输入人名,一个小模型代理会去网上搜资料,生成一份带来源的人物档案,然后用这个人的口吻回答10个开放式问题(比如自由意志、机器意识)。每个回答转成向量,这样一个人物就变成了空间里的一个点,可以跟其他人比距离。还画了一张特质热力图,显示谁更幽默、谁更抽象、谁更怀疑——但注意,热力值是相对排名,不是绝对分数。整个流程...
#Agent#Embedding#Tools#Hugging Face
一句话点评
短评:把名人变成可量化的思维坐标,创意不错,但验证很弱。 点评:Hugging Face 上一个开源工具,输入人名,小模型代理会去网上搜资料,生成带来源的人物档案,然后用这个人的口吻回答10个开放式问题(比如自由意志、机器意识)。每个回答转成向量,这样一个人物就变成了空间里的一个点,可以跟其他人比距离。还画了一张特质热力图,显示谁更幽默、谁更抽象、谁更怀疑——但注意,热力值是相对排名,不是...
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R0
11:14
52d ago
Product Hunt · AI· rssEN11:14 · 06·06
Stride:一个AI工作台,覆盖从规划到上线的全流程
Stride是一个AI原生的协作工作台,覆盖了产品开发的完整周期:规划、设计、验证和上线。它的AI能直接读取你项目里的真实数据,并通过MCP协议接入Claude Code和Codex,不只是聊天,而是真正干活。团队可以在一个工具里完成从想法到发布的全过程,不用来回切换。今天在Product Hunt上线,提供免费选项,目前以128票排在日榜第8。正文没...
#Stride#Claude Code#Codex
一句话点评
Stride 是一个把规划、设计、验证、上线全塞进一个工具的 AI 协作台,亮点是 AI 能读项目真实数据,并通过 MCP 协议直接调用 Claude Code 和 Codex 干活,不只是聊天。今天在 Product Hunt 上线,128 票排日榜第 8,有免费版。但正文没披露具体定价和基准测试,实际效果和成本未知,先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
10:05
52d ago
r/LocalLLaMA· rssEN10:05 · 06·06
Qwen 3.6 27B MTP 开两个参数后速度砍半、功耗降近200W
一位用户在本地跑 Qwen 3.6 27B MTP 时发现,加上 `--spec-type draft-mtp` 和 `--spec-draft-n-max 2` 后,生成速度从 70 t/s 掉到约 30 t/s,GPU 功耗也从 475W 降到 300W。虽然官方说草稿接受率超过 50%,但实际跑起来反而更慢、更省电,说明推测解码的验证开销可能抵消...
#Inference-opt#Qwen#llama.cpp#BitGreen1270
一句话点评
用户实测 Qwen 3.6 27B MTP 开启推测解码后,生成速度从 70 t/s 暴跌至 30 t/s,GPU 功耗从 475W 降到 300W。官方称草稿接受率超 50%,但实际验证开销反而拖慢速度、降低利用率。正文没披露具体硬件和量化配置,这点先别太激动——可能只是特定场景下的优化失效。
HKR 分解
hook knowledge resonance
打开信源
56
SCORE
H0·K1·R1
09:52
52d ago
AI HOT 精选· aihot-apiZH09:52 · 06·06
海螺AI×上影节:6月14-15日开放日,有展位和行业沙龙
MiniMax的海螺AI要在上海电影节期间办开放日,时间是6月14-15日,内容包括专属展位、多模态行业聚会和主题圆桌。正文没披露具体时间和地点,只说在图片里。如果你对AI+影视感兴趣,这两天可以去逛逛,但建议先找官方确认详细安排。
#Multimodal#MiniMax#Hailuo AI#Shanghai International Film Festival
一句话点评
海螺AI借上影节办开放日,6月14-15日,有展位、多模态聚会和圆桌。正文没披露具体时间和地点,只说在图片里。如果你对AI+影视感兴趣,这两天可以去逛逛,但建议先找官方确认详细安排。
HKR 分解
hook knowledge resonance
打开信源
32
SCORE
H0·K0·R0
09:27
52d ago
AI 群聊日报· atomZH09:27 · 06·06
Google 每月花 9.2 亿美元租 SpaceX 的 11 万块 GPU,Musk 靠“马戏团牌照”绕过审批
Google 跟 SpaceX 签了份大单:从今年 10 月起,每月付 9.2 亿美元租 11 万块 NVIDIA GPU,租到 2029 年,总额约 300 亿。群友算了一笔账,每卡每小时约 11.6 美元,属于 hyperscaler 托管价的上沿。更有意思的是 Musk 的骚操作——数据中心发电机以“临时建筑”名义跑了一年多不用审批,甚至申请了“...
#Code#Google#SpaceX#OpenAI
一句话点评
Google 每月花 9.2 亿美元租 SpaceX 的 11 万块 GPU,每卡每小时约 11.6 美元,属于托管价上沿。更骚的是 Musk 用“临时建筑”和马戏团牌照绕开审批,电力和卡都捏在自己手里。DeepSeek V4 Pro 中文写作实测比 Opus 4.6 还强,30 分钟跑完完整工作流,价格和 1M 上下文很香。OpenAI 全球封号潮是风控误杀,申诉后反而送了一个月免费 Pro。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
09:23
52d ago
最佳拍档· atomZH09:23 · 06·06
Anthropic 呼吁 AI 暂停?Claude 写 80% 代码,PR 合并量提升 8 倍
视频标题说 Anthropic 讨论了 AI 暂停、RSI(自我改进)以及 Claude 写了 80% 代码、PR 合并量提升 8 倍、代码成功率 76% 等数据。但正文没披露这些数字的来源、测量方法或可复现条件,所以没法判断这些提升是真实可靠还是特定场景下的结果。
#Agent#Code#Reasoning#Anthropic
一句话点评
Anthropic 自己说 Claude 写了 80% 的代码,PR 合并量提升 8 倍,代码成功率 76%。但正文没披露这些数字怎么测的、在什么场景下跑的,所以先打个折。短评:数字漂亮,但没给测量方法,先别全信。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
08:48
52d ago
r/LocalLLaMA· rssEN08:48 · 06·06
本地模型 vs 前沿模型:只有 Opus 能搞定 AirPlay 固件逆向
Reddit 用户拿 Qwen 3.6 35B-A3B、GPT-5 和 Opus 做 AirPlay 音箱固件项目,结果只有 Opus 完成了全套活:映射固件结构、逆向出 CRC 校验约束、反汇编大段代码、自动打补丁测试几十个变体来关掉 20 分钟待机定时器。Qwen 和 GPT-5 在低层系统工程上明显掉队,正文没披露具体失败在哪一步,但差距很直接—...
#Code#Reasoning#Tools#Qwen
一句话点评
Opus 在逆向固件、反汇编、自动打补丁上全流程跑通,Qwen 3.6 35B 和 GPT-5 都掉了链子。差距很直接:一个能关掉 20 分钟待机定时器,另外两个做不到。但正文没披露具体失败在哪一步,是理解错汇编、补丁写错还是工具调用卡住,这点先别太激动。另外这是单用户单任务,样本太少,不能直接推成模型能力排名。如果后续有更多人复现,那才是真信号。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
08:05
52d ago
Product Hunt · AI· rssEN08:05 · 06·06
TypingMind:自己带 API Key 按用量付费,不用月费,支持 18 家模型
TypingMind 是一个聊天界面,让你用自己的 API Key 访问 18 家模型(包括 ChatGPT、Gemini、Claude),按用量付费,不用交月费。面向重度用户的功能包括项目、分支/并行对话、插件/MCP/技能。作者 Tony Dinh 在 2023 年 ChatGPT API 发布后做了这个产品,今天在 Product Hunt 第二...
#TypingMind#Tony Dinh#Product Hunt
一句话点评
TypingMind 是一个聚合聊天界面,让你用自己的 API Key 访问 18 家模型(ChatGPT、Gemini、Claude 等),按用量付费,不用交月费。面向重度用户的功能包括项目、分支/并行对话、插件/MCP/技能。作者 Tony Dinh 在 2023 年 ChatGPT API 发布后做了这个产品,今天在 Product Hunt 第二次发布,排名当日第二。 短评:聚合 ...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
08:03
52d ago
AI 群聊日报· atomZH08:03 · 06·06
群友实测:Codex 真的赶上 Claude Code 了吗
一群重度 Claude 用户正在倒向 Codex,理由是“更耐用”“不开倒车”“不跳步骤”。但翻评测发现,Codex 并没有全面超越 Claude:SWE-bench Pro 上 Claude 反超,代码盲评中 Claude 更干净(67% vs 25%),Reddit 投票虽偏向 Codex,但 Claude 社区讨论量是 4 倍。Codex 真正的...
#Code#Benchmarking#OpenAI#Anthropic
一句话点评
群友实测显示Codex在稳定性和成本上优于Claude Code,但评测数据并不支持“全面超越”:SWE-bench Pro上Claude反超(69.2% vs 58.6%),代码盲评中Claude更干净(67% vs 25%)。Codex的真正优势在于token消耗少约72%,订阅消息配额更高(30-150条 vs 10-45条),且免费档位更友好。但正文未披露测试任务的具体类型和难度分布...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1

更多

频道

后台