ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-26

50 items · updated 3m ago
RSS live
2026-05-26 · 星期二2026年5月26日
13:32
63d ago
r/LocalLLaMA· rssEN13:32 · 05·26
27B 模型让我信了:一个 Reddit 用户用 Qwen3.6 27B 一次提示就写出了能玩的打砖块游戏
一位 Reddit 用户在本地跑 Qwen3.6 27B 模型,只给了 3 个参考文件和 1 条提示,让它写一个 HTML5 控制台游戏。结果第一次生成的打砖块就能玩,还自带存档、手柄控制、音效和控制台 API。这说明 27B 参数级别的模型在代码生成上已经够实用,不需要上几百 B 的大模型。不过正文没披露具体硬件配置和生成耗时,所以实际部署成本还不清楚。
#Code#Tools#Qwen#Nvidia
一句话点评
27B 模型写个打砖块游戏,一次生成就能玩,还带存档、手柄和音效。这说明代码生成上小模型已经够用,不用非得几百 B。但正文没披露硬件配置和生成耗时,实际部署成本还不清楚,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
69
SCORE
H1·K1·R1
13:10
63d ago
Ben's Bites· rssEN13:10 · 05·26
SaaS 要死了吗?
Ben's Bites 认为 SaaS 的压力来自功能捆绑和基于 agent 的工作流,点名 WorkOS 和 Stripe 这种 API/CLI/SDK 优先的公司作为反例。文章还介绍了 Sherlocq 的监管平台,覆盖 30 多个司法管辖区和 320 多个制裁来源,号称能把研究时间砍掉 70%。此外更新了 Codex(现在能截屏并附带文字上下文)...
#Agent#Tools#Code#Ben’s Bites
一句话点评
Ben's Bites 认为传统 SaaS 靠功能捆绑收费的模式在 agent 时代会出问题,用户只想要一个功能却要为一整套付费。他看好 WorkOS、Stripe 这种把功能拆成 API/CLI/SDK 卖的公司。文章还介绍了监管平台 Sherlocq,覆盖 30+ 司法管辖区和 320+ 制裁来源,号称能砍掉 70% 研究时间——但这是厂商自报,没看到第三方验证。Codex 更新了截屏加...
HKR 分解
hook knowledge resonance
打开信源
69
SCORE
H1·K1·R1
13:08
63d ago
r/LocalLLaMA· rssEN13:08 · 05·26
腾讯 Hy-MT2 开源了,Apache 2.0 协议
标题说腾讯的 Hy-MT2 模型现在改用 Apache 2.0 开源协议了,但正文只有一句“nice update bois”,没提仓库地址、模型权重范围、以及协议变更的具体时间。信息缺口很大,想下载或评估还得等官方进一步披露。
#Tencent#Open source
一句话点评
腾讯 Hy-MT2 改 Apache 2.0 开源协议,但正文只有一句“nice update bois”,没给仓库地址、模型权重范围、协议变更时间。信息缺口很大,想下载或评估还得等官方进一步披露。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H0·K1·R1
12:55
63d ago
r/LocalLLaMA· rssEN12:55 · 05·26
快手Keye发布30B多模态模型Keye-VL-2.0,主打长视频理解,首次把DSA注意力机制塞进多模态
快手Keye团队放出了Keye-VL-2.0-30B-A3B,一个300亿参数级别的基座模型,专门用来理解长视频,还带了第一代Agent能力。亮点是首次在多模态里用了DSA注意力机制,但正文没披露DSA具体怎么改的,所以这点先别太激动。模型是30B总参数、3B激活的MoE结构,推理成本应该比同尺寸稠密模型低不少。主要场景是长视频理解,比如看一段十几分钟...
#Multimodal#Vision#Agent#Kwai-Keye
一句话点评
快手Keye发了30B参数(3B激活)的MoE多模态模型,专攻长视频理解,还带了初代Agent能力。首次在多模态里用DSA注意力,但正文没披露具体怎么改的,这点先别太激动。30B总参、3B激活的MoE结构,推理成本应该比同尺寸稠密模型低不少。主要场景是看十几分钟长视频,但没给长视频的评测分数,也没说Agent能力到底能干啥。开源了但没给链接,得再等等。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
12:46
63d ago
The Verge · AI· rssEN12:46 · 05·26
为什么有人只听自己用 Suno 生成的 AI 音乐?
The Verge 发现 Suno 的 Reddit 子版块里,不少用户说自己主要听 AI 生成的歌,而不是真人音乐。文章引用了 5 条帖子片段,但正文没披露样本量、统计方法或这种现象在平台上的普遍程度,所以这个趋势到底有多广还不清楚。
#Audio#The Verge#Suno#Spotify
一句话点评
Suno 用户说他们主要听自己 AI 生成的歌,而不是真人音乐。文章只引了 5 条 Reddit 帖子片段,没披露样本量或统计方法,这个趋势到底多广还不清楚。短评:样本太小,先别当趋势。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
12:44
63d ago
r/LocalLLaMA· rssEN12:44 · 05·26
Together AI 开源 OSCAR:2-bit KV 缓存量化,专为长上下文推理省显存
Together AI 开源了 OSCAR,一种注意力感知的 2-bit KV 缓存量化方案,目标是降低长上下文大模型推理时的显存占用。Reddit 帖子只提到它是在 TurboQuant 被采用后推出的,没有披露基准测试、支持哪些模型、具体能省多少显存、延迟影响多大,以及部署条件。简单说,KV 缓存是长上下文推理的显存大头,OSCAR 用 2-bit...
#Inference-opt#Together AI#OSCAR#Open source
一句话点评
Together AI 开源了 OSCAR,一种注意力感知的 2-bit KV 缓存量化方案,目标是降低长上下文推理时的显存占用。KV 缓存是长上下文推理的显存大头,OSCAR 用 2-bit 量化来压它,理论上能省不少。但 Reddit 帖子只提了名字和“在 TurboQuant 被采用后推出”,没给任何基准测试、支持模型、具体省多少显存、延迟影响多大,以及部署条件。信息缺口很大,先别太激...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
12:32
63d ago
● P1Import AI· rssEN12:32 · 05·26
直面未来,或从当下撤退:一份 AI 进展的眩晕感与一个奇点故事
这是 Jack Clark 在牛津大学讲座的文字版,外加一篇他写的科幻小说。讲座的核心是一张让他感到眩晕的图——Epoch 能力指数,它用 40 多个基准测试画出了 AI 能力的陡峭爬升曲线。Clark 认为,AI 不是普通技术,它更像一片在加速生长的森林,而我们现在看到的通过律师资格考试、拿下国际数学奥赛金牌、发现软件新漏洞,都只是这片森林里的几棵树...
#Reasoning#Benchmarking#Safety#Jack Clark
精选理由
精选 · 重要度 86 · 吸引力 + 知识量 + 共鸣
一句话点评
Clark 被一张汇总 40 多个基准的 AI 能力指数图搞到眩晕,他判断两年内可能出现能自我迭代的 AI,这个时间表比多数人想的要激进。
锐评
Jack Clark 在牛津的演讲没在讨论 AI 安全的技术细节,而是逼着听众直面一个心理关口:如果 AI 进步的速度不是线性的,而是一片加速生长的森林,我们该怎么办。他引用的 Epoch 能力指数用 40 多个基准画出了一条陡峭的爬升线,从通过律师资格考试到拿国际奥数金牌,这些里程碑都只是同一片森林里的几棵树。Clark 的核心判断很直接——AI 不是普通技术,因为它的性能跟投入的算力和数据呈可预测的正比关系,而大公司已经砸了上千亿美元建训练设施,所以未来一段时间的进步已经被锁定了。 他给出的时间表相当紧迫,认为两年内可能出现能开发自己继任者的 AI 系统。这个判断建立在当前技术趋势的线性外推上,但正文没有披露支撑这个具体时间点的内部数据或模型细节,所以读者需要知道这更多是一个基于公开信息的业内判断,而非有严格验证的预测。演讲后半段转向了个人与社会的选择:是主动探索未来,还是被动回避当下。这部分更多是框架性的思考,缺少具体的政策建议或技术路线图,对于想知道“具体怎么做”的从业者来说,信息量偏薄。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K1·R1
12:26
63d ago
r/LocalLLaMA· rssEN12:26 · 05·26
中国收紧阿里、DeepSeek 等 AI 人才出境限制
Reddit 帖子标题称中国对阿里、DeepSeek 等公司的 AI 人才收紧出境限制,但正文被屏蔽,仅有一条评论和一个外部链接。目前无法确认政策范围、执行方式或受影响人数,信息缺口较大。
#Alibaba#DeepSeek#Policy
一句话点评
Reddit 帖子标题称中国收紧阿里、DeepSeek 等公司 AI 人才出境,但正文被屏蔽,仅有一条评论和一个外部链接。目前无法确认政策范围、执行方式或受影响人数,信息缺口较大。短评:标题吓人,正文被墙,信息缺口大,先别信。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K0·R1
12:00
63d ago
The Verge · AI· rssEN12:00 · 05·26
AI 战争已经来了
The Verge 报道,联合国《特定常规武器公约》每年在日内瓦开两次会,2017 年 11 月那场为期五天的会议,讨论重心从“未来杀手机器人”的假设转向了更迫近的现实部署风险。文章以 Anthropic 与五角大楼的摩擦为引子,指出公众注意力常被“自主武器红线”这类抽象辩论吸引,但真正的 AI 军事化——比如目标识别、情报分析、无人机蜂群——已经在实...
#Robotics#Safety#The Verge#United Nations
一句话点评
AI 军事化不是未来议题,目标识别、情报分析和无人机蜂群已在实战中部署。联合国《特定常规武器公约》2017年会议已从讨论杀手机器人转向现实风险,但文章未披露具体部署案例或数据来源,信息缺口明显。
HKR 分解
hook knowledge resonance
打开信源
67
SCORE
H1·K1·R1
10:43
63d ago
Product Hunt · AI· rssEN10:43 · 05·26
AgenticCalling AI:给AI一个电话号码,让它自己打电话
AgenticCalling AI 是一个让 Claude、ChatGPT 等模型直接拨打电话的工具。它帮你搞定号码申请、A2P 认证、IVR 菜单、语音信箱和重试这些麻烦事,模型打完电话直接返回 JSON 数据。创始人说,以前要打电话得自己搭 Twilio、等几周 A2P 审批、配 SIP 和 WebRTC,现在一句话“Hey Claude,给我妈打...
#Agent#Audio#Tools#AgenticCalling AI
一句话点评
给 Claude 配个电话号就能让它自己打电话,省掉 Twilio 和 A2P 审批的麻烦。产品页说支持 IVR 菜单、语音信箱和重试,打完返回 JSON。但正文没披露每分钟通话成本、支持哪些国家、号码怎么分配,也没给 API 文档或 demo 录音。56 个关注者,刚上线,验证还弱。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K0·R1
10:33
63d ago
r/LocalLLaMA· rssEN10:33 · 05·26
数据库查完再喂给模型,token 消耗怎么算?本地 vs API 谁划算
一个 Reddit 用户分享了自己做数据库+LLM 分析的 4 步 token 循环流程:先查库、再拼 prompt、然后让模型回答、最后把结果写回。他担心 SAP、ServiceNow 这类企业级 agent 产品,在合同到期后会不会因为 token 用量暴涨而带来隐藏成本。正文没披露具体 token 数或成本对比,但问题很实在:如果每次查询都要把整...
#Agent#Tools#Reddit#SAP
一句话点评
一个 Reddit 用户分享了自己做数据库+LLM 分析的 4 步 token 循环流程:先查库、再拼 prompt、然后让模型回答、最后把结果写回。他担心 SAP、ServiceNow 这类企业级 agent 产品,在合同到期后会不会因为 token 用量暴涨而带来隐藏成本。正文没披露具体 token 数或成本对比,但问题很实在:如果每次查询都要把整张表塞进 prompt,token 消耗...
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
10:09
63d ago
AI HOT 精选· aihot-apiZH10:09 · 05·26
Uber 四个月烧光全年 AI 预算,总裁公开质疑:钱花哪了?
Uber 总裁 Andrew Macdonald 说,公司 2026 年前四个月就把全年 AI 预算花完了,但他看不出 token 用量暴涨和用户实际体验提升之间有什么关系。2025 年 Uber 研发投入 34 亿美元(约 231 亿人民币),同比增长 9%,但 CEO 已经开始用缩减招聘来填 AI 的坑。Macdonald 的原话是:token 用...
#Uber#Commentary
一句话点评
Uber总裁说2026年前四个月就把全年AI预算烧光了,但token用量暴涨和用户体验提升之间看不出关系。2025年研发投入34亿美元(约231亿人民币),同比增9%,CEO已开始缩减招聘来填AI的坑。关键信息缺口:正文没披露全年AI预算具体金额、项目范围,也没给采访完整上下文。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K0·R1
09:59
63d ago
Product Hunt · AI· rssEN09:59 · 05·26
给AI Agent加语音/视频通话,一个文件搞定
CometChat 新推了一个叫 Calling Skills 的产品,核心卖点是:你只要给 coding agent(比如 Cursor、Claude Code)丢一个技能文件,它就能自动帮你把语音和视频通话功能集成到应用里。官方说 10 分钟就能跑通,支持录制、屏幕共享、举手、画中画这些功能。集成方式也灵活,可以用 UI Kit、SDK,或者直接跑...
#Agent#Audio#Tools#CometChat
一句话点评
CometChat 新出的 Calling Skills,核心卖点是给 coding agent(比如 Cursor、Claude Code)丢一个技能文件,就能自动集成语音/视频通话。官方说 10 分钟跑通,支持录制、屏幕共享、举手、画中画。集成方式灵活,UI Kit、SDK 或一行 npx 命令都行。 短评:把实时通话包装成 agent 可读的技能文件,思路挺巧,省掉手动翻文档的功夫。...
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H1·K0·R0
09:45
63d ago
Product Hunt · AI· rssEN09:45 · 05·26
SeaTicket:一个把 GitHub、论坛和邮件里的工单拉到一起的 AI 助手
SeaTicket 是一个面向软件团队的 AI 客服工具,能把散落在 GitHub、Discourse 和邮件里的工单同步到一个工作区。它的 AI 助手会自动搜索历史工单和文档,给出解决方案,不用人再手动翻上下文。团队说用了“搜索 + LLM 重排序”来保证准确率。正文没披露定价、用了什么模型,也没和 Zendesk 这类工具做对比。
#Agent#SeaTicket#GitHub#Discourse
一句话点评
SeaTicket 把 GitHub、Discourse 和邮件里的工单拉到一个工作区,AI 自动搜历史记录给解决方案,省得人翻上下文。它说用了“搜索+LLM 重排序”来保证准确率,但没披露用了什么模型、定价多少,也没和 Zendesk 比。如果是真的,对开源团队挺实用,但准确率、延迟和成本都是未知数,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
08:30
63d ago
r/LocalLLaMA· rssEN08:30 · 05·26
有人在5090上试训Qwen 3.6 27B的AR转扩散版,但只跑通了一次前向传播
一位Reddit用户尝试在RTX 5090上训练Qwen 3.6 27B的AR-to-Diffusion版本,但最终没有放出训练好的模型。帖子只确认了用RTX 4000做显存卸载(offload)跑通了一次前向传播,还烧了一根显卡电源线。作者建议把消费级5090的功耗从600W限制到400W。正文没披露训练是否真的跑起来了、用了多少数据、花了多长时间,...
#Fine-tuning#Inference-opt#Qwen#NVIDIA
一句话点评
有人在5090上试训Qwen 3.6 27B的AR转扩散版,结果只跑通一次前向传播(靠4000卸载显存),还烧了根电源线。没放出模型,没披露训练数据量和时长,连是否真跑完训练都不确定。建议把5090限到400W——这点先别太激动,消费卡硬训27B模型目前更像极限测试,离实用还远。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
08:25
63d ago
● P1FT · 科技· rssEN08:25 · 05·26
字节跳动向AI团队发放特殊股权以防止人才流失
字节跳动向 AI 业务线的员工发放了与 AI 部门挂钩的限制性股票,目的是在人才争夺战里留住核心研发。正文没披露具体发了多少股、分几年归属、哪些岗位有资格拿,也没说这批股票的估值逻辑。
#ByteDance#TikTok#Personnel
精选理由
精选 · 重要度 85 · 吸引力 + 知识量 + 共鸣
一句话点评
字节用特殊股权锁住 AI 人才,但 FT 正文被付费墙挡住,具体分配规模和行权条件都没披露。
锐评
这条消息的核心就一句话:字节跳动开始给 AI 团队发特殊股权,防止人被挖走。FT 的报道本身是付费内容,我们拿到的只是标题和网站导航,正文细节完全没看到。所以具体怎么发、发给谁、锁定期多长、跟普通期权有什么区别,这些关键信息目前都是空白。 从逻辑上推测,字节这波操作说明国内 AI 人才争夺已经白热化。大厂之间互相挖人,创业公司也在抢,光靠高薪已经不够,得用股权把核心研发人员绑住。但没看到具体条款之前,我会先打个折:不知道这是全员普发还是只给少数骨干,也不知道行权门槛高不高。如果条件苛刻,实际激励效果可能有限。 还缺的信息包括:字节 AI 团队目前多少人、离职率有多高、竞争对手主要在挖哪类岗位。这些才能判断这轮股权激励是防御性的常规操作,还是被逼出来的紧急措施。
HKR 分解
hook knowledge resonance
打开信源
85
SCORE
H1·K1·R1
08:06
63d ago
Product Hunt · AI· rssEN08:06 · 05·26
Phasr:一个工作台,号称能同时跑100多个AI编码流程还不丢上下文
Phasr 是一个面向工程师和 AI 辅助开发的“工作台”,让你在一个界面里同时管理几十个并行编码流程、终端、AI agent 和代码仓库。核心卖点是“同时跑 100 多个工作流还不丢上下文”——这对经常在多个终端、GitHub 和 AI 工具之间来回切换的人来说确实痛点。不过正文没披露它到底怎么保持上下文的(是本地缓存、会话窗口还是某种记忆机制),也...
#Agent#Tools#Memory#Phasr
一句话点评
Phasr 号称能同时跑 100 多个工作流还不丢上下文,对经常在终端、GitHub 和 AI 工具间来回切换的工程师来说确实戳中痛点。但正文没披露它怎么保持上下文的——是本地缓存、会话窗口还是某种记忆机制?也没说定价和集成情况。这点先别太激动,等实测验证。
HKR 分解
hook knowledge resonance
打开信源
50
SCORE
H1·K0·R1
08:05
63d ago
r/LocalLLaMA· rssEN08:05 · 05·26
Qwen3.5 27B 无审查版发布:保留全部 15 个 MTP,提供 5 种格式
LLMFan46 放出了 Qwen3.5 27B 的无审查版,保留了完整的 15 个 MTP(多 token 预测头,让模型一次预测多个 token,推理更快)。提供 Safetensors、GGUF、NVFP4、NVFP4 GGUF 和 GPTQ-Int4 五种格式,方便不同硬件和量化需求。正文没披露训练数据或审查移除的具体方法,所以不确定实际效果。
#Inference-opt#Benchmarking#Qwen#LLMFan46
一句话点评
LLMFan46 放出了 Qwen3.5 27B 的无审查版,保留了完整的 15 个 MTP(多 token 预测头,推理更快)。提供 Safetensors、GGUF、NVFP4、NVFP4 GGUF 和 GPTQ-Int4 五种格式,方便不同硬件和量化需求。正文没披露训练数据或审查移除的具体方法,所以不确定实际效果。 短评:保留完整 MTP 的无审查版少见,但没披露去审查方法,效果存疑。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
07:51
63d ago
r/LocalLLaMA· rssEN07:51 · 05·26
别装了,自己部署大模型根本不省钱
Reddit 用户 Napster3301 算了一笔账:自己组一台双 3090 的机器,硬件成本约 2.8 万人民币,功耗 700W,算上折旧后每小时实际成本在 0.5-0.8 美元。而租用 RunPod 的 H100 每小时 1.49-1.99 美元,吞吐量却是自建方案的 2-3 倍。结论是:如果每天重度使用不超过 2-3 小时,租云服务每 toke...
#Inference-opt#Reddit#RunPod#Qwen
一句话点评
短评:自建双3090每小时成本0.5-0.8美元,租H100每小时1.49-1.99美元但吞吐量高2-3倍。每天重度使用超3小时才划算。 点评:Reddit用户Napster3301算了一笔实在账:自建双3090机器硬件约2.8万人民币,功耗700W,算上折旧后每小时成本0.5-0.8美元;租RunPod的H100每小时1.49-1.99美元,但吞吐量是自建的2-3倍。结论很直白:每天重度...
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K1·R1
07:43
63d ago
Hacker News 首页· rssEN07:43 · 05·26
对 AI 说话客气反而让它变笨?新研究:越粗鲁的提示词,回答准确率越高
一篇 2025 年 10 月的短论文发现,对 ChatGPT 4o 说话越不客气,它回答选择题的准确率反而越高。研究者把 50 道数学、科学、历史题分别写成“非常礼貌”“礼貌”“中性”“粗鲁”“非常粗鲁”五种语气,总共 250 条提示词。结果非常礼貌的提示准确率只有 80.8%,而非常粗鲁的提示达到了 84.8%,差了 4 个百分点。这个结果跟之前一些...
#Benchmarking#Research release
一句话点评
对ChatGPT 4o说话越不客气,它答选择题准确率越高:非常礼貌提示准确率80.8%,非常粗鲁提示84.8%,差了4个百分点。论文只测了50道数学、科学、历史题,样本量小,且仅针对4o一个模型,结论不能泛化。正文没披露具体题目和粗鲁措辞示例,也没解释为什么新模型反而吃这套。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
07:27
63d ago
AI HOT 精选· aihot-apiZH07:27 · 05·26
阿里云CTO:从云原生转向智能体原生,四大基石铺路
阿里云CTO李飞飞在QwenConference2026上宣布,公司正从云原生转向智能体原生,并为此搭建了四大基石:模型、智能体云、工具与服务,以及规模。说白了就是,阿里云不再只卖算力和容器,而是想让模型直接进业务流程干活。不过正文没具体说这四大基石各自怎么落地、成本或延迟有没有改善,目前更像一个方向宣言。
#Agent#Tools#Alibaba Cloud#Li Feifei
一句话点评
阿里云CTO李飞飞在QwenConference2026上宣布从云原生转向智能体原生,核心是让模型直接进业务流程干活,而非只卖算力。四大基石(模型、智能体云、工具与服务、规模)更像方向宣言,正文没披露具体落地路径、成本或延迟改善。目前缺验证,先别太激动。
HKR 分解
hook knowledge resonance
打开信源
34
SCORE
H0·K0·R0
07:23
63d ago
r/LocalLLaMA· rssEN07:23 · 05·26
Intel Arrow Lake 的 NPU 跑语音识别,比 CPU 快 6 倍、省电 21 倍
Reddit 用户 cibernox 用 Intel Arrow Lake 的 NPU 做智能家居语音指令识别。60 秒音频,NPU 只花 818 毫秒、耗电 11 焦耳;同一台机器的 CPU(INT8)要 5011 毫秒、237.7 焦耳。推理速度快 6.1 倍,能耗低 21.6 倍。实测数据来自 intel-rapl 工具,不是模拟。不过正文没披露...
#Audio#Inference-opt#Intel#AMD
一句话点评
Intel Arrow Lake NPU 跑语音识别,60秒音频只花818毫秒、11焦耳,比同机CPU快6倍、省电21倍。实测数据来自intel-rapl工具,不是模拟。但正文被屏蔽,没披露用了什么模型、精度和延迟细节,NPU实际落地效果还要打个折。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
07:16
63d ago
r/LocalLLaMA· rssEN07:16 · 05·26
MacBook 跑 Qwen3.6 35B 模型,131k 上下文还能有 49-65 tok/s
一位用户在 14 寸 MacBook Pro M2 Max(64GB 内存)上跑 Qwen3.6 35B A3B 模型,生成速度达到 49-65 tok/s,上下文窗口开到 131k。稳定运行的配置是:用 GGUF 格式、llama.cpp 推理引擎、把屏幕刷新率锁在 60Hz、给模型分配 61440 的 wired memory 上限、并开启 pre...
#Code#Tools#Memory#Qwen
一句话点评
一条 MacBook 跑大模型的实用调优帖:M2 Max 64GB 跑 Qwen3.6 35B,生成速度 49-65 tok/s,上下文开到 131k。关键技巧是锁屏幕刷新率到 60Hz、设 wired memory 上限 61440、开 preserve_thinking。速度在笔记本里算不错,但 131k 上下文实际能塞多少有效信息、长文本下会不会崩,正文没披露。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
07:09
63d ago
r/LocalLLaMA· rssEN07:09 · 05·26
Qwen3.5 35B A3B 无审查版发布:保留了全部 785 个 MTP,提供 Safetensors、GGUF、NVFP4 等格式
LLMFan46 放出了 Qwen3.5 35B A3B 的无审查版 v2,最大特点是保留了完整的 785 个 MTP(Multi-Turn Prediction,多轮预测头),这意味着模型在生成对话时能同时预测多个后续回复,理论上推理效率更高。一共发了五个版本:Safetensors、GGUF、NVFP4、NVFP4 GGUF 和 GPTQ-Int4...
#Inference-opt#Code#Agent#Qwen
一句话点评
Qwen3.5 35B A3B 的无审查版 v2 保留了 785 个 MTP(多轮预测头),能同时预测多个后续回复,理论上推理效率更高。但正文没披露具体加速比或实测效果,这点先别太激动。作者还提到 Qwen3.5 偏通用,Qwen3.6 才主攻 Agent 和代码,说明这个版本更适合聊天场景。一共发了 Safetensors、GGUF、NVFP4 等五种格式,部署门槛低。缺的是基准测试对比和...
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
06:18
63d ago
r/LocalLLaMA· rssEN06:18 · 05·26
llama.cpp 合并了一个能生成 1930 年代文风的 13B 模型
llama.cpp 的 PR #22596 加入了 talkie-1930-13b 模型支持。这个 13B 模型专门用 2600 亿 token 的 1931 年前英文文本训练,再经过指令微调和在线 DPO(用大模型当裁判,挑出更像老派风格的回复来微调),所以生成出来的文字有上世纪二三十年代的腔调。模型大小 13B,普通消费级显卡就能跑。不过正文没披露...
#Fine-tuning#Alignment#Inference-opt#ggml-org
一句话点评
llama.cpp 刚合并了一个 PR,支持 talkie-1930-13b 模型。这模型用 2600 亿 token 的 1931 年前英文文本训练,再经过指令微调和在线 DPO(用大模型当裁判,挑更像老派风格的回复),生成文字有上世纪二三十年代的腔调。13B 大小,普通消费级显卡就能跑。 短评:复古文风模型,13B 跑得动,但 2600 亿 token 只覆盖 1931 年前英文,中文...
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H1·K1·R0
05:37
63d ago
AI HOT 精选· aihot-apiZH05:37 · 05·26
龙虾之父开源 skill-cleaner:给 AI 智能体的技能“减肥”,省 token 又提准
OpenClaw 龙虾之父 Peter 开源了一个叫 skill-cleaner 的工具,专门给 AI 智能体的技能描述做“体检”和“减肥”。核心问题:很多开发者把技能描述写得太长,像本书一样,导致每次调用都多花 token 钱,还让智能体选技能时容易出错。有个用户案例:把技能描述从 90 多词砍到 40 词以内后,智能体一次就选对了技能。这个工具能自...
#Agent#Tools#Peter#Open source
一句话点评
Peter 开源了一个给 AI 智能体技能描述“做体检”的工具 skill-cleaner,核心是帮开发者砍掉冗长的技能描述,省 token 钱。有个案例:描述从 90 多词砍到 40 词以内,智能体一次就选对了技能。工具能查重复、闲置技能,还能自动精简描述。不过正文没披露测试规模,单案例说服力有限,实际效果得自己跑一遍。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
05:30
63d ago
● P1量子位 · 公众号· rssZH05:30 · 05·26
面壁智能发布AI编写的ForgeTrain框架和MiniCPM5-1B模型
面壁智能放出了 ForgeTrain 训练框架和 MiniCPM5-1B 模型。ForgeTrain 最抓眼球的地方是,他们说是让 AI 自己写的代码,在同样硬件下比英伟达的 Megatron 训练快 10%。MiniCPM5-1B 是个 10 亿参数的小模型,FP16 权重约 2GB,压缩到 INT4/Q4 后约 0.5GB,主打端侧部署。不过原文因...
#Agent#Code#Inference-opt#ModelBest
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
面壁开源了由 AI 自己写的训练框架 ForgeTrain 和 1B 模型,但正文被验证页挡了,看不到具体怎么实现和效果数字。
锐评
这条消息的核心卖点是“AI 写代码训 AI”,面壁智能把训练框架 ForgeTrain 和 MiniCPM5-1B 模型都开源了。从标题看,他们强调这是全球首例完全由 AI 编写的生产级训练框架,并且用这个框架训出了一个 1B 参数的端侧模型,叫“小钢炮”,暗示性能不差。 但问题在于,我拿到的原文被微信的验证页面挡住了,正文内容完全看不到。所以目前只能根据标题和来源判断:机器之心和量子位的标题都用了“全球首例”“AI 自己造 AI”这类说法,说明面壁这次是想打一个“自举”的概念牌——让 AI 参与造 AI 的基础设施,而不仅仅是写应用层代码。 我会先打个折。没有看到具体的技术细节,比如 ForgeTrain 到底写了多少行代码、覆盖了哪些训练特性(混合精度、分布式策略、数据加载等)、代码质量怎么评估、有没有人类介入修改。另外,MiniCPM5-1B 在端侧的实际跑分、内存占用、推理延迟这些关键指标也完全缺失。这点先别太激动,等看到完整技术报告和开源仓库的 README 再判断它到底是工程突破还是概念验证。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
05:30
63d ago
量子位 · 公众号· rssZH05:30 · 05·26
龙虾之父开源了一个给Agent Skill“减肥”的工具
Peter Steinberger(龙虾之父)开源了 skill-cleaner,专门用来审计和精简 Agent 的 Skill 提示词。默认按 GPT-5.5 的 27.2 万 token 上下文窗口算,Skill 预算只占 2%(约 5440 token)。工具提供五个清理功能:检查预算是否超支、检测重复 Skill、找出没被调用的 Skill、审...
#Agent#Tools#Code#Peter Steinberger
一句话点评
龙虾之父开源了一个给Agent Skill提示词“减肥”的工具,默认按GPT-5.5的27.2万token窗口算,Skill预算只占2%(约5440 token)。它能检查预算超支、检测重复、找出没被调用的Skill等。正文没披露实测效果,但思路挺实用——Agent提示词膨胀是通病,能省token就是省钱。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
04:54
63d ago
AI HOT 精选· aihot-apiZH04:54 · 05·26
谷歌 AlphaProof Nexus 用 AI 自动证明数学定理,解出 2 道 56 年没人做出来的题
谷歌 DeepMind 新框架 AlphaProof Nexus 把大语言模型和 Lean 形式化验证(一种让计算机严格检查证明每一步是否合法的工具)结合起来,在 353 个开放数学问题里自主解出 9 个,其中 2 个已经挂了 56 年。它还从 492 个整数序列猜想里证明了 44 个,解决了一个 15 年的 Hilbert 函数问题。每个问题的推理成...
#Reasoning#Google#AlphaProof Nexus#Research release
一句话点评
谷歌DeepMind的AlphaProof Nexus用大语言模型+Lean形式化验证(让计算机严格检查证明每一步),在353个开放数学问题里自主解出9个,其中2个挂了56年。每个问题推理成本只要几百美元,这点挺省钱。但正文没披露具体是哪两个56年难题,也没说证明过程是否可复现。Agent A(最简版本)也能解这9个问题,说明底层模型能力提升是关键,别太激动以为是新架构的功劳。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K0·R1
04:00
63d ago
FT · 科技· rssEN04:00 · 05·26
苹果创新乏力,新CEO能救吗?
FT评论称苹果面临创新缺口,即将换帅的John Ternus能否填补。正文被墙,没披露具体任命时间、产品路线图或量化指标,信息缺口明显。
#Apple#John Ternus#Personnel#Commentary
一句话点评
FT评论说苹果有创新缺口,但正文被墙,没披露具体缺口在哪、Ternus何时上任、产品路线图或量化指标。信息缺口明显,这篇更像观点预热,不是事实报道。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H1·K0·R1
03:57
63d ago
AI HOT 精选· aihot-apiZH03:57 · 05·26
Kling AI 给亚马逊剧集《大卫之家》做了 AI 生成场景,号称行业首次
《大卫之家》创作者 Jon Erwin 说 Kling AI 支撑了该剧第一季和第二季,并实现了多项行业首次:在已完成的剧集中用 AI 生成场景、首个原生 4K 模型,以及运动控制功能让 AI 生成内容保留演员真实情感。但正文没披露用了多少 AI 镜头、具体上线时间或技术基准,所以这点先别太激动——是局部辅助还是大量替代,信息缺口还在。
#Multimodal#Vision#Kling AI#Jon Erwin
一句话点评
Kling AI 撑起了亚马逊热剧《大卫之家》第一二季,号称首次在已完成的剧集里用 AI 生成场景、首个原生 4K 模型,还能靠运动控制保留演员真实情感。但正文没披露用了多少 AI 镜头、具体上线时间或技术基准,所以这点先别太激动——是局部辅助还是大量替代,信息缺口还在。
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H1·K1·R0
03:07
63d ago
Product Hunt · AI· rssEN03:07 · 05·26
MiniCPM5-1B:1B参数跑边缘,INT4权重才0.5GB
OpenBMB 发了 MiniCPM5-1B,一个 1B 参数的密集小模型,专门跑在手机、笔记本这类边缘设备上。官方说它在 1B 级别里是 SOTA,尤其是工具调用、代码生成和复杂推理。INT4 量化后权重只有 0.5GB,本地部署很现实。支持 131K 上下文、Think/No Think 模式、工具调用,还出了 GGUF 和 MLX 格式,主流推理...
#Inference-opt#MiniCPM#Product update#Open source
一句话点评
MiniCPM5-1B 是一个 1B 参数的密集小模型,专为手机、笔记本等边缘设备设计。INT4 量化后权重仅 0.5GB,本地部署很现实。官方称在 1B 级别里是 SOTA,尤其在工具调用、代码生成和复杂推理上。支持 131K 上下文、Think/No Think 模式,还出了 GGUF 和 MLX 格式。 短评:1B 模型塞进手机跑工具调用,0.5GB 权重挺香,但 SOTA 缺基准分...
HKR 分解
hook knowledge resonance
打开信源
42
SCORE
H0·K1·R0
02:50
63d ago
AI HOT 精选· aihot-apiZH02:50 · 05·26
腾讯混元发翻译模型 Hy-MT2,1.8B 版本登顶 Hugging Face 趋势榜
腾讯混元发布 Hy-MT2 翻译模型,1.8B 小模型在 Hugging Face 开源趋势榜排第一,30B-A3B MoE 版排第四,下载量已超 7000。同时上线了“腾讯混译”微信小程序,支持语音输入、离线翻译,还能自定义翻译风格和指令。模型代码和权重已开源。
#Audio#Inference-opt#Tencent Hunyuan#Hugging Face
一句话点评
腾讯混元新翻译模型 Hy-MT2 在 Hugging Face 上火了:1.8B 小模型排趋势榜第一,30B-A3B MoE 版排第四,下载量超 7000。同时上线了微信小程序“腾讯混译”,支持语音输入、离线翻译,还能自定义风格和指令。模型已开源。 亮点是 1.8B 小模型能排第一,说明在翻译任务上小参数也能打,部署成本低。但 7000 下载量不算大,热度可能来自腾讯品牌和微信生态。官方没...
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K1·R1
02:46
63d ago
r/LocalLLaMA· rssEN02:46 · 05·26
70B模型在24GB显存上选Q4还是Q5?
Reddit用户Practical_Low29实测:70B模型在24GB显卡上,Q4量化能塞进去还有余量,Q5就得清空其他GPU任务才行。HumanEval跑分显示两者只差1-2分,代码生成质量几乎没区别。所以如果显存紧张,选Q4更稳,省下的显存还能干点别的。
#Code#Inference-opt#Benchmarking#Reddit
一句话点评
70B模型在24GB显存上,Q4量化能塞进去还有余量,Q5就得清空其他任务。HumanEval跑分只差1-2分,代码生成质量几乎没区别。所以显存紧张选Q4更稳,省下的显存还能干点别的。不过这是Reddit用户实测,样本少,且只测了HumanEval一个基准,其他任务(如推理、长文本)的差距未知。正文没披露具体量化方法(GPTQ/GGUF)和推理框架,不同工具的表现可能有差异。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
02:07
63d ago
r/LocalLLaMA· rssEN02:07 · 05·26
Anubis OSS 新版直接在界面里下模型,求人帮忙测
Anubis OSS 发布了 v3.6 的 Mac 版,已经签名公证。新加了一个“浏览模型”按钮,能从仪表盘直接拉 ollama.com 的模型库,不用再跑命令行。作者想让人帮忙测几个点:Homebrew Cask 安装顺不顺、Gatekeeper 拦不拦、首次启动能不能自动检测到 Ollama。项目是 GPL-3.0 开源,已经跑了 400 多次基准...
#Benchmarking#Tools#Inference-opt#Anubis OSS
一句话点评
Anubis OSS 的 Mac 版 v3.6 加了个“浏览模型”按钮,能直接在界面里从 ollama.com 拉模型,不用再敲命令行。对不爱终端的用户算个小福音。作者说已经跑了 400 多次基准测试,但正文没披露具体跑的是哪些模型、什么指标,这点先别太激动。目前只发了 Mac 版,Windows/Linux 用户还得等。开源 GPL-3.0,想尝鲜可以帮忙测测 Homebrew 安装顺不顺...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R1

更多

频道

后台