ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-08

42 items · updated 3m ago
RSS live
2026-05-08 · 星期五2026年5月8日
11:00
81d ago
FT · 科技· rssEN11:00 · 05·08
AI能帮美联储打赢通胀吗?古尔斯比聊了聊
FT发了一篇芝加哥联储主席古尔斯比的访谈,标题拿AI和通胀做文章。但正文目前只披露了GPT、利率前景和美联储提名人凯文·沃什这些信息,没讲AI到底通过什么机制影响通胀,也没有数据或政策主张支撑这个判断。所以这条先当个话题引子看,别急着下结论。
#Financial Times#Austan Goolsbee#Kevin Warsh#Commentary
一句话点评
FT用AI和通胀做标题,但正文只提了GPT、利率前景和美联储提名人沃什,没讲AI通过什么机制影响通胀,也没数据或政策主张。先当话题引子看,别急着下结论。
HKR 分解
hook knowledge resonance
打开信源
46
SCORE
H1·K0·R0
10:15
81d ago
彭博科技· rssEN10:15 · 05·08
英特尔CEO搞定了特朗普和马斯克,但芯片业务还没翻身
陈立武去年3月上任英特尔CEO,七个月过去股价没涨,AI芯片市场还在丢地盘。正文被Bloomberg paywall挡住,没披露具体产品进展或客户订单。能搞定政治关系是好事,但芯片生意最终要看产品能不能打。
#Inference-opt#Intel#Lip-Bu Tan#Trump
一句话点评
陈立武上任七个月,英特尔股价没涨,AI芯片还在丢地盘。他能搞定特朗普和马斯克是加分项,但芯片生意最终看产品。正文被Bloomberg paywall挡住,没披露具体产品进展或客户订单,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R0
09:21
81d ago
AI HOT 精选· aihot-apiZH09:21 · 05·08
阿里云推Smart Studio:一个平台搞定模型测试到上线,不用再切好几个网站
阿里云发布Smart Studio,把模型测试和上线服务整合到一个平台,省去用户在不同网站间来回切换的麻烦。平台直接提供Qwen3.6-Max、DeepSeek-v4等最新模型,也支持多模态和图像视频生成模型。核心功能是可视化实验室,可以并排对比开源和闭源模型的效果,还能把Hugging Face上的模型一键转成实时API,简化部署。正文没披露定价、部...
#Multimodal#Tools#Inference-opt#Alibaba Cloud
一句话点评
阿里云出了个Smart Studio,把模型测试和上线服务打包成一个平台,不用再在Hugging Face、API网关之间来回跳了。核心卖点是可视化实验室,能并排对比Qwen3.6-Max和DeepSeek-v4的效果,还能把Hugging Face上的模型一键转成实时API。正文没披露定价和部署限制,如果是真的挺省钱,但先别太激动——自托管平台的实际成本和延迟还得看具体配置。
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H0·K1·R0
09:06
81d ago
● P1机器之心 · 公众号· rssZH09:06 · 05·08
SGLang团队创立RadixArk完成1亿美元种子轮融资
SGLang 的团队新成立了一家公司叫 RadixArk,5 月 5 号宣布完成 1 亿美元种子轮融资,投后估值 4 亿美元。SGLang 是一个开源的模型推理框架,目前在 GitHub 上有超过 2.7 万颗星,部署的 GPU 超过 40 万张。不过,这篇微信文章因为环境异常被屏蔽了,正文内容没拿到,所以具体的产品方向、团队背景和这笔钱怎么花,暂时都...
#Inference-opt#Fine-tuning#Reasoning#RadixArk
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
SGLang 团队拿了 1 亿美元种子轮,但正文被微信验证页挡了,具体产品、团队背景和钱怎么花都没看到。
锐评
这条消息本身挺炸的——1 亿美元种子轮在开源推理框架圈子里很少见,而且投资方名单里同时出现了英伟达、AMD、英特尔三家芯片巨头,说明硬件厂商在押注一个能跨芯片跑的高性能推理引擎。SGLang 本身是这两年社区里口碑很好的推理框架,主打用结构化生成和调度优化把大模型跑得更快更省。新公司叫 RadixArk,名字里带“开放 AI 基础设施”,大概率是想把 SGLang 从开源项目做成商业化的推理平台或服务。 但问题在于,目前能看到的公开信息只有标题和融资额,机器之心的原文被微信环境验证拦住了,另一篇新智元的报道也没提供正文。所以团队具体要做什么产品、钱主要投向研发还是市场、商业化路径是什么,这些关键信息都还缺。1 亿种子轮这个数字本身也要打个折——种子轮通常不会这么大,可能是包含了后续承诺或者算上了资源型投资(比如芯片、算力额度),实际现金部分未必有标题那么夸张。等看到完整披露再判断更靠谱。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
08:56
81d ago
r/LocalLLaMA· rssEN08:56 · 05·08
Chrome 在后台偷偷下了个 4GB 的 Gemini Nano 模型?
Reddit 用户发现 Chrome 可能静默下载了一个约 4GB 的 Gemini Nano 模型,用于本地摘要功能。帖子没给出具体模型名称、版本或 GGUF 来源,正文也因 403 无法访问。4GB 对端侧模型来说体积偏大,但如果是本地运行,意味着推理不依赖云端,隐私和延迟有优势。不过 Chrome 是否默认开启下载、用户能否控制,这些细节都没披露。
#Inference-opt#Google#Gemini Nano#Chrome
一句话点评
Chrome 可能静默下载了 4GB 的 Gemini Nano 模型,用于本地摘要。
锐评
Reddit 用户发现 Chrome 可能静默下载了一个约 4GB 的 Gemini Nano 模型,用于本地摘要功能。4GB 对端侧模型来说体积偏大,但本地运行意味着推理不依赖云端,隐私和延迟有优势。不过帖子正文因 403 无法访问,没给出具体模型名称、版本或 GGUF 来源。Chrome 是否默认开启下载、用户能否控制,这些细节都没披露。如果真能本地跑,对隐私敏感场景是好事,但 4GB 对手机或低配电脑可能是个负担。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K0·R1
07:54
81d ago
AI HOT 精选· aihot-apiZH07:54 · 05·08
在AMD显卡上微调医疗问答模型,不用CUDA也能跑
这篇博客来自Lablab.ai和AMD的黑客松,作者在AMD Instinct MI300X显卡上(192GB显存)用LoRA微调了Qwen3-1.7B模型,让它回答医学选择题并给出解释。训练只用了2000条样本,跑了大约5分钟,全程没碰CUDA。正文没披露微调后的准确率或评测结果,所以效果好不好还不清楚。亮点是证明了HuggingFace的Trans...
#Fine-tuning#Hugging Face#AMD#Lablab.ai
一句话点评
有人在AMD MI300X上(192GB显存)用LoRA微调了Qwen3-1.7B,让它做医学选择题并给解释。只用了2000条样本,跑了5分钟,全程没碰CUDA。但正文没披露微调后的准确率,效果好不好还不清楚。亮点是证明了HuggingFace的Transformers、PEFT、TRL在ROCm上能跑通,对没有NVIDIA卡的人是个好消息。如果是真的,挺省钱。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
07:44
81d ago
Product Hunt · AI· rssEN07:44 · 05·08
Jotform 在 Claude 里直接建表单
Jotform 出了个 Claude App,用户用自然语言就能在 Claude 里创建、编辑和分析表单,不用手动拖拽或切换工具。支持加字段、设逻辑、查提交记录和出统计。正文没披露定价、权限控制、上线时间或能处理多大规模的表单,所以实际可用性和成本还不清楚。
#Tools#Jotform#Claude#Product update
一句话点评
Jotform 把表单生成塞进 Claude 里,说句话就能建表、加逻辑、查提交记录,省了拖拽和切工具。但正文没披露定价、权限控制、上线时间,也没说能处理多大规模的表单,实际可用性和成本还不清楚。
HKR 分解
hook knowledge resonance
打开信源
61
SCORE
H0·K1·R0
07:31
81d ago
AI 群聊日报· atomZH07:31 · 05·08
群聊日报:Agent 无人值守产出 40 万行代码,DeepSeek Flash 单日 70 亿 token 实战
两条实战线:一是 MVVM + 六边形架构配合 test automation,让 agent 自己跑 ReAct 循环,上月产出 30-40 万行代码,实现无人值守开发。二是 DeepSeek Flash 单日消耗 70 亿 token(大部分命中缓存),成本仅数百元,为 guideme.city 批量生成城市导览和品牌故事。用户总结“笨模型因为笨所...
#Agent#Code#Memory#DeepSeek
一句话点评
两条实战线值得细看:一是MVVM+六边形架构让agent自动跑ReAct循环,上月产出30-40万行代码,实现无人值守开发——关键是test automation做到位。二是DeepSeek Flash单日消耗70亿token(大部分命中缓存),成本仅数百元,为guideme.city批量生成城市导览和品牌故事。用户总结“笨模型因为笨所以更可控”,但代价是需要极其详细的prompt。Clau...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
05:40
81d ago
● P1AI HOT 精选· aihot-apiZH05:40 · 05·08
Anthropic 计划今夏融资最高 500 亿美元,估值可能冲到近万亿,反超 OpenAI
Anthropic 正在筹备一轮新融资,目标金额最高 500 亿美元,融资前估值约 9000 亿美元,完成后整体估值将接近 1 万亿美元。这个数字会超过 OpenAI 今年 3 月融资后的 8520 亿美元估值。公司年化收入预计很快超过 450 亿美元,是去年底的 5 倍。投资方 Dragoneer、General Catalyst 等已表示兴趣,部分...
#Anthropic#OpenAI#Financial Times#Funding
精选理由
精选 · 重要度 86 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 想靠一笔最高 500 亿美元的融资把估值推到近万亿,超过 OpenAI。但条款还没谈拢,正文也没说钱具体怎么花。
锐评
这条消息的核心就一句话:Anthropic 准备在今年夏天搞一轮超级融资,目标金额最高 500 亿美元,融资前估值约 9000 亿,完成后整体估值逼近 1 万亿美元,直接压过 OpenAI 今年 3 月融资后的 8520 亿。我会先打个折,因为消息源是《金融时报》引述的“知情人士”,公司 CFO 只是和投资人聊了聊,具体条款没定,交易也可能黄。 值得看的是收入增速。报道说 Anthropic 年化收入很快会超过 450 亿美元,是去年底 90 亿的五倍。这个数字如果属实,说明它的商业化在加速,不是纯烧钱换规模。但正文没披露利润、成本结构,也没说这 500 亿是拿来买算力、堆人还是补亏损,所以别急着把它当成健康的高速增长。 另一个信息缺口是上市时间表。文章提到投资者想在 IPO 前占坑,但没给出任何上市进展或公司官方表态。这轮融资更像是上市前的战略卡位,而不是单纯缺钱。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K1·R1
05:38
81d ago
r/LocalLLaMA· rssEN05:38 · 05·08
TokenAI 发了个新优化器 STAM,训练时动态调动量,内存比 AdamW 省一半
TokenAI 在 Reddit 上贴了一篇优化器论文,叫 STAM。核心思路是训练过程中根据梯度残差动态调整 beta1(动量系数),在噪声大的阶段自动减小动量,避免震荡。他们同时给了个轻量版 STAMLite,参数内存只占模型参数的 1 倍,而 AdamW 要 2 倍,这对大模型微调来说能省不少显存。论文报了个 0.61 的准确率和 0.91 的 ...
#Fine-tuning#Inference-opt#Benchmarking#TokenAI
一句话点评
TokenAI 发了个新优化器 STAM,号称训练时动态调动量,省显存。但论文正文被屏蔽了,关键实验设置没披露。
锐评
TokenAI 在 Reddit 上贴的 STAM 优化器,核心是训练时根据梯度残差动态调整 beta1(动量系数),噪声大时自动减动量,避免震荡。轻量版 STAMLite 参数内存只占模型参数的 1 倍,而 AdamW 要 2 倍,对大模型微调确实能省显存。论文报 0.61 准确率和 0.91 loss,但没披露完整实验设置——比如基座模型、数据集、训练步数、对比基线是否公平。正文被 Reddit 屏蔽了,无法验证细节。如果是真的,省显存这点挺实用,但准确率提升幅度没给置信区间,得打个折。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H0·K1·R1
05:15
81d ago
r/LocalLLaMA· rssEN05:15 · 05·08
两台 Strix Halo 组集群,本地内存翻倍到 256GB,专为跑 400B 大模型
Reddit 用户想用两台 AMD Strix Halo 机器组集群,把本地统一内存从 128GB 堆到 256GB,目标是跑 Minimax 2.7、GLM 4.7、GLM 5.1、Qwen 3.5 这些约 400B 参数的大模型,上更高精度的量化版本。思路挺直接:单机 128GB 不够塞 400B 模型的高量化,两台凑一起就能装下。但正文没披露实际...
#Inference-opt#Agent#Code#Thanks-Suitable
一句话点评
两台 Strix Halo 组集群,把 128GB 统一内存翻倍到 256GB,想跑 400B 大模型的高量化版。想法直接,但网络延迟和带宽是硬伤。
锐评
Reddit 用户想用两台 AMD Strix Halo 机器组集群,把本地统一内存从 128GB 堆到 256GB,目标是跑 Minimax 2.7、GLM 4.7、GLM 5.1、Qwen 3.5 这些约 400B 参数的大模型,上更高精度的量化版本。思路挺直接:单机 128GB 不够塞 400B 模型的高量化,两台凑一起就能装下。但正文没披露实际跑起来的延迟和吞吐数据,关键瓶颈在互联:50/100GbE 网卡在 tensor parallel 下延迟可能很高,远不如单机 NVLink 或 Infinity Fabric。vLLM 的 tensor parallel 设置和 Exo 框架的支持情况也没提,实际部署坑不少。如果只是做实验验证可行性,成本比买一台 256GB 统一内存的机器低,但推理速度会打折。这点先别太激动,等有人放出 benchmark 再说。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
04:42
81d ago
TechCrunch AI· rssEN04:42 · 05·08
美国医疗还在用传真机,VC 开始投 AI 替人填表了
TechCrunch 报道,美国医疗后台还在靠传真机传单子,效率极低。一家叫 Basata 的 AI 公司专门做行政工作自动化,帮人填表、处理文书。创始人说,员工不担心被取代,更担心被活淹死。正文没披露融资金额、客户数量或产品具体怎么跑,信息缺口明显。
#Agent#TechCrunch#Basata#Funding
一句话点评
美国医疗后台还在靠传真机传单子,效率低到离谱。AI 公司 Basata 专做行政自动化,帮人填表、处理文书。创始人说员工不担心被取代,更担心被活淹死。正文没披露融资金额、客户数量或产品具体怎么跑,信息缺口明显。
HKR 分解
hook knowledge resonance
打开信源
42
SCORE
H1·K0·R0
04:12
81d ago
新智元 · 公众号· rssZH04:12 · 05·08
快手发了个打工人Agent:说人话就能生成桌面软件,跑起来不烧token
快手推出KroWork,用户用自然语言描述工作流程,它就能调用大模型规划、写代码、生成界面,最终打包成一个本地桌面应用。之后每次运行不再重复调用大模型,所以不烧token。相当于把一次性的模型调用成本换成永久可用的工具,适合重复性任务。正文没披露具体支持哪些API或能否离线运行,这点先别太激动。
#Agent#Code#Tools#Kuaishou
一句话点评
快手出了个KroWork,用自然语言描述工作流,它就能调用大模型规划、写代码、生成界面,最后打包成桌面应用。关键是一锤子买卖:第一次跑烧token,之后每次运行都不再调用大模型,相当于把一次性的模型调用成本换成永久可用的工具。适合重复性任务,比如日报生成、数据整理。但正文没披露具体支持哪些API、能否离线运行,也没说生成的代码能不能改。如果是真的挺省钱,但先别太激动,验证信息太少。
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K1·R1
04:09
81d ago
r/LocalLLaMA· rssEN04:09 · 05·08
“硬件才是唯一护城河”——现在买显卡还是再等等?
Reddit 用户 Alan_Silva_TI 发帖说硬件才是 AI 的护城河,理由是 Anthropic 和 xAI 最近的动作表明推理需求会暴涨,数据中心抢卡会挤压消费级 GPU 供应。但正文没披露任何价格、时间线或跑分数据,所以这个判断目前更像一个观点,不是可执行的购买建议。如果你在纠结买不买新硬件,可以先当个信号看,别急着下单。
#Inference-opt#Anthropic#xAI#Alan_Silva_TI
一句话点评
观点先行,缺数据支撑,先当信号看。
锐评
Reddit 用户 Alan_Silva_TI 认为硬件才是 AI 的护城河,理由是 Anthropic 和 xAI 最近的动作表明推理需求会暴涨,数据中心抢卡会挤压消费级 GPU 供应。这个判断逻辑上说得通——推理需求上来后,算力确实可能成为瓶颈——但正文没披露任何价格、时间线或跑分数据,所以目前更像一个观点,不是可执行的购买建议。如果你在纠结买不买新硬件,可以先当个信号看,别急着下单。缺的是具体证据:比如数据中心 GPU 采购量增长多少、消费级 GPU 供应是否真的被挤压、以及新硬件跑推理的实际性价比。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K0·R1
04:00
81d ago
● P1FT · 科技· rssEN04:00 · 05·08
Anthropic 融资谈判估值接近万亿美元
Anthropic 收到了外部投资意向,如果谈成,估值会接近 1 万亿美元,超过 OpenAI。不过这篇 FT 文章正文被付费墙挡住了,只显示了标题和导航栏,没有披露收入到底涨了多少、具体融资金额、投资人是谁、条款怎么定。所以“收入激增”这个说法暂时看不到数据支撑,先别太激动。
#Anthropic#OpenAI#Funding
精选理由
精选 · 重要度 99 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 被曝在谈新一轮融资,估值可能冲到近一万亿美元,但 FT 原文被付费墙挡了,具体条款和投资人还没看到。
锐评
这条消息先打个折看。FT 的标题确实写了“near $1tn valuation”,但正文需要订阅才能读,我们看不到收入到底涨了多少、谁在领投、钱怎么花这些关键信息。另外两家中文媒体的转述提到“今夏融资数百亿美元”和“反超 OpenAI”,这些说法目前没法从 FT 原文交叉验证。一万亿美元估值是什么概念——比现在全球绝大多数上市科技巨头都高,如果成真,说明有投资人赌 Anthropic 会成为 AI 基础设施层级的公司,而不只是又一个模型厂商。但没看到具体收入数字和增长曲线之前,这个估值更像谈判桌上的开价,不是落地的价签。还缺的东西很明确:Anthropic 最新的年化收入、这轮融资的实际规模和领投方、以及钱主要投向模型训练还是推企业客户。
HKR 分解
hook knowledge resonance
打开信源
99
SCORE
H1·K1·R1
03:31
81d ago
Hacker News 首页· rssEN03:31 · 05·08
AWS弗吉尼亚数据中心故障,FanDuel和Coinbase交易中断,恢复需数小时
AWS位于弗吉尼亚的一个数据中心从周四晚上开始出现“热故障”(散热系统出问题),导致FanDuel(体育博彩)和Coinbase(加密货币交易所)的交易服务中断。AWS说恢复需要几个小时。正文没有披露具体有多少客户受影响、故障根因是硬件还是电力、以及是否有数据丢失风险。对AI从业者来说,这件事的提醒是:如果你的推理或训练任务跑在美东区域,尤其是单AZ部...
#AWS#Amazon#Incident
一句话点评
AWS弗吉尼亚数据中心因散热故障宕机,FanDuel和Coinbase交易中断,恢复需数小时。对AI从业者的提醒:推理或训练任务若依赖美东单可用区,需检查冗余设计。正文未披露根因是硬件还是电力,也未说明是否有数据丢失风险。
HKR 分解
hook knowledge resonance
打开信源
48
SCORE
H1·K0·R1
03:00
81d ago
FT · 科技· rssEN03:00 · 05·08
韩国金融科技公司Toss:刷脸支付三年内取代实体信用卡
韩国金融科技公司Toss放话,三年内要让韩国人彻底扔掉实体信用卡,全面转向刷脸支付。Toss是韩国最大的移动支付平台之一,用户量超过3000万,相当于韩国一半以上人口。他们已经在便利店、咖啡店等场景铺开了人脸识别支付终端,用户注册后刷脸就能扣款,不需要掏手机或卡片。Toss CEO说,刷脸支付的体验比扫码快得多,而且能降低商户的终端成本——一台人脸识别...
#Vision#Toss#Product update
一句话点评
刷脸支付三年内取代信用卡?Toss 画了个大饼,但韩国 3000 万用户基础让这事值得看。
锐评
Toss 放话三年内让韩国人扔掉实体信用卡,全面转向刷脸支付。他们已有 3000 万用户(超韩国一半人口),在便利店、咖啡店铺开了人脸识别终端,注册后刷脸扣款,不用掏手机。CEO 说比扫码快,还能降低商户终端成本。 但正文没披露识别精度、活体检测方案、商户覆盖率、费率或合规细节。刷脸支付最大的坎是隐私和安全——人脸数据一旦泄露不可重置,韩国监管态度也未提及。三年取代信用卡更像是愿景,不是 roadmap。如果 Toss 能公开误识率、防伪方案和监管进展,这个判断才站得住。目前看,先当 PR 稿打折读。
HKR 分解
hook knowledge resonance
打开信源
48
SCORE
H1·K0·R0
02:49
81d ago
Hacker News 首页· rssEN02:49 · 05·08
Mojo 1.0 Beta 发布
Mojo 语言宣布进入 1.0 Beta 阶段,但官网除了版本号外,没有透露任何新功能、兼容性、发布计划或迁移规则。对于从业者来说,这只是一个版本里程碑的确认,编译器性能或语法变化一概未知。正文未披露任何技术细节,建议观望。
#Code#Mojo#Product update
一句话点评
Mojo 1.0 Beta 只是改了个版本号,官网没提任何新功能或性能数据。
锐评
Mojo 宣布进入 1.0 Beta,但官网除了版本号,没透露任何新功能、兼容性、发布计划或迁移规则。对于从业者来说,这只是一个版本里程碑的确认,编译器性能或语法变化一概未知。正文未披露任何技术细节,建议观望。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
02:38
81d ago
r/LocalLLaMA· rssEN02:38 · 05·08
DDR6 又跳票了,商用推到 2028 年
Reddit 帖子说 DDR6 再次延期,引用了一份报告称商用时间改到 2028 年。正文只提了之前预期是 2026 年,没披露 JEDEC 的规划、带宽规格或量产条件。如果真拖到 2028,意味着当前 DDR5 的寿命会再拉长两年,对需要高带宽内存的本地大模型推理来说不是好消息。不过帖子本身信息有限,具体延期原因和官方说法都没给,这点先别太激动。
#Reddit#MSN#JEDEC#Commentary
一句话点评
DDR6 延期到 2028 年,DDR5 还得再撑两年。
锐评
Reddit 帖子引用了一份报告,说 DDR6 商用时间从 2026 年改到 2028 年。如果属实,意味着当前 DDR5 的寿命会再拉长两年,对需要高带宽内存的本地大模型推理来说不是好消息——带宽和容量都卡在 DDR5 的天花板上。不过帖子本身信息有限:正文只提了之前预期是 2026 年,没披露 JEDEC 的规划、带宽规格或量产条件,也没说延期原因。来源是 Reddit 和 MSN,权威性一般,这点先别太激动。缺的是官方确认和具体技术细节,比如带宽目标、功耗改进和量产时间表。如果是真的,挺省钱——不用急着升级内存架构,但也意味着本地推理的瓶颈会持续更久。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H1·K1·R0
02:34
81d ago
Product Hunt · AI· rssEN02:34 · 05·08
Memori:让 AI 智能体记住自己干过什么,不只是聊过什么
Memori 做的是智能体(agent)的长期记忆,但记忆来源不只是对话,还包括智能体执行过的工具调用、工作流步骤、决策逻辑等 trace 数据。相当于给智能体装了一个“操作日志型记忆”,而不只是聊天记录。在 LoCoMo 基准上准确率 81.95%,每次查询只花 1294 个 token——大约是塞满全部上下文成本的 5%,也就是说推理开销能省 95...
#Agent#Memory#Memori#Product update
一句话点评
Memori 给智能体装了个“操作日志型记忆”——不光记对话,还记它调过什么工具、走过什么流程、做过什么决策。LoCoMo 基准 81.95% 准确率,每次查询只用 1294 token,大约是塞满全部上下文的 5%,推理开销省 95% 以上,这点挺省钱。但正文没披露存储机制、API 细节和定价,开源程度和落地门槛还不清楚。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R1
02:27
81d ago
r/LocalLLaMA· rssEN02:27 · 05·08
苹果芯片上跑最快的本地 AI 引擎,专为 agent 场景优化
一位开发者发布了 lightning-mlx,号称是 Apple Silicon 上最快的本地推理引擎。在 128GB 内存的 MacBook Max M5 上,Qwen3.6-27B 跑到 40.67 tok/s,Qwen3.6-35B-A3B 更是冲到 220.86 tok/s——后者每秒能吐两百多个 token,基本感觉不到延迟。目标场景是写代码...
#Agent#Code#Inference-opt#Apple
一句话点评
Apple Silicon 上跑 Qwen3.6-35B-A3B 能到 220 tok/s,写代码几乎无延迟。
锐评
这个 lightning-mlx 引擎在 128GB M5 Max 上把 Qwen3.6-27B 推到 40.67 tok/s,35B-A3B 混合专家版更是飙到 220.86 tok/s——每秒两百多个 token,写代码、调工具基本感觉不到卡顿。作者专门为 agent 短轮次场景优化了 prompt 拼接和 KV 缓存复用,这点先别太激动:实测只跑了单机单卡,没披露多轮对话或长上下文下的表现,也没和 llama.cpp、MLX 官方做同条件对比。正文没披露具体优化手段,只说“重写了注意力层和调度器”,可信度要打折。如果真能稳定跑满 200+ tok/s,那本地 agent 的体验会从“能忍”跳到“顺手”,但得等第三方复现。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
01:36
81d ago
r/LocalLLaMA· rssEN01:36 · 05·08
台湾 Skymizer 发布 HTX301 PCIe 推理卡:384GB 内存、240W 功耗
Skymizer 新出的 HTX301 是一张 PCIe 推理卡,塞了 384GB 内存,功耗只有 240W 左右。384GB 意味着能本地跑 70B 甚至更大参数的模型,不用拆层或量化太狠。功耗 240W 比一张 RTX 4090(450W)还低,对机房散热和电费都友好。但正文没披露用了什么芯片、内存带宽多少、价格多少、什么时候量产——这些才是决定实...
#Inference-opt#Skymizer#HTX301#Product update
一句话点评
384GB 内存、240W 功耗,能本地跑 70B 模型不拆层,但没带宽和价格,先别激动。
锐评
Skymizer 的 HTX301 是一张 PCIe 推理卡,塞了 384GB 内存,功耗仅 240W。384GB 意味着能本地跑 70B 甚至更大参数的模型,不用拆层或量化太狠;240W 比 RTX 4090(450W)还低,对机房散热和电费都友好。但正文没披露用了什么芯片、内存带宽多少、价格多少、什么时候量产——这些才是决定实际推理速度的关键。如果带宽低,大模型跑起来可能比预期慢很多。另外,Skymizer 是台湾公司,之前产品落地案例不多,验证程度有限。建议等带宽和价格出来再评估性价比。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
01:30
81d ago
彭博科技· rssEN01:30 · 05·08
印度投资者因本土缺乏AI概念股且回报差,转向海外市场
彭博报道,印度投资者长期以来主要投资国内市场,但现在因为本土市场缺乏AI相关公司、回报率跑输全球,开始把钱投向海外。正文没有披露具体资金流出规模、时间节点或哪些AI公司被提及,信息缺口比较明显。
#Bloomberg#Commentary
一句话点评
印度投资者因本土缺AI概念股、回报跑输全球,开始转向海外市场。
锐评
彭博这篇报道点出一个趋势:印度投资者长期只买国内股票,现在因为本土市场缺少AI相关公司、回报率跑输全球,开始把钱投向海外。核心逻辑很直白——哪里能买到AI,钱就去哪里。但正文没披露具体资金流出规模、时间节点,也没说哪些AI公司被提及,信息缺口比较明显。报道本身更像一个现象观察,缺乏数据支撑,这点先别太激动。对AI从业者来说,这条新闻的启示是:AI正在重塑全球资本流向,一个市场如果没有AI标的,可能连本土资金都留不住。
HKR 分解
hook knowledge resonance
打开信源
46
SCORE
H1·K0·R0
01:12
81d ago
彭博科技· rssEN01:12 · 05·08
Principal 要募 30 亿美元建两个数据中心基金,押注 AI 基建
Principal Financial Group 今年打算募 30 亿美元,成立两只数据中心基金,钱主要投美国和欧洲的数据中心。30 亿这个数字不小,说明机构资金还在往 AI 基础设施里涌。但正文没披露基金的具体条款,也没说哪些 AI 公司会是租户,所以这轮募资到底能落地多少、回报怎么算,目前还不清楚。
#Principal Financial Group#Funding
一句话点评
Principal 要募 30 亿美元建数据中心基金,钱不少,但租户和条款都没说。
锐评
Principal Financial Group 今年计划募 30 亿美元,成立两只数据中心基金,投向美国和欧洲。30 亿这个数字不小,说明机构资金还在往 AI 基础设施里涌,尤其是数据中心这种重资产。但正文没披露基金的具体条款,比如期限、预期回报率,也没说哪些 AI 公司会是租户。这点很关键——数据中心基金的核心是租约锁定,没有大客户承诺,募资和回报都存在不确定性。所以这轮募资到底能落地多少、回报怎么算,目前还不清楚。如果是真的,说明传统金融机构对 AI 基建的押注在加码,但信息缺口太大,先别太激动。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H0·K1·R1
01:05
81d ago
r/LocalLLaMA· rssEN01:05 · 05·08
Qwen3.6-35B-A3B 魔改版:Apple Silicon 上跑得快的聊天模型,但没跑分没细节
Reddit 用户 eclipsegum 推荐了一个 Qwen3.6-35B-A3B 的魔改版(Abliterated-Heretic-MLX-4bit),说它适合当通用聊天机器人,在 Apple Silicon 上跑得很快。但帖子正文被屏蔽了,看不到任何跑分、量化细节、许可证或可复现的设置。有用的信息只有两点:一是 MLX 格式意味着能在苹果芯片本地...
#Inference-opt#Qwen#Apple#eclipsegum
一句话点评
一个 Reddit 用户吹 Qwen3.6 魔改版在苹果芯片上跑得快,但帖子正文被屏蔽,没跑分没细节,信源价值极低。
锐评
这条 Reddit 帖子来自用户 eclipsegum,推荐 Qwen3.6-35B-A3B 的魔改版(Abliterated-Heretic-MLX-4bit),声称适合当通用聊天机器人,在 Apple Silicon 上跑得快。但正文被 Reddit 屏蔽(403 错误),看不到任何跑分、量化细节、许可证或可复现设置。唯一有用信号是 MLX 格式意味着能在苹果芯片本地推理,但速度多快、效果如何全凭一张嘴。没有对比基线、没有样本量、没有延迟数据,连模型权重来源都没披露。对于 AI 从业者来说,这条信息只能当个线索:有人在做 Qwen3.6 的苹果端优化,但具体效果需要自己实测。正文没披露任何可验证指标,建议直接忽略主观好评,等第三方跑分出来再判断。
HKR 分解
hook knowledge resonance
打开信源
48
SCORE
H1·K0·R1
01:02
81d ago
Hacker News 首页· rssEN01:02 · 05·08
GPT-5.5 涨价了,但实际多花的钱没标价那么夸张
OpenRouter 分析了从 GPT-5.4 切到 5.5 的用户实际账单,发现虽然输入和输出 token 的单价都翻了一倍,但最终成本只涨了 49% 到 92%。原因是 GPT-5.5 在处理长文本(超过 1 万个 token)时,回答比 5.4 短了 19% 到 34%,省下了一部分输出费用。不过短对话就没这么幸运了,2K token 以内的请求...
#OpenRouter#Commentary
一句话点评
OpenRouter 用真实账单算了一笔账:GPT-5.5 单价翻倍,但长文本回答变短,实际成本只涨了 49%-92%。短对话用户就没这么幸运了,涨幅最高 92%。
锐评
OpenRouter 抓了一批从 GPT-5.4 切到 5.5 的用户,对比同一批人换模型前后的实际账单。结论:单价翻倍(输入 $2.5→$5/M,输出 $15→$30/M),但长文本(>10K token)的回答变短了 19%-34%,所以最终成本只涨了 49%-92%。短对话(<2K token)回答反而长了 7%,成本直接涨 92%。 这个数据来自 OpenRouter 自己的请求日志,样本是纯文本请求,时间窗口是 5.4 上线前三天 vs 5.5 上线后三天。好处是真实用户真实账单,不是 benchmark 估算;缺点是样本量没披露,而且 OpenRouter 的 token 计数和 OpenAI 官方可能不一致。另外正文没披露 GPT-5.5 在短对话场景下回答变长 52%(2K-10K 区间)的原因,是模型更啰嗦了还是任务分布变了,不清楚。 对开发者来说,如果你的场景是长文档总结、代码生成这类长输入,升级 5.5 的成本涨幅可控;如果是短对话客服、聊天,成本翻倍基本跑不掉。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K0·R1
00:49
81d ago
r/LocalLLaMA· rssEN00:49 · 05·08
Qwen 3.6 27B 在 2×3090 NVLink 上跑分:拓扑比卡数更重要
Reddit 用户实测 Qwen3.6-27B-AWQ-BF16-INT4 在 4×RTX 3090 上的推理速度。关键发现:用 NVLink 桥接的两张卡(TP=2)在并发数为 1 时比纯 PCIe 快 25%;并发数到 4 时,NVLink 跑到 181.9 tok/s,PCIe 只有 119.2 tok/s,而四卡全开(TP=4)反而只有 127...
#Inference-opt#Benchmarking#Qwen#NVIDIA
一句话点评
NVLink 在并发高时优势明显,但 TP=4 反而比 TP=2 慢,说明拓扑比卡数更重要。
锐评
Reddit 用户实测 Qwen3.6-27B 在 4×RTX 3090 上的推理速度,核心发现:NVLink 桥接的两张卡(TP=2)在并发数为 1 时比纯 PCIe 快 25%;并发数到 4 时,NVLink 跑到 181.9 tok/s,PCIe 只有 119.2 tok/s。有意思的是,四卡全开(TP=4)反而只有 127.9 tok/s,说明多卡通信开销抵消了算力增长。测试环境是 vLLM 0.20.1、CUDA 12.8,输入 1024 token 输出 256 token。这个结果对自建推理集群有参考价值:如果并发请求多,优先组 NVLink 对子,而不是堆更多卡。不过正文没披露功耗和温度,也没说量化精度对速度的影响,实际部署还得自己跑一遍。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
00:27
81d ago
r/LocalLLaMA· rssEN00:27 · 05·08
MTP 让 Gemma 4 在 MacBook 上提速 40%,本地推理又省一笔
有人在 LLaMA.cpp 里实现了多 token 预测(MTP),让 Gemma 26B 在 MacBook Pro M5Max 上从 97 token/s 跑到 138 token/s,快了 40%。测试任务是写递归斐波那契代码,模型是量化后的 GGUF 版。MTP 的思路是让模型一次猜多个后续 token 当草稿,再快速验证,相当于给推理加了条快...
#Inference-opt#Code#AtomicBot-ai#LLaMA.cpp
一句话点评
MacBook 上跑 Gemma 26B 快了 40%,本地推理党可以关注。
锐评
有人在 LLaMA.cpp 里塞进了多 token 预测(MTP),让 Gemma 26B 在 MacBook Pro M5Max 上从 97 token/s 跑到 138 token/s,快了 40%。MTP 的思路是让模型一次猜多个后续 token 当草稿,再快速验证,相当于给推理加了条快车道。测试任务是写递归斐波那契代码,模型是量化后的 GGUF 版,所以这个速度提升对本地部署有参考价值。不过正文没披露 MTP 对生成质量的影响——草稿 token 如果猜错,验证环节会不会改回来?也没说内存占用和功耗变化。另外,这个 40% 是在特定硬件(M5Max)和特定任务(代码生成)上测的,换模型或换 prompt 可能打折。如果是跑长文本或对话,加速效果未必这么亮眼。整体来说,这是个有潜力的优化方向,但别急着拿它当通用加速方案。
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K1·R1
00:18
81d ago
彭博科技· rssEN00:18 · 05·08
黄仁勋:如果特朗普邀请,我愿意一起去中国
英伟达CEO黄仁勋表示,如果收到邀请,他愿意加入特朗普即将进行的中国之行。目前他还没收到正式邀请,正文也没透露具体日期、代表团名单或议程。
#Nvidia#Jensen Huang#Donald Trump#Policy
一句话点评
黄仁勋表态愿随特朗普访华,但还没收到邀请。
锐评
黄仁勋公开说,如果特朗普邀请,他愿意加入访华团。目前只是口头表态,没有正式邀请,也没有具体日期、代表团名单或议程。这条新闻的信息量其实很少,更像一个试探性信号。 关键看两点:一是特朗普团队是否真的会带科技企业高管访华,二是英伟达对华芯片出口限制的走向。黄仁勋此前多次强调中国市场的重要性,这次表态可以理解为在政策不确定性中主动释放善意。但正文没披露任何实质进展,连“是否已与白宫沟通”都没提,所以这点先别太激动。 如果成行,这将是中美科技高层罕见的高级别接触,对AI芯片、半导体设备等领域的政策预期会有直接影响。但目前信息缺口太大,连代表团规模、议题范围都没有,只能当作一个政治姿态来读。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
00:00
81d ago
Computing Life · Share · 鸭哥调研· rssZH00:00 · 05·08
Chrome 静默推送 4GB AI 模型:一个更自洽的商业解释
Chrome 147 未经用户同意向约 5 亿台设备静默下载了 4GB 的 Gemini Nano 本地模型,删了还会自动重装,唯一关闭入口藏在 chrome://flags 里。Google 官方说是为了端侧推理保护隐私,但文章指出这个解释有漏洞:AI Mode 按钮是混合调用,部分请求仍会发到云端,用户根本不知道自己的数据去了哪。作者提出一个更自洽...
#Inference-opt#Chrome#Gemini Nano#Commentary
一句话点评
短评:Google 给 5 亿台 Chrome 静默塞了个 4GB 模型,删了还自动重装。说是为了隐私,但 AI Mode 按钮却混合调用云端。作者猜它可能是个本地数据预处理管道:过滤噪声、提取标签再传回,绕过隐私合规。如果是真的挺省钱,但正文没披露模型版本和传输机制,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1

更多

频道

后台