ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-04

23 items · updated 3m ago
RSS live
2026-05-04 · 星期一2026年5月4日
08:53
85d ago
r/LocalLLaMA· rssEN08:53 · 05·04
一个简单的 LLM 代码测试:让模型写 Python 扫描 C 盘并按文件夹大小排序
Reddit 用户 KptEmreU 分享了一个 LLM 代码测试:让模型写 Python 脚本扫描 C 盘并按文件夹大小排序。他说本地模型全挂了,要么重复计算文件大小,要么写出嵌套递归函数。帖子没透露具体模型名称、运行环境或日志,所以没法判断是模型能力问题还是提示词写得太模糊。
#Code#Benchmarking#KptEmreU#LocalLLaMA
一句话点评
本地模型写个扫C盘脚本都翻车,这测试比跑分更扎心。
锐评
Reddit用户KptEmreU发了个很基础的代码测试:让LLM写Python脚本扫描C盘,按文件夹大小排序。结果本地模型全军覆没——要么重复计算文件大小,要么写出嵌套递归函数。这个测试门槛极低,Windows用户都能复现,比刷MMLU更能暴露模型在真实系统编程上的短板。但帖子没披露具体模型名称、运行环境或日志,所以没法判断是模型能力问题还是提示词写得太模糊。正文也没说商用模型(如GPT-4o、Claude)是否通过,这点先别太激动。如果后续有人补上对照测试,这个“扫盘测试”可能比现有代码基准更贴近日常开发场景。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K1·R1
08:49
85d ago
AI 群聊日报· atomZH08:49 · 05·04
群聊日报:FDE模式帮小生意数字化,GPT-5.5写代码两极分化,Claude“富人最爱”是标题党
群聊讨论了FDE(驻场工程师)模式,认为AI最大机会是帮传统小生意数字化,但老板对技术没底,纯产品不行,得靠服务。GPT-5.5和Codex体验两极:有人吐槽它花3小时瞎猜bug,有人夸它比Opus快且结果准。一篇“80%富人在用Claude”的文章被群友拆穿——数据其实显示Claude在富人里占有率垫底,只是用的人恰好有钱,跟“富人都在用”是两码事。...
#Agent#Code#Sequoia#OpenAI
一句话点评
群聊日报里最有价值的是对FDE模式的讨论和拆穿“80%富人在用Claude”的标题党。
锐评
FDE(驻场工程师)模式被讨论为AI落地传统小生意的关键:老板对技术没底,纯产品卖不动,得靠人带着know-how上门服务。这点挺实在,但正文没披露具体收费或规模化案例,先别太激动。GPT-5.5和Codex体验两极——有人吐槽它花3小时瞎猜bug,有人夸它比Opus快且结果准,说明模型稳定性还是看场景。最值得看的是对“80%富人在用Claude”的拆解:原文数据其实显示Claude在富人里占有率垫底,只是用的人恰好有钱,跟“富人都在用”是两码事。群友一针见血:P(富人|Claude) ≠ P(Claude|富人)。这点先别信标题,自己看原始调查。
HKR 分解
hook knowledge resonance
打开信源
28
SCORE
H0·K0·R1
08:46
85d ago
r/LocalLLaMA· rssEN08:46 · 05·04
Cursor 企业版两个提示词就要 10 美元,开源模型的机会来了
一位 Reddit 用户吐槽 Cursor 企业版两个提示词就花掉 10 美元,Claude Opus 4.7 一周烧了 80 美元(这还是打了五折的价格)。帖子没说具体做了什么任务、也没拿开源模型做对比,但数字本身已经说明问题:闭源 API 按量计费,高频使用时成本会快速累积。如果开源模型能在代码补全场景达到接近的效果,开发者完全有动力切过去省这笔钱...
#Code#Cursor#OpenCode#Reddit
一句话点评
两个提示词烧掉10美元,一周80美元,这数字够劝退。
锐评
一位Reddit用户晒账单:Cursor企业版两个提示词花掉10美元,Claude Opus 4.7一周烧了80美元(这还是打了五折的价格)。帖子没交代具体做了什么任务,也没拿开源模型跑同样的活做对比,但数字本身已经说明问题——闭源API按量计费,高频使用时成本会快速累积。如果开源模型在代码补全场景能达到接近的效果,开发者完全有动力切过去省这笔钱。不过正文没披露任务类型、模型版本和复现步骤,所以这个成本对比只能当个参考,不能直接推广到所有场景。
HKR 分解
hook knowledge resonance
打开信源
65
SCORE
H1·K1·R1
08:41
85d ago
r/LocalLLaMA· rssEN08:41 · 05·04
Reddit 子版建议:发“我做了个网站”的链接必须坦白交代
LocalLLaMA 版有人提议新规:以后谁发“我做了个网站”这类推广链接,必须公开三个信息——用了多少 AI、花了多久开发、发帖人跟网站什么关系。目的是筛掉那些用 AI 批量生成的垃圾站。帖子只举了一个例子链接,没提版主是否采纳。
#Benchmarking#LocalLLaMA#Policy#Commentary
一句话点评
LocalLLaMA 版有人提议新规:发推广链接必须公开用了多少AI、开发时长、发帖人与网站的关系,目的是筛掉AI批量生成的垃圾站。帖子只举了一个例子,版主是否采纳未披露。
锐评
这条提议挺实在。现在AI生成网站太容易,一个prompt就能批量造几十个,然后到处发帖引流。要求公开AI使用比例和开发时长,至少能让读者判断这是真花了心思做的工具,还是几小时拼出来的套壳站。帖子只举了一个违规链接,没提版主是否采纳,也没讨论执行难度——比如怎么验证开发者报的AI比例是真实的。如果真落地,对靠AI批量做站引流的人是个打击,但对认真做产品的开发者影响不大。
HKR 分解
hook knowledge resonance
打开信源
48
SCORE
H1·K1·R1
08:30
85d ago
r/LocalLLaMA· rssEN08:30 · 05·04
Llama.cpp 的量化可能有问题,Qwen 模型在低比特下不稳定
Reddit 用户发现 llama.cpp 的标准量化方法(如 Q4_K_M)在 Qwen 模型上效果不好,低于 Q5 时质量下降明显。有人拿 GRM-2.6-Plus 的 Q4_K_M 和 Qwen3.6 27B 的 AutoRound Q2_K_Mixed 比,只测了一个 SVG 生成提示,说 AutoRound 在相近模型大小下更稳定。但正文没披...
#Inference-opt#Benchmarking#llama.cpp#Qwen
一句话点评
一个 SVG 提示就下结论,样本太少,先别信。
锐评
Reddit 用户称 llama.cpp 标准量化(如 Q4_K_M)在 Qwen 模型上低于 Q5 时质量下降明显,但证据很弱:只拿 GRM-2.6-Plus 的 Q4_K_M 和 Qwen3.6 27B 的 AutoRound Q2_K_Mixed 比,且只测了一个 SVG 生成提示。正文没披露系统评测分数或更多测试集,结论缺乏统计意义。AutoRound 是 Intel 的量化工具,理论上比 llama.cpp 的 round-to-nearest 更优,但跨模型、跨量化级别对比需要更多样本验证。如果是真的,对本地部署用户影响大——意味着用 Q4 省显存可能得不偿失。但目前建议观望,等第三方跑完整评测。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
04:16
85d ago
FT · 科技· rssEN04:16 · 05·04
FT盘点6个AI落地案例:从电力调度到对冲基金,但细节太少
英国金融时报发了一篇AI应用盘点,列了6个行业案例:公用事业、餐厅、招聘、创业公司、对冲基金和财富管理。标题看着挺全,但正文基本只给了场景名字,没披露用了什么模型、跑了多大规模、花了多少钱、效果指标是多少。AI编程和金融两个方向值得跟进,但目前只有标题级信息,没法判断可复制性。
#Code#Financial Times#Commentary
一句话点评
FT 盘点 6 个行业 AI 案例,但只有标题没细节,没法判断可复制性。
锐评
金融时报这篇 AI 应用盘点列了公用事业、餐厅、招聘、创业公司、对冲基金和财富管理 6 个场景,标题看着挺全。但正文基本只给了场景名字,没披露用了什么模型、跑了多大规模、花了多少钱、效果指标是多少。AI 编程和金融两个方向值得跟进,但目前只有标题级信息,没法判断可复制性。正文没披露任何具体数字或验证条件,所以没法判断这些案例是实验性试点还是已规模落地。如果真想了解落地细节,得去找原始来源或具体公司的技术博客。
HKR 分解
hook knowledge resonance
打开信源
42
SCORE
H0·K0·R1
04:09
85d ago
● P1r/LocalLLaMA· rssEN04:09 · 05·04
Mistral Medium 3.5 128B 与 Qwen 3.5 122B 在消费级显卡上性能对比
一位 Reddit 用户用 4 张 RTX 3080 20GB 显卡跑了两个大模型。Mistral Medium 3.5 128B 在 llama.cpp 里把张量拆分(tensor split)打开后,生成速度从每秒 10.37 个 token 翻倍到 21.59。但 Qwen 3.5 122B A10B 这个混合专家模型(MoE,把任务分给不同子模...
#Inference-opt#Benchmarking#Mistral#Qwen
精选理由
精选 · 重要度 86 · 吸引力 + 知识量 + 共鸣
一句话点评
Reddit 帖子被屏蔽,正文内容没抓到,只有标题。性能对比的具体数据、推理速度、显存占用全看不到,没法判断谁更强。
锐评
这条消息来自 Reddit 的 LocalLLaMA 板块,标题说有人用 4 张 RTX 3080 20GB 跑 Mistral Medium 3.5 128B 和 Qwen 3.5 122B A10B 做对比测试。但文章正文被 Reddit 的安全策略拦住了,返回了 403 错误,我们拿到的只有标题和一张图片的占位符,没有任何实测数字。 从标题能猜出几个信息点:测试环境是 4 张 RTX 3080,总显存 80GB,跑的是量化版模型——Mistral 那边用了 Q3_K_M 量化,Qwen 是 A10B 的 MoE 架构,激活参数只有 10B,理论上推理更快、显存压力更小。但具体谁在生成速度、回答质量、显存占用上赢了,正文没披露。 这条对比对想在消费级显卡上跑大模型的人有参考价值,但前提是能看到原始数据。现在只能等 Reddit 帖子恢复或者有人搬运到其他平台。如果你手上有这两款模型在 3080 上的实测结果,欢迎补充。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K1·R1
04:06
85d ago
机器之心 · 公众号· rssZH04:06 · 05·04
黄仁勋怼Anthropic CEO:别一当老板就开上帝视角
黄仁勋公开批评Anthropic CEO Dario Amodei的预测——AI会取代50%入门白领岗位。Amodei之前说五年内10-20%失业率,马斯克则提过20%的AI灭绝风险。正文没披露黄仁勋拿出了什么量化反证,但核心意思很直接:CEO别坐在高位拍数字,得接地气。
#Safety#Jensen Huang#Anthropic#Dario Amodei
一句话点评
黄仁勋怼Anthropic CEO:别坐高位拍脑袋,AI取代岗位的数字没那么好猜。
锐评
黄仁勋公开批评Anthropic CEO Dario Amodei的预测——AI会取代50%入门白领岗位。Amodei之前说五年内10-20%失业率,马斯克则提过20%的AI灭绝风险。正文没披露黄仁勋拿出了什么量化反证,但核心意思很直接:CEO别坐在高位拍数字,得接地气。 这条新闻的价值在于,它暴露了AI行业对“替代率”的预测有多随意——从5%到50%到20%灭绝风险,全凭一张嘴。黄仁勋的批评本身没给数据,更像在喊“别瞎猜”。对从业者来说,真正该关注的是:这些预测背后有没有可验证的模型或实验?目前没有。所以这条更适合当行业八卦看,别当决策依据。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
04:04
85d ago
新智元 · 公众号· rssZH04:04 · 05·04
有人一分钟烧了4000万Token,奥特曼亲自给他加额度
OpenAI员工Peter Steinberger在X上晒出自己每分钟消耗4000万Token的API配额,Sam Altman直接回复给他提额。他搞了个叫ClawSweeper的并行编程工具,同时跑50个GPT-5.5实例(注意:GPT-5.5这个型号、金融和市场数据都是二手信息,正文没披露验证细节)。核心看点是:并行coding agent烧Tok...
#Agent#Code#Tools#OpenAI
一句话点评
OpenAI员工一分钟烧4000万token,Altman亲自给他提额。
锐评
核心看点是并行coding agent的token消耗量,不是GPT-5.5这个型号(正文没披露验证细节)。一分钟4000万token,按GPT-5.0定价算,一分钟成本约2000美元,确实烧钱。Altman亲自回复提额,说明OpenAI内部对这类极端用例也感兴趣。但ClawSweeper具体效果、金融和市场数据来源都是二手信息,正文没披露验证细节。对AI从业者来说,这条信息提示:并行agent的token消耗可能远超预期,成本控制是落地关键。
HKR 分解
hook knowledge resonance
打开信源
67
SCORE
H1·K1·R1
04:00
85d ago
FT · 科技· rssEN04:00 · 05·04
AI 正在帮香水行业省钱和做个性化,但 FT 这篇没给具体数字
FT 说 AI 正在改变香水行业,方向是超个性化(根据个人喜好调香)和降本。但正文被付费墙挡住,没披露用了哪家公司的模型、省了多少成本、数据从哪里来、部署条件是什么。信息缺口很大,目前只能当趋势信号看,没法做技术判断。
#Financial Times#Commentary
一句话点评
FT说AI在改香水行业,但正文被付费墙挡住,没披露具体模型、成本、数据来源。
锐评
FT这篇讲AI改变香水行业,方向是超个性化调香和降本。但正文被付费墙挡住,信息缺口很大:没披露用了哪家公司的模型、省了多少成本、数据从哪里来、部署条件是什么。目前只能当趋势信号看,没法做技术判断。如果真能根据个人喜好生成配方,确实能省掉调香师反复试错的时间和原料成本,但前提是得有足够多的用户偏好数据和香原料数据库来训练模型。这点先别太激动,正文没披露数据量和验证结果。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H1·K0·R0
04:00
85d ago
FT · 科技· rssEN04:00 · 05·04
对冲基金用AI抢速度,但只敢让它读文件不敢让它下单
对冲基金开始用AI分析财报和新闻,想靠速度差赚钱。但正文没披露用了什么模型、数据来源、回测结果,也没说部署规模。目前AI只被用来读文档,敏感交易决策还是人来做——这点先别太激动,离全自动交易还远。
#Tools#Commentary
一句话点评
对冲基金用AI读财报赚速度差,但敏感交易还是人拍板,离全自动还远。
锐评
这篇FT报道说对冲基金开始用AI分析财报和新闻,想靠速度差赚钱。但正文没披露用了什么模型、数据来源、回测结果,也没说部署规模。目前AI只被用来读文档,敏感交易决策还是人来做——这点先别太激动,离全自动交易还远。关键信息缺口:没有具体案例说明AI比人快多少、赚了多少;也没提延迟、成本或样本量。如果是真的,这更像一个辅助工具,不是颠覆。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
04:00
85d ago
FT · 科技· rssEN04:00 · 05·04
英国水务公司扔掉听漏棒,改用AI查漏
新加坡的漏损率比英格兰和威尔士低75%,靠的就是AI。但正文没披露用了哪家模型、什么传感器、铺了多少设备,所以这点先别太激动。传统听漏棒靠人耳贴地听,换成AI就是用水管上的传感器+算法实时分析,能更快定位漏点。如果真能大规模落地,省下的水费和维修成本会很可观,但目前缺具体方案和验证数据。
#Commentary
一句话点评
新加坡漏损率比英格兰和威尔士低75%,靠AI听漏。但正文没披露用哪家模型、什么传感器、铺了多少设备,这点先别太激动。
锐评
传统听漏棒靠人耳贴地听,换成AI就是水管上装传感器+算法实时分析,能更快定位漏点。新加坡漏损率比英格兰和威尔士低75%,这个数字很漂亮,但正文没披露用了哪家模型、什么传感器、铺了多少设备,所以先别太激动。如果真能大规模落地,省下的水费和维修成本会很可观,但目前缺具体方案和验证数据,比如误报率、部署成本、维护周期都没提。对于AI从业者来说,这是个典型的IoT+边缘推理场景,但信息缺口太大,没法判断技术门槛和可复制性。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
04:00
85d ago
FT · 科技· rssEN04:00 · 05·04
创业公司用AI写代码,跑得飞快
FT报道称,越来越多创业公司直接用AI生成代码,绕过传统产品开发瓶颈。创始人说这样能更快验证想法、缩短上线周期。但正文没披露具体用了什么工具、团队规模、开发周期缩短了多少,也没提代码缺陷率。所以“快”是定性判断,缺量化支撑。
#Code#Financial Times#Commentary
一句话点评
创业公司用AI写代码,快是快了,但缺数据支撑。
锐评
FT这篇报道说创业公司直接用AI生成代码,绕过传统开发瓶颈,创始人觉得这样能更快验证想法。但全文没披露具体用了什么工具、团队规模、开发周期缩短了多少,也没提代码缺陷率。所以“快”只是定性判断,缺量化支撑。对于AI从业者来说,这条信息价值有限——它更像一个趋势观察,而不是可复用的实践参考。想知道AI生成代码到底多快、多靠谱,还得看有具体数字的案例。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R1
04:00
85d ago
FT · 科技· rssEN04:00 · 05·04
猎头用AI筛简历,先让机器干杂活,再让人做判断
FT报道,招聘行业开始用AI来“清空甲板”——先把简历初筛、匹配关键词这些重复劳动交给模型,腾出时间让人类猎头做深度沟通和关系维护。文章没有披露具体用了哪家模型、部署规模多大、效果指标如何,更像一个行业趋势观察。核心逻辑是:AI不直接替代猎头,而是把人的精力集中在“连接”这个高价值环节上。这点先别太激动,正文没给任何落地数据或成本对比,验证还很弱。
#Agent#Tools#Financial Times#Commentary
一句话点评
AI帮猎头筛简历,但正文没给任何落地数据。
锐评
FT这篇报道讲的是招聘行业用AI做初筛和关键词匹配,把重复劳动交给模型,让人类猎头腾出时间做深度沟通。逻辑上说得通:AI不替代猎头,而是把精力集中在“连接”这个高价值环节。但正文没披露具体用了哪家模型、部署规模多大、效果指标如何,更像一个行业趋势观察,不是产品评测或案例研究。关键数字和成本对比全缺,验证还很弱。如果你在考虑采购类似方案,这篇只能当背景参考,不能当决策依据。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H0·K0·R1
03:52
85d ago
彭博科技· rssEN03:52 · 05·04
ASX 警告上市公司:别拿 AI 吹股价
澳大利亚交易所(ASX)发话,上市公司别为了拉股价就夸大 AI 对业务的实际影响。ASX 说自己会盯着这种“吹捧”行为,但正文没披露具体罚什么、抓过多少家、什么时候开始查。
#ASX#Policy
一句话点评
ASX警告上市公司别用AI概念拉股价,但没说具体罚什么。
锐评
澳大利亚交易所(ASX)直接点名上市公司,别为了拉股价就夸大AI对业务的实际影响。ASX说自己会盯着这种“吹捧”行为,但正文没披露具体罚什么、抓过多少家、什么时候开始查。这更像一个口头警告,威慑力取决于后续有没有真动作。对于AI从业者来说,这条信号意味着监管开始关注AI概念炒作,尤其是那些主营业务跟AI关系不大、但硬蹭热点的公司。如果ASX后续出台具体披露指引,可能会影响上市公司在财报和公告里怎么描述AI业务——比如要求区分“已落地”和“在研发”,或者要求量化AI对营收的实际贡献。目前信息缺口很大:没有案例、没有时间表、没有处罚细则,所以暂时不用过度解读。但值得留意的是,这可能是全球交易所跟进SEC对AI“洗绿”监管的前奏。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
03:05
85d ago
r/LocalLLaMA· rssEN03:05 · 05·04
Reddit 用户爆料:OpenRouter 上的 owl-alpha 就是美团的长猫模型
一位 Reddit 用户在 LLM 看板应用里看到调用记录,声称 OpenRouter 上的 owl-alpha 模型其实就是美团的 LongCat(长猫)。正文没披露任何参数、验证步骤,也没有 OpenRouter 或美团的官方确认。目前只能当传闻看,别急着下结论。
#OpenRouter#Meituan#klippers#Commentary
一句话点评
Reddit 用户凭调用记录猜测 OpenRouter 上的 owl-alpha 就是美团 LongCat,但无官方确认。
锐评
这条消息来自 Reddit 用户 klippers,他在 LLM 看板应用里看到调用记录后,声称 OpenRouter 上的 owl-alpha 模型其实就是美团的 LongCat(长猫)。目前没有任何参数、验证步骤,也没有 OpenRouter 或美团的官方确认。如果属实,意味着美团可能通过 OpenRouter 低调测试自家模型,但这点先别太激动——正文没披露任何技术细节,连模型大小、架构都没提。对于 AI 从业者来说,这更像一个需要跟踪的线索,而不是可用的信息。建议观望,等官方回应或更多验证数据。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
03:02
85d ago
Product Hunt · AI· rssEN03:02 · 05·04
Codex Pets:给 OpenAI 代码助手养个电子宠物
OpenAI 在 Product Hunt 上架了一个叫 Codex Pets 的小功能,本质是给 Codex 工作流加一个浮窗宠物。它会用动画告诉你 Codex 当前是在跑代码、等着你确认,还是已经跑完可以审查了。你可以通过 hatch-pet 技能换皮肤。目前免费,但正文没披露具体怎么定制、有没有内购,也没说是不是 OpenAI 官方直接发布的。就...
#Code#Tools#OpenAI#Product Hunt
一句话点评
Codex 工作流里养个浮窗宠物,看状态用。免费,但定制和内购都没说。
锐评
OpenAI 在 Product Hunt 上架了 Codex Pets,本质是给 Codex 工作流加一个浮窗宠物。它会用动画告诉你 Codex 当前是在跑代码、等着你确认,还是已经跑完可以审查了。你可以通过 hatch-pet 技能换皮肤。目前免费,但正文没披露具体怎么定制、有没有内购,也没说是不是 OpenAI 官方直接发布的。就是个锦上添花的小功能,对开发效率没实质提升,适合喜欢桌面宠物的用户尝鲜。
HKR 分解
hook knowledge resonance
打开信源
42
SCORE
H1·K0·R0
01:26
85d ago
r/LocalLLaMA· rssEN01:26 · 05·04
给模型加个“回头检查”小模块,1.7B 写代码效果猛涨
Reddit 用户 bigattichouse 给 1.7B 小模型加了一个“反向侧车”:在模型快生成完时,让一个小 transformer 读一遍输出,再把修正信号送回模型头部,循环几次。测试只跑了 HumanEval 前 20 题,没披露完整分数,但说效果提升明显。灵感来自一篇神经解剖学文章(Repeat Yourself),思路是把模型生成当成“...
#Code#Reasoning#Inference-opt#bigattichouse
一句话点评
给1.7B小模型加个反向侧车,循环读输出再修正,代码能力提升明显,但只测了20题。
锐评
Reddit用户bigattichouse给1.7B小模型加了一个“反向侧车”:在模型快生成完时,让一个小transformer读一遍输出,再把修正信号送回模型头部,循环几次。测试只跑了HumanEval前20题,没披露完整分数,但说效果提升明显。灵感来自一篇神经解剖学文章(Repeat Yourself),思路是把模型生成当成“先写草稿再修改”。目前只验证了代码生成,且样本量极小(20题),完整HumanEval跑完才能判断是否真的有效。作者说正在训练9B版本,后续会开源代码。如果真能低成本提升小模型推理能力,对本地部署场景有价值,但循环推理会增加延迟,这点正文没提。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1

更多

频道

后台