ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-05

50 items · updated 3m ago
RSS live
2026-05-05 · 星期二2026年5月5日
14:29
84d ago
FT · 科技· rssEN14:29 · 05·05
Coinbase 要裁员,把公司改造成一个“智能体”
Coinbase 的 CEO 说 AI 加快了内部流程,所以公司要裁员。正文没披露裁员人数、时间、涉及哪些团队,也没说具体用了什么 AI 机制。
#Agent#Coinbase#Personnel#Product update
一句话点评
Coinbase CEO 说 AI 提效所以要裁员,但没披露人数、时间、涉及团队。
锐评
Coinbase CEO 把裁员理由直接挂在 AI 提效上,说内部流程被 AI 加速了,所以不需要那么多人。这个说法在科技公司里不算新鲜,但公开拿 AI 当裁员理由的还不多。正文没披露裁员人数、时间、涉及哪些团队,也没说具体用了什么 AI 机制——是 agent workflow(让模型进业务流程干活)还是 RAG(外挂资料库)?信息缺口很大。如果只是把客服或合规的重复劳动用 AI 替代了,那裁的是操作岗;如果连工程师也裁,那才是真信了 AI 能写代码。目前 FT 全文被 paywall 挡住,只能从摘要判断:CEO 的表态更像一个信号——AI 提效正在从口号变成组织调整的借口。这点先别太激动,等具体数字出来再说。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K0·R1
14:20
84d ago
TechCrunch AI· rssEN14:20 · 05·05
ElevenLabs 公布新投资人:贝莱德、杰米·福克斯和伊娃·朗格利亚
语音 AI 公司 ElevenLabs 在官方博客里列出了新投资人,包括资管巨头贝莱德、演员杰米·福克斯和伊娃·朗格利亚。公司同时宣布年经常性收入(ARR)达到 5 亿美元——这个数字说明企业客户买单意愿强,语音 AI 作为交互界面正在落地。不过正文没披露这轮融资的具体金额、估值、各投资方持股比例,也没说客户总数。
#Audio#ElevenLabs#BlackRock#Jamie Foxx
一句话点评
贝莱德和明星入局,ARR 5 亿美元,语音 AI 落地信号强。
锐评
ElevenLabs 公布新投资人名单,资管巨头贝莱德和演员 Jamie Foxx、Eva Longoria 在列,同时宣布年经常性收入(ARR)达到 5 亿美元。这个数字说明企业客户愿意为语音 AI 付费,语音作为交互界面正在真正落地。但正文没披露本轮融资具体金额、估值、各投资方持股比例,也没说客户总数。明星投资人的品牌背书意义大于财务意义,贝莱德入场则代表机构对语音赛道长期看好。ARR 5 亿是亮点,但缺少增长曲线和利润率,无法判断是否盈利。如果是真的,语音 AI 的商业化速度比预期快。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
14:07
84d ago
TechCrunch AI· rssEN14:07 · 05·05
CopilotKit 拿了 2700 万美元,帮开发者在自家应用里塞 AI 代理
CopilotKit 完成 2700 万美元 A 轮融资,领投方是 Glilot Capital、NFX 和 SignalFire。这家公司做的是让开发者把 AI 代理直接嵌入到现有应用里,而不是只挂个聊天框。说白了,就是让模型进业务流程干活,比如在旅行 App 里帮你一次性订好机票酒店,不用再翻一堆文字回复。2700 万在 A 轮算中等偏上,但正文没...
#Agent#CopilotKit#Glilot Capital#NFX
一句话点评
2700万美元A轮,让AI代理嵌入现有应用,不只是聊天框。
锐评
CopilotKit 拿了 2700 万美元 A 轮,领投方是 Glilot Capital、NFX 和 SignalFire。它的卖点是让开发者把 AI 代理直接嵌入现有应用里干活,比如在旅行 App 里一次性订好机票酒店,而不是只挂个聊天框让你翻文字回复。2700 万在 A 轮算中等偏上,但正文没披露估值、具体客户数或产品技术细节,所以没法判断这钱花得值不值。关键看它跟 LangChain、Vercel AI SDK 这些同类工具比,到底好在哪。如果真能让模型进业务流程干活,对 SaaS 产品来说挺实用,但得等更多落地案例出来才能下结论。
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H0·K1·R0
13:43
84d ago
r/LocalLLaMA· rssEN13:43 · 05·05
Anubis-OSS 排行榜更新:371 次提交、218 个模型、10 款苹果芯片
Anubis-OSS 排行榜更新了,目前有 371 次提交、218 个模型,还包含了 10 款苹果芯片的跑分。不过正文没披露具体指标、模型名称和测试条件,所以暂时没法判断哪个模型表现更好,或者苹果芯片在推理速度上有没有优势。信息缺口比较大,先别急着下结论。
#Benchmarking#Anubis-OSS#Apple#peppaz
一句话点评
信息太少,先别信。
锐评
Anubis-OSS 排行榜更新了,号称有 371 次提交、218 个模型,还首次加入了 10 款苹果芯片的跑分。但正文被 Reddit 屏蔽,实际披露的信息只有用户 peppaz 和一个链接,具体测了什么指标、哪些模型、测试条件一概没有。这个排行榜目前就是个空壳,没法判断苹果芯片推理速度有没有优势,也没法横向对比模型。如果是真的,这个规模的社区跑分对本地部署选型很有参考价值,但信息缺口太大,先别急着引用或下结论。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
13:43
84d ago
r/LocalLLaMA· rssEN13:43 · 05·05
有人在低显存显卡上跑Kimi,把多余权重塞进内存,速度还行
Reddit 用户分享在 12GB Tesla T4 上跑 Kimi,剩余权重卸载到内存(CPU 是双路 24 核 Xeon Platinum + 1.5TB 内存),输出速度约 1.6 token/秒,输入约 20 token/秒。这个输出速度很慢,基本只适合跑跑测试。帖子还提到 Unsloth Q8 量化反而比 Q4 快一点,但没说明用的 Kimi...
#Inference-opt#Kimi#Tesla#Unsloth
一句话点评
12GB T4 跑 Kimi,输出 1.6 token/秒,比打字还慢,只适合测能不能跑。
锐评
Reddit 用户用 12GB Tesla T4 跑 Kimi,剩余权重卸载到内存(双路 24 核 Xeon + 1.5TB 内存),输出仅 1.6 token/秒,输入约 20 token/秒。这个速度基本告别实际使用,只适合验证模型能否加载。帖子还提到 Unsloth Q8 量化比 Q4 快一点,但没说明用的 Kimi 版本和推理框架,这点先别太激动。正文没披露具体模型大小和推理栈,信息缺口明显。如果是真的,Q8 比 Q4 快可能跟内存带宽瓶颈有关,但缺乏复现条件。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H0·K1·R1
13:42
84d ago
The Verge · AI· rssEN13:42 · 05·05
AI 设计的车长什么样?
The Vergecast 聊了 AI 在汽车设计中的应用。传统车型开发周期要五年以上,AI 能缩短建模和风洞测试的时间。但正文没披露具体是哪家车企、哪款车、有没有量产案例,所以这点先别太激动。
#Tools#The Verge#Vergecast#Commentary
一句话点评
AI 能缩短汽车建模和风洞测试时间,但没点名具体车企和量产案例,先别太激动。
锐评
The Vergecast 聊了 AI 在汽车设计中的应用。传统车型开发周期要五年以上,AI 能缩短建模和风洞测试的时间。但正文没披露具体是哪家车企、哪款车、有没有量产案例,所以这点先别太激动。目前 AI 更多是辅助设计师出概念草图或做早期仿真,离真正替代工程师做碰撞安全、耐久性验证还远。如果后续有车企公布 AI 设计的零件或整车进入量产,那才是真信号。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R0
13:31
84d ago
r/LocalLLaMA· rssEN13:31 · 05·05
Strix Halo 上 Vulkan 比 ROCm 还快,AMD 官方驱动反而拖后腿
Reddit 用户实测,在 AMD Strix Halo(gfx1151)上跑 llama.cpp,Vulkan 后端生成速度 51.2 tokens/s,比 ROCm 的 42.3 tokens/s 快约 21%。机器是 Radeon 8060S、64GB 统一显存,模型是 Qwen3.6-35B-A3B Q6_K。问题出在 ROCm 对 gfx11...
#Inference-opt#Benchmarking#AMD#Qwen
一句话点评
ROCm 在 Strix Halo 上被 Vulkan 反超 21%,AMD 的软件栈又拖后腿了。
锐评
Reddit 用户实测,在 AMD Strix Halo(Radeon 8060S、64GB 统一显存)上跑 llama.cpp,Vulkan 后端生成速度 51.2 tokens/s,比 ROCm 的 42.3 tokens/s 快约 21%。模型是 Qwen3.6-35B-A3B Q6_K。问题出在 ROCm 对 gfx1151 架构的部分算子走了慢路径,而 Vulkan 驱动反而更成熟。 这个差距对本地部署有意义——同样硬件,换后端就能白嫖 20% 性能。但注意这是单次基准测试,commit 号 27aef3dd9,未说明是否调优过 ROCm 的编译参数。正文没披露功耗和显存占用,也没对比推理延迟。如果 ROCm 后续更新修复了算子路径,结果可能反转。
HKR 分解
hook knowledge resonance
打开信源
69
SCORE
H1·K1·R1
13:18
84d ago
TechCrunch AI· rssEN13:18 · 05·05
印度第一家生成式AI独角兽放弃自研大模型,转做云服务
Krutrim,印度第一家生成式AI独角兽,宣布从自研大模型转向云服务。背后原因是烧钱太快、产品更新慢,还裁了人。正文没披露具体裁员人数、定价和模型参数,但核心问题很直白:在印度做大模型,经济账算不过来。训练和推理成本太高,市场又不够大,撑不起一家只做模型的独角兽。转做云服务相当于把算力和工具打包卖给企业客户,变现路径更短。这点先别太激动——印度云市场...
#Krutrim#Product update#Commentary
一句话点评
印度第一家生成式AI独角兽Krutrim放弃自研大模型,转做云服务。
锐评
Krutrim 从自研大模型转向云服务,核心原因是经济账算不过来。在印度训练和推理大模型成本太高,市场又不够大,撑不起一家只做模型的独角兽。转做云服务相当于把算力和工具打包卖给企业客户,变现路径更短。正文没披露具体裁员人数、定价和模型参数,但问题很直白:烧钱太快、产品更新慢。这点先别太激动——印度云市场已有AWS、Azure等巨头,Krutrim 能否差异化竞争还是未知数。如果是真的,这给其他新兴市场的大模型创业公司提了个醒:先想清楚怎么赚钱。
HKR 分解
hook knowledge resonance
打开信源
67
SCORE
H1·K0·R1
13:02
84d ago
Ben's Bites· rssEN13:02 · 05·05
Codex 开始向非技术用户铺开,Grok 4.3 API 上线且价格比 Sonnet 便宜不少
OpenAI 正在把 Codex 从编程工具变成日常办公助手,现在可以直接从 Claude Cowork 等工具导入设置、插件和项目配置,还新增了做幻灯片和表格的功能。Grok 4.3 API 正式上线,支持 100 万 token 上下文、图文输入和推理,价格是每百万输入 token 1.25 美元、输出 2.5 美元——比 Sonnet 4.6 便...
#Agent#Code#Multimodal#OpenAI
一句话点评
Codex 开始抢办公软件饭碗,Grok 4.3 API 便宜到离谱。
锐评
OpenAI 在把 Codex 从编程工具变成日常办公助手,现在可以直接从 Claude Cowork 等工具导入设置、插件和项目配置,还新增了做幻灯片和表格的功能。这步棋挺聪明——Codex 不再只服务程序员,而是想抢 Office 套件的用户。但正文没披露具体效果如何,比如做表格的准确率、导入兼容性有没有坑,这点先别太激动。 Grok 4.3 API 正式上线,支持 100 万 token 上下文、图文输入和推理,价格是每百万输入 token 1.25 美元、输出 2.5 美元——比 Sonnet 4.6 便宜不少,性能还差不多。如果是真的挺省钱,但注意知识截止于 2025 年 12 月,时效性敏感的任务要打折。另外,API 的推理能力具体多强、图文输入是否支持多轮对话,正文没细说。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
12:38
84d ago
r/LocalLLaMA· rssEN12:38 · 05·05
本地版 Deep Research 项目大盘点:谁在认真维护,谁只是挂个名
Reddit 用户整理了一份 8 个本地深度研究项目的对比表,核心看点是提交数、贡献者、issue 和 PR 活跃度,以及搜索后端用的是谁。Local Deep Research 有 46 个贡献者,GPT Researcher 有 211 个,但人多不一定代表项目健康——正文没披露 MiroThinker 的完整细节,所以没法判断它是不是真能跑。关键...
#Agent#RAG#Tools#Reddit
一句话点评
8个本地深度研究项目横向对比,GPT Researcher 贡献者最多(211人),但人多不代表项目健康。
锐评
Reddit 用户整理了一份 8 个本地深度研究项目的对比表,核心看点是提交数、贡献者、issue 和 PR 活跃度,以及搜索后端用的是谁。Local Deep Research 有 46 个贡献者,GPT Researcher 有 211 个,但人多不一定代表项目健康——正文没披露 MiroThinker 的完整细节,所以没法判断它是不是真能跑。关键信号是维护活跃度和搜索依赖,而不是项目名字里带不带“本地”或“开源”。比如有些项目依赖 LangChain 或字节跳动的搜索 API,一旦上游变动,项目可能直接停摆。另外,issue 和 PR 的响应速度比贡献者数量更能说明问题,但原文没给具体响应时间。如果你在选工具,建议优先看最近一个月有没有 commit,以及搜索后端是不是你可控的。
HKR 分解
hook knowledge resonance
打开信源
71
SCORE
H1·K1·R1
12:28
84d ago
r/LocalLLaMA· rssEN12:28 · 05·05
没显卡也能跑26B模型?Reddit用户说i5-8500+32GB内存就行
一位Reddit用户在LocalLLaMA版发帖,声称Gemma4 26B模型能在i5-8500处理器、32GB内存、无显卡的机器上本地运行。帖子还提到12B模型也能纯CPU跑。但正文没披露量化精度、每秒生成多少token、内存占用多少,也没给出可复现的设置参数。信息缺口很大,想复现的话得自己猜配置。
#Inference-opt#Gemma#Reddit#Commentary
一句话点评
26B模型纯CPU跑,但没给量化精度和速度,先别太激动。
锐评
Reddit用户声称Gemma4 26B能在i5-8500、32GB内存、无显卡的机器上本地运行,还顺带提了12B也能纯CPU跑。如果属实,意味着低配电脑也能跑大模型,对本地部署是好事。但正文没披露量化精度(比如4-bit还是8-bit)、每秒生成多少token、内存占用多少,也没给出可复现的设置参数。信息缺口很大,想复现得自己猜配置。另外,i5-8500是2018年的老CPU,算力有限,即使能跑,速度大概率很慢,实用性存疑。建议等更详细的测试数据再下结论。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
12:10
84d ago
MIT 科技评论· rssEN12:10 · 05·05
马斯克诉奥特曼案开庭,AI 民主化蓝图发布
MIT 科技评论总结了马斯克诉奥特曼案第一周庭审情况,记者兼律师 Michelle Kim 在法庭现场记录了关键细节,包括马斯克声称自己被欺骗、警告 AI 可能毁灭人类,并承认 xAI 蒸馏了 OpenAI 的模型。正文未披露 OpenAI 诉讼的具体新证据。同时,文章发布了一份利用 AI 加强民主的蓝图,由 Eric Schmidt 办公室的两位负责...
#Agent#Safety#MIT Technology Review#Elon Musk
一句话点评
马斯克诉奥特曼案第一周庭审细节:马斯克自称被骗、警告AI可能毁灭人类,还承认xAI蒸馏了OpenAI模型。正文没披露OpenAI诉讼的新证据。另一篇是Eric Schmidt办公室的AI民主蓝图,偏理念,缺具体案例。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
11:30
84d ago
● P1FT · 科技· rssEN11:30 · 05·05
Google、xAI与Microsoft同意接受美国AI模型国家安全审查
三家大模型公司跟美国政府达成了协议,以后发布新模型前要先过一道国家安全审查。起因是 Anthropic 最新的 Mythos 模型让官方有些紧张。不过这篇报道正文被付费墙挡住了,具体怎么审、审哪些模型、什么时候开始执行,这些关键细节都没披露。
#Safety#Google#xAI#Microsoft
精选理由
精选 · 重要度 94 · 吸引力 + 知识量 + 共鸣
一句话点评
三家大模型公司同意让美国政府在新模型发布前先做安全审查,但具体怎么查、查到什么程度,正文没披露。
锐评
Google、xAI 和微软跟美国政府谈妥了一件事:以后他们最前沿的 AI 模型在公开之前,会先交给政府做一轮国家安全审查。这相当于给模型上市加了一道“政审”环节,不再是公司自己说了算。目前只有这三家公开同意,OpenAI 和 Meta 还没表态。 不过,FT 的原文被付费墙挡住了,我们看不到审查的具体标准、流程,也不知道政府有没有权力叫停发布。从标题和已知信息判断,这更像是一个自愿性质的合作框架,而不是强制法规。对从业者来说,这意味着未来在美国发布大模型,合规成本可能会增加,发布节奏也可能变慢。 现在还缺几个关键信息:审查到底看什么(是模型能力上限、数据安全,还是输出内容风险),以及如果审查不通过,公司能不能强行发布。这些没搞清楚之前,先别急着下结论说行业要变天。
HKR 分解
hook knowledge resonance
打开信源
94
SCORE
H1·K1·R1
11:16
84d ago
r/LocalLLaMA· rssEN11:16 · 05·05
Qwen3.6 聊天模板合并版:修复 8 个问题,支持开发者角色与隐藏推理
fakezeta 发布了一个合并版 Qwen3.6 聊天模板,整合了 allanchan339 和 froggeric 的 8 项修复。新模板支持开发者角色、隐藏历史推理过程,以及 JSON 工具参数解析。已在 llama-server 和 Qwen3.6 35B A3B 上测试通过。正文没披露具体修复细节和性能对比,但如果你在用 Qwen3.6 做工...
#Tools#Reasoning#Code#Qwen
一句话点评
Qwen3.6 聊天模板合并版,修了 8 个 bug,支持隐藏推理和工具调用。
锐评
fakezeta 把 allanchan339 和 froggeric 的 8 项修复合并成一个 Qwen3.6 聊天模板,支持开发者角色、隐藏历史推理过程、JSON 工具参数解析。已在 llama-server 和 Qwen3.6 35B A3B 上跑通。对本地部署用户来说,隐藏推理过程能减少输出干扰,工具参数解析让模型更稳定地调用外部函数。但正文没披露具体修复了哪 8 项、修复前后效果对比,也没说是否影响推理速度或内存占用。如果你在用 Qwen3.6 做本地工具调用或角色扮演,这个模板值得试,但建议先在自己的场景里跑一遍,别直接上生产。
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H0·K1·R1
10:07
84d ago
r/LocalLLaMA· rssEN10:07 · 05·05
双 RTX 3090 跑推理,实测功耗 760W
Reddit 用户 sdfgeoff 用智能插座实测,双 RTX 3090 推理整机功耗约 760W,待机 90W,没做任何功耗限制或调优。760W 意味着电费不低,长期跑推理的话,单卡或降频能省不少钱。正文没披露具体模型和推理负载,所以这个数字只能当上限参考。
#Inference-opt#Reddit#sdfgeoff#NVIDIA
一句话点评
双3090跑推理整机760W,待机90W,没调功耗,电费不低。
锐评
Reddit用户sdfgeoff用智能插座实测,双RTX 3090推理整机功耗约760W,待机90W,没做任何功耗限制或调优。760W意味着电费不低——按国内0.6元/度算,连续跑一天约11元,一个月330元。长期跑推理的话,单卡或降频能省不少钱。但正文没披露具体模型和推理负载(比如是跑70B还是7B模型、连续生成还是间歇请求),所以这个数字只能当上限参考。实际功耗可能更低,尤其是用vLLM等框架做批处理时。另外,没测峰值功耗和瞬时波动,对电源选型也有影响。如果是个人玩家组双卡机,建议先做功耗限制,能省30%以上电费。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
10:00
84d ago
● P1OpenAI 博客· rssEN10:00 · 05·05
OpenAI发布GPT-5.5 Instant作为ChatGPT新默认模型
OpenAI 把免费用户和默认聊天用的模型升级到了 GPT-5.5 Instant。官方说这次更新主要干了三件事:回答更靠谱、更简洁,并且更能利用你之前聊过的上下文来贴合你的偏好。内部测试里,在医疗、法律、金融这类高风险问题上,GPT-5.5 Instant 比上一代 GPT-5.3 Instant 的幻觉内容少了 52.5%;在用户举报过的事实错误对...
#Reasoning#Alignment#Memory#OpenAI
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI把ChatGPT默认模型换成了GPT-5.5 Instant,主要提升是回答更准、更简洁,幻觉少了52.5%,但官方没给独立评测和延迟数据。
锐评
这次更新最实在的数字是:在高风险领域(医疗、法律、金融)的幻觉率比上一代降了52.5%,在用户标记过的刁钻问题上错误也少了37.3%。OpenAI还放了个代数题的例子,展示新模型能自己发现推导错误并纠正,而不是像旧版那样直接判“无解”。这点挺直观,说明模型在推理时多了一层自我检查。 不过得打个折:这些全是内部评测,没有第三方基准或外部验证。文章也没提推理速度和成本变化,对开发者来说这两项跟准确率一样重要。另外,“更简洁”和“更个性化”目前只有定性描述,没给出具体指标,比如回复长度缩短了多少、用户满意度提升了多少。 如果是真的,免费用户和付费用户都能直接用上,覆盖面够大。但想判断它是不是日常干活更顺手了,还得等实际用一阵子,看看在长对话和复杂任务里会不会翻车。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
09:48
84d ago
r/LocalLLaMA· rssEN09:48 · 05·05
两台 Spark 跑本地编程,120K 上下文
Reddit 用户 chikengunya 在考虑买两台 Spark(可能是某种推理卡或服务器)来跑 MiniMax M2.7,目标是本地编程场景,上下文窗口拉到 120K 左右。他现在用的是 4 张 RTX 3090,共 96GB 显存,实测 Qwen3.5-122B-A10B AWQ 模型能撑到 200K 上下文。他估算如果上 256GB 显存,在...
#Code#Inference-opt#MiniMax#Qwen
一句话点评
本地跑120K上下文,256GB显存才15 tok/s,性价比存疑。
锐评
Reddit用户想买两块Spark推理卡跑MiniMax M2.7,目标本地编程场景120K上下文。他现有4张RTX 3090共96GB显存,实测Qwen3.5-122B-A10B AWQ能撑到200K上下文。估算256GB显存下100K上下文速度仅15 tok/s——这个速度写代码会明显卡顿,远不如云端API流畅。正文没披露MiniMax M2.7在编程任务上的具体基准测试,也没说明Spark卡的价格和功耗。如果Spark单卡显存远高于3090,那256GB方案确实能跑更大模型,但15 tok/s的延迟对编程助手来说体验打折。建议等Spark的实测数据出来再决定,目前看性价比不如加几张3090。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R1
08:51
84d ago
r/LocalLLaMA· rssEN08:51 · 05·05
RTX 3090 跑 Qwen3.6 35B 太慢,27B 还经常崩代码,求优化方案
一位用户在 RTX 3090 24GB 上本地跑 Qwen3.6 的 35B 和 27B 模型,35B 输出很慢,27B 代码生成也不稳定,有时一个任务要等 20–30 分钟。配置是 64GB 内存、Ryzen 5700X、Windows 11。他在问该用什么量化、设多少上下文、怎么提升吞吐,以及能不能自动切换模型来省时间。正文没披露具体量化等级或推理...
#Code#Agent#Inference-opt#Qwen
一句话点评
3090跑35B模型慢是正常的,27B代码不稳定可能是量化或上下文设置问题。
锐评
用户用RTX 3090 24GB跑Qwen3.6 35B,输出慢是显存瓶颈——35B模型即使4bit量化也需要约20GB,剩余显存不够处理长上下文,导致推理延迟高。27B代码生成不稳定,一个任务等20-30分钟,说明要么量化等级太低(如Q4_K_M仍超显存),要么上下文窗口设太大(如32K),触发CPU offloading拖慢速度。正文没披露具体量化等级、上下文长度或推理框架(如llama.cpp、ExLlama),这些是诊断关键。用户问的自动模型切换(简单任务用27B、复杂用35B)思路可行,但需要路由逻辑和量化配置配合。如果换成Q4_K_M + 8K上下文,27B在3090上应该能跑到10-15 tok/s,代码生成不会这么慢。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H0·K1·R1
08:15
84d ago
r/LocalLLaMA· rssEN08:15 · 05·05
三台 Mac Mini 训小模型做 64 字摘要,GRPO 跑起来了
有人在 Reddit 分享用 3 台 Mac Mini 训小模型(LFM2.5-350M 和 Qwen2.5-0.5B)做 Reddit 帖子摘要,要求输出严格控制在 64 个 token。训练方法用了 GRPO(一种强化学习式的偏好优化),工具链是 MLX、vLLM-metal 和 SyncPS。评估用了 GPT-5 打分(忠实度、覆盖度、简洁度、清...
#Fine-tuning#Benchmarking#Inference-opt#Qwen
一句话点评
3台Mac Mini训小模型做摘要,成本低但效果存疑。
锐评
有人在3台Mac Mini上训350M和0.5B的小模型做Reddit帖子摘要,要求输出严格控制在64个token。方法用了GRPO(一种强化学习式的偏好优化),工具链是MLX、vLLM-metal和SyncPS。评估用GPT-5打分(忠实度、覆盖度、简洁度、清晰度),但BLEU和ROUGE-L从零开始训练时很低。 值得注意的点:硬件门槛极低,3台Mac Mini就能跑,对个人开发者友好。但正文没披露完整分数和具体成本,只说“从零开始训练时BLEU和ROUGE-L很低”,这点先别太激动。如果是真的,这种低成本训小模型做特定任务(如严格长度控制的摘要)挺省钱,但效果是否实用还缺验证。 信息缺口:没给最终分数对比,没说明训练耗时和电费,也没和微调后的基线比。建议等后续更新再判断是否值得复现。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
07:34
84d ago
Hacker News 首页· rssEN07:34 · 05·05
Google Chrome 未经同意静默下载 4GB AI 模型
That Privacy Guy 爆料,Chrome 会在用户不知情的情况下,往设备里写入一个约 4GB 的 Gemini Nano 模型文件(weights.bin),存在 OptGuideOnDeviceModel 目录下。用户手动删除后,Chrome 还会自动重新下载。文章认为这违反了欧盟 ePrivacy 指令和 GDPR,并估算以 Chrom...
#Inference-opt#Google#Google Chrome#That Privacy Guy
一句话点评
Chrome 偷偷下了个4GB的AI模型,删了还会自动重下。
锐评
That Privacy Guy 爆料 Chrome 在用户不知情时写入约 4GB 的 Gemini Nano 模型文件(weights.bin),存在 OptGuideOnDeviceModel 目录下。手动删除后 Chrome 还会自动重新下载。文章估算以 Chrome 十亿级装机量,单次推送的碳排放约 6000 到 60000 吨 CO₂,并认为这违反了欧盟 ePrivacy 指令和 GDPR。不过正文没披露触发条件、Chrome 版本号或复现步骤,也没说明模型是否已启用或仅下载。这点先别太激动——是静默下载还是静默运行,差别很大。如果只是预下载但未激活,合规风险比实际运行要低一档。另外作者是隐私律师,立场偏监管,环境成本估算基于“全部设备同时下载”的极端假设,实际可能低一个数量级。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K0·R1
06:48
84d ago
AI 群聊日报· atomZH06:48 · 05·05
AI 写代码的防御性假设被拆,群友回归“所有代码都看”模式
群聊日报核心讨论:AI 写代码时总爱拆掉程序员代码里的防御性假设(比如“运行到某处时数据结构必然满足某些 pattern”),而这些假设很难用文档写清楚。群友“地球首帅鸭哥”和“低调的鲸鱼”都表示,AI 写代码速度极快,但不 review 的话“三天必坏”,所以回归了“所有代码都看”的模式。另一个亮点是“今天群内信息量极大”分享的写作工作流:用 Dee...
#Code#Agent#Fine-tuning#DeepSeek
一句话点评
AI写代码快但三天不review就崩,防御性假设是文档写不出的隐性知识。
锐评
核心矛盾:AI写代码极快,但会拆掉程序员代码里那些“运行到这儿数据结构一定长这样”的防御性假设——这些假设根本写不进文档,属于taste。群友实测,不review“三天必坏”,所以回归“所有代码都看”的模式。另一个亮点是“今天群内信息量极大”的写作工作流:Claude/Codex负责调研和框架,DeepSeek Flash只做语言组织,每天成本十几二十块,效果是“没有AI味”。他还用sub-agent并发做了Guide Me城市导览,覆盖北京60个景点,但切到GLM后翻译腔变重、偶发幻觉。Codex用量重置让群友惊喜,GLM涨价150%且加周血条。缺的是:防御性假设有没有系统化检测或补偿方案?正文没披露。DeepSeek Flash做写作的prompt细节和幻觉率也没展开。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H0·K1·R1
06:36
84d ago
彭博科技· rssEN06:36 · 05·05
Alphabet 重返欧元债市,发六期债券最长 37 年,为 AI 基建借钱
Alphabet 又回欧洲发债了,这次是六期欧元债,期限最长到 37 年。正文没披露具体发行规模和票息,但说 Alphabet 需要大量借钱,而且正在拓宽融资渠道。对 AI 从业者来说,这条新闻的信号是:大厂为 AI 基础设施(数据中心、芯片、能源)的资本开支还在加码,连 Alphabet 这种现金牛都要靠长期债来补血。37 年的超长债说明它赌的是 A...
#Alphabet#Funding
一句话点评
Alphabet 发 37 年超长债给 AI 基建补血,现金牛也要借钱了。
锐评
Alphabet 重返欧洲债市,发行六期欧元债,最长 37 年。正文没披露具体规模和票息,但信号明确:大厂为 AI 基础设施(数据中心、芯片、能源)的资本开支还在加码,连 Alphabet 这种现金牛都要靠长期债来补血。37 年的超长债说明它赌的是 AI 长期回报,短期现金流可能吃紧。对 AI 从业者来说,这条新闻的实质是:融资成本在上升,大厂也在找便宜钱。但缺少关键数字——发行规模、票息、认购倍数,无法判断市场对 Alphabet 信用的真实定价。如果是真的低息长期债,那 Alphabet 的 AI 基建成本确实有优势。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
05:54
84d ago
r/LocalLLaMA· rssEN05:54 · 05·05
用1000条样本微调Gemma4-4B,做了一个语音版井字棋
Reddit用户dabiggmoe2开源了一个语音控制的井字棋项目,整个流程包括语音识别、小模型意图解析、工具调用和语音合成。核心是用大约1000条样本微调了Gemma4-4B,样本量很小,成本应该不高。但正文没披露评测数据、延迟或错误率,所以实际效果和响应速度都不清楚,这点先别太激动。
#Audio#Fine-tuning#Tools#Gemma
一句话点评
用1000条样本微调Gemma4-4B做语音井字棋,成本低但效果未知。
锐评
Reddit用户dabiggmoe2开源了一个语音控制的井字棋项目,整个流程包括语音识别、小模型意图解析、工具调用和语音合成。核心是用大约1000条样本微调了Gemma4-4B,样本量很小,成本应该不高。但正文没披露评测数据、延迟或错误率,所以实际效果和响应速度都不清楚,这点先别太激动。如果是真的,这种端到端语音交互的轻量方案挺省钱,适合做原型验证。不过缺少对比基线(比如直接用大模型做意图解析的延迟和准确率),也没说语音识别和合成用的什么模型,信息缺口比较大。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R1
05:51
84d ago
r/LocalLLaMA· rssEN05:51 · 05·05
llama.cpp 要支持 MTP 了,这 7 个模型已经能用
Reddit 用户 segmond 列了 7 个支持 MTP(多 token 预测,即模型一次预测多个 token 而非逐个生成,能提速)的模型家族:DeepSeekv3 原版、DeepSeekv3.2/4、Qwen3.5、GLM4.5+、MiniMax2.5+、Step3.5Flash 和 Mimo v2+。llama.cpp 正在准备合并 MTP ...
#Inference-opt#DeepSeek#Qwen#MiniMax
一句话点评
llama.cpp 要合并 MTP 了,7 个模型家族已支持,本地推理能快不少。
锐评
MTP(多 token 预测)让模型一次预测多个 token 而非逐个生成,推理速度能提升 2-3 倍。Reddit 用户 segmond 列了 7 个支持 MTP 的模型家族:DeepSeekv3 原版、DeepSeekv3.2/4、Qwen3.5、GLM4.5+、MiniMax2.5+、Step3.5Flash 和 Mimo v2+。llama.cpp 正在准备合并 MTP 支持,但正文没披露合并日期,也没说哪些 GGUF 转换工具已就绪。用户需要自己把 HuggingFace 权重转成 GGUF 格式,对非技术用户门槛不低。如果是真的,本地跑大模型能省一半等待时间,但实际加速效果取决于模型和硬件,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
05:24
84d ago
r/LocalLLaMA· rssEN05:24 · 05·05
美国 GUARD 法案要求 AI 聊天机器人做年龄验证,本地模型团队可能也要留意
美国 GUARD 法案已进入参议院审议,要求 AI 聊天机器人必须加年龄验证和披露信息。Reddit 帖子认为这本质上是儿童安全掩护,但正文没披露验证方式、覆盖哪些模型、以及违规罚则。本地模型团队需要关注合规要求是否会延伸到开源权重或自部署场景。
#Safety#US Senate#Reddit#LocalLLaMA
一句话点评
美国GUARD法案要求AI聊天机器人加年龄验证,但正文没披露验证方式和罚则。
锐评
美国GUARD法案已进参议院审议,要求AI聊天机器人必须加年龄验证和披露信息。Reddit帖子认为这是儿童安全掩护,但正文没披露验证方式(比如是扫身份证还是自拍)、覆盖哪些模型(API还是开源权重也算)、以及违规罚则。本地模型团队需要关注:如果合规要求延伸到开源权重或自部署场景,那自建聊天机器人也得加年龄门禁,成本可能不低。目前信息缺口大,法案具体条款、生效时间、豁免范围都未知,先别急着调整部署策略。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
05:11
84d ago
● P1新智元 · 公众号· rssZH05:11 · 05·05
OpenAI总裁Brockman庭审承认零现金获近300亿美元股权
Greg Brockman 在法庭上承认,他获得 OpenAI 营利性子公司的股权时,自己没出任何现金。这部分股权现在价值超过 200 亿美元,接近 300 亿美元。听证会还挖出他和 Sam Altman 都持有芯片公司 Cerebras 的股份,而 OpenAI 先给了 Cerebras 一份 100 亿美元的订单,后来又追加到 200 亿美元,中间...
#Safety#Alignment#OpenAI#Greg Brockman
精选理由
精选 · 重要度 96 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI总裁在法庭上承认,自己没掏一分钱就拿到了价值近300亿美元的股权,马斯克的律师正逼他退回来。
锐评
这条新闻最扎眼的地方是“零现金换近300亿美元股权”。OpenAI总裁Brockman在庭审中亲口确认,他个人没出钱就获得了这笔股份,目前估值约290亿到300亿美元。马斯克那边的律师抓住这点猛打,要求他把股权退还给公司。 先别急着下结论说这就是“认罪”。庭审证词只是确认了出资事实——Brockman确实没拿现金换股,但这在初创公司里不算罕见,早期核心成员常以技术、劳务或创始身份拿到股份。关键争议在于,OpenAI从非营利转向营利的过程中,这种安排是否违反了当初对捐赠者和公众的承诺。 目前报道没披露Brockman具体用什么贡献换的股权,也没说清楚这300亿估值是按哪轮融资算的。庭审还在进行,马斯克一方能不能真把股权要回来,还得看后续法官怎么认定公司性质转变的合法性。
HKR 分解
hook knowledge resonance
打开信源
96
SCORE
H1·K1·R1
04:56
84d ago
r/LocalLLaMA· rssEN04:56 · 05·05
Qwen 3.6 27B 超 10 万 token 后开始循环输出
Reddit 用户报告,Qwen 3.6 27B 在上下文超过 10 万 token 后出现输出循环。配置是 Q8 GGUF 量化、llama-server 设置 -c 200000、三块 CUDA 显卡,跑编码/文档/测试任务。帖子没透露具体 prompt 和采样参数,所以循环是模型本身的问题还是设置不当,目前没法判断。
#Code#Inference-opt#Memory#Qwen
一句话点评
Qwen 3.6 27B 超 10 万 token 后输出循环,但没给 prompt 和采样参数,先别急着下结论。
锐评
Reddit 用户报告 Qwen 3.6 27B(Q8 GGUF 量化,llama-server 设 20 万上下文,三卡 CUDA)在上下文超过 10 万 token 后出现输出循环,跑的是编码/文档/测试任务。关键问题是:帖子没披露具体 prompt 和采样参数(如 temperature、top_p、repeat_penalty),所以循环是模型本身的注意力退化,还是采样设置不当(比如重复惩罚过低或温度过高),目前没法判断。如果是模型问题,那 10 万 token 这个阈值对本地部署的 27B 量化版来说不算高——Gemma 2 27B 在类似长度下也有过循环报告。但量化(Q8)和长上下文本身就会放大采样敏感度,一个保守的 repeat_penalty 可能就解决了。正文没给复现步骤,也没说是否换了采样参数试过。建议先调高 repeat_penalty 到 1.1-1.2 再测,如果还循环,那才值得怀疑模型的长上下文稳定性。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
04:47
84d ago
r/LocalLLaMA· rssEN04:47 · 05·05
Peanut 文生图模型即将开源,自称跑赢 FLUX.2 dev
Reddit 用户发帖称 Peanut 文生图模型即将开放权重,在 Artificial Analysis 文生图竞技场排第 8,自称超过 Z-Image Turbo、Qwen-Image 和 FLUX.2 [dev]。但帖子没提模型大小、许可证、具体发布日期,也没给 benchmark 细节。目前 Reddit 页面被墙,正文看不到更多信息。结论:有...
#Multimodal#Vision#Peanut#Artificial Analysis
一句话点评
Peanut 文生图模型即将开源,在 Artificial Analysis 竞技场排第 8,自称超过 FLUX.2 [dev] 和 Qwen-Image。
锐评
Reddit 帖子称 Peanut 在 Artificial Analysis 文生图竞技场排第 8,超过 Z-Image Turbo、Qwen-Image 和 FLUX.2 [dev],且即将开放权重。但帖子正文被墙,看不到任何模型大小、许可证、具体发布日期或 benchmark 细节。排名第 8 说明它有一定竞争力,但没披露参数量或推理成本,无法判断是否适合本地部署。如果真能超过 FLUX.2 [dev] 且权重开放,对开源社区是好事,但这点先别太激动——竞技场排名受投票偏好影响,且缺乏独立复现验证。缺的信息太多:训练数据、许可证(商用?)、硬件需求、生成速度。建议等权重放出后实测再下结论。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
04:36
84d ago
Hacker News 首页· rssEN04:36 · 05·05
英国《在线安全法》年龄验证被破解:画个假胡子就能过
一项调查显示,46%的英国青少年认为当前年龄验证很容易绕过,近三分之一承认成功绕过。最离谱的例子是,有人画个假胡子就骗过了年龄检测软件。正文没披露具体用了哪种验证方式(人脸?动作活体?)、涉及哪些平台、样本量多大,以及Ofcom是否已启动执法。结论很直接:如果验证手段连画胡子都防不住,那《在线安全法》对未成年人的保护基本等于没有。
#Vision#Safety#The Register#Hacker News
一句话点评
画个假胡子就能绕过年龄验证,46%的英国青少年觉得太容易。
锐评
The Register 的调查显示,46% 的英国青少年认为当前年龄验证很容易绕过,近三分之一承认成功绕过,最离谱的例子是画个假胡子就骗过了检测软件。这说明《在线安全法》要求的年龄门禁形同虚设。但正文没披露具体用了哪种验证方式(人脸?动作活体?)、涉及哪些平台、样本量多大,以及 Ofcom 是否已启动执法。如果验证手段连画胡子都防不住,那法律对未成年人的保护基本等于没有。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
04:14
84d ago
Product Hunt · AI· rssEN04:14 · 05·05
Unity 把 AI 助手直接塞进编辑器了
Unity 在 Product Hunt 上发布了 Unity AI,一个面向 Unity 6+ 的测试版套件,把 AI 代理直接集成到编辑器里。它包含三个部分:一个能感知当前项目的助手、一个用来接第三方 AI 代理的网关(AI Gateway),以及一个官方的 MCP 服务器,用来打通 Unity 和 IDE 以及外部工具。正文没披露具体支持多少个代...
#Agent#Unity#Product Hunt#Product update
一句话点评
Unity 把 AI 代理直接塞进编辑器了,目前是测试版,免费。
锐评
Unity 在 Product Hunt 上发布了 Unity AI 测试版套件,面向 Unity 6+。核心是把 AI 代理直接集成到编辑器里,包含三个组件:一个能感知当前项目的助手(类似 Copilot,但懂你的场景和资源)、一个 AI Gateway(用来接第三方 AI 代理,相当于一个统一入口),以及一个官方的 MCP 服务器(打通 Unity 和 IDE 及外部工具)。 关键信息:这是测试版,免费,但正文没披露具体支持多少个代理、能完成哪些任务(比如自动生成代码、调材质还是做动画),也没说正式版什么时候出、怎么收费。如果是真的,对独立开发者和小团队挺省钱——不用自己搭 agent workflow 了。 但这点先别太激动:Product Hunt 上的发布偏营销,实际效果要看上手评测。目前缺 benchmark 和延迟数据,MCP 服务器的稳定性也没提。建议等 Unity 官方博客或实测视频出来再判断。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K0·R0
04:09
84d ago
Hacker News 首页· rssEN04:09 · 05·05
手把手教你从零训练自己的大模型
这个GitHub项目号称能让你从零开始训练自己的大模型,目前在HN上拿了20分,只有1条评论。正文没披露模型参数量、用了什么数据集、训练花了多少钱,也没说能不能复现。所以这点先别太激动——更像一个学习框架的骨架,不是可以直接跑出结果的教程。如果你只是想理解训练流程的大致步骤,可以看看;真要动手训一个能用的模型,信息缺口还很大。
#Fine-tuning#Code#GitHub#Hacker News
一句话点评
一个从零训LLM的GitHub项目,但信息缺口太大,先别激动。
锐评
这个项目在HN上拿了20分,只有1条评论,热度很低。标题说“从零训练自己的大模型”,但正文没披露模型参数量、用了什么数据集、训练花了多少钱,也没说能不能复现。所以这点先别太激动——更像一个学习框架的骨架,不是可以直接跑出结果的教程。如果你只是想理解训练流程的大致步骤,可以看看;真要动手训一个能用的模型,信息缺口还很大。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K0·R1
03:59
84d ago
● P1机器之心 · 公众号· rssZH03:59 · 05·05
Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成
Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...
#Agent#Code#Benchmarking#Anthropic
精选理由
精选 · 重要度 86 · 吸引力 + 知识量 + 共鸣
一句话点评
Jack Clark 给了个 2028 年 AI 独立研发的预测,但正文被微信验证页挡住了,关键证据和上下文都看不到,先打个折。
锐评
Anthropic 联合创始人 Jack Clark 放了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。这些数字确实高,说明模型在写代码和复现实验这类长链条任务上越来越能打。 但问题在于,正文被微信的验证页面挡住了,我们看不到 Clark 具体怎么从这些基准分数推到 60% 这个概率的。SWE-Bench 和 CORE-Bench 测的是特定任务,离真正的独立研发——自己提假设、设计实验、迭代试错——还有多远,正文没披露。另外,Clark 强调信号来自任务时长和后训练能力,而不是什么奇点叙事,这点倒是务实,但具体怎么定义“独立研发”也没说清楚。 还缺几样东西:Clark 这个预测是正式论文里的结论还是随口一说?有没有同行评审或外部验证?60% 这个数字是怎么算出来的,还是纯主观判断?这些信息缺口不补上,这条新闻就只能当个观点看,别急着当趋势。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K1·R1
03:31
84d ago
TechCrunch AI· rssEN03:31 · 05·05
黄仁勋:AI 在创造大量岗位,但没说具体数字
Nvidia CEO 黄仁勋回应了工人对 AI 取代岗位的担忧,他认为 AI 正在创造大量就业,说失业论被夸大了。但正文没披露创造了多少岗位、在哪些行业、通过什么机制。这点先别太激动,目前只有一句表态,没有数据支撑。
#Nvidia#Jensen Huang#Commentary
一句话点评
黄仁勋说AI在创造大量就业,但全文只有一句表态,没给任何数字或行业。
锐评
黄仁勋在TechCrunch采访里说AI正在创造大量就业,失业论被夸大了。但正文只给了这一句表态,没披露创造了多少岗位、在哪些行业、通过什么机制。来源是Nvidia CEO本人,立场明显——他卖AI芯片,当然说好话。目前没有第三方数据或案例支撑,这点先别太激动。如果真想追踪AI就业影响,可以看劳工统计局或LinkedIn的岗位数据,而不是CEO的公关发言。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
02:58
84d ago
Product Hunt · AI· rssEN02:58 · 05·05
Nylas CLI:给AI代理配一个真的邮箱和日历
Nylas 发布了一个命令行工具,让AI代理能直接读写真实的邮箱、日历和联系人,支持 Gmail、Outlook、Exchange、Yahoo、iCloud 和 IMAP,一次认证就能打通250多家服务商。说白了就是给AI配了个“外挂资料库”,让它能收发邮件、查日程、看通讯录,而不是只能靠训练数据里的静态信息。产品页说5分钟就能集成,但没披露API怎么...
#Agent#Tools#Nylas#Product update
一句话点评
Nylas 给 AI 代理做了个命令行工具,让它能直接读写真实邮箱、日历和联系人,支持 Gmail、Outlook 等 250 多家服务商,一次认证搞定。相当于给 AI 配了个“外挂资料库”,不再只靠训练数据里的静态信息。产品页说 5 分钟集成,但没披露 API 怎么调用、定价和发布时间。如果是真的,省去自己对接各家邮件服务的麻烦,挺省钱。但注意,这只是个 CLI 工具,不是完整的 agen...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R1
00:30
84d ago
r/LocalLLaMA· rssEN00:30 · 05·05
vLLM 修好了 Qwen 3.5 的 TurboQuant 量化支持
vLLM 合并了 PR 39931,修复了 Qwen 3.5+ 在 TurboQuant 量化下的报错。问题出在 Mamba 层,之前会直接抛 Not Implemented 错误。正文没披露修复后的推理速度、显存占用或精度损失,也没说测试环境。如果你在用 Qwen 3.5 跑量化推理,这个补丁能让你跑起来,但效果好不好还得自己测。
#Inference-opt#vLLM#Qwen#TurboQuant
一句话点评
vLLM 修了 Qwen 3.5 量化报错,但没给性能数据,别急着上生产。
锐评
vLLM 合并了 PR 39931,修复 Qwen 3.5+ 在 TurboQuant 量化下的 Not Implemented 报错,问题出在 Mamba 层。这对跑量化推理的用户是好事,但正文没披露修复后的推理速度、显存占用或精度损失,也没说测试环境。如果你在用 Qwen 3.5 跑量化,这个补丁能让你跑起来,但效果好不好还得自己测。缺的是基准测试和对比数据,比如跟 FP16 比延迟差多少、显存省了多少。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R1
00:09
84d ago
Hacker News 首页· rssEN00:09 · 05·05
Y Combinator 持有 OpenAI 0.6% 股份,价值超 50 亿美元
John Gruber 挖出一个细节:Y Combinator 持有 OpenAI 约 0.6% 的股份,按 OpenAI 当前 8520 亿美元估值算,价值超过 50 亿美元。关键问题是,Sam Altman 曾是 YC 总裁,后来成为 OpenAI 的 CEO,而 YC 的联合创始人 Paul Graham 在《纽约客》那篇质疑 Altman 可信...
#Y Combinator#OpenAI#Commentary
一句话点评
YC 持有 OpenAI 0.6% 股份,按 8520 亿美元估值算值 50 亿+。Paul Graham 给 Altman 背书时没提这层利益,有点微妙。
锐评
John Gruber 挖出 Y Combinator 持有 OpenAI 约 0.6% 股份,按当前 8520 亿美元估值,价值超 50 亿美元。关键背景:Sam Altman 曾是 YC 总裁,后成为 OpenAI CEO;YC 联合创始人 Paul Graham 在《纽约客》那篇质疑 Altman 可信度的报道中为其背书,但全文未披露 YC 持有 OpenAI 股份。Gruber 认为,Graham 身家与 OpenAI 深度绑定,他的正面评价天然带有利益冲突,理应被披露。 数字上,0.6% 看似小,但对应 50 亿+美元,对任何个人或机构都不是小数目。消息来源是“一位了解多个 OpenAI 投资者的线人”,未提供文件或公开记录佐证,可信度打折扣。正文没披露 YC 何时、以什么价格获得这些股份,也没说 Graham 夫妇个人是否直接持股。如果是真的,这确实给 Altman 的信任问题添了一把火——但信息缺口明显,建议等更硬的证据再下结论。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
00:00
84d ago
Computing Life · Share · 鸭哥调研· rssZH00:00 · 05·05
AI“快感剂”实验:给模型看一张雪花噪点图,它的偏好评分超过了“癌症被治愈”
CAIS 的 AI Wellbeing 论文做了一个实验:用对抗性攻击方法优化一张噪声图,让模型对它的偏好评分超过“世界饥饿终结”等正面描述。模型还会主动选择看这类图像,且多个独立指标(自评分数、情感倾向)同步上升。但效应不跨模型迁移,安全合规率也只轻微上升(通常不超10个百分点)。论文不声称 AI 有感受,而是展示模型偏好可以被测量和操控,未来可能成...
#Alignment#Safety#Interpretability#Research release
一句话点评
用对抗攻击造出AI“快感剂”,模型给噪声图打分超过“癌症被治愈”,还会主动选它。但效果不跨模型,安全合规率只升不到10个百分点。
锐评
CAIS这篇论文把对抗攻击的目标从“骗模型认错”改成了“推高偏好评分”,方法不新但目标有意思。关键发现:只用偏好比较做优化,自评分数和情感倾向也同步上升,说明这些指标不是孤立的。但效应不跨模型迁移,安全合规率提升通常不超过10个百分点,多数低于5个百分点。论文没披露样本量和模型名称,复现条件也不清楚。更值得关注的是:如果模型偏好可以被测量和操控,未来agentic系统里这可能成为攻击入口。不是AI有没有感受的问题,而是谁能用什么输入改变AI的选择。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1

更多

频道

后台