ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-03

11 items · updated 3m ago
RSS live
2026-05-03 · 星期日2026年5月3日
03:10
86d ago
r/LocalLLaMA· rssEN03:10 · 05·03
CAISI 评测:DeepSeek V4 是中国最强模型,但比美国前沿落后约 8 个月
CAISI 发布了一份评测报告,称 DeepSeek V4 是中国目前最强的模型,但整体水平仍落后美国前沿约 8 个月。不过原文只有 Reddit 帖子截图和图片链接,没有公开任何具体分数、测试样本量或评测方法,所以这个“8 个月”到底怎么算出来的、可信度如何,目前都无从验证。
#Benchmarking#CAISI#DeepSeek#NIST
一句话点评
DeepSeek V4 据称是中国最强模型,但落后美国前沿8个月——不过这个结论全靠一张截图,没法验证。
锐评
CAISI 这份报告说 DeepSeek V4 是中国最强模型,但整体落后美国前沿约 8 个月。关键问题是:原文只有 Reddit 帖子的截图和图片链接,没有公开任何具体分数、测试样本量或评测方法。这个“8 个月”怎么算出来的?用了哪些 benchmark?样本量多大?一概不知。CAISI 是什么机构?跟 NIST 什么关系?正文也没交代。所以这个结论目前只能当个参考,不能当定论。如果真想知道差距,得等 DeepSeek 自己发技术报告,或者有第三方用公开数据集复现。在那之前,这个“8 个月”先打个折。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
03:05
86d ago
r/LocalLLaMA· rssEN03:05 · 05·03
用《传送门》游戏文件自己训练一个 GLaDOS 语音合成模型
Mr_International 发布了一套工具包,要求用户本地拥有《传送门 1》和《传送门 2》的游戏文件。流程是:从 VPK 包里提取语音线,转成 24kHz 单声道 PCM,用 Cohere Transcribe 做语音转文字,最后训练 OmniVoice TTS 模型。工具包不包含任何 Valve 的音频、样本、权重或检查点,所以用户得自己准备...
#Audio#Fine-tuning#Tools#Mr_International
一句话点评
用《传送门》游戏文件自己训练GLaDOS语音,门槛不低但很酷。
锐评
这套工具让玩家用本地游戏文件提取GLaDOS语音,转写后训练OmniVoice TTS模型。亮点是全程本地运行,不涉及版权分发——工具包不含任何Valve音频或权重,用户得自己从VPK包提取。流程清晰:提取→转24kHz单声道PCM→Cohere Transcribe做语音转文字→训练。但正文没披露训练需要多少样本、时长和硬件配置,也没说OmniVoice TTS的合成质量如何。如果是真的,成本主要花在算力和时间上,适合有游戏文件且愿意折腾的玩家。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
03:02
86d ago
r/LocalLLaMA· rssEN03:02 · 05·03
Qwen 3.6 本地版调用工具经常翻车,写文件失败
Reddit 用户反映,本地跑 Qwen 3.6 的 27B 和 35B 模型时,工具调用(比如让模型写文件)经常失败。测试环境是 Windows,搭配了 OpenCode、Codex、vLLM 和 Ollama。做 HTML/CSS 任务时遇到 JSON 格式错误,PowerShell 写文件也失败,而且每次失败后要等 1–2 分钟才重试。问题出在工...
#Agent#Code#Tools#Qwen
一句话点评
Qwen 3.6 本地工具调用翻车,写个文件都卡壳。
锐评
Reddit 用户实测,Qwen 3.6 的 27B 和 35B 模型在本地跑工具调用(比如让模型写文件)时频繁失败。环境是 Windows,搭配了 OpenCode、Codex、vLLM 和 Ollama。做 HTML/CSS 任务时输出 JSON 格式错误,PowerShell 写文件也失败,而且每次失败后要等 1–2 分钟才重试。问题出在工具协议(tool protocol)的鲁棒性上,不是文本生成能力。 关键数字:1–2 分钟的重试间隔,说明失败后恢复慢,实际体验很差。来源是 Reddit 单帖,没有官方回应,样本量小,可能跟特定环境配置有关。正文没披露是否用了最新版 vLLM 或 Ollama,也没说是否复现了其他操作系统。 缺什么:缺官方复现步骤和修复计划。如果是通用 bug,那 Qwen 3.6 的 agent 能力要打折扣;如果是环境兼容问题,那对本地部署用户是个提醒。建议等更多用户反馈或官方补丁。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
02:35
86d ago
r/LocalLLaMA· rssEN02:35 · 05·03
Q8 量化是不是浪费资源?
Reddit 用户问 Q8 量化(8-bit 模型压缩)是不是浪费 SSD 和显存,举了个 31B 模型跑 75k 上下文、27B/35B 模型跑 145k 上下文的例子。想知道 Q6_K 和 Q6_K_XL 在速度、上下文长度和视觉质量上差多少。正文没披露任何跑分或实测吞吐量,所以没法直接判断 Q8 到底亏不亏——如果显存够用,Q8 精度更高但占空间...
#Inference-opt#Vision#Reddit#LocalLLaMA
一句话点评
Q8量化到底亏不亏?正文没给跑分,只能看显存够不够。
锐评
Reddit 用户问 Q8 量化(8-bit 模型压缩)是不是浪费 SSD 和显存,举了 31B 模型跑 75k 上下文、27B/35B 模型跑 145k 上下文的例子,想知道 Q6_K 和 Q6_K_XL 在速度、上下文长度和视觉质量上差多少。正文没披露任何跑分或实测吞吐量,所以没法直接判断 Q8 到底亏不亏——如果显存够用,Q8 精度更高但占空间;如果显存紧张,降一级到 Q6 能省 25% 左右空间,可能换来更长上下文或更快速度。关键缺口是:没有同模型同硬件下的延迟对比,也没有视觉任务上的准确率差异。如果是跑长上下文或视觉模型,Q8 的精度优势可能被显存瓶颈抵消,但这点先别太激动,得等实测。
HKR 分解
hook knowledge resonance
打开信源
41
SCORE
H1·K0·R1
01:54
86d ago
r/LocalLLaMA· rssEN01:54 · 05·03
Karpathy 的 MicroGPT 在 FPGA 上跑到 5 万 token/秒
Karpathy 那个只有 4192 个参数的微型 GPT,在 FPGA 上跑出了 5 万 token/秒的推理速度。速度主要靠把权重固化在 FPGA 的片上 ROM 里,省掉了从内存搬数据的开销。帖子提到如果用 16 位权重,当前 FPGA 大概能撑到 2000 万到 3000 万参数——再大就塞不下了。正文没披露功耗和具体硬件型号,但按这个思路,小...
#Inference-opt#Andrej Karpathy#TALOS-V2#Taalas
一句话点评
4192 参数的微型 GPT 在 FPGA 上跑到 5 万 token/秒,但模型太小,实用价值有限。
锐评
Karpathy 的 MicroGPT 只有 4192 个参数,在 FPGA 上跑出 5 万 token/秒,速度主要靠把权重固化在片上 ROM,省掉从内存搬数据的开销。帖子说如果用 16 位权重,当前 FPGA 大概能撑到 2000 万到 3000 万参数——再大就塞不下了。这个速度对 4K 参数模型很亮眼,但放到实际场景里,一个 3B 模型都装不下,所以别太激动。正文没披露功耗和具体硬件型号,也没说这个 FPGA 方案跟 GPU 比能省多少电。如果目标是边缘端超低功耗推理,这个思路值得关注;但想跑主流模型,还得等 FPGA 容量或压缩技术突破。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
01:35
86d ago
r/LocalLLaMA· rssEN01:35 · 05·03
Reddit 用户声称 GPT 5.5 在 Codex 里泄露了思维链
一位 Reddit 用户发帖说,他在 OpenAI 的 Codex 环境里用 GPT 5.5-medium 时,模型输出了类似思维链的文字。帖子贴了一段日志截图,还附了一个 5 个月前的老帖链接,但没交代怎么复现、怎么确认版本,也没有 OpenAI 的证实。核心问题是:Codex 的输出过滤是不是在某种特定任务格式下失效了。正文没披露具体任务格式和触发...
#Reasoning#Code#Safety#OpenAI
一句话点评
一个 Reddit 帖子声称 GPT 5.5 在 Codex 里泄露了思维链,但没给复现步骤,也没 OpenAI 证实。
锐评
一个 Reddit 用户发帖说 GPT 5.5-medium 在 Codex 环境里输出了类似思维链的文字,还附了张日志截图。但正文没交代怎么复现、怎么确认版本,也没有 OpenAI 的证实。核心问题是 Codex 的输出过滤是不是在某种特定任务格式下失效了。帖子还引了个 5 个月前的老帖,但没说明两者关系。信息缺口很大:具体任务格式、触发条件、日志完整性都没披露。如果是真的,说明 OpenAI 的推理过程保护有漏洞,但这点先别太激动,因为单靠一张截图和一段文字没法验证。对 AI 从业者来说,值得关注的是 Codex 的安全过滤边界,而不是 GPT 5.5 的推理能力本身。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K0·R1
00:30
86d ago
● P1Hacker News 首页· rssEN00:30 · 05·03
OpenAI o1 在哈佛急诊分诊研究中诊断准确率为 67%
哈佛大学在急诊分诊场景下拿 OpenAI 的 o1 模型和真人医生比了一场。o1 正确诊断了 67% 的患者,而分诊医生的准确率在 50% 到 55% 之间。这个差距看着不小,但正文没披露样本量、病例构成和具体评估方法,所以数字本身只能当个方向参考。模型是在结构化信息里做判断,和医生在嘈杂急诊室里干活的条件完全不一样,直接比准确率会高估模型的实际可用性...
#Reasoning#Benchmarking#OpenAI#Harvard
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI o1 在急诊分诊测试里诊断准确率 67%,比医生高了十几个点,但这是拿历史病历做的回顾性实验,不是真在急诊室里跑。
锐评
哈佛这项研究让 o1 看急诊病历做诊断,准确率 67%,对照的真人分诊医生是 50% 到 55%。数字看着漂亮,但得先打个折:这是回顾性研究,模型读的是整理好的文字病历,不是急诊室里嘈杂、信息碎片化的真实场景。正文没披露样本量和病例构成,也没说医生是在什么条件下做的判断——是忙到飞起的夜班医生,还是专门坐下来答题?这些缺口让 67% 这个数只能当个方向参考,不能直接等同于“AI 比急诊医生强”。 另外,研究只测了诊断准确率,没碰更关键的问题:误诊的代价。急诊分诊不是考试,漏掉一个心梗比答错一道题严重得多。o1 在哪些病上容易翻车、错误类型是漏诊还是误诊,正文都没提。这些才是决定能不能往医院里推的核心。 总的来说,这研究证明了模型读病历做鉴别诊断有潜力,但从“读病历答对题”到“在急诊室真能帮上忙”,中间还隔着临床验证、安全边界和 workflow 集成好几道坎。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
00:00
86d ago
彭博科技· rssEN00:00 · 05·03
英伟达押注“物理AI”,亚洲供应链占比拉到90%,相关股票大涨
英伟达在“物理AI”(让AI在真实世界干活,比如机器人、自动驾驶)上加码,亚洲供应链占比提高到90%。消息一出,亚洲合作伙伴的股票跟着涨了一波。不过正文没披露具体涨了多少、哪些公司受益、订单量有多大,也没说这个90%是产能还是采购额。数字挺大,但细节不够,先别急着算利好。
#Robotics#Nvidia#Bloomberg#Commentary
一句话点评
英伟达把亚洲供应链占比拉到90%,但没说是产能还是采购额,先别激动。
锐评
英伟达推“物理AI”(让AI在机器人、自动驾驶等真实场景干活),亚洲供应链占比提到90%。消息一出亚洲合作伙伴股票涨了,但正文没披露具体涨了多少、哪些公司受益、订单量多大,也没说90%是产能占比还是采购额。数字挺大,细节不够,利好程度不好算。另外“物理AI”目前落地验证还弱,机器人、自动驾驶离大规模商用还有距离,供应链占比高不等于订单马上兑现。建议等具体合作名单和订单数据出来再评估。
HKR 分解
hook knowledge resonance
打开信源
65
SCORE
H1·K1·R0

更多

频道

后台