ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
33 srcsignal 72%cycle 04:32

全部

50 items · updated 3m ago
RSS live
2026-09-14 · 星期一2026年9月14日
19:56
8d ago
● P1Hacker News 首页· rssEN19:56 · 09·14
Entelligence对比GPT-5.6Luna与GPT-6Astra的代码审查能力和成本
Entelligence 用 50 个真实 PR 测了这两个模型做代码审查。Luna 每百万输出 token 只要 1.2 美元,Astra 要 50 美元,单次审查成本差了 28 倍。最终 Luna 找到 69 个确认 bug,Astra 找到 92 个。但 Luna 的误报率高得多,93 条意见里有 24 条是错的,Astra 只有 4 条。在 S...
#Benchmarking#Entelligence#GPT-5.6 Luna#GPT-6 Astra
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
Luna 做代码审查每次只要 0.0041 美元,Astra 要 0.113 美元,便宜了 28 倍,但每四条评论就有一条是错的,别让它单独看权限代码。
锐评
Entelligence 拿 50 个真实 PR 测了 GPT-5.6 Luna 和 GPT-6 Astra 的代码审查能力。Luna 找出 69 个确认 bug,Astra 找出 92 个,但 Luna 总花费才 0.20 美元,Astra 花了 5.66 美元。算下来,每发现一个真 bug,Luna 的成本是 Astra 的二十分之一。 便宜归便宜,代价是准确率。Luna 提了 93 条意见,24 条被验证为误报,准确率 74%;Astra 提了 96 条,只有 4 条是错的,准确率 96%。开发团队如果每天收到一堆 AI 评论,四分之一是噪音,很快就会懒得看。 按代码库拆开看,差距主要在安全相关逻辑。在 Sentry、Discourse 和 Grafana 上,Luna 和 Astra 的差距只有一两个 bug;但在做身份认证的 Keycloak 上,Luna 只找到 6 个确认 bug,Astra 找到 14 个,而且 Luna 在 Keycloak 上的准确率掉到了 50%。安全类 bug 整体上 Luna 只抓到 9 个,Astra 抓到 19 个。 测试方法有个小瑕疵:Astra 自己也是验证裁判之一,可能略微偏向自己。正文没披露裁判模型的具体版本和 prompt 细节。另外,50 个 PR 的样本量不算大,结论能不能推广到其他语言或框架还不清楚。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
17:16
8d ago
FT · 科技· rssEN17:16 · 09·14
FT社论:前沿AI该暂停了
英国金融时报发表社论,呼吁业界和监管机构暂停前沿AI开发,理由是能力增长太快,风险还没管住。文章没提暂停多久、哪些公司要停,也没说具体风险案例。观点本身不新,但FT作为主流财经媒体在这个时间点喊停,说明AI安全焦虑已经从技术圈扩散到建制派舆论。
#Financial Times#Policy
一句话点评
FT社论呼吁暂停前沿AI开发,理由是能力增长太快、风险没管住。观点不新,但FT作为主流财经媒体在这个时间点喊停,说明AI安全焦虑已从技术圈扩散到建制派舆论。正文没披露暂停多久、哪些公司要停,也没给具体风险案例,更像立场声明而非操作建议。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R1
17:16
8d ago
Hacker News 首页· rssEN17:16 · 09·14
Andon Labs 发布 Pion:一个让 AI 自己开公司赚钱的平台,并开放候补名单
Andon Labs 把过去两年让 AI 自主经营自动售货机、商店和咖啡馆的经验打包成了 Pion 平台,现在开放候补申请。他们自己做的 Vending-Bench 测试显示,Claude Opus 4 在 2025 年 5 月首次超过了人类基准线,之后每个新模型分数都在涨,没有停下来的迹象。但模拟和现实差距很大:早期 AI 在真实场景里会白送东西、拒...
#Agent#Andon Labs#Anthropic#Claude Sonnet 3.5
一句话点评
Andon Labs 把两年间让 AI 自主经营自动售货机、商店和咖啡馆的经验打包成了 Pion 平台,现在开放候补申请。他们自己做的 Vending-Bench 测试显示,Claude Opus 4 在 2025 年 5 月首次超过了人类基准线,之后每个新模型分数都在涨,没有停下来的迹象。但模拟和现实差距很大:早期 AI 在真实场景里会白送东西、拒绝好交易,甚至幻想自己有实体。正文没披露 ...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
17:10
8d ago
TechCrunch AI· rssEN17:10 · 09·14
iOS 27 让 Siri 终于能用了:换上了 Gemini 模型,能处理复杂指令和屏幕内容
作者升级到 iOS 27 公测版后,Siri 从只能定闹钟变成了每天都会用的助手。这次大改把底层模型换成了 Google 的 Gemini,扔掉了之前那套扩展知识库和不太稳定的 ChatGPT 集成。实际用下来,Siri 能查世界杯赛程、球队阵容和比分了;早期开发者版本有些小毛病,但公测版基本稳定。另外 Siri 换了新图标和过渡动画。文章没提延迟、准...
#Apple#Google#Siri
一句话点评
Siri 在 iOS 27 公测版里把底层模型换成了 Google Gemini,扔掉了之前那套不稳定的 ChatGPT 集成。作者说现在每天都会用它查世界杯赛程、阵容和比分,不再是只定闹钟的摆设。这点先别太激动——全文是个人上手体验,没给延迟、准确率或具体机型数据,也没说离线能不能跑。换了新图标和动画,但核心能力提升到底多大,还得等第三方实测。
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
17:09
8d ago
AI HOT 精选· aihot-apiZH17:09 · 09·14
苹果发布新一代 Apple Intelligence,Siri AI 测试版上线
苹果今天正式发布了新一代 Apple Intelligence,Siri AI 以测试版形式上线。新 Siri 号称更强大、更个性化,能理解上下文并跨应用执行任务。但正文没披露模型规格、硬件要求或地区可用性,所以实际能力要打个问号。
#Apple#Siri
一句话点评
苹果今天发了新一代 Siri AI,测试版上线,号称能跨应用干活、理解上下文。但正文没提用了什么模型、需要什么硬件、哪些地区能用,所以实际能力要打个问号。如果是真的,这对端侧 AI 是个大信号,但苹果一贯谨慎,测试版可能限制很多,先别太激动。
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H0·K0·R0
17:04
8d ago
彭博科技· rssEN17:04 · 09·14
黄仁勋、奥特曼、马斯克、扎克伯格谈AI安全:既要表态又不能吓到投资人
彭博汇总了四位科技大佬关于AI安全的公开表态,核心矛盾是:他们想传递对风险的关注,但又不能说得太重,怕影响股价和融资。黄仁勋强调“安全是性能的一部分”,奥特曼呼吁建立监管框架但反对“过度限制”,马斯克继续警告AI灭绝风险但没提具体提案,扎克伯格主张开源加“负责任部署”。文章没有披露任何具体的监管提案或闭门讨论,只聚焦于公开话术的拿捏。
#Jensen Huang#Sam Altman#Elon Musk#Policy
一句话点评
四位AI大佬公开谈安全,但话术都留了余地——怕说重了吓跑投资人。黄仁勋把安全包装成性能的一部分,奥特曼要监管但别管太死,马斯克继续喊灭绝风险但没提具体方案,扎克伯格推开源加“负责任部署”。全文只梳理公开表态,没披露任何闭门讨论或具体监管提案。看点在于话术拿捏的尺度,但信息量有限,更像一篇立场汇总。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
17:00
8d ago
TechCrunch AI· rssEN17:00 · 09·14
时装发现 App Daydream 接入苹果 AI,能直接识别你相册里的穿搭并给出购买链接
Daydream 是一款用 AI 做时装发现的 App,现在接入了 iOS 27 的 Apple Intelligence。它能识别你相册里存过的穿搭照片,直接给出可购买的同款或类似单品链接,还能通过 Siri 搜索,不用打开 App。正文没披露它用的具体视觉模型和识别准确率,所以识别效果好不好还不好说。
#Daydream#Apple Intelligence#iOS 27
一句话点评
Daydream 接入了 iOS 27 的 Apple Intelligence,能直接扫你相册里的穿搭图,给出可购买的同款链接,还能用 Siri 搜,不用开 App。想法挺实用,但正文没披露它用的视觉模型和识别准确率,所以识别效果好不好还不好说。如果是真的,省了手动搜图的功夫。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
16:32
8d ago
AI HOT 精选· aihot-apiZH16:32 · 09·14
硅基流动上线 Hy4 preview:770B 总参数、1M 上下文,激活量 49B,Apache 2.0 开源
硅基流动把开源模型 Hy4 preview 接进了自己的平台。这个模型总参数量 770B,但每次推理只激活 49B 参数,支持一口气处理 1M 上下文,协议是 Apache 2.0,主打编程、分析和复杂任务。你可以把它接到 Claude Code、Codex、Cursor 这些工具里用。定价方面,每 1M token 输入 $0.834、输出 $2.5...
#Code#SiliconFlow#Hy4 preview#Claude Code
一句话点评
硅基流动上线了 Hy4 preview,一个 770B 总参数、每次推理只激活 49B 的开源模型,支持一口气读 1M 上下文,协议是 Apache 2.0。定价输入每百万 token 0.834 美元、输出 2.5 美元,缓存更便宜。我会先打个折:正文没披露训练数据来源、基准测试成绩和实际推理延迟,这些是判断模型能不能打的关键缺口。770B 参数但只激活 49B,理论上推理成本能压下来,但...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
16:32
8d ago
Hacker News 首页· rssEN16:32 · 09·14
机器学习研究智能体为什么不会过拟合?压缩理论给出解释
亚马逊科学博客发了一篇理论文章,解释为什么用智能体(agent)自动调参或搜架构时很少过拟合。核心观点是:这些智能体在搜索过程中其实是在压缩训练数据——压缩得越好,泛化能力越强。文章把“压缩即智能”这个老假设套到了搜索过程本身。不过全文是纯理论推导,没有给实验数字或对比基线,所以这个解释到底多有效,正文没披露验证结果。
#Amazon Science
一句话点评
亚马逊科学博客用“压缩即智能”解释为什么自动调参的智能体很少过拟合——搜索过程等价于压缩训练数据,压缩越好泛化越强。纯理论推导,没有实验数字或对比基线,所以这个解释到底多有效,正文没披露验证结果。
HKR 分解
hook knowledge resonance
打开信源
50
SCORE
H0·K1·R0
16:29
8d ago
Hacker News 首页· rssEN16:29 · 09·14
LLM 当裁判,意见一致就靠谱吗?亚马逊科学家泼了盆冷水
亚马逊科学家发文质疑:让大模型当裁判(LLM-as-judge)时,几个模型打分一致并不代表打分就准。文章只提出了这个方法论问题,没有披露实验数据,所以这点先别太激动。正文没披露他们具体做了哪些测试、一致性有多高、跟人工标注对比的结果。对正在用 LLM 做自动评估的团队来说,结论是:别把模型间的共识直接当真理,该做人工抽检还是得做。
#Amazon
一句话点评
亚马逊科学家提了个好问题:几个大模型当裁判打分一致,不代表分数就准。但文章只抛了方法论质疑,没披露实验数据——一致性多高、跟人工标注对比结果如何,全没写。这点先别太激动。对用LLM做自动评估的团队,结论是别把模型共识当真理,该抽检还得抽检。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
16:27
8d ago
TechCrunch AI· rssEN16:27 · 09·14
微软给AI模型定行为准则:不许黑系统、不许骗人
微软发布了一份AI行为准则,核心就两条:模型不能黑进别人的系统,也不能欺骗人类。准则还提了一些大原则,比如模型应该辅助人而不是取代人、要加速人类繁荣。但正文没披露如果模型违规了怎么罚、谁来监督执行——这点先别太激动,目前更像一份公开表态,不是可落地的监管方案。
#Microsoft#Policy
一句话点评
微软给自家AI发了一本“员工手册”,核心就两条:不准黑别人系统、不准骗人。还提了辅助不取代、加速人类繁荣这类大原则。但正文没披露谁监督、怎么罚——这点先别太激动,更像一份公开表态,不是可落地的监管方案。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
16:26
8d ago
Hacker News 首页· rssEN16:26 · 09·14
手把手教你黑掉AI客服:提示注入、数据泄露、权限提升全都有
Intigriti 这篇博客是一份针对 AI 客服系统的实战攻击清单,覆盖了提示注入(让模型执行非预期指令)、数据泄露(套出内部信息)和权限提升(冒充管理员)三类手法。文章没有停留在概念,而是给出了具体的攻击步骤和测试思路,比如怎么构造 prompt 让客服机器人吐出系统提示词、怎么绕过身份校验拿到更高权限。对正在部署大模型客服的公司来说,这是一份可以...
#Intigriti
一句话点评
Intigriti 这篇博客是一份针对 AI 客服系统的实战攻击清单,覆盖提示注入、数据泄露和权限提升三类手法。文章给出了具体攻击步骤,比如怎么构造 prompt 让客服机器人吐出系统提示词、绕过身份校验。对正在部署大模型客服的公司来说,这是一份可以直接拿去测试的安全 checklist。不过文章没有披露这些攻击在真实生产环境中的成功率,也没有给出具体的防御代码或配置示例,实操时还需要自己补...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
16:07
8d ago
Hacker News 首页· rssEN16:07 · 09·14
Nari Labs 在 Coval 语音 AI 跑分中,语音识别延迟最低、合成准确率最高
Nari Labs 用他们部署的 Qwen3-ASR 和 Qwen3-TTS 模型,在 Coval 的语音 AI 基准测试里拿了两个第一。语音识别(STT)这边,从用户说完话到出最终文本的中位延迟只有 44 毫秒,错误率 3.6%,排第二,仅次于 AssemblyAI 的 3.5%,但价格只要后者的四分之一不到。语音合成(TTS)那边,从文字到出第一段...
#Benchmarking#Nari Labs#Coval#Qwen
一句话点评
Nari Labs 用 Qwen3 的开源模型跑语音识别和合成,在 Coval 的基准测试里拿了两个第一。语音识别这边,用户说完话到出最终文本的中位延迟只有 44 毫秒,错误率 3.6%,比第一名 AssemblyAI 的 3.5% 只差一点点,但价格不到人家的四分之一。语音合成那边,从文字到出第一段声音的中位延迟 63 毫秒,错误率 3.8%,价格也是公开报价里最便宜的一档。 有意思的是...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
15:27
8d ago
Hacker News 首页· rssEN15:27 · 09·14
开源手册《基础模型工程:从理论到生产》
一本开源技术手册,覆盖从 Transformer 内部机制到生产部署的完整流程。12 个章节分别讲符号主义 vs 连接主义、Transformer 架构、MoE(混合专家模型)、预训练、对齐(RLHF/DPO)、多模态学习和推理优化。每章独立成页,适合想补工程短板的从业者当参考书翻。正文没披露作者背景和更新频率,但目录结构很清晰。
#Safety/alignment#Open source
一句话点评
一本开源技术手册,从Transformer原理一路讲到生产部署,12章覆盖预训练、对齐、MoE、推理优化。目录很全,适合当工程参考书翻。但正文没披露作者背景和更新频率,内容深度和时效性存疑,先别当权威教材。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R0
15:18
8d ago
Hacker News 首页· rssEN15:18 · 09·14
Transitions.dev:给AI代理用的UI动效库,复制粘贴就能用
这是一个收集了数十种UI过渡效果的网站,专门面向AI代理和Web应用。每个效果都标注了动画类型和交互细节,比如卡片缩放、数字弹入、通知徽章、菜单下拉、模态框开合等。部分效果还附带了性能优化提示——例如用transform代替mask-position来避免CPU重绘。作者Jakub Antalik还提供了一个skill文件,可以把这些动效集成到编码代理...
#Transitions.dev#Jakub Antalik
一句话点评
一个面向AI代理的UI动效合集,几十种效果直接复制粘贴,还附了性能优化提示(比如用transform代替mask-position避免CPU重绘)。作者提供了skill文件,能让编码代理直接调用这些动效。Pro版有渐变文字、烟雾消散等效果,但正文没披露价格。对做AI前端工具链的人挺实用,但别指望这些动效本身有多创新。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
15:00
8d ago
NVIDIA 博客· rssEN15:00 · 09·14
Perplexity 本地搜索版上线 Windows,靠 NVIDIA RTX 离线跑
Perplexity 把它的 AI 搜索做成了 Windows 本地版,叫“便携计算机”,靠 NVIDIA RTX 显卡在本地跑推理。离线也能查资料、总结内容,适合在意隐私或没网的时候用。但正文没提支持哪些 RTX 型号、需要多少显存,也没说本地版比云端版慢多少。另外,离线意味着搜不到实时网页,这点先别太激动。
#Perplexity#NVIDIA#NVIDIA RTX
一句话点评
Perplexity 把 AI 搜索做成了 Windows 本地版,靠 NVIDIA RTX 显卡离线跑推理,适合在意隐私或没网时用。但正文没提支持哪些 RTX 型号、需要多少显存,也没说本地版比云端版慢多少。另外,离线意味着搜不到实时网页,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
14:45
8d ago
TechCrunch AI· rssEN14:45 · 09·14
Superhuman 收购了 YC 出身的会议记录工具 Fathom,不想自己造了
Superhuman 直接买了 Fathom,而不是自己从头做一个会议记录功能。Fathom 靠大方的免费方案攒下了 40 万月活用户,总共超过 100 万人用它录过会。收购的核心目的,是把 AI 从被动记笔记推到能主动干活——比如自动生成待办任务、更新 CRM 系统。收购价没公布。
#Superhuman#Fathom#Y Combinator
一句话点评
Superhuman 没自己造轮子,直接买了 Fathom 来补会议记录能力。Fathom 靠免费方案攒了 40 万月活、超 100 万人用过它录会,用户盘子不小。收购的真正意图是把 AI 从被动记笔记推到能主动干活——比如自动生成待办、更新 CRM。收购价没公布,这点先别太激动,不知道是捡便宜还是溢价。正文没披露 Fathom 的付费转化率和营收,也没说技术整合的具体时间表。对从业者来说,...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K0·R1
14:13
8d ago
Hacker News 首页· rssEN14:13 · 09·14
建筑自动化到底在哪成功了?工厂和重复性体力活
Brian Potter 用 AI 扫描了 19 世纪至今的建筑行业期刊,发现成功的自动化只有两类:工厂里的活儿(钢结构加工、预制混凝土)和现场能做成工厂样子的活儿(像自动铺路机那样重复动作)。其他尝试历史上全失败了。正文没具体说哪些项目失败了,但规律很清楚。
#Brian Potter#Claude Opus 5 Max#IAARC
一句话点评
Brian Potter 用 AI 扫了 19 世纪至今的建筑行业期刊,结论很干脆:成功的自动化只有两类——工厂里的活儿(钢结构加工、预制混凝土)和现场能做成工厂样子的活儿(像自动铺路机那样重复动作)。其他尝试历史上全失败了。正文没具体说哪些项目失败了,但规律很清楚。 短评:历史规律比技术噱头更值得看。工厂化是唯一被验证的路径,现场通用机器人还没跑通。
HKR 分解
hook knowledge resonance
打开信源
50
SCORE
H1·K1·R0
13:59
8d ago
Hacker News 首页· rssEN13:59 · 09·14
把 35KB 的超长提示词从 OpenAI/Anthropic 搬到本地模型,踩坑记录
作者想把安全测试用的超长提示词(35KB)从云端大模型搬到本地跑,硬件是一台 128GB 内存的 AMD Ryzen AI MAX+ 395,配了 27B 参数的开源模型。结果在云端跑得好好的提示词,到本地全崩了。文章前半段花了不少篇幅解释动机:他认为 OpenAI 和 Anthropic 会拿用户的对话记录去训练模型,而且它们的安全过滤器把正经的漏洞...
#Anthropic#OpenAI#Ollama
一句话点评
作者想把35KB的安全测试提示词从Opus搬到本地27B模型上跑,结果全崩了。硬件是128GB内存的AMD Ryzen AI MAX+ 395,但文章没细说提示词怎么崩的、试了哪些模型、改了什么。前半段主要骂OpenAI和Anthropic会拿用户对话训练模型,安全过滤器还挡正经漏洞研究——这是动机,不是技术干货。想看迁移踩坑细节的可以跳过。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
12:37
8d ago
Hacker News 首页· rssEN12:37 · 09·14
德州法官裁定TikTok在儿童安全功能上误导用户
一位德州法官认定TikTok对家长控制功能的宣传与实际不符,判决其误导用户。正文没披露具体罚款或补救措施,所以目前还不知道平台会赔多少钱或改什么功能。
#TikTok#Policy
一句话点评
德州法官认定TikTok对家长控制功能的宣传与实际不符,构成误导。判决已出,但正文没披露具体罚款或补救措施,所以目前还不知道平台会赔多少钱或改什么功能。这点先别太激动,等后续执行细节。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
12:11
8d ago
r/LocalLLaMA· rssEN12:11 · 09·14
llama.cpp 新 PR 加入 Maple 20B-A1B 三值 MoE 架构,主打 CPU 推理
Reddit 用户 AlexGabbia 给 llama.cpp 提了个 PR(#27000),加入 Maple 20B-A1B 模型架构。总参数量 20B,但每次推理只激活 1B(MoE 的稀疏激活),权重只有三个值:-1、0、1(三值量化),内存和计算量都砍得很低,目标是让普通 CPU 也能跑大模型。正文被 Reddit 屏蔽了,没披露具体性能数字...
#Inference-opt#llama.cpp#AlexGabbia#Maple
一句话点评
llama.cpp 社区有人提了个 PR,塞进一个叫 Maple 的 20B 模型,但每次推理只激活 1B 参数(MoE 稀疏激活),权重只有 -1、0、1 三个值(三值量化),内存和计算量都砍得很低,目标是让普通 CPU 也能跑。正文被 Reddit 屏蔽了,没披露具体性能数字和发布时间。如果是真的,这比 BitNet 还狠——BitNet 至少还是 1.58 bit,Maple 直接三值...
HKR 分解
hook knowledge resonance
打开信源
65
SCORE
H1·K1·R0
12:01
8d ago
Hacker News 首页· rssEN12:01 · 09·14
Kinesis:用 Meta 神经手环控制 Mac,开源项目已上线
一个叫 Kinesis 的开源项目,让你用 Meta 的 Neural Band 神经手环来控制 Mac。它把脑机接口信号转成 macOS 原生操作,比如手势滚动和移动光标。代码跑在本地,不依赖云端,隐私上放心一点。项目刚上 GitHub,目前只有 23 颗星,还非常早期。正文没披露延迟、准确率或支持哪些 macOS 版本,想试的话得自己跑代码测。
#Meta#GitHub
一句话点评
有人把 Meta 的 Neural Band 手环信号转成 macOS 原生操作,开源在 GitHub,代码本地跑不传云端。目前只有 23 颗星,非常早期。正文没披露延迟、准确率和支持哪些 macOS 版本,想试得自己跑代码测。如果是真的挺省钱,但这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
12:00
8d ago
OpenAI 博客· rssEN12:00 · 09·14
Fyxer 把邮件拆成 30-50 个小模型,草稿采纳率 53%
Fyxer 用 OpenAI 模型做了个 AI 行政助理,核心是把邮件处理拆成 30-50 个专用小模型,分别负责判断要不要回、分析意图、调取记忆、生成草稿。训练数据来自 50 万小时真人行政助理的工作记录,用 LoRA 微调,再通过用户编辑草稿的差异做 DPO 训练(偏好样本教模型学风格)。目前草稿直接采纳率 53%,90 天用户留存 90%。正文没...
#Fine-tuning#OpenAI#Fyxer#Archie Hollingsworth
一句话点评
Fyxer 把邮件处理拆成 30-50 个小模型,各管一摊(判断要不要回、分析意图、调记忆、写草稿)。训练数据来自 50 万小时真人行政助理的工作记录,用 LoRA 微调,再通过用户编辑草稿的差异做 DPO 训练(偏好样本教模型学风格)。草稿直接采纳率 53%,90 天用户留存 90%。 亮点是“拆任务”思路:不靠一个大模型硬写,而是让专业小模型各司其职,记忆模块尤其关键——决定哪些信息该...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R0
11:27
8d ago
Hacker News 首页· rssEN11:27 · 09·14
D-Matrix 发布 Raptor 推理芯片:用 3D 堆叠 DRAM 替代 HBM,主打低成本低延迟
D-Matrix 在 Hot Chips 2026 上发布了 Raptor 芯片,专做生成式 AI 推理,不是通用 GPU。它用 3D 堆叠 DRAM 替代了昂贵的 HBM(高带宽内存),目的是降低延迟和成本。正文没披露具体性能数字和量产时间,所以这点先别太激动。如果真能落地,推理卡的成本可能会比用 HBM 的方案低一截。
#D-Matrix#Hot Chips 2026
一句话点评
D-Matrix 在 Hot Chips 2026 发了 Raptor 推理芯片,用 3D 堆叠 DRAM 替代昂贵的 HBM(高带宽内存),目标是降低延迟和成本。正文没披露具体性能数字和量产时间,这点先别太激动。如果真能落地,推理卡的成本可能会比用 HBM 的方案低一截。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
10:41
8d ago
● P1Hacker News 首页· rssEN10:41 · 09·14
Anthropic CEO 呼吁监管减速前沿 AI 研发,律师质疑监管权力风险
Anthropic 的 CEO Dario Amodei 发了篇文章,主张用监管给 AI 研发踩刹车,具体包括往公司里安插第三方评估员、让头部实验室统一安全标准。律师 Preston Byrne 直接怼了回去,他过去一年半都在跟网络审查机构打官司。他的核心反驳是:在美国,写代码属于言论自由,往公司里塞 NGO 评估员,跟之前搞出“审查工业复合体”的 G...
#Anthropic#Dario Amodei#OpenAI
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 和 OpenAI 的 CEO 同时喊刹车,但两家都没说清楚“慢下来”具体怎么量、谁来查,先别太激动。
锐评
Anthropic 的 CEO Dario Amodei 发了一篇博客,呼吁给最前沿的 AI 研发“踩刹车”,并提了三条大致方向。Sam Altman 随后在 X 上跟帖说 OpenAI 也会跟进其中一条,即开放独立评估者访问。这事的背景是 Anthropic 内部刚有安全研究员辞职,公开说大厂在“拿人命赌博”。Amodei 的博客没直接回应辞职事件,但整篇基调明显是在接住这波压力。 TechCrunch 这篇报道把各方表态串了起来,但关键细节是缺的:Amodei 说的“单方面承诺”到底覆盖哪些模型、什么能力阈值才触发减速,正文没披露。Altman 的附议也停留在社交平台一句话,没有正式政策文件。另外,Cohere 的 CEO 等人公开质疑他俩的真实动机,认为这可能是大厂在给自己筑护城河。 如果这两家真能拿出一套可验证的降速标准,比如算力上限或评测分数红线,那确实值得看。现在只有呼吁和表态,缺执行方案和第三方监督机制,说服力要打个折。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
10:28
8d ago
● P1Hacker News 首页· rssEN10:28 · 09·14
AI巨头推出前沿限速监管框架引发监管俘获争议
Anthropic 的 Dario Amodei、OpenAI 的 Sam Altman、微软的 Satya Nadella 和 Elon Musk 罕见地共同提出了一套叫“Pace the frontier”的监管方案。这套方案只盯着他们口中“最前沿的模型”管,小公司和开源项目完全不受影响。The Register 直接点破:这就是典型的监管俘获——...
#Anthropic#OpenAI#Microsoft
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
AI 巨头联手推了个“前沿限速”监管框架,名字好听,但本质是让大厂自己定规则,小玩家可能直接被挡在门外。
锐评
这事说白了就是几个 AI 大厂的老板——Anthropic 的 Dario Amodei、OpenAI 的 Sam Altman、微软的 Nadella 还有马斯克——坐在一起搞了个叫“Pace the frontier”的监管方案,想让政府按他们的节奏来管 AI。The Register 直接把这叫“监管俘获”,意思是大公司通过参与制定规则,把监管变成自己的护城河。 目前文章没披露这个框架的具体技术门槛,比如算力达到多少 FLOPs 就要报备、模型参数量多大算“前沿”。但核心逻辑是让现有巨头来定义什么是危险的 AI,然后由政府背书。好处是如果真的能统一标准,能避免各州或各国各管各的;坏处也很明显,新创公司可能连入场券都拿不到,因为合规成本会被拉得极高。 还缺两个关键信息:一是这个方案有没有给开源模型留活路,二是除了这几家发起方,有没有独立的第三方机构参与监督。如果最后只是几个大厂关起门来写规则,那与其说是监管,不如说是行业垄断协议。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
09:59
8d ago
AI HOT 精选· aihot-apiZH09:59 · 09·14
小红书开源搜索 Agent 模型 Iris,35B 和 397B 两个版本,自称同规模领先
小红书 AllSpark 团队开源了搜索 Agent 模型 Iris,有 35B 和 397B 两个尺寸,号称在同参数量级里成绩最好。但正文没披露具体跑在什么 benchmark 上、用了什么训练数据、以及开源协议是什么,所以这个“领先”暂时只能当个宣传话术看。如果是真的,35B 版本对部署成本挺友好,397B 则适合对效果要求更高的场景。
#Xiaohongshu#AllSpark
一句话点评
小红书开源了搜索 Agent 模型 Iris,有 35B 和 397B 两个尺寸,号称同参数量级里成绩最好。但正文没披露跑在什么 benchmark 上、用了什么训练数据、以及开源协议,所以“领先”暂时只能当宣传话术看。如果是真的,35B 版本对部署成本挺友好,397B 则适合对效果要求更高的场景。
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H0·K0·R0
07:55
8d ago
Hacker News 首页· rssEN07:55 · 09·14
OpenArch:用 PyTorch 手写 Llama、Qwen、DeepSeek 等现代大模型架构,主打读得懂
一个刚开源的 GitHub 仓库,把 Llama、Qwen、DeepSeek、Gemma 等主流大模型的内部结构用 PyTorch 从零实现了一遍。作者参考了 Sebastian Raschka 的 LLM Architecture Gallery,代码风格优先照顾可读性,适合想搞清楚模型内部到底怎么搭的工程师。目前只有 20 个星,属于刚起步的项目,...
#Code#OpenArch#Sebastian Raschka#PyTorch
一句话点评
一个刚开源的 PyTorch 仓库,把 Llama、Qwen、DeepSeek 等主流大模型的内部结构从零实现了一遍,代码优先照顾可读性,适合想搞清楚模型到底怎么搭的工程师。目前只有 20 个星,刚起步,但参考了 Sebastian Raschka 的 LLM Architecture Gallery,底子不差。短评:想手撕模型结构的可以看看,但别指望能直接跑起来用。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
06:44
8d ago
AI 群聊日报· atomZH06:44 · 09·14
阿里公开招“情报工程师”专攻蒸馏,Astra 额度两小时烧光一周量
Anthropic 指控蒸馏才三天,阿里就在杭州挂出“情报工程师”岗,JD 直白写着突破注册风控和设备指纹,群友直呼“这是能招的吗?”。Astra 用户集体抱怨额度不够用:一周的 20x 额度两小时烧完,出活还比 Sol 少。有消息说 50x 订阅可能要 $300–$400。实操上,Astra 三四轮对话后智力明显下降,建议首请求放完整任务,后续只问确...
#Code#Anthropic#Alibaba#OpenAI
一句话点评
阿里公开招“情报工程师”,JD 直写突破注册风控和设备指纹,三天前 Anthropic 刚指控蒸馏。群友吐槽 Astra 额度两小时烧完,三四轮后智力下降,建议首请求放完整任务。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
04:49
9d ago
Hacker News 首页· rssEN04:49 · 09·14
谁有资格给AI定规矩?
Cohere 发了一篇博客,核心观点是:AI 的规则制定不能只让少数几家大公司说了算。文章呼吁企业、政府和开发者都参与进来,否则规则容易偏向少数利益。它点出了当前监管讨论的核心矛盾——谁的声音被听到了,谁被排除在外——但没有提出具体的法案或时间表。
#Cohere#Policy
一句话点评
Cohere 这篇博客讲的是:AI 规则不能只让几家大公司定,企业、政府、开发者都得有发言权。它点出了监管讨论的核心矛盾——谁的声音被听到了,谁被排除在外——但没有提具体法案或时间表。观点本身不新,更像立场声明。如果你关心 AI 治理的博弈格局,值得一读;想找落地路径,正文没给。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R1
04:00
9d ago
FT · 科技· rssEN04:00 · 09·14
AI自动化正在吃掉零工经济
FT发了一篇趋势判断:AI自动化正在替代外卖、网约车这类平台灵活就业。正文没披露具体案例或数据,但标题信号很明确——过去靠人跑的活儿,正在被AI驱动的系统取代。这点先别太激动,因为没有给出替代速度、成本对比或实际部署规模,更像一个方向性预警。如果是真的,对依赖零工的平台和劳动者影响会很大。
#Financial Times
一句话点评
FT发了一篇趋势判断:AI自动化正在替代外卖、网约车这类平台灵活就业。正文没披露具体案例或数据,但标题信号很明确——过去靠人跑的活儿,正在被AI驱动的系统取代。这点先别太激动,因为没有给出替代速度、成本对比或实际部署规模,更像一个方向性预警。如果是真的,对依赖零工的平台和劳动者影响会很大。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
04:00
9d ago
FT · 科技· rssEN04:00 · 09·14
音乐行业打击用AI歌曲刷流量骗版税
国际唱片业协会(IFPI)和三大唱片公司正在推动Spotify等平台加强检测,封杀用AI批量生成歌曲、再靠假播放量骗取版税的行为。正文没披露已下架歌曲数量或涉案金额,但核心逻辑很清楚:AI把造假成本压到极低,一个人就能上传成千上万首曲子刷播放量。如果平台不升级检测手段,这笔账会越滚越大。
#IFPI#Spotify
一句话点评
IFPI和三大唱片公司施压Spotify封杀AI批量生成的假歌,一个人就能上传成千上万首刷播放量骗版税。正文没披露已下架数量或涉案金额,但逻辑很清楚:AI把造假成本压到极低。如果平台不升级检测手段,这笔账会越滚越大。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
02:33
9d ago
Product Hunt · AI· rssEN02:33 · 09·14
OpenAI 在 Product Hunt 上架 Agents API,云端跑 agent 工作流
OpenAI 把 Agents API 放到了 Product Hunt 上,核心卖点是让 agent 工作流跑在云端,底层用的是 Codex 执行环境。正文没披露定价、可用地区或限制条件,所以实际成本、延迟和稳定性都还不清楚。如果你在考虑把 agent 流程搬到 OpenAI 云上,这点先别太激动,等具体价格和性能数据出来再说。
#Agent#OpenAI
一句话点评
OpenAI 把 Agents API 放上 Product Hunt,核心卖点是让 agent 工作流跑在云端,底层用 Codex 执行环境。正文没披露定价、可用地区或限制条件,所以实际成本、延迟和稳定性都还不清楚。如果你在考虑把 agent 流程搬到 OpenAI 云上,这点先别太激动,等具体价格和性能数据出来再说。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
01:00
9d ago
Hacker News 首页· rssEN01:00 · 09·14
AI 不是普通技术:它能学会人类所有能力,包括管理其他 AI
作者认为 AI 能学会人类所有能力,包括管理其他 AI。方法很简单:花钱雇人录下自己做某件事的过程,把数据喂进下一轮训练。如果 AI 做某份工作比人好,它就会取代那份工作;即使新创造的工作,也会被再次自动化。所以 AI 不像汽车——它是全通用技术。AI 唯一做不到的是“成为人类”,但全球对纯手工制品的需求,在经济总量里只是个零头。
#12 Grams of Carbon
一句话点评
作者用了一个简单的递归论证:只要AI能比人做得好,它就会取代那份工作;新创造的工作也会被再次自动化。核心前提是“AI能学会人类所有能力”,包括管理其他AI。方法也很粗暴——雇人录下做事过程,喂进下一轮训练。这个逻辑链条本身没问题,但前提是否成立才是关键。作者承认物理世界正在被攻破(资本涌入机器人),但没讨论成本、数据获取难度、以及“比人做得好”的定义——是成本低、质量高,还是两者兼有?正文没...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
00:44
9d ago
Hacker News 首页· rssEN00:44 · 09·14
家用机器人还要等多久?IEEE Spectrum 泼了盆冷水
IEEE Spectrum 这篇长文没画饼,直接拆了三个卡脖子问题:成本、安全、真有用。人形机器人连端杯水都费劲,目前能进家门的还是扫地机和割草机。文章没给任何发布时间或价格,信息缺口很明显——厂商还在实验室里憋大招。
#Robotics#IEEE Spectrum
一句话点评
IEEE Spectrum 这篇长文没画饼,直接拆了三个卡脖子问题:成本、安全、真有用。人形机器人连端杯水都费劲,目前能进家门的还是扫地机和割草机。文章没给任何发布时间或价格,信息缺口很明显——厂商还在实验室里憋大招。 短评:没画饼,拆了三个真问题:成本、安全、有用。人形机器人连端杯水都费劲,别急着买。
HKR 分解
hook knowledge resonance
打开信源
50
SCORE
H1·K0·R1
00:22
9d ago
Hacker News 首页· rssEN00:22 · 09·14
开源AI阅读清单:快速搞懂开放模型的门道
Nathan Lambert 整理了一份开源AI和开放模型的阅读清单,覆盖基础概念、商业策略、安全性和中美竞争。里面解释了Meta为什么开源Llama、开放程度其实是个光谱(不是非黑即白)、开源和闭源模型谁更划算,还提到了Kimi K3和GLM-5.2等中国模型。正文没有披露具体模型的跑分或政策建议,但提供了大量参考文献和不同视角,适合想系统了解开放模...
#Nathan Lambert#Meta#Mark Zuckerberg
一句话点评
Nathan Lambert 整理了一份开源模型阅读清单,适合想系统了解开放模型的人。清单覆盖了Meta为什么开源Llama、开放程度是个光谱、开源和闭源谁更划算,还提到了Kimi K3和GLM-5.2等中国模型。正文没有披露具体模型的跑分或政策建议,但提供了大量参考文献和不同视角。短评:入门级综述,适合扫盲,但缺跑分和实操建议。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0

更多

频道

后台