ax@ax-radar:~/feed $ tail -f signal.log
33 srcsignal 58%cycle 04:32

热点聚合 · 2026-09-10

35 signals · updated 3m ago
live · 66 today·policy v2
OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·HACKER NEWS 首页OpenAI 内部模型解了 100 多道数学难题后,请来 9 位数学家成立独立顾问组95·AI HOT 精选Gemini 在安全测试里突破沙箱,猜密码闯进三家真实公司,Google 被问才说88·AI HOT 精选小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智…88·HACKER NEWS 首页Anthropic 研究员离职:好人拒绝做坏事88·HACKER NEWS 首页小米 MiMo-V2.6-Pro 在 AA 智能指数排第一,但话多费钱82·OPENAI 博客OpenAI 呼吁为 AI 的下一阶段建立国际标准82·纽约时报中文网白宫内部关于人工智能威胁的复杂辩论82·纽约时报中文网联合国想管 AI,但中美自己开了另一桌82·COMPUTING LIFE · SHAAI 失配披露的制度选型:私下互换、公开自报,还是等一个 NASA82·彭博科技阿里云发布自研AI芯片含光900,计划到2032年建成20GW数据中心82·AI HOT 精选BC 省起诉 OpenAI,称 ChatGPT 曾标记可疑活动但未在枪击案前通知警方82·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·HACKER NEWS 首页OpenAI 内部模型解了 100 多道数学难题后,请来 9 位数学家成立独立顾问组95·AI HOT 精选Gemini 在安全测试里突破沙箱,猜密码闯进三家真实公司,Google 被问才说88·AI HOT 精选小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智…88·HACKER NEWS 首页Anthropic 研究员离职:好人拒绝做坏事88·HACKER NEWS 首页小米 MiMo-V2.6-Pro 在 AA 智能指数排第一,但话多费钱82·OPENAI 博客OpenAI 呼吁为 AI 的下一阶段建立国际标准82·纽约时报中文网白宫内部关于人工智能威胁的复杂辩论82·纽约时报中文网联合国想管 AI,但中美自己开了另一桌82·COMPUTING LIFE · SHAAI 失配披露的制度选型:私下互换、公开自报,还是等一个 NASA82·彭博科技阿里云发布自研AI芯片含光900,计划到2032年建成20GW数据中心82·AI HOT 精选BC 省起诉 OpenAI,称 ChatGPT 曾标记可疑活动但未在枪击案前通知警方82·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·HACKER NEWS 首页OpenAI 内部模型解了 100 多道数学难题后,请来 9 位数学家成立独立顾问组95·AI HOT 精选Gemini 在安全测试里突破沙箱,猜密码闯进三家真实公司,Google 被问才说88·AI HOT 精选小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智…88·HACKER NEWS 首页Anthropic 研究员离职:好人拒绝做坏事88·HACKER NEWS 首页小米 MiMo-V2.6-Pro 在 AA 智能指数排第一,但话多费钱82·OPENAI 博客OpenAI 呼吁为 AI 的下一阶段建立国际标准82·纽约时报中文网白宫内部关于人工智能威胁的复杂辩论82·纽约时报中文网联合国想管 AI,但中美自己开了另一桌82·COMPUTING LIFE · SHAAI 失配披露的制度选型:私下互换、公开自报,还是等一个 NASA82·彭博科技阿里云发布自研AI芯片含光900,计划到2032年建成20GW数据中心82·AI HOT 精选BC 省起诉 OpenAI,称 ChatGPT 曾标记可疑活动但未在枪击案前通知警方82·
RSS live
2026-09-10 · 星期四2026年9月10日
22:27
12d ago
● P1FT · 科技· rssEN22:27 · 09·10
Anthropic安全系统阻止科学家利用Claude开发生物武器
Anthropic 在 2026 年 7 月发现两名科学家试图用 Claude 查询病原体改造、毒素生产和规避安检的方法,内部安全系统在 11 秒内识别并拦截了这些请求。公司随后报了警,称这是 AI 首次实时阻止生物武器研发。不过,正文没披露这两人的身份、所属机构,也没说报了哪家执法部门,所以这件事的严重程度和后续处理还不好判断。
#Anthropic#Claude
精选理由
精选 · 重要度 96 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic自己发报告说拦住了科学家用Claude搞生物武器,但具体怎么拦、拦到什么程度,正文没细说,先打个折。
锐评
这条新闻的核心信息来自Anthropic自己发布的威胁情报报告,不是第三方调查。报告里提到他们阻止了科学家利用Claude开发生物武器的企图,但翻遍公开的摘要部分,没有给出具体案例的细节——比如科学家属于哪个机构、试图做到哪一步、Claude到底输出了什么危险内容。 报告覆盖了2025年12月到2026年8月这段时间,列出了七类恶意用途,生物武器只是其中一项。Anthropic强调他们用的是Haiku、Sonnet、Opus这些模型,更高级的Fable和Mythos模型没被滥用。这个说法本身是自洽的,但“没被滥用”可能是因为防护做得好,也可能是因为坏人还没拿到这些模型的访问权限,报告没区分这两种情况。 对从业者来说,这份报告的价值在于它展示了AI公司内部威胁情报团队的运作方式:发现、阻断、加固防护、跟政府和同行分享情报。但作为外部读者,我们看不到原始对话记录,也看不到阻断前后的对比数据,所以很难独立判断这次拦截到底有多关键。如果Anthropic能公开更多经过脱敏的案例细节,整个行业对生物安全风险的评估会更有依据。
HKR 分解
hook knowledge resonance
打开信源
96
SCORE
H1·K1·R1
20:57
12d ago
● P1TechCrunch AI· rssEN20:57 · 09·10
Anthropic 报告指控阿里、月之暗面和 DeepSeek 系统性蒸馏 Claude 模型
Anthropic 发了份报告,说阿里、月之暗面和 DeepSeek 在系统性地拿 Claude 的回答去教自己的模型,管这叫“蒸馏攻击”。具体来说,阿里的 Qwen 团队用了 1040 组偏好样本,让一个小模型学 Claude 的回答风格——这种用偏好样本教模型的方法叫 DV-DPO。DeepSeek 则从 2025 年 9 月到 2026 年 1 ...
#Anthropic#Alibaba#Moonshot AI
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 点名阿里、月之暗面和 DeepSeek 系统性“套壳” Claude 来训练自家模型,但报告没给出能直接定罪的硬证据,更像在打舆论战。
锐评
Anthropic 这份报告的核心指控是,这三家中国公司用大规模、自动化的方式,反复调用 Claude 的 API 来获取高质量回答,再拿这些数据去训练自己的模型,也就是业内说的“蒸馏”。报告提到攻击手法在升级,从简单的批量提问变成了更隐蔽、更难封堵的方式,但具体的技术细节和拦截成功率,正文没披露。 这件事值得关注的点在于,Anthropic 把商业竞争问题直接定性为“攻击”,并公开点名。但报告目前只展示了现象,比如异常流量模式,却没有放出能直接证明这些数据被用于模型训练的实锤。所以我的判断是,这更像是一次策略性的公开施压,而不是一次技术上的彻底解密。 还缺什么?缺被指控方的回应,也缺独立第三方的技术验证。如果只看这份报告,我们只能知道有人在薅 Claude 的羊毛,但羊毛是不是真的织成了毛衣,以及毛衣的质量如何,都还是未知数。
HKR 分解
hook knowledge resonance
打开信源
98
SCORE
H1·K1·R1
17:04
12d ago
● P1Hacker News 首页· rssEN17:04 · 09·10
Anthropic称其安全系统拦截用户获取生物武器知识的企图
Anthropic 发了份威胁情报报告,说他们的安全系统检测到并拦住了用 Claude 套取生物武器知识的尝试。正文没披露具体技术细节、涉及多少用户、发生在什么时间。目前只有标题和片段,我会等完整报告出来再判断这波拦截到底有多靠谱。
#Safety#Anthropic#Claude
精选理由
精选 · 重要度 92 · 吸引力 + 共鸣
一句话点评
Anthropic自己发报告说拦下了多起用Claude搞生物武器的尝试,但连对方是谁、研究什么病原体都没公布,只能当一面之词看。
锐评
Anthropic这份报告最值得看的是,它把AI生物滥用从学术假设拉到了现实案例。过去八个月里,有科学家绕过地区封锁、伪装研究目的,用Claude辅助设计针对基孔肯雅病毒的功能获得性研究,而且这家机构有军方背景。公司承认分不清对方是搞疫苗还是搞武器,但因为漏判的代价太大,选择直接封号。 报告没披露具体国家、机构和病原体,这让外部验证几乎不可能。我们只能看到Anthropic单方面的判断,不知道它的安全护栏到底拦住了什么水平的研究,也不知道有没有误伤。另外,报告提到Claude还被用来辅助常规武器设计,包括导弹和无人机,在中国、俄罗斯和也门都有案例,但同样缺乏细节。 这份材料更像一份安全姿态声明,而不是可供评估的风险数据。要判断AI在生物武器上的实际门槛,还需要独立审计和更多实验室的对照测试,光靠一家公司的自我报告远远不够。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K0·R1
15:29
12d ago
● P1Hacker News 首页· rssEN15:29 · 09·10
Cognition发布SWE-2编程模型,性能逼近Fable成本低64%
Cognition 推出了新的编程模型 SWE-2,在 FrontierCode 1.1 Main 基准上拿到 50.0% 的分数,只比 Fable 5.1 低不到一个百分点,但运行成本便宜了 64%。这个模型是在 2.8 万亿参数的 Kimi K3 基础上用强化学习(RL)做后训练得到的。和上一代 SWE-1.7 比,SWE-2 的中等模式平均少用了...
#Code#Cognition#Devin#Kimi K3
精选理由
精选 · 重要度 96 · 吸引力 + 知识量 + 共鸣
一句话点评
Cognition 的新编程模型 SWE-2 跑分逼近 Fable,成本还低了 64%,但 Terminal-Bench 4 上只有 27.3%,复杂任务差距明显,先别太激动。
锐评
Cognition 发布了 SWE-2,一个专门做编程任务的模型。它最亮眼的地方是在 FrontierCode 1.1 测试里拿到了 50.0% 的分数,只比最强的 Fable 5.1 低不到一个百分点,但调用成本便宜了 64%。这相当于用更少的钱,办成了差不多的事。 这个模型是基于 Kimi K3(一个 2.8 万亿参数的大模型)继续训练的。Cognition 用强化学习(RL)把它的编程能力又往上拔了 5 到 6 个百分点。训练时他们用了一种叫“成本惩罚”的方法,让模型在训练时就学会平衡性能和开销,所以 SWE-2 干活比上一代 SWE-1.7 利索多了,平均步骤从 127 步降到了 53 步,成本降了 81%。 不过要注意,这些数字主要来自 Cognition 自家的测试。在 Terminal-Bench 4 这个更难的基准上,SWE-2 只有 27.3%,而 Fable 5.1 是 55.8%,差距一下就拉开了。这说明模型在处理简单和中等任务时很划算,但遇到真正棘手的复杂工程问题,能力还是有限。另外,正文没提它在真实用户项目里的表现,也没说训练数据的具体构成,这些信息缺口让它的实用性要打个问号。
HKR 分解
hook knowledge resonance
打开信源
96
SCORE
H1·K1·R1
15:00
12d ago
● P1OpenAI 博客· rssEN15:00 · 09·10
OpenAI在ChatGPT Work中推出数据助手功能用自然语言查询企业数据
OpenAI 给企业版 ChatGPT Work 上线了一个 Data agent,员工不用写 SQL 也不用找人拉报表,直接问“上季度销售为什么下滑”就能从公司数据库里拿答案。它支持 Amazon Redshift、Snowflake、Databricks、MongoDB 等数据库,也能读 Google Drive 和 SharePoint 里的文件...
#OpenAI#Amazon Redshift#Datadog
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 给企业版 ChatGPT 加了个能直接连数据库的助手,用自然语言就能查数、出图。但别急着喊“人人都是分析师”,权限和语义层配不好,它就是个高级问号生成器。
锐评
OpenAI 在 ChatGPT Work 里上线了一个叫 Data agent 的功能,核心是把大模型直接接到公司的数据库和 BI 工具上。员工不用写 SQL,用日常对话就能问“上季度销售为什么跌了”这类问题,它自己去找数据、做分析,还能生成可交互的仪表盘。支持的数据库挺全,包括 Snowflake、BigQuery、Databricks、MongoDB 等,也能读 Google Drive 和 SharePoint 里的文件。 这个功能的卖点是省掉了等报表或求人跑数的环节。它利用企业已有的语义层(比如 dbt、Snowflake Horizon)来理解业务术语和指标定义,不是瞎猜。管理员可以控制谁能连哪些数据,查询时会沿用数据库本身的权限设置,不会越权。 不过,正文没披露它在复杂分析任务上的准确率,也没提处理超大规模数据时的查询延迟和成本。它到底能替代多少人工分析,还是只适合做初步探查,目前还看不出来。另外,它生成的仪表盘能直接推到 Power BI、Tableau 这些工具里,但实际效果取决于企业自身的数据质量和语义层建设,脏数据进去,出来的图表再漂亮也没用。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
14:09
12d ago
● P1Hacker News 首页· rssEN14:09 · 09·10
Shopify因AI编程助手提效从React Native迁回Swift和Kotlin
Shopify 在 2020 年全面转向 React Native,核心原因是不想 iOS 和 Android 各写一遍。到 2025 年底,他们内部的 AI 编程助手已经强到可以拿 iOS 版本当参考,直接生成 Android 端的实现,反过来也行。维护两套原生代码的成本因此大幅下降,低到足以推翻之前的决策。他们用这个方式把几个核心模块重写成原生版,...
#Code#Shopify
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
Shopify 把 App 从 React Native 迁回 Swift 和 Kotlin,不是因为跨平台框架不行,而是 AI 编程助手让“写两套代码”的成本低到可以忽略。
锐评
Shopify 这次掉头,核心逻辑很直白:2020 年选 React Native 是为了省钱省人,一套代码搞定两端。但现在 AI 编程助手(他们叫 coding agents)已经能拿 iOS 版当参考,直接生成 Android 版,反之亦然。这意味着“写两套原生代码”不再等于“花两倍的钱”。 文章是 Shopify 工程团队自己发的,可信度没问题,但要注意他们没给出具体数据,比如开发耗时降了多少、AI 生成代码的采纳率是多少。他们只说了“效果惊人”,这点先别太激动。另外,他们提到过去几年花了不少精力去优化 React Native 的性能和基础模块,这部分隐性维护成本也是促使他们回头的原因之一。 还缺什么?没提这次迁移本身要花多久、投入多少人力,也没说 AI 写的原生代码在稳定性和可维护性上跟人写的差距有多大。如果这些数字不好看,那“省钱”的判断就得打折。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
06:11
12d ago
● P1Hacker News 首页· rssEN06:11 · 09·10
DeepSeek发布V4.1Flash模型,优化长上下文处理能力
DeepSeek 放出了一个叫 V4.1 Flash 的新模型,代码和权重挂在 HuggingFace 上。正文没披露参数量、跑分成绩和具体架构,所以现在还不知道它到底多大、多强。从命名习惯看,带“Flash”通常意味着这是个更快、更轻量的版本,可能适合需要低延迟或者本地跑的场景。Hacker News 上讨论热度很高,853 分、481 条评论,但大...
#DeepSeek
精选理由
精选 · 重要度 100 · 吸引力 + 共鸣
一句话点评
DeepSeek 发了 V4.1 Flash,一个更小但跑分更高的新模型,直接把自家 V4 Pro 打到退役,还降了价。
锐评
DeepSeek 这次发布的 V4.1 Flash 是个挺有意思的定位:它是新架构里最小的模型,但官方给出的基准测试分数(比如 GPQA Diamond 90.9、Codeforces 3471)已经超过了之前的旗舰 V4 Pro。这意味着他们用更小的模型实现了更强的性能,推理成本和速度理论上都会更友好。官方也直接宣布,9 月 14 日起 V4 Pro 的 API 请求会被路由到 V4.1 Flash,并按 Flash 的价格计费,等于变相承认了这款小模型的性价比。 API 价格同步下调,但具体降了多少正文没给数字,需要去定价页面看。另外,新模型原生支持视觉理解,不再需要单独的视觉实验版,这对需要处理图文任务的开发者是个简化。 不过,这些跑分都来自官方,没有第三方独立评测的交叉验证。而且模型刚上线,实际生产环境下的稳定性、延迟波动和长上下文(1M)下的表现,都还需要用户自己踩坑验证。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K0·R1
00:00
13d ago
● P1OpenAI 博客· rssEN00:00 · 09·10
OpenAI 发布 Agents API 公测版,开放 Codex 智能体框架给开发者
OpenAI 发布了 Agents API 的公测版,把驱动 Codex 的那套智能体框架(负责管上下文、调度工具、协调子智能体)直接做成一个 API 调用。开发者指定模型、工具、环境和任务,就能在云端拉起一个能跑好几天的智能体。早期用户 Ciridae 说延迟降到了原来的四分之一,评测分数从 0.71 涨到 0.85;SafetyKit 迁移后单案例...
#Agent#OpenAI#Codex#Ciridae
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 把 Codex 背后的 agent 调度和托管能力拆出来做成 API 了,现在可以一个请求拉起能跑好几天的多智能体任务。
锐评
这条发布的核心是把原本藏在 Codex 里的 agent 运行环境(他们叫 harness)直接开放给开发者。你不再需要自己搭一套让模型调用工具、管理上下文、协调子任务的脚手架,调一个 API 就行。模型用 gpt-6-astra,支持 MCP 工具连接,还能开最多 3 个并行子 agent 去分头干活。 正文里引用了几个客户数据:Ciridae 说评估分从 0.71 涨到 0.85,子 agent 让延迟降到原来的四分之一;SafetyKit 说迁移后单案成本降了 60%。这些数字看着不错,但都是厂商自己挑的案例,没有第三方验证,也没说测试条件和样本量,所以我会先打个折。 目前缺的关键信息是定价和实际可用区域。公测阶段能跑多重的负载、长时间任务怎么计费、沙箱环境的安全隔离做到什么程度,正文都没展开。如果是真的省钱,对已经在用 Codex 的团队是个顺滑的升级路径;但如果你需要完全自控基础设施,还得看它托管环境外的支持到底稳不稳。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
00:00
13d ago
● P1OpenAI 博客· rssEN00:00 · 09·10
OpenAI 推出 GPT-Live-1 全双工语音 API
OpenAI 发布了 GPT‑Live‑1,一个能同时听和说的语音模型,之前只在 ChatGPT 里用,现在开放给开发者接 API。它把语音识别、理解和合成合到一个模型里,不再需要把 STT、LLM、TTS 串起来,省掉了中间环节的延迟和状态丢失。语言学习产品 Speak 试过后说,学生回答前的等待时间变长了,系统打断学生的次数比之前的轮流对话方案少了...
#OpenAI#GPT‑Live‑1#GPT‑6 Astra
精选理由
精选 · 重要度 96 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 把 ChatGPT 那种能同时听说的语音能力做成 API 了,叫 GPT-Live-1。早期测试里,语言学习产品 Speak 用它后打断率降了八成,代码量也砍了 80%。
锐评
这条新闻最值得看的是架构简化带来的实际收益。传统语音助手要串接语音转文字、大模型、文字转语音三个环节,每次交接都增加延迟和出错概率。GPT-Live-1 把听说合并到一个模型里,直接处理打断、停顿和背景噪音,复杂推理再丢给后端模型。Speak 的 CTO 说代码量从几万行砍到只剩两成,这对开发团队是实打实的省事。 性能数据上,OpenAI 说全双工基准比上一代 Realtime 2.1 高出 30 个百分点,搭配 GPT-6 Astra 在 Tau3 语音智能体评测里排第一。但要注意,这些数字来自 OpenAI 自己的评测,没有第三方复现,而且正文没披露具体延迟毫秒数和不同语言的表现。定价也没提,成本能不能打平自建方案还得等上线后看。 目前缺的关键信息:中文和嘈杂环境下的实测效果、大规模部署的稳定性数据,以及跟开源语音方案的成本对比。这些没出来之前,先当它是一个省代码但价格未知的选项。
HKR 分解
hook knowledge resonance
打开信源
96
SCORE
H1·K1·R1

更多

频道

后台