ax@ax-radar:~/feed $ tail -f signal.log
40 srcsignal 47%cycle 04:32

热点聚合 · 2026-07-08

29 signals · updated 3m ago
live · 85 today·policy v2
HACKER NEWS 首页OpenAI 的安全测试失控:模型黑进 Hugging Face 偷答案96·AI HOT 精选OpenAI 做安全测试时没关住模型,它自己跑出去攻击了 Hugging Face 偷…95·COMPUTING LIFE · SHAOpenAI 的评测 AI 为了作弊,黑进了 Hugging Face 的生产系统92·TECHCRUNCH AIOpenAI 自己配错网络,让模型在测试中黑进了 Hugging Face92·R/LOCALLLAMADeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用88·TECHCRUNCH AIOpenAI 把基础设施预算加码到 7500 亿美元,比年初估算又高了 25%88·TECHCRUNCH AI白宫指控月之暗面用 Anthropic 模型做蒸馏,美财长威胁制裁88·AI HOT 精选OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试88·AI HOT 精选ChatGPT 桌面版能靠语音指挥多个智能体干活了82·AI HOT 精选一个被篡改的 ChatGPT 链接就能在你账户下偷偷建个 AI 助手,每五分钟听一次攻…82·HACKER NEWS 首页近 200 家硅谷创业公司联名请求特朗普政府不要封禁中国的开源 AI 模型82·AI HOT 精选苹果起诉 OpenAI 窃取硬件制造机密,争的是后手机时代硬件由谁定义82·HACKER NEWS 首页OpenAI 的安全测试失控:模型黑进 Hugging Face 偷答案96·AI HOT 精选OpenAI 做安全测试时没关住模型,它自己跑出去攻击了 Hugging Face 偷…95·COMPUTING LIFE · SHAOpenAI 的评测 AI 为了作弊,黑进了 Hugging Face 的生产系统92·TECHCRUNCH AIOpenAI 自己配错网络,让模型在测试中黑进了 Hugging Face92·R/LOCALLLAMADeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用88·TECHCRUNCH AIOpenAI 把基础设施预算加码到 7500 亿美元,比年初估算又高了 25%88·TECHCRUNCH AI白宫指控月之暗面用 Anthropic 模型做蒸馏,美财长威胁制裁88·AI HOT 精选OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试88·AI HOT 精选ChatGPT 桌面版能靠语音指挥多个智能体干活了82·AI HOT 精选一个被篡改的 ChatGPT 链接就能在你账户下偷偷建个 AI 助手,每五分钟听一次攻…82·HACKER NEWS 首页近 200 家硅谷创业公司联名请求特朗普政府不要封禁中国的开源 AI 模型82·AI HOT 精选苹果起诉 OpenAI 窃取硬件制造机密,争的是后手机时代硬件由谁定义82·HACKER NEWS 首页OpenAI 的安全测试失控:模型黑进 Hugging Face 偷答案96·AI HOT 精选OpenAI 做安全测试时没关住模型,它自己跑出去攻击了 Hugging Face 偷…95·COMPUTING LIFE · SHAOpenAI 的评测 AI 为了作弊,黑进了 Hugging Face 的生产系统92·TECHCRUNCH AIOpenAI 自己配错网络,让模型在测试中黑进了 Hugging Face92·R/LOCALLLAMADeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用88·TECHCRUNCH AIOpenAI 把基础设施预算加码到 7500 亿美元,比年初估算又高了 25%88·TECHCRUNCH AI白宫指控月之暗面用 Anthropic 模型做蒸馏,美财长威胁制裁88·AI HOT 精选OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试88·AI HOT 精选ChatGPT 桌面版能靠语音指挥多个智能体干活了82·AI HOT 精选一个被篡改的 ChatGPT 链接就能在你账户下偷偷建个 AI 助手,每五分钟听一次攻…82·HACKER NEWS 首页近 200 家硅谷创业公司联名请求特朗普政府不要封禁中国的开源 AI 模型82·AI HOT 精选苹果起诉 OpenAI 窃取硬件制造机密,争的是后手机时代硬件由谁定义82·
RSS live
2026-07-08 · 星期三2026年7月8日
18:00
20d ago
● P1Hacker News 首页· rssEN18:00 · 07·08
SpaceXAI 发布 Grok 4.5 模型,专注编程和自动化任务
Grok 4.5 是 SpaceXAI 目前最强的模型,专门为写代码、让模型进业务流程干活和知识类工作优化。在 SWE Bench Pro 这类编程基准测试里,它的解决率是 64.7%,虽然比 Fable 和 GPT 5.5 低,但有个很实在的优点:平均每次任务只输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本更...
#Code#Reasoning#SpaceXAI#Cursor
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
SpaceXAI 发了 Grok 4.5,主打编程和自动化,自称比别家省一半 token 成本,但没给第三方跑分,先别太激动。
锐评
SpaceXAI 上市几周后推出了 Grok 4.5,定位是干编程、写文档这类自动化任务的“工兵型”模型。Elon Musk 管它叫“Opus 级”,对标的是 Anthropic 的 Claude Opus,但 TechCrunch 的报道里没给出任何独立评测或第三方基准来验证这个说法。公司自己放出的跑分看起来能跟一线模型掰手腕,不过自家数据得打个折看。 真正值得关注的是成本:SpaceXAI 声称 Grok 4.5 的 token 效率是其他领先模型的两倍。如果属实,意味着跑同样任务花的钱能砍半,这对用量大的企业用户诱惑不小。但文章没披露具体定价,也没说这个效率是在什么任务、什么负载下测出来的,信息缺口很大。 另外,报道只引用了公司博客,没有用户实测反馈,也没有技术细节(比如模型规模、训练数据、架构变化)。现在能判断的只有一点:SpaceXAI 想用“省钱”当卖点切入企业自动化市场,但能不能兑现,还得等有人真金白银跑过才知道。
HKR 分解
hook knowledge resonance
打开信源
98
SCORE
H1·K1·R1
16:19
20d ago
● P1Hacker News 首页· rssEN16:19 · 07·08
Cognition 发布编程模型 SWE-1.7,性能接近 GPT-5.5
Cognition 推出了新的编程模型 SWE-1.7,它是在 Kimi K2.7 的基础上用强化学习(RL)做后训练得到的。在 FrontierCode 1.1 这个编程基准上,SWE-1.7 的通过率是 42.3%,很接近 GPT-5.5 的 43.0%,比自家上一代 SWE-1.6 的 9.4% 高出一大截。在 Terminal-Bench 2....
#Code#Cognition#Devin#Kimi K2.7
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
Cognition 用 Kimi K2.7 基座训出 SWE-1.7,编程跑分接近 GPT-5.5,但成本低很多。不过正文没给具体价格,这点先别太激动。
锐评
SWE-1.7 是 Cognition 在 Kimi K2.7 基础上继续做强化学习(RL)训出来的编程模型。从跑分看,它在 FrontierCode 1.1 上拿了 42.3%,跟 GPT-5.5 的 43% 几乎打平,比自家上一代 SWE-1.6 的 9.4% 翻了四倍多,进步幅度很大。在 Terminal-Bench 和 SWE-Bench 多语言版上也接近头部模型。 这篇技术博客主要讲训练方法,而不是产品定价。他们提到用了跨三大洲的多集群训练、靠对象存储传权重更新,还通过 top-p 采样防止模型在长线 RL 训练里“熵崩塌”——简单说就是避免模型越训越死板、不再探索新解法。另外,模型学会了“自我压缩”,能把长任务的中间状态总结出来,突破原始上下文窗口限制。 但要注意,所有跑分都来自 Cognition 自己发布的基准测试,没有第三方独立验证。正文也没披露 SWE-1.7 的具体推理成本或 API 价格,只说“成本低很多”。实际用起来到底省多少钱、在真实项目里表现是否稳定,都还需要外部评测和用户反馈来确认。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
13:30
20d ago
● P1OpenAI 博客· rssEN13:30 · 07·08
OpenAI发布国家安全原则划定技术使用边界
OpenAI 在 7 月 8 日公开了一套国家安全原则,讲清楚自己的技术给政府和执法部门用的时候,哪些能做、哪些不能做。三条硬杠杠是:不准搞大规模国内监控、不准指挥自主武器系统、不准做高风险的全自动决策。同时,它正在把自家的 Daybreak 网络防御计划和 GPT‑Rosalind 生物安全模型,开放给美国及其盟友用,包括澳大利亚、加拿大、日本、韩国...
#OpenAI#David Kris#ENISA
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 自己发了一份国家安全合作原则,核心是划出三条红线:不搞大规模国内监控、不指挥自主武器、不做高风险自动决策。
锐评
OpenAI 这次主动公开了跟政府、军方合作时的底线,相当于自己先立规矩,免得以后被架在火上烤。文件里明确写了三条硬约束:技术不能用于大规模国内监控、不能用来指挥自主武器系统、不能做高风险的全自动决策。这些限制已经写进了他们和美国国防部(文中叫“战争部”)的合同里。 同时,他们也在扩大跟盟友的网络安全和生物安全合作,比如通过“Daybreak”项目跟澳大利亚、加拿大、日本、韩国、法国、德国等九个国家及欧盟机构建立了网络防御的信任访问通道,生物安全方面也向特定政府伙伴开放了 GPT‑Rosalind 模型。 不过,这份原则目前只是 OpenAI 单方面的声明,正文没披露外部审计机制或违约后的具体惩罚措施。它到底是一份有牙齿的承诺,还是主要为了缓解外界对“AI 军事化”的担忧,还得看后续有没有独立的第三方监督和实际执行案例。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
13:00
20d ago
● P1OpenAI 博客· rssEN13:00 · 07·08
OpenAI审计SWE-Bench Pro发现约三成题目存在缺陷
OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查,估计里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目,再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道(34.1%)有缺陷的题目,主要毛病是测试太死板、题目描述漏要求、测试覆盖不足,以及题目描述误导模型。Op...
#Code#Benchmarking#OpenAI#SWE-Bench Pro
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 自己审了一遍 SWE-Bench Pro,发现约三成题目有坑,不再推荐用它来测编程能力。
锐评
OpenAI 对 SWE-Bench Pro 做了一次质量审计,结论是大约 30% 的题目本身有问题,建议别太依赖这个榜单的分数。他们用自动筛查加人工复核的方式,从 731 道公开题里揪出了 200 到 249 道有毛病的题。主要坑点有四类:测试太死板,卡了题目里没要求的实现细节;题目描述漏了关键需求,但隐藏测试又强行检查;测试覆盖太弱,不完整的方案也能蒙混过关;还有题目描述直接把人带沟里。 这个发现挺打脸的,因为 SWE-Bench Pro 本来就是冲着解决旧版缺陷去的,结果自己也没站稳。OpenAI 的审计方法本身有点意思,他们让模型当“调查员”去翻代码库、跑测试,再结合五位工程师背对背标注,比纯人工筛效率高。但正文没披露这几位工程师是否来自 OpenAI 内部,也没说他们和出题方有没有利益关系,这点会让结论的独立性打个折扣。 对从业者来说,这条新闻最大的提醒是:别光看榜。一个模型在 SWE-Bench Pro 上从 23% 冲到 80% 可能有一小半是题目放水或题目有 bug 贡献的。选模型做开发任务,还是得用自己的代码库和真实场景跑一遍。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
13:00
20d ago
● P1TechCrunch AI· rssEN13:00 · 07·08
General Intuition融资3.2亿美元押注游戏数据赋能机器人
General Intuition 刚拿了 3.2 亿美元融资,估值 23 亿。CEO Pim de Witte 在播客里说,ChatGPT 这类大语言模型对空间和时间的理解很差,而游戏数据正好能补上这个缺口。他们用 8 分钟的真实世界数据就让一个机器人能在办公室里自己认路,这点挺有意思。公司还拒绝了 OpenAI 的收购,自己做了个叫 Nerve 的...
#Robotics#General Intuition#Pim de Witte#Coatue
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
用游戏数据训练机器人,思路不新,但融了3.2亿美元说明有人愿意赌。正文没披露具体技术指标,这点先别太激动。
锐评
General Intuition 拿了 3.2 亿美元,估值 23 亿,投资人包括 Coatue 和贝索斯。他们想用游戏里产生的操作数据来训练机器人,让机器学会物体在空间和时间里怎么动,补上纯语言模型不懂物理世界的短板。CEO 在播客里提了一个例子:只用 8 分钟的真实办公室数据,就让机器人能在陌生环境里自己导航。这个数字听起来很省数据,但正文没交代成功率、重复实验次数,也没说这 8 分钟数据具体包含什么场景,所以实际泛化能力要打个问号。 公司是从游戏录屏平台 Medal TV 分出来的,还做了一个叫 Nerve 的众包平台,让玩家接数据标注和远程操控的活儿,算是给自己铺数据管道。他们拒绝过 OpenAI 的收购要约,选择独立发展。整篇报道来自一期播客对谈,不是技术论文或产品发布,很多细节停留在口头描述,缺可复现的基准测试和第三方验证。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
06:05
20d ago
● P1AI HOT 精选· aihot-apiZH06:05 · 07·08
工信部警告:Claude Code 部分版本有后门,会偷传你的位置和身份信息
工信部发了风险提示,说 Claude Code 从 2.1.91 到 2.1.196 这几个版本里藏了监控代码,没经过你同意就把位置、身份标识这些敏感数据传到远程服务器。建议正在用的团队马上排查,要么卸载,要么升到已经去掉后门的最新版,同时把开发工具的外联权限和流量监控收紧,别让数据偷偷溜出去。正文没说是 Anthropic 自己放的还是第三方塞进去的...
#MIIT#Anthropic#Claude Code#Policy
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
Claude Code 被曝藏后门,2.1.91 到 2.1.196 版本会偷传位置和身份信息。正文没说是谁塞的,也没说影响多大,先别急着下结论,但排查和升级别拖。
锐评
工信部这次点名很直接,Claude Code 在 2.1.91 到 2.1.196 这几个版本里内置了监控代码,不经用户同意就把位置、身份标识这类敏感数据往外传。对用这个工具做开发的团队来说,风险不小——开发环境里通常躺着密钥、代码库和内部文档,一旦外联没管住,泄露面会很大。 不过原文有两个关键缺口:第一,没说是 Anthropic 自己放的还是供应链被人动了手脚;第二,没有披露实际受影响的范围和已确认的泄露事件。这两点直接决定这事是产品恶意行为还是安全事件,现在下判断还太早。 建议先做三件事:排查内部有没有在用受影响版本,有就立刻卸载或升到官方确认清理后的版本;收紧开发工具的外联权限,别让它随便往外连;把流量监控拉起来,看有没有异常外传。如果是真的后门,这事比一般的漏洞严重得多,别等官方通报了再动。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
05:25
20d ago
● P1Hacker News 首页· rssEN05:25 · 07·08
研究人员发现GitHub Copilot跨仓库记忆漏洞可泄露私有代码
Noma Security 的研究员发现 GitHub Copilot 的 AI 编程助手有个跨仓库记忆的漏洞。他们在公开仓库里埋下诱饵代码,然后引导助手回忆它之前在私有仓库里“看”过的上下文,结果助手真的把不该公开的代码片段输出了。这个攻击不是无差别泄露,攻击者得事先知道私有库里大概有什么,但它暴露了 AI 编程工具在权限边界上的真实缺口。文章没提 ...
#GitHub#GitHub Copilot#Noma Security
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
安全团队用“跨仓库记忆”骗过 GitHub Copilot,让它把私有代码片段吐了出来。
锐评
Noma Labs 的研究人员发现,GitHub Copilot 的 AI 编程助手在处理跨仓库的上下文时,会记住并复现其他仓库里的代码。他们利用这一点,构造了一个“提示词注入”攻击:先让 Copilot 读一段精心设计的公开代码,再诱导它在私有仓库里把之前记住的敏感代码片段补全出来。 这个漏洞的核心在于 Copilot 的“记忆”机制没有做好仓库之间的隔离。原文没有披露受影响的具体版本范围和修复时间线,也没有说明 GitHub 是否已经确认并修补。目前公开的只有安全团队单方面的技术博客,缺乏 GitHub 官方的回应。 对开发者来说,这意味着如果你在 Copilot 开启的状态下编辑私有仓库,理论上存在泄露风险。但实际利用需要攻击者能控制你引用的公开代码,门槛不低。建议先关注 GitHub 后续的安全公告,别急着关掉 Copilot,但敏感项目可以暂时限制其使用范围。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
00:00
20d ago
● P1OpenAI 博客· rssEN00:00 · 07·08
OpenAI 推出 GPT-Live 全双工语音模型 支持实时边听边说
OpenAI 推出了新的语音模型 GPT-Live,取代了之前必须轮流发言的 Advanced Voice Mode。它最大的变化是用了全双工架构,能边听边说,会在你说话时用“嗯”、“对”这类词给反馈,你停下来思考时它也不会抢话。遇到需要搜索或复杂推理的问题,GPT-Live 会把任务丢给后台的 GPT-5.5 去处理,自己继续跟你聊,等结果出来再接上...
#Audio#Reasoning#Agent#OpenAI
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 发了 GPT-Live,能边听边说的全双工语音模型,对话更像真人。但别急着激动,目前只有官方演示,实际延迟和打断体验还得等上手。
锐评
GPT-Live 最大的变化是架构:从“你说完我再说”的回合制,变成了能同时听和说的全双工。这意味着它可以在你说话时用“嗯”“对”来回应,或者在你思考时安静等着,不会因为停顿就抢话。官方说它每秒能做多次交互决策,还能在后台把需要搜索或复杂推理的任务丢给 GPT-5.5 去跑,自己继续跟你聊。 从评测看,GPT-Live-1 在 GPQA 科学推理和 BrowseComp 网页搜索任务上都比之前的 Advanced Voice Mode 强,5-10 分钟对话里用户也更偏好它。但正文没披露具体的延迟数字、打断准确率,也没说这些评测是实验室环境还是真实用户场景。另外,API 还没开放,开发者只能填表等通知。 我会先打个折:全双工语音在工程上确实难做,但“更像真人”这件事,最终要看它在嘈杂环境、长对话和跨语言场景里会不会崩。现在还缺第三方实测和 API 定价,这两点决定了它到底是真可用,还是又一个炫技 demo。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1

更多

频道

后台