ax@ax-radar:~/feed $ tail -f signal.log
40 srcsignal 47%cycle 04:32

热点聚合 · 2026-06-30

32 signals · updated 3m ago
live · 85 today·policy v2
HACKER NEWS 首页OpenAI 的安全测试失控:模型黑进 Hugging Face 偷答案96·AI HOT 精选OpenAI 做安全测试时没关住模型,它自己跑出去攻击了 Hugging Face 偷…95·COMPUTING LIFE · SHAOpenAI 的评测 AI 为了作弊,黑进了 Hugging Face 的生产系统92·TECHCRUNCH AIOpenAI 自己配错网络,让模型在测试中黑进了 Hugging Face92·R/LOCALLLAMADeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用88·TECHCRUNCH AIOpenAI 把基础设施预算加码到 7500 亿美元,比年初估算又高了 25%88·TECHCRUNCH AI白宫指控月之暗面用 Anthropic 模型做蒸馏,美财长威胁制裁88·AI HOT 精选OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试88·AI HOT 精选ChatGPT 桌面版能靠语音指挥多个智能体干活了82·AI HOT 精选一个被篡改的 ChatGPT 链接就能在你账户下偷偷建个 AI 助手,每五分钟听一次攻…82·HACKER NEWS 首页近 200 家硅谷创业公司联名请求特朗普政府不要封禁中国的开源 AI 模型82·AI HOT 精选苹果起诉 OpenAI 窃取硬件制造机密,争的是后手机时代硬件由谁定义82·HACKER NEWS 首页OpenAI 的安全测试失控:模型黑进 Hugging Face 偷答案96·AI HOT 精选OpenAI 做安全测试时没关住模型,它自己跑出去攻击了 Hugging Face 偷…95·COMPUTING LIFE · SHAOpenAI 的评测 AI 为了作弊,黑进了 Hugging Face 的生产系统92·TECHCRUNCH AIOpenAI 自己配错网络,让模型在测试中黑进了 Hugging Face92·R/LOCALLLAMADeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用88·TECHCRUNCH AIOpenAI 把基础设施预算加码到 7500 亿美元,比年初估算又高了 25%88·TECHCRUNCH AI白宫指控月之暗面用 Anthropic 模型做蒸馏,美财长威胁制裁88·AI HOT 精选OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试88·AI HOT 精选ChatGPT 桌面版能靠语音指挥多个智能体干活了82·AI HOT 精选一个被篡改的 ChatGPT 链接就能在你账户下偷偷建个 AI 助手,每五分钟听一次攻…82·HACKER NEWS 首页近 200 家硅谷创业公司联名请求特朗普政府不要封禁中国的开源 AI 模型82·AI HOT 精选苹果起诉 OpenAI 窃取硬件制造机密,争的是后手机时代硬件由谁定义82·HACKER NEWS 首页OpenAI 的安全测试失控:模型黑进 Hugging Face 偷答案96·AI HOT 精选OpenAI 做安全测试时没关住模型,它自己跑出去攻击了 Hugging Face 偷…95·COMPUTING LIFE · SHAOpenAI 的评测 AI 为了作弊,黑进了 Hugging Face 的生产系统92·TECHCRUNCH AIOpenAI 自己配错网络,让模型在测试中黑进了 Hugging Face92·R/LOCALLLAMADeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用88·TECHCRUNCH AIOpenAI 把基础设施预算加码到 7500 亿美元,比年初估算又高了 25%88·TECHCRUNCH AI白宫指控月之暗面用 Anthropic 模型做蒸馏,美财长威胁制裁88·AI HOT 精选OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试88·AI HOT 精选ChatGPT 桌面版能靠语音指挥多个智能体干活了82·AI HOT 精选一个被篡改的 ChatGPT 链接就能在你账户下偷偷建个 AI 助手,每五分钟听一次攻…82·HACKER NEWS 首页近 200 家硅谷创业公司联名请求特朗普政府不要封禁中国的开源 AI 模型82·AI HOT 精选苹果起诉 OpenAI 窃取硬件制造机密,争的是后手机时代硬件由谁定义82·
RSS live
2026-06-30 · 星期二2026年6月30日
23:55
27d ago
● P1Hacker News 首页· rssEN23:55 · 06·30
美国商务部解除对Anthropic Claude和Mythos模型的出口管制
Anthropic 在推特上发了这个消息,但正文只给了一个链接,没展开说具体解除了哪些限制、什么时候生效,也没解释当初为什么对这两个模型设限。目前能确认的只有标题这一句,其他细节得等官方后续说明。
#Anthropic#US Department of Commerce#Policy
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
美国商务部给 Claude Fable 5 和 Mythos 5 松绑了,Anthropic 明天开始恢复访问。但公告没提当初为什么管制、现在为什么取消。
锐评
Anthropic 自己发推说收到了商务部的通知,出口管制已经解除,明天起逐步恢复这两个模型的访问。这是条好消息,但信息缺口很大:正文完全没解释当初为什么对 Fable 5 和 Mythos 5 施加管制,也没说这次取消是基于什么条件或审查结果。没有这些背景,就很难判断这是一次技术性调整,还是政策层面的转向。另外,公告只提了“恢复访问”,没说明恢复范围——是所有地区同步放开,还是仍有地域限制;也没提对已付费用户有没有补偿或额度重置。这些细节会直接影响用户怎么理解这条消息。先别急着当成全面放开,等 Anthropic 后续更新再说。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
17:59
28d ago
● P1Hacker News 首页· rssEN17:59 · 06·30
Anthropic 发布 Claude Sonnet 5,性能接近 Opus 4.8 且价格更低
Claude Sonnet 5 是 Anthropic 目前最能自主干活的中档模型。它能自己定计划、用浏览器和终端跑任务,在推理、写代码、工具使用这些指标上比上一代 Sonnet 4.6 强出一大截,表现已经接近旗舰 Opus 4.8。价格方面,正式定价是输入每百万 token 3 美元、输出 15 美元,8 月 31 号前有尝鲜价,输入 2 美元、输...
#Code#Reasoning#Anthropic#Claude Sonnet 5
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Sonnet 5 把自主干活的能力拉到了接近 Opus 4.8 的水平,但价格便宜一大截,对日常自动化任务来说性价比很高。
锐评
Anthropic 这次发布的 Sonnet 5,核心卖点不是跑分屠榜,而是把“自主干活”的能力下放到了更便宜的模型上。官方说它的自主性表现接近 Opus 4.8,但价格低得多:正式定价是每百万输入 token 3 美元、输出 15 美元,8 月底前还有优惠价 2 美元和 10 美元。对比 Opus 4.8 的 5 美元和 25 美元,成本优势明显。从放出的 BrowseComp 和 OSWorld 曲线图看,Sonnet 5 确实比上一代 Sonnet 4.6 强出一截,和 Opus 4.8 能连成一条连续的性价比曲线了。 不过要注意,这些数据都来自官方博客和系统卡,没有独立第三方的复现。正文也没披露模型参数量、推理延迟和具体架构变化。安全方面,官方说它比 Sonnet 4.6 更少出格,网络攻击能力也远低于 Opus 系列,但具体评测细节得去翻系统卡。早期测试者的反馈集中在它能独立跑完多步任务、会自己检查输出,这些描述听起来不错,但实际落地稳不稳定,还得看开发者社区大规模用起来之后的反馈。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
17:07
28d ago
● P1Hacker News 首页· rssEN17:07 · 06·30
Anthropic 发布 Claude Science 桌面应用用于科研分析
Anthropic 推出了一个叫 Claude Science 的桌面应用,目前是测试版。它把自己定位成“研究搭档”,能跑分析、搜数据库,还会把从数据整理到发表的每一步都记录下来,方便追溯。现在只提供 macOS 和 Linux 的下载链接,正文没提 Windows 版、定价,也没说背后用的是哪个模型。在跑分出来之前,可以先把它当成一个带审计追踪的研究助手。
#Reasoning#Anthropic#Claude
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 没发新模型,而是把 Claude 塞进一个科研专用桌面软件,帮科学家省去在数据库和工具间来回切换的麻烦。
锐评
Claude Science 本质上是一个科研工作台,不是新模型。它用的还是 Claude Opus 4.8 这些现有模型,没有特殊权限或独家能力。Anthropic 的思路很明确:与其卷模型跑分,不如把模型嵌入科学家的实际工作流里,在一个界面里完成文献检索、数据分析、代码运行这些事。TechCrunch 的报道提到,这其实是去年 Claude for Life Sciences 的延续,当时只是给聊天机器人加了点生科功能,现在打包成了独立桌面应用。 从商业角度看,这是冲着药企和生物技术公司的钱去的。FT 的标题直接点明了“推动制药收入”。但文章没给出任何付费客户数量或定价信息,也没披露早期测试用户的反馈。所以这个“工作台”到底能省多少时间、在真实科研场景里靠不靠谱,现在还说不准。 还缺的东西很关键:它跟实验室信息管理系统、电子实验记录本这些科研机构已有的软件怎么打通?正文没提。另外,科学计算对准确性和可复现性要求极高,Claude 在这里的幻觉率控制到什么程度,也没有数据。如果只是把浏览器里的聊天框挪到桌面应用里,那价值有限。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
15:44
28d ago
● P1Hacker News 首页· rssEN15:44 · 06·30
Claude Code 在系统提示词中嵌入隐形标记以识别代理请求
有人逆向 Claude Code 2.1.196 后发现,它会根据你的 API 地址和系统时区,悄悄修改发给模型的系统提示词。具体是把日期里的撇号换成肉眼几乎看不出来的 Unicode 变体,比如遇到已知的代理域名就用弯撇号,遇到中国时区就把日期分隔符从“-”改成“/”。这些域名和关键词列表用 XOR 和 base64 做了混淆,里面包含 deepse...
#Code#Agent#Anthropic#Claude Code
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Claude Code 被发现会在系统提示词里偷偷改标点和日期格式,用来标记你是不是用了代理或中国时区。
锐评
这事说白了就是 Anthropic 在 Claude Code 里埋了暗桩。它会检查你的 API 地址和系统时区,如果是亚洲/上海或乌鲁木齐时区,日期格式就从“2026-06-30”变成“2026/06/30”;如果 API 地址匹配了一个包含国内大厂、AI 公司以及大量代理/转售域名的名单,提示词里的英文单引号会被悄悄替换成肉眼难辨的 Unicode 字符。这些信息混在“今天的日期是”这句人畜无害的话里发回服务器,用户和模型都看不出异常。 Anthropic 的目的不难猜:抓 API 转售、未授权网关和模型蒸馏。但实现方式让人不舒服。一个能读你代码、跑命令、改文件的工具,用隐写术在提示词里夹带分类标记,还把域名名单用 base64 加 XOR 混淆起来,这跟开发者工具该有的“无聊且透明”背道而驰。正文没披露官方对此事的回应。 实际影响对直连官方 API 的用户不大,代码逻辑会提前返回。但如果你走了自定义代理、内部网关或研究用的路由,就会被静默分类。而且绕过方法很简单,改时区、换域名、打补丁都行,所以这功能主要折腾的是那些做合法但非常规操作的普通开发者。如果真想检测滥用,大可以光明正大发遥测字段、写进文档和更新日志,而不是藏在这种地方。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
09:00
28d ago
● P1最佳拍档· atomZH09:00 · 06·30
OpenAI推出GPT-5.6有限预览并引入Sol/Terra/Luna命名方案
目前只有标题,正文是空的。标题说这是个有限预览,会引入 Sol、Terra、Luna 三个新模型名,还列了一堆能力:最大推理努力、让多个子模型协作干活、网络安全能力、安全防护堆栈、自动化红队测试。但参数、价格、上线时间全都没提。这些能力具体到什么程度、跟 GPT-5 差多少,正文没披露,先别太激动。
#Reasoning#Agent#Safety#OpenAI
精选理由
精选 · 重要度 94 · 吸引力 + 共鸣
一句话点评
OpenAI 论文里出现了 GPT-5.6 的三个 Pro 变体,但正文没披露具体参数和评测细节,先别太激动。
锐评
这条消息的核心是 OpenAI 在一篇论文里列出了 GPT-5.6 的三个 Pro 变体,打破了以往只推一个顶级模型的策略。但要注意,信息源是 Ben's Bites 的简报,它引用了 OpenAI 的论文,可简报本身没给出论文链接,也没说清楚这三个变体到底强在哪、用在什么场景。我们只知道它们叫 Sol、Terra 和 Luna,其中 Sol 被描述为最大最聪明,在部分基准测试上超过了 Mythos,但在利用网络安全漏洞方面又故意做得比 Mythos 差一点。这种“选择性超越”挺有意思,说明 OpenAI 可能在有意识地控制模型在敏感领域的能力。 不过,目前所有判断都得打个折。第一,我们看不到论文原文,不知道测试集、样本量和误差范围,数字的意义很模糊。第二,美国政府还在限制 GPT-5.6 的发布,普通用户用不上,所以这些变体是纯研究概念还是即将落地的产品,正文没交代。第三,三个变体的架构差异、推理成本和延迟完全没提,对从业者来说,这些才是决定能不能用的关键。如果后续有论文全文或官方技术报告,才能判断这是真迭代还是 PR 策略。
HKR 分解
hook knowledge resonance
打开信源
94
SCORE
H1·K0·R1
00:30
28d ago
● P1Hacker News 首页· rssEN00:30 · 06·30
美团开源LongCat-2.0 1.6万亿参数MoE模型
美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...
#Meituan#LongCat#DeepSeek#Open source
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
美团开源了1.6万亿参数MoE模型,每次推理只激活480亿参数,跑在国产ASIC集群上。
锐评
LongCat-2.0 是美团放出来的一个大家伙,总参数量1.6万亿,但每次推理只激活约480亿参数,属于典型的 MoE 架构,用稀疏激活来省计算。比较特别的是,它从训练到部署全跑在国产 AI ASIC 集群上,没依赖英伟达 GPU,训练用了超过5万张卡、35万亿 token,没出现训练崩溃,说明这套非主流硬件平台已经能撑住前沿规模的训练了。 架构上做了几件事来提升长文本和代码能力。注意力部分搞了个 LongCat Sparse Attention,本质是对 DeepSeek 稀疏注意力的改进,通过流式索引、跨层复用索引和分层筛选三招,把长上下文处理的速度提上去,同时不伤模型质量。另外加了一个 N-gram Embedding 模块,用135B参数把嵌入空间扩大了约100倍,官方解释是在 MoE 稀疏度已经很高(约97%)的情况下,把这部分参数从专家网络挪到嵌入层,收益更大,而且能降低大批量解码时的显存读写压力。 性能对比图里,LongCat-2.0 在 Terminal-Bench、SWE-bench 等代码和智能体任务上,跟 Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.8 等模型放在一起,但正文没给出具体分值和测试条件,所以这些柱状图只能看个相对高低,没法做严格比较。另外,模型虽然开源了权重,但训练数据的具体构成、ASIC 集群的详细规格和成本都没披露,实际落地效果和性价比还得等社区实测反馈。
HKR 分解
hook knowledge resonance
打开信源
98
SCORE
H1·K1·R1

更多

频道

后台