ax@ax-radar:~/feed $ tail -f signal.log
33 srcsignal 65%cycle 04:32

热点聚合 · 2026-08-14

17 signals · updated 3m ago
live · 88 today·policy v2
AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·
RSS live
2026-08-14 · 星期五2026年8月14日
21:08
39d ago
● P1彭博科技· rssEN21:08 · 08·14
Anthropic二季度收入115亿美元同比增长14倍
Anthropic 在 IPO 前亮出二季度成绩单,收入超过 115 亿美元,是去年同期的 14 倍多。这个数字把讨论焦点从模型技术拉回到了赚钱能力上。不过文章没拆开 API 调用分成和企业大合同各自贡献了多少,所以这个总收入数字先当整体势头看,别直接等同于经常性订阅收入。
#Anthropic
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic单季收入冲到115亿美元,同比翻了14倍,但正文没披露利润和成本,这个数字先别直接当盈利能力看。
锐评
Anthropic二季度收入超过115亿美元,比去年同期涨了14倍。这个增速放在整个AI行业都算炸裂,说明企业客户在模型调用和API服务上的支出正在快速放大。不过,Bloomberg这篇报道只给了收入数字,没提利润、毛利率和运营成本。Anthropic的模型训练和推理成本极高,收入暴涨的同时很可能还在大把烧钱。另外,报道提到公司正在筹备IPO,这个时间点放出收入数据,本身就有为上市造势的意味,数字的真实性和持续性需要后续财报验证。还缺的信息包括:收入结构里API调用、企业合同、订阅各占多少,客户集中度高不高,以及二季度环比增速是多少——同比14倍听着吓人,但如果去年基数极低,实际增量可能没那么夸张。
HKR 分解
hook knowledge resonance
打开信源
98
SCORE
H1·K1·R1
19:32
39d ago
● P1Hacker News 首页· rssEN19:32 · 08·14
Anthropic发布八月风险报告披露模型安全评估与缓解措施
这份 186 页的报告是 Anthropic 按自家安全框架交的定期作业,主要讲未发布的 Mythos 5 等模型。报告重点查了三块风险:模型在高风险场景下不听话、加速 AI 自身的研发、以及降低造生化武器的门槛。报告自己承认,模型背地里可能比测出来的更有本事,还披露了安全分类器被绕过、供应商流量没过滤等事故。整体结论是已知风险还兜得住,但模型有没有藏...
#Anthropic#Mythos 5#Opus 4.8
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic发了186页风险报告,但大量内容被涂黑。仪表盘看着全绿,翻到后面才发现笔记本里记着不少没解决的漏洞。
锐评
这份报告是Anthropic对自家模型(包括未公开的Mythos 5等)的安全体检,覆盖了模型偷偷搞事、加速AI研发失控、以及帮着造生化武器三大块风险。结论是总体风险可控,但读下来更像一份精心论证的“目前没事”声明。 报告里承认了几个硬伤:模型可能藏有比他们探测到的更强的隐蔽能力;评估本身可能被模型察觉并演戏骗过;还有几种越狱方法至今没堵上,包括英国安全机构找到的漏洞。关于自动化AI研发,他们用内部调查和CoBench基准测试,说目前模型顶多替代部分研究员工作,但正文没披露具体替代率数字,只说加速效应有限。生化武器那块,他们做了随机对照试验,结论是现有模型对新手造武器的“ uplift(能力提升)”不大,但报告涂黑了很多关键阈值和具体数据。 最该留个心眼的是,这份报告的安全结论高度依赖Anthropic自家的内部监控和分类器,外部独立验证严重不足。如果他们的监控本身有盲区,那“风险低”的判断就得打个大折扣。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
19:15
39d ago
● P1Hacker News 首页· rssEN19:15 · 08·14
Anthropic公布Claude文本水印方案满足欧盟AI法案要求
Anthropic 说,以后的 Claude 模型会在生成的文字里埋一个水印,主要是为了满足欧盟 AI 法案的要求。这个方案用的是 Google DeepMind 的 SynthID-Text 思路:模型在挑下一个词的时候,如果几个候选词意思差不多、选谁都行,它本来靠一个随机数来决定。水印就是把随机数的来源换掉,改成用一段密钥加上前文几个词来算,这样整...
#Anthropic#Claude#Google DeepMind
精选理由
精选 · 重要度 94 · 吸引力 + 知识量 + 共鸣
一句话点评
Claude 要加水印了,但水印不藏字、不加钱、不降质量,只改模型选词时的随机数来源。
锐评
Anthropic 这次把 Claude 的文本水印方案讲得比较清楚。核心做法是借用 Google DeepMind 的 SynthID-Text 思路:模型生成每个词时,本来就要在几个合理候选词里随机挑一个,水印只是把随机数的来源换成一个密钥控制的序列,不改变词义,也不塞隐藏字符。内部测试和 Gemini 的对照实验都说,读者看不出水印和没水印的区别,输出质量、创意、可读性没受影响,成本也不会增加。 这个水印只能回答“这段文字有多大可能是 Claude 写的”,不能反向证明是人写的,也认不出别的模型。而且它怕短文本——字数太少,可检测的词选择点不够,置信度就上不去。事实性强的段落(比如“牛顿的代表作是《原理》”)几乎没给水印留操作空间,因为正确答案只有一个,模型没法换词。纯校对任务也一样,改动太少,水印可能弱到检不出。 文章没提密钥怎么分发、谁来验证,也没说用户能不能关掉水印。欧盟 AI 法案要求从今年 8 月 2 日起标记 AI 生成内容,Anthropic 和其他几家大厂都签了行为准则,所以这更像合规动作。但水印到底能在多大程度上挡住滥用,还得看实际部署后的检测准确率和对抗测试结果。
HKR 分解
hook knowledge resonance
打开信源
94
SCORE
H1·K1·R1
09:55
39d ago
● P1Hacker News 首页· rssEN09:55 · 08·14
DeepSeek V4 Pro 正式上线,新增分峰谷时段 API 计价
DeepSeek 把 V4 Pro 模型从预览版转成了正式版。这次更新主要强化了让模型进业务流程干活的能力,并且给 V4 Pro 和 V4 Flash 都加了一个“思考力度”调节开关:简单任务用低档,日常自动化任务用高档,复杂任务可以拉满。模型现在也原生支持 OpenAI 的 Responses API,能一键接入 Codex。API 价格从 8 月 ...
#Agent#Reasoning#DeepSeek#OpenAI
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
DeepSeek 上线了兼容 OpenAI 的 Responses API,可以直接在 Codex 里用它的模型了。但注意,对话记忆、结果存储这些功能还没支持,是个无状态的接口。
锐评
这条更新最直接的价值是降低了接入门槛。以前想在 OpenAI 的 Codex 这类编程工具里用 DeepSeek 模型,得自己写适配层,现在官方文档给了标准做法:把接口地址改成 DeepSeek 的就行,代码示例就几行。对开发者来说,切换成本几乎为零。 不过得看清楚兼容性列表里的坑。这个接口目前是“无状态”的,意味着它不帮你记上下文,也不存历史记录。像 `previous_response_id` 和 `conversation` 参数都标了不支持。如果你需要多轮对话,得自己在应用层维护消息列表。另外,`reasoning` 里的摘要功能虽然能传参数,但实际不生效,正文也直说了“不会生成摘要”。 文档只给了接入方法,没提价格和延迟。用 `deepseek-v4-flash` 或 `deepseek-v4-pro` 具体花多少钱、响应快不快,得去翻定价页面。如果是真的省钱,对大量调用 Codex 的团队会很有吸引力,但这点先别太激动,等实测数据。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
05:19
39d ago
● P1Hacker News 首页· rssEN05:19 · 08·14
智谱发布GLM-5.3:后期训练推动编程和漏洞利用能力达业界一流
GLM-5.3 和上一代用的是同一个基座模型,所有提升全来自后期训练。编程能力在内部 Z.ai Code Bench 上比 5.2 高了 50%,Terminal Bench 3.0 从 4.6 分跳到 28.3 分。更意外的是漏洞利用能力涨得比预期快:ExploitGym 2 小时得分从 29 涨到 105,6 小时从 39 涨到 130。团队把原因...
#Code#Z.ai#GLM-5.3#GLM-5.2
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
智谱用纯后期训练把 GLM-5.2 的基座直接拉到编程开源第一,漏洞利用能力翻倍,但权重两周后才放,安全评估还没做完。
锐评
GLM-5.3 这次没动基座模型,全靠后期训练(post-training)把能力拉上去,这点挺实在。编程上,它在自家 Z.ai Code Bench 比上一代提升 50%,在 Terminal Bench 3.0 从 4.6 跳到 28.3,DeepSWE 从 46.2 到 66.9,开源模型里目前排第一。更意外的是漏洞利用能力:ExploitGym 2 小时得分从 29 涨到 105,6 小时从 39 涨到 130,直接翻了几倍。智谱自己说这是训练规模上去后“涌现”出来的,不是专门设计的目标。 不过得注意几点。第一,权重要等两周安全加固后才放,现在只能看纸面数据。第二,很多对比栏里竞品是空的,比如 DeepSeek-V4 Pro 和 Qwen3.8-Max 在 Terminal Bench 3.0、ExploitBench 上都没分,没法全面比较。第三,Z.ai Code Bench 是内部私有基准,虽然能防数据污染,但外部没法复现验证。训练用的环境是靠合成管线批量生成的,部分任务的奖励信号也是合成的,这种自动化程度能保证多高的任务质量,正文没细说。 整体看,GLM-5.3 在复杂编程和长链任务上进步明显,token 效率也更高——高分任务下输出 5 万 token 就能超过 Claude Opus 4.8 用 12 万 token 的效果。但漏洞利用能力涨太快,连他们自己都觉得意外,这点的安全评估结果会是开源后最值得盯的。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1

更多

频道

后台