ax@ax-radar:~/feed $ tail -f signal.log
33 srcsignal 65%cycle 04:32

热点聚合 · 2026-08-12

27 signals · updated 3m ago
live · 88 today·policy v2
AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·
RSS live
2026-08-12 · 星期三2026年8月12日
16:54
41d ago
● P1Hacker News 首页· rssEN16:54 · 08·12
xAI发布Grok 4.6,在智能体任务上领先同级模型
Grok 4.6 在 Artificial Analysis 的智能指数上拿了 61 分,比上代高了 5 分,和 GPT-5.6 Sol 打平,只比 Claude Opus 5(63 分)和 Claude Fable 5(62 分)低一点。它最亮眼的是智能体任务:在模拟真实知识工作的 GDPval-AA v2 测试里 Elo 分达到 1753,仅次于 ...
#SpaceXAI#Grok 4.6#Artificial Analysis
精选理由
精选 · 重要度 95 · 吸引力 + 知识量 + 共鸣
一句话点评
Grok 4.6 在智能体跑长任务的基准上追平了 GPT-5.6 Sol,但 Terminal-Bench 得分只有 26%,说明它在命令行这类实操环境里还不太稳。
锐评
xAI 这次发布的 Grok 4.6,核心卖点是让模型在长流程的智能体任务里干活更稳。从官方给的跑分看,它在 AA Intelligence 综合指数上拿了 61 分,跟 GPT-5.6 Sol 打平,比自家上一代 Grok 4.5 的 56 分有明显提升。在 CursorBench 和 DeepSWE 这类偏工程和代码的测试里,分数也咬得很紧,说明模型在需要多步推理和跨文件操作的场景下确实变强了。 不过有几个数字得打个折看。Terminal-Bench v3.0 只拿了 26%,远低于 GPT-5.6 Sol 的 34.6%,说明它在直接操作终端、处理复杂命令行任务时还是短板。另外,官方说训练用了“精选模型生成数据”和“改进的优化器”,但没给出具体的数据规模和算力投入,也没提长任务跑到多少步之后会开始出错或忘事。价格方面,输入每百万 token 2 美元、输出 6 美元,还有个快版价格翻倍,但正文没披露快版的具体延迟数据。 整体看,Grok 4.6 在把想法变成可运行原型的这条路上走得更远了,但它在真实命令行环境下的可靠性,以及长时间运行后的稳定性,还需要第三方评测来验证。
HKR 分解
hook knowledge resonance
打开信源
95
SCORE
H1·K1·R1
16:20
41d ago
● P1Hacker News 首页· rssEN16:20 · 08·12
Lovable完成4亿美元C轮融资估值达133亿美元
Lovable 刚宣布完成 4 亿美元 C 轮融资,估值 133 亿美元,由 Menlo Ventures 和 EQT 的基金领投。这家公司做的是 AI 应用搭建平台,让不会写代码的人也能靠描述想法直接生成软件。从 2024 年 11 月上线到现在,用户已经建了超过 6000 万个项目,用 Lovable 搭出来的应用每月总访问量超过 9 亿次。近八成...
#Agent#Lovable#Menlo Ventures#EQT
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
Lovable 拿了 4 亿美元,估值半年翻倍到 133 亿,年化收入冲到 5 亿。但正文没披露利润和续费率,这个估值先打个折看。
锐评
Lovable 这轮融资速度和估值膨胀都很快。去年 12 月才以 66 亿估值融了 3.3 亿,现在 8 个月后估值直接翻倍到 133 亿,又拿了 4 亿。公司说 6 月年化收入(ARR)到了 5 亿美元,按这个算估值大约是 26 倍 ARR,在 SaaS 里不算便宜,但如果是真的增速确实猛。 几个数字值得留意:平台上有 6000 万个项目,每月 9 亿访客,说明用户量很大,但文章没提付费用户占比和客户留存。另外他们开始用自己的模型,还跟 Google Cloud 签了多年合同,成本结构会怎么变也没说。 信息缺口很明显:没看到毛利率、净收入留存率、烧钱速度。光靠 ARR 和估值数字,只能判断市场在赌它成为 AI 开发工具的入口,但能不能跑通单位经济还缺关键数据。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
16:10
41d ago
● P1AI HOT 精选· aihot-apiZH16:10 · 08·12
阿里首次把 Qwen-Max 级别的模型权重放出来了,总参数 2.4 万亿,每次只激活 950 亿
阿里 Qwen 团队开源了 Qwen3.8-2.4T-A95B,这是他们第一次把云端最强模型级别的权重直接公开。模型用了混合专家架构,总共 2.4 万亿参数,但每次计算只激活其中的 950 亿,所以跑起来比同体量的稠密模型省算力。它原生支持 26 万多 token 的上下文,能一口气处理整本小说,还能扩展到 101 万 token。训练时加入了多 to...
#Agent#Code#Alibaba#Qwen
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
阿里把自家云端最强模型Qwen-Max的权重直接公开了,2.4万亿参数每次只激活950亿,跑起来比同体量模型省算力。但正文没披露开源许可证和跑推理需要多大显存,想试的同学先确认硬件门槛。
锐评
阿里这次把Qwen-Max级别的模型权重放出来,是实打实的动作。模型用混合专家架构,总共2.4万亿参数,每次计算只激活950亿,相当于一个超大团队里每次只叫10个专家加1个常驻顾问干活,比同样体量的稠密模型省不少算力。原生支持26万token上下文,能一口气吞下整本小说,还能扩展到101万token,处理长文档和长周期任务有天然优势。 官方说训练时加了多token预测,让模型一次能猜后面好几个词,推理速度有提升空间。后训练部分提到用组合环境扩展、统一奖励系统和在线数据均衡器来降低训练波动,思路是让模型在更杂更真的任务里练手,而不是靠人工一个个定制场景。跑分上和Opus 4.8、GPT 5.6 Sol互有胜负,在PaperBench这类偏学术写作的指标上拿了所列模型里的高分。 不过这篇公告缺了两个关键信息:一是没写开源协议是什么,商用是否受限完全不清楚;二是没给推理需要的硬件配置,2.4T的模型权重全加载需要多少显存、最低用什么卡能跑,这些都没提。想在生产环境用的团队得自己踩坑验证。另外,云端版Qwen3.8-Max说加了更多生产环境能力,但具体加了什么、和开源版差多少,也没展开说。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
16:04
41d ago
● P1Hacker News 首页· rssEN16:04 · 08·12
DeepSeek V4 Pro正式版上架OpenRouter和硅基流动平台
DeepSeek 把 V4 Pro 的正式版(GA)挂上了 OpenRouter。这是个超大规模的混合专家模型,上下文窗口能塞进 100 万 token,差不多是一整套三体三部曲的量。价格定在输入 $0.435/1M、输出 $0.87/1M,在目前的大模型里算便宜的那档。不过现在只有一个供应商在跑,OpenRouter 收到请求直接转发,没得选路。页面...
#DeepSeek#OpenRouter
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
DeepSeek V4 Pro 正式版上线,1M 上下文,输入 $0.435/百万 token,输出 $0.87。价格比预览版涨了,但上下文窗口直接拉满。
锐评
DeepSeek V4 Pro 的正式版(GA)在 OpenRouter 和硅基流动上架了。这是一个大规模混合专家模型,上下文窗口直接给到 100 万 token,意味着它能一口气处理像《三体》三部曲那么厚的文本。价格方面,输入每百万 token 0.435 美元,输出 0.87 美元。这个价格比之前 V3 的 API 贵了不少,但考虑到 1M 上下文的推理成本,涨幅在预期之内。 目前 OpenRouter 上只有一个供应商在托管这个模型,没有做多路由分发,所以可用性和延迟完全取决于这一家。正文没披露具体的性能跑分和吞吐量数据,只给了定价和上下文信息。OpenRouter 页面上的性能图表是空的,没法判断实际生产环境下的首 token 延迟和生成速度。 还缺什么:没有看到任何官方技术报告或基准测试对比,不知道它跟 V3 或者同期的 Claude、GPT 比到底强在哪。硅基流动那边的部署细节、国内定价和并发限制也完全没提。建议等第一批实测数据出来再决定要不要切生产流量。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
15:32
41d ago
● P1Hacker News 首页· rssEN15:32 · 08·12
xAI发布Grok4.6,优化长周期智能体任务能力
Grok 4.6 在 4.5 基础上多跑了一轮训练,重点让模型能处理步骤多、周期长的智能体任务,比如把一个宽泛的产品想法直接做成能跑的第一版应用,过程中还会自己检查代码。它在 AA 智能指数上跟 GPT-5.6 Sol 打平,CursorBench 得分 69.9%。API 价格是输入每百万 token 2 美元、输出 6 美元,今天在 Cursor ...
#Agent#Code#Reasoning#xAI
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Grok 4.6 主打长时间跑任务的智能体,跑分追上 GPT-5.6 Sol,但 Terminal-Bench 只有 26%,命令行操作还不太行。
锐评
xAI 这次发布的 Grok 4.6,核心卖点不是聊天,而是让模型自己拆解复杂任务、多步执行,比如把一个想法直接做成能跑的网页应用。从跑分看,它在 AA Intelligence 综合分上追平了 GPT-5.6 Sol,DeepSWE 编程分也到了 65.9%,比前代 4.5 的 54% 有明显提升。 但别急着下结论。这些分数大部分来自 xAI 自己公布的评测,第三方独立验证还不多。而且 Terminal-Bench 只有 26%,说明模型在纯命令行环境里干活还比较吃力,离“全能打工人”有距离。价格是输入每百万 token 2 美元、输出 6 美元,不算便宜。 正文没提模型参数量、训练数据截止时间,也没说长时间任务具体能跑多少步不跑偏。这些缺口让“专注长时间智能体”这个说法暂时只能打个折看。
HKR 分解
hook knowledge resonance
打开信源
100
SCORE
H1·K1·R1
02:05
41d ago
● P1Hacker News 首页· rssEN02:05 · 08·12
医学研究公司Research Gold宣称100%人工撰写却全由AI运营
Research Gold 对外宣称提供“100%真人撰写、绝不用AI”的系统性综述和荟萃分析服务,网站上列了8位博士方法论专家。404 Media 调查发现,这8个人全是AI生成的假身份,没有任何发表记录,头像也是AI画的。另一组“方法论专家”倒是真人,但身份是从领英上直接扒来的——其中一位叫 Jenny Berrio 的科学家确认自己从未在这家公司...
#Research Gold#Jenny Berrio#404 Media
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
一家号称“100%人类撰写、绝不用AI”的医学研究公司,从员工头像到客服电话全是AI生成的,连真人专家信息都是从领英偷的。
锐评
这事荒诞到像洋葱新闻,但404 Media的记者实打实验证了:Research Gold网站上8位核心方法论专家全是AI虚构人物,头像一眼假,学术履历搜不到。另一批“真人专家”更离谱,直接盗用领英上的真实身份,连人家头像里的“#opentowork”水印都没去掉。记者打电话过去,AI客服“Sarah”死咬自己是真人,被反复追问后只会机械地把话题拉回推销话术。 这家公司卖的是医学系统综述和元分析服务,号称遵循PRISMA 2020和Cochrane手册标准——这些都是对严谨性要求极高的活儿。如果连“人”都是假的,交出来的论文质量根本无从验证。正文没披露是否有客户因此发表了问题论文,也没说清楚那些已发表的合作论文里AI参与到了什么程度。 目前已知一位被盗用身份的专家Jenny Berrio已准备发律师函要求下架信息。Research Gold在记者联系她之后火速删掉了那批真人页面,但没做任何公开回应。这事最让人后怕的不是AI冒充人类,而是有人敢在需要严格同行评审的医学领域这么干。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1

更多

频道

后台