ax@ax-radar:~/curated $ grep -l 'curated=true' sources/
33 srcsignal 72%cycle 04:32

AX 严选 · 2026-09-02

13 · updated 3m ago
2026-09-02 · 星期三2026年9月2日
21:39
20d ago
● P1AI HOT 精选· aihot-apiZH21:39 · 09·02
Meta发布Muse Spark 1.3,智力评分62接近Claude和GPT
Meta 五个月内发了第四个 Muse Spark 版本,这次是 1.3。最强的 max 变体在 Artificial Analysis 的智力指数上拿了 62 分,已经贴近 Claude 和 GPT-5.6 的水平。不过这个 max 版目前只是给合作伙伴的限时预览,正文没提参数量、推理成本,也没说什么时候公开。
#Meta#Muse Spark#Artificial Analysis
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
Meta 新模型智力评分 62,接近 Claude 和 GPT,但正文没披露具体测试条件和模型规模,先别太激动。
锐评
Meta 放出了 Muse Spark 1.3,主打智能体任务和科学推理,智力评分 61-62 分,这个分数已经逼近 Claude 和 GPT-5.6 的水平。数字看着挺能打,但得先打个折:目前只有 RSS 标题和摘要,正文是空的,具体评测基准、模型参数量、推理成本这些关键信息全都没披露。 智力评分 62 这个数字本身需要上下文——它是在什么测试集上跑的,对比的 Claude 和 GPT 具体是哪个版本,测试条件是否对等,这些都不知道。另外,模型叫 Spark,听起来像是轻量级路线,如果真是小模型跑出接近大模型的分数,那成本优势会是个看点。但正文没给任何架构细节,也没提是开源还是闭源,这些缺口让判断只能停在标题层面。 等完整技术报告出来,重点要看推理延迟、硬件需求和实际任务上的稳定性,光一个智力评分说明不了太多。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
16:35
20d ago
AI HOT 精选· aihot-apiZH16:35 · 09·02
Google AI 团队分享:怎么给“用模型当裁判”写一份靠谱的评分标准
这是 Google AI 系列文章的第二篇,讲的是怎么让“用大模型给大模型打分”这件事更靠谱。核心思路是把评分标准写成一组严格、客观的是非题,而不是让裁判模型去“感觉”答案好不好。文章给了四条规则:每条问题只检查一个点,别把多个要求塞进一句话;不同问题之间别重复检查同一个东西,否则一个错误会被扣两次分;用布尔判断(是/否)代替主观打分;把评分标准当成正...
#Benchmarking#Google AI#Jan-Felix Schmakeit
一句话点评
Google AI 这篇博客讲的是怎么让“用大模型给大模型打分”更靠谱。核心思路是把评分标准拆成一组严格的是非题,而不是让裁判模型凭感觉打分。文章给了四条规则:每条只查一个点、不同问题别重复扣分、用是/否代替主观打分、把标准当正式规格写。但正文没披露他们用哪个模型当裁判,也没给定量对比数据,所以实际能提升多少稳定性还不清楚。
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
15:28
20d ago
AI HOT 精选· aihot-apiZH15:28 · 09·02
Google 解释 harness 工程:给编程 AI 套上缰绳,让它自己改 bug
Shir Meir Lador 把 harness 工程讲得很直白:别让 AI 编程助手裸奔,要用一套确定性的规则把它框住——比如限定工作区、自动抓错误日志喂回去让它自己修、让代码仓库结构清晰方便它逐步理解上下文。她引用了 OpenAI 的一个实验,3 个工程师一行手写代码都没写就交付了一个内部测试版产品。文章还给了段代码示例,用 Google 的 A...
#Google#Google ADK 2.0#Google Antigravity SDK
一句话点评
Google 的人把 harness 工程讲得很直白:别让 AI 编程助手裸奔,要用一套确定性的规则把它框住——限定工作区、自动抓错误日志喂回去让它自己修、让代码仓库结构清晰方便它逐步理解上下文。文章引用了 OpenAI 的一个实验,3 个工程师一行手写代码都没写就交付了一个内部测试版产品,所有代码由 Codex 生成。这个数字挺唬人,但正文没披露产品复杂度、测试覆盖率和后续维护成本,所以别...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
03:50
20d ago
AI HOT 精选· aihot-apiZH03:50 · 09·02
美团 LongCat-2.0 在 Cline 上免费试用
美团 LongCat-2.0 现在可以在 Cline 上免费试用了。不过正文没披露模型规格、能力或试用时长,只有标题确认了这件事。
#Meituan#LongCat-2.0#Cline
一句话点评
美团 LongCat-2.0 在 Cline 上开放免费试用,但正文没披露模型规格、能力或试用时长,只有标题确认了这件事。目前只能判断美团在推模型落地,但具体水平、适用场景、是否限时都不清楚。如果是真的,对开发者多一个选择,但信息太少,建议等详细说明再评估。
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H0·K0·R0
03:32
20d ago
AI HOT 精选· aihot-apiZH03:32 · 09·02
UU远程新版上线:完整终端界面渲染,支持多会话管理,专为远程Vibe Coding优化
UU远程发布了新版本,核心是两个功能:完整TUI渲染(终端界面能完整显示,不只是文字流)和多终端会话管理(可以同时连多个远程终端,切换方便)。目标场景是远程Vibe Coding——即一边写代码一边让AI实时辅助的编程方式。正文没披露版本号、发布日期或技术实现细节,信息量有限,但标题确认了这两项更新。
#UU Remote
一句话点评
UU远程新版主打完整TUI渲染和多终端会话管理,专为远程Vibe Coding场景优化。TUI渲染意味着终端界面能完整显示,不只是文字流;多终端会话管理可同时连多个远程终端,切换方便。但正文被屏蔽,未披露版本号、发布日期或技术细节,信息量有限。如果是真的,对远程AI编程体验有实际提升,但需验证具体实现和稳定性。
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H0·K0·R0
00:30
21d ago
AI HOT 精选· aihot-apiZH00:30 · 09·02
Anthropic 发了 Claude Fable 5.1 和 Mythos 5.1,一位深度用户给了两条实用建议
Thariq 在 X 上说这两个模型他用了很久,觉得不错,完整评测后面会出。他提了两个实操点:一是对验证要求不高、边界情况少的任务,可以把 effort 调低,省点算力;二是现在切换 effort 不会清掉 prompt cache 了,这对频繁调参的人是个好消息。
#Code#Anthropic#Thariq
一句话点评
Anthropic 发了两个新模型,Claude Fable 5.1 和 Mythos 5.1,主打编程和知识类任务。作者 Thariq 实测后给了两条实用建议:对验证要求不高、边界情况少的任务,可以把 effort 调低省算力;现在切换 effort 不会清掉 prompt cache 了,调参党会舒服很多。正文没给具体跑分、延迟或成本数据,只说“模型不错”,完整评测还没出。这点先别太激动...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0

更多

频道

后台