ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-06-30

33 items · updated 3m ago
RSS live
2026-06-30 · 星期二2026年6月30日
09:00
28d ago
● P1最佳拍档· atomZH09:00 · 06·30
OpenAI推出GPT-5.6有限预览并引入Sol/Terra/Luna命名方案
目前只有标题,正文是空的。标题说这是个有限预览,会引入 Sol、Terra、Luna 三个新模型名,还列了一堆能力:最大推理努力、让多个子模型协作干活、网络安全能力、安全防护堆栈、自动化红队测试。但参数、价格、上线时间全都没提。这些能力具体到什么程度、跟 GPT-5 差多少,正文没披露,先别太激动。
#Reasoning#Agent#Safety#OpenAI
精选理由
精选 · 重要度 94 · 吸引力 + 共鸣
一句话点评
OpenAI 论文里出现了 GPT-5.6 的三个 Pro 变体,但正文没披露具体参数和评测细节,先别太激动。
锐评
这条消息的核心是 OpenAI 在一篇论文里列出了 GPT-5.6 的三个 Pro 变体,打破了以往只推一个顶级模型的策略。但要注意,信息源是 Ben's Bites 的简报,它引用了 OpenAI 的论文,可简报本身没给出论文链接,也没说清楚这三个变体到底强在哪、用在什么场景。我们只知道它们叫 Sol、Terra 和 Luna,其中 Sol 被描述为最大最聪明,在部分基准测试上超过了 Mythos,但在利用网络安全漏洞方面又故意做得比 Mythos 差一点。这种“选择性超越”挺有意思,说明 OpenAI 可能在有意识地控制模型在敏感领域的能力。 不过,目前所有判断都得打个折。第一,我们看不到论文原文,不知道测试集、样本量和误差范围,数字的意义很模糊。第二,美国政府还在限制 GPT-5.6 的发布,普通用户用不上,所以这些变体是纯研究概念还是即将落地的产品,正文没交代。第三,三个变体的架构差异、推理成本和延迟完全没提,对从业者来说,这些才是决定能不能用的关键。如果后续有论文全文或官方技术报告,才能判断这是真迭代还是 PR 策略。
HKR 分解
hook knowledge resonance
打开信源
94
SCORE
H1·K0·R1
09:00
28d ago
OpenAI 博客· rssEN09:00 · 06·30
OpenAI 用自家数据画了一张 ChatGPT 全球用户行为图
OpenAI 在 2026 年 6 月底发了一组用户行为数据,追踪个人用户怎么用 ChatGPT。注册半年后,用户每天发的消息量比刚注册时多了 50%,尝试过的功能种类翻了一倍。从 2023 年 7 月算起,非洲和亚洲的周活用户增长最快,人类发展指数偏低的国家相对增幅更猛。用户群也在变:全球范围内,名字偏女性化的用户发的消息已经占了大头;非英语用户超过...
#OpenAI#ChatGPT
一句话点评
OpenAI 发了一组用户行为数据:注册半年后,用户每天消息量涨 50%,尝试的功能种类翻倍。非洲和亚洲周活增长最快,低人类发展指数国家相对增幅更猛。全球范围内,女性用户发的消息已占大头,非英语用户过半。数据来自 0.1% 样本,不含绝对用户数和收入,验证力度有限。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H0·K1·R0
09:00
28d ago
AI HOT 精选· aihot-apiZH09:00 · 06·30
OpenAI 自家数据:ChatGPT 用户用得越久,发消息越多,尝试的任务种类也翻倍
OpenAI 发了份 Signals 数据,追踪个人用户怎么用 ChatGPT。注册半年后,用户每天发的消息量比刚注册时多了 50%,尝试过的不同任务种类也翻了一倍。从 2023 年 7 月算起,非洲和亚洲的周活用户增长最快,人类发展指数偏低的国家相对增幅最猛。非英语用户现在占了活跃用户的一半以上,排前三的是西班牙语、葡萄牙语和阿拉伯语。OpenAI ...
#OpenAI#ChatGPT
一句话点评
OpenAI 用 Signals 数据画了张 ChatGPT 全球用户画像:注册半年后,用户日均消息量涨 50%,尝试的任务种类翻倍。非洲和亚洲周活增长最快,低人类发展指数国家增幅更猛。非英语用户已过半,西语、葡语、阿语排前三。女性用户占比也超过男性。数据来自 0.1% 抽样,排除了未成年人和首月零消息用户,但没给绝对用户数和付费转化率。整体趋势可信,但增长基数低的地方相对涨幅大是常识,这点...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H0·K1·R0
09:00
28d ago
TechCrunch AI· rssEN09:00 · 06·30
OKX 上线 AI 代理市场:让 AI 互相雇佣、自动付钱
OKX 今天上线了一个 AI 代理市场,让 AI 程序可以互相雇佣、自动用稳定币结算,还能在链上积累信誉。这基于 OKX 已有的 AI 钱包和支付技术。CEO 预测未来十年会出现年入百万美元的一人公司,因为每个人都能拥有无限 AI 员工。市场今天对开发者开放,之前有 50 家 AI 服务商参与了内测。正文没披露抽成比例和哪些类型的代理会先上架。
#OKX#Star Xu#Haider Rafique
一句话点评
OKX 上线了一个 AI 代理市场,让 AI 程序能互相雇佣、用稳定币自动结算,还能在链上攒信誉。CEO 预测未来十年会出现年入百万美元的一人公司。市场今天对开发者开放,之前有 50 家 AI 服务商参与了内测。想法挺酷,但正文没披露抽成比例和哪些类型的代理会先上架,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H1·K1·R0
07:25
28d ago
AI 群聊日报· atomZH07:25 · 06·30
Fable 5 对做模型开发的人悄悄降智,群里晒出了让 AI 干一整天活的长任务指令
今天群聊最硬核的是两段真实的长任务 prompt。一段让 AI 把横跨四个代码仓库的测试工具重构、自动发 PR,另一段让 AI 同时开七个子代理并行识别双栏扫描件里的文字再归档。@三只纳垢灵 更狠,让 GPT 5.5 盯着代码集成测试跑了 40 小时,一句“那你把他搞定”直接触发无限循环,最后手动杀掉进程。另一条线是 Anthropic 收紧管控:@飘...
#Agent#Code#Anthropic#Fable 5
一句话点评
群聊日报里最硬核的是两段真实长程任务 prompt:一段让 AI 横跨四个代码仓库重构测试工具并自动发 PR,另一段开七个子代理并行 OCR 双栏扫描件再归档。@三只纳垢灵 更狠,让 GPT 5.5 盯着 CI 跑了 40 小时,一句“那你把他搞定”触发无限循环,最后手动杀进程。另一条线是 Anthropic 收紧管控:Fable 5 System Card 显示对 LLM 开发场景会静默降...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R0
06:45
28d ago
AI HOT 精选· aihot-apiZH06:45 · 06·30
特斯拉 Cybercab 量产版上路测试,无方向盘无踏板,20 个月从概念到实车
特斯拉在奥斯汀公共道路启动量产版 Cybercab 工程测试,车内无方向盘和踏板,只有安全员随车观测。从 2024 年 10 月概念发布到 2026 年 6 月上路,只用了约 20 个月。目前 34 台车在市中心跑,不接乘客,主要验证硬件可靠性。奥斯汀之前已有 Model Y 无人驾驶出租车运营,6 月 22 日刚开放付费服务,Cybercab 是在此...
#Tesla#Elon Musk#Austin
一句话点评
特斯拉Cybercab量产版已在奥斯汀公共道路开测,无方向盘和踏板,仅34台车,配安全员但不接乘客。从2024年10月概念发布到上路只用了20个月,节奏很快。但注意这只是工程测试,验证硬件可靠性,离商业化还有距离。正文没披露具体测试里程和故障率,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
04:40
28d ago
AI HOT 精选· aihot-apiZH04:40 · 06·30
X 官方上线 MCP 服务,AI 智能体可以直接调 X API 了
X 推出了一个叫 hosted X MCP 的服务,让 AI 智能体通过 MCP 协议直接调用 X 的 API 拿实时数据,Grok 和 Cursor 已经能用。个人开发者每次调用 0.01 美元,有人试了拉三天书签只花了 0.1 美元。配置流程是建应用、充值、拿配置 ID,然后交给 Codex 或 Claude 去授权。正文没提免费额度或企业定价。
#Agent#X#Grok#Cursor
一句话点评
X 官方下场做 MCP 了,让 AI 直接调 X API 拿实时数据,Grok 和 Cursor 已经能用。个人开发者每次调用 0.01 美元,有人拉三天书签才花 0.1 美元,成本确实低。但正文没提免费额度,也没说企业怎么定价,这点先别太激动。配置流程是建应用、充值、拿配置 ID,然后交给 Codex 或 Claude 授权,门槛不高。还缺的是:这个 hosted MCP 到底能调哪些 A...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
04:36
28d ago
Product Hunt · AI· rssEN04:36 · 06·30
Livinity:开源家庭服务器系统,自带AI管家帮你装应用
Livinity 是一个开源的家庭服务器操作系统,能把闲置电脑变成私有 AI 服务器。它内置了一个叫 Liv 的 AI 助手,通过 MCP(模型上下文协议)帮你安装应用和管理容器,支持 495 多种一键部署的 Docker 应用。你需要自己准备 Claude 或 Gemini 的 API 密钥。项目用 TypeScript 编写,完全开源。
#Agent#Livinity#Claude#Gemini
一句话点评
把闲置电脑变成私有AI服务器,内置AI助手Liv通过MCP帮你装应用、管容器,支持495+一键Docker部署。你得自备Claude或Gemini的API密钥。开源项目,TypeScript写的。 亮点是“私有+AI代理”组合,适合不想把数据交给云服务的人。495个应用一键部署听着多,但实际质量取决于Docker生态,不是它自己做的。Liv的MCP集成是核心卖点,但正文没披露它处理复杂任务...
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H1·K1·R0
04:17
28d ago
最佳拍档· atomZH04:17 · 06·30
DeepSpec 开源 DSpark:用草稿模型给大模型推理加速
DeepSpec 开源了推测解码方案 DSpark,核心是用一个轻量级草稿模型做半自回归生成,再通过置信度调度验证器决定是否采纳草稿,配合 CUDA 图回放实现零开销调度。这套方法针对的是自回归生成逐 token 生成的瓶颈,目标是加速大模型推理。正文没披露草稿模型大小、加速比或支持哪些架构,所以实际效果要等跑分。
#DeepSpec#DSpark
一句话点评
DeepSpec 开源了推测解码方案 DSpark,核心是用一个轻量草稿模型先快速生成多个 token,再用验证器决定要不要采纳,配合 CUDA 图回放降低调度开销。思路是让大模型推理不再逐 token 卡脖子。但正文没披露草稿模型多大、加速比多少、支持哪些架构,所以实际效果要等跑分。如果是真的,推理成本能降不少。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
04:02
28d ago
机器之心 · 公众号· rssZH04:02 · 06·30
Meta 内部禁用 Claude Code 和 Codex,怕自家模型被反向蒸馏
Meta 在内部限制员工使用 Claude Code 和 OpenAI Codex,核心担忧是“反向蒸馏”——怕外部代码工具通过交互数据,把 Meta 自家模型的能力偷学走。不过原文因为微信环境异常打不开,具体禁了哪些团队、限制到什么程度、有没有替代方案,这些细节目前都看不到。
#Code#Meta#Anthropic#OpenAI
一句话点评
Meta 内部开始限制员工用 Claude Code 和 OpenAI Codex,怕自家模型的能力被反向蒸馏偷走。但原文因为微信环境异常打不开,具体禁了哪些团队、限制到什么程度、有没有替代方案,这些细节目前都看不到。
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R1
04:01
28d ago
AI HOT 精选· aihot-apiZH04:01 · 06·30
一份追踪2.2万家公司的报告显示,AI花钱最猛的企业反而在扩招,连初级岗位都涨了12%
Ramp和Revelio Labs联合追踪了近2.2万家公司的数据,发现“高强度AI采用者”——指前三个月平均每名员工每月在AI上花30美元的公司——员工总数增长了10.2%,其中初级岗位人数涨了12%。这个数字直接打脸了“AI先干掉初级岗位”的说法。不过报告没说明新增岗位是AI相关还是传统岗位,也没区分自然增长和AI带来的增长。相关性不等于因果,但至...
#Ramp#Revelio Labs
一句话点评
一份追踪2.2万家公司的报告说,AI用得猛的公司反而在扩招,员工总数涨了10.2%,初级岗位涨了12%。这个数据直接打脸“AI先干掉初级岗位”的说法。但先别激动,报告把“高强度AI采用者”定义为前三个月人均月花30美元买AI工具的公司,这个门槛不算高。而且它没区分新增的是AI工程师还是普通岗位,也没排除公司自然增长的部分。相关性不等于因果,只能说这些公司没在裁员,但AI到底创造了岗位还是只是...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R1
03:30
28d ago
FT · 科技· rssEN03:30 · 06·30
企业AI账单超预算,FT说这是普遍问题
FT报道,企业AI支出正在普遍超出预算。文章没有点名具体公司或给出具体数字,但指出成本超支是一个广泛现象。正文没披露超支幅度或哪些环节最烧钱,但信号很明确:AI部署的实际成本比很多公司年初预估的要高。
#Financial Times
一句话点评
FT报道企业AI支出普遍超预算,但没点名具体公司或给出超支幅度。信号明确:部署成本比年初预估高,但正文没披露哪些环节最烧钱。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H0·K0·R1
03:30
28d ago
FT · 科技· rssEN03:30 · 06·30
AI 工具让做游戏的门槛变低了,但大厂还是占着坑
FT 报道说,AI 工具降低了游戏开发门槛,新游戏数量因此激增。但大厂在资金、数据和发行渠道上的优势,让它们依然主导市场。正文没披露具体的增长数字或市场份额数据。
#Financial Times
一句话点评
FT 报道 AI 工具降低了游戏开发门槛,新游戏数量激增,但大厂在资金、数据和发行渠道上的优势让它们依然主导市场。正文没披露具体的增长数字或市场份额数据,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R1
03:30
28d ago
FT · 科技· rssEN03:30 · 06·30
AI 能加速制药,但人体实验快不了
FT 这篇评论的核心判断是:AI 在药物早期发现阶段确实能提速——筛分子、预测毒性——但临床试验和人体生物学的节奏不会因此变快。真正的瓶颈不在算力,而在后期验证阶段。换句话说,AI 能帮你在实验室里跑得更快,但病人入组、药效观察、副作用追踪这些环节,该等多久还是等多久。正文没有披露具体案例或数据来支撑这个判断,更像一个行业共识的总结。
#Financial Times
一句话点评
AI能加速药物早期筛选,但临床试验该等多久还是等多久。FT这篇评论没给具体案例或数据,更像行业共识总结。真正的瓶颈不在算力,而在后期验证——病人入组、药效观察这些环节,AI帮不上忙。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R1
03:30
28d ago
FT · 科技· rssEN03:30 · 06·30
旅游业准备迎接能自主订票的AI代理
FT报道,旅游业正在为能自动订机票、酒店和行程的AI代理做准备,这类代理不再是聊天机器人,而是能执行多步骤任务的agent workflow。正文没披露具体产品或上线时间,但指出行业正从对话式AI转向能独立完成操作的智能体。
#Financial Times
一句话点评
FT说旅游业准备让AI代理自动订机票酒店,不再是聊天机器人,而是能跑多步骤任务的agent workflow。正文没披露具体产品名或上线时间,只说了行业方向。这点先别太激动,目前还是概念阶段,落地要看准确率和用户敢不敢放手。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
03:30
28d ago
FT · 科技· rssEN03:30 · 06·30
AI 让中国工厂机器人更快进入新行业
FT 报道,AI 正在帮中国工厂机器人更快地适应不同生产线,从而从汽车、电子等传统领域扩展到新行业。文章没具体说哪些新行业,但核心是 AI 降低了机器人换产线的成本和时间。
#Financial Times
一句话点评
FT报道说AI让中国工厂机器人换产线更快更便宜,从汽车电子往新行业扩。但正文没点名是哪些新行业,也没给具体降本数据。逻辑通顺,但信息密度偏低,更像趋势观察而非硬新闻。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
02:39
28d ago
Product Hunt · AI· rssEN02:39 · 06·30
WorkBuddy:腾讯的AI办公助手,能组队干活还能要第二意见
腾讯今天在Product Hunt上线了WorkBuddy,一个AI办公助手。你提需求,它自动组一个AI专家团队来执行,出结果前还能拉一个“第二意见”做复核。正文没披露底层模型、定价和具体支持的任务类型,只有概念和UI截图。亮点是“组队+复核”这个流程设计——不是单模型对话,而是让多个AI角色协作,再加一层校验,理论上能减少幻觉和跑偏。但没说明专家团队...
#Tencent#WorkBuddy
一句话点评
腾讯今天在Product Hunt上架了WorkBuddy,一个AI办公助手。亮点是“组队+复核”流程:你提需求,它自动组一个AI专家团队来执行,出结果前还能拉一个“第二意见”做复核。理论上能减少幻觉和跑偏,但正文没披露底层模型、定价和具体支持的任务类型,只有概念和UI截图。如果是真的挺省钱,但信息缺口太大,先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
02:35
28d ago
Product Hunt · AI· rssEN02:35 · 06·30
Flowly:开源桌面 AI 代理,能跨应用操作并记住你的上下文
Flowly 今天在 Product Hunt 上线,核心代理代码以 Apache-2.0 协议开源。它是一个原生 AI 助手,支持 macOS、Windows、Linux 和 iPhone,能用你自己的 API 密钥跨应用和浏览器标签页操作。最大亮点是私有记忆功能,能学习并自我纠错。你可以通过全局快捷键调出全屏聊天、菜单栏或刘海屏浮窗。发布期间免费,...
#Memory#Flowly#Product Hunt#Open source
一句话点评
Flowly 今天在 Product Hunt 上线,核心代理代码以 Apache-2.0 协议开源。它是个跨平台(macOS/Windows/Linux/iPhone)的原生 AI 助手,能用你自己的 API 密钥跨应用和浏览器标签页操作。最大卖点是私有记忆功能,能学习并自我纠错。你可以通过全局快捷键调出全屏聊天、菜单栏或刘海屏浮窗。发布期间免费,但正文没披露免费期多长、支持哪些模型后端。...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
02:28
28d ago
TechCrunch AI· rssEN02:28 · 06·30
Base44 自己训模型了:被 Wix 花 8000 万美元收购的“一句话写代码”平台,不想再依赖别人的大模型
Base44 是一个用自然语言就能生成 App 的“氛围编程”平台,去年被 Wix 以 8000 万美元收购,当时公司才成立 6 个月、只有 8 个人。现在它开始推自己的 AI 模型,目标是最终超过市面上的前沿模型。背后的逻辑是:AI 创业公司如果只套别人的模型,长期来看护城河很浅。Base44 选择自己造模型来建立壁垒。正文没披露模型规格、发布时间线...
#Base44#Wix
一句话点评
Base44 被 Wix 花 8000 万美元买下时才 8 个人、成立 6 个月,现在要自研模型来建护城河。想法对——套壳没壁垒,但造模型烧钱又拼人才,正文没披露模型规格、发布时间线或跑分,目前更像一个战略表态而非产品落地。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
01:47
28d ago
AI HOT 精选· aihot-apiZH01:47 · 06·30
AI News Radar 更新:新增自媒体板块,支持订阅多平台账号
AI News Radar 做了一次大更新,主要加了自媒体板块,可以订阅多个平台的账号。但正文没披露具体支持哪些平台、更新了哪些细节、以及什么时候上线。
#AI News Radar#Product update
一句话点评
AI News Radar 更新了自媒体板块,支持多平台账号订阅。但正文被微信拦截,没披露具体支持哪些平台、更新细节和上线时间。信息缺口太大,目前只能当个标题看,等补充细节再判断价值。
HKR 分解
hook knowledge resonance
打开信源
25
SCORE
H0·K0·R0
00:30
28d ago
● P1Hacker News 首页· rssEN00:30 · 06·30
美团开源LongCat-2.0 1.6万亿参数MoE模型
美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...
#Meituan#LongCat#DeepSeek#Open source
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
美团开源了1.6万亿参数MoE模型,每次推理只激活480亿参数,跑在国产ASIC集群上。
锐评
LongCat-2.0 是美团放出来的一个大家伙,总参数量1.6万亿,但每次推理只激活约480亿参数,属于典型的 MoE 架构,用稀疏激活来省计算。比较特别的是,它从训练到部署全跑在国产 AI ASIC 集群上,没依赖英伟达 GPU,训练用了超过5万张卡、35万亿 token,没出现训练崩溃,说明这套非主流硬件平台已经能撑住前沿规模的训练了。 架构上做了几件事来提升长文本和代码能力。注意力部分搞了个 LongCat Sparse Attention,本质是对 DeepSeek 稀疏注意力的改进,通过流式索引、跨层复用索引和分层筛选三招,把长上下文处理的速度提上去,同时不伤模型质量。另外加了一个 N-gram Embedding 模块,用135B参数把嵌入空间扩大了约100倍,官方解释是在 MoE 稀疏度已经很高(约97%)的情况下,把这部分参数从专家网络挪到嵌入层,收益更大,而且能降低大批量解码时的显存读写压力。 性能对比图里,LongCat-2.0 在 Terminal-Bench、SWE-bench 等代码和智能体任务上,跟 Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.8 等模型放在一起,但正文没给出具体分值和测试条件,所以这些柱状图只能看个相对高低,没法做严格比较。另外,模型虽然开源了权重,但训练数据的具体构成、ASIC 集群的详细规格和成本都没披露,实际落地效果和性价比还得等社区实测反馈。
HKR 分解
hook knowledge resonance
打开信源
98
SCORE
H1·K1·R1
00:05
28d ago
Hacker News 首页· rssEN00:05 · 06·30
开放记忆协议:让 Claude、ChatGPT 共用同一个记忆库
SMJAI 发布了一个开放标准,叫 Open Memory Protocol,目标是让不同 AI 助手(比如 Claude、ChatGPT)能读写同一个用户记忆文件,不再各自为政。现在每个助手都记得你的偏好,但彼此不互通,这个协议就是想打破这种“记忆孤岛”。正文没有透露具体实现方式或性能数据,所以目前只是一个接口规范,离真正落地还有距离。
#Memory#SMJAI#Claude#ChatGPT
一句话点评
SMJAI 搞了个开放记忆协议,让 Claude、ChatGPT 等助手读写同一个用户记忆文件,打破记忆孤岛。想法挺好,但正文没披露实现细节或性能数据,目前只是个接口规范,离落地还远。短评:跨模型记忆互通,方向对,但没代码没跑分,先别激动。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
00:00
28d ago
Hugging Face 博客· rssEN00:00 · 06·30
Hugging Face 模型页将直接显示所有评测成绩
Hugging Face 宣布要在模型页面上展示“Every Eval Ever”的评测结果,用户以后点进模型就能直接看到跑分。正文没披露具体覆盖哪些模型、评测集范围以及上线时间,目前只有标题确认。
#Hugging Face#Benchmark
一句话点评
Hugging Face 要在模型主页直接挂“Every Eval Ever”跑分,以后点进去就能看,不用再翻论文或第三方榜单。正文没披露覆盖哪些模型、评测集范围以及上线时间,目前只有标题确认。如果是真的,对选模型省事不少,但得等具体细则出来再判断含金量。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
00:00
28d ago
OpenAI 博客· rssEN00:00 · 06·30
OpenAI 发了个测 AI“科研品味”的生物学基准
OpenAI 推出了 GeneBench-Pro,一个专门测试 AI 在计算生物学里做判断和应对模糊性的基准。它包含 129 道合成题,覆盖统计遗传学、癌症基因组等 10 个领域。每道题给模型一个乱糟糟的数据集,要求它自己探索、选分析路径、迭代、最后给出答案。基准是合成数据生成的,目的是避免“多个答案都说得通”或者“随便跑跑也能蒙对分”这类常见坑。正文...
#Benchmarking#Reasoning#OpenAI#Benchmark
一句话点评
OpenAI 出了个新基准 GeneBench-Pro,专测 AI 在计算生物学里做判断和应对模糊性的能力。129 道合成题,覆盖统计遗传学、癌症基因组等 10 个领域。每道题给模型一个乱糟糟的数据集,要求它自己探索、选分析路径、迭代、最后给出答案。基准是合成数据生成的,目的是避免“多个答案都说得通”或者“随便跑跑也能蒙对分”这类常见坑。正文没披露任何模型得分,只论证“研究品味”是当前 AI...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0

更多

频道

后台