ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-06-28

37 items · updated 3m ago
RSS live
2026-06-28 · 星期日2026年6月28日
23:17
29d ago
● P1彭博科技· rssEN23:17 · 06·28
三星和SK海力士计划十年投入1.3万亿美元扩产AI芯片
韩国政府正拉着三星和 SK 海力士起草一份十年投资计划,总金额 1.3 万亿美元,主要砸向龙仁和平泽的半导体园区,重点搞 HBM(高带宽内存)和先进逻辑芯片。目标是不被美国和中国在 AI 基础设施上甩开。不过文章没写政府和两家公司各自出多少钱,也没说从哪年开始算。这种十年期的天文数字,我一般会先打个折,因为通常会把已经公布的预算和乐观的远期规划打包在一起算。
#Samsung#SK Hynix#South Korean government
精选理由
精选 · 重要度 92 · 吸引力 + 共鸣
一句话点评
三星和SK海力士要砸1.3万亿美元扩产芯片,但这是十年总账,不是一次性掏钱,别被标题吓到。
锐评
韩国两大芯片厂准备在十年内合计投入1.3万亿美元,主要用来扩建内存产线、应对AI训练和推理对HBM(高带宽内存)的爆炸需求。这个数字是彭博援引韩媒的报道,不是官方正式公告,具体出资节奏和资金来源正文没细说。TechCrunch那篇标题用了“RAMageddon”(内存末日)来形容供给紧张,说明现在高端内存确实缺货,但十年投资周期很长,中间需求会不会降温、地缘政治会不会卡设备出口,都是变数。 1.3万亿摊到每年大概1300亿,比两家现在的资本开支高出一大截。如果真按这个规模执行,意味着它们赌AI芯片需求会持续十年不回头。但正文没披露这笔钱里多少是政府补贴、多少是企业自有资金,也没说新厂选址和产能爬坡时间表。这些缺口让“十年1.3万亿”更像一个方向性表态,实际落地要打不少折扣。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K0·R1
22:32
29d ago
Hacker News 首页· rssEN22:32 · 06·28
Proxy-KD:给黑盒大模型装个“翻译官”,把知识传给小模型
GPT-4这类闭源大模型很强,但你拿不到它的内部参数,没法直接做知识蒸馏(把大模型的能力压缩进小模型)。这篇论文提出Proxy-KD,思路是加一个代理模型当“翻译官”,让代理模型去跟黑盒老师学,再把学到的教给小模型。实验说效果不仅超过常规的黑盒蒸馏,甚至比白盒蒸馏(能看到内部参数的那种)还好。不过正文没披露具体用了哪个老师模型、学生模型多大、在什么be...
#GPT-4
一句话点评
这篇论文提出 Proxy-KD,加一个代理模型当“翻译官”,把 GPT-4 这类闭源大模型的能力传给小模型。实验说效果甚至超过能看到内部参数的白盒蒸馏。但正文没披露具体用了哪个老师模型、学生多大、在什么 benchmark 上测,验证力度不够。如果是真的,挺省钱——不用调 API 也能蒸馏闭源模型。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H0·K1·R0
22:30
29d ago
彭博科技· rssEN22:30 · 06·28
动画人声称AI能把电影成本砍掉90%
彭博社报道,一些电影制作人称AI工具能把动画电影制作成本降低90%。这个数字来自从业者,但正文没披露具体用了什么技术、有没有完成的作品。如果是真的,传统动画预算逻辑会被推翻。但我会先打个折——这么大幅度的削减,大概率牺牲了画质、片长或创作控制权。正文也没说清楚省的钱来自人力、渲染还是整条管线。
#Bloomberg
一句话点评
彭博社报道,电影制作人称AI工具能把动画电影成本砍掉90%。这个数字来自从业者,但正文没披露具体用了什么技术、有没有完成的作品。如果是真的挺省钱,但我会先打个折——这么大幅度的削减,大概率牺牲了画质、片长或创作控制权。正文也没说清楚省的钱来自人力、渲染还是整条管线。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H1·K0·R1
21:42
29d ago
The Verge · AI· rssEN21:42 · 06·28
中国 Z.ai 称其 GLM-5.2 在网络安全上追平了 Anthropic 的 Mythos
Z.ai 发布 GLM-5.2,声称在漏洞发现能力上已经和 Anthropic 的 Mythos 持平。通用能力仍然落后,但网络安全这个细分领域的差距在缩小。正文没有披露具体跑分或测试集,只说了找 bug 这一项。
#Z.ai#Anthropic#Mythos
一句话点评
Z.ai 说 GLM-5.2 找漏洞的能力和 Anthropic 的 Mythos 持平,但正文没给任何跑分或测试集,只有一句声称。通用能力仍然落后,这点先别太激动。如果是真的,至少说明在安全这个窄领域,国产模型追得挺快。缺的是可复现的 benchmark 和第三方验证。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
19:38
29d ago
Hacker News 首页· rssEN19:38 · 06·28
NanoEuler:纯 C/CUDA 手写 GPT-2 级模型,不用 PyTorch
一个从头用 C/CUDA 写的 GPT-2 规模语言模型,完全不依赖 PyTorch 或 TensorFlow。手写了反向传播、BPE 分词器、FlashAttention,还支持预训练和 SFT(用标注数据微调)。对想搞懂 Transformer 内部实现的工程师来说是个不错的学习资源。正文没披露参数量、训练数据大小和最终跑分,所以实际效果和成本还不...
#JustVugg#Open source
一句话点评
一个纯C/CUDA手写的GPT-2级别模型,不依赖PyTorch,适合想抠底层实现的工程师学习。手写了反向传播、BPE分词、FlashAttention,还支持预训练和SFT。但正文没披露参数量、训练数据大小和跑分,实际效果和成本未知,先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
18:32
30d ago
Hacker News 首页· rssEN18:32 · 06·28
斯坦福更新内存价格数据集:1960到2026年,DRAM、NAND和HBM每GB价格全公开
斯坦福DAM项目发布了截至2026年6月的内存价格数据集,覆盖DRAM、NAND闪存和HBM。数据来源:McCallum历史数据集和Keepa抓取的亚马逊零售价;HBM价格来自TrendForce和SemiAnalysis的分析师估算,不是实际成交价。页面还包含Epoch AI对英伟达、AMD、谷歌和亚马逊AI加速器的季度成本拆解,按HBM、逻辑芯片、...
#Stanford University#Epoch AI#TrendForce
一句话点评
斯坦福DAM项目更新了1960年至今的内存价格数据集,覆盖DRAM、NAND和HBM,数据可下载CSV。亮点是Epoch AI对英伟达、AMD、谷歌、亚马逊AI加速器的季度成本拆解,按HBM、逻辑芯片、封装等分项。但HBM价格来自TrendForce和SemiAnalysis的分析师估算,不是实际成交价,HBM4还是预测值(Q3 2026才上市)。DRAM和NAND的零售价来自亚马逊Keep...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
18:31
30d ago
Hacker News 首页· rssEN18:31 · 06·28
YAGNI 省的不是敲代码的力气,而是两笔更贵的账
Kent Beck 重新解释 YAGNI(你不会需要它):这条原则从来不是为了省下写代码的功夫。它真正要避免的是两笔账单。第一笔是选择权——提前把架构定死,等于在看清需求前就放弃了做对事的机会,哪怕猜对了需求,提前锁定结构本身就已经亏掉了等待的价值。第二笔是资金的时间成本——提前花钱、推迟交付,就算有完美预知,把成本拉到收入前面也是净亏。现在让模型生成...
#Kent Beck#Chet Hendrickson#WorkOS
一句话点评
Kent Beck 重新解释 YAGNI:它从来不是为了省写代码的功夫,而是避免两笔账单。第一笔是选择权——提前把架构定死,等于在看清需求前就放弃了做对事的机会,哪怕猜对了需求,提前锁定结构本身就已经亏掉了等待的价值。第二笔是资金的时间成本——提前花钱、推迟交付,就算有完美预知,把成本拉到收入前面也是净亏。现在让模型生成代码变便宜了,反而更容易让人不知不觉地违反 YAGNI。正文没披露具体案...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R0
17:58
30d ago
● P1Hacker News 首页· rssEN17:58 · 06·28
Ornith-1.0开源编程智能体模型系列发布,支持自生成任务脚手架
Ornith-1.0 是一套开源的编程智能体模型,从 9B 到 397B MoE 都有。核心思路是训练时不让模型用人类写死的流程框架,而是让它自己生成任务“脚手架”——也就是解题时怎么组织步骤、处理错误、调用工具。这个脚手架和最终答案一起被强化学习优化,模型会自己摸索出更高效的解题路径。397B 版本在 Terminal-Bench 2.1 上拿了 7...
#Ornith-1.0#Deep-Reinforce AI#Gemma 4
精选理由
精选 · 重要度 96 · 吸引力 + 知识量 + 共鸣
一句话点评
一个开源编程智能体模型家族,主打“自己教自己”的自我改进路线,但正文没披露具体训练成本和实际项目验证,这点先别太激动。
锐评
Ornith-1.0 是一套专门做编程任务的智能体模型,覆盖了从 7B 到 70B 多个参数规模。它最特别的地方在于用了“自我搭脚手架”的方法——让模型在写代码的过程中自己生成训练数据、自己改进自己,而不是全靠人工标注。这听起来挺省钱,但正文没给出具体的训练开销数字,也没说这种自我改进会不会跑偏或产生垃圾数据。 目前项目在 GitHub 上刚发布,有 351 个星标,还没看到独立的第三方评测或真实项目里的表现报告。团队说模型在编程基准测试上成绩不错,但没说明测试环境是否接近实际开发场景。 如果这套自我改进机制真的稳定,对小团队来说是个好消息,因为不用花大价钱请人标数据。但缺了成本对比、长期稳定性分析和社区反馈,现在只能说方向有意思,落地效果还得等等看。
HKR 分解
hook knowledge resonance
打开信源
96
SCORE
H1·K1·R1
17:03
30d ago
AI HOT 精选· aihot-apiZH17:03 · 06·28
开源模型生态变宽了:Zyphra、Cohere、Poolside 都发了新东西
Interconnects 最新一期 Artifacts 指出,开源模型生态不再只有几家中国玩家。他们把发布方分成三类:纯做模型的(DeepSeek、Zyphra)、大厂(阿里 Qwen、Google Gemma)和产品公司(JetBrains、Krea)。重点模型:NVIDIA Nemotron-3-Ultra 550B 用了 LatentMoE(一...
#Multimodal#Code#NVIDIA#Cohere
一句话点评
NVIDIA 的 550B 参数大模型用了 LatentMoE(一种让模型更快的稀疏架构),还换了专门针对模型权重设计的 OpenMDW 许可证,比 MIT/Apache 更合规。Cohere 的 Command A+ 是 218B 参数、激活 25B 的 MoE 模型,改成了 Apache 2.0 许可,支持多模态和智能体。Zyphra 的 ZAYA1 系列(74B 和 8B)用了新架构。...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R0
17:00
30d ago
OpenAI 博客· rssEN17:00 · 06·28
惠普与OpenAI签下“Frontier”战略合作,从试点走向全线铺开
惠普宣布与OpenAI达成Frontier战略合作,把AI从试点推向全公司。一个工程师用OpenAI模型在几周内处理了122个代码合并请求、涉及43个项目;安全团队一天修好了原本要干一个月的漏洞。Frontier将作为统一平台管理定价、支持、设备和安全,覆盖惠普10万多家合作伙伴的生态。安全团队每周省出约82小时。正文没披露合同金额和具体上线时间表。
#Code#HP Inc.#OpenAI#OpenAI Frontier
一句话点评
惠普把OpenAI的Frontier平台当企业AI中台用,一个工程师几周处理了122个PR(代码合并请求),安全团队一天修完原本一个月的漏洞。每周省出82小时。正文没披露合同金额和上线时间表,所以规模化的实际成本和时间线还不清楚。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
16:58
30d ago
AI HOT 精选· aihot-apiZH16:58 · 06·28
Wayfinder Router:用规则决定本地还是云端模型来回答,省成本降延迟
这是一个命令行工具,核心思路是不让模型自己选模型——而是用写死的规则判断该用本地小模型还是托管大模型。比如简单问题走本地,复杂问题才调云端。好处是成本可控、延迟可预测,不会出现模型自己“选贵了”的情况。项目刚开源,GitHub 上 200 多星,但正文没披露支持哪些模型、也没给 benchmark,实际效果得自己试。
#Wayfinder Router#itsthelore
一句话点评
短评:用写死规则代替模型自己选模型,简单粗暴但有效。成本可控、延迟可预测,但没披露支持哪些模型和 benchmark,效果得自己试。 点评:Wayfinder Router 是个命令行工具,核心思路是不让模型自己选模型——而是用写死的规则判断该用本地小模型还是托管大模型。比如简单问题走本地,复杂问题才调云端。好处是成本可控、延迟可预测,不会出现模型自己“选贵了”的情况。项目刚开源,GitH...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
16:24
30d ago
Hacker News 首页· rssEN16:24 · 06·28
Tokenmaxxing 死了,Tokenmaxxing 万岁
Meta 把员工绩效和 token 用量挂钩,结果有人让两个 AI 互聊一整天来刷量。作者认为高管是故意用这种粗暴手段逼抗拒 AI 的团队上手。现在目的达到了,人人都用 AI 写代码,但 OpenAI 和 Anthropic 为了上市在砍补贴、涨 API 价格,公司又开始取消无限用 token 的政策。真正的变化在于:以前让 AI 长时间干活会累积错误...
#Code#Meta#OpenAI#Anthropic
一句话点评
Meta 曾把员工绩效和 token 用量挂钩,结果有人让两个 AI 互聊一整天刷量。作者认为高管是故意用这种粗暴手段逼抗拒 AI 的团队上手。现在目的达到了,人人都用 AI 写代码,但 OpenAI 和 Anthropic 为了上市在砍补贴、涨 API 价格,公司又开始取消无限用 token 的政策。真正的变化在于:以前让 AI 长时间干活会累积错误,现在花更多 token 反而能带来“累...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R0
14:12
30d ago
The Verge · AI· rssEN14:12 · 06·28
洛杉矶检察官把 ChatGPT 聊天记录当纵火证据,陪审团没买账,审判无效
在洛杉矶帕利塞兹山火纵火案里,检方把被告的 ChatGPT 对话记录作为证明其纵火意图的关键证据提交了。但陪审团不觉得这能定罪,案子最终以无效审判收场。文章没写聊天记录具体问了什么、检方怎么拿到这些记录的,也没说被告到底问了 ChatGPT 哪些问题。
#ChatGPT#OpenAI
一句话点评
检方把被告的ChatGPT聊天记录当纵火证据提交,但陪审团不买账,案子以无效审判收场。文章没披露聊天记录具体问了什么、检方怎么拿到的,信息缺口很大。这案子说明AI对话记录进法庭还远没到“铁证”阶段,证据链和隐私边界都模糊。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K0·R1
14:09
30d ago
Product Hunt · AI· rssEN14:09 · 06·28
Sequence 给 AI 智能体开了个管钱的 API,能直接转账、分账、调度真金白银
Sequence 这次发布的 Agentic 功能,是让 Claude、Cursor、n8n 或 Zapier 里的 AI 智能体通过一个 API 调用就能操作真钱,覆盖银行账户、卡、应用和贷款。安全上做了几件事:用权限范围受限的密钥,不让智能体直接接触你的账户密码;在服务端设消费上限来控制风险;每笔操作都有完整日志。团队说底层基建已经在受监管的轨道上...
#Sequence#Claude#Cursor
一句话点评
Sequence 让 Claude、Cursor 等 AI 智能体通过一个 API 就能操作真钱(转账、分账、路由到银行卡/应用/贷款),安全上用了权限受限密钥、服务端消费上限和完整日志。底层基建已在受监管轨道上跑过 30 亿美元,但正文没披露定价和延迟。对做 agent 支付场景的团队是个现成方案,但金融合规和实际延迟还得自己测。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
14:00
30d ago
彭博科技· rssEN14:00 · 06·28
无人出租车还在蹒跚学步:Waymo 每周接单超 10 万,但路口发呆、绕路的老毛病没改
Bloomberg 这篇长文把全球无人出租车的现状扒了一遍。Waymo 在旧金山和凤凰城每周能跑超过 10 万单付费行程,但车还是会卡在路口不敢动,或者莫名其妙绕远路。特斯拉放话 2026 年推出 Cybercab,不过文章里没给出明确的实际上路时间。百度萝卜快跑在武汉有几百辆车在跑,车里依然坐着安全员,每公里成本大概 1 块钱人民币。大家共同的坎是恶...
#Waymo#Tesla#Baidu
一句话点评
Waymo 每周能跑 10 万单付费行程,但车还是会卡路口、绕远路,离“真无人”还差一截。特斯拉 Cybercab 放话 2026 年推出,正文没给实际上路时间,这点先别太激动。百度萝卜快跑在武汉有几百辆车,车里还坐着安全员,每公里成本大概 1 块钱——比网约车便宜,但去掉安全员之前谈不上赚钱。三家共同的坎是恶劣天气、施工路段和各地法规不统一,目前没人做到无安全员还能盈利。文章没披露各家具体...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
13:34
30d ago
● P1Hacker News 首页· rssEN13:34 · 06·28
美国限制 Claude 出口后奥地利游说欧盟吸引 Anthropic 迁欧
美国刚对 Anthropic 的 Claude 模型加了出口管制,奥地利总理和内政部长就联名写信给欧盟,催着加快审批和政策支持,想把 Anthropic 的欧洲总部和数据中心抢到自己地盘上。这封信是在 2026 年 6 月 28 日发出的。不过正文没披露 Anthropic 有没有点头同意,也没提具体选址在哪、什么时候落地。
#Anthropic#Austria#European Union#Policy
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
美国卡了 Claude 的出口许可,奥地利立刻去欧盟游说想把 Anthropic 接过来,动作很快但正文没披露 Anthropic 是否接茬。
锐评
这条新闻的核心不是技术,是地缘抢人。美国限制 Claude 出口后,奥地利跳出来游说欧盟,想把 Anthropic 整个迁到欧洲。这相当于在 AI 供应链上挖墙脚——谁拿到顶级模型公司,谁就在下一轮监管和产业话语权上多一张牌。 不过正文没写清楚几个关键点:一是美国到底限制了什么范围的出口,是模型权重、API 调用还是芯片配套;二是 Anthropic 自己有没有搬迁意愿,还是奥地利单方面喊话。如果只是出口管制收紧后欧洲趁机拉拢,那更像政治姿态而非落地计划。 对从业者来说,这条值得盯的是后续 Anthropic 的回应。如果真搬,欧洲的算力基建、数据合规和人才池能不能接住是个大问号。目前只能当信号看,别急着下结论。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
11:00
30d ago
彭博科技· rssEN11:00 · 06·28
欧洲投资者找 AI 股票,盯上了供电公司和银行
彭博社报道,欧洲投资者想押注 AI,但发现纯科技公司不好找,于是转向供电公司和银行。数据中心需要大量电力,供电公司成了“卖铲子”的受益者;银行则靠 AI 提高效率、降低坏账率,相当于“收过路费”。正文没提具体公司名字,但点出了一个投资逻辑的转变:从卖铲子到收过路费。
#Bloomberg
一句话点评
欧洲投资者想押注AI但找不到纯科技公司,转向供电公司和银行。供电公司靠数据中心用电需求成“卖铲子”受益者,银行靠AI降坏账率“收过路费”。正文没提具体公司名,逻辑转变值得关注,但缺数据支撑验证。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H0·K0·R0
09:00
30d ago
FT · 科技· rssEN09:00 · 06·28
BIS警告:AI投资热潮可能以长期萧条收场
国际清算银行(BIS)发报告说,现在市场对AI的预期太高了,实际回报可能撑不住,一旦泡沫破裂,全球金融可能跟着遭殃。BIS拿当年的互联网泡沫做对比,意思是现在这股狂热劲儿很像。正文没披露具体数据或时间线,但核心判断很清楚:投资者该冷静了。
#BIS
一句话点评
BIS警告AI投资过热可能重演互联网泡沫破裂,导致长期低迷。报告没给具体数据或时间线,核心判断是预期太高、回报跟不上。宏观视角,适合提醒团队别盲目追高,但缺微观证据支撑。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H1·K0·R1
07:45
30d ago
Hacker News 首页· rssEN07:45 · 06·28
中国能自己造出ASML吗?
日经报道,中国想在芯片设备上100%自给,刻蚀、沉积这些环节已经能用国产替代了,但光刻机还是空白。中芯国际、长鑫存储、长江存储目前量产14nm和7nm,用的还是ASML和尼康的老机型。ASML最新的高数值孔径EUV光刻机重150吨、卖3.5亿美元一台,靠激光每秒打5万次锡滴产生极紫外光,定位精度到纳米级。中国离自己造出这东西还差得远。
#ASML#SMIC#CXMT
一句话点评
日经这篇长文把中国芯片设备自给率现状摊开了:刻蚀、沉积这些环节国产替代已经能上产线,但光刻机还是空白。中芯国际、长鑫存储、长存目前量产14nm和7nm,用的还是ASML和尼康的老机型。ASML最新的高数值孔径EUV光刻机重150吨、卖3.5亿美元一台,靠激光每秒打5万次锡滴产生极紫外光,定位精度到纳米级。中国离自己造出这东西还差得远。正文没披露国产光刻机具体进展到什么阶段,只说“空白”。如果...
HKR 分解
hook knowledge resonance
打开信源
50
SCORE
H0·K1·R0
04:31
30d ago
Hacker News 首页· rssEN04:31 · 06·28
Wayfinder Router:一个按规则把查询分给本地或云端大模型的 CLI 工具
这是一个开源命令行工具,核心功能是让用户写规则来决定哪些查询走本地模型、哪些走云端 API,而不是靠模型自己“猜”该走哪条路。好处是省钱(敏感或简单问题用本地模型,不浪费 API 调用)和保护隐私(数据不用全往外送)。项目目前只有 37 个星,正文没披露支持哪些具体模型、规则怎么写,也没给性能数据,所以实用性还得自己试。
#Wayfinder Router#itsthelore#Open source
一句话点评
一个开源命令行工具,让你写规则决定哪些查询走本地模型、哪些走云端 API,而不是让模型自己猜。省钱(简单问题用本地,不浪费 API 调用)且保护隐私。目前只有 37 个星,正文没披露支持哪些模型、规则怎么写,也没给性能数据,实用性得自己试。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
03:55
30d ago
AI HOT 精选· aihot-apiZH03:55 · 06·28
阿德拉菲尼尔:让Mac在AI agent干活时自动保持唤醒
一个菜单栏小工具,能检测AI编程agent是否在运行,只有agent工作时才阻止Mac休眠。不用再手动切到“永不睡眠”模式了。正文没披露支持哪些agent、是否免费开源。
#kageroumado
一句话点评
一个Mac菜单栏小工具,能检测AI编程agent是否在运行,只有agent干活时才阻止Mac休眠,省得手动切“永不睡眠”。正文没披露支持哪些agent、是否免费开源,实用性得自己试。
HKR 分解
hook knowledge resonance
打开信源
35
SCORE
H0·K0·R0
00:10
30d ago
r/LocalLLaMA· rssEN00:10 · 06·28
55 个模型互相盲评:同门模型打分时普遍偏袒自己人
一个社区实验让 55 个语言模型互相盲评,总共收集了 2.2 万条打分。结果发现,只要数据量够,每个模型家族都会偏袒自家兄弟:Qwen 当裁判时给 Qwen 系模型平均多打约 0.9 分,而 Mistral 当裁判时反而会压自家模型约 1.0 分。正文被 Reddit 的网络防火墙拦住了,具体的实验设计、评分标准和数据集都没法看到,所以这些偏差是怎么测...
#Benchmarking#Qwen#Mistral
一句话点评
一个社区实验让 55 个模型互相盲评,发现模型当裁判时会偏袒自家兄弟。Qwen 裁判给 Qwen 系模型平均多打 0.9 分,Mistral 裁判反而压自家模型约 1.0 分。这个偏差幅度不算小,如果是真的,说明用模型评模型这套做法本身就有系统性偏误,不能直接当客观分数用。 不过正文被 Reddit 防火墙拦住了,实验设计、评分标准、数据集和样本量都看不到。2.2 万条打分听起来不少,但不...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R1

更多

频道

后台