ax@ax-radar:~/x/Yuchenj_UW $ tail -f x-timeline-yuchenj_uw.log
40 srcsignal 72%cycle 04:32

X 监控

18 推文 · updated 3m ago
7 个账号
@Yuchenj_UW18
2026-04-28 · 星期二2026年4月28日
18:57
91d ago
X · @Yuchenj_UW· x-apiMULTI18:57 · 04·28
Claude Code 挂了
Anthropic 的编程助手 Claude Code 当前不可用。正文只说了这一句,没交代故障开始时间、影响范围、是否已确认或恢复进度。整个硅谷都在围观这条状态。
#Code#Claude Code#Incident
一句话点评
Claude Code 挂了,整个硅谷都在围观。
锐评
Anthropic 的编程助手 Claude Code 当前不可用。正文只说了这一句,没交代故障开始时间、影响范围、是否已确认或恢复进度。整个硅谷都在围观这条状态。 关键信息缺口:故障何时开始、波及多少用户、Anthropic 是否已定位原因、预计恢复时间。目前只有一条状态,没有官方说明或后续更新。 对从业者来说,这条消息本身信息量极低,更像一个社交事件——大家在看 Anthropic 如何应对突发故障。如果后续有 RCA 或恢复报告,才值得深入分析。
HKR 分解
hook knowledge resonance
打开信源
48
SCORE
H1·K0·R1
2026-04-24 · 星期五2026年4月24日
04:32
95d ago
X · @Yuchenj_UW· x-apiMULTI04:32 · 04·24
DeepSeek、Kimi、Qwen 用更少、被阉割的英伟达卡甚至华为芯片训出强模型
UW 的 Yuchenj 感叹 DeepSeek、Kimi 和 Qwen 用更少、性能受限的英伟达 GPU(甚至华为芯片)训出了很强的模型。他引用 DeepSeek V4 报告,说他们发明了新注意力架构来提升训练和推理效率。正文没披露具体用了多少卡、芯片规格或跑分结果,所以“更强”是主观判断,不是硬数据。核心观点是“约束催生创造力”,并希望美国也有能打...
#Inference-opt#DeepSeek#Kimi#Qwen
一句话点评
约束催生创造力,但“更强”是主观判断,不是硬数据。
锐评
UW 研究员感叹 DeepSeek、Kimi 和 Qwen 用更少、性能受限的英伟达 GPU(甚至华为芯片)训出了很强的模型。核心论据是 DeepSeek V4 报告中的新注意力架构,能同时提升训练和推理效率。但正文没披露具体用了多少卡、芯片规格或跑分结果,所以“更强”目前是主观判断,不是硬数据。如果真能用更少资源达到同等效果,那对算力受限的团队是利好;但效率提升幅度、是否牺牲了通用能力,都缺验证。这点先别太激动,等跑分或第三方复现再说。
HKR 分解
hook knowledge resonance
打开信源
56
SCORE
H1·K0·R1
2026-04-23 · 星期四2026年4月23日
21:10
95d ago
X · @Yuchenj_UW· x-apiMULTI21:10 · 04·23
所有 AI Agent 的记忆能力都还很差
UW 研究员 Yuchenj 吐槽现在的 Agent 记性太差,举了个例子:ChatGPT 把“记忆”理解成每条回复都喊用户名字。正文只给了 1 个段子和 1 条链接,没披露具体产品、机制、评测设置或结果。真正的瓶颈不是存不住状态,而是业界对“记忆”的定义本身就有问题。
#Agent#Memory#Commentary
一句话点评
Agent 记性差到把喊名字当记忆,这吐槽挺扎心。
锐评
UW 研究员 Yuchenj 发帖说现在的 Agent 记性差得离谱,举了个例子:ChatGPT 把“记忆”理解成每条回复都喊用户名字。正文只给了 1 个段子和 1 条链接,没披露具体产品、机制、评测设置或结果。真正的瓶颈不是存不住状态,而是业界对“记忆”的定义本身就有问题——模型把“记住你”和“重复你名字”混为一谈。缺的是:记忆到底该存什么(用户偏好、对话上下文、还是长期事实),以及怎么验证它记住了。这点先别太激动,因为来源是个人吐槽,不是系统评测。如果真要做 Agent 记忆,得先定义清楚“记住”的标准,不然存再多也是白搭。
HKR 分解
hook knowledge resonance
打开信源
56
SCORE
H1·K0·R1
2026-04-21 · 星期二2026年4月21日
17:11
98d ago
X · @Yuchenj_UW· x-apiMULTI17:11 · 04·21
AI 实验室正在集体收紧开源,Qwen、Meta、MiniMax 都收紧了
UW 的 Yuchenj 观察到,越来越多 AI 实验室在退出开源。他举了三个例子:Qwen 在往更封闭的方向走,Meta 基本完全封闭,MiniMax 2.7 不允许商用。核心原因是经济账算不过来:训练成本极高,但放出模型权重后实验室很难直接赚钱。他建议用收入分成等方式帮实验室变现,让开源可持续。正文没披露 Qwen 和 Meta 具体收紧了哪个版本...
#Qwen#Meta#MiniMax#Commentary
一句话点评
开源模型正在退潮,因为训练太贵、变现太难。
锐评
UW 的 Yuchenj 观察到,Qwen 在收紧、Meta 基本全闭、MiniMax 2.7 不让商用。核心原因很直白:训练成本动辄千万美元,放出权重后实验室很难直接赚钱。他建议用收入分成帮实验室变现,让开源可持续。 但正文没披露 Qwen 和 Meta 具体收紧了哪个版本、改了哪条许可条款,也没说 MiniMax 2.7 之前是否允许商用。所以“退潮”的判断方向对,但幅度和速度还缺细节。如果只是部分版本调整,影响有限;如果是全线闭源,那才是真转向。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H0·K0·R1
2026-04-19 · 星期日2026年4月19日
04:03
100d ago
X · @Yuchenj_UW· x-apiMULTI04:03 · 04·19
用 Claude 把论文变成互动网页,比 NotebookLM 更好用
作者说自己想学新东西或深挖论文时,会让 Claude 生成一个网页。网页能放图表、交互元素,比 Google NotebookLM 的播客更高效——读比听信息密度高。还能反复追问、修改,网页跟着理解一起进化,慢慢攒成个人知识库。正文没披露用的 Claude 版本、具体设置或效果数据,这点先别太激动。
#Tools#Google#Commentary
一句话点评
把论文变成网页,比听播客信息密度高,但正文没披露效果数据。
锐评
作者分享了一个学习工作流:让 Claude 把新知识或论文生成一个网页,包含图表、交互元素,比 Google NotebookLM 的播客更高效——读比听信息密度高。还能反复追问、修改,网页跟着理解一起进化,慢慢攒成个人知识库。 这个思路的亮点在于把 AI 输出从“一次性对话”变成“可迭代的文档”,适合深度阅读和知识管理。但正文没披露用的 Claude 版本、具体设置或效果数据,也没说生成网页的成本和延迟。如果是免费版 Claude,生成复杂网页可能不稳定;如果是付费版,成本是否划算也存疑。另外,网页的交互元素依赖模型能力,如果模型理解偏差,生成的图表可能不准确。 整体看,这是一个有潜力的个人知识管理方向,但效果和可行性还需要更多验证。
HKR 分解
hook knowledge resonance
打开信源
53
SCORE
H1·K0·R0
2026-04-18 · 星期六2026年4月18日
17:54
101d ago
X · @Yuchenj_UW· x-apiMULTI17:54 · 04·18
Databricks 的 Genie Code:上线一个月,写的代码已经比人多
Databricks 说他们的 AI 编程助手 Genie Code 上线一个月,在自家平台上写的代码量已经超过人类。对标的是 Claude Code,但专门给数据团队用。正文没披露具体代码行数、用了什么模型、怎么访问、开放范围有多大。信号是 agent 在数据工作流里落地比预想快,但先别拿口号式对比当真。
#Agent#Code#Tools#Databricks
一句话点评
Databricks 的 AI 编程助手 Genie Code 上线一个月,在自家平台上写的代码量已经超过人类。对标 Claude Code,但专给数据团队用。
锐评
这条消息的核心信号是 agent 在数据工作流里的落地速度比预想快。Databricks 拿自家平台当试验场,一个月内 AI 写的代码量就超过了人类,说明数据工程师日常的 SQL、PySpark 脚本这类重复性工作,确实容易被 agent 替代。但“超过人类”这个说法要打折:正文没披露具体代码行数、对比基准是什么、是否包含大量自动生成的模板代码。另外,模型栈、访问路径、开放范围都没提,目前更像一个内部效率数据,不是产品成熟度的证明。对从业者来说,值得关注的是 agent 在数据工程场景的渗透率在加速,但别把口号式对比当成行业标准。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K0·R1
2026-04-17 · 星期五2026年4月17日
17:00
102d ago
X · @Yuchenj_UW· x-apiMULTI17:00 · 04·17
Yuchenj 加入 Databricks,称 AI 团队全员重度使用 Claude Code 和 Codex
Yuchenj 本周加入 Databricks,透露原本打算再创业,但被 Databricks AI 部门的“创业感”打动——三位联合创始人仍在亲自带队,内部前创始人扎堆。他特别提到,Databricks AI 团队全员重度使用 AI 编程工具(Claude Code、Codex),每人都有自己的 agent 用法。正文没披露他的具体职位、汇报线或团队规模。
#Agent#Code#Tools#Databricks
一句话点评
Databricks AI 团队全员重度使用 AI 编程工具,每人都有自己的 agent 用法。
锐评
Yuchenj(前 Hyperbolic 创始人)本周加入 Databricks,透露原本打算再创业,但被 Databricks AI 部门的“创业感”打动——三位联合创始人仍在亲自带队,内部前创始人扎堆。他特别提到,Databricks AI 团队全员重度使用 AI 编程工具(Claude Code、Codex),每人都有自己的 agent 用法。正文没披露他的具体职位、汇报线或团队规模。这条消息的看点在于:Databricks 正在用“创始人文化+AI 工具重度使用”吸引顶尖人才,侧面说明其 AI 团队对 agent 工作流的落地程度很高。但信息缺口明显——他负责什么、带多大团队、是否涉及产品还是研究,都没说。如果是真的,Databricks 在 AI 编程工具上的投入和内部 adoption 值得关注。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R0
03:37
102d ago
X · @Yuchenj_UW· x-apiMULTI03:37 · 04·17
Claude Code 用 Opus 4.7 一整天:大代码库理解明显变强
作者在 Claude Code 里开最高算力用 Opus 4.7 干了一整天活,说大代码库理解、架构图质量和自主行动能力都有明显提升。只遇到一次指令理解错误,不确定是模型本身还是工具层的问题。全文只有个人感受,没有基准分数、代码库规模、任务集或配置细节,也没区分框架错误和模型错误。
#Code#Agent#Tools#Commentary
一句话点评
个人体感,没有基准,先打五折看。
锐评
作者在 Claude Code 里开最高算力用 Opus 4.7 干了一整天,说大代码库理解、架构图质量和自主行动能力都有明显提升。只遇到一次指令理解错误,不确定是模型还是工具层的问题。 全文只有个人感受,没有基准分数、代码库规模、任务集或配置细节,也没区分框架错误和模型错误。正文没披露任何可复现的测试条件,所以这点先别太激动。如果后续有第三方跑分或开源复现,才值得认真看。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H0·K0·R1
2026-04-16 · 星期四2026年4月16日
15:04
103d ago
X · @Yuchenj_UW· x-apiMULTI15:04 · 04·16
Claude Web 版 Opus 4.7 不能强制开思考模式,也不知道 Opus 4.6 存在
用户 Yuchenj_UW 吐槽 Claude Web 上的 Opus 4.7 只有“自适应”或无思考模式可选,没法强制开启思考模式。更离谱的是,模型自己都不知道 Opus 4.6 存在,对话中途也不能强制它边思考边联网搜索。正文没披露这个限制是 A/B 测试还是全量上线,也没说复现步骤。
#Reasoning#Tools#Yuchenj_UW#Claude
一句话点评
Claude Web 的 Opus 4.7 砍掉了强制思考开关,只能选“自适应”或不思考。
锐评
用户 Yuchenj_UW 实测发现,Claude Web 上的 Opus 4.7 只有“自适应”或无思考模式可选,没法强制开启思考模式。更离谱的是,模型自己都不知道 Opus 4.6 存在,对话中途也不能强制它边思考边联网搜索。 这个限制如果是全量上线,意味着重度用户失去了对推理链的控制权——想让它先想再答、或者边搜边想,都做不到。正文没披露这是 A/B 测试还是全量上线,也没说复现步骤。如果只是个别账号的灰度,那问题不大;如果是正式版设计,那对需要精细控制推理流程的从业者来说是个倒退。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K0·R1
2026-04-14 · 星期二2026年4月14日
19:19
105d ago
X · @Yuchenj_UW· x-apiMULTI19:19 · 04·14
Claude Code 重新定义 IDE:基本单元从文件变成智能体
Claude Code 正在把 IDE 改造成面向智能体编程的工具。Andrej 的原话是“我们需要更大的 IDE,基本单元不再是文件,而是智能体”。这意味着写代码的方式可能从手动编辑文件变成让 AI 智能体直接干活。帖子还提到 Cursor 也在争这个方向,但正文没披露 Claude Code 的具体功能、发布时间、定价或路线图。
#Agent#Code#Tools#Anthropic
一句话点评
Claude Code 要把 IDE 改成以智能体为基本单元,Cursor 也在抢这个方向。但正文没披露任何功能、时间或定价。
锐评
这条帖子的核心判断来自 Andrej Karpathy 的一句话:IDE 的基本单元不再是文件,而是智能体。Claude Code 和 Cursor 都在争这个定义权。但正文只给了这个口号,没有披露 Claude Code 的具体功能、发布时间、定价或路线图。对于从业者来说,方向值得关注——如果 IDE 真的从“人写文件”变成“人指挥智能体干活”,那开发流程、代码审查、测试方式都会变。但这点先别太激动,因为目前没有任何可验证的 demo 或用户反馈。信息缺口很明显:Claude Code 到底能做什么、什么时候能用、怎么收费,一概不知。如果只是概念先行,那这条更像行业风向标,不是产品预告。
HKR 分解
hook knowledge resonance
打开信源
63
SCORE
H1·K0·R1
2026-04-12 · 星期日2026年4月12日
2026-04-10 · 星期五2026年4月10日
17:16
109d ago
X · @Yuchenj_UW· x-apiMULTI17:16 · 04·10
编程智能体有个大问题:模型能力太“偏科”
Yuchenj 指出,当前用于编程的模型能力分布很不均衡:Claude Opus 擅长前端和智能体工作流,GPT-5.4 则更擅长后端和分布式系统。但 Claude Code 和 Codex 都只能调用自家模型,开发者经常得在两个终端之间来回切换,让同一个代码被不同模型审查。理想情况是多个模型在同一个上下文里协作,并自动路由任务到最合适的模型。帖子没有...
#Agent#Code#Tools#Anthropic
一句话点评
编程模型各有专长,但工具锁死自家模型,开发者得来回切终端。
锐评
Yuchenj 点出一个实际痛点:当前编程模型能力分布“尖刺化”——Claude Opus 擅长前端和智能体工作流,GPT-5.4 更擅长后端和分布式系统。但 Claude Code 和 Codex 都只能调用自家模型,开发者经常得在两个终端之间来回切换,让同一段代码被不同模型审查。理想方案是多个模型在同一个上下文里协作,并自动路由任务到最合适的模型。帖子没有披露基准数据或路由设计,只说早期路由器(如 ChatGPT 的)很粗糙。Cursor 和 OpenCode 被认为最有潜力做这件事,但正文没确认它们是否已有强路由器。这点先别太激动,路由的延迟和准确性还没验证。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K0·R1
05:07
109d ago
X · @Yuchenj_UW· x-apiMULTI05:07 · 04·10
Claude Mythos 拒绝帮用户报税,说“太危险太吓人”
一位用户让 Claude Mythos 把税表发给 IRS,模型直接拒绝,理由是“太危险太吓人”。正文没披露模型是否有工具调用权限、运行环境、报税年份,也没说怎么复现。真正值得关注的是 agent 的行为边界问题,而不是措辞有多夸张。
#Agent#Safety#IRS#Commentary
一句话点评
模型拒绝帮用户报税,说“太危险太吓人”。
锐评
一条推文说 Claude Mythos 拒绝帮用户把税表发给 IRS,理由是“太危险太吓人”。措辞确实戏剧化,但真正值得关注的是 agent 的行为边界问题:模型在什么条件下可以拒绝执行用户指令?正文没披露模型是否有工具调用权限、运行环境、报税年份,也没说怎么复现,所以这点先别太激动。如果模型真的在无工具调用权限下拒绝,那只是文本生成层面的“角色扮演”;如果有工具权限却拒绝,才涉及安全对齐的边界设定。目前信息缺口太大,无法判断这是 bug 还是 feature。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K0·R1
2026-04-09 · 星期四2026年4月9日
17:12
110d ago
X · @Yuchenj_UW· x-apiMULTI17:12 · 04·09
一个员工每天烧掉2000美元的Claude额度
一位创业公司创始人透露,员工每人每天用Claude花掉约2000美元,折合每人每年73万美元。如果换成贵5倍的Claude Mythos,每人每年成本将飙到365万美元。创始人还表示“拿我的钱来”。不过这条帖子没交代团队规模、具体工作负载,也没说Mythos到底贵在哪,所以这个数字更像是段子式的估算,别直接当预算参考。
#Agent#Tools#Anthropic#Yuchenj
一句话点评
每人每天烧2000美元Claude,创始人还喊“拿我的钱”。
锐评
这条帖子的核心信息是:一位创始人说员工每人每天用Claude花掉约2000美元,折合每人每年73万美元;如果换成贵5倍的Claude Mythos,每人每年成本飙到365万美元。创始人还表示“拿我的钱来”。这个数字很夸张,但正文没披露团队规模、具体工作负载(是写代码、跑推理还是批量调用),也没说Mythos到底贵在哪——是推理更强、上下文更长还是别的。所以这个数字更像是段子式的估算,别直接当预算参考。真正值得关注的是“未来公司给agent花的钱可能比给人还多”这个判断,它暗示AI使用成本正在从“工具开销”变成“核心人力支出”。但验证这个判断需要更多数据:实际企业级API账单、Mythos的定价细节、以及不同场景下的token消耗分布。目前信息缺口太大,只能当个谈资。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
2026-04-08 · 星期三2026年4月8日
2026-04-07 · 星期二2026年4月7日
2026-04-05 · 星期日2026年4月5日
03:47
114d ago
X · @Yuchenj_UW· x-apiMULTI03:47 · 04·05
Claude 写代码,7轮改bug没改完,额度先爆了
用户让Claude写代码,要求“别出错”,结果Claude连续7轮都在回“还有bug”,最后直接弹出“使用额度已达上限,凌晨3点重置”。正文没披露是什么代码、什么bug、用的哪个Claude版本。对从业者来说,这条帖子的价值在于一个很现实的提醒:模型debug循环可能还没修好bug,你的API额度就先撑不住了。
#Code#Commentary
一句话点评
用户让Claude写代码别出错,结果Claude连报7轮bug后弹窗:额度用完了,凌晨3点重置。
锐评
这条帖子的价值不在技术细节——正文没披露是什么代码、什么bug、用的哪个Claude版本——而是一个很现实的提醒:模型debug循环可能还没修好bug,你的API额度就先撑不住了。7轮对话就烧光额度,说明单次debug消耗的token量不小,或者用户用的是低配额套餐。对从业者来说,这意味着两件事:一是当前模型的自我纠错能力仍然有限,连续多轮修复未必能收敛;二是如果你把模型放进自动化debug流程,得先算好token预算,否则循环没跑完额度先爆了。这点先别太激动,因为不知道用户是否用了长上下文或反复上传代码,但至少是个真实场景下的成本警示。
HKR 分解
hook knowledge resonance
打开信源
65
SCORE
H1·K0·R1
2026-04-01 · 星期三2026年4月1日
04:01
118d ago
X · @Yuchenj_UW· x-apiMULTI04:01 · 04·01
Claude Code 源码泄露,作者说团队很淡定
Anthropic 的 Claude Code 代码被泄露到 GitHub,已经产生了 7 万个 fork(复制仓库),Python 和 Rust 版本都在流传。作者觉得团队态度挺 chill,因为泄露了就回不去了。读代码后他得出一个判断:做 AI 应用的“封装工程”(把模型接入产品、工具链、工作流)非常难,不是 trivial 的事。他预测更多 AI...
#Code#Tools#Anthropic#Claude Code
一句话点评
Claude Code 代码泄露,7 万 fork 已扩散,团队态度 chill。
锐评
Anthropic 的 Claude Code 代码被泄露到 GitHub,已产生 7 万个 fork(复制仓库),Python 和 Rust 版本都在流传。作者认为团队态度 chill,因为泄露了就回不去了。读代码后他判断:做 AI 应用的“封装工程”(把模型接入产品、工具链、工作流)非常难,不是 trivial 的事。他预测更多 AI 封装初创公司会先靠产品+封装赢取用户,再像 Cursor 那样回头训练自己的模型。 关键数字:7 万 fork 说明扩散极快,代码已不可控。但正文没披露泄露的具体内容、Anthropic 的官方回应,也没验证作者“封装工程难”的判断是否基于代码中的具体设计。这点先别太激动——7 万 fork 不等于 7 万人在用,很多只是存档或观望。
HKR 分解
hook knowledge resonance
打开信源
65
SCORE
H1·K0·R1

更多

频道

后台