ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-14

49 items · updated 3m ago
RSS live
2026-05-14 · 星期四2026年5月14日
09:05
75d ago
AI HOT 精选· aihot-apiZH09:05 · 05·14
写了个技能:让 Codex 自动循环审查代码直到零错误
开发者 steipete 写了一个 codex-review 技能,能自动循环调用 Codex 的 /review 接口,直到代码没有报错为止。注意:它不会帮你改系统架构,核心逻辑还得靠人脑(原文说“仍然需要 BRAIN 作为主模型”)。适合用来做代码质量检查的自动化,但别指望它能重构你的项目结构。
#Agent#Code#Tools#steipete
一句话点评
短评:自动循环跑 Codex 审查直到无报错,省人工但别指望它改架构。 点评:开发者 steipete 写了个 codex-review 技能,核心逻辑是循环调用 Codex 的 /review 接口,直到代码没报错才停。好处是自动化代码质量检查,省掉反复手动提交审查的功夫。但原文明确说了两点限制:一是不会修系统架构,二是“仍然需要 BRAIN 作为主模型”——说白了,核心逻辑和设计决策还...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
08:53
75d ago
Product Hunt · AI· rssEN08:53 · 05·14
Picsart MCP:一个接口调 140 多个 AI 模型做图做视频
Picsart 今天上线了一个 MCP 服务器,相当于给 AI 助手开了一个统一工具箱,通过一个接口就能调用 140 多个图像、视频和音频模型。用户用自然语言提需求,助手自动选模型出结果,不用手动切换工具或学界面。好处是省掉了集成多个 API 的麻烦,但正文没披露定价、API 限频和具体模型列表,实际落地成本和使用门槛还不清楚。
#Multimodal#Vision#Tools#Picsart
一句话点评
Picsart 把 140 多个图像/视频/音频模型打包成一个 MCP 接口,AI 助手说人话就能调,不用切工具。省掉集成多个 API 的麻烦,这点对开发者友好。但正文没披露定价、API 限频和具体模型列表,实际落地成本和使用门槛还不清楚。短评:140+模型一个接口,省事但没报价,先别激动。
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R0
08:24
75d ago
r/LocalLLaMA· rssEN08:24 · 05·14
TurboQuant+MTP 在 ROCm 上跑起来了:RX 7900 XTX 跑 Qwen3.6-27B,64k 上下文,38–54 tok/s
DrBearJ3w 在 llama.cpp 分支里给 ROCm 加上了 TBQ4 KV cache 和 MTP(多 token 预测)。实测 RX 7900 XTX 跑 Qwen3.6-27B,64k 上下文只占约 20 GB 显存,生成速度 38–54 tok/s。这个显存占用挺省,比同规模模型常规量化低不少;速度也够用,但注意这是 AMD 卡,N ...
#Inference-opt#DrBearJ3w#llama.cpp#Qwen
一句话点评
AMD 卡用户有福了。有人在 llama.cpp 分支给 ROCm 加了 TBQ4 KV cache 和多 token 预测,RX 7900 XTX 跑 Qwen3.6-27B,64k 上下文只占约 20 GB 显存,生成速度 38–54 tok/s。显存省得明显,速度也够用。但注意这是 AMD 卡,N 卡用户别激动;且这是个人分支,非官方合并,稳定性未知。正文被屏蔽,没披露具体量化精度损失...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
08:20
75d ago
r/LocalLLaMA· rssEN08:20 · 05·14
本地模型搜到2026年伊朗战争新闻,却硬说是虚构的
一位Reddit用户发现,gemma-4-26B-A4B-it-Q4_K_M_128k模型在联网搜索后,明明看到了“Epic Fury”等具体操作名称和日期,仍然把2026年伊朗战争新闻归类为“虚构场景”或“地缘政治模拟”。问题出在过度RLHF训练让模型对知识截止日期之后的内容产生怀疑,即使给了搜索工具也改不了。一个临时解法是在系统提示里加上“今天是2...
#Tools#Alignment#Gemma#Gemini
一句话点评
Gemma-4本地版联网搜到“Epic Fury”等2026年伊朗战争新闻,仍坚持这是“虚构场景”。过度RLHF让模型对知识截止日期后的内容产生怀疑,给了搜索工具也改不了。临时解法:系统提示里加“今天是2026年”。正文没披露哪些模型受影响更严重,也没说Gemini API是否完全无此问题。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
08:12
75d ago
r/LocalLLaMA· rssEN08:12 · 05·14
用树莓派搭集群学分布式训练,一块板子30到50美元
作者发了个树莓派集群搭建指南,目标是用来学分布式训练和推理。每块板子30到50美元,成本确实低,但正文没披露跑了什么模型、吞吐量多少,也没说异构推理能不能跑通。目前更像一个硬件搭建教程,离真正能跑模型还有距离。
#Inference-opt#Raspberry Pi#smolcluster#LocalLLaMA
一句话点评
树莓派集群跑分布式训练,成本确实低(每块30-50美元),但正文没披露跑了什么模型、吞吐量多少,也没说异构推理能不能跑通。目前更像硬件搭建教程,离真正能跑模型还有距离。短评:树莓派组集群学分布式,成本低但没跑通模型,别急着当生产力工具。
HKR 分解
hook knowledge resonance
打开信源
61
SCORE
H1·K0·R1
08:10
75d ago
AI HOT 精选· aihot-apiZH08:10 · 05·14
Ring-2.6-1T 模型发布,Claw-Eval 通用分 58.4、多轮对话 86.8
inclusionAI 放出了 Ring-2.6-1T 模型,参数量 1T。在 Claw-Eval 测试里,通用能力拿了 58.4 分,多轮对话拿了 86.8 分。两个分数都已经上了对应的排行榜。不过正文没披露训练数据、推理成本、开源协议这些信息,暂时只能看个分数。
#Benchmarking#inclusionAI#Product update#Benchmark
一句话点评
Ring-2.6-1T 在 Claw-Eval 上通用 58.4、多轮 86.8,多轮分数挺高,但通用刚过及格线。1T 参数不小,可训练数据、推理成本、开源协议全没提,暂时只能看个榜。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R0
07:17
75d ago
AI 群聊日报· atomZH07:17 · 05·14
Anthropic 给 Claude Code 加量但把 Agent SDK 拆出来单独收费
Anthropic 调整了 Claude Code 的配额和计费:周限额提高 50%(到 7 月 13 日),但 Agent SDK 和 claude -p 从订阅中拆出来独立计费——Max 5x 用户每月给 100 美元额度,用完按量付费。群里反应从“感谢一龙”到“自助餐没有了”只隔了几条消息,有人立刻给出 stdio redirection 绕路方...
#Agent#Code#Tools#Anthropic
一句话点评
Anthropic 给 Claude Code 周限额加了 50%,但把 Agent SDK 和 claude -p 从订阅里拆出来单独收费,Max 5x 用户每月给 100 美元额度,用完按量付费。群里反应从“感谢一龙”到“自助餐没有了”只隔了几条消息,有人立刻给出 stdio redirection 绕路方案。短评:加量但拆了核心功能,绕路方案实操性存疑。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H0·K1·R1
07:03
75d ago
Product Hunt · AI· rssEN07:03 · 05·14
Drizz:用自然语言写移动端测试,AI 自动跑并自己修
Drizz 是一个 AI 驱动的移动端测试自动化平台,核心卖点是“意图驱动测试”——你直接用中文描述想测什么(比如“登录后检查首页是否显示用户名”),它就在真机上用视觉 AI 执行,并自动生成可复用的测试用例。不用写脚本、不用管选择器、不用手动维护,还能适配动态 UI 并接入 CI/CD 流水线。正文没披露支持哪些平台(iOS/Android)、具体定...
#Agent#Code#Tools#Drizz
一句话点评
Drizz 让你用中文说“测登录后首页显示用户名”,它就在真机上用视觉 AI 跑测试,自动生成可复用的用例,不用写脚本。亮点是意图驱动 + 真机执行,省掉维护选择器的麻烦。但正文没披露支持 iOS 还是 Android、定价、以及视觉 AI 在复杂 UI 下的准确率,这点先别太激动。如果真能稳定适配动态 UI,对 QA 团队挺省人力。
HKR 分解
hook knowledge resonance
打开信源
46
SCORE
H1·K0·R1
06:50
75d ago
Product Hunt · AI· rssEN06:50 · 05·14
Raindrop Workshop:开源免费的 AI Agent 本地调试器
Raindrop Workshop 是一个开源、免费、本地的 AI Agent 调试工具,能逐 token 实时流式显示 Agent 的调用轨迹。它支持通过 MCP 协议让另一个 Agent(比如 Claude Code)读取这些轨迹,然后自动写评估、回放调试、修 bug,形成“自愈循环”。目前正文没披露支持哪些框架、运行环境要求以及具体开源协议,但免...
#Agent#Tools#Raindrop Workshop#Product update
一句话点评
Raindrop Workshop 是一个开源、免费、本地的 AI Agent 调试工具,能逐 token 实时显示 Agent 的调用轨迹。亮点是它支持通过 MCP 协议让另一个 Agent(比如 Claude Code)读取这些轨迹,然后自动写评估、回放调试、修 bug,形成“自愈循环”。这点先别太激动——正文没披露支持哪些框架、运行环境要求以及具体开源协议,但免费本地运行这点对开发者挺...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
06:48
75d ago
AI HOT 精选· aihot-apiZH06:48 · 05·14
百度把智能体日活当核心指标,但没公布具体数字
百度发了一篇新闻稿,说要全力推智能体(让AI独立完成任务的程序),并把日活跃智能体数量作为关键考核指标。但正文没披露目前有哪些智能体产品、日活怎么定义、以及具体数值是多少。这个方向本身不新鲜,关键是后续能不能拿出有用户量的实际案例。
#Agent#Baidu#Product update
一句话点评
百度把日活智能体数当KPI,但没公布任何具体数字或产品名单。方向不新鲜,关键是后续能不能拿出有用户量的实际案例。
HKR 分解
hook knowledge resonance
打开信源
48
SCORE
H0·K1·R0
06:24
75d ago
彭博科技· rssEN06:24 · 05·14
鸿海利润超预期,AI服务器撑起增长
鸿海(富士康)季度利润高于预期,股价创2月以来最大盘中涨幅,主要靠AI服务器需求拉动。正文被彭博付费墙挡住,没披露利润具体增长多少、服务器收入占比和股价涨幅数字。
#Hon Hai Precision Industry#Nvidia#Product update
一句话点评
鸿海(富士康)靠AI服务器需求拉动,季度利润超预期,股价创2月以来最大盘中涨幅。但正文被彭博付费墙挡住,利润具体增长多少、服务器收入占比和股价涨幅数字都没披露。信息缺口明显,只能确认AI服务器确实在拉动代工厂业绩,但没法判断拉动幅度和持续性。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K0·R1
06:13
75d ago
r/LocalLLaMA· rssEN06:13 · 05·14
开源工具让AI跨电脑操控屏幕:点、点、打字,全在本地
Opendesk 发布了一个计算机使用 MCP,能让 AI 在同一 WiFi 下远程操控另一台电脑的屏幕——看到画面、移动鼠标、点击、打字。一次配对后无需云账号或中转服务器,所有数据本地加密传输。支持 Mac、Linux、Windows,开源免费。适合想用 Claude、Cursor 或自己写的 AI 流程去操作另一台机器的场景。正文没披露延迟和稳定性...
#Agent#Tools#opendesk#Claude
一句话点评
Opendesk 搞了个开源 MCP,能让 AI 在同一 WiFi 下远程操控另一台电脑的屏幕、鼠标和键盘,一次配对后数据本地加密传输,不用云账号。适合用 Claude 或 Cursor 去操作另一台机器。但正文没披露延迟和稳定性,实际体验可能打折扣。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
06:05
75d ago
TechCrunch AI· rssEN06:05 · 05·14
AI 该告诉你什么,谁说了算?前 Meta 新闻主管有话说
Campbell Brown 在 StrictlyVC 活动上说,硅谷圈子和普通消费者对 AI 信息筛选的讨论完全是两码事。但正文没披露任何具体的治理机制或决策流程,只点出了这个认知分裂的现象。
#Safety#Campbell Brown#Meta#StrictlyVC
一句话点评
前Meta新闻主管Campbell Brown点出一个现象:硅谷圈和普通消费者对AI该不该筛选信息、怎么筛,讨论的完全是两回事。但正文只抛了现象,没披露任何具体治理机制或决策流程——谁定规则、怎么定、用户有没有选择权,一概没提。这点先别太激动,信息缺口很大。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R1
05:57
75d ago
AI HOT 精选· aihot-apiZH05:57 · 05·14
Kimi K2.6 金融智能体评测登顶,但分数和对手差距没说
Kimi K2.6 在 Finance Agent Benchmark V2 上拿了开源模型第一,这个榜单测的是 AI 能不能干金融分析师的工作,比如读财报、算指标。但原帖没交代测试集多大、评分规则是什么、比第二名高多少,所以这个“第一”的含金量暂时不好判断。
#Agent#Benchmarking#Kimi#Moonshot AI
一句话点评
Kimi K2.6 在金融智能体基准上拿了开源第一,测的是读财报、算指标这类活儿。但原帖没交代测试集多大、评分规则、比第二名高多少,这个“第一”的含金量暂时不好判断。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
05:24
75d ago
TechCrunch AI· rssEN05:24 · 05·14
法律科技公司 Clio 年收入冲到 5 亿美元,Anthropic 也来加码
Clio 刚宣布年经常性收入(ARR)达到 5 亿美元,说明法律行业客户正在大量采用它的软件。同一时间 Anthropic 也在加码这个赛道,但正文没披露具体产品、定价、机制或上线时间。
#Clio#Anthropic#Commentary
一句话点评
Clio 年收入冲到 5 亿美元,说明法律行业真在批量买它的软件。同一时间 Anthropic 也盯上这块,但正文没披露具体产品、定价或上线时间,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H1·K1·R0
05:05
75d ago
● P1新智元 · 公众号· rssZH05:05 · 05·14
Anthropic企业市场份额首次超越OpenAI据Ramp支出数据
根据 Ramp 从 5 万多家公司的信用卡和发票支出里拉出来的数据,Anthropic 的企业市场份额冲到了 34.4%,OpenAI 掉到 32.3%,这是 OpenAI 三年来第一次在这个指标上被反超。不过正文因为微信环境验证挂了,看不到具体细节,比如统计口径是只算 API 调用还是也包了 ChatGPT 企业版订阅、数据覆盖了多长时间,这些都没法...
#Agent#Code#Multimodal#Anthropic
精选理由
精选 · 重要度 94 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 在 B2B 付费客户占比上首次超过 OpenAI,但数据来自美国偏重的支付平台 Ramp,不是全球市场,别急着说王座易主。
锐评
Ramp 的支付数据显示,今年 4 月 Anthropic 的企业客户占比达到 34.4%,OpenAI 是 32.3%,这是 Anthropic 第一次在这个指标上反超。过去一年 Anthropic 的渗透率翻了四倍,而 OpenAI 几乎没动,只涨了 0.3%。 但这个数据有几个坑要先说清楚。第一,Ramp 主要覆盖美国公司,不能代表全球。第二,它统计的是“有多少公司在 Ramp 上给这家 AI 公司付过钱”,不是花了多少钱、用了多少量。如果一家公司只是试了一下就停掉,也会被算进去。第三,Anthropic 的新模型 Opus 4.7 成本比前代高出一大截,处理图片的费用更是涨到三倍,客户账单变贵不等于用得更多。Ramp 自己的经济学家也提醒,这行换供应商太快,领先优势可能几个月就没了。 正文没披露客户留存率、平均合同金额,也没说这些公司到底在用模型做什么。光看一个付费占比就说 Anthropic 赢了,还太早。
HKR 分解
hook knowledge resonance
打开信源
94
SCORE
H1·K1·R1
05:05
75d ago
● P1新智元 · 公众号· rssZH05:05 · 05·14
田渊栋带队八人创业,估值 46.5 亿美元,要做能自己进化、自己搞研究的 AI
田渊栋和另外七位 AI 研究员一起创立了 Recursive Superintelligence,团队目前 25 人,拿了 6.5 亿美元融资,估值冲到 46.5 亿美元。他们想干的事是把模型评估、数据筛选、训练、后训练甚至研究方向选择这些环节全交给 AI 自己跑,让整个研发流程自动化。正文因为需要验证没加载出来,具体技术路线和验证结果还不清楚,所以这...
#Agent#Reasoning#Fine-tuning#Recursive Superintelligence
精选理由
精选 · 重要度 86 · 吸引力 + 知识量 + 共鸣
一句话点评
田渊栋带队拿了44亿人民币,要做一个让AI自己搞研发的公司。但正文被验证墙挡了,具体怎么做、跑出什么结果全看不到,先别太激动。
锐评
田渊栋和另外七位研究员组了个25人的团队,公司叫Recursive Superintelligence,一口气融了6.5亿美元(约44亿人民币),估值冲到46.5亿美元。他们想干的事很直接:把模型评估、数据筛选、训练、后训练,甚至研究方向选择这些环节全交给AI自己跑,让整个研发流程自动化。 但问题在于,这篇报道的正文因为需要验证没加载出来,我们看不到任何技术细节或实验结果。团队到底是用什么架构让AI自己管自己的训练循环,有没有跑出比人工调参更好的模型,成本是多少,这些关键信息全是空白。6.5亿美元的融资额确实大,但光靠创始团队背景和愿景撑起46.5亿估值,在没有公开验证的情况下,更像是一场对“递归进化”概念的豪赌。 我会先打个折。田渊栋在Meta的强化学习和推理方向有实打实的积累,团队里还有Richard Socher这样的NLP老兵,人的底子不差。但“让AI自己搞研发”这个目标太大了,目前连一个跑通的demo都没看到。等他们放出第一个自动训练出来的模型再聊,现在只能当一条高额融资新闻看。
HKR 分解
hook knowledge resonance
打开信源
86
SCORE
H1·K1·R1
04:10
75d ago
机器之心 · 公众号· rssZH04:10 · 05·14
魔芯科技发VGGT系列:用单张图也能做动态3D重建,还拿了新融资
魔芯科技(KOKONI 3D)联合同济大学发了四个VGGT成果,核心是StreamCacheVGGT,能处理无限长的视频流,内存只占O(1)——意思是不管视频多长,显存不涨。在KITTI数据集上超过500帧的测试里,深度误差(Abs Rel)做到0.123,算挺低的。其他几个工作分别解决单图重建、动态场景和实时渲染。公司同时宣布拿了新一轮融资,但正文没...
#Vision#Multimodal#Memory#KOKONI 3D
一句话点评
魔芯科技联合同济大学发了四个VGGT成果,核心是StreamCacheVGGT:视频流无限长,显存不涨(O(1)内存)。在KITTI超500帧测试里深度误差0.123,算低。其他三个分别做单图重建、动态场景和实时渲染。公司还拿了新一轮融资,但正文没披露金额和投资方。短评:无限长视频流+固定显存,这个挺实用;但KITTI是自动驾驶数据集,场景有限,泛化能力未知。融资细节缺失,不好判断商业化进度。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R0
04:00
75d ago
FT · 科技· rssEN04:00 · 05·14
科技巨头赢了:AI 烧天然气,但可以用“清洁”碳抵消来算账
一家企业气候监督机构在游说后放弃了一项更严格的净零排放提案。标题说科技巨头可以用“清洁”碳抵消来对冲 AI 扩张带来的天然气发电碳排放,但正文没披露监督机构名称、规则文本和实施日期。
#Policy
一句话点评
一家企业气候监督机构在游说后放弃更严提案,允许科技巨头用“清洁”碳抵消对冲AI扩张带来的天然气发电碳排放。正文没披露监督机构名称、规则文本和实施日期,信息缺口大,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
03:59
75d ago
Hacker News 首页· rssEN03:59 · 05·14
Anthropic 推出 Claude 小企业版:一键接入 QuickBooks、PayPal 等工具,自动跑 payroll、对账、开发票
Anthropic 发布了一个叫 Claude for Small Business 的套餐,本质是一套预制的 agent workflow(让 Claude 进业务流程干活),装在 Claude Cowork 里,小企业主一键开启就能连上 QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspac...
#Anthropic#Claude#Hacker News#Product update
一句话点评
Anthropic 出了个 Claude for Small Business 套餐,本质是给 Claude Cowork 预装 15 个 agent workflow(让模型进业务流程干活),一键连 QuickBooks、PayPal、HubSpot 等工具,能自动算工资、对账、跑营销。小企业占美国 GDP 44%,但 AI 落地慢,这套想降低门槛。不过正文没披露定价、上线时间、是否限地区...
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H0·K0·R1
03:29
75d ago
Product Hunt · AI· rssEN03:29 · 05·14
Agent FM:给 Claude 和 Codex 的智能体开个专属电台
Agent FM 是一个本地、开源的 Mac 应用,能让你像听电台一样实时监听 Claude Code 和 Codex 智能体的工作状态。每个智能体有独立频道,也可以混音收听全局动态,包括进度、卡点、决策、报错和请求关注。免费,但正文没披露具体集成方式、支持哪些平台以及发布时间表。
#Agent#Code#Tools#Agent FM
一句话点评
一个本地开源的 Mac 应用,让你像听电台一样实时监听 Claude Code 和 Codex 智能体的工作状态——每个智能体独立频道,还能混音听全局动态,包括进度、卡点、决策、报错和请求关注。免费,但正文没披露具体集成方式、支持哪些平台以及发布时间表。
HKR 分解
hook knowledge resonance
打开信源
52
SCORE
H1·K0·R1
03:19
75d ago
Hacker News 首页· rssEN03:19 · 05·14
AI Arena 模型 ELO 历史
作者开源了一个仪表盘,给每家 AI 实验室画一条旗舰模型 ELO 曲线,数据来自 Arena API 评测。正文没披露消费端网页输出的历史 ELO 数据集。曲线能看出模型发布后有没有被偷偷降级、加审查或量化压缩(为了省算力)。注意:API 测的是“裸模型”,而 gemini.com 或 chatgpt.com 这类聊天界面会加系统提示、安全过滤和 UI...
#Benchmarking#Arena AI#Hacker News#Open source
一句话点评
开源仪表盘给每家AI实验室画一条旗舰模型ELO曲线,数据来自Arena API评测。曲线能看出模型发布后有没有被偷偷降级、加审查或量化压缩(为了省算力)。注意:API测的是“裸模型”,而gemini.com或chatgpt.com这类聊天界面会加系统提示、安全过滤和UI包装,所以曲线下降不一定等于你实际体验变差。正文没披露消费端网页输出的历史ELO数据集,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
03:13
75d ago
Hacker News 首页· rssEN03:13 · 05·14
一个让AI帮你写代码时顺便学东西的GitHub项目
这是一个GitHub仓库,作者DrCatHicks提供了一个技能(skill),让Claude Code或Codex在帮你写代码的同时,刻意帮你练习编程技能。说白了就是不让AI替你全干了,而是留一些学习机会给你。项目目前有989颗星和43个fork,说明关注度还行。但正文没披露具体怎么实现的,比如它是通过提示词控制模型留白,还是有一套工作流来生成练习题...
#Code#Agent#Claude#Codex
一句话点评
一个让Claude Code或Codex在帮你写代码时故意留出学习机会的GitHub技能。989颗星,关注度还行。核心思路是让AI不全替你干,而是留一些编程练习给你。但正文没披露具体怎么实现的——是靠提示词控制模型留白,还是有一套工作流生成练习题。这点先别太激动,等作者放出实现细节再判断实用性。
HKR 分解
hook knowledge resonance
打开信源
56
SCORE
H1·K0·R1
02:35
75d ago
r/LocalLLaMA· rssEN02:35 · 05·14
Qwen 在 LLaMA.cpp 上跑通多 token 预测,MacBook 速度从 21 冲到 34 token/s
有人在 LLaMA.cpp 上给 Qwen 加上了多 token 预测(MTP),配合 TurboQuant 量化,在 MacBook Pro M5 Max 64GB 上跑出 34 token/s,比原来 21 token/s 快了 60% 多。接受率 90%,意味着模型猜下一个 token 时大部分能命中,不是瞎蒙。不过正文没披露具体用了哪个 Qwe...
#Inference-opt#Qwen#LLaMA.cpp#AtomicBot-ai
一句话点评
有人在 LLaMA.cpp 上给 Qwen 加了多 token 预测(MTP),配合 TurboQuant 量化,在 MacBook Pro M5 Max 64GB 上跑出 34 token/s,比原来 21 token/s 快了 60% 多。接受率 90%,意味着模型猜下一个 token 时大部分能命中,不是瞎蒙。不过正文没披露具体用了哪个 Qwen 模型、量化精度和上下文长度,这些变量对...
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
02:14
75d ago
r/LocalLLaMA· rssEN02:14 · 05·14
小米 MiMo-V2.5 310B 量化版幻觉严重:编造文件名和目录结构
Reddit 用户反映,在 llama.cpp 上跑小米 MiMo-V2.5(310B 总参数量、15B 激活参数的 MoE 模型)的 Unsloth UD-Q4_K_XL 量化版时,幻觉非常严重。在一个分析代码文件的任务里,模型凭空编造了文件名、文件路径和目录结构。帖子没有给出可复现的提示词,也没对比 Q5/Q6 量化版本的表现,所以不确定是量化精度...
#Code#Inference-opt#Xiaomi#Unsloth
一句话点评
小米310B MoE模型(15B激活)的Q4量化版在llama.cpp上被曝严重幻觉——分析代码时凭空编造文件名和路径。帖子没给可复现的prompt,也没对比Q5/Q6,所以问题可能出在量化精度太低或特定任务上。如果是量化导致,换高比特版本可能解决;如果是模型本身问题,那这15B激活的性价比就要打折了。正文没披露硬件配置和推理参数,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
66
SCORE
H1·K1·R1
01:45
75d ago
r/LocalLLaMA· rssEN01:45 · 05·14
用四个本地模型玩一夜狼人杀,Gemma4 和 Qwen3.6 谁更会骗人
一个 Reddit 用户用自制的 llama.cpp 界面,让四个本地模型玩了一局《一夜终极狼人杀》。每局公开讨论 8–10 轮,还特意关掉了 Qwen 的思考链,防止模型在公共聊天里暴露自己的推理过程。正文没披露具体模型表现对比,但能跑通这个流程说明本地模型已经能处理多角色、多轮对话的社交推理任务,延迟和幻觉控制是主要瓶颈。
#Agent#Tools#Reasoning#Reddit
一句话点评
有人用四个本地模型跑了一局《一夜终极狼人杀》,还特意关掉 Qwen 的思考链防止暴露推理。能跑通多角色多轮社交推理,说明本地模型已经能处理这类复杂任务。但正文没披露具体模型表现对比,延迟和幻觉控制才是真正的瓶颈。
HKR 分解
hook knowledge resonance
打开信源
67
SCORE
H1·K1·R1
01:12
75d ago
Product Hunt · AI· rssEN01:12 · 05·14
transfa.sh:给 AI agent 用的 WeTransfer
transfa.sh 把自己定位成“AI agent 版 WeTransfer”——不是给人开浏览器传文件,而是让 Claude、Cursor 这类 agent 或 MCP 主机直接通过命令行上传文件。跑一条 `tf upload model.pt` 就能拿到一个带签名的 URL,几秒搞定,不需要注册账号。支持密码保护和一次性链接,同一个文件上传会返回...
#Agent#Tools#transfa.sh#WeTransfer
一句话点评
transfa.sh 把自己包装成“AI agent 版 WeTransfer”——让 Claude、Cursor 这类 agent 直接通过命令行上传文件,不用开浏览器、不用注册。跑一条 `tf upload model.pt` 就能拿到签名 URL,几秒搞定。支持密码保护和一次性链接,同一个文件上传会返回相同 URL,方便缓存。 短评:agent 传文件痛点确实存在,但产品刚上线,文件...
HKR 分解
hook knowledge resonance
打开信源
46
SCORE
H1·K0·R0
01:05
75d ago
r/LocalLLaMA· rssEN01:05 · 05·14
一个比 Open WebUI 更轻量的自托管聊天界面
Overtchat 是一个自托管的聊天界面,实测在 4×3090 上跑 Qwen3.6 27B,一个 Docker Compose 文件就能启动。它内置了 searxng 网页搜索和 kokoro 语音合成,不需要申请 API key,也没有遥测。支持手机 PWA,MIT 协议。如果你觉得 Open WebUI 太重,这个可以试试。正文没披露具体延迟和...
#Tools#Audio#overtchat#Open WebUI
一句话点评
Overtchat 是一个比 Open WebUI 更轻量的自托管聊天界面,一个 Docker Compose 文件就能跑起来,实测在 4×3090 上跑 Qwen3.6 27B。内置了 searxng 网页搜索和 kokoro 语音合成,不用申请 API key,也没有遥测,还支持手机 PWA。如果你觉得 Open WebUI 太重,这个可以试试。不过正文没披露具体延迟和显存占用,4×30...
HKR 分解
hook knowledge resonance
打开信源
64
SCORE
H1·K1·R1
00:48
75d ago
r/LocalLLaMA· rssEN00:48 · 05·14
用SFT微调1B小模型,指令遵循能力反而下降了
Reddit用户GPUburnout分享了一个反直觉的实验:他用SlimOrca 50K样本、LoRA r=16、训练1个epoch微调1B和3B模型。结果1B模型的IFEval评分从20.50掉到14.75,反而变差了;3B模型在lr=5e-5时从23.14升到25.18。帖子没有区分是模型容量不够还是学习率没调好,所以1B下降的原因还不确定。
#Fine-tuning#Benchmarking#GPUburnout#LocalLLaMA
一句话点评
1B模型用50K样本微调后指令遵循能力反而下降(IFEval从20.50跌到14.75),3B模型同样设置却涨了2分。帖子没控制学习率变量,1B下降原因可能是模型太小扛不住LoRA扰动,也可能是lr没调对。50K样本对1B来说可能太多,信息量超载。想复现的注意:这个实验没做消融,结论要打折。
HKR 分解
hook knowledge resonance
打开信源
70
SCORE
H1·K1·R1
00:00
75d ago
Computing Life · Share · 鸭哥调研· rssZH00:00 · 05·14
Anthropic 一周连发三个行业方案:金融、法律、小企业,AI 开始卖行业 know-how 而不是卖模型
Anthropic 在 5 月 11-14 日密集发布了三个垂直方案:金融(10 个预置 agent 模板,连接 FactSet 等数据源)、法律(12 个领域插件,集成 Westlaw 等工具)、小企业(15 个预置工作流,连 QuickBooks/PayPal/HubSpot,不额外收费)。核心逻辑是把 agent 循环(多步推理+工具调用)打包成...
#Tools#Anthropic#Product update#Commentary
一句话点评
Anthropic 四天连发金融、法律、小企业三个垂直方案,核心是把 agent 循环(多步推理+工具调用)打包成行业预制件,不再只卖模型 token。金融有10个 agent 模板连 FactSet,法律12个插件接 Westlaw,小企业15个工作流连 QuickBooks,且不额外收费。策略赌的是:行业 know-how 能编码成可复用配置,分发成本趋零。对比 OpenAI 砸40亿美...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H1·K1·R1
00:00
75d ago
OpenAI 博客· rssEN00:00 · 05·14
ChatGPT 能记住敏感对话的上下文了,OpenAI 说安全响应提升 50%
OpenAI 发了一篇博客,说 ChatGPT 现在能更好地识别敏感对话中逐渐出现的风险信号。核心做法是让模型生成“安全摘要”——一段简短的事实性笔记,记录之前对话里跟安全相关的上下文,只保留有限时间,只在高风险场景下调用。比如用户先聊了几句情绪低落,过几天又问“哪种方式最不痛苦”,模型就能结合前后文判断意图,而不是当成普通问题回答。内部评测显示,在长...
#Safety#Memory#OpenAI#ChatGPT
一句话点评
OpenAI 给 ChatGPT 加了个“安全摘要”功能,在敏感对话(自杀、自伤、伤害他人)中,模型会记下前几轮的风险信号,下次用户再问类似问题时能结合上下文判断意图,而不是当普通问题处理。内部评测说长对话场景下安全响应提升了,但没给具体数字,也没说覆盖多少用户、延迟增加多少。跟心理健康机构合作了两年,这点先别太激动——正文没披露评测集规模、误报率,也没说这个“安全摘要”存多久、谁审计。思路...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K0·R1

更多

频道

后台