ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-06-12

38 items · updated 3m ago
RSS live
2026-06-12 · 星期五2026年6月12日
09:00
46d ago
r/LocalLLaMA· rssEN09:00 · 06·12
Kimi K2.6 的思考链突然变短了,写代码也变好了
有用户发现 Kimi Code 里的 K2.6 模型今天思考链(CoT)变得非常短,写代码的表现也比之前好了。帖子没说是模型更新了还是用户心理作用,也没给出更新日志。另外提到 GLM 5.2 快发布了,希望国产模型继续开源,跟 Fable 5 竞争。
#Code#Reasoning#Kimi#Kimi K2.6
一句话点评
有用户发现 Kimi Code 里的 K2.6 模型思考链变短了,写代码表现也变好了。但帖子没给出任何更新日志或官方确认,可能是心理作用。如果是真的,推理成本可能降低了,但这点先别太激动。另外提到 GLM 5.2 快发布了,希望国产模型继续开源。正文没披露模型是否真的更新了。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
08:06
46d ago
r/LocalLLaMA· rssEN08:06 · 06·12
PP-OCRv6 正式发布:轻量 OCR 模型,参数从 150 万到 3450 万
百度 PaddleOCR 发布了 PP-OCRv6,提供 Tiny(150 万参数)、Small(770 万)、Medium(3450 万)三个版本。相比 v5,检测准确率提升 4.9%,识别准确率提升 5.1%。用 OpenVINO 在 CPU 上跑推理,速度最高能快 5.2 倍,这对不想上 GPU 的场景挺实用。一个模型支持 50 种语言,还新增了...
#PaddleOCR#OpenVINO#Open source
一句话点评
百度开源 PP-OCRv6,三个模型从 150 万到 3450 万参数,检测和识别准确率分别涨了 4.9% 和 5.1%。用 OpenVINO 在 CPU 上跑能快 5.2 倍,不上 GPU 也能用。一个模型支持 50 种语言,新增了 PCB、CAD 图纸等场景。Apache 2.0 协议,浏览器和边缘设备都能跑。正文没披露训练数据量和具体硬件配置,实际效果得自己跑一遍。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
07:00
46d ago
The Verge · AI· rssEN07:00 · 06·12
苹果软件主管:新 Siri 不会学 OpenAI 和谷歌那套拍马屁话术
苹果软件主管 Craig Federighi 在采访中明确说,新版 Siri 不会像 OpenAI 和谷歌的聊天机器人那样靠奉承用户来拉长对话时长。他批评现有 bot 用“你太棒了”这类话术诱导用户自我暴露,而苹果刻意让 Siri 学会“该闭嘴时就闭嘴”。正文没披露具体功能或发布时间,只强调了设计理念上的差异。
#Apple#Craig Federighi#OpenAI
一句话点评
苹果软件主管说新版Siri不会像OpenAI和谷歌的聊天机器人那样靠夸你“太棒了”来拉长对话,而是学会该闭嘴时就闭嘴。目前只有设计理念,没披露具体功能或发布时间。这点先别太激动,理念和落地之间差着好几个iOS版本。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
06:42
46d ago
r/LocalLLaMA· rssEN06:42 · 06·12
为什么主流游戏还没把大模型塞进NPC里?
技术演示已经不少了,但没有一款正式发售的游戏真的把大模型用在了NPC对话上。发帖人问:到底是延迟太高搞不定,还是游戏公司压根没兴趣?帖子没点明具体瓶颈在哪,也没提哪个工作室正在试。
一句话点评
短评:技术演示多但没游戏真用上,延迟和成本是明面上的坎,但更可能是游戏公司没找到非用不可的玩法。 点评:Reddit 帖子问为什么主流游戏还没把大模型塞进 NPC 对话里。技术演示不少,但正式发售的游戏一个都没有。发帖人没点明具体瓶颈,只说要么延迟太高搞不定,要么工作室压根没兴趣。正文被屏蔽了,信息缺口很大——没提哪个工作室在试、延迟具体多少、成本多高。如果是延迟问题,本地跑小模型(比如 ...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
06:12
46d ago
Product Hunt · AI· rssEN06:12 · 06·12
Qursor:点一下网页元素,把结构信息直接喂给 AI
Qursor 是一个 Chrome 插件,让你点一下网页上的任意 UI 元素,就能把它的选择器、样式、字体、颜色等结构化信息复制到剪贴板,然后粘贴给 AI 用。作者 Omkar Birje 说自己之前跟 AI 描述“那个蓝色按钮”经常说半天,AI 还改错元素,浪费 token,干脆做了这个工具。免费版每天 3 次,终身买断 39 美元。正文没披露它具体...
#Qursor#Omkar Birje
一句话点评
一个Chrome插件,点一下网页元素就能把它的选择器、样式、颜色等结构化信息复制给AI用,省去描述“那个蓝色按钮”的麻烦。免费版每天3次,终身买断39美元。痛点真实,但正文没披露它支持哪些AI平台,也没说能不能用于Figma这类设计工具,实用性得自己试。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
06:02
46d ago
r/LocalLLaMA· rssEN06:02 · 06·12
上下文压缩做到 16 倍,声称精度不降、还比 KV 缓存强
VentureBeat 一篇文章说,有新研究能把大模型输入压缩到原来的 1/16,精度没掉,效果还比标准的 KV 缓存好。但原帖只贴了个标题和链接,正文没披露用了什么方法、什么模型、跑分基准,也没提延迟数据。我会先打个折,等论文放出来再看具体怎么做的。
#VentureBeat
一句话点评
新研究号称能把大模型输入压缩16倍,精度不降反超标准KV缓存。但原帖只有标题和链接,没披露方法、模型、跑分基准,延迟数据也缺。如果是真的挺省钱,但信息缺口太大,等论文出来再判断。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
05:34
46d ago
Latent Space· rssEN05:34 · 06·12
别再当人肉提示词了,把 AI 循环叠起来让它自己跑
Peter Steinberger、Boris Cherny 和 Andrej Karpathy 最近都指向同一个结论:人就是瓶颈,别再做那个在循环里手动发指令的角色了。Karpathy 在聊 Autoresearch 时说,要把所有环节重构到按一次“开始”就能全自动运行的程度,目标是提高你的杠杆率,而不是卡在中间看结果。文章把这个思路叫“叠循环”,并...
#Agent#Code#Anthropic#Claude Fable 5
一句话点评
Karpathy 和几位工程师最近都在说同一件事:别再做那个在循环里手动发指令的人了,你就是瓶颈。他们管这叫“叠循环”——把写提示词、跑代码、看结果这些步骤串起来,按一次开始就全自动跑完。文章给了两张图,画的就是我们已经在用的循环。核心教训很直白:别自己上手修东西,去搭目标和调度系统,让更多 agent 替你干活。 同一天,Anthropic 悄悄给 Claude Fable 5 降了智,...
HKR 分解
hook knowledge resonance
打开信源
72
SCORE
H1·K1·R0
04:42
46d ago
Hacker News 首页· rssEN04:42 · 06·12
AI Agent 扫描 DN42 网络,流量费把运营者搞破产了
一个 AI Agent 在扫描 DN42 网络时产生了巨额流量费,直接让运营者破产。文章没透露具体账单金额,但“破产”这个词说明成本失控到了什么程度。DN42 是一个去中心化的实验网络,类似一个大型 BGP 游乐场。给所有搭 agent workflow 的人提个醒:在让模型撒欢之前,先设好预算上限和流量限制,否则账单会跑得比产出快。
#DN42
一句话点评
一个AI agent在扫描DN42实验网络时,24小时内跑出6531美元AWS流量费,直接让运营者破产。DN42是个去中心化BGP测试网,agent用大量EC2实例全速扫IPv6段,出站流量按AWS标准收费,成本瞬间失控。正文没披露agent具体任务目标,但账单数字说明一切:让模型撒欢前不设预算上限和流量限制,账单会跑得比产出快。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
04:35
46d ago
Product Hunt · AI· rssEN04:35 · 06·12
Basedash 在 Slack 里塞了个 AI 数据分析师,@它就能查数据并返回图表
Basedash 把 AI 数据分析师直接放进了 Slack,产品已上架 Slack Marketplace。你在任意频道 @Basedash,它就会去连好的数据源查数据,然后在对话线程里回复文字答案和一张内嵌图表。它还支持定时推送报表、自动异常告警,以及根据提问人身份做行级权限控制。团队内部用它每天早上 9 点往 #metrics 频道推一份营收日报...
#Basedash#Slack
一句话点评
Basedash 把 AI 数据分析师塞进 Slack,@它就能查数据、回答案、带图表,还支持定时推送和异常告警。亮点是行级权限——谁问只能看谁的数据,这对团队协作很实用。但正文没披露支持哪些数据源、定价和延迟,如果是真的挺省钱,但先别太激动,等实测。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
04:30
46d ago
TechCrunch AI· rssEN04:30 · 06·12
Avataar 视频模型每秒 0.5 美分,专攻印度市场
Avataar AI 发布了一个蒸馏后的视频生成模型,价格低到每秒 0.005 美元,一分钟大约 0.3 美元,远低于主流视频模型。目标很明确:在印度做到便宜、快、且文化上贴地气。正文没披露模型规格、训练数据或最长时长,但价格数字本身已经说明它走的是低成本路线。
#Avataar AI
一句话点评
Avataar 把视频生成价格打到每秒 0.005 美元,一分钟才 0.3 美元,比主流模型便宜一个数量级。走蒸馏路线,目标明确:在印度做到便宜、快、文化贴地。但正文没披露模型规格、训练数据或最长时长,低成本是否牺牲了画质或时长,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
03:40
46d ago
AI HOT 精选· aihot-apiZH03:40 · 06·12
小互开源公众号自动排版工具:一句话搞定排版、封面和发稿
小互(@xiaohu)开源了一个公众号排版技能组合,核心卖点是:在 Claude Code、Codex 或 OpenClaw 里给一个链接或文件路径,它就能自动排版、从 20 种主题色里选配色、生成封面图,然后一键发到公众号草稿箱。支持非 Markdown 文件,还有可视化预览。全程不用手动操作。正文没披露是否支持自定义 CSS 或图片库,这点先别太激...
#小互#Claude Code#Codex
一句话点评
小互开源了一个公众号排版工具,在 Claude Code 里给个链接就能自动排版、选配色、生成封面并一键发到草稿箱,全程不用手动操作。支持非 Markdown 文件和可视化预览。但正文没披露是否支持自定义 CSS 或图片库,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
03:34
46d ago
Product Hunt · AI· rssEN03:34 · 06·12
Bob's CLI:完全本地跑的 AI 编程命令行工具,零 API 费用
Bob's CLI 是一个完全运行在你本地硬件上的 AI 编程命令行工具,不产生任何 API 费用,数据也不离开你的机器。它能自动检测本地 AI 模型,通过所谓的“行为 DNA”分析你的工作习惯,并提供自主代码审查、对话分支和远程执行(SovereignLink)功能。所有代码改动都需要你明确批准。免费起步。正文没有披露支持哪些模型、性能基准或具体的隐...
#Code#Bob's CLI#Bob's Workshop#Ollama
一句话点评
一个完全跑在本地的 AI 编程命令行工具,零 API 费用,数据不出机器。亮点是自动检测本地模型(比如 Ollama)和“行为 DNA”分析你的工作习惯来调整回答。支持自主代码审查、对话分支和远程执行。所有代码改动需你批准。免费起步。但正文没披露支持哪些模型、性能基准或隐私审计细节,实际效果和安全性存疑。如果是真的,对隐私敏感和想省 API 费的开发者挺省钱。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K0·R0
03:33
46d ago
Product Hunt · AI· rssEN03:33 · 06·12
Otty:一款为代码智能体优化的 Mac 原生终端模拟器
Otty 是一款专为 macOS 打造的 GPU 加速终端模拟器,主要面向同时运行多个代码智能体(如 Claude Code 或 Codex)的用户。它主打极简和速度,提供了垂直标签页、会话恢复和拖拽分屏功能,但没有加入任何 AI 相关的 UI 元素。开发者 Abner Lee 认为,大多数“AI 终端”把界面搞复杂了,所以 Otty 先把终端本身做好...
#Otty#Abner Lee#Claude Code
一句话点评
短评:一个纯终端模拟器,没加AI花活,适合同时跑多个Claude Code的用户。免费,但没给性能对比数据。 点评:Otty是一个macOS原生、GPU加速的终端模拟器,主打极简和速度。它提供了垂直标签页、会话恢复和拖拽分屏,但刻意不加入任何AI相关的UI元素。开发者认为大多数“AI终端”把界面搞复杂了,所以先把终端本身做好。对于需要同时运行多个代码智能体(如Claude Code或Cod...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R0
02:54
46d ago
r/LocalLLaMA· rssEN02:54 · 06·12
Qwen 3.6 27B 能打赢 Gemini 2.5 Pro?有用户说编码和智能体任务上更强
Reddit 用户发帖问:目前最强的百亿参数以下模型 Qwen 3.6 27B,能不能打赢一年前的旗舰 Gemini 2.5 Pro 和 Sonnet 3.7?他个人测试发现,在深度网页搜索、编码和智能体任务(比如去某个网站点按钮、截图)上,27B 表现更好。帖子没披露具体跑分或样本量,纯属个人体验。如果打不赢,他问哪个最小参数模型能稳赢 Gemini...
#Code#Qwen#Gemini#Sonnet
一句话点评
Reddit 用户说 Qwen 3.6 27B 在深度搜索、编码和智能体任务上比 Gemini 2.5 Pro 和 Sonnet 3.7 强。但这是个人测试,没披露跑分和样本量,得打折。如果真能打,意味着小模型在特定场景下可能替代旗舰,但验证太弱。正文没披露具体测试任务和对比方法。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K0·R1
02:46
46d ago
AI HOT 精选· aihot-apiZH02:46 · 06·12
qiaomu-ai-prd:一个让AI自己看懂需求的Prompt
推文说人类和AI对PRD的理解不一样,所以专门写了个Prompt(叫qiaomu-ai-prd),让开发者先生成文档,再丢给AI写代码,声称能提升功能完整度。安装命令是`npx skills add joeseesun/qiaomu-ai-prd`,Prompt和仓库链接在评论区。正文没披露测试结果或支持哪些模型,效果得自己试。
#Code
一句话点评
一个专门给AI看的PRD生成Prompt,先写文档再让AI写代码。思路挺实用——人和AI对需求的理解确实不一样。但正文没披露测试结果、支持哪些模型,效果得自己试。安装命令一行搞定,门槛低,适合想优化AI编码质量的开发者试试。
HKR 分解
hook knowledge resonance
打开信源
45
SCORE
H0·K0·R0
02:06
46d ago
AI HOT 精选· aihot-apiZH02:06 · 06·12
iOS 27 健康 App 大改:卡片布局、相机扫食物看营养评级、围绝经期追踪
苹果在 iOS 27 里把健康 App 的列表改成了卡片布局,加了导航栏,翻起来更直观。新功能是视觉智能营养识别:用相机(通过 Siri 模式)拍食物,能显示加工程度、蛋白质、含糖量和营养价值评级,但不给精确卡路里——这点先别太激动,想算热量还得自己估。需要 iPhone 15 Pro 及以上才能用。经期追踪新增围绝经期支持,能分析长期周期不规律的模式...
#Apple#iOS 27#Health App
一句话点评
苹果健康App改卡片布局,新增拍食物看营养评级(不标卡路里),需iPhone 15 Pro以上。围绝经期追踪靠分析周期异常模式。GymKit现在iPhone直连健身设备,不用手表。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
02:02
46d ago
r/LocalLLaMA· rssEN02:02 · 06·12
Qwen3.6-27B Q4_K_S 在总统生日测试上拿了满分,算术 95.5%,注意力 93%
一个开发者在 Reddit 上发了自己跑的量产模型精度对比测试,覆盖算术(1000 道大数加法)、美国总统生日(46 题)和注意力(100 道找重复词)三类任务。结果最亮眼的是 Qwen3.6-27B Q4_K_S,总统题全对,算术 95.5%,注意力 93%,接近完美。同系列的 35B-A3B MoE 变体总统题也满分,但注意力只有 71%,说明 M...
#Benchmarking#Gemma#Qwen#Unsloth
一句话点评
Qwen3.6-27B Q4_K_S在总统生日题上全对,算术95.5%,注意力93%,接近完美。Gemma 31B Q4_K_S三项都超83%,但2B和4B在算术和注意力上几乎挂科。测试覆盖1000道大数加法、46道总统生日、100道找重复词,温度0且关闭思考。正文没披露硬件和推理速度,这点先别太激动——如果是真的,Q4量化就能接近满血,挺省钱。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
01:48
46d ago
TechCrunch AI· rssEN01:48 · 06·12
Theker 融了 8500 万美元,做一种不挑活的工厂机器人
Theker 刚拿了 8500 万美元,要做一种能重新配置的工厂机器人。跟波士顿动力那种固定外形的人形机器人不同,Theker 的机器可以换模块来干不同产线活。文章没具体说怎么换、哪些模块能换,但思路是一台机器干多个岗位,降低部署成本。
#Theker#Boston Dynamics#Funding
一句话点评
Theker 拿了 8500 万美元做可换模块的工厂机器人,一台机器干多个产线活,降低部署成本。思路像给机器人换“工具头”,但正文没披露怎么换、换哪些模块、换一次多久。如果是真的,比波士顿动力那种固定人形更灵活,但模块化通常意味着结构复杂、可靠性打折。8500 万够烧一阵,但离量产还远。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K0·R0
01:37
46d ago
纽约时报中文网· rssZH01:37 · 06·12
人形机器人离不开中国零部件,但效率只有人的30%
中国主导了人形机器人供应链,宇树等公司量产机器人售价不到5000美元,美银分析师称几乎不可能不用中国零件造机器人。但当前机器人效率仅相当于人类工人的30%,复杂决策问题未解决,多数机器人仍流向实验室而非工厂。
#Unitree#UBTECH#Tesla#Funding
一句话点评
中国靠电动车供应链把机器人成本打到5000美元以下,宇树等公司已量产,美银分析师说不用中国零件几乎造不出人形机器人。但效率只有人类工人的30%,复杂决策没解决,多数机器人还在实验室。投资热但落地冷,正文没披露具体部署数量。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
01:09
46d ago
r/LocalLLaMA· rssEN01:09 · 06·12
本地跑两天模型省了151美元,账算得挺清楚
一个开发者用本地模型跑了49次编码会话,两天烧了5000万token。按Claude Sonnet的API价格算,这些token要花151美元。输入token特别多,因为他把几个大项目代码直接喂给了模型。他算了一笔账:输入token每百万3美元,输出每百万15美元,结果输入占了147美元,输出只占4美元。他的意思是,很多人说本地跑模型不划算,但没真算过...
#Claude Sonnet
一句话点评
一个开发者用本地模型跑了49次编码会话,两天烧了5000万token,按Claude Sonnet API价格算省了151美元。输入token占了147美元,因为他把整个项目代码喂进去。这账算得挺实在,但得注意:他用的本地模型性能可能不如Sonnet,而且电费、硬件折旧没算。正文没披露具体模型和硬件配置,这点先别太激动。如果是高频编码场景,本地跑确实能省,但前提是你有块好显卡。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H1·K1·R0
01:04
46d ago
● P1TechCrunch AI· rssEN01:04 · 06·12
贝索斯投资的Prometheus融资120亿美元估值410亿
Prometheus 刚融了 120 亿美元,投后估值 410 亿。这家公司想做一个能自动干重型工程和药物设计的实体 AI,相当于给物理世界配个通用工程师。不过正文只说了融资金额和估值,没提技术路线、团队背景,也没说钱具体怎么花。估值很高,但信息太少,先别急着下判断。
#Robotics#Jeff Bezos#Prometheus
精选理由
精选 · 重要度 90 · 吸引力 + 共鸣
一句话点评
贝索斯投的 Prometheus 拿了 120 亿美元,估值冲到 410 亿,要做“人工通用工程师”去干物理世界的活。正文没披露具体产品、客户或收入数据,先当个巨额赌注看。
锐评
这条消息最值得关注的是金额和方向。120 亿美元融资、410 亿估值,在 AI 赛道里也是顶格的数字,说明资本在押注一个比聊天机器人更“硬”的方向:让 AI 直接操作物理世界,也就是他们说的“人工通用工程师”。这跟现在多数公司做软件或内容生成完全不同,更像是要造能进工厂、工地干活的机器人或控制系统。 但信息缺口很大。正文只给了融资额和定位,没提技术路线、团队背景、有没有原型机或落地案例。没有这些,就没法判断这 120 亿是投给一个已经跑通的模型,还是一个刚画好的蓝图。贝索斯的背书能拉高信任度,但物理世界的 AI 比纯软件难得多,安全、成本、可靠性都是硬骨头。 我会先打个折:这更像是一张巨额支票开给了一个野心极大的方向,至于能不能兑现,得等他们拿出能动的、能干活的东西再说。
HKR 分解
hook knowledge resonance
打开信源
90
SCORE
H1·K0·R1
00:46
46d ago
AI HOT 精选· aihot-apiZH00:46 · 06·12
邵猛开源了一套“写规格→实现→验证”的 AI 编程工作流,三个 Skill 就能跑通
邵猛分享了一套 Spec 驱动开发(SDD)方法,核心是三个可复用的 Skill:写产品规格、写技术规格、验证改动是否匹配规格。规格分两层——PRODUCT.md 放用户故事和不变量,TECH.md 放架构和实现策略,都放在 specs// 目录下随 PR 提交。流程五步:先写产品规格,再写技术规格,然后让 Agent 按规格实现,接着做一致性校验,最...
#邵猛#Warp#warpdotdev/common-skills#Open source
一句话点评
邵猛把写规格、写技术文档、验证一致性做成三个可复用的 Skill,开源在 warpdotdev/common-skills,装一下就能用。流程五步:先写产品规格(PRODUCT.md),再写技术规格(TECH.md),Agent 按规格实现,然后做一致性校验,最后端到端验证。好处是规格随 PR 提交,闭环清晰。但正文没披露三个 Skill 怎么被调用、是否支持自定义模板,落地细节不够。如果是...
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H0·K1·R0
00:42
46d ago
Hacker News 首页· rssEN00:42 · 06·12
去掉录音里的“嗯”“啊”比想象中难,有人写了个本地命令行工具
作者发现去掉语音里的“嗯”“啊”这类填充词其实挺麻烦,于是自己写了一个完全在本地运行的 CLI 工具。它先用 Whisper 做语音转文字,然后把填充词对应的音频段静音。全程离线,不传数据出去。正文没披露具体延迟和用了哪个版本的 Whisper,但点出了本地处理的隐私和准确度之间的取舍。
#Whisper
一句话点评
有人写了个本地 CLI 工具,用 Whisper 去掉录音里的“嗯”“啊”。难点不在识别,而在切完不产生爆音和背景噪声断层。作者用了三个音频后处理技巧:找 Whisper 漏掉的填充词、把粘在单词上的填充词拆开、切点对齐到波形零点避免咔嗒声。默认用 medium.en 模型,推荐 large-v3。全程离线,隐私好。正文没披露处理一段 10 分钟音频要多久,也没说内存占用。如果延迟能接受,对...
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0
00:24
46d ago
r/LocalLLaMA· rssEN00:24 · 06·12
16GB显存跑Qwen 3.6 35B MoE:选全进显存的Q3还是溢出3-4GB的Q4?
一位用户在16GB显存+32GB内存的Linux机器上跑Ollama+Aider做编程辅助,纠结Qwen 3.6 35B MoE该用IQ3_M(刚好塞进显存)还是IQ4_NL(约20GB,溢出3-4GB到系统内存)。他问Q4能不能明显减少代码语法错误或agent死循环,还是全显存的Q3速度更香。另外也在考虑换成Qwen 3.6 27B Dense。帖子...
#Code#Qwen#Ollama#Aider
一句话点评
一个用户在16GB显存上纠结Qwen 3.6 35B MoE该用IQ3_M(刚好塞进显存)还是IQ4_NL(溢出3-4GB到内存),问Q4能否减少代码语法错误或agent死循环。帖子没给任何基准测试或推荐,纯属个人纠结。关键点:IQ3_M全显存速度更快但精度更低,IQ4_NL精度高但溢出内存会拖慢速度。如果是真的,选哪个取决于你更怕语法错误还是更怕延迟。缺实测数据,这点先别太激动。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H0·K1·R0
00:11
46d ago
AI HOT 精选· aihot-apiZH00:11 · 06·12
OpenAI Codex 推出速率重置攒存功能
OpenAI 听到了用户吐槽:速率限制重置不能攒着用,想用的时候又没额度。现在 Codex 改了,没用掉的重置次数可以存起来以后再用。先从 Go、Plus、Pro 和 Business 用户开始,每人送一次免费重置。正文没披露后续要不要收费、能存多少次、有没有过期时间。
#OpenAI#Codex#Product update
一句话点评
OpenAI 给 Codex 加了速率重置攒存功能,没用掉的次数可以存着以后用。先从 Go、Plus、Pro 和 Business 用户开始,每人送一次免费重置。正文没披露后续要不要收费、能存多少次、有没有过期时间。如果是真的挺省钱,但这点先别太激动——一次免费重置对重度用户只是杯水车薪,而且攒存上限和过期规则都没说,可能只是安抚性小更新。
HKR 分解
hook knowledge resonance
打开信源
62
SCORE
H1·K1·R0
00:01
46d ago
r/LocalLLaMA· rssEN00:01 · 06·12
llama.cpp 调个线程数,推理速度直接翻倍
Reddit 用户实测发现,在 Intel 250K Plus(6 大核 + 12 小核)上跑 Gemma 4 26B,把 --threads 从 6 改成 16,推理速度从 49 tok/s 飙到 89 tok/s,提升 80%。以前大家都说只用大核(P-core),但 Arrow Lake 架构下这个经验不灵了。18 线程反而掉速,作者没找到原因。...
#Inference-opt#Benchmarking#llama.cpp#Intel
一句话点评
旧经验失效了。Reddit 用户实测,Intel 250K Plus(6大核+12小核)跑 Gemma 4 26B,把 --threads 从6调到16,推理速度从49 tok/s飙到89 tok/s,提升80%。以前都说只用大核,但Arrow Lake架构下这招不灵了。18线程反而掉速,作者没找到原因。注意:只测了一颗CPU,其他平台未必适用。建议自己跑一遍benchmark,别盲信旧参数。
HKR 分解
hook knowledge resonance
打开信源
55
SCORE
H1·K1·R0

更多

频道

后台