ax@ax-radar:~/all $ grep -v 'tier=excluded' stream.log
40 srcsignal 72%cycle 04:32

全部 · 2026-05-30

14 items · updated 3m ago
RSS live
2026-05-30 · 星期六2026年5月30日
03:25
59d ago
AI HOT 精选· aihot-apiZH03:25 · 05·30
Tiny-vLLM:一个用 C 和 CUDA 手写的轻量级推理引擎
GitHub 上开源了一个叫 Tiny-vLLM 的项目,作者用 C 和 CUDA 自己写了一个 LLM 推理引擎,可以理解为 vLLM 的迷你版。目前星标 338,说明社区有点兴趣。但正文没披露它支持哪些模型、吞吐量多少、显存上限多少、支不支持批处理和量化,也没说部署条件。所以这点先别太激动——它更像一个教学或实验性质的项目,离生产环境还有距离。
#Inference-opt#GitHub#Open source#Product update
一句话点评
有人用C和CUDA手写了一个迷你版vLLM推理引擎,GitHub上338星。但正文没披露支持哪些模型、吞吐量、显存上限、批处理和量化情况,更像教学实验项目,离生产还远。短评:手搓推理引擎,星标338,但缺关键指标,先别激动。
HKR 分解
hook knowledge resonance
打开信源
61
SCORE
H1·K0·R1
03:07
59d ago
Hacker News 首页· rssEN03:07 · 05·30
VT Code:一个开源的终端编程助手,用 Rust 写的
VT Code 是一个开源的终端编程助手,用 Rust 写的,主打 LLM 原生代码理解和 shell 安全。支持多个模型供应商,能自动切换,上下文管理也做了优化。不过项目页没提具体支持哪些模型、工具权限怎么设、安装步骤也没有,想试的话得自己去翻代码。
#Agent#Code#Tools#GitHub
一句话点评
VT Code 是一个用 Rust 写的开源终端编程助手,主打 LLM 原生代码理解和 shell 安全。支持多模型供应商和自动切换,上下文管理也做了优化。但项目页没提具体支持哪些模型、工具权限怎么设、安装步骤也没有,想试得自己翻代码。短评:Rust 写的终端编程助手,主打 shell 安全,但模型列表和安装步骤都没给。
HKR 分解
hook knowledge resonance
打开信源
60
SCORE
H1·K0·R1
02:08
59d ago
r/LocalLLaMA· rssEN02:08 · 05·30
八家厂商的 DGX Spark 克隆机对比图来了
Reddit 用户 rexyuan 把 NVIDIA DGX Spark 和戴尔、惠普、联想、微星、技嘉、宏碁、华硕的同类小主机放在一张表里比尺寸和重量。图里没写芯片型号、价格和上市时间,所以目前只能看谁更小更轻,没法比性能。
#Inference-opt#NVIDIA#Dell#HP
一句话点评
Reddit 用户把 8 家厂商的 DGX Spark 克隆小主机摆在一起比尺寸和重量,图里没写芯片、价格和上市时间。目前只能看谁更小更轻,没法比性能。短评:尺寸对比图,性能未知。
HKR 分解
hook knowledge resonance
打开信源
56
SCORE
H1·K1·R0
01:57
59d ago
Latent Space· rssEN01:57 · 05·30
Claude 4.8 小步更新,多轮 RL 训练有个隐蔽 bug,开源模型追上闭源只差四个月
Latent Space 这期 AI 新闻覆盖了 5 月 28-29 日的内容。Claude Opus 4.8 上线后评测反馈不一:多个独立测试认为提升“有但不大”,比如 CursorBench 显示效率更高但效果略差于 4.7,文档解析在表格/布局上有小进步但内容忠实度反而退步。好消息是 4.8 在编程时没那么“过度自主”,更愿意配合人。Anthro...
#Agent#Code#Benchmarking#Latent Space
一句话点评
Claude Opus 4.8 上线后评测分化:多个独立测试认为提升“有但不大”,比如 CursorBench 显示效率更高但效果略差于 4.7,文档解析在表格/布局上有小进步但内容忠实度反而退步。好消息是 4.8 在编程时没那么“过度自主”,更愿意配合人。Anthropic 还支持了对话中途改系统指令且不破坏缓存,对长会话省钱有用。但价格仍是硬伤——有开发者因为 API 太贵而倾向 GPT...
HKR 分解
hook knowledge resonance
打开信源
58
SCORE
H0·K1·R0
00:44
59d ago
r/LocalLLaMA· rssEN00:44 · 05·30
跑本地大模型选显卡,带宽不是唯一指标
Reddit 用户 Ok_Top9254 对比了本地跑大模型常用的 GPU 和整机规格,核心观点是内存带宽不能只看峰值。他举例说,两张 P100 显卡(二手约 200 美元)加起来有 32GB 显存和 700GB/s 带宽,但实际跑模型时,预填充(prefill)阶段的性能在常见的 1000 token 生成测试里被低估了。正文没披露具体测试数据和对比...
#Inference-opt#Multimodal#Benchmarking#Reddit
一句话点评
Reddit 用户实测对比本地跑大模型的 GPU 规格,核心观点:别只看峰值带宽。两张二手 P100(约 200 美元)凑出 32GB 显存和 700GB/s 带宽,但预填充阶段性能在常见 1000 token 测试里被低估。正文没披露具体测试数据和对比型号,结论需谨慎参考。
HKR 分解
hook knowledge resonance
打开信源
69
SCORE
H1·K1·R1
00:36
59d ago
AI HOT 精选· aihot-apiZH00:36 · 05·30
阿里云和Qwen拿下欧足联六年合同,给足球比赛当AI后台
阿里云和Qwen成了欧足联(UEFA)的独家AI、云计算和电商合作伙伴,从2027/28赛季一直签到2032/33赛季,还覆盖2028年欧洲杯。合作内容是用Qwen大模型和阿里云基础设施来搞赛事运营、球迷互动、媒体内容和沉浸式观赛。蔡崇信说会投入全栈AI和电商能力。合同期六年,说明阿里云在体育行业拿了个长期大单,但正文没披露具体金额和落地场景细节,比如...
#Multimodal#Tools#Alibaba Cloud#Qwen
一句话点评
阿里云签下欧足联六年长约,从2027/28赛季到2032/33赛季,覆盖2028年欧洲杯。合作内容是用Qwen大模型和阿里云基础设施搞赛事运营、球迷互动和沉浸式观赛。这是阿里云在体育行业拿下的长期大单,但正文没披露具体金额和落地场景细节,比如Qwen具体用在哪个环节、球迷互动怎么做。合同期长说明双方信任度高,但没金额就不好判断投入规模。短评:阿里云拿下欧足联六年AI大单,但没披露金额和具体落...
HKR 分解
hook knowledge resonance
打开信源
39
SCORE
H1·K1·R0
00:00
59d ago
Computing Life · Share · 鸭哥调研· rssZH00:00 · 05·30
LLM 推理到底怎么跑:跟着 SGLang Omni 团队走一遍设计决策
SGLang Omni 团队公开了一篇罕见的内部设计文档,把顶级推理系统团队从问题定义到架构选择的完整决策链路摊开了。文章先讲标准 LLM 推理的基础:自回归 decode、prefill 和 decode 的区别(prefill 是 compute-bound,瓶颈在算力;decode 是 memory-bound,瓶颈在显存带宽)、continuo...
#Inference-opt#SGLang Omni#Commentary
一句话点评
SGLang Omni 团队公开了内部设计文档,把推理系统从问题定义到架构选择的决策链路全摊开了。文章从标准 LLM 推理讲起,解释 prefill 和 decode 的区别、KV cache 和调度器的作用,然后重点分析语音输出带来的新挑战:Thinker 和 Talker 是两条独立的 decode loop,节奏和计算特性完全不同,不能塞进同一个调度循环。对非系统背景的读者友好,每个判...
HKR 分解
hook knowledge resonance
打开信源
68
SCORE
H0·K1·R1

更多

频道

后台