FEATUREDHacker News 首页· rssEN13:53 · 06·22
Moebius:一个 2.26 亿参数的图像修补模型,效果能打 119 亿参数的 FLUX.1-Fill-Dev
华中科技大学和 VIVO AI Lab 搞了个叫 Moebius 的轻量级图像修补模型,参数只有 2.26 亿,不到 FLUX.1-Fill-Dev(119 亿参数)的 2%,但在 6 个基准测试上效果能打平甚至超过它。核心思路是把自注意力和交叉注意力改成了固定大小的线性矩阵,绕开了传统注意力机制里计算量随分辨率平方级增长的问题,再配合一套在潜空间里直...
#Huazhong University of Science and Technology#VIVO AI Lab#PixelHacker
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
一个 2.26 亿参数的修图模型,效果打平 119 亿参数的 Flux,推理快 15 倍以上。但正文没给消费级显卡上的实际吞吐和显存占用,这点先别太激动。
锐评
Moebius 把修图这件事从“大模型暴力出奇迹”拉回了“小模型也能干好”。核心思路是把自注意力和交叉注意力改成固定大小的线性矩阵,绕开了传统注意力计算量随分辨率平方级增长的问题,再配合一套在潜空间里直接蒸馏老师模型 PixelHacker 的策略,省掉了昂贵的像素空间解码。最终在 6 个基准测试上跟 FLUX.1-Fill-Dev 和 SD3.5 Large-Inpainting 打平甚至略超,参数不到对方的 2%,单步推理 26 毫秒,总速度快 15 倍以上。
不过现在能看到的对比对象主要是 Flux 和 SD3.5 这两个通用模型,缺少跟其他轻量级修图专有模型的直接对比。另外项目页只给了单步延迟,没披露端到端吞吐、不同分辨率下的显存占用,也没说在笔记本或边缘设备上的实测表现。如果这些数据补上,对实际部署的参考价值会大很多。
HKR 分解
hook ✓knowledge ✓resonance —