FEATUREDAI HOT 精选· aihot-apiZH11:12 · 07·13
腾讯混元开源 HyOCR-1.5:1B 参数的端到端 OCR 模型,推理速度提升 6.37 倍
腾讯混元把 HyOCR-1.5 的训练代码、推理代码和模型权重全开源了,这在端到端 OCR 大模型里是头一个。模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transf...
#Tencent Hunyuan#HyOCR-1.5#DFlash#Open source
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
腾讯把OCR大模型的训练、推理代码和权重全开源了,1B参数在文档测试上拿了端到端第一,推理速度也快了不少。
锐评
HyOCR-1.5 这次最实在的动作是全栈开源,训练代码、推理代码、模型权重都放出来了,这在端到端 OCR 大模型里确实是头一个。模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务,在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transformers 框架下推理速度提了 6.37 倍,在 vLLM 下提了 2.14 倍,端到端推理每页只要 1.408 秒。另外它还支持 4K 分辨率和 128K 上下文窗口,通过一种叫 Agentic Data Flow 的方法把低资源 OCR 扩展到了 331 种语言,还能认古文字、做多图问答。
不过有几个点得先打个折。正文没披露 94.74 分这个成绩是在什么硬件上跑的,也没说对比的其他端到端模型具体是哪些、分数差多少。DFlash 的加速效果在 Transformers 和 vLLM 下差了近三倍,说明这个加速方法对推理框架比较挑,实际部署时能拿到多少加速还得看环境。另外,331 种语言的 OCR 能力具体到什么程度、古文字识别准确率怎么样,正文都没给数字,这部分先别太激动。如果是真的能在 1B 参数下做到这个水平,部署成本确实挺省,但缺的验证信息还不少。
HKR 分解
hook ✓knowledge ✓resonance ✓