腾讯混元推出 HyOCR-1.5:1B 参数实现推理速度提升 6.37 倍

腾讯混元发布轻量级端到端 OCR 模型 HyOCR-1.5,仅 1B 参数,推理速度提升 6.37 倍。作为首个全栈开源 OCR 模型,HyOCR-1.5 开放模型权重、训练配方、数据构造方法和推理加速框架,便于开发者复现、微调,并在消费级显卡或笔记本上部署。
近日,轻量化端到端 OCR 专家模型 HyOCR-1.5 正式发布。该模型在延续轻量化架构的基础上,通过多项技术改进,进一步提升了识别性能与推理效率。
HyOCR-1.5 被称为该领域首个全栈开源模型。除模型权重外,项目还向社区开放了训练配方、数据构造方法和推理加速框架,帮助开发者降低复现、微调与部署门槛。依托这些开放内容,模型可部署于消费级显卡,甚至普通笔记本电脑。
推理速度最高提升 6.37 倍
针对长自回归解码造成的延迟问题,研发团队引入了名为“DFlash”的投机解码框架。该框架利用一个约 90.7M 参数的轻量级草稿模型进行并行预测,在保持输出准确性的同时,加快整体推理过程。
在 OmniDocBench 权威测评中,DFlash 结合 Transformers 架构后,最高可实现 6.37 倍推理加速。这一表现使其成为当前端到端 OCR 模型中具有代表性的推理优化方案。
强化长尾场景处理能力
在模型能力训练方面,HyOCR-1.5 采用了“智能体驱动数据流”策略。研发团队会先定位模型的薄弱环节,再将这些问题转化为具体任务,由智能体自主完成任务拆解、语料搜集、清洗与验证,形成闭环训练流程。
通过这一方式,模型在古文字识别、低资源语种处理以及跨页多图问答等长尾任务上的能力得到补强。同时,针对 4K 分辨率输入和 128K 上下文窗口进行训练优化后,HyOCR-1.5 处理复杂文档时的稳定性也进一步提升。
1B 参数实现越级表现
评测结果显示,参数规模仅为 1B 的 HyOCR-1.5 在多项任务中展现出较强竞争力。在 OmniDocBench v1.6 测试中,该模型位于端到端模型第一梯队;在古文字识别和图表解析任务上,其性能甚至可以与 8B 参数规模的通用模型相媲美。
HyOCR-1.5 的推出,体现了端到端 OCR 大模型向轻量化和普惠化发展的趋势。通过进一步融合视觉感知与内容理解能力,该模型既为企业部署提供了更高效的选择,也为个人电脑上的本地化文档智能处理打下基础,并推动 OCR 技术加快落地。
