今日,腾讯混元正式开源其全新光学字符识别(OCR)模型HunyuanOCR。该模型以仅10亿(1B)参数的轻量级架构,在多项行业标准评测中斩获最先进(SOTA)成绩,展现了其在高效部署与强大性能之间的出色平衡。

HunyuanOCR基于腾讯自研的混元原生多模态架构,采用“端到端”一体化设计理念,使得文字检测、识别、结构化输出等关键步骤在单次前向推理中即可完成,显著提升了处理效率与准确率。这一创新机制区别于传统OCR系统依赖多个独立模块串联的流程,有效减少了误差累积和延迟。

模型核心由三大组件构成:原生分辨率视频编码器、自适应视觉适配模块以及轻量化混元语言模型。这种组合使其能精准应对文档、街景、手写体、艺术字、票据乃至广告牌等多种复杂场景。据官方披露,在复杂文档解析任务中,HunyuanOCR以94.1分的高分超越包括谷歌Gemini 3 Pro在内的多个主流模型,并在综合OCR能力评估中取得860分的优异成绩,成为3B参数以下开源模型中的性能标杆。

此外,HunyuanOCR还拓展了多语言处理能力,支持14种小语种翻译,并在ICDAR 2025文档翻译评测中荣获冠军。更值得一提的是,该模型不仅能按人类阅读顺序组织文本,还能将公式以LaTeX格式、复杂表格以HTML格式精准还原,为科研文献与结构化数据电子化提供了强有力的技术支持。
凭借其小体积、高精度与强泛化能力,HunyuanOCR已在票据字段抽取、多语种文档解析、视频字幕识别、拍照翻译等多个实际场景中展现出广泛应用潜力,为开发者和企业提供了轻量化、高效能的OCR开源解决方案。