腾讯混元大模型团队正式发布并开源了商业级、轻量的OCR专用视觉语言模型HunyuanOCR。该模型在感知和语义能力上表现出色,荣获ICDAR 2025 DIMT挑战赛冠军等荣誉。HunyuanOCR实现了三大突破:全能与高效兼具、极简端到端架构、数据驱动与强化学习(RL)创新。其核心技术包括:轻量化模型结构设计,采用端到端训练与推理一体范式,协同架构有效避免图像失真与细节丢失;高质量预训练数据生产,构建了超2亿“图像-文本对”的语料库,覆盖多场景多语言;重应用导向的预训练策略,分四阶段循序渐进;以及针对OCR任务定制的强化学习方案,采用混合策略,并注重数据筛选、自适应奖励设计、GRPO算法优化及格式约束。
