7月9日,昆仑万维正式发布并开源其最新多模态大模型Skywork-R1V 3.0。该模型在跨模态推理能力上实现重大突破,在多项权威评测中超越主流开源及闭源模型,逼近人类初级专家水平,成为当前开源领域最具竞争力的多模态推理模型之一。
技术突破:小数据激发大能力
Skywork-R1V 3.0基于上一代模型Skywork-R1V 2.0的蒸馏数据进行“冷启动”,通过拒绝采样构建高质量多模态训练集,并借助强化学习算法GRPO(Group Relative Policy Optimization)深度优化模型的跨模态推理能力。值得注意的是,该模型仅使用约1.2万条监督微调样本和1.3万条强化学习样本即实现高效训练,展现了“小数据激发大能力”的技术优势。

性能表现:全面领先开源阵营,逼近闭源标杆
在综合性多模态评测MMMU中,Skywork-R1V 3.0以76.0分的成绩刷新开源模型纪录,超越Claude-3.7-Sonnet(75.0)和GPT-4.5(74.4),接近人类初级专家水平(76.2)。此外,该模型在细分领域表现尤为亮眼:
视觉推理:在EMMA-Mini(CoT)评测中以40.3分领先同类开源模型,优于参数规模更大的Qwen2.5-VL-72B-Instruct和InternVL3-78B。
学科知识:在覆盖中小学知识点的MMK12测试中,以78.5分超越GPT-4.5、GPT-4o等闭源模型。
物理推理:在PhyX-MC-Text-Minimal和SeePhys评测中分别取得52.8分和31.5分,擅长处理图文结合的复杂物理问题。
逻辑与数学:在LogicVista、MathVista等测试中均位列开源模型榜首,数学解题能力接近顶尖闭源模型。

行业影响:推动多模态AI发展
Skywork-R1V 3.0的开源将进一步降低企业与研究机构在多模态AI领域的应用门槛。其在小样本训练下的高效表现,也为AI模型的轻量化发展提供了新思路。昆仑万维表示,未来将持续优化模型在复杂场景下的泛化能力,推动多模态AI技术的实际落地。
此次升级标志着国产大模型在多模态推理领域已具备国际竞争力,或将对AI行业格局产生深远影响。
Skywork-R1V 3.0 下载:
https://huggingface.co/Skywork/Skywork-R1V3-38B
https://github.com/SkyworkAI/Skywork-R1V
技术报告:
https://github.com/SkyworkAI/Skywork-R1V/blob/main/Skywork_R1V3.pdf