昆仑万维今天正式推出全新轻量级多模态智能体 Skywork R1V4-Lite,标志着多模态AI从“被动看图回答”迈向“主动视觉操作+深度规划”的新阶段。该模型集成了视觉操作、深度推理与任务规划三大核心能力,用户只需随手拍摄一张照片,即可触发一系列智能响应——自动判断空间结构、放大模糊文字、绘制辅助线,甚至生成可执行的行动计划。
与传统多模态模型仅能对图像进行静态理解不同,Skywork R1V4-Lite具备主动式图像操作能力。在面对视角受限、信息模糊或内容密集的复杂图像时,模型会自动执行裁剪(Crop)、放大(Zoom)、旋转(Rotate)等操作,构建一条清晰、可回溯的“视觉行动链”,确保推理过程具备可解释性与严谨性。例如,在识别一张模糊的说明书时,它会多次局部放大关键区域,并绘制参考线辅助判断,而非直接给出不确定的答案。
更值得关注的是,该模型支持联网搜索与多模态深度研究。当任务需要超出图像本身的信息时,R1V4-Lite会主动触发外部工具调用,通过搜索、检索、比对等方式与外部资源交互,将网络信息与视觉内容深度融合,形成“搜索—推理—行动”的闭环。这一能力使其在学术研究、法律文书解析、生态保护监测及电商商品理解等多个垂直领域展现出强大潜力。
性能方面,Skywork R1V4-Lite在权威基准测试中表现亮眼。据官方数据显示,该模型在8个多模态理解基准评测中整体领先谷歌Gemini 2.5 Flash,其中在5项任务上的表现甚至超过Gemini 2.5 Pro。这一成绩充分体现了其在轻量级架构下实现高性能推理的技术突破。

此外,R1V4-Lite的设计理念强调极简交互。用户无需编写复杂提示词(prompt),仅通过视觉输入即可获得完整解决方案。这种“所见即所控”的交互模式,大大降低了多模态AI的使用门槛,推动智能体从封闭推理系统向开放、动态、可交互的智能伙伴演进。
业内专家指出,Skywork R1V4-Lite的发布不仅是昆仑万维在多模态AI领域持续深耕的成果,更代表了下一代智能体的发展方向——以视觉为入口,融合感知、认知与行动,真正实现“看得懂、想得清、做得对”。随着此类模型在实际场景中的落地,AI将更深入地融入人类的日常生活与专业工作流程。