阿里巴巴自然语言处理团队近日发布了一款名为WebWatcher的开源多模态研究智能体,该技术旨在解决当前人工智能在多模态深度研究领域的关键性难题。这一创新成果标志着AI技术在跨模态理解和复杂任务处理方面取得重要突破。
据了解,WebWatcher通过整合网页浏览、图像搜索、代码解释和光学字符识别(OCR)等多种功能,能够模拟人类研究员的思维方式处理包含文本、图像、图表等混合内容的复杂任务。该系统的核心优势在于其出色的视觉理解能力、逻辑推理能力以及多工具协同工作能力。

阿里巴巴技术团队表示,当前市场上的AI研究系统存在明显局限:闭源系统虽然文本处理能力强,但难以应对多模态内容;而开源系统则往往只能在单一模态上发挥作用。WebWatcher的研发正是为了突破这些技术瓶颈。
在技术实现方面,WebWatcher采用了创新的全自动多模态数据生成技术,通过"随机游走"算法收集跨模态知识链,并引入信息模糊化处理增强模型的复杂任务处理能力。系统训练过程分为两个关键阶段:先通过监督学习掌握基础能力,再通过强化学习提升复杂环境下的决策水平。
为验证系统性能,研究团队开发了专门的评测体系BrowseComp-VL。测试结果显示,WebWatcher在多模态任务处理能力上显著优于当前主流AI模型。在包括复杂推理、信息检索、知识整合等多个维度的评估中,WebWatcher的表现均大幅领先于GPT-4o、Gemini2.5等知名AI系统。
特别是在模拟真实研究场景的MMSearch评测中,WebWatcher的准确率达到55.3%,相比同类产品提升显著。在最能体现综合能力的BrowseComp-VL基准测试中,其性能优势更为突出,成绩达到其他主流模型的两倍以上。
业内专家认为,WebWatcher的推出为AI技术在学术研究、商业分析等需要处理复杂多模态信息的领域开辟了新的可能性。这一技术的开源特性也将促进整个AI行业在多模态研究方向的进一步发展。
仓库地址:
https://github.com/Alibaba-NLP/WebAgent