微软近日发布了一款名为Fara-7B的全新开源小型语言模型,标志着其在“计算机使用智能体”(Computer Use Agent, CUA)领域迈出关键一步。该模型于当地时间11月24日正式推出,是微软首款专为执行实际电脑操作任务而设计的代理型小型语言模型(SLM)。

Fara-7B 拥有 70 亿参数,基于 Qwen2.5-VL-7B 架构开发,支持长达 128K 的上下文长度。与传统依赖文本对话的语言模型不同,Fara-7B 能够直接解析网页截图,并通过模拟鼠标点击、键盘输入、页面滚动等操作,在无需依赖网页可访问性树(Accessibility Tree)或多模型协同的情况下,自主完成复杂的网页任务。

为训练该模型,微软构建了一套创新的合成数据生成流程,依托 Magentic-One 框架,模拟真实用户在网页上的多步骤操作。整个训练数据集包含超过 14.5 万条经过验证的任务轨迹,涵盖约 100 万个操作步骤,并辅以定位、描述和视觉问答等多模态任务。

在多个公开基准测试中,Fara-7B 表现不俗。它不仅在 WebVoyager、Online-Mind2Web 和 Deepshop 等任务中领先于同类模型 UI-TARS-1.5-7B,甚至在部分场景下可与更大规模的 GPT-4o 系统相媲美。在 Browserbase 的人工评测中,Fara-7B 在 WebVoyager 基准上实现了 62% 的任务通过率(含重试)。

尽管性能亮眼,微软强调 Fara-7B 仍属实验性发布,当前版本在复杂任务准确性、指令遵循能力以及减少“幻觉”方面仍有提升空间。为此,微软在模型中嵌入了多项安全机制:当涉及敏感操作(如提交个人信息或执行不可逆动作)时,模型会自动暂停并请求用户确认;所有操作均被完整记录;模型必须在沙盒环境中运行;并在训练中加入大量拒绝执行不当请求的示例。在 WebTailBench-Refusals 的 111 项红队测试中,Fara-7B 的拒绝执行率高达 82%。
目前,Fara-7B 已以 MIT 许可协议在 Microsoft Foundry 和 Hugging Face 平台开源,并被整合进 Magentic-UI 研究原型系统。微软还计划推出针对 Copilot+ PC 优化的量化版本,用户可通过 VS Code 的 AI Toolkit 在 Windows 11 设备上本地部署,并利用 NPU 加速推理。
微软表示将探索更强大的端侧 CUA 模型,包括采用更优的基础模型架构,以及结合真实环境与沙盒中的强化学习技术,进一步提升智能体在复杂人机交互场景中的可靠性与实用性。