清华×字节发布 OS-Themis:为‘会用电脑’的AI智能体装上‘火眼金睛’

3.21 它并非一个新模型,而是一个可扩展可验证可审计的GUI智能体奖励框架简言之,是专为会用电脑的AI打造的质量把关员

当大模型不再只擅长“写诗答题”,而是真正开始操作软件、点击按钮、填写表单、切换窗口——一个更真实、也更棘手的问题浮出水面:如何告诉AI,“你刚才的操作,到底对不对?”

3月19日,清华大学与字节跳动联合研究团队在arXiv正式开源 OS-Themis(论文编号:arXiv:2603.19191),首次系统性地回答了这一问题。它并非一个新模型,而是一个可扩展、可验证、可审计的GUI智能体奖励框架——简言之,是专为“会用电脑”的AI打造的“质量把关员”。


为什么需要“Themis”?

当前GUI智能体(如能自动订机票、处理报销单的AI助手)常陷入两难: 

若用简单规则打分(如“是否点击了提交按钮?”),AI会钻空子,比如疯狂点击页面任意位置; 

若依赖人工标注反馈,成本高、速度慢,无法支撑海量界面迭代。

 

OS-Themis 的破局思路很“工程”:不追求一步到位的终极判决,而是将一次复杂操作(如“完成飞书会议预约”)拆解为多个可验证的“里程碑”——例如:“定位到日历入口”、“正确选择时间区间”、“成功添加参会人”、“生成会议链接”。每个里程碑由独立子评判器(Critic)验证,并最终由一个“评审委员会”严格审计证据链,才给出最终奖励。


不止于理论:OGRBench 让评测“有据可依”

团队同步推出 OmniGUIRewardBench(OGRBench)——首个支持 Android、iOS、Web 三端的GUI结果奖励评测基准。这意味着:不同团队开发的GUI智能体,终于能在同一把“尺子”下公平比拼。实测显示,在AndroidWorld环境中,采用OS-Themis训练的智能体,任务成功率提升超10%,自训练轨迹筛选效率提升近7%。


这意味着什么? 

对开发者:告别“玄学调参”,GUI智能体开发进入可度量、可迭代的新阶段; 

对企业用户:未来接入飞书、钉钉、企业微信的AI助手,将更可靠、更少出错,真正成为“数字员工”而非“数字玩具”; 

对行业:它标志着AI智能体正从“语言理解”迈向“具身交互”的深水区——下一步,或许是让AI真正读懂屏幕、理解意图、自主纠错。

 

“OS-Themis 不是终点,而是起点。” 论文作者之一、清华交叉信息研究院研究员李泽浩表示,“我们希望它成为GUI智能体时代的‘Linux内核’——开放、可组合、可演进。”

论文原文:https://arxiv.org/abs/2603.19191     代码与基准:已开源(详见论文附录)