哈佛研究发现:选AI就像选员工?要看价值观契不契合

5.22 哈佛商学院近期使用一套原本用来测量人类价值的问卷PVQ-RR,评估了市面上9款主流大型语言模型LLM,结果显示,不同AI模型竟展现出明显不同的价值偏好有的强调规则,有的偏好创意,有的则显得较不关怀他人

20250522105125


当我们与AI对话,是否真的能相信它的价值观与我们一致?哈佛商学院近期使用一套原本用来测量人类价值的问卷(PVQ-RR),评估了市面上9款主流大型语言模型(LLM),结果显示,不同AI模型竟展现出明显不同的“价值偏好”:有的强调规则,有的偏好创意,有的则显得较不关怀他人。


这项研究可知AI背后隐性的行为倾向,更提醒我们在企业与社会中导入AI时,不能只看功能,还要审视它们可能带来的价值观影响。这样的差异,不只是学术上的好玩而已,它直接触及了AI实际应用的核心问题:你在用的AI,真的适合你的公司文化与任务目标吗?

 

AI“性格”会随版本更新而变动

很多人可能会以为这些语言模型背后没有意识,那它的回应就只是根据语料统计给出的“最合理答案”;但哈佛的研究指出,即使AI没有主观意图,它所“表现出来的价值倾向”,却会深刻影响它的回应内容。例如,在“是否遵守规则”这一项上,Mistral与DeepSeek-V3两款模型的分数高得惊人,代表它们在设计与训练中内置了高度规范导向的思维;相对地,Grok 2(Fun Mode)与Llama的规则遵守度偏低,却更重视“刺激”与“自我方向”,这样的模型更适合用在头脑风暴或创意萌生想法的场景中。


特别值得注意的是,同一品牌不同版本的模型也有明显落差:像GPT o1在“关怀他人”与“自我方向”上的分数都偏低,而且回答也不稳定,显示这个版本的稳定性与价值取向可能还未定型。这说明了一件事:AI的“性格”会随着升级版本而变动,今天看起来温和有礼的模型,下一次更新后可能就变得冷静务实,甚至无视某些价值考量。

 

选AI,也像选团队成员一样

如果说选一个AI模型就像选择一个团队成员,那么哈佛这份研究就是我们第一次真正看清楚这些“虚拟伙伴”的履历表。根据研究结果,GPT-4.5是各项表现最均衡的选手,不但在“关怀他人”、“普世价值”等面向得分高,在“自我方向”与“成就”上也维持中等以上的平衡,适合多样场景与需求的企业使用。


相对地,Claude则特别擅长“谦逊”与“人际敏感”,这让它在需要细腻处理人际关系的工作环境中表现出色,例如心理咨询、顾客服务或教育领域。反观像Gemini则在“自我方向”与“关怀他人”的表现都偏低,可能更适合用在强调控制力、标准化流程为主的场景,像是风控、数据审核等任务。这样的分类不仅可以帮助企业选出“最适合的AI搭文件”,更能在AI部署上减少价值冲突带来的沟通与管理问题。换句话说,AI的选择早已不再只是看处理速度或API兼容性这么简单,而是进入了一个要看“价值观契合度”的全新阶段。

 

从工具到伙伴,AI价值观将影响企业文化

这项研究的真正启示在于:我们过去把AI看作是一种工具,是可以任意操控与应用的智慧机械。但现在,它正逐渐变成我们工作流程中的参与者,甚至是决策过程上的一环。当我们在使用AI协助撰写文件、设计策略、建议决策方向的同时,这些看似中立的建议,可能早已深受模型价值观的潜移默化所影响。企业若忽视这些潜在价值偏差,轻则导致团队误判,重则影响企业文化与外部形象。


若一个强调创新文化的企业,长期使用一个重视服从与规范的模型为创意生成工具,那么团队的思维可能逐渐趋于保守、缺乏突破性,这会不会在不知不觉中削弱了竞争力?

 

反之,如果一家金融机构选用一个价值观太过自由奔放的模型,会不会带来潜在的法遵风险?这些问题,都值得企业在选AI时就提前思考。未来的AI,或许不只是我们的工具,而是我们的文化共同创作者。我们能否善用这些“价值偏好”,让AI真正与我们的使命一致,将是组织领导者的新责任。