科技行业的竞争往往在两个层面同时展开:一个是面向未来的技术制高点,另一个是面向当下的生态底盘。谷歌今天发布的Gemini Deep Research,显然想在这两个层面同时下注。
就在OpenAI的GPT-5.2发布后不久,谷歌亮出了他们的回应。但这次回应的重心有些不同——他们不仅展示了一个能深度钻研、自主检索的AI智能体,更重要的是,他们选择将这个能力装进API,扔给开发者摆弄。

从"会做研究"到"帮别人做研究工具"
Gemini Deep Research的核心能力听起来像是一个资深研究员的数字分身:它能规划研究路径,反复搜索,阅读结果,识别信息缺口,然后继续深挖。谷歌的人说,这个基于Gemini 3 Pro的模型把"幻觉率"降下了四成,是他们迄今最靠谱的事实型AI。
但技术上的领先性只是硬币的一面。真正有趣的是谷歌的开源动作——DeepSearchQA基准测试。这个包含17个领域、900个因果链任务的评估体系。
DeepSearchQA 还作为“思考时间”的一种诊断工具。在其内部评估中,观察到当允许代理进行更多的搜索和推理步骤时,性能显著提高,他们计划在未来版本中进行探索。

Gemini深度研究在完整的Humanity's Last Exam (HLE)数据集上取得了最先进的46.4%,在DeepSearchQA上取得了66.1%,在BrowseComp上取得了59.2%的高分。

所有这些,本质上是在告诉整个行业:"来,我们定个标准,看看到底什么叫真正的深度研究能力。"
当一家科技巨头主动定义游戏规则并开放工具时,通常不是单纯的慷慨。这是一种生态策略:让开发者和企业先习惯用谷歌的框架来评估和构建AI研究工具,久而久之,整个下游产业就会在这个技术河床里自然流淌。
价格杠杆的现实意义
谷歌DeepMind产品经理在社交媒体上的表态值得玩味:在BrowseComp测试上,Gemini Deep Research的表现与GPT-5 Pro相当,但价格大约只有十分之一。
对于企业用户来说,性能指标固然重要,但成本往往是决定采用规模的关键变量。如果一个金融公司能用十分之一的成本完成尽职调查的早期信息收集,或者一个生物技术团队能以更低预算处理药物毒性预测的文献分析,这种经济效应会很快转化为市场选择。
Axiom Bio的案例很有代表性。他们用这个智能体处理药物毒性相关的文献,不是为了炫技,而是实实在在获得了"更高的研究深度与颗粒度"。在研发管线动辄数年的生物制药行业,任何能加速早期研究流程的工具,都可能意味着数月的先发优势。
API背后的战略意图
通过Interactions API开放这些能力,谷歌实际上是在把"深度研究"从一个产品功能提升为一个基础设施层。开发者可以上传PDF和CSV,整合公开网页数据,定义输出结构,还能获得精细到每个事实的引用来源。
这种设计思路很清晰:与其让AI成为一个黑箱式的"报告生成器",不如让它变成可组装、可嵌入、可定制的研究组件。企业可以把它塞进自己的尽职调查系统,科研机构能把它接入文献管理流程,市场研究公司可以基于此构建自动化分析工具。
未来几个月,当这些能力逐步渗透到Google Search、NotebookLM、Google Finance等谷歌自家产品时,Deep Research将不再是一个独立的功能,而是整个信息生态系统的一种基础能力。

更深的问题
不过,真正值得关注的不是今天发布了什么,而是这种"深度研究"能力的规模化会带来什么。
当AI能够自主规划研究路径、在数百万字文献中追踪因果链条、以人类难以企及的速度完成跨领域信息综合时,"研究"这个过程本身可能会被重新定义。不是取代人类研究者,而是把那些最耗时的信息收集、筛选、关联工作,转交给一个从不疲倦的数字化助手。
这意味着什么?也许意味着未来的研究者可以把更多精力花在提出真正有价值的问题上,而不是在数不清的数据源中埋头挖矿。也可能意味着信息过载的时代,我们第一次有了一个能帮忙"读完全部内容"的可靠伙伴。
当然,这一切的前提是这个智能体真的如谷歌所说,足够准确,足够透明,足够可控。
毕竟,一个会"深度研究"的AI,如果跑偏了,它犯的错误也会很有深度。
论文:
https://blog.google/technology/developers/deep-research-agent-gemini-api/
https://blog.google/technology/developers/interactions-api/