谷歌开源深度研究Agent性能达SOTA 价格比GPT-5 Pro低90%
谷歌开源深度研究Agent,HLE测试达46 4%,优于GPT-5Pro的38 9%,成本仅十分之一。同时发布DeepSearchQA基准及InteractionsAPI,简化开发,提升金融科研自动化效率。
01 Deep Research Agent:更新网页搜索、低成本生成研究报告功能
谷歌在博客里提到,Gemini 3 Pro是迄今为止最“真实”的模型,这很大程度上归功于Deep Research Agent的迭代式流程。它会主动提问、阅读结果、识别知识空白,然后继续搜索。新版本的这项能力被大大强化,能够深入网站内部查找特定数据,而不是只在表面扫荡。
更重要的是,谷歌对这个Agent进行了专门优化,让它能以一个非常低的成本,生成高质量的深度研究报告。这从根本上改变了前期调研的成本结构。
对于金融、生物技术和市场调研这类行业,Deep Research Agent的价值在于它能提供快速、准确的初步调研,并基于早期反馈进行测试和修正。它不只是一个搜索引擎,而是一个可以分析复杂信息并输出结构化报告的系统。
* **统一信息综合**:能分析你的文档,也能搜索公开网络数据。最重要的是,它强大的长上下文处理能力,让你可以直接在提示中塞入大量背景信息。
* **报告可控性**:你可以通过提示词定义报告的结构、标题,甚至指定数据表的生成格式。
* **详细引用**:它会提供非常细粒度的来源链接,让你可以随时回去验证数据的真伪。
* **结构化输出**:支持JSON模式,下游应用可以直接解析、使用研究成果,非常方便集成。
02 DeepSearchQA:新Agent基础,涵盖17大领域、900条任务
这才是真正的“幕后功臣”。DeepSearchQA不是一个普通的测试题集,它是谷歌专门为评估像Deep Research这样的Agent在真实、复杂的网页研究任务中的表现而设计的。它弥补了现有基准测试与现实世界之间巨大的鸿沟。 这个基准有多硬核?它包含了900个由专家手工设计的“因果链”任务,覆盖了从分子生物学到宏观经济学的17个领域。这些任务一环扣一环,下一步的答案完全依赖于对上一步的分析。传统的测试只关心答案对不对,但DeepSearchQA评估的是“全面性”——你的Agent能不能生成一个详尽的答案集,覆盖问题的所有方面。这既是检验研究准确性,也是在考察Agent的“记忆力”。 另一个有趣的点是,DeepSearchQA还能衡量Agent的“思考时长”效率。谷歌内部评估后发现,允许Agent执行更多的搜索和推理步骤,其性能会显著提升。换句话说,这个基准可以帮你找到Agent的“思考效率”与“思考时长”之间的最佳平衡点。
03 交互API:集成专为Agent应用开发设计的接口
如果说Deep Research Agent和DeepSearchQA是“发动机”和“测试跑道”,那么Interactions API就是那个“驾驶座舱”。它不是一个简单的API,而是一套专门为Agent应用开发场景设计的交互界面。 开发Agent应用最大的痛点之一,就是处理那些交错出现的消息、思维链、工具调用和状态信息。Interactions API原生集成了处理这种复杂上下文的能力。目前,它除了提供Gemini模型套件,还直接内置了Deep Research Agent。 这意味着什么?你只需要一个API端点,就能同时连接Gemini模型、谷歌内置的Agent,以及未来你自己定制的Agent。这极大地简化了开发流程。 它的设计思路非常务实,主要解决了几个核心问题: * **可选的服务器端状态管理**:把历史记录管理的负担从客户端甩给服务器。这不仅简化了你的代码,减少了上下文管理的错误,还能通过提高缓存命中率来降低成本。 * **可解释和可组合的数据模型**:为复杂的Agent历史记录提供了一套干净的数据架构。开发者可以方便地对交错的信息、思维过程、工具调用及其结果进行调试、流式分析和推理。 * **背景执行**:可以把那些需要长时间运行的推理任务交给服务器,不需要一直保持客户端连接。这对后台任务或自动化流程非常有用。 * **远程MCP工具支持**:模型可以直接调用模型上下文协议(MCP)服务器作为工具。这为Agent连接外部数据源提供了标准化的方式。
04 结语:Gemini生态再扩容,谷歌简化Agent开发模式
总的来说,谷歌这次的动作,不只是更新了一个Agent,更是在围绕Gemini构建一个更完整的开发生态。Deep Research Agent证明了其自身在金融、科研等领域的巨大潜力。而Interactions API的发布,则是这把火的关键助燃剂,它试图把从模型能力到Agent应用之间的开发门槛降到最低。 未来,谷歌还会继续给这个生态添砖加瓦,比如让Deep Research Agent原生生成图表来做可视化分析,通过模型上下文协议(MCP)来连接更丰富的数据源,以及把它接入面向企业的Vertex AI平台。可以预见,在谷歌的规划里,Agent将不再是实验室里的新奇玩意,而是能立刻上手、马上创造价值的标准生产力工具。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令
本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。
时间:2026-09-01 16:53
CAD从入门到项目交付:绘图、标注、图块与实战工作流
掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。
时间:2026-09-01 16:52
Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤
本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。
时间:2026-09-01 14:27
Claude Code 文件修改前的权限模式配置与命令审批指南
本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。
时间:2026-09-01 14:12
Claude Code接入VS Code后先测扩展和终端命令
在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。
时间:2026-09-01 14:10
- 热门数据榜
相关攻略
2026-09-01 16:53
2026-09-01 16:52
2026-09-01 14:27
2026-09-01 14:12
2026-09-01 14:10
2026-09-01 14:07
2026-09-01 13:55
2026-09-01 13:47
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
天天拼词王第422关攻略:从“甭”找出11个常用字
发布于 2026-07-31
《天天拼词王》第421关抹茶奶冻20个常用字通关攻略
发布于 2026-07-31
头号禁区梵高套装效果详解
发布于 2026-07-31
口袋斗罗大陆新手阵容搭配攻略
发布于 2026-07-31
《穿越火线:潜伏》首度亮相嘉年华,CF IP迈向3A叙事新高度
发布于 2026-08-12
共建非遗资源联动新生态,为品牌增长探索新路径
发布于 2026-08-05
年度人气新游戏公测排行榜热门新品推荐
发布于 2026-07-31
年最受欢迎女巫题材手游排行榜推荐
发布于 2026-07-31
VMware安装Ubuntu完整教程:创建虚拟机与启动验证
发布于 2026-09-01
Win10专业版U盘安装教程:制作启动盘与完整安装步骤
发布于 2026-09-01
Windows10系统字体太小怎么调大
发布于 2026-08-27
Win10磁盘占用100%基础排查:从监控到清理的完整步骤
发布于 2026-08-27
小米AI Cube工程版详解:三芯协同架构与150W本地大模型部署
发布于 2026-08-28
致态Ti600s 2TB SSD评测:Xtacking 4.0架构下的性能与寿命突破
发布于 2026-08-28
鲁大师怎么看轻薄本是否过热:三步判断法
发布于 2026-08-27
WPS PDF查看缩略图:3步调出页面预览快速定位
发布于 2026-08-27

