百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军
By 量子位的朋友们

原文正文
百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军
2026 年 7 月 17 日,百度文心助手任务 Agent,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。
在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。
这个榜单,测的是最难作假的能力
PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。
当前版本包含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预。
更关键的是,PinchBench 用于衡量模型与 Agent 框架的综合能力。即便是同一底座模型,搭载不同 Agent 框架,最终评测得分也会存在较大差距。这也说明,文心助手任务 Agent 取得榜首成绩,代表的是模型能力与系统工程协同打造的综合实力第一。
百度 AI 搜索团队在 GitHub 上开源了完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个任务的执行快照、交付物、LLM Judge 打分理由全量公开,任何人都可以逐条复现。
让AI从「动动嘴」,到「迈开腿」
比如其中一个任务是:「GitLab Q3 2025 财季的实际利润率与指引之间差了多少个基点?」没有给任何数据文件,Agent 需要自主检索 GitLab 财报原文或电话会议记录,定位相关指引,计算出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,并将结论写入指定文件。
五个自动化评分维度——文件创建、指标定位、实际值与指引值提取、基点计算结论——全部满分 1.0。
另一个任务考的是安全工程:分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。评测要求 Agent 识别 express RCE 和 JWT bypass 两个 CRITICAL 级漏洞为 P0,其中 JWT bypass 因存在活跃利用记录需要特别标注;将 PostgreSQL SQL 注入定为 P1 并结合 PCI DSS 支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为 P2/P3;制定五批次修复计划,附具体部署窗口(4 月 12 日紧急热修、4 月 14 日 P1 批次)。
LLM 评审的评审结论是「所有维度表现卓越」,得分满分 1.0。
还有一个合同法律分析的 case,任务是读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。这种任务过去需要律师助理花几个小时。文心助手任务 Agent 的输出结果,识别了客户方 12 项风险、供应商 10 项风险、5 项共享风险,付款结构六期分期的现金流前置问题、IP 转让条件的产权间隙,全部做到了——最终评分四个维度都是满分 1.0。
上面这些复杂的任务文心助手任务 Agent 都不在话下,更不用说普通用户的日常办公需求。
比如,你扔给文心助手一份职业数据表,然后说「统一表头格式,新建汇总 sheet,按职业大类做汇总表和 Top10/Bottom10 榜单,生成图表对比各职业大类就业人数。」
这是一条有内部依赖关系的任务链,任何一步出错后面就没法接。文心助手任务 Agent 自主拆解,一次性跑完。
或者你给不了这么详细的指令,想摇个盲盒:「我这周末想从北京去青岛玩两天 solo trip。」没有给任何别的信息。Agent 自主检索了交通、住宿、景点实时数据,排出完整行程、预算清单和避坑指南,交付一份可以直接截图出发的攻略。
或者你不想每次都要问 AI,让它帮你完成重复性又高脑力的劳动,可以设置定时任务,如「每周一晚上十点,帮我汇总近一周的高质量 AI 领域论文,用投研报告风格的 HTML 给我」。
7×24 小时,用户无需时刻在场。
为什么是百度做出来了?
答案其实很简单:百度是一家在意图理解上花了 20 多年的公司。
文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架构建。
从架构逻辑来看,搜索引擎本身就是最早的 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度已经跑了二十余年。
工具集从索引爬虫升级成了代码执行环境、文件处理器和实时 API 接口,输出从蓝链列表变成了结构化报告和可运行代码,但底层逻辑一脉相承。
文心助手任务 Agent 将模型任务评估得分提升至 94% 以上,证明优秀的系统架构与工程实现能够显著释放模型潜力。
也就是说,同一个底层模型,换上文心助手任务 Agent 的框架,任务完成率会更高。Agent 时代,框架工程能力的重要性正在超过单纯的模型参数比拼。
目前,文心助手任务 Agent 核心技术已全面应用于百度 App 及文心助手,可登录 chat.baidu.com ,点选「任务」,即可体验。
本文由百度提供,量子位获授权转载,观点归原作者所有。
- 全球首款720°连续后空翻机器狗来了!宇泛智能携“灵猫”双馆联袂首秀WAIC2026-07-18
- Halliday发布第二代AI眼镜Halliday G2,AI功能走向“实时参与会议”2026-07-22
- 天立启鸣发布教育AGI白皮书:破解教育“不可能三角”2026-07-22
- 懂你、能交付、专业操作:金山办公田然给出AI办公助理的三项标准2026-07-22