2026 年 7 月 17 日,百度文心助手任务 Agent 在全球工程向 AI 智能体评测榜单 PinchBench v2 中,以 最高分 94.6%平均分 94.4% 的成绩夺得第一,成为首个以正式产品身份登顶该总榜的国产智能体系统。

在全部 59 个参评模型中,文心助手任务 Agent 排名居首,领先于 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)以及 OpenAI GPT-5.6-luna(88.7%)。这一排名凸显了百度在智能体领域的系统级工程能力。

PinchBench 与传统基准的区别 PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,与 MMLU、GPQA 等传统大模型基准不同。传统基准主要考察“模型知不知道”,而 PinchBench 考核的是“智能体能不能把整件事做完并交付可验证的结果”。当前版本包含 23 个真实工作场景147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用“自动化校验 + LLM 评审”双轨机制,全程零人工干预。

评测案例展示实际能力 例如,一项任务要求 Agent 自主检索 GitLab 财报,计算 Q3 2025 财季实际利润率与指引之间的差距。文心助手任务 Agent 成功定位相关数据,得出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,并在文件创建、指标定位、实际值与指引值提取、基点计算结论五个自动化评分维度均获满分。

另一项安全工程任务:分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。Agent 识别出 express RCE 和 JWT bypass 两个 CRITICAL 级漏洞为 P0,其中 JWT bypass 因存在活跃利用记录被特别标注;将 PostgreSQL SQL 注入定为 P1,并结合 PCI DSS 支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为 P2/P3;制定五批次修复计划,附具体部署窗口。LLM 评审结论为“所有维度表现卓越”,得分满分。

在合同法律分析任务中,Agent 读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。输出结果识别了客户方 12 项风险、供应商 10 项风险5 项共享风险,付款结构六期分期的现金流前置问题、IP 转让条件的产权间隙均被准确标注,四个维度评分均为满分。

百度为何能取得这一成绩 文心助手任务 Agent 依托百度搜索 猎户座 AI 引擎的多智能体框架构建。搜索引擎本身就是最早的 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度已积累了二十余年。工具集从索引爬虫升级为代码执行环境、文件处理器和实时 API 接口,输出从蓝链列表变为结构化报告和可运行代码,但底层逻辑一脉相承。

百度 AI 搜索团队已在 GitHub 上开源完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个任务的执行快照、交付物、LLM Judge 打分理由全量公开,任何人都可逐条复现。这一举措增强了评测结果的可信度,也展示了百度在开放生态方面的努力。

市场意义与行业影响 文心助手任务 Agent 将模型任务评估得分提升至 94% 以上,证明优秀的系统架构与工程实现能够显著释放模型潜力。这意味着,同一底层模型,换上文心助手任务 Agent 的框架,任务完成率会更高。Agent 时代,框架工程能力的重要性正在超过单纯的模型参数比拼。

目前,文心助手任务 Agent 核心技术已全面应用于百度 App 及文心助手,用户可登录 chat.baidu.com,点选“任务”即可体验。这一成绩不仅巩固了百度在 AI 智能体领域的领先地位,也为国产 AI 系统在全球竞争中赢得了重要一席。