2026 年 7 月 17 日,百度文心助手任務 Agent 在全球工程向 AI 智慧體評測榜單 PinchBench v2 中,以 最高分 94.6%平均分 94.4% 的成績奪得第一,成為首個以正式產品身份登頂該總榜的國產智慧體系統。

在全部 59 個參評模型中,文心助手任務 Agent 排名居首,領先於 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通義千問 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)以及 OpenAI GPT-5.6-luna(88.7%)。這一排名凸顯了百度在智慧體領域的系統級工程能力。

PinchBench 與傳統基準的區別 PinchBench 由 Kilo AI 推出、OpenClaw 社群維護,與 MMLU、GPQA 等傳統大模型基準不同。傳統基準主要考察“模型知不知道”,而 PinchBench 考核的是“智慧體能不能把整件事做完並交付可驗證的結果”。當前版本包含 23 個真實工作場景147 項任務,覆蓋資料分析、研究寫作、程式碼開發、辦公自動化、文件處理、網頁操作、多媒體處理七大類別,共完成 617 次測試執行。評分採用“自動化校驗 + LLM 評審”雙軌機制,全程零人工干預。

評測案例展示實際能力 例如,一項任務要求 Agent 自主檢索 GitLab 財報,計算 Q3 2025 財季實際利潤率與指引之間的差距。文心助手任務 Agent 成功定位相關資料,得出非 GAAP 運營利潤率約 18%、超出指引約 500 個基點,並在檔案建立、指標定位、實際值與指引值提取、基點計算結論五個自動化評分維度均獲滿分。

另一項安全工程任務:分析一個 Node.js 應用的多個 CVE 漏洞,按優先順序分級並制定修復計劃。Agent 識別出 express RCE 和 JWT bypass 兩個 CRITICAL 級漏洞為 P0,其中 JWT bypass 因存在活躍利用記錄被特別標註;將 PostgreSQL SQL 注入定為 P1,並結合 PCI DSS 支付路徑給出上下文;將僅影響構建階段的依賴漏洞降級為 P2/P3;制定五批次修復計劃,附具體部署視窗。LLM 評審結論為“所有維度表現卓越”,得分滿分。

在合同法律分析任務中,Agent 讀取一份軟體服務協議,提取關鍵日期、梳理雙方義務、識別風險點、生成財務摘要。輸出結果識別了客戶方 12 項風險、供應商 10 項風險5 項共享風險,付款結構六期分期的現金流前置問題、IP 轉讓條件的產權間隙均被準確標註,四個維度評分均為滿分。

百度為何能取得這一成績 文心助手任務 Agent 依託百度搜索 獵戶座 AI 引擎的多智慧體框架構建。搜尋引擎本身就是最早的 Agent 雛形——接收意圖、拆解任務、呼叫工具、驗證結果,這條鏈路百度已積累了二十餘年。工具集從索引爬蟲升級為程式碼執行環境、檔案處理器和即時 API 介面,輸出從藍鏈列表變為結構化報告和可執行程式碼,但底層邏輯一脈相承。

百度 AI 搜尋團隊已在 GitHub 上開源完整評測流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 個任務的執行快照、交付物、LLM Judge 打分理由全量公開,任何人都可逐條復現。這一舉措增強了評測結果的可信度,也展示了百度在開放生態方面的努力。

市場意義與行業影響 文心助手任務 Agent 將模型任務評估得分提升至 94% 以上,證明優秀的系統架構與工程實現能夠顯著釋放模型潛力。這意味著,同一底層模型,換上文心助手任務 Agent 的框架,任務完成率會更高。Agent 時代,框架工程能力的重要性正在超過單純的模型引數比拼。

目前,文心助手任務 Agent 核心技術已全面應用於百度 App 及文心助手,使用者可登入 chat.baidu.com,點選“任務”即可體驗。這一成績不僅鞏固了百度在 AI 智慧體領域的領先地位,也為國產 AI 系統在全球競爭中贏得了重要一席。