爬虫饲养员 11小时前
百度文心助手任务Agent登顶PinchBench,94.6%最高分力压Claude、GPT
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

" 这个榜单,测的是最难作假的能力。"

2026 年 7 月 17 日,百度文心助手任务 Agent 在 PinchBench v2 评测中,以最高分 94.6%、平均分 94.4% 的成绩拿下总榜第一。它是首个以正式产品身份拿到 PinchBench 榜首的国产智能体系统。59 个参评模型中,Anthropic Claude Opus 4.8-fast 得分 93.5%,阿里通义千问 Qwen3.7-max 92.5%,Anthropic Claude Opus 4.8 90.5%,OpenAI GPT-5.6-luna 88.7%,全部被甩在身后。

PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,和 MMLU、GPQA 这类传统大模型基准走的不是一条路。传统基准问的是 " 模型知不知道 ",PinchBench 问的是 " 智能体能不能把整件事做完并交付可验证的结果 "。当前版本覆盖 23 个真实工作场景、147 项任务,横跨数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类,完成 617 次测试运行。评分采用 " 自动化校验 +LLM 评审 " 双轨机制,全程零人工干预,直接堵住了靠刷题或靠蒙的投机可能。

更值得关注的是,同一底座模型搭上不同的 Agent 框架,跑出来的分数会有明显差距。PinchBench 不仅能测模型,还能量出框架工程的水准。文心助手任务 Agent 拿下榜首,靠的不单是模型底座,而是模型能力和系统工程协同打造的完整交付力。百度 AI 搜索团队已经在 GitHub 上开源了完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个任务的执行快照、交付物、LLM Judge 打分理由全部公开,任何人都能逐条复现。

榜单上的高分数是怎么来的?看看具体任务就知道了。一个典型题目是:"GitLab Q3 2025 财季的实际利润率与指引之间差了多少个基点?" 没有任何数据文件,Agent 需要自己检索 GitLab 财报原文或电话会议记录,找到指引数值,算出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,再把结论写入指定文件。评测中,文件创建、指标定位、实际值与指引值提取、基点计算结论五个维度全部满分 1.0。

安全工程任务更考验综合分析能力。题目要求分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。Agent 必须识别出 express RCE 和 JWT bypass 两个 CRITICAL 级漏洞为 P0,其中 JWT bypass 因存在活跃利用记录需要特别标注;将 PostgreSQL SQL 注入定为 P1 并关联 PCI DSS 支付路径给出上下文;把仅影响构建阶段的依赖漏洞降级为 P2/P3;再制定五批次修复计划,附带具体部署窗口:4 月 12 日紧急热修、4 月 14 日 P1 批次。LLM 评审的结论是 " 所有维度表现卓越 ",又是满分 1.0。

合同法律分析任务同样让人挑不出毛病。Agent 要读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。文心助手任务 Agent 的输出结果,辨识出客户方 12 项风险、供应商 10 项风险、5 项共享风险,还理清了付款结构六期分期的现金流前置问题、IP 转让条件的产权间隙——四个评分维度全部满分。

这些复杂任务能交出满分答卷,普通用户的日常办公需求就更不在话下。比如把一份职业数据表扔给文心助手,说一句 " 统一表头格式,新建汇总 sheet,按职业大类做汇总表和 Top10/Bottom10 榜单,生成图表对比各职业大类就业人数 "。这条指令背后是一串有内部依赖关系的任务链,文心助手任务 Agent 自主拆解,一次性跑完。再简化一点,来一句 " 我这周末想从北京去青岛玩两天 solo trip",Agent 自动检索交通、住宿、景点实时数据,排出完整行程、预算清单和避坑指南。你甚至不用时刻在场,设定一个定时任务:" 每周一晚上十点,帮我汇总近一周的高质量 AI 领域论文,用投研报告风格的 HTML 给我 ",7 × 24 小时,任务 Agent 准时交付。

为什么是百度做出来了?答案藏在一家搜素引擎公司二十多年的意图理解积累里。文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架构建,而搜索引擎本身就是最早的 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度已经跑了二十年以上。过去工具集是爬虫和索引,输出是一串蓝链;现在升级成了代码执行环境、文件处理器和实时 API 接口,输出变成了结构化报告和可运行代码。底层逻辑没有变,只是能力范围和交付形态彻底打开了。

把大模型任务评估得分拉升到 94% 以上,也再次说明了一件事:在 Agent 时代,系统架构与工程实现的重要性正在超过单纯的模型参数比拼。同一个底层模型,换上文心助手任务 Agent 的框架,任务完成率就能更高。目前,这套核心能力已全面应用在百度 App 和文心助手当中,登录 chat.baidu.com,点选 " 任务 ",就可以直接上手体验。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

百度 数据分析 自动化 通义千问 刷题
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论