评测编码智能体,过去总在几块割裂的场子里打转——修 bug 的看 SWE-bench,做前端的看 Design2Code,生产环境的基准又多半关着门不让外人审计。腾讯这次把四块拼到一处,端出一个叫 WorkBuddy Bench 的多领域评测套件,论文已挂在 arXiv 上。它最较劲的地方不在于题多,而在于这些题从根上就防着"背答案"。
整套基准横跨四个工作领域:代码(仓库级软件工程)、网页(前端制品)、办公(多文件业务流程)和安全(红蓝队)。规模分别是80、70、50、60个任务,合计260道。关键点在于,每个任务都不是从某份公开题库里改来的,而是从真实的代码提交、拉取请求或业务场景里"逆向工程"出来,再改写成简短、口语化、带角色扮演味道的请求。这么做的好处是,任务的提示词没法靠上网搜到对应的 PR 或提交线索——你搜不到,自然就背不了。由于数据集是公开发布的(任务目录、环境镜像、评估工具、测试用例、参考方案全给),它的抗污染靠的是这种构造方式加版本管理,而不是把题捂着。
四个子集共享同一套任务目录格式,但各自有独立的验证方式,分数因此不能在子集之间直接比,所以腾讯干脆不报套件平均分。代码类按隐藏测试通过率打分;网页类用规则检查加 LLM/VLM 评判再加智能体评判,且必须交付一条声明路径上的制品、不连实时互联网;办公类走确定性规则检查加基于证据的 LLM 评判,权重0.70到0.95之间偏向规则;安全类则干脆用确定性的 scoring.py 跑三次取平均,不用大模型当裁判。安全子集还布了五层反作弊——禁字面量扫描、重命名输入、覆盖篡改测试、编码依赖、低权重诱饵,红队38题、蓝队22题,白盒审计锚定 binutils、curl、nginx 等真实 CVE。
任务构建走的是统一流水线:来源收集、改写成真实请求、组装工作空间、回合后隔离评估资产、独立目录打包,全程不碰用户数据。代码任务给五种角色(开发者、算法工程师、产品经理、QA、运维),安全任务赋专业角色,而且刻意把信息写得不充分——不告诉你目标文件、模式或边界,智能体得自己把上下文找回来。评分资产在智能体跑完之后才引入,它全程看不见。
评测在隔离容器里跑,模型和沙箱分离,框架用 CodeBuddy Code(默认)和 Claude Code 两种,推理努力调高、上下文给到200k,并禁用 WebSearch 与 AskUserQuestion。这点很重要:关掉联网搜索,本就为了验证抗污染是不是真管用。
排行榜把多家模型族摆上了台面(分数0–100,思考模式,三次平均)。Claude Opus4.8在代码、网页、办公、安全多数榜首通吃,拿下五个第一;GLM-5.2在 security 两榜登顶,GPT-5.5则摘下 office cc 第一。框架的敏感性也不小——安全子集重排最狠,平均绝对变动达8.6个点;Claude Opus4.8在 cc 框架下拒答了13次,GPT-5.5在 cbc 下只拒2次。效率上,GPT-5.5输出 token 最少却分数不低,而 DeepSeek-V4-Pro 在代码上跑了44轮、出入 token 都高,显得更"费劲"。
这篇论文由腾讯多家实验室合力完成,署名的包括优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy 团队与云鼎安全实验室(Yunding Security Lab)。团队也坦承局限:代码子集以 Python 为主、跨语言偏少;开源发布本身带来被爬取污染的风险,得靠版本管理缓解;评判器偏差尚未量化;办公类偏文本,暂无 OCR 与 GUI。近期计划是校准网页评分、扩充公开榜单。对一个想把"真实工作分布"搬进考场的评测来说,WorkBuddy Bench 已经把门敞得很开了。





京公网安备 11011402013531号