腾讯发布 WorkBuddy Bench:一个面向真实工作场景的多领域编码智能体评测套件
评测编码智能体,过去往往分散在不同领域:修 bug 的看 SWE-bench,做前端的看 Design2Code,生产环境的基准又大多不对外公开。腾讯近日在 arXiv 发表论文,推出名为 WorkBuddy Bench 的多领域评测套件,试图将这一割裂的局面整合起来。其核心设计理念并非单纯追求题目数量,而是从源头上防止模型"背答案"。
该基准覆盖四个工作领域:代码(仓库级软件工程)、网页(前端制品)、办公(多文件业务流程)和安全(红蓝队对抗),任务数量分别为 80、70、50、60 道,总计 260 道。关键区别在于,所有任务均非改编自公开题库,而是从真实的代码提交、拉取请求或业务场景中"逆向工程"提取,再改写为简短、口语化、带有角色扮演色彩的请求。由于提示词无法通过搜索对应到具体 PR 或提交记录,模型难以凭借训练数据中的记忆作答。数据集本身完全公开,包括任务目录、环境镜像、评估工具、测试用例及参考方案,其抗污染能力依赖于构造方式与版本管理,而非封闭保密。
四个子集采用统一任务目录格式,但验证方式各自独立,分数不可跨子集直接比较,因此官方未提供套件平均分。具体评分机制为:代码类按隐藏测试通过率计分;网页类采用规则检查、LLM/VLM 评判与智能体评判相结合,且要求交付指定路径的制品、禁止连接实时互联网;办公类以确定性规则检查为主、基于证据的 LLM 评判为辅,规则权重介于 0.70 至 0.95;安全类则由确定性的 scoring.py 执行三次取平均,不依赖大模型裁判。安全子集还设置了五层反作弊机制,包括禁用字面量扫描、重命名输入、覆盖篡改测试、编码依赖及低权重诱饵,涵盖红队 38 题、蓝队 22 题,白盒审计锚定 binutils、curl、nginx 等真实 CVE。
任务构建遵循统一流水线:来源收集、改写为真实请求、组装工作空间、回合后隔离评估资产、独立目录打包,全程不涉及用户数据。代码任务设定五种角色(开发者、算法工程师、产品经理、QA、运维),安全任务赋予专业角色,且刻意提供不充分信息——不指明目标文件、模式或边界,要求智能体自行补全上下文。评分资产仅在智能体运行结束后引入,确保其全程不可见。
评测在隔离容器中进行,模型与沙箱分离,框架采用 CodeBuddy Code(默认)与 Claude Code 两种,推理努力程度调高、上下文窗口达 200k,并禁用 WebSearch 与 AskUserQuestion。关闭联网搜索的目的,正是为了验证抗污染机制的实际效果。
排行榜涵盖多家模型家族(分数 0–100,思考模式,三次平均)。Claude Opus 4.8 在代码、网页、办公、安全多数榜单中领先,共拿下五个第一;GLM-5.2 在 security 两榜登顶,GPT-5.5 则获得 office cc 第一。框架敏感性显著,安全子集重排幅度最大,平均绝对变动达 8.6 个百分点;Claude Opus 4.8 在 cc 框架下拒答 13 次,GPT-5.5 在 cbc 框架下仅拒答 2 次。效率方面,GPT-5.5 输出 token 最少但分数不低,DeepSeek-V4-Pro 在代码任务中运行 44 轮、输入输出 token 均较高,表现更为"费力"。
论文由腾讯优图实验室、科恩安全实验室、WorkBuddy 团队及云鼎安全实验室联合完成。团队也坦承现有局限:代码子集以 Python 为主,跨语言覆盖不足;开源发布存在被爬取污染的风险,需靠版本管理缓解;评判器偏差尚未量化;办公类偏重文本,暂未纳入 OCR 与 GUI。近期计划包括校准网页评分、扩充公开榜单。对于希望将"真实工作分布"引入考场的评测体系而言,WorkBuddy Bench 已迈出开放的一步。