WorkBuddy Bench:腾讯优图开源的全场景AI工作智能体评测基准
一、WorkBuddy Bench 是什么
WorkBuddy Bench 是腾讯优图实验室、科恩安全实验室联合推出的开源真实岗位AI智能体评测基准框架,专门用于量化评估各类代码、通用工作型AI智能体的综合实操能力。
传统AI评测数据集大多是单道独立问答、简易代码填空题,脱离真实职场工作流程;而本项目全部任务均源自腾讯内部真实业务需求、线上缺陷、研发工单逆向重构而成,覆盖开发、前端、办公数据处理、网络安全四大职场核心赛道。
框架依托Docker沙箱隔离运行环境,自动化执行任务、校验产出、输出标准化打分结果,完整解决AI智能体实操能力无统一、可信评测标准的行业痛点,所有数据集、执行代码、校验逻辑全部开源可复现。项目数据集本体托管在Hugging Face,GitHub仓库仅提供完整评测运行调度框架。

二、功能特色
四大细分领域完整评测数据集
总计260道真实业务任务,划分Code、Web、Office、Security四大独立评测子集,各赛道评分体系独立,不交叉干扰,精准定位智能体短板:Code开发子集(80题):Python仓库级工程任务,跨模块代码修复、功能迭代、单元测试编写;
Web前端子集(70题):HTML/CSS/JS页面开发、可视化搭建、前端问题修复;
Office办公子集(50题):Excel、CSV、PDF、Word混合文档数据清洗、统计、文档生成;
Security安全子集(60题):漏洞复现、恶意代码分析、红蓝攻防、安全运维排查。
防数据污染任务设计
所有任务基于内部真实工单重构改写,无公开网络原题,避免大模型依靠训练记忆“背题刷分”,评测分数可真实反映智能体实际动手能力。Docker沙箱隔离运行
每一项评测任务独立容器环境运行,文件修改、代码执行、脚本运行完全隔离,不会污染本地环境,同时保证所有评测流程100%可复现。双模式评测启动方案
提供手动配置完整评测流程、Agent技能一键全自动评测两种使用模式,适配专业算法研究员与轻量化快速测试两种使用人群。通用大模型接口兼容
统一适配OpenAI标准接口协议,主流闭源大模型、开源本地大模型均可接入,仅通过环境变量完成API密钥、接口地址配置,无额外改造成本。标准化自动打分与日志输出
内置自动化校验套件,自动验证代码运行结果、文件输出、安全报告完整性,评测日志、分数明细统一归档至results目录,便于数据分析。
三、技术细节
1. 仓库目录结构核心模块
src/workbuddy_bench:框架核心调度、打分、沙箱管理源码;datasets:数据集拉取脚本,数据集原始文件独立托管Hugging Face;scripts:环境初始化、批量评测、数据集校验、任务预览脚本;configs:模型配置模板、评测任务Job模板;.agents/skills:AI智能体一键评测自动化技能工具;.env.example:环境变量配置模板,存储模型API密钥、数据集路径。
2. 技术栈构成
主开发语言:Python(占比92%),负责调度、打分、任务解析;
辅助脚本:Shell(7.5%),容器批量管理、环境一键安装;
环境定义:Dockerfile(0.5%),标准化沙箱镜像构建;
包管理工具:uv,极速Python依赖安装与版本锁定;
运行依赖:Python≥3.12、Docker容器服务、网络访问Hugging Face;
模型适配层:标准化REST API适配层,兼容所有遵循OpenAI协议的大模型服务。
3. 完整评测执行链路
环境初始化:uv同步依赖,配置.env模型接口信息;
数据集拉取:脚本自动下载对应赛道任务,校验文件完整性;
任务沙箱初始化:为单任务创建独立Docker容器工作区;
调用目标AI智能体下发职场任务;
沙箱执行智能体产出文件/代码,运行校验用例;
自动计算得分,记录完整交互日志;
全部任务完成后汇总分数输出至结果文件夹。
四、应用场景
大模型研发评测
大模型研发团队用于量化自研代码智能体、通用工作智能体真实职场实操能力,区分模型在开发、办公、安全场景的优劣。AI代码工具横向对比
企业技术团队对比Claude Code、各类开源编码Agent、本地部署代码大模型的真实落地能力,选型采购参考。AI安全攻防测试
安全实验室测试AI智能体漏洞挖掘、恶意代码分析能力,评估AI辅助安全运维的落地效果。高校AI科研实验
计算机、人工智能专业科研人员开展智能体自主规划、工具调用相关实验,提供标准化、可复现实验基准。企业内部AI工具验收
企业自研办公AI、研发辅助AI上线前标准化验收,客观量化工具解决真实业务问题的能力。
五、使用方法
1. 前置环境准备
本地安装Docker、Python3.12及以上版本、uv包管理工具;克隆GitHub项目仓库至本地。
git clone https://github.com/Tencent/workbuddy-bench cd workbuddy-bench
2. 依赖与环境配置
执行
uv sync自动安装全部Python依赖;复制环境模板:
cp .env.example .env;编辑.env文件,填入大模型API地址、密钥、模型名称等参数。
3. 数据集下载
执行仓库内置脚本,按需下载单赛道或全量260道评测任务,脚本自动校验文件哈希,防止数据集损坏。
4. 启动评测两种模式
手动自定义评测:修改configs下任务Job配置文件,指定评测赛道、目标模型,执行脚本启动正式评测,支持dry-run预览模式,先校验配置不运行完整任务;
一键自动化评测:使用仓库内置
.agents/skills智能体技能,在支持Agent Skill的编码工具中调用指令,全自动完成数据集下载、模型配置、批量评测、分数汇总全流程。
5. 结果查看
所有任务运行日志、单题得分、赛道平均分统一保存在项目results文件夹,支持二次数据分析。
六、竞品对比
选取2款主流AI智能体评测基准,与WorkBuddy Bench做多维度对比
| 对比维度 | WorkBuddy Bench(腾讯) | HumanEval | AgentBench(Meta) |
|---|---|---|---|
| 开发主体 | 腾讯多实验室联合开源 | OpenAI | Meta FAIR团队 |
| 评测任务来源 | 企业真实业务工单逆向重构 | 简易独立代码填空题 | 人工构造多工具调用任务 |
| 覆盖赛道 | Code/前端Web/Office办公/安全Security 四大场景 | 仅Python代码单赛道 | 通用工具调用、网页交互,无安全、办公细分赛道 |
| 运行环境隔离 | Docker独立沙箱,任务环境完全隔离 | 本地直接运行代码,无隔离机制 | 轻量沙箱,不支持完整项目级工程测试 |
| 防刷分设计 | 真实业务定制任务,无公开网络原题 | 题目全网公开,大模型易记忆刷题 | 人工构造场景,存在公开数据集泄露风险 |
| 复现难度 | 完整容器镜像、数据集开源,一键复现 | 仅代码片段,无完整项目工程环境 | 依赖Meta自有环境组件,本地完整复现成本高 |
| 适配模型 | 所有OpenAI协议大模型,闭源/开源通用 | 仅适配代码专用大模型 | 仅适配Meta系模型,第三方模型适配复杂 |
七、常见问题解答
Q1:WorkBuddy Bench数据集可以单独下载使用吗?
A:可以,评测框架仅提供调度逻辑,全部任务数据集托管在Hugging Face,仓库内置专用下载脚本,可单独拉取单赛道数据集脱离框架单独使用。
Q2:本地无Docker环境能否运行该评测框架?
A:不能,所有任务校验、代码执行依赖Docker沙箱隔离,缺少Docker会存在本地文件篡改、脚本恶意执行风险,框架强制依赖容器环境。
Q3:仅需要评测前端Web智能体,需要下载全部260道任务吗?
A:不需要,下载脚本支持指定单赛道下载,仅拉取70道Web前端任务,节省本地存储与下载时间。
Q4:本地开源部署的大模型可以接入WorkBuddy Bench评测吗?
A:只要模型服务兼容OpenAI标准API接口,即可直接接入,仅需在.env文件填写本地模型接口地址与密钥,无需修改框架源码。
Q5:评测完成后的分数代表什么,跨赛道分数可以对比吗?
A:单赛道分数仅代表智能体在该领域的实操能力,四大赛道评分规则、任务难度独立设计,Code、Web、Office、Security得分不能横向对比。
Q6:项目开源协议有什么限制?
A:项目采用腾讯自有开源协议,允许个人、企业非商用科研、测试使用,商用落地二次分发需要联系腾讯官方获取授权。
八、相关链接
GitHub仓库地址:https://github.com/Tencent/workbuddy-bench
HuggingFace模型库:https://huggingface.co/datasets/tencent/workbuddy-bench
技术论文:https://workbuddybench.com/report/main.pdf
九、总结
WorkBuddy Bench作为腾讯推出的全场景职场AI智能体开源评测基准,填补了现有评测工具仅聚焦简易代码、缺少真实企业多岗位任务、无安全与办公细分赛道的空白,依托Docker沙箱实现高可信度、可复现的自动化打分流程,兼容市面上绝大多数主流大模型服务,兼顾轻量化一键评测与专业精细化自定义测试需求,无论是大模型研发、企业AI工具选型、安全攻防测试还是高校人工智能科研,都能提供客观、标准化的智能体实操能力量化依据。
版权及免责申明:本文由@97ai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/workbuddy-bench.html

