WorkBuddy Bench:腾讯优图开源的全场景AI工作智能体评测基准

AI新闻 97ai
61

一、WorkBuddy Bench 是什么

WorkBuddy Bench 是腾讯优图实验室、科恩安全实验室联合推出的开源真实岗位AI智能体评测基准框架,专门用于量化评估各类代码、通用工作型AI智能体的综合实操能力。

传统AI评测数据集大多是单道独立问答、简易代码填空题,脱离真实职场工作流程;而本项目全部任务均源自腾讯内部真实业务需求、线上缺陷、研发工单逆向重构而成,覆盖开发、前端、办公数据处理、网络安全四大职场核心赛道。

框架依托Docker沙箱隔离运行环境,自动化执行任务、校验产出、输出标准化打分结果,完整解决AI智能体实操能力无统一、可信评测标准的行业痛点,所有数据集、执行代码、校验逻辑全部开源可复现。项目数据集本体托管在Hugging Face,GitHub仓库仅提供完整评测运行调度框架。

WorkBuddy Bench(图1)

二、功能特色

  1. 四大细分领域完整评测数据集
    总计260道真实业务任务,划分Code、Web、Office、Security四大独立评测子集,各赛道评分体系独立,不交叉干扰,精准定位智能体短板:

    • Code开发子集(80题):Python仓库级工程任务,跨模块代码修复、功能迭代、单元测试编写;

    • Web前端子集(70题):HTML/CSS/JS页面开发、可视化搭建、前端问题修复;

    • Office办公子集(50题):Excel、CSV、PDF、Word混合文档数据清洗、统计、文档生成;

    • Security安全子集(60题):漏洞复现、恶意代码分析、红蓝攻防、安全运维排查。

  2. 防数据污染任务设计
    所有任务基于内部真实工单重构改写,无公开网络原题,避免大模型依靠训练记忆“背题刷分”,评测分数可真实反映智能体实际动手能力。

  3. Docker沙箱隔离运行
    每一项评测任务独立容器环境运行,文件修改、代码执行、脚本运行完全隔离,不会污染本地环境,同时保证所有评测流程100%可复现。

  4. 双模式评测启动方案
    提供手动配置完整评测流程、Agent技能一键全自动评测两种使用模式,适配专业算法研究员与轻量化快速测试两种使用人群。

  5. 通用大模型接口兼容
    统一适配OpenAI标准接口协议,主流闭源大模型、开源本地大模型均可接入,仅通过环境变量完成API密钥、接口地址配置,无额外改造成本。

  6. 标准化自动打分与日志输出
    内置自动化校验套件,自动验证代码运行结果、文件输出、安全报告完整性,评测日志、分数明细统一归档至results目录,便于数据分析。

三、技术细节

1. 仓库目录结构核心模块

  • src/workbuddy_bench:框架核心调度、打分、沙箱管理源码;

  • datasets:数据集拉取脚本,数据集原始文件独立托管Hugging Face;

  • scripts:环境初始化、批量评测、数据集校验、任务预览脚本;

  • configs:模型配置模板、评测任务Job模板;

  • .agents/skills:AI智能体一键评测自动化技能工具;

  • .env.example:环境变量配置模板,存储模型API密钥、数据集路径。

2. 技术栈构成

  • 主开发语言:Python(占比92%),负责调度、打分、任务解析;

  • 辅助脚本:Shell(7.5%),容器批量管理、环境一键安装;

  • 环境定义:Dockerfile(0.5%),标准化沙箱镜像构建;

  • 包管理工具:uv,极速Python依赖安装与版本锁定;

  • 运行依赖:Python≥3.12、Docker容器服务、网络访问Hugging Face;

  • 模型适配层:标准化REST API适配层,兼容所有遵循OpenAI协议的大模型服务。

3. 完整评测执行链路

  1. 环境初始化:uv同步依赖,配置.env模型接口信息;

  2. 数据集拉取:脚本自动下载对应赛道任务,校验文件完整性;

  3. 任务沙箱初始化:为单任务创建独立Docker容器工作区;

  4. 调用目标AI智能体下发职场任务;

  5. 沙箱执行智能体产出文件/代码,运行校验用例;

  6. 自动计算得分,记录完整交互日志;

  7. 全部任务完成后汇总分数输出至结果文件夹。

四、应用场景

  1. 大模型研发评测
    大模型研发团队用于量化自研代码智能体、通用工作智能体真实职场实操能力,区分模型在开发、办公、安全场景的优劣。

  2. AI代码工具横向对比
    企业技术团队对比Claude Code、各类开源编码Agent、本地部署代码大模型的真实落地能力,选型采购参考。

  3. AI安全攻防测试
    安全实验室测试AI智能体漏洞挖掘、恶意代码分析能力,评估AI辅助安全运维的落地效果。

  4. 高校AI科研实验
    计算机、人工智能专业科研人员开展智能体自主规划、工具调用相关实验,提供标准化、可复现实验基准。

  5. 企业内部AI工具验收
    企业自研办公AI、研发辅助AI上线前标准化验收,客观量化工具解决真实业务问题的能力。

五、使用方法

1. 前置环境准备

本地安装Docker、Python3.12及以上版本、uv包管理工具;克隆GitHub项目仓库至本地。

git clone https://github.com/Tencent/workbuddy-bench
cd workbuddy-bench

2. 依赖与环境配置

  1. 执行uv sync自动安装全部Python依赖;

  2. 复制环境模板:cp .env.example .env

  3. 编辑.env文件,填入大模型API地址、密钥、模型名称等参数。

3. 数据集下载

执行仓库内置脚本,按需下载单赛道或全量260道评测任务,脚本自动校验文件哈希,防止数据集损坏。

4. 启动评测两种模式

  1. 手动自定义评测:修改configs下任务Job配置文件,指定评测赛道、目标模型,执行脚本启动正式评测,支持dry-run预览模式,先校验配置不运行完整任务;

  2. 一键自动化评测:使用仓库内置.agents/skills智能体技能,在支持Agent Skill的编码工具中调用指令,全自动完成数据集下载、模型配置、批量评测、分数汇总全流程。

5. 结果查看

所有任务运行日志、单题得分、赛道平均分统一保存在项目results文件夹,支持二次数据分析。

六、竞品对比

选取2款主流AI智能体评测基准,与WorkBuddy Bench做多维度对比

对比维度 WorkBuddy Bench(腾讯) HumanEval AgentBench(Meta)
开发主体 腾讯多实验室联合开源 OpenAI Meta FAIR团队
评测任务来源 企业真实业务工单逆向重构 简易独立代码填空题 人工构造多工具调用任务
覆盖赛道 Code/前端Web/Office办公/安全Security 四大场景 仅Python代码单赛道 通用工具调用、网页交互,无安全、办公细分赛道
运行环境隔离 Docker独立沙箱,任务环境完全隔离 本地直接运行代码,无隔离机制 轻量沙箱,不支持完整项目级工程测试
防刷分设计 真实业务定制任务,无公开网络原题 题目全网公开,大模型易记忆刷题 人工构造场景,存在公开数据集泄露风险
复现难度 完整容器镜像、数据集开源,一键复现 仅代码片段,无完整项目工程环境 依赖Meta自有环境组件,本地完整复现成本高
适配模型 所有OpenAI协议大模型,闭源/开源通用 仅适配代码专用大模型 仅适配Meta系模型,第三方模型适配复杂

七、常见问题解答

Q1:WorkBuddy Bench数据集可以单独下载使用吗?

A:可以,评测框架仅提供调度逻辑,全部任务数据集托管在Hugging Face,仓库内置专用下载脚本,可单独拉取单赛道数据集脱离框架单独使用。

Q2:本地无Docker环境能否运行该评测框架?

A:不能,所有任务校验、代码执行依赖Docker沙箱隔离,缺少Docker会存在本地文件篡改、脚本恶意执行风险,框架强制依赖容器环境。

Q3:仅需要评测前端Web智能体,需要下载全部260道任务吗?

A:不需要,下载脚本支持指定单赛道下载,仅拉取70道Web前端任务,节省本地存储与下载时间。

Q4:本地开源部署的大模型可以接入WorkBuddy Bench评测吗?

A:只要模型服务兼容OpenAI标准API接口,即可直接接入,仅需在.env文件填写本地模型接口地址与密钥,无需修改框架源码。

Q5:评测完成后的分数代表什么,跨赛道分数可以对比吗?

A:单赛道分数仅代表智能体在该领域的实操能力,四大赛道评分规则、任务难度独立设计,Code、Web、Office、Security得分不能横向对比。

Q6:项目开源协议有什么限制?

A:项目采用腾讯自有开源协议,允许个人、企业非商用科研、测试使用,商用落地二次分发需要联系腾讯官方获取授权。

八、相关链接

  1. GitHub仓库地址https://github.com/Tencent/workbuddy-bench

  2. HuggingFace模型库https://huggingface.co/datasets/tencent/workbuddy-bench

  3. 技术论文:https://workbuddybench.com/report/main.pdf

  4. 项目官网https://workbuddybench.com/

九、总结

WorkBuddy Bench作为腾讯推出的全场景职场AI智能体开源评测基准,填补了现有评测工具仅聚焦简易代码、缺少真实企业多岗位任务、无安全与办公细分赛道的空白,依托Docker沙箱实现高可信度、可复现的自动化打分流程,兼容市面上绝大多数主流大模型服务,兼顾轻量化一键评测与专业精细化自定义测试需求,无论是大模型研发、企业AI工具选型、安全攻防测试还是高校人工智能科研,都能提供客观、标准化的智能体实操能力量化依据。

打赏
THE END
作者头像
97ai
我不是在训练模型,而是在与未来的自己对话。