AlphaEval:覆盖6大行业94个真实任务的开源生产级AI智能体评测框架
AlphaEval是GAIR-NLP开源生产级AI智能体评测框架,内置94个企业真实业务任务,支持多范式混合评测、Docker沙箱执行,对比Claude Code、Copilot等商用Agent,解决学术基准与...
AlphaEval是GAIR-NLP开源生产级AI智能体评测框架,内置94个企业真实业务任务,支持多范式混合评测、Docker沙箱执行,对比Claude Code、Copilot等商用Agent,解决学术基准与...
WorkBuddy Bench 是腾讯优图实验室、科恩安全实验室联合推出的开源真实岗位AI智能体评测基准框架,专门用于量化评估各类代码、通用工作型AI智能体的综合实操能力。
EdgeBench是字节跳动Seed开源的长周期AI智能体评测基准,配套SForge双容器隔离评测引擎,支持12小时迭代式测试,包含134项真实工业任务,用于大模型、自主智能体能力标准化...
PawBench是通义实验室AgentScope团队开源的全链路AI智能体评测基准,采用模型+框架+任务三维评测体系,内置海量标准化测试用例,支持多主流大模型与智能体框架接入,具备自...