EdgeBench:字节开源的长时序AI智能体评测基准,支持12小时迭代闭环打分 EdgeBench是字节跳动Seed开源的长周期AI智能体评测基准,配套SForge双容器隔离评测引擎,支持12小时迭代式测试,包含134项真实工业任务,用于大模型、自主智能体能力标准化... 4周前 AI新闻 98
One-Eval:开源大模型智能评测框架,自然语言驱动全自动基准测评 One-Eval 是由北大 OpenDCAI 团队开源打造的大语言模型一站式智能评测框架,基于智能工作流与 Agent 思想设计,主打自然语言驱动自动化评测核心能力。 3个月前 AI新闻 126