MineExplorer:美团联合上交大开源的MLLM智能体开放世界标准化评测基准
一、MineExplorer 是什么
MineExplorer 是美团 longcat 团队联合上海交通大学共同开源的Minecraft 开放世界大模型智能体评测基准,开源协议为 MIT,配套学术论文《MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft》。
当前行业内用于大模型智能体测评的游戏环境普遍存在短板:任务时序短、高度绑定游戏专属知识、无法衡量通用长链条规划推理能力。MineExplorer 以《我的世界》作为仿真沙箱,专门面向多模态大语言模型(MLLM),量化评测智能体在开放世界中的长时序探索、多步骤逻辑规划、环境感知推理(ReAct)综合能力,是标准化、可自动化运行的通用AI智能体测评工具。
项目整体由仿真沙箱环境、自动任务生成流水线、标准化评测执行模块、结果可视化分析工具四部分构成,全部代码基于Python开发,支持Docker一键部署无头Minecraft模拟器,无需显示器即可批量完成大模型智能体自动化测试。

二、功能特色
通用化复合任务自动生成
剔除大量Minecraft专属冷门知识任务,优先保留贴近现实通用逻辑的原子任务;支持单智能体、多智能体两种任务生成模式,自动构建带前置依赖的多跳复合任务,可自定义14跳标准任务,也能生成812跳多分支超高难度任务,同时输出任务依赖图、自动判定里程碑打分规则。无头游戏仿真沙箱
基于MineStudio底层搭建可HTTP接口调用的Minecraft虚拟环境,提供预制Docker镜像,依托Xvfb虚拟渲染实现无显示器运行,支持场景程序化生成、游戏指令下发、对局一键重置、第一视角画面截帧,对外提供统一HTTP调用接口。多类型大模型统一接入评测
兼容两类主流大模型接入方式:OpenAI标准兼容API(通各类云端大模型、Claude等闭源模型)、本地vLLM部署开源大模型(Qwen、Llama系列等),一套评测脚本适配所有主流大模型,统一打分标准。标准化自动化评测流水线
独立评测脚本可批量加载任务数据集,自动驱动沙箱环境运行智能体、记录交互日志、判定任务完成度、保存运行过程视频素材,内置绘图工具一键输出评测数据可视化图表。低门槛可定制扩展
开放原子任务库、任务难度配置、打分规则自定义接口,开发者可新增自定义游戏任务、修改智能体推理框架、接入自研大模型,MIT协议允许商用二次开发。
三、技术细节
3.1 底层仿真环境技术栈
基础系统:Ubuntu 22.04,Python 3.10,OpenJDK 8,Xvfb虚拟帧缓冲;
容器部署:预制镜像
davidzhth/mineexplorer:0.0.1,容器内部监听8000端口,通过环境变量MC_SANDBOX_URL对接评测脚本;通信方式:沙箱与上层评测代码通过HTTP REST接口交互,支持场景重置、图像采集、智能体动作下发、状态查询。
3.2 任务生成核心技术
采用多智能体协同流水线作为标准生成方案(生成任务质量优于单智能体):
基础原子任务池筛选过滤,剔除强游戏知识依赖任务;
多轮大模型协作拼接原子任务,构建多层前置依赖逻辑;
自动生成任务依赖拓扑图、里程碑完成判定规则;
输出标准化任务文件夹,包含场景配置、打分规则、交互对话模板。
核心脚本:generate_benchmark.py,可配置参数:模型地址、任务样本数量、任务跳数区间、候选原子任务数量、输出存储目录。
3.3 智能体评测核心技术
依托ReAct(感知-推理-行动)标准推理框架驱动MLLM智能体运行,核心脚本eval_benchmark.py:
加载生成好的任务数据集,自动拉起/连接Docker沙箱;
沙箱实时返回游戏第一视角图像、环境文本信息给大模型;
大模型输出推理思考与游戏操作指令,下发至沙箱执行;
内置自动打分器根据里程碑判定任务完成率、步骤损耗、规划准确率;
全流程日志、运行视频、原始推理文本自动持久化存储,配套绘图工具生成评测指标图表。
3.4 模型接入适配层
云端模型:实现OpenAI标准API适配,兼容所有遵循该接口规范的商用大模型;
本地开源模型:对接vLLM推理服务,支持本地离线部署的开源多模态大模型批量测评。
四、应用场景
大模型研发评测
大模型研发团队快速量化自家MLLM智能体的长时序规划、开放世界探索能力,对比不同模型、不同版本智能体的推理性能差距,为模型微调、Prompt优化提供数据支撑。AI智能体学术实验
高校、科研机构开展智能体、具身智能、多步骤推理相关学术研究,标准化数据集可用于论文实验对比,统一实验环境消除变量干扰。智能体框架开发调试
AI智能体框架开发者在标准化Minecraft开放世界场景中调试ReAct、Plan-and-Solve等推理算法,验证多智能体协同、工具调用逻辑有效性。AI教学与实训
计算机、人工智能专业实训,用于直观演示大模型在真实仿真环境中的规划、感知、决策全流程,提供可复现、可视化的实验案例。商用AI产品性能验收
企业商用多模态大模型上线前标准化验收,检测智能体处理复杂多分支连锁任务的稳定性与完成效率。
五、使用方法
步骤1:环境部署(Docker推荐)
拉取官方预制沙箱镜像,启动容器并映射8000端口,配置环境变量记录沙箱访问地址。
docker pull davidzhth/mineexplorer:0.0.1 docker run -p 8000:8000 davidzhth/mineexplorer:0.0.1
步骤2:克隆项目仓库,安装Python依赖
git clone https://github.com/meituan-longcat/MineExplorer cd MineExplorer pip install -r requirements.txt
步骤3:生成标准化评测任务数据集
执行任务生成脚本,推荐multi多智能体模式(论文标准方案),自定义任务跳数、样本数量:
python generate_benchmark.py --mode multi --k-min 1 --k-max 4 --num-samples 50 --output ./benchmark_data
步骤4:配置大模型接入参数
修改配置文件,填写云端大模型API密钥/本地vLLM服务地址,选择模型调用模式。
步骤5:执行自动化模型评测
调用评测脚本,加载上一步生成的任务数据集,自动批量运行智能体测试:
python eval_benchmark.py --data-path ./benchmark_data --sandbox-url http://127.0.0.1:8000
步骤6:查看评测结果
运行结束后,输出目录包含:任务运行日志、智能体对话记录、游戏运行视频、打分数据文件;执行内置绘图脚本生成指标对比图表。
六、竞品对比
选取3款同类型游戏AI智能体评测基准进行横向对比,不对比价格,仅从核心能力、适用场景、部署难度区分:
| 对比维度 | MineExplorer | Minecraft Voyager | Crafter Benchmark |
|---|---|---|---|
| 开发主体 | 美团longcat+上海交大 | 独立学术开源项目 | 海外AI实验室开源 |
| 核心场景 | Minecraft开放世界长时序多跳任务 | Minecraft单步、短链条采集任务 | 2D像素简化游戏世界 |
| 任务生成方式 | 多智能体自动生成带依赖复合任务 | 固定内置任务集,无自动生成功能 | 少量固定基础任务,无法自定义难度 |
| 沙箱环境 | 无头Docker容器,无显示器批量运行 | 需本地安装完整游戏客户端 | 轻量化2D模拟器,无图像多模态输入 |
| 模型兼容性 | 兼容云端API、本地vLLM开源模型 | 仅适配OpenAI系列模型 | 仅支持简单文本大模型,无多模态图像输入 |
| 核心优势 | 标准化长时序规划测评、全自动任务流水线 | 部署极简,适合简单单任务快速测试 | 资源占用极低,仅用于基础文本推理验证 |
| 适用人群 | 大模型研发、学术复杂实验、批量自动化测评 | 快速小规模单任务测试 | 入门级AI智能体教学、极简推理实验 |
七、常见问题解答
Q:MineExplorer只能测评Minecraft相关的游戏AI吗?
A:不是,项目核心目标并非测评游戏AI,而是依托Minecraft开放世界环境,测评通用多模态大模型的长链条规划、环境感知、多步骤推理能力,游戏仅作为标准化仿真载体,任务剔除了大量游戏专属冷门知识,推理逻辑可迁移至现实世界通用场景。
Q:没有GPU设备,可以运行MineExplorer吗?
A:沙箱仿真环境仅需CPU即可运行;但评测本地开源大模型时,vLLM推理服务必须依赖GPU。如果仅使用云端API调用商用大模型,整机仅CPU就能完整运行整套评测流程。
Q:单智能体生成模式和多智能体生成模式该如何选择?
A:小规模快速测试、快速产出简易任务选single单智能体模式,运行速度更快;学术论文实验、正式模型测评、追求任务逻辑严谨度时,必须选用multi多智能体模式,生成的任务前置依赖关系更合理,测评结果可信度更高。
Q:是否支持自定义新增专属游戏任务?
A:支持,项目开放原子任务库配置文件,开发者可自行新增自定义基础原子任务,调整任务拼接规则、自定义任务难度区间与打分判定标准,所有自定义内容不会破坏原有官方数据集。
Q:Windows系统能否部署运行整套项目?
A:官方推荐Linux系统搭配Docker运行无头沙箱;Windows系统可通过WSL2子系统安装Docker完成部署,原生Windows不支持Xvfb虚拟渲染,无法直接启动游戏沙箱。
Q:项目是否允许企业商用二次开发?
A:项目采用MIT开源协议,允许个人、企业免费商用、修改源码、二次封装,仅需保留原开源协议声明即可,无额外授权费用。
八、相关链接
arXiv论文地址:https://arxiv.org/abs/2605.30931
九、总结
MineExplorer是一套完整、自动化、标准化的多模态大模型智能体开放世界测评开源工具,依托Docker无头Minecraft仿真沙箱与多智能体任务生成流水线,解决了现有游戏类AI基准无法有效衡量大模型长时序多分支规划推理的痛点,兼容云端商用大模型与本地离线开源模型,兼顾学术研究、大模型迭代测试、智能体算法调试等多元需求,低门槛容器化部署方案大幅降低了具身智能测评的实验搭建成本,完整开放的代码与可自定义扩展结构也让不同行业开发者均可按需改造适配自身测评场景。
版权及免责申明:本文由@dotaai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/mineexplorer.html

