Orchard:微软研究院开源AI智能体统一沙盒与训练框架
Orchard是什么
Orchard是微软研究院开源的智能体统一沙盒+训练一体化框架。传统Agent项目大多将沙盒环境作为训练代码附属模块,不同项目环境无法复用,评测、训练、数据集生成环境割裂。Orchard将容器沙盒独立为通用服务层,上层对接SFT、RL训练逻辑与各类Agent任务模板,实现任务、数据集、评测协议跨模型、跨推理引擎复用。
项目内置完整实验案例,覆盖代码修复、网页交互、通用任务助手三大典型智能体方向,配套公开可复用的大规模交互轨迹数据集。

功能特色
分布式隔离沙盒服务:基于Kubernetes实现容器级隔离,提供REST API、Python SDK,支持终端PTY会话、命令执行、文件读写、Git补丁操作,具备CPU、内存、超时、网络隔离等资源管控与安全鉴权能力。
训练‑环境解耦架构:沙盒作为独立服务运行,训练逻辑、大模型推理与执行环境完全分离,训练、生成数据集、评测使用同一套环境,消除环境漂移问题。
完整RL训练组件:内置适配沙盒rollout的强化学习训练栈,支持监督微调SFT、在线强化学习,开箱即用智能体训练流程。
多类型Agent任务模板:内置代码修复、网页多模态浏览、通用个人助手三套Recipe实验方案,可直接复现论文实验指标。
高性能低成本沙盒:沙盒启动速度快,支持大规模并行实例,对比同类托管沙盒服务具备更低算力开销。
公开高质量轨迹数据集:提供SWE代码修复、GUI网页交互多轮Agent交互轨迹数据集,托管于Hugging Face,可直接用于模型微调与研究。
部署灵活:支持Azure AKS一键部署,也可部署在自定义自建Kubernetes集群,不绑定特定镜像与大模型。
技术细节
整体三层架构
底层Orchard Env:K8s原生沙盒服务,对外提供同步/异步SDK与REST接口,负责容器生命周期管理、资源限制、安全隔离、终端交互,是整个项目运行底座。单命令平均执行延迟0.28s,并行1000个沙盒实例启动耗时约26秒,支持API密钥鉴权做访问控制。
中层Trainer训练栈:改造后的Slime RL库,对接Env沙盒完成rollout采样,实现SFT、在线强化学习完整训练链路。
上层Recipes业务方案:封装不同智能体任务逻辑,包含SWE代码智能体、GUI网页浏览智能体、Claw通用助手智能体,衍生OpenWebRL、OpenForge RL扩展实验。
安全与资源管控:每个Agent任务运行在独立隔离容器,做网络隔离,配置CPU内存上限、执行超时时间,避免任务之间互相干扰。
模型兼容性:不绑定特定大模型,可接入Qwen、Claude、OpenCode等任意推理后端。
数据集构成
swe子集:107185条代码修复多轮交互轨迹,覆盖2788个GitHub仓库,每条轨迹平均47.5轮交互,标注任务修复结果。
gui子集:3070条浏览器多模态网页交互轨迹。

应用场景
AI代码智能体研发:构建、训练、评测自动修复GitHub项目bug的代码Agent,复现SWE‑bench系列基准实验。
多模态网页智能体研究:训练能够浏览网页、操作浏览器完成任务的多模态Agent,复现WebVoyager、Mind2Web评测。
通用个人助手Agent开发:训练可在沙盒内执行系统操作的通用任务助手。
Agent数据集构建:批量生成高质量多轮交互轨迹数据集,用于SFT微调。
学术研究复现:统一环境复现各类智能体论文实验,解决环境不一致导致复现失败问题。
大规模Agent评测:批量并行跑Agent基准测试,降低评测成本。
使用方法
环境准备
准备可用Kubernetes集群,支持Azure AKS或自建K8s集群,安装集群依赖组件。部署Orchard Env沙盒服务
使用项目提供部署脚本完成Env服务部署,获取服务地址与API访问密钥。安装Python SDK
引入项目SDK,通过API地址和密钥连接沙盒服务,测试容器创建、命令执行、文件读写基础接口。选择Recipe任务模板
选择内置Recipe示例:代码智能体、GUI网页智能体、Claw助手,配置目标大模型推理后端地址。执行rollout/训练/评测
可直接运行任务做数据集采样;也可启动Trainer模块执行SFT或者在线RL训练;也可直接跑基准评测获取指标。使用公开数据集
从Hugging Face下载microsoft/Orchard数据集,用于模型微调、分析、二次研究。
提示:沙盒运行依赖K8s集群资源,大规模并行实验需要充足集群算力。
竞品对比
选取E2B、Modal两个主流Agent沙盒产品进行对比。
| 对比项 | Orchard(微软) | E2B | Modal |
|---|---|---|---|
| 核心定位 | 开源完整Agent沙盒+RL训练一体化框架 | 托管式AI Agent沙盒服务 | 通用云函数/沙盒运行平台 |
| 开源模式 | 完全开源MIT协议,可自建集群 | 闭源托管,仅SDK开源 | 闭源托管服务 |
| 部署方式 | 自建K8s / Azure AKS部署 | 云端托管,用户无需维护集群 | 云端托管 |
| 内置Agent训练能力 | 自带RL训练栈、多套Agent实验Recipe | 仅沙盒执行环境,无内置训练逻辑 | 仅运行环境,无Agent专用训练组件 |
| 大规模并行性能 | 支持千级实例快速启动 | 支持大规模并行 | 支持大规模并行 |
| 成本模式 | 自建集群,仅承担硬件资源成本 | 按使用量付费 | 按使用量付费 |
| 数据集配套 | 自带大规模公开Agent交互轨迹数据集 | 无配套公开数据集 | 无配套公开数据集 |

常见问题解答
Orchard必须使用Azure云才可以部署吗?
不是,Orchard原生基于Kubernetes,既支持Azure AKS一键部署,也可以部署在任意自建K8s集群,不强制绑定Azure云厂商。
Orchard是否内置大模型?
项目本身不携带大模型权重,它只是基础设施框架,需要用户自行接入外部推理后端,支持各类主流开源、闭源大模型。
普通个人电脑可以直接运行Orchard吗?
不建议。Orchard底层依赖完整Kubernetes集群,个人单机环境资源不足,适合有K8s运维基础的研究人员、实验室使用。
Orchard数据集可以用于商业微调吗?
数据集跟随项目MIT协议,使用时需要遵守数据集内部附加约束,建议查阅Hugging Face数据集页面许可说明。
Orchard可以直接拿来做生产环境线上Agent产品吗?
项目面向学术研究,沙盒为研究场景设计,安全模型没有经过生产级加固,不建议直接直接上线生产业务。
Orchard和OpenForge RL是什么关系?
OpenForge RL是基于Orchard底座衍生的扩展研究项目,主要解决训练与真实推理环境不一致问题,属于上层实验方案,不属于底层框架本体。
相关链接
项目GitHub仓库:https://github.com/microsoft/Orchard
Hugging Face数据集地址:https://huggingface.co/datasets/microsoft/Orchard
arXiv技术论文:https://arxiv.org/pdf/2605.15040
总结
Orchard作为微软研究院开源的智能体基础设施框架,通过把沙盒环境独立成标准化分布式服务,解决传统AI智能体项目环境割裂、难以复现、部署成本高的行业痛点,整套方案包含沙盒服务、训练组件、任务模板与公开数据集,面向代码、网页、通用助手多类智能体研究场景,为智能体科研工作提供统一可复用的底层工具链。
版权及免责申明:本文由@dotaai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/orchard.html

