Orchard:微软研究院开源AI智能体统一沙盒与训练框架

AI新闻 dotaai
59

Orchard是什么

Orchard是微软研究院开源的智能体统一沙盒+训练一体化框架。传统Agent项目大多将沙盒环境作为训练代码附属模块,不同项目环境无法复用,评测、训练、数据集生成环境割裂。Orchard将容器沙盒独立为通用服务层,上层对接SFT、RL训练逻辑与各类Agent任务模板,实现任务、数据集、评测协议跨模型、跨推理引擎复用。

项目内置完整实验案例,覆盖代码修复、网页交互、通用任务助手三大典型智能体方向,配套公开可复用的大规模交互轨迹数据集。

Orchard(图1)

功能特色

  1. 分布式隔离沙盒服务:基于Kubernetes实现容器级隔离,提供REST API、Python SDK,支持终端PTY会话、命令执行、文件读写、Git补丁操作,具备CPU、内存、超时、网络隔离等资源管控与安全鉴权能力。

  2. 训练‑环境解耦架构:沙盒作为独立服务运行,训练逻辑、大模型推理与执行环境完全分离,训练、生成数据集、评测使用同一套环境,消除环境漂移问题。

  3. 完整RL训练组件:内置适配沙盒rollout的强化学习训练栈,支持监督微调SFT、在线强化学习,开箱即用智能体训练流程。

  4. 多类型Agent任务模板:内置代码修复、网页多模态浏览、通用个人助手三套Recipe实验方案,可直接复现论文实验指标。

  5. 高性能低成本沙盒:沙盒启动速度快,支持大规模并行实例,对比同类托管沙盒服务具备更低算力开销。

  6. 公开高质量轨迹数据集:提供SWE代码修复、GUI网页交互多轮Agent交互轨迹数据集,托管于Hugging Face,可直接用于模型微调与研究。

  7. 部署灵活:支持Azure AKS一键部署,也可部署在自定义自建Kubernetes集群,不绑定特定镜像与大模型。

技术细节

  1. 整体三层架构

    • 底层Orchard Env:K8s原生沙盒服务,对外提供同步/异步SDK与REST接口,负责容器生命周期管理、资源限制、安全隔离、终端交互,是整个项目运行底座。单命令平均执行延迟0.28s,并行1000个沙盒实例启动耗时约26秒,支持API密钥鉴权做访问控制。

    • 中层Trainer训练栈:改造后的Slime RL库,对接Env沙盒完成rollout采样,实现SFT、在线强化学习完整训练链路。

    • 上层Recipes业务方案:封装不同智能体任务逻辑,包含SWE代码智能体、GUI网页浏览智能体、Claw通用助手智能体,衍生OpenWebRL、OpenForge RL扩展实验。

  2. 安全与资源管控:每个Agent任务运行在独立隔离容器,做网络隔离,配置CPU内存上限、执行超时时间,避免任务之间互相干扰。

  3. 模型兼容性:不绑定特定大模型,可接入Qwen、Claude、OpenCode等任意推理后端。

  4. 数据集构成

    • swe子集:107185条代码修复多轮交互轨迹,覆盖2788个GitHub仓库,每条轨迹平均47.5轮交互,标注任务修复结果。

    • gui子集:3070条浏览器多模态网页交互轨迹。

Orchard(图2)

应用场景

  • AI代码智能体研发:构建、训练、评测自动修复GitHub项目bug的代码Agent,复现SWE‑bench系列基准实验。

  • 多模态网页智能体研究:训练能够浏览网页、操作浏览器完成任务的多模态Agent,复现WebVoyager、Mind2Web评测。

  • 通用个人助手Agent开发:训练可在沙盒内执行系统操作的通用任务助手。

  • Agent数据集构建:批量生成高质量多轮交互轨迹数据集,用于SFT微调。

  • 学术研究复现:统一环境复现各类智能体论文实验,解决环境不一致导致复现失败问题。

  • 大规模Agent评测:批量并行跑Agent基准测试,降低评测成本。

使用方法

  1. 环境准备
    准备可用Kubernetes集群,支持Azure AKS或自建K8s集群,安装集群依赖组件。

  2. 部署Orchard Env沙盒服务
    使用项目提供部署脚本完成Env服务部署,获取服务地址与API访问密钥。

  3. 安装Python SDK
    引入项目SDK,通过API地址和密钥连接沙盒服务,测试容器创建、命令执行、文件读写基础接口。

  4. 选择Recipe任务模板
    选择内置Recipe示例:代码智能体、GUI网页智能体、Claw助手,配置目标大模型推理后端地址。

  5. 执行rollout/训练/评测
    可直接运行任务做数据集采样;也可启动Trainer模块执行SFT或者在线RL训练;也可直接跑基准评测获取指标。

  6. 使用公开数据集
    从Hugging Face下载microsoft/Orchard数据集,用于模型微调、分析、二次研究。

提示:沙盒运行依赖K8s集群资源,大规模并行实验需要充足集群算力。

竞品对比

选取E2B、Modal两个主流Agent沙盒产品进行对比。

对比项 Orchard(微软) E2B Modal
核心定位 开源完整Agent沙盒+RL训练一体化框架 托管式AI Agent沙盒服务 通用云函数/沙盒运行平台
开源模式 完全开源MIT协议,可自建集群 闭源托管,仅SDK开源 闭源托管服务
部署方式 自建K8s / Azure AKS部署 云端托管,用户无需维护集群 云端托管
内置Agent训练能力 自带RL训练栈、多套Agent实验Recipe 仅沙盒执行环境,无内置训练逻辑 仅运行环境,无Agent专用训练组件
大规模并行性能 支持千级实例快速启动 支持大规模并行 支持大规模并行
成本模式 自建集群,仅承担硬件资源成本 按使用量付费 按使用量付费
数据集配套 自带大规模公开Agent交互轨迹数据集 无配套公开数据集 无配套公开数据集

Orchard(图3)

常见问题解答

Orchard必须使用Azure云才可以部署吗?

不是,Orchard原生基于Kubernetes,既支持Azure AKS一键部署,也可以部署在任意自建K8s集群,不强制绑定Azure云厂商。

Orchard是否内置大模型?

项目本身不携带大模型权重,它只是基础设施框架,需要用户自行接入外部推理后端,支持各类主流开源、闭源大模型。

普通个人电脑可以直接运行Orchard吗?

不建议。Orchard底层依赖完整Kubernetes集群,个人单机环境资源不足,适合有K8s运维基础的研究人员、实验室使用。

Orchard数据集可以用于商业微调吗?

数据集跟随项目MIT协议,使用时需要遵守数据集内部附加约束,建议查阅Hugging Face数据集页面许可说明。

Orchard可以直接拿来做生产环境线上Agent产品吗?

项目面向学术研究,沙盒为研究场景设计,安全模型没有经过生产级加固,不建议直接直接上线生产业务。

Orchard和OpenForge RL是什么关系?

OpenForge RL是基于Orchard底座衍生的扩展研究项目,主要解决训练与真实推理环境不一致问题,属于上层实验方案,不属于底层框架本体。

相关链接

总结

Orchard作为微软研究院开源的智能体基础设施框架,通过把沙盒环境独立成标准化分布式服务,解决传统AI智能体项目环境割裂、难以复现、部署成本高的行业痛点,整套方案包含沙盒服务、训练组件、任务模板与公开数据集,面向代码、网页、通用助手多类智能体研究场景,为智能体科研工作提供统一可复用的底层工具链。

打赏
THE END
作者头像
dotaai
正在和我的聊天机器人谈恋爱,它很会捧场。