SearchOS:人大蚂蚁联合开源多智能体检索操作系统

AI新闻 AI铺子
60

一、SearchOS是什么

SearchOS 是由中国人民大学计算机实验室与蚂蚁集团联合研发开源的多智能体开放域信息检索协作系统,项目核心设计理念类比计算机操作系统调度进程的逻辑,以统一调度架构管理检索类AI智能体,针对性解决传统检索Agent上下文丢失、循环重复检索、信息来源无溯源、任务进度不可追踪四大行业痛点。

项目包含后端调度内核、终端交互界面、Web可视化工作台、评测数据集四大完整配套模块,支持本地私有化部署,可对接各类大模型与第三方搜索API,是面向深度资料调研、批量信息搜集场景的开源检索智能体底层框架。

SearchOS(图1)

二、功能特色

  1. 覆盖图驱动全域信息检索
    将用户查询自动拆解为实体-属性二维覆盖地图,自动识别信息空白点位并派发检索任务,保障信息完整度;最终输出结构化结果,每条数据绑定原始网页来源编号,支持溯源核验。

  2. 多智能体并行流水线调度
    内置Explore探索、Search检索、Writer撰写三类分工隔离智能体,检索、网页解析、信息提取阶段并行执行,多任务复用算力槽位,大幅缩短整体检索耗时,规避串行执行低效问题。

  3. SOCM全局持久化上下文管理
    项目核心自研SOCM搜索专用上下文存储模块,统一托管全部智能体会话状态,包含任务DAG队列、证据存储图、检索覆盖记录、策略记忆四大存储单元,支持会话快照保存、历史任务回放、中断恢复。

  4. 三层统一中间件管控体系
    全链路拦截所有模型、搜索工具调用,分为上下文中间件、传感器监控中间件、信息抽取中间件,自动检测检索循环、算力预算超限、上下文溢出问题,统一标准化网页信息抽取格式。

  5. 280+内置分层可复用技能库
    技能沙箱隔离运行,分为访问适配技能、检索策略技能、全局调度技能三类;适配各类网站反爬、登录墙限制,支持榜单枚举、实体消歧、多跳深度检索等复杂检索逻辑,支持自定义新增域名适配技能。

  6. 三端交互操作界面

  • CLI命令行:单条检索一键执行,极简轻量化调用;

  • TUI全屏终端面板:实时查看智能体运行状态、检索覆盖进度,支持手动干预调整检索约束;

  • Web可视化工作台:基于FastAPI+Next.js搭建,3000端口本地访问,提供可视化调度看板、历史会话管理、参数可视化配置。

  1. 多模型、多搜索后端兼容
    兼容智谱、Tavily、Serper等主流大模型与搜索引擎API,通过环境变量一键切换;支持11类智能体角色独立绑定不同模型,可单独配置单角色并发上限、接口速率限制。

  2. 四档算力预算自定义
    内置low/medium/high/max四档算力模式,一键调整检索迭代次数、单次搜索候选数量、最大运行时长,适配轻量快速查询与深度全域调研两类需求。

三、技术细节

3.1 整体架构分层

整体架构自上而下分为四层,分层解耦互不干扰:

  1. 交互接入层:CLI、TUI终端、Web前端、API接口,统一接收用户检索请求;

  2. Orchestrator全局调度层:核心总调度器,负责拆解用户问题、分发任务至三类子智能体、汇总证据、生成最终结构化回答;

  3. SOCM状态管理层:项目核心存储底座,全局唯一共享状态池,所有智能体读写同一套任务、证据、覆盖数据,解决多智能体上下文割裂问题;

  4. 工具技能底层层:三层中间件 + 沙箱技能库,封装搜索、网页读取、信息抽取、接口调用全部底层能力。

3.2 核心模块SOCM详解

SOCM(面向搜索专用上下文管理模块)包含四大核心组件:

  • DAG任务队列:带优先级、依赖关系的检索任务池,调度器自动按依赖顺序分发并行任务;

  • 证据图存储:结构化存储实体、属性、数值、网页来源、信息置信度,自动校验信息冲突;

  • 实体属性覆盖地图:二维表格化记录已检索内容,自动标记未填充空白单元格作为下一轮检索目标;

  • 策略记忆池:存储历史检索失败记录、写作输出大纲、算力预算消耗数据,优化后续检索策略。

3.3 智能体流水线执行闭环

完整检索六步闭环流程:

  1. Explore智能体解析用户提问,识别核心实体与待查询属性;

  2. 自动生成实体-属性覆盖图,标记信息缺失点位;

  3. Orchestrator批量分发并行检索任务至多个Search智能体;

  4. 抽取中间件标准化提取网页有效证据,绑定来源链接存入证据图;

  5. 传感器中间件校验信息完整度,存在缺失则新增补充检索任务;

  6. Writer智能体基于全局完整证据图生成带引用标注的结构化答案。

3.4 环境与技术栈

模块分区 核心技术栈 版本要求
内核调度核心 Python ≥3.11
Web前端工作台 TypeScript、Next.js、Node.js Node.js ≥20.9
Web后端服务 FastAPI 配套自动安装
终端TUI界面 Python终端UI组件 随项目一键部署

3.5 性能评测基准

项目基于WideSearch、GISA两大公开检索数据集完成评测,对比ReAct、Table-as-Search等主流检索智能体框架,所有F1指标全面领先:

  1. 表格枚举类任务Set·F1较第二名基线提升13.4;

  2. WideSearch数据集:Item F1=80.3,Row F1=56.5;

  3. GISA真实调研数据集:Table Item F1=76.9,Table Row F1=59.7;
    框架核心性能优势来源于覆盖地图机制,大幅提升信息召回率,减少重复检索、信息遗漏问题。

SearchOS(图2)

四、应用场景

  1. 行业批量调研:企业竞品信息、产品参数、财报数据批量对比搜集,自动生成标准化对比表格;

  2. 学术资料检索:多文献、多论文实体信息汇总,统一标注文献来源,方便学术论文引用;

  3. 政策信息整理:多地政策条文、补贴标准、申报条件全域检索,整合无遗漏;

  4. 榜单类数据枚举:院校排名、行业榜单、产品排行榜完整信息抓取,规避数据缺失;

  5. 保险/金融信息汇总:保险产品条款、理财产品参数多维度对比溯源;

  6. 自动化资料归档:长期周期性信息搜集任务,支持会话保存、定时复现检索流程。

五、使用方法

5.1 前置环境要求

本地设备安装Python3.11及以上版本、Node.js20.9及以上版本,支持Linux/macOS/Windows WSL环境。

5.2 一键安装部署

仓库内置install.sh一键部署脚本,自动创建虚拟环境、安装内核、前端、评测全部依赖:

  1. 克隆开源仓库
    git clone https://github.com/antins-labs/SearchOS.git

  2. 进入项目根目录,执行安装脚本
    chmod +x install.sh && ./install.sh

5.3 基础使用方式

  1. CLI单次快速检索
    终端直接执行命令,快速获取检索结果:
    searchos "你的检索查询语句"

  2. TUI交互式终端面板
    启动全屏可视化终端,可新建、恢复会话,调整算力档位、管理技能库:
    python -m searchos
    面板内置快捷指令:/new新建会话、/resume恢复历史任务、/effort切换算力档位、/skill管理技能白名单。

  3. Web可视化工作台
    执行web目录启动脚本,本地3000端口访问网页控制台:
    ./web/start.sh
    网页端支持可视化配置模型密钥、查看智能体实时调度看板、导出完整检索报告。

5.4 配置管理方式

项目提供三种统一配置渠道,参数互通:

  1. 项目.env环境变量文件,适合批量自动化部署;

  2. TUI终端内置/config配置面板;

  3. Web工作台可视化设置页面,新手友好图形化配置。

六、竞品对比

选取ReAct检索智能体、Tavily AI Agent两大主流检索框架做维度对比:

对比维度 SearchOS ReAct 检索智能体 Tavily AI Agent
核心架构 多智能体分工调度+SOCM全局状态存储 单智能体循环思考检索架构 单智能体轻量化检索工具
信息完整度机制 实体-属性覆盖地图,自动补全缺失信息 无全局覆盖检测,易遗漏信息 仅满足简短问答,不支持批量枚举
会话持久化 完整快照、任务回放、中断恢复 仅临时上下文,关闭即丢失 云端会话,本地无持久存储
溯源能力 每条数据绑定来源编号,完整网页证据存储 仅简单标注检索链接,无结构化证据库 仅输出摘要,原始网页不缓存
自定义技能扩展 280+内置技能,支持自定义域名适配技能 无分层技能库,自定义开发成本高 封闭API,无法自定义检索技能
部署方式 开源本地私有化部署(MIT协议) 开源无完整配套可视化界面 闭源云端API,无本地部署能力
批量调研适配 专门优化表格、枚举、多实体对比任务 适合单条简单问答,批量任务效率低 仅轻量化单次查询,不支持深度调研

七、常见问题解答

Q:SearchOS是否可以完全离线运行?

A:无法纯离线运行。框架仅本地调度内核开源,检索能力依赖第三方搜索API、大模型接口完成网页检索与文本生成,离线无搜索、模型调用渠道,无法执行检索任务。

Q:SearchOS支持Windows原生系统直接运行吗?

A:不支持Windows原生CMD,推荐使用WSL2 Windows子系统、虚拟机Linux或macOS系统完成部署,Windows原生环境会出现终端TUI、前端依赖兼容异常。

Q:SOCM存储的会话数据保存在什么位置?

A:所有会话快照、网页缓存、证据数据统一存储在项目根目录searchos_workspace文件夹,以时间戳创建独立子目录,可手动备份、删除历史检索记录。

Q:能否单独禁用某一类内置访问技能?

A:可以。TUI面板/网页控制台均提供技能白名单配置功能,可单独禁用、启用任意域名适配访问技能,也可批量关闭全部访问类技能。

Q:更换大模型API后,需要重新初始化会话吗?

A:不需要重新初始化已有会话,模型配置全局实时生效,下一轮检索任务自动调用新配置的大模型接口,历史存储的证据、任务数据不受配置变更影响。

Q:项目商用是否存在协议限制?

A:项目采用MIT开源协议,允许个人、企业商用二次开发、私有化部署,无商用授权费用,仅需保留原开源协议声明。

八、相关链接

九、总结

SearchOS是国内高校与大厂联合落地的开源检索智能体操作系统,依托自研SOCM全局状态管理模块与多智能体并行调度架构,从底层解决传统AI检索工具信息遗漏、无溯源、会话易丢失、批量调研效率低下等核心痛点,提供命令行、终端可视化、Web网页三套交互方案,配套完善技能库与评测基准,支持本地私有化部署,适配企业调研、学术资料整理、批量数据搜集等各类深度信息检索场景,同时采用宽松MIT开源协议,开发者可自由二次改造、商用落地,是兼顾完整功能与私有化需求的检索智能体底层开源框架。

打赏
THE END
作者头像
AI铺子
关注ai行业发展,专注ai工具推荐