LoHoSearch:美团开源的高难度搜索智能体评测数据集

AI新闻 AI铺子
61

一、LoHoSearch是什么

LoHoSearch是美团LongCat团队开源发布的英文搜索智能体评测基准数据集,专门面向复杂多约束知识检索任务,用于检验大模型搜索Agent的多线索融合、图结构推理、多轮检索规划能力。数据集总计544道经过人工复核的英文问答样本,全部为测试集,不提供训练数据,仅用作模型能力测评,不用于模型预训练。

数据集样本分为树结构Tree‑structured、图结构Graph‑structured两大类型,覆盖音乐、影视、地理、体育等11个通用知识领域,底层依托Wikidata+维基百科构建大规模知识图谱生成题目。

二、功能特色

  1. 高难度约束式命题:不以增加推理跳数为主要难点,刻意扩大单条线索对应的候选实体集合,单一线索无法锁定答案,必须多条件交叉校验,有效区分模型真实检索能力与记忆能力。

  2. 双结构样本划分:包含树结构与图结构两类样本;树结构支持分步拆解推理;图结构带有环形依赖、交叉约束,无法线性分步求解,模拟现实复杂检索场景。

  3. 多层级质量管控:采用子图抽取生成、自动化检索校验、人工复核三道质控流程,淘汰低质量样本,保证题目有效性。

  4. 真实能力暴露:主流大模型在此数据集整体得分偏低,可以有效暴露现有搜索智能体在复杂约束检索场景的短板,规避传统基准测试的高分虚高现象。

  5. 丰富元字段输出:每条样本附带问题、标准答案、结构类型、领域标签、底层图谱关系等完整元信息,方便统计、细分维度做模型效果分析。

LoHoSearch(图1)

三、技术细节

  • 底层知识图谱:基于英文维基百科与Wikidata构建,包含762万实体,2.65亿条有向关系边,作为题目生成底层数据源。

  • 样本规模分布:总样本544条,树结构样本282条,图结构样本262条;全部为测试子集,无训练、验证集划分。

  • 命题生成逻辑:从知识图谱抽取子图,生成带有多条并行约束条件的自然语言问题;图结构样本引入环、交叉依赖,打破线性多跳问答范式。

  • 质控流程:自动化初筛过滤无效问题;再开展人工复核,约2.2%样本被淘汰,75.5%样本一次人工校验通过。

  • 评测判分方案:官方论文采用GPT‑4.1与Qwen2.5‑32B双模型自动评判,取两者均值,降低单一评判模型带来的打分噪声;约29.2%样本不存在绝对唯一标准答案,存在天然评测噪声。

  • 数据语言:全部为英文,无中文样本。

四、应用场景

  1. 搜索智能体评测:评估联网Agent、工具调用大模型的检索规划、多条件消歧、多轮搜索能力。

  2. RAG与图谱检索算法对比:对比Graph‑RAG、多跳检索、Agent搜索框架在高约束难题上的性能差异。

  3. 学术研究基准:用于复杂知识推理、智能体规划方向论文实验,提供难度更高的评测指标。

  4. 模型能力诊断:定位大模型在多线索融合、图约束推理上的缺陷,辅助算法迭代优化。

五、使用方法

环境依赖

需要安装datasets、huggingface‑hub库,版本建议升级至最新。

pip install --upgrade datasets huggingface‑hub

Python加载代码

from datasets import load_dataset

# 直接加载公开数据集
dataset = load_dataset("meituan-longcat/LoHoSearch")
# 数据集只有test拆分
sample = dataset["test"][0]
print(sample)

字段说明:question待回答问题;answer标准答案;structure_type区分tree/graph;附带domain、图谱关系等元数据。

网络访问提示:国内访问Huggingface不稳定时,可配置HF镜像环境变量。

import os
os.environ["HF_ENDPOINT"] = "https://hf‑mirror.com"

六、竞品对比

选取HotpotQA、Musique、BrowseComp三个主流多跳检索评测基准做横向对比:

数据集 样本规模 题目结构 核心难点 适用对象 难度水平
LoHoSearch 544条(仅测试集) 树结构+图结构,含环形交叉约束 单线索候选空间爆炸,需要多约束交叉验证 搜索智能体、图谱Agent 很高
HotpotQA 十余万条,含训练集 线性链式多跳 实体多跳推理,分步拆解即可求解 多跳问答、RAG 中等
Musique 数千条,含训练集 多线索多跳,少量干扰信息 混入无关干扰事实,过滤冗余信息 多跳问答系统 中高
BrowseComp 上万条,含训练集 模拟网页浏览检索 模拟网页浏览、工具调用 网页浏览Agent 中等偏高

七、常见问题解答

Q:LoHoSearch是否可以用来做模型微调训练?

A:不适合用于微调训练。该数据集仅提供测试样本,没有训练集,定位是评测基准;样本总量很小,不满足预训练、微调的数据量级需求,仅用于效果测试打分。

Q:数据集是否有中文版本?

A:官方发布版本全部为英文问答,没有提供中文翻译版本,社区也暂无官方中文衍生版本。

Q:为什么顶尖大模型在LoHoSearch上准确率很低?

A:数据集专门放大检索消歧难度,很多问题不能依靠模型内部静态记忆,必须多轮外部检索、多条约束交叉筛选;即使头部模型也很难处理图结构环形依赖类题目,低分属于数据集设计带来的正常现象。

Q:加载数据集时报网络连接失败,如何处理?

A:国内网络访问Huggingface原站会超时,配置hf‑mirror镜像环境变量;同时升级datasets与huggingface‑hub到最新版本;数据集完全公开,无需申请访问权限。

Q:样本answer字段一定是唯一标准答案吗?

A:并非全部绝对唯一,官方说明约29.2%样本存在多个合理答案;论文使用双大模型共同评判来降低该噪声带来的评测偏差。

八、相关链接

九、总结

LoHoSearch由美团LongCat团队开源,是面向搜索智能体领域的高难度评测基准,区别于传统线性多跳问答数据集,引入树与图两类问题结构,依靠大规模知识图谱生成大量多约束检索难题,经过多轮人工质量校验;该数据集样本量不大,但题目含金量高,能够真实暴露出大模型在多线索融合、环形约束、多轮检索规划等方面存在的能力短板,为搜索Agent、图谱检索、复杂知识推理方向的开发者与科研人员,提供了更贴合真实复杂检索场景的测试评价工具。

打赏
THE END
作者头像
AI铺子
关注ai行业发展,专注ai工具推荐