PerceptionBench:Moonshot AI开源的多模态大模型纯视觉感知专项测评基准

AI新闻 dotaai
60

一、PerceptionBench 是什么

PerceptionBench 是 Moonshot AI(月之暗面)于2026年7月开源推出,专门面向多模态大模型(MLLM)原子级视觉感知能力的标准化评测基准,配套完整论文、数据集、可直接运行的评测代码、Hugging Face公开数据集资源。

现有多模态评测体系存在两大核心痛点:一是通用综合评测会将视觉感知错误、逻辑推理缺陷、外部知识缺失三类问题混合打分,无法区分模型短板根源;二是垂直场景评测覆盖范围碎片化,缺乏统一、底层的视觉能力衡量标准。

PerceptionBench 采用自下而上的故障拆解思路,从42个主流现有评测中提取前沿模型视觉失效案例,归纳出10项独立无干扰的基础视觉感知能力,构建纯视觉导向评测题库,全程剥离推理、常识知识干扰,仅衡量模型看图基础感知能力,可精准定位多模态模型底层视觉缺陷,是首个专注原子视觉感知细分维度的专业评测工具。

PerceptionBench(图1)

二、功能特色

  1. 纯感知隔离评测,消除分数干扰
    所有测试题目仅依赖图像信息即可作答,不设置需要逻辑推导、专业知识的问题,得分仅反映视觉感知水平,不会被推理能力、知识库强弱影响,评测结果真实反映模型视觉底层能力。

  2. 10维原子视觉能力细分打分
    摒弃单一总分输出,拆分10项独立视觉维度分项准确率,可直观识别模型在计数、3D深度、细粒度识别、视觉幻觉等细分模块的强弱差距。

  3. 大规模人工核验标准化数据集
    内置3000道经过人工校验的标准化试题,样本源自17000+内部原始样本池,按能力均衡、难度分层采样,答案简短唯一,规避模型文字先验投机得分。

  4. 统一自动化评测与判分体系
    兼容所有遵循OpenAI接口规范的多模态模型,内置专用判分提示词,由GPT-oss-120B自动二元0/1打分,人工核验判分一致性达99.7%,评测结果客观可复现。

  5. 开箱即用Python开源评测框架
    仓库提供完整可运行代码、环境配置模板、结果自动导出逻辑,支持并发请求、接口自动重试、自定义生成参数,评测数据自动存储为JSONL、标准化分数JSON文件。

  6. 跨模型横向对标榜单能力
    官方完成16款主流闭源/开源多模态大模型统一条件测评,提供完整横向对比榜单,方便开发者快速对比不同模型视觉感知上限。

三、技术细节

3.1 感知能力分类体系(10大原子维度)

缩写 维度全称 评测核心目标
VRel Visual Relation 视觉关系 识别画面内物体之间空间、从属、交互关系
Count Counting 计数 精准统计图像内同类物体数量
Attr Attribute 属性识别 识别物体颜色、材质、尺寸等基础属性
Depth Depth & 3D Perception 深度三维感知 判断物体远近、立体空间层级、遮挡关系
Loc Localization 目标定位 精准定位指定物体在画面中的位置
Comp Comparison 物体对比 对比两个物体大小、长短、颜色差异
FGR Fine-grained Recognition 细粒度识别 区分外观高度相似的细分物体品类
Ctx Contextual Integration 上下文融合 结合全局画面信息理解局部视觉内容
OCR Optical Character Recognition 图文识别 读取图像内印刷、手写文字内容
Hallu Perception-related Hallucination 视觉幻觉 抑制模型编造图像不存在物体、文字的能力

3.2 数据集技术构成

总题库3000道标准化试题,样本来源分为两类:

  1. 拆解错题样本(60%,1800题):从42个现有多模态评测基准中提取模型感知失效案例,拆解为单一感知维度子问题;

  2. 全新定制样本(40%,1200题):基于补充图像全新创作,覆盖原有基准缺失的视觉场景。
    全部题目为开放式简答,答案唯一简短,无模糊歧义,样本池原始总量超17000条,发布集经过分层均衡采样,保证10项感知维度样本数量均衡。

3.3 自动化评测底层实现

  1. 开发语言:项目100%基于Python开发,无其他编程语言依赖;

  2. 接口兼容:适配全部OpenAI兼容API接口,支持自定义私有模型推理端点;

  3. 配置管理:采用python-dotenv读取.env环境配置文件,统一管理API密钥、模型名称、并发数、最大token等参数;

  4. 打分逻辑:模型输出答案后,调用专用Judge模型加载judge_prompt.txt打分脚本,每题仅输出0(错误)/1(正确)二元结果;

  5. 数据存储:原始推理结果存入results/PerceptionBench_模型名.jsonl,各维度分项准确率、综合总分自动生成_scores.json标准化文件;

  6. 调度能力:支持自定义并发请求数量、API失败重试次数、推理温度、TopP/TopK采样参数,适配批量大规模评测需求。

3.4 官方评测实验技术参数

统一推理资源、固定Prompt模板测评16款模型(10款闭源、6款开源),判分模型固定为GPT-oss-120B,人工300样本抽样校验判分一致性99.7%;所有模型综合准确率均低于60%,视觉幻觉(Hallu)维度为全模型平均最低分项。

PerceptionBench(图2)

四、应用场景

  1. 多模态大模型研发迭代
    研发团队可批量评测自研多模态模型,定位视觉感知短板(如计数不准、3D深度感知弱、幻觉严重),针对性优化视觉编码器、跨模态对齐模块。

  2. 模型选型横向对比
    企业落地多模态业务前,使用统一基准横向对比开源/闭源模型底层视觉能力,不再仅依靠综合对话分数判断模型适配性。

  3. 学术科研实验
    多模态视觉、大模型安全方向论文实验,提供标准化、可复现的感知评测指标,用于量化模型视觉感知性能、幻觉抑制效果。

  4. 多模态安全检测
    针对视觉幻觉专项打分,量化模型无中生有编造画面内容的风险,为图片审核、工业视觉检测等高安全场景提供风险评估依据。

  5. 开源模型社区测评
    开源模型开发者、评测博主可一键部署框架,产出公平统一的视觉感知测评数据,输出客观横向对比榜单。

五、完整使用方法

步骤1:拉取项目代码并安装依赖

git clone git@github.com:MoonshotAI/PerceptionBench.git
cd PerceptionBench
pip install -r requirements.txt

步骤2:配置API接口凭证

复制环境变量模板生成配置文件,填入对应模型接口信息:

cp .env.example .env

打开.env文件填写OPENAI_API_KEYOPENAI_BASE_URL、待评测MODEL名称;
也可直接通过终端导出环境变量:

export OPENAI_API_KEY="你的接口密钥"
export OPENAI_BASE_URL="模型接口地址/v1"

步骤3:自定义评测参数(可选)

可修改并发请求数、最大生成token、重试次数、判分模型等参数,核心可配置变量:

  • JUDGE_MODEL:自动打分模型,默认gpt-oss-120b

  • CONCURRENCY:并发请求数量,默认16

  • MAX_TOKENS:单次推理最大token,默认65536

  • MAX_RETRIES:接口失败重试次数,-1代表无限重试

步骤4:执行自动化评测脚本

python eval/eval.py

步骤5:查看评测结果

运行完成后自动在results文件夹生成两类文件:

  1. PerceptionBench_模型名.jsonl:每条样本原始提问、图像、模型输出、打分结果;

  2. PerceptionBench_模型名_scores.json:综合总分+10个感知维度分项准确率。

六、竞品对比

选取当下通用多模态评测工具 MME、SEED-Bench 与 PerceptionBench 进行横向对比:

对比维度 PerceptionBench MME SEED-Bench
核心定位 原子级纯视觉感知专项评测,剥离推理/知识干扰 通用多模态综合评测,混合感知、推理、常识 多模态综合能力评测,侧重图文问答逻辑推理
细分能力维度 10项独立视觉感知专项,含视觉幻觉专项打分 基础感知+推理两大板块,无幻觉独立维度 20+综合图文任务,视觉感知无细分分项
数据集设计 3000题,单一感知维度单题,无复杂推理 千级样本,单题融合多种视觉+推理任务 万级图文样本,大量长逻辑、多步骤推理题目
评测干扰项 完全剔除常识、逻辑推导,仅测看图能力 推理、知识会大幅影响最终得分 核心考核逻辑推理,感知误差易被掩盖
自动化判分 内置专用Judge模型,二元0/1客观打分 部分任务依赖匹配,开放式答案难统一判分 选择题为主,开放式问答判分一致性低
适用人群 视觉编码器研发、幻觉优化、底层视觉诊断 通用多模态整体能力快速筛查 图文对话、复杂场景推理能力测评

PerceptionBench(图3)

七、常见问题解答

Q1:PerceptionBench 和普通多模态评测最大区别是什么?

A1:普通综合评测会把视觉看错、逻辑想错、知识不懂三类错误合并计算总分,无法区分模型问题根源;PerceptionBench所有题目仅依靠图像信息就能作答,不涉及推理和外部知识,分数仅代表模型纯粹的视觉感知能力,还能拆分10个细分维度精准定位短板。

Q2:没有Moonshot AI模型,是否可以使用该评测框架?

A2:完全可以,框架兼容所有实现OpenAI兼容接口的多模态模型,包括GPT系列、Claude、Gemini、Qwen、GLM、Seed等开源/闭源模型,只需填入对应厂商的API地址与密钥即可完成评测。

Q3:评测需要自备数据集吗?

A3:不需要,项目配套Hugging Face公开数据集,框架默认读取PerceptionBench.jsonl标准题库文件,开箱即用;如需自定义测试样本,可自行替换同格式JSONL文件。

Q4:Hallu视觉幻觉维度分数低代表什么?

A4:Hallu分项分数越低,代表该多模态模型越容易凭空编造图像不存在的物体、文字、场景,在图片审核、工业质检、政务识别等对真实性要求高的场景存在较高风险。

Q5:运行时报接口请求失败如何解决?

A5:可调整.env中的MAX_RETRIES参数增加重试次数,降低CONCURRENCY并发数减少接口限流,同时核对API_KEY、BASE_URL填写是否正确。

Q6:评测结果的Judge模型是否可以替换?

A6:支持替换,只需修改环境变量JUDGE_MODEL值,更换为支持文本打分的LLM即可,论文标准实验统一使用gpt-oss-120b保证结果对标一致性。

八、相关链接

  1. GitHub仓库地址:https://github.com/MoonshotAI/PerceptionBench

  2. 官网博客地址:https://www.kimi.com/blog/perception-bench

  3. 学术论文地址:https://github.com/MoonshotAI/PerceptionBench/blob/master/paper/PerceptionBench.pdf

  4. huggingface模型库:https://huggingface.co/datasets/moonshotai/PerceptionBench

九、总结

PerceptionBench是Moonshot AI推出的业内首个聚焦多模态大模型原子视觉感知的标准化开源评测工具,通过10项细分视觉能力分类、3000道无干扰纯视觉试题、兼容全品类多模态模型的自动化评测框架,解决了传统综合评测无法独立衡量模型底层看图能力的痛点,既能为多模态研发团队提供精准的视觉缺陷诊断依据,也能为学术研究、企业模型选型提供客观、可横向对比的统一评测标尺,完整开源的Python代码与标准化数据集降低了视觉感知专项测评的落地门槛。

打赏
THE END
作者头像
dotaai
正在和我的聊天机器人谈恋爱,它很会捧场。