SALMONN‑2:字节跳动联合清华大学开源的通用音频大模型

AI新闻 人工智能研究所
60

SALMONN‑2是什么

SALMONN‑2是字节跳动联合清华大学推出的开源通用音频大模型,该模型依托自研SPEAR音频编码器,只使用18.2k小时监督音频数据,就可以处理语音、环境声响、音乐等各类音频信号,将音频转为文本理解与回答输出,支持单音频、多参考音频上下文学习,提供8B、30B‑A3B两种模型规格,完全对外开放推理与微调代码,可本地部署、二次开发。

SALMONN-2(图1)

功能特色

  1. 多类型音频统一理解,语音、环境噪音、乐曲、副语言声音都能解析,不局限于单纯语音识别。

  2. MICL多音频上下文学习能力,输入主音频的同时附加多段参考发音音频,降低生僻词、专有名词识别出错概率。

  3. 全任务能力覆盖,包含语音识别ASR、音频内容描述、音乐分析、声音事件识别、音频真伪检测、语音质量评估。

  4. 轻量化微调,冻结音频编码器,仅训练适配器与LLM的LoRA参数,显卡硬件门槛更低。

  5. 原生兼容HuggingFace生态,可直接通过transformers加载,支持单条推理、命令行推理、批量音频处理。

  6. 时序定位支持,可以结合音频时间信息完成事件定位,输出音频内容对应的时间片段。

技术细节

  1. SPEAR统一音频编码器:自研自监督SSL音频基础模型,摒弃多套独立编码器的方案,一套编码器兼容语音、音乐、环境音各类音频输入,音频采样率固定16kHz。

  2. MLF多层特征融合适配器:提取SPEAR编码器全部层级特征,把浅层细节特征、高层语义特征融合,充分挖掘音频分层信息,搭配时间戳注入模块,实现音频时序定位。

  3. MICL多音频上下文学习机制:通过专项偏置训练,支持同时输入多条音频,参考音频作为上下文提示,用来纠正专有名词、特殊读音识别结果。

  4. 训练架构:SPEAR音频编码器全程冻结,只训练音频连接器模块以及大语言模型LoRA适配器;支持DeepSpeed ZeRO2多卡分布式训练。

  5. 模型规格:8B版本适合单机本地部署;30B‑A3B版本综合指标更高,对显存资源要求更高。

  6. 数据规模:仅使用18.2k小时音文配对监督数据,在MMAU‑Pro、MMAR、MMSU音频评测基准上取得优秀效果。

应用场景

  • 音频转写:长音频录音、访谈、会议录音识别,借助MICL参考音频优化人名、地名、行业专有名词识别。

  • 音频内容解析:播客、短视频音频自动摘要,对环境声音、音乐做内容描述。

  • 音频质检:语音质量打分,检测音频伪造、AI合成音频鉴别。

  • 音乐分析:解析乐曲乐器、曲风、段落信息。

  • 二次开发:开发者基于LoRA微调,面向垂直领域定制音频理解模型,例如方言识别、行业录音解析。

  • 批量业务处理:批量处理大量音频文件,产出结构化文本结果。

SALMONN2

使用方法

环境准备

推荐Python3.10、Python3.11,基础依赖包含torch、torchaudio;可选FlashAttention实现推理加速;多卡微调需要额外安装accelerate、deepspeed。

  1. 克隆salmonn2分支代码仓库;

  2. 创建虚拟环境,项目以可编辑模式安装;

  3. 可选安装FlashAttention;

  4. 运行项目自带校验脚本,确认环境依赖全部就绪。

推理使用

  1. 使用huggingface‑cli下载预训练权重;

  2. 调用transformers,开启trust_remote_code=True加载模型与处理器;

  3. 三种推理方式:

    • Python API:代码调用,适合集成进自有程序;

    • infer.py:命令行单音频快速推理;

    • infer_batch.py:读取JSON清单批量处理音频,支持MICL多参考音频上下文识别。

MICL使用要点:输入JSON清单,同时传入主音频和多条参考发音音频,标记占位符完成音频与文本绑定。

LoRA微调

  1. 准备数据集,JSON对话格式,存储音频路径、用户与助手对话内容;音频统一重采样至16kHz;

  2. 默认配置冻结SPEAR编码器,训练音频连接器与LLM侧LoRA;支持开启DeepSpeed ZeRO2;

  3. 单GPU直接运行训练脚本;多GPU场景使用torchrun分布式启动,自定义数据集路径、输出目录。

竞品对比

项目 SALMONN‑2 Qwen2.5‑Omni MOSS‑Audio
开源主体 字节跳动&清华 阿里通义千问 复旦MOSS团队
核心音频编码器 自研SPEAR统一编码器 多模态内置音频模块 独立音频编码器
多音频上下文MICL ✅支持,参考音频辅助识别 ❌不支持多音频上下文 ❌不支持多音频上下文
训练监督音频数据 18.2k小时 规模更大 规模更大
微调方式 LoRA,冻结音频编码器 全参数/LoRA微调 LoRA微调
主要模型规格 8B、30B‑A3B 7B、14B 部分参数规格
特色能力 音频时序定位、合成音频检测 图文音多模态一体 语音对话交互

常见问题解答

SALMONN‑2可以直接用于商业项目吗?

可以,需要遵守项目仓库内LICENSE开源协议,按照协议约束进行使用、修改与分发。

运行8B版本最低需要多少显存?

FP16推理,建议至少20GB显存;开启量化可以降低显存占用,量化效果会带来轻微精度损失。

MICL上下文识别必须要参考音频吗?

不是必须。普通音频识别不需要参考音频;遇到生僻词、专有名词识别效果差的时候,再搭配对应的参考发音音频提升识别准确率。

可以替换后端大语言模型主干吗?

项目原生设计为固定LLM主干,不支持随意替换主干模型,强行替换会出现特征适配异常。

微调的时候是否可以解冻SPEAR音频编码器?

代码层面允许修改配置开启解冻,但官方不推荐,解冻会大幅提升显存消耗,18.2k小时数据规模不足以完整重训编码器,效果大概率变差。

支持哪些音频格式?

底层torchaudio做音频读取,支持wav、flac;其他格式建议预处理转成16kHz采样率wav后再送入模型。

相关链接

总结

SALMONN‑2是字节跳动与清华联合开源的通用音频大模型,依靠SPEAR编码器与MICL多音频上下文创新,以较少的监督音频数据实现语音识别、音乐解析、声音事件检测等多类音频任务,完整开放推理与LoRA微调工程,兼容HuggingFace生态,为开发者提供本地部署、垂直领域音频模型二次开发的可靠开源方案。

打赏
THE END
作者头像
人工智能研究所
发现AI神器,探索AI技术!