SALMONN‑2:字节跳动联合清华大学开源的通用音频大模型
SALMONN‑2是什么
SALMONN‑2是字节跳动联合清华大学推出的开源通用音频大模型,该模型依托自研SPEAR音频编码器,只使用18.2k小时监督音频数据,就可以处理语音、环境声响、音乐等各类音频信号,将音频转为文本理解与回答输出,支持单音频、多参考音频上下文学习,提供8B、30B‑A3B两种模型规格,完全对外开放推理与微调代码,可本地部署、二次开发。

功能特色
多类型音频统一理解,语音、环境噪音、乐曲、副语言声音都能解析,不局限于单纯语音识别。
MICL多音频上下文学习能力,输入主音频的同时附加多段参考发音音频,降低生僻词、专有名词识别出错概率。
全任务能力覆盖,包含语音识别ASR、音频内容描述、音乐分析、声音事件识别、音频真伪检测、语音质量评估。
轻量化微调,冻结音频编码器,仅训练适配器与LLM的LoRA参数,显卡硬件门槛更低。
原生兼容HuggingFace生态,可直接通过transformers加载,支持单条推理、命令行推理、批量音频处理。
时序定位支持,可以结合音频时间信息完成事件定位,输出音频内容对应的时间片段。
技术细节
SPEAR统一音频编码器:自研自监督SSL音频基础模型,摒弃多套独立编码器的方案,一套编码器兼容语音、音乐、环境音各类音频输入,音频采样率固定16kHz。
MLF多层特征融合适配器:提取SPEAR编码器全部层级特征,把浅层细节特征、高层语义特征融合,充分挖掘音频分层信息,搭配时间戳注入模块,实现音频时序定位。
MICL多音频上下文学习机制:通过专项偏置训练,支持同时输入多条音频,参考音频作为上下文提示,用来纠正专有名词、特殊读音识别结果。
训练架构:SPEAR音频编码器全程冻结,只训练音频连接器模块以及大语言模型LoRA适配器;支持DeepSpeed ZeRO2多卡分布式训练。
模型规格:8B版本适合单机本地部署;30B‑A3B版本综合指标更高,对显存资源要求更高。
数据规模:仅使用18.2k小时音文配对监督数据,在MMAU‑Pro、MMAR、MMSU音频评测基准上取得优秀效果。
应用场景
音频转写:长音频录音、访谈、会议录音识别,借助MICL参考音频优化人名、地名、行业专有名词识别。
音频内容解析:播客、短视频音频自动摘要,对环境声音、音乐做内容描述。
音频质检:语音质量打分,检测音频伪造、AI合成音频鉴别。
音乐分析:解析乐曲乐器、曲风、段落信息。
二次开发:开发者基于LoRA微调,面向垂直领域定制音频理解模型,例如方言识别、行业录音解析。
批量业务处理:批量处理大量音频文件,产出结构化文本结果。

使用方法
环境准备
推荐Python3.10、Python3.11,基础依赖包含torch、torchaudio;可选FlashAttention实现推理加速;多卡微调需要额外安装accelerate、deepspeed。
克隆salmonn2分支代码仓库;
创建虚拟环境,项目以可编辑模式安装;
可选安装FlashAttention;
运行项目自带校验脚本,确认环境依赖全部就绪。
推理使用
使用huggingface‑cli下载预训练权重;
调用transformers,开启
trust_remote_code=True加载模型与处理器;三种推理方式:
Python API:代码调用,适合集成进自有程序;
infer.py:命令行单音频快速推理;
infer_batch.py:读取JSON清单批量处理音频,支持MICL多参考音频上下文识别。
MICL使用要点:输入JSON清单,同时传入主音频和多条参考发音音频,标记占位符完成音频与文本绑定。
LoRA微调
准备数据集,JSON对话格式,存储音频路径、用户与助手对话内容;音频统一重采样至16kHz;
默认配置冻结SPEAR编码器,训练音频连接器与LLM侧LoRA;支持开启DeepSpeed ZeRO2;
单GPU直接运行训练脚本;多GPU场景使用torchrun分布式启动,自定义数据集路径、输出目录。
竞品对比
| 项目 | SALMONN‑2 | Qwen2.5‑Omni | MOSS‑Audio |
|---|---|---|---|
| 开源主体 | 字节跳动&清华 | 阿里通义千问 | 复旦MOSS团队 |
| 核心音频编码器 | 自研SPEAR统一编码器 | 多模态内置音频模块 | 独立音频编码器 |
| 多音频上下文MICL | ✅支持,参考音频辅助识别 | ❌不支持多音频上下文 | ❌不支持多音频上下文 |
| 训练监督音频数据 | 18.2k小时 | 规模更大 | 规模更大 |
| 微调方式 | LoRA,冻结音频编码器 | 全参数/LoRA微调 | LoRA微调 |
| 主要模型规格 | 8B、30B‑A3B | 7B、14B | 部分参数规格 |
| 特色能力 | 音频时序定位、合成音频检测 | 图文音多模态一体 | 语音对话交互 |
常见问题解答
SALMONN‑2可以直接用于商业项目吗?
可以,需要遵守项目仓库内LICENSE开源协议,按照协议约束进行使用、修改与分发。
运行8B版本最低需要多少显存?
FP16推理,建议至少20GB显存;开启量化可以降低显存占用,量化效果会带来轻微精度损失。
MICL上下文识别必须要参考音频吗?
不是必须。普通音频识别不需要参考音频;遇到生僻词、专有名词识别效果差的时候,再搭配对应的参考发音音频提升识别准确率。
可以替换后端大语言模型主干吗?
项目原生设计为固定LLM主干,不支持随意替换主干模型,强行替换会出现特征适配异常。
微调的时候是否可以解冻SPEAR音频编码器?
代码层面允许修改配置开启解冻,但官方不推荐,解冻会大幅提升显存消耗,18.2k小时数据规模不足以完整重训编码器,效果大概率变差。
支持哪些音频格式?
底层torchaudio做音频读取,支持wav、flac;其他格式建议预处理转成16kHz采样率wav后再送入模型。
相关链接
GitHub仓库地址:https://github.com/bytedance/SALMONN/tree/salmonn2
Hugging Face模型库:https://huggingface.co/marcoyang/SALMONN-2-8B
总结
SALMONN‑2是字节跳动与清华联合开源的通用音频大模型,依靠SPEAR编码器与MICL多音频上下文创新,以较少的监督音频数据实现语音识别、音乐解析、声音事件检测等多类音频任务,完整开放推理与LoRA微调工程,兼容HuggingFace生态,为开发者提供本地部署、垂直领域音频模型二次开发的可靠开源方案。
版权及免责申明:本文由@人工智能研究所原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/salmonn-2.html

