MuScriptor:开源AI多乐器音频转录模型,混音音乐自动识别生成多声部MIDI

AI新闻 AI铺子
60

一、MuScriptor是什么

MuScriptor 是由 Kyutai 与 Mirelo 联合开源的混音音频多乐器自动转录项目,它是依托17万首覆盖古典、摇滚、重金属、流行等多元曲风真实音乐数据集训练而成的AI模型,核心目标是直接处理包含多种乐器的混合音频,识别乐曲内不同乐器音符信息,输出标准MIDI文件。

项目同时提供Python开发API、CLI命令行工具、内置Web可视化界面三种交互方式,代码采用MIT开源协议;配套模型权重托管于Hugging Face,遵循CC BY-NC 4.0协议,仅限非商业场景使用。

MuScriptor:开源AI多乐器音频转录模型,混音音乐自动识别生成多声部MIDI

二、功能特色

  1. 混合音频多乐器识别
    无需预先分离音轨,直接输入混音歌曲,区分不同乐器声部生成独立音符信息,支持自定义锁定目标乐器,过滤无关声部输出纯净音轨。

  2. 多格式音频兼容
    支持WAV、FLAC、MP3、M4A等主流音频格式,同时兼容本地文件读取、内存张量输入两种调用模式。

  3. 多样化输出形式
    可导出标准MIDI文件,也能输出流式音符事件JSON/JSONL日志,包含音符起始、结束时间、乐器类别、音高等完整信息(模型不还原演奏力度)。

  4. 多种生成解码策略
    内置贪心采样、温度随机采样、束搜索多种解码方案,可自由调整切片长度、引导系数、采样温度等参数,平衡转录速度与精准度。

  5. 开箱即用Web可视化工作台
    集成钢琴卷帘可视化界面,支持拖拽音频文件实时转录、在线预览音符、音频与MIDI回放对比,开放局域网访问。

  6. 轻量化部署方案
    提供Docker部署支持,模型权重自动缓存,重复调用无需重复下载;同时支持批量音频批量转录任务。

三、技术细节

  1. 模型架构
    底层采用仅解码器Transformer架构,官方提供三种尺寸预训练权重,自动从Hugging Face拉取缓存:

    模型规格 参数量 配置 运行建议
    Small 103M 14层,768维嵌入 低配CPU设备,追求转录速度
    Medium 307M 24层,1024维嵌入(默认加载) 速度与精度均衡,通用首选
    Large 1.4B 48层,1536维嵌入 最高转录精度,建议GPU环境运行
  2. 音频处理逻辑
    音频按照5秒切片流式处理,降低内存占用与推理延迟;采用序列建模方式预测音符事件序列(NoteStart、NoteEnd、时序标记)。

  3. 项目技术栈
    后端:Python、FastAPI;前端:TypeScript、CSS;音频回放依赖FluidSynth加载SF2/SF3音色库实现MIDI试听。

  4. 授权区分
    项目源代码(推理脚本、Web服务、CLI工具):MIT协议,可自由修改;
    模型权重文件:CC BY-NC 4.0,禁止商用;
    内置MuseScore音色库:独立MIT协议。

  5. 环境约束
    推荐Python 3.10 ~ 3.12;Intel架构Mac仅推荐Python3.12;访问预训练模型需要Hugging Face账号与HF Token完成鉴权。

MuScriptor:开源AI多乐器音频转录模型,混音音乐自动识别生成多声部MIDI

四、应用场景

  • 音乐爱好者:歌曲扒谱,快速从成品音乐提取多声部乐谱素材

  • 独立音乐人:翻唱、改编创作,快速获取乐曲音符信息作为编曲参考

  • 音乐教育:乐曲声部拆解教学素材制作,辅助乐理学习

  • 音频科研:音乐信息检索(MIR)、多乐器转录相关实验基线模型

  • 工作室素材预处理:批量歌曲转MIDI,作为DAW编曲初始素材

    注意:权重非商用授权,商业项目不可直接使用官方预训练权重。

五、使用方法

方式1:CLI命令行(最简单)

  1. 使用uv快速安装

uv pip install muscriptor
  1. 单音频转录输出MIDI

muscriptor transcribe song.wav
  1. 启动内置Web可视化服务

uvx muscriptor serve --host 0.0.0.0

启动后默认访问地址 http://127.0.0.1:8222
4. 查询支持全部乐器列表

muscriptor list-instruments

方式2:Python API集成

调用内置接口,支持程序自动化批量处理,可获取原始音符事件流或者直接导出MIDI字节,方便嵌入本地脚本、自动化工作流。

方式3:Docker部署

仓库提供Docker配置文件,可容器化一键部署Web服务,适合服务器长期运行。

前置准备:注册Hugging Face账号,同意模型许可协议,本地配置HF_TOKEN环境变量,否则无法自动下载权重。

六、竞品对比

选取当前主流开源音频转MIDI模型进行横向对比:

项目名称 MuScriptor Basic-Pitch Onsets and Frames
核心定位 混音音频多乐器转录 单旋律单音高提取 单轨乐器/鼓组转录
多乐器区分 ✅ 支持区分多种乐器声部 ❌ 仅识别单旋律 有限支持,乐器区分弱
输入源 完整混音歌曲 推荐纯净单旋律音频 推荐分离后单音轨
输出格式 MIDI、流式音符JSON 基础MIDI MIDI
运行门槛 中,Large模型推荐GPU 极低,CPU流畅运行 中等
权重商用权限 权重CC BY-NC 4.0(禁止商用) 开源权重无额外限制 开源权重无额外限制
自带可视化WebUI ✅ 内置钢琴卷帘网页端 ❌ 无原生界面 ❌ 无原生界面

七、常见问题解答

Q:运行时报模型无法下载,鉴权失败怎么办?

A:需要登录Hugging Face,进入MuScriptor模型页面同意许可协议,在本地配置HF_TOKEN环境变量,确保网络可正常访问Hugging Face。

Q:转录后的MIDI缺少演奏力度信息,是否属于故障?

A:不属于故障。MuScriptor模型设计上只识别音符起止时间、音高、乐器种类,不预测力度参数,输出MIDI统一使用固定力度。

Q:能不能直接用于商业音乐制作项目?

A:项目代码MIT协议可以商用,但官方发布预训练模型权重为CC BY-NC 4.0非商业协议。商用场景需要自行重新训练权重。

Q:CPU运行Large模型速度很慢如何优化?

A:低配设备优先切换small/medium规格模型;有条件使用NVIDIA GPU加速推理;缩短音频切片长度提升响应速度。

Q:支持中文歌曲、人声旋律转录吗?

A:模型主要针对乐器声部优化,人声旋律识别效果不稳定,不建议作为人声扒谱首选工具。

Q:转录效果差、音符错乱如何调整参数?

A:尝试切换束搜索解码方式,适当调整采样温度;如果目标明确,可以通过参数限定乐器范围,减少误识别。

八、相关链接

九、总结

MuScriptor是一套功能完整、开箱即用的开源多乐器音乐转录解决方案,依托大规模真实音乐数据集训练,突破传统模型只能处理单音轨音频的局限,能够直接对混音音乐进行多声部乐器识别并输出标准MIDI文件,同时配套命令行、Python API以及可视化网页界面,兼顾普通使用者与开发者需求,适合音乐扒谱、乐理教学、音频信息研究等非商业场景,是当下多乐器音频转MIDI领域实用的开源基线模型。

打赏
THE END
作者头像
AI铺子
关注ai行业发展,专注ai工具推荐