MuScriptor:开源AI多乐器音频转录模型,混音音乐自动识别生成多声部MIDI
一、MuScriptor是什么
MuScriptor 是由 Kyutai 与 Mirelo 联合开源的混音音频多乐器自动转录项目,它是依托17万首覆盖古典、摇滚、重金属、流行等多元曲风真实音乐数据集训练而成的AI模型,核心目标是直接处理包含多种乐器的混合音频,识别乐曲内不同乐器音符信息,输出标准MIDI文件。
项目同时提供Python开发API、CLI命令行工具、内置Web可视化界面三种交互方式,代码采用MIT开源协议;配套模型权重托管于Hugging Face,遵循CC BY-NC 4.0协议,仅限非商业场景使用。

二、功能特色
混合音频多乐器识别
无需预先分离音轨,直接输入混音歌曲,区分不同乐器声部生成独立音符信息,支持自定义锁定目标乐器,过滤无关声部输出纯净音轨。多格式音频兼容
支持WAV、FLAC、MP3、M4A等主流音频格式,同时兼容本地文件读取、内存张量输入两种调用模式。多样化输出形式
可导出标准MIDI文件,也能输出流式音符事件JSON/JSONL日志,包含音符起始、结束时间、乐器类别、音高等完整信息(模型不还原演奏力度)。多种生成解码策略
内置贪心采样、温度随机采样、束搜索多种解码方案,可自由调整切片长度、引导系数、采样温度等参数,平衡转录速度与精准度。开箱即用Web可视化工作台
集成钢琴卷帘可视化界面,支持拖拽音频文件实时转录、在线预览音符、音频与MIDI回放对比,开放局域网访问。轻量化部署方案
提供Docker部署支持,模型权重自动缓存,重复调用无需重复下载;同时支持批量音频批量转录任务。
三、技术细节
模型架构
底层采用仅解码器Transformer架构,官方提供三种尺寸预训练权重,自动从Hugging Face拉取缓存:模型规格 参数量 配置 运行建议 Small 103M 14层,768维嵌入 低配CPU设备,追求转录速度 Medium 307M 24层,1024维嵌入(默认加载) 速度与精度均衡,通用首选 Large 1.4B 48层,1536维嵌入 最高转录精度,建议GPU环境运行 音频处理逻辑
音频按照5秒切片流式处理,降低内存占用与推理延迟;采用序列建模方式预测音符事件序列(NoteStart、NoteEnd、时序标记)。项目技术栈
后端:Python、FastAPI;前端:TypeScript、CSS;音频回放依赖FluidSynth加载SF2/SF3音色库实现MIDI试听。授权区分
项目源代码(推理脚本、Web服务、CLI工具):MIT协议,可自由修改;
模型权重文件:CC BY-NC 4.0,禁止商用;
内置MuseScore音色库:独立MIT协议。环境约束
推荐Python 3.10 ~ 3.12;Intel架构Mac仅推荐Python3.12;访问预训练模型需要Hugging Face账号与HF Token完成鉴权。

四、应用场景
音乐爱好者:歌曲扒谱,快速从成品音乐提取多声部乐谱素材
独立音乐人:翻唱、改编创作,快速获取乐曲音符信息作为编曲参考
音乐教育:乐曲声部拆解教学素材制作,辅助乐理学习
音频科研:音乐信息检索(MIR)、多乐器转录相关实验基线模型
工作室素材预处理:批量歌曲转MIDI,作为DAW编曲初始素材
注意:权重非商用授权,商业项目不可直接使用官方预训练权重。
五、使用方法
方式1:CLI命令行(最简单)
使用uv快速安装
uv pip install muscriptor
单音频转录输出MIDI
muscriptor transcribe song.wav
启动内置Web可视化服务
uvx muscriptor serve --host 0.0.0.0
启动后默认访问地址 http://127.0.0.1:8222
4. 查询支持全部乐器列表
muscriptor list-instruments
方式2:Python API集成
调用内置接口,支持程序自动化批量处理,可获取原始音符事件流或者直接导出MIDI字节,方便嵌入本地脚本、自动化工作流。
方式3:Docker部署
仓库提供Docker配置文件,可容器化一键部署Web服务,适合服务器长期运行。
前置准备:注册Hugging Face账号,同意模型许可协议,本地配置
HF_TOKEN环境变量,否则无法自动下载权重。
六、竞品对比
选取当前主流开源音频转MIDI模型进行横向对比:
| 项目名称 | MuScriptor | Basic-Pitch | Onsets and Frames |
|---|---|---|---|
| 核心定位 | 混音音频多乐器转录 | 单旋律单音高提取 | 单轨乐器/鼓组转录 |
| 多乐器区分 | ✅ 支持区分多种乐器声部 | ❌ 仅识别单旋律 | 有限支持,乐器区分弱 |
| 输入源 | 完整混音歌曲 | 推荐纯净单旋律音频 | 推荐分离后单音轨 |
| 输出格式 | MIDI、流式音符JSON | 基础MIDI | MIDI |
| 运行门槛 | 中,Large模型推荐GPU | 极低,CPU流畅运行 | 中等 |
| 权重商用权限 | 权重CC BY-NC 4.0(禁止商用) | 开源权重无额外限制 | 开源权重无额外限制 |
| 自带可视化WebUI | ✅ 内置钢琴卷帘网页端 | ❌ 无原生界面 | ❌ 无原生界面 |
七、常见问题解答
Q:运行时报模型无法下载,鉴权失败怎么办?
A:需要登录Hugging Face,进入MuScriptor模型页面同意许可协议,在本地配置HF_TOKEN环境变量,确保网络可正常访问Hugging Face。
Q:转录后的MIDI缺少演奏力度信息,是否属于故障?
A:不属于故障。MuScriptor模型设计上只识别音符起止时间、音高、乐器种类,不预测力度参数,输出MIDI统一使用固定力度。
Q:能不能直接用于商业音乐制作项目?
A:项目代码MIT协议可以商用,但官方发布预训练模型权重为CC BY-NC 4.0非商业协议。商用场景需要自行重新训练权重。
Q:CPU运行Large模型速度很慢如何优化?
A:低配设备优先切换small/medium规格模型;有条件使用NVIDIA GPU加速推理;缩短音频切片长度提升响应速度。
Q:支持中文歌曲、人声旋律转录吗?
A:模型主要针对乐器声部优化,人声旋律识别效果不稳定,不建议作为人声扒谱首选工具。
Q:转录效果差、音符错乱如何调整参数?
A:尝试切换束搜索解码方式,适当调整采样温度;如果目标明确,可以通过参数限定乐器范围,减少误识别。
八、相关链接
Hugging Face模型库:https://huggingface.co/MuScriptor
论文arXiv地址:https://arxiv.org/abs/2607.08168
九、总结
MuScriptor是一套功能完整、开箱即用的开源多乐器音乐转录解决方案,依托大规模真实音乐数据集训练,突破传统模型只能处理单音轨音频的局限,能够直接对混音音乐进行多声部乐器识别并输出标准MIDI文件,同时配套命令行、Python API以及可视化网页界面,兼顾普通使用者与开发者需求,适合音乐扒谱、乐理教学、音频信息研究等非商业场景,是当下多乐器音频转MIDI领域实用的开源基线模型。
版权及免责申明:本文由@AI铺子原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/muscriptor.html

