Mega-ASR:开源高鲁棒语音识别模型,适配全场景恶劣环境语音转写
Mega-ASR是一款主打全场景恶劣环境的开源自动语音识别模型,依托海量实景语音数据与声学语义渐进微调技术,有效解决噪声、远场、混响失真音频识别难题,具备低幻觉高精准转...
Mega-ASR是一款主打全场景恶劣环境的开源自动语音识别模型,依托海量实景语音数据与声学语义渐进微调技术,有效解决噪声、远场、混响失真音频识别难题,具备低幻觉高精准转...
Stable Audio 3是Stability AI研发的开源AI音频生成项目,支持文本生成音乐音效、音频片段修复续写,搭载多款梯度模型,兼容多类硬件设备,具备LoRA风格微调能力,提供网页...
Hy-MT2是腾讯混元开源的快思考多语种翻译模型家族,拥有1.8B、7B、30B-A3B多规格版本,支持33种语言双向翻译与七类指令定制翻译,搭载AngelSlim极致量化技术,体积小巧适配...
Hy-MT1.5-1.8B-1.25bit 是由腾讯混元团队联合 AngelSlim 共同推出的超轻量化端侧离线多语言翻译大模型,基于腾讯原生 HY-MT1.5-1.8B 翻译底座模型,采用自研 Sherry 三值量...
TIPSv2是谷歌DeepMind推出的第二代空间感知型文本-图像预训练编码器,收录于CVPR 2026,核心解决多模态模型全局理解强、局部定位弱的痛点。通过iBOT++全区域监督、Head-onl...
Wav2Lip是2020年由印度IIIT-H团队推出的开源AI唇形同步模型,基于GAN与SyncNet架构,可对任意人脸视频/静态图与任意语言音频实现毫秒级精准口型匹配,保留原始画面质感,广...
Audio Flamingo Next(AF-Next)是NVIDIA与马里兰大学联合发布的新一代开源大型音频语言模型,支持30分钟长音频输入与128K上下文窗口,首创时序音频思维链技术,精准锚定时...
Harrier-OSS-v1是微软研究院开源的多语言文本嵌入模型家族,包含270M、0.6B、27B三档参数规模,采用decoder-only架构、last-token pooling与L2归一化,最长支持32768 token...
Matrix-Game 3.0是昆仑万维旗下天工AI研发的工业级实时流式交互式世界模型,是首个实现长时序一致性、720p高分辨率、实时交互三者统一的开源世界模型。该模型基于扩散Trans...
InternVL-U是由上海人工智能实验室OpenGVLab团队推出的40亿参数轻量级统一多模态开源模型,在单一框架内融合多模态理解、逻辑推理、图像生成、图像编辑四大核心能力,以“统...
Helios是北京大学YuanGroup开源的140亿参数实时长视频生成模型,无需传统抗漂移与加速技巧,即可在单张H100显卡实现19.5FPS端到端推理,支持文本/图像/视频驱动的分钟级高质...
RynnBrain是阿里巴巴达摩院开源的具身基础模型,以物理现实为锚点,面向机器人操作、视觉-语言导航、复杂任务规划等具身智能场景设计,具备时空定位、物理空间交错推理、物...
Anima是一款面向动漫与非写实艺术创作的20亿参数开源文本到图像(Text-to-Image)模型,由CircleStone Labs与Comfy Org联合研发,基于NVIDIA Cosmos架构构建,托管于Huggin...
ACE-Step 1.5是一款由ACE Studio与StepFun联合开发的开源音乐生成基础模型,主打在消费级硬件上实现商用级别的音乐生成能力,仅需4GB显存即可本地运行,兼具极速生成、多语...
SoulX-FlashTalk是由Soul AI Lab(Soul App人工智能实验室)联合东华大学研发并开源的实时音频驱动数字人无限流式生成模型,核心定位是解决传统数字人生成技术中“高画质必...