MiMo-Audio:小米公司开源的多功能AI音频处理模型
MiMo-Audio是小米公司开发并开源的音频语言模型项目,旨在通过大规模预训练和创新的模型架构,实现音频领域的少样本学习能力。该项目依托超过1亿小时的多语言、多场景音频数...
MiMo-Audio是小米公司开发并开源的音频语言模型项目,旨在通过大规模预训练和创新的模型架构,实现音频领域的少样本学习能力。该项目依托超过1亿小时的多语言、多场景音频数...
VoxCPM是一款创新型无分词器文本转语音(TTS)系统。该系统采用端到端的扩散自回归架构,能够直接从文本生成连续的语音表示,彻底摆脱了传统TTS系统中离散分词的限制,重新...
OpenAI Codex CLI是由OpenAI开发的一款可在本地计算机运行的AI编码代理工具。它旨在为开发者提供便捷、高效的编码辅助支持,能够与多种代码编辑器配合使用,也可基于云服务...
Codexia是一款基于Codex CLI的开源GUI工具包,旨在为开发者提供丰富的AI辅助开发体验。它通过直观的图形界面,将强大的AI能力与实用的开发工具相结合,帮助用户更高效地完成...
OpenHands(前身为OpenDevin)是一个开源的AI驱动软件开发智能体平台,旨在通过人工智能技术辅助开发者完成各类软件开发任务。该项目提供了一套完整的解决方案,让AI智能体...
Unsloth是一个专注于大语言模型(LLM)高效微调的开源工具库,旨在解决大模型训练过程中普遍存在的速度慢、显存占用高的问题。该项目由Unsloth AI团队开发并维护,通过创新...
Nano Bananary(中文名称:香蕉超市)是一款基于Google Gemini 2.5 Flash Image模型开发的AI图片生成与编辑工具。该工具旨在降低创意图片制作的门槛,让普通用户无需专业设...
Lucy Edit Dev是由DecartAI开发的一款开源文本引导视频编辑工具,它作为ComfyUI的扩展节点存在,能够通过自然语言指令实现对视频内容的精准编辑。该项目基于先进的深度学习...
FastMTP是由腾讯BAC团队开发的一种针对大语言模型(LLM)的高效推理加速技术,旨在通过增强多token预测(Multi-Token Prediction, MTP)能力来显著提升大语言模型的推理速度...
Ling-V2是一款基于混合专家(Mixture of Experts,MoE)架构设计的开源大型语言模型系列,旨在实现高性能与计算效率的完美平衡。作为开源大语言模型领域的创新成果,Ling-V...