Nemotron 3 Embed:英伟达开源的高性能检索嵌入模型
一、Nemotron 3 Embed 是什么
Nemotron 3 Embed 是英伟达推出的开源商用级文本嵌入向量模型系列,专门面向RAG检索、AI智能体记忆检索、代码知识库检索场景打造,全系列统一32768(32K)超长上下文窗口,其中旗舰8B版本登顶Hugging Face权威检索基准RTEB榜单,是当前开源领域检索精度顶尖的向量嵌入方案。
该系列包含3款梯度化模型:高精度8B、轻量化1B BF16、Blackwell显卡专用1B NVFP4量化版,全部基于Ministral-3基座改造双向编码器,采用OpenMDW-1.1宽松开源协议,权重、蒸馏/微调脚本、训练数据全部公开,支持企业私有化部署、云端API调用、GPU硬件加速推理,适配全球多语言与代码混合检索需求。
二、功能特色
行业顶尖检索精度
Nemotron-3-Embed-8B-BF16以78.5总分登顶RTEB排行榜,在长文档、多语言、代码、智能体记忆四大检索赛道NDCG@10指标全面领先开源竞品,大幅降低RAG幻觉、检索漏召回问题。统一32K超长上下文窗口
全系无阉割支持32768 Token输入,可完整嵌入整本专利、合同、代码工程、行业手册,无需手动分片切割,减少检索分片误差与多轮调用成本,适配长文本知识库、智能体长期记忆存储。原生多语言+代码双支持
内置34种人类语言语义表征能力,原生兼容40+主流编程语言片段检索,跨国企业知识库、代码仓库、多语种客服知识库可开箱即用。三规格覆盖全生产场景
一套模型矩阵覆盖高精度核心业务、低延迟高并发服务、超大集群硬件优化三类需求,无需切换模型生态,统一向量维度、统一推理接口。NVIDIA硬件深度优化
NVFP4量化版本专为Blackwell架构GB200、RTX PRO 6000调优,显存占用大幅降低,并发吞吐量相比BF16版本提升最高2倍,精度损失不足1%。完整开源商用生态
开放权重、蒸馏配方、领域微调方案;兼容Transformers、vLLM、NVIDIA NeMo、LangChain;提供NIM企业微服务容器,支持私有化本地部署、云端API调用。AI Agent场景专项优化
针对智能体多轮记忆、工具调用检索、网页浏览检索(ViDoRe V3、BRIGHT基准)优化语义匹配,减少重复检索次数,降低整体推理Token开销。

三、技术细节
3.1 三款模型基础参数表
| 模型名称 | 参数规模 | 数据精度 | 核心定位 | RTEB总分 | 适配GPU架构 |
|---|---|---|---|---|---|
| Nemotron-3-Embed-8B-BF16 | 8B | BF16 | 旗舰高精度 | 78.5 | H100/H200/GB200 |
| Nemotron-3-Embed-1B-BF16 | 1.14B | BF16 | 通用轻量化 | 72.4 | 全系列NVIDIA GPU |
| Nemotron-3-Embed-1B-NVFP4 | 1.14B | NVFP4 4bit量化 | 超大集群高吞吐 | 72.1 | Blackwell(GB200)专属 |
3.2 底层架构与训练流程
骨干网络改造
基于Ministral-3大模型解码器转换为双向Encoder嵌入架构,保留原生长文本注意力机制,优化语义向量输出层,强化段落、代码、跨语言文本判别能力。轻量化模型蒸馏技术
1B版本采用量化感知蒸馏(QAD)+两阶段剪枝:以8B高精度模型为教师,先压缩3B基座至2B,再蒸馏至1.14B,同步保留32K长文本检索能力,解决小模型长文本精度衰减痛点。训练数据集构成
混合百万级多语言文本检索对、开源代码库匹配样本、智能体记忆交互数据、长文档专利/法律文本,覆盖噪声、短句、超长篇章、代码片段等真实业务样本。向量输出规格
统一输出固定维度稠密语义向量,支持余弦相似度、内积两种主流向量库匹配算法,无缝对接Chroma、Milvus、Pinecone、FAISS等向量数据库。开源许可
OpenMDW-1.1协议,允许企业商用、二次微调、私有化部署,无商用收费限制,可自由修改模型蒸馏、微调代码。
四、应用场景
企业级高精度RAG知识库
法律合同、医疗病历、金融研报、专利文献等高价值长文档检索,使用8B旗舰模型,保障召回精准度,减少大模型幻觉。AI智能体长期记忆系统
客服智能体、办公自动化Agent、数据分析智能体,存储多轮对话历史、工具执行记录,快速调取历史上下文,降低重复检索成本。代码仓库检索平台
开发内部代码库、开源代码检索工具,支持函数、注释、完整工程文件混合语义匹配,替代传统关键词检索。多语种跨境搜索系统
外贸、跨国企业多语言知识库、多语言客服问答,无需多模型切换,单模型完成中英日韩西法等语言跨语言检索。高并发轻量化检索服务
中小型企业知识库、前端实时搜索、百万级用户并发场景,选用1B BF16版本,平衡延迟与检索精度。超大规模云向量检索集群
公有云向量检索服务、万亿级文档知识库,部署1B NVFP4量化版本,最大化GPU吞吐量,降低硬件采购成本。
五、使用方法
5.1 环境依赖安装
# 基础推理依赖 pip install transformers torch huggingface-hub # 生产高性能推理(推荐) pip install vLLm # NVIDIA官方训练微调工具 pip install nemo-toolkit
5.2 Hugging Face Transformers 本地调用示例
from transformers import AutoTokenizer, AutoModel
import torch
model_name = "nvidia/Nemotron-3-Embed-8B-BF16"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModel.from_pretrained(model_name)
def get_embedding(text):
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=32768)
with torch.no_grad():
outputs = model(**inputs)
# 取句首token作为文本向量
emb = outputs.last_hidden_state[:,0,:]
return emb
# 文本向量化
vec = get_embedding("企业长文档RAG检索方案")5.3 vLLM生产API服务部署
vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4 \ --served-model-name nemotron-3-embed \ --max-model-len 32768 \ --dtype auto \ --host 0.0.0.0 \ --port 8000
部署后提供OpenAI兼容向量API,可直接接入LangChain、LlamaIndex等RAG框架。
5.4 NVIDIA NIM云端托管调用
登录build.nvidia.com,搜索Nemotron 3 Embed,一键创建托管API端点,无需本地GPU,开箱即用向量检索服务。
5.5 领域微调
通过NVIDIA NeMo框架加载官方蒸馏微调脚本,导入行业专属语料(法律/医疗/代码),低成本完成垂直领域适配。
六、竞品对比
选取行业主流开源嵌入模型BGE Large、Jina Embeddings v4与Nemotron 3 Embed 8B做横向对比
| 对比维度 | Nemotron 3 Embed 8B | BGE-Large-en-v1.5 | Jina Embeddings v4 |
|---|---|---|---|
| 最大上下文长度 | 32768 Token | 8192 Token | 32768 Token |
| RTEB检索综合得分 | 78.5(榜单第一) | 73.2 | 74.7 |
| 原生代码检索支持 | ✅ 内置代码训练样本 | ❌ 仅文本优化 | ✅ 轻度代码适配 |
| 多语言覆盖数量 | 34种语言 | 中英双语为主 | 30种主流语言 |
| 硬件专属量化方案 | NVFP4(Blackwell显卡) | FP8通用量化 | FP16/FP8 |
| 开源商用协议 | OpenMDW-1.1 宽松商用 | MIT | Apache 2.0 |
| AI Agent记忆检索表现 | ViDoRe/BRIGHT基准最优 | 中等 | 良好 |
| 长文档分片依赖 | 无需分片,完整加载 | 必须手动分片 | 可完整加载 |
七、常见问题解答(FAQ)
Q1:Nemotron 3 Embed是否支持商用,是否有版权限制?
A:全系模型采用OpenMDW-1.1开源协议,允许企业免费商用、私有化部署、二次微调与蒸馏,无授权费用,仅禁止移除模型版权标识。
Q2:32K上下文窗口是否会大幅提升推理延迟?
A:原生搭配vLLM PagedAttention缓存与NVIDIA硬件加速,同等长度文本推理速度优于8K上下文竞品;1B量化版本单卡可承载数百并发长文本嵌入任务。
Q3:无NVIDIA显卡能否运行Nemotron 3 Embed?
A:BF16版本支持AMD GPU、CPU推理,但速度大幅下降;NVFP4量化版本仅支持Blackwell架构GB200系列显卡,其他硬件无法加载。
Q4:该模型是否支持中文检索,中文效果相比BGE如何?
A:原生内置中文训练数据,通用长文本、中英文混合检索优于BGE-Large;纯中文短句检索BGE略有优势,长文档、代码、多语种混合场景Nemotron 3 Embed更强。
Q5:如何选择8B、1B BF16、1B NVFP4三款模型?
A:核心高精度业务(法律/医疗/专利)选8B;中小规模通用知识库、平衡成本精度选1B BF16;云超大集群、GB200显卡集群高并发场景选1B NVFP4。
Q6:可以基于该模型做领域微调吗,官方是否提供训练脚本?
A:完全支持,NVIDIA NeMo开源仓库提供完整微调、蒸馏、量化脚本,配套官方检索训练数据集,适配金融、医疗、代码等垂直领域优化。
Q7:向量输出维度固定吗,能否压缩向量降低存储?
A:原生输出固定稠密向量,官方未提供动态降维功能;可通过向量数据库内置PCA算法压缩向量维度,轻微损失检索精度换取存储空间缩减。
八、相关链接
项目官网:https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb
HuggingFace模型库:https://huggingface.co/collections/nvidia/nemotron-3-embed
九、总结
Nemotron 3 Embed作为英伟达推出的全场景开源嵌入向量模型系列,凭借登顶RTEB榜单的检索精度、全系统一32K超长上下文、原生多语言与代码检索能力、梯度化三规格硬件适配方案,完整覆盖企业RAG、AI智能体、代码检索、大规模云搜索等生产需求,搭配宽松可商用开源协议、完善的本地部署与云端托管工具链,解决了传统嵌入模型长文本精度不足、并发成本高、多场景适配割裂的行业痛点,是当前兼顾检索效果、硬件效率与商用落地友好度的主流开源向量模型方案。
版权及免责申明:本文由@97ai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/nemotron-3-embed.html

