NVIDIA 发布 Nemotron3Embed 系列嵌入向量模型,8B 版本登顶 RTEB 基准测试
NVIDIA 近日推出 Nemotron3Embed 系列嵌入向量模型,面向生产级 RAG、智能体检索、代码检索及智能体记忆等应用场景。该系列包含三个开放检查点:Nemotron-3-Embed-8B-BF16(精度优先)、Nemotron-3-Embed-1B-BF16(轻量化版本),以及 Nemotron-3-Embed-1B-NVFP4(针对 Blackwell 架构优化的 4 比特版本)。三者均采用双向注意力掩码训练的 Transformer 编码器,序列长度上限为 32,768 个 token,支持 34 种语言,并基于 OpenMDW-1.1 许可协议开源。其基础模型源自 Mistral 架构,8B 版本基于 Ministral-3-8B-Instruct-2512,两个 1B 变体则基于 Ministral-3-3B-Instruct-2512。
在 RTEB 基准的 16 项公开任务测试中,8B-BF16 版本以平均 NDCG@10 得分 78.46 位列榜首。1B-BF16 版本得分 72.38,相较上一代基线 llama-nemotron-embed-vl-1b-v2 提升 10.4 分。针对 Blackwell 优化的 1B-NVFP4 版本仅损失 0.38 分,保留 99.5% 的精度,同时在 Blackwell 架构上吞吐量较 BF16 提升 2 倍。
1B 模型采用压缩而非从头训练的路径构建:研发团队先使用 NVIDIA ModelOpt 的神经架构搜索将 3B 基础模型剪枝至 2B,再从微调后的 8B 嵌入向量教师模型中通过余弦距离损失和均方误差损失进行知识蒸馏,最终迭代至 1.14B 参数。NVFP4 版本在此基础上进行量化感知蒸馏,使用 512 个样本校准、2 万个样本训练,在长输入场景下恢复精度。
部署方面,8B 和 1B 的 BF16 版本支持 Transformers 和 Sentence Transformers 框架,1B-NVFP4 仅支持 vLLM 0.25.0 的 /v2/embed 接口。微架构覆盖上,NVFP4 版本兼容 Ampere、Hopper、Lovelace 和 Blackwell,BF16 版本面向 Ampere、Hopper 和 Blackwell。NVIDIA 还发布了针对 1B 模型的优化版 NIM 微服务,基于 Rust 构建,在 GB200 和 RTX PRO6000 上达到或超越 vLLM 检查点的性能。
应用场景方面,该系列模型支持多语言企业搜索、代码检索(训练数据包含 SWE-bench 等代码数据集)以及智能体记忆(32K token 长上下文支持较长对话摘要嵌入)。对于成本敏感场景,可采用"1B-NVFP4 处理高容量召回 + 8B 处理困难查询"的分层 RAG 策略。
NVIDIA 同时提供了完整的代码示例,涵盖基于 Sentence Transformers 的本地推理和基于 vLLM 的服务端部署。查询和文档分别通过 `query:` 和 `passage:` 前缀区分,嵌入向量经 L2 归一化处理后点积即等于余弦相似度。