Nemotron 3 Nano Omni 是由 NVIDIA 推出的新一代开放式全模态 AI 模型,属于 Nemotron 系列中的多模态模型,专注于视觉理解、语音处理、视频分析、文本推理和 AI Agent 应用。
该模型采用 MoE(Mixture-of-Experts)混合专家架构,基于 Nemotron 3 Nano 30B-A3B 模型骨干,并融合视觉编码器和音频编码器,实现对文本、图片、视频和音频的统一理解能力。
Nemotron 3 Nano Omni 支持原生音频输入,是 Nemotron 多模态系列中进一步扩展音频理解能力的模型,可用于复杂文档分析、长视频理解、语音内容处理以及智能体任务执行。
模型拥有约 30B 总参数、3B 激活参数,通过稀疏计算方式提升推理效率,在保持较强性能的同时降低部署成本。
相比传统需要多个模型组合完成视觉、语音和文本任务的方案,Nemotron 3 Nano Omni 能够在一个统一模型中处理多种信息来源,更适合真实业务环境中的复杂数据分析和 AI Agent 工作流。
作为 NVIDIA 开放模型生态的一部分,Nemotron 3 Nano Omni 支持开发者进行本地部署、模型微调和企业级 AI 应用开发。
Nemotron 3 Ultra
35 开放推理模型,550B总参数(55B激活),支持百万上下文,擅长多步推理与智能体编排。
NVIDIA
评论(0)