Nemotron 3 Ultra

1.95
开放推理模型,550B总参数(55B激活),支持百万上下文,擅长多步推理与智能体编排。
Advertisement 728 × 90
公司NVIDIA
上下文1M
发布日期2026-06
更新日期2026-08-04

Nemotron 3 Ultra 概述

NVIDIA Nemotron 3 Ultra 是 NVIDIA 推出的一款开放前沿推理与编排模型,总参数量为 5500 亿,其中激活参数为 550 亿(采用 MoE 混合专家架构)。该模型基于 Transformer-Mamba 混合专家架构构建,支持文本输入与输出,上下文窗口最高可达 100 万 Token。它非常适用于长时间运行的智能体工作流,包括智能体编排、编码智能体、深度研究以及复杂的企业级任务。

该模型在多步骤推理与规划方面表现尤为突出,并具备高吞吐量推理能力,专为高并发智能体流水线而设计。它是 NVIDIA Nemotron 开放模型家族的一部分,专注于智能体 AI 应用。

Nemotron 3 Ultra 定价

套餐价格说明
DeepInfra API 接入 Input $0.50 / Output $2.20 每百万 Tokens 支持约 550B 参数规模 MoE 架构(约 55B 激活参数),最高支持 1M Token 上下文窗口。缓存读取约 $0.10/百万 Tokens。
Together AI API 接入 Input $0.60 / Output $3.60 每百万 Tokens 通过 Together AI 平台调用 Nemotron 模型,缓存读取约 $0.20/百万 Tokens,适合开发者快速集成。
NVIDIA 免费体验 免费(有调用限制) 可通过 NVIDIA 开发者平台体验模型能力,无需信用卡,适合开发测试和功能评估。
自托管部署(开源模型) 免费(需自备硬件) 支持下载开放模型权重,在自有 GPU 环境中部署运行,适合企业私有化部署和开发者研究使用。

Nemotron 3 Ultra 主要功能

专为“智能体”而生:它不仅仅是聊天模型,而是专门处理需要多步推理、调用工具、制定计划并自我纠错的复杂智能体工作流。

强大的MoE架构:总参数量达5500亿,但每次推理只激活其中的550亿参数(混合专家模型MoE),在保证高性能的同时也兼顾了效率。

超长上下文窗口:支持高达100万Token的上下文,可以一次性处理长篇报告、大型代码库等超长文本。

极高的推理效率:通过NVFP4精度、多Token预测(MTP)等技术创新,推理吞吐量比同类模型最高可提升5倍,并能将复杂智能体任务的使用成本降低高达30%。

全面的生态兼容:已适配主流的智能体开发框架(如OpenHands、LangChain Deep Agents等),方便开发者快速集成和部署。

总结

1. AI智能体开发者
构建编码、研究、企业自动化等复杂智能体应用的团队,需要多步推理与工具调用能力。

2. 企业IT与行业用户
适用于软件、网络安全、法律、科研等领域,处理大型代码库、漏洞修复、海量文本分析等长时任务。

3. 关注数据主权与成本的组织
开源可本地部署,满足政府、金融等隐私要求;推理速度提升5倍,成本降低30%,兼顾性能与效益。

评论(0)

发表评论

Advertisement 728 × 90

NVIDIA 模型对比

模型 上下文 定价 API 发布 全球热度
Nemotron 3 Ultra
1M 付费 YES 2026-06
74/100
128K 免费 NO 2026-06
42/100
256K 免费 NO 2026-04
36/100

类似模型

关联工具

相关新闻