NVIDIA近日推出了一款名为Nemotron 3.5 Lightning的新型开放模型,专为自主智能体的高频执行任务设计,旨在降低长时间运行智能体的成本与延迟。该模型通过混合专家架构,总参数量达300亿,但每次推理仅激活30亿参数,实现了接近小模型的计算效率,同时保留了大模型的容量优势。
这一模型聚焦于自主智能体的执行层,能够高效处理重复性工具调用、任务委派及结果检查等操作。开发者无需在每个步骤都调用大型推理模型,而是可以将常规任务交由Lightning处理,将复杂决策与规划留给更大规模的模型。这种分工模式显著提升了系统整体效率,尤其适用于需要频繁执行简单操作的场景。
Nemotron 3.5 Lightning支持本地部署,兼容NVIDIA DGX Spark、Jetson系统及GeForce RTX 5090显卡,同时也可在数据中心运行。这种灵活性使开发者能够将高吞吐量工作负载靠近数据源,进一步优化响应速度。NVIDIA强调,该模型在训练阶段已针对OpenClaw和Hermes Agent等主流智能体框架进行优化,可减少工具调用延迟并提升准确性。
作为开放模型,Nemotron 3.5 Lightning在OpenMDW-1.1许可证下公开了权重、训练数据及方法配方。开发者可通过NVIDIA NeMo工具进行微调,或实施强化学习与环境评估。实测数据显示,该模型输出速度达同规模模型的四倍,在PinchBench基准测试中准确率达86%,完成1万项任务的速度比Qwen3.6 35B快30%,且准确度相当。
为提升推理效率,NVIDIA引入了推测性解码技术,允许模型一次性生成多个候选token并快速验证。训练过程中,团队还纳入了多token预测机制,并额外提供DSpark和DFlash两个草案模型,以适应不同推理需求。配套发布的NeMo Switchyard模型路由库可自动将复杂请求导向大型推理模型,将常规任务分配至Lightning,从而减少持续运行智能体的算力消耗。
目前,该模型已获得Ollama、LM Studio、Amazon SageMaker JumpStart、Google Cloud、Microsoft Foundry及Oracle Cloud Infrastructure等平台的支持。开发者可通过Hugging Face、ModelScope、NVIDIA自有平台及OpenRouter获取模型资源。这一生态布局进一步扩大了Nemotron 3.5 Lightning的应用场景,为自主智能体的规模化部署提供了技术基础。