8月12日,据英伟达最新发布消息,NVIDIA正式开源全新模型Nemotron 3.5 Lightning。该模型专为AI智能体的执行层打造,适用于长时间、高频率任务场景,在显著降低推理成本与延迟的同时,保障响应效率与稳定性。
该模型基于300亿参数的混合专家(MoE)结构,实际激活参数量仅为30亿。借助动态专家路由机制,每次前向推理仅启用部分子网络,从而兼顾大模型性能优势与小模型的轻量化计算开销。模型集成推测解码、权重量化等先进优化技术,并在OpenClaw、Hermes Agent等主流智能体框架上完成针对性训练,在维持高准确率的前提下,推理吞吐量达到同级别模型的4倍水平。
与此同时,NVIDIA同步发布NeMo Switchyard开源库,支持根据任务类型、复杂度及硬件资源状况,自动调度并分发至最优适配模型,实现规划类任务与执行类任务的高效解耦与协同运作。模型全面支持本地化部署,兼容DGX Spark、Jetson系列边缘设备以及GeForce RTX 5090等消费级GPU,并无缝接入Ollama、llama.cpp等主流推理生态工具链。
目前,模型权重、训练数据集及完整训练配置均已依据OpenMDW-1.1开源协议公开,开发者可通过Hugging Face、ModelScope等平台直接下载使用。