英伟达携手本地AI社区推动开源模型与智能体发展
4 小时前 1 阅读来源:blogs.nvidia.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
NVIDIA在8月掀起了一轮本地AI开源热潮,一口气发布了多款面向开发者与创作者的开源模型和工具,从世界模型、视频生成到编程智能体,几乎覆盖了当下最热门的AI应用方向。这轮密集更新背后,是NVIDIA试图将AI能力从云端下沉到个人电脑和工作站的明确意图,让开发者和企业不再依赖昂贵的云端算力,就能在本地跑起大模型和智能体应用。
此次发布的核心看点在于模型规格与本地部署能力的双重突破。NVIDIA自家推出的Cosmos 3 Edge是一个40亿参数的世界模型,专为机器人、自动驾驶和视觉AI设计,体积仅为Nano版本的四分之一,可以直接在NVIDIA DGX Spark和Jetson设备上运行。MiniMax-H3则是一个330亿参数的开源权重模型,能够根据文本、图像、视频或音频混合输入生成视频,并同步输出立体声音频,创作者可通过ComfyUI在本地调用。Poolside AI发布的Laguna S 2.1是一个1180亿参数的智能体编程模型,能够处理长达数小时的复杂任务,借助NVFP4量化技术,开发者可以在单个DGX Spark上本地运行,计算和内存需求大幅降低而不牺牲精度。DeepSeek也更新了V4-Flash版本,这是一个2840亿参数的MoE架构模型,激活参数仅130亿,支持100万token上下文窗口,社区已构建GGUF版本供开发者在DGX Station上本地运行。Thinking Machines Lab的Inkling-Small则是一个2760亿参数的多模态模型,支持文本、图像和音频的原生推理,每个token仅激活120亿参数,可在单个DGX Station或两个DGX Spark上运行。
除了模型本身,NVIDIA还在推动本地AI工具链的完善。Unsloth推出了名为Unsloth Desktop的桌面应用,将本地模型推理、图像和视频扩散、微调、智能体集成、网络研究和代码执行整合到一个完全开源的桌面应用中,号称是首个既能训练又能运行AI模型的桌面工具。阿里巴巴也发布了Wan-Animate-2,一个140亿参数的开源权重模型,能够将驱动视频中的动作和面部表情迁移到静态角色图像上,支持人物、卡通、机器人或动物,在NVIDIA RTX PRO 5000 Blackwell上生成速度比Apple M3 Ultra快16倍,在RTX 5090上快26倍。LTX则推出了LTX-2.5视频生成模型,支持多镜头序列生成和生成式编辑,在媒体娱乐、机器人和实时生成场景中提供了更高质量的视频输出和更强的提示词遵循能力。
对中国跨境电商卖家和AI从业者而言,这轮更新的实际意义在于降低了AI应用的门槛。过去,运行大模型往往需要租用云端GPU,成本高且数据安全难以保障。现在,借助NVIDIA的本地部署方案,卖家可以在自己的工作站上运行视频生成、图像编辑、智能客服等模型,既节省了云端费用,又保护了核心数据不外泄。特别是对于需要处理大量商品图片和视频的电商场景,MiniMax-H3和Wan-Animate-2这类模型可以直接在本地完成内容生成,大幅提升运营效率。而Unsloth Desktop这类工具的出现,则让没有深厚技术背景的团队也能上手微调和部署模型,进一步缩短了从想法到落地的路径。可以预见,随着本地AI生态的成熟,更多中小卖家将有能力自主掌控AI能力,而不必受制于云服务商的定价和政策。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
