华为官方宣布,昇腾 Atlas 800 A3 和 Atlas 900 A3 SuperPoD 超节点已完成对小红书最新开源大模型 dots3-note preview 的全量适配。这一进展的背景是小红书于 8 月 14 日正式发布了 dots3-note preview 开源大模型,该模型构建能力底座时拥有 280B 总参数量和 16B 激活参数量。
此次适配工作在技术层面进行了多项关键优化。首先,华为基于 vLLM Ascend 推理框架,完成了 dots3-note preview 的文本、图片、音频全模态能力的端到端适配。这表明昇腾平台能够支持该开源大模型的多模态处理需求。
在底层计算效率的提升方面,适配工作涉及了对分布式训练和推理流程的深度优化。具体技术细节包括通过数学等价变换将 AllReduce 操作拆解为 ReduceScatter+AllGather,从而彻底消除了多卡间重复的计算过程。此外,还启用了 MoE 层 dispatch_ffn_combine 融合算子,该算子的应用将原本包含“dispatch、gmm1、swiglu、gmm2、combine”等多个独立 Kernel 的通信步骤合并为一个单一的大算子。
从推理能力的角度看,适配工作还原生支持了 dots3-note preview 在 vLLM Ascend 中的 MTP 投机解码能力。这些技术层面的优化,旨在确保昇腾平台能够高效、稳定地运行具备大规模参数量和多模态能力的先进开源模型。
时间线方面来看,小红书于 8 月 14 日发布了 dots3-note preview 开源大模型,随后华为官方宣布其在 Atlas 800 A3 和 Atlas 900 A3 SuperPoD 超节点上的适配工作完成。这标志着昇腾平台生态系统对行业前沿开源模型的快速响应能力。
影响分析方面,此次全量适配的意义在于,它极大地拓宽了昇腾平台在处理具备复杂多模态和超大规模参数模型时的应用边界。对于需要部署类似 dots3-note preview 这样具有高计算需求的AI应用的机构而言,这提供了一个经过验证的、高效的硬件加速方案。
读者提示:理解此次适配的关键点在于“全量适配”和“端到端能力”。这意味着昇腾平台不仅支持模型本身(dots3-note preview),还优化了其运行所需的底层计算流程(如AllReduce拆解、MoE融合算子)以及推理模式(MTP投机解码)。
需要明确的是,所有关于华为官方宣布适配的细节均来源于公开资料,仅围绕该单一来源进行梳理和阐述,不涉及其他任何方对该模型的评估或后续计划。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。