浪潮信息发布元脑SD200 Ultra超节点:单机承载2.8万亿参数Kimi K3

AI 驱动中国 周野 338次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

浪潮信息在2026人工智能计算大会上推出元脑SD200 Ultra超节点AI服务器,该设备基于国产AI芯片打造,单机可承载运行2.8万亿参数的Kimi K3大模型。其Token生成时延降至5.85毫秒以内,达到业界平均水平的5倍,并支持10万亿参数规模模型单机运行。

驱动中国9月22日消息,浪潮信息在2026人工智能计算大会(AICC2026)上正式推出元脑SD200 Ultra超节点AI服务器及元脑HC2000多元算力机组。其中,元脑SD200 Ultra基于国产AI芯片构建,官方数据显示其单机具备承载运行2.8万亿参数Kimi K3大模型的能力。

在性能指标方面,浪潮信息表示SD200 Ultra将Token生成时延首次控制在5.85毫秒以内,相当于单用户每秒处理170个Token,这一速度达到业界平均水平的5倍。该机型同时支持10万亿参数规模的前沿模型在单机环境下运行。Token生成时延作为衡量大模型推理响应速度的核心指标,指模型每输出一个词元所需的平均时间。

架构层面,SD200 Ultra采用3D Hyper Mesh架构,紧耦合128颗本土AI芯片,提供8TB统一编址显存和64TB内存。系统通过原生内存语义通信,将通信时延降低至0.69微秒。借助全局统一编址、虚拟影子设备映射、跨域地址翻译与路由技术,该超节点实现了GPU跨主机域的统一寻址访问,构建了百纳秒级低时延内存语义互连域。

浪潮信息指出,通过应用对称内存技术,SD200 Ultra在基于本土AI芯片的超节点上首次实现GPU显存直连,允许GPU直接访问远端GPU显存,使AllReduce通信时间降低3.5倍。针对Kimi K3推理场景,SD200 Ultra构建了超级算子智能体,实现通算融合与Tile级流水,将KDA、Gated MLA、MoE中的基础算子进行融合,致使算子数量减少10倍,推理性能提升3倍以上。

同日发布的元脑HC2000多元算力机组采用DirectCom 2.0极速架构,基于高密液冷AI整机柜,搭配MCIS推理软件栈,能够动态匹配计算负载。官方称在同等投资条件下,该机组可使Token产能提升10倍。

浪潮信息将Agent时代的AI计算划分为两个方向:支撑突破智能上限的Capability AI Compute(能力型智算),以及实现智能充分供给的Capacity AI Compute(容量型智算)。公司分析认为,前沿模型参数规模已从DeepSeek R1的6710亿增长至Kimi K3的2.8万亿,并趋向10万亿级;上下文长度从128K扩展至1M以上;Agent形态从单体走向成百上千个协同。

随着模型权重、KV Cache(键值缓存)和并发任务规模的同步增长,对显存容量、高速互连及并行扩展效率提出了更高要求。复杂Agent任务包含大量“推理—工具调用—反馈—重新规划”循环,每轮时延的累积可能影响任务能否及时完成。此外,复杂Agent任务需连续运行数小时甚至数天,期间经历大量模型调用、工具调用和数据交互,任何计算、通信或软件故障均可能导致任务中断。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 5 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友