Day-0极速适配!摩尔线程MTT S5000跑通智谱GLM-5.3-Flash:10万国产卡承载62T Token调用
最新8月27日消息,8月26日晚,智谱正式上线并开源GLM-5.3-Flash(320B-A18B)原生多模态模型。摩尔线程在模型发布当天便完成Day-0极速适配,基于AI训推一体智算卡MTT S5000及MUSA软件栈实现高效运行。
GLM-5.3-Flash总参数量320B(3200亿),激活参数仅18B(180亿),层数较GLM-4.5减半。模型在全球权威的Artificial Analysis Intelligence Index中取得57分;在智谱自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。

正式发布前,该模型以匿名代号Ox-Alpha(中文社区昵称“牛来”)在OpenRouter、OpenCode两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token调用量高达62T。
如此高的Token调用量,出自超过10万张国产芯片的集体承载,其算力供应商包括华为、海光、摩尔线程。这是国产算力芯片首次大规模集体出海支持海外最火模型。
针对GLM-5.3-Flash混合架构中线性注意力采用的KDA机制,摩尔线程基于MATE算子优化引擎,快速完成了状态矩阵更新、分块并行扫描等全新算子形态的定制实现与深度调优。

KDA机制将传统注意力中随推理长度线性增长的KV Cache转化为固定规模状态矩阵的增量更新,显存占用不再随序列变长而膨胀。该架构特性与MTT S5000的高算力密度形成深度协同,为超长上下文推理提供高效支撑。
本次极速适配充分验证了MTT S5000智算卡的高算力密度与稳定性。MTT S5000单卡FP8算力达1000 TFLOPS,配备80GB显存,显存带宽1.6TB/s,卡间互联带宽784GB/s。
目前智谱GLM-5.3-Flash已开源,开发者可访问Hugging Face获取模型权重,摩尔线程也提供了配套的SGLang推理镜像供开发者开箱体验。

《Day-0极速适配!摩尔线程MTT S5000跑通智谱GLM-5.3-Flash:10万国产卡承载62T Token调用》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
内存造假新套路!DDR4颗粒伪装DDR5:触点对不上靠散热片掩护
快科技8月27日消息,近日一名X平台用户发帖分享,他在二手市场购入的金士顿FURY系列内存出现严重造假情况,造假者竟将DDR4颗粒重新打标后焊接在DDR5 PCB上。根据买家公开的图片显示,他购买的... -
英伟达CFO:存储采购成本大涨 供应是限制产能主要瓶颈
快科技8月27日消息,英伟达今日公布2027财年第二季度财报,营收达962.2亿美元,超出市场预期的921.7亿美元,环比增长18%,同比飙升106%。在财报电话会议上,公司首席财务官(CFO)给出强劲展望... -
H200流入中国 英伟达坦言相关营收占比不足1%
快科技8月27日消息,英伟达发布2027财年第二季度财报。数据显示,公司营收达962.21亿美元,同比增长106%;净利润596.88亿美元,同比增长126%;调整后每股收益为2.22美元,同比增长120%。其中,... -
黄仁勋赚麻了!亚马逊狂买300万颗英伟达GPU芯片:超6500亿元
快科技8月27日消息,当地时间8月26日,就在英伟达交出962亿美元创纪录季报的同一时间,亚马逊云服务(AWS)与英伟达宣布大幅扩展战略合作。双方计划于2027年至2028年间,在AWS全球基础设施中额... -
一招让老显卡重回巅峰!RTX 2080 Ti换硅脂后帧率翻倍 降温10℃
快科技8月27日消息,近日Reddit用户发帖分享了自己对老旧显卡进行物理维护的实测案例,只需要简单的清灰换脂操作,就能让RTX 2080 Ti的帧率表现直接翻倍。据了解,该用户手中的技嘉RTX 2080 T...












