企业站

2024 OCP峰会聚焦:阿里云磐久AI Infra 2.0与UALink共启AI新篇章

PConline 2024-10-28 15:50:19
企业频道厂商稿

10月15日-17日,一年一度的开放计算全球峰会(OCP Global Summit)在美国加州圣何塞(San Jose)召开,本次峰会以“从创新到影响力(From Ideas to Impact")”为主题盛大开幕,吸引全球7000多位基础设施软硬件技术和应用领域的专业人士参会。作为全球最具影响力的的基础设施和开放计算领域标志性盛会,特别是在今年OCP基金会重磅宣布其人工智能开放系统战略计划后,2024 OCP全球峰会上专门设置人工智能特别关注议程(Special Focus Tracks),重点推动AI基础设施领域的技术生态建设。

阿里云服务器研发资深总监文芳志受邀和UALink联盟主席Kurtis Bowman联合发表了题为《UALink: Pioneering the AI Accelerator Revolution》的演讲,重点阐述了AI服务器Scale UP互连技术领域的发展趋势,UALink标准的路线图,UALink联盟和ALink System产业生态未来的合作潜力,以及阿里云磐久 AI Infra 2.0服务器的落地实践思路。

行业领先的AI芯片、服务器和CSP厂商联合发起的UALink协议,将是一项彻底改变AI服务器Scale UP互连技术生态系统的行业新标准。相比较超级以太网联盟 (UEC) 的协议标准专注于Scale out扩展能力,UALink协议凭借高性能内存语义访问的原生支持、显存共享,支持Switch组网模式,以及超高带宽、超低时延能力等性能优势,正在迅速构建起一个AI服务器Scale UP互连技术的超级开放生态。按照计划,UALink联盟将于10月底正式成立并开始吸纳成员加入,并在将在年底对外发布第一版UALink spec。

UALink标准作为目前最具潜力的AI服务器Scale UP互连开放标准,如何在业界特别是在中国市场落地实践是一个巨大挑战,ALink System(ALS)产业生态应运而生。ALS提供具备性能竞争力和统一标准的互连系统,包括ALS-D数据面和ALS-M管控面两个主要组成部分,为AI训推场景提供丰富的能力和特性支持。

ALS-D将支持UALink国际标准,形成极具性能竞争力的数据面方案。当前以推理和训练场景为主的AI应用,在Scale Up网络上具有并行切分算法、大显存共享、GPU超多核内存语义编程等多种显著特点。ALS-D数据面互连采用UALink协议,除了原生支持高性能内存语义访问、显存共享,支持Switch组网模式,性能上具备超高带宽、超低时延能力外,还增加定义了在网计算等特性。

ALS-M可以为不同芯片方案提供标准化的接入方案,符合规范的设备均可灵活接入应用方系统。无论是对开放生态还是厂商专有互连协议,ALS使用统一的软件接口。同时,ALS-M为云计算等集群管理场景,提供单租、多租等灵活和弹性的配置能力。

正是遵循ALink System的规范,阿里云自主设计了面向下一代超大规模AI集群的磐久AI Infra 2.0服务器,贯穿了开放生态、高能效、高性能和、高可用的设计理念。AI Infra 2.0服务器开放性地定义了AI计算节点和Scale Up/Scale Out互连系统,可以在统一的硬件架构下支持业界主流AI方案,引领AI领域的“一云多芯”。

互连系统ALink System全面兼容国际标准UALink生态,可以与行业伙伴开放共建超高性能、超大规模的Scale UP集群互连能力,一级互连64-80个节点,二级互连可达2000以上节点,提供了PB级共享显存和TB级互连带宽。

AI计算节点内集成阿里自研CIPU 3.0芯片,既能支持高带宽大规模AI服务器实现Scale Out网络扩展,又能兼顾云网络弹性、安全的要求。

硬件工程方面,AI Infra 2.0服务器单机柜可以支持最大80个AI计算节点,业界密度最高;在业界率先采用400V PSU,单体供电效率可达98%,整体供电效率提高2%。在散热设计上,机柜级液冷方案可以根据实际负载动态调整CDU冷却能力来降低能耗,单柜冷却系统节能30%。最后,在运维管理上,全新的CableCartridge设计后维护设计,支持全盲插,零理线易运维、零误操作,维护效率提升50%。

可靠性方面,AI Infra 2.0服务器支持弹性节点、智能路由、高可靠供电、分布式CDU等技术,可以实时监控、探测各种硬件故障并自愈,硬件的故障域也缩减到节点级。

在ALink System产业生态建设上,阿里云一贯秉持开放合作的策略,推动互连技术领域的发展和繁荣。自今年9月ALink System产业生态在开放数据中心大会上正式发布以来,目前已经有20多家国内外AI芯片、互连芯片、服务器整机硬件和IP设计厂商加入,成员单位已就相关协议标准制定和实行路径选择展开交流。

除了积极拥抱UALink和牵头成立ALink System产业生态,阿里云还是OCP、CXL、UCIe和UEC等多个互连技术行业组织的创始成员或技术委员会成员,并用实际行动支持相关多种开放互连技术标准的制定和落地。

点击展开全文
打开APP,阅读体验更佳

网友评论

聚超值推荐

更多优惠

相关推荐

用户说丨东莞凤岗医院HIS升级记:云桌面保驾护航 企业频道 资讯
用户说丨东莞凤岗医院HIS升级记:云桌面保驾护航
促进算力与绿色电力融合发展,国家超算互联网闪耀2024算力网络发展大会 企业频道 资讯
促进算力与绿色电力融合发展,国家超算互联网闪耀2024算力网络发展大会
直面高密化供电、制冷,维谛技术破局AI数据中心挑战 企业频道 资讯
直面高密化供电、制冷,维谛技术破局AI数据中心挑战
提前剧透!2024深圳智慧养老展有这些助老“黑科技” 企业频道 资讯
提前剧透!2024深圳智慧养老展有这些助老“黑科技”
绿盟科技集团总部大楼正式启用:万里路虽遥,风好正扬帆 征程再起时,安全展新篇 企业频道 资讯
绿盟科技集团总部大楼正式启用:万里路虽遥,风好正扬帆 征程再起时,安全展新篇
鸿蒙生态蓬勃发展:超1万5应用和元服务上架,版本迭代日新月异 企业频道 资讯
鸿蒙生态蓬勃发展:超1万5应用和元服务上架,版本迭代日新月异
精彩抢先看丨10月24日HGDC.2024应用服务与商业合作分论坛将在京举行 企业频道 资讯
精彩抢先看丨10月24日HGDC.2024应用服务与商业合作分论坛将在京举行
华为擎云亮相第84届教装展,携手合作伙伴赋能教育全场景 企业频道 资讯
华为擎云亮相第84届教装展,携手合作伙伴赋能教育全场景
HUAWEI MatePad Pro 12.2英寸流金典藏版(SIM卡版)发布,带来专业户外创作体验 企业频道 资讯
HUAWEI MatePad Pro 12.2英寸流金典藏版(SIM卡版)发布,带来专业户外创作体验
原生鸿蒙应用市场升级焕新 全新体验开启沉浸探索 企业频道 资讯
原生鸿蒙应用市场升级焕新 全新体验开启沉浸探索
相关产品
取消