1、演讲嘉宾:King.Cui,GMI CLOUD亚太区总裁1AI 出海趋势与“提效”挑战23GMI Cloud 高稳定性 GPU 集群架构解析与故障预防策略4AI Infra 选型思考快速认识一下 GMI Cloud5AI 应用开发最佳实践快速认识一下 GMI Cloud1第一章节GMI Cloud:关注 AI 出海,打造 AI 时代的新基建台湾唯一 NVIDIA 认证的 云服务提供商(NCP/NPN)亚太区 GPU优先分配权AI 工程师为开发者铸就的 独立 AI原生云平台愿景以 AI-TSMC 之姿,引领智算革命使命铸就全球领先的 AI CLOUDGMI Cloud:使命和愿景GMI Clou
2、d:战略布局,服务全球加利福尼亚州 IDCx1 科罗拉多州 IDCx1德克萨斯州 IDCx1阿肯色州 IDCx2美国台湾 台北 IDCx2泰国 曼谷 IDCx1马来西亚 吉隆坡 IDCx1AI 出海趋势与“提效”挑战2第二章节我们正处于“1999 年的互联网”时代技术普及率2000199519902020200520102025201525%50%75%100%InternetSmartphonesAIGPT4/ChatGPT 影响的用户也还非常有限,远远未到“技术普惠点”(mobile internet)0204060801001201402024/12024/22024/32024/420
3、24/52024/62024/72024/82024/92024/102024/112024/12MAU百万中国 AI 应用 MAU 增长趋势图源:中国证券报产品9月 AI 应用 MAUMAU 增长值ChatGPT225.39M12.74%Talkie-AI(MiniMax)18.12M7.54%Cici(字节)12.19M7.56%QuestionAI(作业帮)10.23M7.27%Gauth(字节)9.61M112.73%Linky(昆仑万维)3.16M6.43%Fotor1.02M4.06%中国 AI 出海加速,提效需求=算力需求截止至 2024 年 8 月,全球 AI WEB 产品总数
4、共 1717 个,其中中国 AI WEB 产品数量 280 个,出海 AI WEB 产品数量 95 个,较今年 1 月有明显增长,中国 AI 企业在海外市场的布局正在加速。“出海”趋势的背后是中国产品全球竞争力提升。所有 AI 应用的出海,只要涉及模型的训练和推理,“算力”都是最核心的生产资料。AI 出海过程中,以算力为中心的生产矛盾逐渐增多AI Infra 稳定性下降花费更多时间、经济的沉默成本国内算力资源不足,导致业务进展缓慢AI Infra 的建设经验不足,软件和硬件基础设施构建需消耗大量时间及经济成本供应商(机房、能源、设备等)可靠性、稳定性难保障,选型困难带宽延迟远大于推理带来的延迟
5、,网络问题占用过多研发精力、更高带宽成本合规性问题造成常见问题148 次,即 30.1 的意外中断来自各种 GPU 失效(包括 NVLink 总线)72 次,即 17.2 来自 HBM3 内存失效(700W 功耗过热)19 次,来自 GPU SRAM17 次来自 GPU 处理器6 次来自 GPU 静默数据错误6 次来自 GPU 散热和传感器其他错误来自软件 bug、网线和网卡等方面GPU 集群在大规模 AI 训练中的稳定性至关重要Meta 披露的报告显示,为期 54 天的预训练阶段中,总共出现了466 次工作中断,其中 47 次是计划内的自动维护,419 次是意外的,且大部分都来自硬件问题,G
6、PU 又是最多的,占了其中的 58.7。维持 AI Infra 层的稳定性并不是一件简单的事情!CPU 错误只出现了 2 次我们需要在组网、硬件、软件、工程化等方面做大量工作,以减少 GPU 的掉卡率,保持任务的连续性,最大化 GPU 的使用效率!GPU 集群在大规模 AI 训练中的稳定性至关重要GPU 集群稳定性模型训练推理效率时间成本经济成本GMI Cloud 高稳定性 GPU 集群架构解析与故障预防策略3第三章节PART ONE集群引擎产品竞争优势-全栈 AI 应用平台从 GPU 到应用,驱动智能化转型平台即服务基础大模型行业大模型智能金融智能制造智能客服自动驾驶内容生成与创作更多应用安