- HCCL(Huawei Collective Communication Library)是基于昇腾AI处理器的高性能集合通信库,提供单机多卡以及多机多卡间的集合通信能力,支持大模型的数据并行、模型并行、专家并行、pipeline并行、序列并行等多种加速方案。 HCCL(Huawei Collective Communication Library)是基于昇腾AI处理器的高性能集合通信库,提供单机多卡以及多机多卡间的集合通信能力,支持大模型的数据并行、模型并行、专家并行、pipeline并行、序列并行等多种加速方案。
- 扫码关注【昇腾CANN】视频号快速预约直播,填写问卷在线收集问题并解答!B站观看链接:https://live.bilibili.com/h5/23361884 昇腾社区观看链接:https://www.hiascend.com/developer/cann20241 问卷链接:https://www.hiascend.com/zh/forms/shendukaifang?from=S0 扫码关注【昇腾CANN】视频号快速预约直播,填写问卷在线收集问题并解答!B站观看链接:https://live.bilibili.com/h5/23361884 昇腾社区观看链接:https://www.hiascend.com/developer/cann20241 问卷链接:https://www.hiascend.com/zh/forms/shendukaifang?from=S0
- 本文以PaddleOCR的模型推理为例,介绍如何将PaddleOCR模型的推理迁移至ModelArts的昇腾环境上,并部署成AI应用和在线服务。 本文以PaddleOCR的模型推理为例,介绍如何将PaddleOCR模型的推理迁移至ModelArts的昇腾环境上,并部署成AI应用和在线服务。
- 昇腾算子开发和应用开发环境配置 昇腾算子开发和应用开发环境配置
- 在昇腾裸金属服务器中,启动容器挂载XPU卡,容器创建成功,但是执行Npu-smi报错显示8020. 在昇腾裸金属服务器中,启动容器挂载XPU卡,容器创建成功,但是执行Npu-smi报错显示8020.
- 华为CANN训练营昇腾训练执行与推理部署系列课程笔记一、课程介绍本次华为CANN训练营昇腾训练执行与推理部署系列课程旨在提供全面的指导和实践,让学员能够深入了解昇腾AI处理器的工作原理,并熟练掌握在CANN(Compute Architecture for Neural Networks)框架下进行深度学习模型的训练执行和推理部署。二、昇腾AI处理器与CANN概述昇腾AI处理器:华为自主研发... 华为CANN训练营昇腾训练执行与推理部署系列课程笔记一、课程介绍本次华为CANN训练营昇腾训练执行与推理部署系列课程旨在提供全面的指导和实践,让学员能够深入了解昇腾AI处理器的工作原理,并熟练掌握在CANN(Compute Architecture for Neural Networks)框架下进行深度学习模型的训练执行和推理部署。二、昇腾AI处理器与CANN概述昇腾AI处理器:华为自主研发...
- 【CANN训练营笔记】Atlas 200I DK A2体验手写数字识别模型训练&推理 【CANN训练营笔记】Atlas 200I DK A2体验手写数字识别模型训练&推理
- 海思Hi3516DV500部署paddle的版型分析模型记录,包含了python版本以及c++版本的部署,同时根据需要制作自己的数据集并重新训练达到理想效果 海思Hi3516DV500部署paddle的版型分析模型记录,包含了python版本以及c++版本的部署,同时根据需要制作自己的数据集并重新训练达到理想效果
- Ascend Snt9B服务器上HCCL_TEST profiling工具使用 Ascend Snt9B服务器上HCCL_TEST profiling工具使用
- 本文旨指导在华为云Ascend Snt9B裸金属服务器上进行 RoCE网卡带宽测试 本文旨指导在华为云Ascend Snt9B裸金属服务器上进行 RoCE网卡带宽测试
- 昇腾为使用PyTorch框架的开发者提供昇腾昇腾AI处理器的超强算力,需要安装PyTorch Adapter插件用于适配PyTorch,本文提供了解决方案指导用户安装Pytorch框架和Pytorch Adapter插件。 昇腾为使用PyTorch框架的开发者提供昇腾昇腾AI处理器的超强算力,需要安装PyTorch Adapter插件用于适配PyTorch,本文提供了解决方案指导用户安装Pytorch框架和Pytorch Adapter插件。
- 华为云NPU驱动固件包商用版本周期性的发布。 本文给出驱动固件新版本的升级方案。 华为云NPU驱动固件包商用版本周期性的发布。 本文给出驱动固件新版本的升级方案。
- 1. 问题描述使用华为云Snt9B裸金属服务器,通过nohup命令基于pytorch框架进行大模型训练时,训练中途偶现如下报错导致训练中断:{'loss': 0.0759, 'learning_rate': 0.0005298913043478261, 'epoch': 3.15} 79%|███████▉ | 4640/5888 [2:28:56<5:39:33, 16.32s/it] ... 1. 问题描述使用华为云Snt9B裸金属服务器,通过nohup命令基于pytorch框架进行大模型训练时,训练中途偶现如下报错导致训练中断:{'loss': 0.0759, 'learning_rate': 0.0005298913043478261, 'epoch': 3.15} 79%|███████▉ | 4640/5888 [2:28:56<5:39:33, 16.32s/it] ...
- 1. 问题描述使用华为云昇腾Snt9B裸金属服务器,基于pytorch框架进行大模型训练时,需要迭代训练100轮,在第21轮训练时中途报错:RuntimeError: [enforce fail at inline_container.cc:471] . PytorchStreamWriter failed writing file data: file write failed具体报错信息... 1. 问题描述使用华为云昇腾Snt9B裸金属服务器,基于pytorch框架进行大模型训练时,需要迭代训练100轮,在第21轮训练时中途报错:RuntimeError: [enforce fail at inline_container.cc:471] . PytorchStreamWriter failed writing file data: file write failed具体报错信息...
- 1. 背景介绍在使用华为云裸金属服务器Ascend Snt9B机器进行多机训练/推理作业时,往往需要将多机的环境配置的完全一致。如果逐台登录主机,逐台使用环境配置脚本来配置,虽然可以完成任务,但是效率低下。为提高效率,可以在单节点通过脚本实现多台主机批量执行命令,具体步骤如下所示。2. 多机批量执行方案2.1 选择信任节点并生成密钥可以将多机中的一台作为信任节点,通过如下命令生成ssh的rs... 1. 背景介绍在使用华为云裸金属服务器Ascend Snt9B机器进行多机训练/推理作业时,往往需要将多机的环境配置的完全一致。如果逐台登录主机,逐台使用环境配置脚本来配置,虽然可以完成任务,但是效率低下。为提高效率,可以在单节点通过脚本实现多台主机批量执行命令,具体步骤如下所示。2. 多机批量执行方案2.1 选择信任节点并生成密钥可以将多机中的一台作为信任节点,通过如下命令生成ssh的rs...
上滑加载中
推荐直播
-
昇腾AI算法挑战赛-核心算子如何优化?专家带你深度解析2025/11/17 周一 16:00-17:00
王老师 华为算子专家
昇腾AI算法挑战赛进阶赛战鼓催征!本期直播间,我们特邀华为算子专家王老师,为你深度剖析Matmul、wholereducesum等核心算子的底层原理与优化技巧,直击赛题核心。想提升代码效率、冲击更高排名?锁定直播,带你破局!
回顾中 -
AI编码实干派,“码”力全开2026/02/26 周四 15:00-16:30
谈宗玮/于邦旭/丁俊卿/陈云亮/王一男
【中国,深圳,2026年2月26日】,以“AI编码实干派,码力全开”为主题的华为云码道(CodeArts)代码智能体新春发布会在线上成功召开。华为云码道公测版正式发布,为开发者和企业提供具备工程化能力的智能编码解决方案。
回顾中 -
华为云码道-玩转OpenClaw,在线养虾2026/03/11 周三 19:00-21:00
刘昱,华为云高级工程师/谈心,华为云技术专家/李海仑,上海圭卓智能科技有限公司CEO
OpenClaw 火爆开发者圈,华为云码道最新推出 Skill ——开发者只需输入一句口令,即可部署一个功能完整的「小龙虾」智能体。直播带你玩转华为云码道,玩转OpenClaw
回顾中
热门标签