- 问题描述: 我在modelarts运行mindspore平台附件的主运行程序gpt2_dataset_errtest_model.py内 开头增加: context.set_context(mode=context.GRAPH_MODE, device_target="Ascend") context.set_context(device_id=device_id) 然后程序就会出错提示device0 被占用,这个问题如何解决,代码见我的附件 注释掉context.set_context(device_id=device_id)或者 注释掉 context.set_context(mode=context.GRAPH_MODE, device_target="Ascend") 任一句程序都是可以通过的,这个问题太奇怪了,对用户使用来说完全摸不着头脑,调试了N天才发现这个错误位置 后有网友指出是手动指定device_id就会报错,但官方的文档和例子都没有在这块好好说明一下,而这两句是很基本和重要的系统配置语句 那为什么看了官方的几个example:sample_for_cloud,transformer和bert都是完全一样或者类似手动指定device_id的呢,我也是按着例子学的 对我很重要的问题,就是因为这个我的gpt2模型一直无法通过运行,而且靠猜测调试了很久,才定位到这句话出问题,但定位到了,也不知错误原因,模型简化后附上附件 打印错误提示如下: xmask=[[1 0 1 0] [1 0 1 0] [1 0 1 0] [1 0 1 0]] ds.get_dataset_size=16 ds.output_shapes=[[4, 4], [4, 4]] [ERROR] UTILS(163,python):2020-08-15-06:31:42.435.319 [mindspore/ccsrc/utils/context/ms_context.cc:216] OpenTsd] Device 0 is occupied, open tsd failed, status = 16986314. Traceback (most recent call last): File "/home/work/user-job-dir/data_err_model/gpt2_dataset_errtest_model.py", line 117, in <module> netwithloss = GPT2NetworkWithLoss(None, True) File "/home/work/user-job-dir/data_err_model/gpt2_dataset_errtest_model.py", line 60, in __init__ super(GPT2NetworkWithLoss, self).__init__(auto_prefix=False) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/nn/cell.py", line 71, in __init__ init_backend() RuntimeError: mindspore/ccsrc/utils/context/ms_context.cc:216 OpenTsd] Device 0 is occupied, open tsd failed, status = 16986314. [Modelarts Service Log]Training end with return code: 1 [Modelarts Service Log]2020-08-15 06:31:43,745 - ERROR - FMK of device7 (pid: [163]) has exited with non-zero code: 1 [Modelarts Service Log]2020-08-15 06:31:43,745 - INFO - Begin destroy FMK processes [Modelarts Service Log]2020-08-15 06:31:43,745 - INFO - FMK of device7 (pid: [163]) has exited 建议方案: context.set_context(device_id=device_id) 这句话的意义是什么,什么情况下要加,或者不加,例子基本都有加这一项配置,为什么会导致系统崩溃 麻烦能在帮助文档上好好说说系统配置的问题,特别是这种几乎各个模型都要的项目配置 问题描述: 我在modelarts运行mindspore平台附件的主运行程序gpt2_dataset_errtest_model.py内 开头增加: context.set_context(mode=context.GRAPH_MODE, device_target="Ascend") context.set_context(device_id=device_id) 然后程序就会出错提示device0 被占用,这个问题如何解决,代码见我的附件 注释掉context.set_context(device_id=device_id)或者 注释掉 context.set_context(mode=context.GRAPH_MODE, device_target="Ascend") 任一句程序都是可以通过的,这个问题太奇怪了,对用户使用来说完全摸不着头脑,调试了N天才发现这个错误位置 后有网友指出是手动指定device_id就会报错,但官方的文档和例子都没有在这块好好说明一下,而这两句是很基本和重要的系统配置语句 那为什么看了官方的几个example:sample_for_cloud,transformer和bert都是完全一样或者类似手动指定device_id的呢,我也是按着例子学的 对我很重要的问题,就是因为这个我的gpt2模型一直无法通过运行,而且靠猜测调试了很久,才定位到这句话出问题,但定位到了,也不知错误原因,模型简化后附上附件 打印错误提示如下: xmask=[[1 0 1 0] [1 0 1 0] [1 0 1 0] [1 0 1 0]] ds.get_dataset_size=16 ds.output_shapes=[[4, 4], [4, 4]] [ERROR] UTILS(163,python):2020-08-15-06:31:42.435.319 [mindspore/ccsrc/utils/context/ms_context.cc:216] OpenTsd] Device 0 is occupied, open tsd failed, status = 16986314. Traceback (most recent call last): File "/home/work/user-job-dir/data_err_model/gpt2_dataset_errtest_model.py", line 117, in <module> netwithloss = GPT2NetworkWithLoss(None, True) File "/home/work/user-job-dir/data_err_model/gpt2_dataset_errtest_model.py", line 60, in __init__ super(GPT2NetworkWithLoss, self).__init__(auto_prefix=False) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/nn/cell.py", line 71, in __init__ init_backend() RuntimeError: mindspore/ccsrc/utils/context/ms_context.cc:216 OpenTsd] Device 0 is occupied, open tsd failed, status = 16986314. [Modelarts Service Log]Training end with return code: 1 [Modelarts Service Log]2020-08-15 06:31:43,745 - ERROR - FMK of device7 (pid: [163]) has exited with non-zero code: 1 [Modelarts Service Log]2020-08-15 06:31:43,745 - INFO - Begin destroy FMK processes [Modelarts Service Log]2020-08-15 06:31:43,745 - INFO - FMK of device7 (pid: [163]) has exited 建议方案: context.set_context(device_id=device_id) 这句话的意义是什么,什么情况下要加,或者不加,例子基本都有加这一项配置,为什么会导致系统崩溃 麻烦能在帮助文档上好好说说系统配置的问题,特别是这种几乎各个模型都要的项目配置
-
【功能建议】modelarts部署的日志 预审不通过问题描述: 日志刷新出来太慢太慢,,,,,,,这个改起来应该很简单吧 建议方案: 问题描述: 日志刷新出来太慢太慢,,,,,,,这个改起来应该很简单吧 建议方案:
-
【产品缺陷】modelart的使用文档 预审不通过问题描述: modelart的使用文档极其难读。 建议方案:新版的modelart需要更新旧版的文档。 问题描述: modelart的使用文档极其难读。 建议方案:新版的modelart需要更新旧版的文档。
- 问题描述: 在ModelArts切换到新版,然后下面如图显示错乱,页面并没有进行过缩放,屏幕分辨率为1366*768,浏览器为chrome [图片] [图片] 建议方案:调整页面 问题描述: 在ModelArts切换到新版,然后下面如图显示错乱,页面并没有进行过缩放,屏幕分辨率为1366*768,浏览器为chrome [图片] [图片] 建议方案:调整页面
- 问题描述: ModelArts新旧版切换按钮时而显示,时而不显示,大部分时间是不显示的,如图 [图片][图片] 建议方案:修复bug 问题描述: ModelArts新旧版切换按钮时而显示,时而不显示,大部分时间是不显示的,如图 [图片][图片] 建议方案:修复bug
- 问题描述: ModelArts 统一集成OBS操作、减少用户对OBS感知和界面切换。 建议方案: 数据集等相关页面建议集成OBS创建桶和数据上传的操作,一方面简化用户反复切换服务界面操作、另一方面通过平台屏蔽存储概念简化使用 问题描述: ModelArts 统一集成OBS操作、减少用户对OBS感知和界面切换。 建议方案: 数据集等相关页面建议集成OBS创建桶和数据上传的操作,一方面简化用户反复切换服务界面操作、另一方面通过平台屏蔽存储概念简化使用
- 问题描述: 1、模型导入时间过久建议优化。 1M多文件,导入、构建到正常花了18分钟, [图片] 建议方案: 建议优化,同时对于时间过久建议提供进度查询 问题描述: 1、模型导入时间过久建议优化。 1M多文件,导入、构建到正常花了18分钟, [图片] 建议方案: 建议优化,同时对于时间过久建议提供进度查询
- 问题描述: 在使用ModelArts的AI市场的YOLOv3_Resnet18算法(Ascend 910训练版本,最新发布的第11版本)存在Bug,当我使用我发布的数据集训练时,总是在执行一定时间(1小时以内)无故报错,导致运行失败,但是同等条件下,只是换为了第10版算法就能成功运行了。 而我的同学同样使用该算法的第11版本,同等条件下,只是只用了我的部分数据集就能够正常训练,没用问题,并能得到.pb模型,也能部署到Ascend 310上。 这就很奇怪,是因为我的数据集太大了(不到11000张图片,我同学使用的是从我的不到11000张图片中选出的不到9000张图片),所以失败了? 但是这个数据集,使用第10版算法是可以的,目前已正常运行了3个多小时。 建议方案: 个人认为ModelArts的AI市场的YOLOv3_Resnet18算法(Ascend 910训练版本,最新发布的第11版本)存在Bug,当数据集在11000张图片及以上时,无故训练报错,希望能优化改进一下。 问题描述: 在使用ModelArts的AI市场的YOLOv3_Resnet18算法(Ascend 910训练版本,最新发布的第11版本)存在Bug,当我使用我发布的数据集训练时,总是在执行一定时间(1小时以内)无故报错,导致运行失败,但是同等条件下,只是换为了第10版算法就能成功运行了。 而我的同学同样使用该算法的第11版本,同等条件下,只是只用了我的部分数据集就能够正常训练,没用问题,并能得到.pb模型,也能部署到Ascend 310上。 这就很奇怪,是因为我的数据集太大了(不到11000张图片,我同学使用的是从我的不到11000张图片中选出的不到9000张图片),所以失败了? 但是这个数据集,使用第10版算法是可以的,目前已正常运行了3个多小时。 建议方案: 个人认为ModelArts的AI市场的YOLOv3_Resnet18算法(Ascend 910训练版本,最新发布的第11版本)存在Bug,当数据集在11000张图片及以上时,无故训练报错,希望能优化改进一下。
-
【产品缺陷】ModelArts界面问题 预审不通过问题描述: [图片] 昨天还正常,但今天通过公测申请后,进来这个界面 建议方案: 问题描述: [图片] 昨天还正常,但今天通过公测申请后,进来这个界面 建议方案:
- 问题描述: 在ModelArts的数据集管理中,可以自行创建数据集,同时可以选择上传图片,直接加数据到数据集中,也可以先上传到桶中,直接从OBS桶下载,但是无法在标注界面或数据集界面下载特定图片,这就不太好: 比如我想下载某张或某些标签的图片做处理,这无法在数据集界面做到,如图所示,而如果从OBS桶下载,无法对想要的图片进行选择。 不太方便。 [图片] 建议方案: 在数据集界面增加下载图片或下载某类标签图片的选项。 问题描述: 在ModelArts的数据集管理中,可以自行创建数据集,同时可以选择上传图片,直接加数据到数据集中,也可以先上传到桶中,直接从OBS桶下载,但是无法在标注界面或数据集界面下载特定图片,这就不太好: 比如我想下载某张或某些标签的图片做处理,这无法在数据集界面做到,如图所示,而如果从OBS桶下载,无法对想要的图片进行选择。 不太方便。 [图片] 建议方案: 在数据集界面增加下载图片或下载某类标签图片的选项。
-
【用户体验】ModelArts 未采纳问题描述: 做学习作业时候,开发环境需要收费28元/小时,希望在使用开发环境的时候,旁边有个实时的消费金额【使用时间*28¥/h】。 [图片] 建议方案: 免费的开发环境需要72个小时后自动回收资源,最好在创建时间旁边的加个“回收时间”的提示! 问题描述: 做学习作业时候,开发环境需要收费28元/小时,希望在使用开发环境的时候,旁边有个实时的消费金额【使用时间*28¥/h】。 [图片] 建议方案: 免费的开发环境需要72个小时后自动回收资源,最好在创建时间旁边的加个“回收时间”的提示!
- 问题描述: 使用ModelArts的AI市场的yolo3_resnet18(Ascend 910训练版本)训练作业,训练完成,显示运行成功,并可以部署在Ascend 310上执行推理,但是日志会在最后部分多次显示 FileNotFoundError: [Errno 2] No such file or directory 如图: [图片] 我觉得这个ERROR应该是不对的,因为训练完成了,而且可以部署到设备上,这样可能让看日志了解训练情况的同学误解。 建议方案: 优化日志显示,建议将这些无关报错删除,日志更多呈现有用的内容。 问题描述: 使用ModelArts的AI市场的yolo3_resnet18(Ascend 910训练版本)训练作业,训练完成,显示运行成功,并可以部署在Ascend 310上执行推理,但是日志会在最后部分多次显示 FileNotFoundError: [Errno 2] No such file or directory 如图: [图片] 我觉得这个ERROR应该是不对的,因为训练完成了,而且可以部署到设备上,这样可能让看日志了解训练情况的同学误解。 建议方案: 优化日志显示,建议将这些无关报错删除,日志更多呈现有用的内容。
- 问题描述: 1. ModelArts降低了AI模型开发难度,成功实现无代码开发AI模型,使得AI模型开发得到普及。 2.本人相对于同行业几家大平台比较,发现ModelArts在线部署API接口调用文档阅读门槛高,不适于基础薄弱的开发人员阅读。 建议方案: 1.可以增加文档内容,增加实例代码(下文附有图片)。降低阅读与使用门槛。亦符合ModelArts对于开发人员全覆盖的理念。 [图片] [图片] [图片] 问题描述: 1. ModelArts降低了AI模型开发难度,成功实现无代码开发AI模型,使得AI模型开发得到普及。 2.本人相对于同行业几家大平台比较,发现ModelArts在线部署API接口调用文档阅读门槛高,不适于基础薄弱的开发人员阅读。 建议方案: 1.可以增加文档内容,增加实例代码(下文附有图片)。降低阅读与使用门槛。亦符合ModelArts对于开发人员全覆盖的理念。 [图片] [图片] [图片]
- 问题描述: 我生成mindrecord文件,按这样shema: data_schema = { "target_sos_ids": {"type": "int32", "shape": [-1]}, "target_sos_mask": {"type": "int32", "shape": [-1]}, } 期望读出来的格式(batch_size=4, 共写入文件64samples): xids=[[50256 52 13 50] [50256 26932 3524 290] [50256 464 9317 6241] [50256 2396 11 7062]] xmask=[[1 1 1 1] [1 1 1 1] [1 1 1 1] [1 1 1 1]] ds.get_dataset_size=16 ds.output_shapes=[[4, 4],[4, 4]] 实际云上读出来的格式: xids=[[50256 0 52 0 13 0 50 0] [50256 0 26932 0 3524 0 290 0] [50256 0 464 0 9317 0 6241 0] [50256 0 2396 0 11 0 7062 0]] xmask=[[1 0 1 0 1 0 1 0] [1 0 1 0 1 0 1 0] [1 0 1 0 1 0 1 0] [1 0 1 0 1 0 1 0]] ds.get_dataset_size=16 ds.output_shapes=[[4, 8],[4, 8]] 猜测是否生成文件是int32,读取的时候没做 cast int32 测试发现不是没有cast int32的原因,cast后结果还是一样,每个数后面都插入了0,这就又很疑惑了,到底什么原因导致 最后生成文件的时候定义格式改为{"type": "int64", "shape": [4]}, 原来是{"type": "int32", "shape": [-1]} 读取的时候再转为int32,终于ok了,问题解决 另外: 举个例子,我的text样本文件是13M大小,5000个样本,按int32生成mindrecord是49M,按int64生成是100M,另外如果我只选择生成64个样本,出来的文件还是100M,没变,这就非常奇怪了。而对应生成64个样本的TFrecord大小是45k 建议方案: 生成文件数据类型选择可以选int32,或者int16,这样空间占用就小很多,目前int类型只能选int64,否则会出错 生成文件大小按实际生成样本数量增长,不能按全部样本来定义 问题描述: 我生成mindrecord文件,按这样shema: data_schema = { "target_sos_ids": {"type": "int32", "shape": [-1]}, "target_sos_mask": {"type": "int32", "shape": [-1]}, } 期望读出来的格式(batch_size=4, 共写入文件64samples): xids=[[50256 52 13 50] [50256 26932 3524 290] [50256 464 9317 6241] [50256 2396 11 7062]] xmask=[[1 1 1 1] [1 1 1 1] [1 1 1 1] [1 1 1 1]] ds.get_dataset_size=16 ds.output_shapes=[[4, 4],[4, 4]] 实际云上读出来的格式: xids=[[50256 0 52 0 13 0 50 0] [50256 0 26932 0 3524 0 290 0] [50256 0 464 0 9317 0 6241 0] [50256 0 2396 0 11 0 7062 0]] xmask=[[1 0 1 0 1 0 1 0] [1 0 1 0 1 0 1 0] [1 0 1 0 1 0 1 0] [1 0 1 0 1 0 1 0]] ds.get_dataset_size=16 ds.output_shapes=[[4, 8],[4, 8]] 猜测是否生成文件是int32,读取的时候没做 cast int32 测试发现不是没有cast int32的原因,cast后结果还是一样,每个数后面都插入了0,这就又很疑惑了,到底什么原因导致 最后生成文件的时候定义格式改为{"type": "int64", "shape": [4]}, 原来是{"type": "int32", "shape": [-1]} 读取的时候再转为int32,终于ok了,问题解决 另外: 举个例子,我的text样本文件是13M大小,5000个样本,按int32生成mindrecord是49M,按int64生成是100M,另外如果我只选择生成64个样本,出来的文件还是100M,没变,这就非常奇怪了。而对应生成64个样本的TFrecord大小是45k 建议方案: 生成文件数据类型选择可以选int32,或者int16,这样空间占用就小很多,目前int类型只能选int64,否则会出错 生成文件大小按实际生成样本数量增长,不能按全部样本来定义
- 问题描述: 我在本地生成了mindrecord文件,供云上运行模型生成dataset用,结果错误提示如下 shard_reader.cc:124] Init] DB file can not match file [ERROR] MD(162,python):2020-08-11-04:00:39.655.725 [mindspore/ccsrc/mindrecord/io/shard_reader.cc:124] Init] DB file can not match file /cache/gpt2cx_data/webtext-valid.mr Traceback (most recent call last): File "/home/work/user-job-dir/datatest/gpt2_dataset.py", line 222, in <module> for x in ds.create_dict_iterator(): File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/datasets.py", line 1076, in create_dict_iterator return DictIterator(self) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/iterators.py", line 82, in __init__ root = self.__convert_node_postorder(self.dataset) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/iterators.py", line 178, in __convert_node_postorder c_child = self.__convert_node_postorder(py_child) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/iterators.py", line 175, in __convert_node_postorder c_node = self.depipeline.AddNodeToTree(op_type, node.get_args()) RuntimeError: Thread ID 281472905199632 Unexpected error. MindRecordOp init failed. Error message: operator failed Line of code : 149 File : /home/jenkins/agent-working-dir/workspace/Compile_Ascend_ARM_EulerOS/mindspore/mindspore/ccsrc/dataset/engine/datasetops/source/mindrecord_op.cc [Modelarts Service Log]2020-08-11 04:00:40,019 - ERROR - FMK of device3 (pid: [162]) has exited with non-zero code: 1 后改为在云上生成,云上用才可以 建议方案: 希望后续改进生成mindrecord文件内,没有路径限制,因为云上运行模型,每次都是要重新生成数据文件,文件是临时的,训练模型的数据通常都很大,还要调试运行很多次,这样每次都重新生成太浪费资源 问题描述: 我在本地生成了mindrecord文件,供云上运行模型生成dataset用,结果错误提示如下 shard_reader.cc:124] Init] DB file can not match file [ERROR] MD(162,python):2020-08-11-04:00:39.655.725 [mindspore/ccsrc/mindrecord/io/shard_reader.cc:124] Init] DB file can not match file /cache/gpt2cx_data/webtext-valid.mr Traceback (most recent call last): File "/home/work/user-job-dir/datatest/gpt2_dataset.py", line 222, in <module> for x in ds.create_dict_iterator(): File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/datasets.py", line 1076, in create_dict_iterator return DictIterator(self) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/iterators.py", line 82, in __init__ root = self.__convert_node_postorder(self.dataset) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/iterators.py", line 178, in __convert_node_postorder c_child = self.__convert_node_postorder(py_child) File "/usr/local/ma/python3.7/lib/python3.7/site-packages/mindspore/dataset/engine/iterators.py", line 175, in __convert_node_postorder c_node = self.depipeline.AddNodeToTree(op_type, node.get_args()) RuntimeError: Thread ID 281472905199632 Unexpected error. MindRecordOp init failed. Error message: operator failed Line of code : 149 File : /home/jenkins/agent-working-dir/workspace/Compile_Ascend_ARM_EulerOS/mindspore/mindspore/ccsrc/dataset/engine/datasetops/source/mindrecord_op.cc [Modelarts Service Log]2020-08-11 04:00:40,019 - ERROR - FMK of device3 (pid: [162]) has exited with non-zero code: 1 后改为在云上生成,云上用才可以 建议方案: 希望后续改进生成mindrecord文件内,没有路径限制,因为云上运行模型,每次都是要重新生成数据文件,文件是临时的,训练模型的数据通常都很大,还要调试运行很多次,这样每次都重新生成太浪费资源
上滑加载中
推荐直播
-
用码道,让你的AI作品三步上朋友圈2026/08/04 周二 19:00-20:00
林华鼎-华为云AI开发者运营负责人
从入门 · 到做AI应用 · 到企业级开发。不教编程,只教用AI · 零代码、有产出、能带走、可炫耀 · 每课人人动手实操
回顾中 -
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
基于华为云码道,构建你的定制化AI搭子2026/08/14 周五 09:00-11:30
明亮-华为云开发者发展与支持部部长
本期直播将向您全面介绍华为云码道产品,并基于码道手把手教你部署自己的定制化AI陪伴搭子。
回顾中
热门标签