-
金融领域使用机器学习建模最多的场景就是风控,细分场景如下: 信用卡交易反欺诈:分类任务,GBDT算法+LR逻辑回归; 信用卡申请反欺诈:分类任务,GBDT算法+LR逻辑回归; 贷款申请反欺诈:分类任务,GBDT算法+LR逻辑回归; 反洗钱:分类任务,GBDT算法+LR逻辑回归; 目前在金融领域涉及到风控的几乎都是GBDT+LR,目前市场上还没有哪一家金融科技公司做反欺诈、反洗钱场景使用的不是GBDT+LR,这是目前市场上做该场景效果最好的算法。同时金融行业存在高监管的属性,乙方AI厂商给银行做项目时,最终项目交付时都需要模型可解释,LR模型存在一个优点就是特征可以解释,特征工程很清晰,每个特征的贡献度也可以统计出来。如果用深度学习模型等,可能效果差不多,但是完全不可解释,这种在金融这种强监管的场景下,不可解释的模型是不符合监管要求的。金融行业的属性导致的,目前深度学习在金融风控领域应用非常有限。确实也有用XGBT算法在上述这些场景,XGBT在GBDT算法进行了一些优化。 营销场景:为用户推荐理财产品、基金产品、保险产品或者邀请用户办理信用卡账单分期等;这部分主要用的都是推荐的算法,主要都是基于协同过滤CF算法+简单的策略;营销场景做推荐,一般分为三个部分:召回+排序+业务规则。召回层面会利用协同过滤CF算法、FM算法,构建排序模型还是LR模型居多,金融领域目前使用深度学习相对较少,但是在互联网和其他领域使用深度学习做排序模型已经很广泛了。
-
“昇腾众智金质量奖”2021年8月份启动,9月份评选第一期,每月一期,至今评选了五期,评选出在“昇腾生态众智项目”交付过程中表现优异的开发者153人次。其中:获得“昇腾众智金质量奖”开发者所属高校&科研院所 24个,其中前五高校&科研院所为: 高校&科研院所人次获得“昇腾众智金质量奖”任务类型分布浙江大学20MindX高性能预训练模型:6,Pytorch & ONNX模型:9,MindSpore算子:4,CANN算子:4浙江工业大学20MindSpore模型:6,Pytorch & ONNX模型:2,TensorFlow模型:4,CANN算子:8武汉理工大学16MindSpore模型:1,TensorFlow模型:1,MindSpore算子:14重庆大学16MindX高性能预训练模型:4,MindSpore模型:9,TensorFlow模型:2,MindX SDK参考设计:1哈尔滨工业大学9MindSpore模型:6,TensorFlow模型:3获得“昇腾众智金质量奖”开发者所属众智团队 40个,其中前五团队为: 众智团队人次获得“昇腾众智金质量奖”任务类型分布武汉理工大学-熊盛武老师 团队15MindSpore模型:1,MindSpore算子:14重庆大学-钟将老师 团队11MindSpore模型:7,MindX高性能预训练模型:4浙江大学-梁秀波老师 团队10Pytorch & ONNX模型:8,MindX高性能预训练模型:1,CANN算子:1浙江工业大学-杨旭华老师 团队8CANN算子:8中山大学-张冬雨老师 团队8Pytorch & ONNX模型:8获得“昇腾众智金质量奖”开发者 103 人,其中前五开发者为: 众智开发者人次获得“昇腾众智金质量奖”任务类型分布浙江大学-智鑫8MindX高性能预训练模型:1,Pytorch & ONNX模型:2,MindSpore算子:4,CANN算子:1重庆大学-黄纲弘5MindX高性能预训练模型:3,MindSpore模型:2武汉理工大学-徐聪5MindSpore算子:5哈尔滨工业大学-郭佳宇4MindSpore模型:4浙江工业大学-裘坤锋4MindSpore模型:4感谢所有参与“昇腾生态众智项目”的众智开发团队和开发者,在昇腾生态中做出的贡献!您我均在提升!2022年,我们继续,评选规则和奖品均会在近期刷新,请各位众智开发团队和开发者关注,持续参与“昇腾生态众智项目”,并邀请更多的团队和开发者参与到我们中。“昇腾众智金质量奖”第五期“2021年收官评选”结果已新鲜出炉,恭喜各位开发者!开发者所属院校指导老师交付内容获奖事迹奖品桂胜楠北京科技大学支瑞聪MindSpore 算子-Inv 在Inv算子的适配过程中,主动思考,积极提问,善于沟通交流,快速掌握了业务要求,在较短时间内高质量完成交付,是一名优秀的贡献者。华为手环 6刘立博北京科技大学支瑞聪MindSpore 算子-Cos在Cos算子适配过程初期,克服对库不熟悉的困难,积极学习了解Mindspore库,勤于请教,最后掌握算子迁移所需的能力,最后提前一个月完成交付。华为手环 6郑鹏飞北京科技大学支瑞聪MindSpore 算子-Round在Sigmoid等2个MindSpore动态Shape算子的交付中,克服深度学习相关基础的困难,积极学习,主动思考,积极与同学们共同探讨难题,与同学们共同进步,最后高效率完成交付验收。华为手环 6 * 2MindSpore 算子-Sigmoid黄吉瑞武汉理工大学熊盛武MindSpore 算子-Acosh完成动态Shape算子acoshgrad、asingrad的MindSpore适配交付,提前提交并一次性通过验收,并在交付中,积极思考、理解任务、把握关键因素,代码及测试用例质量高。华为手环 6 * 2MindSpore 算子-AcoshGrad王超武汉理工大学熊盛武MindSpore 算子-Erf在Mindspore算子Erf交付过程中,积极主动,碰到困难不退缩,认真思考,积极与团队及支持人员交流,提前交付并一次性验收通过,代码及测试用例质量高。华为手环 6夏国威武汉理工大学熊盛武MindSpore 算子-Ceil在Ceil算子交付中,通过自己富有激情、积极主动的努力实现算子开发。待人诚恳,人际关系良好,处事冷静稳健。具备较强的逻辑思维和判断能力,高效完成了任务交付。华为手环 6王宇杰武汉理工大学熊盛武MindSpore 算子-Xdivy在开发的过程中主动思考,积极与同学们讨论问题,克服开发过程中的种种困难,顺利且高效的完成了开发任务并交付验收。华为手环 6徐聪武汉理工大学熊盛武MindSpore 算子-Asinh完成Atanh等5个动态Shape算子的MindSpore适配交付,提前提交并一次性通过验收,代码及测试用例质量高。华为手环 6 华为手环 6SKG-颈椎按摩器-G7MindSpore 算子-AsinhGradMindSpore 算子-AtanMindSpore 算子-AtanGradMindSpore 算子-Atanh智鑫浙江大学周磊晶MindSpore 算子-AssignAdd在Invert等4个MindSpore动态Shape算子的交付中,克服深度学习相关基础的困难,积极学习,主动思考,积极与同学们共同探讨难题,与同学们共同进步,最后高效率完成交付验收。HUAWEI sound SE华为手环 6MindSpore 算子-GeluGradMindSpore 算子-InvertMindSpore 算子-LogSoftmaxGrad庞宇超浙江工业大学杨旭华CANN算子-MultinomialAliasDraw算子开发中,快速学习背景知识,及时发现问题,帮助同学,热心解答,积极和华为专家沟通,提前半个月完成了交付要求。HUAWEI WATCH FITSKG-颈椎按摩器-G7CANN算子-MultinomialAliasSetup何家靖浙江工业大学杨旭华CANN算子-Combinations完成了Combinations算子的cann算子开发任务和pytorch适配的交付。在开发过程中遇到问题能够主动思考、积极解决。高效率、高质量地完成了算子和适配框架的开发工作,且算子的性能和精度均达标。算子交付提前提交并一次性通过验收,代码和测试用例的质量高,测试用例覆盖的异常情况全面。HUAWEI WATCH FIT王天浩浙江工业大学杨旭华CANN算子-Geometric在CANN算子Geometric交付中,快速学习背景知识,理解项目流程,主动与支持人员积极沟通,快速闭环,提前完成了算子的开发和适配,高质量达成交付要求。倍益康 MINI 肌肉按摩器廉令航浙江工业大学杨旭华CANN算子-PInverse在CANN算子PInverse的交付过程中,从零开始逐步摸索,解决了一些难点,积极团队合作,帮助其他团队成员解答算子开发过程中遇到的问题,提高了团队的开发效率。高质量达到交付要求,并且按时一次性交付通过。HUAWEI WATCH FIT成传兴浙江工业大学杨旭华CANN算子-Poisson完成了Poisson算子的cann算子开发任务和pytorch适配的交付。在开发过程中遇到问题能够主动思考、积极解决。高效率、高质量地完成了算子和适配框架的开发工作,且算子的性能和精度均达标。算子交付提前提交并一次性通过验收,代码和测试用例的质量高,测试用例覆盖的异常情况全面。SKG-颈椎按摩器-G7张凯磊浙江工业大学杨旭华CANN算子-UniqueWithCountsAndSorting在CANN算子的交付过程中,遇到问题能够独立思考,解决了多个关键性问题,同时响应其他同学,贡献自己的开发经验,提前完成交付,精度和性能均达标。HUAWEI WATCH FITHUAWEI WATCH FITCANN算子-Tril智鑫浙江大学梁秀波CANN算子-ProbSample完成cann算子ProbSample的aicpu实现,提前完成交付,执行力强,是一名优秀的开发者。SKG-颈椎按摩器-G7罗昱冬东北大学郭贵冰CANN算子-Roll在Roll算子的任务中,快速补充背景知识,认真分析、主动思考,开发过程严谨细心,遇到问题能够及时和老师同学交流沟通,最终提前一个月高质量达成交付要求,并一次性通过验收。SKG-颈椎按摩器-G7王阔东北大学郭贵冰CANN算子-Addcmul在CANN 算子Addcmul的开发过程中,积极思考,努力尝试,在算子逻辑实现过程中探索出创造性的解决方法,并通过与支持人员的主动沟通将方法以代码形式实现。提前完成了算子的实现和各个阶段的测试,高质量达成交付要求。HUAWEI WATCH FIT马彪武汉理工大学熊盛武MindSpore模型-RotatE模型在RotatE-MindSpore模型的交付中,克服深度学习相关基础的困难,积极学习,主动思考,积极与同学们共同探讨难题,与同学们共同进步,最后高效率完成交付验收。HUAWEI WATCH FIT党翌洲东北大学郭贵冰PyTorch框架-3DMPPE_ROOTNET模型-训练主观能动性很强,专业技术也很好,提前交付模型,模型质量高。HUAWEI WATCH GT 3(46mm)魏景琦东北大学郭贵冰PyTorch框架-3DMPPE_ROOTNET模型-推理提前很早完成了模型的交付,交付模型质量高,遇到问题主动思考解决,专业技能扎实。FreeBuds 4i 无线耳机耿锦坤浙江大学梁秀波PyTorch框架-SOLOv1模型-训练&推理在SOLOv1模型训练推理交付过程中,主动思考,不畏困难,解决了模型精度性能的一系列问题,提前交付并一次性验收通过HUAWEI WATCH GT 3(46mm)力博得智能声波牙刷冯堂虎浙江大学梁秀波PyTorch框架-SOLOv2模型-训练&推理在SOLOv2高难度模型交付过程中,主动思考,独立解决问题并积极帮助团队其他模型解决动态shape等难点问题,与支持人员积极沟通,高质量达成交付要求。HUAWEI WATCH GT 3(46mm)FreeBuds 4i 无线耳机庄佳尧浙江工业大学洪榛PyTorch框架-SSD-ResNet34模型-训练在SSD-Resnet模型-训练交付过程中,积极主动解决问题,独立完成,认真分析总结,完善了模型的性能与精度,提前交付并一次性验收通过。HUAWEI WATCH GT 3(46mm)於志成浙江工业大学洪榛PyTorch框架-SSD-ResNet34模型-推理在SSD-Resnet34模型交付过程中,遇到问题能主动思考,独立解决,善于总结,学习新知识,勤实践,最终提前完成模型的交付任务,精度和性能均达标。华为手环 6王跃辉中山大学张冬雨PyTorch框架-SSD-ResNet34模型-训练跃辉同学能力强并且执行力也很强,对于性能要求很高的模型,性能精度均对标V100达标,提前15天交付,质量极佳。HUAWEI WATCH GT 3(46mm)陈俊宏中山大学张冬雨PyTorch框架-Yolor模型-推理开发过程中不惧困难,主动解决问题,最终提前交付模型,性能超过T4,质量非常优秀。FreeBuds 4i 无线耳机李朝阳西北工业大学徐韬TensorFlow框架-SWD模型-训练在SWD模型交付中,上手快、解决问题效率高,提前完成模型迁移调优,精度性能达标,同时能够积极对项目中的其他模型开发提供支持,项目整体进展也较好。HUAWEI FreeBuds 4 蜜语红华为手环4 曜石黑白玉琼西北工业大学徐韬TensorFlow框架-DANN模型-训练在DANN模型交付中,遇到问题能够主动思考、独立解决,提前完成网络训练交付,精度性能均达标。HUAWEI FreeBuds 4 陶瓷白孙颖智西安电子科技大学王爽/谷裕TensorFlow框架-ADDA模型-训练在ADDA模型交付中,需求理解全面准确,善于发现并解决问题,快速完成了训练交付,精度和性能达标。并积极社区互动,为社区发展贡献力量。HUAWEI WATCH GT 3(42mm)李骁西安电子科技大学王爽/谷裕TensorFlow框架-DSRC模型-训练在DSRC模型交付中,学习理解能力强,能够很快理解任务、把握关键因素,超预期完成项目的阶段交付。并积极社区互动,为社区发展贡献力量。华为手环 B6贺浩庭崔浩洁西安交通大学李垚辰TensorFlow框架-BSRN模型-训练在BSRN模型交付中,快速上手基于CANN的模型迁移调优,遇到问题能够主动思考、及时进行解决,使项目有序进行,且与支持人员积极沟通互动,所负责的模型提前通过验收。华为手环 B6晏国志重庆大学刘凯TensorFlow框架-DeepFaceLab模型-训练&推理负责的DeepFaceLab模型提前高质量完成,交付效率高,交付件规范。在交付过程中,表现出了较优秀的项目执行能力,在项目前期分析、问题讨论、方案沟通等环节思路清晰,且动手能力较强,能针对多个不同方案尝试选择最优解。HUAWEI WATCH GT 3(42mm)华为手环 6周晨哈尔滨工业大学胡悦TensorFlow框架-MASF模型-训练在MASF模型交付中,体现了较强的学习、编程和解决问题能力,克服参考源码不完整等困难,通过个人努力所负责的模型提前通过验收。华为手环 B6刘晋豪哈尔滨工业大学胡悦TensorFlow框架-Deep-SLR模型-训练在Deep-SLR模型交付中,上手快、解决问题效率高,且积极互动沟通解决问题,提前完成模型迁移调优,精度和性能均达标。HUAWEI WATCH FIT唐雨欣哈尔滨工业大学胡悦TensorFlow框架-fusionGAN模型-训练在FusionGAN模型交付中,对模型的理解能力较好,动手能力较强,遇到的一些问题能够通过自行查阅资料或者积极和HW技术人员互动得到较好的解决,所负责的模型提前通过验收。华为手环 B6宋春颖南开大学王恺MindX SDK参考设计-EfficientDet在 EfficientDet 目标检测模型交付中,积极解决遇到的各种难题,及时总结,在实现过程中对 MindXSDK 平台的特性进行了深入学习,结合平台特性合理调整实现方法,对不同子模型做了充分的评测,提供了详细完备的测试文档和开发文档,完成项目交付。华为手环 B6 尊享版常顺西安电子科技大学苗启广MindX 高性能预训练模型-DeepSort在DeepSort模型交付中,不畏困难,敢于挑战,解决了多个后处理疑难问题,提前完成了ModelArts训练、SDK、MxBase推理功能和精度达标,且一次验收通过。HUAWEI WATCH GT 3(46mm)杨羽频重庆大学钟将MindX 高性能预训练模型-Senta在Senta模型交付中,在NLP模型C++后处理较为复杂的情况下,在很短的时间内就完成了模型的开发和交付,提前完成了ModelArts和SDK功能和精度达标,且一次验收通过。索尼(SONY)PS5 playstation dualscene 无线游戏手柄智鑫浙江大学赵艺钧MindX 高性能预训练模型-Xception(MindSpore)在Xception(MindSpore)模型交付中,快速理解业务背景,提前完成了ModelArts和SDK功能和精度达标,且一次验收通过。华为手环 6干淇钧浙江大学赵艺钧MindX 高性能预训练模型-resnetv2_152在resnetv2_152、lenet_quant和cnn_direction三个模型交付中,积极主动,高效沟通,在承担了三个模型的开发任务下不畏困难,提前完成了ModelArts训练、SDK、MxBase推理功能和精度达标,且一次完成验收。SKG-颈椎按摩器-G7华为无线键盘MindX 高性能预训练模型-lenet_quantMindX 高性能预训练模型-cnn_direction陈治清浙江大学赵艺钧MindX 高性能预训练模型-MASS在MASS模型交付中,快速理解业务背景,面对问题迎难而上,在很短的时间内就完成了模型的开发和交付,提前完成了ModelArts和SDK功能和精度达标,且一次完成验收。HUAWEI WATCH FIT感谢各位开发者的贡献,向各位优秀开发者学习!我们追求高质量交付,“一次性把事情做好”!活动持续,请大家参与“昇腾众智金质量奖”评选,2022年活动评选规则和奖品即将刷新发布,敬请关注!历史展播 昇腾众智金质量奖展播 2021年第一期:You Are No.1昇腾众智金质量奖展播 2021年第二期:We Are Best昇腾众智金质量奖展播 2021年第三期:We Keep Going昇腾众智金质量奖展播 2021年第四期:Go For It!
-
HMS Core简介HMS Core是华为终端云服务(HUAWEI Mobile Services)开放能力合集,位于开发者应用与操作系统之间,是为应用开发提供基础服务的平台。同时,依托华为云服务,HMS Core也为这些服务提供云端能力,用于各服务的开通、业务实现及运营,帮助开发者实现应用高效开发、快速增长、商业变现,使能开发者创新,为全球用户提供精品内容、服务及体验。如下图所示。对应用的用户来说,集成了HMS Core的应用能为用户提供多样化、多场景、多功能的极致体验。对应用的开发者来说,HMS Core的通用开放能力能快速为开发者构建跨平台的差异化产品能力。对应用的运营人员来说,HMS Core能为运营人员提供针对各项服务的一站式多平台运营管理能力。HMS Core 训练营8大课程合集课程名称课程简介课程入口HMS移动应用开发训练营(Java基础)本课程作为HMS移动应用开发训练营的前置基础课程,带你从零入手Java编程,为后续的学习打下坚实基础!https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN094/about?source=hwdevHMS移动应用开发训练营(Android基础)本课程作为HMS移动应用开发训练营的前置基础课程,带你掌握Android基础,走进APP开发的世界!https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN095/about?source=hwdevHMS实战训练营第1期 - 分析服务Analytics Kit华为分析服务是华为为开发者提供的一套数据收集和数据分析的服务系统,通过强大的数据分析能力提供数据驱动服务。https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN029/about?source=hwdevHMS实战训练营第2期 - 华为帐号服务&游戏服务本课程介绍了华为帐号服务和游戏服务的适用场景与接入步骤,通过实战演练帮助开发者迅速掌握如何用华为帐号实现一键登录,如何用游戏服务实现排行榜、成就等功能https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN034/about?source=hwdevHMS 实战训练营第3期 - 机器学习服务本课程将介绍HMS Core——ML Kit的基本功能,同时从代码层次由浅入深的介绍各个服务sdk的集成方式,全方位多角度的带领开发者了解并实践整体的开发过程。https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN042/about?source=hwdevHMS 实战训练营第4期 - 华为推送服务本课程将全面解读HMS Core——Push Kit的基本功能,开发者可以将样式丰富的消息快速、精准地发送给用户,从而构筑与用户的联系,提升用户粘性和活跃度。 https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN054/about?source=hwdevHMS 实战训练营第5期 - 快应用本课程将介绍全场景、全终端、全球化的快应用技术,指导开发者快速开发、接入,加速商业成功。创建快应用,让用户无需安装,快速体验您的产品和服务!https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN063/about?source=hwdevHMS实战训练营第6期 - HiAI本课程将全面解读HUAWEI HiAI所具备的强大端侧能力,丰富的场景能力,高效的商业支撑,完备的工具支持等创新性特性,并从代码层面演示如何集成HUAWEI HiAI。https://developer.huaweiuniversity.com/portal/courses/HuaweiX+CBGHWDCN074/about?source=hwdev
-
华为云发布盘古系列超大规模预训练模型,包括30亿参数的全球最大视觉(CV)预训练模型,以及与循环智能、鹏城实验室联合开发的千亿参数、40TB训练数据的全球最大中文语言(NLP)预训练模型。其中,盘古NLP大模型由华为云、循环智能和鹏城实验室联合开发,具备领先的语言理解和模型生成能力:在权威的中文语言理解评测基准CLUE榜单中,盘古NLP大模型在总排行榜及分类、阅读理解单项均排名第一,刷新三项榜单世界历史纪录;总排行榜得分83.046,多项子任务得分业界领先, 向人类水平(85.61)迈进了一大步。盘古NLP大模型–业界首个千亿参数中文大模型盘古NLP大模型由华为云、循环智能和鹏城实验室联合开发,具备领先的语言理解和模型生成能力:在权威的中文语言理解评测基准CLUE榜单中,盘古NLP大模型在总排行榜及分类、阅读理解单项均排名第一,刷新三项榜单世界历史纪录;总排行榜得分83.046,多项子任务得分业界领先, 向人类水平(85.61)迈进了一大步。盘古NLP大模型预训练阶段学习超40TB文本数据,并通过行业数据的小样本调优,提升模型在场景中的应用性能预训练阶段沉淀了大量的通用知识,同时既能做生成又能做理解的特性让大模型有能力支持行业知识库和数据库的嵌入,对接行业经验encoder-decoder架构基础上植入了特点训练技巧、方法,性能优异。中文权威CLUE榜单分类任务、阅读理解任务,总成绩排名第一;Rouge Score平均分0.53基于提示(prompt-based)调优、动态冰化等一系列正则化技术,实现小样本学习任务上超越GPT系列盘古CV大模型–超30亿参数业界最大CV大模型CV大模型,解决AI工程难以泛化和复制的问题。现有的AI工程需要针对不同场景做定制化开发,费时费力;盘古CV大模型的出现,使AI开发进入工业化模式,即一套流水线能够复制到不同的场景中去,大大节约研发的人力和算力。盘古CV大模型首次兼顾图像判别与生成能力,能同时满足底层图像恢复与高层语义理解需求能够简单高效融合行业知识,快速适配各种下游任务。盘古CV大模型已经在100余项实际任务中得到验证,大幅提升了业务测试精度,节约90%以上的研发成本相关文献/视频匠心故事 |“盘古”开天记,AI落地时 https://bbs.huaweicloud.com/blogs/298020“玩转”17亿个小分子,盘古大模型家族又添新成员https://bbs.huaweicloud.com/blogs/301226华为“天才少年”在研究什么?看谢凌曦揭秘千亿参数盘古大模型https://bbs.huaweicloud.com/blogs/281852 盘古大模型,开启工业化AIhttps://bbs.huaweicloud.com/live/HDZ_live/202110251500.html数据集干货下载数据集大全列表跳转链接文本分类模型--基于外卖评论数据集 https://bbs.huaweicloud.com/forum/thread-176871-1-1.html 物体检测-model-car-and-person https://bbs.huaweicloud.com/forum/thread-176870-1-1.html 钢筋检测模型 基于目标检测的方法检测钢筋的横截面 https://bbs.huaweicloud.com/forum/thread-176869-1-1.html 23种美食识别模型 图像分类模型 https://bbs.huaweicloud.com/forum/thread-176868-1-1.html 猫狗识别模型 40张图片小数据集训练的模型 https://bbs.huaweicloud.com/forum/thread-176867-1-1.html 识别昆虫, 提高农产品产量, 稳定市场价格 https://bbs.huaweicloud.com/forum/thread-176866-1-1.html 猴子物种亚类的细粒度识别 即便是对于生物学家, 分辨一种他不熟悉的物种亚类也极具挑战 https://bbs.huaweicloud.com/forum/thread-176865-1-1.html 图像分割-Fast-SCNN https://bbs.huaweicloud.com/forum/thread-176864-1-1.html DynamicRCNN-目标检测 https://bbs.huaweicloud.com/forum/thread-176863-1-1.html人脸检测-RetinaFace 支持Pytorch, GPU训练, 支持CPU,GPU推理 https://bbs.huaweicloud.com/forum/thread-176862-1-1.html文字识别-Aster https://bbs.huaweicloud.com/forum/thread-176861-1-1.html 命名实体识别-FLAT-NER https://bbs.huaweicloud.com/forum/thread-176860-1-1.html 行人姿态估计-HRNet https://bbs.huaweicloud.com/forum/thread-176859-1-1.html 指定姿态行人图像生成-XingGAN https://bbs.huaweicloud.com/forum/thread-176858-1-1.html CrowdDet (目标检测/Pytorch) https://bbs.huaweicloud.com/forum/thread-176857-1-1.html PointRend(图像分割/Pytorch) https://bbs.huaweicloud.com/forum/thread-176856-1-1.html 物体检测-CenterNet-Hourglass https://bbs.huaweicloud.com/forum/thread-176855-1-1.html Speaker change point detection-Maxout DNN-d-vector https://bbs.huaweicloud.com/forum/thread-176854-1-1.html 目标检测-TSD https://bbs.huaweicloud.com/forum/thread-176853-1-1.html GFocal loss 目标检测-Pytorch https://bbs.huaweicloud.com/forum/thread-176733-1-1.html conv-ensemble-str MM2018 https://bbs.huaweicloud.com/forum/thread-176724-1-1.html 强化学习游戏训练框架ASED https://bbs.huaweicloud.com/forum/thread-176722-1-1.html 遥感卫星影像数据集 "华为云杯"2020人工智能创新应用大赛数据集 https://bbs.huaweicloud.com/forum/thread-176720-1-1.html 街景图像语义分割数据集 华为云"云上先锋"AI挑战赛数据集 https://bbs.huaweicloud.com/forum/thread-176719-1-1.html TownCentreXVID目标跟踪数据集 数据是一个5分钟的视频 https://bbs.huaweicloud.com/forum/thread-176718-1-1.html 西安美食分类数据https://bbs.huaweicloud.com/forum/thread-176717-1-1.html 西安旅游主题图片数据集 "华为云杯"2019人工智能创新应用大赛数据集 https://bbs.huaweicloud.com/forum/thread-176715-1-1.html 机械硬盘故障预测数据集 来自backblaze公司的2020年机械硬盘故障预测数据集 https://bbs.huaweicloud.com/forum/thread-176712-1-1.html VOC2012子集--适用于图像分割算法训练 https://bbs.huaweicloud.com/forum/thread-176708-1-1.html Protein MSA数据库 https://bbs.huaweicloud.com/forum/thread-176706-1-1.html Cityscapes Dataset https://bbs.huaweicloud.com/forum/thread-176704-1-1.html 钢筋检测数据集 250张,PASCAL标注格式 https://bbs.huaweicloud.com/forum/thread-176702-1-1.html ECS-50(声音分类)数据集 https://bbs.huaweicloud.com/forum/thread-176701-1-1.html 四类美食图片分类小数据集 图片总数40张 https://bbs.huaweicloud.com/forum/thread-176700-1-1.html 中文语句情感分类(manifest) https://bbs.huaweicloud.com/forum/thread-176699-1-1.html COCO2017子集--适用于目标检测算法训练 https://bbs.huaweicloud.com/forum/thread-176695-1-1.html 二分类猫狗图片分类小数据集 图片总数40张 https://bbs.huaweicloud.com/forum/thread-176693-1-1.html 10类常见美食图片数据集 https://bbs.huaweicloud.com/forum/thread-176692-1-1.html 化合物-蛋白质相互作用(CPI)识别数据集 "华为云杯"2021人工智能创新应用大赛创客https://bbs.huaweicloud.com/forum/thread-176690-1-1.html 8类常见生活**图片数据集 https://bbs.huaweicloud.com/forum/thread-176689-1-1.html 口罩检测小数据集 总共291张图,PASCAL标注格式 https://bbs.huaweicloud.com/forum/thread-176688-1-1.html 爱(AI)美食--10类常见美食图片数据集 https://bbs.huaweicloud.com/forum/thread-176687-1-1.html 文本分类数据集--外卖评论 https://bbs.huaweicloud.com/forum/thread-176685-1-1.html 四类花卉图像分类小数据集 图片总数40张 https://bbs.huaweicloud.com/forum/thread-176683-1-1.html pedestrian_detection_334 已标注的多场景下的行人检测数据集,用于目标检测,334张https://bbs.huaweicloud.com/forum/thread-176682-1-1.html 红绿灯、斑马线、限速、解限速数据集 无人车挑战杯大赛训练集 https://bbs.huaweicloud.com/forum/thread-176681-1-1.html dataset-car-and-person-500 已标注的街道场景中的车辆和路人数据集,目标检测https://bbs.huaweicloud.com/forum/thread-176680-1-1.html “华为云杯”2020人工智能创新应用大赛(数据集来源于北京二号卫星) https://bbs.huaweicloud.com/forum/thread-176679-1-1.html 爱(AI)美食-美食图片分类Baseline https://bbs.huaweicloud.com/forum/thread-176676-1-1.html 第十六届中国研究生数学建模竞赛-华为赛题 https://bbs.huaweicloud.com/forum/thread-176672-1-1.html 【“华为云杯”2019人工智能创新应用大赛 — 训练数据】 https://bbs.huaweicloud.com/forum/thread-176671-1-1.html 【2019华为云人工智能大赛·**分类挑战杯】训练集、测试集 https://bbs.huaweicloud.com/forum/thread-176668-1-1.html
-
5月13日19:00举办的华为云AI论文精读会2021 第四期:Dynamic RCNN:一种有效提升RCNN系列网络表现的动态训练方法很多小伙伴们都有热情的参与~我们的嘉宾是北京大学的白璐斌,直播时评论都在说白璐斌老师讲解好细致,真的是太厉害啦!错过了直播的小伙伴也不要担心,贴心的我们为大家准备好了回放!准备好了吗!观看地址:https://bbs.huaweicloud.com/live/cloud_live/202105131900.html
-
讲师介绍刘文志(花名风辰),华为诺亚AI系统工程实验室主任,异构并行计算专家,毕业于中国科学院研究生院,闻名于并行计算江湖,尤善异构并行计算、AI系统工程和大规模集群计算,涉及图像处理、计算机视觉、自然语言处理、推荐系统、科学计算和石油勘探。现华为诺亚AI系统工程实验室主任,前商汤集团hpc和汽车业务创建人,曾任英伟达并行计算工程师、百度在线高级研发工程师。著有《并行算法设计与性能优化》、《并行编程方法与优化实践》、《科学计算与企业级应用并行优化》和《OpenCL异构并行计算》四本并行计算领域的专著。创建了ppl、parrots、bolt和vega等AI著名项目。业务背景随着5G时代的到来,电信流量呈爆发式的增长,基站流量的预测对站点的扩容和站点的规划至关重要。根据基站流量的精准预测结果,对于超负荷流量的基站可以及时发现并进行扩容,对于某一段时间段流量使用较小的基站,可以智能关站来降低资源的损耗。 但是基站流量预测是一个老大难的问题,针对这一挑战,我们近期尝试深度学习的方法来解决。传统的流量预测模型使用时间序列分析的模型如ARIMA,没有考虑流量的空间相关性信息(见图1)。Vega 提供一种多信息融合的电信网络流量预测的算法,将基站网络建模为图结构,图的节点表示基站,边刻画基站之间的关联,每个基站的流量作为节点属性特征输入给网络模型进行训练。此外我们可以通过架构搜索的方式动态设计网络结构,使得网络结构能够完美匹配当前的业务场景,使用超参优化对训练参数进行自动调优,从而减少人工的干预和成本。本文将介绍如何使用vega自动机器学习(AutoML)系统解决电信领域的基站流量预测问题。 Vega介绍Vega是由华为诺亚方舟实验室开发的面向于深度学习的AutoML工具链(框架流程图见图2),有如下主要特点:●完备的AutoML能力:涵盖HPO(超参优化, Hyperparameter Optimization)、Data-Augmentation、NAS(网络架构搜索, Network Architecture Search)、Model Compression、Fully Train等关键功能,同时这些功能自身都是高度解耦的,可以根据需要进行配置,构造完整的pipeline。●业界标杆的自研算法:提供了诺亚方舟实验室自研的 业界标杆(Benchmark) 算法,并提供 Model Zoo 下载SOTA(State-of-the-art)模型。●高并发模型训练能力:提供高性能Trainer,加速模型训练和评估。●细粒度SearchSpace:可以自由定义网络搜索空间,提供了丰富的网络架构参数供搜索空间使用,可同时搜索网络架构参数和模型训练超参,并且该搜索空间可以同时适用于Pytorch、TensorFlow和MindSpore。●多Backend支持:支持PyTorch(GPU), TensorFlow(GPU, Ascend 910), MindSpore(Ascend 910).。●支持昇腾平台:支持在Ascend 910搜索和训练,支持在Ascend 310上模型评估。使用Vega解决基站流量预测问题我们先介绍下Vega中时空预测算法STGCN算法。该算法使用GRU对时间前后的依赖关系进行建模,同时通过GCN网络从三个视角捕获对象之间的关系:空间相似性、功能相似性和最近趋势相似性,网络结构见图3。 更详细的STGCN算法说明,参考论文 Spatio-Temporal Hybrid Graph Convolutional Network for Traffic Forecasting in Telecommunication Networks,链接为 https://arxiv.org/abs/2009.09849 下面我们将基于Vega采用5种不同使用方式来介绍基站流量预测建模。3.1使用方式1:Fine TuneVega提供ModelZoo供用户使用。用户可以根据自己的需求(数据集、网络结构、参数量、性能指标等)选择ModelZoo中相应的模型文件,在此基础上进行Fine Tune训练。下面是基于Abilene数据集进行Fine Tune训练的流程图,见图4. 可以看到在Ablilene数据集上,我们已经训练过很多模型,从中选取一个性能较好的给vega进行Fine Tune,能够大大减少需要训练的时间,仅仅一分钟的训练时长,10个epochs就能达到30.32的RMSE。 3.2使用方式2:超参优化在网络训练中,为了提高网络的性能,我们往往需要进行大量的调测工作,如采用何种优化器,batch_size为多少比较合适,学习率设置为多少才能取得最优的性能效果。如果让专家手动调参就太耗费人力和财力,Vega提供了自动超参优化的能力,通过大量的超参优化算法来自动调参,有效的利用算力资源来找到一组满足目标的超参。Vega HPO 流程图见图5. 我们选取ASHA算法来对使用方式1中的训练过程进行优化,定义可调的超参有:每轮训练的批次大小batch_sizeopt优化器学习率LR在训练了15分钟以后,采样出25组不同的超参组合,最终选择了最优的超参组合,精度为29.37,相对于使用方式1中的30.32,提升了3%,其超参组合的详细数据如下:optimizer: type: RMSProp lr: 0.0058batch_size: 16epochs: 813.3使用方式3: Vega NAS自动优化时序网络结构AutoML另一个主要的作用是可以用于动态调整网络架构,使得所生成的网络能够更好的适用于当前的数据和应用场景。比如网络中采用何种的blocks较为合适,应该堆叠几层,堆叠的少了可能无法获取到相关的特征,堆叠层数过多不容易收敛,而且有可能会导致过拟合。这需要研究者花费大量的专家经验和时间反复试验。我们希望能够通过Vega的能力来简化网络的设计流程,用户只需要定义搜索空间,选择一个搜索算法,然后指定一个优化目标比如RMSE,Vega就能够自动寻找出一个较为合适的网络给用户使用。Vega NAS 流程如见图6。 我们定义如下的搜索空间,搜索算法选用ASHA,优化目标为RMSE:graph类型:temporal、spatial、spatial-temporalgcn_layers: gcn堆叠层数(1,2,3,4)gru_layers: gru堆叠层数(1,2,3,4)训练时长为15分钟,采样出25组候选网络,最佳的RMSE为29.87,相对于基础模型性能提升了1.5%,最终得到的网络结构如下:model_desc: type: GCN graph: spatial-temporal gcn_layers: 4 gru_layers: 1 kernel_size: 43.4使用方式4: 先NAS后HPO在上述的实验中,我们发现不管是超参优化还是架构搜索都能够对最终的性能有所提升,那么我们如何才能够将HPO和NAS一起使用构成一个端到端的流程实现性能更优。Vega提供了Pipeline的能力,用于将多个不同的PipeStep算法无缝的串联起来,用户只需要进行简单的配置而不需要关心具体的实现细节。由于我们一般先优化网络,得到一个最优的网络后继续优化其训练超参。这里我们可以定义两个PipeStep:NAS用于搜索网络架构,输出一个新的网络,HPO获取NAS输出的网络后进行训练超参的优化,最终得到一个最佳网络和最佳超参的组合。先NAS后HPO流程图见图7. 我们将搜索空间的定义分为2个不同的PipeStep中: Nas网络结构空间定义:graph类型:temporal、spatial、spatial-temporalgcn_layers: gcn堆叠层数gru_layers: gru堆叠层数Hpo可调参数定义:每轮训练的批次大小batch_sizeOpt函数:Adam,SDG,RMSProp学习率LRNAS的训练时长为10分钟,HPO为15分钟,产生候选网络25组,候选超参25组,最终的RMSE只为29.23,相比于基线模型性能提升了3.5%,相比于单独使用HPO或者单独使用NAS都有一定的提升效果。 最佳的参数配置如下:model_desc: type: GCN graph: spatial-temporal gcn_layers: 4 gru_layers: 1kernel_size: 4trainer: epochs: 9 optimizer: type: Adam lr: 0.00094dataset: batch_size: 83.5使用方式5: HPO+NAS联合优化通过上述的先NAS后HPO的优化,我们在模型性能上面得到的一定的提升,于是我们想到一个问题,就是网络结构与训练超参之间是否存在一定的关联性,另外对于搜索算法来讲,更高维度的采样能够提高搜索算法的采样效率,从而减少训练时长。 所以我们考虑将HPO和NAS合并在同一个PipeStep中做联合优化。区别于其他的AutoML框架,Vega提供了统一的SearchSpace的定义,使得训练超参和架构参数能够在同一个搜索算法中联合优化,用户只需要指定key来表示需要优化何种超参,type表示采用何种采样类型,range表示采样的范围。最终的采样结果即包含了网络架构参数也包含了训练超参。NAS和HPO联合优化流程图,见图8. 我们将搜索空间定义如下:Graph类型:temporal、sparial、sparial-temporalGcn_layers: 网络层数gru_layers: gru堆叠层数每轮训练的批次大小batch_sizeOpt函数:Adam,SDG,RMSProp学习率LR训练时长为30分钟,采样出25组候选网络,最终RMSE结果为26.75,相对于基线的性能提升了12%,在同等的训练时间内比先NAS后HPO要提升近8%。 最佳的参数配置如下:trainer: epochs: 9 optimizer: type: RMSProp lr: 0.0009dataset: batch_size: 32model_desc: type: GCN graph: spatial-temporal gcn_layers: 3 gru_layers: 2kernel_size: 4总结在基站流量预测场景,Vega提供了基于时空序列的STGCN算法来解决时序预测问题,相对于基线的性能提升了12%。用户可以通过使用yaml配置,修改几行配置文件,然后使用算力资源进行自动优化就能够得到专家级别的网络,大大减少了网络交付的时间。详细对比见下表: 此外,Vega实现了统一的AutoML框架, 不仅支持了基站流量预测场景,而且在深度学习的其他领域和场景也取得了极大的成效。更具体地,Vega提供了丰富的AutoML算法,覆盖了架构搜索(NAS)、 超参优化(HPO)、 数据增强(Data Augmentation)、 模型压缩(Model Compression)多种领域,支持了分类、超分、目标检测、自动驾驶等多种业务场景。 欢迎大家试用并贡献自己的开源代码:https://github.com/huawei-noah/vega。 同时华为NAIE平台提供了基于Vega的AutoML服务,大家可以访问如下网站进行使用:https://www.hwtelcloud.com/products/mts 本文来源:https://mp.weixin.qq.com/s/w6gS6bhrg70vBsKfm2QV5A
-
4月25日,华为云CEO余承东在华为开发者大会 #HDC.Cloud 2021 期间,重磅发布了华为云盘古系列大模型,帮助千行百业解决 AI 模型难以泛化和复制的问题,开启 AI 工业化开发新模式。华为云盘古大模型基于华为云一站式AI开发平台ModelArts构建,包含了:华为云盘古NLP大模型:是业界首个2000亿参数中文预训练模型,预训练阶段学习了40TB中文文本数据,是最接近人类中文理解能力的AI大模型。华为云盘古CV大模型:是目前业界最大的视觉预训练模型,包含超过30亿参数对于盘古大模型,大家都充满了好奇~AI新入门:如何快速进入相关方向学习和研发?AI开发者:盘古大模型的易用性、使用成本、落地场景、端侧性能如何保证? 华为云AI开发者社区挑选了一些HDC.Cloud现场开发者的热门问题,专访盘古大模型的核心研发人员谢凌曦博士和张晓鹏博士进行答疑谢凌曦博士专访Q:作为一个开发者,请问这些预训练模型的易用性如何?使用成本有多高?谢凌曦博士:预训练模型本身设计的目的就是为了让大家在使用云服务的时候降低成本,那么我们预训练模型因为它是预训练,所以我们已经在后台完成了这样一个训练过程,这个过程的成本是比较高的,但是成本的不会需要开发者本身来承担。在使用这些模型的时候,它本身易用性和成本都会在设置在一个比较合适的位置,比如说我们会开发出一些比较通俗易懂的pipeline,如果你是有一定基础的开发人员,你也可以从我们pipeline当中去做更多的定制化的开发,更好的去释放我们预训练模型的能力。如果你只是一个小白,就想用我们的模型去做AI的一些简单的开发,我们也会给你一些更加通俗易懂的界面,让大家能够用一些拖拉拽的方式去使用我们的训练模型,同时成本相对来讲是比较低的,我们有很多种不同的这种计价方式,但是总体来讲,预训练模型都是降低了大家后续使用的时候它的一个计算时长,包括你的这种调仓所需要的重复的代价,这都会被降到一个很低的程度,总体来讲是对开发者非常友好的。Q:华为视觉计划里面提到了很多计算机视觉的新方向,那么对于新入门的人来说,如果想快速投入新的方向中去学习,需要掌握什么哪些知识才可以快速进入到相关方向的学习和研发中。是否需要先掌握传统全监督学习才可以更好的掌握弱监督和无监督数据的方向的研究中呢?谢凌曦博士:总的来讲是一个非常好的问题,我自己刚入行的时候也有过类似思考,是因为不管怎么说,人工智能计算机视觉都是经过几十年的发展,到现在为止已经是一个很庞大的知识体系了。如果一个人想要把这些东西都了解以后,开始做研究的话,稍微效率会有点低,而且你会花费很多不必要的精力去做一些事情。所以我们给大家的这样一个建议是说,你在学习过程当中,你可以先找准一个问题,这个问题可能一开始是一个相对初级的一点的问题,比如说刚才谈到我想做一个弱监督学习,那么我一定是有一个具体的场景,比如说在现在有一个问题当中,我遇到一个实际的问题当中,他确实需要用到弱监督的算法,但这个时候我是不是一定要先掌握全监督,并不是这个样子,你可以先去查阅一些,比如说当前弱监督学习,它的基线是什么,它的前沿在哪里,然后你就可以去做一些简单的实验,在这个实验的过程当中,你一般会遇到一些困难或者遇到一些疑惑,这些疑惑为了去解决,它一般就会帮你把你引导到这样一些它的基础,比如说全监督到底是怎么做的,那么你有了这样一些更多的基础以后,你回过头来也会对你当前正在做这个算法有更好的理解,所以我的建议是大家可以找一本教材,一个对机器学习也好,计算机视觉也好,这些比较介绍的比较深入的一个教材看。但是另外一方面也不要局限于这样一个教材,你可以一边做一个具体的课题,一边去学习这样一些知识,这样的话会比较有效率一些。张晓鹏博士专访Q:图像预训练模型有哪些成功的落地?跟业界比较处在什么位置?我们的智能驾驶系统有用到这方面技术吗?张晓鹏博士:已经在华为内部以及其他合作项目上有100家的一个成功的落地,那么这些方向其实涵盖了各行各业,我们在一些工业视觉,包括一些网络审查,包括一些零售商超以及医疗上,其实都获得了一些相较于我们之前不使用预训练模型更高的一个结果。在某些场景上,比如刚才提到的遥感印象上,我们通过这样一种遥感针对遥感影像这样一种预训练算法,其实在没有增加额外的这种标注代价的情况下,其实是达到了最多10%的这样一种分割精度的提升。那么还有另外一个比较有意思的现象就是说,我们其实在超大规模,我们这里大概用了几千万到亿级的图像的预训练,然后我们直接把这样一个模型,然后迁移到了我们的工业质检的缺陷上。然后其实我们非常欣喜的发现一个有意思的现象,就是我们在下游数据集上其实没有进行任何微调,然后但是我们在这样一个工业缺陷检测上,其实获得了比之前的更高度的优化,甚至利用下游的数据微调,基本上还会更好的结果,这个结果基本上会高出3~4个百分点。也是启发我们就是说我们的模型的数据一旦够多,其实它的泛化能力其实是从隐式的能够获得一种保障。第二个就是说我们的到了什么地步,我们其实是国内公司里面其实是最早做视觉艺术的模型的公司之一,据我了解其实在国外的话是Facebook和谷歌,其实从2019年开始在图像上面做了一些应用,我们这一块其实我们的视觉医学的模型开发其实大概在2019年的时候然后就开始了。所以说到目前为止,其实我们在一个大模型或者这种方针下,搭载我们的一些模型,蒸馏抽取其实以及行业大模型,我们现在其实已经适配了大概10余种这样一种预训练模预训练这种模型,而这10余种模型都是通过我们的一个大模型的一种分发抽取所得到的得到的,然后它在相应的行业上其实是得到了一种非常大的精度提升,同时也极大的减少了这样一个标注以及模型的迭代。Q: 机器视觉应用场景很多,不同场景图像角度,物体尺寸等影响因素很多,我们预训练是采用什么类型数据和学习任务?如果想落地某些特定场景还需要多少数据对特定任务进行模型微调?大模型如何保证端侧性能?张晓鹏博士:这一共有三个问题其实问的非常好,然后其实针对整个在机器视觉图像它的不同的角度,就是说整个整个或者刚才提到的可能不同的变化,其实我们采取的方法其实非常简单,其实一我们可能有海量的,数据集这个数据集规模其实已经达到了一级甚至10亿级这样一种规模,我们相信海量的数据集它是能够建模我们在实际场景的方方面面。另外一个我们采取了什么样的这种学习方式,其实它的一个核心思想就是2019年开始比较火。这样一种对比度之间都学习的方法,然后当然了我们这上面做了很多改进,包括如何来利用一些弱标签的信息,包括如何把这种全局的信息拓展到局部,来更好的建模它在局部的一种相关性关系。然后刚才同时的话也会就是说呼应了刚才提到的我有不同的视角,不同的这种角度,不同尺度问题,那么怎么来让它进行高效的建模?其实这里面就是让它不同的数据增强,我们在其实预训练算法里面是集成了数千余种的这样一种数据增强方法,然后让他通过不同的数据增强,然后让这个模型具有针对不同数据增强它的不变性来建模。Q:华为的预训练模型是如何结合不同行业知识,解决标注数据大的问题?张晓鹏博士:举一个就是我们HDC上发布的国网电力的巡检的例子,其实这就是一个非常典型的我们的视觉预训练大模型来如何解决这样一个行业知识。在这样一种国网电力的过程中,其实它有一些海量的数据,然后标注是非常困难,我们做了一个什么事情,就是我们通过我们的视觉医学的算法,然后在海量的这样一种巡检数据上进行了一一个批次的预训练。然后医学院其实是利用了我们无人机巡检的就是数10tb就是说上百万的这样一种规模的数量,然后来进行一种预训练。然后它的预训练其实是可以看到我们非常多的数据它的内在分布,然后由于我们的大模型模型参数量越大,然后我们也看了更多的数据,然后所以说它能够更好的建模,就是说在电力行业它的无人机巡检过程中的的一些,图片之间的细微的差异。然后我们当时也给了一个数字,就是说我们利用我们的视觉预训练大模型,然后它能够提供更好的一个表征以后,因为它的一个缺陷和正常样本的一种表征能力更强,我们在标注代价上基本上是减少了80%以上。一块的话整个在人力代价上是一个非常大的提升。另外一个就是减少标注,其实就是我们一个模型其实是可以适配我们电力行业的100多种缺陷,我们这个适配100多种缺陷的话,就让模型的迭代周期大大的减少。我们大概减少了就是说整个把迭代周期减少了10倍。然后这样子的话我们在每次迭代的过程中更少,就是说我反馈给人需要标注的这样一种整体的工作量就会越少,所以说通过这两种模式,然后我们实现了在电力这样一个行业方面,利用我们的这样一种视觉医学的模型,极大的提升了我们的一种开发效率。本文来源:https://bbs.huaweicloud.com/blogs/263786
-
一年一度的计算机视觉顶会IEEE计算机视觉及模式识别大会CVPR录用结果最近公布。据悉,今年CVPR投稿量与论文接收量相对往年继续上升,有效投搞量达7015篇,接收论文1663篇,接收率23.7%,与往年相比略有上升。华为诺亚方舟实验室此次有30篇论文被接收,包括两篇Oral,其中主要由正式或者实习员工完成的工作有24篇,主要由高校合作方完成的工作有6篇。研究方向涵盖模型压缩和能耗高效、神经网络搜索、语义理解、底层视觉、自动驾驶、无损数据压缩、可解释AI等多个方面。诺亚方舟实验室的这些文章,体现出工业界需求与学术前沿的紧密结合,围绕业务中的迫切需求,结合最新学术进展提出创新性解决方案,也让学术研究能够有具体落地。如这些文章中包含了去年AdderNet算法的继续演进AdderSR,以及最近广为流传的IPT网络等。下面挑选一些本次CVPR接收的代表性论文进行介绍。CVPR 2021代表性工作介绍AdderSR: Towards Energy Efficient Image Super-Resolution本论文研究使用加法网络解决图像超分的问题,降低超分网络的能耗。由于任务的属性不同,直接将加法网络应用到超分任务上损失严重,本文对该问题进行了深入分析。首先,加法算子难以学到恒等映射;除此之外,加法算子难以学到有效的高通滤波器,但是这两个特性对于图像处理任务非常重要。在此基础上,本文继而提出自连接加法单元和可学习的幂激活函数来调整特征分布、增强细节,有效解决该问题。实验表明,本文提出的加法超分网络可以有效减少2.5x能耗,并达到与原模型非常接近的效果。ReNAS: Relativistic Evaluation of Neural Architecture Search (Oral)一个有效的神经网络结构性能评估方案是神经网络结构搜索(NAS)成功的关键。现有NAS算法通常在训练时间有限的小型数据集上训练和评估神经结构。但这样一种粗糙的评估方式很难对神经网络结构进行准确评估。本文提出一种新的神经网络结构评价方案,旨在确定哪个神经网络结构的性能更好,而不是精确地预测性能绝对值。因此,我们提出了一个结构相对性能预测NAS (ReNAS)。我们将神经结构编码为特征张量,并利用预测器进一步细化表示。本方法可用于离散搜索,无需额外评估。在NASBench101数据集上抽样424个(搜索空间的0.1%)神经架构及其标签已经足够学习一个准确的架构性能预测器。在NAS-Bench-101和NAS-Bench-201数据集上,我们搜索的神经结构的准确性高于最新的方法,显示了本方法的优先性。Transformation Invariant Few-Shot Object Detection不同于以往基于元学习的小样本物体检测框架,本文从样本扩增的角度解决这一问题。本文提出了一种简单而有效的变换不变原则,它可以灵活地应用于各种元学习模型,以提高新类物体的检测性能。该方法通过对变换后图像的预测结果引入一致性正则,增强小样本物体检测模型的泛化能力。重要的是,这一方法可以处理未标记数据,从而解决半监督小样本物体检测问题。实验表明,本文提出的方法在标准小样本物体检测和半监督小样本物体检测上均有效。Joint-DetNAS: Upgrade Your Detector with NAS,Pruning and Dynamic DistillationJoint-DetNAS是一个融合了NAS、剪枝以及蒸馏的目标检测模型优化算法,由两个主要部分组成:a) 构建弹性教师模型池:通过一次渐进式收缩训练获得大量高质量模型,用于支撑教师模型搜索b)学生-教师网络联合优化:通过交迭搜索,动态寻找最优蒸馏组合。学生网络采用Network Morphism策略, 有效融合模型结构演化和剪枝技术。算法直接输出学生模型作为结果,无需额外训练。Joint-DetNAS搜索高效且优化效果显著:如对于R101-FPN模型,在FPS及FLOPS优化 50%的情况下,仍能有2.5%的AP提升。TransNAS-Bench-101: Improving Transferrability and Generalizability of Cross-Task Neural Architecture Search神经网络架构搜索(NAS)的最新突破将该领域的研究范围扩展到了更广泛的视觉任务和更多样化的搜索空间。现有的NAS方法大多是在单个任务上进行搜索,而跨任务搜索的算法正在涌现。为了降低计算成本和实验复杂性对跨任务算法研究的阻碍,本论文提出了TransNAS-Bench-101基准测试数据集。该数据集涵盖了图像分类、语义分割、自编码器等七个不同的视觉任务,并探索了两类不同的搜索空间:Cell-based搜索空间和Macro-based搜索空间。通过7,352个backbone在七个任务上的训练,我们提供了51,464个模型的详细训练数据。我们希望借助TransNAS-Bench-101来鼓励跨任务的NAS算法的出现,从而将跨任务搜索的效率和通用性提高到新的水平。Pre-Trained Image Processing Transformer随着现代硬件计算能力的快速增强,在大规模数据集上预训练的Transformer模型(例如BERT,GPT-3)表现出了巨大的潜力和超越传统模型的效果。我们提出了一种可用于底层视觉任务(例如,去噪,超分辨率和去雨)的预训练Transformer模型(IPT)。为了最大程度地挖掘Transformer的能力,我们利用具有大量自然图像的ImageNet数据集生成大量降质图像对,并在这些图像上使用多头和多尾机制对IPT模型进行预训练。另外,我们还引入了对比学习以来提升模型的泛化性能。我们提出的IPT模型可以在迅速微调后有效地用于不同的底层视觉任务中,并在多项任务上取得了SOTA的结果。Efficient Multi-Stage Video Denoising with Recurrent Spatio-Temporal Fusion论文提出了极简的视频去噪网络EMVD,旨在通过结合传统图像处理和深度学习构造高能效的像素级视频处理框架。基于时序融合、空间去噪和时空精细化等多阶段设计,结合可逆可学习变换,既递归地利用视频中自然固有的时空相关性渐进改善视频质量,又大大降低模型的复杂度。通过业界公开数据集和真实数据集评测,计算量仅5.38GFLOPS的EMVD精度和视觉效果超过300多倍计算量的SOTA网络模型,在硬件资源有限的终端设备上处理1080P视频可达50FPS,业界首次在终端设备上实现实时的高分辨率视频AI降噪算法。深度学习领域的图像降噪方法往往需要噪声图像和相应的干净图像配对来训练,然而在真实场景中构造训练配对是十分困难的。我们提出Neighbor2Neighbor:通过近邻采样,从含噪图像采样出两张“相似但不相同”的子图以构成配对数据来训练降噪网络,其中两张子图每个位置对应的像素在原噪声图像中都是近邻像素;同时,在损失函数中引入正则项来修正两张近邻子图“相似但不相同”导致的过度平滑问题。本方法仅需噪声图像数据集即可训练任意降噪网络,在RGB域合成数据和RAW域真实含噪图像数据集上均表现出优秀的降噪效果,性能接近基于“噪声-干净”图像配对进行训练的模型。相比于现有的自监督图像降噪方法,本方法既不需要构造配对数据的采集过程,也不需要改造网络结构,同时无需额外的噪声模型信息,在暗光人脸拍照、夜间户外拍照、医学图像降噪等场景具有较高的应用潜力。Focus on Local: Detecting Lane Marker from Bottom Up via Key Point当前车道线检测的主流方向分为基于分割和基于检测的方法两大类。前者生成像素级的语义类别并通过聚类生成不同实例的曲线,后者由每个锚点预测整根曲线,这两种方法都直接建模全局信息,存在聚类容易产生误差以及远端预测不准的问题。受到人体位姿估计方法的启发,我们首次将车道线检测转化为局部关键点估计及其关联问题,用距离信息建模局部关联关系。车道线局部建模相对于全局建模更加简单,复杂度更低,泛化性能更好。我们采用两个轻量化的模型,在车道线检测公开数据集CULane和TuSimple上取得了新的SOTA结果,另外在跨数据集的泛化性能上也展现出了相当大的优越性。综上,我们的方法证明了位姿估计方法在车道线检测中的应用潜力,为解决这一问题开辟了新的方向。AF2-S3Net: Attentive Feature Fusion with Adaptive Feature Selection for Sparse Semantic Segmentation Network激光雷达点云的语义分割可视为自动驾驶的基石功能之一,精确的分割结果可以辅助物体检测、定位等核心感知任务。针对LiDAR语义分割问题,AF2S3Net以3D稀疏神经网络为框架,通过多分支、多层级主动特征融合实现了全局空间语义与局部细节的动态叠加,在单个网络中实现了单点网络与3D卷积网络的有机统一。同时为了降低特征融合后产生的梯度噪声,各分支原始特征被投票后送入特征选择模块,该模块通过压缩赋权过滤了部分噪声特征列向量,从而进一步提升了网络稳定性和泛化能力。在SemanticKITTI和nuScenes两大重量级LiDAR数据集语义分割竞赛排行榜上,AF2S3Net斩获双料冠军。QPP: Real-Time Quantization Parameter Prediction for Deep Neural Networks深度神经网络的权重和特征的量化可以降低能耗,提升计算效率,有助于促进其在手机等设备上的应用。量化感知训练的方法通常可以达到较好的效果,但是需要完整的数据集,但是这一点很多情况下难以满足。非训练量化的方法通常需要一个比较耗时的量化参数计算过程,否则量化精度损失比较严重。本文提出一种量化参数预测的算法,称为QPP。通过部分训练数据或者无标签数据的学习,QPP预测器在给定网络输入的情况下可以准确预测激活值的量化参数。预测器在避免复杂计算的同时有效保持了原始模型的精度。因此,本文的方法结合了动态量化和静态量化的优点。本文将QPP算法用在两个标准的动态量化算法上,并在分类、分割、超分等视觉任务上进行了广泛的验证。iVPF: Numerical Invertible Volume Preserving Flows for Lossless Compression在存储领域,高效无损压缩由于可以有效降低存储介质成本,故被广泛研究。AI算法通过学习数据分布规律并根据数据规律进行压缩,具有压缩率高等有点,具备良好的研究和应用前景。可逆流模型(Flow model)能准确拟合概率分布,理论压缩比高,但由于浮点误差问题,不能直接用于无损压缩任务。本方案第一次提出基于保体积流模型(volume preserving flow)的无损压缩方法吗,具有压缩率高,压缩吞吐率大的优点。首先,设计保体积流算子的数值计算方法,消除数据和待压缩隐变量的误差,保证无损压缩正确性;其次,设计基于保体积流模型的压缩和解压算法,它能达到最优的理论压缩率上界,压缩比高,压缩吞吐率高。本方法在图像数据集取得了最优的压缩率性能。CausalVAE: Disentangled Representation Learning via Neural Structural Causal Models解耦表征学习旨在寻找低维的、由多个可解释因子组成的观测数据的隐表征。常用的变分自动编码器(VAE)的框架假设因子是独立的。然而,在实际场景中,具有语义的因素并不是必然独立的。相反,可能有一个潜在的描述这些因素相互依赖的因果结构。因此,我们提出了一个新的基于VAE的框架,名为因果VAE,其中包括带有因果结构的神经层,以此找到数据中的因果相关概念。在华为解耦数据集和真实数据集CelebA的实验表明,因果VAE学习的是语义上可解释的隐表征。我们可以控制某些语义因子,他们之间的信息可以通过表征之间的因果关系正确传递,生成反事实图片。本文来源:https://mp.weixin.qq.com/s/HeQbRdb4N7UJbKqD70qIyw
-
一年一度的计算机视觉顶会IEEE计算机视觉及模式识别大会CVPR录用结果最近公布。据悉,今年CVPR投稿量与论文接收量相对往年继续上升,有效投搞量达7015篇,接收论文1663篇,接收率23.7%,与往年相比略有上升。华为诺亚方舟实验室此次有30篇论文被接收,包括两篇Oral,其中主要由正式或者实习员工完成的工作有24篇,主要由高校合作方完成的工作有6篇。研究方向涵盖模型压缩和能耗高效、神经网络搜索、语义理解、底层视觉、自动驾驶、无损数据压缩、可解释AI等多个方面。诺亚方舟实验室的这些文章,体现出工业界需求与学术前沿的紧密结合,围绕业务中的迫切需求,结合最新学术进展提出创新性解决方案,也让学术研究能够有具体落地。如这些文章中包含了去年AdderNet算法的继续演进AdderSR,以及最近广为流传的IPT网络等。下面挑选一些本次CVPR接收的代表性论文进行介绍。CVPR 2021代表性工作介绍AdderSR: Towards Energy Efficient Image Super-Resolution本论文研究使用加法网络解决图像超分的问题,降低超分网络的能耗。由于任务的属性不同,直接将加法网络应用到超分任务上损失严重,本文对该问题进行了深入分析。首先,加法算子难以学到恒等映射;除此之外,加法算子难以学到有效的高通滤波器,但是这两个特性对于图像处理任务非常重要。在此基础上,本文继而提出自连接加法单元和可学习的幂激活函数来调整特征分布、增强细节,有效解决该问题。实验表明,本文提出的加法超分网络可以有效减少2.5x能耗,并达到与原模型非常接近的效果。ReNAS: Relativistic Evaluation of Neural Architecture Search (Oral)一个有效的神经网络结构性能评估方案是神经网络结构搜索(NAS)成功的关键。现有NAS算法通常在训练时间有限的小型数据集上训练和评估神经结构。但这样一种粗糙的评估方式很难对神经网络结构进行准确评估。本文提出一种新的神经网络结构评价方案,旨在确定哪个神经网络结构的性能更好,而不是精确地预测性能绝对值。因此,我们提出了一个结构相对性能预测NAS (ReNAS)。我们将神经结构编码为特征张量,并利用预测器进一步细化表示。本方法可用于离散搜索,无需额外评估。在NASBench101数据集上抽样424个(搜索空间的0.1%)神经架构及其标签已经足够学习一个准确的架构性能预测器。在NAS-Bench-101和NAS-Bench-201数据集上,我们搜索的神经结构的准确性高于最新的方法,显示了本方法的优先性。Transformation Invariant Few-Shot Object Detection不同于以往基于元学习的小样本物体检测框架,本文从样本扩增的角度解决这一问题。本文提出了一种简单而有效的变换不变原则,它可以灵活地应用于各种元学习模型,以提高新类物体的检测性能。该方法通过对变换后图像的预测结果引入一致性正则,增强小样本物体检测模型的泛化能力。重要的是,这一方法可以处理未标记数据,从而解决半监督小样本物体检测问题。实验表明,本文提出的方法在标准小样本物体检测和半监督小样本物体检测上均有效。Joint-DetNAS: Upgrade Your Detector with NAS,Pruning and Dynamic DistillationJoint-DetNAS是一个融合了NAS、剪枝以及蒸馏的目标检测模型优化算法,由两个主要部分组成:a) 构建弹性教师模型池:通过一次渐进式收缩训练获得大量高质量模型,用于支撑教师模型搜索b)学生-教师网络联合优化:通过交迭搜索,动态寻找最优蒸馏组合。学生网络采用Network Morphism策略, 有效融合模型结构演化和剪枝技术。算法直接输出学生模型作为结果,无需额外训练。Joint-DetNAS搜索高效且优化效果显著:如对于R101-FPN模型,在FPS及FLOPS优化 50%的情况下,仍能有2.5%的AP提升。TransNAS-Bench-101: Improving Transferrability and Generalizability of Cross-Task Neural Architecture Search神经网络架构搜索(NAS)的最新突破将该领域的研究范围扩展到了更广泛的视觉任务和更多样化的搜索空间。现有的NAS方法大多是在单个任务上进行搜索,而跨任务搜索的算法正在涌现。为了降低计算成本和实验复杂性对跨任务算法研究的阻碍,本论文提出了TransNAS-Bench-101基准测试数据集。该数据集涵盖了图像分类、语义分割、自编码器等七个不同的视觉任务,并探索了两类不同的搜索空间:Cell-based搜索空间和Macro-based搜索空间。通过7,352个backbone在七个任务上的训练,我们提供了51,464个模型的详细训练数据。我们希望借助TransNAS-Bench-101来鼓励跨任务的NAS算法的出现,从而将跨任务搜索的效率和通用性提高到新的水平。Pre-Trained Image Processing Transformer随着现代硬件计算能力的快速增强,在大规模数据集上预训练的Transformer模型(例如BERT,GPT-3)表现出了巨大的潜力和超越传统模型的效果。我们提出了一种可用于底层视觉任务(例如,去噪,超分辨率和去雨)的预训练Transformer模型(IPT)。为了最大程度地挖掘Transformer的能力,我们利用具有大量自然图像的ImageNet数据集生成大量降质图像对,并在这些图像上使用多头和多尾机制对IPT模型进行预训练。另外,我们还引入了对比学习以来提升模型的泛化性能。我们提出的IPT模型可以在迅速微调后有效地用于不同的底层视觉任务中,并在多项任务上取得了SOTA的结果。Efficient Multi-Stage Video Denoising with Recurrent Spatio-Temporal Fusion论文提出了极简的视频去噪网络EMVD,旨在通过结合传统图像处理和深度学习构造高能效的像素级视频处理框架。基于时序融合、空间去噪和时空精细化等多阶段设计,结合可逆可学习变换,既递归地利用视频中自然固有的时空相关性渐进改善视频质量,又大大降低模型的复杂度。通过业界公开数据集和真实数据集评测,计算量仅5.38GFLOPS的EMVD精度和视觉效果超过300多倍计算量的SOTA网络模型,在硬件资源有限的终端设备上处理1080P视频可达50FPS,业界首次在终端设备上实现实时的高分辨率视频AI降噪算法。深度学习领域的图像降噪方法往往需要噪声图像和相应的干净图像配对来训练,然而在真实场景中构造训练配对是十分困难的。我们提出Neighbor2Neighbor:通过近邻采样,从含噪图像采样出两张“相似但不相同”的子图以构成配对数据来训练降噪网络,其中两张子图每个位置对应的像素在原噪声图像中都是近邻像素;同时,在损失函数中引入正则项来修正两张近邻子图“相似但不相同”导致的过度平滑问题。本方法仅需噪声图像数据集即可训练任意降噪网络,在RGB域合成数据和RAW域真实含噪图像数据集上均表现出优秀的降噪效果,性能接近基于“噪声-干净”图像配对进行训练的模型。相比于现有的自监督图像降噪方法,本方法既不需要构造配对数据的采集过程,也不需要改造网络结构,同时无需额外的噪声模型信息,在暗光人脸拍照、夜间户外拍照、医学图像降噪等场景具有较高的应用潜力。Focus on Local: Detecting Lane Marker from Bottom Up via Key Point当前车道线检测的主流方向分为基于分割和基于检测的方法两大类。前者生成像素级的语义类别并通过聚类生成不同实例的曲线,后者由每个锚点预测整根曲线,这两种方法都直接建模全局信息,存在聚类容易产生误差以及远端预测不准的问题。受到人体位姿估计方法的启发,我们首次将车道线检测转化为局部关键点估计及其关联问题,用距离信息建模局部关联关系。车道线局部建模相对于全局建模更加简单,复杂度更低,泛化性能更好。我们采用两个轻量化的模型,在车道线检测公开数据集CULane和TuSimple上取得了新的SOTA结果,另外在跨数据集的泛化性能上也展现出了相当大的优越性。综上,我们的方法证明了位姿估计方法在车道线检测中的应用潜力,为解决这一问题开辟了新的方向。AF2-S3Net: Attentive Feature Fusion with Adaptive Feature Selection for Sparse Semantic Segmentation Network激光雷达点云的语义分割可视为自动驾驶的基石功能之一,精确的分割结果可以辅助物体检测、定位等核心感知任务。针对LiDAR语义分割问题,AF2S3Net以3D稀疏神经网络为框架,通过多分支、多层级主动特征融合实现了全局空间语义与局部细节的动态叠加,在单个网络中实现了单点网络与3D卷积网络的有机统一。同时为了降低特征融合后产生的梯度噪声,各分支原始特征被投票后送入特征选择模块,该模块通过压缩赋权过滤了部分噪声特征列向量,从而进一步提升了网络稳定性和泛化能力。在SemanticKITTI和nuScenes两大重量级LiDAR数据集语义分割竞赛排行榜上,AF2S3Net斩获双料冠军。QPP: Real-Time Quantization Parameter Prediction for Deep Neural Networks深度神经网络的权重和特征的量化可以降低能耗,提升计算效率,有助于促进其在手机等设备上的应用。量化感知训练的方法通常可以达到较好的效果,但是需要完整的数据集,但是这一点很多情况下难以满足。非训练量化的方法通常需要一个比较耗时的量化参数计算过程,否则量化精度损失比较严重。本文提出一种量化参数预测的算法,称为QPP。通过部分训练数据或者无标签数据的学习,QPP预测器在给定网络输入的情况下可以准确预测激活值的量化参数。预测器在避免复杂计算的同时有效保持了原始模型的精度。因此,本文的方法结合了动态量化和静态量化的优点。本文将QPP算法用在两个标准的动态量化算法上,并在分类、分割、超分等视觉任务上进行了广泛的验证。iVPF: Numerical Invertible Volume Preserving Flows for Lossless Compression在存储领域,高效无损压缩由于可以有效降低存储介质成本,故被广泛研究。AI算法通过学习数据分布规律并根据数据规律进行压缩,具有压缩率高等有点,具备良好的研究和应用前景。可逆流模型(Flow model)能准确拟合概率分布,理论压缩比高,但由于浮点误差问题,不能直接用于无损压缩任务。本方案第一次提出基于保体积流模型(volume preserving flow)的无损压缩方法吗,具有压缩率高,压缩吞吐率大的优点。首先,设计保体积流算子的数值计算方法,消除数据和待压缩隐变量的误差,保证无损压缩正确性;其次,设计基于保体积流模型的压缩和解压算法,它能达到最优的理论压缩率上界,压缩比高,压缩吞吐率高。本方法在图像数据集取得了最优的压缩率性能。CausalVAE: Disentangled Representation Learning via Neural Structural Causal Models解耦表征学习旨在寻找低维的、由多个可解释因子组成的观测数据的隐表征。常用的变分自动编码器(VAE)的框架假设因子是独立的。然而,在实际场景中,具有语义的因素并不是必然独立的。相反,可能有一个潜在的描述这些因素相互依赖的因果结构。因此,我们提出了一个新的基于VAE的框架,名为因果VAE,其中包括带有因果结构的神经层,以此找到数据中的因果相关概念。在华为解耦数据集和真实数据集CelebA的实验表明,因果VAE学习的是语义上可解释的隐表征。我们可以控制某些语义因子,他们之间的信息可以通过表征之间的因果关系正确传递,生成反事实图片。本文来源:https://mp.weixin.qq.com/s/HeQbRdb4N7UJbKqD70qIyw
-
华为诺亚方舟实验室网络大脑和因果研究团队基于在机器学习和信息论研究方面的积累,利用核均值嵌入方法(kernel mean embedding)和大偏差理论中的Sanov’s定理,第一次从理论上证明了在非有限样本空间上的单样本检验的全局最优性质,(基本)解决了信息论和统计中的一个长期开放的问题(追溯到W. Hoeffding在1965年的工作)。同时建立了扩展的Sanov’s定理,从而证明了一般情况下的双样本检验的全局最优性。该工作“Asymptotically Optimal One- and Two-Sample Testing with Kernels”经过近一年半的评审,已被IEEE顶刊IEEE Transactions on Information Theory接收。论文地址为:https://arxiv.org/abs/1908.10037(单栏),http://dx.doi.org/10.1109/TIT.2021.3059267(双栏)。背景我们考虑统计假设检验中两个基础问题:单样本和双样本检验。在单样本问题(one-sample or goodness-of-fit testing)中,我们会给定某个分布P(例如高斯分布)和样本,目标是判断是否由该分布产生。我们用Q来表示对应的真实但是未知的分布,该问题可转化为一个假设检验问题:。双样本问题(two-sample or homogeneity testing)中,给定样本和,目标是判断和是否由同一个分布产生。如果我们用P和Q分别表示样本的潜在分布,那我们同样考虑一个假设检验问题:。 单样本和双样本问题有很长的历史,在实际中也有非常广泛的应用。异常检测中,异常样本通常认为是来自和正常分布不同的分布。在变化点检测中,变化点之前的样本分布与变化前的分布不一样。通过将观察的样本与随机打乱的版本进行比较,可以将双样本检验应用于(条件)独立性测试,这对因果发现中一大类的方法(constraint-based methods)会很有帮助。其他的例子包括认知无线电中的频谱感知,生成模型中判别构造样本和实际样本的相似度,以及衡量MCMC方法生成的样本的质量等。 我们考虑非参数检验场景,并且假设没有关于未知分布(单样本问题中的Q,双样本问题中的P和Q)的先验知识。在这种情况下,通常的方法是基于一定的概率距离度量:只有两个分布相同时概率距离才为0,因此基于样本估计的统计量越大则表明P和Q越倾向于不同,即更倾向成立。已有的例子包括最早的Kolmogorov-Smirnov distance,total variation,Wasserstein distance,Kullback-Leibler divergence(KLD),以及近些年提出的maximum mean discrepancy(MMD)和kernel Stein discrepancy (KSD)等基于核方法的概率距离度量。目前存在很多单样本和双样本检验,一个自然的问题是如何从衡量一个方法的好坏,更进一步的是找到或者设计最优的检测。在单样本问题上,W. Hoeffding在1965年的一个工作里提出了一种衡量准则。假设样本是i.i.d.的,在简单假设检验问题中(即假设P和Q已知,判断样本是由哪个分布产生),似然比检验(likelihood ratio test)可以在给定第一类错误概率的约束取得最小的第二类错误概率。Chernoff-Stein引理进一步证明了第二类错误概率可以随着样本数量的增长而指数衰减到0,并且最优的指数速率为P和Q之间的KLD,记为。因此,Hoeffding提出了一个最优的标准:是否存在这样一个单样本检验,在满足第一类错误概率的约束下,对于任意真实的Q(只要),都可以实现和简单假设检验问题中同样的最优指数速率?上述问题在信息论中被称为universal hypothesis testing。Hoeffding证明了似然比检验在此条件下的全局最优性,但是该结果只有当概率分布的样本空间为有限集的时候才成立。Hoeffding的结果吸引了很多后续的工作(如下[2]-[6]),尝试将上述结果扩展到更一般的样本空间(例如实数集),但是已有的工作通常是考虑某种弱化的标准或者假设检验问题,并且所提出的方法在实际中很难使用。如何在非有限样本空间上达到同样的全局最优性仍然是个开放的问题。值得注意的是,在非有限样本空间上,即便是存在性(achievability),即是否存在这样一个全局最优的单样本检验,也是个未知的问题。[1] W. Hoeffding, “Asymptotically optimal tests for multinomial distributions,” The Annals of Mathematical Statistics, 1965.[2] G. Tusnady, “On asymptotically optimal tests,” The Annals ofStatistics, 1977.[3] O. Zeitouni and M. Gutman, “On universal hypothesis testing vialarge deviations,” IEEE Trans. Inf. Theory, 1991.[4] M. Feder and N. Merhav, “Universal composite hypothesis testing:A competitive minimax approach,” IEEE Trans. Inf. Theory, 2002.[5] J. Unnikrishnan, D. Huang, S. P. Meyn, A. Surana, and V. V.Veeravalli, “Universal and composite hypothesis testing via mismatched divergence,” IEEE Trans. Inf. Theory, 2011.[6] P. Yang and B. Chen, “Robust Kullback-Leibler divergence anduniversal hypothesis testing for continuous distributions,” IEEE Trans. Inf.Theory, 2019.问题描述我们主要以单样本检验为例。考虑概率分布的样本空间为Polish空间(例如),给定某个分布和样本,目标是判断是否由该分布产生。我们用来表示对应的真实但是未知的分布,该问题可转化为一个假设检验问题:。我们可以将一个单样本检验表示为,当成立时,则判断成立。对于一个给定的单样本检验,我们考虑两类错误:当真实的分布满足、但检验判别为,此类错误被称为第一类错误(type-Ierror or false positive);第二类错误(type-II error or false negative)发生是为真但判别为。我们将两类错误的概率分别表示为: 注意这里的第二类错误概率依赖真实的但是未知的分布Q。通常第一类和第二类错误概率不能同时最小化,一个常用的策略是Neyman-Person准则,即给定第一类错误概率约束条件,目标最小化第二类错误概率。如上述介绍,这里我们关心的是指数收敛速率: 上述极限也被称为错误指数(error exponent),经常用在信息论中信源编码和信道编码等问题中,并且和其他两个渐进统计指标,Chernoff index和Bahadur slope有很强的联系。在Hoeffding全局最优的结果上,我们的目标是寻找一个单样本检验,对于任意一个潜在的分布,都满足如下条件: 主要贡献我们首先利用大偏差理论中的Sanov’s定理和KLD的下半连续性,得到满足全局最优的一个充分条件: 这里表示样本的经验概率测量(empiricalmeasure),条件a)是第一类错误的约束,条件b)需要一个弱收敛的概率距离。目前大部分的概率距离测量例如KLD,total variation distance都不满足b),而Wasserstein distance,Levy metric等距离尽管具有弱收敛性,但是他们的样本估计通常不好计算,并且很难找到一个合适的阈值使得条件a)成立。显然,上述充分条件的关键是寻找一个合适的概率距离。 与此同时,机器学习领域中一个广泛研究的方向是基于核方法的概率距离,例如MMD和KSD等,然而目前的统计刻画结果通常依赖于具体的核函数,因此并非最优。基于上述定理和已有对这些概率距离的研究结果,我们第一次从理论上证明了在非有限样本空间上单样本检验的全局最优性。基于MMD的插入单样本检验(plug-in test)我们首先考虑直接带入观测样本的MMD统计量。假设样本空间为Polish, locally compact and Hausdorff(包括),并且核函数满足有界、连续和characteristic的性质。那么以下单样本检验的第一类错误概率满足约束条件,并且达到最优的第二类错误指数:这里,核函数可以为高斯或者拉帕拉斯核函数。虽然该检验的构造比较直接和简单,但实际中需要计算关于的积分。如果是非高斯的,显式表达式可能不太容易得到,下一个单样本检验方法则不需要计算这些积分。基于双样本检验的单样本检验我们从给定的分布中抽样得到个i.i.d.样本,考虑如下检验: 我们证明了只要样本数量随着,满足,那么以上检验也可以实现单样本检验的全局最优性。基于KSD的单样本检验当给定的概率分布比较复杂的时候,获得i.i.d.样本同样可能不太容易。KSD(kernel Steindiscrepancy)是近年提出的基于Stein变换再生核希尔伯特空间(RKHS)函数构建的统计量。KSD在下的期望值为零,并且不需要计算积分或样本抽样。在放松第一类错误的约束(只需要渐进满足给定的约束)的条件下,我们证明了基于KSD的单样本检验同样可以达到最优的第二类错误指数。但是该结果需要关于概率分布和核函数更强的假设,具体细节请参见文章。双样本检验我们将全局最优性准则扩展到双样本检验的问题中。和单样本问题不同的是,现有的研究并没有建立双样本问题下的最优第二类错误指数。因此,我们首先证明了在第一类错误概率约束下的最优的第二类错误指数为: 这里, ,并且假设。然而,单样本问题下全局最优的充分条件并不适用,因为Sanov’s定理只适用于一个概率分布的情况。为此,我们建立了扩展的Sanov’s定理,从而证明了一般情况下基于MMD的双样本检验的全局最优性。细节请参见文章。结语我们第一次从理论上证明了单样本检验在非有限样本空间(具体的,Polish, locally compact and Hausdorff space)上的全局最优性,(基本)解决了信息论和统计中的一个长期开放的问题。同时建立了扩展的Sanov’s定理,证明了一般情况下的双样本检验的全局最优性。未来的一个工作是将现在的结果扩展到Polish空间。目前我们的证明框架和Sanov’s定理在Polish空间上也是适用的,如果能够找到一个合适的概率距离,我们相信全局最优结果在Polish样本空间会同样成立。 我们团队目前主要从事因果推理和发现相关的基础研究和应用(例如推荐、根因发现、解耦表征、RL等),欢迎有兴趣加入我们的同学发送简历至zhushengyu@huawei.com。
-
Transformer结构被广泛地应用在各类NLP任务上。Transformer结构除去位置编码将不能建模输入的顺序,所以位置编码及其重要。在现有的预训练模型中,已经发展出了多种位置编码(例如:完全可学习的位置编码[6],固定的三角函数式位置编码[12],相对位置编码[13]等),试验上都有不错的表现,但当前学界对位置编码仍然没有较系统性的对比和研究,缺少一个统一的框架来理解和评价这些位置编码。在我们最新的ICLR-2021《On Position Embeddings in BERT》工作中,提出了统一的框架来探究各种不同的位置编码。首先我们对位置编码特性所应具有的一些原则性上的属性(平移不变、单调和对称性)进行了形式化的表述,对现有的位置编码在何种程度上满足上述属性进行了归类,并定量地评估了这些属性如何对不同类型的下游任务造成影响。本文发现,完全可学习的位置编码在整句分类场景表现优秀;相对位置编码则在span prediction(比如:阅读理解任务SQuAD)上效果更佳,这是由于其能更好地满足位置编码的理想属性。最后,本文给出了基于上述发现的经验性总结:[CLS]所在位置编码和普通token的位置编码进行解耦更加有利于下游任务表现;满足位置编码的平移不变性和单调性尤为重要,而不必要严格满足对称性。本文已经被ICLR 2021接受,链接如下:https://openreview.net/forum?id=onxoVA9FxMw研究背景Transformer结构因其在更多的数据和更大的参数规模下依然有着不俗的表现,已经在预训练语言模型中大放光彩,这股风潮甚至开始蔓延到计算机视觉、蛋白质结构预测等领域。Transformer结构中的重要组件是自注意力机制:通过Q向量和K向量的点积计算所有输入序列中token两两之间的注意力,并以此来线性加权得到V向量,并通过FFN(Feed-Forward Network)对V向量做一些非线性变化。在layer normalization,残差连接,dropout等技巧帮助下,可以使得模型更容易做到更深,增大参数量,为模型赋予更强的表达能力。Transformer结构的自注意力机制也自然地导致了网络结构本身是对输入token的位置和顺序不敏感,若在Transformer输入的embedding中去掉位置编码(Position Embedding, PE),Transformer将退化成一个词袋模型—任意变换输入token的位置,其输出保持不变。 虽说位置编码在Transformer中不可或缺,但是大家用起来却参差不齐,不一而足。一众国内外炼丹师们目前在不同的模型上试用了不同的配方:ModelsPE typesTransformers (machine translation)fixed sinusoidal APEsBERT/Roberta/Albert/BART/GPT/Electra, etc.fully-learnable APEsT5relative position biasesvanilla RPE (machine translation)fully-learnable RPEsXLNET/NEZHAfixed sinusoidal RPEAPE和RPE分别指绝对位置编码(Absolute PE)和相对位置编码(Relative PE),其区别在于在计算两两token的注意力时,是根据两个token在输入序列中对应的绝对位置,或是根据一个token到另一个token的之间的距离。两种典型的APE和RPE的实现方式如下所示:典型的位置编码PE的参数化主要可分为两种方式:1)完全可学习的PE;2)不可学习的三角函数参数化的PE。为了在研究中对PE的种类进行更全面的覆盖,我们提出了一个综合了上述两种方式的PE—半可学习的三角函数PE,称为“learnable sinusoidal PE”,将原始三角函数PE中固定的角频率(固定为)修改为可以训练参数的角频率。将APE和RPE分别以上述三种不同的参数化方法实现,我们得到了如下表所示的六种不同形式的PE:本文分别使用这六种不同形式的PE替换预训练好的BERT base模型中的PE,并在替换后使用相同的预训练任务对的模型继续训练了5至7个epoch。为公平比较,同时原始的BERT-base的fully learnable APE也接着训练了相同的epoch数。所以他们通用的模式到底是什么?位置编码的通用DesiderataDesiderata是拉丁语“thing desired” ,这里我们想了解“任意一组向量满足如何的性质才能成为一个不错的位置编码”。那么我们首先重新回顾一下位置编码是什么? 位置编码可以被定义成一个从的映射。将原始的整数形式的位置表示映射成向量空间里面的向量。如果把他看成一个经典的表示学习(representation learning)的问题。左边的位置编码是在一根数轴上的整数,右边是预训练后的BERT-base中的fully-learnable APE形式的位置编码,通过T-SNE降维并可视化到二维平面上。我们发现向量化的位置编码经由预训练后,仍一定程度上保留着整数空间上的邻近关系。更加形式化地,我们对向量化的PE所所需的属性做出如下假设: 假设1:如果位置x和位置y更近(整数位置上),那么在向量空间上他们的向量表示更接近;如果位置x和位置y更远(整数位置上),那么在向量空间上他们的向量表示也更远。 假设1可以简单概括为单调性:即两个位置向量的相似度,随着其所表示的位置在原始整数空间上距离的增加单调递减。假设2:若两个位置向量对在整数空间上距离相同,那么其在向量空间的相似度也相同,与其绝对位置无关。文献[11]根据假设2和位置向量有界假设导出了一个形式优美的复数的位置向量,该位置向量等于是在极坐标上以词向量为半径,根据位置长短对其做了一个旋转。这是一个非常强的假设,而且其背后也有很强的归纳偏置。假设2意味着,任意一个词/词组/子句/句子的含义与其所在的绝对位置无关,而只关心它们与其他单元的相对距离(词/词组/子句/句子)。这个假设的另一个动机来自于BERT的数据预处理机制:token的绝对位置是任意可替换的 — 例如第二个句子的绝对位置依赖于第一个句子的长度;当句子长度超过给定长度时,句首有多少词被随机丢掉了。因此一些随机因素可以导致token的绝对位置的偏移,其绝对位置并不能带来多少信息量。 假设3:相似度和距离定义本身是对称的。而且对方向有什么额外的先验假设,假设其是对称的。这样我们得到了单调性、平移不变性和对称性。然后我们研究一下存在的位置编码是否满足这些原则上的属性。定量分析位置编码的属性虽然完全可学习的位置编码,没有任何假设和约束,难以分析其属性。但是我们可以做一些马后炮式分析,把学好的位置编码拿出来看看。首先我们需要一个简单的函数来度量两个位置向量之间的距离或者相似度,一个简单的指标是直接算两个位置向量的点积,但是在Transformer中,他们的交互是比较复杂的,同时和 和相关。这儿我们尝试直接用attention矩阵来检验位置向量之间的关系如上式子,但是计算两个词的attention时候同时也会考虑词语之间的关系。这样我们提出一个新的probing任务:给BERT喂进去128个相同的词,这样attention矩阵就会主要体现位置向量的关系—以及位置向量在平均意义上给attention矩阵额外带来的bias。这里我们的probing测试选取第一层的attention的矩阵,并采样一些词给attention矩阵做平均。取第一层的attention而不是选取其他层的原因是因为,研究发现越底层的transformer跟位置相关性更大,参见 [4].以上是attention矩阵没有softmax激活之前平均,激活后的平均请参看文章附录。我们看到,没有位置编码的时候,位置将不会对attention计算带来很直接的影响。后面大家可以看到不同的位置编码都或多或少有一些通用模式:颜色由对角线向两边逐渐变浅,左上到右下方向颜色一致,基本对称,分别对应于我们的三个属性。为了进一步定量分析上述的性质,我们提出了三个量化的指标(定义见附录),结果如下主要观察如下:1. 如果不装配位置编码,注意力机制对不同位置几乎没有任何有规律的倾向; 2. 装配几乎所有不同位置编码的BERT在考虑20位置偏移以内都较好地满足单调性;考虑更长位置编码,单调性满足地更差 -- 这大致因为模型对更长位置的attending不敏感。 3. 在不考虑特殊token([CLS])所在的位置时,所有BERT模型会更好地满足平移不变性满。特别是完全可学习的位置编码(fully-learnable APE)考虑CLS时满足地不好,但是去掉之后却满足得很好。-- [CLS] 所在的位置和普通token所在的位置并不兼容。 4. 对称性大体满足,但是都在平均意义上稍微更多地attend到前面的词。 不同位置编码在GLUE和SQuAD上结果我们把不同位置编码拉到GLUE 和Squad上练练,任务均使用标准设置,我们报告了Dev上的均值和标准差(五个不同随机种子求平均)如上表所示,从GLUE结果的平均值(去掉WNLI结果)来看,BERT原来的完全可学习的位置编码的结果相当不错,仅仅比一种APE和RPE混合版本低一点(但是其没有统计显著性)。可以看到完全可学习的位置编码在分类任务上优势很大。但是在SQuAD任务上,BERT原来的位置编码几乎是最差的结果(仅仅好于fixed sin. APE)。 也就是说BERT完全可学习的APE位置编码在分类任务上有优势,但是在spanprediction上表现不佳。 完全可学习的APE在两种不同任务的结果上的差异,本文认为其体现在对[CLS]的处理上,在完全可学习的APE(BERT-style)中,[CLS]所在的位置向量(也就是第一个位置向量)和正常的位置向量是是相互独立的。但是其他的位置编码(如sin. APE或者所有RPE)在参数化的时候就将[CLS]当成了一个正常的位置向量,比如参数化时其满足平移不变性;但是并非如此,[CLS]的位置不会平移,一直都是在第一个位置。 另外,在去掉了位置编码后,GLUE的结果有所下降,但是其结果下降幅度相对不大,但是在SQuAD中结果下降幅度很大,这也侧面说明分类任务本身对位置的敏感程度不及span prediction。当前分类用的时只用到[CLS]位置输出的隐层变量,但是span prediction用到了所有token的位置输出的隐层变量。关于不同任务对位置编码不同敏感程度也可以从[4]中看到。 一些其他的小发现如下: 1. 在sinusoidal APE,学习频率可以稳定提升结果,但是提升的幅度不一定显著。 2. 在span prediction任务上,结合APE和RPE可以稍微提升结果。在分类任务上其结合的优势不一定观察到 3. RPE 并不适合用sinusoidal参数化,其中一个原因是,模型对远距离的相对位置向量不敏感,实际训练后的结果比20偏移更大的相对位置向量(不管前向还是后向)非常相似(其cosine similarity 接近0.95),这些现象不能通过sinusoidal 参数化体现。属性如何影响结果根据以上13种不同位置编码的probing的结果,我们可以定量地得到这13种位置编码多大程度上违背我们定义的属性,我们还计算了这些定量的属性可以跟他们在不同任务上结果之间的相关性(Pearson correlation)如下我们可以观察到:1. 在二十个偏移内,违背单调性对GLUE和SQuAD结果均有害 2. 不考虑特殊tokens,违背平移不变性对GLUE和SQuAD结果均有害 3. 违背对称性和方向平衡性对GLUE和SQuAD结果均有益 结果是较近偏移内的单调性和不考虑特殊token的平移不变性应该是是位置编码的通用模式 ,但是不同场景(不容任务,不同语言)对方向性和对称性的需求不相同,一般不需要绝对的对称性。什么是理想的PE本文的结论是说理想的PE应该有如下两个性质 1. 普通token所在的位置向量和[CLS]所在的位置向量解耦; 2. 可以在L个位置附加一种position bias,比如计算attention的时候,得到一个的attention map时附加一个position bias 如下:且对应到我们的属性为:完全满足单调性和平移不变性,且不要求对称性。为了简单检验我们这么一个朴素的假设,我们测试了T5中的position bias,输出了其中encoder的position bias如下: 左图时T5 small setting 右图时T5-3B setting(见[9])。多头position bias的平均值,与理想的三条属性相同,唯一的一个多的模式在于:词基本不喜欢attend他们自己(在T-3B扩展到附近的几个词),在本文中称为”white band effect“,同时见于Kevin et.al;其具体的原因还不明确。其他场景的位置编码我们同时比较了Encoder-only, Encoder-decoder(英法翻译)和Decoder中的位置编码probing的结果与Encoder-only 不同的是 1)Decoder 会额外attend最前面的词;越到后面的词需要参看相对偏移更大范围的词;不会attend到后面的词防止信息泄露 2)Encode-Decoder里的Encoder,词会额外attend更多后面的词而不是前面的词,这与BERT相反;当然这个翻译的语言有关,本文是用的英法翻译模型,其他语言还未测试。 以一个有趣开放的问题作为结束,从CV里面的二维位置编码(下图来自[10])中,大家是否可以观察到一些简单的平移不变性,单调性? [1] Clark, Kevin, Urvashi Khandelwal,Omer Levy, and Christopher D. Manning. "What does bert look at? an analysis of BERT's attention." arXiv preprint arXiv:1906.04341 (2019).[2] Wang, Yu-An, and Yun-Nung Chen."What Do Position Embeddings Learn? An Empirical Study of Pre-Trained Language Model Positional Encoding." arXiv preprint arXiv:2010.04903(2020).[3] Ke, Guolin, Di He, and Tie-Yan Liu."Rethinking the Positional Encoding in Language Pre-training." arXiv preprint arXiv:2006.15595 (2020).[4] Shane Steinert-Threlkeld Special Topic 1: Analysis of positional embeddings (Group 9) [LING 575: Analyzing Neural Language Models Win '20] (https://www.shane.st/teaching/575/win20/index.html#page-top)[5] Amirhossein Kazemnejad's Blog,Transformer Architecture: The Positional Encoding.https://kazemnejad.com/blog/transformerarchitecturepositional_encoding/[6] Gehring, Jonas, Michael Auli, David Grangier, Denis Yarats, and Yann N. Dauphin. "Convolutional sequence to sequence learning." In International Conference on Machine Learning, pp. 1243-1252. PMLR, 2017.[7] Benyou Wang, Lifeng Shang, Christina Lioma, Xin Jiang,Hao Yang, Qun Liu, Jakob Grue Simonsen On Position Embeddings in BERT, accepted in ICLR 2021.[8] Giambattista Parascandolo, Heikki Huttunen,Tuomas Virtanen Taming the waves: sine as activation function in deep neural networks. 2017[9] T5-3b checkpoint https://huggingface.co/t5-3b and T5-small: https://huggingface.co/t5-small[10] Alexey Dosovitskiy, Lucas Beyer,Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner,Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, Neil Houlsby. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR 2021.[11] Benyou Wang, Donghao Zhao, Christina Lioma, Qiuchi Li, Peng Zhang, Jakob Grue Simonsen. Encoding word order in complex embeddings. ICLR 2020[12] Vaswani, Ashish, Noam Shazeer, NikiParmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, and Illia Polosukhin. "Attention is all you need." In Proceedings of the 31st International Conference on Neural Information Processing Systems, pp.6000-6010. 2017.[13]Shaw, Peter, Jakob Uszkoreit, and Ashish Vaswani. "Self-Attention with Relative Position Representations." In Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers), pp. 464-468.2018.位置编码相关博客推荐苏剑林的 https://kexue.fm/archives/8130夕小瑶的卖萌屋的 https://zhuanlan.zhihu.com/p/121126531Hinrich Schütze组的综述:Position Information in Transformers: An Overview https://arxiv.org/abs/2102.11090
-
描述本模型基于以下数据集和算法训练而来:数据集:23类美食图片分类数据集算法:图像分类-ResNet_v1_50模型的预测结果格式是:{ "predicted_label": "美食_贵妃鸡翅", "scores": [ [ "美食_贵妃鸡翅", "0.999" ], [ "美食_八宝玫瑰镜糕", "0.000" ], [ "美食_凉皮", "0.000" ], [ "美食_凉鱼", "0.000" ], [ "美食_德懋恭水晶饼", "0.000" ] ] }交付交付方式华为云ModelArts交付区域华北-北京一、华北-北京四、华东-上海一、华东-上海二、华南-广州、亚太-**
-
描述本模型基于以下数据集和算法训练而来:数据集:二分类猫狗图片分类小数据集算法:图像分类ResNet50-EI-Backbone模型的预测结果格式是:{ "predicted_label": "dog", "scores": [ [ "dog", "0.821" ], [ "cat", "0.179" ] ] }交付交付方式华为云ModelArts交付区域华北-北京一、华北-北京四、华东-上海一、华东-上海二、华南-广州、亚太-**
-
描述Fast-SCNN(图像分割/Pytorch)1. 概述此模型基于Fast-SCNN: Fast Semantic Segmentation Network中提出的模型结构实现,该算法会载入在Cityscape上的预训练模型,在用户数据集上做迁移学习。我们提供了训练代码和可用于训练的模型,用于实际场景的微调训练。训练后生成的模型可直接在ModelArts平台部署成在线服务。图像分割的评估手段一般使用mIOU指标,详细说明请参考:https://github.com/mcordts/cityscapesScripts#evaluation本算法的其他信息如下表所示:项目说明参考论文Fast-SCNN: Fast Semantic Segmentation Network使用框架Pytorch-1.4.0训练集Cityscapes leftImg8bit_trainvaltest.zip中的train set训练总epoch数1200训练batch_size使用6卡训练,每张卡TRAIN_BATCH_SIZE = 2,相当于总batch_size为12训练硬件及耗时6*v100,11.7小时测试集Cityscapes leftImg8bit_trainvaltest.zip中的test set推理硬件及速度CPU,2.6s/pic输入图像尺寸1024*2048*3原论文准确率mIOU=68.62本算法准确率mIOU=68.6682、训练2.1. 算法基本信息任务类型:图像分割支持的框架引擎:PyTorch-1.4.0-python3.6算法输入:存储在OBS上的数据集,必须按照Cityscape数据集的格式进行存储,详情请查看下文第4节案例指导Cityscape预训练模型,在Cityscape上的mIOU是68.668算法输出:用于Pytorch推理的pth模型,CPU推理速度:2.6s/pic代码结构src |- pre-trained_weights |- Fast-SCNN无预训练模型,此文件夹为空 |- trained_model |- model |- segmentron |- ... |- config.yaml |- config.json |- customize_service.py |- best_model.pth |- configs # 配置文件,包含除fast-scnn外的其他算法 |- cityscapes_fast_scnn.yaml |- ... |- segmentron # 开源包、模型构建、数据集加载等文件 |- ... |- tools |- train.py # 执行训练 |- eval.py # 在验证集上验证,输出伪彩色结果图像和评估结果 |- eval_txt.py # 在验证集上验证,输出结果保存为txt |- run.py # 启动文件,根据超参数启动train或eval |- demo.py2.2. 训练参数说明名称默认值类型是否必填是否可修改描述num_nodes1int是是训练使用 GPU 数cuda_visiable0string是是GPU 编号,如果选择多卡,则需要按照“0,1,2,3”的格式填写config_fileconfigs/cityscapes_fast_scnn.yamlstring否是配置文件路径,支持配置为OBS上的某个路径,不配置时,默认路径为本算法代码内的路径train_epochs10int是是总训练轮数(cityscape数据集上建议设置为1000以上);设置为0时,不进行训练,直接将本算法mIOU达到68.668的模型保存到输出路径。train_batch_size12int是是训练时每块GPU指定的图片数(例如默认使用单卡时设置为12,而使用6卡时应当设置为2以保证总batchsize=2*6=12)。solver_lr0.045string否是base 学习率solver_auxTruestring否是是否使用辅助训练solver_aux_weight0.4string否是辅助训练权重load_weighttrained_model/model/best_model.pthstring否是pth模型文件路径,支持加载OBS上的pth模型进行训练,默认路径时支持加载本算法达到mIOU=68.668的模型作为初始化参数;支持设置为中间过程保存的模型进行断点续训;设置为None时直接进行训练(train from scratch).evalFalsestring否是是否进行模型评估,默认为False,如果设为True,则必须设定load_weight参数,加载指定的pth模型,在创建训练作业时指定的数据存储位置验证集上进行预测,所有预测结果pred_results及模型评估结果eval_result.txt将保存到创建训练作业时指定的训练输出位置上注1:设置load_weight时,支持两种保存形式的模型训练完成后保存的最佳模型best_model.pth,只保存模型参数 |- learning_to_downsample.conv.conv.weight |- ... |- learning_to_downsample.conv.bn.weight |- ... |- learning_to_downsample.conv.bn.bias |- ... |- learning_to_downsample.conv.bn.running_mean |- ... |- learning_to_downsample.conv.bn.running_mean |- ... |- learning_to_downsample.conv.bn.num_batches_tracked |- ... |- ...中间过程保存的模型,除模型参数外,保存优化器、学习率、epoch等参数; 例如 2.pth |- epoch # 此模型文件保存时已训练的epoch数 |- state_dict # 模型参数,与上文best_model.pth结构一致 |-... |- optimizer # 优化器参数 |- lr_scheduler # 学习率参数(包含学习率衰减) 加载该模型时,会从该模型所属的epoch开始训练,设置的epoch数应与原来一致。 例如:2.pth为某次总epoch数为10时训练过程中第2个epoch保存的模型,则load_weight设置为2.pth时,训练将从第2个epoch开始,且此时epoch也应设置为10。该功能用于断点续训。注2:自定义config文件时,可先设定epoch为0将本算法model文件夹保存至自己的OBS,然后按照该文件夹里的config.yaml格式进行编写。其中TEST.TEST_MODEL_PATH请设置为’./best_model.pth’用于部署。2.3. 训练输出文件训练完成后的输出文件如下:|- model |- segmentron |- ... |- config.yaml # 模型配置文件,和训练使用的配置文件一致;自定义配置文件可参考该文件 |- config.json |- customize_service.py |- best_model.pth |- xxxx.pth |- xxxx.pth |- ...如果设置eval为True,输出文件如下:|- model |- segmentron |-... |- config.yaml |- config.json |- customize_service.py |- best_model.pth |- eval_results |- eval_results.txt |- frankfurt_000000_000294_leftImg8bit.png |- frankfurt_000000_000576_leftImg8bit.png |- ... |- ...3. GPU/CPU推理元模型来源 选择 从训练中选择,选择训练作业及版本。注意:推理配置文件model/config.json中的runtime字段为pytorch1.4-python3.7,表示该模型可同时在CPU或GPU运行。4. 案例指导本算法的详细使用方法,请查看《ModelArts AI Gallery算法Fast-SCNN使用指导》。交付交付方式华为云ModelArts交付区域华北-北京一、华北-北京四、华东-上海一、华南-广州、亚太-**
-
描述DynamicRCNN(图像目标检测/Pytorch)1. 概述此模型基于Dynamic R-CNN: Towards High Quality Object Detection via Dynamic Training中突出的模型结构实现,该算法可以载入预训练好的,达到论文精度的模型作为特征提取网络,可以在用户的数据集上进行训练,用于其他场景的预测。训练后生成的模型可以直接在modelArts平台部署成在线服务。图像目标检测的评估手段一般使用mAp,详细说明请参考:coco数据集评价指标本算法的其他信息如下表所示:项目说明参考论文Dynamic R-CNN: Towards High Quality Object Detection via Dynamic Training使用框架Pytorch-1.0.0-python3.6训练集COCO 2017 train训练总iteration数270k训练batch_size使用8卡训练,每张卡IMS_PER_GPU = 2,相当于总batch_size为16训练硬件及耗时8*v100,54.9小时测试集COCO 2017test-dev推理硬件及速度GPU,2.3s/pic(GPU型号v100NV32)输入图像尺寸multi-scale训练,有400*400,600*600,800*800,1000*1000,1200*1200五种,可以支持多尺度原论文准确率mAP=49.2本算法准确率map=49.22. 训练2.1 算法基本信息任务类型:目标检测支持的框架引擎:Pytorch-1.0.0-python3.6算法输入:存储在OBS上的数据集,必须按照coco数据集的格式进行存储。训练时标记文件以train.json命名,图片文件放在train文件夹下,测试时标记文件以test.json命名,图片文件放在test文件夹下。详情及目录结构查看下文和第4节案例指导训练好的iteration_270000_mAP_49.2.pth参数文件。算法输出用于Pytorch推理的pth模型,GPU推理速度:2.3s/pic代码结构DynamicRCNN-sub |-pre-trained_weights |R101.pkl |R50.pkl |-trained_model |-model |-build |... |-dynamic_rcnn |... |-DynamicRCNN.egg-info |... |config.json |config.py |customize_service.py |network.py |iteration_270000_mAP_49.2.pth |train.py #模型启动文件 |evaluation.py #模型预测文件 |pip-requirements #环境配置文件 |... #其他配置文件 |-build #以下为模型运行必须的文件 |... |-dynamic_rcnn |... |-DynamicRCNN.egg-info |...2.2 训练参数说明名称默认值类型是否必填是否可修改描述evalFalsestring是是(1)False,本算法执行模型训练过程;(2)True,本算法加载load_weight参数指定的模型,然后执行模型评估过程。创建训练作业时指定的数据存储位置data_url目录下,需要有test文件夹(存放测试图片)和test.json文件,输出有test_log.txt包含计算得到的mAP等各项预测指标,预测的结果图片文件夹imgs和包含预测结果bbox.json的文件夹inference。针对test.json中是否包含groundtruth,输出的test_log.txt会有所不同。2a) 如果test.json中包含groundtruth则模型输出的test_log.txt包含计算得到的mAP等各项预测指标。2b) 如果test.json中包含groundtruth则模型输出的test_log.txt中的mAP等各项预测指标为-1。除此之外,创建训练作业时指定的数据存储位置data_url目录下,如果没有图片,则模型评估过程报错;num_gpus1int是是训练使用到的gpu个数,与用户选择的训练规格有关,如果用户选择单个gpu训练那么该参数为1,如果用户选择8gpu训练,为了避免资源浪费,请将该参数改为8。注意在test模式下该参数不起作用,无论使用什么样的训练规格,都只使用单gpu进行测试training_iter1000int是是train模式下训练的轮数,论文中是在8gpu的条件下训练了270k个iteration。test模式下该参数不起作用。check_period5000string是是经过多少个iteration保留一次训练的中间结果参数文件,默认5000。由于训练时有内存的限制,该值不易设置的太小,建议一次训练最多保留15次中间结果。load_weightstdstring是是(1)std会加载固定的默认路径,默认加载本算法源码目录中的trained_model/model/best_model.pth继续训练,加载成功会打印日志;(2)可变的OBS路径,如obs://blb-paper/DynamicRCNN-MINE/output/model/dynamic_rcnn_r101_dcnv2_fpn_mstrain_2x_test_model_0270000.pth。用户可指定OBS上的一个模型文件路径,然后本算法会加载该模型继续训练,加载成功会打印日志。eval是false的时候,load_weights如果加载obs路径的模型则用于继续训练,eval为true的时候load_weights如果加载obs路径的模型则用于测试注1:训练模式下输入的数据文件夹格式|train.json#相当于coco数据集里的annotations,里面有图片信息和标记信息 |-train#放入训练图片数据 |0000000001.jpg |0000000002.jpg | ...注2:测试模式下输入的数据文件夹格式|test.json#相当于coco数据集里的annotations,里面有图片信息和标记信息 |-test#放入测试图片数据 |0000000001.jpg |0000000002.jpg | ... 2.3 训练输出文件train模式下的训练输出文件如下:|-model |-build ... |-dynamic_rcnn ... |-DynamicRCNN.egg-info ... |config.json |config.py |customize_service.py |network.py |iteration_270000_mAP_49.2.pth |-checkpoints |xxx.pth |xxx.pth |...#训练过程中保存的中间过程参数 |train_log.txt#训练日志test模式下的训练输出文件如下:|-log |test_log.txt#测试日志 |-inference |xxx.bbox#预测结果的所有bbox输出 |xxx #其他输出文件 |-imgs#预测结果图片 |1.jpg |2.jpg |xxx.jpg3. GPU推理本模型只支持GPU训练与测试4. 案例指导本算法的详细使用方法,请查看ModelArts AI Gallery算法Dynamic R-CNN使用指导。交付交付方式华为云ModelArts交付区域华北-北京一、华北-北京四、华东-上海一、华南-广州、亚太-**
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第三期2026/08/21 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;念擎-华为云AI开发者运营案例开发专家
本期直播内容:AI六层能力首次详细解读 + 新一代华为云开发者空间亮相 + 校园案例直播带练
回顾中
热门标签