• [资产园地] 西安旅游主题图片数据集 "华为云杯"2019人工智能创新应用大赛数据集
    描述2019西安AI大赛旅游主题数据集1、简介该数据集为《“华为云杯”2019人工智能创新应用大赛》竞赛数据集(初赛)。数据集包含了西安热门景点、美食、特产、民俗、工艺品五大类图片。2、数据类别及目录结构说明- 数据类别该数据集包含景点、美食、特产、民俗、工艺品五大类、54小类图片,图片类别如下:"0": "工艺品/仿唐三彩", "1": "工艺品/仿宋木叶盏", "2": "工艺品/布贴绣", "3": "工艺品/景泰蓝", "4": "工艺品/木马勺脸谱", "5": "工艺品/柳编", "6": "工艺品/葡萄花鸟纹银香囊", "7": "工艺品/西安剪纸", "8": "工艺品/陕历博唐妞系列", "9": "景点/关中书院", "10": "景点/兵马俑", "11": "景点/南五台", "12": "景点/大兴善寺", "13": "景点/大观楼", "14": "景点/大雁塔", "15": "景点/小雁塔", "16": "景点/未央宫城墙遗址", "17": "景点/水陆庵壁塑", "18": "景点/汉长安城遗址", "19": "景点/西安城墙", "20": "景点/钟楼", "21": "景点/长安华严寺", "22": "景点/阿房宫遗址", "23": "民俗/唢呐", "24": "民俗/皮影", "25": "特产/临潼火晶柿子", "26": "特产/山茱萸", "27": "特产/玉器", "28": "特产/阎良甜瓜", "29": "特产/陕北红小豆", "30": "特产/高陵冬枣", "31": "美食/八宝玫瑰镜糕", "32": "美食/凉皮", "33": "美食/凉鱼", "34": "美食/德懋恭水晶饼", "35": "美食/搅团", "36": "美食/枸杞炖银耳", "37": "美食/柿子饼", "38": "美食/浆水面", "39": "美食/灌汤包", "40": "美食/烧肘子", "41": "美食/石子饼", "42": "美食/神仙粉", "43": "美食/粉汤羊血", "44": "美食/羊肉泡馍", "45": "美食/肉夹馍", "46": "美食/荞面饸饹", "47": "美食/菠菜面", "48": "美食/蜂蜜凉粽子", "49": "美食/蜜饯张口酥饺", "50": "美食/西安油茶", "51": "美食/贵妃鸡翅", "52": "美食/醪糟", "53": "美食/金线油塔"- 目录结构说明2019xaiic (数据集根目录)|- train_data (训练集目录,包含图片和对应的标签文件(.txt))|- label_id_name.json (图片分类规则字典,key值是id,value是“图片种类/具体物品名”。例如训练数据标签文件img1.txt的内容是“img_1.jpg, 0”,表示img_1.jpg这张图中的物品是“工艺品/仿唐三彩”。)3、其他说明该数据集可以用于图像分类场景训练,也可以基于ModelArts数据标注进行物体检测类型的标注,然后用于目标检测场景训练。
  • [资产园地] VOC2012子集--适用于图像分割算法训练
    描述VOC2012子集–适用于图像分割算法训练1、数据简介本数据集为VOC2012子集,包含train、eval两个文件夹,数据目录结构如下:train----| Images------|1.jpg------|2.jpg…----| SegmentationClassRaw------|1.png------|2.pngeval----| Images------|1.jpg------|2.jpg…----| SegmentationClassRaw------|1.png------|2.png…2、适用的算法本数据可用于如下AI Gallery图像分类算法进行训练:图像分割-DeepLabV3(支持Ascend910训练、Ascend310推理):https://marketplace.huaweicloud.com/markets/aihub/modelhub/detail/?id=ce3c8d84-798d-4975-b359-45ca3de2c02b图像分割-DeepLabV3:https://marketplace.huaweicloud.com/markets/aihub/modelhub/detail/?id=260e2464-8ad4-401c-a177-33bec533468d
  • [前沿快讯] 华为云最新力作入选AAAI 2021:揭秘个性化联邦学习框架
    华为云论文研究成果,揭秘首创自分组个性化联邦学习框架。该框架可以有效地处理普遍存在的数据分布不一致问题,并大幅度提高联邦学习性能。人工智能顶级会议 AAAI 2021 将于 2021 年 2 月 2 日 - 9 日线上召开,华为云 AI 最新联邦学习成果《Personalized Cross-Silo Federated Learning on Non-IID Data》成功入选。这篇论文首创自分组个性化联邦学习框架。该框架让拥有相似数据分布的客户进行更多合作,并对每个客户的模型进行个性化定制,从而有效处理普遍存在的数据分布不一致问题,并大幅度提高联邦学习性能。该框架已被集成至华为云一站式 AI 开发管理平台 ModelArts 联邦学习服务中,其特有的个性化分组学习机制和优秀的隐私保护性能为中国科学院上海药物所蒋华良院士带领的生物制药团队提供了有效的算法支持,并在中国医药大会上吸引了广大制药厂商洽谈合作。 论文地址:https://arxiv.org/abs/2007.03797背景介绍联邦学习机制以其独有的隐私保护机制受到很多拥有高质量数据的客户青睐。通过联邦学习,能有效地打破数据孤岛,使数据发挥更大的作用,实现多方客户在保证隐私的情况下共赢。但与此同时,在实际应用中各个客户的数据分布非常不一致,对模型的需求也不尽相同,这些在很大程度上制约了传统联邦学习方法的性能和应用范围。为此, 在客户数据分布不一致的情况下如何提高模型的鲁棒性成为了当前学术界与工业界对联邦学习算法优化的核心目标,希望通过联邦学习得到的模型能满足不同客户的需求。  传统的联邦学习的目的是为了获得一个全局共享的模型,供所有参与者使用。但当各个参与者数据分布不一致时,全局模型却无法满足每个联邦学习参与者对性能的需求,有的参与者甚至无法获得一个比仅采用本地数据训练模型更优的模型。这大大降低了部分用户参与联邦学习的积极性。 为了解决上述问题,让每个参与方都在联邦学习过程中获益,个性化联邦学习在最近获得了极大的关注。与传统联邦学习要求所有参与方最终使用同一个模型不同,个性化联邦学习允许每个参与方生成适合自己数据分布的个性化模型。为了生成这样的个性化的模型,常见的方法是通过对一个统一的全局模型在本地进行定制化。而这样的方法仍然依赖一个高效可泛化的全局模型,然而这样的模型在面对每个客户拥有不同分布数据时经常是可遇而不可求的。为此,华为云 EI 温哥华大数据与人工智能实验室自研了一套个性化联邦学习框架 FedAMP。该框架使用独特的自适应分组学习机制,让拥有相似数据分布的客户进行更多的合作,并对每个客户的模型进行个性化定制,从而有效地处理普遍存在的数据分布不一致问题,并大幅度提高联邦学习性能。下面我们来具体看一下这一新的框架 FedAMP 是怎么提升联邦学习性能的。图一:FedAMP 的注意消息传递机制算法介绍图三:最优平均测试准确率。结果展示为了评估 FedAMP 及 HeurFedAMP 的性能,作者设计了一套更为符合实际应用场景的非均匀数据分布。如图三所示,FedAMP 及 HeurFedAMP 在四个常见数据集上展示了比现有五种 SOTA 算法更高的最优平均测试准确率。相比 Google 提出的原始联邦学习框架 FedAvg,FedAMP 及 HeurFedAMP 所获得的最优平均测试准确率更是大幅提升,表现非常亮眼。图四:所有客户测试准确率分布。通过分析进一步统计的结果(如图四),作者发现通过 FedAMP 和 HeurFedAMP 所得到的模型对于每个客户的测试精度在统计上显著高于其他方法获得的结果。图五:对于 EMNIST 数据集的可视化分组结果。为了更好的理解 FedAMP 及 HeurFedAMP 的机理, 作者进一步分析了注意消息传递机制(如图五)。作者发现 FedAMP 和 HeurFedAMP 均成功发现了蕴含在客户之间的真实分组关系。这一发现进一步解释了 FedAMP 及 HeurFedAMP 在数据分布不均匀时性能卓越的原因。联邦学习三步骤,降低使用门槛基于华为云 ModelArts 平台,实现联邦学习仅需简单的三步操作:第一步:发起者创建一个联邦学习团队,定义联邦任务,并邀请参与者,如图六所示 (其中更新策略可配置 FedAVG,FedAMP 等):图六:基于 ModelArts 的联邦训练任务创建。第二步:参与者同意加入联邦团队,并配置数据及资源类型,如图七所示:图七:基于 ModelArts 的联邦学习团队加入。第三步:联邦训练发起者启动联邦训练,直至训练完成,如图八所示:图八:基于 ModelArts 的联邦学习训练。总结 FedAMP/HeurFedAMP 是两种简单高效的个性化联邦学习框架。通过注意消息传递机制,FedAMP/HeurFedAMP 还将天然拥有抗投毒潜力。其在数据分布不均匀时的优异表现,将为云产商吸引更多拥有高质量数据的客户参与联邦学习。 基于上述框架,华为云一站式 AI 开发平台 ModelArts 提供联邦学习特性,用户各自利用本地数据训练,不交换数据本身,只用加密方式交换更新的模型参数,实现联合建模。 近日,国际权威研究机构国际数据公司(IDC)发布《中国 AI 云服务市场(2020 上半年)跟踪》报告显示,华为云 ModelArts 位居机器学习公有云服务中国市场份额第一位。 算法免费体验链接:https://t.ly/nGN9
  • [资产园地] COCO2017子集--适用于目标检测算法训练
    描述COCO2017子集–适用于目标检测算法训练1、数据简介本数据集为COCO2017子集,包含train文件夹、train.json两个文件,目录结构如下:|-train.json # 该文件为annotation标记文件|-train # 该目录下存放训练图片,该文件夹下的图片在train.json中都有相对应的图片信息和标记信息—|xxx.jpg—|xxx.jpg2、适用的算法DynamicRCNN-目标检测:https://marketplace.huaweicloud.com/markets/aihub/modelhub/detail/?id=6842fa7f-2b4c-4b73-8001-82070ac47f5c
  • [前沿快讯] 医学影像AI为什么需要小数据学习?
    近年来,深度神经网络的出现一定程度上颠覆了医学影像行业的发展路径,人工智能介入下,影像相关科室繁杂重复的工作逐渐由算法接替,医生资源短缺这一问题似乎出现了解决的希望。但AI亦有其限制。从当前发展情况看,有效的人工智能算法大多**于存在大量标准化数据的病种,毕竟要实现高质量AI诊断,需要大量的高质量标注图像进行前期的算法训练。这一数据相关的特质限制了医学AI的广泛应用。现实之中,罕见病和疑难杂症的数据较少,囿于患者隐私、数据安全等问题,数据收集行为的开展也较为困难。此外,医学图像的标注过程成本较高,对于不同的标注内容往往需要开发特殊的标注工具并交由有经验的医生进行。多方面原因协同下,某些医学图像问题的高标注质量医学图像数据集非常稀缺,其AI自然也难以孕育。好在AI面临的困境并非没有解法。回想起来,人类只需通过极少的样本就能辨别新的事物,那么机器是否能以复制人类的这一能力呢?答案或许是可以的。最近医学AI领域兴起的一系列小数据学习方法便是以模仿人类的判别能力为目标,尝试通过减少需要的数据量,实现特定目标图像的识别,最终克服医学领域数据量少、标准缺乏的问题。以先验知识为基础的小样本学习要实现小样本学习(few-shot learning)必须要具备一些特定条件,譬如模型学习前已经吸收了一定类别的大量资料后,再加之新类别的极少量数据,最终实现小样本模型的形成。因此,小样本学习的关键是在算法中纳入合适的先验知识。具体到医疗领域之中,很多医学图像模态中广泛存在器官的位置先验信息,例如CT图像中肝脏主要位于腹腔的右上位置,而脾则在腹腔的左上部分,这些位置先验信息对于AI识别特定类别的器官有非常大的帮助。体素科技在顶级会议ISBI2021上发表的论文《Location Sensitive Local Prototype Network For Few-shot Medical Image Segmentation》便提出了一种基于位置先验信息的局部原型网络(location sensitive local prototype network,见图1)。该论文以肝和脾影像数据构建训练集,再将其收获先验信息的算法加入少量肾部影像分割任务,实现基于小样本学习的AI模型训练。图一:基于位置先验信息的局部原型网络框架在公开的CT器官分割数据集Visceral进行试验后,其结果表明,论文提出的新框架比目前的最好方法在Dice Score指标上提高了10%,显著推进了小样本下的器官分割这一领域的技术进展。利用极端变化一致性来提高数据不足情况下医学图像分割的鲁棒性除了数据获取困难这一问题外,研究人员在训练时还会遭遇数据来源不统一的问题。由于医学图像的拍摄设备和拍摄环境和方式多样,各个医院和体检中心之间的人群分布差异明显,因此很难收集和标注足量的训练数据充分涵盖不同来源的图像特征。如果训练数据和实际测试数据存在明显的的分布差异(domain shift),生成的模型往往性能不佳。体素科技在顶级会议MICCAI2020上发表的《Extreme Consistency: Overcoming Annotation Scarcity and Domain Shifts》为解决这一问题提供了方向。具体而言,该论文提出了极端一致性(extreme consistency)的概念,核心思想是在训练数据中加入极端的图像变换(比如大量强烈的亮度, 对比度, 旋转, 尺寸变换),以增加训练数据的多样性,并假设这些极端的图像变换并不影响图像的语义含义。举例来说,眼底图像中的血管在经过极端的旋转和亮度对比度等变换后,依然能够对应血管本身。为了实现这一构想,论文设计了一种半监督算法(semi-supervised learning, 见图2), 迫使模型遵守极端变化前和变化后的语义一致性这一约束,进而提高模型对于分布差异的鲁棒性。该论文在皮肤病变分割数据集(ISIC)和两个眼底血管分割数据集 (HRF和STARE)上进行了测试,展现了在数据不足和分布差异较大情况下,算法的鲁棒性和准确性的优势。 图2:左边是基于极端一致性的半监督学习方法的伪代码,右边是网络结构示意图。 少标注和弱标注情况下医学图像分割如何解决?除了数据的来源问题,对已有数据进行分割标注同样需要研究人员付出大量成本。在中国,影像数据标注非常昂贵,尤其是像素级别的医学图像分割标注,人力支出更为巨大。因此,近期大量的研究工作试图解决不完善医学图像分割数据集中的两类典型问题:标注稀缺。数据集中只有极稀少的图像数据有分割标注。弱标签。数据集中的图像数据只有部分标注、或者标注带有噪声、或者只有图像级的类别标签没有逐像素的分割标注。对于这两问题,体素科技发表在顶级期刊《Medical Image **ysis》中的文章《Embracing Imperfect Datasets: A Review of Deep Learning Solutions for Medical Image Segmentation》系统性地对现有方案进行了详细的回顾和分类总结(见图3所示)。根据医学图像分割数据集的不同缺陷,论文对这些方案的选择给出了实际的指导建议。图3:医学分割图像数据集数据集缺陷问题及相应训练策略总结
  • [资产园地] 红绿灯、斑马线、限速、解限速数据集 无人车挑战杯大赛训练集
    描述1、数据简介本数据集为无人车挑战杯大赛供参赛选手使用的训练集,包含红灯、绿灯、黄灯、人行横道、限速标志、解除限速标志六种类型图片。2、使用方法a、下载本数据集,下载方式选择“ModelArts数据集”。b、下载完成后(下载需等待一定时间),在ModelArts数据管理打开此数据集,然后按照如下标签完成数据集标注:红灯:red_stop绿灯:green_go黄灯:yellow_back人行横道:pedestrian_crossing限速标志:speed_limited解除限速标志:speed_unlimited
  • [资产园地] “华为云杯”2020人工智能创新应用大赛(数据集来源于北京二号卫星)
    https://competition.huaweicloud.com/information/1000041322/circumstance数据说明本次比赛数据集来源于北京二号卫星,分辨率为0.8米,分为训练集和测试集2个数据集,分别包含3景遥感影像,其中训练集2景影像的尺寸分别为40391×33106、34612×29810。参赛者可自行将训练集切分为小图,并划分为训练集和验证集以用于模型调优。点击此处下载数据集data.zip。data.zip解压后目录结构说明如下:目录名说明182.png第一张遥感影像182_label.png第一张遥感影像的标签数据382.png第二张遥感影像382_label.png第二张遥感影像的标签数据
  • [技术干货] 【华为云杯2020】深圳开放数据应用创新大赛:AI训练营 开启AI“大狮”之路
    【大赛介绍】由深圳市政务服务数据管理局、南山区人民政府主办,南山区政务服务数据管理局、华为技术有限公司承办的“华为云杯”2020深圳开放数据应用创新大赛(Shenzhen Open Data Innovation Contest,简称SODiC),以“数聚粤港澳,智汇大湾区”为主题,面向全球高等院校、专业研究机构、数据分析公司、开发者征集基于开放数据的创新应用解决方案和算法模型。AI训练营录播视频链接(含baseline解读&调优):https://huaweicloud.bugu.mudu.tv/watch/lm0p02d7
  • [资产园地] 第十六届中国研究生数学建模竞赛-华为赛题
    【赛题背景】在本届数学建模竞赛中,希望参赛者能够对机器学习的工作方式有一定掌握并站在设备供应商以及无线运营者的角度,通过合理地运用机器学习模型(不限定只使用这种方法)来建立无线传播模型,并利用模型准确预测在新环境下无线信号覆盖强度,从而大大减少网络 建设成本,提高网络建设效率。 【详细赛题】赛题下载链接数据集下载链接训练集:点击下载测试集:点击下载注:测试集用于参赛选手验证开发模型
  • [资产园地] 【“华为云杯”2019人工智能创新应用大赛 — 训练数据】
    【“华为云杯”2019人工智能创新应用大赛 — 训练数据】训练数据:train_data.zip
  • [资产园地] 【2019华为云人工智能大赛·**分类挑战杯】训练集、测试集
    **分类大赛在7月30日启动赛事时,放出了第一版训练数据。在赛事进行过程中,发现训练集中有少量标记错误和标记不够合理的图,因此赛事组对公开的训练数据和判分系统后台使用的测试数据进行了整改,数据整改说明如下:(1)菜叶菜根:番茄,转移到水果果肉(2)剩饭剩菜:一些空的碗,转移到**花盆及碟碗(3)水果果皮:一些带有较多果肉的图,转移到水果果肉,有些同时有葡萄皮和葡萄肉的图,皮多放水果果皮,肉多放水果果肉(4)玻璃杯:瓷杯,转移到**花盆及碟碗(5)调料瓶:删除塑料调料盒的图片(6)洗发水瓶:洗面奶,转移到化妆品瓶(7)一次性快餐盒:删除KFC、pisa等纸质包装的盒子(8)软膏:少量的洗面奶图,转移到化妆品瓶(9)其他整改:删除少量尺寸太小、模糊的图(10)类别名及类别数不变新训练集下载链接:garbage_classify_v2.zip
  • [前沿快讯] 拿下机器学习公有云服务中国市场份额第一的AI开发平台,到底做对了什么?
    作者 张倩近日,国际权威研究机构 IDC(国际数据公司)最新发布的《中国 AI 云服务市场(2020 上半年)跟踪》报告显示,华为云一站式 AI 开发平台 ModelArts 位居机器学习公有云服务中国市场份额第一位,高达 29%。报告指出:华为在国内市场具有先天的认知优势,开发者对于华为的技术、产品、品牌有着天然的认知和信赖。其中,华为云一站式 AI 开发平台 ModelArts 在行业用户中的主动提及率非常高。可以见得,在 ModelArts 平台学习 AI 技术已经成为越来越多开发者的偏爱,ModelArts 也正逐渐成为行业 AI 落地的首选。数据来源:IDC《中国 AI 云服务市场半年度研究报告,2020H1》众所周知,市场份额是产品是否好用的一个忠实反应。对于用户来说,「好用」的标准非常简单,即你的产品到底有没有解决我的问题?比如能否实现降本增效,产品是否安全可控等等。 作为一站式 AI 开发平台,华为云 ModelArts 的用户所关注的问题也在这一范畴之内。具体来说,他们会关心:这个平台上手门槛高不高?成本、效率高不高?我的数据隐私能得到保护吗?我的模型我自己能把关吗? 接下来,我们就从这些问题入手,看看市场份额第一的华为云 ModelArts 有没有解决这些问题。 开发者和企业所看中的,华为云 ModelArts 都满足了吗? 1. 门槛、成本和效率 一位从传统 IT 转向 AI 软件研发的技术总监曾表示,在早期的研发阶段,他们遇到了不少棘手的问题,比如从数据收集、处理,模型训练、管理到发布,AI 开发基本都处于一种「乡间作坊」的工作模式。这种工作方式不仅效率低下,而且不利于新人的培养,让人才培训成本居高不下。同时,模型上线后的工作性能受物理硬件的限制,横向扩展耗时耗力,资源利用率也无法有效保障。 这位技术总监提到的问题主要体现在门槛、成本和效率几个方面。在门槛方面,推动 AI 发展的核心四要素——算法、算力、数据和知识,每一个都存在门槛。在成本方面,传统的「乡间作坊」工作模式开发流程冗长,涉及的人员较多,人力、物力成本居高不下;在效率方面,这种工作模式容易重复造轮子,资源复用率低。 在种种困境下,华为云 ModelArts 走进了这些开发团队的视野。 为什么是 ModelArts? 在自然语言处理领域,BERT 的问世是一个里程碑事件。它让整个社区尝到了「预训练」的甜头:只需要简单的迁移策略,就能让模型在下游任务中获得良好的性能,使该领域由原来的手工调参、依靠机器学习专家的阶段,进入到大规模、可复制的大工业生产的阶段。这一经验同样可以复制到其他领域,华为云 ModelArts 的通用预训练模型架构——EI-Backbone 就是这一路径的开拓者之一。 EI-Backbone 通过整合算法模型、算力、数据和知识,可以进行模型选择自动设计、参数配置自动调优,在分钟级内完成模型训练,无需依仗专家经验就能大幅提升模型精度,显著降低 AI 使用门槛,缩短开发流程,提升开发性能。该架构提供了一种「预训练模型 + 小样本微调」的高效训练模式,能够让开发者基于行业小样本数据训练高精度模型。这在医疗等优质数据稀缺的场景中尤其有用。以医疗影像分割为例,过去需要成百上千例标注数据才能进行的训练,在 EI-Backbone 的加持下,只需要几十例甚至十几例标注数据即可完成,节省标注成本高达 90% 以上。 效率的提升和成本的节约还体现在算力方面。华为全联接大会 2020 发布的最新版华为云 ModelArts 3.0 在集群规模、任务数量以及分布式训练各个环节做了针对性优化,并支持弹性训练。弹性训练指的是华为云 ModelArts 提供的两种模式:一是 Turbo 模式,可以充分利用空闲资源加速已有训练作业,训练速度可提升 10 倍以上,并且不影响模型的收敛精度;二是经济模式,可以通过最大化资源利用率给开发者提供极致的性价比,在大多数典型场景下可以提升性价比 30% 以上。这种降本增效的成果在实际的业务场景中是非常可观的,无论是对 AI 开发者的低成本快速上手的需求,还是对行业 AI 智能转型升级来说,无疑都是最合适的选择。 2. 对数据的掌控 AI 模型性能的提升离不开大量的多源数据。如果企业只用自己有限、单一来源的数据进行训练,得到的模型可能不够准确,或泛化性较差。在此背景下,各个数据拥有方不可避免地要进行合作。 但与之矛盾的是,很多行业的数据涉及用户隐私、行业机密等问题,数据拥有者不愿或不能将数据上传至一个数据中心进行模型训练,从而形成了一个个的「烟囱」或「孤岛」。 华为云 ModelArts 的用户大多是这种类型,他们身处医疗、政务、金融等安全、隐私性要求极高的领域,因此必须对自己数据的流向进行严格把控,做到数据不出库。 数据不能出库,但模型的参数可以,这就是华为云 ModelArts 提供的联邦学习解决思路。在华为云 ModelArts 3.0 下,用户可以各自利用本地数据训练模型,不交换数据本身,只用加密方式交换更新的模型参数,实现云边协同训练。此外,华为云 ModelArts 3.0 不仅支持横向联邦学习,处理对齐的数据,还支持纵向联邦学习,可以轻松处理训练样本 ID 重叠多的数据。 对于使用华为云 ModelArts 实现行业 AI 落地的用户来说,引入联邦学习不仅解决了数据隐私问题,还节约了数据方面的成本。众所周知,医疗、制药等领域的数据标注难度非常大,需要领域专家的介入,因此成本非常高。通过联邦学习,各个数据拥有方都可以在这一技术的保护下实现数据价值的交换,显著降低成本。  3. 对模型的掌控 模型从实验室走向生产环境是一个令人揪心的过程。开发者和企业会担心这个模型精度不够高、性能不够好、可解释性差、可信度低等问题。在这些都没弄清楚之前,没有人敢大规模部署这款模型。 华为云 ModelArts 的成功之处在于,它在一定程度上缓解了这种「不透明」所带来的顾虑,将自动评估、诊断之后得到的模型精度、性能、可解释性、可信度等信息展示在一块「面板」上,让用户直观地看到自己模型的基本情况。 而且,这种评估是非常精细的,仅精度方面就有准确率、精确率、召回率、F1 值、混淆矩阵、ROC 曲线、数据敏感度分析等多项指标。这些指标可以帮助用户进行有针对性的调优,让用户做到「心中有数」,放心部署。 哪些行业已经用上了华为云 ModelArts? 当前,华为云 ModelArts 已经在金融、医疗、药物研发、自动驾驶等多个领域得到了广泛应用。 在金融领域,华为云 ModelArts 已经用于金融票据 OCR 识别。由于金融票据格式多样,差别细微,需要 AI 专家进行长时间的票据 AI 训练,因此业界识别准确率普遍不够精准。针对票据模型开发训练数据标注、模型训练、调优和部署上的诸多难点,华为云 ModelArts 通过数据集分类、自动学习、迁移学习等方法,让初级 AI 开发者无需调参等操作,轻松操作数据标注工具,完成部署。 在医疗领域,去年 11 月份,放射学领域国际顶级期刊《Radiology》发表了华为云 EI 创新孵化 lab、华中科技大学电信学院、华中科技大学同济医学院附属协和医院放射科联合团队的最新研究成果:运用华为云 ModelArts 开发的一套基于 CTA 影像的脑动脉瘤检测算法。该算法灵敏度高达 97.5%,帮助医生临床诊断灵敏度提升约 10 个百分点,漏诊率降低了 5 个百分点,同时有效缩短了医生的诊断时间。在药物研发领域,2020 年,华为云 EI 与中国科学院上海药物研究所签署联合创新合作协议,将华为自研的 FedAMP 算法和 AutoGenome 算法应用到药物研发的 AI 任务中,精准预测药物水溶解性、心脏毒性和激酶活性。中国科学院院士、中国科学院上海药物研究所研究员蒋华良联合华为云发布基于 ModelArts 平台的药物联邦学习服务,以解决研发数据高壁垒、高成本以及高机密的问题。实践证明,通过华为云 EI 联邦学习训练后的模型,准确度远超传统的联邦学习和深度学习算法。回顾过去的一年,华为云 ModelArts 在抗击疫情方面也发挥了重要作用,其参与的联合科研团队在 2020 年 2 月份就筛选出了五种可能有效的新冠抗病毒药物。此外,华为云还依托 AI 昇腾集群服务和 ModelArts 推出了 AI+CT 医学影像分析服务,运用计算机视觉与医学影像分析技术对患者肺部 CT 多发磨玻璃密度影(GGO)以及肺实变进行分割以及量化评价,并结合临床信息和实验室结果,辅助医生更高效、精准地区分早期、进展期与重症期,助力疫情防控工作。 技术赋能行业离不开一个低门槛、高效率同时又安全、可靠的工具。华为云 ModelArts 这类 AI 开发新工具的出现是实现技术普惠的重要条件,让「学 AI,用 ModelArts」成为开发者群体的新风尚,亦将让行业 AI 落地开拓者们亲手触碰到未来。 参考链接: https://www.zhihu.com/question/327642286/answer/1465037757 https://bbs.huaweicloud.com/blogs/203915 https://tech.ifeng.com/c/81fISXbX0Ay 本文转自:机器之心
  • [前沿快讯] 2020 ACM Fellow 出炉!图灵奖得主坐镇,陈怡然、颜水成、周昆等12位华人科学家入选
    作者 | AI科技评论AI 科技评论消息,**计算机学会(ACM)于今日刚刚宣布了 2020年新当选 ACM Fellow 名单,共有 95位科学家当选,其中包括陈怡然、颜水成、周昆、申恒涛、陶宇飞、王薇、Cathy Wu、李学龙、吕晨阳、任奎、王义、张耀文等12位华人学者!值得注意的是,2020 年入选的 ACM Fellows 中,还有多位图灵奖得主(未经评选,直接授予),包括Whitfield Diffie、Adi Shamir、Manuel Blum等人。作为世界上最大的计算机领域专业性学术组织,ACM 的影响力不言而喻。它创立于 1947 年,目前在全世界 130 多个国家和地区拥有超过 10 万名会员,其所评选的图灵奖是计算机界最负盛名、最崇高的一个奖项,被称为「计算机界的诺贝尔奖」。而 ACM Fellow 则设立于 1993 年,用于表彰在计算和信息技术领域从业五年以上,并做出了「突出贡献」(Exceptional Contributions) 的科学家,是 ACM 所有会员中最顶尖的那 1% 位成员。截止目前为止,已有 1000 多位 ACM Fellow 诞生。本次选出的95名ACM Fellow ,分别在人工智能、云计算、计算机图形学、计算生物学、数据科学、安全和隐私、软件工程、量子计算和网络科学等领域做出了广泛的基础性贡献。ACM 前主席 Cherri M.Pancake 曾经说过:“计算机技术对塑造我们今天的生活和工作产生了巨大影响。所有直接或间接影响我们的技术都是无数个小时工作的结果,协作或个人工作,以及创造性的灵感,有时甚至是明智的冒险。每年,我们都希望有一批最杰出的人成为 ACM Fellow,ACM Fellow是我们整体认可的基石,在强调ACM Fellow的成就时,我们希望给予应有的赞誉,同时也向公众传播计算机专业人员所从事的特殊领域。”为彰显ACM的全球影响力,2020年ACM Fellow 来自澳大利亚、加拿大、中国、埃及、法国、德国、以色列、意大利、瑞士和**的大学、公司和研究中心。以下是12位入选华人学者介绍:陈怡然杜克大学电子与计算机工程终身正教授、IEEE Fellow、杜克大学计算进化智能中心(CEI)主任、** NSF 新型可持续智能计算产学合作中心主任。专注于研究新型存储系统、机器学习和神经形态计算,以及移动计算系统。1998年获得清华大学理学学士学位,2001年获清华硕士学位,2005年获普度大学博士学位。在工业界工作五年后,他于2010年加入匹兹堡大学担任助理教授,后于2014年晋升为终身副教授,并获双世纪校友讲席。他同时也是 NSF CAREER奖、ACM SIGDA杰出新教师奖、德国洪堡资深学者研究奖和IEEE SYSC/CEDA TCCPS职业中期奖的获得者,并被列入HPCA名人堂。陈教授出版过一本专著并发表过400多篇技术论文。他获得过96项**专利,担任或曾担任十多个国际学术论文/期刊的副主编,并曾在60多个国际会议的技术和组织委员会任职。他现在是IEEE电路和系统( IEEE Circuits and Systems )杂志的主编。他获得过七次最佳论文奖,一次最佳 poster奖,以及十四次最佳论文提名。入选理由:对非易失性内存技术的贡献。个人主页:https://ece.duke.edu/faculty/yiran-chen 颜水成前依图科技首席技术官,新加坡国立大学终身机器学习与计算机视觉实验室负责人,IEEE Fellow、IAPR Fellow,曾任 360 集团副总裁、首席科学家与人工智能研究院院长。主要研究领域为计算机视觉、机器学习与多媒体分析。本科就读于北京大学数学科学学院,在微软亚洲研究院实习期间,先后师从人脸识别和智能视频监控专家李子青和计算机视频检索研究领域的“开山鼻祖”张宏江,还与前滴滴研究院院长何晓飞一同搭档发表 4 篇单篇引用过千的论文。他们将 Subspace Learning 与 Manifold Learning 两个当时非常火爆的领域巧妙而简单地串联了起来。2006年,颜水成在伊利诺伊大学香槟分校(UIUC)做博士后研究,师从计算机视觉大师黄煦涛(Thomas Huang)。2007年12月,颜水成教授加入新加坡国立大学,其团队在五年内获得了计算机视觉领域的核心竞赛即PASCAL视觉对象类和ImageNet大规模视觉识别挑战赛的十余次冠军或荣誉奖,以及十多次(最佳)学生论文 奖项。此外,颜水成团队提出的“Network in Network”(NIN)网络结构的核心 1×1 卷积,在近年来几乎被所有计算机视觉深度学习模型当作标准模块,后期出现的 GoogleNet、ResNet等模型也借鉴了其思想。他的团队开发的“Purine”是全球第一个开源的支持多机多GPU的深度学习系统。入选理由:对视觉内容理解技术与应用的贡献。个人主页:https://www.ece.nus.edu.sg/stfpage/eleyans/ 周昆浙江大学计算机系教授,IEEE Fellow,兼任浙江大学计算机辅助设计与图形学国家重点实验室主任,教育部长江学者特聘教授,国家杰出青年科学基金获得者。主要研究方向为计算机图形学、计算机视觉、人机交互和虚拟现实。在ACM/IEEE Transactions上发表论文80余篇,论文引用1万余次,获得发明专利50余项。此外,他曾获得2009年NVIDIA Professor Partnership Award、2010年中国计算机图形学杰出奖、2011年中国青年科技奖、2011年《麻省理工学院技术评论》全球杰出青年创新人物奖 (MIT TR35 Award)、2012年中组部首批青年拔尖人才支持计划、2013年国家自然科学二等奖、2016年陈嘉庚青年科学奖、2017年浙江省自然科学一等奖。入选理由:对计算机图形学的贡献。个人主页:https://person.zju.edu.cn/kunzhou 申恒涛申恒涛教授,**光学学会会士和ACM杰出会员,是电子科技大学计算机科学与工程学院院长,电子科技大学人工智能研究院执行院长,四川省人工智能研究院(宜宾)院长。他分别于2000年和2004年获得了新加坡国立大学计算机科学系一等荣誉学士和博士学位。随后加入昆士兰大学并于2011年底成为教授。他一直从事最前沿的计算机科学研究,研究方向包括多媒体搜索,计算机视觉,人工智能,和大数据管理。申恒涛累计发表了300+篇高水平同行评审论文,其中包括200多篇CCF A类论文, 并获得了8个国际会议和期刊的最佳论文奖,包括A类会议ACM Multimedia 2017 最佳论文奖和ACM SIGIR 2017 最佳论文-Honourable Mention奖,以及IEEE Transactions on Multimedia 2020最佳论文奖。入选理由:对大规模多媒体内容的理解、索引和检索的贡献。个人主页:https://cfm.uestc.edu.cn/~shenht/#陶宇飞**中文大学计算机与工程系教授,复旦大学兼职教授。主要研究兴趣是开发“小而精”的算法,以及数据库、机器学习与理论计算机科学的交叉研究。他在2002年于**科技大学获得计算机科学博士学位,师从 Dimitris Papadias 教授。他曾在CMU担任访问科学家、**城市大学担任助理教授、昆士兰大学担任教授。曾获得2002年**杰出科学家奖、SIGMOD 2013/2015 最佳论文奖、2016年谷歌教职研究奖、PODS 2018 最佳论文奖等。入选理由:对用于大规模数据处理的算法的贡献。个人主页:https://www.cse.cuhk.edu.hk/~taoyf/ 王薇加利福尼亚大学洛杉矶分校(UCLA)计算机系 Leonard Kleinrock 讲席教授,Scalable **ytics Institute 主任,Jonsson Comprehensive 癌症中心、量子计算生物研究所成员。主要研究兴趣为大数据分析、数据挖掘、数据库系统、自然语言处理、生物信息学、计算机生物与计算医疗。她于1999年从UCLA获得计算机科学博士学位,曾于1999年至2002年在IBM T. J. Watson中心担任研究员,于2002年至2012年在北卡罗来纳大学教堂山分校计算机系担任教授。她曾获得 IBM 发明成就奖、微软研究 New Faculty Fellow。入选理由:对数据挖掘的奠基与实践的贡献。个人主页:http://web.cs.ucla.edu/~weiwang/(吴凯茜)Cathy H. Wu特拉华大学生物信息与计算生物中心 Edward G. Jefferson 主席与教授,蛋白质信息资源(PIR) 主任,乔治城大学医学中心兼职教授。主要研究兴趣包括蛋白质家族分类和功能注释、生物数据整合和文本挖掘。她在1978年本科毕业于国立台湾大学植物病理学,随后于1982年获得**普渡大学植物病理学硕士学位,1984年获得普渡大学博士学位。博士毕业后,她继续求学之路,1986年在密歇根州立大学获得分子生物博士后学位,并于19**在德克萨斯大学获得计算机科学硕士学位,硕士毕业论文主题是使用人工神经网络来分类蛋白质,导师为George M. Witson III。之后,19**至1994年,她在德克萨斯大学计算机系担任助理教授,教计算机科学的课程,又在德克萨斯大学健康中心担任助理教授、副教授与教授。吴自1990年以来一直从事生物信息学研究,并开发了几个蛋白质分类系统和数据库。入选理由:对生物信息学、计算生物、知识挖掘与语义数据聚合的贡献。个人主页:https://bioinformatics.udel.edu/people/personnel/cathy_wu/ 李学龙李学龙,国际欧亚科学院院士、西北工业大学教授、博导,校学术委员会副主任。毕业于中国科学技术大学,关注高维数据的智能获取、处理和管理。在应用系统中发挥作用。在工程和计算两个领域入选全球高被引科学家。  此外,还入选**科学促进会会士(AAAS Fellow)、**光学学会会士(OSA Fellow)、国际光学工程学会会士(SPIE Fellow)、国际电气电子工程师协会会士(IEEE Fellow)、国际模式识别学会会士(IAPR Fellow)等。2018年,获得“钱伟长中文信息处理科学技术奖”一等奖。入选理由:对计算高阶数据以及从高阶数据中学习的贡献。个人主页:https://teacher.nwpu.edu.cn/2018010290.html 吕晨阳吕晨阳,圣路易斯华盛顿大学计算机科学与工程系教授,研究领域包括实时系统、无线传感器网络和物联网。他是“ACM Transactions on Sensor Networks”的期刊主编、IEEE IOT期刊的区域编辑。此外,他发表了150多篇研究论文的作者,被引用超过14,000次,h指数为54。他1995年在中国科技大学念完本科,1997年获得中国科学院硕士学位,2001年在弗吉尼亚大学获得博士学位。入选理由:表彰其在自适应实时系统、实时虚拟化和无线网络物理系统方面的贡献。个人主页:https://www.cse.wustl.edu/~lu/任奎浙江大学求是讲席教授,目前担任浙江大学网络空间安全学院院长、计算机科学与技术学院副院长、计算机创新技术研究院执行院长,此前入选 IEEE Fellow。主要研究方向为云安全、物联网安全与隐私保护,是其研究领域的权威专家。任奎教授发表了280余篇同行评议的期刊与会议文章,获得了包括IEEE INFOCOM’20、IEEE Globecom’19, 中国密码学会’18、ACM ASIACCS’18、IEEE ICDCS’17、IWQoS’17,ICNP’11等在内的多篇最佳论文和时间考验论文奖。他的H-Index为69,文章总引用次数超过30,000次,并入选科睿唯安高被引科学家。同时任奎教授的多项研究成果在工业界有广泛应用。入选理由:对无线系统安全与云数据安全的贡献。个人主页:https://person.zju.edu.cn/kuiren 王义瑞典乌普萨拉大学信息技术系教授,主要研究兴趣为 CPS 的设计与动态更新、安全至上的嵌入实时系统、实时调度、建模与验证。1982年本科毕业于中国东北大学计算机工程专业,随后赴瑞典查尔姆斯理工大学攻读计算机科学博士预科与博士学位。2014年当选 IEEE Fellow。曾获得2019年 IEEE TCRTS Award、RTSS 2099/2015/2017 最佳论文奖、ECRTS 2015最佳论文奖、DATE 2013最佳论文奖、ETAPS 2002 最佳工具论文奖。入选理由:对实时系统的自动化分析与验证的贡献。个人主页:http://user.it.uu.se/~yi/ 张耀文张耀文,国立台湾大学电机工程系特聘教授,他在1988年获得国立台湾大学学士学位,在1993年获得德克萨斯大学奥斯汀分校硕士学位,1996年获得德克萨斯大学奥斯汀分校博士学位。研究领域为电子设计自动化、积体电路实体设计、积体电路可制造性设计等。入选理由:为算法电子设计自动化做出贡献。个人主页:https://www.ee.ntu.edu.tw/profile1.php?teacher_id=943001&p=3近三年来当选 ACM Fellows 的华人学者 2019年共有 7 位:吕松武、宋晓东、陶大程、谢源、周礼栋、陈熙霖、李向阳。 2018 年共有 6 位:李飞飞、刘欢、罗杰波、Lili Qiu、何田以及 Lillian Lee。 2017 年共有 9 位:马毅、芮勇、杨强、张世富、翟成祥、张爱冬、Li Erran Li。以下为2020年入选 ACM Fellow完整名单:Daniel J. AbadiUniversity of MarylandFor contributions to stream databases, distributed databases, graph databases, and column-store databasesSamuel MaddenMassachusetts Institute of TechnologyFor contributions to data management and sensor computing systemsJames AllanUniversity of Massachusetts AmherstFor contributions to information retri, including topic detection and trackingScott MahlkeUniversity of MichiganFor contributions in compiler code generation for instruction level parallelism, and customized microprocessor architecturesSrinivas AluruGeorgia Institute of TechnologyFor contributions to parallel methods in computational biology and leadership in data scienceDavid MaltzMicrosoft AzureFor contributions to networking infrastructure, including data center networking, network operating systems, and cloud networkingAndrea C. Arpaci-DusseauUniversity of WisconsinFor contributions to storage and computer systemsVolker MarklTU BerlinFor contributions to query optimization, scalable data processing, and data programmabilityRemzi Arpaci-DusseauUniversity of WisconsinFor contributions to storage and computer systemsMaja MataricUniversity of Southern CaliforniaFor contributions to socially assistive robotics and human-robot systemsSuman BanerjeeUniversity of Wisconsin-MadisonFor contributions to design, implementation, and tools of wireless systemsFilippo MenczerIndiana UniversityFor research on the vulnerability of social media networks to disinformation and manipulationManuel BlumCarnegie Mellon UniversityFor contributions to the foundations of computational complexity theory and its application to cryptography and program checkingJose MeseguerUniversity of Illinois at Urbana-ChampaignFor the development of logical methods for design and verification of computational systemsLionel BriandUniversity of Ottawa and University of LuxembourgFor contributions to automated software testingMeredith Ringel MorrisMicrosoft ResearchFor contributions to human-computer interaction, information retri, computer-supported cooperative work, and accessibilityDavid BrooksHarvard UniversityFor contributions to software and hardware design for power-efficient computer architecturesNachiappan NagappanMicrosoft ResearchFor contributions to empirical software engineering and data-driven software developmentRan CanettiBoston UniversityFor contributions to cryptography and computer securityRadhika NagpalHarvard UniversityFor contributions to collective intelligence, including self-organizing systems and swarm roboticsJohn CannyUniversity of California, BerkeleyFor contributions in robotics, machine perception, human-computer interaction, and ubiquitous computingMoni NaorWeizmann Institute of ScienceFor contributions to the foundations of cryptography and theoretical computer scienceAnantha ChandrakasanMassachusetts Institute of TechnologyFor energy-efficient design methodologies and circuits that enabled ultralow-power wireless sensors and computing devicesChandrasekhar NarayanaswamiIBM T.J. Watson Research CenterFor design and development of the Linux Watch and SoulPad, which influenced wearable and mobile systemsYao-Wen ChangNational Taiwan UniversityFor contributions to algorithmic electronic design automationSam H. NohUNISTFor contributions to storage system software, including flash and byte-addressable non-volatile memoryMoses CharikarStanford UniversityFor design of efficient algorithmic techniques for big data, hashing, approximation algorithms, and metric embeddingsPrakash PanangadenMcGill UniversityFor making continuous state systems amenable to logical and computational treatmentYiran ChenDuke UniversityFor contributions to to nonvolatile memory technologiesSethuraman PanchanathanArizona State UniversityFor contributions to multimedia technologies and leadership in the scientific communityGraham R. CormodeUniversity of WarwickFor contributions to data summarization and privacy enabling data management and **ysisManish ParasharRutgers UniversityFor contributions to high-performance parallel and distributed computing and computational sciencePatrick CousotNew York UniversityFor contributions to programming languages through the invention and development of abstract interpretationKeshab K. ParhiUniversity of MinnesotaFor contributions to architectures and design tools for signal processing and networking acceleratorsMathieu DesbrunCalifornia Institute of TechnologyFor contributions to geometry processing and discrete differential geometryHaesun ParkGeorgia Institute of TechnologyFor contributions to numerical algorithms, data **ytics, and leadership in computational science and engineeringWhitfield DiffieFindora Advanced Research CenterFor the invention of asymmetric public-key cryptography and the promulgation of a practical cryptographic key-exchange methodGordon PlotkinUniversity of EdinburghFor contributions to the science of programming languages, particularly their operational and denotational semanticsBonnie J. DorrIHMCFor human-centered and linguistically inspired approaches to natural language processing     Michael O. RabinHarvard UniversityFor the introduction of nondeterministic automata, probabilistic automata, and for contributions to computability and computational complexity theoryNicholas DuffieldTexas A&M UniversityFor contributions to network measurement and **ysisKui RenZhejiang UniversityFor contributions to wireless system security and cloud data securityAlan EdelmanMassachusetts Institute of TechnologyFor contributions to algorithms and languages for numerical and scientific computingPaul ResnickUniversity of MichiganFor contributions to recommender systems, economics and computation, and online communitiesThomas EiterTU WienFor contributions to knowledge representation and reasoning, logic programming, and declarative problem solvingMary Beth RossonPennsylvania State UniversityFor contributions to human-computer interaction, including scenario-based designCormac FlanaganUniversity of California, Santa CruzFor contributions to static and dynamic program debugging and verification methodsSteven SalzbergJohns Hopkins UniversityFor contributions to computational biology, including software for DNA sequence **ysis, alignment, and genome assemblyJodi ForlizziCarnegie Mellon UniversityFor contributions to design research in human-computer interactionSanjit Arunkumar SeshiaUniversity of California, BerkeleyFor contributions to formal verification, inductive synthesis, and cyber-physical systemsDieter FoxUniversity of WashingtonFor contributions to probabilistic state estimation, RGB-D perception, and learning for robotics and computer visionAdi ShamirWeizmann Institute of ScienceFor contributions to the field of cryptographySanjay GhemawatGoogleFor contributions to distributed systems designHeng Tao ShenUniversity of Electronic Science and Technology of ChinaFor contributions to large-scale multimedia content understanding, indexing and retriAntonio GonzalezUniversitat Politecnica de CatalunyaFor contributions to the design of energy-efficient and resilient computer architecturesAmit ShethUniversity of South CarolinaFor contributions to data semantics and knowledge-enhanced computingAndrew D. GordonMicrosoft Research and University of EdinburghFor contributions to programming languages: their principles, logic, usability, and trustworthinessAdam SmithBoston UniversityFor contributions to data privacy and cryptographySteven GribbleGoogleFor contributions to virtualization technology across clusters, servers, and networks     Olga Sorkine-HornungETH ZurichFor contributions to digital geometry processing, computer animation, computer graphics and visual computingSusanne E. HambruschPurdue UniversityFor research and leadership contributions to computer science educationRick L. StevensArgonne National LaboratoryFor contributions in high-performance computing systems, collaborative environments, and tools for large-scale science initiativesMartin HellmanStanford UniversityFor the invention of asymmetric public-key cryptography and the promulgation of a practical cryptographic key-exchange methodPeter StoneUniversity of Texas at AustinFor contributions to automated planning, learning, and multiagent systems with applications in robotics and ecommerceNicholas HighamUniversity of ManchesterFor contributions to numerical linear algebra, numerical stability **ysis, and communication of mathematicsYufei TaoChinese University of Hong KongFor contributions to algorithms for large scale data processingC. Anthony (“Tony”) R. HoareUniversity of CambridgeFor contributions to the theory of programming, and its application to the practice of engineering of softwareLeandros TassiulasYale UniversityFor contributions to network control and optimization with applications in communication networksHolger H. HoosLeiden UniversityFor contributions to automated algorithm selection and configuration for optimization and machine learningKenneth Lane ThompsonGoogleFor contributions to the development of operating systems theory and for the implementation of the UNIX operating systemIhab F. IlyasUniversity of WaterlooFor contributions to data cleaning and data integrationAndrew TomkinsGoogleFor contributions to the understanding of the web and web-based social networksLizy Kurian JohnUniversity of Texas at AustinFor contributions to the design, modeling and benchmarking of computer architecturesOlga TroyanskayaPrinceton University and Simons FoundationFor contributions to computational biology, data integrationJoost-Pieter KatoenRWTH Aachen UniversityFor contributions to model checking of software and probabilistic systemsMatthew A. TurkToyota Technological Institute at Chicago and University of California, Santa BarbaraFor contributions to face recognition, computer vision, and multimodal interactionNam Sung KimSamsungFor contributions to design and modeling of power-efficient computer architecturesWil Van Der AalstRWTH Aachen UniversityFor contributions to process mining, process management and data scienceSven KoenigUniversity of Southern CaliforniaFor contributions to artificial intelligence, including heuristic search and multi-agent coordinationToby WalshUniversity of New South Wales and CSIRO Data61For contributions to artificial intelligenceDavid KotzDartmouth CollegeFor contributions to the security, privacy, and usability of mobile systemsWei WangUniversity of California, Los AngelesFor contributions to the foundation and practice of data miningArvind KrishnamurthyUniversity of WashingtonFor contributions to networks and distributed computer systemsLaurie Ann WilliamsNorth Carolina State UniversityFor contributions to empirical research on agile software development, software security, and software engineering educationRavi KumarGoogle ResearchFor contributions to web science modeling, **ytics, and algorithmsCathy H. WuUniversity of DelawareFor contributions to bioinformatics, computational biology, knowledge mining and semantic data integrationZhou KunZhejiang UniversityFor contributions to computer graphicsShuicheng YanYITU TechnologyFor contributions to visual content understanding techniques and applicationBrian LevineUniversity of Massachusetts AmherstFor contributions to network forensics, security, and privacy, and for thwarting crimes against childrenWang YiUppsala UniversityFor contributions to the automated **ysis and verification of real-time systemsKevin Leyton-BrownUniversity of British ColumbiaFor contributions to artificial intelligence, including computational game theory, multi-agent systems, machine learning, and optimizationMichael J. ZydaUniversity of Southern CaliforniaFor contributions to game design, game and virtual reality networking, and body trackingXuelong LiNorthwestern Polytechnic UniversityFor contributions to computing on and learning from higher-order dataSteven H. LowCalifornia Institute of TechnologyFor theoretical foundations and real-world deployment of Internet congestion control and smart grid optimizationChenyang LuWashington University in St. LouisFor contributions to adaptive real-time systems, real-time virtualization, and wireless cyber-physical Acm Fellow 2020年名单:https://www.acm.org/media-center/2021/january/fellows-2020
  • [前沿快讯] 华为云AI领域首席科学家、IEEE Fellow田奇:云原生时代,视觉预训练大模型探索与实践
    近日,在 Qcon 全球软件开发大会(深圳站)上,华为云人工智能领域首席科学家、IEEE FELLOW 田奇博士,作了题为「云原生时代,视觉预训练大模型探索与实践」的主题演讲,介绍了云原生时代华为云在 AI 基础研究、视觉预训练模型研发和行业实践,以及 AI 开发平台 ModelArts 的最新进展。以下是田奇博士演讲要点:随着企业数字化的转型,传统企业已基本上将业务从线下搬到了云上。其中,第一个阶段是将企业的业务简单地部署到云上,我们可以称之为 ON CLOUD,在这种形态下,通过资源池化,解决了 IDC 时代运维、部署、扩容的难题。但是,传统方法的过于厚重、烟囱式的架构,导致云对业务的价值还仅仅停留在资源供给阶段,未充分发挥出云计算的潜力。随着企业的数字化建设逐步迈入智能化阶段,企业需要充分利用云计算带来的红利,就需要让其业务能力内生于云,由现在的 ON CLOUD 进阶到 IN CLOUD 阶段,即基于云的技术架构来构建企业业务,通过构建多云、多中心的分布式架构以及敏捷、智能的企业数字化业务,将企业的数字化建设带入智能化新阶段。此时,云对业务的价值不再是简单的资源供给,还能够以应用为中心,为业务赋能。一站式 AI 开发平台,加速行业 AI 落地,践行普惠 AI华为云提供了一站式的 AI 开发平台,加速行业 AI 落地,践行普惠 AI。华为云对 AI 平台打造了四层体系,第一层是智能体;第二层是知识计算解决方案;第三层是 ModelArts Pro,针对专业应用开发套件;第四层是 ModelArts Fundamental。对于一站式的 AI 开发平台,主要聚焦在模型高效、数据高效以及知识高效。这些强大的 AI 服务,底层都是基于云原生容器的 Volcano 高效能调度引擎,而 Volcano 调度引擎将训练任务的效率提升了 50%。华为云 AI 基础研究进展华为云长期扎根 AI 技术基础研究,在计算机视觉、语音语义、决策优化三个方向做了深入探索与研究。为此,我们针对数据、模型和知识提出了六个子计划。其中,针对模型包含两个计划,一个是针对大模型的模型摸高计划,提供极致的性能;第二是针对小模型的模型瘦身计划。针对数据提出了两个计划,一个是处理多模态的数据魔方计划;另一个是针对小样本学习的数据冰山计划。最后针对知识的高效提取,我们提出了两个计划:建造通用 AI 系统的万物预视计划以及学习一种新范式的虚实合一计划。在这些计划中,我们始终聚焦在模型高效、数据高效、知识高效等重点方向上。对于自主研发的一些新技术,比如自动学习、知识蒸馏、预训练模型等等,都会以即插即用的方式部署到华为云线上,助力 AI 行业落地。在众多 AI 领域中,计算机视觉具有广泛的落地场景,在智能汽车、智能手机、无人机、智能眼镜等应用都有计算机视觉算法的身影。这些年随着计算能力和 5G 通信技术的极大提高,以计算机视觉为代表的大批 AI 技术,已跨越了早期仅在研究领域取得进展的阶段,过渡到了与社会环境协同发展、共同促进的阶段。未来视觉 AI 技术会在千行百业进行落地,比如政府、医疗、工业、能源、交通、物流、金融等等。但是,技术落地也面临着巨大的挑战,由于 AI 应用的碎片化、定制化等因素,极大地限制了 AI 在真实环境下的落地部署。为了解决应对 AI 碎片化等问题,我们提出了预训练大模型的解决方案,希望能用大量无标注的数据和更大的模型来实现更通用的 AI 系统。在自然语言处理领域,这两年大规模预训练模型取得了突破性进展,但是预训练模型对算力有极大的需求,而且我们预计更大规模、更大参数的模型还会继续出现。因此,受到自然语言处理中预训练模型的启发,在计算机视觉中我们也希望构建通用的 AI 系统,为下游各种视觉任务提供一个高效的初始化模型。现在主流的学习方式有两种,一种是监督学习,一种是强化学习。监督学习需要海量标注样本,泛化能力相对比较弱,另一种是强化学习,强化学习需要海量的试错,同样缺乏通用系统所需要的可适用性、可重复性以及鲁棒性。我们认为,自监督学习是迈向常识学习的关键步骤,但是目前自监督学习在视觉任务中的应用还不够成熟。过去,在数据标注、模型训练和输出阶段,分别要做大量的重复工作。未来,我们希望可以对计算机视觉或者自然语言处理任务构建一个通用预训练模型,仅通过下游少量的标注样本进行微调就可以高效完成任务,从而大量节约开发成本。视觉预训练大模型研究和实践接下来的报告,我会介绍一下我们在预训练模型方面的工作,主要是在自监督学习过程中预训练模型的一些进展。自监督学习由于不需要任何人工标注便能够学习图像的内在表征,近年来受到了业界的极大关注。在没有人工标注的情形下,自监督学习需要预先设定一些预训练任务辅助模型学习。2016 年以前,一些预训练任务推动该领域出现了一些大的进展。自监督学习主要分为两种,一种是生成式,一种是对比式,近几年最新的一些工作大多是基于实例区分的对比学习。 基于实例区分的对比自监督学习在最近几年取得了极大的进展,在一些任务上刷新了现有自监督预训练任务的 SOTA 结果。最近我们在对比自监督学习方面有两项优化工作,首次实现了在 ImageNet 线性分类任务中达到全监督基线性能,并且在小样本分类上大大超越了之前的方法。然而,现有的自监督预训练模型仍然处于探索阶段,存在大量的问题未能够解决:现有的自监督预训练算法迭代缓慢,很难复制到大模型以及超大规模数据集;另外,相较于全监督学习,其特征表达在大多数下游任务上仅仅能获得与之相比拟的结果,其进一步的性能优势还有待挖掘。因此,如何利用自监督学习在超大数据集合,超大模型上获取更强的泛化性能将会是未来的发展方向。在这里,介绍一下我们最新的几个工作,在对比自监督学习框架下,我们提出了基于邻域保持的混合图像增强,在业界首次提出了利用不同图像数据增强策略提升其泛化性能。过去,对比学习通常利用同一样本的不同数据增强生成正样本集合,并且把其他样本均视为负样本的策略,将样本特征的距离拉近或者拉远作对比学习任务,而我们首次提出了选取不同正样本的方法。同时,提出了基于局部领域混合增强的技术,把多个相似样本的特征拉近,不同样本的距离拉远。我们的方法在 ImageNet 线性分类评估上,TOP-1 的精度达到了 75.5% 准确率,离监督学习基线 76.5% 仅仅差了 1 个百分点。通过对预训练模型在小样本标注数据上进行微调(1% 和 10% 标注的数据),我们的精度达到了最好的结果。 接下来介绍一个我们今年刚刚完成的工作,基于等级化语义**的对比自监督学习框架。在上述工作的基础上,我们进一步发现即使显示地拉近语义相似性样本,特征表达的可分离特性并没有达到我们的预期目标,这限制了其泛化表征能力。自监督学习仍然存在优化困难,收敛速度慢等问题,为此,我们做了两点改进,第一,我们拓展了自监督学习算法中正样本数目,使得正样本集合能够更加高效的被**,同时避免受大量负样本优化的影响。第二,我们在浅层特征上引入对比自监督学习,通过精心设计的浅层优化目标加速训练过程,在浅层特征上实现了更好的可分离性,我们发现这些优势对小样本学习有极大的提升。从结果来看,我们在线性分类任务中达到了 76.4% 的精度,首次达到了和全监督基线相比拟的性能,而且通过将预训练模型在小样本标注数据上进行微调,在之前的结果上又得达到了新的 SOTA,特别地,仅仅使用 10% 标注,我们在 ImageNet 分类上达到了 75.1% 的 TOP-1 精度。上述两项工作都是在没有任何标签设置下完成的,更进一步,我们探索了如何把对比学习和数据标签高效地结合起来,通过引入图像真实标签来辅助对比学习,我们认为应该将自监督学习得到的表观特征和监督学习的语义特征相结合,它的本质是把表观相似和语义相似的样本距离拉近,将不相似样本的距离推远。从结果上看,这个工作在各个下游工作中(比如检测、语义分割、实例分割)的表现全面超越了以往的自监督和全监督的泛化能力。华为云的第二个核心研究方向是如何设计高效的视觉识别模型,即模型高效。在这个方向主要聚焦两个方面,第一是如何设计神经网络模型,第二是在神经网络架构搜索中,如何在原子算子层面上进行搜索。关于神经网络模型设计,最初的方式都是手工设计的,这种方式经过高速发展后,也进入了一个瓶颈,因此从 2017 年开始,自动的神经网络架构搜索经历了一个迅猛发展的过程,也取得了一些可喜的成绩。但是搜索出的网络也面临几个问题,第一个问题,搜索空间仍然是手工定义的;第二个,搜索的卷积算子是人工定义的,而且相比于手工设计的网络,搜索的网络可迁移性也是比较差的。我们在网络架构搜索上第一个工作是 P-DARTS,提出渐进的可微分网络架构搜索算法。之前的网络架构搜索面临着搜索网络和测试网络深度不一样的问题,在较浅的搜索网络中搜索出来的架构并不适合较深的测试网络。早期的方法直接加深搜索的深度,但是会造成显存爆炸的问题,并且导致搜索不稳定。为了解决这个问题,我们提出了两个思想,一个是搜索空间近似,第二个是搜索正则化。搜索空间近似,是指采用渐进搜索策略,逐渐加深搜索的深度;同时进行链接权重的学习,把权重比较小的链接运算都扔掉,这样减少了搜索空间。搜索正则化主要是对搜索得到的一些 skip connect 的数量上的限制。从结果上看,我们把 P-DARTS 搜索的网络迁移到 ImageNet 上,在 ImageNet 分类任务上与基线方法相比提高了两个百分点。P-DARTS 网络搜索算法是在 P100 上完成的,大概需要 0.3 个 GPU-days。与去年同期的 DARTS 工作进行大致的比较,它的搜索时间是 4 个 GPU-days,而在性能和速度都有超越的情况下,我们的方法只需要 0.3 个 GPU-days。我们在架构搜索上的第二个工作是 PC-DARTS,这是业界搜索速度最快的网络架构方法之一,其主要思想有两个,一个是采用局部连接的思想来解决网络冗余的问题,第二个是采用边正则化的思想来解决网络搜索稳定性的问题。并且,这个工作首次在大规模图像数据集 ImageNet 上进行了神经网络架构搜索。我们最新的一个相关工作是 GOLD-NAS,渐进剪枝的单阶段可微分搜索算法。这个算法主要的一个贡献是它打破了传统可微分搜索空间的诸多限制,因此大大增加了搜索空间的容量,并提出了单阶段优化策略和渐进剪枝的优化策略。从结果上看,在扩大的搜索空间中,算法不仅能够找到绝对性能更强的网络,也能找到具有更高性价比的网络。我们第四个工作是卷积搜索,提出对卷积操作进行搜索,当前的模型搜索都是采用一些固定的卷积操作,比如 1×1、3×3 的卷积,这种方式限制了模型的性能。因此,为了将卷积的设计也纳入搜索的范围,这个工作提出了针对点云任务的基于数据驱动的模型搜索,同时对卷积的结构也进行了搜索,将来将进一步扩展到传统的图像领域。我们最近两年在计算机视觉三大顶会 CVPR、ICCV、ECCV 大概发表了近百篇文章,基本进入视觉研究领域第一梯队,极大地提高了华为在计算机视觉领域的国际竞争力,同时有一些工作也获得了最佳论文和最佳论文提名。而且最新的算法已经逐渐部署到华为的一站式 AI 开发平台,在一些行业得到了广泛的应用,下面再介绍一下视觉任务的进展和在行业的实践。第一个进展是图像分类技术,在 ImageNet 上,今年我们的分类准确率达到了 85.8%,而之前谷歌最好的精度是 85.5%。从今年 3 月份以来,我们在这方面一直保持着领先水平。第二个进展是弱标注场景下的图像分类技术。在 WebVision 大规模弱标注的网络图像分类比赛中,大约有 5000 个类别的 1600 万张图像,有 90 多支参赛队伍竞争,华为云在分类准确率上取得了业界第一的水平。我们把图像分类技术应用到了一些传统行业,比如米旗蛋糕店。结果上看,我们的技术让商品整盘识别率达到了 99% 以上的精度。另外,我们的模型训练时间小于一天,因此每天都可以进行模型更新,商品的识别时间也小于 1 秒。第三个进展是图像检测、分割技术,在业界权威的目标检测数据集 MS-COCO 数据集上,不论是单模型还是多模型,我们都取得了今年业界第一的成绩。我们将检测、分割技术用到了医疗智能体,在今年新冠肺炎 AI-CT 辅助筛查中实现了自动智能检测,而且已经在各大医院成功部署。我们第四个进展是多模态数据处理技术,相对于单模态,多模态具有天然的互补优势,比如在无人驾驶中除了图像的输入,还有激光雷达信号、GPS、图像分割的数据。在最权威的三维目标检测 NuScenes 数据上,我们提出的技术也取得了非常好的成绩,我们的结果比第二名领先了 3.1%。同时我们将多模态处理技术用在了深圳交通智能体上,实现对红绿灯控制的智能化,在交通总量相同的情况下将平均通行车速提高了 15%,将平均等待时间、延误时间下降了 17.7%。最后介绍一下华为云一站式 AI 开发管理平台 ModelArts。ModelArts 有两个不同层次的版本,一个是 ModelArts Fundamental,一个是 ModelArts Pro。根据华为云在十多个行业常年的技术积累,ModelArts Pro 开发平台主要提供五大类的专业应用开发套件,包括文字识别套件、视觉套件、知识图谱套件、多模态开发套件、自然语言处理套件,还提供了四十多个行业级的高精度预置的算法, 包含数据准备、数据处理、 模型设计、模型管理及部署等等。以上是华为云在视觉预训练模型上的一些基础研究最新进展和行业实践的案例,以及在华为云 AI 开放平台沉淀的一些工作。谢谢!文章来源:https://www.jiqizhixin.com/articles/2020-12-08-8
  • [前沿快讯] 刘群:预训练语言模型研究进展和趋势展望
    作者 | 戚路北自2018年下半年开始,到现在为止,预训练语言模型的发展基本呈现爆发趋势,研究人员数目越来越多,研究方向也越来越广。近日,在第十九届中国计算语言学大会(CCL2020)上,华为诺亚方舟实验室语音语义首席科学家刘群介绍了预训练语言模型研究进展和趋势展望。演讲内容包括自然语言处理的预训练方法的背景,预训练语言模型的近期进展,华为课题组的成员们做的工作,以及目前的成就与未来的展望。刘群是自然语言处理和机器翻译领域的国际著名专家,研究方向包括多语言信息处理、机器翻译模型、方法与评价等。2012 年 7 月之前,刘群是中国科学院计算技术研究所的研究员和自然语言处理研究组负责人。2012 年 7 至 2018 年 6 月,刘群任都柏林城市大学教授、爱尔兰 ADAPT 研究中心(前身 CNGL 研究中心)自然语言处理主题负责人。2018 年 7 月开始,他正式加入华为诺亚方舟实验室,任语音语义首席科学家,主导语音和自然语言处理领域的前沿研究和技术创新,除了语音、对话、翻译、多模态以外,其实验室也在重点布局预训练语言模型。以下是演讲全文,AI科技评论进行了不改变原意的整理。1自然语言处理的预训练方法的背景自然语言处理的预训练方法属于自然语言的表示学习,自然语言表示学习的形成已经经过了长期的历史发展。首先,1948年N-gram分布式模型被提出来,这是最初的语言模型。1986年出现了分布式语义表示,即用一个词的上下文来表示该词的词义。2003年神经语言模型被提出,开始使用神经网络来进行语言建模。2013年word2vec的提出,标志着神经网络方法开始在NLP领域获得成功,word2vec将词语从一个符号空间映射到了一个向量空间,使得NLP中大规模使用神经网络方法成为可能。到2018年,出现了预训练语言模型。不管是统计方法还是神经网络方法,都是一种基于数据的方法。如果数据不够的话,模型就无法有效建立。但是现实生活中,数据永远是一个很大的问题。在实际应用场景中,我们得到的很多数据都是无标注的,在这种情况下传统模型就无法解决实际问题。预训练的思想是,在利用标注数据之前,先利用无标注的数据也就是纯文本数据,去训练一个模型,这个模型能够学到一些潜在的跟标注无关的知识。然后在具体的任务上,预训练模型就可以利用大量的无标注数据训练所得到的知识。第一代自然语言处理预训练模型是词向量模型。词向量模型是把大量的无标注的文本送到一个比较简单的神经网络里面,经过训练,每个词都会被赋予一个静态的向量。词的静态向量在空间分布上有一个非常好的特点,即相似的词会聚在一起。词与词之间的关系也会以一种向量的形式得到体现,从而实现了符号空间到向量空间的映射。第二代自然语言处理的预训练模型,就是我们今天研究和使用的预训练语言模型。预训练语言模型是词向量模型的进化,它的本质其实是有上下文的词向量模型。预训练语言模型的训练过程是,首先给句子中的每个词赋予一个静态向量,然后它会跟句子的上下文词进行交互,最后就得到了这个词在句子中的变化的词向量。这种特殊的词向量模型我们叫做预训练语言模型。预训练语言模型有一个很重要的特点,它既会给每一个句子赋予一个概率,同时还会给每个词赋予一个表示或一些特征。利用预训练语言模型的这个特点,就可以使用现实生活中几乎无穷无尽的无标注文本,来训练预训练语言模型,然后就能把经过训练的预训练语言模型,用在任何的下游任务上。这不仅可以使下游任务的性能得到非常大的提高,还可以大大降低下游任务所依赖的标注语料的规模。实际上,预训练语言模型的出现,几乎使所有的下游任务的性能都得到了很大的提高,使得自然语言处理技术又上了一个台阶,因此这是一个具有重大意义的突破。在实际应用中,使用预训练语言模型可以分成两个过程,一个叫预训练,一个叫微调。首先在大量的文本上训练出一个预训练语言模型,然后在下游的任务上,根据实际情况对得到的预训练语言模型进行微调。Transformer模型是预训练语言模型的主要框架,它的主要特点就是词与词之间可以互相关注。类似于卷积神经网络中具有多个卷积核,并且每个卷积核会自动去会分配不同的权重,Transformer的基本结构的每一层都由多头的自注意力网络,以及一个前向的神经网络共同组成。自注意力机制是预训练语言模型中非常有趣的机制。通过一些可视化工具,我们可以看到不同的自注意力头呈现出不同的特点或不同的关注结构,比如关注句子的第一个词、相邻的词、中心词甚至是句子结尾的标点符号。所有的关注信息,或者说词的注意力都可以在可视化图里看到。预训练语言模型出现以来发展得非常迅速,目前已经演化形成了一个家族。2预训练语言模型的近期进展预训练语言模型的近期进展包括以下几个方面:1.更强大,也被戏称为叫大力出奇迹。2.更小巧,即怎么把做模型做的更小、更快。3.更优秀、功能更多、性能更高、训练更快的模型。4.更聪明,即怎么引入外部知识。5.更能干,即预训练语言模型如何影响了自然语言处理以外的一些领域。1.更强大预训练语言模型几乎成为了大公司之间的军备竞赛,目前学术界还还很难参与这种军备竞赛。很多大企业都将自己的预训练语言模型做的越来越大,仿佛没有终点,并且这种趋势还在不断加强。预训练语言模型的做大不仅仅是带来量的提高,更带来了模型使用性质的变化。最早在词向量模型时期,整个自然语言处理就被带入了神经网络时代。在神经网络时代,单一的CPU已经不能满足需求了。可以通过GPU,在不需要进行过多额外计算的情况下,做到在整个词表上进行词的选择,这在以前的SMT上是不可想象的。正是有了GPU,我们才可以通过词向量模型这类神经语言模型来完成这类工作。如果没有GPU支持,或者用以前的统计方法,是难以想象的。预训练语言模型通过使用更大的GPU,更多的数据,也带来了更大的变化,即微调的模式。微调为下游任务大致规定了几种固定的模式,包括句子分类、句子关系的分类、词语序列标注,以及QA任务中常见的句子片段的提取等。以前解决每个NLP问题,都要先设计模型。现在通过微调这一简单的模式,我们不再需要去为每个任务去设计特定的NLP模型,而可以将所有的NLP任务都纳入几个模式。GPT-3有一个非常吸引人的地方,就是它几乎无需做微调,并且它的演示效果也很好。GPT-3给我们带来了非常大的冲击。这个模型有着极高的训练成本,使得实际上绝大部分的企业和科研机构都无力承担。它的1750亿参数比BERT-base模型大了100倍,比 GPT-2大了10倍。它单次训练需要1万亿单词的训练数据,以及1200万美元的训练成本,能够承担这种训练成本的企业在世界范围内也非常少。虽然它的训练成本如此之高,但是它的效果非常令人吃惊。以前我们解决特定的问题,都需要专门去找语料,做专门的训练才能做。现在这个模型,只要是需要的功能都可以直接实现,基本不用训练。还有一些我们原来觉得很难做到的事情,GPT-3也能做到,例如算术计算、写代码等等。它还能够很细致的区分56和49这两个词,甚至在数量上都能区分出来,如此的细腻度令人吃惊,这也给它的商业价值也带来巨大的想象空间。很多人都在想,大算力会不会成为预训练语言模型的瓶颈?实际上,算力最终并不会成为瓶颈。上世纪90年代IBM提出统计机器翻译模型的时候,大家几乎都重复不了。但是99年以后,统计机器翻译模型基本上变成普遍的、所有人都能用的模型了。深度学习也是一样,深度学习在GPU出现以前,也是曲高和寡,然而 GPU的出现,突破了算力瓶颈以后,也变成了一种普通的工具。那么GPT-3这样的模型,现在的成本虽然非常高,但是我们大家可以去憧憬一下,未来的某一天,它或许也会变成一种非常普遍的工具。训练大模型实际上是很困难的,它并不是在单一的CPU或者GPU上进行训练,而是在多个硬件的组合结构上进行训练。但同时,每引入一种更复杂的硬件结构,也会带来更多的问题。上图为一些常见的用来解决这些问题的技术。下面着重介绍三维并行训练技术和稀疏注意力加速技术。三维并行训练技术,是指把数据和模型进行各种维度的切分,包括数据并行、pipeline并行和模型并行。模型并行又包括不同类型的模型变形,通过把整个数据和模型进行三维的切分,建立三维并行坐标和物理设备之间的映射,然后每一个区域运行一小块的方法。稀疏注意力加速技术也是一个被证明有效的技术,GPT-3就使用了这个技术。它的原理是把一个注意力矩阵分成两个小型矩阵的乘积,这是一个可以有效处理更长注意力的机制,这也是目前为止被证明非常有效的办法。2.更小巧目前的大型预训练模型,不但训练麻烦,而且推理时间也很长,因此只能用在云端应用上,在设备端应用有明显的局限性。因此训练出更小的模型,实际上也具有非常大的应用价值。就华为来说,华为目前的业务方向除了手机业务外,也在做大量的用于物联网的小设备。既然希望将模型用到小设备上,我们就面临将模型进行加速和压缩的问题。预训练语言模型就形成了这两种趋势。一方面是人们把模型越做越大,去探索模型能力的边界。另外一方面就是模型越做越小,让它在各种下游任务上形成生产力,即在手机端等各种小设备上能够单独运行。目前模型压缩这一方面研究也非常多,主要包括三大类技术,一类是基于知识蒸馏的预训练语言模型压缩,另一类是基于剪枝的预训练语言模型压缩,还有一类是基于量化的预训练语言模型压缩。基于剪枝的预训练语言模型压缩,就是基于一定的准则,去除掉参数矩阵的冗余部分。比如在神经网络模型中,我们可以去掉一些冗余的神经元节点,和神经元连接,使得模型变小一点。基于量化的预训练语言模型压缩,就是减少数值表示所需要的比特值。目前我们使用的GPU都是用32位的浮点数计算,计算代价非常高。我们可以将它量化为8位的浮点数,甚至4位的浮点数、2位的浮点数,这样运算过程就得到了简化。还有一些别的压缩技术,比如矩阵参数分解、参数共享、模型架构设计与搜索。矩阵参数分解就是将一个大矩阵,分解成两个小矩阵的乘积。参数共享有很多方式,比如Transformer有很多层,各层之间可以共享其中一些参数。而ALBERT,就是所有的层共享其中一层的参数。共享参数的好处就是参数量大大减少,但实际上在推理时间上并不能大幅度减少,所以它能带来的好处还是有限。模型架构设计与搜索这方面的发展,其实跟近年来自动机器学习的发展有关系,我们希望通过自动机器学习,能够去搜索出更好的、更精简的架构。3.更优秀目前看来Transformer模型架构确实非常优秀,当下也很难去做大的改动。真正做出一些影响力的工作是transformer XL,它的贡献是引入了recurrent的思想,以及引入了相对位置编码。而其它方面的话,大的改动很少。另外就是试图降低复杂度,因为attention机制是每两个词之间都要做一次 attention,这样的话attention的计算数量就是一个句子长度的平方级。在日常处理更长的文本的时候,都会面临这样的问题。目前我们需要的文本长度一般都不能超过1024,很多任务甚至只能用512或者256。很多研究工作速度希望把它的计算数量从平方量级降到线性量级,从而可以使语言模型处理更长的文本,所以目前这方面的研究也非常多。除了去寻找更好的模型结构,我们还需要训练更复杂的任务。现在BERT训练的过程实际上并不高效,它的训练时间很长,很多学者就试图在这方面去改进,提出更好的训练任务。Baseline是基础的预训练语言模型的训练,包括LM、MLM和NSP等训练任务。除此之外,大家也提出了各种各样的新的训练任务来进行改进。BERT就提出了几种新的训练方法,一种叫做next sentence prediction(NSP),就是根据前文预测下一个句子。另一种叫做whole word masking,这跟BERT的设计有关系。因为BERT里很多词都被拆分成一个个小单位,这样单独预测其中一个subword难度就比较小。通过把小单位合起来,加大训练难度,预测效果就会更好一点。以下还列举了其它模型的一些训练任务。replaced token prediction:也就是将一个词给换掉,然后来预测这个词是换掉之后的词还是原来的词。Sentence order prediction:将两个句子的顺序给颠倒,来检测哪种顺序是正确的。Denoising Autoencoder:这个是更复杂的训练任务,它是对一个句子进行插入、删除、替换等操作之后,再将它还原出来。Multi-task Learning:它同时使用了多种训练任务。Generator and discriminator:它是用一个生成器去替换一些词,然后由判别器来判断每个词是否替换。它的好处在于一个句子中的所有词都可以做错误的反向传播,所有词都能被我们使用,而BERT一个句子只能利用15%的词。这样我们就能加快它的训练速度。另外我们还在追求更多的功能,比如多语言预训练语言模型,像mBERT和XLM,另外还有一些想法就是把GPT和BERT这一类模型给综合起来,像UniLM和PMLM。4.更聪明现在,人们都意识到语言模型缺乏知识,那么是否可以融入一些外部知识呢?知识这个话题很大,目前也有一些争议,但是相关研究还是很多的。图中是刘知远团队跟华为合作的早期工作,就是试图把采用TransE预训练得到的知识空间的向量表示嵌入到语言模型里面去。这是刘知远团队改进后的工作叫KEPLER,也就是将知识图谱融入到语言模型中,像这一类的工作还有很多。还有一种更简单的想法,Span知识融入:就是让实体或者关系对应着句子中的一个span,通过利用span的方式来把知识嵌入。图中是赵海团队做的SemBERT, 这种方法是将语义角色标记这种更复杂的句法语义的知识融入到语言模型。5.更能干目前在预训练语言模型中,有很多想法都非常好,而且在自然语言处理方面取得了成功。因此很多人都在想,能不能将这种思路应用到别的领域?这个想法很好,做起来很困难,但最终也取得了一些喜人的成果。比如说在语音识别领域, Facebook提出了 wave2vec,它就是通过使用大量没有标注的、纯语音的数据,去预训练一个模型,然后利用这个模型,在一个少量文本标注的语料上进行语音识别,最终取得了非常好的效果。那么最近在图像上面,包括图像分类、目标检测等任务,都有一些预训练的相关研究。其中,DETR是用了transformer模型,但不算预训练。信息检索也已经开始用预训练语言模型,并取得了非常好的效果。在这方面目前大概有两类模型,一类采用sparse索引,它是使用传统的搜索引擎的前提下,去改进传统倒排表的方法。另一类采用dense索引,这种方法不需要建立传统的倒排表,而是直接用dense向量去对文本进行信息检索。3我们的工作接下来我将介绍一下华为诺亚方舟实验室在这方面所取得的成果。首先,我们开发了一个自研的预训练语言模型叫哪吒。其次,我们在模型压缩方面做的工作非常多,华为的TinyBERT模型被压缩的非常小,小到可以用在端侧。如今的预训练语言模型太多了,但我们还是希望有自主开发的模型,然后兼收并蓄,融合好的技术,并且把新技术也结合,然后训练好用的模型。同时我们也把它开源,大家可以去网上下载。目前我们已经推出了不同的版本,另外还有生成模型和TinyBERT,也都开源了。哪吒的性能也是非常强的,我们在目前中文的CLUE排行榜上是第二名,仅次于human模型,事实上在之前很长时间内我们都是第一名。另外在英文的排行榜SUPERGLUE,我们现在已经排到第二名,第一名的是目前在规模上大哪吒十倍的T5模型。哪吒在华为产品的落地,包括华为云,华为手机小艺,以及华为的 HMS。哪吒在华为产品落地的技术,包括基础的算法和模型,对话系统,还有推荐搜索等。TinyBERT是我们目前取得成就最多的一个模型,接下来我着重讲一下TinyBERT的原理。TinyBERT知识蒸馏的基本流程包括两步,第一步叫做general distillation,即使用一个大的预训练语言模型,训练一个小的预训练语言模型。第二步叫做task-specific distillation,即使用一个大的预训练语言模型,去对一个小的预训练语言模型进行微调。在这里我们引入了一个新的技术,叫做数据增强,这个技术非常重要,如果没有这个技术的话,整个模型的性能会下降很多。TinyBERT知识蒸馏的损失函数中一个比较重要的就是,让中间层去学习隐藏状态和attention向量。TinyBERT知识蒸馏的选层策略就是,我们用4层或者6层的学生模型,去学习12层的教师模型。但是让哪一层去学习哪一层,这就是一个有关映射的策略的问题了。我们最早提出的是一个均匀映射模型,即用小模型的1,2,3,4层,去依次学习大模型的3,6,9,12层。后来我们就在想,是否可以让每一层都自动去搜索一个最合适的层次学习?我们就引入了进化学习算法。然后我们发现,对小模型来说,最好的学习层次是0,0,5,10。即小模型的第一层,第二层不要去学习,最好直接使用自动反向传播去调。用第3层去学大模型的第5层,第4层去学大模型的第10层,这样效果最好。6层的学生模型我们学到的是0,5,0,0,0,10。通过选层策略可以发现,选择好的层次的话就可以提高整体的效果。TinyBERT知识蒸馏数据增强是一个非常有效的技术。因为下游任务一般数据都比较少,那么我们在蒸馏小模型的时候,数据的数量经常是不足的。我们采取的办法,就是把用于下游任务的数据进行增强。数据增强实际上就是利用了BERT本身的特点,它的每个词都是可以替换成别的词的。我们采用一种替换策略,就是把每个词都去做一些替换,这样的话就会生成很多的跟原来的句子很相似的句子,比如10个词的句子换掉2个或者3个词,去生成增强的语料。最后,我们发现大概增强20倍的时候,即将原来的一个句子替换生成20个左右相似的句子,用来做下游任务的蒸馏的效果最好。这是我们的实验结果,我们看到在4层的模型,在GLUE上面,总的分数大概降低了2.5,从79.5降到77。6层的TinyBERT基本上是跟12层的没有什么变化。在参数量方面,BERT-base有109M,而4层的模型只有14.5M,只有原模型的13.3%。6层的模型只降到了原来的一半。在速度方面,我们也可以看到4层的模型提速了9.4倍,提速非常高。并且我们现在模型空间非常小,参数量是14.5M的模型大小只有50M左右,完全可以放入手机之中,并且它的推理速度比原来快将近快10倍。目前我们这个模型已经大量的运用在华为的设备与应用之中。我们还做了一个工作,在华为自研的BOLT深度学习加速库下,利用了底层的硬件再一次进行压缩和加速,使得TinyBERT最终的推理速度,可以达到1.3毫秒。我们的TinyBERT在中文的CLUE小模型排行榜上一直是第一名。然后我们参加了 NLPCC的小模型评测比赛,也是获得了第一名。4总结与展望从历史角度来讲,模型越来越大。GPT-3已经这么大了,我们还能做得更大吗?当然如果未来计算设备的硬件的问题解决了,可以更大,但是近期内呢?更大的模型应该是什么样子?我设想的一种方式就是分布式,把模型分布到很多机器上计算,就像搜索引擎一样。像BERT这一类模型如何再把它训练的更大?现在最大的几个预训练语言模型都是GPT类的,BERT这一类模型很难做得更大,一些工程上的问题目前还是很难解决的。那么未来我们是否可能训练更大的BERT类的模型?小模型相反, BERT这类模型可以压缩的很小,GPT模型就很难压缩。BERT这个模型的压缩是不是还有潜力可以挖掘?另外知识融入是一个很有意思的问题。知识融入人们做了很多工作,实际上我是不太满意的。因为很多工作只是在解决知识类的问题效果比较好, 一般的 NLP的问题,知识融入的作用并不是那么大,所以希望知识融入能够解决一般的 NLP的问题。还有就是知识应该如何表示?现在大部分人认为知识都是三元组,我觉得这个是存在争议的,三元组实际上能够表达的知识其实非常有限。比如序列关系、空间关系、集合关系、数值关系等等关系知识都是很难学到的。关于搜索引擎,我希望以后预训练语言模型可以和搜索引擎结合起来,预训练语言模型就是个能够回答任何问题的搜索引擎。最后就是多模态预训练,希望将来它能带来无限的想象空间。
总条数:5192 到第
上滑加载中