• [前沿快讯] 2020 ACM Fellow 出炉!图灵奖得主坐镇,陈怡然、颜水成、周昆等12位华人科学家入选
    作者 | AI科技评论AI 科技评论消息,**计算机学会(ACM)于今日刚刚宣布了 2020年新当选 ACM Fellow 名单,共有 95位科学家当选,其中包括陈怡然、颜水成、周昆、申恒涛、陶宇飞、王薇、Cathy Wu、李学龙、吕晨阳、任奎、王义、张耀文等12位华人学者!值得注意的是,2020 年入选的 ACM Fellows 中,还有多位图灵奖得主(未经评选,直接授予),包括Whitfield Diffie、Adi Shamir、Manuel Blum等人。作为世界上最大的计算机领域专业性学术组织,ACM 的影响力不言而喻。它创立于 1947 年,目前在全世界 130 多个国家和地区拥有超过 10 万名会员,其所评选的图灵奖是计算机界最负盛名、最崇高的一个奖项,被称为「计算机界的诺贝尔奖」。而 ACM Fellow 则设立于 1993 年,用于表彰在计算和信息技术领域从业五年以上,并做出了「突出贡献」(Exceptional Contributions) 的科学家,是 ACM 所有会员中最顶尖的那 1% 位成员。截止目前为止,已有 1000 多位 ACM Fellow 诞生。本次选出的95名ACM Fellow ,分别在人工智能、云计算、计算机图形学、计算生物学、数据科学、安全和隐私、软件工程、量子计算和网络科学等领域做出了广泛的基础性贡献。ACM 前主席 Cherri M.Pancake 曾经说过:“计算机技术对塑造我们今天的生活和工作产生了巨大影响。所有直接或间接影响我们的技术都是无数个小时工作的结果,协作或个人工作,以及创造性的灵感,有时甚至是明智的冒险。每年,我们都希望有一批最杰出的人成为 ACM Fellow,ACM Fellow是我们整体认可的基石,在强调ACM Fellow的成就时,我们希望给予应有的赞誉,同时也向公众传播计算机专业人员所从事的特殊领域。”为彰显ACM的全球影响力,2020年ACM Fellow 来自澳大利亚、加拿大、中国、埃及、法国、德国、以色列、意大利、瑞士和**的大学、公司和研究中心。以下是12位入选华人学者介绍:陈怡然杜克大学电子与计算机工程终身正教授、IEEE Fellow、杜克大学计算进化智能中心(CEI)主任、** NSF 新型可持续智能计算产学合作中心主任。专注于研究新型存储系统、机器学习和神经形态计算,以及移动计算系统。1998年获得清华大学理学学士学位,2001年获清华硕士学位,2005年获普度大学博士学位。在工业界工作五年后,他于2010年加入匹兹堡大学担任助理教授,后于2014年晋升为终身副教授,并获双世纪校友讲席。他同时也是 NSF CAREER奖、ACM SIGDA杰出新教师奖、德国洪堡资深学者研究奖和IEEE SYSC/CEDA TCCPS职业中期奖的获得者,并被列入HPCA名人堂。陈教授出版过一本专著并发表过400多篇技术论文。他获得过96项**专利,担任或曾担任十多个国际学术论文/期刊的副主编,并曾在60多个国际会议的技术和组织委员会任职。他现在是IEEE电路和系统( IEEE Circuits and Systems )杂志的主编。他获得过七次最佳论文奖,一次最佳 poster奖,以及十四次最佳论文提名。入选理由:对非易失性内存技术的贡献。个人主页:https://ece.duke.edu/faculty/yiran-chen 颜水成前依图科技首席技术官,新加坡国立大学终身机器学习与计算机视觉实验室负责人,IEEE Fellow、IAPR Fellow,曾任 360 集团副总裁、首席科学家与人工智能研究院院长。主要研究领域为计算机视觉、机器学习与多媒体分析。本科就读于北京大学数学科学学院,在微软亚洲研究院实习期间,先后师从人脸识别和智能视频监控专家李子青和计算机视频检索研究领域的“开山鼻祖”张宏江,还与前滴滴研究院院长何晓飞一同搭档发表 4 篇单篇引用过千的论文。他们将 Subspace Learning 与 Manifold Learning 两个当时非常火爆的领域巧妙而简单地串联了起来。2006年,颜水成在伊利诺伊大学香槟分校(UIUC)做博士后研究,师从计算机视觉大师黄煦涛(Thomas Huang)。2007年12月,颜水成教授加入新加坡国立大学,其团队在五年内获得了计算机视觉领域的核心竞赛即PASCAL视觉对象类和ImageNet大规模视觉识别挑战赛的十余次冠军或荣誉奖,以及十多次(最佳)学生论文 奖项。此外,颜水成团队提出的“Network in Network”(NIN)网络结构的核心 1×1 卷积,在近年来几乎被所有计算机视觉深度学习模型当作标准模块,后期出现的 GoogleNet、ResNet等模型也借鉴了其思想。他的团队开发的“Purine”是全球第一个开源的支持多机多GPU的深度学习系统。入选理由:对视觉内容理解技术与应用的贡献。个人主页:https://www.ece.nus.edu.sg/stfpage/eleyans/ 周昆浙江大学计算机系教授,IEEE Fellow,兼任浙江大学计算机辅助设计与图形学国家重点实验室主任,教育部长江学者特聘教授,国家杰出青年科学基金获得者。主要研究方向为计算机图形学、计算机视觉、人机交互和虚拟现实。在ACM/IEEE Transactions上发表论文80余篇,论文引用1万余次,获得发明专利50余项。此外,他曾获得2009年NVIDIA Professor Partnership Award、2010年中国计算机图形学杰出奖、2011年中国青年科技奖、2011年《麻省理工学院技术评论》全球杰出青年创新人物奖 (MIT TR35 Award)、2012年中组部首批青年拔尖人才支持计划、2013年国家自然科学二等奖、2016年陈嘉庚青年科学奖、2017年浙江省自然科学一等奖。入选理由:对计算机图形学的贡献。个人主页:https://person.zju.edu.cn/kunzhou 申恒涛申恒涛教授,**光学学会会士和ACM杰出会员,是电子科技大学计算机科学与工程学院院长,电子科技大学人工智能研究院执行院长,四川省人工智能研究院(宜宾)院长。他分别于2000年和2004年获得了新加坡国立大学计算机科学系一等荣誉学士和博士学位。随后加入昆士兰大学并于2011年底成为教授。他一直从事最前沿的计算机科学研究,研究方向包括多媒体搜索,计算机视觉,人工智能,和大数据管理。申恒涛累计发表了300+篇高水平同行评审论文,其中包括200多篇CCF A类论文, 并获得了8个国际会议和期刊的最佳论文奖,包括A类会议ACM Multimedia 2017 最佳论文奖和ACM SIGIR 2017 最佳论文-Honourable Mention奖,以及IEEE Transactions on Multimedia 2020最佳论文奖。入选理由:对大规模多媒体内容的理解、索引和检索的贡献。个人主页:https://cfm.uestc.edu.cn/~shenht/#陶宇飞**中文大学计算机与工程系教授,复旦大学兼职教授。主要研究兴趣是开发“小而精”的算法,以及数据库、机器学习与理论计算机科学的交叉研究。他在2002年于**科技大学获得计算机科学博士学位,师从 Dimitris Papadias 教授。他曾在CMU担任访问科学家、**城市大学担任助理教授、昆士兰大学担任教授。曾获得2002年**杰出科学家奖、SIGMOD 2013/2015 最佳论文奖、2016年谷歌教职研究奖、PODS 2018 最佳论文奖等。入选理由:对用于大规模数据处理的算法的贡献。个人主页:https://www.cse.cuhk.edu.hk/~taoyf/ 王薇加利福尼亚大学洛杉矶分校(UCLA)计算机系 Leonard Kleinrock 讲席教授,Scalable **ytics Institute 主任,Jonsson Comprehensive 癌症中心、量子计算生物研究所成员。主要研究兴趣为大数据分析、数据挖掘、数据库系统、自然语言处理、生物信息学、计算机生物与计算医疗。她于1999年从UCLA获得计算机科学博士学位,曾于1999年至2002年在IBM T. J. Watson中心担任研究员,于2002年至2012年在北卡罗来纳大学教堂山分校计算机系担任教授。她曾获得 IBM 发明成就奖、微软研究 New Faculty Fellow。入选理由:对数据挖掘的奠基与实践的贡献。个人主页:http://web.cs.ucla.edu/~weiwang/(吴凯茜)Cathy H. Wu特拉华大学生物信息与计算生物中心 Edward G. Jefferson 主席与教授,蛋白质信息资源(PIR) 主任,乔治城大学医学中心兼职教授。主要研究兴趣包括蛋白质家族分类和功能注释、生物数据整合和文本挖掘。她在1978年本科毕业于国立台湾大学植物病理学,随后于1982年获得**普渡大学植物病理学硕士学位,1984年获得普渡大学博士学位。博士毕业后,她继续求学之路,1986年在密歇根州立大学获得分子生物博士后学位,并于19**在德克萨斯大学获得计算机科学硕士学位,硕士毕业论文主题是使用人工神经网络来分类蛋白质,导师为George M. Witson III。之后,19**至1994年,她在德克萨斯大学计算机系担任助理教授,教计算机科学的课程,又在德克萨斯大学健康中心担任助理教授、副教授与教授。吴自1990年以来一直从事生物信息学研究,并开发了几个蛋白质分类系统和数据库。入选理由:对生物信息学、计算生物、知识挖掘与语义数据聚合的贡献。个人主页:https://bioinformatics.udel.edu/people/personnel/cathy_wu/ 李学龙李学龙,国际欧亚科学院院士、西北工业大学教授、博导,校学术委员会副主任。毕业于中国科学技术大学,关注高维数据的智能获取、处理和管理。在应用系统中发挥作用。在工程和计算两个领域入选全球高被引科学家。  此外,还入选**科学促进会会士(AAAS Fellow)、**光学学会会士(OSA Fellow)、国际光学工程学会会士(SPIE Fellow)、国际电气电子工程师协会会士(IEEE Fellow)、国际模式识别学会会士(IAPR Fellow)等。2018年,获得“钱伟长中文信息处理科学技术奖”一等奖。入选理由:对计算高阶数据以及从高阶数据中学习的贡献。个人主页:https://teacher.nwpu.edu.cn/2018010290.html 吕晨阳吕晨阳,圣路易斯华盛顿大学计算机科学与工程系教授,研究领域包括实时系统、无线传感器网络和物联网。他是“ACM Transactions on Sensor Networks”的期刊主编、IEEE IOT期刊的区域编辑。此外,他发表了150多篇研究论文的作者,被引用超过14,000次,h指数为54。他1995年在中国科技大学念完本科,1997年获得中国科学院硕士学位,2001年在弗吉尼亚大学获得博士学位。入选理由:表彰其在自适应实时系统、实时虚拟化和无线网络物理系统方面的贡献。个人主页:https://www.cse.wustl.edu/~lu/任奎浙江大学求是讲席教授,目前担任浙江大学网络空间安全学院院长、计算机科学与技术学院副院长、计算机创新技术研究院执行院长,此前入选 IEEE Fellow。主要研究方向为云安全、物联网安全与隐私保护,是其研究领域的权威专家。任奎教授发表了280余篇同行评议的期刊与会议文章,获得了包括IEEE INFOCOM’20、IEEE Globecom’19, 中国密码学会’18、ACM ASIACCS’18、IEEE ICDCS’17、IWQoS’17,ICNP’11等在内的多篇最佳论文和时间考验论文奖。他的H-Index为69,文章总引用次数超过30,000次,并入选科睿唯安高被引科学家。同时任奎教授的多项研究成果在工业界有广泛应用。入选理由:对无线系统安全与云数据安全的贡献。个人主页:https://person.zju.edu.cn/kuiren 王义瑞典乌普萨拉大学信息技术系教授,主要研究兴趣为 CPS 的设计与动态更新、安全至上的嵌入实时系统、实时调度、建模与验证。1982年本科毕业于中国东北大学计算机工程专业,随后赴瑞典查尔姆斯理工大学攻读计算机科学博士预科与博士学位。2014年当选 IEEE Fellow。曾获得2019年 IEEE TCRTS Award、RTSS 2099/2015/2017 最佳论文奖、ECRTS 2015最佳论文奖、DATE 2013最佳论文奖、ETAPS 2002 最佳工具论文奖。入选理由:对实时系统的自动化分析与验证的贡献。个人主页:http://user.it.uu.se/~yi/ 张耀文张耀文,国立台湾大学电机工程系特聘教授,他在1988年获得国立台湾大学学士学位,在1993年获得德克萨斯大学奥斯汀分校硕士学位,1996年获得德克萨斯大学奥斯汀分校博士学位。研究领域为电子设计自动化、积体电路实体设计、积体电路可制造性设计等。入选理由:为算法电子设计自动化做出贡献。个人主页:https://www.ee.ntu.edu.tw/profile1.php?teacher_id=943001&p=3近三年来当选 ACM Fellows 的华人学者 2019年共有 7 位:吕松武、宋晓东、陶大程、谢源、周礼栋、陈熙霖、李向阳。 2018 年共有 6 位:李飞飞、刘欢、罗杰波、Lili Qiu、何田以及 Lillian Lee。 2017 年共有 9 位:马毅、芮勇、杨强、张世富、翟成祥、张爱冬、Li Erran Li。以下为2020年入选 ACM Fellow完整名单:Daniel J. AbadiUniversity of MarylandFor contributions to stream databases, distributed databases, graph databases, and column-store databasesSamuel MaddenMassachusetts Institute of TechnologyFor contributions to data management and sensor computing systemsJames AllanUniversity of Massachusetts AmherstFor contributions to information retri, including topic detection and trackingScott MahlkeUniversity of MichiganFor contributions in compiler code generation for instruction level parallelism, and customized microprocessor architecturesSrinivas AluruGeorgia Institute of TechnologyFor contributions to parallel methods in computational biology and leadership in data scienceDavid MaltzMicrosoft AzureFor contributions to networking infrastructure, including data center networking, network operating systems, and cloud networkingAndrea C. Arpaci-DusseauUniversity of WisconsinFor contributions to storage and computer systemsVolker MarklTU BerlinFor contributions to query optimization, scalable data processing, and data programmabilityRemzi Arpaci-DusseauUniversity of WisconsinFor contributions to storage and computer systemsMaja MataricUniversity of Southern CaliforniaFor contributions to socially assistive robotics and human-robot systemsSuman BanerjeeUniversity of Wisconsin-MadisonFor contributions to design, implementation, and tools of wireless systemsFilippo MenczerIndiana UniversityFor research on the vulnerability of social media networks to disinformation and manipulationManuel BlumCarnegie Mellon UniversityFor contributions to the foundations of computational complexity theory and its application to cryptography and program checkingJose MeseguerUniversity of Illinois at Urbana-ChampaignFor the development of logical methods for design and verification of computational systemsLionel BriandUniversity of Ottawa and University of LuxembourgFor contributions to automated software testingMeredith Ringel MorrisMicrosoft ResearchFor contributions to human-computer interaction, information retri, computer-supported cooperative work, and accessibilityDavid BrooksHarvard UniversityFor contributions to software and hardware design for power-efficient computer architecturesNachiappan NagappanMicrosoft ResearchFor contributions to empirical software engineering and data-driven software developmentRan CanettiBoston UniversityFor contributions to cryptography and computer securityRadhika NagpalHarvard UniversityFor contributions to collective intelligence, including self-organizing systems and swarm roboticsJohn CannyUniversity of California, BerkeleyFor contributions in robotics, machine perception, human-computer interaction, and ubiquitous computingMoni NaorWeizmann Institute of ScienceFor contributions to the foundations of cryptography and theoretical computer scienceAnantha ChandrakasanMassachusetts Institute of TechnologyFor energy-efficient design methodologies and circuits that enabled ultralow-power wireless sensors and computing devicesChandrasekhar NarayanaswamiIBM T.J. Watson Research CenterFor design and development of the Linux Watch and SoulPad, which influenced wearable and mobile systemsYao-Wen ChangNational Taiwan UniversityFor contributions to algorithmic electronic design automationSam H. NohUNISTFor contributions to storage system software, including flash and byte-addressable non-volatile memoryMoses CharikarStanford UniversityFor design of efficient algorithmic techniques for big data, hashing, approximation algorithms, and metric embeddingsPrakash PanangadenMcGill UniversityFor making continuous state systems amenable to logical and computational treatmentYiran ChenDuke UniversityFor contributions to to nonvolatile memory technologiesSethuraman PanchanathanArizona State UniversityFor contributions to multimedia technologies and leadership in the scientific communityGraham R. CormodeUniversity of WarwickFor contributions to data summarization and privacy enabling data management and **ysisManish ParasharRutgers UniversityFor contributions to high-performance parallel and distributed computing and computational sciencePatrick CousotNew York UniversityFor contributions to programming languages through the invention and development of abstract interpretationKeshab K. ParhiUniversity of MinnesotaFor contributions to architectures and design tools for signal processing and networking acceleratorsMathieu DesbrunCalifornia Institute of TechnologyFor contributions to geometry processing and discrete differential geometryHaesun ParkGeorgia Institute of TechnologyFor contributions to numerical algorithms, data **ytics, and leadership in computational science and engineeringWhitfield DiffieFindora Advanced Research CenterFor the invention of asymmetric public-key cryptography and the promulgation of a practical cryptographic key-exchange methodGordon PlotkinUniversity of EdinburghFor contributions to the science of programming languages, particularly their operational and denotational semanticsBonnie J. DorrIHMCFor human-centered and linguistically inspired approaches to natural language processing     Michael O. RabinHarvard UniversityFor the introduction of nondeterministic automata, probabilistic automata, and for contributions to computability and computational complexity theoryNicholas DuffieldTexas A&M UniversityFor contributions to network measurement and **ysisKui RenZhejiang UniversityFor contributions to wireless system security and cloud data securityAlan EdelmanMassachusetts Institute of TechnologyFor contributions to algorithms and languages for numerical and scientific computingPaul ResnickUniversity of MichiganFor contributions to recommender systems, economics and computation, and online communitiesThomas EiterTU WienFor contributions to knowledge representation and reasoning, logic programming, and declarative problem solvingMary Beth RossonPennsylvania State UniversityFor contributions to human-computer interaction, including scenario-based designCormac FlanaganUniversity of California, Santa CruzFor contributions to static and dynamic program debugging and verification methodsSteven SalzbergJohns Hopkins UniversityFor contributions to computational biology, including software for DNA sequence **ysis, alignment, and genome assemblyJodi ForlizziCarnegie Mellon UniversityFor contributions to design research in human-computer interactionSanjit Arunkumar SeshiaUniversity of California, BerkeleyFor contributions to formal verification, inductive synthesis, and cyber-physical systemsDieter FoxUniversity of WashingtonFor contributions to probabilistic state estimation, RGB-D perception, and learning for robotics and computer visionAdi ShamirWeizmann Institute of ScienceFor contributions to the field of cryptographySanjay GhemawatGoogleFor contributions to distributed systems designHeng Tao ShenUniversity of Electronic Science and Technology of ChinaFor contributions to large-scale multimedia content understanding, indexing and retriAntonio GonzalezUniversitat Politecnica de CatalunyaFor contributions to the design of energy-efficient and resilient computer architecturesAmit ShethUniversity of South CarolinaFor contributions to data semantics and knowledge-enhanced computingAndrew D. GordonMicrosoft Research and University of EdinburghFor contributions to programming languages: their principles, logic, usability, and trustworthinessAdam SmithBoston UniversityFor contributions to data privacy and cryptographySteven GribbleGoogleFor contributions to virtualization technology across clusters, servers, and networks     Olga Sorkine-HornungETH ZurichFor contributions to digital geometry processing, computer animation, computer graphics and visual computingSusanne E. HambruschPurdue UniversityFor research and leadership contributions to computer science educationRick L. StevensArgonne National LaboratoryFor contributions in high-performance computing systems, collaborative environments, and tools for large-scale science initiativesMartin HellmanStanford UniversityFor the invention of asymmetric public-key cryptography and the promulgation of a practical cryptographic key-exchange methodPeter StoneUniversity of Texas at AustinFor contributions to automated planning, learning, and multiagent systems with applications in robotics and ecommerceNicholas HighamUniversity of ManchesterFor contributions to numerical linear algebra, numerical stability **ysis, and communication of mathematicsYufei TaoChinese University of Hong KongFor contributions to algorithms for large scale data processingC. Anthony (“Tony”) R. HoareUniversity of CambridgeFor contributions to the theory of programming, and its application to the practice of engineering of softwareLeandros TassiulasYale UniversityFor contributions to network control and optimization with applications in communication networksHolger H. HoosLeiden UniversityFor contributions to automated algorithm selection and configuration for optimization and machine learningKenneth Lane ThompsonGoogleFor contributions to the development of operating systems theory and for the implementation of the UNIX operating systemIhab F. IlyasUniversity of WaterlooFor contributions to data cleaning and data integrationAndrew TomkinsGoogleFor contributions to the understanding of the web and web-based social networksLizy Kurian JohnUniversity of Texas at AustinFor contributions to the design, modeling and benchmarking of computer architecturesOlga TroyanskayaPrinceton University and Simons FoundationFor contributions to computational biology, data integrationJoost-Pieter KatoenRWTH Aachen UniversityFor contributions to model checking of software and probabilistic systemsMatthew A. TurkToyota Technological Institute at Chicago and University of California, Santa BarbaraFor contributions to face recognition, computer vision, and multimodal interactionNam Sung KimSamsungFor contributions to design and modeling of power-efficient computer architecturesWil Van Der AalstRWTH Aachen UniversityFor contributions to process mining, process management and data scienceSven KoenigUniversity of Southern CaliforniaFor contributions to artificial intelligence, including heuristic search and multi-agent coordinationToby WalshUniversity of New South Wales and CSIRO Data61For contributions to artificial intelligenceDavid KotzDartmouth CollegeFor contributions to the security, privacy, and usability of mobile systemsWei WangUniversity of California, Los AngelesFor contributions to the foundation and practice of data miningArvind KrishnamurthyUniversity of WashingtonFor contributions to networks and distributed computer systemsLaurie Ann WilliamsNorth Carolina State UniversityFor contributions to empirical research on agile software development, software security, and software engineering educationRavi KumarGoogle ResearchFor contributions to web science modeling, **ytics, and algorithmsCathy H. WuUniversity of DelawareFor contributions to bioinformatics, computational biology, knowledge mining and semantic data integrationZhou KunZhejiang UniversityFor contributions to computer graphicsShuicheng YanYITU TechnologyFor contributions to visual content understanding techniques and applicationBrian LevineUniversity of Massachusetts AmherstFor contributions to network forensics, security, and privacy, and for thwarting crimes against childrenWang YiUppsala UniversityFor contributions to the automated **ysis and verification of real-time systemsKevin Leyton-BrownUniversity of British ColumbiaFor contributions to artificial intelligence, including computational game theory, multi-agent systems, machine learning, and optimizationMichael J. ZydaUniversity of Southern CaliforniaFor contributions to game design, game and virtual reality networking, and body trackingXuelong LiNorthwestern Polytechnic UniversityFor contributions to computing on and learning from higher-order dataSteven H. LowCalifornia Institute of TechnologyFor theoretical foundations and real-world deployment of Internet congestion control and smart grid optimizationChenyang LuWashington University in St. LouisFor contributions to adaptive real-time systems, real-time virtualization, and wireless cyber-physical Acm Fellow 2020年名单:https://www.acm.org/media-center/2021/january/fellows-2020
  • [前沿快讯] 华为云AI领域首席科学家、IEEE Fellow田奇:云原生时代,视觉预训练大模型探索与实践
    近日,在 Qcon 全球软件开发大会(深圳站)上,华为云人工智能领域首席科学家、IEEE FELLOW 田奇博士,作了题为「云原生时代,视觉预训练大模型探索与实践」的主题演讲,介绍了云原生时代华为云在 AI 基础研究、视觉预训练模型研发和行业实践,以及 AI 开发平台 ModelArts 的最新进展。以下是田奇博士演讲要点:随着企业数字化的转型,传统企业已基本上将业务从线下搬到了云上。其中,第一个阶段是将企业的业务简单地部署到云上,我们可以称之为 ON CLOUD,在这种形态下,通过资源池化,解决了 IDC 时代运维、部署、扩容的难题。但是,传统方法的过于厚重、烟囱式的架构,导致云对业务的价值还仅仅停留在资源供给阶段,未充分发挥出云计算的潜力。随着企业的数字化建设逐步迈入智能化阶段,企业需要充分利用云计算带来的红利,就需要让其业务能力内生于云,由现在的 ON CLOUD 进阶到 IN CLOUD 阶段,即基于云的技术架构来构建企业业务,通过构建多云、多中心的分布式架构以及敏捷、智能的企业数字化业务,将企业的数字化建设带入智能化新阶段。此时,云对业务的价值不再是简单的资源供给,还能够以应用为中心,为业务赋能。一站式 AI 开发平台,加速行业 AI 落地,践行普惠 AI华为云提供了一站式的 AI 开发平台,加速行业 AI 落地,践行普惠 AI。华为云对 AI 平台打造了四层体系,第一层是智能体;第二层是知识计算解决方案;第三层是 ModelArts Pro,针对专业应用开发套件;第四层是 ModelArts Fundamental。对于一站式的 AI 开发平台,主要聚焦在模型高效、数据高效以及知识高效。这些强大的 AI 服务,底层都是基于云原生容器的 Volcano 高效能调度引擎,而 Volcano 调度引擎将训练任务的效率提升了 50%。华为云 AI 基础研究进展华为云长期扎根 AI 技术基础研究,在计算机视觉、语音语义、决策优化三个方向做了深入探索与研究。为此,我们针对数据、模型和知识提出了六个子计划。其中,针对模型包含两个计划,一个是针对大模型的模型摸高计划,提供极致的性能;第二是针对小模型的模型瘦身计划。针对数据提出了两个计划,一个是处理多模态的数据魔方计划;另一个是针对小样本学习的数据冰山计划。最后针对知识的高效提取,我们提出了两个计划:建造通用 AI 系统的万物预视计划以及学习一种新范式的虚实合一计划。在这些计划中,我们始终聚焦在模型高效、数据高效、知识高效等重点方向上。对于自主研发的一些新技术,比如自动学习、知识蒸馏、预训练模型等等,都会以即插即用的方式部署到华为云线上,助力 AI 行业落地。在众多 AI 领域中,计算机视觉具有广泛的落地场景,在智能汽车、智能手机、无人机、智能眼镜等应用都有计算机视觉算法的身影。这些年随着计算能力和 5G 通信技术的极大提高,以计算机视觉为代表的大批 AI 技术,已跨越了早期仅在研究领域取得进展的阶段,过渡到了与社会环境协同发展、共同促进的阶段。未来视觉 AI 技术会在千行百业进行落地,比如政府、医疗、工业、能源、交通、物流、金融等等。但是,技术落地也面临着巨大的挑战,由于 AI 应用的碎片化、定制化等因素,极大地限制了 AI 在真实环境下的落地部署。为了解决应对 AI 碎片化等问题,我们提出了预训练大模型的解决方案,希望能用大量无标注的数据和更大的模型来实现更通用的 AI 系统。在自然语言处理领域,这两年大规模预训练模型取得了突破性进展,但是预训练模型对算力有极大的需求,而且我们预计更大规模、更大参数的模型还会继续出现。因此,受到自然语言处理中预训练模型的启发,在计算机视觉中我们也希望构建通用的 AI 系统,为下游各种视觉任务提供一个高效的初始化模型。现在主流的学习方式有两种,一种是监督学习,一种是强化学习。监督学习需要海量标注样本,泛化能力相对比较弱,另一种是强化学习,强化学习需要海量的试错,同样缺乏通用系统所需要的可适用性、可重复性以及鲁棒性。我们认为,自监督学习是迈向常识学习的关键步骤,但是目前自监督学习在视觉任务中的应用还不够成熟。过去,在数据标注、模型训练和输出阶段,分别要做大量的重复工作。未来,我们希望可以对计算机视觉或者自然语言处理任务构建一个通用预训练模型,仅通过下游少量的标注样本进行微调就可以高效完成任务,从而大量节约开发成本。视觉预训练大模型研究和实践接下来的报告,我会介绍一下我们在预训练模型方面的工作,主要是在自监督学习过程中预训练模型的一些进展。自监督学习由于不需要任何人工标注便能够学习图像的内在表征,近年来受到了业界的极大关注。在没有人工标注的情形下,自监督学习需要预先设定一些预训练任务辅助模型学习。2016 年以前,一些预训练任务推动该领域出现了一些大的进展。自监督学习主要分为两种,一种是生成式,一种是对比式,近几年最新的一些工作大多是基于实例区分的对比学习。 基于实例区分的对比自监督学习在最近几年取得了极大的进展,在一些任务上刷新了现有自监督预训练任务的 SOTA 结果。最近我们在对比自监督学习方面有两项优化工作,首次实现了在 ImageNet 线性分类任务中达到全监督基线性能,并且在小样本分类上大大超越了之前的方法。然而,现有的自监督预训练模型仍然处于探索阶段,存在大量的问题未能够解决:现有的自监督预训练算法迭代缓慢,很难复制到大模型以及超大规模数据集;另外,相较于全监督学习,其特征表达在大多数下游任务上仅仅能获得与之相比拟的结果,其进一步的性能优势还有待挖掘。因此,如何利用自监督学习在超大数据集合,超大模型上获取更强的泛化性能将会是未来的发展方向。在这里,介绍一下我们最新的几个工作,在对比自监督学习框架下,我们提出了基于邻域保持的混合图像增强,在业界首次提出了利用不同图像数据增强策略提升其泛化性能。过去,对比学习通常利用同一样本的不同数据增强生成正样本集合,并且把其他样本均视为负样本的策略,将样本特征的距离拉近或者拉远作对比学习任务,而我们首次提出了选取不同正样本的方法。同时,提出了基于局部领域混合增强的技术,把多个相似样本的特征拉近,不同样本的距离拉远。我们的方法在 ImageNet 线性分类评估上,TOP-1 的精度达到了 75.5% 准确率,离监督学习基线 76.5% 仅仅差了 1 个百分点。通过对预训练模型在小样本标注数据上进行微调(1% 和 10% 标注的数据),我们的精度达到了最好的结果。 接下来介绍一个我们今年刚刚完成的工作,基于等级化语义**的对比自监督学习框架。在上述工作的基础上,我们进一步发现即使显示地拉近语义相似性样本,特征表达的可分离特性并没有达到我们的预期目标,这限制了其泛化表征能力。自监督学习仍然存在优化困难,收敛速度慢等问题,为此,我们做了两点改进,第一,我们拓展了自监督学习算法中正样本数目,使得正样本集合能够更加高效的被**,同时避免受大量负样本优化的影响。第二,我们在浅层特征上引入对比自监督学习,通过精心设计的浅层优化目标加速训练过程,在浅层特征上实现了更好的可分离性,我们发现这些优势对小样本学习有极大的提升。从结果来看,我们在线性分类任务中达到了 76.4% 的精度,首次达到了和全监督基线相比拟的性能,而且通过将预训练模型在小样本标注数据上进行微调,在之前的结果上又得达到了新的 SOTA,特别地,仅仅使用 10% 标注,我们在 ImageNet 分类上达到了 75.1% 的 TOP-1 精度。上述两项工作都是在没有任何标签设置下完成的,更进一步,我们探索了如何把对比学习和数据标签高效地结合起来,通过引入图像真实标签来辅助对比学习,我们认为应该将自监督学习得到的表观特征和监督学习的语义特征相结合,它的本质是把表观相似和语义相似的样本距离拉近,将不相似样本的距离推远。从结果上看,这个工作在各个下游工作中(比如检测、语义分割、实例分割)的表现全面超越了以往的自监督和全监督的泛化能力。华为云的第二个核心研究方向是如何设计高效的视觉识别模型,即模型高效。在这个方向主要聚焦两个方面,第一是如何设计神经网络模型,第二是在神经网络架构搜索中,如何在原子算子层面上进行搜索。关于神经网络模型设计,最初的方式都是手工设计的,这种方式经过高速发展后,也进入了一个瓶颈,因此从 2017 年开始,自动的神经网络架构搜索经历了一个迅猛发展的过程,也取得了一些可喜的成绩。但是搜索出的网络也面临几个问题,第一个问题,搜索空间仍然是手工定义的;第二个,搜索的卷积算子是人工定义的,而且相比于手工设计的网络,搜索的网络可迁移性也是比较差的。我们在网络架构搜索上第一个工作是 P-DARTS,提出渐进的可微分网络架构搜索算法。之前的网络架构搜索面临着搜索网络和测试网络深度不一样的问题,在较浅的搜索网络中搜索出来的架构并不适合较深的测试网络。早期的方法直接加深搜索的深度,但是会造成显存爆炸的问题,并且导致搜索不稳定。为了解决这个问题,我们提出了两个思想,一个是搜索空间近似,第二个是搜索正则化。搜索空间近似,是指采用渐进搜索策略,逐渐加深搜索的深度;同时进行链接权重的学习,把权重比较小的链接运算都扔掉,这样减少了搜索空间。搜索正则化主要是对搜索得到的一些 skip connect 的数量上的限制。从结果上看,我们把 P-DARTS 搜索的网络迁移到 ImageNet 上,在 ImageNet 分类任务上与基线方法相比提高了两个百分点。P-DARTS 网络搜索算法是在 P100 上完成的,大概需要 0.3 个 GPU-days。与去年同期的 DARTS 工作进行大致的比较,它的搜索时间是 4 个 GPU-days,而在性能和速度都有超越的情况下,我们的方法只需要 0.3 个 GPU-days。我们在架构搜索上的第二个工作是 PC-DARTS,这是业界搜索速度最快的网络架构方法之一,其主要思想有两个,一个是采用局部连接的思想来解决网络冗余的问题,第二个是采用边正则化的思想来解决网络搜索稳定性的问题。并且,这个工作首次在大规模图像数据集 ImageNet 上进行了神经网络架构搜索。我们最新的一个相关工作是 GOLD-NAS,渐进剪枝的单阶段可微分搜索算法。这个算法主要的一个贡献是它打破了传统可微分搜索空间的诸多限制,因此大大增加了搜索空间的容量,并提出了单阶段优化策略和渐进剪枝的优化策略。从结果上看,在扩大的搜索空间中,算法不仅能够找到绝对性能更强的网络,也能找到具有更高性价比的网络。我们第四个工作是卷积搜索,提出对卷积操作进行搜索,当前的模型搜索都是采用一些固定的卷积操作,比如 1×1、3×3 的卷积,这种方式限制了模型的性能。因此,为了将卷积的设计也纳入搜索的范围,这个工作提出了针对点云任务的基于数据驱动的模型搜索,同时对卷积的结构也进行了搜索,将来将进一步扩展到传统的图像领域。我们最近两年在计算机视觉三大顶会 CVPR、ICCV、ECCV 大概发表了近百篇文章,基本进入视觉研究领域第一梯队,极大地提高了华为在计算机视觉领域的国际竞争力,同时有一些工作也获得了最佳论文和最佳论文提名。而且最新的算法已经逐渐部署到华为的一站式 AI 开发平台,在一些行业得到了广泛的应用,下面再介绍一下视觉任务的进展和在行业的实践。第一个进展是图像分类技术,在 ImageNet 上,今年我们的分类准确率达到了 85.8%,而之前谷歌最好的精度是 85.5%。从今年 3 月份以来,我们在这方面一直保持着领先水平。第二个进展是弱标注场景下的图像分类技术。在 WebVision 大规模弱标注的网络图像分类比赛中,大约有 5000 个类别的 1600 万张图像,有 90 多支参赛队伍竞争,华为云在分类准确率上取得了业界第一的水平。我们把图像分类技术应用到了一些传统行业,比如米旗蛋糕店。结果上看,我们的技术让商品整盘识别率达到了 99% 以上的精度。另外,我们的模型训练时间小于一天,因此每天都可以进行模型更新,商品的识别时间也小于 1 秒。第三个进展是图像检测、分割技术,在业界权威的目标检测数据集 MS-COCO 数据集上,不论是单模型还是多模型,我们都取得了今年业界第一的成绩。我们将检测、分割技术用到了医疗智能体,在今年新冠肺炎 AI-CT 辅助筛查中实现了自动智能检测,而且已经在各大医院成功部署。我们第四个进展是多模态数据处理技术,相对于单模态,多模态具有天然的互补优势,比如在无人驾驶中除了图像的输入,还有激光雷达信号、GPS、图像分割的数据。在最权威的三维目标检测 NuScenes 数据上,我们提出的技术也取得了非常好的成绩,我们的结果比第二名领先了 3.1%。同时我们将多模态处理技术用在了深圳交通智能体上,实现对红绿灯控制的智能化,在交通总量相同的情况下将平均通行车速提高了 15%,将平均等待时间、延误时间下降了 17.7%。最后介绍一下华为云一站式 AI 开发管理平台 ModelArts。ModelArts 有两个不同层次的版本,一个是 ModelArts Fundamental,一个是 ModelArts Pro。根据华为云在十多个行业常年的技术积累,ModelArts Pro 开发平台主要提供五大类的专业应用开发套件,包括文字识别套件、视觉套件、知识图谱套件、多模态开发套件、自然语言处理套件,还提供了四十多个行业级的高精度预置的算法, 包含数据准备、数据处理、 模型设计、模型管理及部署等等。以上是华为云在视觉预训练模型上的一些基础研究最新进展和行业实践的案例,以及在华为云 AI 开放平台沉淀的一些工作。谢谢!文章来源:https://www.jiqizhixin.com/articles/2020-12-08-8
  • [前沿快讯] 刘群:预训练语言模型研究进展和趋势展望
    作者 | 戚路北自2018年下半年开始,到现在为止,预训练语言模型的发展基本呈现爆发趋势,研究人员数目越来越多,研究方向也越来越广。近日,在第十九届中国计算语言学大会(CCL2020)上,华为诺亚方舟实验室语音语义首席科学家刘群介绍了预训练语言模型研究进展和趋势展望。演讲内容包括自然语言处理的预训练方法的背景,预训练语言模型的近期进展,华为课题组的成员们做的工作,以及目前的成就与未来的展望。刘群是自然语言处理和机器翻译领域的国际著名专家,研究方向包括多语言信息处理、机器翻译模型、方法与评价等。2012 年 7 月之前,刘群是中国科学院计算技术研究所的研究员和自然语言处理研究组负责人。2012 年 7 至 2018 年 6 月,刘群任都柏林城市大学教授、爱尔兰 ADAPT 研究中心(前身 CNGL 研究中心)自然语言处理主题负责人。2018 年 7 月开始,他正式加入华为诺亚方舟实验室,任语音语义首席科学家,主导语音和自然语言处理领域的前沿研究和技术创新,除了语音、对话、翻译、多模态以外,其实验室也在重点布局预训练语言模型。以下是演讲全文,AI科技评论进行了不改变原意的整理。1自然语言处理的预训练方法的背景自然语言处理的预训练方法属于自然语言的表示学习,自然语言表示学习的形成已经经过了长期的历史发展。首先,1948年N-gram分布式模型被提出来,这是最初的语言模型。1986年出现了分布式语义表示,即用一个词的上下文来表示该词的词义。2003年神经语言模型被提出,开始使用神经网络来进行语言建模。2013年word2vec的提出,标志着神经网络方法开始在NLP领域获得成功,word2vec将词语从一个符号空间映射到了一个向量空间,使得NLP中大规模使用神经网络方法成为可能。到2018年,出现了预训练语言模型。不管是统计方法还是神经网络方法,都是一种基于数据的方法。如果数据不够的话,模型就无法有效建立。但是现实生活中,数据永远是一个很大的问题。在实际应用场景中,我们得到的很多数据都是无标注的,在这种情况下传统模型就无法解决实际问题。预训练的思想是,在利用标注数据之前,先利用无标注的数据也就是纯文本数据,去训练一个模型,这个模型能够学到一些潜在的跟标注无关的知识。然后在具体的任务上,预训练模型就可以利用大量的无标注数据训练所得到的知识。第一代自然语言处理预训练模型是词向量模型。词向量模型是把大量的无标注的文本送到一个比较简单的神经网络里面,经过训练,每个词都会被赋予一个静态的向量。词的静态向量在空间分布上有一个非常好的特点,即相似的词会聚在一起。词与词之间的关系也会以一种向量的形式得到体现,从而实现了符号空间到向量空间的映射。第二代自然语言处理的预训练模型,就是我们今天研究和使用的预训练语言模型。预训练语言模型是词向量模型的进化,它的本质其实是有上下文的词向量模型。预训练语言模型的训练过程是,首先给句子中的每个词赋予一个静态向量,然后它会跟句子的上下文词进行交互,最后就得到了这个词在句子中的变化的词向量。这种特殊的词向量模型我们叫做预训练语言模型。预训练语言模型有一个很重要的特点,它既会给每一个句子赋予一个概率,同时还会给每个词赋予一个表示或一些特征。利用预训练语言模型的这个特点,就可以使用现实生活中几乎无穷无尽的无标注文本,来训练预训练语言模型,然后就能把经过训练的预训练语言模型,用在任何的下游任务上。这不仅可以使下游任务的性能得到非常大的提高,还可以大大降低下游任务所依赖的标注语料的规模。实际上,预训练语言模型的出现,几乎使所有的下游任务的性能都得到了很大的提高,使得自然语言处理技术又上了一个台阶,因此这是一个具有重大意义的突破。在实际应用中,使用预训练语言模型可以分成两个过程,一个叫预训练,一个叫微调。首先在大量的文本上训练出一个预训练语言模型,然后在下游的任务上,根据实际情况对得到的预训练语言模型进行微调。Transformer模型是预训练语言模型的主要框架,它的主要特点就是词与词之间可以互相关注。类似于卷积神经网络中具有多个卷积核,并且每个卷积核会自动去会分配不同的权重,Transformer的基本结构的每一层都由多头的自注意力网络,以及一个前向的神经网络共同组成。自注意力机制是预训练语言模型中非常有趣的机制。通过一些可视化工具,我们可以看到不同的自注意力头呈现出不同的特点或不同的关注结构,比如关注句子的第一个词、相邻的词、中心词甚至是句子结尾的标点符号。所有的关注信息,或者说词的注意力都可以在可视化图里看到。预训练语言模型出现以来发展得非常迅速,目前已经演化形成了一个家族。2预训练语言模型的近期进展预训练语言模型的近期进展包括以下几个方面:1.更强大,也被戏称为叫大力出奇迹。2.更小巧,即怎么把做模型做的更小、更快。3.更优秀、功能更多、性能更高、训练更快的模型。4.更聪明,即怎么引入外部知识。5.更能干,即预训练语言模型如何影响了自然语言处理以外的一些领域。1.更强大预训练语言模型几乎成为了大公司之间的军备竞赛,目前学术界还还很难参与这种军备竞赛。很多大企业都将自己的预训练语言模型做的越来越大,仿佛没有终点,并且这种趋势还在不断加强。预训练语言模型的做大不仅仅是带来量的提高,更带来了模型使用性质的变化。最早在词向量模型时期,整个自然语言处理就被带入了神经网络时代。在神经网络时代,单一的CPU已经不能满足需求了。可以通过GPU,在不需要进行过多额外计算的情况下,做到在整个词表上进行词的选择,这在以前的SMT上是不可想象的。正是有了GPU,我们才可以通过词向量模型这类神经语言模型来完成这类工作。如果没有GPU支持,或者用以前的统计方法,是难以想象的。预训练语言模型通过使用更大的GPU,更多的数据,也带来了更大的变化,即微调的模式。微调为下游任务大致规定了几种固定的模式,包括句子分类、句子关系的分类、词语序列标注,以及QA任务中常见的句子片段的提取等。以前解决每个NLP问题,都要先设计模型。现在通过微调这一简单的模式,我们不再需要去为每个任务去设计特定的NLP模型,而可以将所有的NLP任务都纳入几个模式。GPT-3有一个非常吸引人的地方,就是它几乎无需做微调,并且它的演示效果也很好。GPT-3给我们带来了非常大的冲击。这个模型有着极高的训练成本,使得实际上绝大部分的企业和科研机构都无力承担。它的1750亿参数比BERT-base模型大了100倍,比 GPT-2大了10倍。它单次训练需要1万亿单词的训练数据,以及1200万美元的训练成本,能够承担这种训练成本的企业在世界范围内也非常少。虽然它的训练成本如此之高,但是它的效果非常令人吃惊。以前我们解决特定的问题,都需要专门去找语料,做专门的训练才能做。现在这个模型,只要是需要的功能都可以直接实现,基本不用训练。还有一些我们原来觉得很难做到的事情,GPT-3也能做到,例如算术计算、写代码等等。它还能够很细致的区分56和49这两个词,甚至在数量上都能区分出来,如此的细腻度令人吃惊,这也给它的商业价值也带来巨大的想象空间。很多人都在想,大算力会不会成为预训练语言模型的瓶颈?实际上,算力最终并不会成为瓶颈。上世纪90年代IBM提出统计机器翻译模型的时候,大家几乎都重复不了。但是99年以后,统计机器翻译模型基本上变成普遍的、所有人都能用的模型了。深度学习也是一样,深度学习在GPU出现以前,也是曲高和寡,然而 GPU的出现,突破了算力瓶颈以后,也变成了一种普通的工具。那么GPT-3这样的模型,现在的成本虽然非常高,但是我们大家可以去憧憬一下,未来的某一天,它或许也会变成一种非常普遍的工具。训练大模型实际上是很困难的,它并不是在单一的CPU或者GPU上进行训练,而是在多个硬件的组合结构上进行训练。但同时,每引入一种更复杂的硬件结构,也会带来更多的问题。上图为一些常见的用来解决这些问题的技术。下面着重介绍三维并行训练技术和稀疏注意力加速技术。三维并行训练技术,是指把数据和模型进行各种维度的切分,包括数据并行、pipeline并行和模型并行。模型并行又包括不同类型的模型变形,通过把整个数据和模型进行三维的切分,建立三维并行坐标和物理设备之间的映射,然后每一个区域运行一小块的方法。稀疏注意力加速技术也是一个被证明有效的技术,GPT-3就使用了这个技术。它的原理是把一个注意力矩阵分成两个小型矩阵的乘积,这是一个可以有效处理更长注意力的机制,这也是目前为止被证明非常有效的办法。2.更小巧目前的大型预训练模型,不但训练麻烦,而且推理时间也很长,因此只能用在云端应用上,在设备端应用有明显的局限性。因此训练出更小的模型,实际上也具有非常大的应用价值。就华为来说,华为目前的业务方向除了手机业务外,也在做大量的用于物联网的小设备。既然希望将模型用到小设备上,我们就面临将模型进行加速和压缩的问题。预训练语言模型就形成了这两种趋势。一方面是人们把模型越做越大,去探索模型能力的边界。另外一方面就是模型越做越小,让它在各种下游任务上形成生产力,即在手机端等各种小设备上能够单独运行。目前模型压缩这一方面研究也非常多,主要包括三大类技术,一类是基于知识蒸馏的预训练语言模型压缩,另一类是基于剪枝的预训练语言模型压缩,还有一类是基于量化的预训练语言模型压缩。基于剪枝的预训练语言模型压缩,就是基于一定的准则,去除掉参数矩阵的冗余部分。比如在神经网络模型中,我们可以去掉一些冗余的神经元节点,和神经元连接,使得模型变小一点。基于量化的预训练语言模型压缩,就是减少数值表示所需要的比特值。目前我们使用的GPU都是用32位的浮点数计算,计算代价非常高。我们可以将它量化为8位的浮点数,甚至4位的浮点数、2位的浮点数,这样运算过程就得到了简化。还有一些别的压缩技术,比如矩阵参数分解、参数共享、模型架构设计与搜索。矩阵参数分解就是将一个大矩阵,分解成两个小矩阵的乘积。参数共享有很多方式,比如Transformer有很多层,各层之间可以共享其中一些参数。而ALBERT,就是所有的层共享其中一层的参数。共享参数的好处就是参数量大大减少,但实际上在推理时间上并不能大幅度减少,所以它能带来的好处还是有限。模型架构设计与搜索这方面的发展,其实跟近年来自动机器学习的发展有关系,我们希望通过自动机器学习,能够去搜索出更好的、更精简的架构。3.更优秀目前看来Transformer模型架构确实非常优秀,当下也很难去做大的改动。真正做出一些影响力的工作是transformer XL,它的贡献是引入了recurrent的思想,以及引入了相对位置编码。而其它方面的话,大的改动很少。另外就是试图降低复杂度,因为attention机制是每两个词之间都要做一次 attention,这样的话attention的计算数量就是一个句子长度的平方级。在日常处理更长的文本的时候,都会面临这样的问题。目前我们需要的文本长度一般都不能超过1024,很多任务甚至只能用512或者256。很多研究工作速度希望把它的计算数量从平方量级降到线性量级,从而可以使语言模型处理更长的文本,所以目前这方面的研究也非常多。除了去寻找更好的模型结构,我们还需要训练更复杂的任务。现在BERT训练的过程实际上并不高效,它的训练时间很长,很多学者就试图在这方面去改进,提出更好的训练任务。Baseline是基础的预训练语言模型的训练,包括LM、MLM和NSP等训练任务。除此之外,大家也提出了各种各样的新的训练任务来进行改进。BERT就提出了几种新的训练方法,一种叫做next sentence prediction(NSP),就是根据前文预测下一个句子。另一种叫做whole word masking,这跟BERT的设计有关系。因为BERT里很多词都被拆分成一个个小单位,这样单独预测其中一个subword难度就比较小。通过把小单位合起来,加大训练难度,预测效果就会更好一点。以下还列举了其它模型的一些训练任务。replaced token prediction:也就是将一个词给换掉,然后来预测这个词是换掉之后的词还是原来的词。Sentence order prediction:将两个句子的顺序给颠倒,来检测哪种顺序是正确的。Denoising Autoencoder:这个是更复杂的训练任务,它是对一个句子进行插入、删除、替换等操作之后,再将它还原出来。Multi-task Learning:它同时使用了多种训练任务。Generator and discriminator:它是用一个生成器去替换一些词,然后由判别器来判断每个词是否替换。它的好处在于一个句子中的所有词都可以做错误的反向传播,所有词都能被我们使用,而BERT一个句子只能利用15%的词。这样我们就能加快它的训练速度。另外我们还在追求更多的功能,比如多语言预训练语言模型,像mBERT和XLM,另外还有一些想法就是把GPT和BERT这一类模型给综合起来,像UniLM和PMLM。4.更聪明现在,人们都意识到语言模型缺乏知识,那么是否可以融入一些外部知识呢?知识这个话题很大,目前也有一些争议,但是相关研究还是很多的。图中是刘知远团队跟华为合作的早期工作,就是试图把采用TransE预训练得到的知识空间的向量表示嵌入到语言模型里面去。这是刘知远团队改进后的工作叫KEPLER,也就是将知识图谱融入到语言模型中,像这一类的工作还有很多。还有一种更简单的想法,Span知识融入:就是让实体或者关系对应着句子中的一个span,通过利用span的方式来把知识嵌入。图中是赵海团队做的SemBERT, 这种方法是将语义角色标记这种更复杂的句法语义的知识融入到语言模型。5.更能干目前在预训练语言模型中,有很多想法都非常好,而且在自然语言处理方面取得了成功。因此很多人都在想,能不能将这种思路应用到别的领域?这个想法很好,做起来很困难,但最终也取得了一些喜人的成果。比如说在语音识别领域, Facebook提出了 wave2vec,它就是通过使用大量没有标注的、纯语音的数据,去预训练一个模型,然后利用这个模型,在一个少量文本标注的语料上进行语音识别,最终取得了非常好的效果。那么最近在图像上面,包括图像分类、目标检测等任务,都有一些预训练的相关研究。其中,DETR是用了transformer模型,但不算预训练。信息检索也已经开始用预训练语言模型,并取得了非常好的效果。在这方面目前大概有两类模型,一类采用sparse索引,它是使用传统的搜索引擎的前提下,去改进传统倒排表的方法。另一类采用dense索引,这种方法不需要建立传统的倒排表,而是直接用dense向量去对文本进行信息检索。3我们的工作接下来我将介绍一下华为诺亚方舟实验室在这方面所取得的成果。首先,我们开发了一个自研的预训练语言模型叫哪吒。其次,我们在模型压缩方面做的工作非常多,华为的TinyBERT模型被压缩的非常小,小到可以用在端侧。如今的预训练语言模型太多了,但我们还是希望有自主开发的模型,然后兼收并蓄,融合好的技术,并且把新技术也结合,然后训练好用的模型。同时我们也把它开源,大家可以去网上下载。目前我们已经推出了不同的版本,另外还有生成模型和TinyBERT,也都开源了。哪吒的性能也是非常强的,我们在目前中文的CLUE排行榜上是第二名,仅次于human模型,事实上在之前很长时间内我们都是第一名。另外在英文的排行榜SUPERGLUE,我们现在已经排到第二名,第一名的是目前在规模上大哪吒十倍的T5模型。哪吒在华为产品的落地,包括华为云,华为手机小艺,以及华为的 HMS。哪吒在华为产品落地的技术,包括基础的算法和模型,对话系统,还有推荐搜索等。TinyBERT是我们目前取得成就最多的一个模型,接下来我着重讲一下TinyBERT的原理。TinyBERT知识蒸馏的基本流程包括两步,第一步叫做general distillation,即使用一个大的预训练语言模型,训练一个小的预训练语言模型。第二步叫做task-specific distillation,即使用一个大的预训练语言模型,去对一个小的预训练语言模型进行微调。在这里我们引入了一个新的技术,叫做数据增强,这个技术非常重要,如果没有这个技术的话,整个模型的性能会下降很多。TinyBERT知识蒸馏的损失函数中一个比较重要的就是,让中间层去学习隐藏状态和attention向量。TinyBERT知识蒸馏的选层策略就是,我们用4层或者6层的学生模型,去学习12层的教师模型。但是让哪一层去学习哪一层,这就是一个有关映射的策略的问题了。我们最早提出的是一个均匀映射模型,即用小模型的1,2,3,4层,去依次学习大模型的3,6,9,12层。后来我们就在想,是否可以让每一层都自动去搜索一个最合适的层次学习?我们就引入了进化学习算法。然后我们发现,对小模型来说,最好的学习层次是0,0,5,10。即小模型的第一层,第二层不要去学习,最好直接使用自动反向传播去调。用第3层去学大模型的第5层,第4层去学大模型的第10层,这样效果最好。6层的学生模型我们学到的是0,5,0,0,0,10。通过选层策略可以发现,选择好的层次的话就可以提高整体的效果。TinyBERT知识蒸馏数据增强是一个非常有效的技术。因为下游任务一般数据都比较少,那么我们在蒸馏小模型的时候,数据的数量经常是不足的。我们采取的办法,就是把用于下游任务的数据进行增强。数据增强实际上就是利用了BERT本身的特点,它的每个词都是可以替换成别的词的。我们采用一种替换策略,就是把每个词都去做一些替换,这样的话就会生成很多的跟原来的句子很相似的句子,比如10个词的句子换掉2个或者3个词,去生成增强的语料。最后,我们发现大概增强20倍的时候,即将原来的一个句子替换生成20个左右相似的句子,用来做下游任务的蒸馏的效果最好。这是我们的实验结果,我们看到在4层的模型,在GLUE上面,总的分数大概降低了2.5,从79.5降到77。6层的TinyBERT基本上是跟12层的没有什么变化。在参数量方面,BERT-base有109M,而4层的模型只有14.5M,只有原模型的13.3%。6层的模型只降到了原来的一半。在速度方面,我们也可以看到4层的模型提速了9.4倍,提速非常高。并且我们现在模型空间非常小,参数量是14.5M的模型大小只有50M左右,完全可以放入手机之中,并且它的推理速度比原来快将近快10倍。目前我们这个模型已经大量的运用在华为的设备与应用之中。我们还做了一个工作,在华为自研的BOLT深度学习加速库下,利用了底层的硬件再一次进行压缩和加速,使得TinyBERT最终的推理速度,可以达到1.3毫秒。我们的TinyBERT在中文的CLUE小模型排行榜上一直是第一名。然后我们参加了 NLPCC的小模型评测比赛,也是获得了第一名。4总结与展望从历史角度来讲,模型越来越大。GPT-3已经这么大了,我们还能做得更大吗?当然如果未来计算设备的硬件的问题解决了,可以更大,但是近期内呢?更大的模型应该是什么样子?我设想的一种方式就是分布式,把模型分布到很多机器上计算,就像搜索引擎一样。像BERT这一类模型如何再把它训练的更大?现在最大的几个预训练语言模型都是GPT类的,BERT这一类模型很难做得更大,一些工程上的问题目前还是很难解决的。那么未来我们是否可能训练更大的BERT类的模型?小模型相反, BERT这类模型可以压缩的很小,GPT模型就很难压缩。BERT这个模型的压缩是不是还有潜力可以挖掘?另外知识融入是一个很有意思的问题。知识融入人们做了很多工作,实际上我是不太满意的。因为很多工作只是在解决知识类的问题效果比较好, 一般的 NLP的问题,知识融入的作用并不是那么大,所以希望知识融入能够解决一般的 NLP的问题。还有就是知识应该如何表示?现在大部分人认为知识都是三元组,我觉得这个是存在争议的,三元组实际上能够表达的知识其实非常有限。比如序列关系、空间关系、集合关系、数值关系等等关系知识都是很难学到的。关于搜索引擎,我希望以后预训练语言模型可以和搜索引擎结合起来,预训练语言模型就是个能够回答任何问题的搜索引擎。最后就是多模态预训练,希望将来它能带来无限的想象空间。
  • [精彩回顾] 人工智能十年回顾:CNN、AlphaGo、GAN……它们曾这样改变世界
    盘点 AI 十年来取得的重要突破。过去十年间,人工智能技术突飞猛进,最疯狂的科幻小说场景现在已经成为我们生活中不可或缺的一部分。十年前,人们在谈论 AI 的理论化和实验,但这些年来,AI 变得更加切实了,也变成了主流。无论是国际标准课程、平台、库、框架、硬件,一切都顺理成章。就算说这十年里取得的成绩奠定了未来的基础,也不为过。这篇文章将盘点 AI 十年来取得的重要突破。卷积2012 年是深度学习历史上重要的一年。那一年,卷积神经网络(CNN)在著名的 ImageNet 挑战赛中大放异彩。由 Alex Krizhevsky 等人设计的卷积神经网络「Alexnet」以远超第二名的成绩夺冠,在 ImageNet 数据集上的视觉识别错误率为 15.3%,降低了一半。该神经网络对猫的检测准确度达到了 74.8%,在 YouTube 视频中检测人脸的准确率为 81.7%。现在,手机和商场中的人脸识别应用都应该归功于 2012 年的这项工作,识别准确率的提升使研究者能够进行医学成像模型的部署,这些模型具备高置信度。与 AI 对话Vaswani 等人 2017 年发表的《Attention Is All You Need》带来了级联效应,使得机器能够以前所未有的方式去理解语言。得益于 Transformer 架构,AI 现在能够撰写假的新闻、推文,甚至可能引起政治动荡。继 Transformer 之后,谷歌又推出了 BERT 模型,将其用于关键字预测和 SEO 排名等。BERT 如今已经变成了自然语言处理领域的实际标准,诸如 Microsoft 和 NVIDIA 之类的公司开始堆积更多参数来追赶该模型。NVIDIA 的 Megatron 具有 80 亿个参数,而 Microsoft 的 Turing NLG 模型具有 170 亿个参数。OpenAI 的 GPT 模型后来居上,1750 亿参数的 GPT-3 目前是历史记录的保持者。GPT-3 也是 Transformer 的扩展,是目前最大的模型,它可以编码、写散文、生成商业创意,只有人类想不到,没有它做不到。将人类一军AI 早已在国际象棋中击败了人类。而更加复杂的人类游戏,如 Jeopardy! 游戏、围棋、德州扑克等,也没有挡住算法的脚步。人工智能近几年来最广为人知的事件就是 AlphaGo 在最复杂棋类游戏——「围棋」上击败了人类顶级选手。与此同时,在这个十年中,IBM 的 Watson 也在 Jeopardy! 决赛中击败了两位人类,最终 Watson 获得了 77147 美元奖金,而两位人类分别获得了 24000 和 21600 美元。Facebook 和卡耐基梅隆大学共同开发的德扑 AI Pluribus 战胜了五名专家级人类玩家,实现了前辈 Libratus(冷扑大师)未能完成的任务,该研究还登上了 2019 年的《科学》杂志。2020 年 12 月,DeepMind 提出的 MuZero 让一种人工智能模型掌握多种游戏,包括将棋、国际象棋和围棋。每一个生物体的行为都可以在其蛋白质中寻踪溯源。蛋白质承载着秘密,**蛋白质或许有助于击败新冠大流行。但蛋白质结构非常复杂,需要不断地运行模拟。DeepMind 尝试解决这一难题,其开发的深度学习算法「Alphafold」**了出现五十年之久的蛋白质分子折叠问题。计算机视觉被证明可以帮助诊断,而解决蛋白质折叠问题甚至能够帮助研发人员开发新药。AI:是艺术家,也是骗子去年,在一则视频中,比利时首相谈论着解决经济和气候危机的紧急需求,后来人们发现这其实是 Deepfake 视频。在机器学习和 AI 对比利时首相声音和表达方式的操纵下,这则假视频让首相发表了一场关于全球变暖影响的演讲。这些伪造内容的背后是精心设计的算法——生成对抗网络(GAN)。该算法在 2014 年提出,并得到广泛应用,甚至已经侵入了人类工作的最后一道壁垒:创作。这种网络可以生成从未存在的人脸、互换人脸,让一国总统胡言乱语。GAN 生成的一幅画甚至在佳士得拍卖会上以破纪录的价格——40 万美元成交了。GAN 的另一面是被用于恶意目的,以致于像 Adobe 这种公司不得不研究新技术来鉴别伪造内容。GAN 在下一个十年里仍将是被广泛讨论的对象。秘密武器——硅神经网络的概念诞生了半个世纪,今天流行的反向传播方法也出现三十年了。但是,我们仍然缺少能够运行这些计算的硬件。过去十年,我们见证了十多家公司研究专门的机器学习芯片。这些年来,芯片技术得到了极**展,我们可以在手掌大小的设备上执行百万次运算。这些芯片被用到数据中心,用户可以观看自己喜欢的 Netflix 电影、使用智能手机等。接下来,专为边缘设备定制的 AI 芯片蕴含着价值数十亿美元的商机。苹果等公司已经开发了定制化机器学习芯片(如 A14 Bionic)来提供智能服务。即使是依赖英伟达和英特尔的 AWS,也正在慢慢进入芯片行业。随着芯片变得越来越小,这一趋势只会更加明显:例如使用英伟达 Jetson AGX Xavier 开发者套件,你可以轻松创建和部署端到端 AI 机器人应用,用于制造、零售、智能城市等等。谷歌的 Coral 工具包可将机器学习带到边缘设备上。安全、实时输出是目前的主题。开源文化逐渐成熟2015 年,TensorFlow 开源。一年后,Facebook AI 又开源了基于 Python 的深度学习框架 PyTorch。今天,TensorFlow 和 PyTorch 已经成为使用最广泛的框架。通过不断的版本更新,谷歌和 Facebook 为机器学习社区带来了极大便利。自定义库、软件包、框架和工具的爆发式增长,使得更多人进入了 AI 领域,也为 AI 研究带来了更多人才。开源是近几年的一个主要特性。开源工具和越来越多的可用资源(如 arxiv 或 Coursera)促进了 AI 变革。另一个催化剂是流行的竞赛平台——Kaggle。Kaggle 和 GitHub 滋养了一批高质量 AI 开发者。更多学习,更少规则Schmidhuber 教授上世纪 90 年代初提出的元学习概念,最近才逐渐得到关注。元学习指在有限训练示例的基础上,使机器学习模型学习新技能并适应不断变化的环境。通过操纵超参数对特定任务优化机器学习模型需要大量用户输入的话,过程会较为繁琐,而使用元学习后,这一负担将得到极大缓解,因为元学习将优化部分自动化了。自动优化带来了一个新的行业 MLaaS(机器学习即服务)。未来方向关于一些专家预测以下领域或许将发挥主要作用:可复现性差分隐私几何深度学习神经形态计算强化学习尽管 AI 已经进入许多我们未曾想象的领域,但它仍需应用到更流行的应用中,如自动驾驶汽车。然而,挑战更多地在于数学层面:目前已有能够做出准确决策的算法,也有能够处理这些算法的处理器,但何时能够部署到应用上仍未可知。不管是医疗还是自动驾驶汽车,AI 仍需要继续进展,而这只有在透明性和可复现性得到建立时才会发生。原文链接:https://**yticsindiamag.com/ai-top-decade-2010-2020-breakthroughs/本文来源:https://www.jiqizhixin.com/articles/2021-01-11-3作者:RAM SAGAR编译:蛋酱 魔王
  • [其他] 基于同态加密的横向联邦学习
    除了 Secure Aggregation 方法外,我们亦可使用同态加密技术对参与者的梯度信息进行保护。同态加密是密码学研究中的「明珠」,其特殊性质在于,可以直接在密文上进行计算而无需解密。根据同态加密算法在密文上支持算子的不同,可以将其分为:加法同态、乘法同态和全同态算法。 在横向联邦学习中一般使用支持加法的同态加密算法,即参与者在上传模型数据前,首先对其进行加密,然后中心服务器收到密文后,在密文上进行加法聚合,再将密文结果返回给参与者,假设使用的同态加密为部分同态,则参与者需要先解密、再完成模型更新;如果使用的同态加密为全同态加密,则参与者无需进行解密,可以在密文的模型上进行更新。 下图  展示了一个标准的基于加法同态加密的横向联邦学习框架,该框架的运算流程可以概括为以下三个步骤:Map:中心服务器将当前加密模型分发给参与者,收到模型的参与者先对模型进行加密,再在本地数据上进行参数的有偏估计;Aggregate:中心服务器收集参与者的加密参数估计,进行聚合,得到新的、密态下的模型参数;Reduce:中心服务器使用聚合后的新加密参数最为当前模型。图 :基于加法同态加密的横向联邦学习 [3]。 基于全同态的横向联邦框架:除了使用加法同态算法之外,还可以使用全同态对横向联邦里的参数信息进行保护。在使用了全同态加密后,不止中心服务器上的参数聚合在密文下,参与者本地的模型更新也是在密文下,多方需要预先规定训练次数,在达到指定数量后停止训练。 安全性分析(密钥管理):在对基于同态加密的联邦学习系统进行安全性分析之前,还有一点需要我们额外注意的,那就是同态加密算法在使用中如何管理密钥。大部分同态加密算法仅有一个私钥,即在使用中,所有的参与者持有同一组公私钥、然后将公钥分享给中心服务器。但这种模型安全性较低,一旦有一个参与者与中心服务器共谋,系统的安全性就下降到了 vanilla 联邦学习。以上问题目前有一个较好的解决方案,即使用阈值同态加密算法 [10,11],该类型的同态加密算法支持多个私钥存在,并且当一定数量以上的私钥参与,才能将密文成功解密,近期阈值同态加密研究火热 [7,8,9],受到了广泛关注。 安全性分析(总结):在使用了同态加密之后,中心服务器无法获取任何有效的明文信息,所以也无法进行梯度攻击。并且借助阈值同态加密,多个参与者可以各自持有一个私钥,可以大大提升了系统的安全性,可以说参与者的数据十分安全。 转发自https://www.jiqizhixin.com/
  • [其他] 应用迭代-基于数据的应用迭代优化
    应用迭代优化主要包含两个方面,1,从数据上提升应用迭代效果 2,从算法和模型角度提升应用迭代效果1,从数据上提升应用迭代效果当推理态数据经过采集,筛选之后,可以进一步做处理和分析。ModelArts支持针对难例数据的推荐和数据增强,最终对用户的数据集进行补充,从而进一步提升模型精度。2,从算法和模型角度提升应用迭代效果模型训练过程和评估调优过程涉及的内容非常多,可以根据实际场景从模型迁移(修正模型,扩展模型),模型替换,多模型集成等多个角度综合提升模型性能,最终将模型打包为应用以增强迭代后的效果。基于数据的应用迭代优化最简单的模型维护方式是添加数据,或者在此基础上做进一步数据增强,进一步提升模型迭代的精度。基于数据的应用迭代优化流程       输入数据集->合并->重训练->部署推理数据集->新数据集->合并->重训练->部署推理数据集->难例挖掘->新数据集->合并->重训练->部署为了避免模型在新数据上发生拟合,通常需要将新老数据集合并在一起增量训练。1,简单重训练在实际业务场景中,应用维护是一个长期的过程,伴随着不断的数据采集和模型重复训练。如,按每周,每月进行重训练,或累计数据到一定数量时进行定期的重训练。另外,针对一些对时间比较敏感的场景,可以对新数据做一些加权。2,难例增强为了进一步提升应用迭代的效果,需要在数据采集和难例筛选的基础上做进一步的难例数据增强。如数据特征分析方法,可以利用数据特征统计分析工具对难例数据和训练做出统计对比,从而在某些特征维度上使得训练数据的特征统计分布向难例数据靠近。
  • [其他] 在自定义的数据集上训练YOLOv5(4)
    评估定制YOLOv5检测器的性能 现在我们已经完成了训练,我们可以通过查看验证指标来评估训练过程的执行情况。训练脚本将删除tensorboard日志,我们将其可视化: 在我们的自定义数据集上可视化tensorboard结果 如果你因为一些原因不能把张量可视化,可以用utils.plot_result来绘制并保存为result.png。 你需要在验证评估分数达到其最高点处获取训练好的模型权重。 可视化YOLOv5训练数据 在训练过程中,我们可以可视化真实训练数据和增强后的训练数据。 我们的真实训练数据 我们的训练数据采用自动YOLOv5增强 对象测试图像运行YOLOv5推断 现在我们利用我们训练好的模型,对测试图像进行推理。训练完成后,模型权重将保存到 weights/。推理过程,我们调用这些权重和一个指定模型置信度的conf(要求的置信度越高,预测越少)、以及一个推理源。源可以接受一个包含图像、单个图像、视频文件以及设备的网络摄像头端口的目录。对于源代码,我将test/*jpg移到test-infer/。 !python detect.py --weights weights/last_yolov5s_custom.pt --img 416 --conf 0.4 --source ../test_infer推理时间非常快,在我们的 Tesla P100 上,YOLOv5s 达到了每秒142帧!!以142 FPS(0.007s/图像)的速度推断YOLOv5s 最后,我们在测试图像上可视化我们的检测器推断结果。 测试图像的YOLOv5推理 导出并保存YOLOv5权重以将来推断 既然我们定制的YOLOv5物体检测器已经通过验证,我们需要从Colab中取出权重,用于实时计算机视觉任务,为此我们导入一个Google驱动器模块并将其发送出去。 from google.colab import drive drive.mount('/content/gdrive') %cp /content/yolov5/weights/last_yolov5s_custom.pt /content/gdrive/My\ Drive结论 我们希望你可以训练属于你自己的定制YOLOv5检测器!使用 YOLOv5 非常方便,而且训练迅速,推理迅速,表现出色。让我们把它弄出来!
  • [其他] 在自定义的数据集上训练YOLOv5(3)
    定义YOLOv5模型配置和架构 接下来,我们为我们的定制对象检测器编写一个模型配置文件。在本教程中,我们选择了最小、最快的YOLOv5基本模型,你也可以从其他YOLOv5模型中选择,包括:YOLOv5sYOLOv5mYOLOv5lYOLOv5x你也可以在此步骤中编辑网络结构,但一般不需要这样做。以下是YOLOv5模型配置文件,我们将其命名为custom_yolov5s.yaml: nc: 3 depth_multiple: 0.33 width_multiple: 0.50 anchors: - [10,13, 16,30, 33,23] - [30,61, 62,45, 59,119] - [116,90, 156,198, 373,326] backbone: [[-1, 1, Focus, [64, 3]], [-1, 1, Conv, [128, 3, 2]], [-1, 3, Bottleneck, [128]], [-1, 1, Conv, [256, 3, 2]], [-1, 9, BottleneckCSP, [256]], [-1, 1, Conv, [512, 3, 2]], [-1, 9, BottleneckCSP, [512]], [-1, 1, Conv, [1024, 3, 2]], [-1, 1, SPP, [1024, [5, 9, 13]]], [-1, 6, BottleneckCSP, [1024]], ] head: [[-1, 3, BottleneckCSP, [1024, False]], [-1, 1, nn.Conv2d, [na * (nc + 5), 1, 1, 0]], [-2, 1, nn.Upsample, [None, 2, "nearest"]], [[-1, 6], 1, Concat, [1]], [-1, 1, Conv, [512, 1, 1]], [-1, 3, BottleneckCSP, [512, False]], [-1, 1, nn.Conv2d, [na * (nc + 5), 1, 1, 0]], [-2, 1, nn.Upsample, [None, 2, "nearest"]], [[-1, 4], 1, Concat, [1]], [-1, 1, Conv, [256, 1, 1]], [-1, 3, BottleneckCSP, [256, False]], [-1, 1, nn.Conv2d, [na * (nc + 5), 1, 1, 0]], [[], 1, Detect, [nc, anchors]], ]训练定制YOLOv5探测器我们的data.yaml和custom_yolov5s.yaml文件已经准备好了,我们库开始训练了! 为了开始训练,我们使用以下选项运行训练命令:img:定义输入图像大小 batch:确定batch大小 epochs:定义epochs。(注:通常,3000+很常见!) data:设置yaml文件的路径 cfg:指定我们的模型配置 weights:指定权重的自定义路径。(注意:你可以从Ultralytics Google Drive文件夹下载权重) name:结果名称 nosave:只保存最后的检查点 cache:缓存图像以加快训练速度 运行训练命令: 训练定制的YOLOv5探测器。它训练得很快! 在训练期间,你可以看 mAP@0.5 来了解你的探测器是如何运行的,请参阅这篇文章。https://blog.roboflow.ai/what-is-mean-average-precision-object-detection/
  • [其他] 在自定义的数据集上训练YOLOv5(2)
    安装YOLOv5环境!git clone https://github.com/ultralytics/yolov5 # clone repo !pip install -U -r yolov5/requirements.txt # install dependencies %cd /content/yolov5然后,我们可以看看谷歌Colab免费提供给我们的训练环境。import torch from IPython.display import Image # for displaying images from utils.google_utils import gdrive_download # for downloading models/datasets print('torch %s %s' % (torch.__version__, torch.cuda.get_device_properties(0) if torch.cuda.is_available() else 'CPU'))你会从谷歌Colab收到一个 Tesla P100 GPU。以下是我收到的:torch 1.5.0+cu101 _CudaDeviceProperties(name='Tesla P100-PCIE-16GB', major=6, minor=0, total_memory=16280MB, multi_processor_count=56)GPU可以让我们加快训练时间,Colab预装了torch和cuda。如果你尝试在本地使用本教程,可能需要执行其他步骤来设置YOLOv5。 下载自定义YOLOv5对象检测数据 在本教程中,我们将从Roboflow下载YOLOv5格式的自定义对象检测数据。在本教程中,我们使用公共血细胞检测数据集训练YOLOv5检测血流中的细胞,你可以使用公共血细胞数据集或上传你自己的数据集。Roboflow:https://roboflow.ai/公共血细胞数据集:https://public.roboflow.ai/object-detection/bccd 关于标记工具的说明 如果你有未标记的图像,则首先需要标记它们。对于免费的开源标签工具,我们推荐你阅读 LabelImg入门 或 CVAT注释工具入门 的教程指南。尝试标记约50幅图像再继续本教程,因为在以后提高模型的性能的过程中,你将需要添加更多标签。https://blog.roboflow.ai/getting-started-with-labelimg-for-labeling-object-detection-data/https://blog.roboflow.ai/getting-started-with-cvat/一旦你标记了数据,要将数据移动到Roboflow中,请创建一个免费帐户,然后你可以以任何格式拖动数据集:(VOC XML、COCO JSON、TensorFlow对象检测CSV等)。 上传后,你可以选择预处理和增强步骤: 为BCCD示例数据集选择设置 然后,单击 Generate 和 Download,你将可以选择YOLOv5 Pythorch格式了。 选择“YOLO v5 Pythorch” 当出现提示时,一定要选择“Show Code Snippet”,这将输出一个下载curl脚本,这样你就可以轻松地将数据以正确的格式移植到Colab中。 curl -L "https://public.roboflow.ai/ds/YOUR-LINK-HERE" > roboflow.zip; unzip roboflow.zip; rm roboflow.zip正在Colab中下载…下载YOLOv5格式的自定义对象数据集 导出将会创建一个名为data.yaml的YOLOv5.yaml文件,指定YOLOv5 images文件夹、YOLOv5 labels文件夹的位置以及自定义类的信息。
  • [其他] 在自定义的数据集上训练YOLOv5(1)
    YOLO系列的目标检测模型随着YOLOv5的引入变得越来越强大了。在这篇文章中,我们将介绍如何训练YOLOv5为你识别自己定制的对象。本文我们使用公共血细胞检测数据集,你可以自己导出,也可以在自己自定义数据上使用本教程。公共血细胞检测数据集:https://public.roboflow.ai/object-detection/bccd为了训练检测器,我们采取以下步骤:安装YOLOv5依赖项 下载自定义YOLOv5对象检测数据 定义YOLOv5模型配置和架构 训练一个定制的YOLOv5检测器 评估YOLOv5性能 可视化YOLOv5训练数据 对测试图像使用YOLOv5进行推断 导出并保存YOLOv5权重以供将来使用 YOLOv5的新技术点就在两个月前,我们对googlebrain引入EfficientDet感到非常兴奋,并写了一些关于EfficientDet的博客文章。我们认为这个模型可能会超越YOLO家族在实时目标探测领域的突出地位,但事实证明我们错了。 三周内,YOLOv4在Darknet框架下发布,我们还写了很多关于YOLOv4技术解析的文章。 在写这些文章的几个小时之前,YOLOv5发布了,我们发现它非常清晰明了。 YOLOv5是在Ultralytics-Pythorch框架中编写的,使用起来非常直观,推理速度非常快。事实上,我们和许多人经常将YOLOv3和YOLOv4 Darknet权重转换为Ultralytics PyTorch权重,以便使用更轻的库来更快地进行推理。 YOLOv5比YOLOv4表现更好吗?我们很快会向你介绍,在此之前你需要已经对YOLOv5和YOLOv4有了初步的了解。YOLOv5与EfficientDet的性能对比 YOLOv4显然没有在YOLOv5存储库中进行评估,也就是说,YOLOv5更易于使用,而且它在我们最初运行的定制数据上表现非常出色。 我们建议你在 YOLOv5 Colab Notebook 中同时进行接下来的操作。https://colab.research.google.com/drive/1gDZ2xcTOgR39tGGs-EZ6i3RTs16wmzZQ
  • [其他] 日志提示"write line error"
    问题现象在程序运行过程中,刷出大量错误日志"write line error"。并且问题是必现问题,每次运行到同一地方的时候,出现错误,具体见下面截图。图1 错误日志原因分析出现该问题的可能原因如下:程序运行过程中,产生了core文件,core文件占满了"/"根目录空间。本地数据、文件保存将"/cache"目录3.5T空间用满了。说明:云上训练磁盘空间满一般是两个地方1.一个是“/”根目录,这个是docker中配置项“base size”,默认是10G,云上统一改成50G了。2.一个是‘/cache’目录满了,一般是3.5T存储空间满了,具体规格的空间大小见如下文档。处理方法如果是有core文件生成,可以在启动脚本最前面加上如下代码,来关闭core文件产生。import os os.system("ulimit -c 0")排查数据集大小,checkpoint保存文件大小,是否占满了磁盘空间。必现的问题,使用本地Pycharm远程连接Notebook调试。建议与总结在创建训练作业前,推荐您先使用ModelArts开发环境调试训练代码,避免代码迁移过程中的错误。直接使用线上notebook环境调试请参考使用JupyterLab开发模型配置本地IDE(Pycharm或者VsCode)联接云上环境调试请参考使用本地IDE开发模型
  • [其他] 特奖得主任队长,清华夺冠NeurIPS 2021国际深度元学习挑战赛
    国际AI顶级会议 NeurIPS 2021 召开。清华大学朱文武教授实验室 Meta_Learners 团队在 NeurIPS 2021 举办的第二届国际深度元学习挑战赛(MetaDL Challenge)中夺得冠军。该团队在最终阶段的五个数据集中以平均准确率超越第二名 17.5%(相对提升 22.3%)的优势强势摘得桂冠。元学习(Meta Learning)作为机器学习迈向自动化的一个重要研究方向,已经得到了产学研各界的持续关注。元学习旨在让机器学习算法从已经学过的任务中总结学习经验,提取「元」知识,来在遇到新场景、新任务时,让算法能够仅利用少量的样本就完成复杂的训练过程,从而又快又好地适应未知场景。为了进一步提升元学习算法在实际场景中的应用效果,机器学习比赛平台 ChaLearn 联合微软、谷歌等知名公司在各大人工智能学术顶级会议举办 MetaDL 系列竞赛。作为元学习领域的第二届国际竞赛,本次 NeurIPS 2021 MetaDL 挑战赛吸引了国内外顶尖团队的近五十支参赛队伍。    比赛关注元学习系统面对不同领域、不同质量的数据、任务时的表现。具体地,比赛要求选手们提供一个元学习系统,该系统需要在两小时、4 张 Tesla M60 显卡的环境中完成对已有任务的学习以及提取元知识,并在完全未知的 600 个图像分类任务(每个任务仅有 5 分类 x5 张 = 25 张标注图片,需要完成额外 95 张图片的标注)上完成快速学习和标签预测。此外,系统还需要在无人工调整的情况下适配包括生物、地质、病理、纹理、字符等不同领域的小样本图像分类问题,具有极大的挑战性。具体来说,这次比赛具有以下两个方面的挑战:    数据层面,来自各领域的图像内容和特性不同,采集与处理的方法也各不相同,有些是电子显微镜成像照片,有些是卫星传感照片,有些是人工手写字符,有些是家用摄像机拍照,这对元学习系统如何处理不同质量的输入信息提出挑战;    算法层面,不同领域的小样本任务需要不同的元知识,对应的特征提取算法、超参、框架也大有不同,这对元学习算法的泛化性和自适应能力提出巨大挑战。清华 Meta_Learners 团队赢得冠军此前,清华大学朱文武教授实验室的 Meta_Learners 团队就已在相关深度元学习比赛中取得优异成绩。在年初的AAAI 2021 国际首届深度元学习挑战赛(MetaDL Challenge)中,该团队以高出第二名 13% 性能的成绩强势夺冠。此次在 NeurIPS 2021 MetaDL 挑战赛中,团队延续了元学习领域的一贯优势,并再次夺得第一名。针对数据和算法层面的挑战,Meta_Learners 团队采用多级分辨率输入设计、低质量数据增强、混合领域半监督弱监督混合训练的方法来处理不同大小和质量的数据,解决数据层面的挑战。与此同时,他们采用半冻结模型参数更新与自动集成的方式来提取不同领域的元知识,解决算法层面的挑战。该团队提出的 MetaDelta++ 系统将向学术社区开源,为元学习算法进一步的研究和推广提供支持。官网地址:https://metalearning.chalearn.org/metadlneurips2021
  • [其他] 目标检测回归损失函数总结(5)
    CIoU Loss(2019)论文地址:https://arxiv.org/pdf/1911.08287.pdf代码地址:https://github.com/Zzh-tju/DIoU-darknet【动机】 解决DIoU loss没有包含长宽比因素的不足【分析】CIoU的惩罚项是在DIoU的惩罚项基础上加了一个影响因子。CIoU Loss定义为:其中  ,用于做trade-off的参数【实验】上表中左边是用5种不同Boudning Box Regression Loss Function的对比,右边是以IoU和GIoU来计算的2种Evaluation的结果;GIoU相对IoU会有2.49点提升,DIoU相对IoU会有3.29点提升,CIoU会有大概5.67点提升,CIoU结合DIoU-NMS使用效果最好,大概会有5.91点提升。【不足】 在CIoU的定义中,衡量长宽比过于复杂,从两个方面减缓了收敛速度长宽比不能取代单独的长宽,比如  都会导致v=0;从v的导数可以得到  ,这说明   在优化中意义相反。
  • [其他] 目标检测回归损失函数总结(4)
    DIoU Loss(2019)论文地址:https://arxiv.org/pdf/1911.08287.pdf代码链接:https://github.com/Zzh-tju/DIoU【动机】 解决GIoU Loss缺点当真实框完全包裹预测框的时候,IoU 和 GIoU 的值都一样,引入距离【分析】基于IoU和GIoU存在的问题,作者提出了两个问题:第一:直接最小化预测框与目标框之间的归一化距离是否可行,以达到更快的收敛速度。第二:如何使回归在与目标框有重叠甚至包含时更准确、更快。好的目标框回归损失应该考虑三个重要的几何因素:重叠面积,中心点距离,长宽比。针对问题一,作者提出了DIoU Loss,相对于GIoU Loss收敛速度更快,该Loss考虑了重叠面积和中心点距离,但没有考虑到长宽比;针对问题二,作者提出了CIoU Loss,其收敛的精度更高,以上三个因素都考虑到了。其中表示预测框和真实框中心点欧氏距离,c表示预测框和真实框最小外界矩形的对角线距离,如下图所示绿色框为真实框,黑色框为预测框,灰色框为两者的最小外界矩形框,d表示真实框和预测框的中心点距离,c表示最小外界矩形框的距离。当2个框完全重合时,当2个框不相交时:【不足】 边框回归的三个重要几何因素:重叠面积、中心点距离和长宽比,DIoU 没有包含长宽比因素
  • [其他] 目标检测回归损失函数总结(3)
    GIOU Loss(2019)论文地址:https://arxiv.org/abs/1902.09630代码地址:https://github.com/generalized-iou/g-darknet【动机】 解决IoU Loss没有考虑两个框是如何相交【分析】GIoU定义如下:实际使用时:GIoU 取值范围为 [-1, 1],在两框重合时取最大值1,在两框无限远的时候取最小值-1;与 IoU 只关注重叠区域不同,GIoU不仅关注重叠区域,还关注其他的非重合区域,能更好的反映两者的重合度。【实验】 GIoU Loss,在单阶段检测器YOLO v1涨了2个点,两阶段检测器涨点相对较少(原因分析:RPN的box比较多,两个框未相交的数量相对较少)【不足】 当真实框完全包裹预测框的时候,IoU 和 GIoU 的值都一样,此时 GIoU 退化为 IoU, 无法区分其相对位置关系。
总条数:5195 到第
上滑加载中