-
新的AI技术发展趋势有哪些?多模态学习技术一定是其中之一。最近,刚刚宣布“自立门户”的微软AI明星产品小冰改名为“红棉小冰”。殊不知2014年诞生的这一个AI对话机器人已经在5年时间里更新到了第七代了,据称能力上正在“无限接近人类”。现在的小冰,不仅是那个会作诗的机器人了,她还会唱歌作曲、阅读朗诵、撰写新闻,甚至去年还办了一个虚拟7位画家的个人画展。多模态识别技术正是小冰越来越像人一样沟通表达的关键之一。多模态技术同样也在视频网站、电商物流、自动驾驶等领域得到广泛。像爱奇艺推出的“只看TA”功能,优酷视频正在使用的视频帧、人脸帧的图向量检索,都离不开多模态识别技术的支持。而像京东淘宝等电商平台的“拍照购”、“拍立淘”的搜索技术背后也都是在计算机视觉技术下,使用了图像、文本和高层语义属性等多模态下的信息融合,才实现高精度的“以图搜图”功能。百度提出的“多模态深度语义理解”,则让AI实现从“看清听清”到“看懂听懂”的进化。可以说,人工智能在通向人的智能的道路上,多模态学习就是一个绕不开的发展方向。因为人类本身就是一个多模态学习的典范。现在,多模态学习技术正在带来众多全新的应用场景。关注AI技术和应用发展趋势的你,想必也想了解下多模态学习的来龙去脉,以及在这些新应用场景中的技术现状与问题。而这些问题也是本文重点探讨的内容。“多模态学习”,正式认识下模态(Modality),虽然不是我们的日常用语,但却十分容易理解。我们每一天都会接触到各种不同来源和形式的信息。正如我们有视觉、听觉、嗅觉和触觉等,那么我们接触的信息就有视频、图像、文字、语音、味道、软硬度等,这每一种信息的形式就可以称作一种模态。模态的范围要比我们的感知能力更宽泛。除了视觉、听觉获得的模态信息,我们也可以利用传感器获得诸如雷达、红外线等不同感应数据的模态信息。此外,模态的类型定义也可以非常宽泛,比如我们可以把两种不同的语言当做是两种模态,把不同结构下采集的数据,也可以当做两种模态。比如,仅仅一个视频内容数据,就是一个高维度、多模态的数据信息,其中包含了标题、简介、评论、字幕等文本信息,也有视频帧的图像、声音,以及连贯动作视频片段的视觉、声音信息。多模态学习,从上世纪70年代就已经起步,几经发展,现在正进入到机器学习特别是深度学习的阶段。通常称为多模态机器学习(Multi-Modal Machine Learning ,MMML),试图通过机器学习的方法实现对多源模态信息进行分析和理解。当前主要热门的研究方向自然是对图像、视频、音频、语义之间的多模态学习。当前,多模态学习主要研究方向有多模态表示学习、模态间映射,多模态对齐、融合、协同学习等。多模态表示学习,研究如何将多个模态数据所蕴含的语义信息数值化为实值向量,通俗理解就是对多个模态的数据进行相关性编码,让不同模态建立起映射关系。按多模态表示共享的方式,主要分为公共表示学习和特异性表示学习,后者由于是分别学习不同模态的特征,可以应用于诸如零次学习、模态间映射、跨模态检索等任务中。模态间映射,研究如何将某一特定模态数据中的信息映射至另一模态。例如,给定一幅图像,通过机器学习得到这副图像的描述,或者给定一段文字,生成一幅匹配的图像。类似于我们学习中遇到的“看图说话”和“以题作画”的问题。模态间映射早已可以应用于语音合成、图像视频描述以及跨模态检索等应用中。此外,多模态对齐,主要研究如何识别不同模态之间的部件、元素的对应关系,以促进学习到的多模态表示更加精确,例如将电影画面、口型、语音、字幕的自动对齐;多模态融合,主要致力于不同模态间的模型与特征的整合,以获得更全面的特征,提高模型鲁棒性,并且保证模型在某些模态缺失时仍能有效工作;而多模态协同学习,主要考虑如何从信息丰富模态上学习的知识迁移到信息匮乏的模态,使各个模态的学习互相辅助。典型的方法包括多模态的零样本学习、领域自适应等。近两年,随着机器学习的模型的飞速进展,多模态学习中出现的映射质量问题、对齐的匹配度量以及融合噪声干扰等问题,都在实现很好的优化解决,为多模态的落地应用做好了准备。多模态学习,正在丰富哪些应用场景?通过以上解释可以知道,其实很多我们熟知的AI技术都可以归类到模态学习当中。比如,像机器翻译,通过输入的一种A语言即时翻译为另一种B语言,其实质就是一种模态之间的映射转化。类似的还有唇读识别和语音翻译,也就是分别将唇部视觉和语音信息转换为文本信息。在图像识别中,会应用到一种“图片语义分割”,即尝试给图片的不同像素区域对应到每一种类型标签,实现视觉和词汇的对应。这就是多模态对齐在空间维度的应用。当然,基于多模态数据的丰富表示以及映射、对齐和融合的应用,可以将目前AI的三种主要感知模态——语音交互、机器视觉、传感器智能进行多模态组合,产生全新的应用场景。在语音交互上,“多模态深度语义理解”技术正在为其带来更深度的应用场景。对于前几年的智能音箱,我们都有这样的感触,那就是语音交互只能完成简单的搜索,一旦多聊几句,就发现机器人要么只有万能的“套路”公式,要么就“答非所问”。这一问题的根源就是人工智能无法更好的理解对话者的深层涵义,也没有灵活的应答机制和内容。此外,也更难理解人的语气、情绪这类情感模态信息,当然因为没有视觉感知,更不可能去理解人的表情、动作、姿态等信息。多模态深度语义理解可以极大改善这类语音交互的语义理解难题。比如,其中一个应用场景是智能汽车的数字座舱,正在从原本单一的车载语音识别,实现融合视觉、语音、车内外场景图像的多模态识别的转变。在实际的语音交互中,车载智能助手不仅可以实现语音的识别,也可以通过摄像头识别人的表情神态、动作,比如识别疲劳驾驶、分心、发热等状况,以进行即时的语音提醒。语音交互也可以更加以人类的自然语言进行交互,而不必要使用生硬的指令型语言。而在以机器视觉为主的应用中,多模态学习技术也带来新的应用可能。以电商平台购物为例,用户的一大痛点就是看到一些“心水”的好物或者同款,但不知道名字,通过拍照识别和检索,将为用户提供最便捷的推荐服务。另外,在电商的智能客服,用户也希望能够通过简单对话或者发送图片、视频的方式处理订单问题。在这些场景中,跨模态检索和映射转化技术就得到了深度应用。比如,在商品推荐和信息流广告中,就需要结合海量商品图像与对应的商品语义属性,学习图像语义特征表达,以提高符合用户需求的商品推荐度。而与智能客服进行的多轮对话中,融入视觉到语言的跨模态转换技术,可以自动实现对用户上传的图片或视频进行自动应答。在传感器智能上,多模态识别技术可以应用到大量的物联网设备场景中。通过在大量的智能设备中增加视觉、温度、湿度和光线传感器,来实现多模态的智能交互。比如在智能空调中,加入语音交互、视觉识别指令,结合传感器判断屋内温度和湿度,可以根据屋内人数、位置等因素来实现更精准的控温方案。而现在更多智能大屏应用,也在将机器视觉、语音交互和一些智能传感器引入到智能硬件中,实现对屋内光线的调节、音量、观看者状态(离得是否太近,是否有未成年人)等因素的智能识别和调节。而近期,华为推出的一款针对办公场景的智慧屏幕,可以根据视频会议中的发言对象进行视角跟踪,将摄像头跟踪、焦点人物识别和身份识别结合起来。正如开始列举的,多模态学习技术更主要的应用还是集中在语音和视觉的多模态识别上。在爱奇艺的“只看TA”的功能中,除了人脸识别要区分是真人还是卡通人物,还要对**信息,甚至还有微表情、身体语言等识别,多模态技术成为视频场景中不可缺少的技术支撑。而在未来的聊天机器人或者智能助手上,多模态学习将帮助智能机器人综合处理图像、声音和文字信息,同时可以进行综合模态,甚至包括情感等特征信息的输出与表达。技术尚在中途,未来仍需努力不过,我们仍然需要指出的是,尽管多模态学习技术已经有诸多的应用场景,但其技术实现仍然有诸多不足,也会有一些场景仍然是“伪多模态”的技术应用状态,导致一些场景体验仍然不能“尽如人意”。现在的多模态技术的结合多为“松耦合”状态,各个模态可以一起工作,但耦合之下还不够十分紧密。也就是现在更多实现的是两种模态信息的转化和融合。而一旦多种模态数据增加,耦合也会增多,冲突也就会增加,产生各种噪声。比如,对于聊天机器人,如何在回复的声音、文本中增加情感特征,就是一件非常困难的事情。因此,我们遇到的一批智能机器人都很容易是冷冰冰的客服腔调,以致于我们确实不好识别对方是真人还是机器人多模态技术主要还是采用已标注的多模态数据来生成深度学习模型,这导致这些模型在真实场景下的泛化能力受到很大限制。现有的多模态技术更多要与知识图谱结合,融入专家、常识等知识,利用数据和知识的联合来让多模态技术建立其“智能”的作用。此外,正如一位专家指出的,当前的多模态技术还是属于狭隘的单任务学习,整个训练和测试的过程都是在封闭和静态的环境下进行,这就和真实世界中开放动态的应用场景存在一定的差异性。这距离人类在真实场景中的泛化的多模态感知相距甚远。未来为提高多模态的泛化感知能力,可以利用元学习的方式来让模型自己学会如何认知新的多模态知识,实现适用于开放动态场景并具备终生学习能力的多模态模型。而在推动AI的推理能力上,在多模态模型训练的过程中,可以引入自监督、自学习的推理性任务,“强迫”多模态模型进行推理和思考,这也能在一定程度上让机器去慢慢学会推理。通过多模态学习技术实现AI的推理,看起来难度极大,这一假设还需要未来更多实验和验证。总的来说,多模态技术已经在试图“复制”人类在日常生活中的各类场景,尽可能把人类的感知信息进行分析处理和整合,并实现更全面综合的理解,也能结合“数据”和“知识”给出相应的回应。但这距离真正的人类级别的智能还有质的差别。当然,人们对多模态技术的发展前景仍然看好,相比于只侧重单一模态的技术,多模态技术所构建的智能应用场景将更多样化,也与我们普通人期待的智能生活更近一些。更何况,多模态技术仍处在“襁褓状态”,我们应该留给它足够长的成长时间,等待美好发生。
-
目前,我国的人工智能芯片行业发展尚处于起步阶段。 长期以来,中国在 CPU、 GPU、DSP 处理器设计上一直处于追赶地位,绝大部分芯片设计企业依靠国外的 IP 核设计芯片,在自主创新上受到了极大的限制。 然而,人工智能的兴起,无疑为中国在处理器领域实现弯道超车提供了绝佳的机遇。 人工智能领域的应用目前还处于面向行业应用阶段,生态上尚未形成垄断,国产处理器厂商与国外竞争对手在人工智能这一全新赛场上处在同一起跑线上,因此, 基于新兴技术和应用市场,中国在建立人工智能生态圈方面将大有可为。由于我国特殊的环境和市场,国内 AI 芯片的发展目前呈现出百花齐放、百家争鸣的态势, AI 芯片的应用领域也遍布股票交易、金融、商品推荐、安防、早教机器人以及无人驾驶等众多领域,催生了大量的人工智能芯片创业公司,如地平线、深鉴科技、中科寒武纪等。尽管如此, 国内公司却并未如国外大公司一样形成市场规模, 反而出现各自为政的散裂发展现状。除了新兴创业公司,国内研究机构如北京大学、清华大学、中国科学院等在AI 芯片领域都有深入研究;而其他公司如百度和比特大陆等, 2017 年也有一些成果发布。可以预见,未来谁先在人工智能领域掌握了生态系统,谁就掌握住了这个产业的主动权。
-
为了应对数据隐私的挑战,最近出现了联邦学习的概念。联邦学习的思想认为,目前各个企业的数据之前就像不同的国家,它们各自有自己的体系,但是无法很好地完成统一建模。联邦学习则将它们管辖在“一个国家、一个联邦政府”之下,将不同的企业看作是这个国家里的“州”。这样,通过彼此之前不互通数据,彼此之间都可以获得模型效果的提升。FTL的核心是:各个企业的自有数据不出本地,模型效果不变。联邦迁移学习事实上,Google等一些大公司也最先开始了一些关于联邦学习的研究。例如,Google在2017年的一篇论文里进行了去中心化的推荐系统建模研究。其核心是,手机在本地进行模型训练,然后仅将模型更新的部分加密上传到云端,并与其他用户的进行整合。目前该方法已在Google输入法中进行实验。一些研究者也提出了CryptoDL深度学习框架、可扩展的加密深度方法、针对于逻辑回归方法的隐私保护等。但是,它们或只能针对于特定模型,或无法处理不同分布数据,均存在一定的弊端。正是为了解决上述这些挑战,香港科技大学杨强教授和微众银行AI团队,最近提出了联邦迁移学习 (Federated Transfer Learning, FTL)。FTL将联邦学习的概念加以推广,强调在任何数据分布、任何实体上,均可以进行协同建模学习。这项工作在国内,是杨教授与微众银行AI团队主导,目的是建立数据联邦,以解决大数据无法聚合的问题。在国外,目前是Google在进行相关的研究。二者的区别:微众银行AI团队的做法是,用户维度部分重叠,特征维度不重叠;而Google则是反过来:特征重叠,用户不重叠。可以预见的是,微众AI团队针对的情景,要比Google的情景更加具有普适性,也更符合未来大数据、多企业的应用需求。下图展示了FTL的应用情景。解释:假设我们现有的A和B两个企业的数据,它们的服从上图的特征和样本维度。当A和B处于同一样本维度、不同特征维度时,我们可以用联邦学习;当A和B处于同一特征维度、不同样本维度时,我们就可以用迁移学习;二者的结合点则是:不同样本、不同特征维度。具体地,可以扩展已有的机器学习方法,使之具有FTL的能力。比如,我们可以将不同企业、不同来源的数据首先训练各自的模型,然后,将模型数据进行加密,使之不能直接传输以免泄露用户隐私。然后,在这个基础上,我们对这些模型进行联合训练,最后得出最优的模型,再返回给各个企业。联邦迁移学习使得不同企业之间,第一次有了可以跨领域挖掘用户价值的手段。
-
5月17-18日,以“因聚而生,有能有为”为主题的华为中国生态大会2021在深圳举行。在“蓬勃发展的AI生态,共赢行业智能升级时代”论坛上,华为云携手多位AI生态伙伴围绕机器学习、知识管理、NLP、AI+RPA等人工智能技术热点和解决方案,进行了深入探讨。华为云EI营销总监分享了华为云全栈全场景战略及最新进展,介绍了开启AI工业化开发新模式的华为云盘古大模型。他表示:“从目前AI的发展来看,人工智能逐渐走进千行百业的核心生产系统,开始进入实用阶段,创造出更大价值。华为云AI作为行业智能升级的使能者,提供全栈全场景的AI生态产品。基于一站式AI开发平台ModelArts提供模型开发、训练、推理和部署能力,管理全周期AI工作流。基于其AI Gallery实现数据、模型、工具等AI数字资产沉淀和分享。与伙伴和行业客户共建蓬勃发展的AI生态,助力千行百业实现智能升级。”知识智能,驱动数字化转型云问科技联合创始人茆传羽向与会嘉宾分享了基于华为云AI技术的创新实践。云问科技在为客户提供定制化智能客服+知识智能系统服务的实践过程中,曾面临许多痛点,包括数据量少、纯文本交互限制大、人机交流效果不佳等。为了应对上述挑战,华为云向云问科技提供了云平台、NLP、OCR、图引擎等系列技术,助力云问深耕知识智能和服务智能两大领域,打造知识管理平台、智能客服、电话机器人等AI产品,帮助工业制造、电力、政务等行业客户实现数字化转型。华为云TrafficGo:助力交通治理实现行业穿透博研智通首席品牌官吴伟娜介绍了博研智通携手华为云AI新技术,共同打造华为云交通智能体TrafficGo——城市交通综合治理解决方案。该方案为客户提供一整套优化体系、两大治理抓手、三大基础能力,实现区域协同优化效果,为城市交通管理带来更多数字化体验与业务提效升级,也为万千交通参与者提供卓越、安全、高效的出行体验。AI+RPA :加速企业智能自动化的新方案RPA(机器人流程自动化)可使软件机器人像人一样,通过多模态的AI技术,在不同系统之间进行数据的录入、提取和验证等操作。智能自动化将RPA和AI结合,从而实现复杂业务流程自动化。华为云EI资深专家表示:“华为云深度融合OCR、NLP等AI服务与RPA、低代码能力,通过云上训练,端侧快速部署,打造端云协同、数据安全、0代码开发和开箱即用的智能自动化服务,例如企业财务助手、金融营销助手、政务综合治理助手等,帮助企业打通数字化转型最后一公里。”作为华为生态中的重要战略合作伙伴和RPA领域实践先行者,软通动力在企业智能自动化(AI+RPA)的实施方法与实践中带来最新的应用思考和独到见解,基于华为AI+RPA,通过“超自动化+数据智能+场景智能”的“智能化三角”实施策略,推动企业的内外部服务生态融合,进而加速企业和组织完成智能化转型。在软通动力CTO刘会福看来,企业要实现智能化转型战略的落地需要在组织上实现相关要素的落地,即战略、产品、人才、技术和实施。目前,软通动力与华为云赋能客户的过程中,在这在5方面都有不同程度的合作。如在AI+RPA规划设计能力方面为客户提供AI场景应用设计与RPA管理规划;在AI研究及技术研发方面提供一站式AI开发平台与AI算法定制服务(包括CV、NLP、OCR、知识计算等)。基于双方共同合作的AI+RPA技术,软通动力率先应用于内部提升流程效率、优化流程质量等方面,整体业务效率提升了近6.5倍,实现了数据价值的重构。人工智能机器学习平台:数字化助手助力AI百业落地在人工智能的感知智能和认知智能阶段,力维智联拥有多项AI实践经验,涵盖城市、电信、能源、新零售以及出版等行业场景。力维智联营销副总裁凌敏表示,目前力维智联提供线下零代码机器学习、深度学习训练平台,让客户的数据无需上传公有云,也可以实现智能化转型。未来力维智联还将结合华为云Stack和ModelArts一站式AI开发平台,让客户能够在私有云上使用整套的华为云AI能力,同时还可以借助华为云盘古大模型进行模型参数优化,提升泛化能力,使AI模型达到极致性能。在智能升级的浪潮中,利用前沿创新技术解决困扰自身发展问题、以场景化视角实现降本增效,是每一位开发者和管理者的共同目标。华为云将持续围绕客户需求,联合伙伴打造能力,构建更多元的AI生态,与生态伙伴一起共创行业新价值。
-
“喂,你好,最近听说可以免费接种新冠疫苗,我想来了解下。”“欢迎来电,您想具体咨询关于接种新冠疫苗的哪方面问题呢?比如?2020年疫情高峰时期,竹间防疫AI机器人完成近2万通/日的防疫电话的拨打。不仅如此,竹间智能AI+金融、AI+医疗、AI+企业、AI+政务、金融+IOT、金融+IOT,各行各业大放异彩,让企业无限可能!大咖直播:竹间智能-5/27 晚19:00-20:00 直播亮点:1、联合华为云AI+智能解决方案展示2、6大自主研发核心技术精度剖析3、如何助力企业智能化服务和智能知识构建有奖直播链接:点我收看直播,闯关赢好礼!!! 竹间好礼第一弹:点击直播页面向下拉,点击“问答闯关”按钮获得答卷(点我)填写华为云ID并且答题(5题),得分在75分以上且前500名提交的用户即可获得500码豆。AI应用达人就是你!!!(小云提示:所有问题的答案可在竹间智能官网(点我)找到答案,若出现一个提问同时在2个获奖区间,则取第一个获奖区间)(扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!!!竹间好礼第二弹:PART1:直播提问直播期间在“问答区”向专家提问,专家抽取问题进行答疑,被选中前5个问题获得竹间智能高档精美茶具一套,后5个问题获得5000码豆!(提问格式:手机号码后四位+问题,例:7309+竹间涉及不同行业业务场景时,如何保证服务?)一定要来看直播,锁定5/27日晚上19:00!!!(点我)PART2:论坛提问在本帖回复#竹间智能AI#+您最想提问专家的问题,便可获200码豆(一个id仅为一个提问可获码豆,但可提多个问题参与评选,限前500名)。(例:#灵动科技AMR机器人#竹间自研NLP集成27个技术模块,全球首屈一指,目前如何应用到市场,技术中又有什么亮点?)嘉宾将挑选出n个问题论坛和社群回答,其中2名优秀问题赠送2000码豆,2名最佳问题赠送5000码豆!!!PART3:论坛畅谈在本帖回复##竹间智能AI#+您对竹间智能AI的了解或者发展前景,一切关于竹间智能的议题且不少于50字便可获200码豆(一个id仅为一个畅谈可获码豆,但可提多个畅谈参与评选,限前500名)。(例:竹间的六大产品已全面升级为云为先的六大云平台,Bot Factory Cloud,AICC+Cloud,Gemini Cognitive Cloud,NLP Cloud, AutoML Cloud,Intelligent Automation Cloud。)嘉宾将挑选出n个畅谈进行点评,其中2名优秀畅谈赠送2000码豆,2名最佳问题畅谈5000码豆!!!(扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!!!达27个自然语言理解技术模块言理解技术模块竹间好礼第三弹:看直播,四轮抽奖,大奖就是你!(点我)(扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!!!竹间好礼第四弹:所有参加直播的企业用户,都可获得申请竹间产品试用资格,请扫码入群添加群主微信对接详情。(扫我加入社群)本次活动所有奖励领取,必须加入社群并收看直播,否则无效!!!竹间好礼第五弹:AI Gallery网站(点击)华为云AI知识&实训社区,助你从0到1成为AI开发达人!!!4月29日(周四)19:00-20:00云市场直播间,不见不散!5月27日(周四)19:00-20:00云市场Eco Space直播间,看直播,好礼等你哦!!(点我)本期活动已结束,现将获奖用户公布如下:一、优秀最佳提问畅谈华为云ID码豆优秀问题SeeU_ZH2000CrayonGo2000最佳问题hw055939875000hw21012767235000优秀畅谈hw253761612000hw301419202000最佳畅谈hw551019715000hw113266485000二、提问&畅谈&答题闯关 答题 闯关论坛提问论坛畅谈华为云ID码豆linghz666200linghz666200f1113206748500hw11326648200hw11326648200hw75435701500hw36946664200hw36946664200zhukang777500yizhangl200yizhangl200inspur_wll500DouDou_200DouDou_200lhw79459023-500hw46425134200hw46425134200hw02428460500nukinsan200nukinsan200Ethins500hw09974076200hw09974076200sunxiaobei500qiushu2020200qiushu2020200maoning2019500nanxi123200nanxi123200Ysz666Lac500hw17383096200hw17383096200hw96458811500hw01949548200hw01949548200lu_zhishen500hw16375480200hw16375480200hw03426922500hw31151336200hw31151336200hw00257852500hw86105405200hw86105405200hw05593987500hw36175659200hw36175659200hw43395846500oznar119200oznar119200bigdata1500hw55101971200hw55101971200RAkira500hw43985887200hw43985887200SeeU_ZH500hw46433192200hw46433192200user_beifeng500hw26536804200hw26536804200hw20080808500hw78949957200hw78949957200hw2021888500kitty787200kitty787200hw11078500holoyh200holoyh200hw10996515500hw75771608200hw75771608200kasson_500hw73261881200hw73261881200hw48382267500hw94545161200hw94545161200hw94545161500zhengxx6688200zhengxx6688200power11500a565855829200a565855829200zekelove500lsj9527200lsj9527200zhengxx6688500khg305387543200khg305387543200a565855829500hw00257852200hw00257852200hw73261881500csdn_zeke200csdn_zeke200hw51932160500hw02428460200hw02428460200hw75771608500lhw79459023-200lhw79459023-200kitty787500whw43454189_200whw43454189_20017671372110500hwid_c7gbgw8wvl56bxs200hwid_c7gbgw8wvl56bxs200holoyh500sunshine_huawei200sunshine_huawei200hw89145575500f1113206748200f1113206748200hw26536804500hw46433192500hw43985887500hid_j2_s9fprdpy26qv500hw56223614500hx13119189421500hw63394802500cj15389664340500oznar119500hw16375480500hw01949548500meet00500hw36175659500suchao444500hw46425134500coolanimals500JaneConan500zhangpaodan500cl4690500hw25376161500hw53660789500sunshine_huawei500whw43454189_500hw72130810500hw63723198500hw19663623500teiditeidi500msolution500huyulei500SeeU_ZHL500SeeU_XM500hw90509325500hw19116355216500hwloulan_lu35323741500wjsandy500hw72023025500lisdon 714220089@qq.com500changgaogong500khg305387543500lsj9527500hw29419212wzyy2500hw98541549500hw47032991500hw21950384500quminjie500qumimjie500wyw5476458500hw37344076500hw33060943500qimiao2111500qimiao2112500qimiao2113500mi_mic500momingqimiao2111500chenxi2111500hw55101971500HW_Alex500hw31151336500huang_guoqing500hw17383096500nanxi123500CrayonGo500jinsashou500hw64838345500jinsashou1500hw09974076500hw86105405500tingting1990500nukinsan500hw28810968500hw63991709500hw73501220500hw29419212500hw79926743500hw31711871500qiushu2020500heiyouheiyoubaluobo500wangzengyin500hw_008617750345773_01500lyzml1991500hw51364135500canfen500hw35544043500DouDou_500heiyouyoubaluobo500zhangyibaluobo500yizhangl500cai_hy500hw11326648500linghz666500注:1、所有中奖用户在申诉时间结束前必须完成实名认证并确定华为云账号是否正确,否则码豆无法发放,视为放弃领奖。2、本次活动申诉时间:2021年6月4日19:00前
-
### 名称及链接 [AI智能语音识别计算器](https://edu.huaweicloud.com/certifications/0e2f9cb342a34505830a0c9630962210) ### 课程章节 1. 语音处理技术概述 2. 语音识别和语音合成 3. 智能语音计算实践 ### 证书  ### 笔记 1. 语音助手执行流程 1. 语音输入 2. 语音识别 3. 语言理解 4. 对话管理 5. 语言生成 6. 语音合成 7. 语音输出 2. 语音处理:语音 -> 语音 3. 语音合成:文字 -> 语音 4. 语音识别:语音 -> 文字 5. SIS,语音交互服务 1. ASRC,定制语音识别 2. RASR,实时语音转写 3. TTSC,定制语音合成 6. 常见的音频格式:MP3 WAV APE flac 7. 波形图,语谱图 8. 语音识别技术 1. 综合性的技术,它涉及到多个学科领域,如发声机理和听觉机理、信号处理、概率论和信息论、模式识别以及人工智能等等 9. 鸡尾酒会问题 1. 采集到的语音里有多个人同时说话,识别出每个说话人的内容 2. 远场语音识别中必须解决的重要问题 10. 语音识别任务处理流程 1. 语音文件(压缩格式) 2. 非压缩语音文件(WAV) 3. 预处理(静音切除,降噪,平滑,标准化) 4. 声学模型 5. 分帧 6. 声学特征提取 7. 语言模型 8. 单词 9. 文本文件 11. 词汇识别过程 1. 把帧识别成状态 2. 把状态组合成音素 3. 把音素组合成单词 12. 语音识别算法 混合模型,也称为hybrid模型 端到端模型,也称为end2end模型 13. 语音合成 涉及声学、语言学、数字信号处理、计算机科学等多个学科技术,是信息处理领域的一项前沿技术 14. 语音合成系统过程 1. 将文字序列转换成音韵序列 1. 涉及语言学处理,例如分词、字音转换等,以及一整套有效的韵律控制规则 2. 由系统根据音韵序列生成语音波形 1. 需要先进的语音合成技术,能按要求实时合成出高质量的语音流 15. 语音合成处理流程 1. 文本文件 2. 文本分析 3. 语音内部表示 4. 波形合成 5. 波形文件 6. 评估 16. 语音合成 1. 自然度:在单字和词组级别、在句子和篇章级别 2. 语种:单语种合成、多语种合成 17. 人类语音饱含情感,语气语速,并且不同年龄有不同的说话方式,这是现在语音合成所无法较好做到的。 ### 备注 1. 感谢老师的教学与课件 2. 欢迎各位同学一起来交流学习心得^_^ 3. 在线课程、沙箱实验、博客和直播,其中包含了许多优质的内容,推荐了解与学习。
-
深度学习目前人工智能最受关注的领域,但并不是人工智能研究的全部。张钹认为尽管产业层面还有空间,但目前基于深度学习的人工智能在技术上已经触及天花板,此前由这一技术路线带来的“奇迹”在Alphago获胜后未再出现,而且估计未来也很难继续大量出现。技术改良很难彻底解决目前阶段人工智能的根本性缺陷,而这些缺陷决定了其应用的空间被局限在特定的领域——大部分都集中在图像识别、语音识别两方面。同时,在张钹看来,目前全世界的企业界和部分学界对于深度学习技术的判断过于乐观,人工智能迫切需要推动到新的阶段,而这注定将会是一个漫长的过程,有赖于与数学、脑科学等结合实现底层理论的突破。作为中国少有的经历了两个人工智能技术阶段的研究者,张钹在过去数年鲜少接受采访,其中一个原因在于他对目前人工智能技术发展现状的估计持有部分不同看法,在时机未到之时,张钹谨慎的认为这些看法并不方便通过大众媒体进行传播,即使传播也很难获得认同。一、“奇迹并没有发生,按照我的估计,也不会继续大量发生”经济观察报:您是如何估计和评价目前人工智能发展的现状?张钹:这一轮人工智能热潮是本世纪初兴起的。首先是出现在学术界。学术界过去对人工智能是冷遇的,但是多层神经网络的出现带来了一些改变,神经网络的理论在上世纪50年代就有了,但是一直处于浅层的应用状态,人们没有想到多层会带来什么新的变化。真正引起大家注意的就是2012年斯坦福的实验(注:2012年谷歌和斯坦福利用多层神经网络和大量数据进行图像识别的实验),过去实验的图像样本数最多是“万”这个级别,斯坦福用了1000万,用多层神经网络来做,结果发现在人脸、人体、猫脸三个图像类别中,这个模型的识别率大概有7%-10%的提高。这给大家非常大的震动,因为通常识别率要提高1%要做好多努力,现在只是把层数增加了,竟然发生两大变化,一个是识别率提高这么多;第二个是能处理这么大数据。这两个变化给大家非常大的鼓舞,何况在2012年之前,人工智能没有解决过实际问题。经济观察报:这种突破的原因是什么?张钹:现在分析下来是三个原因,大家也都非常清楚了,一个大数据、一个是计算能力、一个是算法。认识到之后,一夜之间业内业外对深度学习都非常震动,然后就发生了三件历史性的事件。第一件事是2015年12月,微软通过152层的深度网络,将图像识别错误率降至3.57%,低于人类的误识率5.1%;第二件事,2016年微软做的语音识别,其词错率5.9%,和专业速记员水平一样;第三件事:Alphago打败韩国围棋选手李世石。通过人工智能,利用深度学习、大数据这两个工具,在一定条件下、一定领域内竟然能够超过人类,这三件事情给大家极大的鼓舞。特别是对于业外的人,都认为我只要掌握了大数据,利用深度学习说不定还能搞出奇迹来,于是大家做了很多很多预测,比如在多短时间内计算机会在什么事情上能超过人。但实际上,在这个之后,奇迹并没有发生,按照我的估计,今后也不会大量发生。准确一点说,今后或许会在个别领域取得进展,但是不会像之前预计的那样全面开花。特别是中国市场乐观的认为“中国市场大、数据多,运用又不受限制,所以将来奇迹一定会发生在中国”。结果很多企业在做的时候发现,不是那么回事。从目前的情况来看效果最好的事情还是这两件:图像识别、语音识别。我看了一下,中国人工智能领域20个独角兽30个准独角兽企业,近80%都跟图像识别或者语音识别有关系。经济观察报:为什么会出现这样的情况?或者说在这么长时间后,我们对人工智能目前能做什么有一个清晰的认识了吗?张钹:人工智能在围棋上战胜人类后产生了这种恐慌,“大师才能做的事,人工智能居然能做,我的工作这么平凡,肯定会被机器所替代”。这里需要考虑一下它的局限性,我一直在各种各样的会上谈到不要过于乐观。人工智能能做的那三件事(语音识别、图像识别、围棋)是因为它满足了五个条件,就是说只要满足了这五个条件,计算机就能做好,只要有任何一个或者多个条件不满足,计算机做起来就困难了。第一个是必须具备充足的数据,充足不仅仅是说数量大,还要多样性,不能残缺等。第二个是确定性。第三个是最重要的,需要完全的信息,围棋就是完全信息博弈,牌类是不完全信息博弈,围棋虽然复杂,但本质上只需要计算速度快,不要靠什么智能,可是在日常生活中,我们所有的决策都是在不完全信息下做的。第四个是静态,包括按确定性的规律演化,就是可预测性问题,在复杂路况下的自动驾驶就不满足这一条;实际上它既不满足确定性,也不满足完全信息。第五个就是特定领域,如果领域太宽他做不了。单任务,即下棋的人工智能软件就是下棋,做不了别的。经济观察报:就是说在满足这五个条件的前提下,目前的人工智能是胜任部分工作的?张钹:如果你的工作符合这五个条件,绝对会被计算机替代,符合这五个条件的工作特点很明显,就是四个字“照章办事”,不需要灵活性,比如出纳员、收银员。如果你的工作富有灵活性和创造性,计算机绝对不可能完全代替,当然部分代替是可能的,因为其中肯定也有一些简单和重复性的内容。如果认识到这一条就会认识到人工智能仍处于发展阶段的初期。不是像有些人估计的那样“人工智能技术已经完全成熟,而进入发展应用的阶段”。二、“深度学习技术,从应用角度已经接近天花板了”经济观察报:我们应该怎么去定义目前的深度学习技术路线,它是基于概率学的一个事物吗?张钹: 现在的深度学习本质是基于概率统计 ,什么叫做概率统计?没有那么玄,深度学习是寻找那些重复出现的模式,因此重复多了就被认为是规律(真理),因此谎言重复一千遍就被认为真理,所以为什么大数据有时会做出非常荒唐的结果,因为不管对不对,只要重复多了它就会按照这个规律走,就是谁说多了就是谁。我常常讲我们现在还没有进入人工智能的核心问题,其实人工智能的核心是知识表示、不确定性推理这些,因为人类智慧的源泉在哪? 在知识、经验、推理能力,这是人类理性的根本。 现在形成的人工智能系统都非常脆弱容易受攻击或者欺骗,需要大量的数据,而且不可解释,存在非常严重的缺陷,这个缺陷是本质的,由其方法本身引起的。经济观察报:就是说通过改良的方式无法彻底解决?比如我们再增加神经网络层数和复杂性或者再提升数据的量级,会解决它的缺陷吗?张钹: 改良是不行的,深度学习的本质就是利用没有加工处理过的数据用概率学习的“黑箱”处理方法来寻找它的规律,这个方法本身通常无法找到“有意义”的规律,它只能找到重复出现的模式,也就是说,你光靠数据,是无法达到真正的智能。此外,深度学习只是目前人工智能技术的一部分,人工智能还有更大更宽的领域需要去研究,知识表示、不确定性处理、人机交互,等等一大片地方,不能说深度学习就是人工智能,深度学习只是人工智能的一部分。一直到去年人工智能大会交流的论文还是三分之一是机器学习方面,三分之二是其他方面。经济观察报:学界在这上面还是有一个比较清晰的认识?张钹: 我可以这么说,全世界的学界大多数有清晰的认识; 全世界的企业界大多持过于乐观的估计。为什么出现这样的情况呢?因为从事过早期人工智能研究的人,大多已经故去或者年老,已经没有话语权。现在活跃在人工智能研究第一线的都是深度学习、大数据兴起以后加入的,他们对人工智能的了解不够全面。经济观察报:如果说每一个技术路线都有一个“技术潜力”,那么在深度学习方面,我们已经把这个潜力用了多少?张钹: 科学研究是很难精确估计的,但是深度学习如果从应用角度,不去改变它,我觉得已经接近天花板了,就是说你要想再出现奇迹的可能性比较小了。经济观察报:那基于此,目前商业公司在底层技术和产业应用上还是有很大的空间吗?张钹:只要选好合适的应用场景,利用成熟的人工智能技术去做应用,还有较大的空间。 目前在学术界围绕克服深度学习存在的问题,正展开深入的研究工作,希望企业界,特别是中小企业要密切注视研究工作的进展,及时地将新技术应用到自己的产品中。当然像谷歌、BAT这样规模的企业,他们都会去从事相关的研究工作,他们会把研究、开发与应用结合起来。经济观察报:有一种观点认为我们强调的“白盒”(可理解性)它实际上是从人的思维来强调的,但是通过大数据、概率统计工具离散到连续的投射,它实际上是机器的思维,你不一定需要它给你一个解释,只要正确的答案就可以了?张钹: 目前有两种意见,一种观点认为智能化的道路是多条的,不是只有一条路能通向智能,我们通过自然进化产生了自然智能,那么我们为什么不能通过机器产生机器智能?这个智能和自然智能不会是完全一样的,条条大路通罗马,我们通过自然进化获得的智能也不见得是最佳的。这个观点我赞成,机器智能与人类不相同,其实是有好处的,恰恰可以互补,发挥各自的长处。但是从长远来看,必须得走人类智能这条路,为什么?因为我们最终是要发展人机协同,人类和机器和谐共处的世界。我们不是说将来什么事情都让机器去管去做,人类在一边享受。我们要走人机共生这条路,这样机器的智能就必须和人类一样,不然没法共处,机器做出来的事情,我们不能理解,我们的意图机器也不知道,二者怎么能合作?经济观察报:就是必须具有可解释性?张钹: 是,就是可解释性,你要它做决策,你不理解它,飞机就让它开,谁敢坐这架飞机?所以目前的阶段,车和飞机还是不能完全让机器开的。为什么司机坐在上面我们放心?因为我们和他同命运,要撞死一块撞死,机器和你可不是同一命运,它撞不死,你撞死了。有的人非常脱离实际的去想这个问题,这是不对头的,人类怎么会去那样发展机器呢(注:指把人类的命运全部交给机器)?人类不会去那么发展的,有些人在那边担忧什么机器人统治人类,我说这最多只能算远虑。经济观察报:所以图灵的论文中也说这种观点“不值一驳”。张钹: 是,那是远虑,我们目前还有很多近忧,发展人工智能必须要考虑安全问题,这已是现实问题。你看语音合成,利用现有的技术可以做到以假乱真,和真人基本没有差别。现在看来这种技术不能推广应用,因为一旦推广就全乱套了,只要搞一段用语音合成技术做成的假录音,就可以让任何一位名人身败名裂。这些都是非常危险的技术。人工智能的治理已经提到日程上了。三、“我们培养不出爱因斯坦、培养不出图灵”经济观察报:一种观点认为中国有更多的数据和更多的工程师,这种规模能倒推带来基础研究层面的突破或者决定技术的路线?张钹:这里混淆了好多概念,科学、技术、工程。科技水平需要三个标准来衡量,一个是科研水平、一个是技术水平、一个是工程实践能力,或者产业化能力。我们中国什么情况?从工程角度来看,在一些领域我们“接近世界水平”;技术水平我用的词是“较大差距”,因为不少东西还是外国会做我们不会做;科研究领域我用的词是“很大差距”,科学研究就是原创,实际上,所有人工智能领域的原创成果都是美国人做出来的,人工智能领域图灵奖得主共十一人,十个美国人,一个加拿大人。经济观察报:数据显示中国在人工智能领域的论文发表量和被引用次数都已经进入前列位置,这是否说明中国人工智能科学研究领域的突破?张钹:如果单从论文来看研究水平,基本反映在三个指标上:数量、平均引用率、单篇最高引用率。拿人工智能来讲,中国研究者论文的数量和平均引用率都还不错,但是单篇最高引用率和世界差距就很大,而这个指标恰恰是反映你的原创能力。也就是说深度学习这个领域,我们的平均水平达到世界水平了,但是最高水平和世界差距还是很大的。不过还是要肯定的,我们应用上发展比较快。经济观察报:清华在这方面有什么优势吗?张钹:在人工智能重要的会议杂志上,这十年期间论文数量、平均质量CMU(美国卡耐基梅隆大学)排第一,清华大学排第二。我们培养的人,在计算机这个领域,清华的本科、博士生都是世界一流的。目前我们的跟踪能力是比较强的,一旦有人起个头,我们能迅速跟上去。但是很可惜,我们缺乏顶尖人物,也培养不出顶尖的人才,如爱因斯坦、图灵等。我个人认为原因之一,可能与中国的文化有点关系,我们的从众心理很严重,比如在人工智能领域,深度学习很热,发表的论文作者中几乎70%是华人,但是其他非热门领域,包括不确定性推理、知识表示等几乎没有华人作者。这就是从众扎堆,不愿意去探索“无人区”。当然也不要着急,科学研究本来就是富人干的事情,是富国干的事情,我们还是发展中国家,科学研究起点比较低,暂时落后是难免的,我们会迎头赶上。四、“低潮会发生,但不会像过去那样”经济观察报:如果说深度学习已进天花板,那么人工智能未来的前进方向将会在哪?张钹:最近我们准备提出一个新的概念,就是第三代人工智能的概念,人工智能实际上经历过两代,第一代就是符号推理,第二代就是目前的概率学习(或深度学习),我们认为现在正在进入人工智能的第三代。原因很明显,第一代、第二代都有很大的局限性。经济观察报:你所说的第三代人工智能技术是有明确的实现方向或者特点吗?张钹:我们现在提出的是要建立可解释、鲁棒性(注: 可以理解为稳健性)的人工智能理论和方法,发展安全、可靠和可信的人工智能技术。经济观察报:这样的技术可能要等很久?张钹:是啊,很难预计,我们也很着急。经济观察报:是不是还得回归到数学等理论层面里再去找新的方法?张钹:这个目前我们有两条路,一个是和数学结合,一个是和脑科学结合。你想想如果没有新的数学工具,没有来自于脑科学启发下的新思路,哪来的新理论?另一方面是要把数据驱动和知识驱动结合起来,因为通过数学、脑科学上寻求突破是比较艰难的,前面这件事现在则完全能够做。经济观察报:这个结合是指之前几十年人工智能的经验统合到一块?张钹:是的,至少有一个方向就是要把第一代和第二代结合,利用各自的优势。但是这两个结合很困难,因为他们在不同空间中操作,一个是向量空间,一个是符号空间,也需要有新的数学工具的加入。经济观察报:看人工智能历史,每一代技术之间有很长的间隔期,第三代人工智能技术也会这样吗?张钹:我认为会更长,因为需要攻坚,因为遇到的问题更困难。经济观察报:会不会再过10年、20年,人工智能在学界或者公众心中,又变成一个“隐学”,就像70、80年代那样,大众又不会再经常提起来这个词?张钹:低潮会发生,但不会像过去那样,原因在哪?因为有大数据、互联网和强大的计算资源,这些都会支撑人工智能继续走下去,尽管有的时候还只是表面上的繁荣。 附: 在2018 全球人工智能与机器人峰会上,清华大学人工智能研究院院长张钹院士做题为“走向真正的人工智能”(Towards A Real Artifitial Intelligence)的大会报告。以下为报告全文,供大家学习交流。张钹院士:走向真正的人工智能我今天要讲的中心思想就是:我们现在离真正的人工智能还有一段很长的路。为了讲清这个思想,我必须回答下面三个问题:第一,什么叫做真正的人工智能?我们的目标是什么?第二,为什么我们需要真正的人工智能?第三,我们如何走向真正的人工智能?我现在回答这三个问题。首先我们如何评价目前人工智能取得的成果,我们的评价很简单,针对这 5 件事:第一是深蓝打败人类国际象棋冠军;第二是 IBM 在电视知识竞赛中打败了美国的前两个冠军,这两件事是一种类型,后面的三件事是另外一种类型;即 2015 年微软在 ImageNet 上做图象识别,它的误识率略低于人类。还有百度、讯飞也都宣布在单句的中文语音识别上,它的误识率也略低于人类。还有一个是大家非常熟悉的 AlphaGo 打败了李世石。这 5 件事情都是机器在一定的范围内超过了人类,我们如何来评价这 5 件事?大家一致认为这 5 件事之所以成功,是由于前面三个因素,一是大数据,二是计算能力提高,第三是有非常好的人工智能算法。这三个因素大家都讨论得非常多了,没必要我再来说,我现在要说的最后一个因素是被大家所忽略的,这个因素是说,这所有的成果必须建立在一个合适的应用场景下。这 5 件事虽然领域很不一样,但是它们都满足完全一样的条件,或满足下面的 5 个限制,首先你必须有丰富的数据或者丰富的知识,如果这两件东西没有,或者很少,你不用来谈人工智能,因为你无法实现无米之炊。人工智能唯一的两个资源,一个是数据,一个是知识。还有确定性信息、完全信息、静态的、单任务和有限领域。这 5 个条件里面任何一个条件不满足,现在的人工智能做起来就非常困难了。大家想想这 5 个限制条件下的应用场景是什么样的应用场景?就是照章办事,不需要任何灵活性,这显然不是智能的核心。我们现在分析一下上述 5 个场景。下象棋是完全信息博弈,信息完全和确定,没有问题。其次,它遵循着完全确定的游戏规则演化,我们把这种情况也叫做静态。Watson 机器人也是这样,Watson 是什么样的对话问题呢?它为什么选择知识竞赛呢?我们知道知识竞赛提的问题都没有二义性,都是明确的,它的答案总是唯一性的。所以这样的问答对机器人来讲是非常容易的。它涉及的领域虽然比较宽,但也是有限的,包括大家觉得很玄乎的围棋,也完全符合上面 5 个条件,所以对计算机来说也是很容易的。目前计算机打麻将就不行,因为牌类是不完全信息博弈,所以比棋类要难。总之,我们对目前人工智能取得的成果要有一个正确的评价。目前的人工智能技术在以下领域都可以找到它的应用,它们是交通、服务、教育、娱乐等等,但我要强调是这些领域里面只有满足上述 5 个条件的事情,计算机做起来才会容易,如果不满足这些条件,计算机就做起来就困难了。大家常常关心什么样的工作会被机器所替代,我可以明确告诉大家,满足这 5 个条件的工作,总有一天会被计算机取代,就是那些照章办事,不需要任何灵活性的工作,比如说出纳员、收银员等等。在座的所有工作都不可能被计算机完全代替,但不排斥你的工作中有一部分会被计算机取代,老师、企业家等的工作不可能被计算机完全代替。为什么有这 5 个限制?原因在于我们现在的人工智能是没有理解的人工智能。我们先看符号模型,理性行为的模型,举 Watson 的例子,它是个对话系统,我们现在所有做的对话系统都跟这个差不多,但是 Watson 做得更好些,它里面有知识库,有推理机制。沃森除了专家知识之外,还有大量互联网上大众的知识,还运用了多推理机制。请看,这就是 Watson 系统的体系结构。它里面有哪些知识呢?有很多,包括百科全书、有线新闻、文学作品等等。所有的知识用纸质来表示有 2 亿页,用存储量表示达到了 4TB。它能回答什么问题呢?用它的例子来说明。第一个问题,1974 年 9 月 8 日谁被总统赦免?这对美国人来讲很好回答,同样对计算机来讲也很好回答,你用这几个关键字「1974 年 9 月 8 日」、「被总统赦免」,就能在文献里头查出来是谁,他就是尼克松。也就是说根据问题中的关键字,可以在已有的文献里头直接找到答案,这就是一般的网络检索方法。第二个问题,荧光粉受到电子撞击以后,它的电磁能以什么方式释放出来?我们用「荧光粉」、「电子撞击」、「释放电磁能」等关键词,也可以找到答案:「光或者光子」。这种方法就是平时网络搜索的原理,应该说没有什么智能。回答下面的问题就需要「智能」了,跟智利陆地边界最长的是哪个国家?跟智利有陆地边界的国家可以检索到,它们是阿根廷和玻利维亚,但是谁的边境长?通常查不到。Watson 具备一定的推理能力,它从边界间发生的事件、边界的地理位置等等,经过分析推理以后就可以找出答案,它就是阿根廷。下一个问题也属于这种性质,跟美国没有外交关系的国家中哪个最靠北,跟美国没有外交关系的国家有 4 个,只要检索就行了,但是哪个国家最靠北,没有直接答案,但可以从其它信息中推导出来,比如各个国家所处的纬度、气候寒冷的程度等等分析出来,答案是北朝鲜。智能体现在推理能力上。 但是很不幸,现在的对话系统推理能力都很差。Watson 系统好一些,但也很有限。换句话说,我们现在的对话系统离真正的智能还很远。我们通过索菲亚机器人就可以看出来,索菲亚的对话是面向开放领域,你可以随便提问,问题就暴露出来了。大家在电视上看到索菲亚侃侃而谈,问什么问题都能答得很好,这里面有玄机,如果你的问题是预先提出来的,因为里头有答案,因此回答得非常好,在电视上给大家演示的都是这种情况。如果我们临时提问题,问题就出来了。这是一个中国记者给索菲亚提的 4 个问题,它只答对了一个。「你几岁了」,这个问题很简单,它答不上来,它的回答是「你好,你看起来不错」,答非所问,因为它不理解你所问的问题。只有第二个问题它是有准备的,里面有答案,所以答得很好。「你的老板是谁」,这个肯定它有准备。第三个问题,「你能回答多少问题呢」?它说「请继续」,没听懂!。再问第四个问题,「你希望我问你什么问题呢」?它说「你经常在北京做户外活动吗」?这就告诉我们说,现代的问答系统基本上没有理解,只有少数有少量的理解,像 Watson 这样算是比较好的。为什么会这样?也就是说我们现在的人工智能基本方法有缺陷,我们必须走向具有理解的 AI,这才是真正的人工智能。我这里提出的概念跟强人工智能有什么区别?首先我们说它在这点上是相同的,我们都试图去准确地描述人类的智能行为,希望人工智能跟人类的智能相近,这也是强人工智能的一个目标,但是强人工智能只是从概念上提出来,并没有从方法上提出怎么解决。大家知道强人工智能提出了一个最主要的概念,就是通用人工智能。怎么个通用法?它没有回答。我们现在提出来的有理解的人工智能是可操作的,不只是概念,这是我们跟强人工智能的区别。人机对话的时候,机器为什么不能理解人们提的问题。我们看一个例子就知道了,我们在知识库里把「特朗普是美国总统」这个事实,用「特朗普-总统-美国」这三元组存在计算机里面,如果你提的问题是「谁是美国总统」?机器马上回答出来:「特朗普」。但是你如果问其它有关的问题,如「特朗普是一个人吗」?「特朗普是一个美国人吗」?「美国有没有总统」?它都回答不了。它太傻了,任何一个小学生,你只要告诉他特朗普是美国总统,后面这几个问题他们绝对回答得出来。机器为什么回答不了后面的三个问题呢?就是这个系统太笨了,没有常识,也没有常识推理。既然特朗普是美国的总统,美国当然有总统,但是它连这一点常识的推理能力都没有。所以要解决这个问题,必须在系统中加上常识库、常识推理,没有做到这一步,人机对话系统中机器不可能具有理解能力。但是大家知道,建立常识库是一项「AI 的曼哈顿工程」。大家想想常识库多么不好建,怎么告诉计算机,什么叫吃饭,怎么告诉计算机,什么叫睡觉,什么叫做睡不着觉,什么叫做梦,这些对人工智能来说都非常难,美国在 1984 年就搞了这样一个常识库的工程,做到现在还没完全做出来。可见,要走向真正的人工智能,有理解的人工智能,是一条很漫长的路。这里介绍一点我们现在做的工作,加入常识以后,对话的性能会不会有所改善。 我们的基本做法是建立一个常识图谱,用这个图谱帮助理解提出的「问题」,同时利用常识图谱帮助产生合适的答案。下面就涉及到具体怎么做了,我不详细说了,我就说结果,结果是有了常识以后,性能有了显著的改善,对话的质量提高了。这篇文章已经发表,有兴趣可以去阅读。另外是准符号模型,深度学习、神经网络主要用来模拟感性行为,感性行为是一般很难采用符号模型,因为感性(感觉)没法精确描述。比如「马」,怎么告诉计算机什么叫做马?你说马有四条腿,什么叫做腿?你说细长的叫做腿,什么叫细?什么叫做长?没法告诉机器,因此不能用符号模型。目前用的办法就是我们现在说的神经网络或者准符号模型,也就是用人类同样的办法,学习、训练。我不告诉机器什么叫做马,只是给不同的马的图片给它看,进行训练。训练完以后,然后再用没见过的马的图片给它看,说对了,就是识别正确了,说不对就是识别不正确,如果 90% 是对的,就说明它的识别率是 90%。后来从浅层的神经网络又发展到多层的神经网络,从浅层发展到多层有两个本质性的变化,一个本质性的变化就是输入,深层网络一般不用人工选择的特征,用原始数据就行。所以深度学习的应用门槛降低了,你不要有专业知识,把原始数据输进去就行了。第二个是它的性能提高很多,所以现在深度学习用得很多,原因就在这个地方。通过数据驱动建立的系统能不能算是有智能呢?必须打一个很大的问号,就是说你做出来的人脸识别系统甚至识别率会比人还高,但是我们还不能说它有智能,为什么呢?这种通过数据驱动做出来的系统,它的性能跟人类差别非常大,鲁棒性很差,很容易受干扰,会发生重大的错误,需要大量的训练样本。我们刚才已经说过,给定一个图像库我们可以做到机器的识别率比人还要高,也就是说它可以识别各种各样的物体,但是这样的系统,我如果用这个噪声输给它,我可以让它识别成为知更鸟,我用另外的噪声输给它,可以让它识别成为猎豹。换句话讲,这样的系统只是一个机械的分类器,根本不是感知系统。也就是说它尽管把各种各样动物分得很清楚,但是它不认识这个动物,它尽管可以把猎豹跟知更鸟分开,但是它本质上不认识知更鸟和猎豹,它只到达了感觉的水平,并没有达到感知的水平,它只是「感」,没有上升到「知」。我们的结论是,只依靠深度学习很难到达真正的智能。这是很严峻的结论,因为如果有这样的问题,在决策系统里头是不能用这样的系统,因为它会犯大错。我在很多场合讲过,人类的最大的优点是「小错不断、大错不犯」,机器最大的缺点是「小错不犯,一犯就犯大错」。这在决策系统里头是不允许的,这就显示人跟机器的截然不同,人非常聪明,所以他做什么事都很灵活,这就使得他很容易犯各种各样的小错。但是他很理性,很难发生大错。计算机很笨,但是很认真,小错误绝对不会犯,但是它一犯就是天大的错误。刚才把那个把噪声看成知更鸟,这不是大错吗?你把敌人的大炮看成一匹马,不是大错吗?但是人类不会发生这种错误,人类只会把骡看成驴,但是计算机的识别系统会把驴看成一块石头。原因在哪儿?原因还是 AI 的理解能力问题。我们看这个自动驾驶,过去讲得很多,而且讲得很乐观,我们看看问题在什么地方。我们现在是这样做,我们通过数据驱动的学习方法,学习不同场景下的图象分割,并判别是车辆还是行人、道路等,然后建立三维模型,在三维模型上规划行驶路径。现在用硬件已经可以做到实时,请问大家,这样能不能解决问题?如果路况比较简单,行人、车辆很少,勉强可以用。复杂的路况就用不了。什么原因?非常简单,好多人总结出这个经验,行人或者司机都会有意无意破坏交通规则,包括外国人也一样,中国人更严重一点。这就使得数据驱动方法失效,比如说我们可以用数据驱动方法来了解各种各样行人的行为,我们可以通过大量进行训练,都训练完以后,如果出现新的情况呢?计算机能理解这是人从底下钻过来,很危险吗?所以你不可能把所有情况都训练到。自动驾驶不可能对付突发事件,如果这个突发事件它没见过,它就解决不了。怎么来解决这个问题呢?实际上就是要解决从「Without」到「With」理解的问题。人工智能现在有两种基本方法,一种是用符号模型来模拟理性行为,符号模型可以表达信息的内容,所以它是在一个语义的符号空间里头,但是非常不幸,这个离散的符号表示,数学工具很难用,很多数学工具用不上去,所以它发展很慢。在模拟感性行为的时候,我们用的是特征空间的向量,向量就是数,可以把所有的数学工具都用上,优化的工具、概率统计的工具全部用上。所以数据驱动方法这几年发展非常快,再难的问题,下围棋非常难吧,计算机也可以「算」出来。但是它有一个非常大的缺陷,它是在特征空间里,缺乏语义。我们用数据去训练一个模型,所谓「黑箱学习法」,加上你的数据质量不高,很难学出有用的东西。什么叫概率统计?重复多了就是真理。如果数据质量差,充满了「谎言」。谎言重复多了,就变成真理了。我们现在想出的解决办法是这样的,就是把这两个空间投射到一个空间去,这个空间叫做语义的向量空间。 也就是说我们把符号变成向量,同时把特征空间的向量变成语义空间的向量。怎么做?一是通过 Embedding(嵌入)把符号变成向量,尽量保持语义不变,可惜现在的方法都会引起语义的丢失,我们只能在投射的过程中让语义丢失得少。第二方面做的工作比较少,就是 Raising(提升),把特征空间提升到语义空间去,这主要靠学科交叉,靠跟神经科学的结合。只有这些问题解决以后,我们才能够建立一个统一的理论,因为过去的感知和认知是不同的处理方法,大家说不到一块,如果我们能够投射到同一空间去,我们就可以建立一个统一的理论框架,这是我们的目标。在语义空间处理就可以解决理解问题,但是这项工作是非常艰巨的。介绍一项我们现在做的工作。人工神经网络为什么不能得到语义信息呢?人脑的神经网络为什么可以呢?差别就在这里,我们现在用的人工神经网络太简单了,我们正想办法把脑神经网络的许多结构与功能加进去,我们这里只用了「稀疏发电」这一性质,就可以看出一些效果,人脸、大象或者鸟的轮廓,神经网络可以把它提取出来。还有一个办法就是把数据驱动跟知识驱动结合起来。 刚才讲了,人的智能没法通过单纯的大数据学习把它学出来,那怎么办?很简单,加上知识,让它有推理的能力,做决策的能力,这样就能解决突发事件。我们现在做的工作就是把这些结合起来,这是我们的基本思路,知识也好,数据也好,都投射到同一空间,然后都用同样的数学方法进行处理,这方面我们已经做了不少工作。最后做一个总结,我们从这个坐标看人工智能,横轴代表领域的宽窄,从单领域到多领域、到开放领域。纵轴代表信息的确定性与完全性,从完全到不完全、从确定到不确定。在左下角代表最容易的,就是刚才讲的符合 5 个条件的,现在人工智能在这部分解决得非常好,我们用白色来表示它,AlphaGo 在这里,深蓝在这里,工业机器人在这里。现在我们正在向灰色地区去走,打牌,信息不完全,现在打德州扑克,一人对一人,计算机能战胜人类,多人对弈,计算机还不行,这是灰色地带,我们还可以做,为什么可以做?尽管打牌是不确定的,但是它在概率意义下是确定的,你拿的这副牌的概率,可以算出来,同花的概率是多少,排成顺的概率是多少,既然概率能算出来,最终人类肯定会被计算机打败。Watson 在右边,它的领域比较宽,但是它是确定性的,所以是在灰色的区域。往右上方去就比较难了,自动驾驶、服务机器人、大数据分析,它是一个大框,有的简单,有的困难,就自动驾驶来讲,专用道、行车很少,路况简单等,在白色或者灰色区,如果路况复杂就到了黄色区域,黄色区现在计算机还解决不好。最远的在哪儿呢?右上角,图灵测试。大家对图灵测试有很多误解,其实图灵测试是开领域问答,很难!索菲亚做得怎么样?很糟糕。自然语言理解也在这里,复杂环境下的决策在偏左一点的地方,这也是很难的。所以我们人工智能现在是从左下角往右上角走,我们现在处在出发点附近。有的人想把它用一些名词来区分人工智能的不同发展阶段,有专家问我,你的看法怎么样?我建议不要用新词,用新词往往说不清,很麻烦,有的人说现在是弱人工智能,以后是强人工智能,也有人说现在叫增强智能(Augmented Intelligence)也是 AI……概念太多说不清,还是简单一点,「我们正在通往真正 AI 的路上」,现在走得并不远,在出发点附近,人工智能永远在路上,大家要有思想准备,这就是人工智能的魅力。 大家为什么这么重视人工智能?因为我们永远在路上,这就吸引我们去解决这些问题,这些问题一旦解决了,人类的社会进步、人类的生活就会发生本质上的改变。最后我用中文写最后一段作为总结,可惜我翻译不了。周穆王西巡狩,路遇匠人名偃师。翌日偃师谒见王,偕来一个假人。「趋步俯仰,信人也」。「领其颅,则歌合律;捧其手,则舞应节。千变万化,惟意所适。王以为实人也,与盛姫内御并观之,技将终,倡者瞬其目而招王之左右侍妾。王大怒,要杀这个偃师。偃师大慑,立剖其倡者以示王,皆傅会革、木、胶、漆、白 、黑、丹、青之所为。穆王始悦,诏贰车载之以归。这是 3000 年前我们古人对机器人的想象,看看现在的人工智能做得怎么样呢?索菲亚是我们现在达到的水平,可是她不会唱歌、不会跳舞,只会说英文,周王也听不懂,肯定没有印象。现在我们假设索菲亚「瞬其目而招王之左右侍妾」,向周王的姨太太们送去秋波,王会如何呢?我认为没反应,因为索菲亚是女的,他用不着吃醋。但是我们假设索菲亚「瞬其目而招王」,向大王送去秋波,王会大悦,立即神魂颠倒,坠入爱河?我认为不会,因为索菲亚根本不像人,它最近才刚刚安上手脚,走路都不利索,怎么行呢?所以我的结论是,「索菲亚通不过穆王的测试,当然它更通不过图灵测试」。我们的结论是什么? 人工智能刚刚起步,离真正的 AI 还很遥远, 大家共同努力吧,我们任重道远。
-
段圣宇博士的观点是RISC-V在CPU设计上已成为除了x86和Arm外的第三大指令集架构,其思想和领域专用架构非常相似的,两者实际上在解决同一件事情。随着未来领域专用架构逐渐成为主流,可定制化设计的RISC-V指令集也将随之发挥极大的作用。陈迟晓对以上观点进行了补充,他表示没有RISC-V,就没有软件生态可言。RISC-V是实现AI加速器最经济的办法。同时,RISC-V的开源也促使了更多指令集的开源。相反地,王勇认为“近几年软件定义硬件的概念大热,未来芯片公司出路在哪里?掌握数据的大公司都开始自己做芯片,自己定义指令集,形成闭环了。这是和RISC-V相冲突的。未来开放指令集架构的路不好走。” 赵文科则认为从市场角度来看,还是英伟达的芯片占主导。RISC-V在研究层面可以进一步去推广,但在市场层面还没有看到用例。嘉宾们对RISC-V开源指令集的讨论反映了科研领域与产业市场之间的碰撞。RISC-V及其它指令集的开源无疑在芯片研究领域推动了更多尝试的可能;然而,就芯片产业及市场而言,我们可能需要更加成熟、稳定的系统架构,RISC-V作为强定制化的新兴架构很显然难以满足。技术论坛讨论得出:摩尔定律必将终结,不管是开源还是闭源,软件定义硬件,有应用场景才有价值。AI芯片变革性的改革,需要大家共同添砖加瓦。转发自:https://www.jiqizhixin.com/articles/2021-05-13-10
-
4月24日,华为开发者大会2021(Cloud)浙江大学分会成功举办。作为一年一度的ICT领域开发者盛会,华为开发者大会一直备受业界关注,今年更是在国内36个城市63个分会场以及18个线上技术频道同期启动,打造全场景参会体验。浙江大学分会由浙大与华为联合举办,浙江大学本科生院院长张光新、昇腾产品部门软件副部长,软件架构专家,昇腾高级资深布道师周明耀、浙江大学代表处20级软件学院人工智能专业昇腾算子开发方向硕士马健、华为昇腾CANN生态布道师钟林等重要嘉宾和技术专家参会。当前,我国发展仍然处于重要的战略机遇期,技术创新和产业升级是数字经济实现“智变、质变”的关键要素。产业创新、质量的提升是要求也是衡量标准,全栈智能的创新技术是引擎,而拥有产业视角和创新技术的人才是关键,这其中,对开发者的培养更是重中之重。作为国内科技行业的领军企业,华为历来重视对高新技术人才的培养与引进,已面向开发者实施了沃土、耀星等开发者培养计划,助力开发者们快速成长。会议期间,华为宣布2021年将向“沃土计划”投入2.2亿元,包括全新发布的“沃土云创”计划、以及鲲鹏众智计划和昇腾众智计划等。华为Cloud BU总裁、华为消费者云服务总裁张平安表示,华为云沃土云创计划将投入1亿美元,重点赋能SaaS和ISV伙伴,提供云资源、技术赋能和商业推广支持,覆盖容器/微服务、SaaS化、大数据、AI、视频、智能边缘等6大技术领域。本次,华为走进全国重点综合类大学浙江大学,旨在向师生们分享最前沿的技术应用与研发方向、全球产业发展形势以及华为在人才培育方面的能力储备和最新展望。直连先锋少年论坛,引领浙大学子入驻AI开发产业通过连线华为开发者大会2021主会场,包括浙大在内的各分会场都不约而同聚焦“华为云·先锋少年论坛”这一亮点环节,论坛详细介绍了高校学生如何通过华为开源的技术平台和工具,以极为简单的方式展开专业的实践并取得可观的研究成果。同时,华为面向高校学生发布的“先锋少年普惠计划”更吸引浙大师生的高度关注,这项计划将激励高校学子更早、更快、更好的参与到研发与实践中去。浙江大学本科生院院长张光新在致辞中表示,人工智能等前沿技术正逐步应用于我国的各行各业,为国家发展、产业升级注入了颠覆式的力量,面向未来工业发展,提高智能或智慧水平,需要更多尖端人才与企业的加入与努力。浙江大学本科生院院长张光新致辞华为构建知行合一的AI生态围绕着《智能未来·昇腾万里》这一议题,昇腾产品部门软件副部长,软件架构专家,昇腾高级资深布道师周明耀指出,华为已构筑了业界最强的AI算力平台,使能千行百业智能化转型。在华为的MindX SDK体系中,集成了深度学习平台和智能边缘平台、优选模型库及行业应用SDK。截至2020年10月,华为已上线制造和视觉两大行业SDK。在未来,华为将陆续推出电力、交通、医疗等行业SDK。昇腾产品部门软件副部长、软件架构专家、昇腾高级资深布道师周明耀演讲由浅入深帮助开发者充分了解昇腾浙江大学20级软件学院人工智能专业昇腾算子开发方向硕士马健在题为《智能芯片原理与应用》的演讲中表示,历经多年发展,完全采用ASIC设计方法全定制的人工智能芯片成为了深度学习领域的代表。而华为昇腾AI芯片则是类脑计算芯片的典型代表。在此基础上,华为已经打造出一套开放的AI全栈解决方案,能够应对不断增长的额算子多样性,开发效率提升可达三倍。浙江大学20级软件学院人工智能专业昇腾算子开发方向硕士马健演讲华为昇腾芯片的巨大优势,深深吸引了在场的师生,马健由浅入深的讲解,为有志进入昇腾领域的开发者们打下了坚实的基础。CANN实操训练营带领开发者快速入门华为昇腾CANN生态布道师钟林围绕《昇腾CANN推理应用开发的快速入门》议题,向参会师生介绍了应用开发框架AscendCL、计算图引擎GE、自定义算子开发工具TBE、运行时Runtime与调度TaskSchedule、集合通信算子库HCCL、数字视觉预处理DVPP以及支撑全流程开发工具链MindStudio等应用开发重点技术环节,以及华为昇腾帮助开发者搭建的可快速接入、应用简单的AI开发环境。这一平台的出现,能够有效解决个人开发者在进行AI研发时难以避免的数据、算力等障碍。华为昇腾CANN生态布道师钟林演讲新时代的开发者征途是星辰大海,归途是中国高质量发展的未来。如今,华为正通过昇腾平台与一系列人才激励计划,吸纳拥有产业视角和创新技术的专业人才。可以说,随着产业创新浪潮的兴起,产业开发者的时代已经来临!
-
4月24日,华为开发者大会2021(Cloud)厦门大学分会顺利召开,本次活动由厦门大学与华为联合举办。会上,厦门大学信息学院多位老师、华为昇腾技术专家等来自产学研的各界精英,围绕人工智能发展、华为昇腾技术创新与应用的议题,发表了精彩演讲,并与厦门大学学生进行了深入讨论和实操训练。活动现场厦门大学信息学院副院长洪学敏、厦门大学信息学院博士生导师曾文华、MindSpore高级工程师兼昇腾布道师刘志丹等重要嘉宾莅临本次活动。信息学院副院长洪学敏在开场致辞中提到,人工智能(以下简称AI)已成为推动社会发展的关键引擎,AI技术可以助力各产业实现智能化转型升级,是社会发展和技术创新的产物。未来,联接、AI、云、计算、行业应用等多种先进技术和机会互相催化、有机融合,必将催生大量的技术创新和应用创新,为社会发展开启了充满想象的广阔前景。信息学院副院长 洪学敏老师这其中,人才是AI发展的核心驱动力,对于产业创新而言,质量的提升是要求也是衡量标准,全栈智能的创新技术则是产业创新的引擎,而拥有产业视角和创新技术的人才则是产业创新关键所在。洪学敏认为,人才缺乏或将严重制约AI技术和产业的发展,随着产业创新浪潮的兴起,产业开发者的时代已经来临。作为为国家孕育人才的知名高校,厦大将携手华为昇腾一同大力支持人工智能产业的发展,为国家AI发展蓝图培养更多懂AI、用昇腾的高精尖人才。同学们积极互动,踊跃发言提到AI,就不得不聚焦计算框架,简单来说,AI计算框架好似互联网时代的安卓操作系统,它就像人工智能的大脑和灵魂,所以,开源的MindSpore其重要性自然不言而喻。华为MindSpore高级工程师、昇腾布道师刘志丹在《MindSpore——AI新势力》演讲中指出,当前,AI框架面临很多挑战,比如,模型规模和复杂度越来越高,逐渐从单一的NN向通用AI和科学计算演进,因此对开发者的专业度和创新力提出了更高的要求。而新的AI编程语言、芯片/集群性能的持续提升,同时也给开发者带来了更多的发展机遇。而华为的MindSpore一方面可以提升运行速度,使运行态更高效,另一方面,着重提升了易用性,降低AI开发者的开发门槛,使开发态更友好。本次活动中,华为还启动了昇腾CANN训练营和MindSpore训练营。刘志丹女士作为MindSpore训练营讲师,带领在场师生开展了基于MindSpore框架端边云全流程开发一个AI应用的实验,令在场的年轻开发者们收获颇丰。MindSpore高级布道师 刘志丹女士近年来,我国人工智能在技术与应用方面取得了巨大进展,在国际上具备了一定的竞争力,但基础层整体实力较弱,缺乏人工智能框架、人工智能芯片等根技术的支撑。据厦门大学信息学院博士生导师曾文华介绍,昇腾310芯片采用华为自研的达芬奇架构,集成了丰富的计算单元,在功耗和计算能力等方面突破了传统设计的约束,使智能系统的性能大幅提升,部署成本大幅降低。而昇腾910是一款具有超高算力的AI处理器,除了基于达芬奇架构的AI核外,昇腾910还集成了多个CPU、DVPP和任务调度器,因而具有自我管理能力,可以充分发挥其高算力的优势。信息学院博士生导师 曾文华老师曾文华特别强调,国际巨头尚未形成类脑芯片等前沿领域的技术和知识产权壁垒,因此我国需要充分发挥国内高校和科研院所力量,加强类脑芯片等前沿性领域布局,方能使我国在人工智能芯片领域实现“换道超车”。人才培养既需要基础理论灌溉,也需要对接产业界科技发展趋势与市场需求。只有通过构建多方协同、优势互补、良性发展的人才生态与培养体系,方能激发基础教育与产业的持续活力。千年树木,百年树人,值此厦门大学百年校庆之际,华为开发者大会2021(Cloud)厦门大学分会的成功召开,不仅为厦大学子带来一场精彩绝伦的知识盛宴,而且真正帮助了ICT领域的年轻人才了解产业创新、加入产业创新、加速产业创新,助力他们成为“了不起的开发者”。
-
4月24日-26日,以“每一个开发者都了不起”为主题的华为开发者大会2021(Cloud)于深圳顺利举行。大会采用全球区域联动模式,线上线下同步开启。18个线上技术频道进行直播,覆盖36座城,63场线下分会场。邀请行业大咖、华为科学家、顶级技术专家在各省市知名机构、学府,为每一位潜在的开发者带来一场科技盛宴。4月24日,华为开发者大会2021(Cloud)西北工业大学分会场顺利举行,业界大咖、华为科学家、顶级技术专家、天才少年和众多开发者,集结汇聚,共同探讨和分享云、计算、人工智能等最新ICT技术在行业的深度创新和应用。华为云生态架构师李文强从新兴互联网到传统行业,云服务已延伸到千行百业。随着技术的不断成熟,AI、大数据、物联网、AR/VR等技术逐渐映入公众眼帘。科技应用在日常生活中,使政务、医疗、教育、交通、制造、汽车等行业不断提升生产力。除此以外,新型技术的结合还在不断衍生出各种新型场景。在琳琅满目的技术应用中,什么是它们的根本,华为又是如何在应用层面去实现这些技术的?带着这些问题,华为云生态架构师李文强先生首先带来主题为“云原生2.0赋能生态使能应用”的演讲。他在演讲中,运用问答互动的形式为西北工业大学学子们,生动的讲解了如何依托华为云的云原生产品能力更加高效的开发行业应用。会上,西北工业大学学子们踊跃发言,针对“多元算力、分布式云、云原生、容器、微服务”等专业技术层面的问题各抒己见,在李文强先生的带领下一起交流探讨各种开发者在应用开发过程中会碰到的难题,会议学习氛围浓厚,探讨情况热烈。西北工业大学计算机学院智能计算系统系主任张羽随后,西北工业大学计算机学院智能计算系统系主任张羽上台为大家讲解西北工业大学“智能基座”产教融合协同育人的实践案例和成果。从操作系统到生态转化,从为何选择华为到如何实施产教结合,一边回顾过去受教于华为的新技术,一边推陈出新将新技术融入到大学的课程中去,为西北工业大学的学子们带来能够学以致用、落于实地的技术课程。他以华为openEuler操作系统为例,讲述了他是如何在华为学习openEuler,如何将其引到西北工业大学来,在短暂的时间里将课程知识转化为西北工业大学学子感兴趣的学习内容,多元化的从实践出发,启迪同学们开拓渠道,多元化、多方位成为一个优秀的开发者。发言最后,张羽分享了通过华为“产教融合”计划,西北工业大学与华为共同取得的进步成果。西北工业大学软件学院院长助理魏倩茹在当今社会,深度学习已经无声无息的影响了许多人的决策和喜好,深度学习技术的应用无处不在:在搜索技术,数据处理,机器翻译,自然语言处理,多媒体学习,语音识别,推荐和个性化技术,以及其他诸多领域都得到了大量的运用。西北工业大学软件学院院长助理魏倩茹在会上,以“深度学习的快乐是什么”为主题,为大家讲解在实际的应用环境下,深度学习需要克服的困难,而克服这些困难正是无数开发者的乐趣所在。青软创新科技集团教学副总监赵锦明青软创新科技集团教学副总监赵锦明带来DevCloud的运用实践。他表示,随着企业数字化转型需求的逐渐凸显,智慧城市建设浪潮的汹涌来袭,在对算力要求越来越高的同时也酝酿出了巨大的软件需求市场。在发言中,他从软件开发层面的技巧到求职就业方面的经验对在场的同学们倾囊相授,更是手把手带领同学们一起学习相关软件的使用,对同学们在开发过程中遇到的困惑给予详细解答。本次华为开发者大会2021(Cloud)西北工业大学分会场,华为云为西北工业大学的学子带来了顶尖的科技创新知识,进一步落实“智能基座”产教协同育人实践,“以产业集聚人才,以人才引领产业”,从专业学子开始,为华为云计算生态的建设培养了不起的开发者。
-
论文名称:Learning How to Listen: A Temporal-Frequential Attention Model for Sound Event Detection作者:Yu-Han Shen / Ke-Xin He / Wei-Qiang Zhang发表时间:2018/10/29论文链接:https://paper.yanxishe.com/review/15418?from=leiphonecolumn_paperreview0420推荐原因这篇文章被 ICASSP 2019收录,核心内容是作者作为一个参赛者对DCASE2017中的一个特殊语音事件检测任务的分析,作者的思路是利用attention机制,提取出声音信号中最为重要的特征,并且从单个frame的频谱特性( spectral characteristic)以及样本中多个frames的时间特性的角度设计注意力模型,使用maxpooling将一段声音中的关键特征抽取出来。从比赛结果来看,作为没有使用集成学习的单个模型,作者提出的这种模型结构所得到的分数是比赛中最优的。本文不仅模型设计的很出色,对于数据不均衡、音频噪声等问题的处理也值得一读。转自AI研习社,https://www.leiphone.com/category/academic/QWnCOMr50v4w5a7x.html
-
将hiai_demo工程编译成so动态链接库生成libssd.so文件 一直报错 我自己电脑装有opencv2 501662
-
【华为云AI论文精读会2021】直播活动,2021年5月13日(周四)晚上19:00不见不散,让更多人低门槛使用经典算法!1.直播页面(建议先看海报进群关注直播抽奖福利):https://bbs.huaweicloud.com/live/cloud_live/202105131900.html2.直播实操活动,学以致用马上动手起来吧:https://marketplace.huaweicloud.com/markets/aihub/activity/detail/?id=1d888fe4-7538-4a4a-a9f5-dadda9f5d912华为云AI论文精读会2021邀请计算机视觉、迁移学习、自然语言处理等领域专家学者基于华为云ModelArts解读经典论文算法,让更多人来低门槛使用经典的算法,论文算法实战赛邀请AI开发者基于ModelArts进行经典论文的复现和算法实战学习。华为云AI论文精读会2021 · 论文算法实战赛报名地址:https://competition.huaweicloud.com/information/1000041393/introduction各位可爱的开发者小伙伴:看完白璐斌老师的直播(直播回看链接:待更新),你是不是也跃跃欲试,想自己动手做一下【DynamicRCNN-目标检测算法实战】呢?华为云已经帮大家做好详细的baseline,欢迎大家动手实操:DynamicRCNN-目标检测算法实战baseline:https://marketplace.huaweicloud.com/markets/aihub/article/detail/?content_id=d86d6bdf-08fa-4561-9355-a0a653430146ModelArts开发速成,看这里!!(快速入门、进阶学习资料、开发案例、开发者活动等):https://bbs.huaweicloud.com/forum/thread-90020-1-1.html按照【DynamicRCNN-目标检测算法实战baseline】成功提交实战结果(上传模型到AI GAllery),就可以获取精美的礼品,我们将按照时间顺序(提交完成之后修改会以你修改的时间为完成时间,建议完成提交的请勿修改)。活动规则:认真观看直播,之后按照【DynamicRCNN-目标检测算法实战baseline】提交实战结果在【DynamicRCNN算法】下认真评价(10个字以上)将提交的实战结果(你上传的模型)链接回帖在:https://marketplace.huaweicloud.com/markets/aihub/activity/detail/?id=1d888fe4-7538-4a4a-a9f5-dadda9f5d912,并文字记录上传成功时间,如:2021/05/20上传+链接根据时间的顺序我们评选获奖用户活动奖项:第一名:华为蓝牙耳机Free Lace第二~四名:机械键盘第五~十名:无线鼠标参与奖(限量20个):认真完成实操,我们将为后面的同学准备神秘的华为云周边精美礼品活动时间:2021/05/13 21:00~2021/05/27 24:00对以上内容有任何疑问请在本帖回帖或扫描如下二维码回复“论文”加入交流群!活动规则 1)请务必使用个人账号参与活动(IAM、企业账号等账号参与无效);2) 为保证活动的公平公正,华为云有权对恶意刷活动资源(“恶意”是指为获取资源而异常注册账号等破坏活动公平性的行为),利用资源从事违法违规行为的用户收回抽奖及奖励资格,本次活动一个实名认证账号只能对应一个收件人,如同一账号填写多个不同收件人,不予发放奖励;3)本活动规则由华为云在法律规定范围内进行解释。华为云保留不时更新、修改或删除本活动规则的权利。上述更新、修改或删除于公布时即时生效,用户应当主动查阅本活动规则的最新内容。4) 所有参加本活动的用户,均视为认可并同意遵守《华为云用户协议》,包括以援引方式纳入《华为云用户协议》的《可接受的使用政策》、《法律声明》、《隐私政策声明》、相关服务等级协议(SLA),以及华为云服务网站规定的其他协议和政策(统称为“云服务协议”)的约束。如果您不同意本活动规则和云服务协议的条款,请勿参加本活动。
-
近日,在华为开发者大会(Cloud)的人工智能全场景创新与实践峰会上,中科院上海药物所郑明月研究员发表了题为《新冠疫情分秒必争,AI提升10倍筛药效率》的演讲,重点介绍了当前药物筛选面临的挑战和关键问题、AI药物研发领域的最新进展,并与华为云联合发布AI大规模药物虚拟筛选云服务,展示了“云+ AI”端到端赋能药物筛选的全流程。 上海药物所联合华为云发布AI药物筛选服务 药物研发是一个漫长的过程,传统的药物研发需要投入大量的研发人员,花费十到十五年的时间,以及数十亿美元的研发经费。演讲中,郑明月研究员介绍到,近年来药物研发领域的技术变革,得益于冷冻电镜、DNA编码化合物库、各种组学技术等新技术的发展。药物研发领域产生了海量数据,而AI技术可以更深入地挖掘这些数据,所以IT和BT的融合可能成为新药研发新的范式。譬如,在2020年新冠疫情爆发初期,上海药物所蒋华良院士和上海科技大学、武汉病毒所成立联合攻关团队,在短短十几天的时间解析出全球首个高分辨率Mpro蛋白结构,并在第一时间发布,极大促进了抗病毒药物的研发工作,相关成果发表于Nature和Science杂志。基于华为云医疗智能体EIHealth,郑明月研究员与华为云团队开展了多个AI药物研发合作项目,如从一级序列预测蛋白质结构的iPhord算法1用于药物靶点早期研究,药物重定位AI预测算法2,使用多组学自动建模工具AutoOmics快速发现生物标志物3,用个性化联邦学习整合算法FedAMP4实现药企数据高效安全整合等。 郑明月研究员介绍华为云医疗智能体EIHealth 最后,郑明月研究员发布了联合华为云团队开发的大规模药物虚拟筛选云服务。利用华为云端万核超大算力,可实现十倍的药物筛选效率提升;服务内置原创的iFitDock算法5,可同时实现刚性和柔性对接,真实反映蛋白质的生理状态和功能;服务内提供亿级规模、最大的人工可合成药物库DrugSpaceX药物筛选库6,可追溯反应路径,快速实现药物生成。该服务能够为医药企业、科研单位提供更好的服务,助力新药研发。 中科院药物所联合华为云发布大规模药物虚拟筛选云服务 华为云医疗智能体EIHealth基于华为云AI昇腾集群服务、华为云一站式AI开发平台ModelArts的强大AI能力,集成了医药领域众多算法、工具、AI模型和自动化流水线,目标是打造一个全栈、开放、专业的医疗行业企业级AI研发平台。 更多信息请访问https://www.huaweicloud.com/product/eihealth.html。 参考文献https://www.predictioncenter.org/casp14/doc/CASP14_Abstracts.pdf.Liu, D. et al. AutoGenome: An AutoML Tool for Genomic Research. bioRxiv 842526 (2019) doi:10.1101/842526.Xu, C. et al. AutoOmics: An AutoML Tool for Multi-Omics Research. bioRxiv 2020.04.02.021345 (2020) doi:10.1101/2020.04.02.021345.Huang, Y. et al. Personalized Cross-Silo Federated Learning on Non-IID Data. arXiv:2007.03797 [cs, stat] (2021).Bai, F., Morcos, F., Cheng, R. R., Jiang, H. & Onuchic, J. N. Elucidating the druggable interface of protein−protein interactions using fragment docking and coevolutionary analysis. Proc Natl Acad Sci USA 201615932 (2016) doi:10.1073/pnas.1615932113.Yang, T. et al. DrugSpaceX: a large screenable and synthetically tractable database extending drug space. Nucleic Acids Research 49, D1170–D1178 (2021).
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签