• [其他] 超轻量AI推理引擎MindSpore Lite新版本发布,支撑HMS Core AI领域全面升级
    华为在20年9月份开源了MindSpore Lite 1.0.0版本之后,其接口易用性、算子性能与完备度、第三方模型的广泛支持等方面,得到了众多手机应用开发者的广泛认可。MindSpore Lite为HMS Core AI领域提供了全场景AI推理框架,支撑华为手机的相机、**、钱包、浏览器的二维码扫描、物体识别等AI相关模块,为各类华为穿戴、智慧屏等设备提供基础AI服务。同时,作为HMS Core开放给全球开发者接入的重要能力之一,华为机器学习服务已为全球1000+应用接入,日均调用量超过3亿。目前,在21年新年伊始,华为发布了MindSpore Lite 1.1.0版本,在算子性能优化、模型小型化、加速库自动裁剪工具、端侧模型训练、语音类模型支持、Java接口开放、模型可视化等方面进行了全面升级,升级后的版本更轻、更快、更易用,新特性也会体现到HMS Core的新版本中。1. 算子库优化与扩展推理性能优化是本次版本的重头戏,除了持续的ARM CPU(FP16/FP32/INT8)性能优化,ARM GPU和X86_64的优化也是本次的亮点。GPU方面我们除了传统的算子优化,还加入了在线融合、AutoTuning等技术,使得ARM GPU推理性能大幅提升;同时为了更好的支持PC侧推理,在X86_64算子方面我们做了大量汇编层面的优化;经过大量模型的实测,MindSpore Lite 1.1.0版本在推理性能方面在业界各类框架中极具竞争力。1.1 ARM CPU优化我们从引入减少计算量的更优算法,到尽可能减少硬件访存从而提高指令吞吐量,MindSpore Lite 的CPU算子性能大幅提升。我们使用TF Hub官网上100+端侧预置模型进行了推理时延对比测试,测试结果显示在Mate30/P30等高端机型上MindSpore Lite已全面超越官网数据,在P20等中低端机型上推理性能优于官网数据的占比也达到97%。1.1.1 FP16推理性能MindSpore Lite全面支持ARMv8.2的FP16推理,推理时延基本达到了FP32类型推理的二分之一,在推理时延大幅降低的同时精度满足业务要求;我们的FP16推理方案已经在华为HMS MLKit和华为手机预置的各类AI服务中普遍应用。由于TF Lite不支持FP16推理,所以在FP16推理性能对比测试环节中我们只选择了MNN最新的1.1版本,从测试结果看MindSpore Lite在FP16推理时延更低,性能表现更好。来源:华为开发者论坛
  • [其他] 人工智能趋势:语音识别发展前景广阔
    当今,用“炙手可热”来形容AI人工智能再恰当不过,其也令全球科技界趋之若鹜,诸如谷歌、微软、苹果、IBM、Facebook、英特尔、中国的BAT、华为等都将人工智能视为下一个技术引爆点,纷纷砸入巨额投资展开研发与竞争。尤其在近几年来,深度学习+大数据+并行计算共同推动了人工智能技术实现跨越式发展。“人工智能+”应用已开始落地开花,从智能安防,到智能客服,再到智慧教育和智慧医疗等等。基于人工智能技术的各种产品在各个领域代替人类从事简单重复的体力或脑力劳动,大大提升了生产效率和生活质量,也促进了各个行业的发展和变革。人工智能产业链的主要包含三个核心环节——基础技术、人工智能技术和人工智能应用。其中,基础技术主要包括数据平台、数据存储以及数据挖掘等,人工智能技术包括语音识别、自然语言处理、图像识别和生物识别等,人工智能应用有工业4.0、无人驾驶汽车、智能家居、智能金融、智慧医疗、智能营销、智能教育以及智能农业等。人工智能趋势分析,语音识别领域突飞猛进发展前景广阔人工智能产业链结构科技企业对开源技术和深度学习等方面的推动,人工智能技术不断突破。交通、医疗、教育、制造业等场景的应用需求和切合确定场景的商业模式出现推动人工智能快速发展。随着人工智能在我国移动互联网、智能家居等领域的发展,我国人工智能产业将持续高速成长。前瞻产业研究院预计到2022年,国内中国人工智能行业市场规模将达到680亿元。前瞻产业研究院也对中国人工智能行业的发展趋势进行了深入分析:1、新一轮的开源化将成为人才争夺主战场两年来,以谷歌为代表的巨头公司纷纷开始开源化自身核心产品。不仅有机器学习软件平台,还有相关硬件平台和完整软件源代码。开放源代码可以吸引外部人才参与项目协作,并改进相关技术。2、语音识别领域将快速实现商业化部署通过利用机器学习技术进行自然语言的的深度理解,一直是工业和学术界关注的焦点。在人工智能的各项领域中,自然语言处理是最为成熟的技术,由此引来各大企业纷纷进军布局。在未来3年内,成熟化的语音产品将通过云平台和智能硬件平台快速实现商业化部署,前景十分广阔。这一领域,轻松呼已率先入局,其基于AI智能语音技术所研发并推向市场的“轻松呼智能电话机器人”已得到了广泛应用,覆盖了包括网络电商、金融、房地产、广告、汽车、保险、教育等十几个行业领域,目前全国累积用户数达800+,取得了良好的市场反响。可以说,轻松呼利用自身在智能语音技术上的优势,有力地推动了人工智能与传统电销的深度融合发展。人工智能趋势分析,语音识别领域突飞猛进发展前景广阔3、人工智能产业将与智慧城市建设协同发展智慧城市的发展将在安防、交通监控、医疗、智能社区等多个领域全面刺激人工智能产业发展。未来,各行业的应用需求以及消费者升级发展的需要将有效激活人工智能产品的活跃度,促进人工智能技术和产业发展。4、中国人工智能应用将在服务机器人领域迎来突破2015年已经有大量企业在服务机器人领域展开相关布局。从中国人工智能市场结构上看,服务机器人市场规模达到60亿元,占比29.4%,服务机器人基于日常生活中的广泛需求,有着广阔的市场空间。人工智能趋势分析,语音识别领域突飞猛进发展前景广阔可以看到,未来中国人工智能行业整体的发展趋势一片大好,而在前不久召开的十三届全国政协第一次双周协商座谈会上对于人工智能有如下的盘点和建议——我国人工智能的成绩单亮眼:论文专利数量跻身世界前列,部分技术已经世界领先。而且,智能产品和应用大量涌现,一批领军企业快速成长……不过,在委员和专家看来,仍要重视我国人工智能发展中存在的问题与不足,尽快抢占科技制高点,才能在这场“马拉松”中立于不败之地。转载自csdn  编程大乐趣
  • AI音响有没有货了
    昨天上新的,今天来还就售罄了,真是太快了
  • [其他] 分享算法—— 可变形核,神经架构搜索
     可变形核论文名称:Deformable Kernels: Adapting Effiective receptive fields for Object Deformation作者:Hang Gao, Xizhou Zhu, Steve Lin, Jifeng Dai发表时间:2020/2/12论文链接:https://arxiv.org/abs/1910.02940v2推荐原因在可变形卷积思想之后,提出可变形核,来适应对象形变的感受野。其核心为重新采样原始内核空间来回复对象的形变能力。 神经体系结构搜索的全面调查:挑战与解决方案论文名称:A Comprehensive Survey of Neural Architecture Search: Challenges and Solutions作者:Pengzhen Ren,Yun Xiao,Xiaojun Chang,Po-Yao Huang,Zhihui Li,Xiaojiang Chen,Xin Wang发表时间:2020/6/1论文链接:https://arxiv.org/abs/2006.02903推荐原因2020神经架构搜索最新综述神经架构搜索Neural Architecture Search (NAS)是深度学习研究热点。NAS旨在通过使用有限的计算资源,以尽可能少的人工干预的自动化方式设计具有最佳性能的网络架构。西北大学等学者发布了关于神经架构搜索的综述论文,对NAS进行了全面、系统的综述。转自,AI研习社,https://www.leiphone.com/category/academic/Is2BSkPUrXDA4Qt9.html
  • [技术干货] 【用户指南】好望云服务如何开通购买服务?
    *添加设备后,默认没有开通云服务,您可以按需选择并开通云服务。提供的云服务如下:接入调阅服务:提供视频接入、调阅和管理功能,开通后可以查看实况和录像。录像存储服务:提供云端视频存储功能,开通后设置录像计划进行录像存储,关闭服务后会删除所有录像文件。(动检存储:当设备发生告警事件后,会保存告警时间段的设备录像到华为云存储    连续存储:在设备在线的状态下,会保存全天连续的设备录像到华为云存储 *当前只开通连续存储)行业数据流服务:提供云端存储设备智能告警数据功能,开通后可以在云端保存设备智能告警数据,如智能告警图片、智能分析元数据等。(当前仅支持按需订阅)操作步骤:1、进入并登陆IVM管理后台https://holosens.huaweicloud.com/#/device2、单击“设备管理”,勾选需要开通服务的设备,单击“配置服务”。说明:a.免费试用服务不能超过20路接入b.当设备类型为NVR或IVS时请确认里面的通道不超过20个,如果超过请勾选需要开通的设备且不能超出20,否则会导致开通服务失败。3、选择需要开通的服务类型,单击“下一步”。4、确认服务类型、所需购买服务等无误后,单击“提交”。5、显示配置成功界面,单击“完成”。为设备分配用户(管理员)* 添加设备后,可根据需要为设备分配用户,分配后该用户拥有设备的操作权限。操作步骤:  1、单击“设备管理”,勾选需要分配的设备,单击“分配用户”。2、选择需要分配设备的用户,单击“确定”,用户分配成功。高危操作清单危险操作操作影响关闭服务关闭服务后会立即清理该通道下正在使用或者已经存储的相关数据资源,详细说明如下:管理服务:该通道所有媒体相关服务,如实况播放,录像回放等。收录服务:停止该通道云端录像计划,删除已存储的云端录像文件。行业数据流服务:停止该通道行业数据流数据存储及转发能力,删除已存储的行业数据流数据。删除设备删除设备后,会自动关闭该设备下所有通道开通的服务,同时将该设备从设备列表(含持有人及被分享人)中删除。解散企业解散企业后会将该企业下所有设备进行删除。用户注销用户注销后,会将该用户下所有用户数据进行清除,包含个人信息,个人所拥有设备信息,个人与企业权限关系等。若用户属于某企业,用户注销只会删除用户与企业的权限关系,不影响企业下设备的正常使用。解绑设备用户可以选择登录设备页面后进行设备与云服务解绑。解绑后,该设备在云服务开通的服务会关闭,用户绑定关系会进行删除,该设备可以重新进行添加绑定。删除aksk企业开发者删除aksk后,原有企业凭证申请的所有AccessToken均会失效。申请AccessToken单个aksk只维护最新两个AccessToken的有效性,申请新的AccessToken会自动覆盖较早AccessToken有效性。北向接口域名https://api-ivm.myhuaweicloud.com
  • [技术干货] 【用户指南】好望云服务如何添加设备?
    *已完成账号注册,并创建企业 一、添加设备组操作步骤:1、进入并登陆IVM管理后台https://holosens.huaweicloud.com/#/device2、选择“设备管理”,单击“添加设备组”。3、输入设备组名称,单击“确定”。说明:a.选择一个设备组再单击“添加设备组”,即可创建其子级设备组。b.单击设备组名称后的“编辑”、“删除”,可以修改设备组名称和删除当前设备组。二、添加设备单个添加设备I.通过GB28181协议接入①、配置平台侧参数1、单击“设备管理”,选择需要添加设备的设备组,单击“添加设备”。2、选择手动添加设备,“国标协议”(GB28181)接入, 输入对应设备参数,点击确定。说明:用户名、密码为登陆设备的用户名、密码。设备ID参照“GB28181国际标准互联编码”规则,可按右侧“问号”提示填写。3、添加设备后,会弹出“录入参数到设备”界面,手动记录该信息,配置设备侧参数时需要使用说明:单击“关闭”,关闭后可在设备详情页面单击“SIP信息”查看。②、配置设备侧参数* 通过GB28181协议添加设备之后,需要在设备侧配置对接参数,以华为摄像机为例,介绍参数配置过程。1、通过Web登录摄像机的Portal界面,选择“高级配置 > 网络 > 平台对接参数”。2、选择“第二协议参数 > T28181” ,勾选“GB/T 28181”,启用GB/T 28181协议。3、配置GB/T 28181参数,参数说明如下表。(“镜头ID”,海康、大华名称为“通道编号”)参数如何配置媒体流保活开关启用“媒体流保活开关”,打勾表示已启用。开启媒体流保活功能后,如果在一定时间内摄像机没有接收到平台侧发送的媒体保活包,则摄像机停止发送媒体流。当前平台不支持该保活功能时,建议“不启用”。保活次数摄像机和媒体流保活连接的次数,范围为2~24内的整数,单次保活时间为5s。例如,当保活次数为2时,媒体流保活时间则为2*5s即10s时间,10s内即使摄像机没有收到媒体保活包也不会停止发送媒体流,超过10s没收到保活包即停止发送媒体流。名称注册到平台时所采用的登录名,可设置数字或其他字符,包括汉字。平台IP摄像机接入云服务的网关地址,为3中记录的“SIP服务器IP地址”。端口号3中记录的“SIP服务器端口号”。设备ID3中记录的“设备ID”。服务器编码3中记录的“SIP服务器国际ID”。@3中记录的“SIP Server域ID”。密码设备在平台中的注册密码。注册有效期设备注册到平台的有效期限。默认为“3600”,设备3600s内没有注册成功,表示本次注册失败,建议采用默认值。心跳周期设备发送心跳信息的时间间隔。系统默认心跳周期为60s,建议设置为20s。最大超时次数心跳信息连续超时达到“最大超时次数”,则认为摄像机无法与平台建立连接。系统默认最大超时次数为3次,建议采用默认值。码流索引码流索引的类型,可以选择主码流或子码流,默认为主码流,建议采用默认值。镜头ID设备镜头的ID号,华为云好望云服务设备的通道ID取值于镜头ID。请按照GB28181协议规定填写,由20位数字组成,中间第11~13位填写131。告警输入ID设备告警输入的ID。平台根据设备ID给设备分配的告警输入ID。音频输出ID设备音频输出的ID。平台根据设备ID给设备分配的音频输出ID。4、单击“保存”。II、通过好望协议接入1、单击“设备管理”,勾选需要添加设备的设备组,单击“添加设备”。2、选择手动添加设备,好望协议接入,根据参数说明填写基本信息。说明:在好望设备上扫描二维码获取“设备ID”、“验证码”。批量添加设备当有大批量支持通过好望协议或国标协议接入的设备需要接入到IVS平台时,可以通过批量添加设备的方式进行快速添加。①、配置平台侧参数1、单击“设备管理”,选择需要添加设备的设备组,单击“添加设备”。2、选择批量添加设备,按界面提示选择接入协议并下载对应模板。3、将设备信息按格式填入模板并上传文件,单击“确定”,上传成功。接入协议设备参数说明好望协议设备编号在好望设备上扫码获取设备编号,由大小写字母、数字组成,长度为8~32个字符。设备校验码在好望设备上扫码获取设备校验码。国标协议设备互联编码由数字组成,长度为20个字符长度,建议参照GB28181国标编码规则填写。设备用户名登录设备的用户名。设备密码登录设备的密码。
  • [分享交流] 叫板英特尔,英伟达发布首个 CPU,集齐“三芯”!
    作者 | 马超出品 | CSDN(ID:CSDNnews) 昨日,在英伟达的新品发布会大会上,英伟达 CEO 黄仁勋如期拿出了首款 CPU 芯片 Grace,剑指 AI 云计算,其实笔者在之前的文章就曾指出,英伟达收购 ARM 预示着 N 厂必然进军 CPU 领域,在云计算市场有所作为。而本次发布会上除了 Grace 之外,英伟达还发布了 Transformers 框架——NVIDIA Megatron;药物研发加速库 Clara Discovery 模型等产品,也侧面印证了笔者的观点,英伟达正在软硬齐发为进军云数据中心领域铺平道路。英伟达 CEO 黄仁勋,来源:NVIDIA GTC无独有偶,上周英特尔也发布了 10nm 的至强三代处理器,在新任 CEO 帕特.基辛格的带领下,英特尔也要加强自身在云计算领域的优势,不过在这场英特尔对阵英伟达的“双英”大战中,双方的策略明显不同,英特尔注重于全面,除了 AI 以外还在安全、虚拟化及调度能力以及存储性能等等方面全线开花;但是英伟达则在专注于 AI 云及低功耗超级计算机几个重要领域进行定点突破。虽然目前还无法预测“双英”大战的结局,不过 AI 云计算的发展空间还是有目共睹的,从最新的 AI 发展趋势来看,最新的人工智能模型对于算力的要求往往都是非常高,比如可以自动写代码的 GPT-3 其参数规模突破了 1000 亿,而 GPT-3 的变种,可以将文字描述转化为图像的跨模态生成模型 DALL.E,其模型参数数量更是达到了惊人的 1500 亿,不少 AI 方面的科学家指出,越大的模型往往表现更好,扩大规模可能仍然是实现更好性能的方式。用黄仁勋在发布会上的话来说“三年间大规模预训练模型的参数量增加了 3000 倍。我们估计在 2023 年会出现 100 万亿参数的模型。”目前资金实力一般的创业公司将越来越难以通过自身的算力去训练最新、最好的 AI 模型。从另一个角度讲,AI 模型越来越大的趋势也推进了 AI 与云的结合,只有充分发挥云计算降本增效的特性,才能降低门槛,促进 AI 行业创新性发展。也只有做好 AI 云,才能让 AI 充分发挥威力,体现价值。我们看到本次英伟达围绕着 AI 云计算,在 CPU、智能驾驶及配套软件方面同都有不少的进展,接下来,本文将为大家逐一进行解读。Grace 打破内存与显存之间的墙由于 ARM 使用 RISC 风格的精简指令集, ARM 核心在指令预测等方面同天然比 X86 更有优势,能耗也比 X86 更低。当然这些都是 ARM 相对于 X86 的传统优势,本次 Grace 最大的创新点在于把 CPU 与 GPU 之间的通信速度提升了近 10 倍。根据黄仁勋的说法,“这是一万名工程人员历经几年的研发成果,旨在满足当前世界最先进应用程序的计算需求,其具备的计算性能和吞吐速率是以往任何架构所无法比拟的。”CPU 和 GPU 的通信速度的重要性,可以用苹果 M1 的例子来加以说明,我们知道苹果 M1 显卡与内存加在一起只有 16 个 G,对比上一代 Mac PRO 内存128G,光是显存都有 16G,不过搭载 M1 的入门版 Mac 在进行图像处理等需要 CPU 与 GPU 进行协同的运算任务时,至少比上一代顶配的 Mac 性能高出近一倍。其中的秘决就是将内存与显卡进行统一管理,从而大大提高了 CPU 与 GPU 的通信效率。 当然苹果将内存与显存混用的做法,在云计算这种多租户共存的场景下并不太适用,但是现有 GPU 与 CPU 共享内存的做法效率确实不佳,在共享内存的方案下,CPU 和 GPU 必须轮流访问内存,这就意味着他们要争夺数据总线的使用权。因此 GPU 和 CPU 不得不轮流使用一个狭窄的通信管道来做数据交换。而英伟达的 Grace 在这方面做出了突破性的进展。类似于 DMA 控制器在磁盘与内存之间搭建了一条快速通道一样,Grace 体系中 GPU 核心与 CPU 核心之间的通信不需要 CPU 的调度,也不需要占用数据总线的带宽,之前 CPU 必须将数据从其内存的区域复制到 GPU 使用的区域,而在 Grace 的加持下,CPU 只需要告诉GPU在内存的某位置有 30MB 的向量数据,然后就可以去做其它事了,GPU 则可以通过 Grace 复制通道迅速开始计算任务。可以说 Grace 的快速能道基本还在笔者的射程范围之内,而英伟达马上要推出的 L5 级别自动驾驶芯片,就只能令人仰望了。————————————————版权声明:本文为CSDN博主「CSDN资讯」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。原文链接:https://blog.csdn.net/csdnnews/article/details/115713575
  • [其他] 多模态学习,带来AI全新应用场景
    文丨脑极体新的AI技术发展趋势有哪些?多模态学习技术一定是其中之一。最近,刚刚宣布“自立门户”的微软AI明星产品小冰改名为“红棉小冰”。殊不知2014年诞生的这一个AI对话机器人已经在5年时间里更新到了第七代了,据称能力上正在“无限接近人类”。现在的小冰,不仅是那个会作诗的机器人了,她还会唱歌作曲、阅读朗诵、撰写新闻,甚至去年还办了一个虚拟7位画家的个人画展。多模态识别技术正是小冰越来越像人一样沟通表达的关键之一。多模态技术同样也在视频网站、电商物流、自动驾驶等领域得到广泛。像爱奇艺推出的“只看TA”功能,优酷视频正在使用的视频帧、人脸帧的图向量检索,都离不开多模态识别技术的支持。而像京东淘宝等电商平台的“拍照购”、“拍立淘”的搜索技术背后也都是在计算机视觉技术下,使用了图像、文本和高层语义属性等多模态下的信息融合,才实现高精度的“以图搜图”功能。百度提出的“多模态深度语义理解”,则让AI实现从“看清听清”到“看懂听懂”的进化。可以说,人工智能在通向人的智能的道路上,多模态学习就是一个绕不开的发展方向。因为人类本身就是一个多模态学习的典范。现在,多模态学习技术正在带来众多全新的应用场景。关注AI技术和应用发展趋势的你,想必也想了解下多模态学习的来龙去脉,以及在这些新应用场景中的技术现状与问题。而这些问题也是本文重点探讨的内容。“多模态学习”,正式认识下模态(Modality),虽然不是我们的日常用语,但却十分容易理解。我们每一天都会接触到各种不同来源和形式的信息。正如我们有视觉、听觉、嗅觉和触觉等,那么我们接触的信息就有视频、图像、文字、语音、味道、软硬度等,这每一种信息的形式就可以称作一种模态。模态的范围要比我们的感知能力更宽泛。除了视觉、听觉获得的模态信息,我们也可以利用传感器获得诸如雷达、红外线等不同感应数据的模态信息。此外,模态的类型定义也可以非常宽泛,比如我们可以把两种不同的语言当做是两种模态,把不同结构下采集的数据,也可以当做两种模态。比如,仅仅一个视频内容数据,就是一个高维度、多模态的数据信息,其中包含了标题、简介、评论、字幕等文本信息,也有视频帧的图像、声音,以及连贯动作视频片段的视觉、声音信息。多模态学习,从上世纪70年代就已经起步,几经发展,现在正进入到机器学习特别是深度学习的阶段。通常称为多模态机器学习(Multi-Modal Machine Learning ,MMML),试图通过机器学习的方法实现对多源模态信息进行分析和理解。当前主要热门的研究方向自然是对图像、视频、音频、语义之间的多模态学习。当前,多模态学习主要研究方向有多模态表示学习、模态间映射,多模态对齐、融合、协同学习等。多模态表示学习,研究如何将多个模态数据所蕴含的语义信息数值化为实值向量,通俗理解就是对多个模态的数据进行相关性编码,让不同模态建立起映射关系。按多模态表示共享的方式,主要分为公共表示学习和特异性表示学习,后者由于是分别学习不同模态的特征,可以应用于诸如零次学习、模态间映射、跨模态检索等任务中。模态间映射,研究如何将某一特定模态数据中的信息映射至另一模态。例如,给定一幅图像,通过机器学习得到这副图像的描述,或者给定一段文字,生成一幅匹配的图像。类似于我们学习中遇到的“看图说话”和“以题作画”的问题。模态间映射早已可以应用于语音合成、图像视频描述以及跨模态检索等应用中。此外,多模态对齐,主要研究如何识别不同模态之间的部件、元素的对应关系,以促进学习到的多模态表示更加精确,例如将电影画面、口型、语音、字幕的自动对齐;多模态融合,主要致力于不同模态间的模型与特征的整合,以获得更全面的特征,提高模型鲁棒性,并且保证模型在某些模态缺失时仍能有效工作;而多模态协同学习,主要考虑如何从信息丰富模态上学习的知识迁移到信息匮乏的模态,使各个模态的学习互相辅助。典型的方法包括多模态的零样本学习、领域自适应等。近两年,随着机器学习的模型的飞速进展,多模态学习中出现的映射质量问题、对齐的匹配度量以及融合噪声干扰等问题,都在实现很好的优化解决,为多模态的落地应用做好了准备。多模态学习,正在丰富哪些应用场景?通过以上解释可以知道,其实很多我们熟知的AI技术都可以归类到模态学习当中。比如,像机器翻译,通过输入的一种A语言即时翻译为另一种B语言,其实质就是一种模态之间的映射转化。类似的还有唇读识别和语音翻译,也就是分别将唇部视觉和语音信息转换为文本信息。在图像识别中,会应用到一种“图片语义分割”,即尝试给图片的不同像素区域对应到每一种类型标签,实现视觉和词汇的对应。这就是多模态对齐在空间维度的应用。当然,基于多模态数据的丰富表示以及映射、对齐和融合的应用,可以将目前AI的三种主要感知模态——语音交互、机器视觉、传感器智能进行多模态组合,产生全新的应用场景。在语音交互上,“多模态深度语义理解”技术正在为其带来更深度的应用场景。对于前几年的智能音箱,我们都有这样的感触,那就是语音交互只能完成简单的搜索,一旦多聊几句,就发现机器人要么只有万能的“套路”公式,要么就“答非所问”。这一问题的根源就是人工智能无法更好的理解对话者的深层涵义,也没有灵活的应答机制和内容。此外,也更难理解人的语气、情绪这类情感模态信息,当然因为没有视觉感知,更不可能去理解人的表情、动作、姿态等信息。多模态深度语义理解可以极大改善这类语音交互的语义理解难题。比如,其中一个应用场景是智能汽车的数字座舱,正在从原本单一的车载语音识别,实现融合视觉、语音、车内外场景图像的多模态识别的转变。在实际的语音交互中,车载智能助手不仅可以实现语音的识别,也可以通过摄像头识别人的表情神态、动作,比如识别疲劳驾驶、分心、发热等状况,以进行即时的语音提醒。语音交互也可以更加以人类的自然语言进行交互,而不必要使用生硬的指令型语言。而在以机器视觉为主的应用中,多模态学习技术也带来新的应用可能。以电商平台购物为例,用户的一大痛点就是看到一些“心水”的好物或者同款,但不知道名字,通过拍照识别和检索,将为用户提供最便捷的推荐服务。另外,在电商的智能客服,用户也希望能够通过简单对话或者发送图片、视频的方式处理订单问题。在这些场景中,跨模态检索和映射转化技术就得到了深度应用。比如,在商品推荐和信息流广告中,就需要结合海量商品图像与对应的商品语义属性,学习图像语义特征表达,以提高符合用户需求的商品推荐度。而与智能客服进行的多轮对话中,融入视觉到语言的跨模态转换技术,可以自动实现对用户上传的图片或视频进行自动应答。在传感器智能上,多模态识别技术可以应用到大量的物联网设备场景中。通过在大量的智能设备中增加视觉、温度、湿度和光线传感器,来实现多模态的智能交互。比如在智能空调中,加入语音交互、视觉识别指令,结合传感器判断屋内温度和湿度,可以根据屋内人数、位置等因素来实现更精准的控温方案。而现在更多智能大屏应用,也在将机器视觉、语音交互和一些智能传感器引入到智能硬件中,实现对屋内光线的调节、音量、观看者状态(离得是否太近,是否有未成年人)等因素的智能识别和调节。而近期,华为推出的一款针对办公场景的智慧屏幕,可以根据视频会议中的发言对象进行视角跟踪,将摄像头跟踪、焦点人物识别和身份识别结合起来。正如开始列举的,多模态学习技术更主要的应用还是集中在语音和视觉的多模态识别上。在爱奇艺的“只看TA”的功能中,除了人脸识别要区分是真人还是卡通人物,还要对**信息,甚至还有微表情、身体语言等识别,多模态技术成为视频场景中不可缺少的技术支撑。而在未来的聊天机器人或者智能助手上,多模态学习将帮助智能机器人综合处理图像、声音和文字信息,同时可以进行综合模态,甚至包括情感等特征信息的输出与表达。技术尚在中途,未来仍需努力不过,我们仍然需要指出的是,尽管多模态学习技术已经有诸多的应用场景,但其技术实现仍然有诸多不足,也会有一些场景仍然是“伪多模态”的技术应用状态,导致一些场景体验仍然不能“尽如人意”。现在的多模态技术的结合多为“松耦合”状态,各个模态可以一起工作,但耦合之下还不够十分紧密。也就是现在更多实现的是两种模态信息的转化和融合。而一旦多种模态数据增加,耦合也会增多,冲突也就会增加,产生各种噪声。比如,对于聊天机器人,如何在回复的声音、文本中增加情感特征,就是一件非常困难的事情。因此,我们遇到的一批智能机器人都很容易是冷冰冰的客服腔调,以致于我们确实不好识别对方是真人还是机器人多模态技术主要还是采用已标注的多模态数据来生成深度学习模型,这导致这些模型在真实场景下的泛化能力受到很大限制。现有的多模态技术更多要与知识图谱结合,融入专家、常识等知识,利用数据和知识的联合来让多模态技术建立其“智能”的作用。此外,正如一位专家指出的,当前的多模态技术还是属于狭隘的单任务学习,整个训练和测试的过程都是在封闭和静态的环境下进行,这就和真实世界中开放动态的应用场景存在一定的差异性。这距离人类在真实场景中的泛化的多模态感知相距甚远。未来为提高多模态的泛化感知能力,可以利用元学习的方式来让模型自己学会如何认知新的多模态知识,实现适用于开放动态场景并具备终生学习能力的多模态模型。而在推动AI的推理能力上,在多模态模型训练的过程中,可以引入自监督、自学习的推理性任务,“强迫”多模态模型进行推理和思考,这也能在一定程度上让机器去慢慢学会推理。通过多模态学习技术实现AI的推理,看起来难度极大,这一假设还需要未来更多实验和验证。总的来说,多模态技术已经在试图“复制”人类在日常生活中的各类场景,尽可能把人类的感知信息进行分析处理和整合,并实现更全面综合的理解,也能结合“数据”和“知识”给出相应的回应。但这距离真正的人类级别的智能还有质的差别。当然,人们对多模态技术的发展前景仍然看好,相比于只侧重单一模态的技术,多模态技术所构建的智能应用场景将更多样化,也与我们普通人期待的智能生活更近一些。更何况,多模态技术仍处在“襁褓状态”,我们应该留给它足够长的成长时间,等待美好发生。【转载 自 钛媒体app
  • [热门活动] 华为大咖分享:AI在软件测试领域应用探索(后附PPT下载)
    &&&sssdfsdf 华为大咖分享:AI在软件测试领域应用探索(后附PPT下载)  华为大咖分享:AI在软件测试领域应用探索(后附PPT下载) 
  • [技术干货] 【用户指南】好望云服务如何创建企业?
    *首次使用行业视频云服务时,需要先创建企业或等待管理员邀请加入企业,然后才能使用IVM管理后台功能 操作步骤:1、进入华为好望云服务官网https://www.huaweicloud.com/product/ivm.html2、单击“登录管理后台”进入IVM登录界面3、单击“注册账号”按要求完成注册后,返回登录界面,使用刚注册的账号登录IVM管理后台(如已注册请直接登录)说明:此处注册的账号与创建华为云租户中注册的账号(华为云实名认证)不同。(邀测时)点击右上角的“”查看申请公测的结果,并点击“同意”4、单击提示界面中的添加企业,或点击右上角“运营体验>添加企业”5、按“添加企业”界面信息提醒,完成企业信息填写。说明:如需修改企业信息,选择“企业管理 > 企业信息”,修改企业信息。Q、如何获取访问密钥、AK、SK值?1、点击右上角“控制台”(或“创建企业”信息填写界面,“企业密钥”处点击“访问秘钥”),进入华为云控制台2、将鼠标移动到右上角账号处,选择“我的凭证> 访问密钥”,单击“新增访问密钥”,输入手机短信验证码,单击“确定”,密钥文件会自动下载,请妥善保存。说明:a.如果访问密钥泄露,会带来数据泄露风险,且每个访问密钥仅能下载一次,为了账号安全性,建议定期更换并妥善保存访问密钥。b.访问密钥最多添加两个,如果需要更换AK、SK,请先删除已创建的访问密钥重新添加。c.新增密匙后,文档自动弹框,提示下载文档。如下载提示错误,请新增密匙尝试再操作Q、如何获取“项目”、“项目ID”、“账号名”、“账号ID”等信息?1、在华为云控制台,选择“我的凭证 > API凭证”,或在“创建企业”界面,“企业凭证”处,点击“API凭证”,获取“账号名”、“账号ID”、“项目”、“项目ID”。(其中“项目”、“项目ID”为所属区域“华北-北京四”对应的参数值)说明:如果项目列表中没有“华北-北京四”,请单击左上角的“控制台”并选择“北京四”,重新进入API凭证页面即可。添加部门和成员操作步骤:1、选择“企业管理 > 组织管理”2、单击“添加部门”,填写分组名称,单击“确定”。按需进行企业组织架构建设,最大支持9级的企业组织管理。3、选择部门,单击“添加成员”。4、填写成员信息,并单击“确定”。角色:企业管理员:企业管理员有企业内所有设备的操作权限。普通用户:普通用户只有分配给该用户的设备的操作权限。说明:a.如需删除成员,勾选要删除的成员,单击操作列的“删除”,单击“确定”b.如需给成员分配设备,勾选需要分配设备的成员,单击“分配设备组”或“分配设备”,单击“确定”
  • [技术干货] 【用户指南】如何注册好望云服务账号?
    *在使用华为好望云服务时,首先需要创建“华为云账号”并完成实名认证,租户创建。一、注册华为云账号,并完成实名认证1、进入华为好望云服务官网首页https://www.huaweicloud.com/product/ivm.html2、点击右上角“注册”进入华为云账号注册界面。(如点击右上角“登录”,进入如下所示页面)3、点击“注册”进入华为云的注册界面,根据界面提示,输入注册信息,完成注册。4、使用注册账号登录华为好望云服务首页。5、鼠标移动至页面右上角的用户名,选择“账号中心”,左键点击进入。6、在“基本信息”界面,“注册邮箱”处按提示绑定邮箱;点击左上角“实名认证”,根据需求选择个人或企业,完成实名认证,华为云账号即创建成功。  a.个人实名认证   按界面提示选择,输入认证信息和上传认证文件,勾选左下角,点击“提交认证”,等待审核通过。  b.企业实名认证   选择企业实名认证,方式为两种,按情况选择,推荐对公账户打款认证,按提示完成信息填写,完成认证。二、注册好望云服务账号1、进入华为好望云服务官网首页https://www.huaweicloud.com/product/ivm.html2、点击“登录管理后台”,进入IVM好望云服务登录界面3、点击“注册账号”,根据页面提示,输入信息完成注册。
  • [云计算周刊] 当云计算飞向深空
    当云计算飞向深空编者按:本文来自微信公众号“脑极体”(ID:unity007),作者:藏狐,36氪经授权发布。我们多次说起过,当下的“上云”浪潮,源自无数来自于扎实产业土地的真实需求:工厂需要AI,机器人需要算力,城市需要智慧,流媒体需要高清低时延的体验……照此逻辑,有着大量数据传输、智能计算、AI应用需求的空间站及太空产业,自然也应该是头部云厂商的必争之地。不过放眼整个云市场,真正将业务开展到了云层之上的,只有亚马逊、微软及谷歌等等非常少数的企业。解锁“太空场景”,有现实意义吗,又要跨越怎样的八千里路云和月?谁在深空盼云来与地面上千姿百态、生机勃勃的众生相不同,提起深空,我们的第一反应是酷寒、失重、冷寂,除了少数人类宇航员,就是无边际的器械与卫星。这样的地方,也需要云吗?或许,可以换一个角度,把深空的云服务想象成和智慧城市、智慧工厂、智慧园区等并行的落地产业之一。首先,深空中存在不少数字化及智能应用的计算需求,而人类短时期内都不可能在太空建一座实体数据中心,云,就成了“指挥太空”这张白纸的首选载体。在空间站与地面的数据中,包含了大量的语音、视频等富媒体数据,近年来还有人开始尝试将VR应用于太空。同时,有大量智能机器人被设计出来并送往太空,它们有的替代人类在太空中进行科学实验、空间探测等活动,有的负责陪伴并帮助人类宇航员承担一部分工作。比如IBM在2018年送往国际空间站的AI系统CimoN,就集成了语音、人脸识别、情感分析、NLP等等算法能力,能检测空间站异常并进行预警。AI、VR、4K视频等等新功能的日趋增多,让原来只能处理单一类型数据的计算系统和通信网络,无法满足太空作业的现实需求,从长远考虑,部署云计算将是各国空间实力的一个赛点。此外,正是因为太空遥远、神秘又无处不在,也成为地面上众多服务生活不可或缺的信息源头。科研需求就不提了,比如平时导航软件都会用到的卫星雷达图像,公共服务涉及的气象数据,海面、高山等偏远地区作业依赖的卫星通讯。就连卫星拍摄到的太空图片以及空间站生活,都能作为科普和创意素材,在社交平台上吸引来自全球好奇星人的目光。大量新业务和初创公司开始进入太空领域,直接带来了大量数据集合以及分析传输的压力,上云显然就成了极具性价比的选择。有海外分析师认为,2030 年左右,与太空相关的云服务产业总收入可能会达到 150 亿美元。这么一瞧,潜在客户不仅数量多还是刚需,舍得花钱。云厂商们平时总说要追寻科技的星辰大海,怎么真到了进击太空的时候,就只剩亚马逊aws、微软,难道这就是传说中的叶公好龙吗?解锁太空三步曲2020年,亚马逊将太空业务作为细分市场,成立了新的航空航天和卫星解决方案部门,由退役美国少将克罗西尔领导。同样在去年,微软与马斯克的星链达成合作,希望通过“Azure Space计划”把云服务带到太空,为客户管理来自太空卫星的大量数据。从中,我们也就不难发现,虽然太空场景下的云业务逻辑与其他产业差不多,需求基本都涵盖在:1.模拟并支持太空任务;2.从卫星数据中发掘有用信息;3.支撑地面和近地轨道服务创新。但太空的特殊环境,又对云厂商的基础设施建设提出了全然不同的新挑战。具体表现在:第一步,卫星。我们知道,传统的太空网络系统要承载的任务很多,包括空间站内的数字通信、空间站与其他卫星、轨道飞行器、航天飞机的通信,与地面的通讯和实时交互等等。这些任务都要将关键数据传递给地面机构和科学家,要将云服务的战火烧到太空中,自然离不开高速低延迟的卫星宽带。在一份美国的监管文件中,就提到对微软 Azure 云服务能力在太空环境中的测试,包括支持O3B 中轨道星座,提升数据中心和边缘设备之间的连通性等等。而亚马逊创始人贝索斯旗下更是自有太空公司蓝色起源(Blue Origin),计划在2021年首次发射自己的New Glenn火箭,并准备投入100亿美元部署3236颗卫星,发展卫星互联网业务Project Kuiper,与微软太空云服务的盟友星链竞争。所以说,没有低成本的小型卫星系统和可重复使用的运载火箭方案支撑,云厂商巧妇也难为无米炊。云计算的竞争,也在于商业航空之间的竞争。第二步,地面。除了部分边缘计算需求要在太空处理,绝大多数工作还是要在地面完成。因此,微软和亚马逊的第一步,都是先发力地面基础设施。早在2018年,亚马逊AWS就与多家卫星公司合作,采用其提供的地面基础设施来存储、分析和传输卫星数据。在一次与NASA合作的国际空间站实时视频演示中,宇航员翻身的4K高清画面没有延迟、没有卡顿地被地球观众所看大,正是得益于地面云基础设施的庞大投入。而微软则打造了模块化数据中心(Modular Datacenter, MDC),为美国国防部创新机构(DIU)部署了一个具备高速云计算能力的解决方案,以便更好地利用太空数据来支持美国空军的CASINO(Commercially Augmented Space Inter Networked Operation) 项目。第三步,商业。太空场景不仅需要最好的云计算技术和数据处理能力,而且应用领域也比较复杂,要成功将云服务和解决方案售卖出去,也没有想象中简单。有的分析需要立刻在边缘侧进行,比如Hewlett-Packard Enterprise(惠与公司)就曾与NASA合作,为国际空间站送去了一个能够本地处理边缘计算的超级计算机,无需先将数据传输到地球,在通信不好的恶劣太空环境下也能支持科学研究,让机器人照常工作。而一些相对复杂的数据分析则需要传输到超大规模的公有云处理,像是探索如何利用人工智能在太空进行医疗诊断,地球直播公司全天候24小时直播的“实时地球观测服务”等等。
  • [技术干货] 初识好望云服务!
    1.什么是好望云服务?好望云服务通过好望视频管理、好望视频智能、好望开发平台、好望商城等智慧云服务,为政府、企业等用户提供智能原生的端云协同行业视频云服务解决方案,助力政企数字化转型。2.好望云服务是用来做什么的?有哪些功能?功能描述视频接入支持全行业摄像机、智能视频存储、视频监测平台等的便捷接入,高效的设备管理、设备配置等能力。视频收录提供高可靠、大容量、安全的云端视频持久化存储,含连续存储和动检存储等多种方式。视频调取提供实况视频、历史录像、设备信息和告警数据的全网高质量调取,以便随时随地查看浏览。行业数据流提供端侧设备智能算法分析结果的统一接入、存储、开放共享给上层应用,以便实现智能算法的业务闭环。3.好望云服务优势开放接入异厂家设备快速接入;标准化API接口使能ISV应用创新;端云智能分析协同服务智能生态智能算法数据开放共享;云上商城智能加持;丰富的行业We码应用安全可信数据传输存储加密、视频水印;动态隐私遮挡;端到端可追溯;拥有四大安全特性:访问控制、传输加密、存储加密、数据删除统一体验华为云、混合云统一架构,统一服务体验;端边云协同极致体验;多终端同步、统一业务体验4.好望云服务有哪些行业应用场景?端云协同,打造智慧应用场景。好望云服务主要应用场景有智慧门店、智慧商超、智慧餐饮、智慧养殖、智慧工地、智慧小区、智慧学校、智慧酒店、智慧园区等,应用场景丰富,更多场景更新规划中...5.四大好望云服务客户端,匹配不同用户诉求                 赶快来加入我们吧!一起紧跟数字化转型热潮步伐,还带贴心客户服务哦。好望云服务官网:https://www.huaweicloud.com/product/ivm.html好望商城(算法、应用、解决方案):https://marketplace.huaweicloud.com/markets/holosensstore/
  • [行业动态] 【4月14日 AI 快讯】英伟达CPU问世:ARM架构,对比x86实现十倍性能提升
    产业336片Gaudi训练芯片+16片Goya推理芯片,英特尔Habana Labs AI加速器赋能圣地亚哥超算中心Voyager项目英特尔旗下 AI 芯片厂商 Habana Labs 宣布将为圣地亚哥超级计算机中心(SDSC)的 Voyager 超级计算机提供高性能的 AI 计算能力。2021/04/13 16:32原文链接开发板还能这么用?美国学者用Jetson Nano支持便携式AI假肢,控制每一根手指Jetson Nano 还能这么用?2021/04/13 15:25原文链接英伟达CPU问世:ARM架构,对比x86实现十倍性能提升英伟达现在是一家制造 CPU、GPU 和 DPU 三种芯片的公司。2021/04/13 15:20原文链接特斯拉刹车失控地库撞墙!官方回应系地面太滑;网友:反正车没问题今年国内已发生9起特斯拉事故2021-04-13 12:06:26原文链接理论μ子刷屏的背后:说「新物理学即将现身」还为之过早现在就说「新物理学即将现身」还为时尚早,因为这个实验结果的显著性还并未达到确定无疑的程度,而且基于「标准模型」的另一种计算方法也能给出与实验结果更一致的预测。2021/04/13 15:30原文链接其他英伟达发布“空气CPU”,Arm架构专为AI而生,性能超x86十倍,与自家GPU更搭老黄变成了长头发2021-04-13 12:15:22原文链接奥数国家队最强6人集结,深圳中学独占2席,人大附中连续三年入围还有一名高一选手2021-04-13 12:04:25原文链接最快的PNG图像解码器!速度提升2.75倍,比老大哥“libpng”还安全Wuffs:这题我会2021-04-13 12:01:18原文链接
  • 华为 AI 音箱 2
    这个也太畅销了一眨眼就告罄了坐等周五拼手速
总条数:7872 到第 页
上滑加载中