• [技术干货] 华为云专家10年技术沉淀,684页《从零到一•Python图像处理》独家免费下载
    《华为云云享.书库》系列电子书来啦!本系列电子书旨在帮助开发者成长,汇聚华为云内外部专家技术精华制作而成。 本书《从零到一•Python图像处理》是该系列电子书第3部。本书作者杨秀璋,贵州财经大学教师,武汉大学在读博士。长期从事Web数据挖掘、知识图谱、人工智能、网络安全等方向研究,现已出版专著6部,发表论文30余篇,主持课题6项(含1项贵州省优秀自然科学基金),并参与多项国家级课题。近十年在华为云等社区分享原创博客600余篇,开源项目100余个,全网累计阅读量超过1000万人次,粉丝20余万。此书是作者十多年图像处理及识别编程经验的结晶,包含丰富真实的案例及详细的算法原理,采用Python3、OpenCV和Keras等库实现,通过图文结合、代码注释、实例详解的形式娓娓道来。希望这本电子书及开源的代码能帮助读者迅速入门,并让图像处理及识别领域的知识轮廓逐渐清晰。全书包括三部分内容,共48章。第一部分是图像处理基础知识(共10章),详细介绍了图像处理基础、OpenCV入门、几何图形绘制、算数与逻辑运算、几何变换、量化和采样处理等内容。第二部分是图像运算和图像增强(共17章),包括图像点运算、灰度变换、形态学处理、直方图绘制、图像均衡化、平滑锐化等内容。第三部分是图像识别及图像高阶案例(共21章),包括图像分割、傅里叶变换、霍夫变换、图像分类、特效处理、OpenGL、图像去雾等知识,也囊括了经典的文字识别、车牌识别、人脸识别、目标检测、基于深度学习的图像分类、小麦检测、GAN图像生成等案例。本书详细讲解了Python图像处理及识别知识,是市面上为数不多结合实战的图像处理书籍,更是一本计算机视觉的宝典。全书内容通俗易懂,案例丰富,图文并茂,便于读者快速上手,非常适合初学者、技术人员和高校师生学习。同时,作者杨秀璋长期从事相关研究,实践经验丰富,并且乐于分享知识。无论是新手还是经验丰富的技术人员,都希望您能从中获益。扫描下方二维码,回复“云享书库”,快来免费领取这本电子书吧~转载自华为云社区云享.书库活动
  • [技术干货] 图像识别入门必读,华为云专家10年技术沉淀,684页《从零到一•Python图像处理》独家免费下载 | 云享·书库No.3[转载
    图像识别入门必读,华为云专家10年技术沉淀,684页《从零到一•Python图像处理》独家免费下载 | 云享·书库No.3 技术火炬手 发表于 2022/03/14 18:49:41  1.5w+  5  3【摘要】 《华为云云享.书库》系列第3部电子书上线啦!《华为云云享.书库》系列电子书来啦!本系列电子书旨在帮助开发者成长,汇聚华为云内外部专家技术精华制作而成。 本书《从零到一•Python图像处理》是该系列电子书第3部。本书作者杨秀璋,贵州财经大学教师,武汉大学在读博士。长期从事Web数据挖掘、知识图谱、人工智能、网络安全等方向研究,现已出版专著6部,发表论文30余篇,主持课题6项(含1项贵州省优秀自然科学基金),并参与多项国家级课题。近十年在华为云等社区分享原创博客600余篇,开源项目100余个,全网累计阅读量超过1000万人次,粉丝20余万。此书是作者十多年图像处理及识别编程经验的结晶,包含丰富真实的案例及详细的算法原理,采用Python3、OpenCV和Keras等库实现,通过图文结合、代码注释、实例详解的形式娓娓道来。希望这本电子书及开源的代码能帮助读者迅速入门,并让图像处理及识别领域的知识轮廓逐渐清晰。全书包括三部分内容,共48章。第一部分是图像处理基础知识(共10章),详细介绍了图像处理基础、OpenCV入门、几何图形绘制、算数与逻辑运算、几何变换、量化和采样处理等内容。第二部分是图像运算和图像增强(共17章),包括图像点运算、灰度变换、形态学处理、直方图绘制、图像均衡化、平滑锐化等内容。第三部分是图像识别及图像高阶案例(共21章),包括图像分割、傅里叶变换、霍夫变换、图像分类、特效处理、OpenGL、图像去雾等知识,也囊括了经典的文字识别、车牌识别、人脸识别、目标检测、基于深度学习的图像分类、小麦检测、GAN图像生成等案例。本书详细讲解了Python图像处理及识别知识,是市面上为数不多结合实战的图像处理书籍,更是一本计算机视觉的宝典。全书内容通俗易懂,案例丰富,图文并茂,便于读者快速上手,非常适合初学者、技术人员和高校师生学习。同时,作者杨秀璋长期从事相关研究,实践经验丰富,并且乐于分享知识。无论是新手还是经验丰富的技术人员,都希望您能从中获益。扫描下方二维码,回复“云享书库”,快来免费领取这本电子书吧~附:云享书库第2期:年度重磅!华为云2021应用构建技术实践精选集,七大领域400页+云上开发宝典,免费下载!云享书库第1期:【年度重磅】2020华为云社区年度技术精选合集,700页+免费下载!
  • [专家秘籍] 专家秘籍汇总贴来喽,欢迎大家交流探讨(持续更新中)
    帖子标题链接玩转PB级分布式数仓GaussDB(DWS)性能调优黑科技cid:link_0玩转PB级数仓深度调优之依“计”行事GaussDB(DWS)性能调优cid:link_1GaussDB(DWS)安全与权限设计cid:link_2GaussDB(DWS) 补丁、升级及扩容流程cid:link_3GaussDB(DWS) 备份与恢复cid:link_4GaussDB(DWS) 日常巡检cid:link_5GaussDB(DWS) 常见问题三板斧cid:link_6【云小课】不可不知的调优技巧-GaussDB(DWS)表结构优化cid:link_7
  • [技术干货] 开源数据库兴起,你需要了解的三件事【转载】
    技术专家每天都必须要平衡生产力与成本以及复杂性,随着开源数据库的日益普及,负责数据库平台的技术人员正面临着更大的挑战。在最新的《SolarWinds调查报告》中,近三分之一的受访技术专家表示,他们在企业机构中需要负责超过300个数据库。大多数受访者表示,其企业机构有一半以上的数据库对业务至关重要。开源模式是中国数据库市场当下的主流趋势之一。根据艾瑞咨询发布的《2021年中国数据库行业研究报告》,开源模式不仅通过公开分享源代码来使研发人员避免重复开发基础程序,从而提高数据库产品的开发“效率”,而且对产品技术创新也很有帮助。开源社区能够最大程度地汇集全球资源,为开发者提供一个交流和讨论空间,从而加快创新思想的诞生。根据CAICT(中国信息通信研究院)的《开源生态白皮书》,中国的开源项目在2021年呈现爆发式增长,中国企业积极投资,在操作系统、数据库、中间件等领域出现了许多高质量的开源项目。随着开源技术被认可和接受程度的提高,2020年中国有88.2%的企业采用了各种形式的开源技术。虽然商业平台仍占据主导地位,尤其是对于企业要害应用,但开源数据库正在增加。为了避免给内部系统带来风险,以前很少有企业IT团队愿意使用开源数据平台或初创企业的数据库管理系统。时过境迁,我们现在正在进入一个数据平台混搭的新时代,同时也需要牢记一些重要的原则,如务必在调查所有选择方案之后,再决定是否采用一个开源平台。没有人能够抵挡免费的诱惑,你也不例外开源数据库有很多优点,其中最突出的无疑是免费——没有人能抵挡免费或低价的诱惑。由于没有商业软件附带的许可证费用(通常这笔费用十分昂贵),因此IT预算不受合同款项的限制。而节省了成本的IT部门具有巨大的灵活性,可以进行尝试并且能够根据市场需求迅速采取行动。由于开源社区不根据所支付的费用来授予许可证,因此小型企业也可以像跨国企业一样获得创新功能。而且初创企业和其他小型企业相比大型企业更有优势——在重新解释快速决策基于的因素并调整这些因素的优先顺序时,所涉及的管理层级较少,因此这些企业通常能够更快做出决策。是否应该采用开源数据库取决于性价比。一家企业可能会选择一个高效率、能够随时提供支持的商业工具来为他们每年节省数千美元。如果工具有效,那么即便是六位数的许可费可能也不是天价,而且当这个工具不起作用时,还可以根据合同直接追讨赔偿。另外,采用开源数据库的你并不孤单。根据《SolarWinds调查报告》,43%的技术专家表示他们目前正在使用MySQL或MariaDB。此外,18%的人表示他们计划在未来三年内采用MySQL、MariaDB或其他开源数据库平台。同时,企业正在为基本的数据库应用寻找开源数据库或者至少在权衡开源数据库的利弊。他们拥有现成的专业数据库管理技术,许多企业最终决定等到出现更好的工具后,才在关键位置上采用开源数据库平台。调查你的选择方案在使用开源数据库之前,数据库专家应该研究此类平台为什么以及何时能给他们的企业机构带来最大的效益。在最初研究是否使用开源数据库时,我们往往只关注平台的性能和工作负载能力,但这还不够。我们的确很难挤出时间来研究这些问题。《SolarWinds调查报告》发现数据库专业人员需要负责300多个数据库的各种平台。仅仅是保持这么多数据库正常运行、解决各种问题和 “救火”,就已经需要他们加班加点。事实上,这份报告还发现维护工作占据了数据库专业人员一天中的大部分时间:三分之一的受访技术专业人员表示,他们一天中的大部分时间都在维护。这无疑使他们更加没有时间来研究开源数据库平台或进行任何可能提高生产力和节约成本的分析。形成监控思维技术专家可以使用合适的自动化和监控工具来节省维护时间。数据库监控工具可以在问题变得严重之前预见问题,还可以实时响应各种警报;自动化系统可以让他们腾出时间来专注于主动性数据库性能管理。监控工具在后台运行,充分发挥同时管理大量数据库的能力,而数据库专业人员则可以提高自身的技能、进行创新和研究他们的开源选择。根据笔者数十年的经验,有监控思维的企业所取得的成功远大于没有监控思维的企业。一流的企业在得到一个新的数据库平台时,也一定会采取监控措施,确保该平台不会在他们毫无察觉的情况下发生故障,然后才会考虑将其用于生产。这些企业会防止平台“胡作非为”、占用特定服务器上的全部处理周期,这大大有助于技术专家继续添加更多的功能。开源数据库已成为一种趋势。但在部署一个数据库之前,请务必详细调查你的选择方案(请记住:错误的选择会带来严重的后果),然后在部署新的数据库平台时务必部署自动化和监控系统。在整个过程中,应基于明确的业务目标制定部署规则,同时把政治因素排除在外。 原文链接:https://blog.csdn.net/FL63Zv9Zou86950w/article/details/123095718
  • [华为伙伴暨开发者大会] (获奖公布)【技术前瞻】专家坐堂,参与交流互动抽取奖励!
    各位开发者:此次活动已开奖抽奖过程可查看本帖附件奖品将在7月31日邮寄如遇其他情况延迟发货将在本帖进行说明没有填写奖品邮寄信息表的用户请抓紧填写兑奖截止日期:2022年7月20日23:59逾期视为弃奖,不补发【华为伙伴暨开发者大会社区活动获奖信息收集表】技术前瞻·专家坐堂-获奖名单公布奖品:文件收纳包1个kirztoshs君临天下夜未央乌龟哥哥yd_291309265湬黍yd_263991330jflmaoyd_222318332dayday大会活动已全部结束,活动正在评奖中,预计 7月15日前 公布结果直播报名地址(报名并观看直播即可解锁LV1)>>点击报名观看<<更多解锁闯关规则,请>>点击了解<<活动时间05月23日—06月30日互动方式直播后您可以在本帖留言,与专家互动交流,我们会在全部活动结束后对参与互动的用户进行抽奖。 活动规则和奖励说明1.本次活动结束后,将由华为云工作人员将符合抽奖条件的用户名单导入至巨公摇号平台(https://www.jugong.wang/random-portal/)内,抽取各奖项,并截屏公示抽奖过程。如您不同意此抽奖规则,请勿参加本次活动。2.我们将抽取10位幸运用户,每人奖励文件收纳包1个。直播列表日期主题 简介 链接5/259:00华为云IoT创新应用开发大赛总决赛本次将为大家直播华为云IoT创新应用开发大赛总决赛现场。20支优秀团队现场竞演,参赛作品覆盖智联生活、智能制造、智慧城市、智慧农业、智慧医疗等场景,带你全方位了解华为云IoT全场景智慧物联!点击观看5/2717:00鲲鹏应用使能套件BoostKit,使能极致性能为您讲解助力伙伴打造具有竞争力的金融、政府等国计民生行业解决方案,如基于BoostKit机密计算开展金融风控模式创新、打造基于BoostKit全局缓存的极致性价比云存储系统等。点击观看5/3117:00通过Rust语言计算加速技术突破图片识别性能瓶颈为您讲解在Rust项目中如何利用计算加速技术帮助开发者解决图片识别等场景下的性能瓶颈问题。点击观看6/117:00解读HarmonyOS 应用与服务生态让您对HarmonyOS基础理念和发展方向有深刻理解,共建共享万物互联的新赛道。点击观看6/217:00对话专家,HMS Core 6创新能力解读为您讲解HMS Core 6在媒体、图形、连接与通信领域的创新能力与技术,如何实现实时环境光照跟踪,如何提升音视频智能化创作体验,弱网环境下如何为用户带来流畅上网体验。点击观看6/617:00openLooKeng,一款面向海量、跨DC的大数据分析利器使用openLooKeng,助力开发者提高跨源秒级查询,解决查询时间长的问题,实现跨域融合分析能力,解决数据零搬移联合查询速度提升。点击观看6/717:00微服务向Serverless演进与场景讲解为您讲解面向电商应用的Serverless托管方案,实现应用的极简上云。助力企业聚焦业务,降低成本。点击观看6/817:00设施云解决方案,帮您解决园区设施管理痛点为您讲解智慧园区三大场景化解决方案之一设施管理的能力及如何解决园区设施管理系统孤立、智控不足等痛点。点击观看6/917:00AI推理应用框架ModelBox,帮助您的算法快速产品化为您讲解AI应用开发框架ModelBox以及ModelBox如何解决代码复用率低,性能调试复杂,硬件适配繁琐等痛点,并演示多场景下的开发过程。点击观看6/1017:00昇腾异构计算架构CANN,助力释放硬件澎湃算力华为推出昇腾AI异构计算架构CANN,将助力解决人工智能技术面临的诸多诉求,充分释放昇腾AI处理器澎湃算力,打造昇腾AI极致性能体验,突破AI产业平台期。点击观看6/1317:00MindSpore Quantum实战,用量子计算解决组合优化问题为您讲解开源量子计算框架MindSpore Quantum主要功能、应用场景和技术优势,并通过实例讲解用量子计算技术解决组合优化问题。点击观看6/1417:00基于鲲鹏DevKit便捷开发高性能应用,助力开发效率提升15%为您解读DevKit 2.0的最新策略,以及如何助力开发者便捷、高效的开发出鲲鹏架构亲和的高性能软件,落地行业应用、繁荣鲲鹏生态。点击观看 注意事项1、为保证您顺利领取活动奖品,请您提前填写奖品收货信息【点击此处填写 】,如您没有填写,视为放弃奖励。2、活动获奖信息填写时间截止至大会结束,如未填写视为弃奖。3、本次活动幸运奖将采用巨公摇号平台(https://www.jugong.wang/random-portal/)进行抽取,话题质量相关奖项将由华为云社区工作人员进行评选,如您对评奖方式有异议,请勿参加本次活动。本活动最终解释权归华为云所有。4、如出现活动奖品出现没有库存的情况,华为云工作人员将会替换等价值的奖品,获奖者不同意此规则视为放弃奖品。5、其他事宜请参考【华为云社区常规活动规则】 温馨提示 请您认真填写收货地址信息【点击此处填写 】,在“华为伙伴暨开发者大会社区活动”系列活动中完成一次填写即可。我们最终将会按照您最后一次填写的信息发放奖励。请务必使用个人账号参与活动(IAM、企业账号等账号参与无效)。所有获得华为电子产品奖项的获奖用户,请于获奖后3日内完成实名认证,否则视为放弃奖励。本次活动如一个实名认证对应多个账号,只有一个账号可领取奖励。本次活动一个实名认证账号只能对应一个收件人,如同一账号填写多个不同收件人或不同账号填写同一收件人,均不予发放奖励。
  • [技术干货] 【深入浅出,Paas之路】华为云.云享专家曹宗南: Serverless,引领云计算下一个阶段
    2009 年,伯克利以其独特的视角发布了一篇文献,正式定义了云计算。自此,千行百业的 IT 基础设施开启上云之路。2019年,伯克利在《Cloud Programming Simplified》预言:“Serverless计算将会成为云时代默认的计算范式,并取代Serverful(传统云)计算模式。”2009-2019年,互联网技术飞速发展。在这期间,出于对计算机技术的兴趣,曹宗南大学期间选择了计算机专业,之后便开启了他的技术开发生涯。只要对开发有所了解,都知道程序员和开源是密不可分的,曹宗南亦是如此。毕业之后的一次项目中遇到数据库开发相关的瓶颈,他在经过一番查询,发现开源项目分布式数据库中间件Mycat能够完美的解决遇到的问题。他表示,Mycat在使用的过程中,后端可以挂接N个普通的MySQL数据库,数据可以按照多种规则进行分布,对外表现的却像一个MySQL实例一样来使用,业务代码不需要做大的改动。自此,曹宗南便对MySQL产生了极大的兴趣,逐渐的也从使用者到开源的贡献者。陆续给Mycat贡献了多数据库后端支持、动态平滑扩容、分片算法、压缩协议等多个核心特性,还参与Mycat线下技术峰会的演讲。“对Mycat源码也熟悉的像自己的掌纹一样清楚。”曹宗南说道。触摸新技术时代的网红Serverless在谈及现在的工作内容中,曹宗南提到了Serverless技术。正如开篇所提到伯克利在《Cloud Programming Simplified》中的预言,Serverless将成为云计算的下一代默认计算范式。曹宗南解释道,Serverless架构是在微服务架构基础上的进一步延伸,按照业界通常的定义,Serverless = FaaS(Function as a Service) + BaaS(Backend as a Service)。相比微服务,FaaS将资源调度的粒度缩小到函数,针对无状态、短时处理任务,通过函数式编程方式,进一步降低了应用开发门槛,缩短了应用上线周期。为了更好的便于理解,曹宗南从三个典型场景,解读了Serverless架构所具有的IT资源可根据需求弹性伸缩的特点。场景一:Web类应用。典型的应用有小程序后端、Web后端、三方服务商对接、前端BFF等。这类应用使用函数编程可以极大简化开发流程,能够做到小时级交付; 场景二:IoT、媒体处理类应用,如实时的图片处理、实时的数据流处理、IoT的事件处理等。这是Serverless最典型的一类应用,特点是事件驱动+计算胶水层,计算胶水层的逻辑通过函数来实现,以事件驱动的方式执行服务,按需供给,开发者无需关注业务波峰波谷,节省闲时成本,最终降低运维的成本; 场景三:AI处理应用,如视频直播、AI推理、人脸识别、车辆识别等,这类应用的特征是基于各行各业的业务智能化,通常无法预知流量大小,需要基础设施能够做到底层资源无感,自动的快速弹缩而不影响业务层的处理。随着在Serverless技术的研究和实践过程中发现,Serverless作为云计算下半场的计算范式,需要解决通用应用开发、原有应用系统无缝对接、支持异构硬件等问题,并且有完备的工具链、云服务,才能让更多的开发者享受Serverless带来的红利。华为云FunctionGraph开启Serverless新时代在华为全联接2021上,华为公司高级副总裁、华为云CEO、消费者云服务总裁张平安重磅发布了华为云FunctionGraph函数计算服务。FunctionGraph是一款带编排能力的函数计算服务,提供了界面化管理、一站式的函数开发上线功能,支持6大类语言、支持10+类的函数触发器类型;拥有丰富的触发器类型,通过事件触发集成多种云服务,满足不同场景需求;根据请求的并发数量自动调度资源运行函数,实现按需极速弹性;函数运行实例出现异常,系统会启动新的实例处理后续的请求,实现秒级故障自愈。曹宗南作为华为云FunctionGraph首席架构师,全程参与了FunctionGraph 2.0全新架构的设计和研发。针对FunctionGraph 2.0全新架构,他从5个特性做了诠释。• 特性1:丰富的函数开发语言及触发方式让设计更灵活支持Python、Java、Node.js、Go等常见的编程语言,也支持容器镜像和自定义运行时。函数调用支持同步和异步两种方式,最长支持12小时,可满足长时间任务的需求,大大突破传统Serverless的适用场景。• 特性2:可视化拖拽式函数流支持编排复杂业务场景支持通过图形化拖拽方式进行函数编排,支持并行分支、条件分支、子流程、循环、异常处理等,可以满足多函数场景下的快速编排需求。• 特性3:统一插件支持云上和云下的开发与调试如何对函数进行调试作为Serverless场景的一个难点,华为云针对云上和云下两个场景都提供了解决方案,而且作为业界首家支持多函数调试能力。• 特性4:Http函数让WEB服务近乎0成本改造,享受Serverless优势能力微服务和函数在未来几年会是一个共存的形态,当前存在着大量微服务应用,如何高效的支撑其Serverless化,让现有微服务快速享用到Serverless的优势能力,是一个待解决的问题。针对Web服务,华为云推出API网关加FunctionGraph的Http函数方案,用户只需把原有的Web Server代码打包为一个Http 函数,即可完成Serverless化改造。该方案价值体现在多语言WEB框架支持方面,例如:Java - Spring Boot,Nodejs - Express等框架,这样对于开发的应用通过极小修改就是能完成Serverless 函数化改造。开发人员可以继续使用熟悉的开发框架和测试工具,降低开发人员学习负担。而且,改造后也无需额外的运维,简单配置即可实现100ms级自动弹性和灰度升级。• 特性5:函数支持在运行时动态指定资源,灵活调度节省成本图片压缩、水印处理、文档转换、视频转码是典型的事件触发,波峰波谷明显的场景,越来越多地使用Serverless 函数来开发业务。以视频转码为例,典型的处理流程如下:视频文件的大小从MB到GB,不同编码格式和分辨率对转码需要的计算资源要求差别很大,为保证转码函数的性能,通常配置一个很大的资源规格,但是在低分辨率的(例如短视频)场景下,会造成资源浪费。Functiongraph提供了一种方案支持函数执行时可根据业务需要动态指定资源规格,最小化资源占用,可以给用户带来更精细的资源控制,更低的成本开销。目前,在华为云Serverless场景落地方面,已全面实现了在移动端的应用实践。曹宗南举例道,2020年新型肺炎疫情牵动着全球人民的心,基于Serverless服务,华为负一屏快速上线“新型肺炎疫情实时播报”,实现了一天上线,资源利用率提升50%。在视频处理应用场景中,华为视频前端基于函数开发,实现前端开发和后端开发解耦,前端界面逻辑变化不需要后端参与,开发上线效率提升100%以上,大幅减少前后端团队沟通协同,效率提升50%以上。在海外的合作伙伴应用中,阿联酋海关基于Functiongraph的弹性收缩轻松应对业务波峰波谷,TCO成本较传统方案降低30%以上,较传统开发模式上线周期减少50%(6个月->3个月)最后事实上,目前的Serverless发展已经远远超出了预期。对于云计算应用架构来说,“无服务器”时代的Serverless技术必将引领云计算下一个阶段。正如华为2012实验室分布式与并行软件Lab主任谭焜博士所说,Serverless将是微服务的“封顶之作”,也是推动应用现代化的基石。
  • [技术干货] 专家解惑 | 关于华为云盘古大模型,你想问的都在这里~
    4月25日,华为云CEO余承东在华为开发者大会 #HDC.Cloud 2021 期间,重磅发布了华为云盘古系列大模型,帮助千行百业解决 AI 模型难以泛化和复制的问题,开启 AI 工业化开发新模式。华为云盘古大模型基于华为云一站式AI开发平台ModelArts构建,包含了:华为云盘古NLP大模型:是业界首个2000亿参数中文预训练模型,预训练阶段学习了40TB中文文本数据,是最接近人类中文理解能力的AI大模型。华为云盘古CV大模型:是目前业界最大的视觉预训练模型,包含超过30亿参数对于盘古大模型,大家都充满了好奇~AI新入门:如何快速进入相关方向学习和研发?AI开发者:盘古大模型的易用性、使用成本、落地场景、端侧性能如何保证? 华为云AI开发者社区挑选了一些HDC.Cloud现场开发者的热门问题,专访盘古大模型的核心研发人员谢凌曦博士和张晓鹏博士进行答疑谢凌曦博士专访Q:作为一个开发者,请问这些预训练模型的易用性如何?使用成本有多高?谢凌曦博士:预训练模型本身设计的目的就是为了让大家在使用云服务的时候降低成本,那么我们预训练模型因为它是预训练,所以我们已经在后台完成了这样一个训练过程,这个过程的成本是比较高的,但是成本的不会需要开发者本身来承担。在使用这些模型的时候,它本身易用性和成本都会在设置在一个比较合适的位置,比如说我们会开发出一些比较通俗易懂的pipeline,如果你是有一定基础的开发人员,你也可以从我们pipeline当中去做更多的定制化的开发,更好的去释放我们预训练模型的能力。如果你只是一个小白,就想用我们的模型去做AI的一些简单的开发,我们也会给你一些更加通俗易懂的界面,让大家能够用一些拖拉拽的方式去使用我们的训练模型,同时成本相对来讲是比较低的,我们有很多种不同的这种计价方式,但是总体来讲,预训练模型都是降低了大家后续使用的时候它的一个计算时长,包括你的这种调仓所需要的重复的代价,这都会被降到一个很低的程度,总体来讲是对开发者非常友好的。Q:华为视觉计划里面提到了很多计算机视觉的新方向,那么对于新入门的人来说,如果想快速投入新的方向中去学习,需要掌握什么哪些知识才可以快速进入到相关方向的学习和研发中。是否需要先掌握传统全监督学习才可以更好的掌握弱监督和无监督数据的方向的研究中呢?谢凌曦博士:总的来讲是一个非常好的问题,我自己刚入行的时候也有过类似思考,是因为不管怎么说,人工智能计算机视觉都是经过几十年的发展,到现在为止已经是一个很庞大的知识体系了。如果一个人想要把这些东西都了解以后,开始做研究的话,稍微效率会有点低,而且你会花费很多不必要的精力去做一些事情。所以我们给大家的这样一个建议是说,你在学习过程当中,你可以先找准一个问题,这个问题可能一开始是一个相对初级的一点的问题,比如说刚才谈到我想做一个弱监督学习,那么我一定是有一个具体的场景,比如说在现在有一个问题当中,我遇到一个实际的问题当中,他确实需要用到弱监督的算法,但这个时候我是不是一定要先掌握全监督,并不是这个样子,你可以先去查阅一些,比如说当前弱监督学习,它的基线是什么,它的前沿在哪里,然后你就可以去做一些简单的实验,在这个实验的过程当中,你一般会遇到一些困难或者遇到一些疑惑,这些疑惑为了去解决,它一般就会帮你把你引导到这样一些它的基础,比如说全监督到底是怎么做的,那么你有了这样一些更多的基础以后,你回过头来也会对你当前正在做这个算法有更好的理解,所以我的建议是大家可以找一本教材,一个对机器学习也好,计算机视觉也好,这些比较介绍的比较深入的一个教材看。但是另外一方面也不要局限于这样一个教材,你可以一边做一个具体的课题,一边去学习这样一些知识,这样的话会比较有效率一些。张晓鹏博士专访Q:图像预训练模型有哪些成功的落地?跟业界比较处在什么位置?我们的智能驾驶系统有用到这方面技术吗?张晓鹏博士:已经在华为内部以及其他合作项目上有100家的一个成功的落地,那么这些方向其实涵盖了各行各业,我们在一些工业视觉,包括一些网络审查,包括一些零售商超以及医疗上,其实都获得了一些相较于我们之前不使用预训练模型更高的一个结果。在某些场景上,比如刚才提到的遥感印象上,我们通过这样一种遥感针对遥感影像这样一种预训练算法,其实在没有增加额外的这种标注代价的情况下,其实是达到了最多10%的这样一种分割精度的提升。那么还有另外一个比较有意思的现象就是说,我们其实在超大规模,我们这里大概用了几千万到亿级的图像的预训练,然后我们直接把这样一个模型,然后迁移到了我们的工业质检的缺陷上。然后其实我们非常欣喜的发现一个有意思的现象,就是我们在下游数据集上其实没有进行任何微调,然后但是我们在这样一个工业缺陷检测上,其实获得了比之前的更高度的优化,甚至利用下游的数据微调,基本上还会更好的结果,这个结果基本上会高出3~4个百分点。也是启发我们就是说我们的模型的数据一旦够多,其实它的泛化能力其实是从隐式的能够获得一种保障。第二个就是说我们的到了什么地步,我们其实是国内公司里面其实是最早做视觉艺术的模型的公司之一,据我了解其实在国外的话是Facebook和谷歌,其实从2019年开始在图像上面做了一些应用,我们这一块其实我们的视觉医学的模型开发其实大概在2019年的时候然后就开始了。所以说到目前为止,其实我们在一个大模型或者这种方针下,搭载我们的一些模型,蒸馏抽取其实以及行业大模型,我们现在其实已经适配了大概10余种这样一种预训练模预训练这种模型,而这10余种模型都是通过我们的一个大模型的一种分发抽取所得到的得到的,然后它在相应的行业上其实是得到了一种非常大的精度提升,同时也极大的减少了这样一个标注以及模型的迭代。Q: 机器视觉应用场景很多,不同场景图像角度,物体尺寸等影响因素很多,我们预训练是采用什么类型数据和学习任务?如果想落地某些特定场景还需要多少数据对特定任务进行模型微调?大模型如何保证端侧性能?张晓鹏博士:这一共有三个问题其实问的非常好,然后其实针对整个在机器视觉图像它的不同的角度,就是说整个整个或者刚才提到的可能不同的变化,其实我们采取的方法其实非常简单,其实一我们可能有海量的,数据集这个数据集规模其实已经达到了一级甚至10亿级这样一种规模,我们相信海量的数据集它是能够建模我们在实际场景的方方面面。另外一个我们采取了什么样的这种学习方式,其实它的一个核心思想就是2019年开始比较火。这样一种对比度之间都学习的方法,然后当然了我们这上面做了很多改进,包括如何来利用一些弱标签的信息,包括如何把这种全局的信息拓展到局部,来更好的建模它在局部的一种相关性关系。然后刚才同时的话也会就是说呼应了刚才提到的我有不同的视角,不同的这种角度,不同尺度问题,那么怎么来让它进行高效的建模?其实这里面就是让它不同的数据增强,我们在其实预训练算法里面是集成了数千余种的这样一种数据增强方法,然后让他通过不同的数据增强,然后让这个模型具有针对不同数据增强它的不变性来建模。Q:华为的预训练模型是如何结合不同行业知识,解决标注数据大的问题?张晓鹏博士:举一个就是我们HDC上发布的国网电力的巡检的例子,其实这就是一个非常典型的我们的视觉预训练大模型来如何解决这样一个行业知识。在这样一种国网电力的过程中,其实它有一些海量的数据,然后标注是非常困难,我们做了一个什么事情,就是我们通过我们的视觉医学的算法,然后在海量的这样一种巡检数据上进行了一一个批次的预训练。然后医学院其实是利用了我们无人机巡检的就是数10tb就是说上百万的这样一种规模的数量,然后来进行一种预训练。然后它的预训练其实是可以看到我们非常多的数据它的内在分布,然后由于我们的大模型模型参数量越大,然后我们也看了更多的数据,然后所以说它能够更好的建模,就是说在电力行业它的无人机巡检过程中的的一些,图片之间的细微的差异。然后我们当时也给了一个数字,就是说我们利用我们的视觉预训练大模型,然后它能够提供更好的一个表征以后,因为它的一个缺陷和正常样本的一种表征能力更强,我们在标注代价上基本上是减少了80%以上。一块的话整个在人力代价上是一个非常大的提升。另外一个就是减少标注,其实就是我们一个模型其实是可以适配我们电力行业的100多种缺陷,我们这个适配100多种缺陷的话,就让模型的迭代周期大大的减少。我们大概减少了就是说整个把迭代周期减少了10倍。然后这样子的话我们在每次迭代的过程中更少,就是说我反馈给人需要标注的这样一种整体的工作量就会越少,所以说通过这两种模式,然后我们实现了在电力这样一个行业方面,利用我们的这样一种视觉医学的模型,极大的提升了我们的一种开发效率。本文来源:https://bbs.huaweicloud.com/blogs/263786
  • [技术干货] 华为云细粒度文本情感分析及应用-华为云 NLP算法专家分享
    分享嘉宾:李明磊博士 华为云 NLP算法专家编辑整理:付一韬出品平台:DataFunTalk导读:随着移动互联网的普及,网络上每天产生大量的文本数据,蕴含着巨大的有价值信息。情感分析作为自然语言处理中的一个重要研究方向。在实践中有着广泛的应用,如商品评论分析、政治、金融、旅游等领域中的商品推荐、产品辅助决策、公司政府的舆情监测、服务评价等等。本文主要介绍情感分析的概念、应用、任务和方法,进一步会介绍华为云在细粒度情感分析方面的实践,包括属性级情感分析和观点四元组分析。主要内容包括:文本情感分析介绍属性级情感分析观点四元组分析总结一、情感分析介绍首先介绍下文本情感分析的基本概念。情感分析,主要是识别媒介中目标对象的情感,这里面可能有两个概念比较容易混淆,一个是sentiment analysis,另一个是emotion analysis。一般我们说的情感分析都是sentiment,主要指的正面和负面的分析,然后emotion会更详细一些,它不仅包含正负面,还包含比如说生气、开心、高兴这些,会更加细粒度一些。我们主要分析sentiment,从分析对象来看会包含文本、图像、语音,EEG(脑电波)、多模态分析情感。从任务方面来看,不仅是有情感的识别,还有情感生成的一些任务,像现在有情感对话的生成,还有虚拟人情感生成。在本报告中,主要侧重文本方面的情感识别。1. 文本情感分析上面文本情感分析五要素定义是采用刘冰老师的定义,这个定义分为了实体 ( entity )、实体的某一个方面 ( aspect )、针对这个实体的情感正负面 ( opinion=sentiment,即情感正负面也称作观点正负面 )、观点持有者 ( hold ) 和持有观点的时间 ( time ) 这五要素,一般来说hold和time文本很少提及。另一个概念一般会把entity和aspect合并在一起成为一个target,是针对我们目标对象的情感或者观点。例如:“我觉得华为手机的拍照非常牛逼”这里面对应的实体是“华为手机”,对应的aspect是“拍照”,对应的情感是“非常牛逼”为正面,对应的观点持有者是“我”,而时间没有提及所以为空。当前的文本情感分析就是根据输入文本,然后识别其中这五要素里的几个要素,现在还没有相关工作可以同时识别出五个要素。一般的话现在最简单的情感分析是只识别出这个文本的观点/情感,既不包含实体也不包含aspect并且也不包含观点持有者,再进一步的工作就是识别出针对哪一个aspect(实体)的观点(情感)。这里简单介绍一些细粒度情感分析和我们说的一般情感分析的区别。一般的情感分析都是直接识别整个文本的正负面,然而细粒度情感分析会更细一些,这里面有两个概念,一个是从情感的粒度上会更细,比如从sentiment到emotion的情感粒度升级,之前我们只分析正负面,现在除了正负面还有情绪,如高兴、伤心等,从情感这个维度讲这是一种细粒度情感分析。还有一个是从分析对象的角度来讲,之前的情感分析是直接识别整个句子或整篇文章的情感,它不区分情感对象是谁,再细粒度一些的话就需要识别出整个句子里面情感针对的对象是谁,它是句子里的某个实体或者是某个实体的某个属性,从这个角度这也是细粒度情感分析的一种,我们今天主要侧重第二个针对对象角度的情感分析。2. 情感分析任务下面介绍一下情感分析的各个任务,这里面分析是情感的识别,不包含生成,还有前面提到的语音图片也不涉及。针对文本的情感分析会分成几个等级:词级别的情感分析:这个类似于情感词典的构建,怎么去构建一个大规模的情感词典,比如“车祸”这个词对应的情感就是负面的,“生日”这个词对应的情感就是正面的。句子/文档级的情感分析:我们现在用比较多的,各大云服务厂商都会有的一个服务,针对句子或者文档的情感分析,输入一句话返回相应的情感正负面,但它不区分正负面针对哪一个句子里面哪个实体或者哪个对象。目标级的情感分析:这是我们今天侧重的目标级的细粒度情感分析,这里面的目标就是上边说的target,它可以是一个实体也可以是一个属性,还可以是实体+属性的组合形式。对于目标级的情感分析分为三种:针对属性的情感分析 ( TG-ABSA ):这里面对象是固定然后只分析里面某几个属性的正负面,这就会涉及到两个任务,一个是对象的属性识别,另一个是该属性的情感识别。例如图中的例子“外观XXX”,这里的对象是固定说的是手机,我们只需要识别出其中的属性外观、内存和性能,然后分别识别出各个属性的情感正负面。针对属性识别也分成两个任务,一是属性词的抽取,就是我们要定位出属性描述词在文中的位置,另一个是该属性描述词对应的属性类别,因为针对某个属性的描述可能是“外观”也可能是“看起来很好看”,它这个描述不一定包含显性的属性描述词。针对情感识别会分为观点词抽取和观点分类。针对实体的情感分析 ( TN-ABSA ):这里是文本中只有实体而没有属性,只针对实体的情感进行分析,这涉及到的两个任务,实体识别和情感识别。实体识别分为实体词抽取和实体分类,情感识别分为观点词抽取和观点分类。针对目标的情感分析 ( T-ABSA ):这里面的目标就是实体+属性的组合,例如:“小米性价比”、“华为拍照”等,这会比上面两个任务相对更细一些。目标识别分为目标词抽取和目标分类,情感识别分为观点词抽取和观点分类。针对情感分析,简单介绍一些方法简史。最早的一个方法是基于字典加规则的方式,我们人工构建一个情感词典,每个词都有对应的正负面,然后根据句子中正面词和负面词的数量,最后做一个投票,这是一个最简单的方法。后边就有了基于机器学习的方法,像传统的机器学习SVM等,将情感词典和词袋作为它的一个特征。再进一步就是深度学习,还有就是现在的基于预训练语言模型+fine tune的方法,应该是现在效果最好的一个方法。二、属性级情感分析下边我介绍一下我们其中的一个工作,属性级情感分析(TG-ABSA),这里面实体是固定的,分析它各个属性的正负面。像上面句子级情感分析是大部分厂商提供的,比如“买没几天就降价一点都不开心,闪存跑分就五百多点”,这个整体是负面,但是它针对价格和闪存两个属性都有相应情感,这里并没有区分。属性级情感分析这个任务就是给定属性的类别集合,然后预测它各个属性的正负面。其中,这里的表达也分为两种,一种是显式的观点表达,另一种是隐式的观点表达。显式的观点表达会显示提到属性的属性词和观点词,比如“手机内存非常大,系统流畅,性价比非常高”,这里属性词“内存”、“系统”和“性价比”都有显示的提到,而像“手机太贵了,颜值非常高,一点都不卡”,这里“手机太贵了”、“一点都不卡”表达的属性分别是“价格”和“性能”,但是没有相应的属性词。针对这两种不同的表达方式,处理方式是不一样的,后边会介绍一种专门针对显示的方法。1. 属性级情感分析—相关工作介绍① 无监督方法:最传统的一个方法是无监督的,这种方法的优势是不需要标注数据,比如使用基于句法解析的方法,先抽取句子里主语谓语宾语的表达方式,比如“服务员很漂亮”,通过抽到的主语“服务员”和它对应的形容词“漂亮”,这样我就可以知道它的评价对象是“服务员”,观点是“漂亮”,再根据查情感词典知道这是一个正面的情感,这样就可以得到针对服务员的评价是正面的。这种方法只能处理显示的表达,如果是隐式的表达,因为句子中没有属性词,那么通过句法解析没法得到对应的角色,所以无法分析来处理隐式的表达。这种无监督方法的优点是不需要标数据,缺点是准确率相对低一些,没法处理隐式表达。② 阅读理解方法:最近的一个工作是复旦邱锡鹏老师组提出的基于深度学习的方法,分析一个句子里面各个属性的正负面,他把这个问题转化成一个阅读理解的问题,本来一个句子有N个属性集合,他把句子和属性转换成句子-属性 pair。输入一个句子,这里面aspect可以描述成阅读理解的一个问你题,比如“针对外观评价是怎么样的”,这样转换成问答对的方式,然后基于Bert来识别这个问答对正负面的答案,这是一个比较新的工作。这种方式的优势是比较灵活,属性可以无限的扩充,不管是新增或者减少属性,都可以用这种方法直接取处理,而且准确率还比较高。但是这种方法的缺点就是它的效率相对要低一些,因为如果有N个属性,在预测的时候,它需要预测N次才能得到结果。2. 属性级情感分析—方案介绍我们提出了一个基于类似多标签,多任务的方法。整个任务给定属性类别集合,然后预测每个属性的正负面。这里面的难点是,首先我们大框架使用的是有监督的方法,因为最终我们想要把应用部署到华为云的服务上,所以准确率要求是比较高的,要求达到90%以上,一般无监督的方法无法满足,所以还是需要有监督的方法。这就需要标注数据,如果是多个属性它的一个问题就是标注起来比较困难,比如说一个手机评论可能会涉及到二三十个属性或者说甚至上百种属性,如果要标数据的话,这会非常的困难。我们的方法不同于传统的多标签分类,像文本多标签分类任务的类别有政治、经济、新闻,该任务只涉及标签是否出现,但这里不一样的地方是它不仅涉及到属性是否出现,还要预测出属性的正负面,相当于每个属性都要预测出它的三个标签—正面、负面和未出现。相当于每个属性是一个多分类任务而不是一个二分类任务。之前那种多标签分类,一般最后会把每个标签转化成logits,这里的话用这种方法就没办法处理。然后还有就是隐式表达。我们解决的技术思路是,把它转换成一个Multi-task多分类任务,每个属性都处理成一个多分类的任务,所以它输出不是二分类而是一个多分类。在标注数据的过程中,我们引入主动学习的思路,先标注一批少量的数据,然后用模型对剩余未标注的做一个预测,然后再对那些置信度比较低的再去人工审核标注这些数据,如果置信度比较高的就不用再标了,这样的话可以提高标注效率。另一个方法是,如果一个样本同时标注多个属性,这个标注成本是很高的,我们引入Label mask的思路,就是在训练的时候 某几个属性可能标也可能没标,如果没标的话就把这个属性mask掉,然后在计算loss的时候该属性就不参与计算了,只将那些已经标注的属性参与loss计算和反向传播的计算,这样的一个好处就是我在真正标注样本的时候想标注哪几个属性就标注哪几个属性,不用每个样本的所有属性都要标注,这样标注就更加灵活,可以先针对某一个属性只标注它,标完该属性后再标另一个属性,这实际上是一个很灵活的标注。使用这个方法的一个优势是,它最终基于深度学习模型,准确率比较高,也支持隐式的表达,因为深度学习可以编码各种语义的表达,还有一个就是我们这种方法可以提高标注效率。在中间编码这块可以是基于bert、roberta这种预训练语言模型,最终输出使用label mask的方法。3. 属性级情感分析—结果上面是我们最终的实验结果,针对汽车领域测试样本大概有7000多个,每个样本平均的属性数量是4.27个,其中预定义的属性集合是8个,最终可以看到每个属性的准确率都是很高的,基本上达到90%以上。针对手机领域的结果基本上也是每个属性F值基本上能达到将近90%。右上角的图是针对每个属性预测的标签的置信度的阈值,随着阈值的上升,命中的属性(即预测的标签的置信度在阈值以上的属性)准确率也在上升,而Attribute Hit Rate(即预测标签的置信度在阈值以上的属性占比)也随着阈值的上升而下降,即有些属性预测的标签的置信度低于阈值,但是命中的属性预测出标签的准确率是慢慢上升的,这个也是符合我们的一般认知的。这个的一个好处是最终产品上线之后,用户要求有一部分不需要人工审核,另一部分则需要人工审核,当达到某个阈值之后,他们就可以不用参与人工审核。通过调节阈值,让某些属性的指标达到了这个阈值,比如准确率都达到95%,这一部分就不需要人工审核。4. 属性级情感分析—应用案例这是我们基于多属性情感分析的一个应用案例,这是汽车领域的案例,针对网上很多的汽车领域的评论,我们可以分析汽车在八个属性维度上的正负面评价。上图左上角里红色的线就是一个行业的平均水平,蓝色的线是针对这个车它的各个维度的雷达图像,这样就可以很方便地对比出不同车型,它的一个好坏。可以方便用户在产品选型的时候做一个对比,也可以方便厂家针对评论本身对他们的产品做相应的改进。三、观点四元组分析1. 四元组观点挖掘—介绍上面讲到的虽然可以分析出各个属性的正负面,但是它的一个缺点是没办法定位出针对某个属性具体评价的属性描述词位置和观点描述的位置,因为有些用户不仅想要找到属性正负面,还要找到它对应的评价位置,所以我们这个工作是针对观点四元组进行挖掘的。观点四元组挖掘这个任务不仅要分析出各个属性的正负面,还要定位出它属性描述词的位置以及观点描述词的位置。比如“手机内存非常大”中属性描述词定位到“内存”,评价词定位“非常大”,对于“性价比非常高”这句话,属性描述词定位到“性价比”,观点描述定位到“非常高”,不仅要识别出属性的类别还要定位到位置,所以这里一共有四个要素要预测出来,分别是属性词、属性类别、评价词和评价极性,其中属性类别和评价极性在前面的工作已经做到了。2. 四元组观点挖掘—方案针对这个任务,我们提出了一个基于抽取加分类的联合模型,上图是我们现在采用的框架,底层是基于编码的模型,可以是bert或者roberta等,然后将句子编码成一个向量表示。图中左边这侧是用于定位属性描述位置和观点描述位置的,是一个序列标注模型,比如这里B_A是属性描述词起始位置,I_A则是在属性描述词中间的位置,例如这里“内存”和“颜色”都是属性描述词。在这里最上层用的是CRF序列标注模型来进行属性描述词的抽取。图中右边这侧对应的跟上面的工作有点类似了,有N个属性对应有N个输出,然后对应每个属性预测它的正负面和未出现这几类。左边做属性词抽取,右边做属性正负面预测,最终可以输出每个属性的四元组(属性类别,属性描述词,观点描述词,观点类别)。3. 四元组观点挖掘—数据标注这里的比较耗时间的工作就是数据标注,因此我们专门做了四元组观点挖掘的数据标注平台。上面“简单”这个分类标签是为了解决标注过程中有些不同标注人员他可能对同一个样本就会有冲突,他觉得这个样本比较难标或者好标的话这里就是用这进行区分,如果样本好标会打个“简单”的分类标签,如果让他觉得不确定,他会不打“简单”的标签,即“复杂”标签。因为我们标的属性比较多,涉及到差不多三四十个属性,这里做了一个对属性做了大致的分类。这里的标注任务是类似于关系抽取里面3元组的标注任务,先标注属性描述词,然后再标注它的观点描述词,这里面它两个其实是形成一个搭配关系,这个类似于一个三元组中实体和实体及他们的关系,只不过这里的关系是一种搭配的关系,将它们连起来就可以了,最后再加上它对应的正负面以及属性描述词对应的属性类别,这样每个样本的四元组就标出来了。上图左边是我们标注大概两万条手机评论的数据分布,其实可以看到数据分布式非常不均衡的。这个是拿到真实用户在线上评论的数据,有些评论会偏的非常多,然而有些类别评论会非常少。上图右边是针对所有属性对应正负面的分布,这个也是非常不均衡的,正面的评论比较多,负面的评论会相对少很多。4. 四元组观点挖掘—结果上图为我们最终的评价结果,因为它是一个四元组既包含分类也包含抽取,对于评价指标我们用了一个Fuzzy F1值。我们对每一个属性加正负面标签作为一个评价对象,比如“外观正”作为一个评价对象,然后去找它对应的位置,计算这个位置它们字符的重合率(包括观点描述词和属性描述词的重合率)这样去算它的F值。EM F1值是预测描述词的位置完全精准匹配,稍微有一点不对也算错,这个比前面的指标更加严格。在编码器这部分我们尝试了几个不同的编码器,包括bert、roberta还有nezha等。由于我们有很多未标注的数据,基于这些数据我们做了领域的预训练,然后再进行fine tune。右图展示了不同指标下的结果,可以看到在未标注数据上进行领域预训练的话是可以带了一个点的提升,Fuzzy F1能达到0.79。另外,这个评估指标对于人的实际感知不太直观,我们随机抽取500条数据进行人工评价。人工评价的过程是每个样本预测出每个属性标签和正负面且包括它们的位置,将这样的四元组抽取出来进行人工评价,判断预测是否合理,如果合理标记为1,如果不合理则标记为0,这样来看人工对模型预测的指标判断。人工评价的准确率是非常高的,差不多96%的准确率,即人工认为预测是合理的。这两个结果差别是比较大的,但也是比较合理的,因为在数据标注过程中,不同标注人员对观点描述词的位置以及属性描述的位置也可是会有歧义。比如“外观非常好看”这句话,有些人观点描述词会标“好看”,有些人就会标“非常好看”,这其实对最终预测结果影响不大,但是如果用字符重合率的方法,那会严重影响计算这个指标,所以说它两个差异比较大也是合理的。5. 四元组观点挖掘—Demo上图是我们一个简单的demo,输入一个样本,生成对应每个属性的正负面,当点击某个属性的时候它对应的评价词位置就可以高亮出来,红色代表属性描述词,绿色代表观点描述词。上面说的人工评价就是这些结果预测出来后,人工看看预测是否合理。四、总结本文主要介绍了情感分析的一些基本任务,包括文本、语音、图像还有生成、识别。对于文本情感分析任务做了详细介绍,重点介绍了两个工作,一个是属性级情感分析,这个是给定属性集合情况下,预测每个属性的正负面,我们将它构建成了一个多任务分类。另一个工作比上面的粒度更细一点,不仅要预测出属性正负面,还要定位出它具体的属性描述词和观点描述词的位置,我们把它做成了一个抽取加分类的多任务联合模型,既包括抽取也包括分类。对于未来的趋势,我们在实际做的过程中发现大家在工业界会碰到标注数据成本非常高的问题,每一个任务基本上我们需要标将近两万条数据,所以最终的效果准确率是比较高的。另一方面,对于模型加速这部分,由于使用深度学习像bert这种预训练模型,它的推理成本还是比较高的,我们华为可以对硬件进行底层适配。对于领域迁移未来也是关注重点,怎么能从更低成本从某一领域迁移到另一个领域,比如从汽车领域迁移到手机领域,或者从手机领域迁移到房地产领域等等。另外,还有自监督去训练超大规模的模型,比如像bert、roberta还有最近GPT3等等,这也是未来的趋势,然后再考虑如何将知识图谱加入到大模型当中进行知识增强来提升模型理解的效果。还有就是多模态这部分,怎么把图像、文本或者语音这些信息辅助来提升模型的效果。因为人在学习的时候不仅参考了文本的信息,还有视觉方面的信息等等。现在对于多模态情感分析我们也有一些工作正在做,比如说从视频中分析出一个人的情感,既考虑人脸的图像信息,也考虑他语音的一些信息,比如语气等等。今天的分享就到这里,谢谢大家。嘉宾介绍:李明磊,华为云NLP算法专家,博士毕业于香港理工大学,从事文本情感分析和情绪识别的研究,在TAC、ACL、EMNLP等发表论文多篇,获得IALP 2016 最佳论文奖,KSEM2017最佳学生论文奖。目前就职于华为云语音语义创新Lab,主要负责华为云文本分析、多模态分析等业务,所孵化服务已在多个实际业务场景中落地。团队DigScience2019,CCF BDCI 2019, WSDM Cup 2020比赛金牌。文章来源:https://mp.weixin.qq.com/s/yeiODUxkTpvi2AsghjbeeQ
  • [热门活动] 最新编程语言排行榜出炉!华为专家邀你一起学编程!
    新年将至,正是重新再出发的好时候。如果要学一门新的编程语言,该从哪个开始入手呢?不如来看下编程语言风向标:2021年最佳编程语言排行榜!近日,IEEE Spectrum发布的2021年度编程语言排行榜,与2020年排行榜相比,Python、Java、C、C++ 和JavaScript 依然占据 2021 排行榜的前 5 名。而在TIOBE编程语言社区发布的12月编程语言排行榜中,Python、C、Java、C++、C#也名列排行榜前5名,都展示出非常火热的发展势头。*图片来源于IEEE Spectrum、TIOBE编程语言没有好坏之分,重点在于应用。各技术社区编程语言排行榜,是编程语言流行趋势的一个指标,可以帮助程序员更好的了解自己所学的编程语言在市场中的竞争力。对于新入门及需要掌握多门编程语言的程序员来说,了解当下编程语言的热门程度是非常有必要的。免费精品课程推荐接下来给大家介绍一下排行前列且较稳定,最值得程序员学习的几个开发语言,同时给大家推荐一些适合自学的免费精品课程。稳居榜首的PythonPython是时下最为流行的编程语言之一,在诸多领域都有着广泛的应用;其优雅的语法、简单的规则让程序员在更短的时间内实现更多的功能。众所周知的JavaJava是目前使用最为广泛的网络编程语言之一,具有易学好用的特点,基于对象的编程更符合人的思维模式,使人们更容易编写程序;与平台无关是 Java 语言最大的优势。经久不衰的C语言当今主流编程语言中,C语言的历史最为悠远且经久不衰,在程序语言发展史上具有重要地位。C语言偏向于底层硬件交互,多用于系统软件开发,设备驱动开发以及嵌入式开发。其中著名的UNIX操作系统就是由C语言所开发。主导性非常强的C++C++是一门被广泛使用的现代编程语言,在兼顾性能和灵活的原则下拥有大量特性,它非常灵活,功能也非常强大,是可以在保证功能的前提下性能最高的语言之一。因互联网而生的JavaScriptJavaScript是一种在网络浏览器上运行的变成语言,这种语言我们称之为脚本语言。它因互联网而生,紧跟浏览器的发展而发展。开发语言大讲堂华为云培训中心官方推出Python,Java,C,C++,Rust,JavaScript等免费精品课程。非常适合打算自学编程语言,或者仅有部分闲暇时间学习编程语言的学员。由华为云专家精心打造课程配合“课程+测评+实战+认证”四步帮助你0基础从入门到精通通过自主“学测练考”不仅能让你对开发语言有整体概念还可以帮助你培养编程思维!此外,通过学习,还可获取华为云官方认证证书,赢取富士INSTAX 一次成像相机、京东3D颈肩按 摩披肩、无线榨汁机、充电宝、帆布包、无线鼠标等1000+好礼!扫描下方二维码了解详情活动日期:即日起截至3月27日课程免费、实验免费奖品有限,发完即止还等什么,马上占位吧!
  • [公告] 【必看】技术问题求助发帖流程指引
    技术专家组论坛专家组专家昵称邮箱备注谢嘉亮 双倍芝士xiejialiang2@huawei.com蔡春福T_Tcaichunfu3@huawei.com钟京添北极starzhongjingtian@huawei.com程泽hi-kylechengze1@huawei.com张凡张先生爱喝茶zhangfan142@huawei.com万林祥kevin.wanwanlinxiang@huawei.com肖威木桑葚-xiaowei34@huawei.com*保障SLA内答复问题。1、进入华为云社区“开发者技术支持社区”板块,选择“发表主题”;2、进入“发表帖子”页面3、选择“选择主题分类”和“选择子分类”标签,如:选择“技术问题”—》“大数据类”。说明:(1)“选择主题分类”在下拉列表中选择“技术问题”;     (2)“选择子分类”在下拉列表中选择与求助问题相关主题,如大数据、AI、数据库等。4、在文本框中描述问题或者上传问题附件。来源: 【必看】技术问题求助发帖流程指引
  • [全栈开发者] 【物联网全栈成长计划】11月23日直播专家坐堂及课后作业打卡帖
    各位亲爱的小伙伴【物联网全栈成长计划】正在火热招募中物联网全栈活动介绍传送>>>>>>>>10月27日 迎来了Vz老师带来的开篇直播-【浅谈物联网初识入门】完成直播课后作业可得活动+30积分,打卡时间截止至12月05日直播课后作业与回看请点击这里这里这里>>>>>>>>>>>>>11月23日 19:00 也迎来了Vz老师带来的第二场直播-【一节课入门物联网应用开发】直播链接与回看传送>>>>>>>>>>>>>本次直播的主要内容是1.应用开发基础知识介绍2.物联网平台应用侧API介绍3.物联网行业应用典型案例介绍4.应用开发实践分享本帖提供给大家提问与作业打卡01.提问>>>>>看过直播或回看的小伙伴们有没有对老师的讲课留下疑问或想要问老师些技术性问题如果有的话,请小伙伴们在回复帖中留下你的问题,老师会定期回复你的问题哦~抓住机会跟大厂专家来场线上battle吧~02.直播后小作业>>>>>看过直播或回看的小伙伴们肯定也看到了老师在课后给大家留了一个小作业-【物联网专业测评打卡】根据物联网全栈活动规则-完成本次直播小作业并按要求反馈结果的用户可获得活动额外加成 30积分直播小作业的要求请下拉查看,请大家认真阅读本次作业的难易程度:★★☆   直播小作业提交时间:即日起-2021年12月05日(之前完成本个测评的同学可以直接截图回复到本帖下方)直播小作业打卡方式:按要求将必要测评要求截图+华为云帐号+昵称回复到本帖评论区,经过审核后可获得对应30积分,积分会每周反馈在积分榜中直播小作业步骤与要求见下方1. 点击链接进入测评平台:https://devcloud.huaweicloud.com/expert/assessment/skill2. 下拉对话框选择指定测评能力岗位:物联网工程师3. 选择自己适合的任一等级点击进入完成测评,达到80分以上即为通过4. 通过测评后即可点亮徽章,之后请大家将测评通过截图+点亮的徽章截图,按要求回复到本帖评论区    回复正确格式举例:grandmaster(自己的华为云账号)+技能测评截图(2张)大家积极参与起来哦,最后的大奖说不定就是你的啦~~~物联网全栈活动积分奖励 本次课程不仅免费跟大厂大佬们学习干货和知识,更重要的是:跟随课程更新,打卡学习任务,获得专属积分每次有效提交的学习任务都会得到对应积分,每阶段根据积分排行会有对应的实物奖品全阶段累计积分最高者可获得HUAWEI GT2 智能手表,还有智能手环和智能保温杯等奖品等着你哦~总阶段积分奖励物联网全栈活动注意事项1. 学习任务提交后,小助手会在整个阶段学习周期内,按序完成审核,并增加活动积分;2 请务必按照上述要求提交内容,以免影响积分增加;3. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:推荐应用构建与赛事打卡>相关认证与沙箱>直播小作业>阶段考核>技术文章>问答官排位赛>限时积分赛4. 其他积分获取方式请查看活动社群公告;5. 回帖已设置仅小助手可见,请大家按要求回复哦,不会外泄大家的隐私呢~想了解更多关于课程内容请移步主帖:【物联网全栈成长计划】0基础34课时,变身高阶物联网能力者,免费学还有智能穿戴!
  • [全栈开发者] 【大数据全栈成长计划】问答官排位赛打卡帖 +2积分
    为的就是让大家巩固学习成果,紧跟学习进度现推出【问答官排位赛】,请各位同学详细查看本帖说明按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~》》参与活动前请先点击这里报名活动《《任务时间2021.11.01-2021.12.19 23:59参与方式&规则用户在本帖里发布自己在学习大前端技术中产生的疑惑或实践问题,其他用户可通过在楼层下评论参与回答。1. 同一ID不可自问自答;2. 同一ID可回复其他同一ID问题数量需≤3次,如,A最多可回答B的三个问题,但A可回答B、C、D、E、F等多人次问题。3. 每个人最多可发布10个有效问题,不可重复,不可灌水。4. 每个ID回答次数不设上限,但是否被采纳要依据专家评审后的结果。 活动奖励由专家经过评审:◎每个有效提问可获得2积分。上限为10个问题,20积分;不得灌水,不得与他人显示,问题具有意义,占楼无效。◎有效提问标准:在本次课程学习中遇到的实际问题,如下图所示:有效提问示例:◎无效提问:与课程相关但偏离学习课程内容,且在网页中可直接搜索出(举例:原理是什么?操作方式有哪些?等等),如下图所示:无效提问示例:◎同一问题下确定一名最佳答案,活动结束后,会根据排位赛积分情况,由专家根据问题质量评选出5名优秀答题官,获取额外10积分奖励。更多活动信息请查看:https://bbs.huaweicloud.com/forum/thread-166386-1-1.html
  • [指令翻译工具] 关于exagear中从二进制文件转换成IR语言的一点疑问
    各位专家你们好,我在网上看的吕研冬老师关于二进制翻译的介绍,有点疑惑请教下你们。这里从guest binary是二进制文件,后面红框这里,front-end 这里guest arch encoder是什么意思?难道不是直接从二进制文件转换成IR语言文件吗?非常希望得到各位专家的解答!
  • [专家内容共创任务] 1024,懂你所需,予你温暖,致敬新时代可爱的程序员们
    1024,在很多人眼里可能是个平平无奇的周日,但于程序员而言,这是他们专属的节日——程序员节。在这个特殊的日子里,蛋花向每一位程序员致敬,感谢可爱的你们为新时代进步作出的努力,并提前送上最诚挚的礼物——有奖征文,参与有奖。1024,一级棒(1GB)的你们,节日快乐!今天无BUG,今晚不加班!写作有礼:华为云社区将会不定期发布内容共创任务,报名者领取并完成,即可获得相应奖励。签约作者有礼:连续2期活动获得优秀作者(输出内容满分)即可成为华为云签约作者。推荐有礼:成功推荐好友参与写作计划即可获得华为云开发者盲盒。01.任务介绍文章编辑整理类:针对音视频、PDF等文件进行文章整理,准确度高,体现技术重点,形成可读性较强的文章,图文结合,标题具有吸引力,字数根据实际文件内容进行要求。专题内容整理类:将华为云社区优质内容按照专题类别编辑整理成册,形成合集。内容翻译类:针对海外优质内容进行翻译整理,准确度高,可读性强。主题创作类:根据指定主题进行博文撰写。高热度Q&A整理类:按产品类别筛选论坛近3个月的常见问题和答复。科普教程:开发者教程视频转化,如:大前端全栈成长计划课程内容转化,可以是开发技术技巧,或开发心得体会。其他更多任务不定期更新。02.奖励(1)根据文章字数、文章质量、文章阅读量等主要指标,华为云社区编辑部进行综合考核,给与奖励,50~300元/篇(以京东卡或等值社区礼品形式进行发放)。(2)连续2期活动(输出内容2篇以上,且均获得满分)获得优秀作者即可认证华为云签约作者。可享有如下权益:(3)成功邀请好友参与写作计划,即可获得华为云开发者盲盒。将华为云小助手蛋花微信名片推给好友添加;或直接添加蛋花微信,备注推荐人微信号,添加后好友成功参与写作计划,交稿反馈博客链接即算成功邀请。优秀的你准备好接招了吗?点此立即报名03.任务领取第一波任务:将以下16个专家直播视频内容编辑整理成为技术文章,每个任务仅限由1人完成。第二波任务:论坛热门问题、答案整理。第三波任务:主题创作-根据如下主题进行撰写博文或整理专题。每人报名时可选取1个任务,请先私信联系华为云小助手蛋花获取任务,再报名。任务主题参考链接/方向120年华为扫地僧,揭开亿万级路灯互联的智能奥秘!2硬核对话 攻城狮vs攻城狮PLUS3自动售货机数据传输背后的智能奥秘4一场人、车、路的智能对话5华为扫地僧带你探索城市物联网背后的奥秘6华为云IoT智简联接,开启物联世界新**7基于物联网平台构建智慧路灯8基于IoT设备接入,实现物联网设备智能的奥秘9揭秘华为园区智能化管理背后的“黑科技”10华为云IoT数据分析资产建模如何支撑企业快速构建数字孪生体11华为云音视频极简接入与开发动手实战12Serverless和云原生应用一站式高效开发解密13华为云Stack构筑繁荣行业生态,让伙伴用好云14基础设施感知业务需求,AI业务基于Volcano的实践15华为全联接2021 智能基座专场16华为专家亲授大厂必备技能,高薪Offer等你来拿!17IoT近3个月热门问题和答案整理18EI近3个月热门问题和答案整理19鲲鹏近3个月热门问题和答案整理20智慧园区近3个月热门问题和答案整理21昇腾近3个月热门问题和答案整理22任意产品实践案例撰写23怎么学习单片机,应该如何入门?是什么?如何学习,需要学习哪些知识,如何入门24物联网究竟是什么?有哪些领域?物联网涉及哪些主要技术,至少列举两个能够运用的领域25边缘计算是什么,和云计算的区别是什么?分别介绍是什么及二者的区别26什么是数字化?又为什么要数字化转型?说明数字化的底层技术支撑,及数字化转型过程中面临最大的挑战和问题27物联网开发板各种各样,要怎么选择?对比小熊派阐述物联网开发板的作用,并列举常见开发板,与小熊派开发板进行对比28嵌入式与单片机之间的关系是什么?分别介绍是什么及二者的区别和联系04.文章输出要求文章内容需准确度高,体现技术重点,形成可读性较强的文章,请不要单纯的复制粘贴材料里的内容,文章字数不少于2000字(高热度Q&A整理不少于1000字),以Word文档形式输出。1、文字精练:通过严谨和专业的文字进行文章整理,不可直接复制速记内容,无错别字;2、思路清晰:整篇文章逻辑清晰,观点输出准确,语句通顺;3、结构工整:结构分明,排版工整,文中需要用小标题进行分割(不能单纯是数字);4、图文并茂:“一图胜千言”,能够在文中准确的配图,让文章内容更加丰富;5、引人入胜:文章标题、内容具有吸引力,抓人眼球,文采好,为加分项。6、按时交稿:延迟交稿或扣减相应分数。※写作前请查阅《审稿人寄语》哦~05 参考案例1、从GaussDB(for MySQL)看全自研数据库的正确打开方式【内容转译】视频链接:https://bbs.huaweicloud.com/videos/103466文章链接:https://bbs.huaweicloud.com/blogs/1998912、ModelArts精品FAQ汇总【高热Q&A】论坛链接:https://bbs.huaweicloud.com/forum/forum-567-1.html文章链接:https://bbs.huaweicloud.com/forum/thread-48984-1-1.html06.报名方式点此立即报名名额有限,先到先得!请先私信联系华为云小助手蛋花获取任务,再报名。07.交稿时间2021年10月25日之前如有任何问题,可添加华为云小助手蛋花微信号:Huawei-danhua,进行沟通咨询。添加微信时请务必备注:内容共创+报名活动时使用的华为云昵称。附件:8-基于华为云IoT设备接入,实现物联网设备智能的奥秘.pdf1.97MB下载次数:1次附件:【云驻共创】审稿人的寄语0825.pdf188.21KB下载次数:2次附件:任务1-5素材.rar10.84MB下载次数:1次附件:9-揭秘华为园区智能化管理背后的“黑科技”.pdf4.37MB下载次数:0次
  • [全栈开发者] 已结束【物联网全栈成长计划】10月27日开篇直播专家坐堂及课后作业打卡帖
    各位亲爱的小伙伴【物联网全栈成长计划】正在火热招募中物联网全栈活动介绍传送>>>>>>>>10月27日 19:00 也迎来了Vz老师带来的开篇直播-【浅谈物联网初识入门】直播链接与回看传送>>>>>>>>>>>>>本次直播的主要内容是1.IoT的概念、发展趋势与挑战2.IoT关键技术、平台能力3.设备侧开发介绍4.应用侧开发介绍01.提问>>>>>看过直播或回看的小伙伴们有没有对老师的讲课留下疑问或想要问老师些技术性问题如果有的话,请小伙伴们在回复帖中留下你的问题,老师会定期回复你的问题哦~抓住机会跟大厂专家来场线上battle吧~02.直播后小作业>>>>>看过直播或回看的小伙伴们肯定也看到了老师在课后给大家留了一个小作业-【物联网平台接口调用实验】根据物联网全栈活动规则-完成本次直播小作业并按要求反馈结果的用户可获得活动额外加成 30积分直播小作业的操作手册与详细打卡要求已放在本帖附件处,大家可以下载并完成本次作业的难易程度:★☆    只要好好听完本次直播内容就可完成本次直播作业哦~直播小作业提交时间:即日起-2021年12月05日直播小作业打卡方式:按文档要求将必要打卡点截图+华为云帐号+昵称回复到本帖评论区,经专家评定通过后即可获得对应30积分,积分会每周反馈在积分榜中详细打卡点要求在操作文档最下方注意:本次作业开发环境分为【需开发板】和【无需开发板】两种模式,运行结果相同,大家可以选择适合自己的环境完成作业打卡点:请将当前页面截图,截图要求1.第一张截图为设备详情,注明所属产品(产品名称由账号名_XXX组成)与设备id2.第二张截图能够看到查询设备影子调试成功的页面,并且device_id与上图设备id相一致。(具体操作手册和打卡要求请大家点击附件中的操作手册查看哈)回复参照,举个栗子:grandmaster+华为云小助手01+打卡点截图大家积极参与起来哦,最后的大奖说不定就是你的啦~~~物联网全栈活动积分奖励 本次课程不仅免费跟大厂大佬们学习干货和知识,更重要的是:跟随课程更新,打卡学习任务,获得专属积分每次有效提交的学习任务都会得到对应积分,每阶段根据积分排行会有对应的实物奖品全阶段累计积分最高者可获得HUAWEI GT2 智能手表,还有智能手环和智能保温杯等奖品等着你哦~总阶段积分奖励物联网全栈活动注意事项1. 学习任务提交后,小助手会在整个阶段学习周期内,按序完成审核,并增加活动积分;2 请务必按照上述要求提交内容,以免影响积分增加;3. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:推荐应用构建与赛事打卡>相关认证与沙箱>直播小作业>阶段考核>技术文章>问答官排位赛>限时积分赛4. 其他积分获取方式请查看活动社群公告;5. 回帖已设置仅小助手可见,请大家按要求回复哦,不会外泄大家的隐私呢~想了解更多关于课程内容请移步主帖:【物联网全栈成长计划】0基础34课时,变身高阶物联网能力者,免费学还有智能穿戴!
总条数:710 到第
上滑加载中