• [问题求助] 【GaussDB】【AI数据挖掘】对个人开发者免费么?
    【功能模块】想利用GaussDB 存储5-40万条 数据,为天线的结构尺寸和天线全频段的S参数,并通过ModelArts做正向、逆向天线设计。类似ANTENNA MAGUS主要是研究探索用,想问HW是有免费的存储方案么?穷人一个。GaussDB 连接应该顺畅吧?之前试过OBS没问题。【操作步骤&问题现象】1、2、【截图信息】【日志信息】(可选,上传日志内容或者附件)
  • [技术干货] 【历史上的今天】4 月 23 日:YouTube 上传第一个视频;网易云音乐正式上线;数字音频播放器的发明者出生【转载】
    透过「历史上的今天」,从过去看未来,从现在亦可以改变未来。今天是 2022 年 4 月 23 日,世界读书日。在 1564 年的这一天,全世界最卓越的文学家之一莎士比亚出生;1616 年的这一天,莎士比亚与西班牙最伟大的作家塞万提斯辞世。还有其他一些伟大作家的生卒日也在这一天,如诺贝尔文学奖得主拉克斯内斯、俄国作家纳博科夫。1995 年,联合国教科文组织规定 4 月 23 日为世界图书与版权日,简称“世界读书日”。回顾计算机历史上的 4 月 23 日,这一天又发生过哪些关键事件呢?1956 年 4 月 23 日:数字音频播放器的发明者 Kane Kramer 出生凯恩·克雷默(Kane Kramer)出生于 1956 年 4 月 23 日,他是英国的一位发明家。在 1979 年,也就是他 23 岁的时候,他发明了一种名为 IXI 的音乐播放器;这枚播放器只有信用卡大小,其上方有一个长方形的屏幕,下方有四个方向的按钮,音乐则储存在一个可更换的芯片之中。不仅如此,克雷默在当时就提出了用电话线传播音乐的想法。他为这个发明注册了全球专利,但是在 1988 年,因为没有足够的钱给专利延期,专利进入了公有领域。在 2007 年,Burst.com 声称苹果公司的 iPod 侵犯了自己的专利权,苹果请克雷默到美国说明他的发明早于 Burst.com 的专利。之后两家公司达成了和解。不过,作为 iPod 的概念的发明人,克莱默并没有从中获得许多经济利益。他自称买不起 iPod,而苹果公司送给他的 iPod 也被他用坏了。如今,克雷默仍在便携式数据处理和存储系统等技术领域工作,他是英国发明家协会主席和英国发明展和世界发明奖的组织者,业余时间他会拍拍电影、组织音乐会,陶冶情操。2005 年 4 月 23 日:YouTube 上传第一个视频YouTube 成立于 2005 年 2 月,由三名前 PayPal 雇员:查得·贺利、陈士骏、贾德·卡林姆创办;同年 4 月 23 日,YouTube 第一部上传视频,标题为“我在动物园”。在为 PayPal 工作前,查德于宾州印第安那大学学习设计,陈士骏则共同在伊利诺伊大学厄巴纳-尚佩恩分校学习计算机科学。YouTube 创办的原意是为了方便朋友之间分享录视频段,后来逐渐成为网友的回忆存储库和作品发布场所。就像许多以新技术创业的公司,YouTube 开始时亦是靠天使投资者注资创立,办公室也只是在一间简陋的车库内。2006 年 11 月,Google 公司以 16.5 亿美元收购 YouTube,并把其当作一间子公司来经营。Google 最初对于如何透过 YouTube 盈利,一直保持着谨慎的态度。收购后的 YouTube 依然风靡全球网络用户。花旗银行分析师认为,以 2012 年计算,Google 从 YouTube 获得 24 亿美元的收入。无 Google 账号的用户仍可以观看 YouTube 中的视频,但无法上传视频及留言。注册用户可以无限量上传视频。如今,YouTube 已经成为影音网站的翘楚,不单在娱乐音乐市场上吸引观众,又成功把庞大流量转变为社区平台,并激发网上创作产业,例如每年 YouTube 名人的演出 YouTube FanFest 等收看人数与收入都相当惊人,同时企业则申请官方账号用作广告与在线传媒、NGO 的推广公关等等,成为又一段硅谷文化新创成功的经营典范,当然也是因为硬件支持,才能承受庞大的信息量而发展起来,还有恰好的创业时机换来的知名度与其爆红效应。尽管有大量用户支持,但同类型网站激烈竞争下内容更变得重要,因此,近几年 YouTube 的眼光开始投向网络知名制作者;YouTube 对这些拥有百万订阅的人十分器重,会给予他们奖杯反馈与官方聚会活动邀请、以及更高的薪资分红等等(这类职业化的视频创作者被称为 YouTuber)。追求高点击率,已经成为世界上许多人获取财富的方式之一。2013 年 4 月 23 日:网易云音乐正式上线网易云音乐(NetEase Cloud Music)是中国网易公司自 2013 年 4 月 23 日基于网易云服务推出的一个音乐平台,除了提供主要的音乐播放、下载与查找服务外,还提供音乐社交功能,如歌曲评论、声学指纹(听歌识曲)、根据历史播放记录的歌单推荐、地理位置识别等。网易云音乐以其个性化推荐(包括每日推荐、私人FM、心动模式)为卖点,一经推出便在当年的应用市场走红。网易云音乐现支持 iOS、Android、Windows、 Linux 在内的多个操作系统。截至 2017 年 11 月,网易云音乐用户数量超过 4 亿,用户创建歌单达 4 亿个,用户评论数达 4 亿个。由于许多唱片公司(如 King Records)要求向用户收取数字专辑的费用,网易云音乐上越来越多的音乐开始转变为付费收听和下载的模式,无损格式的音乐则全部收费,还有一部分音乐由于网易暂未获取授权而不能播放;在 2018 年 3 月移动端的 5.0.0 更新后,网易云重构了移动端的用户界面,将原本不太引人注意的视频模块放置到了首页。这意味着网易开始重视云音乐的短视频功能。原文链接:https://blog.csdn.net/Byeweiyang/article/details/124361554
  • [资料文档] MDC300AI推理sample问题
    【功能模块】【操作步骤&问题现象】1、按照sample示例工程使用指南完成AI推理sample的前面步骤;2、将其拷贝到MDC300mini0 HwHiAiUser用户下执行,出现sudo: unable to resolve host mini0: Resource temporarily unavailable,能完成推理,请问是什么原因?【截图信息】【日志信息】(可选,上传日志内容或者附件)
  • [其他] AI助力社会管理
    看这是一个垃圾箱不上盖,垃圾极有可能落地的: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/17/1650193828868858112.png) 这是一个骑电动车,不带头盔的: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/17/1650193843513178281.png) 这是隧道下道路上有积水的: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/17/1650193904128858983.png) 这些AI科技运用于社会的日常管理,那是可以大大的提高管理效率啊。
  • [技术干货] 论文解读:Database Meets AI
    本文对清华大学李国良教授团队论文《Database Meets AI:A Survey》进行解读。一、概述随着数据库近年来的不断发展,数据库开始与各项新兴技术结合,如人工智能、区块链、密态计算等。本篇论文所涉及的是数据库与人工智能结合的探索,二者的结合是一种双赢,数据库和人工智能都能从这次结合中受益:一方面,人工智能可以使数据库更加智能化(AI4DB)。传统的经验数据库优化技术难以满足大规模数据库实例、各种应用程序和多样化用户的高性能要求,尤其是在云上。而幸运的是,人工智能基于学习的技术可以缓解这个问题。另一方面,数据库技术可以优化AI模型(DB4AI)。例如,人工智能很难在实际应用中部署,因为它需要开发人员编写复杂的代码和训练复杂的模型。数据库技术可用于降低使用人工智能模型的复杂性,加速人工智能算法,并在数据库中提供人工智能功能。下图所示,为论文关于两种模型的主要研究内容:对于AI4DB,文章研究了基于学习的配置调优、优化器、索引/视图顾问和安全性方面的技术;对于DB4AI,文章研究了面向AI的声明性语言、面向AI的数据治理、训练加速和推理加速。二、AI4DB传统的数据库设计基于经验方法和规范,需要人工参与(例如DBA)来调整和维护数据库。人工智能技术被用来缓解这些限制,下图所示为机器学习能为数据库带来的一些技术突破:我们从上图中选取一些AI优化DB的现有技术进行介绍:1)基于学习的数据库配置(1) 旋钮调节数据库旋钮的数量庞大且关系复杂。DBA通常擅长于特定的数据库,并且需要相对较长的时间。显然,DBA无法扩展到云数据库上的数百万个数据库实例。但是通过基于学习的技术自动调整旋钮,可以探索更多旋钮组合空间并推荐高质量旋钮值,从而获得比DBA更好的结果。(2) 索引/视图顾问数据库索引和视图对于实现高性能非常重要。然而,传统数据库高度依赖DBA来构建和维护索引和视图。由于存在大量列/表组合,因此推荐和构建适当的索引/视图的成本很高。最近,有一些基于学习的工作可以自动推荐和维护索引和视图。(3) SQL重写器许多SQL程序员无法编写高质量的SQL,因此需要重写SQL查询以提高性能。例如,嵌套查询会被重写为连接查询来使一些SQL优化可用。现有方法采用基于规则的策略,使用一些预定义的规则重写SQL查询。然而,这些基于规则的方法依赖于高质量的规则,这些规则过多。因此,深度强化学习可用于明智地选择适当的规则,并以良好的顺序应用规则。2)基于学习的数据库优化(1)基数/成本估算数据库选择优化策略需要依靠成本和技术估计,但传统技术无法有效捕获不同列/表之间的相关性,因此无法提供高质量的估计。这时候通过使用深度神经网络捕捉相关性来估计成本和基数,从而获得更好的结果。(2)连接顺序选择。一个SQL查询可能有数百万甚至数十亿个可能的计划,高效地找到一个好的计划非常重要。传统的优化器并不能在数以万计的表里找到合适的连接顺序,因为探索巨大的计划空间成本相当高,这时我们可以利用深度强化学习去自动选择好的计划。(3)端到端优化器。一个成熟的优化器不仅要有好的代价估计和连接顺序,而且还需要考虑索引和视图,并且设计端到端优化器是很重要的。因此可以通过使用深度神经网络优化SQL查询。3)基于学习的数据库设计(1)学习索引。不仅可以减少索引大小,还可以提高索引性能。(2)学习数据结构设计。不同的数据结构可能适用于不同的环境,很难为每个场景设计合适的结构。哈佛大学的论文阐述了一种旨在为不同的数据结构创建一个数据推理的引擎,用于推荐和设计数据结构。(3)基于学习的事务管理。传统的事务管理技术侧重于事务协议,而人工智能技术能够从现有的数据模式中学习,有效地预测未来的工作负载趋势,并通过平衡冲突率和并发性有效地调度它们,从而实现预测并安排事务。4)基于学习的数据库监控数据库监控可以捕获数据库运行时指标,如读/写延迟、CPU/内存使用情况,从而在出现异常时提醒数据库管理员。然而,传统的监视方法依赖于数据库管理员来监视大多数数据库活动并报告问题,效率较为低下。而通过基于机器学习的技术来优化数据库监控,可以较为高效地确定何时以及如何监控哪些数据库指标。5)基于学习的数据库安全传统的数据库安全技术依赖于用户定义的规则,但无法自动检测未知的安全漏洞。通过基于AI的算法来自动识别发现敏感数据,监视数据库活动并检测漏洞,通过自动估计不同的数据访问操作来避免数据泄漏,通过深入学习挖掘用户行为和识别并避免SQL注入攻击。三、DB4AI人工智能在当今逐渐普及用于解决许多现实问题,但由于人工智能现存系统复制性较差,很难被普通用户使用。为了解决这个问题,数据库技术可以用来降低人工智能的使用门槛,如下图所示:下面基于上图中部分内容进行介绍:1)声明式查询范例SQL相对容易使用并在数据库系统中广为接受。然而,与其他高级机器学习语言相比,SQL相较于其它高级机器学习语言缺少一些复杂的处理模式(例如,迭代训练)。但是,SQL可以被延伸至以支持AI模型,可以通过设计用户友好的工具在SQL语句中支持AI模型。2)数据治理数据质量对于机器学习非常重要,数据治理可以提高数据质量,包括数据发现、数据清理、数据集成、数据标记和数据血缘。(1)数据发现。基于学习的数据发现增强了查找相关数据的能力,能够自动且有效发现海量数据之间的关系。(2)数据清理。脏数据或不一致数据会严重影响训练效果。数据清洗和数据集成技术可以对脏数据和未持久化数据进行检测和清理修复,并集成多个数据源的数据,以生成高质量数据。(3)数据标签。借助领域专家、众包和知识库,可以适当利用人力或现有知识为ML算法标记大量训练数据。(4)数据血缘。数据血缘描绘了输入和输出之间的关系,对于确保ML模型正常工作很重要。通过连接和图映射等数据库技术,可以跟踪数据前后关系。3)模型训练模型训练旨在训练一个用于在线推理的好模型,是一个耗时且复杂的过程,因此需要特征选择、模型选择、模型管理和硬件加速这些优化技术。(1)特征选择。需要从大量可能的特征中选择合适的特征。通过批处理模型、物化模型等技术来解决选择和评估非常耗时这一问题。(2)模型选择。需要从大量可能的模型中选择合适的模型(和参数值)。通过一些并行技术来加速这一步,包括任务并行、批量同步并行、参数服务器和模型并行计算。(3)模型管理。由于模型训练是一个反复试验的过程,需要维护许多已经尝试过的模型和参数,因此有必要设计一个模型管理系统来跟踪、存储和搜索ML模型。本文采用基于GUI的和基于命令的模型管理系统。(4)硬件加速。硬件如GPU和FPGA也被用来加速模型训练。硬件加速技术被应用在行存储和列存储数据库中。4)模型推理。模型推理旨在使用经过训练的模型有效地推断结果,数据库中的优化技术包括算子支持、算子选择和执行加速。(1)算子支持。ML模型可能包含不同类型的算子,它们具有不同的优化要求。因此,提出了一些数据库内技术来支持AI算子,包括标量运算、张量运算和张量分区。(2)算子选择。相同的ML模型转换为不同的物理算子可能会带来显著的性能差异。因此在数据库中,算子选择可以估计资源消耗并做出正确的调度。(3)执行加速。加速推理提高效率。一方面,内存数据库将模型数据压缩到内存中进行内存优化。另一方面,分布式数据库通过将任务发送到不同节点提高整体效率。四、挑战1)利用人工智能技术优化数据库仍然存在一些挑战。(1)大规模、高质量、多样化的训练数据获取困难。例如,在数据库旋钮调优中,训练样本需要基于DBA经验获得,因此很难获取非常大数量的样本。此外,为了构建有效的模型,训练数据需要涵盖不同场景、不同硬件环境和不同工作负载,因此迫切需要一个新的方法用小型的训练数据集去获得高质量模型。(2)适应性是一个巨大的挑战。如何使数据集上经过训练的模型适应其他数据集?如何使硬件环境中经过训练的模型适应其他硬件环境?如何使经过训练的数据库模型适应其他数据库?如何使经过训练的模型支持动态数据更新?(3)数据治理。学习模型能否收敛至关重要,如果模型不能被收敛,需要用其它方式规避延迟和不准确的决策。例如,在旋钮调优中,如果模型不收敛,就不能利用模型提供在线旋钮建议。(4)OLAP学习。传统OLAP任务聚焦关系型数据分析,然而大数据时代,图数据、时序数据、空间数据层出不穷,需要新的数据分析技术去分析这些多模数据。(5)OLTP学习。事务模型和调度对OLTP系统很重要,因为不同事务间可能存在冲突。利用学习技术优化OLTP查询是很有希望的,例如一致性快照等。2)利用数据库优化AI模型也存在部分挑战(1) 库内训练方面。在数据库中支持人工智能训练是一项挑战,包括模型存储、模型更新和并行训练。首先,在多租户可以训练和使用模型时,库内存储模型的安全和隐私问题是一个挑战;其次,数据动态更新时区更新模型也是一大挑战。(2) 利用数据库技术加速AI训练。目前大多数研究都集中在人工智能算法的有效性上,而对算法的效率关注不多,需要利用数据库技术提高算法的表现性能。(3) AI优化器。当前研究主要利用用户定义函数(UDF)来支持AI模型,但这些模型没有得到有效优化。需要将AI模型作为算子在库内执行,同时还需要为每个算子设计物理算子,最重要的是,需要将AI算子下推并预估cost/cardinality值,AI优化器应支持优化AI训练和推理,此外,对于分布式环境下AI算子的有效支持也非常重要。(4) 容错学习。现有的学习模式训练不考虑容错度。一个分布式训练执行中穿一个进程崩溃,整个任务就会失败,需要将现有的容错技术以提高库内训练的健壮性。为了确保在可预测和不可预测的灾难下的业务连续性,数据库系统必须保证容错和灾难恢复能力。五、总结该论文综述了AI4DB和DB4AI的最新技术。前者侧重于利用人工智能技术解决计算复杂度高的数据处理问题,例如旋钮调整、成本估算、连接顺序选择、索引顾问和视图顾问。后者侧重于使用数据库技术来降低使用人工智能的复杂性和加速人工智能模型,例如,声明式AI,以及加速AI训练和推理。数据库和人工智能都能从对方那里获得各方面的提升,数据库与人工智能结合势必成为未来二者发展的一大趋势。文章来源:数据库应用创新实验室
  • [技术干货] 企业数字化转型方式方法的探讨[转载]
    1. 数字经济和数字化转型1.1. 数字经济成为未来竞争的主战场数字经济是未来世界经济竞争格局的战略高地。国家十四五规划与 2035远景目标纲要已发布,其中数字中国建设对未来中国数字化转型及其数字中国建设的一系列重大方针政策都做出了相关的规定。1.2. 疫情加速数字经济的发展1.3. 数字化使企业的工作流程更加高效敏捷1.4. 数字化转型的核心价值1.5. 数字技术全面融入社会交往和日常生活在国家十四五规划里,对数字社会建设做出了一系列重要部署。比如数字技术全面融入社会交往和日常生活,提供智慧便捷的公共服务,促进公共服务和社会运行方式创新,建设新型智慧城市,构建国民美好数字生活新图景,推进全民美好数字生活等,这在一定意义上为未来的数字社会建设指明了方向。未来的趋势是通过数字化转型,数字驱动生活方式的变革。趋势一:社会数字化将在未来五年进一步上升。目前我国的数字化普及率刚刚超过 70%,与发达国家还有一定差距、存在较大提升空间;趋势二:民生相关的医疗、教育、社保、养老、就业等数字化水平将大幅提高;趋势三:数字孪生技术与城市的结合,智慧城市建设将得到快速发展;趋势四:数据经济时代,数字消费者对数字化转型将产生更大的影响。2. 新技术对行业应用场景的影响2.1. 2021年Gartner数字商务技术成熟度据 Gartner发布的 2021年数字商务技术成熟度曲线,虚拟客户助理、数字钱包、可视化配置、客户身份和访问管理等数字商务技术已到了稳步爬升期,并有望在 2年内到达生产成熟期。数字体验平台、客户主数据管理、产品主数据管理等技术,也将在 2-5年内到达生产成熟期。2.2. ICT技术与经济社会深度融合2.3. 5G技术在各行业的应用场景2.4. 大数据技术在各行业中应用的深度和广度从应用的功能和成效来看,大数据技术应用的价值主要体现在降本增效、精准营销、决策支持三个方面,其应用的深度和广度,在不同行业呈现不同的侧重点。2.5. 人工智能技术中重点领域应用场景从产业链来看人工智能产业链主要有三个核心层:基础层、技术层及应用层。计算机能力和平台的发展,是人工智能技术和应用实现的基础,计算机视觉、语音识别、自然语言处理、机器学习、大数据服务等技术的实现,是人工智能应用落地的保障。从应用层看人工智能产业主要有智慧城市、智慧生产、智慧生活三大类应用领域,在制造业、电力电网、交通运输三大行业已形成规模应用,主要落地应用有以下十大场景:无人驾驶汽车、人脸识别、机器翻译、声纹识别、智能客服机器人、智能外呼机器人、智能音箱、个性化推荐、医学图像处理、图像搜索等。3. 企业数字化转型通过数字化转型,实现跨层级、跨地域、跨系统、跨部门、跨业务的协同管理,打造组件化、松耦合的中台能力,将数字技术与企业需求相融合,释放数字化转型的真正价值。3.1. 企业数字化阶段企业数字化阶段,可以划分成以下四个阶段:基础信息化应用数字化全面系统化智慧生态化数字化转型各阶段的基本特征和典型应用3.2. 数字化实施策略企业在实施数字化阶段的过程中,可以基于以下实施策略:3.2.1. 基于单个业务场景基于单个业务场景数字化为启动点的方法,以点带面,逐步实施,反复迭代,最终带动企业的整体转型。通过单点突破 -> 局部扩散 —> 复制推广 -> 全面融合 —> 优化创新的路径,推动研发、产品、装备、生产、管理、服务等业务场景数字化、网络化、智能化转型,逐步搭建和完善企业内部数字化管理平台。3.2.2. 基于新技术的应用场景基于工业互联网,通过人工智能、5G、物联网、云计算、大数据、数字孪生、精益制造等数字技术创新应用手段,建设具有“柔性化、智能化、数字化”特征的智能工厂。3.2.3. 基于供应链协同服务场景基于资源对接、协同生产等供应链协同模式新业态,打造行业供应链协同服务平台,推动行业上下游分散资源的有效汇聚与广泛共享。3.3. 数字化转型场景落地线路图企业数字化转型场景企业数字化转型场景指的是在特定时间、空间/地点、人物对象,以生产经营活动为中心使用各类数字化手段,将业务活动的各动作,按照相关的关联关系,完成特定的业务流程,面向生产经营活动中特定的活动问题对应的解决方案构成的相关过程,构建起的碎片化流程及流程对象构成的各类关系。围绕场景的转变所带来的价值,逐步汇集转变中需要的技术、平台、运营、组织管理的需求,通过迭代的方式,逐步的完成数字化的转型。场景要素数字化首先将场景的基本信息进行收集及结构化,即填写背景及目标,深入总结场景建设的背景、痛点问题和建设的目标,通过场景要素的构成性描述场景企业可以深入的了解在特定的时间空间、组织角色、场景活动及其相关的应用、设备、信息等多维度的相关信息。通过场景描述澄清场景对应的需求及场景活动等细节将围绕场景活动及产生相应的数字应用、机器设备、数据信息、数字技术等场景对象的协作关系完整表述出来。数字化场景是不断迭代的,随着新技术、新设备不断涌现,新技术和原有场景可以多次形成新的组合,从而不断向全感知、全联接、全智能的数字化场景发展,所以场景要素是迭代优化的基础,需要完成全面的场景要素清单。场景资源数字化将场景涉及的平台、场景节点等通过数字化的手段进行相关的系统平台支撑的方式承载相关功能及其相关流程,通过数字化智能化系统的建设、业务能力承载。将各场景节点相关的标准业务服务、场景节点业务流程进行自动化、智能化的能力升级、从而将传统由不同的业务角色及其相关组织中的人完成的业务动作转变成部分或全部由自动化、数字化、智能化的系统承载完成。并将相关的业务流程中设计的标准动作以系统功能点的形式落地到对应应用系统建设过程中。完成对应的系统建设后形成对应的标准化应用服务。场景设备数字化将场景涉及的设备、基础设施等通过数据自豪的手段进行相关的设备互通互联建设,通过将设备进行数字孪生的建设,进行设备及基础设施的数字化改造升级及现实世界的数字化同构模型的建设。3.3.1. 数字化转型场景建设五步设计法步骤一: 场景的价值按照场景价值发现法,通过各类调研发现企业场景现状与问题、将相关场景下的业务需求进行需求分析。并针对各类需求制定对应的转型目标。步骤二:场景的技术创新将场景涉及的业务流程进行业务融合新型技术的创新设计,将对应的场景进行技术改造和业务升级形成创新场景。步骤三:场景的生态通过场景生态构建以场景为核心的多维度、供需能力结合的场景生态供给侧与需求侧的拉通,形成特色的生态解决能力提供场景服务。步骤四:场景的长效机制将场景设计建设成效及其未来的运营机制进行相关设计,通过场景运营建立场景的长效培育机制,解决场景相关能力上线后的目标效果评估、目标场景的迭代等相关问题。形成场景能力的长效运营使场景节点目标更好的得到能力升级及产品迭代。步骤五:场景的组织建设将场景涉及的角色、组织、平台装备等一系列相关方进行组织变革、平台能力中心建设设计。形成场景能力建设完成后的组织文化保障,更好的通过组织能力长效服务及建设相关场景能力。3.4. 企业数字化转型场景案例3.4.1. 智能制造数字化转型及重要场景路线图智能制造行业数字化发展路线总结为管理数字化、生产数字化、生产智能化、产业数字化四个阶段总路线,数字化文化和能力的培养贯穿整个数字化发展进程,在每个阶段具有代表性的重点场景.3.4.2. 能源行业数字化转型及重要场景路线图能源行业数字化发展路线总结为业务数字化、数据资产化、海外赋能、数字化生态四个阶段路线,数字化文化和能力的培养贯穿整个数字化发展进程,在每个阶段具有代表性的重点场景。4. 参考华为:数字化转型,从战略到执行华为:华为行业数字化转型方法论白皮书2019[中央企业数字化发展研究院:2021年国有企业数字化转型场景示范和线路图研究白皮书]http://siab.org.cn/2021/12/28/guoqishuzihuazhuanxing/
  • [公告] 华为与达尔文圈发起“维也纳科技向绿倡议”
    在今年华为奥地利和国际数字化论坛达尔文圈共同举办的活动中,华为重点讨论了如何利用科技促进可持续发展,并和达尔文圈联合呼吁来自各行各业的企业加入“维也纳科技向绿倡议”。奥地利环境部副部长Christian Holzer表示:“数字化和利用电子手段获取和处理环境数据有助于制定必要的措施,同时极大地促进了联合国可持续发展目标的实现。”华为奥地利于2021年发起奥地利TECH4ALL 倡议,与维也纳大学和新锡德尔湖国家公园、NGO组织RFCx合作推出“科技守护自然”计划,利用人工智能等新技术开展为期两年的生物多样性研究。该项目在不同时间段内对芦苇带的鸟类、蝙蝠和两栖动物进行声音监测。监测结果将被用于制定和改善保护计划,以保护新锡德尔湖芦苇带的可持续发展和生物多样性。项目覆盖面积为12平方公里,共安装了72个设备,目前已记录了4000 GB的声音数据,长达1.16万小时。在活动中,达尔文圈与华为呼吁各方联合行动,共建绿色未来,呼吁来自各行各业的企业加入“维也纳科技向绿”倡议。ICT技术在自然保护中扮演着关键的使能角色,为人们提供与自然和谐共处的解决方案。该倡议将联合伙伴制定一份白皮书,探讨行业洞察和最佳实践,共建绿色未来。联合国工业发展组织创新与数字化司司长Marco Kamiya表示:“数字化转型和创新是实现发展的重要条件。”在此次活动中,达尔文圈创始人Nikolaus Pelinka,微软奥地利总经理Hermann Erlach、新锡德尔湖国家公园研究员Harald Grabenhofer、联合国亚太可持续发展副主席David Morris、维也纳科技大学系主任Michael Drmota等人出席并现场发言。现场嘉宾与华为一起讨论科技向绿的议题
  • [技术干货] Al Gallery 数据集系列合集,助你从0到1成为 AI 开发达人!
    Al Gallery——华为云 AI 知识 & 实训社区<<点此直达>>,助你从0到1成为 AI 开发达人!以下是为AI开发达人提供的丰富多样的数据集,AI开发训练的原材料。数据集名称数据简介数据标注类型适用算法8类常见生活垃圾图片数据集本数据集包含8类生活垃圾图片,分别为:厨余垃圾蛋壳、厨余垃圾水果果皮、可回收物塑料玩具、可回收物纸板箱、其他垃圾烟蒂、其他垃圾一次性餐盒、有害垃圾干电池、有害垃圾过期药物,每类图片100张。图像分类图像分类ResNet50-EI-Backbone图像分类-ResNeSt图像分类-ResNet_v1_50图像分类-Inception_v3图像分类-Inception_Resnet_V2图像分类-Res2Net_50图像分类-MobileNet_v2四类花卉图像分类小数据集本数据集包含4种类别的花卉图片,分别为:雏菊、向日葵、玫瑰、蒲公英,每类图片10张,图片总数40张。图像分类二分类猫狗图片分类小数据集本数据集包含两种类别的图片:猫和狗。图像分类23类美食图片分类数据集本数据集包含23种类别的美食图片,分别为:八宝玫瑰镜糕,凉皮,鱼,/德懋恭水晶饼,搅团,枸杞炖银耳,柿子饼,浆水面,灌汤包,烧肘子,石子饼,神仙粉,粉汤羊血,羊肉泡馍,肉夹馍,荞面饸饹,菠菜面,蜂蜜凉粽子,蜜饯张口酥饺,西安油茶,贵妃鸡翅,醪糟,金线油塔。图像分类10类常见美食图片数据集本数据集包含10种美食图片,分别为:冰激凌、鸡蛋布丁、烤冷面、芒果班戟、三明治、松鼠鱼、甜甜圈、土豆泥、小米粥、玉米饼,每类图片500张。图像分类四类美食图片分类小数据集本数据集包含4种类别的美食图片,分别为:柿子饼、肉夹馍、凉皮、灌汤包,每类图片10张,图片总数40张。图像分类花卉识别数据集数据集中包含了3669张花卉图片及其标注信息,包括daisy、dandelion、roses、sunflowers、tulip五种类型花卉。图像分类花卉识别口罩检测数据集本数据集包含291张口罩检测的图片。物体检测物体检测YOLOv3_ResNet18物体检测-FasterRCNN_ResNet50物体检测-RetinaNet_ResNet50钢筋检测数据集本数据集包含250张钢筋检测的图片。物体检测物体检测YOLOv3_Darknet53物体检测-SSD_VGG物体检测-物体检测-SSD-MobileNet- v1 PPN物体检测-RetinaNet_ResNet50数据集名称数据简介所属大赛汽车零部件表面缺陷识别数据集2021数字化转型创新应用大赛·创客赛道竞赛复赛数据集“华为云-东吴杯”2021数字化转型创新应用大赛·创客赛道2021数字化转型创新应用大赛·创客赛道竞赛初赛数据集开学季!“互联网+”AI创新实践赛数据集数据总共包含从2600位被试中基于若干脑图谱提取出的灰质体积 (Grey Matter Volume, GMV)和平均皮层厚度 (Cortical Thickness, CT)。被试标签分为AD(Alzheimer Disease)、MCI(Mild Cognitive Impairment)、NC (Normal Control)。使用的脑图谱包括但不限于AAL、Gordon、MIST、Schaefer。说明文件中包含了被试的基本信息,包括年龄、性别、标签以及预处理时的图像信息(分辨率、全脑体积等)。开学季!“互联网+”AI创新实践赛爱(AI)美食--10类常见美食图片数据集该数据集为华为云AI大赛入门赛《爱(AI)美食·美食图片分类》竞赛数据集。该数据集包含10种美食图片,分别为:冰激凌、鸡蛋布丁、烤冷面、芒果班戟、三明治、松鼠鱼、甜甜圈、土豆泥、小米粥、玉米饼,每类图片500张。爱(AI)美食·美食图片分类2020无人车挑战杯竞赛数据集该数据集为《2020第二届华为云人工智能大赛 · 无人车挑战杯》竞赛数据集(海选赛)。该数据集包含了红灯、绿灯、黄灯、人行横道、限速标志、解除限速标志六种类型图片,图片未经过标注,使用前需使用ModelArts数据标注模块完成数据的标注,然后再使用标注后的数据集训练目标检测模型。2020第二届华为云人工智能大赛 · 无人车挑战杯红绿灯、斑马线、限速、解限速数据集本数据集为无人车挑战杯大赛供参赛选手使用的训练集,包含红灯、绿灯、黄灯、人行横道、限速标志、解除限速标志六种类型图片。华为云人工智能大赛 · 无人车挑战杯化合物-蛋白质相互作用(CPI)识别数据集“华为云杯”2021人工智能应用创新大赛·创客赛道竞赛数据集“华为云杯”2021人工智能应用创新大赛·创客赛道竞赛西安旅游主题图片数据集该数据集为《“华为云杯”2019人工智能创新应用大赛》竞赛数据集(初赛)。数据集包含了西安热门景点、美食、特产、民俗、工艺品五大类图片。“华为云杯”2019人工智能创新应用大赛街景图像语义分割数据集该数据集为《华为云杯“云上先锋”·AI挑战赛》竞赛数据集,数据集为城市街景图像,包含路面、人、车辆、建筑、交通标志、植物、天空等物体。华为云杯“云上先锋”·AI挑战赛交通流量预测数据集本数据集为深圳开放数据应用创新大赛数据分析赛·交通流量预测竞赛数据集深圳开放数据应用创新大赛数据分析赛·交通流量预测遥感卫星影像数据集该数据集为“华为云杯”2020人工智能创新应用大赛数据集。赛题任务:基于高分辨可见光遥感卫星影像,提取复杂场景的道路与街道网络信息,将影像的逐个像素进行前、背景分割,检测所有道路像素的对应区域。“华为云杯”2020人工智能创新应用大赛
  • [技术干货] 杭电AI“王炸班”:考研3人清北8人浙大,一大四学生年薪已过百万【转载】
    近日,杭州电子科技大学出了“王炸班”的消息冲上热搜,相关话题#杭电一学生还没毕业年薪已过百万#、 #学霸班六成考研上岸3清北8浙大#的阅读量突破了一亿。据杭州电子科技大学官方公众号介绍,这个学霸“王炸班”的56名学生中,有34个人考研上岸。其中17人考上985高校,8名浙大、2名清华、1名北大。另外,就业的学生人均起薪30万+,有4人进了华为,2人进了腾讯,5人进了海康。56个学生共获得省级以上各类学科竞赛奖励146个。学霸云集,在不同领域发光发热据“王炸班”辅导员宋晓宇介绍,杭电人工智能学院智能科学与技术专业在2018年首次招生,今年是第一届毕业生。“这个专业是多学科融合的,所以考研的时候有人考进了计算机,有人考到了自动化,也有人考到了人工智能的相关方向。他们以优秀带优秀,人人皆有导师、人人参加竞赛、人人有项目,共同铸就了我们这个王炸班。”考入浙大计算机技术专业的陈廷轩说,“我们班太卷了,有的同学参加ACM(国际大学生程序设计)竞赛拿奖,有人发表了好几篇SCI论文。像其他班级能拿一等奖学金的成绩,在我们班连三等奖学金都拿不到。”考入清华大学控制科学与工程专业的方政说,他在班里并不是很厉害。因为班里一个同学在大二就加入了腾讯,现在还没毕业就已经带了十几个人的团队,年薪都已经过百万了。另一位考入北大人工智能专业的石佳玥则“谦虚”地说,自己在班里的排名都在后50%,考上北大还是比较幸运的。但实际上,石佳玥在北大的初试和复试中都考了第一。这就是顶级凡尔赛吧!规划清晰,为打ACM放弃985、211要问这个“王炸班”的学霸们最佩服谁,大家一致认为就是大二就加入腾讯的崔倍宁。崔倍宁从小就是“别人家的孩子”。小学主动要求报3个奥数班,初中数学成绩一马当先,高中从零开始学习信息学,在全国信息学奥林匹克竞赛中斩获铜奖。准备竞赛用了2年,所以高中课程实际只上了一年。最终这个奖项给他带来了1所985高校降60分录取和1所211高校上一本线即录取的政策待遇,但崔倍宁选择放弃“优惠”,裸分考进了杭电。对于这一选择,崔倍宁表示,其实自己的理想一直是交大,因为交大曾代表中国拿过3次ACM全球冠军,每次都让热爱编程的自己热血沸腾。但因为自己的文化课成绩不够,上不了交大,所以他首选了搞ACM的氛围和实力也很优秀的杭电。在填报好志愿后,崔倍宁第一时间就联系了杭电ACM队伍的教练,录取消息一下来就被编入了杭电ACM队伍。经过训练,崔倍宁在大一时就和队友们拿到了两块ACM金牌。在大二春招时,崔倍宁顺利拿到了腾讯、字节跳动、图森未来和阿里巴巴的实习offer。他与这4家企业分别谈好了入职时间和工作期限,希望通过实习过程感受企业文化,用丰富的实习经历来完善自己的职业规划。目前正在读大四的崔倍宁,在某大厂里带着十几个人的研发团队,年薪已过百万。原文链接:https://blog.csdn.net/csdnsevenn/article/details/124047141
  • [其他] 经过训练的AI能不能学会品酒呢
    说到训练,经过训练的AI能不能学会品酒呢? 2月1日发表在《IEEE传感器杂志》(IEEE Sensors Journal)上的一项研究描述了一种新型电子鼻,它在分析威士忌时出人意料地准确,而且只需“闻”一下,就能以95%以上的准确率识别威士忌的品牌。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649408196428335763.png) 论文链接:https://ieeexplore.ieee.org/document/9701291 AI品酒,准确率堪比专业仪器 这项研究是由中国和澳大利亚的学者合作完成的,当然,做这项研究也不是为了在酒局中显摆,而是实实在在为了打击假酒。 威士忌是全球最受欢迎的酒精饮料之一,预计2018年国际市场规模为579.6亿美元,到2025年预计价值为896亿美元。 由于这个巨大的市场规模,威士忌市场也存在非常多的造假。 研究人员开发这款电子鼻,目的就是为了区分正品的威士忌和非法的、贴假标签的或掺假的威士忌。 这款电子鼻名为Nos.e,里面有一小瓶威士忌样品。威士忌的气味被注入到一个气体传感器室中,气体传感器检测各种气味并将数据发送给计算机进行分析。然后,**通过机器学习算法提取和分析最重要的气味特征**,以识别威士忌的品牌、地区和风格。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649408225583117686.png) 在他们的研究中,研究人员对Nos.e进行了测试,用它来分析六种不同的威士忌,从Johnnie Walker Red and Black到麦卡伦(Macallan)12年单一麦芽苏格兰威士忌。 为了进行比较,他们还使用了最先进的全二维气相色谱-飞行时间质谱联用仪(GC×GC-ToFMS)分析了威士忌样品。电子鼻子只是简单地评估一种物质的整体香气特征,而GC×GC-ToFMS可以在复杂的气味混合物中识别单个化合物。虽然GC×GC-ToFMS是高度准确的,这种仪器方法也比电子鼻子更昂贵和复杂的使用。 结果显示Nos.e在识别威士忌品牌方面与全二维气相色谱-飞行时间质谱联用仪(GC×GC-ToFMS)装置相当。
  • [干货汇总] 【AI系列】天呐,这群“员工”的业务能力太强了
    >摘要:智能时代,怎样才能让智能客服和智能助手真正担起智能之名呢?华为正在以AI之名,为之正名。本文分享自华为云社区《[天呐,这群“员工”的业务能力太强了](https://huaweicloud.blog.csdn.net/article/details/114164491)》,原文作者:华为助力企业上云。 在行车途中,双手与双眼需要高度集中的情况下,“请告诉我今天路况如何?”“请告诉我哪条路会更快到达?”智能助手会是身边最可靠的领航员。 在工作场景里,老员工的指导或许很重要,但并不能成为新手的贴身保镖,“请问如何才能修复好这个文件?”“财务流程需要怎样操作?”智能客服会是更为可靠和高效的手段。 显然,无论是消费者还是普通用户,智能客服和个人助手信息系统已然与生活密不可分。智慧源于数据,也源于系统的持续迭代以及企业系统的持续更新。如果用户在使用过程中收获的是一系列的答非所问和繁杂的操作,不仅用户体验不佳,企业内外联动的运营效能提升有限,品牌形象也会受到损害。那么智能时代,怎样才能让智能客服和智能助手真正担起智能之名呢?华为正在以AI之名,为之正名。 华为的研发实力有目共睹,近年来,智能趋势全球开启,站在风口浪尖的华为搭上了这一历史性的进程。在“智能华为”的转型的过程中,其推出了大量的智能化手段来提升企业运行效率,智能客户和智能助手便是其中两大利器。华为把智能领域积累的大量经验和技术,以智能客服和智能助手的方式应用到企业运作流程之中,充分挖掘企业内部技术及能力资源。 # 智能客服越千山,究竟越过哪一关? 接入智能客服之前,一定要明晰一件事情,那就是为什么会需要智能客服?我们现在所听到的一些客服机器人算不算智能客服呢?且请慢慢看来。 设置客服的目的是很简单的,那就是解决普通客户的咨询问题。而目前客服行业中,面向普通客户咨询主要有两种处理方式,传统客服机器人和电话按键导航转人工客服。不过二者相比起来各有利弊,传统客服机器人问题明显,容易答非所问,而且问题解决率不足80%,同时很多在线业务无法办理;而人工客服的话则流程冗长且效率偏低,通常需要等待人工坐席提交工单、人工坐席升级工单、人工坐席关闭工单、客户满意度评价、客服质检等诸多环节。 从华为客服业务给出的数据来看,其目前拥有的超过1万名客服坐席,人均每天60个问询单,每单处理耗时约10分钟,年损失率130%,而且新人培训周期较长。机器人客服拨测命中率低、用户参评率低、答非所问以及知识运营成本高;人工坐席排队及工单升级困难、知识检索速度慢、人工总结问题效率低……那么就没有两全其美的办法吗? 显然不是的,华为智能客服就是要解决掉这个矛盾点。本质上来讲,智能客服解决方案需要把两种客服业务进行结合,其总体流程涵盖了以下5个步骤。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383815554179144.png) - **智能导航**,在导航时根据用户画像识别实现AI智能分流,快速理解用户意图,一些常见问题直接办理; - **智能问答**,在机器人客服方面,基于NLP (Natural Language Processing)技术打造了各类对话机器人,让用户能够更多的进行自助办理业务; - **坐席辅助**,在人工坐席服务中在业务流程、知识内容、业务话术、升单分类等方面实现自动推荐,提升客服效率; - **智能外呼**,在用户满意度评价部分,根据营销线索完成自动挖掘,自动完成客户满意度回访; - **智能质检**,在客服质检流程中能够实时识别情绪异常预警并对服务质量检测,避开敏感信息。 通过这5个流程,华为智能客服可以在无人敢于的情况下实现85%以上的用户问题可由机器人实现闭环处理;并且在人工坐席方面实现千般问一致答,1分钟完成录单查单升单;而更为重要的是,智能客服系统可以实现100%全问题单覆盖,保障没有错漏现象出现,堪称完美之选。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383856984572304.png) 智能客服产品架构示意 那么智能客服能够在哪些场景下发挥作用呢?华为AI使能部智能客服产品经理唐菊香介绍称基于智能路由、问答与任务引擎、意图识别等能力构建的智能客服解决方案,在华为内部得到广泛使用,实现一键触达所需服务;并且该技术也在用户场景、内部连接场景、企业各个服务场景中得到广泛使用。 # 场景化应用,智能客服的长生诀 过往的经验告知,如果一款产品没有竞争力,不能在场景中切实的解决问题,那么这款产品便很难称之为成功。而华为智能客服解决方案在面向普通用户、外部工程师、小语种等诸多场景时,可以切实的击破场景化发展难题。 华为VMALL商城在线客服就是一种典型的应用,其能够处理消费者在售前及售后中的各类问题咨询,全球96个国家, 700+终端产品型号及14个EMUI/Magic UI系统版本均可得到服务。在以往的解决方案里,客服产品往往会面临体系复杂,知识难记忆;业务浪涌风险;坐席压力大,极端情况情绪崩溃,人员流失快、海外招聘难等诸多问题。 而在通过接入智能客服之后,整体解决方案效率得到大幅提升,售前通过 RPA机器人(Robotic Process Automation)、知识图谱机器人、实体识别等完成产品咨询和对比任务;售后则可以通过任务机器人、产品图谱机器人、用户画像来精准化提供到店维修指引;同时能够通过RPA机器人、故障图谱机器人、实体识别能力完成逐步故障解决。 工程师的问题可能会比普通用户更复杂,以往工程师在进行功能对比、产品选型、产品展示、安装指南、故障指导、版本推荐时,很难通过机器人客户解决问题,而求助人工坐席解决问题时需要80美金/单。 为方便企业业务工程师能够快速解决问题,华为企业业务部投入1人月构建14个主要场景的任务多轮自助,实现客户工程师自助快速获取产品相关问题解决方案,缓解了人工坐席压力,实现人工费用节省。这套解决方案的最大特点在于,其能够基于企业业务意图识别模型,是一套将企业产品图谱与场景任务引擎结合的解决方案。 小语种场景相比之下会简单一些,华为利用专利技术实现了小语种与英文机器人能力,目前已经覆盖了西班牙语、泰语、俄语、日语、韩语、阿拉伯语、法语、德语等诸多语言。在以往使用的单一模型中,其往往会各有优劣,只能适用于特定场景,系统对对一些重点语种有专门的模型应对,将其融合之后可以形成互补。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383877090449547.png) 华为智能客服解决方案面向核心小语种,主要采用多模型融合(经典机器学习算法+深度学习算法)+投票决策的方式,分语种训练;面向非核心小语种,主要通过机器翻译,利用英文Bot能力以及答案的多语种同源关联,实现小语种快速覆盖。不同场景不同解决方式,这样才能更加高效的解决问题。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383885123542138.png) 总结来看,华为智能客服的核心技术点在运营层面有着明显的提升,其能够通过文档自动抽取和知识自动生成提升知识储备,并根据对话日志统计报表,热点、高频问题统计,人工服务数据反哺完成机器自学习,再借助人工标注、知识健康检查、知识自动生成、语料扩写等能力实现智能客服的效率提升。同时,其能够通过自动训练人工发布,最终实现系统的知识覆盖面提升,整体准确率提升10%到20%,回答更加准确。 相比以往的智能客服解决方案,华为智能客服具备更强的客户理解能力,能够通过NLP能力、多模态情感识别、基于画像的推荐以及多语种意图识别,增强客户理解,提升客户体验,减少客服压力;此外,其能够提供开箱即用的能力,通过云化和多租户隔离,实现20分钟快速构建;同时,客户服务解决方案覆盖企业内部咨询、业务办理助手等诸多场景,全场景覆盖让产品更具竞争力。 # 智能助手,信息获取新模式 我们都说如今进入了数据时代,尤其是企业发展之后业务范围不断扩大,系统和数据不断增加,传统的信息获取方式便不再那样有效。据麦肯锡调查统计,企业员工大概有40%的时间花在不同信息的获取上,将直接影响工作输出。 那么信息获取有哪些方式呢?在华为AI使能部资深产品经理刘玉峰表示,信息获取方式已经经历了三个时代的变迁。1.0时代,信息获取主要通过菜单点击模式获取信息,用户获取内容有限;2.0时代,信息获取主要依赖于传统搜索,其能够获取海量内容,但问题在于其响应机制较为模糊,而且主要基于功能驱动,结果较为片面。3.0时代,智能助手出现使得用户获取海量信息的渠道更为多元,其能够实现精准响应,并基于场景驱动获取信息,能够实现主动推荐,内容更加全面可靠。 总体来看,信息获取方式经历了“人找服务”到“服务找人”的升级,事实上,这也是下一代数字化服务的特点,由主动获取信息变成信息整合后的被动获取,进而盘活企业数字资产,提升员工生产力。智能助手作为一种面向未来的信息获取方式,那么其是如何构建的呢? ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383899459405378.png) 智能助手AI构建思路示意 以往在做产品时,往往选择的是技术驱动,但智能产品,尤其是智能助手这类产品,往往运营、场景和数据作为驱动的。在构建智能助手时,往往需要会先获取用户行为日志,然后基于用户行为习惯进行分析,最终实现场景识别、服务设计、意图识别设计等核心能力;同时也可以将之用于现状评估和目标制定。 在建设完成上线后,后续更新迭代的环节叫“PDCA”转换(PDCA :PLAN计划、DO实施、CHECK验证、ACTION改进)。产品上线后对需要产品反复进行验证,然后反馈迭代实现用户问题闭环,最终逐步迭代提升用户体验。智能产品的第一个版本往往不尽完善,但就是在这一系列的闭环升级中,让产品的服务能力和用户体验不断的日趋完善。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383910833780292.png) 华为内部使用的智能助手主要基于华为多年的技术积累打造,根据不同的端口,主要有三种呈现方式:语音助手,智能搜索,划词搜索(闪查)。在移动端,语音助手能够便捷地答疑解惑;文字搜索能够跨越终端并且处理各类条件的内容信息,而划词搜索则可以智能地嵌入在各种软件之中,实时简洁地呈现各类信息。华为打造的助手中台能够提供QABot、RPA、搜索Bot、Talk to Data、Task Bot等AI能力,帮助提升员工生产力。 # 多场景落地,智能助手的新春 谈及智能助手,很多人对其的认知可能还停留在小艺、Siri等个人手机上,但显然其能够落地的空间会比这些场景更加丰富。华为智能助手在HR服务、会议助手、数据服务、知识服务等多个领域均有表现。 HR服务并非易事,在企业内部找人与其他的人脉搜索不同,其往往面对的是陌生人搜索,多数属于模糊搜索。而智能助手基于员工图谱支持企业内部找人,根据员工不同标签进行归类和联想搜索,标签触电从入职开始,包括职位上的调动、晋升、出差、培训、项目作战到离职的全职业生涯周期,从部门来看其同部门、秘书、HRBP、主管、同项目组的同事相关性也可以做区隔,进而更加精准地找到合适人选。 会议服务看似简单,却有很多零散的烦心事。在参加会议时,会前需要进行会议室预订、预约与会人等一系列操作,同时还可能找不到会议室。华为会议助手则能够实现一句话预约会议室并通过RPA自动预约与会人时间,内置的室内导航也能够避免找不到会议室的尴尬。 在开会时出勤统计、陌生人信息查询、跨语言沟通、会议记录和任务下发,每一条都可能是一个坑。华为会议助手则可以提供出勤自动统计(摄像头)、陌生人信息推荐、实时会议口水稿、同声传译、拍照识文、一句话创建任务等功能。在会议结束时,往往需要进行会议纪要整理和任务的跟进。能会议助手能够对多媒体会议进行记录,生成视频、语音、口水稿,且纪要口水稿文本顺滑,能够自动进行观点提取;会后也能利用RPA自动跟进任务。 数据服务需求更加繁杂,技术含量会更高。在寻找合适的数据内容时,往往得到的结果过于专业,导致很多一线用户无法明晰数据的价值点和关键所在。而通过使用智能搜索、机器学习算法,智能助手能够准确识别语音,分析用户意图并与用户对话,让用户能够轻松找到想要的数据。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383927145833349.png) 举例而言,当用户想要某一地区的数据时,智能助手能够直接将相关数据的柱状图呈现,并可根据用户指令找到更合适的可视化形式,帮助用户理解相关数据集和问题点。通过AI的NL2SQL(自然语言到结构化查询语言)技术,智能助手实现了自然语言到机器语言的转换。用户只需用最自然的语言,就可随机、自由的、多维度、多逻辑组合数据,通过一次或多次会话完成数据探索和分析,洞悉数据背后的业务本质。 华为智能助手在知识服务方面提供的场景化帮助会更加丰富。基于产品构建的知识图谱能够比普通的FAQ系统更加精准地完成问答,实现产品对比、产品常见问题支持、属性查询等能力。而产品知识图谱本身的三元组比较好定义,因此产品属性比较有限,而且数据多为半结构化数据,能够比较简单地构建;但大概念的知识图谱会比较难,需要在合适的场景来做建设,甚至还需要进行相关的逻辑判断解决。 产品文档内容的深度检索在未来有望成为刚需,仅以华为内部来看,年文档量就能达到百万级。之前只支持员工主动找文档,但这需要大量时间浏览文档内容,信息获取效率低。在找文档过程中,由于文档标题覆盖的信息有限,因此使用搜索功能往往搜不到或者不支持excel、ppt、pdf、word等文件内容搜索。 智能助手能够对文档进行解析,包括页码、标题、正文等内容,并以API形式接入索引库。用户在检索相关文档时,智能助手通过意图理解调用索引库相关内容,并通过智能搜索算法模型,实时输出相关内容。总结来看,智能助手能够实现更深层次的内容搜索,能够精准定位、在线预览、一搜即得。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/8/1649383959934263391.png) 核心语义识别服务架构示意图 核心语义识别是智能助手的一大重要难点所在,在做知识问答或是搜索时往往会遇到一个问题,用户输入一句话时词与词的重要性的不一样的,以往由于未识别核心语义导致的Bad Case达到了35%。以往的解决办法有很多种,比如大量的字典或者标注;但这样做的问题在于人力成本投入过大,而且Case By Case维护,效果不佳。 华为智能助手基于非监督算法核心词的识别模型,当用户输入一句话时,算法模型会自动对语言中多个词汇的权重进行分析。通过核心语义识别让用户问答结果更加精准,也能更好地理解客户的诉求。 此外在很多情况下,用户会搜索一些意图不明确的内容,搜索主题会比较泛;亦或者用户搜索时记忆不太清楚;再者当用户输入一个标签时标签下内容过多导致用户无所适从。为了解决这类意图不明确搜索的问题,华为智能助手基于华为内网相关信息形成了主题图谱,将不同主题下相关的知识内容根据关联性来绘制图谱,进而引导用户明确意图。 在用户进行知识探索时,通过主题下的关键知识提取模块即可获得;当用户输入较为模糊时,主题图谱可以逐步对用户进行相关内容逐步引导;当内容比较多的时候,结构化处理模块以及Query理解模块会共同打造的主题推荐能力能够对用户有所帮助。 总体来看,传统问答系统的信息获取方式效率比较低,通过智能化升级和数字化变革,华为智能客服与智能助手可以共同帮助企业内部盘活资产,提升了整体运营效率,也给予客户更多优质的服务帮助。可以说,智能助手与智能客服,成为了华为智能化转型升级路上的“急先锋”。
  • [技术干货] 【AI-OCR】自定义扩展插件aiverifyinput(输入型验证码、健康码颜色识别、抱杆识别)
    此插件有效期到2023年6月30日,如需体验验证码等AI能力,请浏览以下帖子:【ManasAI-OCR】验证码、健康码颜色识别、表格图片识别cid:link_0---------------------------------------------1. 导入后,在studio中的控件界面,显示见图1;图12. 控件帮忙界面见图2;图23. 属性界面见图3,图4。(识别模式有三种,输入型验证码、健康码颜色识别、抱杆识别;输入型验证码中,需要选择是纯数字,还是纯字母,还是数字与字母混合)图3图4
  • [技术干货] 前沿科技探究DeepSQL:库内AI算法(上)
    数据库DeepSQL特性实现DB4AI功能,即在数据库内实现AI算法,以更好的支撑大数据的快速分析和计算。这里提供了一整套基于SQL的机器学习、数据挖掘以及统计学的算法,用户可以直接使用SQL进行机器学习工作。Deep SQL能够抽象出端到端从数据到模型的研发过程,配合底层的引擎及自动优化,具备基础SQL知识的技术人员即可完成大部分的机器学习模型训练及预测任务。整个分析和处理都运行在数据库引擎中,用户可以直接分析和处理数据库内的数据,不需要在数据库和其它平台之间进行数据传递,避免在多个环境之间进行不必要地数据移动。一、概述DeepSQL是对openGauss DB4AI能力的增强,让对MADLib比较熟悉的数据分析师或开发者可以轻松迁移到openGauss上进行工作。DeepSQL将常用的机器学习算法封装为SQL语句,支持60多个常用算法。其中包括回归算法(例如线性回归,逻辑回归,随机森林等)、分类算法(比如KNN等)、聚类算法(比如K-means)等。除了基础的机器学习算法之外,还包括图相关的算法,比如最短路径,图形直径等等算法;此外还支持数据处理(比如PCA),稀疏向量,统计学常用算法(比如协方差,Pearson系数计算等),训练集测试集分割方法,交叉验证方法等。表 1 支持的机器学习算法 - 回归类算法算法中文名称 算法英文名称应用场景 逻辑回归Logistic Regression例如寻找某疾病的危险因素,金融商业机构需要对企业进行评估等。预测:根据模型预测不同的自变量情况下某病或某情况的发生概率。判别:实际上跟预测类似,也是根据模型判断某人属于某病或属于某种情况的概率有多大,即判断某人有多大可能是属于某病。 Cox比例风险回归Cox Proportional Hazards Regression该模型以生存结局和生存时间为因变量,可同时分析众多因素对生存期的影响,能分析带有截尾生存时间的资料,且不要求估计资料的生存分布类型。由于上述优良性质,该模型自问世以来,在医学类研究中得到广泛的应用,是迄今生存分析中应用最多的多因素分析方法。 弹性网络回归Elastic Net Regularization弹性回归是岭回归和套索回归的混合技术,它同时使用 L2 和 L1 正则化。当有多个相关的特征时,套索回归很可能随机选择其中一个,而弹性回归很可能都会选择。 广义线性模型Generalized Linear Models在一些实际问题中,变量间的关系并不都是线性的,这种情况就应该用曲线去进行拟合。  边际效应Marginal Effects提供边际效应的计算。 多类回归Multinomial Regression如果目标类别数超过两个,这时就需要使用多类回归,如疗效可能是“无效”,“显效”,“痊愈”三类。  序数回归Ordinal Regression在统计学中,序数回归是一种用于预测序数变量的回归分析,即其值存在于任意范围内的变量,不同值之间的度量距离也不同。它可以被认为是介于回归和分类之间的一类问题。例如,病情的分级(1、2、3、4级),症状的感觉分级(不痛、微痛、较痛和剧痛),对药物剂量反应的分级(无效、微效、中效和高效)等等。不同级别之间的差异不一定相等,如不痛与微痛的差值不一定等于较痛与剧痛的差值。 聚类方差Clustered VarianceClustered Variance模块调整聚类的标准误差。例如,将一个数据集合复制100次,不应该增加参数估计的精度,但是在符合独立同分布假设(Independent Identically Distributed,IID)下执行这个过程实际上会提高精度。    稳健方差Robust VarianceRobust Variance模块中的函数用于计算线性回归、逻辑回归、多类逻辑回归和Cox比例风险回归的稳健方差(Huber-White估计)。它们可用于计算具有潜在噪声异常值的数据集中数据的差异。 支持向量机Support Vector Machines(SVM)用于文本和超文本的分类、图像分类,比起传统的查询优化方案,支持向量机能够获取明显更高的搜索准确度。这同样也适用于图像分割系统。 线性回归Linear Regression应用广泛,例如经济学、金融学等。表 2 支持的机器学习算法 - 其他监督学习算法名称(中文) 算法名称(英文)应用场景 决策树Decision Tree最为广泛的归纳推理算法之一,处理类别型或连续型变量的分类预测问题,可以用图形和if-then的规则表示模型,可读性较高。 随机森林Random Forest随机森林是一类专门为决策树分类器设计的组合方法。它组合多棵决策树作出的预测。 条件随机场Conditional Random Field (CRF)条件随机场(CRF)是一种判别的,无向概率的图形模型。线性链CRF是一种特殊类型的CRF,它假定当前状态仅取决于先前的状态。在分词、词性标注和命名实体识别等序列标注任务中取得了很好的效果。  朴素贝叶斯Naive Bayes通过计算概率来进行分类,可以用来处理多分类问题,比如:**邮件过滤器。 神经网络Neural Networks拥有广泛的应用场景,譬如语音识别、图像识别、机器翻译等等。在模式识别的领域中算是标准监督学习算法,并在计算神经学中,持续成为被研究的课题。MLP已被证明是一种通用的函数近似方法,可以被用来拟合复杂的函数或解决分类问题。 k临近算法k-Nearest NeighborsK近邻分类方法通过计算每个训练样例到待分类样品的距离,取和待分类样品距离最近的K个训练样例,K个样品中哪个类别的训练样例占多数,则待分类元组就属于哪个类别。可用于:文字识别,面部识别,基因模式识别,客户流失预测、欺诈侦测。表 3 支持的机器学习算法 - 数据处理类算法 算法名称(中文)算法名称(英文)应用场景 数组操作Array Operations数组、向量操作运算,包括基础的加减乘除、幂运算、开方、cos、sin、绝对值、方差等。 主成成分分析Dimensionality Reduction (PCA)降维,计算主成分。 变量编码Encoding Categorical Variables当前支持one-hot和dummy编码技术。当需要用一组特定的预测变量与其它预测变量组作比较时,通常使用哑编码(dummy coding),与之比较的变量组称为参照组。One-hot编码与哑编码类似,两者的区别是前者为每种分类值建立数字类型的0/1指示列。在每行数据中(对应一个数据点),只有一个分类编码列的值可以为1。 矩阵操作Matrix Operations运用矩阵分解,将大型矩阵分解成简单矩阵的乘积形式,则可大大降低计算的难度以及计算量。矩阵加减乘除、最值、均值、求秩、求逆、矩阵分解(QR,LU,Cholesky),特征提取。 规范化和距离函数Norms and Distance Functions求范数,余弦相似度,向量间距离。  稀疏向量Sparse Vectors实现稀疏向量类型,如果向量中重复值较多,可以用来压缩储存节省空间。 透视图Pivot透视表或枢轴表,通常用来实现OLAP或报表系统中一类常见的行列转置需求。pivot函数能够对一个表中存储的数据执行基本行转列操作,并将汇总后的结果输出到另一个表中。使行列转置操作变得更为简单与灵活。  模式匹配Path是在一系列行上执行常规模式匹配,并提取有关模式匹配的有用信息。有用的信息可以是简单的匹配计数或更多涉及的内容,如聚合或窗口函数。 会话Sessionize会话化功能对包括事件序列的数据集执行面向时间的会话重建。定义的不活动时段表示一个会话的结束和下一个会话的开始。可以用于:网络分析,网络安全,制造,财务和运营分析。 共轭梯度法Conjugate gradient求解系数矩阵为对称正定矩阵的线性方程组的数值解的方法。 词干提取Stemming词干提取简单说就是找出单词中的词干部分,场景比如:搜索引擎建立网页主题概念。在英文网站优化作用明显,对其他语言有借鉴意义。 训练集测试集分割Train-Test Split分割数据集,把一份数据集划分成训练集和测试集,train的部分用于训练,test部分用于验证。 交叉验证Cross Validation交叉验证。 预测指标Prediction Metrics用于评估模型预测的质量,包括均方误差,AUC值、混淆矩阵、修正R方等用于评价模型的函数。小批量预处理Mini-Batch Preprocessor把数据打包成小份进行训练,优点是它可以比随机梯度下降(默认MADlib优化器)表现更好,会更快更平滑的收敛。表 4 支持的机器学习算法 - 图类算法名称(中文)算法名称(英文)应用场景 所有对间最短路径All Pairs Shortest Path (APSP)所有对最短路径(APSP)算法找到所有顶点对之间的最短路径的长度(总和权重),使得路径边缘的权重之和最小化。 广度优先算法Breadth-First Search广度优先算法遍历路径。 超链接诱导主题搜索Hyperlink-Induced Topic Search (HITS)HITS算法输出每个节点的authority评分和hub评分,其中authority评分给出页面内容的分数,hub评估出连接到其他页面的分数。 平均路径长度Average Path Length此函数计算每对顶点之间的最短路径的平均值。平均路径长度基于“可到达的目标顶点”,因此它忽略了未连接的顶点之间的无限长度路径。 中心性Closeness Centrality接近度度量是和的倒数,平均值的倒数,以及到所有可到达目标顶点(不包括源顶点)的最短距离的倒数之和。 图表直径Graph Diameter直径被定义为图中所有最短路径中最长的。 入度出度In-Out Degree计算图中每个点的入度出度,入度指指向此点的边的数量,出度指此点指向其他点的边的数量。 网页排名PageRank给定图形,给定图形,PageRank算法输出概率分布,该概率分布表示随机遍历图形的人将到达任何特定顶点的可能性。 单源最短路径Single Source Shortest Path (SSSP)给定图形和源顶点,单源最短路径(SSSP)算法找到从源顶点到图中的每个其他顶点的路径,使得路径边缘的权重之和最小化(每条边权值非负)。弱连通分量Weakly Connected Component给定有向图,弱连通分量(WCC)是原始图的子图,其中所有顶点通过某个路径彼此连接,忽略边的方向。在无向图的情况下,弱连通分量也是强连通分量。该模块还包括许多在WCC输出上运行的辅助函数。表 5 支持的机器学习算法 - 时间序列算法名称(中文)算法名称(英文)应用场景 差分整合移动平均自回归模型Autoregressive Integrated Moving Average model(ARIMA)时间序列预测,用于理解和预测一系列数据的未来值。比如:国际航空旅客数据,预测旅客人数。表 6 支持的机器学习算法 - 采样算法名称(中文)算法名称(英文)应用场景 采样函数sample抽样。分层抽样Stratified Sampling分层随机抽样,又称类型随机抽样,它是先将总体各单位按一定标准分成各种类型(或层);然后根据各类型单位数与总体单位数的比例,确定从各类型中抽取样本单位的数量;最后,按照随机原则从各类型中抽取样本。对称抽样Balanced Sampling一些分类算法仅在每个类中的样本数大致相同时才最佳地执行。高度偏斜的数据集在许多领域中是常见的(例如,欺诈检测),因此重新采样以抵消这种不平衡可以产生更好的决策边界。表 7 支持的机器学习算法 - 统计学 算法名称(中文)算法名称(英文)应用场景 汇总统计函数Summary生成任何数据表的摘要统计信息。协方差和相关系数Correlation and Covariance描述性统计,求Pearson系数,相关系数,另一个输出协方差。了解数据从统计学上反映的量的特征,以便我们更好地认识这些将要被挖掘的数据。统计频率算法CountMin (Cormode-Muthukrishnan)统计一个实时的数据流中元素出现的频率,并且准备随时回答某个元素出现的频率,不需要的精确的计数。基数估计算法FM (Flajolet-Martin)获取指定列中的不同值的数量。 找出这个数字集合中不重复的数字的个数。最频繁值MFV (Most Frequent Values)计算频繁值的场景。假设检验Hypothesis Tests包含F-test,chi2-test等。概率函数Probability Functions概率函数模块为各种概率分布提供累积分布,密度、质量和分位数函数。表 8 支持的机器学习算法 - 其他算法算法名称(中文)算法名称(英文)应用场景 k-聚类算法K-means聚类场景。隐含狄利克雷分布Latent Dirichlet Allocation (LDA)LDA 在主题模型中占有非常重要的地位,常用来文本分类。关联规则算法Apriori Algorithm关联规则算法,关联规则挖掘的目标是发现数据项集之间的关联关系。比如经典的“啤酒和尿布”。二、环境部署DeepSQL环境包括编译数据库和安装算法库两个部分。前提条件环境中安装python2.7.12以上版本Python。数据库需要开启对PL/Python存储过程的支持。安装算法库需要拥有管理员权限的用户。操作步骤1. 检查部署Python环境安装前,请查看系统安装的python版本,当前DeepSQL需要python2.7.12以上版本的环境。如果当前系统python2版本高于2.7.12,可以直接安装python-devel包。如果版本过低,或者无法安装python-devel包,可以下载最新python2源码,手动配置编译python2,并配置环境变量。算法库中,部分算法调用了python包,如numpy,pandas等。用户可以安装以下python库:pip install numpy pip install pandas pip install scipy须知:如果自行编译python,需要在configure脚本执行时加入–enable-shared参数。如果系统中的python2使用的是UCS4编码,自行编译python2时,还需要加入–enable-unicode=ucs4参数。可以在系统中自带的python2下执行:“import sys;print sys.maxunicode”并查看结果,如果结果是65535,说明系统默认的是ucs2;如果结果是1114111,说明用的ucs4编码。如果系统中内置的python2使用的ucs4,说明系统中的gdb,gstack等也会依赖ucs4。因此自行编译的python2在configure时,需要添加–enable-unicode=ucs4,否则后续使用gdb,gstack时,会遇到报错。2. 编译部署数据库数据库需要开启对PL/Python存储过程的支持。默认编译数据库,不包含此模块。因此需要编译数据库时,在configure阶段,加入--with-python参数;其他编译保持步骤不变;编译完成后,需要重新gs_initdb;默认PL/Python存储过程模块不被加载,请执行“CREATE EXTENSION plpythonu”来加载模块。3. 算法库编译和安装算法库使用开源的MADlib机器学习框架。源码包和相应patch可以从第三方库的代码仓库里获取。安装命令如下:tar -zxf apache-madlib-1.17.0-src.tar.gz cp madlib.patch apache-madlib-1.17.0-src cd apache-madlib-1.17.0-src/ patch -p1 < madlib.patch编译命令如下:./configure -DCMAKE_INSTALL_PREFIX={YOUR_MADLIB_INSTALL_FOLDER} -DPOSTGRESQL_EXECUTABLE=$GAUSSHOME/bin/ -DPOSTGRESQL_9_2_EXECUTABLE=$GAUSSHOME/bin/ -DPOSTGRESQL_9_2_CLIENT_INCLUDE_DIR=$GAUSSHOME/bin/ -DPOSTGRESQL_9_2_SERVER_INCLUDE_DIR=$GAUSSHOME/bin/ # 以上均为configure命令。 make make install其中, {YOUR_MADLIB_INSTALL_FOLDER}需要改为用户的实际安装路径。须知:编译MADlib时,会联网下载依赖软件。无法联网时,需要手动下载依赖包“PyXB-1.2.6.tar.gz”,“eigen-branches-3.2.tar.gz”和“boost_1_61_0.tar.gz”放在本地。使用的configure命令如下:./configure -DCMAKE_INSTALL_PREFIX={YOUR_MADLIB_INSTALL_FOLDER} # your install folder -DPYXB_TAR_SOURCE={YOUR_DEPENDENCY_FOLDER}/PyXB-1.2.6.tar.gz # change to your local folder -DEIGEN_TAR_SOURCE={YOUR_DEPENDENCY_FOLDER}/eigen-branches-3.2.tar.gz # change to your local folder -DBOOST_TAR_SOURCE={YOUR_DEPENDENCY_FOLDER}/boost_1_61_0.tar.gz # change to your local folder -DPOSTGRESQL_EXECUTABLE=$GAUSSHOME/bin/ -DPOSTGRESQL_9_2_EXECUTABLE=$GAUSSHOME/bin/ -DPOSTGRESQL_9_2_CLIENT_INCLUDE_DIR=$GAUSSHOME/bin/ -DPOSTGRESQL_9_2_SERVER_INCLUDE_DIR=$GAUSSHOME/bin/4. 将算法库安装到数据库中进入{YOUR_MADLIB_INSTALL_FOLDER}路径。进入bin文件夹。执行如下命令。 ./madpack -s <SCHEMA_NAME> -p opengauss -c <USER_NAME>@127.0.0.1:<PORT>/<DATABASE_NAME> install命令中参数说明如下:-s:schema的名称。-p:数据库平台,使用opengauss即可。-c:连接数据库的参数。包括用户名、‘@’、IP地址、端口号和目标数据库名称。install为安装的命令,除此之外,还有reinstall(重新安装),uninstall(卸载)等命令可用。说明:目标数据库必须存在。IP请使用127.0.0.1,不要使用localhost。涉及到大量PL/Python存储过程的安装、卸载等操作,需要数据库管理员权限用户来进行,普通用户没有权限创建和修改PL/Python存储过程,只能调用。数据库兼容性,推荐兼容性为B。不同的数据库兼容性下,对空值,NULL等处理有较大差异。建议使用B兼容性。例如,CREATE DATABASE dbcompatibility='B'。三、使用指导PL/Python存储过程当前PL/Python存储过程优先支持python2;默认版本也是python2。PL/Python中的函数通过标准的CREATE FUNCTION声明:CREATE FUNCTION funcname (argument-list) RETURNS return-type AS $$ # PL/Python function body $$ LANGUAGE plpythonu;函数体是一个简单的Python脚本,当函数被调用的时候,它的参数作为列表args的元素传递;命名参数也会被当做普通的变量传递到Python脚本中。命名参数的使用通常更易读。 结果将使用return或yield(结果集语句的情况) 照常从Python代码中返回。如果没有提供返回值,Python返回缺省的None。 PL/Python将Python中的None认为SQL空值。例如,返回两个整数中较大者的函数定义如下。CREATE FUNCTION pymax(a integer, b integer) RETURNS integer AS $$ if a > b: return a return b $$ LANGUAGE plpythonu;注意:PL/Python函数中,后缀为plpythonu。‘u’说明是untrusted类型的存储过程。Trusted:这个语言不能访问越权的数据。例如,数据库服务器的文件、数据库内部(包括直接访问共享内存)。Untrusted:这个语言没有任何限制,允许访问任何数据(包括文件,网络,共享LIB库等,危害性较大),但是功能更加强大。PL/Python属于untrusted类型的存储过程语言,当前仅允许管理员权限的用户创建和修改,普通用户仅支持使用。定义PL/Python存储过程时,注意不要定义执行诸如import os;os.system(“rm -rf /”) 等危险语句。管理员权限的用户需要小心创建此类PL/Python存储过程。数据库Null, None和空串处理如果向函数传递了一个SQL null值,参数值在Python中将会显示为None。在数据库中,不同的兼容性下,空串的行为会被当做NULL处理。同一个函数,在不同的兼容性下表现不同。CREATE FUNCTION quote(t text, how text) RETURNS text AS $$ if how == "literal": return plpy.quote_literal(t) elif how == "nullable": return plpy.quote_nullable(t) elif how == "ident": return plpy.quote_ident(t) else: raise plpy.Error("unrecognized quote type %s" % how) $$ LANGUAGE plpythonu;示例1:SELECT quote(t, 'literal') FROM (VALUES ('abc'),('a''bc'),('''abc'''),(''),(''''),('xyzv')) AS v(t);数据库不同兼容性下的结果为:兼容性为A时,返回结果如下:ERROR: TypeError: argument 1 must be string, not None CONTEXT: Traceback (most recent call last): PL/Python function "quote", line 3, in <module> return plpy.quote_literal(t) referenced column: quote兼容性为B时,返回结果如下:quote ----------- 'abc' 'a''bc' '''abc''' '' '''' 'xyzv' (6 rows)示例2:SELECT quote(t, 'nullable') FROM (VALUES ('abc'),('a''bc'),('''abc'''),(''),(''''),(NULL)) AS v(t);数据库不同兼容性下的结果为:兼容性为A时,返回结果如下:quote ----------- 'abc' 'a''bc' '''abc''' NULL '''' NULL (6 rows)兼容性为B时,返回结果如下:quote ----------- 'abc' 'a''bc' '''abc''' '' '''' NULL (6 rows)可以看到,在兼容性“A”中,空串被当为NULL了。触发器当前PL/Python存储过程中,不支持触发器功能。匿名代码块PL/Python也支持DO声明的匿名代码块:DO $$ # PL/Python code $$ LANGUAGE plpythonu;一个匿名代码块不接受参数,并且丢弃它可能返回的值。共享数据每个函数都在Python解释器里获得自己的执行环境。全局字典SD在函数调用之间用于存储数据。这些变量是私有静态数据。每一个函数都有自己的SD数据空间,函数A的全局数据和函数参数是函数B不可用的。全局字典GD是公共数据,在一个gsql会话中,所有python函数都可访问和改变,使用时需要小心。当gsql断开或退出,共享数据就被释放。注意:运行DeepSQL或者PL/Python存储过程时,需要关闭线程池相关参数。否则PL/Python存储过程中的Sharing Data(“GD”、“SD”)等功能会失效。在数据库中,当线程池功能关闭,每一个连入的gsql,数据库内会起一个新的线程去处理。在gsql中,如果调用到PL/Python存储过程,会在本线程中完成python解析器模块的初始化,其中包括初始化“GD”,“SD”等共享空间。在线程池功能开启的状态下,一个gsql执行时,由当前空闲线程执行,每次执行可能分配到不同的线程上。导致共享数据紊乱。数据库访问PL/Python语言模块自动import一个叫plpy的Python模块。plpy模块提供几个函数执行数据库命令:比如plpy.execute,plpy.prepare等。plpy模块也提供了函数plpy.debug(msg)、 plpy.log(msg)、plpy.info(msg)、 plpy.notice(msg)、plpy.warning(msg)、 plpy.error(msg)和plpy.fatal(msg)。 plpy.error和 plpy.fatal实际上抛出了一个Python异常,会导致当前事务或者子事务退出。另一个实用函数集是plpy.quote_literal(string)、 plpy.quote_nullable(string)和 plpy.quote_ident(string)。关于审计PL/Python存储过程支持审计功能。具体设置可以参考审计。关于并发执行当前PL/Python存储过程对并发执行不友好,建议串行执行。说明: 由于openGauss是多线程架构,C-python中,由于GIL锁(Global Interpreter Lock)的限制,多线程在Python中只能交替执行,无法做到真正的并发。库内算法具体库内算法介绍和使用,可参考MADlib官方网站(MADlib文档)。须知:当前仅支持机器学习算法,不支持深度学习(deep learning)模块。当前数据库不支持xml,所以pmml模块和相关功能不支持。数据库不支持jsonb模块,json格式的模型导出功能也不支持。其他算法支持除了MADlib提供的算法外,openGauss又额外提供了以下三个算法。表 1 额外增加的模块列表算法名称(中文) 算法名称(英文) 梯度提升树gbdt 梯度提升xgboost 时间序列预测的算法facebook_prophet使用时,需要安装依赖的python库:如果使用prophet算法:pip install pystan pip install holidays==0.9.8 pip install fbprophet==0.3.post2如果使用xgboost算法:pip install xgboost pip install xgboost pip install scikit-learngbdt不需要额外安装其他库。详细操作请参考后续章节描述。
  • [交流吐槽] 华为 AI 音箱 2还有货哦
    华为 AI 音箱 2还有哦之前换了一个,质感好好。值得
  • [其他] 浅谈AI芯片
    AI芯片也被称为AI加速器或计算卡,即专门用于处理人工智能应用中的大量计算任务的模块(其他非计算任务仍由CPU负责)。当前,AI芯片主要分为 GPU 、FPGA 、ASIC。AI的许多数据处理涉及矩阵乘法和加法。大量并行工作的GPU提供了一种廉价的方法,但缺点是更高的功率。具有内置DSP模块和本地存储器的FPGA更节能,但它们通常更昂贵。AI芯片该使用什么方法原理去实现,仍然众说纷纭,这是新技术的特点,探索阶段百花齐放,这也与深度学习等算法模型的研发并未成熟有关,即AI的基础理论方面仍然存在很大空白。这是指导芯片如何设计的基本前提。因此,集中在如何更好的适应已有的数据流式处理模式进行的芯片优化设计。技术手段方面AI市场的第一颗芯片包括现成的CPU,GPU,FPGA和DSP的各种组合。虽然新设计正在由诸如英特尔、谷歌、英伟达、高通,以及IBM等公司开发,但还不清楚哪家的方法会胜出。似乎至少需要一个CPU来控制这些系统,但是当流数据并行化时,就会需要各种类型的协处理器。    AI硬件加速技术已经逐渐走向成熟。未来可能更多的创新会来自电路和器件级技术的结合,比如​存内计算​,​类脑计算​;或者是针对特殊的计 算模式或者新模型,比如稀疏化计算和​近似计算​,对图网络的加速;或者是针对数据而不是模型的特征来优化架构。  如AI芯片昇腾910,属于Ascend-max系列。在HC2018上已经发布了其技术规格。实际测试结果表明,在算力方面,昇腾910完全达到了设计规格,即:半精度 (FP16)算力达到256 Tera-FLOPS,整数精度 (INT8) 算力达到512 Tera-OPS,重要的是,达到规格算力所需功耗仅310W,明显低于设计规格的350W。徐直军表示:昇腾910总体技术表现超出预期,作为算力最强AI处理器,当之无愧。我们已经把昇腾910用于实际AI训练任务。比如,在典型的ResNet50 网络的训练中,昇腾910与MindSpore配合,与现有主流训练单卡配合TensorFlow相比,显示出接近2倍的性能提升。面向未来,针对不同的场景,包括边缘计算、自动驾驶车载计算、训练等场景,华为将持续投资,推出更多的AI处理器,面向全场景持续提供更充裕、更经济、更适配的AI算力。
总条数:7868 到第 页
上滑加载中