-
开年采购季-AI+大数据专场ModelArts新品尝鲜低至2.9元/小时,文字识别3折低至120元/年大数据包月包年75折起消费满额送华为P40 Pro企业用户抽华为平板电脑点此直达活动页→【1】ModelArts新品首发,限时抢购CPU的价格,GPU的体验!价格低至2.9元!华为云一站式AI开发开发平台ModelArts,支持数据处理、标注、训练、模型生成、部署全流程AI开发,帮助用户快速创建部署模型,管理全周期AI工作流。(1)ModelArts新人限定款--零基础玩转AI买3小时GPU送3小时CPU,原价87.6元,现价17.52元!(2折)一杯奶茶的价格,带你入手AI开发学习!Tips:活动仅限新用户参与,每位用户仅限购买1次。(2)ModelArts深度学习款,全流程体验买15小时GPU送25小时CPU,原价450元,现价270元(6折)全流程体验进阶学习课程,一次性掌握八大热门AI核心领域。(3)ModelArts实战应用款,企业级应用买30小时GPU送35小时CPU,原价882元,现价441元(5折)超值项目开发套餐,助力企业快速敏捷完成AI项目开发,高效变现。 超低套餐折扣,搭配实战应用案例,助力成为领域专家。华为云高级技术专家亲自授课,体系化课程+实战应用案例。 【2】AI 产品特价放送文字识别产品包年全系3折!通用类、票据类,证件类等22款子产品均享折扣,价格低至120元/年起!内容审核基于图像、文本、视频检测技术,可自动进行涉黄、广告、涉政涉暴、涉政敏感人物等内容检测,帮助客户降低业务违规风险。限时9折优惠,涉及内容审核产品全部规格,对审核能力要求高、审核量大的企业尤为友好!此外,本次开年采购季语音交互服务(一句话识别、录音文件识别、定制语音合成、实时语音转写)人脸识别服务(特征检索、删除特征、人脸检测、人脸比对、检测),包周期全部规格均有9折优惠!【3】大数据产品诚心诚意,开年豪礼75折!(1)数据仓库服务—包年75折数百家大型企业和组织的选择基于华为GaussDB产品云原生服务,实时、简单、安全可信的企业级融合数据仓库,AI-Natvie、分布式、多模能力为客户带来持续创新。华为云DWS所有规格,包年75折,包月也有9折优惠。(2)MapReduce服务—新版本特惠尝鲜华为云MapReduce,提供租户完全可控的企业级大数据集群云服务,轻松运行Hadoop、Spark、HBase、Kafka、Storm等大数据组件。(3)云搜索、数据可视化、数据湖治理中心,均有包年75折华为云云搜索服务是一个基于Elasticsearch且完全托管的在线分布式搜索服务,为用户提供结构化、非结构化文本的多条件检索、统计、报表。完全兼容开源Elasticsearch软件原生接口。它可以帮助网站和APP搭建搜索框,提升用户寻找资料和视频的体验;还可以搭建日志分析平台,在运维上进行业务日志分析和监控,在运营上进行流量分析等等。(4)数据湖探索包年76折起华为云数据湖探索完全兼容Apache Spark、Apache Flink、openLooKeng(基于Presto)生态,提供一站式的流处理、批处理、交互式分析的Serverless融合处理分析服务。企业使用标准SQL、Spark、Flink程序就可轻松完成多数据源的联合计算分析,挖掘和探索数据价值。活动时间:3月3日-3月31日
-
FusionInsight HD系统的网络划分为2个平面,即业务平面和管理平面,两个平面之间采用物理隔离的方式进行部署,保证业务、管理各自网络的安全性。采用单平面组网时,不区分管理平面和业务平面。管理平面通过运维网络接入,主要用于集群管理,对外提供集群监控、配置、审计、用户管理等服务。业务平面通过业务平台接入,主要为用户或上层用户提供业务通道,对外提供数据存储、业务提交和计算的功能。问题:1.哪些组件的流量走管理平面,哪些走业务平面 2.管理平面的流量都是来自哪些组件,什么情况下会导致管理平面流量激增
-
转载https://blog.csdn.net/r6Auo52bK/article/details/101088166原文编注:近日,中科院院士、清华大学人工智能研究院院长张钹教授接受记者采访时认为,目前基于深度学习的人工智能在技术上已经触及天花板。从长远来看,必须得走人类智能这条路,最终要发展人机协同,人类和机器和谐共处的世界。未来需要建立可解释、鲁棒性的人工智能理论和方法,发展安全、可靠和可信的人工智能技术。张钹院士:AI奇迹短期难再现 深度学习技术潜力已近天花板在Alphago与韩国围棋选手李世石对战获胜三年过后,一些迹象逐渐显现,张钹院士认为到了一个合适的时点,并接受了此次的专访。深度学习目前人工智能最受关注的领域,但并不是人工智能研究的全部。张钹认为尽管产业层面还有空间,但目前基于深度学习的人工智能在技术上已经触及天花板,此前由这一技术路线带来的“奇迹”在Alphago获胜后未再出现,而且估计未来也很难继续大量出现。技术改良很难彻底解决目前阶段人工智能的根本性缺陷,而这些缺陷决定了其应用的空间被局限在特定的领域——大部分都集中在图像识别、语音识别两方面。同时,在张钹看来,目前全世界的企业界和部分学界对于深度学习技术的判断过于乐观,人工智能迫切需要推动到新的阶段,而这注定将会是一个漫长的过程,有赖于与数学、脑科学等结合实现底层理论的突破。作为中国少有的经历了两个人工智能技术阶段的研究者,张钹在过去数年鲜少接受采访,其中一个原因在于他对目前人工智能技术发展现状的估计持有部分不同看法,在时机未到之时,张钹谨慎的认为这些看法并不方便通过大众媒体进行传播,即使传播也很难获得认同。 一、“奇迹并没有发生,按照我的估计,也不会继续大量发生” 经济观察报:您是如何估计和评价目前人工智能发展的现状?张钹:这一轮人工智能热潮是本世纪初兴起的。首先是出现在学术界。学术界过去对人工智能是冷遇的,但是多层神经网络的出现带来了一些改变,神经网络的理论在上世纪50年代就有了,但是一直处于浅层的应用状态,人们没有想到多层会带来什么新的变化。真正引起大家注意的就是2012年斯坦福的实验(注:2012年谷歌和斯坦福利用多层神经网络和大量数据进行图像识别的实验),过去实验的图像样本数最多是“万”这个级别,斯坦福用了1000万,用多层神经网络来做,结果发现在人脸、**、猫脸三个图像类别中,这个模型的识别率大概有7%-10%的提高。这给大家非常大的震动,因为通常识别率要提高1%要做好多努力,现在只是把层数增加了,竟然发生两大变化,一个是识别率提高这么多;第二个是能处理这么大数据。这两个变化给大家非常大的鼓舞,何况在2012年之前,人工智能没有解决过实际问题。经济观察报:这种突破的原因是什么?张钹:现在分析下来是三个原因,大家也都非常清楚了,一个大数据、一个是计算能力、一个是算法。认识到之后,一夜之间业内业外对深度学习都非常震动,然后就发生了三件历史性的事件。第一件事是2015年12月,微软通过152层的深度网络,将图像识别错误率降至3.57%,低于人类的误识率5.1%;第二件事,2016年微软做的语音识别,其词错率5.9%,和专业速记员水平一样;第三件事:Alphago打败韩国围棋选手李世石。通过人工智能,利用深度学习、大数据这两个工具,在一定条件下、一定领域内竟然能够超过人类,这三件事情给大家极大的鼓舞。特别是对于业外的人,都认为我只要掌握了大数据,利用深度学习说不定还能搞出奇迹来,于是大家做了很多很多预测,比如在多短时间内计算机会在什么事情上能超过人。但实际上,在这个之后,奇迹并没有发生,按照我的估计,今后也不会大量发生。准确一点说,今后或许会在个别领域取得进展,但是不会像之前预计的那样全面开花。特别是中国市场乐观的认为“中国市场大、数据多,运用又不受限制,所以将来奇迹一定会发生在中国”。结果很多企业在做的时候发现,不是那么回事。从目前的情况来看效果最好的事情还是这两件:图像识别、语音识别。我看了一下,中国人工智能领域20个独角兽30个准独角兽企业,近80%都跟图像识别或者语音识别有关系。经济观察报:为什么会出现这样的情况?或者说在这么长时间后,我们对人工智能目前能做什么有一个清晰的认识了吗?张钹:人工智能在围棋上战胜人类后产生了这种恐慌,“大师才能做的事,人工智能居然能做,我的工作这么平凡,肯定会被机器所替代”。这里需要考虑一下它的局限性,我一直在各种各样的会上谈到不要过于乐观。人工智能能做的那三件事(语音识别、图像识别、围棋)是因为它满足了五个条件,就是说只要满足了这五个条件,计算机就能做好,只要有任何一个或者多个条件不满足,计算机做起来就困难了。第一个是必须具备充足的数据,充足不仅仅是说数量大,还要多样性,不能残缺等。第二个是确定性。第三个是最重要的,需要完全的信息,围棋就是完全信息博弈,牌类是不完全信息博弈,围棋虽然复杂,但本质上只需要计算速度快,不要靠什么智能,可是在日常生活中,我们所有的决策都是在不完全信息下做的。第四个是静态,包括按确定性的规律演化,就是可预测性问题,在复杂路况下的自动驾驶就不满足这一条;实际上它既不满足确定性,也不满足完全信息。第五个就是特定领域,如果领域太宽他做不了。单任务,即下棋的人工智能软件就是下棋,做不了别的。经济观察报:就是说在满足这五个条件的前提下,目前的人工智能是胜任部分工作的?张钹:如果你的工作符合这五个条件,绝对会被计算机替代,符合这五个条件的工作特点很明显,就是四个字“照章办事”,不需要灵活性,比如出纳员、收银员。如果你的工作富有灵活性和创造性,计算机绝对不可能完全代替,当然部分代替是可能的,因为其中肯定也有一些简单和重复性的内容。如果认识到这一条就会认识到人工智能仍处于发展阶段的初期。不是像有些人估计的那样“人工智能技术已经完全成熟,而进入发展应用的阶段”。二、“深度学习技术,从应用角度已经接近天花板了” 经济观察报:我们应该怎么去定义目前的深度学习技术路线,它是基于概率学的一个事物吗?张钹: 现在的深度学习本质是基于概率统计 ,什么叫做概率统计?没有那么玄,深度学习是寻找那些重复出现的模式,因此重复多了就被认为是规律(真理),因此谎言重复一千遍就被认为真理,所以为什么大数据有时会做出非常荒唐的结果,因为不管对不对,只要重复多了它就会按照这个规律走,就是谁说多了就是谁。我常常讲我们现在还没有进入人工智能的核心问题,其实人工智能的核心是知识表示、不确定性推理这些,因为人类智慧的源泉在哪? 在知识、经验、推理能力,这是人类理性的根本。 现在形成的人工智能系统都非常脆弱容易受攻击或者欺骗,需要大量的数据,而且不可解释,存在非常严重的缺陷,这个缺陷是本质的,由其方法本身引起的。经济观察报:就是说通过改良的方式无法彻底解决?比如我们再增加神经网络层数和复杂性或者再提升数据的量级,会解决它的缺陷吗?张钹: 改良是不行的,深度学习的本质就是利用没有加工处理过的数据用概率学习的“黑箱”处理方法来寻找它的规律,这个方法本身通常无法找到“有意义”的规律,它只能找到重复出现的模式,也就是说,你光靠数据,是无法达到真正的智能。 此外,深度学习只是目前人工智能技术的一部分,人工智能还有更大更宽的领域需要去研究,知识表示、不确定性处理、人机交互,等等一大片地方,不能说深度学习就是人工智能,深度学习只是人工智能的一部分。一直到去年人工智能大会交流的论文还是三分之一是机器学习方面,三分之二是其他方面。经济观察报:学界在这上面还是有一个比较清晰的认识?张钹: 我可以这么说,全世界的学界大多数有清晰的认识; 全世界的企业界大多持过于乐观的估计。 为什么出现这样的情况呢?因为从事过早期人工智能研究的人,大多已经故去或者年老,已经没有话语权。现在活跃在人工智能研究第一线的都是深度学习、大数据兴起以后加入的,他们对人工智能的了解不够全面。经济观察报:如果说每一个技术路线都有一个“技术潜力”,那么在深度学习方面,我们已经把这个潜力用了多少?张钹: 科学研究是很难精确估计的,但是深度学习如果从应用角度,不去改变它,我觉得已经接近天花板了,就是说你要想再出现奇迹的可能性比较小了。经济观察报:那基于此,目前商业公司在底层技术和产业应用上还是有很大的空间吗?张钹:只要选好合适的应用场景,利用成熟的人工智能技术去做应用,还有较大的空间。 目前在学术界围绕克服深度学习存在的问题,正展开深入的研究工作,希望企业界,特别是中小企业要密切注视研究工作的进展,及时地将新技术应用到自己的产品中。当然像谷歌、BAT这样规模的企业,他们都会去从事相关的研究工作,他们会把研究、开发与应用结合起来。经济观察报:有一种观点认为我们强调的“白盒”(可理解性)它实际上是从人的思维来强调的,但是通过大数据、概率统计工具离散到连续的投射,它实际上是机器的思维,你不一定需要它给你一个解释,只要正确的答案就可以了?张钹: 目前有两种意见,一种观点认为智能化的道路是多条的,不是只有一条路能通向智能,我们通过自然进化产生了自然智能,那么我们为什么不能通过机器产生机器智能?这个智能和自然智能不会是完全一样的,条条大路通罗马,我们通过自然进化获得的智能也不见得是最佳的。这个观点我赞成,机器智能与人类不相同,其实是有好处的,恰恰可以互补,发挥各自的长处。但是从长远来看,必须得走人类智能这条路,为什么?因为我们最终是要发展人机协同,人类和机器和谐共处的世界。我们不是说将来什么事情都让机器去管去做,人类在一边享受。我们要走人机共生这条路,这样机器的智能就必须和人类一样,不然没法共处,机器做出来的事情,我们不能理解,我们的意图机器也不知道,二者怎么能合作?经济观察报:就是必须具有可解释性?张钹: 是,就是可解释性,你要它做决策,你不理解它,飞机就让它开,谁敢坐这架飞机?所以目前的阶段,车和飞机还是不能完全让机器开的。为什么司机坐在上面我们放心?因为我们和他同命运,要撞死一块撞死,机器和你可不是同一命运,它撞不死,你撞死了。有的人非常脱离实际的去想这个问题,这是不对头的,人类怎么会去那样发展机器呢(注:指把人类的命运全部交给机器)?人类不会去那么发展的,有些人在那边担忧什么机器人统治人类,我说这最多只能算远虑。经济观察报:所以图灵的论文中也说这种观点“不值一驳”。张钹: 是,那是远虑,我们目前还有很多近忧,发展人工智能必须要考虑安全问题,这已是现实问题。你看语音合成,利用现有的技术可以做到以假乱真,和真人基本没有差别。现在看来这种技术不能推广应用,因为一旦推广就全乱套了,只要搞一段用语音合成技术做成的假录音,就可以让任何一位名人身败名裂。这些都是非常危险的技术。人工智能的治理已经提到日程上了。三、“我们培养不出爱因斯坦、培养不出图灵”经济观察报:一种观点认为中国有更多的数据和更多的工程师,这种规模能倒推带来基础研究层面的突破或者决定技术的路线?张钹:这里混淆了好多概念,科学、技术、工程。科技水平需要三个标准来衡量,一个是科研水平、一个是技术水平、一个是工程实践能力,或者产业化能力。我们中国什么情况?从工程角度来看,在一些领域我们“接近世界水平”;技术水平我用的词是“较大差距”,因为不少东西还是外国会做我们不会做;科研究领域我用的词是“很大差距”,科学研究就是原创,实际上,所有人工智能领域的原创成果都是美国人做出来的,人工智能领域图灵奖得主共十一人,十个美国人,一个加拿大人。经济观察报:数据显示中国在人工智能领域的论文发表量和被引用次数都已经进入前列位置,这是否说明中国人工智能科学研究领域的突破?张钹:如果单从论文来看研究水平,基本反映在三个指标上:数量、平均引用率、单篇最高引用率。拿人工智能来讲,中国研究者论文的数量和平均引用率都还不错,但是单篇最高引用率和世界差距就很大,而这个指标恰恰是反映你的原创能力。也就是说深度学习这个领域,我们的平均水平达到世界水平了,但是最高水平和世界差距还是很大的。不过还是要肯定的,我们应用上发展比较快。经济观察报:清华在这方面有什么优势吗?张钹:在人工智能重要的会议杂志上,这十年期间论文数量、平均质量CMU(美国卡耐基梅隆大学)排第一,清华大学排第二。我们培养的人,在计算机这个领域,清华的本科、博士生都是世界一流的。目前我们的跟踪能力是比较强的,一旦有人起个头,我们能迅速跟上去。但是很可惜,我们缺乏顶尖人物,也培养不出顶尖的人才,如爱因斯坦、图灵等。我个人认为原因之一,可能与中国的文化有点关系,我们的从众心理很严重,比如在人工智能领域,深度学习很热,发表的论文作者中几乎70%是华人,但是其他非热门领域,包括不确定性推理、知识表示等几乎没有华人作者。这就是从众扎堆,不愿意去探索“无人区”。当然也不要着急,科学研究本来就是富人干的事情,是富国干的事情,我们还是发展中国家,科学研究起点比较低,暂时落后是难免的,我们会迎头赶上。 四、“低潮会发生,但不会像过去那样” 经济观察报:如果说深度学习已进天花板,那么人工智能未来的前进方向将会在哪? 张钹:最近我们准备提出一个新的概念,就是第三代人工智能的概念,人工智能实际上经历过两代,第一代就是符号推理,第二代就是目前的概率学习(或深度学习),我们认为现在正在进入人工智能的第三代。原因很明显,第一代、第二代都有很大的局限性。经济观察报:你所说的第三代人工智能技术是有明确的实现方向或者特点吗?张钹:我们现在提出的是要建立可解释、鲁棒性(注: 可以理解为稳健性)的人工智能理论和方法,发展安全、可靠和可信的人工智能技术。 经济观察报:这样的技术可能要等很久?张钹:是啊,很难预计,我们也很着急。经济观察报:是不是还得回归到数学等理论层面里再去找新的方法?张钹:这个目前我们有两条路,一个是和数学结合,一个是和脑科学结合。你想想如果没有新的数学工具,没有来自于脑科学启发下的新思路,哪来的新理论?另一方面是要把数据驱动和知识驱动结合起来,因为通过数学、脑科学上寻求突破是比较艰难的,前面这件事现在则完全能够做。经济观察报:这个结合是指之前几十年人工智能的经验统合到一块?张钹:是的,至少有一个方向就是要把第一代和第二代结合,利用各自的优势。但是这两个结合很困难,因为他们在不同空间中操作,一个是向量空间,一个是符号空间,也需要有新的数学工具的加入。经济观察报:看人工智能历史,每一代技术之间有很长的间隔期,第三代人工智能技术也会这样吗?张钹:我认为会更长,因为需要攻坚,因为遇到的问题更困难。经济观察报:会不会再过10年、20年,人工智能在学界或者公众心中,又变成一个“隐学”,就像70、80年代那样,大众又不会再经常提起来这个词?张钹:低潮会发生,但不会像过去那样,原因在哪?因为有大数据、互联网和强大的计算资源,这些都会支撑人工智能继续走下去,尽管有的时候还只是表面上的繁荣。 附: 在2018 全球人工智能与机器人峰会上,清华大学人工智能研究院院长张钹院士做题为“走向真正的人工智能”(Towards A Real Artifitial Intelligence)的大会报告。以下为报告全文,供大家学习交流。张钹院士:走向真正的人工智能 我今天要讲的中心思想就是:我们现在离真正的人工智能还有一段很长的路。为了讲清这个思想,我必须回答下面三个问题:第一,什么叫做真正的人工智能?我们的目标是什么? 第二,为什么我们需要真正的人工智能? 第三,我们如何走向真正的人工智能? 我现在回答这三个问题。首先我们如何评价目前人工智能取得的成果,我们的评价很简单,针对这 5 件事:第一是深蓝打败人类国际象棋冠军;第二是 IBM 在电视知识竞赛中打败了美国的前两个冠军,这两件事是一种类型,后面的三件事是另外一种类型;即 2015 年微软在 ImageNet 上做图象识别,它的误识率略低于人类。还有百度、讯飞也都宣布在单句的中文语音识别上,它的误识率也略低于人类。还有一个是大家非常熟悉的 AlphaGo 打败了李世石。这 5 件事情都是机器在一定的范围内超过了人类,我们如何来评价这 5 件事?大家一致认为这 5 件事之所以成功,是由于前面三个因素,一是大数据,二是计算能力提高,第三是有非常好的人工智能算法。这三个因素大家都讨论得非常多了,没必要我再来说,我现在要说的最后一个因素是被大家所忽略的,这个因素是说,这所有的成果必须建立在一个合适的应用场景下。这 5 件事虽然领域很不一样,但是它们都满足完全一样的条件,或满足下面的 5 个限制,首先你必须有丰富的数据或者丰富的知识,如果这两件东西没有,或者很少,你不用来谈人工智能,因为你无法实现无米之炊。人工智能唯一的两个资源,一个是数据,一个是知识。还有确定性信息、完全信息、静态的、单任务和有限领域。这 5 个条件里面任何一个条件不满足,现在的人工智能做起来就非常困难了。大家想想这 5 个限制条件下的应用场景是什么样的应用场景?就是照章办事,不需要任何灵活性,这显然不是智能的核心。我们现在分析一下上述 5 个场景。下象棋是完全信息博弈,信息完全和确定,没有问题。其次,它遵循着完全确定的游戏规则演化,我们把这种情况也叫做静态。Watson 机器人也是这样,Watson 是什么样的对话问题呢?它为什么选择知识竞赛呢?我们知道知识竞赛提的问题都没有二义性,都是明确的,它的答案总是唯一性的。所以这样的问答对机器人来讲是非常容易的。它涉及的领域虽然比较宽,但也是有限的,包括大家觉得很玄乎的围棋,也完全符合上面 5 个条件,所以对计算机来说也是很容易的。目前计算机打麻将就不行,因为牌类是不完全信息博弈,所以比棋类要难。总之,我们对目前人工智能取得的成果要有一个正确的评价。目前的人工智能技术在以下领域都可以找到它的应用,它们是交通、服务、教育、娱乐等等,但我要强调是这些领域里面只有满足上述 5 个条件的事情,计算机做起来才会容易,如果不满足这些条件,计算机就做起来就困难了。大家常常关心什么样的工作会被机器所替代,我可以明确告诉大家,满足这 5 个条件的工作,总有一天会被计算机取代,就是那些照章办事,不需要任何灵活性的工作,比如说出纳员、收银员等等。在座的所有工作都不可能被计算机完全代替,但不排斥你的工作中有一部分会被计算机取代,老师、企业家等的工作不可能被计算机完全代替。为什么有这 5 个限制?原因在于我们现在的人工智能是没有理解的人工智能。 我们先看符号模型,理性行为的模型,举 Watson 的例子,它是个对话系统,我们现在所有做的对话系统都跟这个差不多,但是 Watson 做得更好些,它里面有知识库,有推理机制。沃森除了专家知识之外,还有大量互联网上大众的知识,还运用了多推理机制。请看,这就是 Watson 系统的体系结构。它里面有哪些知识呢?有很多,包括百科全书、有线新闻、文学作品等等。所有的知识用纸质来表示有 2 亿页,用存储量表示达到了 4TB。它能回答什么问题呢?用它的例子来说明。第一个问题,1974 年 9 月 8 日谁被总统赦免?这对美国人来讲很好回答,同样对计算机来讲也很好回答,你用这几个关键字「1974 年 9 月 8 日」、「被总统赦免」,就能在文献里头查出来是谁,他就是尼克松。也就是说根据问题中的关键字,可以在已有的文献里头直接找到答案,这就是一般的网络检索方法。第二个问题,荧光粉受到电子撞击以后,它的电磁能以什么方式释放出来?我们用「荧光粉」、「电子撞击」、「释放电磁能」等关键词,也可以找到答案:「光或者光子」。这种方法就是平时网络搜索的原理,应该说没有什么智能。回答下面的问题就需要「智能」了,跟智利陆地边界最长的是哪个国家?跟智利有陆地边界的国家可以检索到,它们是阿根廷和玻利维亚,但是谁的边境长?通常查不到。Watson 具备一定的推理能力,它从边界间发生的事件、边界的地理位置等等,经过分析推理以后就可以找出答案,它就是阿根廷。下一个问题也属于这种性质,跟美国没有外交关系的国家中哪个最靠北,跟美国没有外交关系的国家有 4 个,只要检索就行了,但是哪个国家最靠北,没有直接答案,但可以从其它信息中推导出来,比如各个国家所处的纬度、气候寒冷的程度等等分析出来,答案是北朝鲜。智能体现在推理能力上。 但是很不幸,现在的对话系统推理能力都很差。Watson 系统好一些,但也很有限。换句话说,我们现在的对话系统离真正的智能还很远。 我们通过索菲亚机器人就可以看出来,索菲亚的对话是面向开放领域,你可以随便提问,问题就暴露出来了。大家在电视上看到索菲亚侃侃而谈,问什么问题都能答得很好,这里面有玄机,如果你的问题是预先提出来的,因为里头有答案,因此回答得非常好,在电视上给大家演示的都是这种情况。如果我们临时提问题,问题就出来了。这是一个中国记者给索菲亚提的 4 个问题,它只答对了一个。「你几岁了」,这个问题很简单,它答不上来,它的回答是「你好,你看起来不错」,答非所问,因为它不理解你所问的问题。只有第二个问题它是有准备的,里面有答案,所以答得很好。「你的老板是谁」,这个肯定它有准备。第三个问题,「你能回答多少问题呢」?它说「请继续」,没听懂!。再问第四个问题,「你希望我问你什么问题呢」?它说「你经常在北京做户外活动吗」?这就告诉我们说,现代的问答系统基本上没有理解,只有少数有少量的理解,像 Watson 这样算是比较好的。 为什么会这样?也就是说我们现在的人工智能基本方法有缺陷,我们必须走向具有理解的 AI,这才是真正的人工智能。我这里提出的概念跟强人工智能有什么区别?首先我们说它在这点上是相同的,我们都试图去准确地描述人类的智能行为,希望人工智能跟人类的智能相近,这也是强人工智能的一个目标,但是强人工智能只是从概念上提出来,并没有从方法上提出怎么解决。大家知道强人工智能提出了一个最主要的概念,就是通用人工智能。怎么个通用法?它没有回答。我们现在提出来的有理解的人工智能是可操作的,不只是概念,这是我们跟强人工智能的区别。人机对话的时候,机器为什么不能理解人们提的问题。我们看一个例子就知道了,我们在知识库里把「特朗普是美国总统」这个事实,用「特朗普-总统-美国」这三元组存在计算机里面,如果你提的问题是「谁是美国总统」?机器马上回答出来:「特朗普」。但是你如果问其它有关的问题,如「特朗普是一个人吗」?「特朗普是一个美国人吗」?「美国有没有总统」?它都回答不了。它太傻了,任何一个小学生,你只要告诉他特朗普是美国总统,后面这几个问题他们绝对回答得出来。机器为什么回答不了后面的三个问题呢?就是这个系统太笨了,没有常识,也没有常识推理。既然特朗普是美国的总统,美国当然有总统,但是它连这一点常识的推理能力都没有。所以要解决这个问题,必须在系统中加上常识库、常识推理,没有做到这一步,人机对话系统中机器不可能具有理解能力。但是大家知道,建立常识库是一项「AI 的曼哈顿工程」。大家想想常识库多么不好建,怎么告诉计算机,什么叫吃饭,怎么告诉计算机,什么叫睡觉,什么叫做睡不着觉,什么叫做梦,这些对人工智能来说都非常难,美国在 1984 年就搞了这样一个常识库的工程,做到现在还没完全做出来。可见,要走向真正的人工智能,有理解的人工智能,是一条很漫长的路。这里介绍一点我们现在做的工作,加**识以后,对话的性能会不会有所改善。 我们的基本做法是建立一个常识图谱,用这个图谱帮助理解提出的「问题」,同时利用常识图谱帮助产生合适的答案。 下面就涉及到具体怎么做了,我不详细说了,我就说结果,结果是有了常识以后,性能有了显著的改善,对话的质量提高了。这篇文章已经发表,有兴趣可以去阅读。另外是准符号模型,深度学习、神经网络主要用来模拟感性行为,感性行为是一般很难采用符号模型,因为感性(感觉)没法精确描述。比如「马」,怎么告诉计算机什么叫做马?你说马有四条腿,什么叫做腿?你说细长的叫做腿,什么叫细?什么叫做长?没法告诉机器,因此不能用符号模型。目前用的办法就是我们现在说的神经网络或者准符号模型,也就是用人类同样的办法,学习、训练。我不告诉机器什么叫做马,只是给不同的马的图片给它看,进行训练。训练完以后,然后再用没见过的马的图片给它看,说对了,就是识别正确了,说不对就是识别不正确,如果 90% 是对的,就说明它的识别率是 90%。后来从浅层的神经网络又发展到多层的神经网络,从浅层发展到多层有两个本质性的变化,一个本质性的变化就是输入,深层网络一般不用人工选择的特征,用原始数据就行。所以深度学习的应用门槛降低了,你不要有专业知识,把原始数据输进去就行了。第二个是它的性能提高很多,所以现在深度学习用得很多,原因就在这个地方。通过数据驱动建立的系统能不能算是有智能呢?必须打一个很大的问号,就是说你做出来的人脸识别系统甚至识别率会比人还高,但是我们还不能说它有智能,为什么呢?这种通过数据驱动做出来的系统,它的性能跟人类差别非常大,鲁棒性很差,很容易受干扰,会发生重大的错误,需要大量的训练样本。我们刚才已经说过,给定一个图像库我们可以做到机器的识别率比人还要高,也就是说它可以识别各种各样的物体,但是这样的系统,我如果用这个噪声输给它,我可以让它识别成为知更鸟,我用另外的噪声输给它,可以让它识别成为猎豹。换句话讲,这样的系统只是一个机械的分类器,根本不是感知系统。也就是说它尽管把各种各样动物分得很清楚,但是它不认识这个动物,它尽管可以把猎豹跟知更鸟分开,但是它本质上不认识知更鸟和猎豹,它只到达了感觉的水平,并没有达到感知的水平,它只是「感」,没有上升到「知」。我们的结论是,只依靠深度学习很难到达真正的智能。这是很严峻的结论,因为如果有这样的问题,在决策系统里头是不能用这样的系统,因为它会犯大错。我在很多场合讲过,人类的最大的优点是「小错不断、大错不犯」,机器最大的缺点是「小错不犯,一犯就犯大错」。这在决策系统里头是不允许的,这就显示人跟机器的截然不同,人非常聪明,所以他做什么事都很灵活,这就使得他很容易犯各种各样的小错。但是他很理性,很难发生大错。计算机很笨,但是很认真,小错误绝对不会犯,但是它一犯就是天大的错误。刚才把那个把噪声看成知更鸟,这不是大错吗?你把敌人的大炮看成一匹马,不是大错吗?但是人类不会发生这种错误,人类只会把骡看成驴,但是计算机的识别系统会把驴看成一块石头。原因在哪儿?原因还是 AI 的理解能力问题。我们看这个自动驾驶,过去讲得很多,而且讲得很乐观,我们看看问题在什么地方。我们现在是这样做,我们通过数据驱动的学习方法,学习不同场景下的图象分割,并判别是车辆还是行人、道路等,然后建立三维模型,在三维模型上规划行驶路径。现在用硬件已经可以做到实时,请问大家,这样能不能解决问题?如果路况比较简单,行人、车辆很少,勉强可以用。复杂的路况就用不了。什么原因?非常简单,好多人总结出这个经验,行人或者司机都会有意无意破坏交通规则,包括外国人也一样,中国人更严重一点。这就使得数据驱动方法失效,比如说我们可以用数据驱动方法来了解各种各样行人的行为,我们可以通过大量进行训练,都训练完以后,如果出现新的情况呢?计算机能理解这是人从底下钻过来,很危险吗?所以你不可能把所有情况都训练到。自动驾驶不可能对付突发事件,如果这个突发事件它没见过,它就解决不了。怎么来解决这个问题呢?实际上就是要解决从「Without」到「With」理解的问题。人工智能现在有两种基本方法,一种是用符号模型来模拟理性行为,符号模型可以表达信息的内容,所以它是在一个语义的符号空间里头,但是非常不幸,这个离散的符号表示,数学工具很难用,很多数学工具用不上去,所以它发展很慢。在模拟感性行为的时候,我们用的是特征空间的向量,向量就是数,可以把所有的数学工具都用上,优化的工具、概率统计的工具全部用上。所以数据驱动方法这几年发展非常快,再难的问题,下围棋非常难吧,计算机也可以「算」出来。但是它有一个非常大的缺陷,它是在特征空间里,缺乏语义。我们用数据去训练一个模型,所谓「黑箱学习法」,加上你的数据质量不高,很难学出有用的东西。什么叫概率统计?重复多了就是真理。如果数据质量差,充满了「谎言」。谎言重复多了,就变成真理了。我们现在想出的解决办法是这样的,就是把这两个空间投射到一个空间去,这个空间叫做语义的向量空间。 也就是说我们把符号变成向量,同时把特征空间的向量变成语义空间的向量。怎么做?一是通过 Embedding(嵌入)把符号变成向量,尽量保持语义不变,可惜现在的方法都会引起语义的丢失,我们只能在投射的过程中让语义丢失得少。第二方面做的工作比较少,就是 Raising(提升),把特征空间提升到语义空间去,这主要靠学科交叉,靠跟神经科学的结合。只有这些问题解决以后,我们才能够建立一个统一的理论,因为过去的感知和认知是不同的处理方法,大家说不到一块,如果我们能够投射到同一空间去,我们就可以建立一个统一的理论框架,这是我们的目标。在语义空间处理就可以解决理解问题,但是这项工作是非常艰巨的。介绍一项我们现在做的工作。人工神经网络为什么不能得到语义信息呢?人脑的神经网络为什么可以呢?差别就在这里,我们现在用的人工神经网络太简单了,我们正想办法把脑神经网络的许多结构与功能加进去,我们这里只用了「稀疏发电」这一性质,就可以看出一些效果,人脸、大象或者鸟的轮廓,神经网络可以把它提取出来。还有一个办法就是把数据驱动跟知识驱动结合起来。 刚才讲了,人的智能没法通过单纯的大数据学习把它学出来,那怎么办?很简单,加上知识,让它有推理的能力,做决策的能力,这样就能解决突发事件。我们现在做的工作就是把这些结合起来,这是我们的基本思路,知识也好,数据也好,都投射到同一空间,然后都用同样的数学方法进行处理,这方面我们已经做了不少工作。最后做一个总结,我们从这个坐标看人工智能,横轴代表领域的宽窄,从单领域到多领域、到开放领域。纵轴代表信息的确定性与完全性,从完全到不完全、从确定到不确定。在左下角代表最容易的,就是刚才讲的符合 5 个条件的,现在人工智能在这部分解决得非常好,我们用白色来表示它,AlphaGo 在这里,深蓝在这里,工业机器人在这里。现在我们正在向灰色地区去走,打牌,信息不完全,现在打德州扑克,一人对一人,计算机能战胜人类,多人对弈,计算机还不行,这是灰色地带,我们还可以做,为什么可以做?尽管打牌是不确定的,但是它在概率意义下是确定的,你拿的这副牌的概率,可以算出来,同花的概率是多少,排成顺的概率是多少,既然概率能算出来,最终人类肯定会被计算机打败。Watson 在右边,它的领域比较宽,但是它是确定性的,所以是在灰色的区域。往右上方去就比较难了,自动驾驶、服务机器人、大数据分析,它是一个大框,有的简单,有的困难,就自动驾驶来讲,专用道、行车很少,路况简单等,在白色或者灰**,如果路况复杂就到了黄**域,黄**现在计算机还解决不好。最远的在哪儿呢?右上角,图灵测试。大家对图灵测试有很多误解,其实图灵测试是开领域问答,很难!索菲亚做得怎么样?很糟糕。自然语言理解也在这里,复杂环境下的决策在偏左一点的地方,这也是很难的。所以我们人工智能现在是从左下角往右上角走,我们现在处在出发点附近。有的人想把它用一些名词来区分人工智能的不同发展阶段,有专家问我,你的看法怎么样?我建议不要用新词,用新词往往说不清,很麻烦,有的人说现在是弱人工智能,以后是强人工智能,也有人说现在叫增强智能(Augmented Intelligence)也是 AI……概念太多说不清,还是简单一点,「我们正在通往真正 AI 的路上」,现在走得并不远,在出发点附近,人工智能永远在路上,大家要有思想准备,这就是人工智能的魅力。 大家为什么这么重视人工智能?因为我们永远在路上,这就吸引我们去解决这些问题,这些问题一旦解决了,人类的社会进步、人类的生活就会发生本质上的改变。 最后我用中文写最后一段作为总结,可惜我翻译不了。周穆王西巡狩,路遇匠人名偃师。翌日偃师谒见王,偕来一个假人。「趋步俯仰,信人也」。「领其颅,则歌合律;捧其手,则舞应节。千变万化,惟意所适。王以为实人也,与盛姫内御并观之,技将终,倡者瞬其目而招王之左右侍妾。王大怒,要杀这个偃师。偃师大慑,立剖其倡者以示王,皆傅会革、木、胶、漆、白 、黑、丹、青之所为。穆王始悦,诏贰车载之以归。这是 3000 年前我们古人对机器人的想象,看看现在的人工智能做得怎么样呢?索菲亚是我们现在达到的水平,可是她不会唱歌、不会跳舞,只会说英文,周王也听不懂,肯定没有印象。现在我们假设索菲亚「瞬其目而招王之左右侍妾」,向周王的姨太太们送去秋波,王会如何呢?我认为没反应,因为索菲亚是女的,他用不着吃醋。但是我们假设索菲亚「瞬其目而招王」,向大王送去秋波,王会大悦,立即神魂颠倒,坠入爱河?我认为不会,因为索菲亚根本不像人,它最近才刚刚安上手脚,走路都不利索,怎么行呢?所以我的结论是,「索菲亚通不过穆王的测试,当然它更通不过图灵测试」。我们的结论是什么? 人工智能刚刚起步,离真正的 AI 还很遥远, 大家共同努力吧,我们任重道远。
-
随着互联网技术和智能服务的飞快发展,云服务走进了人们的生活和视野当中,云服务广泛的运用于生活或工作中的很多的地方,主要表现为云物联、云安全和云储存三种方式。但是同时云服务安全也成为现在人们较为关注的问题。云服务安全的需求已经迫在眉睫:在传统的信息安全时代主要采用隔离作为安全的手段,具体分为物理隔离、内外网隔离、加密隔离等,这种隔离手段针对传统IT架构能起到有效的防护作用,但随着云计算、大数据的兴起,这种以隔离为主体思想的传统信息安全在新的IT架构中已经难以为继。在安全圈有种说法:“大数据时代最先受益的是骇客”,以前需要逐个攻陷用户的电脑获取资料,现在人们将大量化的数据资料放置在共享网络上,只需入侵服务器的端口,便可以得到数倍于以前的成果,如果缺乏有效的安全防护,一切的数据资料都将成为提供给骇客们的盛宴。于是本着“回归问题原点”的原则,云服务安全这一与云计算相伴相生的服务便应运而生。云服务安全的市场目标明确:云服务安全分为底层的IaaS平台,中间层的PaaS平台及上层SaaS服务。各个云服务安全公司根据自己的技术能力与目标受众的不同,各自拥有着自己的服务对象。目前,国内云服务安全市场还处于发展初期,具体来说,还处在美国2010到2011年阶段,重在研发和产品。但是这一发展状况正在因为国外巨头进入而发生变化。2013年,微软Azure进入中国市场,随后亚马逊AWS也进入中国市场。国际巨头给国内厂商带来巨大压力,国内已经提前迎来价格竞争。目前,国内阿里云、腾讯云普遍降价。国内市场面临的是产品品类、服务质量与价格的多重竞争,市场格局将很快显现。霸主地位和技术垄断从来都不利于一个行业的发展,激烈的竞争会产生频繁的技术创新,也会促使云服务安全提供商带来更好的服务和产品体验,“你方唱罢我登场”,也只有这样,才能真正的为人们的资料安全保驾护航。————————————————版权声明:本文为CSDN博主「qq_42302805」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。原文链接:https://blog.csdn.net/qq_42302805/article/details/84773246
-
泰克双创实践云平台提供云计算、大数据、人工智能、物联网等专业建设资源和师生的实践能力提升服务,大大解决了教学环境普通局限性,打破了ICT行业的教学瓶颈。以下为华为云云市场-泰克双创用户案例:1、云南工程职业学院 - 加强综合实践,全面提升人才培养质量云南工程职业学院与华为、泰克成立大数据技术与应用专业教学部,采取2+1(三年制)的培养模式,合作专业的学生实行“双证”毕业制度,全面推进产教融合、提升教育的社会服务功能。产教融合实践云平台提供技术支撑,为每位学生配置虚拟机,学生通过登陆虚拟机,即可完成大数据的安装、部署、调试以及开发类的实验。支持一键接入实验环境,随时记录实践进程并自动生成实验报告。老师可以通过可视化的管理界面随时了解学生实践进程,方便查阅根据具体操作自动生成的最真实、翔实的实训报告。2、深圳信息职业技术学院 - ICT创新人才培养典范深圳信息职业技术学院和华为公司、泰克教育共建ICT人才培养基地,以产教融合实训云平台为实践环境支撑,涵盖云计算、大数据、人工智能、物联网、数据安全等专业教学内容和便捷高效的云端实验室资源,帮助学生提升动手实践能力,培养出了一批批符合社会需求的技术技能型人才。在华为大学生ICT大赛2018全球总决赛中,深信息的参赛学生凭借优秀的实战能力,斩获企业网络(网络融合)赛道的全球一等奖3、重庆电子工程职业学院 - 立足IT&CT,培养复合型ICT人才2018年,重电、华为、泰克三方共建 “重电—华为ICT学院综合应用创新实训基地” ,该基地由产教融合实训云平台提供技术支撑,聚焦大数据、云计算、人工智能、数据通信等ICT技术领域的创新型人才培养,致力建成涵盖IP、IT、CT全技术领域的ICT校内实训基地,助力培养契合产业需求的ICT高素质人才,就业率达96%以上,专业对口率82%以上。该基地目前已面向社会开展职教1+x华为证书业务、工程项目承接服务。4、北京理工大学 - 培养应用型人才,适应信息技术迅猛发展2018年,新工科联盟、北理工、华为和泰克联合打造的全国首个新工科创新人才基地正式揭牌成立,华为-泰克产教融合实训云平台提供技术支撑,聚焦云计算和大数据创新人才培养。基地可满足200名师生同时进行云计算、大数据、人工智能、数据安全等学科专业的实践实训,是目前北京理工大学规模最大的实训中心,一方面为计算机学院卓越工程师实践能力培养服务,另一方面,也为全校非计算专业学生的ICT能力提升提供了有效帮助。北理工-新工科创新人才基地建成后,华为—泰克双创实践云平台从老师工作效率提升、学生学习和实践体验等方面得到了一致好评。文中提到的商品链接:泰克双创实践云平台华为云云市场-严选商城在售【华为云云市场,助您无忧上云】
-
来源:隐私计算联盟成员-中国工商银行软件开发中心作者:强锋,张闯一、背景近年来,数字经济蓬勃发展,已经成为带动中国经济增长的核心动力。2020年4月9日,**国务院发布了《关于构建更加完善的要素市场化配置体制机制的意见》(以下简称《完善意见》),首次将数据与土地、劳动力、资本、技术等传统要素并列为生产要素,这表明数字经济时代,数据成为新的关键生产要素,已成为社会基础性战略资源,蕴藏着巨大潜力和能量,必将成为提升金融行业赋能实体经济的有力抓手。随着大数据技术的快速发展,人们每天的活动产生了大量的数据,这些数据被众多的企业收集和使用,数据在空间和时间里面流动产生了价值。在价值产生的过程中,需要对数据进行保护。但是数据往往分布在不同的企业、机构,形成了如图1所示的一个个数据“孤岛”。例如,在机构间,尤其政府部门,很多数据没有充分共享。又比如银行和税务,希望通过银税合作来获取客户的风险评估信息。在企业内部也是如此,集团化的企业公司越来越大,子公司、分公司,就连部门内部的系统都可能是自己分别开发的,数据之间完全孤立。为了挖掘数据中蕴藏的巨大价值,消除行业数据孤岛现象,让数据相互之间协作起来,必然是未来发展趋势。数据在为人们的生活带来了种种便利的同时,也使得大家对于个人的数据隐私和安全带来了担忧,这俨然已经成为世界性的问题。各国针对这个情况,纷纷立法进行规范,例如:欧盟提出了《通用数据保护条例》(General Data Protection Regulation, GDPR),该法案已于2018年起正式生效;中国也在制定《个人信息保护法》,用以加强监管。可见,对用户数据隐私和安全管理的日渐收紧已经成为了必然的趋势。这就对企业利用数据开展业务提出了一个挑战。如何才能在遵循法规的要求下,即充分发挥数据的价值,同时又不会影响到用户的数据隐私和安全?尤其是对于依赖外部数据的企业,如何能够利用合作伙伴的数据价值,又不会见到原始数据,造成数据泄露的问题?针对这一情况,近年来,学术界和工业界都已经开始在数据安全和隐私保护方向的探索,尤其是在大数据、人工智能和密码学等领域。如何在满足数据隐私、安全和监管的前提下,设计一个机器学习框架,让人工智能能够更高效、更准确的共同使用各方数据成为了研究的核心,联邦学习应运而生。图1. “数据孤岛“现象普遍存在二、联邦学习(一) 什么是联邦学习1、联邦学习的内涵联邦学习,是一个机器学习框架,能有效帮助多个机构在满足用户隐私保护、数据安全和政府法规的要求下,进行数据使用和机器学习建模,能够有效的解决数据孤岛、数据合规性以及两者的冲突,进而达到“数据可用不可见”的目标。联邦学习从名字上看,有两个明晰的主题:学习和联邦。什么是学习?这个概念源自于我们谈论的数据和信息。数据一般被认为是原始素材,客观描述事物的数量、属性、位置等关系。信息则是经过加工处理之后、具有逻辑关系的数据,通常会是对决策有价值。学习的内容是知识,知识则更多是在信息上再进一步归纳演绎之后,沉淀下来的有价值的信息。通常情况下,学习到的知识被认为是与决策有关的。从学习到联邦,其最终目的是希望通过一种安全的方式解决数据孤岛现象,达到“数据可用不可见”的目标。在联邦学习里,联邦本质上是一种安全协议下的数据交换共享,目的是有效利用各参与方的数据来进行知识的共创、共享和推理。2. 联邦学习的外延联邦学习与很多技术有一定关系,比如可信执行环境、密码学、隐私计算。例如,可信执行环境是一种芯片级的硬件安全计算技术,联邦学习可以依靠这种方式来实现更高的硬件层面的安全性能。如表1所示,列举了在联邦学习中涉及到的相关技术和算法。表1. 联邦学习相关技术3. 数据可用不可见数据可用不可见,即充分利用各方的数据,让数据保持对外开放,同时能够让数据不直接共享,不离开机构或个人。为了实现“数据可用不可见”这个目标,传统的中心化计算模式,也就是大数据经常会做的中心化聚集,把数据存储聚集再做训练,已经不能满足合规性的要求。中心化不可行,那就让数据分散在各个机构中,采用分布式或者去中心化方式计算或学习。在真正的实践中,通常采用一种弱中心化方式,过去强中心化大数据集成方式是不可行的,主要是安全存在很大隐患。但是完全的去中心化,也很难兼顾效率。弱中心化方式更多是一种强中心化和去中心化的折衷。原始数据直接共享不可行,我们可以采用两种方式,第一种方式是对数据进行加密,加密后也不破坏原始数据的统计特征。第二种方式,可以将数据知识化,也就是说将数据转化成一种模型策略的知识,再把这些分散的知识聚合在一起,实现数据的可用。(二) 联邦学习的模式1. 数据视角根据数据分布形式,联邦学习的模式可分为跨样本联邦(横向联邦)、跨特征联邦(纵向联邦)、复合型联邦(联邦迁移)。跨样本联邦的目的是要充分利用数据服务提供方的样本和标签数据,让各参与方利用私有数据在本地进行训练,再通过模型聚合方式不断更新模型。相同性质的机构之间拥有相似特征指标但是样本分布不同,通常采用跨样本联邦的模式,比如多个消金机构之间可以联合进行多头风险分析。跨样本联邦也称作横向联邦学习。跨特征联邦由于可能只有一个参与方有标签数据,由于模型需要多方数据才能训练,模型推理时也同样需要多方数据才能完成。跨特征联邦在金融行业有非常广泛的应用需求,不同性质的机构之间拥有的特征指标会差异很大,通常采用跨特征联邦的模式,比如银行与互联网机构之间进行联合智能风控、信用评估、反欺诈。跨特征联邦也成为纵向联邦学习。复合型联邦,只有一小部分样本或特征集是各参与方的交集,其余数据无论是特征分布还是样本分布都不尽相同。这种场景下,涉及跨样本联邦和跨特征联邦的组合。这种联邦在实际应用中更为常见,比如甲城市面向当地客户的保险公司、乙城市面向当地居民的医疗机构,两方联合训练核保模型。2. 应用视角从联邦应用视角来看,联邦学习的应用流程可划分为如图2所示的三个阶段,包括联邦预数据探查、联邦模型训练、联邦模型推理三个阶段。图2. 联邦学习应用流程参与方生成联邦模型之前通常需要预先对样本、数据进行联邦数据探查,联邦数据探查是指在保障数据安全和隐私的前提下对数据进行的一些处理和统计分析,包括样本对齐、特征处理、联邦分箱、联邦特征选择等。如图3所示,列举了在联邦数据探查阶段常用的联邦特征处理和联邦特征选择方法。图3. 常见的联邦特征处理和联邦特征选择方法完成联邦数据探查后,即可进行联邦模型训练生成联邦模型,根据联邦学习模式不同,联邦模型训练可以分为跨特征联邦、跨样本联邦以及复合型联邦,根据具体的业务场景,可选择相应的联邦算法,如:线性回归、逻辑回归、树、神经网络等模型的训练。联邦训练生成模型后就可以投入生产环境使用进行联邦模型推理了。跨样本联邦只需要本地特征数据和本地模型即可直接推理,不会涉及联邦参与方之间的数据交换。而跨特征联邦在训练过程用到了多方特征,推理时也会用到多方特征指标,但不会涉及到其他参与方隐私数据的交换。联邦推理方法是与联邦模型训练时选择的算法强相关的,一般都是配套设计实现的,通常包括回归模型推理、树模型推理、神经网络模型推理等。三、 联邦三部曲联邦三部曲由联邦协议、联邦算法和联邦平台组成,三者之间内部独立,且又相互关联。联邦协议是参与方之间进行安全数据交换的基础,联邦算法是基于联邦协议实现的多方联合训练和推理的计算过程,联邦平台是在封装了联邦算法之外又提供了更全面的产品化功能。下面将分别进行详细介绍。(一) 联邦协议为了在联邦学习的各个参与方之间,实现算法的训练和推理,必须在底层建立一套协议,使得各参与方之间能够协调一致的运行算法程序,期间进行必要的同步指令控制、执行双方一致的加解密方法、进行有效的信息交换等。就像HTTP协议承载了我们今天看到的极度丰富的互联网应用一样,联邦协议也是建立联邦学习应用所必不可少的基础协议,有了这个协议才能使得联邦学习应用得以标准化,使得联邦学习过程中的数据安全、模型性能得到有效的保障。由于联邦学习技术栈的丰富性,联邦协议涵盖了从数据通信协议、加密算法等多个层面的技术。其中处在最底层的数据通信协议,需要在任意的两个参与方之间能够建立有效的通信,并且双方的通信信道需要支持安全加密和身份的验证,常见的数据通信协议大多基于grpc,如EggRoll,IonicBond。而加密算法则是对于涉及敏感信息的数据,进行加密处理,以在保证数据安全的前提下,进行信息交换。(二) 联邦算法有了底层的联邦协议的支持,就可以构建对应联邦算法来解决实际的问题了,从机器学习算法演化出的联邦学习算法,即以多个参与方组成联邦的方式,从多个参与方各自拥有的数据源,训练机器学习的模型,并使用模型进行应用的特定的机器学习算法。这些算法通常都是比较经典的机器学习模型,例如逻辑回归,决策树等模型的联邦化版本。为了保证在整个建模过程中数据隐私的安全,通常只将模型训练使用的梯度信息进行通信传递,并在各个参与方本地进行模型的更新。所以,这些模型的设计上,会引入特别的设计,尤其以跨特征的联邦学习为代表(一条数据的特征分别出自不同的参与方),并设计独特的数据加密、交换顺序,以完成模型的训练。当然,最终用户得到的模型的性能效果与传统的本地模型是十分接近的,但是由于可以引入更加丰富的特征数据,使得联邦学习具备了更大的提升潜力。1. 跨样本联邦算法架构跨样本联邦算法的典型架构如图4所示。在该系统中,具有相同数据结构的N个参与者通过参数或云服务器(参与方N+1)协同学习机器学习模型。一个典型的假设是参与者是诚实的,而服务器是诚实但好奇的,因此不允许任何参与者向服务器泄漏信息。这种系统的训练过程通常包括以下四个步骤:第一步:参与者在本地计算训练梯度,使用加密、差异隐私或秘密共享技术掩饰所选梯度;第二步:参与方将掩码后的结果发送到服务器;第三步:服务器执行安全聚合,不了解任何参与者的信息;第四步:服务器将汇总后的结果发送给参与者;第五步:参与者用解密的梯度更新他们各自的模型。通过上述步骤进行迭代,直到损失函数收敛,从而完成整个训练过程。该结构独立于特定的机器学习算法(逻辑回归、深度神经网络等),所有参与者将共享最终的模型参数。图4. 跨样本联邦算法架构图在跨样本场景下,各参与方拥有完整联邦模型以及完整特征向量,所以可以在本地完成联邦推理。2. 跨特征联邦算法架构假设A公司和B公司想要联合训练一个机器学习模型,并且他们的业务系统都有自己的数据。此外,B公司还拥有模型需要推理的标签数据。由于数据隐私和安全原因,A和B不能直接交换数据,是一个典型的跨特征联邦的场景,其架构图如图5所示。跨特征联邦算法的通常包括样本对齐、模型训练和模型推理三个部分,分别对应于联邦应用的三个阶段。第一部分,样本对齐:由于两家公司的用户组不同,系统使用基于加密的用户ID对齐技术,来确认双方的共同用户,而A和B不会暴露各自的数据。在实体对齐过程中,系统不会公开彼此不重叠的用户。第二部分,模型训练:在确定了公共实体之后,我们可以使用这些公共实体的数据来训练机器学习模型。模型训练核心在于A、B使用加密、差异隐私或秘密共享技术不断交互中间计算结果,如模型梯度、树的分裂点信息、中间矩阵等,直至达到损失函数收敛或固定迭代次数。图5. 跨特征联邦算法的架构图第三部分,模型推理。跨特征线性回归、跨特征逻辑回归和跨特征神经网络的联邦推理方式实际上是共通的,都是各参与方进行一轮本地计算后,将本地计算结果通过安全聚合得到和,然后各参与方基于该和进行推理,我们将其称为跨特征安全聚合推理。(三) 联邦平台为了有效的组织多种多样的联邦算法,并建立满足产业界需求的落地应用,联邦平台应运而生。就像今天各大公司纷纷建立的机器学习平台以解决各自的业务问题一样,联邦学习也需要采用这样的平台来满足业务需求。不同于一般的机器学习平台,联邦平台需要在多个参与方同时进行部署和应用。例如一个联邦模型的训练想要启动,需要当前用户在联邦平台上发起联邦建模请求,并有其他的参与方用户接受对应的请求,双方达成协议后,才能用协商好的算法,开始模型的训练。对应的,在模型的应用阶段,也需要通过联邦平台取得各个联邦参与方的子模型返回(跨特征的模型),进而合并成最终的结果。不难看出,联邦平台技术是需要在机器学习平台技术的基础上,附以安全加密、联邦算法、分布式系统调度等技术的一个综合性系统,具备相当的技术挑战。由于解决问题的初衷不同,市场上的联邦学习产品也各有特色,互有差异。Google提出开源数据联邦学习应用框架Tensorflow Federated,主要支持移动设备上的联邦学习;NVIDIA发布Clara Federated Learning主要应用医疗领域。国内各公司也在进行联邦学习的布局,如百度的PaddleFL平台,平安科技的蜂巢等。此外,华为也基于自己的终端设备开展联邦学习探索,主要用于识别业务流量后的带宽控制、阻塞控制和业务保障。微众近期开源了FedVision视觉联邦框架,解决计算机视觉任务中的跨样本联邦的问题。字节跳动也于近期开源Fedlearner联邦学习框架,主要用于广告投放。大多数联邦学习产品主要还是以提供框架为主,部分提供了安全加密的算法或者方式,更多地以鼓励参与方利用框架自主解决问题,在解决方案上没有给出明确的标准。此外,还有少部分产品如同盾科技发布的智邦iBond平台,不仅提供了联邦学习框架和安全加密算法,还针对某垂直领域定制化设计解决方案,降低了使用门槛,可以让缺少算法资源储备的行业或公司,快速接入联邦学习场景。面对不同的场景下的数据差异性和标签专属性问题,有针对性地设计了场景定制的整套联邦学习技术方案,适用于各种需要打通数据孤岛实现智能化应用的行业。四、 联邦学习技术展望(一) 联邦学习技术发展展望相比成熟的理论体系和丰富的技术实现框架,联邦学习在生产实际的应用处于初始的发展状态。但随着相关产品和产业标准不断发展,联邦学习在保护用户数据隐私、满足合法合规的基础上进行机器学习,提供强有力的技术支持。目前国内一些大型互联网公司和金融科技公司,如阿里、腾讯、百度和同盾科技等多家单位也在进行联邦学习技术研究和产品实现,不同公司的产品定位和专注点各有侧重。随着企业投资力度的加大,校企之间的合作也是百花齐放,围绕数据经济与人工智能核心、共同创造AI无限想象的商业化未来生态。(二) 应用场景展望以金融行业为例,金融行业安全关乎国家经济运行稳定与人民财产安全,诸如银行、保险等业务面临着极为严格的数据安全监管要求。金融行业在应用联邦学习技术时需要与其它组织机构、系统平台等进行数据交换,以联合各方完成建模所需的数据探查处理、模型训练与推理等流程。此外,金融数字化转型的趋势愈加明显,有必要加强金融机构、企业之间,金融机构与政府之间的数据流转与融合应用。以银行为例,加强银企、银政之家数据要素有序流转与融合,有利于发挥数据要素倍增作用。金融行业在大力发展数字化转型的同时,也要注重安全能力的建设,在数据安全共享与利用的基础上,持续挖掘数据经济价值。通过采用联邦学习技术能够为智能风控、反欺诈、反欺诈、营销等多类型金融业务服务,提供了多维度的金融商业化场景方案。1. 智能风控用户信用评估是一种基于机器学习和深度学习的智能风控模型,以分数的形式展现个人的信用风险等级。随着隐私和安全政策的逐渐收紧,因使用权限不同,导致不同部门或者不同企业之间的数据不能共享使用,最后这些金融数据会以孤岛形式存在。数据模型的准确性取决于数据量、数据种类和数据质量,使用联邦学习共同使用各方数据,提升模型的精度。比如传统信用分的场景,需要信任某一方或第三方将原始数据聚合后,才完成风控模型的建模和推理分析。在联邦学习的技术支持下,可将原始数据的基于模型的梯度进行密文传输,共同构建联邦模型。联邦学习作为一种能够保障数据隐私、数据合法合规利用前提下,充分利用多方数据的建模方法,在智能金融领域拥有巨大的应用前景。2. 智能营销随着移动互联网技术的迅猛发展,当前金融业面临着巨大的科技变革冲击,主要体现在线下服务网点增长乏力,而线上移动互联网用户迅速增长,以往依赖业务员线下地推、电话推销、**的传统营销方式,存在营销针对性不强,市场需求把握不够精准,营销成本高等问题,如今如何通过人工智能、大数据、云计算等技术在“获客-促活-留存-转化-挽留”等核心运营环节实现多维度精准获客、数据化画像分析已成决胜分水岭,行业将面临重新洗牌与变革。为拥抱新时代的到来,各家银行纷纷采取措施,试图借助大数据、AI等技术搭建智能营销平台,投身智能营销建设,期望以金融科技为抓手,赋能业务实现新的增长点。通常智能营销由客户画像、客户行为预测和营销自动化组成,其各环节都会涉及到用户不同敏感等级的数据。以客户画像为例,全行业客户画像需要覆盖客户基础信息、兴趣爱好、社会属性、金融特征、客户价值和互联网特征等多种丰富的客户属性。然而,受制于日趋严格的数据监管,传统的将各行业数据汇集在一起、中心化的方式不再可行。通过联邦学习,能够达到各行业数据可用不可见,知识共创可共享的目的。例如,可以充分发挥企业集团内部丰富的线上线下渠道资源,通过打通集团内、集团外、线上、线下渠道(如银保协同),提升渠道覆盖度,确保流量形成闭环,配合机器学习、深度学习的联邦数据探查、联邦训练和联邦推理,找到更多潜在相似人群,构建多维、准确、及时的全息用户画像。基于联邦学习,还可以构建客户的全景视图,点对点构建客户的全方向画像,完善客户分析体系,结合高效活动效果追踪体系拓展社交渠道,以及发展直营对接多个三方权益平台,综合“客户画像+社交裂变+权益吸引”三方面聚能,最终赋能客户经理直达目标客户,并辐射扩展到社交渠道,大大提升营销的成功率。3. 智能化运营智能KYC和开放银行为典型的银行智能化运营场景。随着互联网银行(也称虚拟银行)的不断发展,智能KYC成为智能化运营中客户审核环节的关键一环。随着信息技术、人工智能、大数据技术的迅速发展,生物识别技术实现了跨越式发展,促进了人脸识别、声纹识别、指纹识别、指静脉识别等创新支付技术的行业应用。如何在保证客户隐私的同时,能综合利用客户的生物特征信息,如:人脸、声纹、语音,和客户的有效证件信息全方位认识客户,是一个有挑战性的难题。基于联邦学习的深度学习、强化学习是一个有效的解决方案。未来开放银行的发展和可持续深化给用户带来了极大的便利,也给银行和金融科技带来新的挑战。在开放银行的场景下,联邦学习将成为刚需,各个机构间各种复杂业务场景下,需要安全交换各种要素,联邦学习能够在保障数据安全和隐私的前提下进行开放银行应用场景的全面覆盖。4. 反欺诈《2019反欺诈行业调研白皮书》显示,截至2018年由于个人信息泄漏造成的总体经济损失可能已超900亿元,目前黑产市场规模预估已逾千亿级别。随着互联网金融的兴起,欺诈行为逐渐渗透到各个环节。欺诈分析需要海量多维化数据,随着数据需求量的增大以及随之带来的数据获取难度的增加,本地训练模型十分昂贵且困难,各机构对数据的隐私性和保密性要求会更加严格。对于反欺诈业务来说,整合某一个用户的所有信息将愈发困难,这将会对业务造成深远的影响。因此,采用联邦的方式,可以得到适应更多区域场景的联邦反欺诈模型。5. 反洗钱随着国际反洗钱监管环境日趋严苛,国际联邦反洗钱的各参与方希望在不泄露各自样本的前提下,充分利用跨国多家合作方的反洗钱样本,在可疑活动监测、客户尽职调查与监察名单筛选等模型中利用联邦学习框架,建立较单方样本训练效果更好、更稳健的联邦反洗钱模型,以降低罚款和声誉受损等业务风险。参考文献[1]Paillier P. Public-key cryptosystems based on composite degree residuosity classes[C]. International conference on the theory and applications of cryptographic techniques. Springer, Berlin, Heidelberg, 1999: 223-238.[2]Gillmor D. Negotiated Finite Field Diffie-Hellman Ephemeral Parameters for Transport Layer Security (TLS)[J]. IETF RFC 7919, 2016.[3]NIST Special Publication 800-90A. Recommendation for Random Number Generation Using Deterministic Random Bit Generators [OL]. https://nvlpubs.nist.gov/nistpubs/Legacy/SP/nistspecialpublication800-90a.pdf. Last accessed on 10/21/2020.[4]NIST Special Publication 800-38G. Recommendation for Block Cipher Modes of Operation: Methods for Format-Preserving Encryption[OL]. https://nvlpubs.nist.gov/nistpubs/SpecialPublications/NIST.SP.800-38G.pdf. Last accessed on 10/21/2020.[5]Chou T, Orlandi C. The simplest protocol for oblivious transfer[C]. International Conference on Cryptology and Information Security in Latin America. Springer, Cham, 2015: 40-58.作者介绍强锋博士,工商银行软件开发中心资深经理,主要负责工商银行大数据与人工智能实验室的数据科学场景建设和相关研究工作,qiangfeng@sdc.icbc.com.cn。引用链接:https://mp.weixin.qq.com/s/g8bhWBQAlnk15c2yLbKqkQ
-
银行在构建大数据架构的同时,面临着诸多问题和挑战。 华为云FusionInsight首席架构师徐礼锋认为,很多大企业的硬件都是集中采购,并没有考虑到大数据不同场景对资源诉求的不一,而且计算与存储的配比并未达到很好的均衡,存在较大的浪费。不同批次的硬件之间也存在差异,虽然可以用技术手段解决硬件异构、OS异构的问题,但是持续维护的代价相当高。此外,大数据手工部署效率低、系统交付周期长、资源池之间的资源无法共享等问题,都会给银行造成浪费。面对这些挑战,许多银行都选择将大数据部署到云平台上。徐礼锋表示:“基于云原生的存算分离架构来部署大数据业务有很多优势。”“首先,硬件资源池化后,计算和存储可以灵活的扩展,利用率相对较高;其次,基于云平台的大数据环境搭建,全部自动化,从硬件资源准备到软件安装,仅用一小时完成;再者,云上只要预留了资源,空间资源可以很快加入到大数据的资源池里,新业务上线也会变得非常敏捷。”以工商银行为例,2020年初,在华为云的帮助下,工商银行开始构建云数据平台,将整个数据湖迁移到云上以实现大数据的云化和服务化,并在金融同业中首家推出了大数据风险信息服务产品融安e信,成功服务了260家金融机构和4.6万家企业。近日,雷锋网《银行业AI生态云峰会》邀请到徐礼锋作为「大数据平台」赛道的科技专家,为大家带来其多年在金融大行服务的大数据平台设计理念和交付实践。 以下为徐礼锋的演讲内容,雷锋网AI金融评论作了不改变原意的编辑:大数据技术的「演进趋势」 感谢雷锋网举办这个活动,让我有机会分享华为FusionInsight在工行的实践。大数据从2010年开始到现在各种新技术层出不穷,最近围绕云基础设施又有非常多的创新发展。 很多企业早期的数据分析系统主要构建在数据仓库之上,有的甚至连数据仓库都没有,使用TP类关系型数据库直接对接BI系统实现。这类系统一般以物理机形态的一体机部署,分布式能力比较弱,随着数据规模巨大增长,尤其是移动互联网发展,传统数据库难以支撑这种大体量的数据分析需求。在这个背景下,Hadoop技术应运而生并飞速发展,有效地解决了大数据量的分析和处理需求。Hadoop最开始的应用多用于日志类非关系型的数据处理,主要基于MapReduce编程模型,随着SQL on Hadoop的发展,关系型数据的处理能力也越来越强。早期的Hadoop主要基于物理机部署,一直到现在仍然是最成熟的部署模式。虽然Hadoop计算与存储之间是解耦的,但是绝大部分实践都还是会把计算与存储进行一体化部署,Hadoop调度系统会把计算调到数据所在位置上进行就近计算,就近计算大大提高了系统的处理能力,后期Spark、flink等都继承了这种架构优势。自从亚马逊推出云IT基础设施以来,越来越多的企业都将自己的IT业务迁移到云上,因此,在云上开展大数据业务顺理成章。基本上所有的云厂家也都提供云上大数据解决方案。那么,在云上部署大数据与原来基于物理机的on premise部署方式又有哪些不同呢?首先,尽量利用云的计算资源,包括云虚机、容器以满足资源的快速发放,包括裸金属服务BMS以提供近似物理机的高性能处理计算资源。其次,各云厂商都推出存算分离的大数据架构,亚马逊是最早实现对象存储替代HDFS,因为对象存储相对HDFS三副本成本相对较低。计算与存储分离之后带来了很多好处,但是也面临着诸多挑战。这个方向一直在不断地完善,目前,云上大数据存算分离已经发展的比较成熟。 Lakehouse是最近非常热的一个大数据概念。2020年1月份databricks发表的一篇博客中首次提到Lakehouse这个概念。之后,在今年的1月份再次发表一篇论文,系统阐述如何构建Lakehouse。很多数据分析系统都构建在数据仓库、数据湖的基础上,有些将两者结合形成如图的两层架构,大型企业后面这种形式更多。这种数据湖、数据仓库的两层架构到底存在哪些问题呢?可以看到,数据湖和数仓的很多数据是雷同的,这样就会导致以下三个问题:第一,数据要存储两份,相应的存储成本翻倍。第二,数据湖和数仓的数据存两份,就需要维护数据的一致性,这个过程主要通过ETL来保证,维护代价比较高,而且往往很难保持一致,可靠性不是很高。第三,数据的时效性。数据湖将大批量的数据集成起来并不容易。由于数据湖大多基于Hive来管理,而其底层HDFS存储并不支持修改,所以数据仅支持追加的模式来集成。而业务生产系统的数据变化不是只有追加的数据,还有很多更新的操作,如果要对数据湖的数据进行更新,就需要按分区先合并后重写。这样就增加了数据合并处理的难度,更多的时候只能通过一天合并一次的T+1的模式,T+1的模式也就意味着大部分数据对后端应用的可见性差了一天,当前看到的数据实际上是昨天的,意味着数仓里面的数据始终并不新鲜。LakeHouse就是期望解决数据湖与数仓的融合分析的问题。LakeHouse提出通过提供ACID的开放格式存储引擎来解决数据的时效性问题,开放格式另一个好处在于数据湖里的数据可以面向多种分析引擎,如Hive、Spark、Flink等都可以对数据进行访问分析,而且AI引擎也可以访问Lakehouse数据做高级分析。对于诸如Hudi、Iceberg、DeltaLake增量数据管理框架,由于其提供了ACID的能力,数据可以进行更新操作以及并发读写,因此对存储数据存储要求也更高,比如需要支持时间旅行、零拷贝等能力,才能保证数据随时可以回溯。Lakehouse除了支撑传统的BI以及报表类的应用,还要支持高级的AI类的分析,数据分析师、数据科学家可以直接在Lakehouse进行数据科学计算和机器学习。另外,Lakehouse的最佳实践是基于存算分离架构来构建。存算分离最大的问题在于网络,各云厂家以及大数据厂家,都探索了很多的手段来解决云存储本身访问的性能问题,如提供本地缓存功能来提高数据处理的效率。 Lakehouse架构可以实现离线与实时的融合统一,数据通过ACID入湖。如图所示是经典的大数据的Lampda架构,蓝色的处理流是批处理,红色的则是流处理,在应用层形成实时合并视图。这个架构存在的问题就是批处理和流处理是割裂的,数据管理之间的协同比较麻烦,而且不同的开发工具对开发要求的能力不同,对系统维护工程师和数据开发人员都是较大的挑战。针对这种的情况,Lakehouse架构可以将批处理和流处理合并成一个Lakehouse view,通过CDC把业务生产系统数据实时抽取到数据湖,实时加工后送到后端OLAP的系统中对外开放,这个过程可以做到端到端的分钟级时延。Lakehouse本身的概念比较新,大家都还在做着各种各样的实践以进行完善。FusionInsight在工商银行实践的三大阶段 工行早期主要以Oracle 、Teradata构建其数据系统。数仓为Teradata,数据集市是Oracle Exadata。 2013年开始,我们在工行上线了银行业第一个大数据平台,当时的大数据平台以单一的应用为主,例如一些日志分析、TD的新业务卸载和明细查询。2015年之后,对数据系统进行整合合并,包括通过GaussDB替代Teradata数仓,形成了融合数仓,在工行被称之为一湖两库,以FusionInsight构建数据湖底座以支持全量的数据加工,同时实时分析、交互式分析等业务也在其中得以开展。2020年初,开始构建云数据平台,将整个数据湖迁移到云上以实现大数据的云化和服务化,同时构建存算分离的架构。另外还引入AI技术。工行的技术演进方向是从单一走向多元、从集中式走向分布式、从孤立系统走向融合、从传统IT走向云原生的过程。 第一代大数据平台更多的是根据应用需求按需建设,这个时期对Hadoop究竟能解决什么问题并没有很深的认知。首先想到的是解决业务创新,以及在数仓里做不出来的业务,比如把大批量的数据合并作业卸载到Hadoop系统里。这个时期缺少系统规划,导致单集群规模小,集群数量不断增多,维护成本较高,资源利用率低。另外,很多数据是需要在多个业务间共享的,需要在集群间进行拷贝迁移,大量冗余的数据增加了资源的消耗。同时,数据需要根据不同的场景存储在不同的技术组件中,利用不同的技术组件进行处理,也导致ETL链路较长、开发效率低,维护的代价高。因此,需要对整个大数据平台的架构进行优化。 第二阶段将多个大数据集群进行了合并,形成数据湖,其特点在于数据处理层统一规划,集中入湖、集中管理。使得整体的管理、维护、开发效率得到极大提升。将原始数据入湖之后,还会对数据进行一些加工处理以形成汇总数据和主题数据,并在数据湖里进行集中治理,数据加工处理后送到数仓或者数据集市,以及后端的其他系统里。基于这种架构,数据湖的应用效率得以极大提升。经过几年发展,当前集群规模已经达到1000多节点,数据量几十PB,日均处理作业数大概是10万,赋能于180多个总行应用和境内外41家分行及子公司。但是,将所有数据存进一个集中的数据湖也带来了很多管理方面的难题。 数据湖支撑的业务和用户对SLA高低的要求不尽相同,如何给不同部门、不同业务线、以及不同用户的作业进行统一管理比较关键,核心是多租户能力,Hadoop社区YARN调度功能早期并不是很强,上千个节点的管理能力较弱,虽然现在的新版本得以改进。早期的集群到几百个节点后,调度管理系统就难以支撑。因此我们开发了 Superior的调度器加以完善。工行的1000节点集群在银行业算是比较大的数量级。我们在华为内部构建了从500到几千直到10000节点的一个集群,这个过程已经对大集群的管理能力提前进行铺垫,在工行的应用就相对比较顺利。如图所示,我们把整个的资源管理按照部门多级资源池进行管理,通过superior调度器,按照不同的策略进行调度以支撑不同的SLA。整体效果而言,资源利用率得以成倍提升。还有一些其它组件,尤其是像HBase的region server是基于JAVA的JVM来管理内存,能利用的内存很有限,物理机资源基本用不满,资源不能充分利用。为了解决这个问题,我们实现在一个物理机上可以部署多实例,尽量将一个物理机的资源充分利用,ES也是按照这种方式来处理。集群变大之后,其可用性和可靠性也存在着很大的问题。大集群一旦出现问题导致全面瘫痪,对业务影响非常大。所以,银行业必须全面具备两地三中心的可靠性。首先是跨AZ部署的能力,AZ实际是属于云上的一个概念,传统的 ICT机房里更多的是跨DC数据中心的概念,跨AZ部署意味着一个集群可以跨两个AZ或者三个AZ进行部署。Hadoop本身具备多副本机制,以多副本机制为基础,可以将多个副本放置在不同的机房里。但是以上条件并非开源能力可以支撑,需要补充一些副本放置和调度的策略,在调度时要感知数据究竟放置在哪个AZ,任务调度到相应的AZ保证数据就近处理,尽量避免AZ之间由于数据传输带来的网络IO。另外,容灾能力还可以通过异地主备来实现,跨AZ能力要求机房之间的网络时延达到毫秒级,时延太高可能无法保证很多业务的开展。异地的容灾备份,即一个主集群和一个备集群。平时,备集群并不承担业务,仅主集群承载业务,一旦主集群发生故障,备集群随之进行接管,但是相应的代价也会较大,比如有1000个节点的主集群,就要构建1000个节点的备集群,所以多数情况下,主备容灾更多的是仅构建关键数据关键业务的备份,并非将其全部做成主备容载。 大数据集群需要不断扩容,随着时间的推移,硬件会升级换代,升级换代之后必然出现两种情况,其中之一就是新采购机器的CPU和内存能力,以及磁盘的容量,都比原来增大或者升高了,需要考虑如何在不同的跨代硬件上实现数据均衡。换盘的操作也会导致磁盘的不均衡,如何解决数据均衡是一个很重要的课题。我们专门开发了按照可用空间放置数据的能力,保证了数据是按照磁盘以及节点的可用空间进行放置。同时,对跨代节点按规格进行资源池划分,对于早期比较老旧且性能相对差一些的设备,可以组成一个逻辑资源池用于跑Hive作业,而内存多的新设备组成另一个资源池则用来跑spark,资源池通过资源标签进行区分隔离,分别调度。 集群变大之后,任何变更导致业务中断的影响都非常大。所以,升级操作、补丁操作都需要考虑如何保证业务不会中断。比如对1000个节点集成进行一次版本升级。如果整体停机升级,整个过程至少需要花费12个小时。滚动升级的策略可实现集群节点一个一个滚动分时升级,逐步将所有节点全部升级成最新的版本。但是开源的社区跨大版本并不保证接口的兼容性,会导致新老版本无法升级。因此我们研发了很多的能力以保证所有版本之间都能滚动升级。从最早的Hadoop版本一直到Hadoop3,所有的组件我们都能保证滚动升级。这也是大集群的必备能力。 数据湖的构建解决了工行的数据管理的难题,但同时也面临着很多新的挑战和问题。一般而言,很多大企业的硬件都是集中采购,并没有考虑到大数据不同场景对资源诉求的不一,而且计算与存储的配比并未达到很好的均衡,存在较大的浪费。其次,不同批次的硬件之间也存在差异,有些可能还会使用不同的操作系统版本,导致了一个集群内有不同的硬件、不同的操作系统版本。虽然可以用技术手段解决硬件异构、OS异构的问题,但是持续维护的代价相当高。再次,大数据手工部署效率低。往往开展一个新业务的时候,从硬件的采购到网络配置、再到操作系统安装,整个系统交付周期至少需要一个月。最后,资源弹性不足,如果上新业务时面临资源不足,就需要扩容。申请采购机器和资源导致上线的周期较长,我们有时给客户部署一个新业务,往往大多时间是在等到资源到位。另外,不同资源池之间的资源无法共享,也存在着一定的浪费。 所以工行要引入云的架构。FusionInsight很早就上了华为云,即华为云上的MRS服务。当下工行和其他很多银行都在部署云平台,将大数据部署到云平台上。但大规模的大数据集群部署到云上还存在着一些挑战,基于云原生的存算分离架构来部署大数据业务有很多优势。首先,将硬件资源池化,资源池化之后对上层就是比较标准的计算资源,计算和存储可以灵活的扩展,利用率相对较高。其次,基于云平台的大数据环境搭建,全部自动化,从硬件资源准备到软件安装,仅用一小时完成。再次,在申请集群扩容资源弹性时,无需准备,可以很快的在大资源池进行统一调配。一般而言,云上只要预留了资源,空间资源可以很快加入到大数据的资源池里,新业务上线也会变得非常敏捷。 再说存算分离,存储主要是以对象存储为主,用低成本的对象存储替代原来HDFS的三副本的能力,对象存储一般提供兼容HDFS的接口,在此基础上,对象存储可以给大数据、 AI等提供一个统一的存储,降低存储成本,运维的效率得以提高。但是,对象存储的性能不是很好,需要围绕大数据的业务特点解决以下问题。第一个,就是元数据,因为大数据是个重载计算,在计算的过程中读IO很高。读取数据的过程中。对象存储的元数据性能是个很大的瓶颈,因此需要提升元数据的读写能力。第二个,网络带宽,存储与计算之间的网络IO对网络带宽的需求比较高。第三个,网络时延,大数据计算是就近计算,数据在哪里相应的计算就会在哪里,存储数据是优先读本地盘,之后是读网络。时延存在一定的敏感性。我们主要是从缓存、部分计算下推上做一些优化,整体上而言,存算分离架构的性能跟一体化相比,除了个别用例有差距,整体性能都更高,尤其是写场景,因为写对象存储是写EC,而不用写三副本,写1.2个副本就可以了。最后,整体的 TCO大概得到30%~60%的下降。整体的性能与周边其他产品对比还是具有很大的优势。大数据部署到云上,对于大集群而言,虚机并没有太大优势,因为数据池子够大,虚机还会带来性能的损耗,而且其性能与物理机有一定差距。而且,基于SLA隔离要求,大数据资源池在私有云部署,很多时候还是需要独占,其资源无法和别的业务共享。而裸金属服务实际上可以很好的解决这些问题,它的性能接近物理机,而且可以分钟级完成裸金属服务器的发放,包括整个网络配置,OS安装。网络部分有专门的擎天网络加速卡,对裸机网络进行管理,而且网络性能比原来的物理网卡的性能更高,在裸金属服务器上开展大规模大数据业务是云上的最佳部署方案。未来展望:湖仓一体 工行和我们也在探索湖仓一体的解决方案。 华为云湖仓一体在存算分离的基础上,将数据管理层独立出来,其中包含了几个部分,第一个是数据集成,数据从各种各样的外部系统入湖。第二个是元数据集成,由于Hadoop数据湖上的元数据通过Hive管理,我们提供一个兼容Hive Metastore的独立元数据服务。第三个是数据的授权以及脱敏这些安全策略,我们要将其在Lake Formation这一层进行统一闭环。数据的底座构建好之后,数据分析服务如大数据的服务、数仓的服务、图计算、AI计算都是在同样的一个数据视图上进行计算处理。数仓DWS的服务本质是本地存储,数仓也可以通过它的一个引擎访问Lakehouse中的数据。这样数仓自己在本地有一个加速的数据层,同时也可以访问Lakehouse。 在此基础上我们通过一个架构来实现这三种湖,持续演进。蓝色数据流是离线数据流,实现离线数据湖能力,数据通过批量集成,存储到Hudi,再通过Spark进行加工。红色数据流是实时流,数据通过CDC实时捕获,通过Flink实时写入Hudi;通过Redis做变量缓存,以实现实时数据加工处理,之后送到诸如Clickhouse 、Redis、Hbase等专题集市里对外提供服务。同时,我们还开发了HetuEngine数据虚拟化引擎,将数据湖里面的数据以及其他专题集市里的数据进行多数据源关联分析,形成逻辑数据湖。虽然HetuEngine可以连接不同的数据源,但并不意味着所有应用只能通过HetuEngine来访问数据,应用还是可以通过各数据源原生接口进行访问。仅需要不同专题数据之间进行联合分析时,才需要通过HetuEngine统一访问。 如下是具体的实施计划:第一个,引入Hudi,构建一个数据湖的数据管理,每年大概可以节省几百万。第二个,引入HetuEngine,实现数据湖内的数据免搬迁的查询分析。避免一些不必要的ETL过程。第三个,引入ClickHouse,ClickHouse在OLAP领域有着非常好的处理性能和很多优势,因此考虑将其在工行落地。 数据湖以Hive作为存储,采用一天一次批量集成、批量合并的方案,即T+1的数据处理模式。这种模式存在几个比较大的业务痛点:第一,数据延时比较高,后端服务看到的数据并不是最新的。第二,跑批作业在夜里进行,而白天资源利用率较低,但集群资源是按照高峰期需求来构建,造成很大的资源浪费。第三, Hive不支持更新,数据合并需要开发较多代码实现,如把新数据临时表与原Hive表进行左右关联后覆盖原来整表或者部分分区表,开发成本比较高,业务逻辑复杂。引入Hudi就可以在很大程度上解决这些问题。数据通过CDC入湖,通过Spark或者Flink写入Hudi,支持实时更新,端到端可以做到分钟级的时延。数据以非常小的微批形式合并到数据湖,分散跑批使得资源白天和晚上都能得到充分利用,数据湖集群TCO预计可以下降20%。此外,数据集成脚本开发可以利用Hudi的Update能力,原来Hive要写几百行的代码,只需一行脚本即可完成,开发效率提升很大。 工行数据湖使用Hive来承载灵活查询业务,如SAS使用Hive SQL来访问数据湖,访问效率比较低,响应时间长,并发能力也不足。另外数据湖与数仓的两层架构导致了大量的重复数据,有较多关联分析需求,关联处理必然涉及到湖仓之间大量ETL。比如为了支撑BI工具的分析诉求,需要数据湖和数仓数据关联处理加工,并将加工之后的数据导入OLAP引擎。整体数据链路比较长,分析效率和开发效率都很低。通过HetuEngine数据虚拟化实现湖仓协同分析,一方面替代Hive SQL访问 Hive的数据,只需1/5的资源即可支撑大概原来5倍并发,同时访问时延降到秒级。另一方面可同时访问Hive和DWS提供秒级的关联查询,可以减少80%的系统间的数据搬迁,大量的减少 ETL的过程。 传统的OLAP方案一般用MySQL、Oracle或者其他的OLAP引擎,这些引擎因其处理能力有限,数据一般按照专题或者主题进行组织后与BI工具对接,导致BI用户和提供数据的数据工程师脱节。比如BI用户有一个新的需求,所需的数据没有在专题集市中,需要将需求给到数据工程师,以便开发相应的ETL任务,这个过程往往需要部门间协调,时间周期比较长。现在可以将所有明细数据以大宽表的形式加载Clickhouse,BI用户可以基于Clickhouse大宽表进行自助分析,对数据工程师供数要求就会少很多,甚至大部分情况下的新需求都不需要重新供数,开发效率和BI报表上线率都会得到极大提升。这套方法论在我们内部实践效果非常好,原来我们基于传统OLAP引擎建模,受限于开发效率,几年才上线了几十个报表。但是切到Clickhouse后,几个月之内就上了大概上百个报表,报表开发效率极大提升。转载自AI金融评论 https://mp.weixin.qq.com/s/eJse0GE8UZp-OJpDyXFx0A免责声明:转载文章版权归原作者所有。如涉及作品内容、版权等问题,请及时联系文章编辑!
-
12月18日,2020数据资产大会在北京召开。会上,中国信息通信研究院为通过“基于可信执行环境的数据计算平台”的产品颁发证书。华为云可信智能计算服务 TICS基于鲲鹏TrustZone机密计算,结合硬件TEE和软件SMPC算法,实现了软硬结合的计算加速,同时支持跨信任域的联邦SQL分析和联邦学习能力,以九大测试项全部通过,树立隐私计算产品的新标杆。 华为云可信智能计算服务通过隐私计算测评证书历经六年的蓬勃发展,大数据产品评测已经成为政企客户选购选型过程中的重要参考,是业界衡量大数据产品质量和能力的重要标准。中国信通院大数据产品评测是国内权威的大数据评测体系,评测范围涵盖大数据产品的基础能力与性能专项,今年新增可信执行环境计算平台能力测评,尤其引人关注。华为云可信智能计算服务 TICS 面向政企行业,打破跨行业的数据孤岛,实现行业内部、跨行业之间在数据隐私保护下的多方数据联邦SQL分析和联邦学习能力,基于可信硬件执行环境TEE、安全多方计算SMPC、区块链等技术,确保了数据在存储、流通、计算过程中端到端的安全和可审计,推动跨行业的可信数据融合和协同。在本次评估测试中,华为云可信智能计算服务TICS一次性100%通过了21个必选用例,此外,在故障监控恢复、数据流通全过程审计、算法可拓展、侧信道安全等4个可选用例中也一次性通过,交出了一份完美的答卷。丰硕的成果离不开辛勤的劳作,在整个研发过程中,华为云隐私计算研发团队凭借雄厚的研发实力和丰富的探索实践经验,从以下六个方面实现了跨信任域联邦SQL分析和联邦学习:◆ 动态联盟管理:邀请华为云租户作为数据参与方, 动态构建可信计算联盟, 实现联盟内严格可控的数据使用和监管。◆ 多方数据融合分析:支持对接多个数据参与方的主流数据存储系统, 为数据消费者实现多方数据的SQL Join等融合分析, 各方的敏感数据在具有TEE安全支撑的聚合计算节点中实现安全统计。◆ 多方联邦训练:通过对接主流深度学习框架实现横向和纵向的联邦训练, 支持基于TEE和SMPC(如不经意传输、秘密分享、同态加密等)的多方样本对齐、联邦特征选择、训练模型的保护、联邦预测等。◆ 可信智能代理:数据参与方使用数据源代理模块实现自主可控的数据源注册、隐私策略(脱敏、加密、水印)的设定、元数据的发布等, 为数据源代理提供全生命周期的可靠性监控、运维管理。◆ 可视化数据使用监管:为数据参与方提供可视化的数据使用流图, 提供插件化的区块链对接存储,实现数据提供方可感知的数据使用方式和执行算法在执行前的多方共识、数据使用过程中的可审计、可追溯。◆ 云和端的容器化部署:容器化的多方数据源代理、聚合计算节点的部署管理,支持云上、边缘、混合云多种部署模式。华为云可信智能计算服务TICS已在政务数据流通、政企数据融合、普惠金融、数据交易等多个场景进行落地实践。未来,可信智能计算服务TICS会践行“平台+生态”战略,实现数据在存储、流通、计算过程中端到端的安全和可审计,释放政企数据价值,使企业更智能。
-
活动时间:2020.1.18-2020.3.6 23:59 参与方式:用户在本帖里发布自己在学习大数据全栈学习中产生的疑惑或实践问题,其他用户可通过在楼层下评论参与回答。由专家经过评审,同一问题下确定一名最佳答案。提问者可获得10积分,被采纳的回答者可获得4积分。 参与规则:1. 同一ID不可自问自答;2. 同一ID可回复其他同一ID问题数量需≤2次,如,A最多可回答B的三个问题,但A可回答B、C、D、E、F等多人次问题。3. 每个人最多可发布2个有效问题,不可重复,不可灌水。4. 每个ID回答次数不设上限,但是否被采纳要依据专家评审后的结果。 全系列活动奖励 本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器,HUAWEI 无线耳机 等智能硬件,还有华为云定制机械键盘、背包、鼠标等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 请务必按照上述要求提交内容,以免影响积分增加;3. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡4. 其他积分获取方式请查看活动主贴。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
-
为了巩固大家的学习成果,紧跟学习进度请将需要完成的大数据技术文章内容按要求回复到本帖下方按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~征集时间2020.1.18-2020.3.6 23:59征集要求1.本学习阶段任意时间内,在【华为云】-【博客】发表与大数据开发的任意博客内容,可以是开发技术技巧,可以是开发心得体会,不可以发布课程笔记作为博文,将文章链接回复至本帖内2.文章需为原创,在发布博客时,需要勾选文章创作类型:原创文章一项。用户承诺,发表的文章不存在任何知识产权问题并自行承担全部责任3.文章字数≥600字,图文并茂,不得抄袭网站课程,需写自己的理解和技术分享4.回复格式:华为云ID+博客文章链接5.如果曾在外部博客发表过的文章,可将文章迁移到华为云博客即可6.技术文章由华为技术专家评审,评审通过会对应的积分,不过专家会给出对应的评语且积分为0奖励方式每阶段每篇有效博客文章可获得10积分,每阶段获取上限20分,每阶段评选1篇最佳博文,奖励定制机械键盘~ 全系列活动奖励本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器,HUAWEI 无线耳机 等智能硬件,还有华为云定制机械键盘、背包、鼠标等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 本次活动通过完成提交大数据技术相关文章博客链接任务,可获得的积分上限为50分/每阶段;3. 请务必按照上述要求提交内容,以免影响积分增加;4. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡5. 其他积分获取方式请查看活动社群公告。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
-
了巩固大家的学习成果,紧跟学习进度请将需要完成的每周学习笔记按要求回复到本帖下方按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~每周打卡一次即可,多发无效征集时间2020.1.18-2020.3.6 23:59征集要求在本帖中,回复自己本周课程内容的学习笔记回复格式:华为云ID+笔记内容(字数≥200字)奖励方式每章有效学习打卡可获得2积分每周在本周内提交随堂测试的用户中,抽取3名幸运奖励华为云定制鼠标*1全系列活动奖励本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器,HUAWEI 无线耳机 等智能硬件,还有华为云定制机械键盘、背包、鼠标等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 本次活动通过完成客观题打卡任务,可获得的积分上限为5分/每篇;3. 请务必按照上述要求提交内容,以免影响积分增加;4. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡5. 其他积分获取方式请查看活动社群公告。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
-
让大家巩固学习成果,紧跟学习进度请将需要完成的每章随堂测验按要求回复到本帖下方按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~征集时间2020.1.18-2020.3.6 23:59征集要求在本帖中,回复自己本章随堂测验内容打卡要求在本帖中,回复对应章节的随堂测验并提交截图 ↓章节作业位置:打卡回复格式:华为云ID+课程完成截图,如图所示↓↓↓华为云ID:grandmaster每人有两次提交机会点击这里前往课程奖励方式每章有效学习打卡可获得2积分每周在本周内提交随堂测试的用户中,抽取1名幸运奖励华为云定制鼠标*1全系列活动奖励本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器,HUAWEI 无线耳机 等智能硬件,还有华为云定制机械键盘、背包、鼠标等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 本次活动通过完成客观题打卡任务,可获得的积分上限为2分/每章节;3. 请务必按照上述要求提交内容,以免影响积分增加;4. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡5. 其他积分获取方式请查看活动社群公告。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
-
伴随云计算、大数据、AI、5G等技术的飞速发展,“云原生”在2020年成为备受瞩目的热词,云原生在确保企业数字化转型中资源快速供给的同时,还能做到敏捷的应用开发、交付运维能力,加速企业的敏捷创新,是企业数字化转型、智能化升级的必经之路。早期,云原生只是提出了一些相关的技术,包括开源、容器、微服务、编排工具等,并没有给出一个关于云原生的具体定义,各厂商根据自身的理解对云原生进行探索和实践。历经五年的野蛮生长,云原生技术和产业得到了长足的发展,现如今,云原生已被各行业广泛接受,加速进入云原生2.0时代。在这个全新时代,数据作为云原生体系中的重要生产资料,如何发挥出数据最大的价值成为客户迫切需要解决的问题。传统大数据平台面临的困境随着5G、IoT、AI等技术的飞速发展,各行各业的大数据系统随之建立,并从海量数据发掘数据价值服务于客户。而大数据平台,已逐步进入客户的生产系统中,发挥至关重要的作用。伴随云原生概念的火热,业务敏捷性的需求,传统大数据平台在应对时渐露疲态,集中表现在以下三个方面:1. 硬件集采,配置不合理目前,企业依然以统一采购硬件的方式为主,配置的框架固定,未考虑大数据在不同场景中对资源的不同诉求,例如离线分析高CPU使用率,实时分析高内存和CPU使用率,全文检索高IO等使用服务器资源的特点,造成集采服务器配置与所需配置存在矛盾,易造成资源浪费。同时,硬件异构,不同厂家的硬件,对于操作系统、大数据软件甚至一个小的工具的异构兼容不统一,造成硬件不可复用,维护管理成本居高不下。2. 手工部署,效率低大数据部署、调优方案相对复杂,手工部署的步骤多,导致周期长、成本高。从方案设计到部署安装调优完成,往往需要20多个环节,一个30节点规模的集群,至上线交付至少需要1个月。同时,传统大数据基础环境的安装存在大量重复性操作,例如安装网络、OS、硬盘RAID方案、分区等,手工部署操作不仅容易出错,且效率不高,每天安装速度仅在10-15节点。3. 资源弹性不足伴随数据量的激增,大数据集群几乎每年都需扩容一次,但传统大数据在扩容时不够敏捷,政企客户在扩容时需先申报,再采购,等设备到位后才进行安装部署扩容,完成整个过程至少需要3个月,超长的等待周期无法满足高速变化的业务诉求。同时,传统大数据集群的资源独占、不共享,资源弹性不足,在业务高峰时无法借用其他闲置资源,在业务低峰时,无法释放闲置资源,造成一定的资源浪费。传统大数据走向云原生数据湖面对传统大数据共有的三大难题,各大厂商已纷纷利用云化来解决这些问题,华为云FusionInsight 认为,理想的云原生数据湖应该具备如下特性:1. 配置标准化,存算分离,资源利用率高首先,云化让大数据、数仓等资源配置标准化(华为多年大数据交付经验计算)交付,可以根据客户用数场景,科学地发放对应硬件资源;同时经过兼容性测试的硬件,也降低了客户资源异构带来的兼容性风险与ISV的适配工作量。其次,云原生数据湖将采用存算分离架构,使得计算与存储能够独立扩容,计算不足扩计算,存储不足扩存储,资源利用率提升30%+。2. 集群搭建周期从月到小时基于云平台,大数据环境搭建可实现全程可视化自动部署,在线运维监控,让大数据集**付时间从数月缩短到小时级。3. 集群扩容,资源池申请,无需等待管理员可预测建成的IAAS资源使用量,提前应对大数据资源申请,在实际使用中做到集群资源的弹性发放,无需等待,资源可用即可得。大数据云化为客户带来敏捷、高效、弹性的便捷云底座,让传统大数据走向云原生数据湖,实现大数据与云计算融合,算力更弹性,管理更敏捷。为加速政企数字化转型,助力传统大数据向云原生数据湖升级,原FusionInsight HD与华为云MRS强强结合,架构、内核归一,已全面升级到FusionInsight MRS云原生架构,将为客户提供一企一湖、一城一湖的解决方案。更多云原生前沿技术请关注12月30日华为云TechWave云原生2.0技术峰会,拥抱云原生2.0,赋能“新云原生企业”!更多内容,华为云FusionInsight系列文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html
-
随着网络世界成为企业目前最大的市场,大数据成为他们拥有和使用的最强大的工具集。几乎所有的网站和应用程序都会跟踪用户的浏览动态,以记录并随后分析用户的需求和选择。大数据技术不仅包括数据的采集,还包括对数据的理解和分析,以创建用户行为模式。只有这样,大数据才能对企业有用。大数据应用为企业进行市场研究、原型开发、产品开发和演变、用户获取以及营销工具铺平了道路。因此,大多数企业都希望以更新、更具创新性的形式使用“大数据”技术。大量数据的收集和处理收集数据并不是一个新概念,但处理数据的方式是新的,而且每天都在进一步发展。早期的数据存储在需要大量物理空间的数据存储设备中。这些数据采用关系数据库管理系统(RDBMS)和其他数据库管理系统等技术进行分析,其中数据以表和数组的形式存储,然后使用查询进行检索。随着数据的增加,这些存储技术变得难以应对。由于计算机、移动设备、物联网设备等大量数字设备现在正在收集和处理数据,并对其进行优化以进一步使用,如今已经成为一项艰巨的任务。由于这些原因,在以往只有大型企业使用大数据技术,他们可以承担存储这些大量数据的成本,然后开发和使用这些分析算法以供进一步使用。大数据的应用随着云计算的出现发生了变化借助云计算服务,“大数据”的一切都发生了变化。云计算技术基本上消除了存储量不断增加和不断变化的数据集对采购和使用大量硬件的需求。除了数据存储之外,甚至数据处理算法现在也可以在云平台上使用。这显著降低了技术使用成本,并消除了其他限制,例如所需空间。随着其他业务现在以cookies和其他工具的形式收集数据,收集到的数据量呈指数性增长。根据报道,全球2020年的互联网流量将达到2.3ZB。智能手机的地理同步数据移动应用程序开发框架及其位置和地理标记功能使数据的新维度得以发展,其中包括跟踪用户的移动,这不仅是数字的,还包括物理的。这打开了一个新的商业运营领域,这些数据可以更有效、更稳定地确定用户行为模式。例如,谷歌地图、旅游网站和应用程序,甚至零售平台现在都在使用位置数据为用户提供定制内容。物联网设备正在进一步推动大数据的获取和分析人们生活中的一切都在逐渐变得数字化。这包括几乎所有的日常用品:电视机、洗衣机、手表、灯泡、电扇甚至衣服现在都是智能设备,因此可以进行跟踪。所有这些设备都是用户数据的巨大来源,这又是大数据开发和分析的重要组成部分,从而导致创建了实时行为模式,这些行为被企业广泛使用。例如,当你在“Alexa”或“Google Home”搜索某个旅游项目时,谷歌公司就会知道你打算去哪里旅游。因此,可以从用户那里获得相关信息和诸如酒店预订之类的查询。此外,人们的睡眠模式可以通过使用大数据统计的智能可穿戴设备进行有效监控。聊天机器人:大数据的未来大数据是企业收集和利用的稳定而巨大的信息流,以改进营销和客户服务。其整体效率以其规模、速度和变化为中心。聊天机器人可以轻松地大量收集此数据。借助机器人的处理速度,聊天机器人可以同时与多个客户交流,并提供更高的客户参与度和满意度。这就是它们现在被多家医疗、保险、银行业务等用来进行在线用户交互的原因。聊天机器人与大数据产生一种共生的关系,相辅相成。越来越多机器人收集大量数据,现在也用于分析人类的心态。该概念已被用于开发“情感分析”系统,即试图通过文本确定某人对某物的情感反应的实践。随着机器人收集更多的数据并成功地识别出更多的情感,它们在分析这些信息方面做得更好,在这个过程中,它们自己也变得更智能。因此,它们相互帮助,形成一个不断发展的相互改进的链条,当与人工智能和机器等技术相结合时,往往会发掘和开发新的以用户为中心、面向未来的系统。未来的发展方向大数据如今主要处理非结构化数据,其数据量有时高达TB和PB以上。随着移动应用程序、社交网络、Web搜索请求、文本消息和媒体文件等产生大量数据,到2025年,全球产生的数据将达到175ZB。随着按需付费的最新发展,云计算基础设施将为大数据技术及其应用程序提供巨大的敏捷性、可扩展性、易用性。机器学习和人工智能技术将进一步提高其实用性和有效性。未来几年还将开发混合业务环境,在这种环境中,大数据将在几毫秒内实时处理,从而在几秒钟内帮助企业做出明智的决策。这就是科技的未来,并将持续发展。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签