-
推荐学习顺序:请知:编号顺序相同的可并行学习;知识图谱:课程链接:组件名称组件介绍链接Manager华为FusionInsight HD是一个分布式数据处理系统,对外提供大容量的数据存储、查询和分析能力基础知识安装教程运维知识HBaseHBase是一个开源的非关系型分布式数据库(NoSQL),它参考了谷歌的BigTable建模,实现的编程语言为 Java。它是Apache软件基金会的Hadoop项目的一部分,运行于HDFS文件系统之上,为 Hadoop 提供类似于BigTable 规模的服务。基础串讲+运维知识最佳实践KafkaKafka是由Apache软件基金会开发的一个开源流处理平台,由Scala和Java编写。 该项目的目标是为处理实时数据提供一个统一、高吞吐、低延迟的平台。基础串讲+运维知识最佳实践HiveHive 是一个架构在 Hadoop 之上的数据仓库基础工具,它可以处理结构化和半结构化数据,它使得查询和分析存储在 Hadoop 上的数据变得非常方便基础串讲+运维知识最佳实践SparkApache Spark 是一种用于大数据工作负载的分布式开源处理系统。它使用内存中缓存和优化的查询执行方式,可针对任何规模的数据进行快速分析查询。基础串讲+运维知识最佳实践FlinkApache Flink 是一个框架和分布式处理引擎,用于在无边界和有边界数据流上进行有状态的计算。Flink 能在所有常见集群环境中运行,并能以内存速度和任意规模进行计算。基础串讲+运维知识最佳实践
-
在大数据背景下,数据库安全保障体系的构建对于有效防范信息安全事件发生具有重要意义。该文首先分析了大 数据背景下数据库系统的安全威胁问题,然后介绍了几种网络安全的新技术,包括身份认证技术、访问控制技术等,最后 阐述了数据库安全保障体系的构建路径,希望为进一步解决大数据背景下的数据库安全问题提供支持。 现阶段大数据产业的快速发展创造了极大的经济效益,大数据的出现推动了社会经济发展,但是随之而来的数据库安全问题也引起了学者对大数据信息安全问题的反思。大数据时代下的信息与隐私安全问题已经成为全球性重点关注的问题,为了能够更有效地避免数据安全问题发生,需要相关人员积极构建数据库安全保障体系。1 数据库的安全威胁问题研究 数据库的信息安全问题得到了社会的普遍关注,从现有的数据库网络安全事件来看,其信息安全问题的风险具有范围广、影响大、突发性强等特征,并且可能产生严重的损失。与传统的攻击行为相比,数据库的网络安全问题呈现出以下特征:(1)高技术性与高智能性特征。例如部分不法分子为了能够盗取数据库中的资料,会采用各种手段穿越防火墙,通过不断地攻击数据库的安全防护体系或注入SQL等方法篡改数据,导致数据大量流失。(2)作案手段日益多样化。在大数据技术的支持下,不法分子威胁数据库的手段也呈现出了多样化的趋势,例如部分人员会运用程序的漏洞进行作案,甚至通过非法用户向管理人员非法授予操作权限的方法进行授权。(3)网络安全问题不受地域与时间因素的显示,不法分子可以随时远程攻击数据库。(4)数据库攻击的隐蔽性较强,收集证据的难度较大。文献认为,数据库作为一种特殊的信息存储结构,在大数据环境下所面临的信息安全隐患问题更加突出,表现为:(1)在网络方面,大部分数据库采用了TCP/IP 的协议通信方式,而该协议本身存在弊端,难以有效鉴别通信双方的身份,导致数据库无法正确识别攻击者的身份而遭到严重破坏。(2)在数据库管理系统上,大部分数据采用了DB2、SQL Server等商用数据库系统,这些数据库系统的技术条件成熟,但是在应用过程中,一些数据库的安全问题发生,例如关于SQL Server数据库的SQL 注入等。虽然现阶段各个厂商都在不断完善数据库等更新补丁包,但是大部分出于对数据库稳定性的考虑,通常会延后补丁的更新速度,最终导致数据库的漏洞难以第一时间被处理,最终成为安全隐患。2 大数据背景下数据库安全技术分析2.1 身份认证技术分析为实现数据库安全对用户的身份进行认证是其中的重点。现阶段常用的数据库普遍采用“ID+密码”的方式进行身份核实,即将用户的账号信息存储在数据字典等当用户产生连接需求之后,系统能够查询数据字典,并对用户的合法性进行判断。但是在大数据背景下,各种解密技术得到了快速的发展,导致 ID 认证方式面临挑战,因此鉴定人体信息的生物认证安全技术出现,通过语言识别、指纹识别的方法,对用户的身份进行判断。但从现有技术发展情况来看,身份认证技术尚未在数据库安全管理中得到运用,但是鉴于大数据的强大数据处理能力,可预见该技术在未来会具有广阔的发展前景。2.2 访问控制技术访问控制是数据库安全管理的核心内容,能够对规定主体的访问行为进行限制,避免出现任何不满足数据库安全的访问行为发生。2.2.1 自主访问控制目前自主访问控制是数据库信息安全中一种常见的访问控制技术,用户可结合自己的需求对系统的数据进行调整并判断哪些用户能够访问数据库。在此基础上,通过构建自主访问控制模型,能够对访问客体的权限做进一步界定,这样当用户的身份被系统识别后,则可以对客体访问数据库的行为进行监控,用户只能在系统允许的范围内完成操作。作为一种灵活的控制策略,自主访问控制能够保障用户自主地将自己所拥有的权限赋予其他用户,操作过程灵活简单,因此大部分的商业数据库都会采用这种访问控制技术。2.2.2 基于角色的访问控制在数据库安全管理中,基于角色的访问控制作为一种新的控制方法,其主要特征为:在该技术中权限并不是直接赋予指定用户的。所以当用户与特定角色绑定之后,则可以通过将基于角色的访问控制过程进行划分,实现对权限的分配。 2.3 数据加密技术数据加密技术主要包括库内加密与库外加密的方法,其中库内加密是在数据库内部设置加密模块,例如对数据内的相关列表进行加密,而库外加密则是通过特定的加密服务器完成加密与解密操作。在大数据环境下,大部分的数据库都能够提供数据加密功能,例如SQL Server数据库构建的多维度密钥保护与备份信息加密等。但是考虑到数据的特殊性,数据库所存储的信息量较大,在这种情况下可能对数据库的加密与加密的稳定性产生影响,因此用户可根据安全管理要求对数据库中的高度机密的数据做加密处理。3 大数据背景下的数据库安全保障策略分析在大数据背景下,应该围绕信息安全问题落实数据库安全管理方案,以大数据强大的数据处理能力结合数据库的功能诉求对数据库的安全保障方案进行改进。 3.1 角色访问控制策略分析受大数据的影响,数据库的访问人数会快速增加,导致数据库所面临的安全风险更高。因此为了能够进一步保障数据库安全,则需要基于角色访问模型的数据库访问控制,为用户分配数据库角色,最终使用户在数据库上获得相应的权限,进一步提高数据库安全质量。本文基于大数据的技术要求,在数据库安全保障体系的设置上提出了一种新的集中管理模式——基于应用的角色访问模型,该模型能够对数据库的信息安全问题进行有效识别,通过对应用数据库、安全中心的功能进行界定,进而明确数据库安全管理的角色与权限。在实施阶段,其中的重点内容包括: (1)应用方案。在大数据系统中的应用系统中往往会存在大量的账户与用户群,所以在数据库安全保障体系建设中能够将任意一个用户的信息注册到安全中心中,这样数据库可以收录用户权限的有用信息,包括名称、属性、创建时间、应用用途等。 (2)子应用。数据安全管理应用方案需要根据环境进行分类,将数据库中的自应用作为特定类用户的集合,可用于实现数据库的安全管理。例如在数据库安全的子应用中,将DBA作为数据库管理员集合。(3)数据库。这里所提到的数据库为特定数据库,为达到安全管理要求,将数据库注册到系统中并与相关安全软件相绑定,或者在特定的数据库环境下将对应的子应用创设到数据库中。(4)用户。用户的数据安全需要与数据库的账户相连接,在数据库安全管理制定用户所属的子应用,并划分相应的权限即可。 3.2 攻击检测大数据背景下的数据库安全形势严峻,数据库所承受的攻击数量巨大,通过开展攻击检测的方法能够发现滥用与异常的攻击行为。现阶段的大部分数据库都不具有攻击检测功能,所以在安全保障体系的构建中,本文根据技术数据挖掘与数据采集的要求,构建基于攻击检测的数据保全保障体系,通过该方法能够记录数据库被攻击情况,为实现数据库安全奠定基础。实时检测主要是针对各种已知的攻击方式,并将这种攻击以代码的形式存储在数据库中,按照数据库中所记录的数据判断系统是否遭受到攻击。该技术的具有较高的检测精度,但由于该技术无法对内部人员与未知攻击行为进行检测,所以本文在实时检测的基础上进一步完善了其中的功能,包括:(1)登录失败检测。当系统检测到在特定时间段内频繁地出现登录失败的情况,则需要对该IP的用户登录情况进行检测。(2)登录检测。若登录数据库的IP地址与以前登录过的地址不同,则需要警惕数据库安全问题。(3)操作失败检测。针对特定时间内检测到的操作失败次数,检测无访问权限对象的登录行为。(4)用户权限变更检测。其主要功能是检测用户的权限是否在满足规定的情况下进行变更。在该系统中,通过将关于系统安全的规则上传到数据库的审计中心中,再同步到各个数据中,由此实现对滥用规则的统一控制。在实时检测过程中,可在数据库添加两个触发器来完成对攻击的检测,包括:(1)通过DDL触发器来抓取数据库的事物,并检测用户权限变更等情况,作为SQLServer数据库中的一种特有触发器,当数据库发生安全事件的同时能够做出响应,在各种数据库安全事件发生之后快速地捕捉信息并分析安全攻击行为的发生间隔,判断攻击事件是否有效。(2)DML触发器具有跟踪审计信息的功能,针对数据库操作过程中的各种常见问题进行安全评估,包括操作失败事件、登录失败情况以及敏感用户对系统的访问等。当DML 检测到数据库遭受到攻击,则会退出攻击账户,保证数据库的安全。 3.3 数据库的安全防护机制在数据库的安全防护中,可利用虚拟化平台来实现数据库的安全管理,为能够达到有效的安全防护目的,可采用以下措施进行数据库安全管理。 3.3.1 数据库的安全备份数据备份的目的就是要为数据安全增添“第二把锁”,当前数据库的数据备份主要采用物理备份与逻辑备份相结合的方法,按照既定的时间要求对数据库中的数据进行存储。此时假设数据遭到攻击或者出现损害时,可以在原数据库的基础上调度备份数据,达到数据快速复原的目的。为实现该目的,可通过MySQL恢复工具、导出数据等方法并引入数据信息的变化,最终有助于实现二进制文件保存,避免备份数据的滥用。 3.3.2 数据库的防火墙设置防火墙是维护数据安全的关键,所以在设置防火墙期间,利用SQL数据库检测到的攻击痕迹将数据与数据库SQL语句运用到应用程序中,利用数据库防火墙的名单检测对任意一个针对数据库的操作行为进行检测,避免系统遭受注入攻击而造成数据损失。4 结束语在大数据背景下,数据库的安全保障管理更加复杂,为了能够更好地适应数据库管理要求,相关人员要充分发挥大数据技术优势,结合各种常见的数据库安全问题进行处置,这样才能有效降低数据库安全事件发生率,最终适应数据安全管理要求。来自:今日头条
-
【摘要】 随着大数据时代的来临,数据量不断增长,传统小机上跑数据库的模式扩容困难且成本高昂,难以支撑业务发展。很多用户开始转向分布式计算路线,用多台廉价的PC服务器组成集群来完成大数据计算任务。Hadoop/Spark就是其中重要的软件技术,由于开源免费而广受欢迎。经过多年的应用和发展,Hadoop已经被广泛接受,不仅直接应用于数据计算,还发展出很多基于它的新数据库,比如Hive、Impala等。 H...本文分享自华为云社区《Hadoop Spark太重,esProc SPL很轻》,作者:石臻臻的杂货铺。随着大数据时代的来临,数据量不断增长,传统小机上跑数据库的模式扩容困难且成本高昂,难以支撑业务发展。很多用户开始转向分布式计算路线,用多台廉价的PC服务器组成集群来完成大数据计算任务。Hadoop/Spark就是其中重要的软件技术,由于开源免费而广受欢迎。经过多年的应用和发展,Hadoop已经被广泛接受,不仅直接应用于数据计算,还发展出很多基于它的新数据库,比如Hive、Impala等。Hadoop/Spark之重Hadoop的设计目标是成百上千台节点的集群,为此,开发者实现了很多复杂、沉重的功能模块。但是,除了一些互联网巨头企业、国家级通信运营商和大型银行外,大多数场景的数据量并没有那么巨大。结果,经常能看到只有几个到十几个节点的Hadoop集群。由于目标和现实的错位,对很多用户来讲,Hadoop成了一个在技术、应用和成本上都很沉重的产品。技术之重如果真的有几千台计算机组成的集群,是不可能依靠手工个性化管理的。试想,将这些计算机罗列出来,运维人员看都看不过来,更别说管理和分配任务了。再说,这么多机器,难免会不断出现各种故障,怎么保证计算任务顺利执行?Hadoop/Spark的开发者为了解决这些问题,编写了大量代码,用于实现自动化节点管理、任务分配和强容错功能。但是,这些功能本身就要占用很多计算资源(CPU、内存和硬盘等),如果用到几台到十几台节点的集群上,就太过沉重了。集群本来就不大,Hadoop还要占用相当一部分的资源,非常不划算。不仅如此,Hadoop产品线很长,要把这些模块都放在一个平台上运行,还要梳理好各个产品之间的相互依赖性,就不得不实现一个包罗万象的复杂架构。虽然大多数场景只用其中一两个产品,也必须接受这个复杂、沉重的平台。后来出现的Spark弥补了Hadoop对内存利用的不足,技术上是不是可以变轻呢?很遗憾,Spark走向了另一个极端,从理论模型上就只考虑内存计算了。特别是Spark 中的 RDD 采用了 immutable 机制,在每个计算步骤后都会复制出新的 RDD,造成内存和 CPU 的大量占用和浪费,离开大内存甚至无法运行,所以技术上还是很重。使用之重Hadoop技术上太过复杂,也就意味着安装和运维会很麻烦。集群只有几台计算机时,却不得不使用为几千台节点集群设计的节点管理、任务分配和容错功能。可想而知,安装、配置、调试都很困难,日常运行的维护、管理工作也不容易。即使克服这些困难让Hadoop运行起来了,编写大数据计算代码时还会面临更大的麻烦。Hadoop编程的核心框架是MapReduce,程序员要编写并行程序,只要写 Map 和 Reduce 动作即可,用来解决求和、计数等简单问题也确实有效。但是,遇到复杂一些的业务逻辑,用MapReduce编程就会变得非常困难。例如,业务计算中很常见的JOIN计算,就很难用MapReduce实现。再比如,很多和次序有关的运算实现起来也很困难。Spark的Scala语言具备一定的结构化数据计算能力,是不是能简单一些呢?很可惜,Scala使用难度很大,难学更难精。遇到复杂一些的运算逻辑,Scala也很难写出来。MapReduce、Scala都这么难,所以Hadoop/Spark计算语法开始回归SQL语言。Hive可以将SQL转化为MapReduce所以很受欢迎,Spark SQL的应用也比Scala广泛的多。但是,用SQL做一些常规查询还算简单,用于处理多步骤过程计算或次序相关运算还是非常麻烦,要写很复杂的UDF。而且,许多计算场景虽然勉强能用SQL实现,但是计算速度却很不理想,也很难进行性能调优。成本之重虽然 Hadoop 软件本身开源免费,但它技术复杂、使用困难,会带来高昂的综合成本。前面说过,Hadoop自身会占用过多的CPU、内存和硬盘,而Spark需要大内存支撑才能正常运行。所以不得不为Hadoop/Spark采购更高配置的服务器,要增加硬件支出。Hadoop/Spark使用困难,就需要投入更多的人力去完成安装、运维,保证Hadoop/Spark的正常运转;还要投入更多的开发人员,编程实现各种复杂的业务计算,要增加人力资源成本。由于使用过于困难,很多用户不得不采购商业公司的收费版本Hadoop/Spark,价格相当可观,会大幅增加软件采购成本。既然Hadoop如此沉重,为什么还有很多用户会选择它呢?答案很简单:暂时找不到别的选择,也只有Hadoop勉强可用,好歹知名度高一些。如此一来,用户就只能安装、配置Hadoop的重型应用,并忍受Hadoop本身对计算资源的大量消耗。小规模集群的服务器数量本来就不多,Hadoop又浪费了不少,小马拉大车,最后运行的效果可想而知。花了大价钱采购、费事费力的使用Hadoop,实际计算的性能却不理想。就没有别的选择了?轻量级的选择开源的esProc SPL是轻量级大数据计算引擎,采用了全新的实现技术,可以做到技术轻、使用简单、成本低。技术轻本文开头说过,越来越大的数据量让传统数据库撑不住,所以用户只能转向分布式计算技术。而数据库之所以撑不住,是因为SQL难以实现高速算法,大数据运算性能只能指望数据库的优化引擎,遇到复杂计算时,优化引擎又常常无能为力。所以,我们应该想办法设计更高效的算法,而不是一味地追求分布式计算。按照这个思路,SPL提供了众多高性能算法(有许多是业界首创)以及高效的存储方案,同等硬件环境下可以获得远超过数据库的运算性能。安装在单机上的SPL就可以完成很多大数据计算任务,架构比集群简单很多,从技术上自然就轻的多了。SPL的高性能算法有下面这些:对于数据量更大的情况,SPL实现了轻量级集群计算功能。这一功能的设计目标是几台到十几台节点的集群,采用了与Hadoop完全不同的实现方法。SPL集群不提供复杂沉重的自动化管理功能,而是允许对每个节点进行个性化配置。程序员可以根据数据特征和计算目标来决定各节点存储什么样的数据,完成哪些计算。这样做,不仅大大降低了架构复杂度,也是提升性能的重要手段。以订单分析为例,订单表很大,要通过产品号字段与较小的产品表主键做关联,再按照产品供应商分组汇总订单金额。SPL集群可以很容易的将订单表分段存放在各个节点的硬盘上,再将较小的产品表读入每个节点的内存中。计算时,每个节点仅对本机上的订单分段和产品数据做关联、分组汇总,可以缩短总计算时间;再将结果传输到一个节点上做二次汇总。由于传输的是第一次汇总的结果,数据量小、网络传输时间较短。总体来说,这个方案可以获得最佳性能,虽然程序员需要做一些更细致的工作,但对于小规模集群来说,增加的工作量并不大。SPL也不提供超强的容错能力,不会像Hadoop那样,在有节点故障的情况下,还要保证任何一个任务都会执行成功。实际上,大多数计算任务的执行时间都在几个小时以内,而几台、十几台机器的集群一般都能做到较长时间正常运行,不会这么频繁的出故障。即使偶尔出现节点故障导致任务执行失败,再重新计算一遍也可以接受,毕竟这种情况不会经常发生。所以,SPL的容错能力只是保证有少数节点故障的时候,整个集群还能继续工作并接受新任务(包括重算的任务),这就大大降低了SPL集群的复杂度。在内存计算方面,SPL没有使用Spark RDD的 immutable机制,而是采用了指针式复用机制,利用地址(指针)访问内存,在数据结构没有改变的情况下,直接用原数据的地址形成结果集,不必每个计算都将数据复制一遍,仅仅多保存一个地址(指针),可以同时减少 CPU 和内存的消耗,运行起来要比Spark轻很多了。并且,SPL改进了当前的外存计算算法体系,降低了复杂度并扩大了适应范围,可以做到内外存计算结合,充分提升计算性能的同时,还不像Spark那样依赖大内存。使用简单SPL采用轻量级技术,自然更容易安装、配置和运行维护。SPL不仅可以作为独立服务器使用,还很容易集成到需要高性能计算的应用中,比如即时查询系统,只要引入几个jar包即可。Hadoop则很难集成,只能在边上作为一个数据源运行。有些临时性数据需要随时进行处理,则可使用SPL的桌面集成开发环境可视化地计算,快速得到结果。如果要安装部署Hadoop,那么等环境搭建好时临时数据任务已经过期了。前面展示的众多SPL高性能算法,也能让大数据计算编程变得简单。程序员可以在较短时间内掌握这些算法函数,学习成本相对较低。而且,使用这些现成的函数很容易实现各种复杂的计算需求,不仅比MapReduce/Scala简单,比SQL也简单很多。比如,以电商网站常见的漏斗分析为例,用SQL实现三步漏斗的代码大致如下:with e1 as ( select gid,1 as step1,min(etime) as t1 from T where etime>= to_date('2021-01-10', 'yyyy-MM-dd') and etime<to_date('2021-01-25', 'yyyy-MM-dd') and eventtype='eventtype1' and … group by 1 ), with e2 as ( select gid,1 as step2,min(e1.t1) as t1,min(e2.etime) as t2 from T as e2 inner join e1 on e2.gid = e1.gid where e2.etime>= to_date('2021-01-10', 'yyyy-MM-dd') and e2.etime<to_date('2021-01-25', 'yyyy-MM-dd') and e2.etime > t1 and e2.etime < t1 + 7 and eventtype='eventtype2' and … group by 1 ), with e3 as ( select gid,1 as step3,min(e2.t1) as t1,min(e3.etime) as t3 from T as e3 inner join e2 on e3.gid = e2.gid where e3.etime>= to_date('2021-01-10', 'yyyy-MM-dd') and e3.etime<to_date('2021-01-25', 'yyyy-MM-dd') and e3.etime > t2 and e3.etime < t1 + 7 and eventtype='eventtype3' and … group by 1 ) select sum(step1) as step1, sum(step2) as step2, sum(step3) as step3 from e1 left join e2 on e1.gid = e2.gid left join e3 on e2.gid = e3.gidSQL写出来要三十多行,理解起来有相当的难度。如果用MapReduce/Scala来写,会更加困难。即使是用SQL实现,写出来的这段代码和漏斗的步骤数量相关,每增加一步就要再增加一段子查询。相比之下,SPL 就简单得多,处理任意步骤数都是下面这样简洁的代码:AB1=["etype1","etype2","etype3"]=file("event.ctx").open()2=B1.cursor(id,etime,etype;etime>=date("2021-01-10") && etime<date("2021-01-25") && A1.contain(etype) && …)3=A2.group(id).(~.sort(etime))=A3.new(~.select@1(etype==A1(1)):first,~:all).select(first)4=B3.(A1.(t=if(#==1,t1=first.etime,if(t,all.select@1(etype==A1.~ && etime>t && etime<t1+7).etime, null))))5=A4.groups(;count(~(1)):STEP1,count(~(2)):STEP2,count(~(3)):STEP3)SPL集群计算的代码也非常简单,比如前面提到的订单分析计算,具体要求是:大订单表分段存储在4个节点上,小产品表则加载到每个节点的内存中,两表关联之后要按照产品供应商分组汇总订单金额。用SPL写出来大致是下面这样:AB1["192.168.0.101:8281","192.168.0.102:8281",…, "192.168.0.104:8281"]2fork to(4);A1=file("product.ctx").open().import()3>env(PRODUCT,B2)4=memory(A1,PRODUCT)5=file("orders.ctx":to(4),A1).open().cursor(p_id,quantity)6=A5.switch(p_id,A4)7=A7.groups(p_id.vendor;sum(p_id.price*quantity))这段代码执行时,任务管理(内存加载、任务拆分、合并等)所需要的计算资源,远远小于关联和分组汇总计算的消耗。如此轻便的任务管理功能,可以在任意节点、甚至是集成开发环境IDE上执行。成本低与Hadoop相同,SPL也是开源软件,不同的是SPL不仅软件免费,综合成本也非常低。SPL安装、配置、运维很容易,可以大大降低支持人员的人力资源成本。同时,由于SPL降低了大数据计算编程的难度,程序员很容易实现各种复杂的计算,开发效率显著提高,也就节省了程序员的人力资源成本。而且,由于SPL技术体系非常轻,平台自身占用的CPU、内存和硬盘很少,可以让更多的资源用于业务计算,能大幅提高硬件利用率。SPL也不像Spark那样依赖大内存,总体来说,大大减少了硬件采购成本。SPL既轻且快SPL技术轻、自身消耗小,而且还提供了众多高性能算法,所以,在几个到几十个节点的集群,甚至单机的情况下,比Hadoop/Spark有更好的性能表现。案例1:某电商漏斗分析计算。Spark:6节点,每节点4CPU核,平均计算时间:25秒。SPL:单机,8线程计算,平均计算时间可达10秒。代码量仅有Spark Scala的一半。案例2:某大型银行用户画像分析。Hadoop上某OLAP服务器:虚拟机100CPU核,计算时间:120秒。SPL:虚拟机12CPU核,计算时间:仅4秒。性能提高250倍。案例3:某商业银行的手机银行APP,活期明细查询,数据量大且高并发。基于Hadoop的某商用数据仓库:高并发时无法达到秒级的响应速度,只好换用6台ES集群。SPL单机:达到6台ES集群同样的并发和响应能力。总结来说,Hadoop/Spark是源自头部互联网企业的重型解决方案,适合需要有超大规模集群的巨大企业。很多场景的数据虽然也不少,但小集群甚至无集群就足够处理,远没多到这些巨大企业的规模,也没有那么多的硬件设备和维护人员。这种情况下,轻量级的大数据计算引擎SPL是首选,投入很低的成本,就可以做到技术轻、使用简便,而且还能提高开发效率、达到更高的性能。SPL资料SPL下载SPL源代码
-
在工业和信息化部所发布的《“十四五”大数据产业规划》中明确,数据是新时代重要的生产要素,是国家基础性战略资源,也是推动经济转型发展的新动力。现今数据逐步受到各方的重视,数据即资产也成为了共识。而面对不断激增的数据,如何管理、如何使其发挥价值、给企业提供决策支撑是现阶段的关键。因此,中国信息通信研究院云计算与大数据研究所聚焦数据管理工具体系,推出了结构化数据管理与非机构化数据管理产品评测,包括数据管理平台、数据质量管理平台、数据标准管理平台、数据模型管理平台、元数据管理平台、主数据管理平台、数据资产目录管理平台、以及数据标注平台,集合数据采集、数据建模、数据标准化、数据质量管理、数据分析应用等多项能力,助力企业提升数据管理的效率与人员意识,辅助各部门人员协作,增强数据与数据应用方的契合程度,发挥数据的潜在价值。数据管理平台基础能力评测是数据治理评测体系里首个推出的标准,依据《YD/T 3760-2020大数据 数据管理平台技术要求与测试方法》行业标准开展评测工作,其中涵盖12个测试大项:数据源、数据质量、数据标准、模型管理、元数据、主数据、数据资产报告、数据共享服务管理、安全性等,共计80项测试用例。截止至2022年6月,已评测50家企业,覆盖了市场上主流的数据管理产品,同时也逐步发展成为甲方的选型标准,涉及金融、银行、医疗、能源、工业等行业。在2022年上半年,“可信大数据”产品评测也推出了首批数据质量管理平台、数据标准管理平台的首批评测工作,杭州数梦工场科技有限公司也成为了第一家通过数据质量与数据标准两项测评的企业。数据治理体系系列评测中国信通院云大所开展的“可信大数据”评测是国内首个大数据产品的评测体系,截止至2022年6月中国信通院已完成400余次测试累积完成近300款产品的测试工作,包括数据管理平台、数据挖掘平台、数据脱敏工具、数据库等,见证了国内大数据产品不断进步,逐渐丰富的过程,也成为了大数据产品发展的风向标。目前,数据治理系列工作评测项目正式启动,其中数据模型管理平台、主数据管理平台、元数据管理平台、数据资产目录管理平台、数据标注平台作为“可信大数据”产品能力评测体系的新项目,将于2022年12月的“数据资产管理大会”上为通过首批评测产品颁发证书,欢迎相关单位积极报名参与!来源:中国信通院-大数据技术标准推进委员会
-
大家好!我是酷哥,数据库资讯,带您速览,欢迎大家阅读。 ------------------------------------------------ **本期精选** ------------------------------------------------ - 创未来,享非凡 | openGauss Developer Day 2022圆满举行 - 中国信通院首批“可信数据库”-数据库运维管理能力成熟度模型评估正式启动 - 鲲鹏应用创新大赛-openGauss赛道报名通道已开启 - 《2021年中国数据管理解决方案市场报告》——湖仓协同,赋能数智融合 - 《云计算白皮书(2022年)》即将重磅发布,七大趋势洞悉行业发展新风向 - 用GaussDB(for Redis)存画像,推荐业务轻松降本60% - 标准系列解读|服务商如何做好SQL审核与安全审计? - ------------------------------------------------ **资讯摘要** ------------------------------------------------ - 创未来,享非凡 | openGauss Developer Day 2022圆满举行 **摘要:** openGauss Developer Day 2022(openGauss开发者大会2022)于7月14-15日线上和线下同步举办。这是面向数据库开发者的年度活动,也是openGauss开源社区发起并主办的首届开发者大会。本届大会在中国计算机学会数据库专委会的指导下,由openGauss开源社区主办,联合海量数据、云和恩墨、东方通、清华大学共同举办。  本次大会以“创未来 享非凡”为主题,邀请学术专家、行业用户、合作伙伴和开发者共同探讨数据库面向多场景的技术创新,分享基于openGauss的行业联合创新成果及商业实践,完善社区治理,共同打造中国最具创新力的开源数据库根社区。会上: - 神舟通用、云和恩墨、超图软件、南大通用、海量数据、超聚变及中国联通等伙伴和行业客户基于openGauss 3.0推出商业发行版; - 社区治理持续升级,openGauss开源社区用户委员会和品牌委员会成立; - 社区贡献看板和面向开发者的Try Me在线实验环境上线。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194575](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194575) - 中国信通院首批“可信数据库”-数据库运维管理能力成熟度模型评估正式启动 **摘要:** 数据库作为信息系统基础底座软件,在大数据背景下,数据库的数据量和节点规模日益增长,数据库使用方的内部数据库节点动辄达到成百上千,甚至万级节点规模,传统手工运维方式对系统稳定性和业务连续性保障的弊端逐渐凸显。数据库使用方越来越看重系统运行是否稳定、安全和高效,这也使其自身信息系统运行与维护的要求也随之增高。是否拥有成熟健全的信息系统运行维护体系,支撑团队的数据库运维管理能力是否足够专业化和标准化,是否拥有提升标准化运维能力的自动化管理平台,都将影响和制约着企业信息化发展的步伐。  基于以上背景,中国信通院云计算与大数据研究所依托中国通信标准化协会大数据技术标准推进委员会(CCSA TC601)和中国信通院数据库应用创新实验室(CAICT DBL),联合中移信息、联通(广东)产互、华泰证券、江苏电力、联通数科、联通软研院、云和恩墨、新炬网络、天道金科、科蓝软件、南大通用等近40家企业专家参与编制,历时5个月完成13次会议讨论,每次会议讨论时长约4小时,共同讨论完成了《数据库运维管理能力成熟度模型》,旨在为应用侧评价自身数据库运维团队提供参考。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194922](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194922) - 鲲鹏应用创新大赛-openGauss赛道报名通道已开启 **摘要:** 自2020年以来,鲲鹏应用创新大赛至今已经连续举办两年,是面向全球开发者的顶级赛事。本次大赛由24个鲲鹏生态创新中心与华为,联合中国软件行业协会、绿色计算产业联盟、中国计算机行业协会、中国计算机学会高专委共同举办,旨在激发行业应用创新、加速产业融合、促进人才培养,吸引全产业开发者共同打造鲲鹏全栈解决方案。  鲲鹏应用创新大赛.openGauss赛道是openGauss社区与各区域鲲鹏生态创新中心一起为开发者准备的大赛。大赛包括区域赛和决赛两大阶段。开发者可自行组队参赛,完成赛道任务参与评选,共同角逐区域赛与决赛的前三等奖。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=195027](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=195027) - 《2021年中国数据管理解决方案市场报告》——湖仓协同,赋能数智融合 **摘要:** 湖仓一体进一步取消了用户的选型困难,为用户提供的数据管理平台兼具数据仓库的结构和治理优点与数据湖的扩展性和为机器学习提供的便利性  大数据(Big Data)在字面上的理解是海量数据,但这个角度是抽象的。在网络信息时代,大数据产生的客观意义并不在于其宏大的数据规模,而在于如何数据进行专业存储和处理,并从中挖掘和提取所需要的知识价值。 技术突破通常来源于市场对产品的实质需求,互联网、云、AI的不断发展与大数据技术融合满足了商业需求。在大数据产业中,降低存储成本、提升计算速度、对数据进行多维度的分析加工、赋能企业利用数据价值,是大数据产业实现盈利的关键,也是大数据技术蓬勃发展的根源。 大数据技术的内涵伴随着传统信息技术和数据应用的发展不断演进,而大数据技术体系的核心始终是面向海量数据的存储、计算、处理等基础技术。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194690](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194690) - 《云计算白皮书(2022年)》即将重磅发布,七大趋势洞悉行业发展新风向 **摘要:** 在政策和市场双轮驱动下,云计算迎来了黄金时代,其触角已经从互联网的虚拟世界,伸向了实体经济这个更加广阔的天地。面对呼啸而来的下一个十年,云计算将走向何方? 在7月21-22日即将举行的“2022可信云大会”上,中国信通院将重磅发布年度重磅研究成果——《云计算白皮书(2022年)》,对云计算产业的发展进行深度剖析,这已是中国信通院连续八年发布云计算白皮书。  今年白皮书主要围绕过去一年多来全球云计算产业的发展,重点聚焦云原生、算力服务、云上系统稳定性、云安全、云成本优化等当前行业发展热点进行系统性剖析,并对未来技术发展趋势进行展望: - 全球云计算市场增速反弹,我国 保持高速增长 - 我国云计算展现中国特色,产业呈现五大特点 - 云原生技术和能力不断成熟 加速企业IT要素变革 - 云服务向算力服务演进 助力算力经济高质量发展 - 云上系统稳定性面临挑战 技管结合助力能力提升 - 云安全聚焦应用新技术理念 构建上云全流程安全体系 - 云成本优化治理势在必行 流程贯穿上云用云全生命周期 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194956](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194956) - 用GaussDB(for Redis)存画像,推荐业务轻松降本60% **摘要:** 什么是推荐系统?维基百科上的定义:推荐系统是一种信息过滤系统,可以根据用户历史行为预测用户对物品的“评分”或“偏好”。简单来说,如果你是一个电子发烧友,那么系统肯定会给你推荐各种新鲜出炉的3C产品,如果你是一个coder,那么你的页面肯定充满各种编程大全的书籍。推荐系统近年来非常流行,应用于各行各业,推荐的对象包括:电影、音乐、新闻、书籍、学术论文、搜索查询、分众分类、电商购物和游戏业务等。  在大数据时代,推荐系统的应用场景将会越来越多,作为推荐系统的数据存储,GaussDB(for Redis)完美弥补了开源Redis的短板,并为推荐系统提供强有力的技术支撑。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194957](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194957) - 标准系列解读|服务商如何做好SQL审核与安全审计? 摘要:本期继续为大家解读《数据库服务能力成熟度模型》运维运营能力域的SQL审核与安全审计两个能力项。  SQL审核能力是指为数据库服务方通过SQL审核平台或工具对未上线、已上线的SQL代码进行代码语法、算法的安全性和质量审核检查,提前发现SQL编写、表和索引设计等方面的隐患问题,推动开发部门提前进行规避性优化处理。 安全审计是指数据库服务方根据需求方的安全审计要求,通过数据库自带的审计功能,或独立的安全审计工具、平台实现数据库安全审计功能,记录符合审计选项的操作记录。通过对用户访问数据库行为的记录、分析和汇报,帮助用户事后生成合规报告、事故追根溯源,同时加强内外部数据库行为记录,提高数据资产安全。 根据公安行业标准《信息安全技术 数据库安全审计产品安全技术要求》定义,数据库安全审计产品是指对用户访问数据库的操作行为进行记录、分析并响应的产品。主要支持数据采集、设置采集策略、生成审计记录、安全告警、设置告警方式和内容、查询和统计审计记录、生成和导出报表、安全存储审计记录、会话分析、安全管理、审计日志等功能。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194685 ](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=194685) *声明:文章源于第三方公开的信息,如果存在侵权或信息不实时,请及时联系处理。* 整理者:酷哥
-
云服务公共资源服务开通服务官网云服务社区入门材料赋能&产品文档等DGC大数据领域公共资源:1、大数据福利专场 0元试用 - 数据域主力产品0元试用https://activity.huaweicloud.com/Date-free.html2、微信公众号:智能数据湖微信号:ei-datalake 1、免费注册-[教程]DGC免费实例购买流程2.0https://bbs.huaweicloud.com/forum/thread-193738-1-1.html华为云-数据湖治理中心DGC-服务官网https://www.huaweicloud.com/product/dayu.html云社区 -EI企业智能数据湖治理中心DGChttps://bbs.huaweicloud.com/forum/forum-890-1.html1、快速入门:提供3个入门示例场景https://support.huaweicloud.com/qs-dgc/dgc_04_0021.html2、数据湖治理中心 DGC> 视频:入门准备https://support.huaweicloud.com/dgc_video/index.html1、DGC官方使用帮助文档:DGC的每个功能提供详细指导https://support.huaweicloud.com/dgc/index.html2、DGC 赋能视频:数据湖治理中心(DGC)伙伴赋能课程https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE133+Self-paced/about3、华为伙伴暨开发者大会2022数据治理生产线,加速构建企业数据资产视频回看:https://live.huawei.com/HPDC/meeting/cn/10741.htmlMRS1、云原生数据湖MRS集群开通https://support.huaweicloud.com/qs-mrs/mrs_09_0010.html华为云-云原生数据湖MRS-服务官网https://www.huaweicloud.com/product/mrs.html云社区 -云原生数据湖MRShttps://bbs.huaweicloud.com/forum/forum-612-1.html云原生数据湖MRS> 视频:入门介绍、操作&二次开发指导https://support.huaweicloud.com/mrs_video/index.html1、云原生数据湖MRS帮助文档:MRS的每个功能提供详细指导https://support.huaweicloud.com/mrs/index.html2、云原生数据湖MRS最佳实践https://support.huaweicloud.com/bestpractice-mrs/mrs_05_0023.htmlDLI免费注册-[教程]DLI免费实例购买流程2.0https://bbs.huaweicloud.com/forumreview/thread-193899-1-1.html华为云-数据湖探索 DLI-服务官网https://www.huaweicloud.com/product/dli.html云社区 -数据湖探索 DLIhttps://bbs.huaweicloud.com/forum/forum-599-1.html1、快速入门:使用DLI SQL分析OBS数据https://support.huaweicloud.com/bestpractice-dli/dli_05_0044.html2、数据湖探索 DLI> 视频:入门准备https://support.huaweicloud.com/dli_video/index.html1、DLI官方使用帮助文档:DLI的每个功能提供详细指导https://support.huaweicloud.com/wtsnew-dli/index.html2、DLI 赋能视频:数据湖探索(DLI)伙伴赋能课程https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE100+Self-paced/about
-
湖仓一体进一步取消了用户的选型困难,为用户提供的数据管理平台兼具数据仓库的结构和治理优点与数据湖的扩展性和为机器学习提供的便利性大数据(Big Data)在字面上的理解是海量数据,但这个角度是抽象的。在网络信息时代,大数据产生的客观意义并不在于其宏大的数据规模,而在于如何数据进行专业存储和处理,并从中挖掘和提取所需要的知识价值。技术突破通常来源于市场对产品的实质需求,互联网、云、AI的不断发展与大数据技术融合满足了商业需求。在大数据产业中,降低存储成本、提升计算速度、对数据进行多维度的分析加工、赋能企业利用数据价值,是大数据产业实现盈利的关键,也是大数据技术蓬勃发展的根源。大数据技术的内涵伴随着传统信息技术和数据应用的发展不断演进,而大数据技术体系的核心始终是面向海量数据的存储、计算、处理等基础技术。在大数据技术发展的60多年之间,数据应用经历了互联网、移动互联网蓬勃的发展与需求变革。数据库与数据仓库基于事务分析处理等传统优势依然是当前信息技术的中流砥柱,但也在日益增长的数据复杂度需求以及海量弹性的数据规模面前难以匹配。分布式架构的突破与云计算的兴起奠定了数据湖的概念,湖仓一体则进一步取消了用户的选型困难,为用户提供的数据管理平台兼具数据仓库的结构和治理优点与数据湖的扩展性和为机器学习提供的便利。数据仓库与数据湖作为两个单独的数据管理范式都具备成熟的技术积累,在长期实践中两者以湖+仓的混合架构方式共同存在:数据湖用作对原始数据的提取和处理,同时依赖数据仓库在数据管道的发布。在用户反馈中,湖+仓的混合架构存在着使Hadoop和MPP共存下的数据冗余、两个系统间ETL造成的低时效性、一致性保障及运维等方面的困难。在用户需求的驱动下,数据湖与数据仓库提供商在原本的范式之上向其限制的范围扩展,逐渐形成了“湖上建仓”与“从数仓向湖”的两种“湖仓一体”的成型路径。虽然在底层逻辑中,湖仓一体仍然是一个二元体系,但能够极大帮助用户在其原IT基础之上封装出与需求更紧密的大数据范式,或者直接挂载全托管服务的湖仓一体系统。数据仓库本身以及ETL的性能取决于通信、I/O能力和硬件性能,执行架构则决定了数据仓库的支撑能力数据库侧重OLTP,数据仓库侧重OLAP。数据仓库是传统的关系型数据库如SQL Server、Oracle等,经过严格的数据模型设计或参数调整就可以变成很好的数据仓库实体,而纯粹的数据仓库如Terradata、SybaseIQ若要用来适应OLTP系统则不合适。趋势中,OLAP与OLTP正在走向统一融合成HTAP,数据库对AP分析能力的加强将使数据库与数据仓库的界限将逐渐模糊。Hadoop架构(MapReduce模型)适合海量数据存储查询、批量数据ETL、非结构化数据分析;而MPP架构适合替代现有关系型数据结构下的大数据处理,进行多维度数据分析、数据集市。混搭架构中,MPP处理高质量的结构化数据,同时提供SQL及事务支持。而Hadoop实现半结构化、非结构化数据处理。通过这种混搭方式,自动满足结构化、半结构化、非结构化数据的高效处理的需求,解决了传统数据仓库在海量数据下加载慢、数据查询效率低、难以融合多种异构数据源进行分析的困难。这种打破数据仓库与数据仓库边界的方案已经成为了一种主流架构方式。但在湖仓一体进程中,有更多新兴的架构正在开发和验证,或有新一代的架构在未来将取代MPP-Hadoop架构成为更优的架构方案。数据湖为了实现实时数据处理开发出了多种架构方式,其中最具代表性的是Lambda、Kappa、IOTA架构数据湖从Lambda架构开始完成离线与实时计算的融合,Kappa架构统一了数据口径简化数据冗余。IOTA架构通过边缘下发和统一数据模型取消了ETL,进一步加速了数据湖效率。其他的数据湖架构还有偶数科技自研的Omega架构,由流数据处理系统和实时数仓组成。融合了Lambda架构和Kappa架构处理流数据的优势,增加了实时按需智能和离线按需智能数据处理的能力,以及高效处理可变更数据实时快照的能力。随着数据智能服务认知的流行,厂商如何将数据分析服务与机器学习服务无缝集成,为无AI算法背景的数据研发和分析师等用户提供更加智能易用的产品服务尤为关键数据库、数据仓库、数据湖以及湖仓一体等产品是数据基础设施,如何采用数据分析工具,并且驱动决策,才能转化出数据价值。人工智能和机器学习功能是赋予湖仓一体服务能力创新的重要功能。数据智能(Data Intelligence)即基于大数据,通过AI对海量数据进行处理、分析、挖掘,提取数据中的信息和知识,并通过建立模型寻求现有问题的解决方案以及实现预测等,帮助决策。过去,BI作为统计分析类计算是数据仓库的主要应用场景,预测类计算的AI分析是数据湖的主流应用。随着湖仓一体的成熟化,AI+BI双模式将成为大数据计算分析的重要负载形式。随着大数据技术的持续发展,离线处理与实时处理的融合、数据存储与数据分析的融合,大数据系统的性能瓶颈的突破提供了巨大的数据服务及应用的潜力。相应的,随着数据智能服务认知的流行,厂商如何将数据分析服务与机器学习服务无缝集成,为无AI算法背景的数据研发和分析师等用户提供更加智能易用的产品服务尤为关键,如:(1)通用性:可直接通过SQL进行机器学习模型推理;(2)易用性:提供简易工具实现业务利用已有数据实现机器学习模型训练;(3)透明化:可视化数据准备低代码进行数据清洗转换;(4)智能运维:AIOPS 能力应用在数据平台日常运维。机器学习平台与大数据平台深度融合,融合后的机器学习大数据平台的数据处理速度和自动化水平将提升一代。而要实现机器学习与大数据的融合,根据相关论文,需要满足以下要求:(1)隔离机制:人工智能与大数据之间不发生相互干扰的情况;(2)代码无缝对接:使大数据平台支持机器学习的原生代码;(3)融合框架:数据处理层、赋能层、应用层中,引入数据融合引擎,对数据处理层和赋能层进行深度融合;而要实现机器学习生产效率的提升,需要满足以下要求:(1)全生命周期平台化:覆盖从数据准备、模型构建、模型开发到模型生产的端对端能力;(2)预置机器学习算法和框架:使用户可以直接调用,而无需自行构建;(3)资源快速启动:底层资源即需即用,无需预置,使用统一的计算集群。全无服务器部署的湖仓一体架构是指数据存储、数据查询引擎、数据仓库、数据处理框架、数据目录产品均支持无服务器部署Serverless无服务器部署通过FaaS+BaaS提供服务,允许用户在不构建不运维一个复杂的基础设施的情况下进行开发,运行和管理应用程序。湖仓一体Serverless化后会具备两个优点:使用流程简化向用户提供Serverlesss部署的湖仓一体架构,使用户获得更易用的使用体验,全托管无运维的方式也帮助用户专注于业务本身,而非关心技术逻辑,符合云原生概念。成本灵活优化Serverless部署能够提供按需计费,不需要为等待付费,可以做到更高效的资源利用率。对于使用随时间变化大的企业是更具性价比的。无服务器部署已经成为了头部厂商在湖仓产品系列竞逐的产品特性,用以更好的支持用户需求:(1)亚马逊云通过具备Serverless能力的Redshift+EMR+MSK+Glue+Athena+Amazon Lake Formation实现Serverless全无服务器部署的湖仓一体;(2)华为云Stack+DLI Serverless+FusionInsight MRS+DWS实现Serverless化部署的大数据体系;(3)阿里云的DLA通过核心组件Lakehouse、Serverless Spark、Serverless SQL打造云原生+Serverless+数据库与大数据一体化架构Maxcompute;(4)其他Serverless湖仓产品还有Databricks Serverless SQL、Azure Synapse Analytics Serverless、移动云云原生Lakehouse等。数据管理解决方案厂商需要以用户体验为中心,从数据仓库、数据湖、湖仓方案、IaaS相关等维度持续深耕产品技术在市场用户对数据仓库要求更高的灵活性,并对数据湖要求更高的成长性的背景下,“湖仓一体”概念是业内厂商与用户对未来大数据架构的共同认知。纵然在概念层面具备显著的优势,湖仓一体在实际生产中依然面临由于技术或服务的不成熟而带来的众多问题。潜在用户出于对使用体验与稳定性的担忧、或对替换成熟稳定的原系统的投入产出价值不清晰,而保持谨慎观望。厂商需要以用户体验为中心,从多维度切入持续深耕产品技术。中国数据管理解决方案市场处于稳步增长阶段,竞争主体将根据其在创新能力及成长能力两个维度的表现划分梯队本报告分别通过市场增长指数与创新指数两大主要维度衡量业内优秀厂商竞争实力。增长指数衡量竞争主体在数据管理解决方案增长维度的竞争力,包括:数据存储、数据准备、机器学习分析支撑、湖仓一体整合、多维度多框架数据分析等创新技术或能力;而创新指数则衡量竞争主体在数据管理解决方案的竞争力,位置越靠右侧,数据管理解决方案的兼容性、查询&计算性能表现、灾备安全、服务支持、产业链生态、数据服务场景解决方案等市场增长能力及水平。沙利文联合头豹研究院根据增长指数和创新指数两大评估维度,通过数据存储、数据准备、数据分析支撑、数据分析、流程编排管理、兼容性、性能、灾备建设、服务支持、开源社区与产业链生态及数据服务场景解决方案十一项大指标,对中国数据管理解决方案市场竞争力多因素分层次评估。由“创新指数”和“增长指数” 综合评分,亚马逊云科技、华为云、阿里云、金山云、星环科技、浪潮云位列中国数据管理解决方案市场领导者梯队。亚马逊云科技:亚马逊云科技智能湖仓架构升级,通过Amazon Athena与Amazon Lake Formation打破数据孤岛,构建云中统一的数据治理底座,Amazon SageMaker机器学习全流程组件助力机器学习由实验转为实践,赋能业务人员探索业务敏捷创新。亚马逊云科技凭借专业深入的技术支持服务提供经历全球商业实践的产品和服务,为各行业客户提供各类数据服务场景的成熟解决方案。华为云:华为云FusionInsight MRS智能数据湖,MRS与AI开发平台ModelArts实现数智融合,通过HetuEngine一站式交互式SQL分析引擎实现湖仓协同,提供离线、实时、逻辑三湖一集市的数据架构支撑丰富的业务场景。华为云在大数据领域引领开源坚持开放,联合1000+行业应用生态合作伙伴共建覆盖金融、运营商、互联网、泛政等领域的落地场景解决方案。阿里云:阿里云Maxcompute适配多种数据湖仓案构建湖仓一体最佳实践,具备DB级元数据透视统一开发管理数据,与机器学习平台PAI无缝集成提供超大规模的机器学习处理能力。同时,Maxcompute与Hologres深度集成,为客户提供离线实时一体化的海量云数仓结构。结合开放开发建设和与伙伴生态产品的深度集成,为多行业用户的各种大数据场景提供多维的产品组合。金山云:金山云云原生数据引擎KCDE的统一元数据服务LMS统一湖仓的元数据层,支持构建实时湖、离线湖、分析湖的逻辑数据湖。大数据开发治理平台KDC与机器学习平台KingAI融合,基于统一的数据底座提供一站式数据挖掘服务。金山云以多元产品矩阵构建全域云原生能力,在金融、泛互联网、医疗、公共服务行业广泛覆盖大数据云平台应用解决方案。浪潮云:浪潮云大数据存储与分析IEMR提供多湖多仓关联计算能力,通过数据湖构建IDLF提供湖仓数据协同调用能力,与机器学习平台IMLP深度适配并提供200+预置模型和100+即开即用的行业模型调用能力。浪潮云IEMR具备高安全保障的灾备建设水平,IBP数据产品线可根据业务场景提供个性化产品交付形态,对电信、医疗、金融、政务等行业及其他大型国企提供丰富的场景解决方案和实施经验。星环科技:星环科技大数据基础平台TDH通过提供统一的SQL编译器Transwarp Quark和统一的分布式计算引擎Transwarp Nucleon等打造湖仓一体解决方案,突破传统Hadoop+MPP混合架构实现批流协同、多模融合的特性。星环科技在大数据各流程任务均提供组件化的技术服务和高度解耦的成熟产品,落地案例覆盖了金融、政务、交通、运营商、邮政、医疗、能源等行业。文章来源:弗若斯特沙利文 (如有侵权,请联系删除)
-
疫情蔓延期间,如何保证高质量“停课不停学”? 随着教育政策的变化与实施推进,人工智能如何助力教育行业发展?如何运用人工智能、大数据等现代信息技术,提升课堂教学质量等,已成为全社会关注的热点。目前人工智能、大数据、云计算、互联网等新一代信息技术正在快速发展,“新型人才热”也在持续升温中。在此背景下,教育回归学校、教学回归课堂成为大势所趋,“人工智能+教育”也成为当前中国教育的重要解题思路。华为云云商店携手伙伴共创共赢,在数字技术支撑平台和培养体系的支撑下研发打造全新服务内容。纸上得来终觉浅,绝知此事要躬行。从课堂走向实践,在实验和实训中还原真实企业环境;共同打造适用于教学、实验、实训等活动的教学服务平台,并且联接人才与市场,赋能新型人才培养。华为云云商店助力教育伙伴慧科,充分发挥差异化优势,为教育领域的管理部门、教育机构、学术机构等提供联合解决方案服务。以云+AI+5G技术的应用,不断促进智慧教育的发展创新,保障高质量新兴技术人才的持续培养输出。一、技术使能,助力高校“产学融合”慧科集团旗下灵鹿实验数字化平台,通过与华为云的技术联合,免费开放人工智能专业方向实验资源,保障高校教师远程教学辅导工作的正常开展。开放的实验包括语音识别、自然语言处理、视觉、Python科学计算、大数据用户行为分析等16个课程的配套173个实验,涵盖优质实践资源、前沿一手行业案例、大厂真实开发环境等,帮助高校教师在疫情期间远程开展在线实验和实践教学。而华为云也在课程内容、企业资源、技术平台三大方面为慧科提供强大的业务支持。-课程:华为各地基地、创新中心对当地的人才需求有较深入了解,帮助慧科快速准确地了解当地客户需求,大幅提升合作效率。-技术:华为自研的人工智能、智能网联、大数据专业课程,结合当下技术前沿,让慧科课程与企业实际需求接轨。-资源:华为云把先进的技术平台SaaS化,更利于慧科把技术引入到教学实践中,培养出符合需求的复合型人才。慧科集团与华为云于2021年中开启全面合作,双方就高等教育和新职业教育领域建立了紧密的合作关系,合作方向包含了智能物联、工业互联网、人工智能、集成电路、大数据、新商科、VR、鲲鹏、智能网联汽车、精益创业、数字孪生等多个方向。 二、华为云云商店助力慧科,提供多场景服务凭借突出的企业服务能力及产品市场竞争力,慧科集团目前已在华为云云商店上线30+产品品类,云商店将继续提供全方位的平台支持与运营赋能,面向产品规划、上市推广及持续运营等多环节,帮助伙伴高效运营。以云商店慧科人才培养服务平台为例,作为一站式综合解决方案,其囊括了丰富的资源及配套实验案例,能够支撑实验室、训练营、项目实战、专业教学及科研等多样化场景,提供实验平台及配套教学实验资源,以及产教融合、专业共建、实战实训、科技赛事、专业认证、政企培训等服务。慧科人才培养服务平台所具备的“一站式、高性能、灵活性、全层次”等优势将为高校提供更加便捷、智慧的教育服务,满足科技背景下的产业人才发展需求。华为云云商店也将继续携手慧科集团,为用户提供丰富、多场景的教育解决方案,为构筑繁荣的教育生态添砖加瓦。三、丰富合作模式,校企共育人才华为与慧科在合作期间,已经在多所院校共建产业学院,推动校企合作共育人才,为助力高校产学融合,提供一体化实训实践解决方案。推出“春雨计划”为满足老师的科研试验需求,减负赋能,慧科集团还在疫情期间推出“春雨计划”,召集百所院校师生免费体验灵鹿试验平台。免费提供10+大厂名师教学经验分享,1V1专属产品使用指导、10+行业实验资源体验、老师+学生免费账号实验资源、免费灵鹿平台云计算服务资源等。在活动过程中,学生以真实的企业项目进行全流程实操,制定目标,搭建团队,分工协作,公开答辩,后期复盘等,在这个过程中将理论和实践经验相结合,加深对专业和未来工作岗位的理解,为日后工作能力的培养打下坚实的基础。 创新赛事举办2020年,由慧科集团主办,华为作为独家合作伙伴的慧科华为人工智能大赛吸引了750多支队伍3000余名学生参赛。慧科华为人工智能大赛入围作品 企业人才培训与此同时,慧科还与华为云开展多项企业人才培训计划,提供企业数字化服务解决方案。通过深入了解企业所需的不同人才需求,培养数字化专业人才、应用人才、管理人才以及领军人物等不同层次的人才,并通过在线训练营、线下工作坊、数字商学院等多种形式开展培训,助力企业搭建数字化人才队伍,加速企业数字化转型步伐。华为与慧科在合作期间,已在多所院校共建产业学院,实现校企合作共育人才。 随着慧科人才培养服务平台上架华为云云商店,面向高等教育、职业教育提供实验平台及配套教学实验资源,并成功登顶云商店6月商品推荐榜(点此回顾),并荣获企业管理推荐榜第一、产品热销榜第二的好成绩。未来,双方将在此良好的合作基础上,进行更广阔和深入的探索,加强合作,加大规模,加快步伐,赋能高校和企业的数字化人才培养。华为云云商店将以“丰富、品质、创新、共赢”为目标,与伙伴携手打造用户首选的企业应用平台,让“上云”更简单。撰文&编辑丨华为云云商店-阿瑾
-
了解鲲鹏BoostKit大数据OmniData,更多详情可参见鲲鹏文档中心:https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/sqlqueryaccelf/kunpengbds_06_0005.html
-
首先非常感谢华为鲲鹏能给我们这个机会参与到华为鲲鹏生态的建设中来,同时也非常荣幸能跟随我的导师朱常鹏一起参与到这个项目中来。我将会从以下三个方面来介绍我们的项目项目背景项目方案心得体会项目背景随着大数据时代的到来,存储和计算大体量数据的需求越来越多的在企业中涌现,作为Hadoop大数据生态圈中目前离线计算性能最优越的大数据计算引擎Spark越来越多的被企业使用,为此,提升Spark在大数据场景下的性能成为当下大数据技术圈中的热点问题。在本项目中,通过对Spark的扩展,使之能够支持新型压缩算法KAEzip,KAEzip是华为新开发出的一种内置于华为鲲鹏920 CPU的高效压缩算法。相比较传统的zlib压缩算法,其压缩/解压缩性能均有较大幅度的提升。如果能够让Spark支持KAEzip压缩算法,将会较大程度上提升Spark在大数据场景下的性能,从而能够提升企业的效益。 项目方案本方案难点是需要了解掌握Spark中的压缩组件与jdk中的zlib组件和操作系统中的libz.so动态库之间的相互关系。Jdk自实现了用于zlib解压缩的动态库libzip.so,操作系统中也自带了一个zlib解压缩的动态库:libz.so,SparkSQL在读写文件时调用的是操作系统中的libz.so中的解压缩算法,其他解压缩场景如broadcast,shuffle,checkpoint调用的是jdk自带的libzip.so中的解压缩算法。Spark中的Spark core包和Spark SQL包负责压缩算法的选择与调用。在这两个包中,分别使用特征CompressionCodec和CompressionCodecs支持不同类型的压缩算法。基于特征的设计使得Spark在其生命周期内更易扩展。因此本方案主要的设计思路:实现Spark中的特征CompressionCodec和CompressionCodecs,使Spark支持KAEzip压缩算法;将Spark中对KAEzip中的压缩方法(deflate)和解压缩方法(inflate)的调用,重定向到操作系统中的libkaezip.so动态库(自实现),最终实现Spark对KAEzip的支持。具体思路如图1所示。Spark SQL提供了spark.read/spark.write等方法对本地文件或hdfs上的文件进行读写操作。根据不同的读写对象,这些可以进一步细分。比如spark.read可以细分为spark.read.text/spark.read.orc/sparkread.parquet等等,其中每个方法都可以设置不同的压缩算法,实现对文件的压缩和解压缩。为了让这些方法支持KAEzip压缩算法。我们的扩展可分为三个部分。首先,扩展CompressionCodecs特征,使Spark能够识别kaezip关键字,并映射到指定类上。该类实现了CompressionCodecs特征中规定的压缩/解压缩方法。因此对CompressionCodecs特征中的压缩/解压缩的调用,对最终被重定向到该类中的相应方法。其次,对ORC和parquet进行扩展。它们并不属于Spark或Hadoop,而是两个相互独立的Apache项目。它们目前并不支持KAEzip压缩算法,因此需要扩展,使其能够识别zlib和kaezip关键字,并将对应的关键字映射到指定的类上。最后,指定类对CompressionCodecs特征中规定的压缩/解压缩的实现依赖libkaezip.so动态库中提供的相应方法。因此需要根据需要动态的激活或者去活该动态库,确保只有在KAEzip压缩算法被调用时才被激活。具体过程如下图所示。除了文件的读写操作外,很多Spark应用程序也可以选择压缩算法,对执行过程中产生的数据进行压缩和解压缩。这一功能由Spark core实现。因此扩展Spark core是本方案的第二重点。具体实现方案如图3所示。首先,创建两个新类KaeInputStream和KaeOutputStream,它们分别调用KaeInflaterInputStream和KaeDeflateOutputStream类中的相关方法,实现CompressionCodeC中的相应方法,实现对数据流的压缩和解压缩。进一步,KaeInflaterInputStream和KaeDeflateOutputStream类都包含一个字节数组,用于临时存储数据流,然后分别调用类KaeInflater和类KaeDeflater,实现对数据流的压缩和解压缩。通过这六个类对Spark core进行扩展,实现Spark对KAEzip的支持。最后,KaeInflater和KaeDeflater并未真正实现压缩和解压方法,而是通过JNI方式调用到操作系统中的libz.so动态库中提供的inflate()方法和deflater()方法。为此,我们还需创建libnativezip.so动态库,作为链接KaeInflater和KaeDeflater和libz.so之间的桥梁。 KaeInflater和KaeDeflater中申明和使用的native方法由libnativezip.so中的相应方法负责实现,而它们的实现会调用到libz.so中的相应方法。最终构建起KaeInflater和KaeDeflater和libz.so之间的桥梁。通过动态地替换libz.so为libkaezip.so即可实现Spark支持KAEzip压缩算法。在方案实现中主要有以下重难点:在OpenEuler系统中搭建大数据环境,需要对以下组件进行适配:JDK,Hadoop(ARM版),Spark;通过Makefile编译libkaezip.so动态库,使其能够调用到OpenEuler中的libz.so;Java通过JNI与C/C++动态库进行交互,在Java层面调用libkaezip.so;软链接的切换;Spark CompressionCodec模块源码修改,扩展KAEzip压缩功能;OpenEuler测试环境搭建,并构建测试数据(1G~50G);测试脚本编写并测试心得体会通过参与本次的研究项目,一方面我学到很多技术:Spark压缩机制,JNI函数调用方法,压缩格式文件的写入写出等等,但更多的是思维方式的思考和转变,对于此我主要有以下两点心得体会。错误的代价是最大的,如果项目中出现了错误,那么建立在错误上的工作都白费了,因此做项目需要做好检查和校验机制,确保前进的每一小步都是正确的,这样才是最快的。我们在一开始犯了一个严重的错误,将Spark依赖的libz.so算法库错误的认为是Spark源码自身携带的,这个结论最后被证实是错误的,这个错误间接导致了我们将近20%的工作白费,极大的影响项目的进度。思考问题要从最基本的粒度进行思考,当我们对于一个问题并不了解时,我们应当从问题的最基本的流程和最微小的组成部分着手进行研究,我们的Spark在开始并不能支持分区块数据进行合并,总是会丢弃掉其他的分区,经过我们研究发现,KAEzip格式的压缩文件最后会有一个文件终止符,当多个分区的文件进行合并后,将会舍弃掉第一个分区文件终止符后的数据,如果我们没有从压缩文件格式的角度出发进行研究,我们是无法发现这个问题的。在此再次感谢鲲鹏众智让我能够有机会参与本次项目,最后衷心希望KAEzip压缩算法性能能越来越强大,鲲鹏920 CPU能够突破西方的技术封锁,走出国门,真正实现CPU中国化!! 重庆理工大学-大数据实验室-尹博文,指导老师:朱常鹏老师
-
云服务公共资源服务开通服务官网云服务社区入门材料赋能&产品文档等DGC大数据领域公共资源:1、大数据福利专场 0元试用 - 数据域主力产品0元试用https://activity.huaweicloud.com/Date-free.html2、微信公众号:智能数据湖微信号:ei-datalake 1、免费注册-[教程]DGC免费实例购买流程2.0https://bbs.huaweicloud.com/forum/thread-193738-1-1.html华为云-数据湖治理中心DGC-服务官网https://www.huaweicloud.com/product/dayu.html云社区 -EI企业智能数据湖治理中心DGChttps://bbs.huaweicloud.com/forum/forum-890-1.html1、快速入门:提供3个入门示例场景https://support.huaweicloud.com/qs-dgc/dgc_04_0021.html2、数据湖治理中心 DGC> 视频:入门准备https://support.huaweicloud.com/dgc_video/index.html1、DGC官方使用帮助文档:DGC的每个功能提供详细指导https://support.huaweicloud.com/dgc/index.html2、DGC 赋能视频:数据湖治理中心(DGC)伙伴赋能课程https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE133+Self-paced/about3、华为伙伴暨开发者大会2022数据治理生产线,加速构建企业数据资产视频回看:https://live.huawei.com/HPDC/meeting/cn/10741.htmlMRS1、云原生数据湖MRS集群开通https://support.huaweicloud.com/qs-mrs/mrs_09_0010.html华为云-云原生数据湖MRS-服务官网https://www.huaweicloud.com/product/mrs.html云社区 -云原生数据湖MRShttps://bbs.huaweicloud.com/forum/forum-612-1.html云原生数据湖MRS> 视频:入门介绍、操作&二次开发指导https://support.huaweicloud.com/mrs_video/index.html1、云原生数据湖MRS帮助文档:MRS的每个功能提供详细指导https://support.huaweicloud.com/mrs/index.html2、云原生数据湖MRS最佳实践https://support.huaweicloud.com/bestpractice-mrs/mrs_05_0023.htmlDLI免费注册-[教程]DLI免费实例购买流程2.0https://bbs.huaweicloud.com/forumreview/thread-193899-1-1.html华为云-数据湖探索 DLI-服务官网https://www.huaweicloud.com/product/dli.html云社区 -数据湖探索 DLIhttps://bbs.huaweicloud.com/forum/forum-599-1.html1、快速入门:使用DLI SQL分析OBS数据https://support.huaweicloud.com/bestpractice-dli/dli_05_0044.html2、数据湖探索 DLI> 视频:入门准备https://support.huaweicloud.com/dli_video/index.html1、DLI官方使用帮助文档:DLI的每个功能提供详细指导https://support.huaweicloud.com/wtsnew-dli/index.html2、DLI 赋能视频:数据湖探索(DLI)伙伴赋能课程https://education.huaweicloud.com/courses/course-v1:HuaweiX+CBUCNXE100+Self-paced/about
-

-
大家好!我是酷哥,数据库资讯,带您速览,欢迎大家阅读。 ------------------------------------------------ **本期精选** ------------------------------------------------ - 2022大数据十大关键词,重磅发布! - 新数据库时代,不要只学 Oracle、MySQL - IDC:2021H2中国关系型数据库软件市场规模同比增长34.9% - 可信隐私计算:破 解数据密态时代技术困局 - 华为云GaussDB助力“2号人事部”打造高品质HR效率软件 - 数据目录——企业数据资产的一个有序清单 - 数据湖治理:优势、挑战和入门 ------------------------------------------------ **资讯摘要** ------------------------------------------------ - 2022大数据十大关键词,重磅发布! **摘要:** 近日,为进一步加速推动我国数据智能转型进程,推动“十四五”期间数据智能产业交流与合作,由中国信息通信研究院、中国通信标准化协会指导,中国通信标准化协会大数据技术标准推进委员会(CCSA TC601)主办的2022大数据产业峰会在京召开。在峰会主论坛上,中国信通院云大所所长何宝宏发布了《2022大数据十大关键词》:  关键词1:创新型数据库优化数据资源化过程 关键词2:图计算平台助力大规模图数据资源化 关键词3:数据中 台成为企业挖掘数据要素价值的核心引擎 关键词4:DCMM贯标引领行业数据治理 关键词5:数据估值成为数据资产化切入点 关键词6:DataOps定义数据开发应用新模式 关键词7:隐私计算一体机助力数据要素流通破 局 关键词8:数据要素政策从宏观到落地 关键词9:数据安全合规整体迈入新阶段 关键词10:数据分类分级在数据安全治理中率先落地 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193543](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193543) - 新数据库时代,不要只学 Oracle、MySQL **摘要:** 目前,中国已经进入“人人都是开发者,家家都是数据公司”的新数据库时代。 近日,CSDN 创始人&董事长、极客帮创投创始合伙人蒋涛发表了《新数据库时代》主题演讲分享。他指出,在开源吞噬世界的背景下,数据库也在大力拥抱开源。不同于传统关系型数据库,新型数据库已成为行业风口,急需大量相关人才汇入,青年才俊应当抓住机遇,迎接挑战。  在此背景下,中国想要构建自己的核心技术生态,数据库是其中关键。今天我将围绕三个部分分享《新数据库时代》: 第一是揭示「我们正在进入的数据大时代」现状; 第二是了解「开源正在吞噬数据库」的改变; 第三是把握「新型的数据库人才特别抢手」的趋势。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193539](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193539) - IDC:2021H2中国关系型数据库软件市场规模同比增长34.9% **摘要:** 2022年6月21日,IDC发布的《2021年下半年中国关系型数据库软件市场跟踪报告》显示:2021下半年中国关系型数据库软件市场规模为15.8亿美元(105.6亿人民币),同比增长34.9%。其中,公有云关系型数据库规模8.7亿美元,同比增长48.7%;本地部署关系型数据库规模7.1亿美元,同比增长21.1%。 IDC预测, 到2026年,中国关系型数据库软件市场规模将达到95.5亿美元,未来5年市场年复合增长率(CAGR)为28.1%。  IDC中国企业软件市场分析师王楠表示:在新兴数据库技术层面,中国本土数据库厂商与国际厂商的差距不大,部分领域还处于领先地位,产品性价比更有优势。在宏观层面,政策极大利好本土厂商,本土厂商的市场机会将会高于国际厂商。在数据库技术发展和宏观政策驱动的双重因素影响下,中国关系型数据库市场过去的格局正在被打破,变革即将到来。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193678](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193678) - 可信隐私计算:破 解数据密态时代技术困局 **摘要:** 数据流通对于国家信息化进程、产业数字化转型是必不可缺的。以前,为了便利数据生产加工和导入导出,许多应用系统常常直接基于明文数据进行开发和流通。在这个过程中,数据流过的每一家机构都有可能会拷贝一份明文数据。随着传播路径的扩散,拥有这份数据的机构越来越多。任何一个机构出现数据滥用或者泄露,都会产生严重影响。可见,明文流通有着显著危害。 《中华人民共和国网络安全法》(简称《网络安全法》)、《中华人民共和国数据安全法》(简称《数据安全法》)、《中华人民共和国个人信息保护法》(简称《个人信息保护法》)须要确保所持有的数据安全,并且对数据的使用进行了严格的限制。在大部分场景下,除了匿名化之后的数据或者已经取得用户授权的数据,数据是不允许任意流通的。在这种情况下,密态流通无疑是最好的选择,能够更好地控制数据的使用和流通范围。  (可信密态计算示例图) **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193755](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193755) - 华为云GaussDB助力“2号人事部”打造高品质HR效率软件 **摘要:** 人才是社会和企业最重要的资产之一。为实现有效管理人才,企业需要一款灵活高效的HR效率软件。“2号人事部”是深圳市点米二号科技有限公司出品的中国第一款即租即用的HR效率软件,为10000家客户、1500万人提供员工管理、招聘管理、考勤打卡、薪酬计算、社保管理等服务,促进企业管理效率提升。 人才是企业的重要资产,高效管理人才是企业成功的重要因素。“2号人事部”全场景数字化平台极大提升了企业组织效率和员工满意度,让人才与企业价值实现共赢。华为云GaussDB数据库愿凭借技术力量,助力万千企业一同推动企业人力资源管理的创新升级,为HR带来工作效能提升和价值重塑。  **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193672](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193672) - 数据目录——企业数据资产的一个有序清单 **摘要:** 数据目录就是关于企业数据资产的一个有序清单。它可以使用元数据来帮助企业管理数据,帮助数据专业人员收集、组织、访问和充实元数据,从而为数据发现和治理提供支持。  与过去相比,想从如今前所未有的数据海洋中找到正确的数据更加困难。同时,关于数据的监管条例和法规(例如 GDPR)也比过去更多、更严格。在这一背景下,除了数据访问之外,数据治理也成为了一个严峻的挑战。您不仅要了解当前您所拥有数据的类型、哪些人在移动数据、数据的用途以及如何保护数据,还必须避免过多的数据层和封装,避免数据因太难使用而毫无用处。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193395](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193395) - 数据湖治理:优势、挑战和入门 **摘要:** 成功的数据治理计划会利用政策、标准和流程来创建高质量数据,并确保在整个组织中正确利用这些数据。数据治理最初侧重于关系数据库和传统数据仓库中的结构化数据,但后来情况发生变化。如果你的企业拥有数据湖环境,并希望从中获得准确的分析结果,那么你还需要部署适当的数据湖治理,作为整体治理计划的一部分。  但数据湖对企业数据管理的所有领域(包括数据治理)带来各种挑战。下面我们将探讨一些主要的治理挑战,以及有效治理数据湖的好处。不过,首先让我们定义什么是数据湖:这是指一个拥有大量原始数据的数据平台,通常包括各种结构化、非结构化和半结构化数据类型。它通常建立在Hadoop、Spark和其他大数据技术之上。 **文章详情:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193577](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=193577) *声明:文章源于第三方公开的信息,如果存在侵权或信息不实时,请及时联系处理。* 整理者:酷哥
-
金融领域的反欺诈、精准营销等大量的业务场景对服务连续性要求高,7*24小时不能中断,为了保持业务的连续性和技术引领,一个超大规模、高效率、可持续发展的数据底座显得尤为重要,而不中断业务的滚动升级能力则成为最硬核的衡量指标,中国最佳零售银行,金融数据湖上千节点滚动升级,2万多个业务正常运行,这背后的奥秘究竟是什么?今天让我们深入了解一下……作为“中国最佳零售银行”,某股份制银行一直将客户体验放在首位。近年来,该行以轻型银行为战略目标,打造以数据作为关键战略资产的未来银行,通过引入华为云FusionInsight建设全行统一的金融数据湖,汇聚各渠道业务数据,实现全行数据资源共享,用于探索新的客户体验和商业模式。当前,该行金融数据湖规模达到千余节点,承载了行内上万应用,支撑反欺诈、智慧营销等重要业务场景,日均处理数万大数据作业。随着该行不断深入使用大数据技术,逐步支撑行内关键金融业务,对于整个数据湖平台的服务连续性要求也越来越高,一方面行内金融数据湖要紧跟技术潮流不断升级革新,一方面要求支撑行内外业务的数据湖能够7*24小时不中断服务。然而传统的方案需要断电重启,显然不能满足行内业务连续性保障的要求;同时在金融数据湖升级过程中,对于数据湖这种复杂系统来讲,传统升级方案如果碰到突发的故障,容易导致整个升级动作中断重来,为平稳升级带来极大地挑战。近期,该行采用FusionInsight MRS云原生数据湖滚动升级能力,实现行内大数据平台的成功滚动升级,升级过程中金融数据湖承载的行内2万+应用正常运行,实现两个“不中断”:业务不中断数据湖承载了成千上万的任务作业,在升级过程中,关键的数据分析服务要能够不间断地支撑上层业务,这就导致升级和使用存在着矛盾冲突;MRS具有循环滚动升级能力,一次升级少量节点,循环滚动,直至整个集群的所有节点升级到新版本;同时,为了降低升级对关键任务SLA的影响,MRS还提供滚动升级暂停能力,在任务高峰时段或关键任务执行时,可以保障关键任务正常平稳运行。分批次升级示意图进度不中断数据湖是一个复杂系统,由服务器、存储、网络、软件等组成,在升级时经常会碰到突发事件,如磁盘故障、网络拥塞问题。在大数据平台升级过程中,部署人员需要应对各种突发事件,如磁盘故障、网络拥塞等多种异常场景,客户要求不中断升级。MRS提供故障节点隔离能力,在故障发生时,可以跳过该节点的升级动作,让故障处理和集群升级有序进行。滚动升级不仅是一个升级动作,更是一个系统工程。该行携手华为云FusionInsight MRS云原生数据湖,从兼容性、可靠性、工具自动化、保障团队等多方面入手,注重细节,实现了行内大数据平台架构的平滑演进,升级过程行内用户无感知,保障上层业务平稳运行。MRS目前已通过中国信通院3万+大集群评测,还可以通过集群联邦扩展到10万+大集群。除此之外,还为大规模集群提供超级调度器Superior,资源调度效率是开源大数据的30倍+,能够让整个集群的资源利用率最高达到90%+。截止目前,华为云FusionInsight已先后帮助国有大行、股份制银行、城商农信行,运营商如广东移动、浙江移动等客户实现平滑升级,顺利完成累计60000多节点的无风险升级,让3000+政企客户技术永新,业务永远在线。在本次升级过程中,某股份制银行成功上线了最新版本的华为云FusionInsight MRS云原生数据湖,并在新集群上提供如HetuEngine、 ClickHouse、Hudi等新组件,为项目管理、反欺诈、BI报表等业务创新提供有力技术支撑。在整个升级期间,行内数万名数据分析师毫无感觉,同事模型平台、先机平台、反欺诈平台等关键业务应用平滑运行无中断,为进一步行内实现湖仓一体目标,深度使用FusionInsight奠定良好基础。
-
DGC免费实例购买流程1、 账号注册 a) 在免费试用页面cid:link_0 找到数据湖治理中心DGC b) 点击立即购买 c) 输入手机号,验证码及密码,点击注册 d) 在新的窗口中勾选阅读并同意,点击开通 e) 注册成功 2、 实名认证 a) 微信扫描上图中的二维码完成实名认证b) 认证成功截图如下: 3、 购买DGC免费实例 a) 认证成功后,点击立即购买,进入新页面,在弹窗中勾选All b) 创建虚拟私有云 c) 创建虚拟私有云成功 d) 返回刚刚DGC订购页面,点击虚拟私有云旁的刷新按钮 e) 加载成功后效果 f) 点击立即购买 g) 在下一页中点击“去支付” h) 在新页面的折扣中选择“数据库治理中心DGC-初级版-1个月 0折”,并确认付款 i) 支付成功,订单完成 j) 点击左上角菜单,搜索DGC,点击进入DGC首页 k) 刷新页面,直至加载出DGC实例,创建DGC免费实例完成
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签