-
【功能模块】【操作步骤&问题现象】1、C语言编写,本地运行成功并输出,提交显示选手程序运行失败2、运行环境:虚拟机ubuntu18.04,分配内存4G,处理器2*1核,gcc版本7.5.0测试数据量级:8192时刻,135边缘节点,35客户【截图信息】运行环境运行结束完成输出访问路径使用库上传压缩包【日志信息】(可选,上传日志内容或者附件)排查了各种可能,如果是内存溢出,相同配置的本地虚拟机应该已经溢出了,路径,压缩内容,命名都没发现问题,还是说是我没注意到
-
1 寄存器分配问题的历史与演进B站视频地址:https://www.bilibili.com/video/BV1eF411x7Rh主讲人介绍:华保健中国科学技术大学软件学院助理教授,先进编译技术实验室主任,中国科学技术大学计算机系博士研究方向:程序设计语言和编译器技术、基于软件技术的计算机安全摘要:寄存器分配是编译器后端的重要优化,对于改进程序性能有显著作用。由于从理论上讲寄存器分配问题是 NP 难的,已有研究提出了各种启发式策略。本报告系统分析总结了经典的寄存器分配问题的历史发展和演进,全面总结了各种分析策略和算法。寄存器分配问题的研究分析,对于研究和构建面向 openEuler 等系统的下一代寄存器分配器有一定的指导作用。2 编译器矩阵扩展指令的支持与优化B站视频地址:https://www.bilibili.com/video/BV1fS4y1u7TE主讲人介绍:魏伟华为毕昇编译器主架构师,编译器领域技术专家研究方向:高性能计算编译优化技术,软硬件协同优化,调测调优工具开发,及新的编译技术研究方向探索等摘要:为了加速机器学习,越来越多的 CPU 架构添加了专门的 Matrix 或者 Tensor 单元,比如 Intel 推出的高级矩阵扩展指令集 AMX(Advanced Matrix Extensions),PowerPC 推出的矩阵乘辅助指令集 MMA(Matrix-Multiply Assist),以及 ARMv9 架构新增的可伸缩矩阵扩展指令集 SME(Scalable Matrix Extension)。本演讲将对上述几种 Matrix 扩展做简单的介绍,并分析当前业界主流编译器的 Matrix 支持情况,同时将会重点分享毕昇编译器上对 Matrix 的支持以及 SME 指令集的适配工作。3 Java 静态编译器的基类解耦方法及 Java/JavaScript 虚拟机上对象内存泄漏的在线检测方法B站视频地址:https://www.bilibili.com/video/BV1Nr4y1q7Dx主讲人介绍:史晓华北京航空航天大学软件学院副教授,博士,博导研究方向:编译技术,并行计算,软件工程等摘要:1)Java 静态编译器将面临某些语义解析的正确性挑战,其中较为关键的挑战之一就是所谓 “脆弱基类 Fragile Base Class”的解耦问题。我们将讨论包括 Java、SWIFT、Objective-C等典型面向对象语言编译器的解耦方法。2)Java 和 JavaScript 的“对象泄漏” 问题存在一定的相似性。我们将讨论如何在不同的 JVM和 JSVM上实现一种相似的在线检测机制,可以在较低负载的前提下,在程序运行过程中有效的捕捉到对象的泄漏信息。4 Python 在大数据领域实践和思考B站视频地址:https://www.bilibili.com/video/BV1EF411x7Zd主讲人介绍:张超腾讯专家工程师,原华为方舟编译器架构师研究方向:编译器和编程语言,大数据 / 机器学习、云计算等摘要:Python登顶编程语言榜单,已经不再是性能无所谓的脚本语言。从大数据现网经验来看,它正深刻影响着海量应用的功能和性能。2021年以来Microsoft、Facebook、Pyston等陆续开源了各自的Cpython高性能计划和代码。腾讯数据中心编译器团队以CPython为基础,针对公司数据科学场景需求和痛点,对CPython做了针对性优化。本演讲将对性能优化的进展、成果和思考进行介绍。5 HPL-AI benchmark for Kunpeng+Ascend AI-specific heterogeneous platformB站视频地址:https://www.bilibili.com/video/BV1zS4y1U7tX主讲人介绍:孙乔中科院软件所高级工程师, 硕士生导师研究方向:并行软件, 并行编程模型及计算机性能评测摘要:HPL-AI (High Performance Linpack, Artificial Intelligence) 是专为衡量计算平台面向 AI 任务处理能力的性能基准测试程序。本报告围绕华为鲲鹏 + 昇腾这一新兴 AI 专用异构平台,介绍我们在 HPL-AI 程序的实现和优化过程中所面对的挑战与解决方案。在优化过程中我们结合毕昇 C++ 的语言特性,实现了 HPL-AI 程序 Host+Device 侧的单源编程编译,充分挖掘 Device 侧算子性能,同时较好地兼顾了平台移植性。6 Kona Fiber 的进阶之路B站视频地址:https://www.bilibili.com/video/BV1kZ4y167pV主讲人介绍:郑淼高级工程师,深入参与腾讯自研协程 KonaFiber 和 ZGC 优化研究方向:协程和 ZGC摘要:协程可以让程序员用熟悉的同步编程方式取得类似异步编程的高性能和高并发收益,OpenJDK 社区正在前沿版本进行协程方案 Loom 的探索、开发,整体方案正在趋于完善。Kona Fiber 是腾讯在 jdk8、jdk11 上,兼容 Loom API 的开源协程实现。Kona Fiber 不仅让用户可以在当前主流 JDK 版本上体验未来 OpenJDK 社区的协程方案,同时一直在加强其可用性和易用性,使 Kona Fiber 能被更广泛、更便捷地应用到实际业务中。
-
一、背景使用 Spark 机器学习库来做机器学习工作,可以说是非常的简单,通常只需要在对原始数据进行处理后,然后直接调用相应的 API 就可以实现。但是要想选择合适的算法,高效准确地对数据进行分析,可能还需要深入了解下算法原理,以及相应 Spark MLlib API 实现的参数的意义。目前,Spark MLlib 中实现了 tree 相关的算法,决策树 DT(DecisionTree),随机森林 RF(Random Forest),GBDT(Gradient Boosting Decision Tree),其基础都是RF,DT 是 RF 一棵树时的情况,而 GBDT 则是循环构建DT,GBDT与DT的代码是非常简单明了的,本文会对 Random Forest 的原理和源码进行分析。二、决策树与随机森林首先我们来对决策树和随机森林进行简单的了解:决策树 GBDT-Decision Tree(DT)关键问题节点分裂:使用的特征及阈值特征选取:最小均方差、信息增益(ID3)、信息增益率(C4.5)阈值:从特征值中选取、等步长选取最大最小值之间的值叶子节点的值:叶子所属数据的均值(回归)、对应类别(分类)截止条件:达到叶子节点数上限、继续划分无法使误差减小 在决策树的训练中,如上图所示,就是从根节点开始,不断的分裂,直到触发截止条件,在节点的分裂过程中要解决的问题其实就两个:分裂点:一般就是遍历所有特征的所有特征值,选取impurity最大的分成左右孩子节点,impurity的选取有信息熵(分类),最小均方差(回归)等方法预测值:一般取当前最多的class(分类)或者取均值(回归)随机森林随机森林就是构建多棵决策树投票,在构建多棵树过程中,引入随机性,一般体现在两个方面,一是每棵树使用的样本进行随机抽样,分为有放回和无放回抽样。二是对每棵树使用的特征集进行抽样,使用部分特征训练。在训练过程中,如果单机内存能放下所有样本,可以用多线程同时训练多棵树,树之间的训练互不影响。三、Spark随机森林概要(训练步骤)随机森林中的每个树模型之间没有关联,可以独立训练,这为随机森林的分布式训练提供可能。具体的训练步骤如下:1.将每个树模型的根节点取出,加入栈中2.将k个节点从栈中取出,组成一个训练集合group,k值由内存限制决定,确定特征采样3.从各分区上计算并汇合分布信息,并计算待切分节点的最优切分点4.根据切分点生成新的叶子节点,并更新nodeIdCache5.若新生成的叶子节点没有达到最小不纯度限制和最小样本数量的限制,则入栈6.若栈非空 goto 2.7.剪枝合并多余节点,结束spark实现分布式随机森林优化点Spark 平台上,传统单机形式的迭代方式必须要进行相应改进才能适用于分布式环境,这是因为在分布式环境下,数据也是分布式的,算法设计不得当会生成大量的 IO 操作,影响算法效率三个优化策略。1.切分点抽样统计在单机环境下的决策树对连续变量进行切分点选择时,一般是通过对特征点进行排序,然后取相邻两个数之间的点作为切分点,如果在分布式环境下如此操作的话,会带来大量的网络传输操作,特别是当数据量达到 PB 级时,算法效率将极为低下 Spark 中的随机森林在构建决策树时,会对各分区采用一定的子特征策略进行抽样, 然后生成各个分区的统计数据,并最终得到切分点。2.切分特征装箱(Binning)决策树的构建过程就是对特征的取值不断进行划分的过程对于离散的特征,如果有M个值,最多个划分如果值是有序的,那么就最多 M-1个划分(按老,中,少的序,那么只有 m-1 个,即 2 种划分,老|中,少;老,中|少)划分的点就是 split(切分点),划分出的区间就是 bin。对于连续特征 ,理论上 split 是无数的,在分布环境下不可能取出所有的值,因此它采用的是1中的切点抽样统计方法。3.逐层训练(level-wise training)单机版本的决策数生成过程是通过递归调用(本质上是深度优先)的方式构造树,在构造树的同时,需要移动数据,将同一个子节点的数据移动到一起分布式环境下采用的策略是逐层构建树节点(本质上是广度优先),这样遍历所有数据的次数 等于所有树中的最大层数。每次遍历时,只需要计算每个节点所有切分点统计参数,遍历完后,根据节点的特征划分,决定是否切分,以及如何切分。总体时序图具体分析代码,可以得出以下时序图具体流程详解随机森林最重要的就是寻找最佳split的过程,首先要计算所有可能的split,流程图如下:找到所有可能的split了,就需要再其中挑选出最佳split,流程图如下:在分割结束后,最后一步需要在driver端建树,流程图如下:
-
1.1 背景与价值业务的持续增长往往带来对于应用系统性能要求的提升,业务应用如何基于既有软硬件资源,充分发挥计算算力,提升并发性能,处理更多事务,是开发者面临的最大挑战。鲲鹏加速库对软件基础库做深度性能优化,通过硬件加速和软件加速,给客户带来更高的性价比。1.2 鲲鹏BoostKit加速库全景鲲鹏应用使能套件BoostKit,释放倍级性能优势,提供以下八大场景化应用使能套件:大数据、分布式存储、数据库、虚拟化、 ARM原生、Web/CDN、NFV和HPC。其中的基础加速软件包,华为提供基础性能优化、基础加速库和加速算法等基础加速软件包和文档,合作伙伴可以从从鲲鹏社区获取基础加速软件包,在鲲鹏创新中心指导下进行编译、部署和性能优化。鲲鹏BoostKit加速库共支持3种加速库,分别是:ARM支持的加速库:开源社区提供的ARM支持的加速库,已在鲲鹏平台完成验证;基于鲲鹏指令的加速库:基于鲲鹏指令深度优化的加速库,并向开源社区开放基于KAE(Kunpeng Accelerator Engine,鲲鹏加速引擎)的加速库:基于鲲鹏硬件加速引擎的加速库,提供领先业界的性能加速能力。包含ZIP(硬加速-压缩),HPRE(硬加速-非对称加解密),SEC(硬加速-对称加解密)。上述3种加速库,依据使用的场景不同,一共可以分为7类,分别是:系统库、压缩库、加解密库、媒体与信号库、数学库、存储库、网络库。这7类加速库,在架构上,对上适用于各种解决方案,比如说大数据、分布式存储、数据库、虚拟化、ARM生web、CDN等,从而支撑这些解决方案服务于政府、运营商、金融等其它领域,对下适配主流的操作系统,比如说openEuler、CentOS等等。鲲鹏BoostKit加速库充分发挥硬件的能力,或者内嵌于操作系统,以及单独作为一个函数库,去支撑解决方案,提升解决方案的性能,最终提升客户的性价比,即不需要去加购硬件的配置,就可以提升算力和性能。1.3 鲲鹏BoostKit加速库实现原理及应用1.3.1 KAE加速库原理及应用KAE使用流程如下:BMC子系统管理芯片加速子系统的License,当系统初始化时,BMC将License传递给BIOS系统。BIOS子系统解析License信息,并根据解析结果对芯片加速子系统进行使能控制,并上报加速器ACPI表到内核。上层应用基于OpenSSL/zlib加速库调用鲲鹏加速引擎,并通过寄存器操作调用芯片加速子系统。从用户层的角度来看,apps在使用KAE时,只需进行简单的配置。如果应用程序已经调用了openSSL或者已经调用了Zlib,无需修改代码,便可获取KAE带来的加速能力,反之,我们提供了Warpdrive层,其算法进行了抽象,提供了API,供上层软件调用。同时提供统一的用户态加速框架,帮助降低调用路径性能损耗。KAE的应用场景十分广泛,包括Web应用方案、分布式存储、大数据、虚拟化。Web应用方案,在互联网和金融行业应用非常普遍,使用KAE的RSA去硬加速Nginx。Nginx负责短连接接入的负载均衡,其性能会直接决定系统能否接入,同时并发处理多少个客户请求。如果硬加速能够对RSA的处理做性能优化,就可以同时处理更多请求。通过实测发现Nginx在使用RSA硬加速之后,并发数量可以提升一倍。相比业界友商的加速卡整体性能领先35%。在分布式存储混合读写7:3典型场景中,对带宽性能验证发现:块存储和对象存储都平均提升15%以上,最高能接近40%。大数据场景,用到了国密的加解密。在大数据的节点之间同步时,需把数据加密之后再传输,或者把数据压缩之后再存储。此前CPU占比较高,约占20%。使用KAE后,整个加密性能有所提升,且CPU损耗不超过5%。省下的CPU就可以去做很多业务上的事情,比如MapReduce的任务数增加,这样整个端到端的性能就会有所提升。虚拟化场景,目前KAE引擎完全按照SR-IOV的标准实现。在虚拟化和容器场景下,使用KAE,不会导致虚拟化调用带来的额外损耗,使用KAE的效果和物理机几乎等同。1.3.2 鲲鹏指令加速库原理及应用Avx2NeonAvx2Neon加速库是一款接口集合库,将AVX指令封装为独立的接口模块,并采用NEON SIMD指令替换对应的AVX指令,解决迁移问题。x86 Intrinsic函数总共6000多个,目前已完成其中5000+个的函数接口适配;Avx2Neon对常用的SSE/AVX Intrinsics函数进行深度优化适配,使用鲲鹏920指令以及ARM Intrinsics函数进行深度性能优化。目前,适配函数以头文件方式集成到Porting Advisor工具,通过工具识别迁移点,并提供一键式快速迁移HyperscanHyperscan是一款高性能的正则表达式匹配库,其中包含大量高效算法。它基于官网5.2.0版本优化,除了使用ARM Neon指令加速外,还使用数据预取、分支预测、结构重排及循环展开等多种优化手段实现加速。Hyperscan支持块模式(适用于对一段现成的完整数据进行匹配)和流模式(网络场景下跨报文匹配设计的特殊匹配模式)两种匹配模式,适用于入侵检测系统、DPI解决方案、互联网营销、网络威胁检测等诸多场景。HMPPHMPP是华为自研高性能媒体性能原语库,包括图像处理HMPPI函数库以及信号处理HMPPS函数库两个子库,适配多个操作系统,提供函数API,应用于运动跟踪、雷达信号、图像分析、视频增强、AI加速、医学扫描、通信工程等诸多行业。目前已经完成信号库HMPPS完成1000+个函数接口开发包括以下方面:基础向量运算:逻辑移位运算、向量转换、向量统计、采样函数、初始化函数信号变换:FFT、CZT、功率谱、希尔伯特滤波:卷积、FIR滤波、重采样、中值滤波、自相关窗口函数:Blackman、Hann、Kaiser、Hamming、Bartlett数学运算:算数运算、三角运算、幂、根、指数运算HW265HW265是用于编码符合高效率视频编码(HEVC/H.265)标准的影片的开源自由软件及函数库。其支持8bit高清低码,性能与码率相比开源有倍级提升;其中8bit标准版实现相比x86开源x265有1~5倍的性能优势;其中8bit高清低码版实现平均50%的码率节省。应用于热门影片、短视频场景、OTT点播、秀场、游戏、在线教育等诸多场景。经测试验证,视频质量与转码速度均得到了大幅的提升,对于直播的场景,单机并发路数也实现倍级提升。数学库数学库KML(Kunpeng Math Library),目前一共包含6个子库,包含处理实复数快速傅里叶变换的KML_FFT,处理稀疏线性代数运算的KML_SPBLAS,处理线性代数运算(向量-向量/向量-矩阵/矩阵-矩阵)的KML_BLAS,处理向量计算的KML_VML,处理基础计算的KML_MATH,处理线性代数运算(矩阵分解/方程组求解/特征值)的KML_LAPACK。数学库广泛应用于大数据分析算法(如KAL)、科学计算(如气象、制造、化学等行业)、AI推理(如卷积算子等)。数学库在保证数学运算精度的同事,利用NEON指令、循环展开、汇编代码重构等方法,大幅度提升计算性能,其中KML_FFT与开源FFTW进行对比的,性能提升约有1倍,和基础库LIBM进行比较,性能提升约有50%。GlibcGlibc是c运行库,是linux系统中最底层、最基础的软件库,其它任何运行库几乎都会依赖于glibc。华为通过使用Q寄存器代替X寄存器、读写内存对齐、结合鲲鹏CPU芯片分支预测特性、算法优化等诸多优化方案,对内存、字符串等接口进行了加速优化,充分利用鲲鹏Neon指令优势提高算力。已优化的接口已合入GNU社区,随glibc2.31主干版本发布,同时openEuler1.0已收编相比于主流OS集成的glibc2.17,接口平均性能提升35+%。1.4 总结鲲鹏BoostKit加速库通过鲲鹏社区,社区化运作,针对合作伙伴和开发者,均可以通过鲲鹏社区(https://www.hikunpeng.com/zh/developer/devkit/library)联系华为和获取相关加速库。同时,加速库项目在github(https://github.com/kunpengcompute/Kunpeng)上进行了部分库的开源,以供开发者合作交流。另外,在鲲鹏众智(https://www.hikunpeng.com/ecosystem/ecology_remit)项目中发布了高回报的开发任务,如果您对加速库感兴趣,可以与鲲鹏BoostKit加速库团队一起共创ARM高性能生态。
JarrettTowne
发表于2022-03-15 10:23:06
2022-03-15 10:23:06
最后回复
JarrettTowne
2022-03-15 10:23:06
1011 0 -
本文分享自华为云社区《[华为云大数据轻模式体验:忘掉底层烦恼,专注数据开发](https://bbs.huaweicloud.com/blogs/336310?utm_source=csdn&utm_medium=bbs-ex&utm_campaign=other&utm_content=content)》,作者: 技术火炬手。 现阶段我们国家从政府到企业都在进行数字化转型,数字化转型的核心是数据,对于有着开发实力和基础的大公司来讲,他们可以有着完备的数据处理体系和开发人员储备,可以高效地利用手中的资源对数据进行再加工,让数据成为企业的生产要素。  我们知道,“二八定律”作为一个经济学原理揭示了任何一组事物最重要的构成只占其中的一小部分,其余的大部分多数构成的很小比例在经济学上被称为“长尾效应”。企业也是一样,处于中长尾的企业想要数字化转型,数据技术、人才、资金的高门槛往往让他们望而却步。他们亟需大数据行业的领导者,能做出企业的通用模式,节约数字化成本,降低用数门槛。不少企业虽然选择将业务上云作为数字化的一个方向,但对上云后产生的数据不管理、不加工、不分析,这让这些数据上云失去了意义。 华为云基于华为IT流程数据治理方法论推出华为云大数据轻量级解决方案,配合华为云资产可以轻资源、轻开发、轻部署、轻运维地快速构建数据治理体系,全Serverless方案对中长尾企业来讲使用灵活,企业无需关注底层技术栈、云资源性能,可按需使用降低运营成本。 华为云大数据相关服务提供数据全生命周期的一站式管理和开发,帮助中长尾企业大幅简化数据治理的流程,在这种轻模式的支持下,中长尾企业可以快速高效地应对大量数据的分析,降低用数门槛,加快企业数据变现,完成企业的数字化转型。 接下来,我们就通过具体的实例来对华为云数据湖治理中心DGC进行全方位的认识和了解,透过华为理念下形成的轻量级通用解决方案探讨中长尾企业如何应对数据治理上的难题。 # 华为云大数据轻量级解决方案介绍 针对中长尾企业的数据治理需求,华为云推出了大数据轻量级解决方案帮助企业进行高效的数据治理。我们都知道Serverless本质是将复杂留给自己,将便利提供给客户,加速用户的敏捷创新,这也是华为云大数据轻量级解决方案的核心思想。  华为云这套轻量级的解决方案区别于企业自建自管自运营的模式,全Serverless方案对于企业来讲不需要额外考虑资源管理、部署、运维,云上模式让企业大大降低了用于硬件管理与扩容、跨AZ可靠调度、Bug修复、软件安全、AI引擎调优等问题,只需专注业务开发即可,业务的使用与运营更加灵活。  华为云大数据轻量级解决方案作为一项通用的大数据治理解决方案为企业提供了丰富的拓展能力,支持对象存储、NoSQL、OLTP、OLAP等数据库类型,支持跨云数据治理、自建数据中心数据治理。企业不需要变更自己的底层数据技术栈就能实现大数据的治理和分析。  针对中长尾企业的数据治理场景,华为云DGC、DLI、CDM、RDS等服务提供轻量化、灵活的技术栈,通过将华为云服务串联,打造数据治理轻量化模式。涉及到以下核心服务: - CDM:高效、易用的数据迁移服务,支持批量和增量数据迁移,提供超过40种数据源到数据湖仓迁移能力; - DRS:基于事物日志(如MySQL、Oracle)的数据库复制进行增量同步; - DGC:数据标准和数据模型的规范设计,可进行在线开发和编排调度,数据质量稽核等一站式数据管理; - DLI:完全兼容Apache Spark、Apache Flink、Presto生态,提供批、流、交互式一体的Serverless融合处理分析,完全兼容SQL语法,开发难度低; - BI:通过华为云DLV数据可视化服务或专业BI软件实现2D或3D数据展示,通过拖拉拽式布局,帮助企业快速进行大屏数据可视化呈现。 对于企业来讲,华为云大数据轻量级解决方案通过一站式的大数据分析服务,实现了企业多端数据采集,并在统一框架下进行数据采集、分析、归纳。 通过全栈式技术能力,依托DLI数据湖探索服务以及配套的数据同步方案,可以满足企业海量数据分析的需求,完成快速数据分析,释放数据的价值。 由于DGC提供高度可视化的ETL任务开发、管理、调度的能力,同时DLI等数据服务支持通用SQL语法,这些对于企业来讲可以的大幅的降低开发过程中的门槛,实现简单易用、灵活高效的数据开发模式。另外通过专业的BI厂商,可以很好的满足企业对可视化BI工具的需求,数据生产到最后直观的可视化呈现,为运营分析降低门槛。 这DGC提供一站式的数据全生命周期的运营管理,配合华为云其他大数据产品, DGC作为华为云轻量级大数据解决方案的核心,它可对接多种数据湖引擎,帮助进行统一开发,并提供统一的数据资产管理。方便企业进行全链路数据治理管控。数据运营全场景可视,统一调度和运维带来全方位的安全保障。  开发人员无需复杂配置就可以完成对数据的导入, DGC提供数据管理、数据集成、脚本开发、作业开发、作业调度、运维监控、全场景可视化等功能。方便企业不同部门的打破相互隔离,以此建设统一的数据平台,统一技术规范、数据标准和访问接口。  DGC提供丰富的大数据平台组件,方便多种数据和分析需求,降低数据治理的人工工作量,以此提升数据管理效率。DGC提供一套完整的数据治理方法论落地,通过这套方法论实现业务上下游数据的快速传递和共享,以此指导实际业务的运作。通过数据质量持续为企业提供预警,以此减少纠错成本,降低运营风险,提升服务质量。  在分析处理上, DLI数据探索服务则成为华为云轻量级大数据治理方案的重要组成。这套方案中, 通过DLI等基础云服务实现数据探查、数据监控、数据标准化,形成有指导意义的集市层数据。DLI它支持结构化和无结构化的数据处理,并支持丰富的编程语言接口,同时成本也非常低。DLI完全兼容Apache Spark、Apache Flink、HetuEngine(基于Presto)。  DLI采用批流交互式一体架构,兼容标准 JDBC 协议,可以直接对接第三方 BI 软件,完成一站式大数据分析、用数的闭环场景。 由于DLI兼容标准的SQL语法且均基于Serverless进行分析计算服务,因此用户无需关心底层的计算架构,只需要通过连接服务即可进行数据分析,大大降低了开发的难度和门槛。DLI还支持免搬迁全域数据联合查询,过滤条件支持只能下压到数据源,减少传输数据量。由于DLI支持Kubernetes,因此DLI还支持资源按需分配,自动弹性伸缩。 接下来我们进入实例场景,通过对门店坪效的全流程设计来了解华为云大数据轻量级解决方案的各项服务能力,并快速的进行业务指标的模拟输出。 # 华为云大数据轻量级解决方案坪效实例场景体验 坪效作为零售行业的典型指标,是这次实例场景所要计算的一个指标,这样的数据分析模型是华为云大数据轻量化解决方案主要的运用场景,在进行坪效实例场景的演示操作前,我们首先了解下什么是坪效。坪效是衡量一个地区或门店某一时间段单位面积产出情况,即每坪经营面积可以产出多少营业额。 坪效计算公式如下:  坪效越高,店铺整体的经营效率也就越高,一般计算都以年为周期。华为云大数据轻量级解决方案的指导及下,我们以过去一年门店坪效指标和地区坪效指标作为目标,进行项目的设计和规划,其中涉及华为云大数据及其他云服务,包括VPS、OBS、RDS、CDM、DGC、DLI、DLV等。 零售业店铺在获取到坪效数据后,可以针对性的对门店业务、门店规模、人员结构进行调整。这一案例中涉及到DGC开发的数据集成、规范设计、数据开发、数据质量、数据资产、数据服务模块以及华为云大数据其他关联服务工具。 通过这些模块的体验,我们得以实现对华为云大数据轻量级解决方案的全面了解,对中长尾的大数据治理进行整体的设计、开发、分析、运营,在这种轻模式下,企业可以对数据进行敏捷开发。 # 轻资产:按需使用,无需担心底层技术栈及安全问题 在对于中长尾企业而言轻量化的资产管理体系可以省去大量云服务建设成本,华为云大数据轻量级解决方案绝大部分资源都建设在云上,对企业而言,可按需购买,购买即用,不需要额外关注底层的硬件性能和技术实现,并且不需要考虑相关工具软件的迭代和安全问题。 这里我们通过华为云CDM云数据迁移服务,集成RDS MySQL数据库模拟数据元门店系统及订单系统数据,利用华为云DLI数据湖探索服务的计算能力实现数据清理、指标计算和汇总,并最终使用华为云RDS MySQL作为集市层数据展现,最终通过DGC作业开发将上述操作串联,形成完整的流水线,并通过DGC数据服务能力将数据API接口输出,以此将数据输出到BI报表分析工具或通过华为云DLV数据可视化服务对数据进行直观的屏幕输出。上述CDM、RDS、OBS等服务均支持按需购买,大幅降低企业的资产购置压力。 其中OBS负责存储DGC的日志和脏数据;DLI作为贴源层的存储和计算技术栈,DLI由于存储量大且价格便宜,并采用分布式计算模型,因此进行大量数据运算的时候速度较、支持高并发;通过DLI生成主题库和专题库后,将这些数据仓库存储在RDS MySQL数据库中,这一服务可以进行专业的BI分析;DGC作为整个项目的数据运营技术栈,继承了数据集成、规范设计、数据开发、数据质量、数据资产、数据服务功能,也是华为云大数据轻量化解决方案的核心技术模块,作为数据湖运营平台,DGC提供了数据的全生命周期管理,在此案例中我们通过上述功能模块完成了一整条数据治理流水线的建设;在所以数据分析归纳后,再通过DLV数据可视化服务对指标进行结果展示。  华为云大数据轻量级解决方案对于企业而言不需要变动其底层的数据源,这套方案在数据集成上已经有很好的支持,无论是华为云数据库、第三方云数据库还是企业自建数据中心,都支持数据迁移。这里我们通过RDS作为模拟数据源导入并最终汇总生成集市层数据,在进行配置前,我们首先要购买对应资源才能实现一整套的数据治理流程,具体需购买和提前创建的资源如下: - 创建VPC、子网、安全组 - 创建OBS桶,创建存储作业日志和脏数据目录 - 购买DGC实例,并配置默认工作空间 - 购买CDM集群,正式项目可考虑使用ROMA - 购买RDS实例 - 购买DLI队列实例 在购买完对应资源后,需对原始数据进行导入,即将数据SQL文件导入到RDS MySQL数据库中,这一操作只需进入RDS数据管理页面,上传脚本即可快速完成数据导入。数据源包含两张表,分别是门店表(t_user_store_info)和订单表(t_trade_order)。  RDS MySQL原始数据导入后,我们需要在DLI中建立相同的表结构进行贴源层数据导入。进入DLI库表管理新建一个DLI库,以此作为项目表存放DLI数据库。  随后在DLI的SQL编辑器中将建表脚本导入建表,表结构和表名称最好与RDS MySQL中原表一致。  数据导入后,在OBS服务中完成DGC日志数据和脏数据文件夹建立,以便后续DGC正常使用。   接下来就需要对数据进行入湖处理,这里采用DGC的数据集成模块,DGC批量数据迁移CDM提供同构或异构数据元之间批量数据迁移服务,可以帮助企业实现数据的自由流动,支持关系型数据库、数据仓库、NoSQL、大数据云服务、对象存储等数据源。  这些数据源涵盖华为云DWS、华为云DLI、FusionInsight LibrA、Hadoop、OBS、阿里云OSS、FTP、SFTP、NAS、MySQL、HWSQL、PostgreSQL、SQL Server、DDM、Oracle、Db2、Redis、MongoDB、CSS、Apache Kafka等30多种数据源。  这些数据源可以作为源也可以作为迁移目的,租户可以按需付费,控制和租户之间是完全分离的,数据始终是在原始位置,后续的作业、对数据的操作都是与原始数据隔离,通过CDM可以更加安全的保护原始数据。  之前我们导入的RDS MySQL云数据库服务作为源数据,另外一个则是数据湖探索DLI的连接,通过CDM服务我们快速生成DLI内贴源数据导入。  这里,CDM提供自动化的字段映射,对于不同数据源数据类型不同这样的情况,CDM支持数据类型一键转换。在CDM迁移之前,我们已经提前将对应的表在DLI中建好,分别是t_trade_order和t_user_store。这样CDM就可以进行快速匹配。  通过CDM我们就快速实现了源数据导入贴源数据的数据迁移工作,由于原始数据可能存在不断生成的问题,这里CDM也提供周期作业以此对数据进行导入。接下里,我们再进行具体的业务场景设计和相关脚本的开发。  # 轻开发:开发高度可视化,SQL脚本通用简单 华为云大数据轻量级解决方案最重要的特点是全流程的高度可视化,没有复杂的代码编写过程,对开发人员的技术要求不高,可以从业务层面需求出发进行系统化的建模,再通过建模实现对应开发脚本的生成。整个过程非常的快速高效,由于华为云大数据解决方案中的DLI、DWS等服务均支持标准SQL语句,因此各类脚本编写上难度不大。在本例中首先需要对业务进行建模,在形成对应的业务指标对贴源数据进行清洗加工并输出有实际指导意义的参数。 华为云大数据轻量级解决方案将业务实体与实现细节紧密结合让需求方无需了解太多编程相关的细节,让开发方不必考虑业务实现的逻辑。通过这套解决方案的DGC规范设计模块就能初步实现各类业务的需求指标设计并对数据进行标准化,包含主题设计、数据标准设计、数据模型设计、数据指标设计,通过规范设计可以根据客户的业务需求,进行统一的数据分类、数据标准化、指标定义和数据模型体系建设。  通过上述四个步骤,将业务数据化需求进行抽象化,就可以输出企业标准化数据中台设计。完成数据模型体系的建设,对于未来同行业的解决方案建设也有了参考价值。通过主题设计可以很快的完成信息架构的设计,针对不同类型的信息,还可以指定数据类型。   在主题设计完成后,就可进行数据建模。首先根据之前的主题设计进行建模,这里提供关系建模和维度建模两种建模方式,关系建模符合3NF,主要是去除数据冗余,使数据标准化,当存在多个数据描述同一个情况时,需要使用关系建模进行合并。维度建模则采用数据结构化的方法进行建模,针对需求和指标对数据源进行维度、事实建模,相比于关系建模,维度建模紧紧围绕业务指标,非常直观显示出业务模型中的业务问题。维度建模包括维度、维度表、事实表、汇总表。  维度表多为业务指标的环境信息,比如时间、空间信息等,这里我们建模对门店和地区维度进行建模,这就是典型的空间信息。维度表是用户用来分析数据的窗口,一个维度表可以对一组数据进行分类,且分组后的数据可以用来分析。我们以门店维度表为例,门店包括门店编码、店铺类型、营业状态、门店名称属性。我们如果要计算坪效指标,可以进行门店坪效指标的计算、某一类型门店坪效指标的计算、营业中门店坪考指标计算等,通过这些指标可以定义一组数据。  事实表内容主要分为三类,分别是维度表外键、事实属性和度量属性。比如门店事实表包含地区外键、门店编码外键、经营面积、开业时间等信息。   汇总表则可以对上述维度和事实进行归纳总结,得出相应的技术指标,我们以地区坪效指标的设计为例。可以看到对应属性和相关内容的汇总信息,地区坪效指标可以通过技术指标进行确定。   DGC将指标分为业务指标和技术指标两类,业务指标模块主要是以文字的形式定义某一指标,并以此为参考指导技术指标实现,我们以坪效为例,坪效位于进销存管理中,根据坪效的定义,坪效就是门店销售额与门店面积的比例。通过这一文字定义,我们来到技术指标中,完成坪效这一指标的技术定义。我们也可以对员工的销售额与绩效关系进行统一的界定,对于需求调研层面的人员来讲,这些只需要文字描述就可以快速完成各种指标和属性的确定。   通过以上的需求建设和管理,需求方很快的就将自己的业务需求确定好,整个过程都是可视化的,接下里再进一步的对指标进行运算分析,最终形成有实际意义的指导数据,这里则通过技术指标完成对业务指标的具体实现,包含原子指标、衍生指标、复合指标。原子指标是最基础的算子,是纬度在模型中某一个属性或属性的简单运算,在坪效计算中,主要用于坪效计算的就是门店的经营面积以及实际门店产生的销售额。这两个指标构成了坪效计算的原子指标。  衍生指标则是对原子指标添加了一个纬度,对原子指标进行限定,使得这些原子指标更具参考价值,在坪效指标计算中,我们可以按照时间原子指标进行限定,从而衍生出新的指标。比如过去一年的某一地区的销售额、过去一年某一门店的销售额、过去一年某地区的经营见面等,这些衍生指标还可以进一步运算,得到复合指标。  复合指标则是多个衍生指标的聚合,用于输出最终的汇总数据,比如某地区过去一年的坪效或某门店过去一年的坪效。到这里坪效指标的规范设计就已经完成了,实体定义与技术指标紧密结合,并且符合标准化的设计规则。在各种技术指标的计算中,DGC还提供一键式的SQL脚本,方便后续流程自动化的开发,帮助开发人员进行快速高效的编程脚本实现。   在信息架构中,我们也可以通过DGC自动汇总的关系图了解到不同维度表、事实表、技术指标、汇总表的关系图谱,这里也方便运维人员快速定位问题,以此进行高效运维。  如何高效的通过脚本和代码实现业务需求并实现一整条业务的流水开发,这对业务不熟悉的开发人员来讲往往是个非常大的难题,但华为云大数据轻量级解决方案提供了一整套高效的开发流程,在需求放完成相关业务定义和指标设定后,开发人员则可以对需求进一步实现,在低代码量的基础上完成业务需求,真正实现编程“轻模式”。这里通过DGC数据开发模块完成脚本开发、作业调度、运维监控等功能实现业务流水,它支持业务流自动化、BI报表生产线、云上仓库建设、日志分析挖掘等工具,实现从数据接入、数据存储、数据分析和计算到业务应用全流程的一站式IDE平台服务。通过数据开发模块,可以帮助用户对入湖后的数据进行快速的加工、清洗,各种聚合运算,数据转换等。在作业开发页面,DGC也为开发人员提供了完整的开发流程介绍。  DGC的脚本开发支持在线的主流数据库脚本开发调试,支持DWS脚本、DLI脚本、Hive脚本等;另外数据开发模块还提供了强大的ETL算子,通过ETL算子可以在数据清洗转换的时候省去开发人员大量的SQL脚本开发,直接通过图形化配置快速实现大量的清洗整合工作;DGC的数据开发模块还整合了主流的数据开发能力和所见即所得图形化ETL工具的能力,最终整合成拖拉拽式的批流结合全链路开发运维,数据管道在运行后可以实施进行监控,方便运维人员快速定位开发中所遇到的问题。  数据开发模块下的脚本开发提供了DWS、DLI、Hive、Spark、Flink、RDS、Shell、Python等多种脚本开发,支持代码补全、语法高亮、错误提示、执行历史记录等功能,可以帮助开发者正确高效的编写。这里我们构建了多个脚本,完成贴源层和明细层数据的清洗,数据汇总,并最终导入到数据库中。  # 轻部署:可视化流水线构建,快速定位问题 华为云大数据轻量化解决方案在业务部署上支持拖拉拽式的流水线业务部署,整个过程开发人员不需要进行专门的环境搭建,只需关注业务是否能完成即可,部署后,开发人员也可对业务运行过程中出现的问题层层分离,快速定位。业务在执行上支持单次调度和周期调度,调度如出现问题还可以进行实时通知。整个过程没有复杂的报警提示,并可生成运维日报,方便运维人员对整体业务有所把控。 这里通过DGC的作业开发实现业务部署,它支持多种云服务任务混合编排,通过一系列节点构成一个有效的工作流。支持图形拖拉拽式的编辑作业页面,快速实现自动化流水部署,并验证作业是否存在问题。   数据开发中的作业监控功能提供短信、邮件等提醒方式,方便开发人员第一时间了解作业运行过程中可能出现的异常状况。   # 轻运维:数据实时监控,封装服务开放 针对各类指标的监控,华为云大数据轻量级解决方案为提供专业的数据质量监控,方便运维人员对数据的动态进行实时的监控,并也可根据实际业务情况设定对应监控指标,帮助企业产出更有价值的数据服务体系。同时企业也可将数据形成的集市层数据封装成服务,对外输出到BI软件或其他应用中,实现数据的最大化利用。对于运维人员来讲,无论是数据质量监控,还是大数据资产管理,抑或是数据服务的开放,这些完全都是在高度可视化的模式下进行,无需复杂代码即可完成数据产品的输出和监控。 这里华为云大数据轻量级解决方案中的DGC数据质量模块可以将业务系统的指标和数据质量进行监控,可以根据业务指标校验规则对数据的完整性、有效性、及时性、一致性、准确性、唯一性这六个维度进行单列、跨列、跨行或者跨表分析,包括存在约束、非空约束、主键唯一性约束、实体唯一性约束、取值范围约束、长度约束、内容规范约束等。通过上述指标校验,我们可以对数据的质量进行评估,如果有些数据存在明显的质量问题,就可以向开发者发送邮件、短信进行告警。同时也可以对数据进行分析和统计,之后将数据推送到客户的相应部门。最终提升数据湖里整体数据的质量。  DGC数据质量模块提供业务指标监控和数据质量监控两种监控方式,我们可以根据之前设计的技术指标对指标进行业务指标监控,我们以之前的坪效指标为例,首先在指标管理中选择需要运算汇总的指标,并以此生成SQL脚本。   然后我们就可以设定具体规则对指标进行监控,比如当全国平均坪效低于20万,就出发年平均坪效较低通知。  在随后的业务场景管理中,我们就可以启动这一指标的业务指标监控。   数据质量监控则可设定规则模版对数据质量进行校验,某人提供了多种数据校验模版方便运维人员快速对数据进行校验。   数据质量监控的质量作业则可设定质量监控的内容,并对关联质量作业进行启停操作。启动后质量作业监控就会生成质量报告,以此帮助运维人员对整体数据进行监控。    为了解各类数据资产的详细情况,华为云大数据轻量化解决方案提供一站式的数据资产归纳,业务资产、技术资产和指标资产三大部分,业务资产包含业务对象、逻辑实体、业务属性三大部分,技术资产则包含数据库、数据表和数据量。  这里通过配置数据元,可以创建数据链接,实现数据集中管理,并提供自定义策略采集任务,以此实现形成资产目录。帮助企业一站式,完成数据报表整理。    在数据目录下,企业可以看到所有的业务资产、技术资产和指标资产,业务资产是逻辑实体,通过逻辑实体我们定义多样化的数据,以此指导形成技术资产和指标资产。  针对不同的技术资产,企业可以看到所有的表结构,同时血缘分析功能方便回溯数据源或作业。   对数据清洗加工并分析生成的集市层数据后,这些数据就可以以服务的形式开放给第三方,华为云大数据轻量化解决方案可以从DWS、DLI、RDS等华为云数据库中获取数据,并通过鉴权等手段向第三方输出数据接口,无需复杂的代码编写,就可以通过Serverless的形式对数据产品进行开放,进而实现零编码的API生成能力,这种零编码的数据开放能力对于企业而言有着更加灵活的数据开放和管理能力,便于企业生成更加丰富的数据产品。 华为云大数据轻量化解决方案中的DGC数据服务支持在线调试、一键发布,通过Web页面编排,可以快速发布基于Serverless的API发布。支持多种数据源对外发布,这项功能基于Nginx和容器化技术,实现单容器50ms内耗时和200次/秒的API逻辑解析和转发速度,另外数据服务还基于WAF行为全方位检测,可准确的进行恶意请求识别,过滤攻击流量。自动化监控和流量预警也方便开发人员快速了解对外输出接口的情况。   开发人员可以对不同的API进行流量控制、使用时长、API名称等信息,方便监控API调用状态。   DGC数据服务还提供App调试,App调试需要调用SDK进行访问,数据服务提供基于Java、C#、Python、Go、JavaScript、PHP、C++、C、Android等多种主流语言的SDK包。一键下载,轻量化开发。  通过实际的体验我们看到,华为云大数据轻量级解决方案的一系列服务,非常直观和高效的帮助企业实现数据清洗、数据加工、数据运算、数据分析等操作,企业重要的是关注业务本身,而不用关注实现的底层技术栈,不需要大量代码编写,也不需要技术人员吃透需求,需求方和开发人员都可以独立高效的完成业务定义和数据产品的开发。 在输出数据产品后,企业可以对这些数据进行可视化输出以便数据治理人员根据这些数据做出决策。 华为云大数据轻量化解决方案还支持多BI平台的可视化图形输出,帮助企业实现更好的数据展示,无论是第三方的BI工具还是华为云自家的DLV数据可视化服务都可以很好的调用接口实现数据的展示分析。  通过这些数据接入,企业可以通过拖拉拽的方式快速构建专属的企业智慧数据大屏幕,形成丰富多样的数据图表,方便进行及时的分析决策。 # 总结 华为云提供的大数据轻量级解决方案,让企业实现了轻资产、轻开发、轻部署、轻运维的大数据治理模式,这样的“轻模式”让广大的中长尾企业也拥有了更加敏捷的大数据治理能力,完备的数据治理流程提供了一站式便利的数据治理体验,企业无需从头再来搭建平台、单独进行人员的开发和架构设计。基于Serverless的平台开发,让企业无需关注业务实现的技术栈,直观精简的开发过程,只需要掌握SQL代码即可快速完成开发。大幅节省了企业的平台建设成本和人才成本。 全流程可视化的界面设计,即便是对没有数据开发经验的非技术人员,也可以友好快速的进行数据规范设计、数据质量监控、数据指标定义等工作。 DGC、CDM、DLI、RDS等服务组成的一整套华为云大数据轻量级解决方案为企业的综合数据治理带来了强大的内生力,大大释放了大数据底层运维管理的压力,让企业能更好的利用数据专注服务质量提升、产品优化等。华为云大数据治理轻量级解决方案未来也将会很好的为中长尾企业赋能,帮助他们实现更高层次的数字化转型。
-
大家好!我是酷哥,数据库相关资讯,带您速览,欢迎大家阅读。 **本期整理如下:** ----------------------------------------------- **本期精选** ------------------------------------------------ - 华为、腾讯、阿里、字节等纷纷布局东数西算 - 解码高瓴的数据库布局:开源、分布式、图数据库、实时数据 - GreenPlum完全兼容欧拉开源操作系统 - 开源数据库MariaDB通过SPAC再**,开启新征程 - 通用数据库管理工具DBeaver 21.3.5 发布 - SQLite 3.38正式发布:改进JSON支持 增强CLI体验 - PostgreSQL 开始支持 Zstd - 最快的SQL计算引擎MatrixOne 0.2.0 发布 - 云迁移将持续深入,今年企业IT支出将超过1.3万亿美元 - 观远数据完成老虎**基金领投的2.8亿元C轮融资 - 时序数据库 Timescale 完成C轮1.1亿融资,数据库领域添独角兽 - 中国自主的数据库评测,是如何开展的? - 中国信通院——开源分布式关系型数据库专刊正式启动 ------------------------------------------------ **资讯全文** ------------------------------------------------ - 华为、腾讯、阿里、字节等纷纷布局东数西算 **摘要:** 财联社《TMT时报》上海报道 作为数字经济的核心基础设施,数据中心正迎来新一轮发展契机。华为、腾讯、阿里、字节等纷纷布局东数西算。 “东数西算”工程于近日正式全面启动,计划在京津冀、长三角、粤港澳大湾区、成渝、贵州、内蒙古、甘肃、宁夏8地布局建设全国一体化算力网络国家枢纽节点,并规划10个国家数据中心集群。国内数据中心产业链上下游企业均有望受益。 **文章详情:** https://tieba.baidu.com/p/7735484697 - 解码高瓴的数据库布局:开源、分布式、图数据库、实时数据 **摘要:** 过去一年是国产数据库诞生以来投融资最为火热的一年。作为基础软件的“三驾马车”之一,这个过往的冷门赛道,在2021年内,出现了几个指标性拐点数字:明星公司PingCap估值高达180亿,超过20家数据库企业获得新融资,而以高瓴、红杉、腾讯为代表的头部基金们出手数据库的次数均超过了3家。 **文章详情:** https://tieba.baidu.com/p/7738189880 - GreenPlum完全兼容欧拉开源操作系统 **摘要:** 近日,Greenplum 社区和欧拉开源社区深化合作,在欧拉开源操作系统(openEuler,简称“欧拉”)编译测试了高级分析数据平台 Greenplum,用实践证明了 Greenplum 与支持多样性计算的欧拉开源操作系统完全兼容,是 Greenplum 深入合作的典型模板,大大丰富了产品应用生态。 基于本次合作内容,Greenplum开源社区与欧拉开源社区联合发布白皮书《开源Greenplum新篇章:兼容欧拉开源操作系统的数据平台,支持国产生态的高级分析数据平台》。 **文章详情:** https://tieba.baidu.com/p/7735489906 - 开源数据库MariaDB通过SPAC再**,开启新征程 **摘要:** 元老级数据库企业MariaDB,借助SPAC,携手Angel Pond实现资本新**。 在数据库创投热中,最新的一个爆炸性消息发生在2022年2月初,开源关系型数据库MariaDB宣布完成1.04亿美元的D轮融资。然而不仅如此, MariaDB同时还宣布打算通过与特殊目的收购企业 Angel Pond Holdings 合并,于2022年下半年在纽约证券交易所公开上市。届时该公司将更名"MariaDB plc",并由现任首席执行官 Michael Howard 继续领导。预计交易完成后,新公司或拥有6.72亿美元估值,获得包括来自Angel Pond以信托方式持有的2.65亿美金以及1800万美元的PIPE投资。 **文章详情:** https://tieba.baidu.com/p/7739194200 - 通用数据库管理工具DBeaver 21.3.5 发布 **摘要:** DBeaver 正式21.3.5 发布。DBeaver 是一个免费开源的通用数据库工具和 SQL 客户端,支持 MySQL, PostgreSQL, Oracle, DB2, MSSQL, Sybase, Mimer, HSQLDB, Derby, 以及其他兼容 JDBC 的数据库。DBeaver 提供一个图形界面用来查看数据库结构、执行SQL查询和脚本,浏览和导出数据,处理BLOB/CLOB 数据,修改数据库结构等等。适用于开发人员和数据库管理员。 **文章详情:** https://tieba.baidu.com/p/7735426577 - SQLite 3.38正式发布:改进JSON支持 增强CLI体验 **摘要:** 作为 2022 年的首个新版,SQLite 3.38 也是 SQLite 的一次盛大更新。SQLite 是一个小型、快速、自包含、高可靠性、全功能的嵌入式 SQL 数据库引擎。早在 2015 年发布的 SQLite 3.9 版本中,开发者就已经为它添加了对 JSON1 模块的支持。现在,随着 2022 年首个重大更新的发布,该模块已在 SQLite 3.38 中被默认包含、而无需启用编译时选项。 **文章详情:** https://tieba.baidu.com/p/7738195534 - PostgreSQL 开始支持 Zstd **摘要:** PostgreSQL 现已通过其 TOAST 存储技术提供压缩支持,并且在过去的一年里构建了 LZ4 压缩支持——用于压缩 WAL、备份压缩以及其他用途,现在 PostgreSQL 开发者正准备通过 Zstd 支持进一步扩展其压缩能力。 Zstd (Zstandard) 是由 Facebook 开源的快速无损压缩算法,主要应用于 zlib 级别的实时压缩场景,并且具有更好的压缩比。Zstd 还可以以压缩速度为代价提供更强的压缩比,速度与压缩权衡可通过小增量进行配置。 **文章详情:** https://tieba.baidu.com/p/7735437424 - 最快的SQL计算引擎MatrixOne 0.2.0 发布 **摘要:** 在数月的打磨和努力开发之下, MatrixOne 0.2版本正式发布啦! 项目文档网站 https://docs.matrixorigin.io/0.2.0/ 相比于0.1版本,0.2版本在以下几方面有着明显改进:性能大幅提升、完整的分布式能力、新Feature、文档更新、 Bug Fixes等。 **文章详情:** https://tieba.baidu.com/p/7739181210 - 云迁移将持续深入,今年企业IT支出将超过1.3万亿美元 **摘要:** 2月21日消息,Gartner预测预测,2025年有效细分市场中的企业在公有云计算领域的IT支出将超过传统IT服务支出。 Gartner云迁移研究包括可以迁移到云的企业IT市场,即应用软件、基础设施软件、业务流程服务和系统基础设施市场。2025年在这四个市场中将有51%的IT支出从传统解决方案转向公有云(2022年为41%)。 Gartner预测,2022年企业IT支出将因云迁移而超过1.3万亿美元,2025年将增长至近1.8万亿美元。分布式云等新技术的出现将扩大云在IT市场引发的持续变革。 **文章详情:** https://tieba.baidu.com/p/7736599583 - 观远数据完成老虎**基金领投的2.8亿元C轮融资 **摘要:** 2月22日,BI服务商观远数据宣布完成新一轮2.8亿元C轮融资。本轮融资由全球知名的老虎**基金(Tiger Global)领投,红杉中国、线性资本、襄禾资本、独秀资本(Unicorn Capital Parnters)等老股东全线跟投。据观远数据创始人&CEO苏春园介绍,此轮融资将主要用于三大方面,智能分析产品矩阵的深化、客户成功体系的升级、重点行业与用户生态的建设。 数字化时代正在加速到来,商业智能将广泛普及,以数据驱动决策将成为企业的常态。IDC预测,2025年,中国商业智能软件市场规模将达到13.3亿美元,未来5年整体市场年复合增长率(CAGR)达到17.9%。 **文章详情:** https://tieba.baidu.com/p/7736623942 - 时序数据库 Timescale 完成C轮1.1亿融资,数据库领域添独角兽 **摘要:** 2022 年 2 月 22 日,Timescale 宣布其在近日完成了 C 轮融资,在 2021 年、2019 年和 2018 年,Timescale 分别完成了 4000 万美元、1500 万美元和 1600 万美元的融资,总融资金额达到 1.8 亿美元。本轮融资由 Tiger Global 领投,现有投资者 Benchmark、New Enterprise Associates、Redpoint Ventures、Icon Ventures 和 Two Sigma Ventures 均参与跟投。目前,Timescale 估值超过 10 亿美元,成为数据库领域的又一独角兽企业。 **文章详情:** https://tieba.baidu.com/p/7738209746 - 中国自主的数据库评测,是如何开展的 **摘要:** 此前,较受认可的评测是由 TPC( Transaction Processing Performance Council,事务处理性能委员会)推出的 TPC-C 评测标准,而 TPC-C 也一度成为每个主流数据库都会尝试一下的评测。但 TPC-C 也有自身的问题,首先,它面向的是 OLTP 数据库,并不能满足所有场景的数据库测试。实际上,TPC 只给出了标准规范,特别场景需要厂商自行处理。另外,TPC 的审核人员人数很少,且全部在**,沟通不便。从开销的角度讲,TPC-C 也较为昂贵,比如 Oracle 从 2010 年开始,就基本退出了 TPC-C 评测。 种种因素,使数据库评测处于一个事实上的空白领域。这也促使国内许多机构开始尝试进行数据库标准评测,信通院作为我国工业和信息化部直属事业单位,有推动我国 ICT 领域健康、快速发展的直接责任,因此从 2015 年开始推出各类数据库评测,在整个行业都产生了较大的影响力。 **文章详情:** https://tieba.baidu.com/p/7736427945 - 中国信通院——开源分布式关系型数据库专刊正式启动 **摘要:** 近年来,开源生态发展势头迅猛,开源在推动技术创新、促进产业协作、加快各行业数字化进程方面发挥的作用日益凸显。过去一年,开源生态进一步发展成熟,并呈现全新态势。开源生态从个人参与到企业参与,从开源技术交流到开源生态协同,逐步形成产业供应关系。自上而**系化构建方式与自下而上竞争式模式相结合,不断推动开源生态发展。 开源已成为企业的主流趋势,也将成为企业的战略方向和商业模式。开源改变了信息产业的格局和商业模式,推动全球信息技术发生了全局性、持续性的重大变革,促进了全球范围内的技术创新成果落地。基于此背景,中国信息通信研究院前期已成功编写并发布了《开源发展态势洞察报告——消息中间件专刊》。 中国信通院第二期《开源发展态势洞察报告》—开源分布式关系型数据库专刊现公开征集参与单位,欢迎社会各界广泛参与! **文章详情:** https://tieba.baidu.com/p/7739152732 [上一期:【技术之声】第九期(20220221)一周精选](https://bbs.huaweicloud.com/forum/thread-180163-1-1.html) *声明:文章源于第三方公开的信息,如内容中涉嫌侵权或存在信息不实时,请及时联系删除。* |整理者:酷哥
-
近日,IDC发布《中国大数据平台市场研究报告,2021 H1》,华为云FusionInsight智能数据湖已连续三次获得大数据平台市场份额第一。基于超过10年服务于政务、金融、运营商、大企业、互联网等行业客户的实践经验,华为云FusionInsight智能数据湖通过不断的技术创新为客户提供业界领先的云原生、湖仓一体解决方案。如今,数据已经与土地、劳动力、资本、技术并称为五种要素,数据不仅是一种产业或应用,更是国家发展的战略性、基础性资源。未来,数据要素市场空间巨大,通过驱动关键大数据技术和开源技术的不断创新发展,培育数据要素市场,打造新型数字产业,到2025年大数据产业规模将达到3万亿。大数据产业快速发展,已成为支撑经济社会发展的优势产业。华为云FusionInsight智能数据湖不断深入客户场景,提供大数据轻咨询专业服务,加速释放各行各业数据要素价值。在政务领域,华为云FusionInsight智能数据湖已为部委、各省市客户,提供领先的大数据云服务产品组合。2021年,华为云携手华傲数据,基于FusionInsight联合打造“三算一景”的政务大数据治理解决方案:华为云提供大数据所需的“算力”,基于各委办局的海量数据资源,即“算料”,通过数据治理的模型不断打磨数据 “算法”, 贯穿包括一网统管、一网通办、一屏尽览等“应用场景”。在“一秒七办”方案中,实现政务数据服务的自动匹配、自动填表、自动证明、自动核对、自动审批、自动评审、自动响应,让业务场景纵向高效畅通;结合大数据、区块链、AI技术,横向扩宽业务范围,实现跨部门、跨层级的互联互通,让“数据多跑路,群众少跑腿”。在金融领域,近年来工商银行、交通银行、杭州银行等银行、保险、证券客户携手华为云FusionInsight智能数据湖共建金融大数据体系。其中在工商银行已建成同业最大的大数据单集群,总规模达4000+节点,支撑行内外200+应用。工行的风险控制、损益预查询等关键业务也逐步接入大数据平台。在交互查询场景,该行通过MRS HetuEngine数据虚拟化引擎,分析提效50倍,提升全行13000名分析师即时BI新体验,并已面向全行推广。在运营商领域,随着移动互联网、IoTDB等技术的迅猛发展,运营商已深入支撑各行各业的大数据应用。广东移动基于华为云FusionInsight智能数据湖,联合政企客户共同打造智慧电网、智慧交通、智慧港口、高清视频等系列标杆应用,实现对内业务支撑、对外应用赋能,建成服务于超过1.3亿移动用户的大数据平台。在互联网领域,华为云在互联网大数据市场同样突飞猛进,在公有云上也建立了专属Region,为客户上云提供便利,使得像梦饷集团、T3出行这样的大型互联网客户纷纷转向华为云。梦饷集团依托MRS云原生数据湖,使用DLI数据湖探索和数据仓库作为基础数据处理层,支持离线、实时、交互式场景,并无缝对接AI引擎,实现智能推荐与搜索,释放数据价值,驱动梦饷集团全场景业务的数字化与智能化升级。在大企业领域,制造、生产、服务型企业越来越重视大数据,不断提升区域统筹能力,提高服务水平。在电力能源、生产制造、交通城轨等领域,越来越多的企业采用云边端的方式协同计算海量数据,支撑业务创新。华为云MRS携手清华大学打造专、快、易、稳、省的IoTDB时序库,覆盖海量高频,且具有时序特点的时序数据分析,一份数据兼容云边端全场景。同时,随着我国提出“双碳”的战略目标,在2021年东华博泰携手华为云FusionInsight,实现以数据为源力核,平台为运力核,应用为创力核,体系为内力核,生态为汇力核,打造“五核聚一”的数字化运营架构,为能源行业提供大数据创新解决方案,共建智慧能源生态圈。越来越多的政务、金融、运营商、互联网、大企业客户,优选华为云FusionInsight智能数据湖构建大数据体系,在数字化转型过程中实现业务的高质量可持续发展。客户需要企业级+安全+高效的大数据平台科技为社会发展提供的源动力,推动了机械化、电气化、自动化和信息化,到如今的智能化。在智能化阶段,数据成为“新石油”,为经济社会发展提供取之不尽用之不竭的“原材料”,这一点是数据要素有别于其他资源的重要特征。越来越多的客户越来越重视数据资产,同时大多数客户在建设大数据平台时要求,不仅要满足当下业务发展需要,还要支撑其未来发展战略目标,进而对大数据底层技术平台提出了更高的要求,需具备如下特点:特点一:企业级,可持续演进各行业的大数据平台已承载了海量数据和关键业务场景,如金融实时风控业务场景,对于业务连续性要求高,需7*24小时不中断;华为云FusionInsight智能数据湖提供单集群6万+节点大规模滚动升级能力,确保关键业务升级“0”中断。特点二:安全可靠,放心使用数据资产安全是大数据平台建设的必备要素。华为云FusionInsight智能数据湖经过超过10年不断打磨,已服务于60多个国家超过3000个客户,深入行业场景化实践,理解客户业务场景化诉求,因为懂行业、懂数据,所以“敬畏”数据。在平台安全方面,FusionInsight围绕数据全生命周期,构筑可信的安全体系,让未经授权的访问者“进不来、看不到、拿不走、赖不掉、用不了、坏不了”以及多平面网络物理隔离,防止数据意外泄露;在数据共享、融合分析等场景,DGC数据湖治理中心除了提供全链路数据治理能力,还提供分层分级的数据安全开放管理,使得客户在不断提高数据要素质量的同时,还能安全地共享数据;在跨地域、跨部门、跨业务的协同安全计算场景中,FusionInsight还提供TICS可信智能计算服务, 提供深度协同优化联邦训练和全同态加密,让跨部门、跨层级数据协同分析“可用不可见”,加速数据要素市场化流通,并获得权威机构包括信通院、金标委的多项认证。时至今日,大数据平台重要性已不言而喻,FusionInsight可以让数据“坏不了”,实现数据备份、跨AZ(可用区)容灾、异地容灾的全场景覆盖,进一步保障业务连续性。特点三:高效易用,不断创新工业革命实现了从“马车”到“火车”的重要改变,资源的挖掘、开采与提炼不断解放了生产力,人们的工作效率得以不断提升。在效率方面,大数据平台建设呈现云原生化趋势,结合容器等虚拟化技术,实现大数据计算所需资源的快速上线,从传统建设耗时数月降至数分钟。在数据供应时效性方面,传统大数据方案批量接入,全量更新,T+1式天级供数,无法满足上层业务的灵活变化;华为云FusionInsight MRS提供自研CDL引擎,配合Hudi+Flink+ClickHouse方案,实时接入,增量更新,PB级数据毫秒级自助分析,结合自研RTD实时决策引擎,实现海量数据从接入到决策的全链路实时数据湖,让数据时效从T+1走向T+0,高效释放海量数据价值。“湖仓一体”+“轻咨询”,打通大数据的“任督二脉”近十年,大数据技术发展迅猛,“湖仓一体”已是数据湖建设的首选架构,其通过统一的数据存储,让数据在湖内流动,减少数据搬迁和冗余,最终实现一份数据支持多工作负载。早在2020年5月,华为云在全球分析师大会上提出“湖仓一体”概念,华为云FusionInsight智能数据湖提供云原生数据湖服务和云数据仓库服务,湖仓既可以灵活按需部署,也可以融合演进到湖仓一体的架构,并基于云原生存储实现存算分离架构,使得数据在底层统一存储,统一元数据,计算与存储资源灵活扩容,采用1.2副本替换传统 3副本方案,让资源利用率提高2倍+。在“全局一份数据”基础之上,FusionInsight提供自研数据虚拟化引擎HetuEngine,其具有自动学习、自动感知、自动优化等智能化特点,上层通过SQL操作大数据,降低技术使用门槛,让海量数据跨域高效、跨源易用,协同分析提效50倍。同时还能让客户在一个架构上实现离线、实时、逻辑三种数据湖和数仓集市,解决传统大数据平台存在的烟囱式建设,湖仓割裂,数据来回搬迁等问题。华为云FusionInsight还为客户提供大数据轻咨询服务,从大数据平台顶层设计规划,到大数据场景化业务构建,甚至包括客户的大数据业务上线运维,提供端到端的专业服务,使能客户,加速客户的数据供给能力。大平台、大市场、大机遇本次华为云FusionInsight智能数据湖在《IDC中国大数据平台市场研究报告,2021H1》获得市场第一,得益于其超过10年持续深入客户业务场景,通过不断地技术创新,为客户提供领先的智能数据湖解决方案。这已是FusionInsight连续三次蝉联中国大数据市场第一,之前分别在IDC《中国大数据平台市场研究,2020》取得2019年市场份额第一,在《IDC MarketScape:中国大数据管理平台厂商评估,2020》报告中获得2020年市场份额第一。独行快、众行远。开放的平台已广泛被政务、金融、运营商、互联网、大企业所使用。华为云FusionInsight智能数据湖坚定开放路线,先后开放CarbonData和openLooKeng,联合世界顶级高校如清华大学持续探索中国软件创新之路,引领全球大数据技术不断发展。华为云FusionInsight将持续联合800+合作伙伴,为客户提供领先的大数据解决方案,在大平台、大市场、大机遇的历史时刻,共同谱写新型数字产业新篇章。更多精彩文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html
-
大家好!我是酷哥,一周精选,带您速览,欢迎大家关注。 **本期整理如下:** ------------------------------------------------**本期精选**------------------------------------------------ - 数据库产业发展综述 - IDC:中国关系型数据库软件市场报告 - 墨天轮2021年度中国数据库魔力象限 - 开源、智能化、隐私安全等八大数据库发展趋势 - 原生分布式数据库与分库分表中间件、云原生数据库有何区别 - Neo4j 针对2022图数据平台发展的十大预测 - 云产融合是方向 人才竞争更关键 - 10个大数据挑战以及应对方法 ------------------------------------------------**资讯全文**------------------------------------------------ - 数据库产业发展综述 **摘要:** 本文节选自中国信通院于2021年6月24日在“2021大数据产业峰会”上发布的《数据库发展研究报告(2021年)》全球数据库产业生态成熟壮大,在发展过程中,逐渐细分出数据库产品、数据库服务和数据库支撑体系三个细分产业。 数据库产品主要由关系型数据库、非关系型数据库、混合型数据库及数据库周边工具构成。数据库服务是指围绕数据库的咨询规划、实施部署和运维运营等环节,为数据库系统的正常、高效、持续、安全使用提供信息技术服务工作。数据库支撑体系由从事数据库学术研究、人才培养、开源社区、评测认证等工作的相关主体共同构成。 据中国信通院测算,2020年全球数据库市场规模为671亿美元,其中中国数据库市场规模为35亿美元(约合240.9亿元人民币),占全球5.2%。预计到2025年,全球数据库市场规模将达到798亿美元。中国的IT总支出将占全球12.3%。我们预计,中国数据库市场在全球的占比将在2025年接近中国IT总支出在全球的占比,中国数据库市场总规模将达到688亿元,市场年复合增长率(CAGR)为23.4%。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178100 - IDC:中国关系型数据库软件市场报告 **摘要:** 1月17日,国际数据公司(IDC)发布的《2021年上半年中国关系型数据库软件市场跟踪报告》显示,2021上半年中国关系型数据库软件市场规模为11.9亿美元,整体市场同比增长37.2%,其中,公有云关系型数据库规模6.7亿美金,同比增长50.1%;本地部署关系型数据库规模5.2亿美金,同比增长23.7%。IDC预测,2021全年中国关系型数据库软件市场规模为27.5亿美元, 到2025年将达到76.7亿美元,未来5年市场年复合增长率(CAGR)为30.4%。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177976 - 墨天轮2021年度中国数据库魔力象限 **摘要:** 墨天轮2019年6月即推出了中国数据库流行度排行,排行榜中的数量也从50增加到194个,见证着中国数据库近三年的蓬勃发展。 墨天轮参考 Gartner 的魔力象限模型,结合墨天轮数据库流行度排行表现,综合得出了2021年度中国数据库魔力象限(魔力象限、领导者象限、挑战者象限、远见者象限)。 **文章详情:** https://bbs.huaweicloud.com/forum/thread-178379-1-1.html - 开源、智能化、隐私安全等八大数据库发展趋势 **摘要:** 新年换旧年之际,便到了盘点时间。随着数字经济不断发展,数据库的重要性愈发凸显。数据库技术有怎样的发展新趋势? ITPUB&IT168结合一些大会上嘉宾的演讲、采访,以及对市场的观察和理解,梳理出数据库技术八大趋势:开源、智能化、隐私安全、软硬一体、上云、分布式、细分场景、架构融合。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178306 - 原生分布式数据库与分库分表中间件、云原生数据库有何区别 **摘要:** 如今,我们正处于数据库从互联网基础软件转变为社会数字化基础软件的时代,在传统集中式数据库已不能满足大规模数据承载需求与高并发处理需求的形势下,基于海量数据场景应用而生的分布式数据库迎来应用热潮。据IDC调研,目前约26.8%的企业级市场用户部署了分布式数据库,超过90%的企业认可分布式数据库部署后的效果。 在分布式数据库中,主要有三类解决方案,一类是以中间件+单机数据库为主的分布式数据库,下层的单机数据库提供存储和执行能力,在多个单机数据库上封装一层中间层,以统一分片规则管理及处理分布在不同数据库节点的数据,并提供SQL解析,请求转发和结果合并的能力;第二类是原生分布式数据库,在架构设计之初,便根据分布式一致性协议做底层设计,因此,数据的存储、查询、处理都天然具备分布式特性,各数据节点提供对等的读写服务,组成统一的集群对外提供服务;第三类是通过构建分布式共享存储实现扩展,采用非对称计算节点,大部分公有云数据库都属于此类。在本文中,我们重点说说前两类。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178099 - Neo4j 针对2022图数据平台发展的十大预测 **摘要:** 数字化经济方兴未艾的浪潮中,中国各类企业乃至政府都面临着数字化转型的挑战。而随着疫情的逐步稳定,是否能成功实现数字化转型成为重要的核心竞争力。作为转型的要素之一,数据日益复杂,且随着世界的连接而愈加密切地相互关联。 以大数据、云计算、人工智能为代表的新一代数字技术日新月异,其中图技术就是数据库产业中增长最快且最具发展前景的领域。根据 Gartner®预测,“到2025年,使用图技术进行数据和分析创新的比例将由2021年的10%提升至80%。”各种类型的数据关联越来越普遍和重要,不同规模价值企业对图技术认知也不断提升。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177859 - 云产融合是方向 人才竞争更关键 **摘要:** 受疫情影响,全球大多数企业线下活动受到明显冲击,线上服务的需求激增,从而带动了云计算服务市场。赛迪数据显示,2020年,全球云计算市场销售额为2957.6亿美元,增速为9.8%,2021年更是有增无减。在政策推动和市场需求的刺激下,分析者普遍认为,未来几年,云计算市场的强劲发展势头有望保持下去。另外,云计算后半程的竞争,云产融合是发展方向,人才竞争才是关键。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177920 - 10个大数据挑战以及应对方法 **摘要:** 执行良好的大数据战略可以简化运营成本、缩短上市时间并支持新产品。但是,在将董事会讨论的大数据举措付诸实践的过程中,企业面临着各种大数据挑战。 IT和数据专业人员需要构建物理基础架构,以便在不同来源和多个应用程序之间移动数据。他们还需要满足性能、可扩展性、及时性、安全性和数据治理的要求。此外,企业必须预先考虑部署成本,因为它们可能会迅速失控。 ERP软件提供商VAI的商业智能经理Bill Szybillo说:“大数据项目面临的最大挑战之一是,如何成功应用所获得的见解。”他解释说,很多应用程序和系统都在捕获数据,但企业往往难以理解什么是有价值的数据,而且无法应用这些见解。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178206 上一期:[【技术之声】第五期(20220117)一周精选](https://bbs.huaweicloud.com/forum/thread-177954-1-1.html) ------------ *声明:文章源于第三方公开的信息,如内容中涉嫌侵权或存在信息不实时,请及时联系删除。* 整理者:酷哥
-
互联网法院和智慧法院是两个概念,互联网法院是一种特殊的法院类型,咱们国家有三个互联网法院,分别在北京、广州和杭州。智慧法院则是国家在进行司法系统建设方面的一个目标,而几家互联网法院都是这方面很具有示范性的建设主体。 信息化和智能化既存在本质差异也具有紧密的联系,这种联系在司法应用的语境中主要表现为:司法信息化孕育了司法智能化,司法信息化需要进化为司法智能化。 从发展阶段讲,司法智能化是司法信息化发展到一定成熟阶段的产物,智能化建设不能脱离或跨越信息化出现;从发展逻辑讲,司法智能化是建立在信息化基础设施之上的应用延伸,如果没有前期信息化的丰富积淀,智能化就无从谈起。 司法信息化向司法智能化进化源自于深度挖掘司法大数据内在价值的客观需求,源自于努力实现“让人民群众在每一个司法案件中都感受到公平正义”的司法目的,源自于全面推进审判体系和审判能力现代化改革目标的共同驱动。 人工智能研究具有高度的不确定性,需要产学研用各方面的密切合作,而信息化本身具有相对的确定性特征,主要依赖于应用需求方和工程建设方的紧密协同,这两者的建设逻辑存在本质差别。 在当前的理论研究和应用建设中,有部分观点简单地认为智能化是信息化的另一个“时髦”说法,或片面地认为按照传统的信息化建设思路再融入一些所谓智能模块,智能化就能自然实现。这些认识误区对于全面深化智慧司法建设有害无利。从 2018 年开始我们去做司法相关的研究,一个很重要的切入点就是“司法公开”。司法公开是推进司法公正、保证司法廉洁、提升司法水平的重要手段。 我国的人民法院系统近年来坚持以公开为原则、不公开为例外,开通审判流程、庭审活动、裁判文书、执行信息四大公开平台,应当说提供了全球范围内规模最大的司法公开数据资源。但是拥有数据和利用好数据是两个不同的概念,如何让社会更好的利用这个数据资源实现司法公平正义的目标,如何让人民群众更加理解和信赖我们的司法系统,这个是我们项目的宏观目标。 具体来讲,项目设置了司法公开敏感信息保护、司法公开信息有效利用、司法公开效益评估 三个方面六个课题,最终希望我们的司法公开系统拥有风险监测与控制能力、复杂上下文感知能力、社会媒体大数据理解能力。 项目团队包括了清华大学、国防科技大学、北京理工大学、中国政法大学等学术研究单位,目前项目正在包括北京市、河北省等地的多家法院进行应用示范,现在反馈的应用效果还是非常不错的。智能司法公开面临的三方面技术挑战是:缺结构、缺知识、缺反馈。具体而言,缺结构是指缺乏对数据内部结构和外部关系的理解,缺少高质量结构化数据标记;缺知识指的是司法公开系统缺乏对于司法本体、司法理论体系、司法政策理念、司法实务经验的认识;缺反馈是指缺乏准确的性能评价方法,难以形成改进的闭环。审判流程、庭审活动、裁判文书、执行信息四大公开平台的建立,已经完成了司法信息获取的第一个重要任务,即司法活动本身的信息化,接下来我们还有两个重要的任务要完成: 首先是确定什么信息可以被公开,什么不适宜公开。周强院长曾经明确指出,司法公开以公开为原则、不公开为例外,但是一旦不该公开的公开了,可能会对整个司法公开的运行形成极大的影响。如何在保证人民群众知情权的同时避免敏感信息的泄露,这种风险感知的能力是司法公开应用中一个非常关键的任务,也是我们在开始做这个司法公开的项目时关注比较少的。 其次是如何把确定可以公开的信息公开好,在信息爆炸的时代,我们的注意力是稀缺资源,太多的数据等于没有数据。如何理解高度异质化的用户在特定上下文背景下的信息需求,是司法信息获取中的另一个重要任务。这个任务其实一点也不简单,并不是现成的用户理解方法在司法场景的简单应用,而是要对司法本身的知识体系做深层次的理解和挖掘。我自己办公桌上除了计算机专业书籍之外,也有法学专业的理论和实务书籍,类案检索的算法设计有琢磨不清楚的时候,看看这些书,尝试从司法从业人员的角度思考一下问题,往往能得到新的研究思路。司法是维护社会公平正义的最后一道防线。人工智能在司法场景的应用需要同时兼顾效率价值和公正价值。 人工智能应用于司法,首要的元素是尊重法官的主体地位,其次是通过大数据、人工智能技术等的应用,推进审判体系和审判能力现代化,更好的服务于法官和整个司法系统,创造更高水平的数字正义。同时,在应用技术成果的过程中,也要注意避免算法本身引入新的不公平因素,这样才能更好的实现“努力让人民群众在每一个司法案件中感受到公平正义”的目标。
-
新年换旧年之际,便到了盘点时间。随着数字经济不断发展,数据库的重要性愈发凸显。数据库技术有怎样的发展新趋势?ITPUB&IT168结合一些大会上嘉宾的演讲、采访,以及对市场的观察和理解,梳理出数据库技术八大趋势:开源、智能化、隐私安全、软硬一体、上云、分布式、细分场景、架构融合。01、开源:开源上升为国策联合创新发力生态在《开源的诱惑——数据库篇》中,我写道:开源如一个意气风发的少年,在数据库领域大展拳脚。2021年初,根据DB-Engines的数据,开源数据库license数量首次超过商业数据库,这是开源数据库的里程碑,近两年开源数据库厂商融资屡创新高,不断刷新数据库单笔最高融资纪录。Gartner预计,到2025年,与目前的IT支出相比,超过70%的企业将增加开源软件方面的IT支出。开源社区被誉为当今科技领域最具创新的一种组织方式,专家强调数据库作为公认最为复杂跨技术领域最多的基础软件,也要充分利用开源和发展开源,广泛吸纳全产业力量。尤其国内,一系列政策利好开源发展,开源纳入“十四五”规划,成为国家战略,去年11月底,工信部印发《“十四五”信息化和工业化深度融合发展规划》指出,开源软件已经成为软件产业创新源泉和“标准件库”。同时,开源开辟了产业竞争新赛道,基于全球开发者众研众用众创的开源生态正加速形成。近年来,越来越多主流数据库产品选择开源来完善生态,打磨产品。比如,openGauss、PolarDB、OceanBase、浪潮云溪等选择开源……业内人士指出开源发展的需要在开放源码与商业发展之间找到平衡,而当前目国内开源生态还面临发展基础较弱、底层技术掌控不足、开源文化氛围不浓、政策支持有待加强等制约因素。02、智能化:AI与数据库结合智能化发展北航计算机学院童咏昕教授在openGauss Summit2021峰会上指出,从学术研究角度,AI与数据库结合的智能化成为最近几年数据库顶级会议里非常热门的研究主题之一。智能化分为两个方面,AI for DB,运用AI技术优化经典数据库算法。DB for AI,运用数据库技术提升人工智能性能。AI for DB方面,童咏昕介绍,传统的经典数据库优化算法称为理性主义,是问题导向,针对问题直接设计算法策略,不需要依赖数据库可以直接求解,在 最坏情况下算法性能具有理论保证。最近几年尤其是2018年之后学习型算法开始流行,可以称之为经验主义,数据导向。通过学习数据分布指导模型设计,在数据服从给定分布时能够取得更优效果,可以使数据库优化算法更快,但并不是有了学习算法就无敌了,更重要的是如何把经典的理性主义和数据驱动经验主义做有机融合,这是未来非常火的方向。DB for AI方面,近两年数据库顶级学术研究尤其在产业研究中多篇论文都共识了一个问题,机器学习的实战性能问题,很大一部分原因是来自数据库问题,数据库经典技术优化不好导致机器学习性能不好。数据库如何协助机器学习的技术也是最近几年非常热门的研究主题。03、隐私安全:法律法规监管加强以技术解决合规问题在数据库研究领域,隐私安全是数据库长期关注的主题。童咏昕指出,隐私和安全是两件事,安全关心计算过程的安全,隐私所强调的是拿出结果不能反推回原始数据。上世纪80年代已经开始提出了安全计算,而隐私计算从最简单的脱敏,到匿名化隐私,再到现在相关法律法规下如何合规处理数据,带来了挑战。2021年数据库顶级会议提出把数据库隐私研究和法律合规嫁接在一起。目前有很多合规要求,在不同隐私和安全约束下,如何自动用基础算子高效集成是最近几年在数据库研究中隐私安全的热点。此外,多实体间如何进行安全高效的数据共享也是数据库技术热点。传统大数据计算是计算不动数据动的架构,在传统架构下需要数据离开本地,但是法律法规要求数据不能离开本地,需要数据不动计算动。数据不动计算动的联邦计算框架区别于传统集中式共享,保护各方数据隐私安全。海量移动设备的端侧拥有大量隐私数据,通过联邦学习,保证个人敏感数据不离开端侧设备本地。最近几年可信执行环境(TEE)是非常火热的话题,比如,软硬结合的高效密态数据库系统,基于TEE的有限内存约束,设计高效的密态数据库框架。利用TEE提升设备的安全计算性能,构建面向海量设备的数据联邦等。如何真正执行安全多方计算,如何高效执行同态加密,这些都是未来数据库发展中安全可信技术的基石,软硬协同也非常重要。04、软硬一体:新硬件带来的机遇和挑战软硬一体化是当下数据库研究热点之一,主要因为新硬件技术为数据库领域带来机遇与挑战。有专家曾经指出,数据库首先是一个系统,而系统就需要能够安全高效地使用有限的硬件资源。所以数据库系统的设计和发展和硬件的发展紧密相关,数据库系统设计需要考虑新硬件所带来的变化。童咏昕在演讲中指出,在存储、网络、计算层面,新硬件都发挥着软硬结合的威力。比如在计算层面,新硬件如何优化数据库中的智能计算,如何支撑数据的隐私安全需求成为热点研究主题。面向数据处理的专用硬件不断产生,近年来除了CPU、GPU外,TPU、NPU等各式各样面向人工智能专用型芯片在不断产生,可以利用专用芯片优化数据库中的智能计算,而CPU与GPU合理协同也是当下研究热点,CPU与GPU混合的数据库查询处理,结合不同计算内核特点进行协同异构计算。05、上云:云原生到DBaaS上云是大势所趋,Gartner预计,到2022年,所有数据库中的75%将被部署或迁移到云平台,只有5%被考虑遣返到本地环境。到2023年,云数据库收入将占数据库市场收入总额的50%。根据日前IDC发布的《2021年上半年中国关系型数据库软件市场跟踪报告》显示,2021上半年中国关系型数据库软件市场公有云关系型数据库规模6.7亿美金,同比增长50.1%。IDC发现,云数据库厂商寻求在私有云、行业客户等传统数据库市场发展,本地部署数据库市场竞争加剧。由于利用了云资源的优势,云数据库具备弹性好、计费模式便捷、套件生态好等特点。不过上云并一定能够节省成本,中小企业成本会降低,大型企业可能会不降反升。在云时代,数据库的演化经历了从采购License自建到云上托管数据库,再到云原生数据库的转变。在OLAP场景下,Snowflake为云原生数据库的发展做出了很好的表率。云原生最大的特点是计算存储分离,有业内专家指出,计算存储分离还不够,未来计算、存储、网络、内存等都要分离解耦,随着未来企业逐步上云,底层基础设施云化,数据库不用关注底层的硬件CPU、磁盘、网络等,而是直接面向各类云服务,资源池化、容器化,真正实现多租户应用架构,订阅收费。如此才能更好发挥云的弹性、扩展、高可用等能力。云时代一切皆向服务化发展,DBaaS(数据库即服务)的时代将要到来。06、分布式:从预演到大规模落地随着摩尔定律的失效,当数据量达到一定量级时,单体集中式架构的瓶颈愈发明显,采用分布式数据库往往是必经之路。总体来看,由于国内企业组织有更大的规模和数据量,对于应用分布式数据库更为迫切。国产数据库寄希望于通过分布式数据库实现变道超车,近几年国产数据库不断成长,在一些难点如分布式事务性、一致性,以及数据容错、灾备等高可用能力方面取得了突破,分布式数据库进入到落地阶段。这一变化可以在DTCC大会上有直观的感受,一位专家在参加完DTCC2021大会后指出,几年前分布式、一致性与CAP/BASE等话题等相关技术细节话题是DTCC大会热点,近两年在DTCC已经没有嘉宾专门演讲相关主题,说明分布式与分布式事务、一致性等这些东西在技术界已经达成共识,在这几年也已经纷纷落地为产品。在政策层面分布式数据库迎来利好,2021年11月底,工信部印发的《“十四五”信息化和工业化深度融合发展规划》明确,加速分布式数据库等产品研发和应用推广。近几年分布式数据库投产金融核心系统的消息不断出现,经过前期大量的预演和准备工作,2022年分布式数据库在国内的落地值得期待。07、细分场景:图数据库、时序数据库细分场景应用成为数据库的一大趋势。图数据库以及时序数据库的发展是细分场景应用的代表,根据DB-Engines,从2013年图数据库流行度趋势一骑绝尘,DB-Engines 从 2014 年起也把时序数据库作为独立的目录进行分类统计,如上图,其流行度发展势头仅次于当红炸子鸡图数据库。2019年开始,DTCC大会设置了图数据库专场,在DTCC2021数据库技术大会,图数据库专场比较火爆受到广泛关注,时序数据库相关的演讲主题也多了起来,通过梳理发现,2021年不少时序数据库创业公司获得了融资。图数据库是一个使用图结构进行语义查询的数据库。图是天生为相关性而生,典型的应用场景如欺诈检测,通过将问题解构为图,更容易在现有数据中获得重要的见解。有国外图数据库专家指出,图数据库方面中外基本处在同一起跑线,甚至在新软硬件协同方面走在前面。有专家指出,目前,图数据库还存在许多挑战需要解决,比如数据的完备性、一致性,对分布式事务的支持以及与OLAP 和 OLTP 融合等。当前,万亿大图、大规模处理以及与新硬件的融合是图数据库的热点话题。时序数据库全称为时间序列数据库,时序数据库指主要用于处理带时间标签(按照时间的顺序变化,即时间序列化)的数据,随着5G商用启动,IoT不断发展,进入到万物互联时代,时序数据作为大数据、机器学习、实时预测、预警的基础数据的作用更加显著,堪称万物互联时代的基石,时序数据库将迎来重大发展机遇。08、架构融合:HTAP、湖仓一体、多模、集中式与分布式一体化架构融合的趋势之一是HTAP混合负载场景的发展,产业界当前正基于创新的计算存储框架研发HTAP数据库,其能够基于同一套引擎同时支撑业务系统运行和分析决策场景,避免在传统架构中,在线与离线数据库之间大量的数据交互。在数据驱动决策的大势所趋下,HTAP在实时数据分析处理方面的优势愈发明显。湖仓一体(Lakehouse)也是目前架构融合的一大趋势,Snowflake、Databricks是其中的代表。湖仓一体解决了传统数据库仓库在数据类型支持上的局限性,可以支持结构化、非结构化、半结构化多种数据类型。湖仓一体(Lakehouse)需要打通数据仓库和数据湖两套体系,让数据和计算在湖和仓之间自由流动。架构融合的另一大趋势是多模(Multi-Model),Gartner 曾在 2017 年预测多模数据管理将成为未来的主要趋势,多模架构逐渐成为主流数据库的选择。2010 年以来,随着移动化的发展以及数字化转型的逐步深化,快速变化的业务场景越来越复杂多元,半结构化、非结构化数据海量增长,单模型数据库虽然优化了数据存储和处理,却难以满足日趋增长的多样化业务场景需求。复杂多元的业务场景往往需要使用多种数据模型,以及数据模型间的融合。从单一数据管理系统到融合型、多模型数据管理系统成为数据库发展趋势。集中式与分布式一体化融合,OceanBase提出的第三代企业级分布式数据库所拥有的一体化架构特性,集中式与分布式一体化融合是一个比较新的概念,数据库系统同时具备分布式与集中式系统的技术优势,即使使用一台机器不用分布式时性能、功能不损失,而且能够随时进行分布式扩展。业务初期一台机器就可以先用起来,随着业务增长系统能力遇到瓶颈再做扩展。回看数据库发展趋势,我们可以看到天下大势分久必合合久必分,业务场景复杂多元化需求催生了图数据库、时序数据库等满足细分场景的数据库发展,而多个单模数据库所带来的管理复杂度等因素又促进多模融合架构发展。世上没有完美的数据库,也从来没有一款数据库可以包打天下,只有适合自己业务的数据库。面对百花齐放的数据库,如何进行数据库选型?ITPUB&IT168将在2022年推出数据库选型相关选题,敬请关注。文章来源:http://blog.itpub.net/69925873/viewspace-2853329/
-
>摘要:华为MRS云原生数据湖平台的HetuEngine就是一款解决大数据时代跨源跨域问题的数据虚拟化引擎。本文分享自华为云社区[《基于华为云原生数据湖MRS HetuEgine的数据虚拟化实践》](https://bbs.huaweicloud.com/blogs/307420),作者: 前锋 。 数据虚拟化是指一种数据管理方式,允许应用在不关心数据源的数据格式及物理存储位置的情况下以一种统一的方式获取和使用整个组织中所有的数据。与数据虚拟化方式对应的一种方式是传统的ETL方式,数据经过抽取、转换和装载的过程,将不同系统的数据收集到一个统一的物理系统中,并经过标准化处理进行格式的统一。数据虚拟化的特点是不改变数据存储位置,实时访问。根据Gartner发布的数据管理技术成熟度曲线,数据虚拟化技术已经进入了生产成熟期,相关理论和技术也已经成熟,如果企业正在受困于各系统或者各部门数据无法高效打通的问题,可以考虑采用数据虚拟化技术。 早期的一种数据虚拟化实践是数据库联邦,在不同的数据库之间建立JDBC/ODBC连接的方式,以标准SQL的方式跨数据库进行数据实时访问。这种方式在传统数据库模式下一定程度上解决了跨数据源实时数据访问的问题。但是在大数据时代,数据的存储和访问方式已经完全不同,每种数据处理组件只解决一个特定的场景问题,具有不同的数据存储方式、组织方式和访问方式。如Hdoop用于解决大规模数据的批量计算,Hbase用于海量数据的实时精确检索,ElasticSearch用于海量数据的综合检索,还有MPP数据库、图数据库、内存数据库、时序数据库等等,百花齐放,百家争鸣,共同形成了大数据时代的数据处理技术栈,解决各个场景下的大规模数据处理问题。在实际的应用中,为了满足业务不同维度的需求,往往在同一个业务中同时使用了不同的处理组件,甚至是分布在不同地域的不同数据处理组件,造成了业务复杂度高,数据冗余,访问效率低等问题。 大数据时代的数据虚拟化技术就是要解决这种跨源跨域场景下的数据高效访问问题,以一种统一的接口,接近原生系统的性能,跨地域的方式进行数据访问。而要满足上述要求,一个数据虚拟化产品需要具备下面的四个功能: - 统一元数据管理。具备全局数据的统一视图,包括数据承载的组件、数据的Schema、数据存储的格式、存储位置等。 - 抽象数据访问层。提供数据访问的抽象层,屏蔽不同数据源的接口差异,在访问层以一种统一的接口面向应用层。 - 统一的安全管控。全局统一安全管控策略,所有数据的访问在安全管控的框架下进行,避免数据越权访问。 - 多源结果集合并。来自不同集群,不同组件的结果数据可以关联、合并,以一个完整的结果集返回给应用层。 华为MRS云原生数据湖平台的HetuEngine就是一款解决大数据时代跨源跨域问题的数据虚拟化引擎。如下图是MRS云原生数据湖平台基于HetuEngine构建的逻辑数据湖平台架构。HetuEngine可以跨Hadoop平台、MPP数据库、数据集市(包括Hbase、ElasticSearch、Clickhouse等)进行跨源访问,并提供统一的SQL接口供上层应用进行数据访问。HetuEngine还支持跨集群数据访问,实现高性能的跨数据湖、数据仓库、数据集市的分析查询。适用多个数据湖或者数据平台联合分析,支持用户间资源隔离,支持全局数据权限管理。  现在,HetuEngine已经帮助众多政企客户解决了在大数据场景下面临的用数难,取数难的问题。某大型国企就利用了HetuEngine的跨域分析能力解决了困扰其很长时间的全域数据实时访问的问题。 该大型国企有众多下属省公司,分布在全国各地,每个省公司都建设有自己的数据湖平台,用于支撑省公司内部的数字业务。各省公司每天要将自己的数据上报给集团公司,集团公司再对全国数据进行统一汇总加工处理,用于支撑集团层面的业务决策。这种方式面临以下几个问题:(1)数据上报不完整。由于带宽限制,只能上报部分结果数据,无法将全部的明细数据上报,部分需要明细数据的业务无法在集团层面开展。(2)数据上报延迟。子公司将数据加工后,分批上报集团公司,数据延迟在小时级别,无法支撑集团实时业务的开展。(3)资源投入太大。随着业务的发展,集团需要的数据越来越多,资源池原来越大,投入和产出无法匹配。(4)数据需求响应不及时。新的数据需求只能通过对分公司提数据需求,重新开发数据流程上报的方式满足,效率太低,无法支撑业务的时效性需求。  如上图所示,在旧模式下,所有的数据只能通过定时上报的方式收集到集团集中化大数据平台,再进行分析,供上层业务使用。引入HetuEngine后,上报的数据只是每天固定模型加工的数据,明细数据和临时汇总数据均可以通过HetuEngine进行实时的查询。通过HetuEngine不仅实现了高效的实时数据查询,还可以通过HetuEngine进行跨省公司的数据关联分析,打破了省公司之间的数据墙,大大提高了跨域数据分析的效率。 HetuEgine通过自己的跨域查询引擎,可以将一个复杂的跨域查询任务根据数据所在的位置将查询下发到数据所在的集群执行,充分利用边缘集群的算力,提高数据分析的效率和整体的资源利用率。如下图的一个场景,要统计年龄为35岁,在两个省同时开户的用户。可以通过一个SQL同时查询两个省公司的数据。HetuEngine将这个SQL下推到两个省公司集群执行,并将执行结果返回给集团公司进行统一汇总,直接向业务层返回最终的汇总结果。整个过程都是自动实时的进行,并且充分利用了边缘集群的算力,集团公司只需要消耗少量的带宽和算力就完成了整个计算过程。  HetuEngine在跨域场景下也充分考虑了整个计算过程的可靠性和安全性。数据访问遵循统一的安全管控模型,对远程数据访问进行细粒度的管控。数据传输过程采用加密传输,保障数据传输过程中的安全。考虑到跨地域的查询通常是传输带宽受限的场景,HetuEngine支持流量管控,防止由于查询结果集过大导致占满传输带宽,影响其他业务。此外,HetuEngine还综合采用了抗网络抖动、断点续传、压缩传输、级联查询等手段提高跨域查询的稳定性和效率。 最终,借助HetuEngine提供的数据虚拟化能力,该集团公司打造了一套高效的全域数据统一查询分析平台。首先,实现了全域数据在集团层面真正的统一,利用HetuEngine可随时访问集团所有省公司的数据。其次,减少了集团公司集群的压力,将大量的数据分析任务下发给省公司集群完成,充分利用省公司边缘集群的算力。然后,提高端到端的数据访问时延,数据由之前的小时级的延迟到现在可以秒级查询省公司集群数据。最后,借助HetuEgine跨源跨域查询能力,可以直接将分布在不同省不同存储组件中的数据在HetuEngine中进行关联分析,打破了数据之间的隔离,带来了很多新的数据应用场景,进一步挖掘了数据的价值。
-
执行良好的大数据战略可以简化运营成本、缩短上市时间并支持新产品。但是,在将董事会讨论的大数据举措付诸实践的过程中,企业面临着各种大数据挑战。IT和数据专业人员需要构建物理基础架构,以便在不同来源和多个应用程序之间移动数据。他们还需要满足性能、可扩展性、及时性、安全性和数据治理的要求。此外,企业必须预先考虑部署成本,因为它们可能会迅速失控。也许最重要的是,企业首先需要弄清楚大数据如何以及为什么对他们的业务很重要。ERP软件提供商VAI的商业智能经理Bill Szybillo说:“大数据项目面临的最大挑战之一是,如何成功应用所获得的见解。”他解释说,很多应用程序和系统都在捕获数据,但企业往往难以理解什么是有价值的数据,而且无法应用这些见解-以一种有影响力的方式。从更广泛的角度来看,下面的建议可帮助企业了解这10个大数据挑战以及如何解决这些挑战。1. 管理大量数据就其定义而言,大数据通常涉及存储在不同系统和平台中的大量数据。Szybillo表示,企业面临的第一个挑战是将他们从CRM和ERP系统以及其他数据源中提取的超大型数据集整合到统一且可管理的大数据架构中。他说,当你对正在收集的数据有所了解,通过进行小的调整就可以更容易地缩小见解。要实现这一点,请构建允许增量更改的基础架构。尝试做较大改变可能最终会产生新的问题。2.发现和修复数据质量问题当数据质量问题蔓延到大数据系统时,基于大数据构建的分析算法和人工智能应用程序可能会产生糟糕的结果。随着数据管理和分析团队试图引入更多不同类型的数据,这些问题可能会变得更加严重和难以审计。Bundler是一个在线市场,用于寻找帮助人们购买产品和安排发货的网络购物助手,当它扩展到500,000名客户时,就经历了这样的问题。该公司的关键增长动力是利用大数据提供高度个性化的体验、识别追加销售机会,并监控新趋势。有效的数据质量管理是关键问题。Bundler首席执行官Pavel Kovalenko说:“你需要不断监控和修复任何数据质量问题。”他说,重复条目和拼写错误很常见,尤其是当数据来自不同来源时。为了确保他们所收集数据的质量,Kovalenko的团队创建了一个智能数据识别器,该识别器将重复数据与较小的数据差异进行匹配,并报告任何可能的拼写错误。对于通过分析数据生成的业务见解,这可帮组提高准确性。3. 应对数据集成和准备复杂性开源分析平台供应商Knime首席数据科学家Rosaria Silipo称,大数据平台解决了收集和存储大量不同类型数据的问题,并可快速检索分析使用所需的数据。但数据收集过程仍然非常具有挑战性。企业收集的数据存储的完整性取决于它们的不断更新。这需要保持对各种数据源的访问,并拥有专门的大数据集成策略。有些企业使用数据湖作为包罗万象的存储库,以存储不同来源收集的大数据集,而没有考虑如何集成不同的数据。例如,各种业务领域会产生对联合分析很重要的数据,但这些数据通常带有不同的底层语义,企业必须消除歧义。Silipo告诫不要对项目进行临时集成,这可能涉及大量返工。为了获得大数据项目的最佳投资回报率,通常最好制定战略方法以支持数据集成。4. 高效且经济地扩展大数据系统如果企业没有关于如何使用大数据的策略,他们可能会浪费大量资金来存储大数据。技术和服务提供商ZL Tech的企业解决方案负责人George Kobakhidze表示,企业需要了解大数据分析始于数据摄取阶段。管理企业数据存储库还需要一致的保留策略,以循环淘汰旧信息,尤其是现在,因为COVID-19疫情前的数据在当今市场上通常不再准确。云管理平台供应商CloudCheckr的产品副总裁Travis Rehl说,因此,数据管理团队应该在部署大数据系统之前,规划好数据的类型、模式和用途。但这说起来容易做起来难。他表示:“通常,你从一个数据模型开始并进行扩展,但很快意识到该模型不适合你的新数据点,并且你突然需要解决技术债务。”具有适当数据结构的通用数据湖可以更轻松地有效且经济地重用数据。例如,Parquet文件通常比数据湖中的CSV转储提供更好的性能成本比。5. 评估和选择大数据技术数据管理团队有多种大数据技术可供选择,而且各种工具的功能往往重叠。NoSQL数据库公司Aerospike的首席战略官Lenley Hensarling建议团队首先考虑来自流和批处理源的数据的当前和未来需求,例如大型机、云应用程序和第三方数据服务。例如,需要考虑的企业级流媒体平台包括Apache Kafka、Apache Pulsar、AWS Kinesis和Google Pub/Sub,所有这些平台都提供云计算、本地和混合云系统之间的无缝数据移动。接下来,团队应该开始评估复杂数据准备能力,为人工智能、机器学习和其他高级分析系统提供数据。规划数据的处理位置也很重要。对于存在延迟问题的情况,团队需要考虑如何在边缘服务器上运行分析和AI模型,以及如何轻松更新模型。企业需要平衡这些功能与部署和管理在本地、云端或边缘运行的设备和应用程序的成本。6. 生成业务见解数据团队倾向于关注大数据技术,而不是结果。在很多情况下,Silipo发现人们很少关注如何处理数据。从企业中的大数据应用程序中生成有价值的业务见解需要考虑各种场景,例如创建基于KPI的报告、识别有用的预测或提出不同类型的建议。这将需要具有机器学习专业知识的业务分析专业人士、统计学家和数据科学家的共同努力。她说,这些团队与大数据工程团队合作可以帮助提高构建大数据环境的投资回报率。7. 雇佣和留住具有大数据技能的员工软件开发和IT外包公司SenecaGlobal战略高级副总裁Mike O’Malley表示:“大数据软件开发面临的最大挑战之一是寻找和留住具有大数据技能的员工。”这种特殊的大数据趋势不太可能很快消失。S&P Global的一份报告发现,云架构师和数据科学家是2021年需求最大的职位之一。填补这些职位的策略是与已经建立人才库的软件开发服务公司合作。提供免费IT培训的慈善机构ComIT的创始人兼所有者Pablo Listingart说,另一个策略是与HR合作,找出并解决现有大数据人才的任何缺口。他表示:“很多大数据计划之所以失败,是因为从项目开始到结束的错误预期和错误估计。”合适的团队将能够估计风险、评估严重性并解决各种大数据挑战。建立吸引和留住合适人才的文化也很重要。客户数据平台供应商Meiro的首席技术官Vojtech Kurka说,他一开始的设想是,他可以在正确的位置使用一些SQL和Python脚本来解决所有数据问题。随着时间的推移,他意识到,他可以取得更大的进步-通过雇用合适的人,并推广一种让人们快乐和积极的安全公司文化。8. 防止成本失控数据集成公司AtScale的创始人兼首席技术官David Mariani称,另一个常见的大数据挑战是“云账单心脏病发作”。很多企业使用现有的数据消耗指标来估计新的大数据基础设施的成本,但这是一个错误。其中一个问题是,企业低估了对计算资源的需求,更丰富数据集带来更广泛的访问,这需要更高的计算资源。特别是,云计算让大数据平台更容易呈现更丰富、更细化的数据,这种能力会推高成本,因为云系统将弹性扩展以满足用户需求。使用按需定价模型也会增加成本。一种好的做法是选择固定资源定价,但这并不能完全解决问题。尽管计量器停止在固定数量,但编写不佳的应用程序最终可能仍会消耗影响其他用户和工作负载的资源。因此,另一个好的做法是对查询实施细粒度的控制。Mariani称:“我见过几个客户,由于SQL设计不佳,用户编写了10,000美元的查询。”CloudCheckr公司的Rehl还建议,数据管理团队在与业务和数据工程团队讨论大数据部署时,提前提出成本问题。定义它的要求是企业的责任;软件开发人员应负责以有效格式交付数据,DevOps负责确保监控和管理正确的归档策略和增长率。9. 管理大数据环境随着大数据应用程序跨更多系统增长,数据管理问题变得越来越难以解决。随着新的云架构使企业能够以非聚合形式捕获和存储他们收集的所有数据,这个问题变得更加复杂。受保护的信息字段可能会意外潜入各种应用程序。Mariani 称:“根据我的经验,如果没有数据治理策略和控制,可能会失去更广泛、更深入的数据访问的大部分好处。”好的做法是将数据视为一种产品,从一开始就制定内置的治理规则。在前期投入更多时间在识别和管理大数据治理问题,将更容易提供自助服务访问,而不需要监督每个新用例。10. 请确保理解数据背景信息和用例企业还倾向于过分强调技术,而不了解数据的背景信息及其对业务的用途。数据争论工具提供商Trifacta公司首席执行官Adam Wilson说:“企业通常投入大量精力在考虑大数据存储架构、安全框架和摄取方面,但很少考虑引导用户和用例。”团队需要考虑谁将提炼数据以及如何提炼数据。那些最接近业务问题的人需要与最接近技术的人合作,以管理风险并确保正确对齐。这涉及到思考如何使数据工程民主化。构建一些简单的端到端用例也有助于获得早期胜利、了解限制并吸引用户。文章来源: TechTarget中国,只为分享、交流,如有涉嫌侵权,请联系删除!
-
本文节选自中国信通院于2021年6月24日在“2021大数据产业峰会”上发布的《数据库发展研究报告(2021年)》全球数据库产业生态成熟壮大,在发展过程中,逐渐细分出数据库产品、数据库服务和数据库支撑体系三个细分产业。(一)数据库产业概述数据库产品主要由关系型数据库、非关系型数据库、混合型数据库及数据库周边工具构成。数据库服务是指围绕数据库的咨询规划、实施部署和运维运营等环节,为数据库系统的正常、高效、持续、安全使用提供信息技术服务工作。数据库支撑体系由从事数据库学术研究、人才培养、开源社区、评测认证等工作的相关主体共同构成。据中国信通院测算,2020年全球数据库市场规模为671亿美元,其中中国数据库市场规模为35亿美元(约合240.9亿元人民币),占全球5.2%。预计到2025年,全球数据库市场规模将达到798亿美元。中国的IT总支出将占全球12.3%。我们预计,中国数据库市场在全球的占比将在2025年接近中国IT总支出在全球的占比,中国数据库市场总规模将达到688亿元,市场年复合增长率(CAGR)为23.4%。(二)数据库产品本节主要聚焦国内数据库产品提供商、产品分布及市场竞争三方面,并逐一展开分析。1.企业主体大部分仍处于发展初期阶段据中国信通院统计分析,截止2021年5月底,我国数据库产品提供商共计80家。成立时间呈现两个热周期。从企业成立时间看,我国数据库企业成立时间主要集中在1999-2000年和2013-2017年两个时间段,数量分别是12个和38个,依次占比15%和48%。上世纪90年代,以Oracle、DB2等为代表的国际商业数据库进入大陆市场,先后在电信、金融、政务等重要行业拿下大单,应用于各类核心系统和周边系统。国内也由于顶层设计加码,掀起一股国产数据库的浪潮。2012年,大数据成为国家级发展战略。在此背景下,我国涌现出一大批以大数据和数据库为主营业务的初创公司。2015年,平凯星辰、星瑞格、华胜信泰、上海丛云、恒辉信达等企业成立。2016至2018年,图数据库和时序数据库关注度不断提升,以费马科技、创邻科技、欧若数网、蜀天梦图等为代表的初创图数据库企业相继成立,以浙江智臾、涛思数据等为代表的时序数据库企业不断涌现,政策利好与资本关注为我国数据库产业不断注入新活力,国产数据库产业迎来第二轮浪潮。地域分布以一线城市为主。总部分布情况代表企业所在城市对数据库产业的重视与发展程度。从企业总部的数量看,由于人才规模聚集效应,企业总部通常设在超一线城市,数量最多的前五名是北京、杭州、上海、成都和深圳,分别是43、9、7、3、2个,占企业总数约为54%、11%、9%、4%和3%,除此之外,济南、南京、天津、武汉、广州、贵阳、福州、合肥和乌鲁木齐等直辖市和省会城市平均孵化出1-2个数据库企业。员工数量普遍在百人以下。我国数据库企业人员平均人数约为184人,最高为1200人左右规模,最低为10人左右规模。其中21-50人左右规模企业占比最高,数量34个,比例达到43%,人数在51-100人左右规模次之,数量为12个,占比15%,101-200人和201-300人规模并列第三,均为10个,分别占比13%,由此可见,我国数据库虽然数量众多,但平均从业人员数量较少,仍在快速发展阶段。平均专利数量不足五十个。我国数据库企业针对数据库领域的平均专利数量(含国内外专利)为38个,最高为500个左右规模,数量为0的企业个数是19个,占比24%。拥有专利数0-4个的企业占比最高为51%,专利数5-10个的企业次之,占比14%,专利数21-50个的企业数量排名第三,占比12%。从企业专利数量上看,Oracle以1.4万个全球领先,SAP居次席,国内数据库的全部企业技术专利累计千余,仍有较大发展空间。2.产品类型仍以关系型为主,非关系型产品正在快速发展我国数据库产品数量分布呈现以关系型为主,非关系型及混合型数据库为辅的局面。数据库产品根据研发方式不同,分为完全自研和基于开源二次研发两类。我国关系型数据库产品多数基于MySQL和PostgreSQL二次开发而来。据中国信通院统计分析,截止2021年6月,我国数据库产品共有135款。其中关系型数据库81个,非关系型数据库有54个,占比分别为60%和40%。按二级细分类别,以云服务为主要服务交付方式的关系型云数据库19个;非关系型数据库中,键值型数据库5个,列存数据库3个,文档数据库4个,图数据库13个,全文检索数据库1个,在非关系数据库中依次占比9.26%、5.56%、7.41%、24.07%和1.85%,由于一些不可控因素,其余非关系型数据库的数据模型暂不可知。关系型数据库中基于开源数据库MySQL和PostgreSQL进行二次开发的个数分别为23和24个,依次占关系型数据库比例为28.40%和29.63%,总计占58.03%。我国非关系型数据库产品发展势头良好,逐渐受到国际认可。非关系型数据库中以基于开源数据库如Redis、InfluxDB、CouchDB等产品进行二次开发为主。时序数据库因其存储处理海量时序数据的特性,常应用于工业控制、物联网、车联网等领域。据中国信通院统计分析,我国时序数据库从2000年后迅速发展,产品数量已达15款,1款为开源数据库,其余均为商业数据库。4个由云厂商提供,还有来自石化、电力、钢铁等传统工业实时数据库企业的产品9个。同时根据DB-Engines官网显示,2021年5月的时序数据库的流行度排名中,我国上榜的数据库产品已有两个,分别是浙江智臾和阿里云TSDB,依次位列第11和第21名。由于图数据库能够支撑社交网络、金融反欺诈等互联网与金融场景的关联分析业务,所以行业关注热度自2016年以来逐渐升温。我国图数据库产品数量为13款,自研程度较高,自研产品占总数比例为69.23%。从供应商类型看,初创公司、云厂商、高校纷纷入局,其比例分别为7:5:1。根据DB-Engines官网显示,2021年5月的图数据库的流行度排名中,我国上榜的数据库产品有3个,分别是欧若数网Nebula Graph、华为云GraphBase和百度智能云开源产品HugeGraph,依次位列第15、第28和第30名。3.市场份额正逐渐倾向云上,线下市场迎来激烈竞争线上市场呈现快速增长。随着云计算技术不断成熟,云上数据库市场快速增长。根据Gartner公司2019年发布的市场分析,2017年至2018年的全球数据库产业总营业额的18.4%增长中,云数据库管理产品的营业额占比68%,而Microsoft与亚马逊的AWS占到总增长的75.5%。同时根据2021年Gartner对数据库产品提供商的排名情况看,Microsoft凭借云数据库的后发优势,抢占了Oracle已经持续占据十年的榜首位置,前十名中已经有四家以云服务为主要供应方式的企业,分别为Microsoft、Amazon、Google和阿里云。据中国信通院统计分析,2020年,中国公有云数据库市场规模为107.68亿元,未来5年,公有云数据库市场年复合增长率将达到36.1%,预计到2025年,中国公有云数据库市场总规模将达到503.31亿元。Gartner预测到2023年,全球数据库市场中75%的数据库将完成到云平台的迁徙,仅有5%的数据保持在原本的本地模式当中。线上市场格局巨头涌现。中国信通院调研显示,阿里云、华为云和腾讯云作为我国头部云服务商,其在云计算基础设施、应用生态、用户渠道等方面处于领先地位,云上数据库作为云基础设施的延续与发展,具备天然先发优势。2020年,上述三家云服务商公有云数据库总营收约占中国公有云数据库市场份额75.5%。以电商、游戏、短视频等为主营业务的互联网公司是线上数据库的服务对象。出于对业务特性和生态兼容考虑,约83%的云上客户倾向选择MySQL、Redis、MongoDB、InfluxDB等开源数据库。存量市场替换空间可观,线下市场迎来激烈竞争。2020年数据库传统部署模式市场为133.22亿元,随着市场倾向的变化,传统部署市场替换国外数据库空间巨大。以关系型数据库为例,2017年以前市场格局十分稳定,Oracle、IBM、Microsoft、Teradata等为代表的产品占据数据库传统部署模式市场份额90%以上,以达梦、人大金仓、南大通用、神舟通用为代表的国产数据库,通常聚焦于军工、政务等封闭领域,整体市场份额较小,如今电信、金融等重要行业数据库改造变更需求不断,相关存量市场前景诱人。随着技术层面的分布式改造需求不断以及市场层面自发选择国产产品倾向,国产数据库市场份额有望得到大幅提升,各企业纷纷抢抓战略机遇,不断迭代打磨产品能力,抢占市场份额。据中国信通院大数据产品能力评测十二批结果显示,国产数据库供给能力较几年前得到大幅提升,产品功能逐渐完善,集群规模与日俱增,性能表现不断攀升,市场竞争程度较为激烈。初创企业和巨头陆续投身开源市场。开源已成为数据库产业的共识,2021年1月,DB-Engines官网显示,开源许可证流行度首次超过商业许可证,开源数据库迎来新纪元。截止2021年6月,开源与商业许可证数量分别为192和179个,流行度分别占比51.1%和48.9%。近些年以巨杉、平凯星辰、涛思数据、欧若数网为代表的初创企业和以百度、华为、阿里云、蚂蚁金服为代表的巨头意识到开源有助于扩大人才规模及上下游生态影响力,通过运营开源社区快速获得反馈并加快产品开发、提升产品质量,同时反哺社区开发者及独立软件开发商(ISV)等生态伙伴,能够达到多方共赢目的。针对开源,企业纷纷采取不同的商业模式。2014年12月,巨杉数据库宣布开源SequoiaDB,成为国内最早开源自研数据库项目;2017年10月,平凯星辰开源TiDB;2018年,百度开源数据库Doris和HugeGraph;2019年,涛思数据和欧若数网分别开源TDengine和NebulaGraph;2020年6月,华为建立openGauss开源社区,并于2021年3月发布第一个Release版本;2021年5月,阿里云宣布对外开放关系型数据库PolarDB for PostgreSQL源代码,同年6月,蚂蚁集团宣布开源OceanBase。(三)数据库服务很长一段时间内,我国数据库服务工作主要以附属技能的形式由应用开发商和硬件服务商提供保障。随着数据库对于企业的重要性越来越高,企业对于以数据库为核心的专业服务的需求也越加迫切,独立的数据库服务厂商开始崭露头角,并形成了一个专业化的数据库细分服务领域。1.头部企业主体发展时间较长数据库服务产业主体主要由多年来在电信、金融、政务等重要行业提供外包IT运维服务的企业构成,成立时间普遍十年以上,核心成员多为早期提供Oracle、DB2原厂或第三方服务的专家,由于企业数据库技术体系庞杂,需要服务提供商能够提供横向主流数据库产品和纵向多版本技术服务覆盖能力,服务行业技术壁垒较高。此外,由于一般与客户签订一至三年合同,服务提供商对客户系统非常熟悉,容易形成相对稳定的长期合作伙伴关系,市场壁垒较高,新兴初创公司较少,巨头员工数量普遍在千人左右。头部典型企业有云和恩墨、新炬网络、海量数据、太阳塔、爱可生、中亦安图、万国数据、银信科技、天玑科技、新数科技、沃趣科技、迪思杰、九桥同步等。2.服务工作范围广,缺乏行业规范和指引数据驱动时代,企业开始利用海量实时数据分析业务发展、了解客户行为和优化配置资源,并据此制定企业发展战略。数据库系统作为数据存储的主要载体,数据库服务贯穿企业IT系统的整个生命周期。按照信息系统建设的不同阶段,数据库的服务范围主要覆盖规划设计、实施部署、运维运营三个方面,三个方面又细分多个服务工作内容,如下图所示。由于数据库服务产业正处于快速变革期,玩家众多,能力水平参差不齐,服务过程缺乏行业规范和指引,导致众多数据库应用单位面临各类选型和实施问题。中国信息通信研究院联合国内数据库厂商和服务商,共同编制并发布了《数据库服务能力成熟度模型》团体标准,期望为国内的数据库服务生态体系提出更全面和专业的评估标准。3.服务市场集中在重点行业,环境变革倒逼各主体转型升级服务市场主要集中在金融、电信、政府、制造、交通五个行业。根据中国信通院统计分析,各行业的数据库服务市场份额比例分别为金融22.3%、电信18.9%、政府16.4%、制造13.3%、交通9.6%,这五个行业合计占比超过80%。云计算改变传统服务市场格局。在云计算逐渐成熟之后,与云上数据库市场份额迅速扩大。而云上数据库的咨询、部署、运维等服务工作则直接由云计算公司负责,所以云计算公司将改变传统服务市场格局。由于服务工作定制化程度较高,相对标准化云产品,属于劳动力密集型工作,所以从综合成本角度出发,未来云上数据库服务市场部分将由云计算公司依靠自身资源储备负责,另一部分云计算公司将与线下服务公司进行合作,形成优势互补,共同完成相关工作。服务企业向产品企业转型。如今随着分布式云数据库兴起,数据库运维要求不断提升,数据库服务商除了提供传统的驻场与远程运维类服务外,围绕数据库开发、测试、运维等环节也提供多种类型的数据库周边工具。与此同时,以云和恩墨、新数科技、爱可生、海量数据等为代表的数据库服务商为了拓展业务范围,提升企业利润总额,认识到可以利用自身服务能力积累与经验,对数据库产品供应商形成差异化优势,顺势推出自有数据库产品,进一步加剧了数据库产品市场竞争激烈程度。其中云和恩墨与海量数据分别基于开源数据库openGauss推出了企业级数据库MogDB和Vastbase,爱可生和新数科技基于MySQL也发布了相关产品。(四)数据库支撑体系当前数据库支撑体系由于数据库技术路线不断演进,也正处于变革和创新的高发期。1.学术研究仍以关系理论为重点,国内研究水平逐渐提升2016至2020年,美国、中国、印度、德国和英国是全球数据库领域论文产出前五的国家,美国发文量最多,占全球总发文量22.4%,之后依次为中国19.4%,印度7.4%。从高水平论文数量分析,英国高被引论文数占3.1%,中国占0.3%。从国际合作论文的角度分析,英国、法国、加拿大、西班牙的国际合作论文较多,均超过50%。学术界公认的数据库领域顶级会议主要有VLDB、SIGMOD和ICDE。从这些会议的研究方向看,当前以关系型数据库为主,非关系型数据库为辅。以VLDB为例,2018-2020年,各领域论文总数分别为146、151和95个,关系型和非关系型数据库论文分别占三年论文总数量的37%和21%。SIGMOD各领域论文总数分别为90、88和144个,关系型和非关系型数据库论文总数占三年论文总数的22%和13%。ICDE各领域论文总数分别为188、268和241个,关系型和非关系型数据库论文总数占三年论文总数均为13%。综合分析全球论文研究主题,除了关系型数据库,图论、图数据库、查询优化、机器学习、分布式处理、时序数据、流数据、时空数据、云数据库等代表当前火热的技术方向。此外,数据安全、隐私保护也是每年不可或缺的研究主题。我国在全球数据库领域学术影响逐渐提升。高校及企业在ICDE论文贡献占比最高,三年依次为28.19%、37.31%和43.15%,三大会议每年贡献占比平均为22.14%、23.74%和23.81%,数量呈逐年上升趋势,研究方向以图论、图数据库、数据挖掘、机器学习、查询处理等方向为主。阿里巴巴、华为、腾讯、蚂蚁金服、百度、PingCAP等企业和清华大学、香港科技大学、北京大学、香港中文大学、香港大学、浙江大学、华中师范大学、华东师范大学、中国人民大学、复旦大学、北京航空航天大学、华中科技大学、中国科学院、北京理工大学等高校论文纷纷入选三大顶会,显示我国数据库学术水平国际影响力不断扩大。2.领域内各类组织形成,产业热度不断提高数据库支撑体系各类组织主要分为以下四类:一类是由具备官方背景的研究组织,例如以中国计算机学会(CCF)数据库专业委员会为代表的学术组织和以中国通信标准化协会大数据技术标准推进委员会(CCSA TC601)为代表的行业组织,用于汇聚国内数据库理论研究头部力量;第二类是数据库从业人员牵头发起的面向数据库技术爱好者的用户组织,如面向DBA的ACDU、面向Oracle用户的ACOUG、面向MySQL用户的ACMUG、面向PostgreSQL用户的中国开源软件推进联盟PostgreSQL分会等,用于进行各类专题技术交流和讨论;第三类是由数据库企业组建,针对自身特定产品讨论的官方技术社区,如阿里云开发者社区、华为云openGauss社区、PingCAP AskTUG社区、PostgreSQL中文社区、爱可生开源社区、移动云开发者社区等;第四类是汇聚数据库整体行业信息的第三方技术社区,如ITPUB、墨天轮、DBAplus等,用于搭建领域内线上交流平台。3.多层级数据库人才培训体系正在快速形成当前数据库人才培养渠道主要有三个:高校教育、培训机构和企业。各渠道分别具有不同的培训方式和培训目标。高校教育注重普适教育,重视社会人才发展大趋势需求。通过原理性知识传授、数据库系统应用实践等教学方式,为数据库产业发展提供了大量储备人才。培训机构是数据库人才认证获取的主要途径。培训机构累计为合作伙伴培训学员超5万人次,其中获得Oracle、MySQL、PostgreSQL认证学员数千人,为企业输送专业DBA万余人。培训方式为厂商授权培训中心或联合认证培训中心等,培训知识主要面向数据库工程实践和应用。除原厂培训,当前专业培训机构包括恩墨学院、新炬学院、盘古云课堂等。企业培训基于人才培养时间成本、人才可用性等考量因素,多渠道聚集人才。一方面,数据库厂商开始建立自己的认证体系,并形成了不同级别的培训课程和认证考试;另一方面,一些企业开始加强与院校的产教融合尝试,通过与高校进行教材编撰、实训开发、专业共建、人才共建等合作项目,在高校提前培养数据库相关储备人才。4.数据库领域受资本市场高度追捧中国信通院统计分析,自2013年至今,数据库企业累计完成约42次融资,根据披露金额显示,融资额度总计约为78.6亿元。自2014年成立的以数据库产品供应与服务提供为主营业务的企业为29个,其中24个企业先后获得单笔数百万元至最高2.7亿美元融资,仅2021年一、二季度期间,获得最新一轮融资的企业数就达12家,2020全年获得融资的企业数量为17家,占比59%,其中不乏高瓴创投、经纬中国、红点创投、红杉资本等知名投资方。由此看出,近些年随着国产数据库概念的火热与应用需求多样化带动的技术变革,国内外各路资本纷纷注入数据库产业,形成“百舸争流”的旺盛态势。文章摘自大数据技术标准推进委员会,只为分享、传播,如果涉嫌侵权,请联系删除!
-
大家好!我是酷哥,一周精选,带您速览,欢迎大家关注。 **本期整理如下:** ------------------------------------------------**本期精选**------------------------------------------------ - 2022年1月国产数据库排行榜:TiDB霸榜两年势头不减,openGauss与OceanBase分数大涨 - 数据库技术七**展趋势 - 非结构化数据将在2022年继续影响数据管理 - 2022年的5个主要的数据迁移趋势 - 数据成熟度的演变过程 - 红遍全球的云原生数据库,未来将走向何方? - 数据库领域下的新跃迁:百家争鸣背后的数据碎片化格局 - 华为云GaussDB连续两年入选Gartner®云数据库管理系统魔力象限™ - 华为云FusionInsight三次蝉联中国大数据市场第一 ------------------------------------------------**资讯全文**------------------------------------------------ - [2022年1月国产数据库排行榜:TiDB霸榜两年势头不减,openGauss与OceanBase分数大涨](https://bbs.huaweicloud.com/forum/thread-177145-1-1.html) **摘要:** 奎钩粲粲光华动,群玉森森气象新。国产数据库行业在经历了2021年的躬行实践之后,产品、服务、生态等取得了蓬勃发展。从2022年1月份的国产数据库流行度排行榜上,我们可以看到,相较于去年12月份,榜单上又增加了新成员。目前,共有194家数据库参与排名。排行榜前十五名的数据库中,80%的产品流行度分数实现上涨。 PingCAP的TiDB依然稳居榜首,第二名openGauss,达梦位于第三。 **文章来源:** [https://bbs.huaweicloud.com/forum/thread-177145-1-1.html](https://bbs.huaweicloud.com/forum/thread-177145-1-1.html) - [数据库技术七**展趋势](https://bbs.huaweicloud.com/forum/thread-177621-1-1.html) **摘要:** 大数据时代,数据量不断爆炸式增长,数据存储结构也越来越灵活多样,日益变革的新兴业务需求催生数据库及应用系统的存在形式愈发丰富,这些变化均对数据库的各类能力不断提出挑战,推动数据库技术不断向着模型拓展、架构解耦的方向演进,与云计算、人工智能、区块链、隐私计算、新型硬件等技术呈现取长补短、不断融合的发展态势,总结起来体现为三个方向: 1)多模数据库实现一库多用、利用统一框架支撑混合负载处理、运用AI实现管理自治,提升易用性、降低使用成本; 2)充分利用新兴硬件、与云基础设施深度结合,增强功能、提升性能; 3)利用隐私计算技术助力安全能力提升、区块链数据库辅助数据存证溯源,提升数据可信与安全。 **文章来源:** [https://bbs.huaweicloud.com/forum/thread-177621-1-1.html](https://bbs.huaweicloud.com/forum/thread-177621-1-1.html) - [非结构化数据将在2022年继续影响数据管理](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177593) **摘要:** 2022年,非结构化数据将继续重塑数据管理的格局,现在不仅产生了空前数量的数据,而且还在多个地方收集、存储、处理和分析,并在这些环境之间移动。 企业正在使用视频、图像、物联网传感器数据、社交媒体和类似的信息,作为他们执行的很多分析、机器学习和商业智能任务的基础。随着我们进入2022年,非结构化数据将继续成为企业数据管理工作的重点。 IT领导者将专注于利用云技术从非结构化数据中获取价值、非结构化数据分析工作流解决方案将会出现、“数据货币化”和相关策略将在2022年流行、IT将拥抱数据竖井、数据管理将继续成为风险投资家的热门市场。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177593](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177593) - [2022年的5个主要的数据迁移趋势](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177292) **摘要:** 数据似乎总是需要迁移,无论是从内部部署设施迁移到云平台,还是从操作系统到长期存档,数据始终在移动。 2022年数据迁移市场的五个主要趋势:非结构化数据迁移、迁移软件整合、数据优先迁移、数据库迁移、云平台之间的迁移。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177292](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177292) - [数据成熟度的演变过程](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177269) **摘要:** 在过去十年中,企业一直致力于将“数据驱动”作为其业务战略的核心原则。数据驱动是指使用数据来做出商业决策,但这不一定可以衡量公司的整体数据状况。成为数据驱动型企业,不仅需要时间和精力,还需要对数据策略进行积极的投资。 首先,我们需要了解公司在“数据成熟度”方面所处的位置。数据成熟度为业务中的数据渗透提供了更具体的衡量标准,并囊括了数据驱动组织中涉及的人员、流程和工具。 为了让数据专业人士从容面对治理和监管方面的新挑战,他们必须将提高数据成熟度作为他们的核心立场。数据成熟的专业人员和企业可以降低复杂性,并根据当前情况调整处理数据管理和分析的方式。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177269](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177269) - [红遍全球的云原生数据库,未来将走向何方?](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177270) **摘要:** 如今,企业面临着指数级递增的海量存储需求,业务也面临更多的热点和突发流量带来的挑战。由于企业需要降本增效,进行更智能的数据决策,传统的商业数据库已经难以满足和响应快速增长的业务诉求。 在此背景下,云原生数据库成为大势所趋,不管是老牌的数据库厂商,还是大型云计算企业都在向这一趋势靠拢。 全球知名咨询公司Gartner指出,云将主导数据库市场的未来,到2022年,75%的数据库将被部署或迁移至云平台,只有25%的数据库会在本地运行。云化无疑代表了未来,企业如何在云原生架构下使用数据库,就成为必须要思考的问题。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177270](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177270) - [数据库领域下的新跃迁:百家争鸣背后的数据碎片化格局](https://bbs.huaweicloud.com/forum/thread-177463-1-1.html) **摘要:** 互联网红利不再,相比 2010 年,现在的市场上显得太过平静,已经太久没有出现关于『风口』的故事。但在表面的岁月静好之下,却是底层的暗流涌动。其中,数据库就是『底层暗流涌动』的典型场景之一,作为支撑数字经济的最关键基础设施,这两年数据库市场中一直都在上演着一浪高过一浪的竞争。 在亚马逊公司看来,数据库也被他们视作为下一个战场。“The real battle will be in databases”。 **文章来源:** [https://bbs.huaweicloud.com/forum/thread-177463-1-1.html](https://bbs.huaweicloud.com/forum/thread-177463-1-1.html) - [华为云GaussDB连续两年入选Gartner®云数据库管理系统魔力象限™](https://bbs.huaweicloud.com/blogs/325342) **摘要:** 近日,国际研究机构Gartner发布2021年全球云数据库魔力象限报告《Magic Quadrant for Cloud DatabaseManagement Systems》,华为云凭借GaussDB系列数据库产品入选魔力象限的特定领域者。成为亚洲唯二入选的云厂商。 **文章来源:** [https://bbs.huaweicloud.com/blogs/325342](https://bbs.huaweicloud.com/blogs/325342) - [华为云FusionInsight三次蝉联中国大数据市场第一](https://www.huaweicloud.com/news/2022/20220111164426467.html) **摘要:** 近日,全球领先的IT研究和咨询公司国际数据公司(IDC)发布《中国大数据平台市场研究报告-2021H1》,华为云FusionInsight智能数据湖位居中国大数据平台市场份额第一,连续3次蝉联榜首。 **文章来源:** [https://www.huaweicloud.com/news/2022/20220111164426467.html](https://www.huaweicloud.com/news/2022/20220111164426467.html) 上一期:[【技术之声】第四期(20220110)一周精选](https://bbs.huaweicloud.com/forum/thread-177196-1-1.html) ------------ *声明:文章源于第三方公开的信息,如内容中涉嫌侵权或存在信息不实时,请及时联系删除。* 整理者:酷哥
-
7月28日-29日,2021(第六届)中国大数据产业生态大会在北京举行。本次大会以“数智转型 融合共生”为主题,共同探讨产业服务数字化发展和行业数智化转型方向,大数据领域年度“金沙奖”也在会上正式揭晓,华为云数据使能DAYU主力产品——数据仓库GaussDB(DWS)蝉联“2021 中国大数据·数据仓库领域最佳产品奖”。华为云GaussDB(DWS)是一款具备分析及混合负载能力的分布式数据库,面向政企、互联网和物联网等应用场景,以企业级内核、统一架构提供标准数仓,实时数仓和云数仓。业务分析师和数据分析师在批量分析、交互式查询与分析、实时分析等业务场景中,可借助GaussDB(DWS)轻松获得一站式分析能力,降低数据分析门槛提升数据分析效率,更便捷高效的释放数据价值。一站式数据分析支持上万分析师在线作业,满足企业平台容量需求继2020年获奖后,华为云GaussDB(DWS)研发团队在数据分析技术上持续探索。通过智能多维的混合负载管理,华为云GaussDB(DWS)可在集群内实现实时、批量、交互式负载的一站式数据分析。为数据接入提供丰富的数据源接口,满足数据分析的全流程中不同角色对数据分析的不同需求。通过自研TCP多流技术提高物理连接数量级,在MPP架构下数据节点全并行数据交换,华为云GaussDB(DWS)实现单集群最大支持2048节点。2021年Q1建成投产的480节点大集群分析师平台,成为金融行业最大规模商用数据仓库集群,支持上万分析师在线作业,极大满足了大企业数据量激增对平台容量扩展的需求。高并发毫秒级点查询,效率提升200倍通过30多项查询重写技术(含4项专利),优化Ad hoc查询性能,实现高并发毫秒级点查询。在已商用的GaussDB(DWS)数据分析平台中,灵活查询平均运行时间由30分钟降低至50秒,查询平均等待时长更是由5小时降低至1.5分钟,查询效率提升200倍!对企业而言,业务数据从产生到汇聚,再到面向场景化分析,每个环节都分秒必争,快速释放数据潜能已成为企业数字化转型的刚需。数据分析架构简化,流数据每秒千万级实时接入在互联网和物联网业务应用中,时序数据和流数据承载了大量的业务内容。典型时序和流数据分析方案需要引入多种组件,不但数据格式难统一,平台架构也变得非常厚重,扩展困难。华为云GaussDB(DWS)在全并行分布式架构上,无缝融合OLAP引擎、时序引擎、CEP引擎,简化数据分析组件架构,实现T+1和T+0合一的一站式数据分析,实时数据与历史数据关联分析技术做到同行业技术领先。在已投产的实时数仓方案中,流数据高峰流量每秒千万级实时接入,解决了传统方案流数据接入流量速率的瓶颈问题。华为云GaussDB(DWS)提供GB~PB级数据分析能力、多模分析和实时处理能力,用于数据仓库、数据集市、实时分析、实时决策和混合负载等场景,在全行业数字化转型中帮助企业提质增效,建立核心竞争力,夯实企业发展根基。 目前,华为云大数据热销主打的产品有:1. 数据仓库服务GaussDB(DWS)提供云上企业级融合数据仓库,支持实时数据分析,具备高性能、低成本、易扩展等特性2.MapReduce服务 3.0.5版新版ClickHouse集群支持跨AZ集群,适用海量数据大宽表实时分析/实时BI报表分析3. 云搜索服务 CSS兼容Elasticsearch完全托管在线分布式搜索服务,用于站内搜索/日志分析/运维监控等场景 4.数据湖治理中心 DGC数据全生命周期一站式开发运营平台,可复用行业知识库,助力企业快速构建数据运营能力5.数据湖探索服务 DLI提供一站式融合处理分析服务,会SQL就会大数据分析,高易用免运维 现在828大促期间,大数据福利专场上线,注册用户即可免费体验大数据,爆款产品击穿底价5折!详情点击了解:https://activity.huaweicloud.com/bigdata.html
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签