• [行业动态] 华为云FusionInsight连续三次获得第一 加速释放数据要素价值
    近日,IDC发布《中国大数据平台市场研究报告,2021 H1》,华为云FusionInsight智能数据湖已连续三次获得大数据平台市场份额第一。基于超过10年服务于政务、金融、运营商、大企业、互联网等行业客户的实践经验,华为云FusionInsight智能数据湖通过不断的技术创新为客户提供业界领先的云原生、湖仓一体解决方案。如今,数据已经与土地、劳动力、资本、技术并称为五种要素,数据不仅是一种产业或应用,更是国家发展的战略性、基础性资源。未来,数据要素市场空间巨大,通过驱动关键大数据技术和开源技术的不断创新发展,培育数据要素市场,打造新型数字产业,到2025年大数据产业规模将达到3万亿。大数据产业快速发展,已成为支撑经济社会发展的优势产业。华为云FusionInsight智能数据湖不断深入客户场景,提供大数据轻咨询专业服务,加速释放各行各业数据要素价值。在政务领域,华为云FusionInsight智能数据湖已为部委、各省市客户,提供领先的大数据云服务产品组合。2021年,华为云携手华傲数据,基于FusionInsight联合打造“三算一景”的政务大数据治理解决方案:华为云提供大数据所需的“算力”,基于各委办局的海量数据资源,即“算料”,通过数据治理的模型不断打磨数据 “算法”, 贯穿包括一网统管、一网通办、一屏尽览等“应用场景”。在“一秒七办”方案中,实现政务数据服务的自动匹配、自动填表、自动证明、自动核对、自动审批、自动评审、自动响应,让业务场景纵向高效畅通;结合大数据、区块链、AI技术,横向扩宽业务范围,实现跨部门、跨层级的互联互通,让“数据多跑路,群众少跑腿”。在金融领域,近年来工商银行、交通银行、杭州银行等银行、保险、证券客户携手华为云FusionInsight智能数据湖共建金融大数据体系。其中在工商银行已建成同业最大的大数据单集群,总规模达4000+节点,支撑行内外200+应用。工行的风险控制、损益预查询等关键业务也逐步接入大数据平台。在交互查询场景,该行通过MRS HetuEngine数据虚拟化引擎,分析提效50倍,提升全行13000名分析师即时BI新体验,并已面向全行推广。在运营商领域,随着移动互联网、IoTDB等技术的迅猛发展,运营商已深入支撑各行各业的大数据应用。广东移动基于华为云FusionInsight智能数据湖,联合政企客户共同打造智慧电网、智慧交通、智慧港口、高清视频等系列标杆应用,实现对内业务支撑、对外应用赋能,建成服务于超过1.3亿移动用户的大数据平台。在互联网领域,华为云在互联网大数据市场同样突飞猛进,在公有云上也建立了专属Region,为客户上云提供便利,使得像梦饷集团、T3出行这样的大型互联网客户纷纷转向华为云。梦饷集团依托MRS云原生数据湖,使用DLI数据湖探索和数据仓库作为基础数据处理层,支持离线、实时、交互式场景,并无缝对接AI引擎,实现智能推荐与搜索,释放数据价值,驱动梦饷集团全场景业务的数字化与智能化升级。在大企业领域,制造、生产、服务型企业越来越重视大数据,不断提升区域统筹能力,提高服务水平。在电力能源、生产制造、交通城轨等领域,越来越多的企业采用云边端的方式协同计算海量数据,支撑业务创新。华为云MRS携手清华大学打造专、快、易、稳、省的IoTDB时序库,覆盖海量高频,且具有时序特点的时序数据分析,一份数据兼容云边端全场景。同时,随着我国提出“双碳”的战略目标,在2021年东华博泰携手华为云FusionInsight,实现以数据为源力核,平台为运力核,应用为创力核,体系为内力核,生态为汇力核,打造“五核聚一”的数字化运营架构,为能源行业提供大数据创新解决方案,共建智慧能源生态圈。越来越多的政务、金融、运营商、互联网、大企业客户,优选华为云FusionInsight智能数据湖构建大数据体系,在数字化转型过程中实现业务的高质量可持续发展。客户需要企业级+安全+高效的大数据平台科技为社会发展提供的源动力,推动了机械化、电气化、自动化和信息化,到如今的智能化。在智能化阶段,数据成为“新石油”,为经济社会发展提供取之不尽用之不竭的“原材料”,这一点是数据要素有别于其他资源的重要特征。越来越多的客户越来越重视数据资产,同时大多数客户在建设大数据平台时要求,不仅要满足当下业务发展需要,还要支撑其未来发展战略目标,进而对大数据底层技术平台提出了更高的要求,需具备如下特点:特点一:企业级,可持续演进各行业的大数据平台已承载了海量数据和关键业务场景,如金融实时风控业务场景,对于业务连续性要求高,需7*24小时不中断;华为云FusionInsight智能数据湖提供单集群6万+节点大规模滚动升级能力,确保关键业务升级“0”中断。特点二:安全可靠,放心使用数据资产安全是大数据平台建设的必备要素。华为云FusionInsight智能数据湖经过超过10年不断打磨,已服务于60多个国家超过3000个客户,深入行业场景化实践,理解客户业务场景化诉求,因为懂行业、懂数据,所以“敬畏”数据。在平台安全方面,FusionInsight围绕数据全生命周期,构筑可信的安全体系,让未经授权的访问者“进不来、看不到、拿不走、赖不掉、用不了、坏不了”以及多平面网络物理隔离,防止数据意外泄露;在数据共享、融合分析等场景,DGC数据湖治理中心除了提供全链路数据治理能力,还提供分层分级的数据安全开放管理,使得客户在不断提高数据要素质量的同时,还能安全地共享数据;在跨地域、跨部门、跨业务的协同安全计算场景中,FusionInsight还提供TICS可信智能计算服务, 提供深度协同优化联邦训练和全同态加密,让跨部门、跨层级数据协同分析“可用不可见”,加速数据要素市场化流通,并获得权威机构包括信通院、金标委的多项认证。时至今日,大数据平台重要性已不言而喻,FusionInsight可以让数据“坏不了”,实现数据备份、跨AZ(可用区)容灾、异地容灾的全场景覆盖,进一步保障业务连续性。特点三:高效易用,不断创新工业革命实现了从“马车”到“火车”的重要改变,资源的挖掘、开采与提炼不断解放了生产力,人们的工作效率得以不断提升。在效率方面,大数据平台建设呈现云原生化趋势,结合容器等虚拟化技术,实现大数据计算所需资源的快速上线,从传统建设耗时数月降至数分钟。在数据供应时效性方面,传统大数据方案批量接入,全量更新,T+1式天级供数,无法满足上层业务的灵活变化;华为云FusionInsight MRS提供自研CDL引擎,配合Hudi+Flink+ClickHouse方案,实时接入,增量更新,PB级数据毫秒级自助分析,结合自研RTD实时决策引擎,实现海量数据从接入到决策的全链路实时数据湖,让数据时效从T+1走向T+0,高效释放海量数据价值。“湖仓一体”+“轻咨询”,打通大数据的“任督二脉”近十年,大数据技术发展迅猛,“湖仓一体”已是数据湖建设的首选架构,其通过统一的数据存储,让数据在湖内流动,减少数据搬迁和冗余,最终实现一份数据支持多工作负载。早在2020年5月,华为云在全球分析师大会上提出“湖仓一体”概念,华为云FusionInsight智能数据湖提供云原生数据湖服务和云数据仓库服务,湖仓既可以灵活按需部署,也可以融合演进到湖仓一体的架构,并基于云原生存储实现存算分离架构,使得数据在底层统一存储,统一元数据,计算与存储资源灵活扩容,采用1.2副本替换传统 3副本方案,让资源利用率提高2倍+。在“全局一份数据”基础之上,FusionInsight提供自研数据虚拟化引擎HetuEngine,其具有自动学习、自动感知、自动优化等智能化特点,上层通过SQL操作大数据,降低技术使用门槛,让海量数据跨域高效、跨源易用,协同分析提效50倍。同时还能让客户在一个架构上实现离线、实时、逻辑三种数据湖和数仓集市,解决传统大数据平台存在的烟囱式建设,湖仓割裂,数据来回搬迁等问题。华为云FusionInsight还为客户提供大数据轻咨询服务,从大数据平台顶层设计规划,到大数据场景化业务构建,甚至包括客户的大数据业务上线运维,提供端到端的专业服务,使能客户,加速客户的数据供给能力。大平台、大市场、大机遇本次华为云FusionInsight智能数据湖在《IDC中国大数据平台市场研究报告,2021H1》获得市场第一,得益于其超过10年持续深入客户业务场景,通过不断地技术创新,为客户提供领先的智能数据湖解决方案。这已是FusionInsight连续三次蝉联中国大数据市场第一,之前分别在IDC《中国大数据平台市场研究,2020》取得2019年市场份额第一,在《IDC MarketScape:中国大数据管理平台厂商评估,2020》报告中获得2020年市场份额第一。独行快、众行远。开放的平台已广泛被政务、金融、运营商、互联网、大企业所使用。华为云FusionInsight智能数据湖坚定开放路线,先后开放CarbonData和openLooKeng,联合世界顶级高校如清华大学持续探索中国软件创新之路,引领全球大数据技术不断发展。华为云FusionInsight将持续联合800+合作伙伴,为客户提供领先的大数据解决方案,在大平台、大市场、大机遇的历史时刻,共同谱写新型数字产业新篇章。更多精彩文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html
  • [酷哥说库] 【技术之声】第六期(20220124)一周精选
    大家好!我是酷哥,一周精选,带您速览,欢迎大家关注。 **本期整理如下:** ------------------------------------------------**本期精选**------------------------------------------------ - 数据库产业发展综述 - IDC:中国关系型数据库软件市场报告 - 墨天轮2021年度中国数据库魔力象限 - 开源、智能化、隐私安全等八大数据库发展趋势 - 原生分布式数据库与分库分表中间件、云原生数据库有何区别 - Neo4j 针对2022图数据平台发展的十大预测 - 云产融合是方向 人才竞争更关键 - 10个大数据挑战以及应对方法 ------------------------------------------------**资讯全文**------------------------------------------------ - 数据库产业发展综述 **摘要:** 本文节选自中国信通院于2021年6月24日在“2021大数据产业峰会”上发布的《数据库发展研究报告(2021年)》全球数据库产业生态成熟壮大,在发展过程中,逐渐细分出数据库产品、数据库服务和数据库支撑体系三个细分产业。 数据库产品主要由关系型数据库、非关系型数据库、混合型数据库及数据库周边工具构成。数据库服务是指围绕数据库的咨询规划、实施部署和运维运营等环节,为数据库系统的正常、高效、持续、安全使用提供信息技术服务工作。数据库支撑体系由从事数据库学术研究、人才培养、开源社区、评测认证等工作的相关主体共同构成。 据中国信通院测算,2020年全球数据库市场规模为671亿美元,其中中国数据库市场规模为35亿美元(约合240.9亿元人民币),占全球5.2%。预计到2025年,全球数据库市场规模将达到798亿美元。中国的IT总支出将占全球12.3%。我们预计,中国数据库市场在全球的占比将在2025年接近中国IT总支出在全球的占比,中国数据库市场总规模将达到688亿元,市场年复合增长率(CAGR)为23.4%。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178100 - IDC:中国关系型数据库软件市场报告 **摘要:** 1月17日,国际数据公司(IDC)发布的《2021年上半年中国关系型数据库软件市场跟踪报告》显示,2021上半年中国关系型数据库软件市场规模为11.9亿美元,整体市场同比增长37.2%,其中,公有云关系型数据库规模6.7亿美金,同比增长50.1%;本地部署关系型数据库规模5.2亿美金,同比增长23.7%。IDC预测,2021全年中国关系型数据库软件市场规模为27.5亿美元, 到2025年将达到76.7亿美元,未来5年市场年复合增长率(CAGR)为30.4%。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177976 - 墨天轮2021年度中国数据库魔力象限 **摘要:** 墨天轮2019年6月即推出了中国数据库流行度排行,排行榜中的数量也从50增加到194个,见证着中国数据库近三年的蓬勃发展。 墨天轮参考 Gartner 的魔力象限模型,结合墨天轮数据库流行度排行表现,综合得出了2021年度中国数据库魔力象限(魔力象限、领导者象限、挑战者象限、远见者象限)。 **文章详情:** https://bbs.huaweicloud.com/forum/thread-178379-1-1.html - 开源、智能化、隐私安全等八大数据库发展趋势 **摘要:** 新年换旧年之际,便到了盘点时间。随着数字经济不断发展,数据库的重要性愈发凸显。数据库技术有怎样的发展新趋势? ITPUB&IT168结合一些大会上嘉宾的演讲、采访,以及对市场的观察和理解,梳理出数据库技术八大趋势:开源、智能化、隐私安全、软硬一体、上云、分布式、细分场景、架构融合。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178306 - 原生分布式数据库与分库分表中间件、云原生数据库有何区别 **摘要:** 如今,我们正处于数据库从互联网基础软件转变为社会数字化基础软件的时代,在传统集中式数据库已不能满足大规模数据承载需求与高并发处理需求的形势下,基于海量数据场景应用而生的分布式数据库迎来应用热潮。据IDC调研,目前约26.8%的企业级市场用户部署了分布式数据库,超过90%的企业认可分布式数据库部署后的效果。 在分布式数据库中,主要有三类解决方案,一类是以中间件+单机数据库为主的分布式数据库,下层的单机数据库提供存储和执行能力,在多个单机数据库上封装一层中间层,以统一分片规则管理及处理分布在不同数据库节点的数据,并提供SQL解析,请求转发和结果合并的能力;第二类是原生分布式数据库,在架构设计之初,便根据分布式一致性协议做底层设计,因此,数据的存储、查询、处理都天然具备分布式特性,各数据节点提供对等的读写服务,组成统一的集群对外提供服务;第三类是通过构建分布式共享存储实现扩展,采用非对称计算节点,大部分公有云数据库都属于此类。在本文中,我们重点说说前两类。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178099 - Neo4j 针对2022图数据平台发展的十大预测 **摘要:** 数字化经济方兴未艾的浪潮中,中国各类企业乃至政府都面临着数字化转型的挑战。而随着疫情的逐步稳定,是否能成功实现数字化转型成为重要的核心竞争力。作为转型的要素之一,数据日益复杂,且随着世界的连接而愈加密切地相互关联。 以大数据、云计算、人工智能为代表的新一代数字技术日新月异,其中图技术就是数据库产业中增长最快且最具发展前景的领域。根据 Gartner®预测,“到2025年,使用图技术进行数据和分析创新的比例将由2021年的10%提升至80%。”各种类型的数据关联越来越普遍和重要,不同规模价值企业对图技术认知也不断提升。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177859 - 云产融合是方向 人才竞争更关键 **摘要:** 受疫情影响,全球大多数企业线下活动受到明显冲击,线上服务的需求激增,从而带动了云计算服务市场。赛迪数据显示,2020年,全球云计算市场销售额为2957.6亿美元,增速为9.8%,2021年更是有增无减。在政策推动和市场需求的刺激下,分析者普遍认为,未来几年,云计算市场的强劲发展势头有望保持下去。另外,云计算后半程的竞争,云产融合是发展方向,人才竞争才是关键。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177920 - 10个大数据挑战以及应对方法 **摘要:** 执行良好的大数据战略可以简化运营成本、缩短上市时间并支持新产品。但是,在将董事会讨论的大数据举措付诸实践的过程中,企业面临着各种大数据挑战。 IT和数据专业人员需要构建物理基础架构,以便在不同来源和多个应用程序之间移动数据。他们还需要满足性能、可扩展性、及时性、安全性和数据治理的要求。此外,企业必须预先考虑部署成本,因为它们可能会迅速失控。 ERP软件提供商VAI的商业智能经理Bill Szybillo说:“大数据项目面临的最大挑战之一是,如何成功应用所获得的见解。”他解释说,很多应用程序和系统都在捕获数据,但企业往往难以理解什么是有价值的数据,而且无法应用这些见解。 **文章详情:** https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=178206 上一期:[【技术之声】第五期(20220117)一周精选](https://bbs.huaweicloud.com/forum/thread-177954-1-1.html) ------------ *声明:文章源于第三方公开的信息,如内容中涉嫌侵权或存在信息不实时,请及时联系删除。* 整理者:酷哥
  • [其他] 智慧法院
    互联网法院和智慧法院是两个概念,互联网法院是一种特殊的法院类型,咱们国家有三个互联网法院,分别在北京、广州和杭州。智慧法院则是国家在进行司法系统建设方面的一个目标,而几家互联网法院都是这方面很具有示范性的建设主体。 信息化和智能化既存在本质差异也具有紧密的联系,这种联系在司法应用的语境中主要表现为:司法信息化孕育了司法智能化,司法信息化需要进化为司法智能化。 从发展阶段讲,司法智能化是司法信息化发展到一定成熟阶段的产物,智能化建设不能脱离或跨越信息化出现;从发展逻辑讲,司法智能化是建立在信息化基础设施之上的应用延伸,如果没有前期信息化的丰富积淀,智能化就无从谈起。 司法信息化向司法智能化进化源自于深度挖掘司法大数据内在价值的客观需求,源自于努力实现“让人民群众在每一个司法案件中都感受到公平正义”的司法目的,源自于全面推进审判体系和审判能力现代化改革目标的共同驱动。 人工智能研究具有高度的不确定性,需要产学研用各方面的密切合作,而信息化本身具有相对的确定性特征,主要依赖于应用需求方和工程建设方的紧密协同,这两者的建设逻辑存在本质差别。 在当前的理论研究和应用建设中,有部分观点简单地认为智能化是信息化的另一个“时髦”说法,或片面地认为按照传统的信息化建设思路再融入一些所谓智能模块,智能化就能自然实现。这些认识误区对于全面深化智慧司法建设有害无利。从 2018 年开始我们去做司法相关的研究,一个很重要的切入点就是“司法公开”。司法公开是推进司法公正、保证司法廉洁、提升司法水平的重要手段。 我国的人民法院系统近年来坚持以公开为原则、不公开为例外,开通审判流程、庭审活动、裁判文书、执行信息四大公开平台,应当说提供了全球范围内规模最大的司法公开数据资源。但是拥有数据和利用好数据是两个不同的概念,如何让社会更好的利用这个数据资源实现司法公平正义的目标,如何让人民群众更加理解和信赖我们的司法系统,这个是我们项目的宏观目标。 具体来讲,项目设置了司法公开敏感信息保护、司法公开信息有效利用、司法公开效益评估 三个方面六个课题,最终希望我们的司法公开系统拥有风险监测与控制能力、复杂上下文感知能力、社会媒体大数据理解能力。 项目团队包括了清华大学、国防科技大学、北京理工大学、中国政法大学等学术研究单位,目前项目正在包括北京市、河北省等地的多家法院进行应用示范,现在反馈的应用效果还是非常不错的。智能司法公开面临的三方面技术挑战是:缺结构、缺知识、缺反馈。具体而言,缺结构是指缺乏对数据内部结构和外部关系的理解,缺少高质量结构化数据标记;缺知识指的是司法公开系统缺乏对于司法本体、司法理论体系、司法政策理念、司法实务经验的认识;缺反馈是指缺乏准确的性能评价方法,难以形成改进的闭环。审判流程、庭审活动、裁判文书、执行信息四大公开平台的建立,已经完成了司法信息获取的第一个重要任务,即司法活动本身的信息化,接下来我们还有两个重要的任务要完成: 首先是确定什么信息可以被公开,什么不适宜公开。周强院长曾经明确指出,司法公开以公开为原则、不公开为例外,但是一旦不该公开的公开了,可能会对整个司法公开的运行形成极大的影响。如何在保证人民群众知情权的同时避免敏感信息的泄露,这种风险感知的能力是司法公开应用中一个非常关键的任务,也是我们在开始做这个司法公开的项目时关注比较少的。 其次是如何把确定可以公开的信息公开好,在信息爆炸的时代,我们的注意力是稀缺资源,太多的数据等于没有数据。如何理解高度异质化的用户在特定上下文背景下的信息需求,是司法信息获取中的另一个重要任务。这个任务其实一点也不简单,并不是现成的用户理解方法在司法场景的简单应用,而是要对司法本身的知识体系做深层次的理解和挖掘。我自己办公桌上除了计算机专业书籍之外,也有法学专业的理论和实务书籍,类案检索的算法设计有琢磨不清楚的时候,看看这些书,尝试从司法从业人员的角度思考一下问题,往往能得到新的研究思路。司法是维护社会公平正义的最后一道防线。人工智能在司法场景的应用需要同时兼顾效率价值和公正价值。 人工智能应用于司法,首要的元素是尊重法官的主体地位,其次是通过大数据、人工智能技术等的应用,推进审判体系和审判能力现代化,更好的服务于法官和整个司法系统,创造更高水平的数字正义。同时,在应用技术成果的过程中,也要注意避免算法本身引入新的不公平因素,这样才能更好的实现“努力让人民群众在每一个司法案件中感受到公平正义”的目标。​​​​
  • [技术干货] 回顾与展望:开源、智能化、隐私安全等八大数据库发展趋势
    新年换旧年之际,便到了盘点时间。随着数字经济不断发展,数据库的重要性愈发凸显。数据库技术有怎样的发展新趋势?ITPUB&IT168结合一些大会上嘉宾的演讲、采访,以及对市场的观察和理解,梳理出数据库技术八大趋势:开源、智能化、隐私安全、软硬一体、上云、分布式、细分场景、架构融合。01、开源:开源上升为国策联合创新发力生态在《开源的诱惑——数据库篇》中,我写道:开源如一个意气风发的少年,在数据库领域大展拳脚。2021年初,根据DB-Engines的数据,开源数据库license数量首次超过商业数据库,这是开源数据库的里程碑,近两年开源数据库厂商融资屡创新高,不断刷新数据库单笔最高融资纪录。Gartner预计,到2025年,与目前的IT支出相比,超过70%的企业将增加开源软件方面的IT支出。开源社区被誉为当今科技领域最具创新的一种组织方式,专家强调数据库作为公认最为复杂跨技术领域最多的基础软件,也要充分利用开源和发展开源,广泛吸纳全产业力量。尤其国内,一系列政策利好开源发展,开源纳入“十四五”规划,成为国家战略,去年11月底,工信部印发《“十四五”信息化和工业化深度融合发展规划》指出,开源软件已经成为软件产业创新源泉和“标准件库”。同时,开源开辟了产业竞争新赛道,基于全球开发者众研众用众创的开源生态正加速形成。近年来,越来越多主流数据库产品选择开源来完善生态,打磨产品。比如,openGauss、PolarDB、OceanBase、浪潮云溪等选择开源……业内人士指出开源发展的需要在开放源码与商业发展之间找到平衡,而当前目国内开源生态还面临发展基础较弱、底层技术掌控不足、开源文化氛围不浓、政策支持有待加强等制约因素。02、智能化:AI与数据库结合智能化发展北航计算机学院童咏昕教授在openGauss Summit2021峰会上指出,从学术研究角度,AI与数据库结合的智能化成为最近几年数据库顶级会议里非常热门的研究主题之一。智能化分为两个方面,AI for DB,运用AI技术优化经典数据库算法。DB for AI,运用数据库技术提升人工智能性能。AI for DB方面,童咏昕介绍,传统的经典数据库优化算法称为理性主义,是问题导向,针对问题直接设计算法策略,不需要依赖数据库可以直接求解,在 最坏情况下算法性能具有理论保证。最近几年尤其是2018年之后学习型算法开始流行,可以称之为经验主义,数据导向。通过学习数据分布指导模型设计,在数据服从给定分布时能够取得更优效果,可以使数据库优化算法更快,但并不是有了学习算法就无敌了,更重要的是如何把经典的理性主义和数据驱动经验主义做有机融合,这是未来非常火的方向。DB for AI方面,近两年数据库顶级学术研究尤其在产业研究中多篇论文都共识了一个问题,机器学习的实战性能问题,很大一部分原因是来自数据库问题,数据库经典技术优化不好导致机器学习性能不好。数据库如何协助机器学习的技术也是最近几年非常热门的研究主题。03、隐私安全:法律法规监管加强以技术解决合规问题在数据库研究领域,隐私安全是数据库长期关注的主题。童咏昕指出,隐私和安全是两件事,安全关心计算过程的安全,隐私所强调的是拿出结果不能反推回原始数据。上世纪80年代已经开始提出了安全计算,而隐私计算从最简单的脱敏,到匿名化隐私,再到现在相关法律法规下如何合规处理数据,带来了挑战。2021年数据库顶级会议提出把数据库隐私研究和法律合规嫁接在一起。目前有很多合规要求,在不同隐私和安全约束下,如何自动用基础算子高效集成是最近几年在数据库研究中隐私安全的热点。此外,多实体间如何进行安全高效的数据共享也是数据库技术热点。传统大数据计算是计算不动数据动的架构,在传统架构下需要数据离开本地,但是法律法规要求数据不能离开本地,需要数据不动计算动。数据不动计算动的联邦计算框架区别于传统集中式共享,保护各方数据隐私安全。海量移动设备的端侧拥有大量隐私数据,通过联邦学习,保证个人敏感数据不离开端侧设备本地。最近几年可信执行环境(TEE)是非常火热的话题,比如,软硬结合的高效密态数据库系统,基于TEE的有限内存约束,设计高效的密态数据库框架。利用TEE提升设备的安全计算性能,构建面向海量设备的数据联邦等。如何真正执行安全多方计算,如何高效执行同态加密,这些都是未来数据库发展中安全可信技术的基石,软硬协同也非常重要。04、软硬一体:新硬件带来的机遇和挑战软硬一体化是当下数据库研究热点之一,主要因为新硬件技术为数据库领域带来机遇与挑战。有专家曾经指出,数据库首先是一个系统,而系统就需要能够安全高效地使用有限的硬件资源。所以数据库系统的设计和发展和硬件的发展紧密相关,数据库系统设计需要考虑新硬件所带来的变化。童咏昕在演讲中指出,在存储、网络、计算层面,新硬件都发挥着软硬结合的威力。比如在计算层面,新硬件如何优化数据库中的智能计算,如何支撑数据的隐私安全需求成为热点研究主题。面向数据处理的专用硬件不断产生,近年来除了CPU、GPU外,TPU、NPU等各式各样面向人工智能专用型芯片在不断产生,可以利用专用芯片优化数据库中的智能计算,而CPU与GPU合理协同也是当下研究热点,CPU与GPU混合的数据库查询处理,结合不同计算内核特点进行协同异构计算。05、上云:云原生到DBaaS上云是大势所趋,Gartner预计,到2022年,所有数据库中的75%将被部署或迁移到云平台,只有5%被考虑遣返到本地环境。到2023年,云数据库收入将占数据库市场收入总额的50%。根据日前IDC发布的《2021年上半年中国关系型数据库软件市场跟踪报告》显示,2021上半年中国关系型数据库软件市场公有云关系型数据库规模6.7亿美金,同比增长50.1%。IDC发现,云数据库厂商寻求在私有云、行业客户等传统数据库市场发展,本地部署数据库市场竞争加剧。由于利用了云资源的优势,云数据库具备弹性好、计费模式便捷、套件生态好等特点。不过上云并一定能够节省成本,中小企业成本会降低,大型企业可能会不降反升。在云时代,数据库的演化经历了从采购License自建到云上托管数据库,再到云原生数据库的转变。在OLAP场景下,Snowflake为云原生数据库的发展做出了很好的表率。云原生最大的特点是计算存储分离,有业内专家指出,计算存储分离还不够,未来计算、存储、网络、内存等都要分离解耦,随着未来企业逐步上云,底层基础设施云化,数据库不用关注底层的硬件CPU、磁盘、网络等,而是直接面向各类云服务,资源池化、容器化,真正实现多租户应用架构,订阅收费。如此才能更好发挥云的弹性、扩展、高可用等能力。云时代一切皆向服务化发展,DBaaS(数据库即服务)的时代将要到来。06、分布式:从预演到大规模落地随着摩尔定律的失效,当数据量达到一定量级时,单体集中式架构的瓶颈愈发明显,采用分布式数据库往往是必经之路。总体来看,由于国内企业组织有更大的规模和数据量,对于应用分布式数据库更为迫切。国产数据库寄希望于通过分布式数据库实现变道超车,近几年国产数据库不断成长,在一些难点如分布式事务性、一致性,以及数据容错、灾备等高可用能力方面取得了突破,分布式数据库进入到落地阶段。这一变化可以在DTCC大会上有直观的感受,一位专家在参加完DTCC2021大会后指出,几年前分布式、一致性与CAP/BASE等话题等相关技术细节话题是DTCC大会热点,近两年在DTCC已经没有嘉宾专门演讲相关主题,说明分布式与分布式事务、一致性等这些东西在技术界已经达成共识,在这几年也已经纷纷落地为产品。在政策层面分布式数据库迎来利好,2021年11月底,工信部印发的《“十四五”信息化和工业化深度融合发展规划》明确,加速分布式数据库等产品研发和应用推广。近几年分布式数据库投产金融核心系统的消息不断出现,经过前期大量的预演和准备工作,2022年分布式数据库在国内的落地值得期待。07、细分场景:图数据库、时序数据库细分场景应用成为数据库的一大趋势。图数据库以及时序数据库的发展是细分场景应用的代表,根据DB-Engines,从2013年图数据库流行度趋势一骑绝尘,DB-Engines 从 2014 年起也把时序数据库作为独立的目录进行分类统计,如上图,其流行度发展势头仅次于当红炸子鸡图数据库。2019年开始,DTCC大会设置了图数据库专场,在DTCC2021数据库技术大会,图数据库专场比较火爆受到广泛关注,时序数据库相关的演讲主题也多了起来,通过梳理发现,2021年不少时序数据库创业公司获得了融资。图数据库是一个使用图结构进行语义查询的数据库。图是天生为相关性而生,典型的应用场景如欺诈检测,通过将问题解构为图,更容易在现有数据中获得重要的见解。有国外图数据库专家指出,图数据库方面中外基本处在同一起跑线,甚至在新软硬件协同方面走在前面。有专家指出,目前,图数据库还存在许多挑战需要解决,比如数据的完备性、一致性,对分布式事务的支持以及与OLAP 和 OLTP 融合等。当前,万亿大图、大规模处理以及与新硬件的融合是图数据库的热点话题。时序数据库全称为时间序列数据库,时序数据库指主要用于处理带时间标签(按照时间的顺序变化,即时间序列化)的数据,随着5G商用启动,IoT不断发展,进入到万物互联时代,时序数据作为大数据、机器学习、实时预测、预警的基础数据的作用更加显著,堪称万物互联时代的基石,时序数据库将迎来重大发展机遇。08、架构融合:HTAP、湖仓一体、多模、集中式与分布式一体化架构融合的趋势之一是HTAP混合负载场景的发展,产业界当前正基于创新的计算存储框架研发HTAP数据库,其能够基于同一套引擎同时支撑业务系统运行和分析决策场景,避免在传统架构中,在线与离线数据库之间大量的数据交互。在数据驱动决策的大势所趋下,HTAP在实时数据分析处理方面的优势愈发明显。湖仓一体(Lakehouse)也是目前架构融合的一大趋势,Snowflake、Databricks是其中的代表。湖仓一体解决了传统数据库仓库在数据类型支持上的局限性,可以支持结构化、非结构化、半结构化多种数据类型。湖仓一体(Lakehouse)需要打通数据仓库和数据湖两套体系,让数据和计算在湖和仓之间自由流动。架构融合的另一大趋势是多模(Multi-Model),Gartner 曾在 2017 年预测多模数据管理将成为未来的主要趋势,多模架构逐渐成为主流数据库的选择。2010 年以来,随着移动化的发展以及数字化转型的逐步深化,快速变化的业务场景越来越复杂多元,半结构化、非结构化数据海量增长,单模型数据库虽然优化了数据存储和处理,却难以满足日趋增长的多样化业务场景需求。复杂多元的业务场景往往需要使用多种数据模型,以及数据模型间的融合。从单一数据管理系统到融合型、多模型数据管理系统成为数据库发展趋势。集中式与分布式一体化融合,OceanBase提出的第三代企业级分布式数据库所拥有的一体化架构特性,集中式与分布式一体化融合是一个比较新的概念,数据库系统同时具备分布式与集中式系统的技术优势,即使使用一台机器不用分布式时性能、功能不损失,而且能够随时进行分布式扩展。业务初期一台机器就可以先用起来,随着业务增长系统能力遇到瓶颈再做扩展。回看数据库发展趋势,我们可以看到天下大势分久必合合久必分,业务场景复杂多元化需求催生了图数据库、时序数据库等满足细分场景的数据库发展,而多个单模数据库所带来的管理复杂度等因素又促进多模融合架构发展。世上没有完美的数据库,也从来没有一款数据库可以包打天下,只有适合自己业务的数据库。面对百花齐放的数据库,如何进行数据库选型?ITPUB&IT168将在2022年推出数据库选型相关选题,敬请关注。文章来源:http://blog.itpub.net/69925873/viewspace-2853329/
  • [知识分享] 【大数据系统】MRS HetuEgine的数据虚拟化实践
    >摘要:华为MRS云原生数据湖平台的HetuEngine就是一款解决大数据时代跨源跨域问题的数据虚拟化引擎。本文分享自华为云社区[《基于华为云原生数据湖MRS HetuEgine的数据虚拟化实践》](https://bbs.huaweicloud.com/blogs/307420),作者: 前锋 。 数据虚拟化是指一种数据管理方式,允许应用在不关心数据源的数据格式及物理存储位置的情况下以一种统一的方式获取和使用整个组织中所有的数据。与数据虚拟化方式对应的一种方式是传统的ETL方式,数据经过抽取、转换和装载的过程,将不同系统的数据收集到一个统一的物理系统中,并经过标准化处理进行格式的统一。数据虚拟化的特点是不改变数据存储位置,实时访问。根据Gartner发布的数据管理技术成熟度曲线,数据虚拟化技术已经进入了生产成熟期,相关理论和技术也已经成熟,如果企业正在受困于各系统或者各部门数据无法高效打通的问题,可以考虑采用数据虚拟化技术。 早期的一种数据虚拟化实践是数据库联邦,在不同的数据库之间建立JDBC/ODBC连接的方式,以标准SQL的方式跨数据库进行数据实时访问。这种方式在传统数据库模式下一定程度上解决了跨数据源实时数据访问的问题。但是在大数据时代,数据的存储和访问方式已经完全不同,每种数据处理组件只解决一个特定的场景问题,具有不同的数据存储方式、组织方式和访问方式。如Hdoop用于解决大规模数据的批量计算,Hbase用于海量数据的实时精确检索,ElasticSearch用于海量数据的综合检索,还有MPP数据库、图数据库、内存数据库、时序数据库等等,百花齐放,百家争鸣,共同形成了大数据时代的数据处理技术栈,解决各个场景下的大规模数据处理问题。在实际的应用中,为了满足业务不同维度的需求,往往在同一个业务中同时使用了不同的处理组件,甚至是分布在不同地域的不同数据处理组件,造成了业务复杂度高,数据冗余,访问效率低等问题。 大数据时代的数据虚拟化技术就是要解决这种跨源跨域场景下的数据高效访问问题,以一种统一的接口,接近原生系统的性能,跨地域的方式进行数据访问。而要满足上述要求,一个数据虚拟化产品需要具备下面的四个功能: - 统一元数据管理。具备全局数据的统一视图,包括数据承载的组件、数据的Schema、数据存储的格式、存储位置等。 - 抽象数据访问层。提供数据访问的抽象层,屏蔽不同数据源的接口差异,在访问层以一种统一的接口面向应用层。 - 统一的安全管控。全局统一安全管控策略,所有数据的访问在安全管控的框架下进行,避免数据越权访问。 - 多源结果集合并。来自不同集群,不同组件的结果数据可以关联、合并,以一个完整的结果集返回给应用层。 华为MRS云原生数据湖平台的HetuEngine就是一款解决大数据时代跨源跨域问题的数据虚拟化引擎。如下图是MRS云原生数据湖平台基于HetuEngine构建的逻辑数据湖平台架构。HetuEngine可以跨Hadoop平台、MPP数据库、数据集市(包括Hbase、ElasticSearch、Clickhouse等)进行跨源访问,并提供统一的SQL接口供上层应用进行数据访问。HetuEngine还支持跨集群数据访问,实现高性能的跨数据湖、数据仓库、数据集市的分析查询。适用多个数据湖或者数据平台联合分析,支持用户间资源隔离,支持全局数据权限管理。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/202201/21/142347kwsdrhcqj0ik0hfu.png) 现在,HetuEngine已经帮助众多政企客户解决了在大数据场景下面临的用数难,取数难的问题。某大型国企就利用了HetuEngine的跨域分析能力解决了困扰其很长时间的全域数据实时访问的问题。 该大型国企有众多下属省公司,分布在全国各地,每个省公司都建设有自己的数据湖平台,用于支撑省公司内部的数字业务。各省公司每天要将自己的数据上报给集团公司,集团公司再对全国数据进行统一汇总加工处理,用于支撑集团层面的业务决策。这种方式面临以下几个问题:(1)数据上报不完整。由于带宽限制,只能上报部分结果数据,无法将全部的明细数据上报,部分需要明细数据的业务无法在集团层面开展。(2)数据上报延迟。子公司将数据加工后,分批上报集团公司,数据延迟在小时级别,无法支撑集团实时业务的开展。(3)资源投入太大。随着业务的发展,集团需要的数据越来越多,资源池原来越大,投入和产出无法匹配。(4)数据需求响应不及时。新的数据需求只能通过对分公司提数据需求,重新开发数据流程上报的方式满足,效率太低,无法支撑业务的时效性需求。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/202201/21/142406hiyiksnj3h2qjwoe.png) 如上图所示,在旧模式下,所有的数据只能通过定时上报的方式收集到集团集中化大数据平台,再进行分析,供上层业务使用。引入HetuEngine后,上报的数据只是每天固定模型加工的数据,明细数据和临时汇总数据均可以通过HetuEngine进行实时的查询。通过HetuEngine不仅实现了高效的实时数据查询,还可以通过HetuEngine进行跨省公司的数据关联分析,打破了省公司之间的数据墙,大大提高了跨域数据分析的效率。 HetuEgine通过自己的跨域查询引擎,可以将一个复杂的跨域查询任务根据数据所在的位置将查询下发到数据所在的集群执行,充分利用边缘集群的算力,提高数据分析的效率和整体的资源利用率。如下图的一个场景,要统计年龄为35岁,在两个省同时开户的用户。可以通过一个SQL同时查询两个省公司的数据。HetuEngine将这个SQL下推到两个省公司集群执行,并将执行结果返回给集团公司进行统一汇总,直接向业务层返回最终的汇总结果。整个过程都是自动实时的进行,并且充分利用了边缘集群的算力,集团公司只需要消耗少量的带宽和算力就完成了整个计算过程。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/202201/21/142421qevqbjs5yvp0bry9.png) HetuEngine在跨域场景下也充分考虑了整个计算过程的可靠性和安全性。数据访问遵循统一的安全管控模型,对远程数据访问进行细粒度的管控。数据传输过程采用加密传输,保障数据传输过程中的安全。考虑到跨地域的查询通常是传输带宽受限的场景,HetuEngine支持流量管控,防止由于查询结果集过大导致占满传输带宽,影响其他业务。此外,HetuEngine还综合采用了抗网络抖动、断点续传、压缩传输、级联查询等手段提高跨域查询的稳定性和效率。 最终,借助HetuEngine提供的数据虚拟化能力,该集团公司打造了一套高效的全域数据统一查询分析平台。首先,实现了全域数据在集团层面真正的统一,利用HetuEngine可随时访问集团所有省公司的数据。其次,减少了集团公司集群的压力,将大量的数据分析任务下发给省公司集群完成,充分利用省公司边缘集群的算力。然后,提高端到端的数据访问时延,数据由之前的小时级的延迟到现在可以秒级查询省公司集群数据。最后,借助HetuEgine跨源跨域查询能力,可以直接将分布在不同省不同存储组件中的数据在HetuEngine中进行关联分析,打破了数据之间的隔离,带来了很多新的数据应用场景,进一步挖掘了数据的价值。
  • [技术干货] 10个大数据挑战以及应对方法
    执行良好的大数据战略可以简化运营成本、缩短上市时间并支持新产品。但是,在将董事会讨论的大数据举措付诸实践的过程中,企业面临着各种大数据挑战。IT和数据专业人员需要构建物理基础架构,以便在不同来源和多个应用程序之间移动数据。他们还需要满足性能、可扩展性、及时性、安全性和数据治理的要求。此外,企业必须预先考虑部署成本,因为它们可能会迅速失控。也许最重要的是,企业首先需要弄清楚大数据如何以及为什么对他们的业务很重要。ERP软件提供商VAI的商业智能经理Bill Szybillo说:“大数据项目面临的最大挑战之一是,如何成功应用所获得的见解。”他解释说,很多应用程序和系统都在捕获数据,但企业往往难以理解什么是有价值的数据,而且无法应用这些见解-以一种有影响力的方式。从更广泛的角度来看,下面的建议可帮助企业了解这10个大数据挑战以及如何解决这些挑战。1. 管理大量数据就其定义而言,大数据通常涉及存储在不同系统和平台中的大量数据。Szybillo表示,企业面临的第一个挑战是将他们从CRM和ERP系统以及其他数据源中提取的超大型数据集整合到统一且可管理的大数据架构中。他说,当你对正在收集的数据有所了解,通过进行小的调整就可以更容易地缩小见解。要实现这一点,请构建允许增量更改的基础架构。尝试做较大改变可能最终会产生新的问题。2.发现和修复数据质量问题当数据质量问题蔓延到大数据系统时,基于大数据构建的分析算法和人工智能应用程序可能会产生糟糕的结果。随着数据管理和分析团队试图引入更多不同类型的数据,这些问题可能会变得更加严重和难以审计。Bundler是一个在线市场,用于寻找帮助人们购买产品和安排发货的网络购物助手,当它扩展到500,000名客户时,就经历了这样的问题。该公司的关键增长动力是利用大数据提供高度个性化的体验、识别追加销售机会,并监控新趋势。有效的数据质量管理是关键问题。Bundler首席执行官Pavel Kovalenko说:“你需要不断监控和修复任何数据质量问题。”他说,重复条目和拼写错误很常见,尤其是当数据来自不同来源时。为了确保他们所收集数据的质量,Kovalenko的团队创建了一个智能数据识别器,该识别器将重复数据与较小的数据差异进行匹配,并报告任何可能的拼写错误。对于通过分析数据生成的业务见解,这可帮组提高准确性。3. 应对数据集成和准备复杂性开源分析平台供应商Knime首席数据科学家Rosaria Silipo称,大数据平台解决了收集和存储大量不同类型数据的问题,并可快速检索分析使用所需的数据。但数据收集过程仍然非常具有挑战性。企业收集的数据存储的完整性取决于它们的不断更新。这需要保持对各种数据源的访问,并拥有专门的大数据集成策略。有些企业使用数据湖作为包罗万象的存储库,以存储不同来源收集的大数据集,而没有考虑如何集成不同的数据。例如,各种业务领域会产生对联合分析很重要的数据,但这些数据通常带有不同的底层语义,企业必须消除歧义。Silipo告诫不要对项目进行临时集成,这可能涉及大量返工。为了获得大数据项目的最佳投资回报率,通常最好制定战略方法以支持数据集成。4. 高效且经济地扩展大数据系统如果企业没有关于如何使用大数据的策略,他们可能会浪费大量资金来存储大数据。技术和服务提供商ZL Tech的企业解决方案负责人George Kobakhidze表示,企业需要了解大数据分析始于数据摄取阶段。管理企业数据存储库还需要一致的保留策略,以循环淘汰旧信息,尤其是现在,因为COVID-19疫情前的数据在当今市场上通常不再准确。云管理平台供应商CloudCheckr的产品副总裁Travis Rehl说,因此,数据管理团队应该在部署大数据系统之前,规划好数据的类型、模式和用途。但这说起来容易做起来难。他表示:“通常,你从一个数据模型开始并进行扩展,但很快意识到该模型不适合你的新数据点,并且你突然需要解决技术债务。”具有适当数据结构的通用数据湖可以更轻松地有效且经济地重用数据。例如,Parquet文件通常比数据湖中的CSV转储提供更好的性能成本比。5. 评估和选择大数据技术数据管理团队有多种大数据技术可供选择,而且各种工具的功能往往重叠。NoSQL数据库公司Aerospike的首席战略官Lenley Hensarling建议团队首先考虑来自流和批处理源的数据的当前和未来需求,例如大型机、云应用程序和第三方数据服务。例如,需要考虑的企业级流媒体平台包括Apache Kafka、Apache Pulsar、AWS Kinesis和Google Pub/Sub,所有这些平台都提供云计算、本地和混合云系统之间的无缝数据移动。接下来,团队应该开始评估复杂数据准备能力,为人工智能、机器学习和其他高级分析系统提供数据。规划数据的处理位置也很重要。对于存在延迟问题的情况,团队需要考虑如何在边缘服务器上运行分析和AI模型,以及如何轻松更新模型。企业需要平衡这些功能与部署和管理在本地、云端或边缘运行的设备和应用程序的成本。6. 生成业务见解数据团队倾向于关注大数据技术,而不是结果。在很多情况下,Silipo发现人们很少关注如何处理数据。从企业中的大数据应用程序中生成有价值的业务见解需要考虑各种场景,例如创建基于KPI的报告、识别有用的预测或提出不同类型的建议。这将需要具有机器学习专业知识的业务分析专业人士、统计学家和数据科学家的共同努力。她说,这些团队与大数据工程团队合作可以帮助提高构建大数据环境的投资回报率。7. 雇佣和留住具有大数据技能的员工软件开发和IT外包公司SenecaGlobal战略高级副总裁Mike O’Malley表示:“大数据软件开发面临的最大挑战之一是寻找和留住具有大数据技能的员工。”这种特殊的大数据趋势不太可能很快消失。S&P Global的一份报告发现,云架构师和数据科学家是2021年需求最大的职位之一。填补这些职位的策略是与已经建立人才库的软件开发服务公司合作。提供免费IT培训的慈善机构ComIT的创始人兼所有者Pablo Listingart说,另一个策略是与HR合作,找出并解决现有大数据人才的任何缺口。他表示:“很多大数据计划之所以失败,是因为从项目开始到结束的错误预期和错误估计。”合适的团队将能够估计风险、评估严重性并解决各种大数据挑战。建立吸引和留住合适人才的文化也很重要。客户数据平台供应商Meiro的首席技术官Vojtech Kurka说,他一开始的设想是,他可以在正确的位置使用一些SQL和Python脚本来解决所有数据问题。随着时间的推移,他意识到,他可以取得更大的进步-通过雇用合适的人,并推广一种让人们快乐和积极的安全公司文化。8. 防止成本失控数据集成公司AtScale的创始人兼首席技术官David Mariani称,另一个常见的大数据挑战是“云账单心脏病发作”。很多企业使用现有的数据消耗指标来估计新的大数据基础设施的成本,但这是一个错误。其中一个问题是,企业低估了对计算资源的需求,更丰富数据集带来更广泛的访问,这需要更高的计算资源。特别是,云计算让大数据平台更容易呈现更丰富、更细化的数据,这种能力会推高成本,因为云系统将弹性扩展以满足用户需求。使用按需定价模型也会增加成本。一种好的做法是选择固定资源定价,但这并不能完全解决问题。尽管计量器停止在固定数量,但编写不佳的应用程序最终可能仍会消耗影响其他用户和工作负载的资源。因此,另一个好的做法是对查询实施细粒度的控制。Mariani称:“我见过几个客户,由于SQL设计不佳,用户编写了10,000美元的查询。”CloudCheckr公司的Rehl还建议,数据管理团队在与业务和数据工程团队讨论大数据部署时,提前提出成本问题。定义它的要求是企业的责任;软件开发人员应负责以有效格式交付数据,DevOps负责确保监控和管理正确的归档策略和增长率。9. 管理大数据环境随着大数据应用程序跨更多系统增长,数据管理问题变得越来越难以解决。随着新的云架构使企业能够以非聚合形式捕获和存储他们收集的所有数据,这个问题变得更加复杂。受保护的信息字段可能会意外潜入各种应用程序。Mariani 称:“根据我的经验,如果没有数据治理策略和控制,可能会失去更广泛、更深入的数据访问的大部分好处。”好的做法是将数据视为一种产品,从一开始就制定内置的治理规则。在前期投入更多时间在识别和管理大数据治理问题,将更容易提供自助服务访问,而不需要监督每个新用例。10. 请确保理解数据背景信息和用例企业还倾向于过分强调技术,而不了解数据的背景信息及其对业务的用途。数据争论工具提供商Trifacta公司首席执行官Adam Wilson说:“企业通常投入大量精力在考虑大数据存储架构、安全框架和摄取方面,但很少考虑引导用户和用例。”团队需要考虑谁将提炼数据以及如何提炼数据。那些最接近业务问题的人需要与最接近技术的人合作,以管理风险并确保正确对齐。这涉及到思考如何使数据工程民主化。构建一些简单的端到端用例也有助于获得早期胜利、了解限制并吸引用户。文章来源:  TechTarget中国,只为分享、交流,如有涉嫌侵权,请联系删除!
  • [技术干货] 数据库产业发展综述
    本文节选自中国信通院于2021年6月24日在“2021大数据产业峰会”上发布的《数据库发展研究报告(2021年)》全球数据库产业生态成熟壮大,在发展过程中,逐渐细分出数据库产品、数据库服务和数据库支撑体系三个细分产业。(一)数据库产业概述数据库产品主要由关系型数据库、非关系型数据库、混合型数据库及数据库周边工具构成。数据库服务是指围绕数据库的咨询规划、实施部署和运维运营等环节,为数据库系统的正常、高效、持续、安全使用提供信息技术服务工作。数据库支撑体系由从事数据库学术研究、人才培养、开源社区、评测认证等工作的相关主体共同构成。据中国信通院测算,2020年全球数据库市场规模为671亿美元,其中中国数据库市场规模为35亿美元(约合240.9亿元人民币),占全球5.2%。预计到2025年,全球数据库市场规模将达到798亿美元。中国的IT总支出将占全球12.3%。我们预计,中国数据库市场在全球的占比将在2025年接近中国IT总支出在全球的占比,中国数据库市场总规模将达到688亿元,市场年复合增长率(CAGR)为23.4%。(二)数据库产品本节主要聚焦国内数据库产品提供商、产品分布及市场竞争三方面,并逐一展开分析。1.企业主体大部分仍处于发展初期阶段据中国信通院统计分析,截止2021年5月底,我国数据库产品提供商共计80家。成立时间呈现两个热周期。从企业成立时间看,我国数据库企业成立时间主要集中在1999-2000年和2013-2017年两个时间段,数量分别是12个和38个,依次占比15%和48%。上世纪90年代,以Oracle、DB2等为代表的国际商业数据库进入大陆市场,先后在电信、金融、政务等重要行业拿下大单,应用于各类核心系统和周边系统。国内也由于顶层设计加码,掀起一股国产数据库的浪潮。2012年,大数据成为国家级发展战略。在此背景下,我国涌现出一大批以大数据和数据库为主营业务的初创公司。2015年,平凯星辰、星瑞格、华胜信泰、上海丛云、恒辉信达等企业成立。2016至2018年,图数据库和时序数据库关注度不断提升,以费马科技、创邻科技、欧若数网、蜀天梦图等为代表的初创图数据库企业相继成立,以浙江智臾、涛思数据等为代表的时序数据库企业不断涌现,政策利好与资本关注为我国数据库产业不断注入新活力,国产数据库产业迎来第二轮浪潮。地域分布以一线城市为主。总部分布情况代表企业所在城市对数据库产业的重视与发展程度。从企业总部的数量看,由于人才规模聚集效应,企业总部通常设在超一线城市,数量最多的前五名是北京、杭州、上海、成都和深圳,分别是43、9、7、3、2个,占企业总数约为54%、11%、9%、4%和3%,除此之外,济南、南京、天津、武汉、广州、贵阳、福州、合肥和乌鲁木齐等直辖市和省会城市平均孵化出1-2个数据库企业。员工数量普遍在百人以下。我国数据库企业人员平均人数约为184人,最高为1200人左右规模,最低为10人左右规模。其中21-50人左右规模企业占比最高,数量34个,比例达到43%,人数在51-100人左右规模次之,数量为12个,占比15%,101-200人和201-300人规模并列第三,均为10个,分别占比13%,由此可见,我国数据库虽然数量众多,但平均从业人员数量较少,仍在快速发展阶段。平均专利数量不足五十个。我国数据库企业针对数据库领域的平均专利数量(含国内外专利)为38个,最高为500个左右规模,数量为0的企业个数是19个,占比24%。拥有专利数0-4个的企业占比最高为51%,专利数5-10个的企业次之,占比14%,专利数21-50个的企业数量排名第三,占比12%。从企业专利数量上看,Oracle以1.4万个全球领先,SAP居次席,国内数据库的全部企业技术专利累计千余,仍有较大发展空间。2.产品类型仍以关系型为主,非关系型产品正在快速发展我国数据库产品数量分布呈现以关系型为主,非关系型及混合型数据库为辅的局面。数据库产品根据研发方式不同,分为完全自研和基于开源二次研发两类。我国关系型数据库产品多数基于MySQL和PostgreSQL二次开发而来。据中国信通院统计分析,截止2021年6月,我国数据库产品共有135款。其中关系型数据库81个,非关系型数据库有54个,占比分别为60%和40%。按二级细分类别,以云服务为主要服务交付方式的关系型云数据库19个;非关系型数据库中,键值型数据库5个,列存数据库3个,文档数据库4个,图数据库13个,全文检索数据库1个,在非关系数据库中依次占比9.26%、5.56%、7.41%、24.07%和1.85%,由于一些不可控因素,其余非关系型数据库的数据模型暂不可知。关系型数据库中基于开源数据库MySQL和PostgreSQL进行二次开发的个数分别为23和24个,依次占关系型数据库比例为28.40%和29.63%,总计占58.03%。我国非关系型数据库产品发展势头良好,逐渐受到国际认可。非关系型数据库中以基于开源数据库如Redis、InfluxDB、CouchDB等产品进行二次开发为主。时序数据库因其存储处理海量时序数据的特性,常应用于工业控制、物联网、车联网等领域。据中国信通院统计分析,我国时序数据库从2000年后迅速发展,产品数量已达15款,1款为开源数据库,其余均为商业数据库。4个由云厂商提供,还有来自石化、电力、钢铁等传统工业实时数据库企业的产品9个。同时根据DB-Engines官网显示,2021年5月的时序数据库的流行度排名中,我国上榜的数据库产品已有两个,分别是浙江智臾和阿里云TSDB,依次位列第11和第21名。由于图数据库能够支撑社交网络、金融反欺诈等互联网与金融场景的关联分析业务,所以行业关注热度自2016年以来逐渐升温。我国图数据库产品数量为13款,自研程度较高,自研产品占总数比例为69.23%。从供应商类型看,初创公司、云厂商、高校纷纷入局,其比例分别为7:5:1。根据DB-Engines官网显示,2021年5月的图数据库的流行度排名中,我国上榜的数据库产品有3个,分别是欧若数网Nebula Graph、华为云GraphBase和百度智能云开源产品HugeGraph,依次位列第15、第28和第30名。3.市场份额正逐渐倾向云上,线下市场迎来激烈竞争线上市场呈现快速增长。随着云计算技术不断成熟,云上数据库市场快速增长。根据Gartner公司2019年发布的市场分析,2017年至2018年的全球数据库产业总营业额的18.4%增长中,云数据库管理产品的营业额占比68%,而Microsoft与亚马逊的AWS占到总增长的75.5%。同时根据2021年Gartner对数据库产品提供商的排名情况看,Microsoft凭借云数据库的后发优势,抢占了Oracle已经持续占据十年的榜首位置,前十名中已经有四家以云服务为主要供应方式的企业,分别为Microsoft、Amazon、Google和阿里云。据中国信通院统计分析,2020年,中国公有云数据库市场规模为107.68亿元,未来5年,公有云数据库市场年复合增长率将达到36.1%,预计到2025年,中国公有云数据库市场总规模将达到503.31亿元。Gartner预测到2023年,全球数据库市场中75%的数据库将完成到云平台的迁徙,仅有5%的数据保持在原本的本地模式当中。线上市场格局巨头涌现。中国信通院调研显示,阿里云、华为云和腾讯云作为我国头部云服务商,其在云计算基础设施、应用生态、用户渠道等方面处于领先地位,云上数据库作为云基础设施的延续与发展,具备天然先发优势。2020年,上述三家云服务商公有云数据库总营收约占中国公有云数据库市场份额75.5%。以电商、游戏、短视频等为主营业务的互联网公司是线上数据库的服务对象。出于对业务特性和生态兼容考虑,约83%的云上客户倾向选择MySQL、Redis、MongoDB、InfluxDB等开源数据库。存量市场替换空间可观,线下市场迎来激烈竞争。2020年数据库传统部署模式市场为133.22亿元,随着市场倾向的变化,传统部署市场替换国外数据库空间巨大。以关系型数据库为例,2017年以前市场格局十分稳定,Oracle、IBM、Microsoft、Teradata等为代表的产品占据数据库传统部署模式市场份额90%以上,以达梦、人大金仓、南大通用、神舟通用为代表的国产数据库,通常聚焦于军工、政务等封闭领域,整体市场份额较小,如今电信、金融等重要行业数据库改造变更需求不断,相关存量市场前景诱人。随着技术层面的分布式改造需求不断以及市场层面自发选择国产产品倾向,国产数据库市场份额有望得到大幅提升,各企业纷纷抢抓战略机遇,不断迭代打磨产品能力,抢占市场份额。据中国信通院大数据产品能力评测十二批结果显示,国产数据库供给能力较几年前得到大幅提升,产品功能逐渐完善,集群规模与日俱增,性能表现不断攀升,市场竞争程度较为激烈。初创企业和巨头陆续投身开源市场。开源已成为数据库产业的共识,2021年1月,DB-Engines官网显示,开源许可证流行度首次超过商业许可证,开源数据库迎来新纪元。截止2021年6月,开源与商业许可证数量分别为192和179个,流行度分别占比51.1%和48.9%。近些年以巨杉、平凯星辰、涛思数据、欧若数网为代表的初创企业和以百度、华为、阿里云、蚂蚁金服为代表的巨头意识到开源有助于扩大人才规模及上下游生态影响力,通过运营开源社区快速获得反馈并加快产品开发、提升产品质量,同时反哺社区开发者及独立软件开发商(ISV)等生态伙伴,能够达到多方共赢目的。针对开源,企业纷纷采取不同的商业模式。2014年12月,巨杉数据库宣布开源SequoiaDB,成为国内最早开源自研数据库项目;2017年10月,平凯星辰开源TiDB;2018年,百度开源数据库Doris和HugeGraph;2019年,涛思数据和欧若数网分别开源TDengine和NebulaGraph;2020年6月,华为建立openGauss开源社区,并于2021年3月发布第一个Release版本;2021年5月,阿里云宣布对外开放关系型数据库PolarDB for PostgreSQL源代码,同年6月,蚂蚁集团宣布开源OceanBase。(三)数据库服务很长一段时间内,我国数据库服务工作主要以附属技能的形式由应用开发商和硬件服务商提供保障。随着数据库对于企业的重要性越来越高,企业对于以数据库为核心的专业服务的需求也越加迫切,独立的数据库服务厂商开始崭露头角,并形成了一个专业化的数据库细分服务领域。1.头部企业主体发展时间较长数据库服务产业主体主要由多年来在电信、金融、政务等重要行业提供外包IT运维服务的企业构成,成立时间普遍十年以上,核心成员多为早期提供Oracle、DB2原厂或第三方服务的专家,由于企业数据库技术体系庞杂,需要服务提供商能够提供横向主流数据库产品和纵向多版本技术服务覆盖能力,服务行业技术壁垒较高。此外,由于一般与客户签订一至三年合同,服务提供商对客户系统非常熟悉,容易形成相对稳定的长期合作伙伴关系,市场壁垒较高,新兴初创公司较少,巨头员工数量普遍在千人左右。头部典型企业有云和恩墨、新炬网络、海量数据、太阳塔、爱可生、中亦安图、万国数据、银信科技、天玑科技、新数科技、沃趣科技、迪思杰、九桥同步等。2.服务工作范围广,缺乏行业规范和指引数据驱动时代,企业开始利用海量实时数据分析业务发展、了解客户行为和优化配置资源,并据此制定企业发展战略。数据库系统作为数据存储的主要载体,数据库服务贯穿企业IT系统的整个生命周期。按照信息系统建设的不同阶段,数据库的服务范围主要覆盖规划设计、实施部署、运维运营三个方面,三个方面又细分多个服务工作内容,如下图所示。由于数据库服务产业正处于快速变革期,玩家众多,能力水平参差不齐,服务过程缺乏行业规范和指引,导致众多数据库应用单位面临各类选型和实施问题。中国信息通信研究院联合国内数据库厂商和服务商,共同编制并发布了《数据库服务能力成熟度模型》团体标准,期望为国内的数据库服务生态体系提出更全面和专业的评估标准。3.服务市场集中在重点行业,环境变革倒逼各主体转型升级服务市场主要集中在金融、电信、政府、制造、交通五个行业。根据中国信通院统计分析,各行业的数据库服务市场份额比例分别为金融22.3%、电信18.9%、政府16.4%、制造13.3%、交通9.6%,这五个行业合计占比超过80%。云计算改变传统服务市场格局。在云计算逐渐成熟之后,与云上数据库市场份额迅速扩大。而云上数据库的咨询、部署、运维等服务工作则直接由云计算公司负责,所以云计算公司将改变传统服务市场格局。由于服务工作定制化程度较高,相对标准化云产品,属于劳动力密集型工作,所以从综合成本角度出发,未来云上数据库服务市场部分将由云计算公司依靠自身资源储备负责,另一部分云计算公司将与线下服务公司进行合作,形成优势互补,共同完成相关工作。服务企业向产品企业转型。如今随着分布式云数据库兴起,数据库运维要求不断提升,数据库服务商除了提供传统的驻场与远程运维类服务外,围绕数据库开发、测试、运维等环节也提供多种类型的数据库周边工具。与此同时,以云和恩墨、新数科技、爱可生、海量数据等为代表的数据库服务商为了拓展业务范围,提升企业利润总额,认识到可以利用自身服务能力积累与经验,对数据库产品供应商形成差异化优势,顺势推出自有数据库产品,进一步加剧了数据库产品市场竞争激烈程度。其中云和恩墨与海量数据分别基于开源数据库openGauss推出了企业级数据库MogDB和Vastbase,爱可生和新数科技基于MySQL也发布了相关产品。(四)数据库支撑体系当前数据库支撑体系由于数据库技术路线不断演进,也正处于变革和创新的高发期。1.学术研究仍以关系理论为重点,国内研究水平逐渐提升2016至2020年,美国、中国、印度、德国和英国是全球数据库领域论文产出前五的国家,美国发文量最多,占全球总发文量22.4%,之后依次为中国19.4%,印度7.4%。从高水平论文数量分析,英国高被引论文数占3.1%,中国占0.3%。从国际合作论文的角度分析,英国、法国、加拿大、西班牙的国际合作论文较多,均超过50%。学术界公认的数据库领域顶级会议主要有VLDB、SIGMOD和ICDE。从这些会议的研究方向看,当前以关系型数据库为主,非关系型数据库为辅。以VLDB为例,2018-2020年,各领域论文总数分别为146、151和95个,关系型和非关系型数据库论文分别占三年论文总数量的37%和21%。SIGMOD各领域论文总数分别为90、88和144个,关系型和非关系型数据库论文总数占三年论文总数的22%和13%。ICDE各领域论文总数分别为188、268和241个,关系型和非关系型数据库论文总数占三年论文总数均为13%。综合分析全球论文研究主题,除了关系型数据库,图论、图数据库、查询优化、机器学习、分布式处理、时序数据、流数据、时空数据、云数据库等代表当前火热的技术方向。此外,数据安全、隐私保护也是每年不可或缺的研究主题。我国在全球数据库领域学术影响逐渐提升。高校及企业在ICDE论文贡献占比最高,三年依次为28.19%、37.31%和43.15%,三大会议每年贡献占比平均为22.14%、23.74%和23.81%,数量呈逐年上升趋势,研究方向以图论、图数据库、数据挖掘、机器学习、查询处理等方向为主。阿里巴巴、华为、腾讯、蚂蚁金服、百度、PingCAP等企业和清华大学、香港科技大学、北京大学、香港中文大学、香港大学、浙江大学、华中师范大学、华东师范大学、中国人民大学、复旦大学、北京航空航天大学、华中科技大学、中国科学院、北京理工大学等高校论文纷纷入选三大顶会,显示我国数据库学术水平国际影响力不断扩大。2.领域内各类组织形成,产业热度不断提高数据库支撑体系各类组织主要分为以下四类:一类是由具备官方背景的研究组织,例如以中国计算机学会(CCF)数据库专业委员会为代表的学术组织和以中国通信标准化协会大数据技术标准推进委员会(CCSA TC601)为代表的行业组织,用于汇聚国内数据库理论研究头部力量;第二类是数据库从业人员牵头发起的面向数据库技术爱好者的用户组织,如面向DBA的ACDU、面向Oracle用户的ACOUG、面向MySQL用户的ACMUG、面向PostgreSQL用户的中国开源软件推进联盟PostgreSQL分会等,用于进行各类专题技术交流和讨论;第三类是由数据库企业组建,针对自身特定产品讨论的官方技术社区,如阿里云开发者社区、华为云openGauss社区、PingCAP AskTUG社区、PostgreSQL中文社区、爱可生开源社区、移动云开发者社区等;第四类是汇聚数据库整体行业信息的第三方技术社区,如ITPUB、墨天轮、DBAplus等,用于搭建领域内线上交流平台。3.多层级数据库人才培训体系正在快速形成当前数据库人才培养渠道主要有三个:高校教育、培训机构和企业。各渠道分别具有不同的培训方式和培训目标。高校教育注重普适教育,重视社会人才发展大趋势需求。通过原理性知识传授、数据库系统应用实践等教学方式,为数据库产业发展提供了大量储备人才。培训机构是数据库人才认证获取的主要途径。培训机构累计为合作伙伴培训学员超5万人次,其中获得Oracle、MySQL、PostgreSQL认证学员数千人,为企业输送专业DBA万余人。培训方式为厂商授权培训中心或联合认证培训中心等,培训知识主要面向数据库工程实践和应用。除原厂培训,当前专业培训机构包括恩墨学院、新炬学院、盘古云课堂等。企业培训基于人才培养时间成本、人才可用性等考量因素,多渠道聚集人才。一方面,数据库厂商开始建立自己的认证体系,并形成了不同级别的培训课程和认证考试;另一方面,一些企业开始加强与院校的产教融合尝试,通过与高校进行教材编撰、实训开发、专业共建、人才共建等合作项目,在高校提前培养数据库相关储备人才。4.数据库领域受资本市场高度追捧中国信通院统计分析,自2013年至今,数据库企业累计完成约42次融资,根据披露金额显示,融资额度总计约为78.6亿元。自2014年成立的以数据库产品供应与服务提供为主营业务的企业为29个,其中24个企业先后获得单笔数百万元至最高2.7亿美元融资,仅2021年一、二季度期间,获得最新一轮融资的企业数就达12家,2020全年获得融资的企业数量为17家,占比59%,其中不乏高瓴创投、经纬中国、红点创投、红杉资本等知名投资方。由此看出,近些年随着国产数据库概念的火热与应用需求多样化带动的技术变革,国内外各路资本纷纷注入数据库产业,形成“百舸争流”的旺盛态势。文章摘自大数据技术标准推进委员会,只为分享、传播,如果涉嫌侵权,请联系删除!
  • [酷哥说库] 【技术之声】第五期(20220117)一周精选
    大家好!我是酷哥,一周精选,带您速览,欢迎大家关注。 **本期整理如下:** ------------------------------------------------**本期精选**------------------------------------------------ - 2022年1月国产数据库排行榜:TiDB霸榜两年势头不减,openGauss与OceanBase分数大涨 - 数据库技术七**展趋势 - 非结构化数据将在2022年继续影响数据管理 - 2022年的5个主要的数据迁移趋势 - 数据成熟度的演变过程 - 红遍全球的云原生数据库,未来将走向何方? - 数据库领域下的新跃迁:百家争鸣背后的数据碎片化格局 - 华为云GaussDB连续两年入选Gartner®云数据库管理系统魔力象限™ - 华为云FusionInsight三次蝉联中国大数据市场第一 ------------------------------------------------**资讯全文**------------------------------------------------ - [2022年1月国产数据库排行榜:TiDB霸榜两年势头不减,openGauss与OceanBase分数大涨](https://bbs.huaweicloud.com/forum/thread-177145-1-1.html) **摘要:** 奎钩粲粲光华动,群玉森森气象新。国产数据库行业在经历了2021年的躬行实践之后,产品、服务、生态等取得了蓬勃发展。从2022年1月份的国产数据库流行度排行榜上,我们可以看到,相较于去年12月份,榜单上又增加了新成员。目前,共有194家数据库参与排名。排行榜前十五名的数据库中,80%的产品流行度分数实现上涨。 PingCAP的TiDB依然稳居榜首,第二名openGauss,达梦位于第三。 **文章来源:** [https://bbs.huaweicloud.com/forum/thread-177145-1-1.html](https://bbs.huaweicloud.com/forum/thread-177145-1-1.html) - [数据库技术七**展趋势](https://bbs.huaweicloud.com/forum/thread-177621-1-1.html) **摘要:** 大数据时代,数据量不断爆炸式增长,数据存储结构也越来越灵活多样,日益变革的新兴业务需求催生数据库及应用系统的存在形式愈发丰富,这些变化均对数据库的各类能力不断提出挑战,推动数据库技术不断向着模型拓展、架构解耦的方向演进,与云计算、人工智能、区块链、隐私计算、新型硬件等技术呈现取长补短、不断融合的发展态势,总结起来体现为三个方向: 1)多模数据库实现一库多用、利用统一框架支撑混合负载处理、运用AI实现管理自治,提升易用性、降低使用成本; 2)充分利用新兴硬件、与云基础设施深度结合,增强功能、提升性能; 3)利用隐私计算技术助力安全能力提升、区块链数据库辅助数据存证溯源,提升数据可信与安全。 **文章来源:** [https://bbs.huaweicloud.com/forum/thread-177621-1-1.html](https://bbs.huaweicloud.com/forum/thread-177621-1-1.html) - [非结构化数据将在2022年继续影响数据管理](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177593) **摘要:** 2022年,非结构化数据将继续重塑数据管理的格局,现在不仅产生了空前数量的数据,而且还在多个地方收集、存储、处理和分析,并在这些环境之间移动。 企业正在使用视频、图像、物联网传感器数据、社交媒体和类似的信息,作为他们执行的很多分析、机器学习和商业智能任务的基础。随着我们进入2022年,非结构化数据将继续成为企业数据管理工作的重点。 IT领导者将专注于利用云技术从非结构化数据中获取价值、非结构化数据分析工作流解决方案将会出现、“数据货币化”和相关策略将在2022年流行、IT将拥抱数据竖井、数据管理将继续成为风险投资家的热门市场。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177593](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177593) - [2022年的5个主要的数据迁移趋势](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177292) **摘要:** 数据似乎总是需要迁移,无论是从内部部署设施迁移到云平台,还是从操作系统到长期存档,数据始终在移动。 2022年数据迁移市场的五个主要趋势:非结构化数据迁移、迁移软件整合、数据优先迁移、数据库迁移、云平台之间的迁移。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177292](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177292) - [数据成熟度的演变过程](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177269) **摘要:** 在过去十年中,企业一直致力于将“数据驱动”作为其业务战略的核心原则。数据驱动是指使用数据来做出商业决策,但这不一定可以衡量公司的整体数据状况。成为数据驱动型企业,不仅需要时间和精力,还需要对数据策略进行积极的投资。 首先,我们需要了解公司在“数据成熟度”方面所处的位置。数据成熟度为业务中的数据渗透提供了更具体的衡量标准,并囊括了数据驱动组织中涉及的人员、流程和工具。 为了让数据专业人士从容面对治理和监管方面的新挑战,他们必须将提高数据成熟度作为他们的核心立场。数据成熟的专业人员和企业可以降低复杂性,并根据当前情况调整处理数据管理和分析的方式。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177269](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177269) - [红遍全球的云原生数据库,未来将走向何方?](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177270) **摘要:** 如今,企业面临着指数级递增的海量存储需求,业务也面临更多的热点和突发流量带来的挑战。由于企业需要降本增效,进行更智能的数据决策,传统的商业数据库已经难以满足和响应快速增长的业务诉求。 在此背景下,云原生数据库成为大势所趋,不管是老牌的数据库厂商,还是大型云计算企业都在向这一趋势靠拢。 全球知名咨询公司Gartner指出,云将主导数据库市场的未来,到2022年,75%的数据库将被部署或迁移至云平台,只有25%的数据库会在本地运行。云化无疑代表了未来,企业如何在云原生架构下使用数据库,就成为必须要思考的问题。 **文章来源:** [https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177270](https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=177270) - [数据库领域下的新跃迁:百家争鸣背后的数据碎片化格局](https://bbs.huaweicloud.com/forum/thread-177463-1-1.html) **摘要:** 互联网红利不再,相比 2010 年,现在的市场上显得太过平静,已经太久没有出现关于『风口』的故事。但在表面的岁月静好之下,却是底层的暗流涌动。其中,数据库就是『底层暗流涌动』的典型场景之一,作为支撑数字经济的最关键基础设施,这两年数据库市场中一直都在上演着一浪高过一浪的竞争。 在亚马逊公司看来,数据库也被他们视作为下一个战场。“The real battle will be in databases”。 **文章来源:** [https://bbs.huaweicloud.com/forum/thread-177463-1-1.html](https://bbs.huaweicloud.com/forum/thread-177463-1-1.html) - [华为云GaussDB连续两年入选Gartner®云数据库管理系统魔力象限™](https://bbs.huaweicloud.com/blogs/325342) **摘要:** 近日,国际研究机构Gartner发布2021年全球云数据库魔力象限报告《Magic Quadrant for Cloud DatabaseManagement Systems》,华为云凭借GaussDB系列数据库产品入选魔力象限的特定领域者。成为亚洲唯二入选的云厂商。 **文章来源:** [https://bbs.huaweicloud.com/blogs/325342](https://bbs.huaweicloud.com/blogs/325342) - [华为云FusionInsight三次蝉联中国大数据市场第一](https://www.huaweicloud.com/news/2022/20220111164426467.html) **摘要:** 近日,全球领先的IT研究和咨询公司国际数据公司(IDC)发布《中国大数据平台市场研究报告-2021H1》,华为云FusionInsight智能数据湖位居中国大数据平台市场份额第一,连续3次蝉联榜首。 **文章来源:** [https://www.huaweicloud.com/news/2022/20220111164426467.html](https://www.huaweicloud.com/news/2022/20220111164426467.html) 上一期:[【技术之声】第四期(20220110)一周精选](https://bbs.huaweicloud.com/forum/thread-177196-1-1.html) ------------ *声明:文章源于第三方公开的信息,如内容中涉嫌侵权或存在信息不实时,请及时联系删除。* 整理者:酷哥
  • [技术干货] 华为云GaussDB(DWS)蝉联数据仓库领域年度“金沙奖”最佳产品奖
    7月28日-29日,2021(第六届)中国大数据产业生态大会在北京举行。本次大会以“数智转型 融合共生”为主题,共同探讨产业服务数字化发展和行业数智化转型方向,大数据领域年度“金沙奖”也在会上正式揭晓,华为云数据使能DAYU主力产品——数据仓库GaussDB(DWS)蝉联“2021 中国大数据·数据仓库领域最佳产品奖”。华为云GaussDB(DWS)是一款具备分析及混合负载能力的分布式数据库,面向政企、互联网和物联网等应用场景,以企业级内核、统一架构提供标准数仓,实时数仓和云数仓。业务分析师和数据分析师在批量分析、交互式查询与分析、实时分析等业务场景中,可借助GaussDB(DWS)轻松获得一站式分析能力,降低数据分析门槛提升数据分析效率,更便捷高效的释放数据价值。一站式数据分析支持上万分析师在线作业,满足企业平台容量需求继2020年获奖后,华为云GaussDB(DWS)研发团队在数据分析技术上持续探索。通过智能多维的混合负载管理,华为云GaussDB(DWS)可在集群内实现实时、批量、交互式负载的一站式数据分析。为数据接入提供丰富的数据源接口,满足数据分析的全流程中不同角色对数据分析的不同需求。通过自研TCP多流技术提高物理连接数量级,在MPP架构下数据节点全并行数据交换,华为云GaussDB(DWS)实现单集群最大支持2048节点。2021年Q1建成投产的480节点大集群分析师平台,成为金融行业最大规模商用数据仓库集群,支持上万分析师在线作业,极大满足了大企业数据量激增对平台容量扩展的需求。高并发毫秒级点查询,效率提升200倍通过30多项查询重写技术(含4项专利),优化Ad hoc查询性能,实现高并发毫秒级点查询。在已商用的GaussDB(DWS)数据分析平台中,灵活查询平均运行时间由30分钟降低至50秒,查询平均等待时长更是由5小时降低至1.5分钟,查询效率提升200倍!对企业而言,业务数据从产生到汇聚,再到面向场景化分析,每个环节都分秒必争,快速释放数据潜能已成为企业数字化转型的刚需。数据分析架构简化,流数据每秒千万级实时接入在互联网和物联网业务应用中,时序数据和流数据承载了大量的业务内容。典型时序和流数据分析方案需要引入多种组件,不但数据格式难统一,平台架构也变得非常厚重,扩展困难。华为云GaussDB(DWS)在全并行分布式架构上,无缝融合OLAP引擎、时序引擎、CEP引擎,简化数据分析组件架构,实现T+1和T+0合一的一站式数据分析,实时数据与历史数据关联分析技术做到同行业技术领先。在已投产的实时数仓方案中,流数据高峰流量每秒千万级实时接入,解决了传统方案流数据接入流量速率的瓶颈问题。华为云GaussDB(DWS)提供GB~PB级数据分析能力、多模分析和实时处理能力,用于数据仓库、数据集市、实时分析、实时决策和混合负载等场景,在全行业数字化转型中帮助企业提质增效,建立核心竞争力,夯实企业发展根基。     目前,华为云大数据热销主打的产品有:1. 数据仓库服务GaussDB(DWS)提供云上企业级融合数据仓库,支持实时数据分析,具备高性能、低成本、易扩展等特性2.MapReduce服务 3.0.5版新版ClickHouse集群支持跨AZ集群,适用海量数据大宽表实时分析/实时BI报表分析3. 云搜索服务 CSS兼容Elasticsearch完全托管在线分布式搜索服务,用于站内搜索/日志分析/运维监控等场景 4.数据湖治理中心 DGC数据全生命周期一站式开发运营平台,可复用行业知识库,助力企业快速构建数据运营能力5.数据湖探索服务 DLI提供一站式融合处理分析服务,会SQL就会大数据分析,高易用免运维 现在828大促期间,大数据福利专场上线,注册用户即可免费体验大数据,爆款产品击穿底价5折!详情点击了解:https://activity.huaweicloud.com/bigdata.html
  • [知识分享] 【大数据系列】大数据集群被窃取数据怎么办?透明加密可以一试
    >摘要:传统大数据集群中,用户数据明文保存在HDFS中,集群的维护人员或者恶意攻击者可在OS层面绕过HDFS的权限控制机制或者窃取磁盘直接访问用户数据。本文分享自华为云社区[《FusionInsight MRS透明加密方案》](https://bbs.huaweicloud.com/blogs/307406?utm_source=zhihu&utm_medium=bbs-ex&utm_campaign=ei&utm_content=content),作者: 一枚核桃 。 # 概述 传统大数据集群中,用户数据明文保存在HDFS中,集群的维护人员或者恶意攻击者可在OS层面绕过HDFS的权限控制机制或者窃取磁盘直接访问用户数据。 FusionInsight MRS引入了Hadoop KMS服务并进行增强,通过对接第三方KMS,可实现数据的透明加密,保障用户数据安全。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/202201/14/104621ua76d2mu1zio5bq2.png) - HDFS支持透明加密,Hive、HBase等在HDFS保存数据的上层组件也将通过HDFS加密保护,加密密钥通过HadoopKMS从第三方KMS获取。 - 对于Kafka、Redis等业务数据直接持久化存储到本地磁盘的组件,通过基于LUKS的分区加密机制保护用户数据安全。 # HDFS透明加密 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/202201/14/104641tyfhpifcfjcwx6im.png) - HDFS透明加密支持AES、SM4/CTR/NOPADDING加密算法,Hive、HBase使用HDFS透明加密做数据加密保护。SM4加密算法由A-LAB基于OpenSSL提供。 - 加密使用的密钥从集群内的KMS服务获取,KMS服务支持基于Hadoop KMS REST API对接第三方KMS。 - 一套FusionInsight Manager内部署一个KMS服务,KMS服务到第三方KMS使用公私钥认证,每个KMS服务在第三方KMS对应拥有一个CLK。 - 在CLK下可以申请多个EZK,与HDFS上的加密区对应,用于加密数据加密密钥,EZK在第三方KMS中持久化保存。 - DEK由第三方KMS生成,通过EZK加密后持久化保存到NameNode中,使用的时候使用EZK解密。 - CLK和EZK两层密钥可以轮转。CLK作为每个集群的根密钥,在集群侧不感知,轮转完全由第三方KMS控制管理。EZK可通过FI KMS管理,轮转在FI KMS可控制管理,同时第三方KMS管理员拥有KMS内密钥的管理能力,也可以做EZK的轮转。 # LUKS分区加密 对于Kafka、Redis等业务数据直接持久化存储到本地磁盘的组件,FusionInsight集群支持基于LUKS的分区加密进行敏感信息保护。 FusionInsight安装过程的脚本工具使用Linux统一密钥设置(Linux Unified Key Setup,简称LUKS)分区加密方案,该方案加密分区时会在集群每个节点生成或者从第三方KMS获取访问密钥,用于加密数据密钥,以保护数据密钥安全性。磁盘分区加密后,重启操作系统或者更换磁盘场景下,系统能够自动获取密钥并挂载或创建新的加密分区。
  • [参赛经验分享] 2020中国高校计算机大赛·华为云大数据挑战赛-周周星分享(第二期)
    一、周周星分享——无能的万金油大家好,我们是“无能的万金油”团队,很荣幸获得了本次的周周星。下面是我们对于复赛数据的部分理解和思路:1、比赛进行到这里,对于训练集和测试集的清洗就不说什么了,大家也意识到其实上分是一件越来越玄学的事情,在初赛表现好的模型,复赛却不一定好原因也很简单,每条路径的不确定影响因素太多了。。 天气、疫情、塞港等突发事件,导致运船并不会按正常路线行驶,同时又由于人为录入的原因,路由信息也并不完全准确,有的船只的实际停靠港口也不一致。在就是test是截断的数据,就更导致trace可能写的 A-B-C 但实际是 A-C 甚至 A-C-D,  而你拿到的只有C-D或者,-C的部分数据,这就更加大了预测难度。2、针对上面的情况,我们其实能够知道,做的特征并不一定越全越好,而且有时候也不一定(强特)就好,因为强特代表训练集的平均特征,但是拿到的数据其实分布是各种各样的。反而“弱”一点的特征,少部分特征的泛化能力特强。3、对于A榜,我觉得没必要太纠结分数,因为数据分布太不一致了,更多的应该表现在模型的泛化能力上,测试下各个特征组合预测的时间分布特点,不然B榜很容易翻车。4、最后说下数据训练,找相似路由匹配的思路是个方向,但是这方面要细化才可能达到好的效果,需要一点点测试。5、如果单纯追求分数的话,完全可以采用探榜的方式,我们其实很大一部分也是探榜提升来的,但是说实话对B榜预测没有实际意义,最多用来做验证,所以后期不会再采取这样的尝试。大赛赛题:https://competition.huaweicloud.com/information/1000037843/introduction
  • [参赛经验分享] 2020中国高校计算机大赛·华为云大数据挑战赛-周周星分享(第一期)
    一、周周星分享——什么都做不队大家好,我们是“什么都做不队”团队,很荣幸获得了本次的周周星。下面是本次的分享:1. 复赛的数据是更加复杂,我们在尝试的时候发现去重这个操作对数据的影响还是挺大的,针对不同的特征进行去重操作后 对最后的得分影响非常高,关于这一点我们初步认为大量塞港数据或者疫情影响数据导致。比如在测试集中LR运单号,我们尝试在匹配相似路径,最后发现部分属于2020的相似路径大部分出现一个情况: 到港口前开始停顿不动。 这可能是疫情原因导致的 也可能是塞港行为。我们认为上分的关键就是来处理这种异常运单号(可能会过拟合测试集)2. 特征选择:大家可以考虑使用少量特征,这个复赛数据有一个问题就是把初赛中某些强特带入能反向上分,可以尽量使用一些泛化能力强的特征。3. 模型方面 调参对模型的影响还是很大的,可以进一步参数通过调参上分。4. 接下来我们尝试去使用xgboost,ctb等其他模型看看是否会有提升效果,模型应该还是需要多多尝试。以上就是我们团队的分享 最后祝大家上分!二、周周星分享——智能集美大家好,我们是“智能集美”团队。首先感谢前几周的周周星的分享,下面是我们的一些思路心得。    1、数据清洗  A榜还有一周就要结束了,数据清洗的重要性我想大家都也明白。  初赛洗数据的方法已经不完全适用,所以我们除了保留了初赛部分简单的洗数据方法(如去除速度方向异常的gps记录),更多的采用的是画图找异常运单号的方式。通过先将各个运单号的航线画出来,找到可能为异常数据的运单号,再通提取这些异常数据的运单号数据,通过观察数据来判断是否进行删除。(在观察航线图的时候,还可以通过观察同一路由的其它运单号进行横向比对)  2、特征工程  特征工程是一个比较玄学的东西,大家可以尝试增删特征,找对比较合适的特征搭配。(我也在找…)  3、模型选择     LGB,永远滴神。参数还是有一定的影响的,在实在没有其它思路的时候可以考虑调参。  4、塞港问题  塞港显然是一个对结果影响很大的因素,但我们目前也没有什么很好的解决方案,毕竟有的船才刚刚走了百分之十到二十的路程,实在不知道怎么判断它有没有塞港。  我们接下来会特别关注一下经常塞港的路由,试图寻找到一些规律,同时我们接下来还会考虑疫情对于航线的影响,最后祝大家都能够取得好成绩。三、周周星分享--突然Ping通大家好,我们是“突然Ping通”团队,很高兴获得本次比赛的最后一周周周星,首先感谢前两周周周星的分享,让我们也有机会获得周周星。简要分享一下我们的思路:1、我们数据处理方式和初赛差不多,不过在初赛的基础上加了一步处理塞港状态的代码,根据之前官方人员提示经纬度在误差0.25之内可算到港,距离大概在30-40千米左右,所以我们对一些塞港的和到港又开走的数据进行了截断,就我们的方案在本地而言清洗完这类数据效果更好。由于测试集存在一些“离谱”的数据,比如FA订单,这些数据模型不能预测,所以我们对这类订单进行了后处理。2、特征工程一开始使用初赛的方案,但是效果不好,删除几个强特反而能够上分,所以大家可以尝试用少量特征调试。3、看到上周有周周星分享调参能上分,我们这周也用调参工具尝试调参,确实能上不少分,所以大家也可以尝试换换祖传参数,上一波分。大赛赛题:https://competition.huaweicloud.com/information/1000037843/introduction
  • [参赛经验分享] 2020中国高校计算机大赛·华为云大数据挑战赛-周周星分享(第一期)
    一、周周星分享——什么都做不队大家好,我们是“什么都做不队”团队,很荣幸获得了本次的周周星。下面是本次的分享:1. 复赛的数据是更加复杂,我们在尝试的时候发现去重这个操作对数据的影响还是挺大的,针对不同的特征进行去重操作后 对最后的得分影响非常高,关于这一点我们初步认为大量塞港数据或者疫情影响数据导致。比如在测试集中LR运单号,我们尝试在匹配相似路径,最后发现部分属于2020的相似路径大部分出现一个情况: 到港口前开始停顿不动。 这可能是疫情原因导致的 也可能是塞港行为。我们认为上分的关键就是来处理这种异常运单号(可能会过拟合测试集)2. 特征选择:大家可以考虑使用少量特征,这个复赛数据有一个问题就是把初赛中某些强特带入能反向上分,可以尽量使用一些泛化能力强的特征。3. 模型方面 调参对模型的影响还是很大的,可以进一步参数通过调参上分。4. 接下来我们尝试去使用xgboost,ctb等其他模型看看是否会有提升效果,模型应该还是需要多多尝试。以上就是我们团队的分享 最后祝大家上分!二、周周星分享——智能集美大家好,我们是“智能集美”团队。首先感谢前几周的周周星的分享,下面是我们的一些思路心得。    1、数据清洗  A榜还有一周就要结束了,数据清洗的重要性我想大家都也明白。  初赛洗数据的方法已经不完全适用,所以我们除了保留了初赛部分简单的洗数据方法(如去除速度方向异常的gps记录),更多的采用的是画图找异常运单号的方式。通过先将各个运单号的航线画出来,找到可能为异常数据的运单号,再通提取这些异常数据的运单号数据,通过观察数据来判断是否进行删除。(在观察航线图的时候,还可以通过观察同一路由的其它运单号进行横向比对)  2、特征工程  特征工程是一个比较玄学的东西,大家可以尝试增删特征,找对比较合适的特征搭配。(我也在找…)  3、模型选择     LGB,永远滴神。参数还是有一定的影响的,在实在没有其它思路的时候可以考虑调参。  4、塞港问题  塞港显然是一个对结果影响很大的因素,但我们目前也没有什么很好的解决方案,毕竟有的船才刚刚走了百分之十到二十的路程,实在不知道怎么判断它有没有塞港。  我们接下来会特别关注一下经常塞港的路由,试图寻找到一些规律,同时我们接下来还会考虑疫情对于航线的影响,最后祝大家都能够取得好成绩。三、周周星分享--突然Ping通大家好,我们是“突然Ping通”团队,很高兴获得本次比赛的最后一周周周星,首先感谢前两周周周星的分享,让我们也有机会获得周周星。简要分享一下我们的思路:1、我们数据处理方式和初赛差不多,不过在初赛的基础上加了一步处理塞港状态的代码,根据之前官方人员提示经纬度在误差0.25之内可算到港,距离大概在30-40千米左右,所以我们对一些塞港的和到港又开走的数据进行了截断,就我们的方案在本地而言清洗完这类数据效果更好。由于测试集存在一些“离谱”的数据,比如FA订单,这些数据模型不能预测,所以我们对这类订单进行了后处理。2、特征工程一开始使用初赛的方案,但是效果不好,删除几个强特反而能够上分,所以大家可以尝试用少量特征调试。3、看到上周有周周星分享调参能上分,我们这周也用调参工具尝试调参,确实能上不少分,所以大家也可以尝试换换祖传参数,上一波分。大赛赛题:https://competition.huaweicloud.com/information/1000037843/introduction
  • [参赛经验分享] 2020中国高校计算机大赛·华为云大数据挑战赛-周周星分享(第二期)
    一、周周星分享——无能的万金油大家好,我们是“无能的万金油”团队,很荣幸获得了本次的周周星。下面是我们对于复赛数据的部分理解和思路:1、比赛进行到这里,对于训练集和测试集的清洗就不说什么了,大家也意识到其实上分是一件越来越玄学的事情,在初赛表现好的模型,复赛却不一定好原因也很简单,每条路径的不确定影响因素太多了。。 天气、疫情、塞港等突发事件,导致运船并不会按正常路线行驶,同时又由于人为录入的原因,路由信息也并不完全准确,有的船只的实际停靠港口也不一致。在就是test是截断的数据,就更导致trace可能写的 A-B-C 但实际是 A-C 甚至 A-C-D,  而你拿到的只有C-D或者,-C的部分数据,这就更加大了预测难度。2、针对上面的情况,我们其实能够知道,做的特征并不一定越全越好,而且有时候也不一定(强特)就好,因为强特代表训练集的平均特征,但是拿到的数据其实分布是各种各样的。反而“弱”一点的特征,少部分特征的泛化能力特强。3、对于A榜,我觉得没必要太纠结分数,因为数据分布太不一致了,更多的应该表现在模型的泛化能力上,测试下各个特征组合预测的时间分布特点,不然B榜很容易翻车。4、最后说下数据训练,找相似路由匹配的思路是个方向,但是这方面要细化才可能达到好的效果,需要一点点测试。5、如果单纯追求分数的话,完全可以采用探榜的方式,我们其实很大一部分也是探榜提升来的,但是说实话对B榜预测没有实际意义,最多用来做验证,所以后期不会再采取这样的尝试。大赛赛题:https://competition.huaweicloud.com/information/1000037843/introduction
  • [参赛经验分享] 2020中国高校计算机大赛·华为云大数据挑战赛-周周星分享(第三期)
    一、周周星分享——练习生团队大家好,我们是“练习生”团队,很荣幸获得了本次的周周星。下面是我们对于复赛数据的部分理解和思路:1、与初赛稍微对数据进行清洗,分数就能得到显著提升不同,复赛对于数据进行清洗产生的效益似乎并不太高,我认为如果初赛已经获得了一个相对较好的成绩,那么说明原先的数据清洗是有一定道理的,可能部分需要进行微调,但是没有必要完全重构。2、对于清洗数据收益甚微的情况,大家可以考虑一下特征的搭配,或许不使用全部特征,也能够获得较大收益。3、模型依然还是LGB模型,并没有什么特别4、对测试集的清洗也是一个关键点,分数上限不高,大部分也和测试集数据有关,目前我们做的只是简单的去重,进行操作的时候,要关注测试集的订单号总数是否发生变化。5、之后我们可能会尝试构造一些新的特征如时间特征、起始点终点的国家、城市等。以上是我们的分享,希望能和大家一起交流进步,祝大家取得好成绩。二、周周星分享—e402冲冲冲大家好,我们是“e402冲冲冲”团队,很荣幸获得了复赛第一周的周周星。下面分享一下我们对于复赛数据的一些理解和思路:1. 由于是复赛的第一周,我们主要是对数据集进行了清洗工作,清洗思路和初赛一样,包括:去掉direction为-1的记录,去重(去除loadingOrder, carrierName, timestamp和vesselMMSI相同的记录),去除路径中两点之间距离过大的的订单,出发港与目的港是否和路径匹配等。       2. 我们的主要思路也是相似轨迹的方法,这里我们采取了聚类的方法(感谢初赛周周星大佬的思路),从训练集中提取和测试集相似的轨迹进行训练,但是测试集中有很多轨迹是在训练集当中找不到的,这个就要自己处理。       3. 目前使用的还是LGB模型,特征也主要是一些统计特征。其实我们的方法也比较常规,相似轨迹的方法大家都有讨论,初赛也有很多团队使用,但是里面的一些细节例如测试集中找不到的轨迹就需要仔细思考。目前复赛第一周我们的主要工作也还是数据清洗,仍然处于探索阶段。希望能和大家一起交流进步,祝大家取得好成绩。 大赛赛题:https://competition.huaweicloud.com/information/1000037843/introduction
总条数:1416 到第
上滑加载中