• [其他] EI企业智能2022年4月高热贴合集
    ## EI企业智能2022年4月高热贴合集 以下是EI企业智能板块在2022年4月份的高热贴的合集。从合集中基本可以看出,本月DWS板块的热度是相对比较高的。 ## 数仓GaussDB(DWS) dws-分区表,可以根据字段值分区吗:https://bbs.huaweicloud.com/forum/thread-185029-1-1.html GAUSSDB200 怎么样通过系统表批量查看所有的表是行存储、还是例存储方式?:https://bbs.huaweicloud.com/forum/thread-185026-1-1.html GaussDB A 8.0.0.1线下版本,100+节点时,其中50+节点为扩容时加入,使用一段时间后存在原本节点和扩容节点存在:https://bbs.huaweicloud.com/forum/thread-184869-1-1.html There is no hash distributable column:https://bbs.huaweicloud.com/forum/thread-184799-1-1.html 【DWS】【登录认证】如何实现免密登录?:https://bbs.huaweicloud.com/forum/thread-184822-1-1.html gds建立外表固定字段长度含中文字符报错: https://bbs.huaweicloud.com/forum/thread-185940-1-1.html copy query 与copy table 语法执行效率问题:https://bbs.huaweicloud.com/forum/thread-185667-1-1.html 高斯数据库select和drop某个表报错:https://bbs.huaweicloud.com/forum/thread-185310-1-1.html like '%XXX%' 这种条件的语句如何优化性能:https://bbs.huaweicloud.com/forum/thread-185581-1-1.html GaussDB DWS对磁盘数量的要求:https://bbs.huaweicloud.com/forum/thread-186188-1-1.html GaussDB A 800版本,使用连接池疑问:https://bbs.huaweicloud.com/forum/thread-186100-1-1.html spark 读hive 写gaussdb 问题求助:https://bbs.huaweicloud.com/forum/thread-186137-1-1.html 【GaussDB DWS】请问有没有适用于Euler-aarch64系统的GaussDB性能测试工具?:https://bbs.huaweicloud.com/forum/thread-186136-1-1.html ## ModelArts 【ModelArts产品】【训练管理功能】无法解决error: unrecognized arguments:https://bbs.huaweicloud.com/forum/thread-184768-1-1.html 用ModelArts预训练完Bert后,想进行网络评估,为什么无法找到评估数据集? https://bbs.huaweicloud.com/forum/thread-185981-1-1.html 使用官方的bert源码,运行报错run task error: https://bbs.huaweicloud.com/forum/thread-185786-1-1.html 【vscode插件】链接实例后打不开:https://bbs.huaweicloud.com/forum/thread-185729-1-1.html 【npu_convert_dropout】无法导入npu_convert_dropout:https://bbs.huaweicloud.com/forum/thread-185424-1-1.html ## MRS 【MRS产品】【hive功能】报错 return code 2 from org.apache.hadoop.hive.ql:https://bbs.huaweicloud.com/forum/thread-184739-1-1.html 华为云mrs中habse如何按照时间戳查询habse数据并抽取到关系数据库中?:https://bbs.huaweicloud.com/forum/thread-184891-1-1.html ## 自然语言处理 【知识图谱】【产品文档】文档中“创建信息抽取模型”中“准备数据”问题:https://bbs.huaweicloud.com/forum/thread-185008-1-1.html 【知识图谱】【模型】MRC-BM中Dataset数据创建和修改问题:https://bbs.huaweicloud.com/forum/thread-185846-1-1.html ## 数据湖处理中心DGC 数据开发-hive脚本页面如何使用变量:https://bbs.huaweicloud.com/forum/thread-184952-1-1.html 【DGC产品】【规范设计功能】拉链表和镜像表一类应该放在哪一层:https://bbs.huaweicloud.com/forum/thread-184669-1-1.html 请问怎么把乌兰一数据同步到乌兰二零三中,环境防火墙是否可以打通:https://bbs.huaweicloud.com/forum/thread-184511-1-1.html 作业开发-restClient模块如何操作MRS的es索引:https://bbs.huaweicloud.com/forum/thread-185459-1-1.html ## DIS DIS添加转储MRS任务时填写HDFS路径显示无效的: https://bbs.huaweicloud.com/forum/thread-185767-1-1.html ## FusionInsight kafka接口调用样例中,创建机机账号测试时,身份认证报错:https://bbs.huaweicloud.com/forum/thread-185886-1-1.html FI产品 使用idea本地调式spark sql 如何配置:https://bbs.huaweicloud.com/forum/thread-185621-1-1.html 【mrs产品】【hive功能】springboot启动可以登录zk,hive连接执行语句报错:https://bbs.huaweicloud.com/forum/thread-185497-1-1.html 【Spark】【提交任务】提交Spark任务时,报错找不到主类:https://bbs.huaweicloud.com/forum/thread-186395-1-1.html
  • [知识分享] 【大数据系列】简述数仓的时间域函数
    本文分享自华为云社区《[​​​​​​​GaussDB(DWS) 时间域函数​​​​​​​](https://bbs.huaweicloud.com/blogs/317197?utm_source=csdn&utm_medium=bbs-ex&utm_campaign=ei&utm_content=content)》,作者: 积少成多。 # 1. 什么是时间域函数,有哪些? 时间域函数是指数据库内获时间戳每部分值的函数。现有的时间域函数包括:  1) quarter函数:获取季度  2) hour函数:获取小时数  3) minute函数:获取分钟数  4) second函数:获取秒数  5) microsecond函数:获取微秒数。 # 2. 时间域函数参数的解析 时间域函数的入参类型有四种,包括:   1) date类型   2) timestamp/timestamptz类型   3) time/timetz类型   4) text类型。text类型的输入会根据输入格式转换为对应的date、timestamp/timestamptz或time类型。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/29/1651195422835141591.png)                  时间域函数入参支持类型表 参数解析支持时区设置,当输入参数含时区时,结果会转换为当前时区。以下用例中,数据库的默认时区为+08:00时区。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/29/1651195443063112467.png) # 3. 结果展示 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/29/1651195458005331118.png) # 4.总结   时间域函数是为获取时间戳各部分值而增加的函数。支持对text类型入参的的解析,使text类型入参进行隐式转换,解析成为对应时间戳类型获取目标值,更贴近实际场景。 **想了解GuassDB(DWS)更多信息,欢迎微信搜索“GaussDB DWS”关注微信公众号,和您分享最新最全的PB级数仓黑科技,后台还可获取众多学习资料哦~**
  • [交流分享] 【悦识鲲鹏系列 第40期】鲲鹏BoostKit大数据机器学习算法——让数据处理更快、更简单
    了解鲲鹏BoostKit大数据机器学习算法,更多详情可参见鲲鹏文档中心:https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml
  • [干货汇总] 【大数据系列】不care工具,在大数据平台中Hive能自动处理SQL
    本文分享自华为云社区《[Hive执行原理](https://bbs.huaweicloud.com/blogs/348195?utm_source=csdn&utm_medium=bbs-ex&utm_campaign=other&utm_content=content)》,作者: JavaEdge 。 MapReduce简化了大数据编程的难度,使得大数据计算不再是高不可攀的技术圣殿,普通工程师也能使用MapReduce开发大数据程序。但是对于经常需要进行大数据计算的人,比如从事研究商业智能(BI)的数据分析师来说,他们通常使用SQL进行大数据分析和统计,MapReduce编程还是有一定的门槛。而且如果每次统计和分析都开发相应的MapReduce程序,成本也确实太高了。 有没有更简单的办法,可以直接将SQL运行在大数据平台? 先看如何用MapReduce实现SQL数据分析。 # MapReduce实现SQL的原理 常见的一条SQL分析语句,MapReduce如何编程实现? ```mysql ` SELECT pageid, age, count(1) FROM pv_users GROUP BY pageid, age;` ``` 统计分析语句,统计不同年龄用户访问不同网页的兴趣偏好,具体数据输入和执行结果: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/22/1650609311443266186.png) - 左边,要分析的数据表 - 右边,分析结果 把左表相同的行求和,即得右表,类似WordCount计算。该SQL的MapReduce的计算过程,按MapReduce编程模型 - map函数的输入K和V,主要看V V就是左表中每行的数据,如1, 25> - map函数的输出就是以输入的V作为K,V统一设为1 比如1, 25>, 1> map函数的输出经shuffle后,相同的K及其对应的V被放在一起组成一个,作为输入交给reduce函数处理。比如2, 25>, 1>被map函数输出两次,那么到了reduce这里,就变成输入2, 25>, 1, 1>>,这里的K是2, 25>,V集合是1, 1>。 在reduce函数内部,V集合里所有的数字被相加,然后输出。所以reduce的输出就是2, 25>, 2> ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/22/1650609380761298262.png) 如此,一条SQL就被MapReduce计算好了。 在数据仓库中,SQL是最常用的分析工具,既然一条SQL可以通过MapReduce程序实现,那有无工具能自动将SQL生成MapReduce代码?这样数据分析师只要输入SQL,即可自动生成MapReduce可执行的代码,然后提交Hadoop执行。这就是Hadoop大数据仓库Hive。 # Hive架构 Hive能直接处理我们输入的SQL(Hive SQL语法和数据库标准SQL略不同),调用MapReduce计算框架完成数据分析操作。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/22/1650609395656925319.png) 通过Hive Client(Hive的命令行工具,JDBC等)向Hive提交SQL命令: - 若为DDL,Hive会通过执行引擎Driver将数据表的信息记录在Metastore元数据组件,该组件通常用一个关系数据库实现,记录表名、字段名、字段类型、关联HDFS文件路径等这些数据库的元信息 - 若为DQL,Driver就会将该语句提交给自己的编译器Compiler进行语法分析、语法解析、语法优化等一系列操作,最后生成一个MapReduce执行计划。然后根据执行计划生成一个MapReduce的作业,提交给Hadoop MapReduce计算框架处理。 对一个简单的SQL命令: ```mysql SELECT * FROM status_updates WHERE status LIKE ‘michael jackson’; ``` 其对应的Hive执行计划: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/22/1650609437583417627.png) Hive内部预置了很多函数,Hive执行计划就是根据SQL语句生成这些函数的DAG(有向无环图),然后封装进MapReduce的map、reduce函数。该案例中的map函数调用了三个Hive内置函数TableScanOperator、FilterOperator、FileOutputOperator,就完成了map计算,而且无需reduce函数。 # Hive如何实现join操作 除了简单的聚合(group by)、过滤(where),Hive还能执行连接(join on)操作。 pv_users表的数据在实际中无法直接得到,因为pageid数据来自用户访问日志,每个用户进行一次页面浏览,就会生成一条访问记录,保存在page_view表中。而age年龄信息则记录在用户表user。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/22/1650609484669408457.png) 这两张表都有一个相同的字段userid,据该字段可连接两张表,生成前面例子的pv_users表: ```mysql SELECT pv.pageid, u.age FROM page_view pv JOIN user u ON (pv.userid = u.userid); ``` 该SQL命令也能转化为MapReduce计算,连接过程如下: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/22/1650609508775654849.png) join的MapReduce计算过程和前面的group by稍有不同,因为join涉及两张表,来自两个文件(夹),所以需要在map输出的时候进行标记,比如来自第一张表的输出Value就记录为1, X>,这里的1表示数据来自第一张表。这样经过shuffle以后,相同的Key被输入到同一个reduce函数,就可以根据表的标记对Value数据求笛卡尔积,用第一张表的每条记录和第二张表的每条记录连接,输出就是join的结果。 所以打开Hive源码,看join相关代码,会看到一个两层for循环,对来自两张表的记录进行连接操作。 # 总结 开发无需经常编写MapReduce程序,因为网站最主要的大数据处理就是SQL分析,因此Hive在大数据应用很重要。 随Hive普及,我们对在Hadoop上执行SQL的需求越强,对大数据SQL的应用场景也多样化起来,于是又开发了各种大数据SQL引擎。 Cloudera开发了Impala,运行在HDFS上的MPP架构的SQL引擎。和MapReduce启动Map和Reduce两种执行进程,将计算过程分成两个阶段进行计算不同,Impala在所有DataNode服务器上部署相同的Impalad进程,多个Impalad进程相互协作,共同完成SQL计算。在一些统计场景中,Impala可做到ms级计算速度。 后来Spark诞生,也推出自己的SQL引擎Shark,即Spark SQL,将SQL语句解析成Spark的执行计划,在Spark上执行。由于Spark比MapReduce快很多,Spark SQL也相应比Hive快很多,并且随着Spark的普及,Spark SQL也逐渐被人们接受。后来Hive推出了Hive on Spark,将Hive的执行计划转换成Spark的计算模型。 我们还希望在NoSQL执行SQL,毕竟SQL发展几十年,积累庞大用户,很多人习惯用SQL解决问题。于是Saleforce推出了Phoenix,一个执行在HBase上的SQL引擎。 这些SQL引擎只支持类SQL语法,并不能像数据库那样支持标准SQL,特别是数据仓库领域几乎必然会用到嵌套查询SQL:在where条件里面嵌套select子查询,但几乎所有的大数据SQL引擎都不支持。然而习惯于传统数据库的使用者希望大数据也能支持标准SQL。 回到Hive。Hive本身的技术架构其实并没有什么创新,数据库相关的技术和架构已经非常成熟,只要将这些技术架构应用到MapReduce上就得到了Hadoop大数据仓库Hive。但是想到将两种技术嫁接到一起,却是极具创新性的,通过嫁接产生出的Hive极大降低大数据的应用门槛,也使Hadoop得到普及。 >参考 - https://learning.oreilly.com/library/view/hadoop-the-definitive/9781491901687/ch17.html#TheMetastore
  • [大数据] Hive 引擎Tez和MR 启用local模式参数
    1.说明  正常在提交任务时,Hive都是提交在yarn上面。启动local模式的目的就是让hive的任务不运行在yarn上面,直接当前的服务器执行任务。2.优点当我们对Hive的源码进行Debug,且代码需要Debug到每个task内部时,如果任务是执行在yarn模式的话,那么是无法打断点的,需要进入local模式才能打断点3.MR当引擎为MR时,需要修改以下参数,可以修改配置文件hive-site.xml,也可以通过set来生效3.1 hive-site.xml<property> <name>hive.exec.mode.local.auto</name> <value>true</value> </property> <property> <name>hive.exec.mode.local.auto.inputbytes.max</name> <value>134217728</value> </property> <property> <name>hive.exec.mode.local.auto.input.files.max</name> <value>10</value> </property>3.2 set模式# 是否开启local模式 set hive.exec.mode.local.auto=true; # 输入最大数据量,默认128MB set hive.exec.mode.local.auto.inputbytes.max=134217728; # 最大任务数 set hive.exec.mode.local.auto.input.files.max=10;4.Tez当引擎为MR时,需要修改tez的配置文件tez-site.xml,如果通过set来执行将不生效4.1 tez-site.xml<property> <name>tez.local.mode</name> <value>true</value> </property> <property> <name>tez.grouping.split-count</name> <value>1</value> </property>说明:tez.grouping.split-count和上面的hive.exec.mode.local.auto.input.files.max类似
  • [技术干货] 2022分布式存储线上峰会成功举行,驱动中国数据要素市场发展
    4月14日,“2022分布式存储线上峰会”成功举行。本次峰会由百易传媒(DOIT)与厦门大学信息学院联合主办,中国计算机学会信息存储专委会、中国计算机行业协会信息存储与安全专委会、武汉光电国家研究中心协办,吸引了近50万观众参与直播和互动交流。不久前,中共中央、国务院在“关于加快建设全国统一大市场的意见”中提到:加快培育数据要素市场,建立健全数据安全、权利保护、跨境传输管理、交易流通、开放共享、安全认证等基础制度和标准规范,深入开展数据资源调查,推动数据资源开发利用。数据要素市场的提出,为分布式存储和数据存储市场带来重要发展机遇。中国计算机学会信息存储专委会主任委员、清华大学计算机科学与技术系教授、厦门大学信息学院院长舒继武在峰会开幕致词中表示:“从技术形态来看,分布式存储在可扩展性、灵活性等方面的优势更适合解决数据要素市场发展过程中所面临的数据存储与管理问题。”主流厂商积极参与,分布式存储市场快速增长云计算、5G、物联网、人工智能等新技术的快速应用,以及传统产业的数字化转型加速,带来海量数据的规模化聚集;IDC预计,未来五年软件定义存储市场的复合增长率将达到23.4%,到2025年分布式存储的市场空间将达到325亿美元。层出不穷的数据形态、不断变化的部署环境、随时出现的安全隐患等,都对存储技术发展提出了新的要求。分布式存储凭借高安全性、可靠性、可用性以及易于扩展等特性得到了快速发展,“十四五”规划更是将超大规模分布式存储技术创新列在数字经济重点产业云计算专项的首要位置,大批优秀的分布式存储供应商争相发力这一赛道。当天的峰会上,英特尔数据中心与人工智能事业部副总裁、英特尔傲腾事业部总经理David Tuhy探讨了如何通过基础设施现代化来帮助客户实现云原生数字化转型;浪潮信息存储产品线分布式存储总经理姜乐果在主题演讲中指出,数据要素是数字经济发展核心引擎,浪潮信息是聚焦于智慧计算战略,面向智慧时代与算力、算法、数据、网络四大支柱持续构筑数字信息的基础设施;新华三集团存储产品线副总经理兼首席产品经理关天舒指出,分布式存储必须拥有极致的性能表现和极智的管理体验,新华三正以极速和智能重塑下一代分布式存储;中国电信集团有限公司云计算首席专家江峰在峰会上表示,中国电信天翼云正致力于以创新的手段减少用户不必要的投资,降低数据中心能耗,推进“双碳”国家战略。据悉,峰会还设置了分布式存储技术应用和混合云数据管理两个分论坛。分布式存储论坛上,联想凌拓资深产品经理吴静介绍了联想凌拓面向海量的非结构化数据打造全自研分布式存储及与本地硬件、芯片、操作系统和存储软件全面国产化的历程;宏杉科技产品部副总工程师谢勇介绍了宏杉MOFS分布式存储系统针对用户的业务需求提供文件、对象、大数据方面差异化的存储资源服务;深信服存储产品线副总经理田皓野表示,深信服存储始终秉持“敬畏数据、充分实践”理念,以更好的方案应对客户业务发展对存储技术架构变化带来的挑战,共同创造数据宏图;在房地产行业创造了多个信息化第一的上海锐通管理咨询有限公司总经理、房地产CIO联盟秘书长罗艳兵分析了企业数字化建设过程中遇到种种困惑,引导企业有效整合和运用内外资源快速转型突围,最终实现数据价值的最大化。此外,来自中国移动云、中国建设银行、腾讯云、阿里云智能、戴尔科技集团合作伙伴荣联科技等企业代表分别就分布式存储技术创新、分布式存储的应用、云原生与SDS、混合云与数据管理等热点话题展开讨论。把脉分布式存储市场,峰会两大研究成果发布本次峰会的亮点之一是《2022分布式存储市场调研报告》的同期发布。该报告从市场、应用和实践的维度,对分布式存储产品技术应用中的热点问题进行了深入解读,分析和预测了分布式存储市场规模。报告对坊间关于分布式存储基本概念的认识误区进行了纠偏,厘清了分布式存储与集中式存储、软件定义存储、云存储等其他相关技术的关系,并对分布式存储的发展趋势、重要特性、市场规模、参与角色、选型应用、场景及成效进行深度阐述,可以说,这篇调研报告对分布式存储概念与分类进行了“重新定义”。与此同时,“2022分布式存储企业图鉴”也于峰会当天正式发布。图鉴集中展示了分布式存储赛道上的50余家代表厂商,吸引了存储专家和企业IT用户的广泛关注。见证分布式存储产业五年变迁,驱动中国数据要素快速发展从2018年开始,分布式存储峰会已经先后在北京、深圳、上海等地连续成功举办了四届,峰会见证了分布式存储产业五年的快速发展。百易传媒(DOIT)持续跟踪分布式存储产业技术发展和行业应用趋势,与业内领军企业携手,将分布式存储领域最新的技术发展趋势和典型行业应用实践呈现给广大用户,推动各行业数字化转型进程。“计算和网络性能的提升,闪存性能的不断突破,为分布式存储的创新奠定了基础,分布式存储系统在性能、可管理性等方面也在不断进步。全球范围内,包括中国市场诞生了多家主打分布式存储技术的创新企业,而且呈现良好的发展态势。”舒继武教授最后呼吁:“让我们携手共同努力,为中国数据要素市场的发展贡献力量!“来源:IT168
  • [技术干货] 企业数字化转型方式方法的探讨[转载]
    1. 数字经济和数字化转型1.1. 数字经济成为未来竞争的主战场数字经济是未来世界经济竞争格局的战略高地。国家十四五规划与 2035远景目标纲要已发布,其中数字中国建设对未来中国数字化转型及其数字中国建设的一系列重大方针政策都做出了相关的规定。1.2. 疫情加速数字经济的发展1.3. 数字化使企业的工作流程更加高效敏捷1.4. 数字化转型的核心价值1.5. 数字技术全面融入社会交往和日常生活在国家十四五规划里,对数字社会建设做出了一系列重要部署。比如数字技术全面融入社会交往和日常生活,提供智慧便捷的公共服务,促进公共服务和社会运行方式创新,建设新型智慧城市,构建国民美好数字生活新图景,推进全民美好数字生活等,这在一定意义上为未来的数字社会建设指明了方向。未来的趋势是通过数字化转型,数字驱动生活方式的变革。趋势一:社会数字化将在未来五年进一步上升。目前我国的数字化普及率刚刚超过 70%,与发达国家还有一定差距、存在较大提升空间;趋势二:民生相关的医疗、教育、社保、养老、就业等数字化水平将大幅提高;趋势三:数字孪生技术与城市的结合,智慧城市建设将得到快速发展;趋势四:数据经济时代,数字消费者对数字化转型将产生更大的影响。2. 新技术对行业应用场景的影响2.1. 2021年Gartner数字商务技术成熟度据 Gartner发布的 2021年数字商务技术成熟度曲线,虚拟客户助理、数字钱包、可视化配置、客户身份和访问管理等数字商务技术已到了稳步爬升期,并有望在 2年内到达生产成熟期。数字体验平台、客户主数据管理、产品主数据管理等技术,也将在 2-5年内到达生产成熟期。2.2. ICT技术与经济社会深度融合2.3. 5G技术在各行业的应用场景2.4. 大数据技术在各行业中应用的深度和广度从应用的功能和成效来看,大数据技术应用的价值主要体现在降本增效、精准营销、决策支持三个方面,其应用的深度和广度,在不同行业呈现不同的侧重点。2.5. 人工智能技术中重点领域应用场景从产业链来看人工智能产业链主要有三个核心层:基础层、技术层及应用层。计算机能力和平台的发展,是人工智能技术和应用实现的基础,计算机视觉、语音识别、自然语言处理、机器学习、大数据服务等技术的实现,是人工智能应用落地的保障。从应用层看人工智能产业主要有智慧城市、智慧生产、智慧生活三大类应用领域,在制造业、电力电网、交通运输三大行业已形成规模应用,主要落地应用有以下十大场景:无人驾驶汽车、人脸识别、机器翻译、声纹识别、智能客服机器人、智能外呼机器人、智能音箱、个性化推荐、医学图像处理、图像搜索等。3. 企业数字化转型通过数字化转型,实现跨层级、跨地域、跨系统、跨部门、跨业务的协同管理,打造组件化、松耦合的中台能力,将数字技术与企业需求相融合,释放数字化转型的真正价值。3.1. 企业数字化阶段企业数字化阶段,可以划分成以下四个阶段:基础信息化应用数字化全面系统化智慧生态化数字化转型各阶段的基本特征和典型应用3.2. 数字化实施策略企业在实施数字化阶段的过程中,可以基于以下实施策略:3.2.1. 基于单个业务场景基于单个业务场景数字化为启动点的方法,以点带面,逐步实施,反复迭代,最终带动企业的整体转型。通过单点突破 -> 局部扩散 —> 复制推广 -> 全面融合 —> 优化创新的路径,推动研发、产品、装备、生产、管理、服务等业务场景数字化、网络化、智能化转型,逐步搭建和完善企业内部数字化管理平台。3.2.2. 基于新技术的应用场景基于工业互联网,通过人工智能、5G、物联网、云计算、大数据、数字孪生、精益制造等数字技术创新应用手段,建设具有“柔性化、智能化、数字化”特征的智能工厂。3.2.3. 基于供应链协同服务场景基于资源对接、协同生产等供应链协同模式新业态,打造行业供应链协同服务平台,推动行业上下游分散资源的有效汇聚与广泛共享。3.3. 数字化转型场景落地线路图企业数字化转型场景企业数字化转型场景指的是在特定时间、空间/地点、人物对象,以生产经营活动为中心使用各类数字化手段,将业务活动的各动作,按照相关的关联关系,完成特定的业务流程,面向生产经营活动中特定的活动问题对应的解决方案构成的相关过程,构建起的碎片化流程及流程对象构成的各类关系。围绕场景的转变所带来的价值,逐步汇集转变中需要的技术、平台、运营、组织管理的需求,通过迭代的方式,逐步的完成数字化的转型。场景要素数字化首先将场景的基本信息进行收集及结构化,即填写背景及目标,深入总结场景建设的背景、痛点问题和建设的目标,通过场景要素的构成性描述场景企业可以深入的了解在特定的时间空间、组织角色、场景活动及其相关的应用、设备、信息等多维度的相关信息。通过场景描述澄清场景对应的需求及场景活动等细节将围绕场景活动及产生相应的数字应用、机器设备、数据信息、数字技术等场景对象的协作关系完整表述出来。数字化场景是不断迭代的,随着新技术、新设备不断涌现,新技术和原有场景可以多次形成新的组合,从而不断向全感知、全联接、全智能的数字化场景发展,所以场景要素是迭代优化的基础,需要完成全面的场景要素清单。场景资源数字化将场景涉及的平台、场景节点等通过数字化的手段进行相关的系统平台支撑的方式承载相关功能及其相关流程,通过数字化智能化系统的建设、业务能力承载。将各场景节点相关的标准业务服务、场景节点业务流程进行自动化、智能化的能力升级、从而将传统由不同的业务角色及其相关组织中的人完成的业务动作转变成部分或全部由自动化、数字化、智能化的系统承载完成。并将相关的业务流程中设计的标准动作以系统功能点的形式落地到对应应用系统建设过程中。完成对应的系统建设后形成对应的标准化应用服务。场景设备数字化将场景涉及的设备、基础设施等通过数据自豪的手段进行相关的设备互通互联建设,通过将设备进行数字孪生的建设,进行设备及基础设施的数字化改造升级及现实世界的数字化同构模型的建设。3.3.1. 数字化转型场景建设五步设计法步骤一: 场景的价值按照场景价值发现法,通过各类调研发现企业场景现状与问题、将相关场景下的业务需求进行需求分析。并针对各类需求制定对应的转型目标。步骤二:场景的技术创新将场景涉及的业务流程进行业务融合新型技术的创新设计,将对应的场景进行技术改造和业务升级形成创新场景。步骤三:场景的生态通过场景生态构建以场景为核心的多维度、供需能力结合的场景生态供给侧与需求侧的拉通,形成特色的生态解决能力提供场景服务。步骤四:场景的长效机制将场景设计建设成效及其未来的运营机制进行相关设计,通过场景运营建立场景的长效培育机制,解决场景相关能力上线后的目标效果评估、目标场景的迭代等相关问题。形成场景能力的长效运营使场景节点目标更好的得到能力升级及产品迭代。步骤五:场景的组织建设将场景涉及的角色、组织、平台装备等一系列相关方进行组织变革、平台能力中心建设设计。形成场景能力建设完成后的组织文化保障,更好的通过组织能力长效服务及建设相关场景能力。3.4. 企业数字化转型场景案例3.4.1. 智能制造数字化转型及重要场景路线图智能制造行业数字化发展路线总结为管理数字化、生产数字化、生产智能化、产业数字化四个阶段总路线,数字化文化和能力的培养贯穿整个数字化发展进程,在每个阶段具有代表性的重点场景.3.4.2. 能源行业数字化转型及重要场景路线图能源行业数字化发展路线总结为业务数字化、数据资产化、海外赋能、数字化生态四个阶段路线,数字化文化和能力的培养贯穿整个数字化发展进程,在每个阶段具有代表性的重点场景。4. 参考华为:数字化转型,从战略到执行华为:华为行业数字化转型方法论白皮书2019[中央企业数字化发展研究院:2021年国有企业数字化转型场景示范和线路图研究白皮书]http://siab.org.cn/2021/12/28/guoqishuzihuazhuanxing/
  • [知识分享] 【大数据系列】业务并发度不够,数仓的CN可以来帮忙
    本文分享自华为云社区《[CN与业务并发度的关系-业务并发度不够?CN来帮忙](https://bbs.huaweicloud.com/blogs/342917?utm_source=csdn&utm_medium=bbs-ex&utm_campaign=ei&utm_content=content)》,作者:闻鲜生 。 # 一、CN的作用是什么? CN全称协调节点(Coordinator Node)。是和用户关系最密切也是DWS内部非常重要的一个组件,它负责提供外部应用接口、优化全局执行计划、向Datanode分发执行计划,以及汇总、处理执行结果。 集群中,CN有多个并且CN的角色是对等的(执行DML语句时连接到任何一个CN都可以得到一致的结果)。只需要在CN和应用程序之间增加一个负载均衡器,使得CN对应用是透明的。DWS通过CCN(Control Coordinator Node)负责集群内的资源全局负载控制,以实现自适应的动态负载管理。CM在第一次集群启动时,通过集群部署形式,选择编号最小的CN作为CCN。若CCN故障之后,由CM选择新的CCN进行替换。 ## 一次简单的查询流程如下所示: 1. 用户通过应用程序发出查询本地数据的SQL请求到Coordinator。 2. Coordinator接收用户的SQL请求,分配服务进程,向GTM请求分配全局事务信息。 3. GTM接收到Coordinator的请求,返回全局事务信息给Coordinator。 4. Coordinator根据数据分布信息以及系统元信息,解析SQL为查询计划树,从查询计划树中提取可以发送到Datanode的执行步骤,封装成SQL语句或者子执行计划树,发送到Datanode执行。 5. Datanode接收到读取任务后,查询具体Storage上的本地数据块。 6. Datanode任务执行后,将执行结果返回给Coordinator。 7. Coordinator将查询结果通过应用程序返回给用户。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648779898158599361.png) # 二、CN与业务并发度的关系 CN是外部应用的接口,CN的并发能力直接决定了业务的并发度。单CN的并发能力受如下几个参数控制: max_connections: 允许和数据库连接的最大并发连接数。此参数会影响集群的并发能力。CN节点默认值为800,DN节点默认值为5000。 max_active_statements:设置全局的最大并发数量。此参数只应用到CN,且针对一个CN上的执行作业。默认值60。 CN的max_connections和max_active_statements参数支持用户根据业务并发度诉求修改,详细操作流程如下图: 点击集群详情的“参数修改”页面,搜索需要修改的参数,会显示对应参数和当前值,参数值框里面输入修改值,点击“保存”按钮保存配置。“是否重启集群”栏显示“是”的参数说明需要重启集群生效,请寻找业务空闲期修改。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648779912148732840.png) # 三、CN不够怎么办? 单CN的并发能力会受到硬件资源和拓扑结构的限制,不能无限制调大。DWS是分布式架构集群,此时就要考虑横向扩展,增加更多的CN来提升业务并发度,充分利用分布式架构的优势。 ## o 下发集群时配置更多的CN CN数量在下发DWS集群时可以配置。默认值3个,最少2个,最多不超过“节点数量”,如果节点数量大于20,则CN数量最多可配置20个。如下图所示,在“创建数据仓库集群”的购买页面的“高级配置”选择“自定义”,“CN部署量”即为CN的初始部署数量。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648779937648110002.png) ## o 下发集群后在线添加CN 集群下发后,如果由于业务并发度高导致CN不够用,可以在线添加CN,具体操作如下图所示。增加CN耗时与用户表数量有关,大概10分钟左右,增加CN过程中间有一段时间会锁集群,阻塞DDL语句执行。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648779959209277794.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648779951612308635.png) # 四、如何做到多个CN负载均衡? 如果集群部署了多个CN,但是怎么做到CN的负载均衡,保证业务并发度和性能最大化呢?DWS提供了弹性负载均衡(Elastic Load Balance,简称ELB)服务。弹性负载均衡可以通过流量分发扩展应用系统对外的服务能力,同时通过消除单点故障提升应用系统的可用性。 - **ELB的配置原理介绍** ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648779995520974514.png) - **ELB的绑定方法** ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648780003005466786.png) # 五、CN故障了怎么办? 由于DWS的CN角色是对等的,同时对外提供服务,因此必须保证其元数据的强一致性,因此外部应用连接任一个CN执行涉及元数据变更的操作(如DDL,DCL)必须分发到所有的CN同时完成。 如果单个CN故障,会影响所有CN的DDL和DCL操作。目前DWS提供了两个解决方案: **自动剔除CN** 如果集群绑定了弹性负载均衡(ELB),则会自动打开自动剔除CN功能,DWS CM周期性检测CN的状态,如果发现CN连续故障600s,则会立即从整个集群剔除该故障CN,保证其余CN的业务不受到影响。再配合弹性负载均衡服务,会自动把发送到故障CN的作业转发到其他正常CN。 **删除cn介绍** 如果发现集群部分CN故障,或存在亚健康状态,可以选择手动删除故障CN,具体操作流程如下。手动删除CN耗时固定,1分钟左右。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648780049643318627.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20224/1/1648780057080756227.png) 总结:希望通过此文,让你能够对CN作用,CN运维操作,业务并发度有进一步的了解!
  • [大数据] Hive Tez 0.10.0版本编译安装 适配3.1以上的hadoop
    1.说明在官网下载的最新的Apache Tez在适配Hadoop3.0以上的版本时会存在一些问题,这边打算自己编译安装来适配2.下载tez github源码下载https://github.com/apache/tez/或者可以直接使用wget命令下载wget https://github.com/apache/tez/archive/rel/release-0.10.0.tar.gz --no-check-certificate3.编译tar -zxvf release-0.10.0.tar.gz解压之后的目录:修改pom.xml的hadoop版本修改适配自己版本的hadoop添加配置可用的Maven仓库源 <repositories> <repository> <id>huaweimaven</id> <name>huawei maven</name> <url>https://mirrors.huaweicloud.com/repository/maven/</url> </repository> </repositories>选择不编译tez-ui模块 不影响功能,编译比较耗时间编译命令:mvn clean install -DskipTests4.安装选择/usr/local作为tez的安装目录将编译好的tez包上传到/usr/local目录上mv tez-0.10.0.tar.gz /usr/local tar -zxvf tez-0.10.0.tar.gz ln -s tez-0.10.0 /usr/local/tez上传tez.tar.gz到hdfs在hdfs上创建目录hdfs dfs -mkdir -p /apps/tez hdfs dfs -put tez.tar.gz /apps/tez新增tez-site.xmlcd /usr/local/tez/conf vim tez-site.xml<?xml version="1.0" encoding="UTF-8"?> <?xml-stylesheet type="text/xsl" href="configuration.xsl"?> <configuration> <property> <name>tez.lib.uris</name> <value>${fs.defaultFS}/apps/tez/tez.tar.gz</value> </property> <property> <name>tez.use.cluster.hadoop-libs</name> <value>false</value> </property> <property> <name>tez.history.logging.service.class</name> <value>org.apache.tez.dag.history.logging.ats.ATSHistoryLoggingService</value> </property> </configuration>修改hadoop-env.sh所有节点都需要替换cd /usr/local/hadoop/etc/hadoop vim hadoop-env.shexport TEZ_CONF_DIR=/usr/local/tez/conf/tez-site.xml export TEZ_JARS=/usr/local/tez export HADOOP_CLASSPATH=${HADOOP_CLASSPATH}:${TEZ_CONF_DIR}:${TEZ_JARS}/*:${TEZ_JARS}/lib/*修改yarn-site.xml所有节点都需要替换cd /usr/local/hadoop/etc/hadoop vim yarn-site.xml<property> <name>yarn.timeline-service.enabled</name> <value>true</value> </property> <property> <name>yarn.timeline-service.hostname</name> <value>server1</value> </property> <property> <name>yarn.timeline-service.http-cross-origin.enabled</name> <value>true</value> </property> <property> <name>yarn.resourcemanager.system-metrics-publisher.enabled</name> <value>true</value> </property> <property> <name>yarn.timeline-service.generic-application-history.enabled</name> <value>true</value> </property> <property> <name>yarn.timeline-service.address</name>cd <value>server1:10200</value> </property> <property> <name>yarn.timeline-service.webapp.address</name> <value>server1:8188</value> </property> <property> <name>yarn.timeline-service.webapp.https.address</name> <value>server1:8190</value> </property> <property> <name>yarn.timeline-service.leveldb-timeline-store.path</name> <value>${hadoop.tmp.dir}/yarn/timeline</value> <description>Store file name for leveldb timeline store.</description> </property> <property> <name>yarn.timeline-service.ttl-ms</name> <value>604800000</value> <description>Time to live for timeline store data in milliseconds.</description> </property> <property> <name>yarn.timeline-service.bind-host</name> <value>0.0.0.0</value> </property>
  • [常见FAQ] 【提交作品】【运行失败】本地相同ubuntu环境用最大数据量级的数据正常运行,提交后直接运行失败
    【功能模块】【操作步骤&问题现象】1、C语言编写,本地运行成功并输出,提交显示选手程序运行失败2、运行环境:虚拟机ubuntu18.04,分配内存4G,处理器2*1核,gcc版本7.5.0测试数据量级:8192时刻,135边缘节点,35客户【截图信息】运行环境运行结束完成输出访问路径使用库上传压缩包【日志信息】(可选,上传日志内容或者附件)排查了各种可能,如果是内存溢出,相同配置的本地虚拟机应该已经溢出了,路径,压缩内容,命名都没发现问题,还是说是我没注意到
  • [讨论交流] 3月20日 Compiler SIG 技术沙龙回顾
    1 寄存器分配问题的历史与演进B站视频地址:https://www.bilibili.com/video/BV1eF411x7Rh主讲人介绍:华保健中国科学技术大学软件学院助理教授,先进编译技术实验室主任,中国科学技术大学计算机系博士研究方向:程序设计语言和编译器技术、基于软件技术的计算机安全摘要:寄存器分配是编译器后端的重要优化,对于改进程序性能有显著作用。由于从理论上讲寄存器分配问题是 NP 难的,已有研究提出了各种启发式策略。本报告系统分析总结了经典的寄存器分配问题的历史发展和演进,全面总结了各种分析策略和算法。寄存器分配问题的研究分析,对于研究和构建面向 openEuler 等系统的下一代寄存器分配器有一定的指导作用。2 编译器矩阵扩展指令的支持与优化B站视频地址:https://www.bilibili.com/video/BV1fS4y1u7TE主讲人介绍:魏伟华为毕昇编译器主架构师,编译器领域技术专家研究方向:高性能计算编译优化技术,软硬件协同优化,调测调优工具开发,及新的编译技术研究方向探索等摘要:为了加速机器学习,越来越多的 CPU 架构添加了专门的 Matrix 或者 Tensor 单元,比如 Intel 推出的高级矩阵扩展指令集 AMX(Advanced Matrix Extensions),PowerPC 推出的矩阵乘辅助指令集 MMA(Matrix-Multiply Assist),以及 ARMv9 架构新增的可伸缩矩阵扩展指令集 SME(Scalable Matrix Extension)。本演讲将对上述几种 Matrix 扩展做简单的介绍,并分析当前业界主流编译器的 Matrix 支持情况,同时将会重点分享毕昇编译器上对 Matrix 的支持以及 SME 指令集的适配工作。3 Java 静态编译器的基类解耦方法及 Java/JavaScript 虚拟机上对象内存泄漏的在线检测方法B站视频地址:https://www.bilibili.com/video/BV1Nr4y1q7Dx主讲人介绍:史晓华北京航空航天大学软件学院副教授,博士,博导研究方向:编译技术,并行计算,软件工程等摘要:1)Java 静态编译器将面临某些语义解析的正确性挑战,其中较为关键的挑战之一就是所谓 “脆弱基类 Fragile Base Class”的解耦问题。我们将讨论包括 Java、SWIFT、Objective-C等典型面向对象语言编译器的解耦方法。2)Java 和 JavaScript 的“对象泄漏” 问题存在一定的相似性。我们将讨论如何在不同的 JVM和 JSVM上实现一种相似的在线检测机制,可以在较低负载的前提下,在程序运行过程中有效的捕捉到对象的泄漏信息。4 Python 在大数据领域实践和思考B站视频地址:https://www.bilibili.com/video/BV1EF411x7Zd主讲人介绍:张超腾讯专家工程师,原华为方舟编译器架构师研究方向:编译器和编程语言,大数据 / 机器学习、云计算等摘要:Python登顶编程语言榜单,已经不再是性能无所谓的脚本语言。从大数据现网经验来看,它正深刻影响着海量应用的功能和性能。2021年以来Microsoft、Facebook、Pyston等陆续开源了各自的Cpython高性能计划和代码。腾讯数据中心编译器团队以CPython为基础,针对公司数据科学场景需求和痛点,对CPython做了针对性优化。本演讲将对性能优化的进展、成果和思考进行介绍。5 HPL-AI benchmark for Kunpeng+Ascend AI-specific heterogeneous platformB站视频地址:https://www.bilibili.com/video/BV1zS4y1U7tX主讲人介绍:孙乔中科院软件所高级工程师, 硕士生导师研究方向:并行软件, 并行编程模型及计算机性能评测摘要:HPL-AI (High Performance Linpack, Artificial Intelligence) 是专为衡量计算平台面向 AI 任务处理能力的性能基准测试程序。本报告围绕华为鲲鹏 + 昇腾这一新兴 AI 专用异构平台,介绍我们在 HPL-AI 程序的实现和优化过程中所面对的挑战与解决方案。在优化过程中我们结合毕昇 C++ 的语言特性,实现了 HPL-AI 程序 Host+Device 侧的单源编程编译,充分挖掘 Device 侧算子性能,同时较好地兼顾了平台移植性。6 Kona Fiber 的进阶之路B站视频地址:https://www.bilibili.com/video/BV1kZ4y167pV主讲人介绍:郑淼高级工程师,深入参与腾讯自研协程 KonaFiber 和 ZGC 优化研究方向:协程和 ZGC摘要:协程可以让程序员用熟悉的同步编程方式取得类似异步编程的高性能和高并发收益,OpenJDK 社区正在前沿版本进行协程方案 Loom 的探索、开发,整体方案正在趋于完善。Kona Fiber 是腾讯在 jdk8、jdk11 上,兼容 Loom API 的开源协程实现。Kona Fiber 不仅让用户可以在当前主流 JDK 版本上体验未来 OpenJDK 社区的协程方案,同时一直在加强其可用性和易用性,使 Kona Fiber 能被更广泛、更便捷地应用到实际业务中。
  • [大数据] spark ml 随机森林解析
    一、背景使用 Spark 机器学习库来做机器学习工作,可以说是非常的简单,通常只需要在对原始数据进行处理后,然后直接调用相应的 API 就可以实现。但是要想选择合适的算法,高效准确地对数据进行分析,可能还需要深入了解下算法原理,以及相应 Spark MLlib API 实现的参数的意义。目前,Spark MLlib 中实现了 tree 相关的算法,决策树 DT(DecisionTree),随机森林 RF(Random Forest),GBDT(Gradient Boosting Decision Tree),其基础都是RF,DT 是 RF 一棵树时的情况,而 GBDT 则是循环构建DT,GBDT与DT的代码是非常简单明了的,本文会对 Random Forest 的原理和源码进行分析。二、决策树与随机森林首先我们来对决策树和随机森林进行简单的了解:决策树 GBDT-Decision Tree(DT)关键问题节点分裂:使用的特征及阈值特征选取:最小均方差、信息增益(ID3)、信息增益率(C4.5)阈值:从特征值中选取、等步长选取最大最小值之间的值叶子节点的值:叶子所属数据的均值(回归)、对应类别(分类)截止条件:达到叶子节点数上限、继续划分无法使误差减小          在决策树的训练中,如上图所示,就是从根节点开始,不断的分裂,直到触发截止条件,在节点的分裂过程中要解决的问题其实就两个:分裂点:一般就是遍历所有特征的所有特征值,选取impurity最大的分成左右孩子节点,impurity的选取有信息熵(分类),最小均方差(回归)等方法预测值:一般取当前最多的class(分类)或者取均值(回归)随机森林随机森林就是构建多棵决策树投票,在构建多棵树过程中,引入随机性,一般体现在两个方面,一是每棵树使用的样本进行随机抽样,分为有放回和无放回抽样。二是对每棵树使用的特征集进行抽样,使用部分特征训练。在训练过程中,如果单机内存能放下所有样本,可以用多线程同时训练多棵树,树之间的训练互不影响。三、Spark随机森林概要(训练步骤)随机森林中的每个树模型之间没有关联,可以独立训练,这为随机森林的分布式训练提供可能。具体的训练步骤如下:1.将每个树模型的根节点取出,加入栈中2.将k个节点从栈中取出,组成一个训练集合group,k值由内存限制决定,确定特征采样3.从各分区上计算并汇合分布信息,并计算待切分节点的最优切分点4.根据切分点生成新的叶子节点,并更新nodeIdCache5.若新生成的叶子节点没有达到最小不纯度限制和最小样本数量的限制,则入栈6.若栈非空 goto 2.7.剪枝合并多余节点,结束spark实现分布式随机森林优化点Spark 平台上,传统单机形式的迭代方式必须要进行相应改进才能适用于分布式环境,这是因为在分布式环境下,数据也是分布式的,算法设计不得当会生成大量的 IO 操作,影响算法效率三个优化策略。1.切分点抽样统计在单机环境下的决策树对连续变量进行切分点选择时,一般是通过对特征点进行排序,然后取相邻两个数之间的点作为切分点,如果在分布式环境下如此操作的话,会带来大量的网络传输操作,特别是当数据量达到 PB 级时,算法效率将极为低下 Spark 中的随机森林在构建决策树时,会对各分区采用一定的子特征策略进行抽样, 然后生成各个分区的统计数据,并最终得到切分点。2.切分特征装箱(Binning)决策树的构建过程就是对特征的取值不断进行划分的过程对于离散的特征,如果有M个值,最多个划分如果值是有序的,那么就最多 M-1个划分(按老,中,少的序,那么只有 m-1 个,即 2 种划分,老|中,少;老,中|少)划分的点就是 split(切分点),划分出的区间就是 bin。对于连续特征 ,理论上 split 是无数的,在分布环境下不可能取出所有的值,因此它采用的是1中的切点抽样统计方法。3.逐层训练(level-wise training)单机版本的决策数生成过程是通过递归调用(本质上是深度优先)的方式构造树,在构造树的同时,需要移动数据,将同一个子节点的数据移动到一起分布式环境下采用的策略是逐层构建树节点(本质上是广度优先),这样遍历所有数据的次数 等于所有树中的最大层数。每次遍历时,只需要计算每个节点所有切分点统计参数,遍历完后,根据节点的特征划分,决定是否切分,以及如何切分。总体时序图具体分析代码,可以得出以下时序图具体流程详解随机森林最重要的就是寻找最佳split的过程,首先要计算所有可能的split,流程图如下:找到所有可能的split了,就需要再其中挑选出最佳split,流程图如下:在分割结束后,最后一步需要在driver端建树,流程图如下:
  • [加速器] 鲲鹏BoostKit加速库对基础软件深度性能优化,助力客户极致性能提升
    1.1      背景与价值业务的持续增长往往带来对于应用系统性能要求的提升,业务应用如何基于既有软硬件资源,充分发挥计算算力,提升并发性能,处理更多事务,是开发者面临的最大挑战。鲲鹏加速库对软件基础库做深度性能优化,通过硬件加速和软件加速,给客户带来更高的性价比。1.2      鲲鹏BoostKit加速库全景鲲鹏应用使能套件BoostKit,释放倍级性能优势,提供以下八大场景化应用使能套件:大数据、分布式存储、数据库、虚拟化、 ARM原生、Web/CDN、NFV和HPC。其中的基础加速软件包,华为提供基础性能优化、基础加速库和加速算法等基础加速软件包和文档,合作伙伴可以从从鲲鹏社区获取基础加速软件包,在鲲鹏创新中心指导下进行编译、部署和性能优化。鲲鹏BoostKit加速库共支持3种加速库,分别是:ARM支持的加速库:开源社区提供的ARM支持的加速库,已在鲲鹏平台完成验证;基于鲲鹏指令的加速库:基于鲲鹏指令深度优化的加速库,并向开源社区开放基于KAE(Kunpeng Accelerator Engine,鲲鹏加速引擎)的加速库:基于鲲鹏硬件加速引擎的加速库,提供领先业界的性能加速能力。包含ZIP(硬加速-压缩),HPRE(硬加速-非对称加解密),SEC(硬加速-对称加解密)。上述3种加速库,依据使用的场景不同,一共可以分为7类,分别是:系统库、压缩库、加解密库、媒体与信号库、数学库、存储库、网络库。这7类加速库,在架构上,对上适用于各种解决方案,比如说大数据、分布式存储、数据库、虚拟化、ARM生web、CDN等,从而支撑这些解决方案服务于政府、运营商、金融等其它领域,对下适配主流的操作系统,比如说openEuler、CentOS等等。鲲鹏BoostKit加速库充分发挥硬件的能力,或者内嵌于操作系统,以及单独作为一个函数库,去支撑解决方案,提升解决方案的性能,最终提升客户的性价比,即不需要去加购硬件的配置,就可以提升算力和性能。1.3      鲲鹏BoostKit加速库实现原理及应用1.3.1        KAE加速库原理及应用KAE使用流程如下:BMC子系统管理芯片加速子系统的License,当系统初始化时,BMC将License传递给BIOS系统。BIOS子系统解析License信息,并根据解析结果对芯片加速子系统进行使能控制,并上报加速器ACPI表到内核。上层应用基于OpenSSL/zlib加速库调用鲲鹏加速引擎,并通过寄存器操作调用芯片加速子系统。从用户层的角度来看,apps在使用KAE时,只需进行简单的配置。如果应用程序已经调用了openSSL或者已经调用了Zlib,无需修改代码,便可获取KAE带来的加速能力,反之,我们提供了Warpdrive层,其算法进行了抽象,提供了API,供上层软件调用。同时提供统一的用户态加速框架,帮助降低调用路径性能损耗。KAE的应用场景十分广泛,包括Web应用方案、分布式存储、大数据、虚拟化。Web应用方案,在互联网和金融行业应用非常普遍,使用KAE的RSA去硬加速Nginx。Nginx负责短连接接入的负载均衡,其性能会直接决定系统能否接入,同时并发处理多少个客户请求。如果硬加速能够对RSA的处理做性能优化,就可以同时处理更多请求。通过实测发现Nginx在使用RSA硬加速之后,并发数量可以提升一倍。相比业界友商的加速卡整体性能领先35%。在分布式存储混合读写7:3典型场景中,对带宽性能验证发现:块存储和对象存储都平均提升15%以上,最高能接近40%。大数据场景,用到了国密的加解密。在大数据的节点之间同步时,需把数据加密之后再传输,或者把数据压缩之后再存储。此前CPU占比较高,约占20%。使用KAE后,整个加密性能有所提升,且CPU损耗不超过5%。省下的CPU就可以去做很多业务上的事情,比如MapReduce的任务数增加,这样整个端到端的性能就会有所提升。虚拟化场景,目前KAE引擎完全按照SR-IOV的标准实现。在虚拟化和容器场景下,使用KAE,不会导致虚拟化调用带来的额外损耗,使用KAE的效果和物理机几乎等同。1.3.2     鲲鹏指令加速库原理及应用Avx2NeonAvx2Neon加速库是一款接口集合库,将AVX指令封装为独立的接口模块,并采用NEON SIMD指令替换对应的AVX指令,解决迁移问题。x86 Intrinsic函数总共6000多个,目前已完成其中5000+个的函数接口适配;Avx2Neon对常用的SSE/AVX Intrinsics函数进行深度优化适配,使用鲲鹏920指令以及ARM Intrinsics函数进行深度性能优化。目前,适配函数以头文件方式集成到Porting Advisor工具,通过工具识别迁移点,并提供一键式快速迁移HyperscanHyperscan是一款高性能的正则表达式匹配库,其中包含大量高效算法。它基于官网5.2.0版本优化,除了使用ARM Neon指令加速外,还使用数据预取、分支预测、结构重排及循环展开等多种优化手段实现加速。Hyperscan支持块模式(适用于对一段现成的完整数据进行匹配)和流模式(网络场景下跨报文匹配设计的特殊匹配模式)两种匹配模式,适用于入侵检测系统、DPI解决方案、互联网营销、网络威胁检测等诸多场景。HMPPHMPP是华为自研高性能媒体性能原语库,包括图像处理HMPPI函数库以及信号处理HMPPS函数库两个子库,适配多个操作系统,提供函数API,应用于运动跟踪、雷达信号、图像分析、视频增强、AI加速、医学扫描、通信工程等诸多行业。目前已经完成信号库HMPPS完成1000+个函数接口开发包括以下方面:基础向量运算:逻辑移位运算、向量转换、向量统计、采样函数、初始化函数信号变换:FFT、CZT、功率谱、希尔伯特滤波:卷积、FIR滤波、重采样、中值滤波、自相关窗口函数:Blackman、Hann、Kaiser、Hamming、Bartlett数学运算:算数运算、三角运算、幂、根、指数运算HW265HW265是用于编码符合高效率视频编码(HEVC/H.265)标准的影片的开源自由软件及函数库。其支持8bit高清低码,性能与码率相比开源有倍级提升;其中8bit标准版实现相比x86开源x265有1~5倍的性能优势;其中8bit高清低码版实现平均50%的码率节省。应用于热门影片、短视频场景、OTT点播、秀场、游戏、在线教育等诸多场景。经测试验证,视频质量与转码速度均得到了大幅的提升,对于直播的场景,单机并发路数也实现倍级提升。数学库数学库KML(Kunpeng Math Library),目前一共包含6个子库,包含处理实复数快速傅里叶变换的KML_FFT,处理稀疏线性代数运算的KML_SPBLAS,处理线性代数运算(向量-向量/向量-矩阵/矩阵-矩阵)的KML_BLAS,处理向量计算的KML_VML,处理基础计算的KML_MATH,处理线性代数运算(矩阵分解/方程组求解/特征值)的KML_LAPACK。数学库广泛应用于大数据分析算法(如KAL)、科学计算(如气象、制造、化学等行业)、AI推理(如卷积算子等)。数学库在保证数学运算精度的同事,利用NEON指令、循环展开、汇编代码重构等方法,大幅度提升计算性能,其中KML_FFT与开源FFTW进行对比的,性能提升约有1倍,和基础库LIBM进行比较,性能提升约有50%。GlibcGlibc是c运行库,是linux系统中最底层、最基础的软件库,其它任何运行库几乎都会依赖于glibc。华为通过使用Q寄存器代替X寄存器、读写内存对齐、结合鲲鹏CPU芯片分支预测特性、算法优化等诸多优化方案,对内存、字符串等接口进行了加速优化,充分利用鲲鹏Neon指令优势提高算力。已优化的接口已合入GNU社区,随glibc2.31主干版本发布,同时openEuler1.0已收编相比于主流OS集成的glibc2.17,接口平均性能提升35+%。1.4      总结鲲鹏BoostKit加速库通过鲲鹏社区,社区化运作,针对合作伙伴和开发者,均可以通过鲲鹏社区(https://www.hikunpeng.com/zh/developer/devkit/library)联系华为和获取相关加速库。同时,加速库项目在github(https://github.com/kunpengcompute/Kunpeng)上进行了部分库的开源,以供开发者合作交流。另外,在鲲鹏众智(https://www.hikunpeng.com/ecosystem/ecology_remit)项目中发布了高回报的开发任务,如果您对加速库感兴趣,可以与鲲鹏BoostKit加速库团队一起共创ARM高性能生态。
  • [干货汇总] 华为云大数据轻模式体验:忘掉底层烦恼,专注数据开发
    本文分享自华为云社区《[华为云大数据轻模式体验:忘掉底层烦恼,专注数据开发](https://bbs.huaweicloud.com/blogs/336310?utm_source=csdn&utm_medium=bbs-ex&utm_campaign=other&utm_content=content)》,作者: 技术火炬手。 现阶段我们国家从政府到企业都在进行数字化转型,数字化转型的核心是数据,对于有着开发实力和基础的大公司来讲,他们可以有着完备的数据处理体系和开发人员储备,可以高效地利用手中的资源对数据进行再加工,让数据成为企业的生产要素。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646963881364553062.png) 我们知道,“二八定律”作为一个经济学原理揭示了任何一组事物最重要的构成只占其中的一小部分,其余的大部分多数构成的很小比例在经济学上被称为“长尾效应”。企业也是一样,处于中长尾的企业想要数字化转型,数据技术、人才、资金的高门槛往往让他们望而却步。他们亟需大数据行业的领导者,能做出企业的通用模式,节约数字化成本,降低用数门槛。不少企业虽然选择将业务上云作为数字化的一个方向,但对上云后产生的数据不管理、不加工、不分析,这让这些数据上云失去了意义。 华为云基于华为IT流程数据治理方法论推出华为云大数据轻量级解决方案,配合华为云资产可以轻资源、轻开发、轻部署、轻运维地快速构建数据治理体系,全Serverless方案对中长尾企业来讲使用灵活,企业无需关注底层技术栈、云资源性能,可按需使用降低运营成本。 华为云大数据相关服务提供数据全生命周期的一站式管理和开发,帮助中长尾企业大幅简化数据治理的流程,在这种轻模式的支持下,中长尾企业可以快速高效地应对大量数据的分析,降低用数门槛,加快企业数据变现,完成企业的数字化转型。 接下来,我们就通过具体的实例来对华为云数据湖治理中心DGC进行全方位的认识和了解,透过华为理念下形成的轻量级通用解决方案探讨中长尾企业如何应对数据治理上的难题。 # 华为云大数据轻量级解决方案介绍 针对中长尾企业的数据治理需求,华为云推出了大数据轻量级解决方案帮助企业进行高效的数据治理。我们都知道Serverless本质是将复杂留给自己,将便利提供给客户,加速用户的敏捷创新,这也是华为云大数据轻量级解决方案的核心思想。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646963932861246481.png) 华为云这套轻量级的解决方案区别于企业自建自管自运营的模式,全Serverless方案对于企业来讲不需要额外考虑资源管理、部署、运维,云上模式让企业大大降低了用于硬件管理与扩容、跨AZ可靠调度、Bug修复、软件安全、AI引擎调优等问题,只需专注业务开发即可,业务的使用与运营更加灵活。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646963942401680720.png) 华为云大数据轻量级解决方案作为一项通用的大数据治理解决方案为企业提供了丰富的拓展能力,支持对象存储、NoSQL、OLTP、OLAP等数据库类型,支持跨云数据治理、自建数据中心数据治理。企业不需要变更自己的底层数据技术栈就能实现大数据的治理和分析。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646963959423288030.png) 针对中长尾企业的数据治理场景,华为云DGC、DLI、CDM、RDS等服务提供轻量化、灵活的技术栈,通过将华为云服务串联,打造数据治理轻量化模式。涉及到以下核心服务: - CDM:高效、易用的数据迁移服务,支持批量和增量数据迁移,提供超过40种数据源到数据湖仓迁移能力; - DRS:基于事物日志(如MySQL、Oracle)的数据库复制进行增量同步; - DGC:数据标准和数据模型的规范设计,可进行在线开发和编排调度,数据质量稽核等一站式数据管理; - DLI:完全兼容Apache Spark、Apache Flink、Presto生态,提供批、流、交互式一体的Serverless融合处理分析,完全兼容SQL语法,开发难度低; - BI:通过华为云DLV数据可视化服务或专业BI软件实现2D或3D数据展示,通过拖拉拽式布局,帮助企业快速进行大屏数据可视化呈现。 对于企业来讲,华为云大数据轻量级解决方案通过一站式的大数据分析服务,实现了企业多端数据采集,并在统一框架下进行数据采集、分析、归纳。 通过全栈式技术能力,依托DLI数据湖探索服务以及配套的数据同步方案,可以满足企业海量数据分析的需求,完成快速数据分析,释放数据的价值。 由于DGC提供高度可视化的ETL任务开发、管理、调度的能力,同时DLI等数据服务支持通用SQL语法,这些对于企业来讲可以的大幅的降低开发过程中的门槛,实现简单易用、灵活高效的数据开发模式。另外通过专业的BI厂商,可以很好的满足企业对可视化BI工具的需求,数据生产到最后直观的可视化呈现,为运营分析降低门槛。 这DGC提供一站式的数据全生命周期的运营管理,配合华为云其他大数据产品, DGC作为华为云轻量级大数据解决方案的核心,它可对接多种数据湖引擎,帮助进行统一开发,并提供统一的数据资产管理。方便企业进行全链路数据治理管控。数据运营全场景可视,统一调度和运维带来全方位的安全保障。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964000525852292.png) 开发人员无需复杂配置就可以完成对数据的导入, DGC提供数据管理、数据集成、脚本开发、作业开发、作业调度、运维监控、全场景可视化等功能。方便企业不同部门的打破相互隔离,以此建设统一的数据平台,统一技术规范、数据标准和访问接口。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964009021672514.png) DGC提供丰富的大数据平台组件,方便多种数据和分析需求,降低数据治理的人工工作量,以此提升数据管理效率。DGC提供一套完整的数据治理方法论落地,通过这套方法论实现业务上下游数据的快速传递和共享,以此指导实际业务的运作。通过数据质量持续为企业提供预警,以此减少纠错成本,降低运营风险,提升服务质量。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964017500688591.png) 在分析处理上, DLI数据探索服务则成为华为云轻量级大数据治理方案的重要组成。这套方案中, 通过DLI等基础云服务实现数据探查、数据监控、数据标准化,形成有指导意义的集市层数据。DLI它支持结构化和无结构化的数据处理,并支持丰富的编程语言接口,同时成本也非常低。DLI完全兼容Apache Spark、Apache Flink、HetuEngine(基于Presto)。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964026584830367.png) DLI采用批流交互式一体架构,兼容标准 JDBC 协议,可以直接对接第三方 BI 软件,完成一站式大数据分析、用数的闭环场景。 由于DLI兼容标准的SQL语法且均基于Serverless进行分析计算服务,因此用户无需关心底层的计算架构,只需要通过连接服务即可进行数据分析,大大降低了开发的难度和门槛。DLI还支持免搬迁全域数据联合查询,过滤条件支持只能下压到数据源,减少传输数据量。由于DLI支持Kubernetes,因此DLI还支持资源按需分配,自动弹性伸缩。 接下来我们进入实例场景,通过对门店坪效的全流程设计来了解华为云大数据轻量级解决方案的各项服务能力,并快速的进行业务指标的模拟输出。 # 华为云大数据轻量级解决方案坪效实例场景体验 坪效作为零售行业的典型指标,是这次实例场景所要计算的一个指标,这样的数据分析模型是华为云大数据轻量化解决方案主要的运用场景,在进行坪效实例场景的演示操作前,我们首先了解下什么是坪效。坪效是衡量一个地区或门店某一时间段单位面积产出情况,即每坪经营面积可以产出多少营业额。 坪效计算公式如下: ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964045917359672.png) 坪效越高,店铺整体的经营效率也就越高,一般计算都以年为周期。华为云大数据轻量级解决方案的指导及下,我们以过去一年门店坪效指标和地区坪效指标作为目标,进行项目的设计和规划,其中涉及华为云大数据及其他云服务,包括VPS、OBS、RDS、CDM、DGC、DLI、DLV等。 零售业店铺在获取到坪效数据后,可以针对性的对门店业务、门店规模、人员结构进行调整。这一案例中涉及到DGC开发的数据集成、规范设计、数据开发、数据质量、数据资产、数据服务模块以及华为云大数据其他关联服务工具。 通过这些模块的体验,我们得以实现对华为云大数据轻量级解决方案的全面了解,对中长尾的大数据治理进行整体的设计、开发、分析、运营,在这种轻模式下,企业可以对数据进行敏捷开发。 # 轻资产:按需使用,无需担心底层技术栈及安全问题 在对于中长尾企业而言轻量化的资产管理体系可以省去大量云服务建设成本,华为云大数据轻量级解决方案绝大部分资源都建设在云上,对企业而言,可按需购买,购买即用,不需要额外关注底层的硬件性能和技术实现,并且不需要考虑相关工具软件的迭代和安全问题。 这里我们通过华为云CDM云数据迁移服务,集成RDS MySQL数据库模拟数据元门店系统及订单系统数据,利用华为云DLI数据湖探索服务的计算能力实现数据清理、指标计算和汇总,并最终使用华为云RDS MySQL作为集市层数据展现,最终通过DGC作业开发将上述操作串联,形成完整的流水线,并通过DGC数据服务能力将数据API接口输出,以此将数据输出到BI报表分析工具或通过华为云DLV数据可视化服务对数据进行直观的屏幕输出。上述CDM、RDS、OBS等服务均支持按需购买,大幅降低企业的资产购置压力。 其中OBS负责存储DGC的日志和脏数据;DLI作为贴源层的存储和计算技术栈,DLI由于存储量大且价格便宜,并采用分布式计算模型,因此进行大量数据运算的时候速度较、支持高并发;通过DLI生成主题库和专题库后,将这些数据仓库存储在RDS MySQL数据库中,这一服务可以进行专业的BI分析;DGC作为整个项目的数据运营技术栈,继承了数据集成、规范设计、数据开发、数据质量、数据资产、数据服务功能,也是华为云大数据轻量化解决方案的核心技术模块,作为数据湖运营平台,DGC提供了数据的全生命周期管理,在此案例中我们通过上述功能模块完成了一整条数据治理流水线的建设;在所以数据分析归纳后,再通过DLV数据可视化服务对指标进行结果展示。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964068571724381.png) 华为云大数据轻量级解决方案对于企业而言不需要变动其底层的数据源,这套方案在数据集成上已经有很好的支持,无论是华为云数据库、第三方云数据库还是企业自建数据中心,都支持数据迁移。这里我们通过RDS作为模拟数据源导入并最终汇总生成集市层数据,在进行配置前,我们首先要购买对应资源才能实现一整套的数据治理流程,具体需购买和提前创建的资源如下: - 创建VPC、子网、安全组 - 创建OBS桶,创建存储作业日志和脏数据目录 - 购买DGC实例,并配置默认工作空间 - 购买CDM集群,正式项目可考虑使用ROMA - 购买RDS实例 - 购买DLI队列实例 在购买完对应资源后,需对原始数据进行导入,即将数据SQL文件导入到RDS MySQL数据库中,这一操作只需进入RDS数据管理页面,上传脚本即可快速完成数据导入。数据源包含两张表,分别是门店表(t_user_store_info)和订单表(t_trade_order)。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964098747620982.png) RDS MySQL原始数据导入后,我们需要在DLI中建立相同的表结构进行贴源层数据导入。进入DLI库表管理新建一个DLI库,以此作为项目表存放DLI数据库。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964106946541782.png) 随后在DLI的SQL编辑器中将建表脚本导入建表,表结构和表名称最好与RDS MySQL中原表一致。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964127211516330.png) 数据导入后,在OBS服务中完成DGC日志数据和脏数据文件夹建立,以便后续DGC正常使用。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964138534998600.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964146819997698.png) 接下来就需要对数据进行入湖处理,这里采用DGC的数据集成模块,DGC批量数据迁移CDM提供同构或异构数据元之间批量数据迁移服务,可以帮助企业实现数据的自由流动,支持关系型数据库、数据仓库、NoSQL、大数据云服务、对象存储等数据源。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964162898332663.png) 这些数据源涵盖华为云DWS、华为云DLI、FusionInsight LibrA、Hadoop、OBS、阿里云OSS、FTP、SFTP、NAS、MySQL、HWSQL、PostgreSQL、SQL Server、DDM、Oracle、Db2、Redis、MongoDB、CSS、Apache Kafka等30多种数据源。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964174886402902.png) 这些数据源可以作为源也可以作为迁移目的,租户可以按需付费,控制和租户之间是完全分离的,数据始终是在原始位置,后续的作业、对数据的操作都是与原始数据隔离,通过CDM可以更加安全的保护原始数据。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964183148756163.png) 之前我们导入的RDS MySQL云数据库服务作为源数据,另外一个则是数据湖探索DLI的连接,通过CDM服务我们快速生成DLI内贴源数据导入。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964191868430525.png) 这里,CDM提供自动化的字段映射,对于不同数据源数据类型不同这样的情况,CDM支持数据类型一键转换。在CDM迁移之前,我们已经提前将对应的表在DLI中建好,分别是t_trade_order和t_user_store。这样CDM就可以进行快速匹配。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964200905586218.png) 通过CDM我们就快速实现了源数据导入贴源数据的数据迁移工作,由于原始数据可能存在不断生成的问题,这里CDM也提供周期作业以此对数据进行导入。接下里,我们再进行具体的业务场景设计和相关脚本的开发。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964209790734780.png) # 轻开发:开发高度可视化,SQL脚本通用简单 华为云大数据轻量级解决方案最重要的特点是全流程的高度可视化,没有复杂的代码编写过程,对开发人员的技术要求不高,可以从业务层面需求出发进行系统化的建模,再通过建模实现对应开发脚本的生成。整个过程非常的快速高效,由于华为云大数据解决方案中的DLI、DWS等服务均支持标准SQL语句,因此各类脚本编写上难度不大。在本例中首先需要对业务进行建模,在形成对应的业务指标对贴源数据进行清洗加工并输出有实际指导意义的参数。 华为云大数据轻量级解决方案将业务实体与实现细节紧密结合让需求方无需了解太多编程相关的细节,让开发方不必考虑业务实现的逻辑。通过这套解决方案的DGC规范设计模块就能初步实现各类业务的需求指标设计并对数据进行标准化,包含主题设计、数据标准设计、数据模型设计、数据指标设计,通过规范设计可以根据客户的业务需求,进行统一的数据分类、数据标准化、指标定义和数据模型体系建设。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964225345825381.png) 通过上述四个步骤,将业务数据化需求进行抽象化,就可以输出企业标准化数据中台设计。完成数据模型体系的建设,对于未来同行业的解决方案建设也有了参考价值。通过主题设计可以很快的完成信息架构的设计,针对不同类型的信息,还可以指定数据类型。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964234758819415.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964242449299192.png) 在主题设计完成后,就可进行数据建模。首先根据之前的主题设计进行建模,这里提供关系建模和维度建模两种建模方式,关系建模符合3NF,主要是去除数据冗余,使数据标准化,当存在多个数据描述同一个情况时,需要使用关系建模进行合并。维度建模则采用数据结构化的方法进行建模,针对需求和指标对数据源进行维度、事实建模,相比于关系建模,维度建模紧紧围绕业务指标,非常直观显示出业务模型中的业务问题。维度建模包括维度、维度表、事实表、汇总表。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964254210728287.png) 维度表多为业务指标的环境信息,比如时间、空间信息等,这里我们建模对门店和地区维度进行建模,这就是典型的空间信息。维度表是用户用来分析数据的窗口,一个维度表可以对一组数据进行分类,且分组后的数据可以用来分析。我们以门店维度表为例,门店包括门店编码、店铺类型、营业状态、门店名称属性。我们如果要计算坪效指标,可以进行门店坪效指标的计算、某一类型门店坪效指标的计算、营业中门店坪考指标计算等,通过这些指标可以定义一组数据。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964267446747767.png) 事实表内容主要分为三类,分别是维度表外键、事实属性和度量属性。比如门店事实表包含地区外键、门店编码外键、经营面积、开业时间等信息。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964274693943541.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964281509618299.png) 汇总表则可以对上述维度和事实进行归纳总结,得出相应的技术指标,我们以地区坪效指标的设计为例。可以看到对应属性和相关内容的汇总信息,地区坪效指标可以通过技术指标进行确定。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964323227239266.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964330630230621.png) DGC将指标分为业务指标和技术指标两类,业务指标模块主要是以文字的形式定义某一指标,并以此为参考指导技术指标实现,我们以坪效为例,坪效位于进销存管理中,根据坪效的定义,坪效就是门店销售额与门店面积的比例。通过这一文字定义,我们来到技术指标中,完成坪效这一指标的技术定义。我们也可以对员工的销售额与绩效关系进行统一的界定,对于需求调研层面的人员来讲,这些只需要文字描述就可以快速完成各种指标和属性的确定。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964359702256251.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964367179919224.png) 通过以上的需求建设和管理,需求方很快的就将自己的业务需求确定好,整个过程都是可视化的,接下里再进一步的对指标进行运算分析,最终形成有实际意义的指导数据,这里则通过技术指标完成对业务指标的具体实现,包含原子指标、衍生指标、复合指标。原子指标是最基础的算子,是纬度在模型中某一个属性或属性的简单运算,在坪效计算中,主要用于坪效计算的就是门店的经营面积以及实际门店产生的销售额。这两个指标构成了坪效计算的原子指标。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964379875691261.png) 衍生指标则是对原子指标添加了一个纬度,对原子指标进行限定,使得这些原子指标更具参考价值,在坪效指标计算中,我们可以按照时间原子指标进行限定,从而衍生出新的指标。比如过去一年的某一地区的销售额、过去一年某一门店的销售额、过去一年某地区的经营见面等,这些衍生指标还可以进一步运算,得到复合指标。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964389208365543.png) 复合指标则是多个衍生指标的聚合,用于输出最终的汇总数据,比如某地区过去一年的坪效或某门店过去一年的坪效。到这里坪效指标的规范设计就已经完成了,实体定义与技术指标紧密结合,并且符合标准化的设计规则。在各种技术指标的计算中,DGC还提供一键式的SQL脚本,方便后续流程自动化的开发,帮助开发人员进行快速高效的编程脚本实现。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964399096545804.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964405622919763.png) 在信息架构中,我们也可以通过DGC自动汇总的关系图了解到不同维度表、事实表、技术指标、汇总表的关系图谱,这里也方便运维人员快速定位问题,以此进行高效运维。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964418181329647.png) 如何高效的通过脚本和代码实现业务需求并实现一整条业务的流水开发,这对业务不熟悉的开发人员来讲往往是个非常大的难题,但华为云大数据轻量级解决方案提供了一整套高效的开发流程,在需求放完成相关业务定义和指标设定后,开发人员则可以对需求进一步实现,在低代码量的基础上完成业务需求,真正实现编程“轻模式”。这里通过DGC数据开发模块完成脚本开发、作业调度、运维监控等功能实现业务流水,它支持业务流自动化、BI报表生产线、云上仓库建设、日志分析挖掘等工具,实现从数据接入、数据存储、数据分析和计算到业务应用全流程的一站式IDE平台服务。通过数据开发模块,可以帮助用户对入湖后的数据进行快速的加工、清洗,各种聚合运算,数据转换等。在作业开发页面,DGC也为开发人员提供了完整的开发流程介绍。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964426759541540.png) DGC的脚本开发支持在线的主流数据库脚本开发调试,支持DWS脚本、DLI脚本、Hive脚本等;另外数据开发模块还提供了强大的ETL算子,通过ETL算子可以在数据清洗转换的时候省去开发人员大量的SQL脚本开发,直接通过图形化配置快速实现大量的清洗整合工作;DGC的数据开发模块还整合了主流的数据开发能力和所见即所得图形化ETL工具的能力,最终整合成拖拉拽式的批流结合全链路开发运维,数据管道在运行后可以实施进行监控,方便运维人员快速定位开发中所遇到的问题。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964437791601414.png) 数据开发模块下的脚本开发提供了DWS、DLI、Hive、Spark、Flink、RDS、Shell、Python等多种脚本开发,支持代码补全、语法高亮、错误提示、执行历史记录等功能,可以帮助开发者正确高效的编写。这里我们构建了多个脚本,完成贴源层和明细层数据的清洗,数据汇总,并最终导入到数据库中。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964445938198472.png) # 轻部署:可视化流水线构建,快速定位问题 华为云大数据轻量化解决方案在业务部署上支持拖拉拽式的流水线业务部署,整个过程开发人员不需要进行专门的环境搭建,只需关注业务是否能完成即可,部署后,开发人员也可对业务运行过程中出现的问题层层分离,快速定位。业务在执行上支持单次调度和周期调度,调度如出现问题还可以进行实时通知。整个过程没有复杂的报警提示,并可生成运维日报,方便运维人员对整体业务有所把控。 这里通过DGC的作业开发实现业务部署,它支持多种云服务任务混合编排,通过一系列节点构成一个有效的工作流。支持图形拖拉拽式的编辑作业页面,快速实现自动化流水部署,并验证作业是否存在问题。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964462294758509.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964469290613314.png) 数据开发中的作业监控功能提供短信、邮件等提醒方式,方便开发人员第一时间了解作业运行过程中可能出现的异常状况。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964481891301935.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964491727275308.png) # 轻运维:数据实时监控,封装服务开放 针对各类指标的监控,华为云大数据轻量级解决方案为提供专业的数据质量监控,方便运维人员对数据的动态进行实时的监控,并也可根据实际业务情况设定对应监控指标,帮助企业产出更有价值的数据服务体系。同时企业也可将数据形成的集市层数据封装成服务,对外输出到BI软件或其他应用中,实现数据的最大化利用。对于运维人员来讲,无论是数据质量监控,还是大数据资产管理,抑或是数据服务的开放,这些完全都是在高度可视化的模式下进行,无需复杂代码即可完成数据产品的输出和监控。 这里华为云大数据轻量级解决方案中的DGC数据质量模块可以将业务系统的指标和数据质量进行监控,可以根据业务指标校验规则对数据的完整性、有效性、及时性、一致性、准确性、唯一性这六个维度进行单列、跨列、跨行或者跨表分析,包括存在约束、非空约束、主键唯一性约束、实体唯一性约束、取值范围约束、长度约束、内容规范约束等。通过上述指标校验,我们可以对数据的质量进行评估,如果有些数据存在明显的质量问题,就可以向开发者发送邮件、短信进行告警。同时也可以对数据进行分析和统计,之后将数据推送到客户的相应部门。最终提升数据湖里整体数据的质量。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964511223702739.png) DGC数据质量模块提供业务指标监控和数据质量监控两种监控方式,我们可以根据之前设计的技术指标对指标进行业务指标监控,我们以之前的坪效指标为例,首先在指标管理中选择需要运算汇总的指标,并以此生成SQL脚本。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964521290917937.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964528490754237.png) 然后我们就可以设定具体规则对指标进行监控,比如当全国平均坪效低于20万,就出发年平均坪效较低通知。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964539885806458.png) 在随后的业务场景管理中,我们就可以启动这一指标的业务指标监控。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964548044381983.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964554133694527.png) 数据质量监控则可设定规则模版对数据质量进行校验,某人提供了多种数据校验模版方便运维人员快速对数据进行校验。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964572511907100.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964580693374859.png) 数据质量监控的质量作业则可设定质量监控的内容,并对关联质量作业进行启停操作。启动后质量作业监控就会生成质量报告,以此帮助运维人员对整体数据进行监控。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964590987190716.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964597631468406.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964604740186792.png) 为了解各类数据资产的详细情况,华为云大数据轻量化解决方案提供一站式的数据资产归纳,业务资产、技术资产和指标资产三大部分,业务资产包含业务对象、逻辑实体、业务属性三大部分,技术资产则包含数据库、数据表和数据量。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964615552433270.png) 这里通过配置数据元,可以创建数据链接,实现数据集中管理,并提供自定义策略采集任务,以此实现形成资产目录。帮助企业一站式,完成数据报表整理。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964625559635177.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964633140206943.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964642002976195.png) 在数据目录下,企业可以看到所有的业务资产、技术资产和指标资产,业务资产是逻辑实体,通过逻辑实体我们定义多样化的数据,以此指导形成技术资产和指标资产。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964655742784019.png) 针对不同的技术资产,企业可以看到所有的表结构,同时血缘分析功能方便回溯数据源或作业。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964665604927125.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964672931203376.png) 对数据清洗加工并分析生成的集市层数据后,这些数据就可以以服务的形式开放给第三方,华为云大数据轻量化解决方案可以从DWS、DLI、RDS等华为云数据库中获取数据,并通过鉴权等手段向第三方输出数据接口,无需复杂的代码编写,就可以通过Serverless的形式对数据产品进行开放,进而实现零编码的API生成能力,这种零编码的数据开放能力对于企业而言有着更加灵活的数据开放和管理能力,便于企业生成更加丰富的数据产品。 华为云大数据轻量化解决方案中的DGC数据服务支持在线调试、一键发布,通过Web页面编排,可以快速发布基于Serverless的API发布。支持多种数据源对外发布,这项功能基于Nginx和容器化技术,实现单容器50ms内耗时和200次/秒的API逻辑解析和转发速度,另外数据服务还基于WAF行为全方位检测,可准确的进行恶意请求识别,过滤攻击流量。自动化监控和流量预警也方便开发人员快速了解对外输出接口的情况。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964684634774978.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964691300201075.png) 开发人员可以对不同的API进行流量控制、使用时长、API名称等信息,方便监控API调用状态。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964705489127077.png) ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964711793590991.png) DGC数据服务还提供App调试,App调试需要调用SDK进行访问,数据服务提供基于Java、C#、Python、Go、JavaScript、PHP、C++、C、Android等多种主流语言的SDK包。一键下载,轻量化开发。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964721452308684.png) 通过实际的体验我们看到,华为云大数据轻量级解决方案的一系列服务,非常直观和高效的帮助企业实现数据清洗、数据加工、数据运算、数据分析等操作,企业重要的是关注业务本身,而不用关注实现的底层技术栈,不需要大量代码编写,也不需要技术人员吃透需求,需求方和开发人员都可以独立高效的完成业务定义和数据产品的开发。 在输出数据产品后,企业可以对这些数据进行可视化输出以便数据治理人员根据这些数据做出决策。 华为云大数据轻量化解决方案还支持多BI平台的可视化图形输出,帮助企业实现更好的数据展示,无论是第三方的BI工具还是华为云自家的DLV数据可视化服务都可以很好的调用接口实现数据的展示分析。 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/20223/11/1646964728801339961.png) 通过这些数据接入,企业可以通过拖拉拽的方式快速构建专属的企业智慧数据大屏幕,形成丰富多样的数据图表,方便进行及时的分析决策。 # 总结 华为云提供的大数据轻量级解决方案,让企业实现了轻资产、轻开发、轻部署、轻运维的大数据治理模式,这样的“轻模式”让广大的中长尾企业也拥有了更加敏捷的大数据治理能力,完备的数据治理流程提供了一站式便利的数据治理体验,企业无需从头再来搭建平台、单独进行人员的开发和架构设计。基于Serverless的平台开发,让企业无需关注业务实现的技术栈,直观精简的开发过程,只需要掌握SQL代码即可快速完成开发。大幅节省了企业的平台建设成本和人才成本。 全流程可视化的界面设计,即便是对没有数据开发经验的非技术人员,也可以友好快速的进行数据规范设计、数据质量监控、数据指标定义等工作。 DGC、CDM、DLI、RDS等服务组成的一整套华为云大数据轻量级解决方案为企业的综合数据治理带来了强大的内生力,大大释放了大数据底层运维管理的压力,让企业能更好的利用数据专注服务质量提升、产品优化等。华为云大数据治理轻量级解决方案未来也将会很好的为中长尾企业赋能,帮助他们实现更高层次的数字化转型。
  • [酷哥说库] 【技术之声】第十期(20220228)一周精选
    大家好!我是酷哥,数据库相关资讯,带您速览,欢迎大家阅读。 **本期整理如下:** ----------------------------------------------- **本期精选** ------------------------------------------------ - 华为、腾讯、阿里、字节等纷纷布局东数西算 - 解码高瓴的数据库布局:开源、分布式、图数据库、实时数据 - GreenPlum完全兼容欧拉开源操作系统 - 开源数据库MariaDB通过SPAC再**,开启新征程 - 通用数据库管理工具DBeaver 21.3.5 发布 - SQLite 3.38正式发布:改进JSON支持 增强CLI体验 - PostgreSQL 开始支持 Zstd - 最快的SQL计算引擎MatrixOne 0.2.0 发布 - 云迁移将持续深入,今年企业IT支出将超过1.3万亿美元 - 观远数据完成老虎**基金领投的2.8亿元C轮融资 - 时序数据库 Timescale 完成C轮1.1亿融资,数据库领域添独角兽 - 中国自主的数据库评测,是如何开展的? - 中国信通院——开源分布式关系型数据库专刊正式启动 ------------------------------------------------ **资讯全文** ------------------------------------------------ - 华为、腾讯、阿里、字节等纷纷布局东数西算 **摘要:** 财联社《TMT时报》上海报道 作为数字经济的核心基础设施,数据中心正迎来新一轮发展契机。华为、腾讯、阿里、字节等纷纷布局东数西算。 “东数西算”工程于近日正式全面启动,计划在京津冀、长三角、粤港澳大湾区、成渝、贵州、内蒙古、甘肃、宁夏8地布局建设全国一体化算力网络国家枢纽节点,并规划10个国家数据中心集群。国内数据中心产业链上下游企业均有望受益。 **文章详情:** https://tieba.baidu.com/p/7735484697 - 解码高瓴的数据库布局:开源、分布式、图数据库、实时数据 **摘要:** 过去一年是国产数据库诞生以来投融资最为火热的一年。作为基础软件的“三驾马车”之一,这个过往的冷门赛道,在2021年内,出现了几个指标性拐点数字:明星公司PingCap估值高达180亿,超过20家数据库企业获得新融资,而以高瓴、红杉、腾讯为代表的头部基金们出手数据库的次数均超过了3家。 **文章详情:** https://tieba.baidu.com/p/7738189880 - GreenPlum完全兼容欧拉开源操作系统 **摘要:** 近日,Greenplum 社区和欧拉开源社区深化合作,在欧拉开源操作系统(openEuler,简称“欧拉”)编译测试了高级分析数据平台 Greenplum,用实践证明了 Greenplum 与支持多样性计算的欧拉开源操作系统完全兼容,是 Greenplum 深入合作的典型模板,大大丰富了产品应用生态。 基于本次合作内容,Greenplum开源社区与欧拉开源社区联合发布白皮书《开源Greenplum新篇章:兼容欧拉开源操作系统的数据平台,支持国产生态的高级分析数据平台》。 **文章详情:** https://tieba.baidu.com/p/7735489906 - 开源数据库MariaDB通过SPAC再**,开启新征程 **摘要:** 元老级数据库企业MariaDB,借助SPAC,携手Angel Pond实现资本新**。 在数据库创投热中,最新的一个爆炸性消息发生在2022年2月初,开源关系型数据库MariaDB宣布完成1.04亿美元的D轮融资。然而不仅如此, MariaDB同时还宣布打算通过与特殊目的收购企业 Angel Pond Holdings 合并,于2022年下半年在纽约证券交易所公开上市。届时该公司将更名"MariaDB plc",并由现任首席执行官 Michael Howard 继续领导。预计交易完成后,新公司或拥有6.72亿美元估值,获得包括来自Angel Pond以信托方式持有的2.65亿美金以及1800万美元的PIPE投资。 **文章详情:** https://tieba.baidu.com/p/7739194200 - 通用数据库管理工具DBeaver 21.3.5 发布 **摘要:** DBeaver 正式21.3.5 发布。DBeaver 是一个免费开源的通用数据库工具和 SQL 客户端,支持 MySQL, PostgreSQL, Oracle, DB2, MSSQL, Sybase, Mimer, HSQLDB, Derby, 以及其他兼容 JDBC 的数据库。DBeaver 提供一个图形界面用来查看数据库结构、执行SQL查询和脚本,浏览和导出数据,处理BLOB/CLOB 数据,修改数据库结构等等。适用于开发人员和数据库管理员。 **文章详情:** https://tieba.baidu.com/p/7735426577 - SQLite 3.38正式发布:改进JSON支持 增强CLI体验 **摘要:** 作为 2022 年的首个新版,SQLite 3.38 也是 SQLite 的一次盛大更新。SQLite 是一个小型、快速、自包含、高可靠性、全功能的嵌入式 SQL 数据库引擎。早在 2015 年发布的 SQLite 3.9 版本中,开发者就已经为它添加了对 JSON1 模块的支持。现在,随着 2022 年首个重大更新的发布,该模块已在 SQLite 3.38 中被默认包含、而无需启用编译时选项。 **文章详情:** https://tieba.baidu.com/p/7738195534 - PostgreSQL 开始支持 Zstd **摘要:** PostgreSQL 现已通过其 TOAST 存储技术提供压缩支持,并且在过去的一年里构建了 LZ4 压缩支持——用于压缩 WAL、备份压缩以及其他用途,现在 PostgreSQL 开发者正准备通过 Zstd 支持进一步扩展其压缩能力。 Zstd (Zstandard) 是由 Facebook 开源的快速无损压缩算法,主要应用于 zlib 级别的实时压缩场景,并且具有更好的压缩比。Zstd 还可以以压缩速度为代价提供更强的压缩比,速度与压缩权衡可通过小增量进行配置。 **文章详情:** https://tieba.baidu.com/p/7735437424 - 最快的SQL计算引擎MatrixOne 0.2.0 发布 **摘要:** 在数月的打磨和努力开发之下, MatrixOne 0.2版本正式发布啦! 项目文档网站 https://docs.matrixorigin.io/0.2.0/ 相比于0.1版本,0.2版本在以下几方面有着明显改进:性能大幅提升、完整的分布式能力、新Feature、文档更新、 Bug Fixes等。 **文章详情:** https://tieba.baidu.com/p/7739181210 - 云迁移将持续深入,今年企业IT支出将超过1.3万亿美元 **摘要:** 2月21日消息,Gartner预测预测,2025年有效细分市场中的企业在公有云计算领域的IT支出将超过传统IT服务支出。 Gartner云迁移研究包括可以迁移到云的企业IT市场,即应用软件、基础设施软件、业务流程服务和系统基础设施市场。2025年在这四个市场中将有51%的IT支出从传统解决方案转向公有云(2022年为41%)。 Gartner预测,2022年企业IT支出将因云迁移而超过1.3万亿美元,2025年将增长至近1.8万亿美元。分布式云等新技术的出现将扩大云在IT市场引发的持续变革。 **文章详情:** https://tieba.baidu.com/p/7736599583 - 观远数据完成老虎**基金领投的2.8亿元C轮融资 **摘要:** 2月22日,BI服务商观远数据宣布完成新一轮2.8亿元C轮融资。本轮融资由全球知名的老虎**基金(Tiger Global)领投,红杉中国、线性资本、襄禾资本、独秀资本(Unicorn Capital Parnters)等老股东全线跟投。据观远数据创始人&CEO苏春园介绍,此轮融资将主要用于三大方面,智能分析产品矩阵的深化、客户成功体系的升级、重点行业与用户生态的建设。 数字化时代正在加速到来,商业智能将广泛普及,以数据驱动决策将成为企业的常态。IDC预测,2025年,中国商业智能软件市场规模将达到13.3亿美元,未来5年整体市场年复合增长率(CAGR)达到17.9%。 **文章详情:** https://tieba.baidu.com/p/7736623942 - 时序数据库 Timescale 完成C轮1.1亿融资,数据库领域添独角兽 **摘要:** 2022 年 2 月 22 日,Timescale 宣布其在近日完成了 C 轮融资,在 2021 年、2019 年和 2018 年,Timescale 分别完成了 4000 万美元、1500 万美元和 1600 万美元的融资,总融资金额达到 1.8 亿美元。本轮融资由 Tiger Global 领投,现有投资者 Benchmark、New Enterprise Associates、Redpoint Ventures、Icon Ventures 和 Two Sigma Ventures 均参与跟投。目前,Timescale 估值超过 10 亿美元,成为数据库领域的又一独角兽企业。 **文章详情:** https://tieba.baidu.com/p/7738209746 - 中国自主的数据库评测,是如何开展的 **摘要:** 此前,较受认可的评测是由 TPC( Transaction Processing Performance Council,事务处理性能委员会)推出的 TPC-C 评测标准,而 TPC-C 也一度成为每个主流数据库都会尝试一下的评测。但 TPC-C 也有自身的问题,首先,它面向的是 OLTP 数据库,并不能满足所有场景的数据库测试。实际上,TPC 只给出了标准规范,特别场景需要厂商自行处理。另外,TPC 的审核人员人数很少,且全部在**,沟通不便。从开销的角度讲,TPC-C 也较为昂贵,比如 Oracle 从 2010 年开始,就基本退出了 TPC-C 评测。 种种因素,使数据库评测处于一个事实上的空白领域。这也促使国内许多机构开始尝试进行数据库标准评测,信通院作为我国工业和信息化部直属事业单位,有推动我国 ICT 领域健康、快速发展的直接责任,因此从 2015 年开始推出各类数据库评测,在整个行业都产生了较大的影响力。 **文章详情:** https://tieba.baidu.com/p/7736427945 - 中国信通院——开源分布式关系型数据库专刊正式启动 **摘要:** 近年来,开源生态发展势头迅猛,开源在推动技术创新、促进产业协作、加快各行业数字化进程方面发挥的作用日益凸显。过去一年,开源生态进一步发展成熟,并呈现全新态势。开源生态从个人参与到企业参与,从开源技术交流到开源生态协同,逐步形成产业供应关系。自上而**系化构建方式与自下而上竞争式模式相结合,不断推动开源生态发展。 开源已成为企业的主流趋势,也将成为企业的战略方向和商业模式。开源改变了信息产业的格局和商业模式,推动全球信息技术发生了全局性、持续性的重大变革,促进了全球范围内的技术创新成果落地。基于此背景,中国信息通信研究院前期已成功编写并发布了《开源发展态势洞察报告——消息中间件专刊》。 中国信通院第二期《开源发展态势洞察报告》—开源分布式关系型数据库专刊现公开征集参与单位,欢迎社会各界广泛参与! **文章详情:** https://tieba.baidu.com/p/7739152732 [上一期:【技术之声】第九期(20220221)一周精选](https://bbs.huaweicloud.com/forum/thread-180163-1-1.html) *声明:文章源于第三方公开的信息,如内容中涉嫌侵权或存在信息不实时,请及时联系删除。* |整理者:酷哥
总条数:1416 到第
上滑加载中