-
未来4年随着5G、AI、IoT等发展,数据量将激增4倍,到35年呈50倍增长,数据已成为世界各国关键的战略资源,跨境数据流通成为多边贸易重要议题,中国也从数据大国迈向数据强国,数据已作为继土地、资本、技术、劳动力的第5种生产要素,其重要性越来越凸显。各企业若想要在数字化转型过程中乘风破浪,搭上通往“数字经济“的快艇,选择具有竞争力的数字底座至关重要。近日, Frost&Sullivan弗若斯特沙利文发布了《2020年中国数据管理解决方案市场报告》,从产品创新能力、成长能力、基础能力三个维度对主流大数据厂商进行全面评估,报告显示华为云位居“领导者”位置,在中国大数据厂商中全面领先。报告解读本次报告从创新能力、成长能力、基础能力三方面对产品进行全面评估,其中横坐标代表创新指数,重点关注湖仓一体能力、海量数据事务支持能力,以及数据虚拟化能力;纵坐标代表成长指数,关注包含可扩展性、生态对接等能力;圆环中的色深代表产品的基础指数,关注支持的部署形态、数据类型等能力。从Frost Radar(弗若斯特雷达)中不难看出,活跃在中国市场的大数据厂商均已进入报告,产品表现上华为云最为抢眼,在上述三方面的表现都处于中国领先位置。华为云FusionInsight智能数据湖为政企客户提供湖仓一体的解决方案,包含MRS云原生数据湖、GaussDB(DWS)云数据仓库、DGC数据湖治理中心、GES图引擎、DLI数据湖探索等云服务,用于离线分析、实时分析、数仓集市、交互查询、实时检索、多模分析、数据接入治理、图计算等海量数据分析场景。本次报告中,华为云FusionInsight智能数据湖解决方案能位居“领导者”位置,有哪些过人之处呢?下面将从创新能力、成长能力及基础能力三方面进行解读:创新能力-湖仓一体打通数据壁垒,跨湖跨仓协同分析高效用数华为云FusionInsight解决方案中的MRS云原生数据湖产品,通过创新的HetuEngine数据虚拟化引擎,可以帮助客户构建逻辑数据湖,提供跨湖、跨仓、跨云的协同分析,实现湖仓一体,减少80%数据搬迁。同时,MRS云原生数据湖还可构建实时数据湖,提供Hudi ACID数据实时增量入湖、ClickHouse毫秒级OLAP分析、Flink批流合一等实时处理能力,支撑全自助实时分析处理等场景,使得数据时效从T+1到T+0。成长能力-一个可持续演进的数字底座至关重要华为云FusionInsight MRS云原生数据湖作为企业级平台,支持2万+超大规模集群,通过集群联邦可达10万节点,助力客户一个平台持续演进。通过创新的超级调度器Superior,任务调度性能相比传统方案提升20+倍。华为云FusionInsight MRS云原生数据湖不仅在规模上满足企业持续高速发展的需求,同时还提供滚动升级能力,使得升级过程业务不中断,保障业务连续性。基础能力-数据不出湖,分析性能提升50%+华为云FusionInsight MRS云原生数据湖可构建离线数据湖,实现湖内建仓,数据不出湖,缩短数据分析链路,让分析性能提升50%+;离线数据湖拥有交互式、BI、AI等多个计算引擎,一个平台实现海量数据多场景分析;采用OBS实现存算分离,计算与存储按需扩容,其企业级EC能力替代了传统3副本方案,统一数据存储有效提升存储周期2倍+,使得云原生数据湖架构更灵活。同时,华为云FusionInsight智能数据湖解决方案,不仅包含有MRS云原生数据湖,可以使政企客户一个架构构建离线、实时、逻辑3种数据湖,还提供GaussDB(DWS)云数据仓库、DGC数据湖治理中心、GES图引擎、DLI数据湖探索等云服务,助力政企客户实现一企一湖、一城一湖,业务洞见更准,价值兑现更快!。GaussDB(DWS)云数据仓库:是一款具备分析及混合负载能力的云数据仓库,具有高性能、高扩展、高可用等特点,广泛应用于汽车、制造、零售、互联网、金融、政府、电信等行业核心分析决策系统。DGC数据湖治理中心:一站式数据开发集成管理平台,包含数据架构、标准规范、数据开发、数据质量等功能,统一数据标准,加速数据资产沉淀。GES图引擎:是中国首个商用的、拥有自主知识产权的原生图产品,具备多项自主专利。针对以关系为基础的图结构数据,应用于社交APP、关系分析、物流配送、知识图谱等场景。DLI数据湖探索:提供一站式Serverless的融合处理分析服务。企业使用标准SQL、Spark、Flink就可轻松完成多数据源的联合计算分析,挖掘和探索数据价值。通过以上 “硬核”能力加持,华为云FusionInsight位居 “领导者”位置和国内领先的大数据厂商,可谓实至名归。 华为云 FusionInsight 智能数据湖深入各行业客户需求,已经规模商用湖仓一体创新技术方案,以数据驱动各行业业务增长。据了解,华为云 FusionInsight 客户覆盖全球 60 多个国家 3000 多家客户,覆盖政府、金融、运营商、电力、传媒、医疗、教育、交通、油气、物流、零售、制造等行业。 在政务领域,在政务数字化参与部委、各省市智慧城市、数字城市建设。在某市,华为云 FusionInsight 联合伙伴建成“一云二网三平台”,针对民生、产业、政府的“痛点”和“难点”,从构建城市数据资源库为开端,以大数据分析支撑政府智慧决策,在 “数聚惠民”、“数聚兴业”、“数聚善政”三大方面,支撑 “一号、一窗、一网” 政务服务,让简政放权、百姓办业务“最多跑一次”成为现实。 在金融领域,华为云 FusionInsight在工商银行、建设银行、招商银行等银行、证券、保险行业广泛应用。其中工商银行与华为开展联创工作,引入了华为云 FusionInsight 智能数据湖解决方案,搭建了自主可控的大数据云平台,解决了大数据全场景生态化应用的存储、算力和算法挑战,支撑了企业级数据湖、数据仓库、集团信息库的建设,通过HetuEngine提升了全行13000+分析师的即时BI体验,智能服务演进由事后快速演进到事前、事中的阶段。 在运营商领域,已覆盖国内三大运营商以及海外运营商客户。其中广东移动基于华为云 FusionInsight,联合政企客户共同打造智慧电网、智慧港口、高清视频等系列标杆应用,打通数据全生命周期链路,实现对内业务支撑、对外应用赋能,全面支撑了各类政务、民生等大数据应用服务。 面向大企业客户,覆盖能源、交通、制造等行业客户大数据平台建设。其中深圳地铁采用华为城轨云解决方案,利用云计算、大数据、5G、人工智能等技术核心,建立了统一、开放、智能的城轨数字平台,利用华为云 FusionInsight MRS 云原生数据湖能力构建深圳地铁大数据分析平台,在智慧车站、智慧运维方面,对新技术与地铁场景进行创新融合,推进了车站业务全日自动运行、线上线下一体化客服、设备主动检测、健康管理等应用,探索数字化、高效化的新业务模式,为城市提供更优质的公共交通服务。 华为云FusionInsight持续投入10年+,坚持与世界同行,在开源社区先后开放CarbonData和openLooKeng等组件,携手800+合作伙伴,服务于全球60+国家和地区3000+政企客户,已广泛应用于政府、金融、运营商、大企业等行业。更多精彩文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html
-
2021年以来,从政策到市场刚需,再看到科技行业的变革与创新。可以预见,新的信息时代已经到来。每一次科技革命都会带来全新的产业变革,衍生具大的商业机会。传统企业都在拥抱新兴科技,希望从中分得一杯羹,为企业的升级转型谋出路,期望创造出新的业务增长点。数字化时代的新机遇,小芯机加速企业升级转型数字化建设已广泛应用于各行各业,其中云计算、云办公、大数据应用、5G应用、人工智能、物联网等技术的深度融合,已经深远影响着企业的发展,激发出新的商业模式,成为推动企业加速数字化建设的重要引擎。在5G时代,诸多的场景应用又将催生新的服务产品、商业模式和投资机会,企业更加趋势于智能办公,企业搭建信息化管理系统,实现电脑办公和协同移动办公,数据可以统一储存管理,具有安全稳定、开放自由等优势。5G不仅创造出万亿的巨大市场规模,更是带动了整个行业数字化建设的快速发展,也为小芯机的发展提供了难得的机遇。以小芯机为例,小芯机作为集微型主机、云计算、信息管理系统于一体的产品,通过打通桌面端硬件,为企业数字化转型提供技术支撑,帮助企业用户快速构建安全、稳定、可靠的云端电脑。数字化时代,小芯机可以为企业带来哪些好处?1、优化企业管理流程,提供企业办公效率小芯机基于云计算和数字化技术,提供无主机、云共享组合产品租赁服务,按需定制云端桌面管理系统,桌面快速部署,数据及应用储存在云端,具有集中管理,信息安全,弹性扩展,节约成本等多种优势,为企业升级减负。2、PC端、移动端实现云端传输同步小芯机采用硬盘上云,使用户可以在任何地方通过手机、iPad等移动设备或电脑,远程连接电脑桌面,享受跨平台的极速访问,浏览公司文件,实现数据互通,便捷办公。3、提高信息储存价值和管理效率企业的数据和信息资源是企业最重要的资产之一,通过小芯机可以在云端进行信息的储存、查询、提取和有效的利用。4、科学的大数据分析小芯机芯享云安全部署提供IT精准管理功能,员工计算机行为轨迹管理,IT数据保护管理。实现企业各类数据的互联互通,一键生成数据报表,充分挖掘企业数据价值,为管理决策提供可靠依据。5、降低企业运维成本小芯机作为一款迷你主机电脑,不仅体积小、重量轻,安装方便,终端采购成本低,不易损坏,耗电量低,升级不报废,终端免维护,显著降低企业办公设备购置和运维成本。随着人工智能、大数据、物联网等信息技术加速应用,各领域企业纷纷上云。企业在不断创新思维,运用各种IT工具,重新定义管理模式,加速企业数字化建设,借助5G技术和云计算向新的实体领域实现延伸,帮助企业实现商业改造。我们相信,未来的云计算市场将会呈现出更加广阔的增长前景。在这样的趋势下,小芯机这种具有核心技术优势的企业,随着产品的升级和技术的不断优化,借助行业的高速发展,迎来巨大的发展机遇,将为这个行业打造成下一个科技巨头。
-
如果说蒸汽机和电力开启了人类历史上的两次工业革命,那么发展到今天,脱胎于互联网,但又被称作"革命性计算模型"的云计算,正在让我们的生活步入另一个阶段。随着社会的不断进步和发展,如今,“上云”已经逐渐成为企业寻求自身发展和突破的趋势和关键了。云计算也凭借着自身在业务方面的敏捷性、可拓展性、效率性以及成本节约优势,受到了越来越多企业的青睐,已然成为各行业、企业智能化、数字化转型升级的关键之所在。1什么是云计算?对于了解IT互联网的小伙伴们来说,想必对于5G、大数据、云计算以及人工智能都不会陌生吧。5G主要拼的是网络传输速度、大数据是通过某些特定的方式或工具实现海量数据的分析,而人工智能则主要是通过不断的模拟、训练让计算机更加的懂你。那么云计算究竟是什么?又可以用它做什么呢?1、云计算,是结合人类社会顶端智囊与最尖端IT科技而诞生的最新互联网技术之一;2、它已成为当前互联网的基础设施:计算能力、存储能力、网络能力、安全能力;3、作为新一代互联网计算资源的基石,云计算支撑着互联网几乎所有的上层数据处理系统;4、无论是大数据还是人工智能,以及各类应用场景,都需要依托云计算提供的基础设施来运行;5、在IT行业领域外,还有政府、金融、工业、交通、物流、医疗健康等这些传统行业,云计算技术都已在广泛使用。云计算有哪些特点呢?大规模、分布式:“云”一般具有相当的规模,一些知名的云供应商如Google云计算、Amazon、IBM、微软、阿里、华为等也都拥能拥有上百万级的服务器规模。而依靠这些分布式的服务器所构建起来的“云”能够为使用者提供前所未有的计算能力。虚拟化:云计算都会采用虚拟化技术,用户并不需要关注具体的硬件实体,只需要选择一家云服务提供商,注册一个账号,登陆到它们的云控制台,去购买和配置你需要的服务(比如 云服务器,云存储,CDN等等),再为你的应用做一些简单的配置之后,你就可以让你的应用对外服务了,这比传统的在企业的数据中心去部署一套应用要简单方便得多。而且你可以随时随地通过你的PC或移动设备来控制你的资源,这就好像是云服务商为每一个用户都提供了一个IDC(Internet Data Center)一样。高可用性和扩展性:那些知名的云计算供应商一般都会采用数据多副本容错、计算节点同构可互换等措施来保障服务的高可靠性。基于云服务的应用可以持续对外提供服务(7*24小时),另外“云”的规模可以动态伸缩,来满足应用和用户规模增长的需要。按需服务,更加经济:用户可以根据自己的需要来购买服务,甚至可以按使用量来进行精确计费。这能大大节省IT成本,而资源的整体利用率也将得到明显的改善。安全:网络安全已经成为所有企业或个人创业者必须面对的问题,企业的IT团队或个人很难应对那些来自网络的恶意攻击,而使用云服务则可以借助更专业的安全团队来有效降低安全风险。2云计算的发展趋势虽然说云计算是新兴行业,但至今也有了10多年的发展历程了,经历了从1.0-2.0的升级迭代,发展速度还是很迅猛的。尤其现在,AI不断落地、5G逐渐商用、软件系统泛在等新趋势,逐渐将云计算推向3.0。甚至以云网端融合技术为中心的社会重塑,将会影响整个社会模式的演变。2018年8月,工信部印发《推动企业上云实施指南(2018-2020 年)》提出了企业上云的工作目标,到2020年,全国新增上云企业100万家。同时,据国务院发展研究中心国际技术经济研究所发布《中国云计算产业发展白皮书》统计显示:2018年我国云计算整体市场规模达962.8亿元,增速39.2%。预测到2023年我国云计算产业规模将超过3000亿元。其中,中国政府和企业上云率将超过60%,全站自主可控计算平台将成为政府和大型企业的主流IT基础设施。有了国家政策的大力支持,我们可以预见,在未来十年甚至二十年里,云计算都将会是行业的“宠儿”,越来越多的行业、企业都会选择业务上云、将应用部署到云端等,也将会迎来云计算行业的“发展黄金期”。云计算行业,未来可期!3云计算人才供不应求面对高速发展的广阔市场,掌握云计算技术的人才已供不应求。作为云计算工程师,一般会选择入职华为云,腾讯云、百度云这类专门做云计算服务的公司,或者入职银行、金融以及其他传统行业企业,为这些企业建立和管理私有云。3-5年之后,就可以向云计算架构师、云计算开发工程师方向发展,此时无论是技术能力还是工资水平都会更上一层楼。当然,口说无凭,数据为证。据职友集最新统计显示:北京云计算工程师平均工资:22.4K/月,取自560份样本,对比北京平均工资,高59.2%;深圳云计算工程师平均工资:20.9K/月,来自近一年314份样本,对比深圳平均工资,高112.2%。杭州云计算工程师平均工资:19.0K/月,来自近一年231份样本,对比杭州平均工资,高93%。
-
《科创板日报》(上海,记者 博罗)讯,根据上交所披露的公告显示,科创板公司一季度共计实现营业收入981.55亿元,同比增长70.88%;实现归母净利润119.91亿元,同比增长216.40%。截至4月底,科创板一季报正式收官。如耀眼新星的新能源板块,表现亮眼,生物医药呈现高成长性,半导体板块不少指标跑出历史新高,先进环保产业板块成绩单漂亮,新材料行业上市公司也全是“好选手”。而科创板大数据与云计算,却是“悲喜交加”,喜的是,营收无一例外全部见涨,但“发光却不发热”,在二级市场,截至4月,股价全面下跌,这一板块无疑是队形整齐的“难兄”与“难弟”。云计算行业特性优先大数据与云计算板块股价齐跌,或与企业整体亏损相关。纳入统计的五家企业,归母净利润4家为负。其中,两家云计算企业优刻得与青云科技亏损最为严重。优刻得在报告期实现营收7.11亿元,同比增长72.31%的情况下,归母净利润亏损1.32亿元,同比亏损扩大400%;青云科技一季度实现营业总收入1.1亿,同比增长87.1%;实现归母净利润-6151.8万,亏损同比也扩大近50%。这两家云计算企业1-4月股价变动均下滑了27%,不过需要注意的是两家股价在报告期内不断触底。其中,青云科技为今年3月科创板上市的云计算厂商,股价最高达98元/股,如今股价对半走低达54.32元,低于发行价63.7元/股。究其原因并非一家之因,而是行业属性使然。云服务业务激烈竞争,优刻得与青云科技均不在第一梯队之列。尤其是公有云领域规模效应突出,龙头厂商通过降低产品报价、加强营销推广等多种手段,积极争取客户订单,着力抢占市场份额,使得第二梯队的云服务企业业务承压降价,增大了盈利难度。由于是长期的行业态势,这两家无一例外的表示,预计年初至下一报告期期末的累计净利润可能为亏损。卓易信息,为云计算产业链服务商,作为唯一一家归母净利润为正,且达到1727万的情况下,股价在财报发布后接连受创,4月30日盘中股价最低35.75元,创历史新低。同时,卓易信息也是该板块跌幅最大的企业。这或与卓易信息2020年报相关,去年卓易信息营收出现下滑,主要是物联网云服务收入大幅收缩,仅有2019年度近1/4。卓易信息解释称,系2020年上半年因新冠肺炎疫情影响,公司云服务业务新项目的招投标时间延期,存续项目交付、验收时间推迟,造成全年项目实施周期整体延长所致。大数据走向“两极”数字地球第一股中科星图,是国内最早从事数字地球产品研发与产业化的企业,行业壁垒较高,特种领域客户贡献的收入占总营收的比例长期在60%以上。中科星图2021年一季度营收约9989万元,同比增长165.32%,净亏损约467万元,但呈收窄趋势。股价虽然一季度下滑33%,机构股东丝毫不减对中科星图的热情。一季度,不仅是全国社保基金大举买入中科星图股票,成为公司的第一大流通股东,中国建设银行-国泰金鼎价值精选混合型证券投资、瑞银集团UBS AG新进成为公司第九大股东、第十大股东。在前十名无限售条件股东中,机构投资者占五名。中科星图基本面向上不改,在最新的机构调研与投资者问答中表示,公司毛利率稳定。并且,在特种领域机构改革完成后,大量的新兴技术应用于特种领域,且这些技术的应用具有滚动性和循环性,因此中科星图在特种领域的业务增长会维持在较高水平。慧辰资讯是板块内另一家大数据企业,2021年第一季度营收同比增长32.16%,但是净亏损约113万元。让人好奇的是,去年一季度受疫情影响之后,二季度以来,慧辰资讯均实现盈利,但今年一季度再度由盈转亏。《科创板日报》记者注意到,销售费用高达1787万,同比增加了53%。慧辰资讯解释称营业成本相应增加及上年12月信唐普华由参股变为控股子公司所致。值得警惕的是,2020年年报显示,慧辰资讯的主营业务为TMT、其他、耐用消费品、快速消费品、政府,占营收比例分别为:37.6%、21.48%、20.05%、18.37%、2.5%。其中,TMT、耐用消费品、快速消费品营收规模均出现下滑,仅有政府与其他保持正向增长。慧辰资讯股价表现一直低迷,Q1股价一度创历史新低至32.16元,甚至低于发行价34.21元。去年7月科创板上市时,慧辰资讯山顶价高达121元/股。星矿数据统计显示,慧辰资讯曾是单日主力资金净流出率最高的科创板个股。
-
2021年上半年,湖仓一体俨然已经成为大数据领域最火热的流行词,各大云厂商推出自己的湖仓一体产品,在众多产品中,企业如何找到符合自身需求的数据管理产品?近日,国际权威分析机构弗若斯特沙利文 Frost & Sullivan(以下简称“沙利文”)发布了《2020 年中国数据管理解决方案市场报告》,对中国主流大数据厂商从产品创新能力、成长能力、基础能力三个维度进行了全面评估。华为云凭借 FusionInsight 的持续创新位居中国数据管理解决方案领导者,并在中国大数据厂商中全面领先。沙利文用 Frost Radar(弗若斯特雷达)清晰明了地展示中国数据管理解决方案市场态势。横坐标代表“创新指数”,体现服务丰富度和产品调优能力;纵坐标代表“成长指数”,衡量产品功能和性能的竞争力,色深代表“基础指数”,体现大数据平台基础能力。华为云位居右上角的领导者区间,三项指标均领先国内其他大数据厂商,其主打解决方案华为云 FusionInsight 智能数据湖是获得沙利文认可的关键。报告还指出,预计到 2024 年,中国大数据硬件市场规模为 111 亿美元,中国大数据软件市场规模为 162.3 亿美元,中国大数据整体市场规模即为两者之和——273.3 亿美元,即将到来的百亿级美元市场,考验着数据管理厂商的能力边界。大数据管理:不仅要存得好更要用得好在行业发展的不同阶段,数据管理解决方案所要面临的主要矛盾截然不同,此前数据管理解决方案的重点分别是数据的数量、种类和速度,现阶段企业对数据管理解决方案的需求,逐渐聚焦于数据如何支撑重要决策,并不断促使数据管理解决方案走向湖仓一体,提升企业的数据价值创造力。数据仓库与数据湖是企业经常会使用到的两种数据管理解决方案,数据仓库到数据湖的演进并不是替代关系,数据仓库诞生较早,借鉴了数据库的数据理念,通过预先定义 schema,将结构化数据清洗提炼,提供数据服务和管理能力。数据湖则诞生于半结构化、非结构化数据的海量增长背景之下,以原始形态存储数据并且逐渐发展数据处理能力,成为可以运行不同类型的大数据工具,对数据进行大数据处理、实时分析和机器学习等操作的统一数据管理平台。在面对愈发复杂的大数据场景时,数据仓库与数据湖各自的弊端显现,也就有了湖仓一体产品的诞生,相较于单一使用数据湖或数据仓库,湖仓一体将两者的优势兼容并蓄。湖仓一体的数据管理解决方案具备事务支持、数据的模型化和数据治理、BI 支持、存算分离、灵活开放、支持多种数据类型、支持各种工作负载、端到端流等特性,此外,数据的安全和访问控制也十分重要,契合云计算时代企业的业务模型。华为云 FusionInsight 智能数据湖为政企客户提供“湖仓一体”的解决方案,提供 MRS 云原生数据湖、GaussDB(DWS) 云数据仓库、DGC 数据湖治理中心、GES 图引擎、DLI 数据湖探索等云服务,用于离线分析、实时分析、数仓集市、交互查询、实时检索、多模分析、数据接入治理、图计算等海量数据分析场景,实现政企客户一企一湖、一城一湖的业务模式。湖仓一体、云化部署已是大数据主流趋势大数据平台的发展历史就是一部企业探索数据价值的历史,当业务发展与现有技术产生矛盾,总会有新的技术浮现,Spark、Flink、Hudi、ClickHouse、HetuEngine 等等技术尽皆如此,大数据平台不断查漏补缺,最终由单点式的工具演变为全栈式的系统。传统数据管理解决方案一般部署在通用服务器之上,近年来数据仓库和数据湖的整体上云趋势愈演愈烈,美国市场还诞生出一些备受关注的独角兽企业,而在中国市场,云化部署也成为数据管理解决方案的大趋势。沙利文报告提出,大数据云化部署方案将成为主流。在存算分离理念的基础上,云化服务完美应对了弹性扩展、功能迭代、成本控制等需求,在资源需求差异化的场景中实现资源的合理配置。同时,按客户业务需要,弹性发放的云化服务显著节约了使用等待时间。华为云得以进入领导者区间,很大程度上也是因为其覆盖数据全生命周期的全栈式数据管理能力,由采、存、算、管、用的全面云化,再到湖仓一体的一站式融合分析,FusionInsight 智能数据湖提供的湖仓一体架构,帮助客户构建一企一湖、一城一湖。华为云 FusionInsight 湖仓一体架构提供灵活的多样性算力和存算分离方案,符合当下的企业需求。MRS 云原生数据湖实现了一个架构可构建逻辑、实时、离线 3 种数据湖,HetuEngine 提供跨湖、跨仓、跨云的协同分析,Hudi 支持 ACID 数据实时增量入湖,提供 ClickHouse 毫秒级 OLAP 分析、Flink 批流合一等实时处理能力,离线数据湖拥有交互式、BI、AI 等多个计算引擎,一个平台实现海量数据多场景分析。GaussDB(DWS) 云数据仓库同时具备分析及混合负载能力,具有高性能、高扩展、高可用等特点,广泛应用于汽车、制造、零售、互联网、金融、政府、电信等行业核心分析决策系统。DGC 数据湖治理中心是一站式数据开发集成管理平台,包含数据架构、标准规范、数据开发、数据质量等功能,支持 40+ 异构数据源、全拖拽开发,效率提升 3 倍,助力企业快速构建从数据接入到分析的 E2E 数据治理体系,统一数据标准,加速数据资产沉淀。GES 图引擎是中国首个商用的、拥有自主知识产权的原生图产品,具备多项自主专利。针对以关系为基础的图结构数据,应用于社交 APP、关系分析、物流配送、知识图谱等场景。DLI数据湖探索提供 Serverless 的融合处理分析服务,企业使用标准 SQL、Spark、Flink 就可轻松完成多数据源的联合计算分析,挖掘和探索数据价值。数据兑现价值,FusionInsight 深入核心业务场景伴随数据管理解决方案的底层设施逐渐成熟,技术升级和服务应用场景拓展的加速及深化,数据管理解决方案行业应用逐渐向各领域的核心业务延伸,数据管理解决方案产品与应用场景融合加深。华为云 FusionInsight 智能数据湖深入各行业客户需求,已经规模商用湖仓一体创新技术方案,以数据驱动各行业业务增长。据了解,华为云 FusionInsight 客户覆盖全球 60 多个国家 3000 多家客户,覆盖政府、金融、运营商、电力、传媒、医疗、教育、交通、油气、物流、零售、制造等行业。在政务领域,在政务数字化参与部委、各省市智慧城市、数字城市建设。在某市,华为云 FusionInsight 联合伙伴建成“一云二网三平台”,针对民生、产业、政府的“痛点”和“难点”,从构建城市数据资源库为开端,以大数据分析支撑政府智慧决策,在 “数聚惠民”、“数聚兴业”、“数聚善政”三大方面,支撑 “一号、一窗、一网” 政务服务,让简政放权、百姓办业务“最多跑一次”成为现实。在金融领域,华为云 FusionInsight在工商银行、建设银行、招商银行等银行、证券、保险行业广泛应用。在某行使用华为云 FusionInsight 构建大数据基础平台,支撑了一湖两库建设,保障银行 BI、AI、数据挖掘、数据分析等日常数据分析,实现全行即时 BI,加速银行数字化转型进程。在运营商领域,已覆盖国内三大运营商以及海外运营商客户。其中广东移动基于华为云 FusionInsight,联合政企客户共同打造智慧电网、智慧港口、高清视频等系列标杆应用,打通数据全生命周期链路,实现对内业务支撑、对外应用赋能,全面支撑了各类政务、民生等大数据应用服务。面向大企业客户,覆盖能源、交通、制造等行业客户大数据平台建设。其中深圳地铁采用华为城轨云解决方案,利用云计算、大数据、5G、人工智能等技术核心,建立了统一、开放、智能的城轨数字平台,利用华为云 FusionInsight MRS 云原生数据湖能力构建深圳地铁大数据分析平台,在智慧车站、智慧运维方面,对新技术与地铁场景进行创新融合,推进了车站业务全日自动运行、线上线下一体化客服、设备主动检测、健康管理等应用,探索数字化、高效化的新业务模式,为城市提供更优质的公共交通服务。写在最后随着 IoT、AI 等新技术的大量应用,未来 4 年里数据量将激增 4 倍,到 35 年呈 50 倍增长。在政企数字化转型的过程中,湖仓一体将是政企客户实现一企一湖、一城一湖的最佳选择,使得业务洞见更准,数据价值兑现更快。华为云等厂商所倡导的湖仓一体,将持续引领2021年大数据领域技术创新潮流,让我们拭目以待。文章来源:https://mp.weixin.qq.com/s/5UHtqKXJHy3bfx_wd_llyw(InfoQ)更多精彩文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html
-
讯方实训云教育解决方案整合行业先进技术及人才标准,通过产教融合协同育人服务高校ICT专业建设与学科发展,实现产、学、研、用人才闭环,助力云计算、大数据、人工智能及鲲鹏人才培养。 商品亮点:①丰富的课程和视频资源:华为认证课程+技术专业课程②实验环境:覆盖云计算、大数据、AI及鲲鹏等多个技术方向,满足日常教学+培训授课所需要的实验环境③智能的学习跟踪管理:提供专项学习、错误记录、模拟考试等多种测评方式,准确评估用户知识点掌握情况④全方位的教学服务项目:提供课程建设、师资培养、认证培训、实习服务等教学服务内容⑤灵活的部署模式:支持公有云、混合云部署方式,保障资源充分利用以5G、人工智能、大数据、云计算、物联网等为代表的新一代信息技术已经全面融合渗透到经济社会生活的各个领域,成为深刻改变人类社会生产方式、生活方式和思维方式的重要使能工具,并推动各行业各领域加速向数字化、网络化、智能化转型。信息技术产业的蓬勃发展,导致产业人才存在需求数量巨大、人才错位等特征。在这个背景下,国家近几年持续加大对教育领域的投入以及政策支持,先后出台多项促进产教融合的政策,并陆续批复设立了云计算、大数据、人工智能等技术方向的新专业。新专业的建设无成熟的模式可借鉴,院校存在人才培养如何定位、课程如何开设、师资培养等一系列问题。技术发展及人才需求走在前面,高校需要和行业优秀企业合作,需要企业在专业建设、课程建设、师资培养、实践环境建设、学生实习就业等多个领域提供支持和专业服务。华为云云市场讯方实训云教育解决方案是针对云计算、大数据、AI等新专业建设痛点的解决方案,主要提供以下核心功能及服务:1、云端教学:可以满足学校进行远程直播教学、线上教学、教学视频回看等需教学需求;2、云端实验:面向云计算、大数据、AI、鲲鹏等技术方向提供云端实验沙箱,满足项目实训需求;3、教学服务:面向专业建设过程的核心任务,提供课程建设、师资培养、认证培训、实习就业服务等教学服务项目: ①课程建设服务:专业课程植入;特色课程定制开发,打造金课、国家/省级精品课程;讲师驻场授课+项目实训 ②师资培养服务:鲲鹏讲师赋能培训、讲师入企业实践提升技能,双师互聘双向交流,打造双师师资队伍 ③认证培训服务:职业认证证书普及;HCIE精英认证服务打造人才培养特色;微认证赋能学生专项技能;1+X认证课程嵌入,实现课证融合 ④实习就业服务:专场招聘会助力学生对口就业;岗前培训、夏(冬)令营赋能职业素养;校内、校外实训基地提升职业技能 ⑤科研创新服务:联合科研助力技术创新平台、技术服务平台建设;创新创业服务打造双创教育高地。讯方技术专注ICT技术人才培养及软件与信息服务20年,整合行业先进技术及人才标准,通过讯方实训云教育解决方案践行产教融合,实现产、学、研、用人才闭环,助力ICT产业人才培养。 文中提到的商品链接:讯方实训云【华为云云市场,助您上云无忧】
-
近日,国际权威分析机构弗若斯特沙利文Frost & Sullivan(以下简称“沙利文”)发布了《2020年中国数据管理解决方案市场报告》,对中国主流大数据厂商从产品创新能力、成长能力、基础能力三个维度进行了全面评估。华为云凭借FusionInsight的持续创新位居中国数据管理解决方案领导者,并在中国大数据厂商中全面领先。沙利文表示:云化的部署将会成为主流,未来整体的数据管理解决方案将会向专业化迈进,需要厂商对客户业务及应用场景有深刻的理解。我们非常认可华为云在数据管理解决方案领域的领导者地位。华为云FusionInsight智能数据湖为政企客户提供湖仓一体的解决方案,提供MRS云原生数据湖、GaussDB(DWS)云数据仓库、DGC数据湖治理中心、GES图引擎、DLI数据湖探索等云服务,用于离线分析、实时分析、数仓集市、交互查询、实时检索、多模分析、数据接入治理、图计算等海量数据分析场景,助力政企客户实现一企一湖、一城一湖,业务洞见更准,价值兑现更快!MRS云原生数据湖,一个架构可构建逻辑、实时、离线三种数据湖:逻辑数据湖:HetuEngine提供跨湖、跨仓、跨云的协同分析,实现湖仓一体,减少80%数据搬迁,协同分析提效50倍。实时数据湖:通过Hudi支持ACID数据实时增量入湖、ClickHouse毫秒级OLAP分析等构建实时更新处理能力,使得供数时效从T+1到T+0。离线数据湖:提供交互式、BI、AI等多个计算引擎,采用OBS实现存算分离,使得云原生数据湖的架构更灵活。同时还支持2万(通过集群联邦,支持10万+规模)节点的超大规模集群滚动升级,保障关键业务升级不中断。GaussDB(DWS)云数据仓库:是一款具备分析及混合负载能力的云数据仓库,具有高性能、高扩展、高可用等特点,广泛应用于汽车、制造、零售、互联网、金融、政府、电信等行业核心分析决策系统。DGC数据湖治理中心:一站式数据开发集成管理平台,包含数据架构、标准规范、数据开发、数据质量等功能,统一数据标准,加速数据资产沉淀。GES图引擎:是中国首个商用的、拥有自主知识产权的原生图产品,具备多项自主专利。针对以关系为基础的图结构数据,应用于社交APP、关系分析、物流配送、知识图谱等场景。DLI数据湖探索:提供Serverless的融合处理分析服务,企业使用标准SQL、Spark、Flink就可轻松完成多数据源的联合计算分析,挖掘和探索数据价值。华为云FusionInsight持续投入10年+,坚持与世界同行,在开源社区先后开放CarbonData和openLooKeng等组件,携手800+合作伙伴,服务于全球60+国家和地区3000+政企客户,已广泛应用于政府、金融、运营商、大企业等行业。文章来源:https://bbs.huaweicloud.com/blogs/266149 更多精彩文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html
-
MLlib是Spark中提供机器学习函数的库,该库专为集群上并行运行的情况而设计MLlib设计理念:把数据以RDD形式表示,然后在分布式数据集上调用各种算法。归根结底,MLlib就是RDD上一系列可调用的函数的集合。注意:MLlib只包含能够在集群上运行良好的并行算法,包括分布式随机森林算法,K-means,交替最小二乘法等,如果用小规模数据集,单节点用scikit_learn,Weka更合适。在spark中,可以通过把参数列表传给parallelize(),来在不同节点上分别运行不同的参数,而在每个节点则使用单节点的机器学习库实现。
-
五一来临,你的假期状态是怎样的呢?是身心放松,捡起远方还是继续在岗,用行动致敬“劳动”1890年美国芝加哥城的工人大罢工推动了8小时工作制的落地而今天“996”“007”仍然是许多劳动者的“不得已而为之”当企业开始加速上云,当互联网与云计算手段连接了社会资源、我们的劳动方式和价值又会有怎样的转变?这个假期能否不做“打工人”,尽情做自己~【AI+客服,互联网时代重新定义用户服务的广度与深度】点此了解>>UDESK智能客服解决方案<<AI的应用,让“人工客服”从高强度且重复枯燥的问答环节中抽身,转而关注于用户价值的深层次挖掘。对于企业来说,应用人工智能客服,更能在降低企业客服成本的同时,提高服务效率,拓宽服务渠道。另外,作为前端与用户直接对话的第一窗口,智能客服能够实时积累大量用户相关信息,利用大数据分析,为企业创造更多价值!【企业OA系统,让工作更简单】点此了解>>泛微e-office<< 从“纸质化”走向“数字化”,告别复杂的办公流程,最大化工作效率,管理、沟通、执行……一个平台,全程掌握。【互联网营销,挖掘企业更深层价值】点此了解>>云速建站<< 互联网改变了企业的经营方式,企业网站、网上商城、小程序等渠对品牌竞争力的影响逐渐加强,每一方面的传播活动,都应尽力体现出品牌的概念,选择专业的营销推广,将为品牌争取更多机会与价值。【大数据时代,为企业筑起安全堡垒】点此了解>>云数据库审计及防护系统<< 大数据时代,构建更全面的企业安全体系尤为重要,24小时的安全防护,实时监测、预警恶意入侵风险,中小企业发展需要更安全的保障服务。 随着云、5G、AI等技术的发展,各行各业寻求上云的步伐也在不断加快,许多传统的劳动方式已经被替代,我们的工作与生活模式也在不断更新,科技在改变劳动,但不变的仍是创造的初心。上华为云云市场,精选企业应用,加速企业上云,用科技改变生活,让劳动创造未来!【华为云云市场,助您上云无忧】
-
概述Logstash 是免费且开放的服务器端数据处理管道,能够从多个来源采集数据,转换数据,然后将数据发送到“存储库”中。具体请参见:https://www.elastic.co/cn/logstashOBS是华为云的对象存储服务,OBS支持S3对象存储协议,Logstash内置了和s3进行交互的输入和输出插件,所以可以借助其S3插件完成和obs的对接,本文用于描述Logstash如何对接使用OBS。OBS服务有对象桶和并行文件桶两种选择,在大数据场景下建议选择并行文件桶。操作步骤以logstash-7.10.2为例1. 下载和安装logstash(1)https://www.elastic.co/cn/downloads/past-releases/logstash-7-10-2(2)tar zxvf logstash-6.4.2.tar.gz2. 示例以file为源端,以obs为目的端(1)创建配置文件file2obs.confinput {file {path => "/usr/local/nginx/logs/access.log"start_position => "beginning"}}output {s3 {endpoint => "obs endpoint"bucket => "obs桶名"access_key_id => "ak"secret_access_key => "sk"size_file => 1048576time_file => 1prefix => "test/logtest/"enable_metric => true}}重要参数说明:endpoint:obs的endpointaccess_key_id:具备访问obs权限的aksecret_access_key:具备访问obs权限的skbucket:obs的桶名称size_file:表示多少byte滚动文件保存time_file:表示多少分钟滚动文件保存prefix:指定文件存储的目录,例如”weili/logtest/”,此时文件会写入到桶的weili/logtest/目录下(注意路径不要以/开头)更多详情参见:https://www.elastic.co/guide/en/logstash/7.x/plugins-outputs-s3.html(2)运行logstashbin/logstash -f ../conf/file2obs.conf注意事项避免使用较老版本的logstash,请使用较新版本的logstash,例如>=7.10.2。
-
概述DataX是一个数据同步框架,实现了包括 MySQL、SQL Server、Oracle、PostgreSQL、HDFS、Hive、HBase、OTS、ODPS 等各种异构数据源之间高效的数据同步功能。具体请参见:https://github.com/alibaba/DataX/OBS是华为云的对象存储服务,OBS支持S3对象存储协议,同时也支持HDFS协议,在大数据场景中可以替代hadoop系统中的HDFS服务,本文用于描述DataX如何对接使用OBS。OBS服务有对象桶和并行文件桶两种选择,在大数据场景下建议选择并行文件桶。操作步骤1. 下载datax源码https://github.com/alibaba/DataX.git2. 修改datax源码(1)升级hdfsreader和hdfswrite模块依赖的hadoop版本:因为OBS不再支持hadoop2.8以下的版本修改datax\hdfswriter\pom.xml和datax\hdfsreader\pom.xml文件<properties><!--由2.7.1升级到2.8.3--><hadoop.version>2.8.3</hadoop.version></properties>3. 编译打包安装datax(1)进入datax源码根目录执行如下maven命令:mvn -U clean package assembly:assembly -Dmaven.test.skip=true在datax源码根目录/target目录下生成datax.tar.gz压缩文件(2)解压datax.tar.gz4. 添加hadoop-huaweicloud-xxx.jar包(1)下载对应版本的jar包:https://github.com/huaweicloud/obsa-hdfs/tree/master/release(2) 将上述jar包放入:datax根目录\plugin\writer\hdfswriter\libs和datax根目录\plugin\reader\hdfsreader\libs5. 示例以txtfilereader为源端,以obs为目的端:(1)创建作业配置文件file2obs.json{"setting": {},"job": {"setting": {"speed": {"channel": 2}},"content": [{"reader": {"name": "txtfilereader","parameter": {"path": ["/root/datax/bin/obstest.txt"],"encoding": "UTF-8","column": [{"index": 0,"type": "STRING"},{"index": 1,"type": "STRING"}],"fieldDelimiter": "\t"}},"writer": {"name": "hdfswriter","parameter": {"defaultFS": "obs://moguauthtest",##obs桶"fileType": "text","path": "/wgptesttable",##obs桶中的路径"fileName": "test","column": [{"name": "col1","type": "STRING"},{"name": "col2","type": "STRING"}],"writeMode": "append","fieldDelimiter": "\t","hadoopConfig": {##此部分hadoop配置必须添加"fs.obs.impl": "org.apache.hadoop.fs.obs.OBSFileSystem","fs.obs.access.key": "可访问OBS的ak","fs.obs.secret.key": "可访问OBS的sk","fs.obs.endpoint": "OBS桶所在region"}}}}]}}(2)启动DataXpython datax根目录/bin/datax.py file2obs.json注意事项1.OBS服务有对象桶和并行文件桶两种选择,目前datax暂时仅支持对接OBS并行文件桶
-
Flume 是一个分布式的、可靠的和高可用的服务,用于收集、聚合以及移动大量日志数据。具体请参见:http://flume.apache.org/OBS是华为云的对象存储服务,OBS支持S3对象存储协议,同时也支持HDFS协议,在大数据场景中可以替代hadoop系统中的HDFS服务,本文用于描述flume如何对接使用OBS。OBS服务有对象桶和并行文件桶两种选择,在大数据场景下建议选择并行文件桶。操作步骤以flume 1.9版本为例1. 下载flumehttp://flume.apache.org/download.html2. 安装flume:支持写数据到OBS(1)解压apache-flume-1.9.0-bin.tar.gz到apache-flume-1.9.0-bin目录(2)在部署了Hadoop的环境中(设置了HADOOP_HOME等环境变量)按照下述文档配置hadoop环境https://github.com/huaweicloud/obsa-hdfs/blob/master/release/doc/%E5%AF%B9%E8%B1%A1%E5%AD%98%E5%82%A8%E6%9C%8D%E5%8A%A1OBSA-HDFS%E4%BD%BF%E7%94%A8%E6%8C%87%E5%8D%97.pdf(3)在没有部署Hadoop的环境中下载hadoop并按照下述文档配置hadoop环境https://github.com/huaweicloud/obsa-hdfs/blob/master/release/doc/%E5%AF%B9%E8%B1%A1%E5%AD%98%E5%82%A8%E6%9C%8D%E5%8A%A1OBSA-HDFS%E4%BD%BF%E7%94%A8%E6%8C%87%E5%8D%97.pdf将hadoop中的相关jar包复制到 apache-flume-1.9.0-bin/lib 目录下,包含hadoop-huaweicloud-xxx.jar将配置好的core-site.xml文件复制到flume根目录/conf目录下3. 示例以flume内置的StressSource为source,以file为channel,以obs为sink(1)创建flume配置文件:sink2obs.propertiesagent.sources = r1agent.channels = c1agent.sinks = k1agent.sources.r1.type = org.apache.flume.source.StressSourceagent.sources.r1.channels = c1agent.sources.r1.size = 1024agent.sources.r1.maxTotalEvents = 100000agent.sources.r1.maxEventsPerSecond = 10000agent.sources.r1.batchSize=1000agent.sources.r1.interceptors = i1agent.sources.r1.interceptors.i1.type = hostagent.sources.r1.interceptors.i1.useIP = falseagent.channels.c1.type = fileagent.channels.c1.dataDirs = /data/agent/agent/flume-dataagent.channels.c1.checkpointDir = /data/agent/agent/flume-checkpointagent.channels.c1.capacity = 500000agent.channels.c1.transactionCapacity = 50000agent.sinks.k1.channel = c1agent.sinks.k1.type = hdfsagent.sinks.k1.hdfs.useLocalTimeStamp = trueagent.sinks.k1.hdfs.filePrefix = %{host}_k1agent.sinks.k1.hdfs.path = obs://obs桶名/flume/dc/create_time=%Y-%m-%d %H-%Magent.sinks.k1.hdfs.fileType = DataStreamagent.sinks.k1.hdfs.writeFormat = Textagent.sinks.k1.hdfs.rollSize = 0agent.sinks.k1.hdfs.rollCount = 1000agent.sinks.k1.hdfs.rollInterval = 0agent.sinks.k1.hdfs.batchSize = 1000agent.sinks.k1.hdfs.round = trueagent.sinks.k1.hdfs.roundValue = 10agent.sinks.k1.hdfs.roundUnit = minute(2)启动flume agent./bin/flume-ng agent -n agent -c conf/ -f conf/sink2obs.properties注意事项1. 多sink写同一文件OBS和HDFS在一致性保证上是有差别的:HDFS租约机制可以保证并发写同一个文件时不会产生一致性问题,但是OBS实现的HDFS协议不支持租约机制(并发写同一个文件时将产生不可确定的状态),所以在flume场景下可以通过文件命名规则进行解决,例如sink文件的命名规则:hostname-sinkname作为文件的前缀,如果一个主机上部署了多个flume agent,不同的agent要有不同的sinkname2. flume日志配置为了减少无谓的日志输出,可以在flume根目录/conf目录下的log4j.properties文件中增加如下配置:log4j.logger.org.apache.hadoop.fs.obs=ERRORlog4j.logger.com.obs=ERROR3. obsa写入时临时文件的目录配置Flume写obs时会先写入本地磁盘缓冲区,然后上传到obs,如果对写入obs有极致性能要求请选择高性能磁盘作为缓冲区,在core-site.xml文件中增加如下配置:<property><name>fs.obs.buffer.dir</name><value>xxx</value></property>
-
PrestoSQL对接OBS简介Presto分为prestoSql(现更名为Trino)和PrestoDB两大分支或是发行版。Presto on OBS仅支持prestoSql/Trino发行版,下述对接步骤以prestoSql-333版本为例。OBS是华为云的对象存储服务,OBS支持S3对象存储协议,同时也支持HDFS协议,在大数据场景中可以替代hadoop系统中的HDFS服务,本文用于描述flume如何对接使用OBS。OBS服务有对象桶和并行文件桶两种选择,在大数据场景下建议选择并行文件桶。安装HadoopHadoop版本2.8.3,按照https://github.com/huaweicloud/obsa-hdfs/tree/master/release/doc配置hadoop安装HiveHive版本2.3.3安装presto server下载安装版本:prestoSQL-3331.下载Presto客户端和服务端:https://repo1.maven.org/maven2/io/prestosql/presto-cli/https://repo1.maven.org/maven2/io/prestosql/presto-server2.下载华为OBSA-HDFS插件:hadoop-huaweicloud-${hadoop.version}-hw-${version}.jarhttps://github.com/huaweicloud/obsa-hdfs/tree/master/release3.解压Presto服务端:tar –zxvf presto-server-333.tar.gz在presto根目录/plugin/hive-hadoop2下放入如下两个jar包hadoop-huaweicloud-${hadoop.version}-hw-${version}.jarApache commons-lang-xxx.jar(可从maven中央仓库下载或从hadoop目录中拷贝)配置presto在安装目录里创建etc目录。这目录会有以下配置(自己创建):· 结点配置文件:每个结点的环境配置· JVM配置文件:Java虚拟机的命令行选项· Server配置文件(Config Properties):Persto server的配置· Catelog配置文件:配置presto的各种Connector(数据源)· 日志配置文件:配置Presto日志结点配置文件结点属性文件etc/node.properties,包含每个结点的配置。一个结点是一个Presto实例。这文件一般是在Presto第一次安装时创建的。以下是最小配置:node.environment=productionnode.id=ffffffff-ffff-ffff-ffff-ffffffffffffnode.data-dir=/var/presto/data解释:node.environment: 环境名字,Presto集群中的结点的环境名字都必须是一样的。node.id: 唯一标识,每个结点的标识都必须是唯一的。就算重启或升级Presto都必须还保持原来的标识。node.data-dir: 数据目录,Presto用它来保存log和其他数据eg:node.environment=presto_clusternode.id= bigdata00node.data-dir /home/modules/presto-server-0.215/data #data需要自己手动创建JVM配置文件JVM配置文件etc/jvm.config,包含启动Java虚拟机时的命令行选项。格式是每一行是一个命令行选项。此文件数据是由shell解析,所以选项中包含空格或特殊字符会被忽略。以下是参考配置:-server-Xmx16G-XX:-UseBiasedLocking-XX:+UseG1GC-XX:G1HeapRegionSize=32M-XX:+ExplicitGCInvokesConcurrent-XX:+ExitOnOutOfMemoryError-XX:+UseGCOverheadLimit-XX:+HeapDumpOnOutOfMemoryError-XX:ReservedCodeCacheSize=512M-Djdk.attach.allowAttachSelf=true-Djdk.nio.maxCachedBufferSize=2000000备注:以上参数都是官网参数,实际环境需要调整Server配置文件配置属性文件etc/config.properties,包含Presto server的配置。Presto server可以同时为coordinator和worker,但一个大集群里最好就是只指定一台机器为coordinator。(1)coordinator节点的配置文件coordinator=truenode-scheduler.include-coordinator=truehttp-server.http.port=5050discovery-server.enabled=truediscovery.uri=http://192.168.XX.XX:5050query.max-memory=20GBquery.max-memory-per-node=1GBquery.max-total-memory-per-node=2GB(2)worker节点的配置文件coordinator=falsehttp-server.http.port=5050discovery.uri=http://192.168.XX.XX:5050query.max-memory=20GBquery.max-memory-per-node=1GBquery.max-total-memory-per-node=2GB解释:coordinator: 是否运行该实例为coordinator(接受client的查询和管理查询执行)。node-scheduler.include-coordinator:coordinator是否也作为work。对于大型集群来说,在coordinator里做worker的工作会影响查询性能。http-server.http.port:指定HTTP端口。Presto使用HTTP来与外部和内部进行交流。query.max-memory: 查询能用到的最大总内存query.max-memory-per-node: 查询能用到的最大单结点内存discovery-server.enabled: Presto使用Discovery服务去找到集群中的所有结点。每个Presto实例在启动时都会在Discovery服务里注册。这样可以简化部署,不需要额外的服务,Presto的coordinator内置一个Discovery服务。也是使用HTTP端口。discovery.uri: Discovery服务的URI。将example.net:8080替换为coordinator的host和端口。这个URI不能以斜杠结尾,这个错误需特别注意,不然会报404错误。另外还有以下属性:jmx.rmiregistry.port: 指定JMX RMI的注册。JMX client可以连接此端口jmx.rmiserver.port: 指定JXM RMI的服务器。可通过JMX监听。Catelog配置文件(重点)hive connector配置如下:a、在etc目录下创建catalog目录b、创建一个hive connector的配置文件:hive.properties# hive.propertiesconnector.name=hive-hadoop2 #连接名hive.metastore.uri=thrift://192.168.XX.XX:9083 #配置hive metastore连接hive.config.resources=/home/modules/hadoop-2.8.3/etc/hadoop/core-site.xml,/home/modules/hadoop-2.8.3/etc/hadoop/hdfs-site.xml,/home/modules/hadoop-2.8.3/etc/hadoop/mapred-site.xml #指定hadoop的配置文件,注意core-site.xml需要按照https://github.com/huaweicloud/obsa-hdfs/tree/master/release/doc配置hive.allow-drop-table=true #给删表权限日志配置文件创建文件log.properties写入内容:com.facebook.presto=INFO备注:日志级别有四种,DEBUG, INFO, WARN and ERROR启动presto步骤如下:a、启动hive metastore:hive --service metastore &b、启动presto server:bin/launcher startc、启动presto client:重命名presto-cli-333-executable.jar为presto,放在bin目录下,然后赋予执行权限:chmod +x presto启动client:./presto --server XX.XX.XX.XX:5050 --catalog hive --schema default关闭presto服务bin/launcher stopPresto查询OBS创建hive表CREATE TABLE sample01(id int,name string,address string)ROW FORMAT DELIMITEDFIELDS TERMINATED BY ','STORED AS TEXTFILElocation obs://obs-east-bkt001/sample01';insert into sample01 values(1,'xiaoming','cd');insert into sample01 values(2,'daming','sh');presto查询hive表./presto --server XX.XX.XX.XX:5050 --catalog hive --schema defaultselect * from sample01;
-
最近,随着健康码的流行,大数据又重回大众的视野。作为新基建产业的原油,数据逐步迈向信息产业的核心。不过随着数据量级的不断扩大,从数据仓库到数据湖再到仓湖一体,如何将各种大数据技术栈整合在一起,发挥出大数据技术的最大价值成为业界都在关注的问题。越来越大的数据,想说爱你不容易权威的咨询机构IDC对于大数据的定义是现有技术难以处理的数据。从历史来看,在谷歌提出大数据三驾马车的论文时,当时的关系型数据库技术的确难以处理大规模的数据。传统SQL在谷歌海量的查询记录面前,根本跑不出结果。当前,科技企业要处理的数据量还在迅速增长,以笔者所在的银行为例,创新性的产品令银行要存储越来越多的数据,以开放银行和数字货币最为典型。比如开放银行产品推出之前,无论是柜台、ATM、网上银行还是手机银行,银行的交易都是由自身完全可控的设备或APP发起的,而开放银行产品无处不在、无时不在,要求银行必须要记录客户的行为数据,这也就使银行要处理更多更庞大的数据。同样的情况也出现在数字货币上,我国的央行数字货币(DCEP)一个最重要的属性就是离线钱包,这也就意味着DCEP必然要记录之前不会体现在银行账面上的现金交易信息,这也会将金融交易的数据量级再上台阶。在诸多行业业务上云如火如荼的大背景下,从工业互联网及IoT的角度看,数据的量级不断创新高,从我了解到的情况,各大厂的数据量级正在以年化80%左右的速度增长,因此可以说大数据技依旧术方兴未艾,未来还有广阔的发展空间。从数据库到数仓,再到数据湖在梳理数据存储模型演进的历史后,明显可以发现,这是一个随着数据量级不断扩大,数据模型不断将传统特性退化掉的过程,在这个演化当中存储的效率不断提升。从最早关系型数据库的视角看,数据库是工厂的车间,数据是原材料。车间为了进行原材料加工,有大量的操作设备,原材料随时会被重塑修改,不适合进行大量材料的储存场所。关系型数据库在大量数据存储方面的短板直接催生了Hadoop等大数据技术的革命,从大数据的视角看,大数据自身就是储存仓库,而数据已经是加工完成的成品,没有被重塑修改回滚的需求。比如HDFS的实现中所有数据只能写入一次,无法修改,这其实是退化掉数据的特性,以换取海量数据的储存与查询性能。而随着大数据应用的进一步拓展,业界发现价值密度更低的非结构化数据也有储存及挖掘的必要。比如客服的对话可能是语音、文字甚至是图像、视频,这都不是传统意义上数据库、数仓可以处理的结构化数据,因此用于储存非结构化的数据湖出现了,在数据湖中数据标准化、结构化的特性也退化了。三座大山,大数据所不能承受之重第一座大山是处理时效:在了解数据存储模型的演进过程后,我们可以看出关系型数据库、数据仓库与数据湖的底层构建模型并不相同,彼此兼容性不佳。这首先就会催生出数据处理的时效性问题,对于处理时效的要求可能是大数据工程师与产品经理之间永远无法达到的协议。以笔者所在的银行为例,分析数据在交易核心数据库中跑批处理,再ODS抽取ETL分析到数仓,再进一步训练流式计算,最后再入湖,其时效最快也是T+1日,而且Hadoop和数据湖的开源生态中很多组件并不兼容,日常运维已捉襟见肘,想提速也无从下手,但业务对了转瞬即逝的营销机会又如此渴求,T+1分钟可能都会嫌慢。如果还回答不出更细节、隐含的问题,比如非线性问题,还要把数据复制到SAS中做机器学习,再做统计的指标体系,去做进一步挖掘。数据要在这里搬动三次,复制三份冗余,还要管理数据一致性,每天数据中心运维的大量工作在做数据搬家。第二座大山是数据治理: 现在,数据中心也开始要做一个融合性的计算框架。比如,现在AI要做online训练,淘宝推荐引擎,滴滴打车的路径动态规划都在做即时数据,这都需要很高的数据治理水平进行支撑。数据治理作为摆在大数据工程师面前的一大痛点,去年初微盟发生了举世瞩目的删库事件,可以看到从2月23日删库中断事件,到3月1日的数据全面找回,再到3月3日的数据恢复整个事件持续了一周多的时间。对微盟这样体量的电商来说,损失无疑是巨大的,股市市值的蒸发是一方面,更重要的是科技公司从本质上是经营数据的公司,而数据丢失事件与银行金库被盗事件从某种程度来说是同样性质的事件,都会对当事公司的声誉造成极大的影响。造成这个问题的本质还是由于数据治理水平,只有将数据按照重要性把数据分类,并分别制订治理策略,才能在真正有用的数据丢失时找到最切实可行的应对办法,眉毛胡子一把抓难以真正降本提效。按照笔者的观察,目前从治理角度,可以将数据分为以下三种类型:应用数据:也就是交易类应用所产生的数据。为了满足业务需要构建业务IT系统,随着IT业务系统的不断运行,大量应用数据就产生了,这些数据经过ETL加工进入数据仓库,进行再处理,供业务应用。这些数据都是单一的关系型数据,数据量级是GB的。用户行为数据:随着互联网和电商的快速发展,大量人的操作行为和使用行为产生的数据,像谷歌、脸书等大数据互联公司,都记录人的形成产生的数据。上网行为、浏览行为、购买行为、评论行为、刷微博,做抖音等都可以产生大量数据。这些数据不再是单一的结构化数据,出现了大量文档、音频和视频数据,数据量级是TB级的。硬件日志数据:进入万物互联的时代,大量机器传感器,IoT设备都会产生大量数据。这些设备 7*24小时产生数据,数据格式也是多种多样,有的是日志数据,有的是时序数据,有的是网格数据等等,数据量级是PB的。从数据治理角度上讲,上述数据的备份需求是不同的,如果混到一起,那快速恢复业务根本无从谈起。而从数据使用的角度上讲,随着海量的行为及日志类数据的出现,数据的价值必然要从数据治理的角度去要价值。针对行为及日志等重要性等级不高的数据,一般采用异地磁带备份的方式,使用温备乃至冷备的试进行,不过从目前情况看不少企业尤其是创业型企业,都没有百年老店的观念,在初创时期对于这方面考虑和规划还不够,规划没做好,将来必然会对企业发展有负面影响。这又就引出第三座大山 - 灾备规划:但也经常被公司管理人员所忽略,大多数初创公司不会提前规划灾备体系,公司上规模之后再进行灾备建设又是mission impossible。一般来说两地三中心中的生产与同城中心是双活的可以快速接管业务,异地中心数据延迟同步,以应对一些删库删表类的误操作。正如刚刚所说Hadoop与数据湖两套体系中的开源组件兼容性很差,能让两者协同工作已属不易,再补充建设灾备节点难上加难。一般来说目前比较流行的灾备体系是两地三中心的架构,也就是至少在两个地域建设三个数据中心,其中:主中心:正常情况下全面提供业务服务同城中心:一般与主中心处在同一省份,主中心使用同步复制的方式来向同城灾备中心传输数据,保证同城中心数据复本为最新,随时可以接管业务,以保证RTO的指标。但是同城中心无法应对此类删库事件。异地中心:一般使用延时异步复制(延时时间一般为30分钟左右)的方式向异地灾备中心传输数据,其中同步复制的好处是一旦主中心被人工破坏,那么不会立刻涉及异地中心。以保证RPO的指标。总结灾备体系的最佳实践就是两地三中心;同城保证业务连续性,优先负责用户体验;异地保证数据连续性,确保企业生存底线。上云后的灾备规划也一定要纳入设计范围,一旦没有提前的规划,后续的补齐填坑的工作非常麻烦。云原生打开大数据未来的正确方式从上面三座大山可以看出,大数据最终用户的最佳选择就是在云平台上找到大数据的一栈式解决方案,屏蔽底层组件的差别,才能提高效率,低成本运维,因此可以说与云计算无缝对接的云原生技术肯定会是未来的方向。而华为云云原生大数据以其容器化集成及全栈大数据云平台的两大特性,很好解决了大数据技术在实际落地中的特点,我们用“大数据的操作系统”来定义华为云的云原生大数据会更加直观贴切:容器化集成:基于Mesos的资源管理,支持Marathon和Kubernetes的容器编排框架,采用云原生架构的数据平台。底层是对容器化的支持,以及对Hadoop、Spark、Kafka、Tensorflow、Hive等这些大数据开源组件的容器化发布,这就是打地基。华为云通过开源的Docker、K8S、Mesos等技术,对主流的Hadoop、Hive、Spark、Kafka等多种大数据技术组件进行了容器化集成,实现大数据应用与底层运行环境之间的解耦,推出了应用云平台(PaaS)与容器大数据平台。也就是说华为云的用户不用再过度关心底层开源组件的运维了,可以更加专注于自身的业务。全栈大数据云:在大数据开源组件容器化的基础上,华为云还把数据开发平台统一集成,推出了数据湖治理中心DGC(Data Lake Govenance Center,链接:https://www.huaweicloud.com/product/dayu.html),包括数据采集、数据规范、数据开发、数据服务、数据治理、数据可视化等多项工具。数据集成开发平台与应用云平台(PaaS)与容器大数据平台打包交付。 并已经服务了能源、教育、医疗健康、物联网、金融等领域的数十家客户,据笔者掌握的信息,华为云的客户复购率近100%。更进一步,华为云最近还推出了一套帮助政企构建数据体系的数据使能DAYU服务(链接:https://www.huaweicloud.com/solution/dataenabling.html),结合华为数字化转型实践和30多年在ICT基础设施领域积累的技术,携手行业合作伙伴,为客户提供一站式数据全生命周期管理解决方案,打造“全域、服务化、资产化、智能、安全”的数据体系,释放数据价值。展望未来,云原生大数据技术还可以充分利用AI技术降本增效:利用人工智能将冷热数据分层分离,让计算和存储资源充分利用,有效降低数据管理成本。通过分析系统运行状态和日志数据信息,利用人工智能建模,来实现动态系统参数调整和系统优化,显著降低系统数据管理者的运维成本。利用机器学习技术帮助系统建立更加准确高效的在线预警与实时监测系统,来实现智能化的运维管控和资源调配,帮助系统管理人员将更多的时间和精力集中在更重要的系统任务上。
-
华为开发者大会2021(Cloud)即将到来,华为云数据使能团队为你准备了大数据训练营,欢迎提前报名咨询~训练营内容:1、清华大学老师介绍大数据教学最新变革方向2、华为云DAYU 专家介绍数据治理方法论、价值和实践案例 3、实际演练:基于华为云DAYU平台演示数据治理过程参加训练营你将获得:1、训练营期间免费使用华为云部分资源2、初步掌握数据治理的概念和实操流程3、免费抽奖机会
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签