• [行业资讯] 如何能进行千万大数据量的数据库设计和优化呢?
    如何能进行千万大数据量的数据库设计和优化呢?
  • [云计算周刊] 互联网——大数据、云计算、物联网
        20世纪之时,计算机对于我们来说是陌生的,就好比鱼儿生活在水里,当它见到外面的世界的时候,对这充满色彩的世界既好奇,又陌生,殊不知这好奇的事物改变了自己对于世界的认识。    历史告诉我们,**改变了昔日的落后,闭关锁国注定贫穷落后,教育、医疗、科学技术、能源环境等永远都是一个国家向前发展的基础,不断探索、努力学习、不断创新是21世纪的发展精神,因为如今的世界正在高速发展,以计算机信息技术为基础的人工智能正在改变着我们,如果我们不思进取,终会被这信息时代所淘汰,这个社会上的强者不属于有多少金钱的人,而是属于有多少智慧、知识、文化的人!        如今我们都懂得网上购物,我们通过淘宝、京东或拼多多等平台购物,可以让我们对物品有所选择,而且可以通过快递方便的获取;当我们付款时,我们可以通过移动支付,支付宝、微信等平台给我们带来便利;当我们外出时可以通过互联网购票、百度地图导航;通过网络社交平台发表工作、生活等视屏,网上看病预约挂号,互联网教育平台学习等等,我们无时无刻的不与互联网为伴!互联网通过对人们出行、社交、购物、教育、工作等方面的大数据分析和后台云计算,不断储存和更新信息,为我们提供更好的服务,物联网是人工智能服务,我们可以通过远程控制系统进行办公、学习等,这一切的成果离不开学习,离不开科学技术与创新!    人人都希望生活在日新月异的时代中,希望人工智能取代那重复性、劳累的工作,给更多的家庭学习当代信息技术的机会,“光阴似箭,日月如梭”,我们不可能在年老之时也卖苦力,因此我们需要学习更多的科学文化知识,这个世界上不缺劳动力,随着时代的发展也终将不会缺有文化的人,但是这个世界上永远缺有责任与担当、有思想与智慧、有理想与追求的胸怀天下者!历史告诉我们,**改变了昔日的落后,闭关锁国注定贫穷落后,教育、医疗、科学技术、能源环境等永远都是一个国家向前发展的基础,不断探索、努力学习、不断创新是21世纪的发展精神,因为如今的世界正在高速发展,以计算机信息技术为基础的人工智能正在改变着我们,如果我们不思进取,终会被这信息时代所淘汰,这个社会上的强者不属于有多少金钱的人,而是属于有多少智慧、知识、文化的人!
  • [行业动态] 华为云TechWave全球技术峰会成功召开,数据使能,驱动业务增长
    据预测未来4年数据量将激增5-8倍,达180ZB,到35年呈50倍增长。同时,数据作为继土地、资本、技术、劳动力的第5种生产要素,已是数字经济发展的重要要素。但相关调查结果显示,企业运营中仅56%的数据被存储,仅32%的数据被利用。因此,在政企数字化转型的关键阶段,如何利用数据湖、数据仓库、数据库等技术,加速数据资产化,发挥数据新价值,成为当前数据领域的重要话题。4月8日,华为云TechWave全球技术峰会在深圳成功举办,峰会以“创新·普惠”为主题,汇聚业界精英、技术大咖、先锋企业、合作伙伴等,共话前沿技术,分享行业优秀应用实践,探讨企业智能升级的成长之道。其中,数据使能分论坛围绕“数据使能,驱动业务增长”为主题,首先解读华为云数据使能服务DAYU,同时招商银行、深圳地铁将分享数字化转型创新实践,合作伙伴永洪BI畅谈联合解决方案,最后由华为云FusionInsight MRS云原生数据湖、GaussDB数据库、GaussDB(DWS)数据仓库等技术专家共同探讨政企用数之道。(数据使能分论坛现场照片)华为云数据使能DAYU重磅开场:加速数据资产化,开发数据新价值(华为云数据使能服务总经理马麟瑜演讲)华为云数据使能服务总经理马麟瑜表示,“数据管理的领导者正在通过挖掘数据价值来驱动数字化转型,创造发展机会,改善客户体验和重塑行业格局。华为云数据使能DAYU致力于打通企业数据从资源到资产的通路,助力政企客户跨越孤立系统、感知业务的数据资源智能管理解决方案,实现全域数据入湖,帮助政企客户从多角度、多层次、多粒度挖掘数据价值,实现数据驱动的数字化转型。”华为云数据使能服务DAYU包含三层能力:数据技术平台-智能数据湖 FusionInsight:为政企客户提供覆盖海量数据全生命周期的管理方案。包含MRS云原生数据湖、GaussDB数据库、GaussDB(DWS)数据仓库、数据湖治理中心DGC等服务。使能套件 DAYU Ekit:包含使能在线化工作台,资产化效率提升10X; 行业使能知识库,协同伙伴沉淀行业资产模型,同时将AI驱动方法论与行业知识结合,实现数据资产化智能流水线工作。资产中心 DAYU Hub:通过为客户提供丰富的数据模型、数据资产管理方法,帮助企业实现资产可信管理,资产模型智能分析 ,多方安全可信计算,保障全局数据的安全流通。招商银行、深圳地铁分享大数据创新实践数据使能分论坛中,招商银行、深圳地铁分别分享了基于华为云数据域的行业创新实践。(招商银行数据仓库架构师曾民演讲)招商银行数据仓库架构师曾民表示:招商银行通过使用华为云强化了数据平台的建设,“人人用数”战略让招行没有难用的数据,打造金融数仓,秉承“源于业务,高于业务,先于业务”的理念,以解决实际业务问题为出发点,沉淀可复用易扩展的数据使能能力,成为数据“能用,好用,爱用”的践行者与布道者。早在2019年下半年,招商银行就开始了新一代MPP数据仓库平台的选型,旨在通过对数据平台的数据处理能力、性能、高可用性、扩展性、易用性、通用性等特性进行多方位的考察。通过多维度的测试,最终选定华为云GaussDB(DWS)作为新一代云上数据仓库平台,进一步提升了金融数仓的算力、备份、存储等性能,加速落实招行“人人用数,人人都是数据分析师”的数据发展战略!同时招商银行已和华为云FusionInsight MRS展开了一系列金融数据湖联合创新,旨在使用HetuEngine提高用数效率,简化用数方式。(深圳地铁运营集团线网管控中心副总经理张洪庆演讲)深圳地铁运营集团线网管控中心副总经理张洪庆在“云数赋能,实现智慧深铁“议题中表示:“在智慧城轨快速发展的大背景下,深圳地铁以科技赋能运营为目标,积极探索智慧运维新模式。在智慧城轨探索上,试点先行,顶层规划和企业标准同步推进,采用了华为城轨云解决方案,利用云计算、大数据、5G、人工智能等技术核心,建立了统一、开放、智能的城轨数字平台。在城轨云平台基础上,利用华为云 FusionInsight MRS云原生数据湖能力构建深圳地铁大数据分析平台,在智慧车站、智慧运维方面,对新技术与地铁场景进行创新融合,推进了车站业务全日自动运行、线上线下一体化客服、设备主动检测、健康管理等应用,探索数字化、高效化的新业务模式,科技赋能运营更高质量运行,企业更低成本运作,为城市提供更优质的公共交通服务。”(永洪BI技术专家黄华晃演讲)合作伙伴永洪BI分享基于华为云实现敏捷BI的联合解决方案永洪BI技术专家黄华晃分享了“永洪BI自助用数,敏捷提效20倍“议题,并表示基于华为云FusionInsight MRS云原生数据湖,永洪BI实现快速搭建应用,打造了更敏捷、更快速、更强大的“永洪BI”,具备自服务、高性能、极致易用等特点,已广泛用于金融、政务、能源等行业,让人人都成为数据分析师!至今,华为云FusionInsight联合800+ISV,已为千行百业的客户提供“一企一湖、一城一湖“的数字化转型方案。数字化转型之路离不开客户对于华为云FusionInsight智能数据湖的信赖,也离不开伙伴的精诚合作。同时,华为云也坚持技术创新,在MRS云原生数据湖、GaussDB数据库、GaussDB(DWS)数据仓库等产品上不断潜心钻研,勇攀技术高峰!华为云FusionInsight、GaussDB技术专家共谈数字化转型创新技术华为云FusionInsight解决方案首席架构师徐礼锋在会议中分享了“华为云FusionInsight MRS云原生数据湖一架构三湖,持续演进“的议题,深度解读了一个架构实现三种湖的能力和新技术。(华为云FusionInsight解决方案首席架构师徐礼锋演讲)逻辑数据湖:HetuEngine提供跨湖、跨仓、跨云统一访问,减少数据搬迁,数据高效流动,全域数据秒级协同分析秒级响应,业务上线效率提升10倍,由周级缩短至天级。实时数据湖:流处理 + Hudi实现数据更新入湖,从T+1到T+0; ClickHouse提供毫秒级实时OLAP分析能力;Flink提供FlinkSQL能力,批流SQL接口统一,实现流批一体。离线数据湖:HetuEngine提供秒级交互式查询能力,数据不出湖,分析链路短,性能比Impala快30%+,分析提效10倍+;DLC提供统一的元数据,数据全局可视; HetuEngine提供湖内统一SQL接口:HDFS、Hive、HBase、ES等,简化用数。华为云FusionInsight MRS践行产学研合作,全面推进大数据开源技术发展,联合清华大学发布了IoTDB时序引擎版本。目前华为云FusionInsight MRS已应用于60多个国家3000+客户,助力政企客户实现一企一湖、一城一湖,业务洞见更准,价值兑现更快!华为云GaussDB技术专家胡彦军分享了“华为云云原生分布式数据库GaussDB,多模架构,多元生态“的议题,为我们解读了华为倾力打造的云原生数据库GaussDB系列产品的技术创新与行业普惠。(华为云GaussDB技术专家胡彦军演讲)华为云GaussDB(for openGauss)基于云化的部署模式,分布式形态,生态开放,更好满足了企业的数据库诉求。经过13年的积累,从内部锤炼,再到外部行业实践,华为云GaussDB(for openGauss)淬炼出6大核心能力:(1)超高可用:支持跨机房、同城、异地、多活高可用,支持分布式强一致,数据0丢失。(2)开放生态:openGauss开放生态,确保客户避免被类似传统商业数据库的封闭生态锁定。(3)极致扩展:通过分布式全局事务一致性优化,实现计算与存储的垂直扩展能力,同时支持新增分片的数据在线重分布能力。(4)卓越性能:分布式优化器+Numa-aware技术加持,提供极致性能。在TPC-C、TPC-H等企业级负载下性能表现卓越。以及具备丰富的企业级特性(如支持HTAP混合负载,拥有AI自治能力)和超高的安全性(具备独立的代码级的问题修复能力及架构优化能力),构建了极具竞争力的能力。华为云GaussDB(DWS)技术专家李海丰分享了“华为云GaussDB(DWS)实时数仓,提速全场景数据分析“的议题,其中实时数仓的时序引擎和CEP引擎成为亮点。(华为云GaussDB(DWS)技术专家李海丰演讲)华为云GaussDB(DWS) 是一款具备分析及混合负载能力的分布式数据仓库,支持行存储与列存储,提供PB级数据分析能力、多模分析能力和实时处理能力,用于数据仓库、数据集市、实时分析、实时决策和混合负载等场景,广泛应用于汽车、制造、零售、互联网、金融、政府、电信等行业核心分析决策系统。作为新一代全场景云原生数据仓库,它不仅仅是把数仓搬上云这么简单,而是真正面向未来的云原生架构的数仓服务。传统数仓一般是基于分布式shared nothing的MPP架构实现的,而GaussDB(DWS)在MPP架构的基础上,与高性能的云存储相结合,打造了多温存储的存算分离架构,支持资源的弹性伸缩。同时,逻辑集群和多租户技术,将存储和计算资源进行了更细粒度的隔离,用户可以对不同的业务划分不同的逻辑集群或租户,实现更加灵活的弹性。受益于云服务的多样性,GaussDB(DWS)支持多源、多模的融合分析,既可以在库内支持时序、流、全文检索、GIS等内置多引擎的数据分析,又可以基于OBS实现跨引擎的协同计算,例如与FusionInsight MRS云原生数据湖、GES图引擎、ModelArts AI平台等实现数据免搬迁。至此,华为云TechWave全球技术峰会数据使能分论坛圆满结束。围绕“数据使能,驱动业务增长”主题,为现场观众讲述了金融、交通等行业的数字化转型创新实践,联合合作伙伴畅谈数据湖BI联合解决方案,云集华为云DAYU数据使能、FusionInsight MRS云原生数据湖、GaussDB数据库、GaussDB(DWS)数据仓库等技术专家共聚一堂“鹏城论数”,探讨政企用数之道,分享了政企客户数字化前沿技术。下一场,上海,与您不见不散!调查问卷更多内容,华为云FusionInsight系列文章:https://bbs.huaweicloud.com/forum/thread-66105-1-1.html 
  • [全栈开发者] (活动已结束)【大数据全栈成长计划】Spark学习篇•最终考核打卡帖&微认证
    【大数据全栈成长计划】Spark学习篇课程内容都已经全部更新完毕。大家积极的学习态度,遇到问题及时在学习群内提出,让本阶段全栈课程可以顺利完成再次感谢大家:◎积极完成每章的随堂测验打卡,做到了课后的知识强化与巩固;◎认真完成每周读书笔记打卡,将自己的学习心得总结下来;◎有活力地问答官打卡,分享自己在学习中的问题和经验。十分感谢大家能顺利完成这一阶段的学习内容现在,大家迎来了第三阶段考核,我们为大家准备了两种考核方式,让我们来看一下:▶方式一:微认证考核  提供订单截图 阶段考核+15分、提交微认证证书截图 阶段考核在订单的基础上再+15分通过特定场景化学习和实际操作,可以获得华为云微认证提供的具有【华为云官方微认证证书】以下三种场景选择一种参与认证考核,多参加选取最高分数模拟场景认证链接基于流计算的双十一大屏开发案例https://edu.huaweicloud.com/certifications/35e95745f9344e1a9b5a92a0bf201fc3球星薪酬决定性因素分析https://edu.huaweicloud.com/certifications/f20642504f504d54b7559659b759612f网站消费者行为分析https://edu.huaweicloud.com/certifications/1866d21d8c074186b72ed952344df625参与认证的同学请将【微认证订单截图&微认证证书截图+华为云ID】回复到本帖当中 才能算作最终考核成功,考核分数才能统计▶方式二: <HDC.Cloud2021>自测考试——大数据   阶段考核分数为考试成绩x10%①打开此链接:https://developer.huaweicloud.com/activity/hdc2021_developer.html②找到[进阶线路]-[大数据],完成考试后截图成绩本次考试只有一次机会,考试成绩为第一次答题(最早一次答题时间)的分数,请认真作答。答题结束后请将【第一次答题成绩截图+华为云ID】发送至本帖视为打卡成功成绩将以系统后台的成绩为准。▶考核打卡时间:即日起 — 2021.04.21 23:59选择以上两种【Spark学习篇考核】方式进行考核,多参加分数可累计。符合证书的发放条件后均可以获得【第三阶段考核纪念证书】,证书的发放条件和发放方式将于2021.04.21后在最终成绩贴中公布。
  • [实践系列] 【GaussDB(DWS)实践系列】华为商城(Vmall)背后的黑科技
    华为商城(Vmall商城)隶属于华为技术有限公司,是华为公司旗下的自营电子商务平台,以最终用户为主要对象,提供华为手机、无线上网设备、平板电脑、配件等系列终端产品和服务;是以营造用户的移动信息生活为服务宗旨的互联网商务平台。2012年3月,华为商城内部测试版正式对外试运营,并于3月18日正式上线营业。        在华为产品的众多销售渠道中,华为商城具有以下优势:正品保证:华为商城为华为终端自有官方销售服务网站。提供全系列华为产品,保证正品、服务可靠!一站式的网站体验:华为商城一站式提供产品和服务。服务无忧:从商品、验货、库存、配货售后服务等环节全方位保证商品品质。社区互动优势:发挥已有社区的优势,增加官方与用户、用户与用户的互动。        随着华为消费者产品的销售的持续增长,作为消费者产品的最重要渠道之一,Vmall是如何支撑保障华为终端业务的快速发展呢?今天我们就为大家来解密Vmall商城成功背后的秘密。        一个成熟的电商平台,一般至少包含以下几个功能:门户Portal、交易系统、端侧APP、用户画像、推荐系统、搜索系统、报表等。究竟Vmall商城通过是什么神秘的技术力量,保障这些系统有机高效的运行,来成就Vmall商业上的成功呢?       下面我们就来为大家揭秘Vmall的大厦是如何建成的?我们仅以报表、营销、画像、推荐等几个核心系统来介绍整个系统是如何有机运行。话不多说,请看图:                整个系统的数据来源包含2部分,一部分来自于交易系统,包括产品管理系统、订单管理系统、客户管理系统、风险管理系统等等。另一部分数据来自于端测的流数据,包括用户点击率、商品搜索等行为数据。从软件架构上来看,这些数据都被流入、汇聚到一个DWS集群中,并且,整个框架的ODS层、DWI/DWD、DWS、DM层,都是构筑于同一套DWS集群中。因此,DWS才是这一系列魔法的关键。        报表系统的数据流如下: 业务系统将数据映像到TiDB中。通过CDM和ROMA服务将数据同步至DWS中。经过SDI、DWD/DWI层加工后,在DWS层进行进一步加工,生成面向各个主体的DM层数据。OAR数据系统通过调用相应DM层数据,进行报表和大屏数据呈现。        说到营销,就不得不提到画像系统。画像是推荐和营销、搜索的基石。画像系统的数据主要来自于对端侧行为数据的分析归类,其业务流程如下:端侧行为数据通过DAP模块汇聚至kafka组件。通过CSS组件(Flink)将数据实时汇聚只DWS中。在DWS中通过标签算法,对用户行为进行标签、分析和归类。将相关标签同步至ES中进行画像查询。        营销系统数据流程如下:基于画像相关的流程基础上,将ES中的画像数据同步至DMP平台。基于DMP平台进行营销获得的策划、编排、跟踪等。        推荐系统和搜索系统强相关的。因为推荐系统需要调用画像、商品等信息。Vmall商城的搜索系统基于华为云ES服务之上,使用了增强的泊松引擎,通过RPC网关,对外提供搜索RPC API接口调用,为商城Web端和移动端APP提供商品搜索和推荐服务。        在整个华为商城的架构中,DWS服务起到了极其重要核心的作用。既有效地承载了传统数仓的批处理和高并发查询任务,又完美实现了高并发实时流数据的接入和实时分析,经受住了618等重大业务极限流量高峰的考验,成为华为商城数据处理基座的中流砥柱。        那么,华为云DWS服务究竟是如何做到这些,这里面又包含了哪些不为人所熟知的独门秘技呢,请听下回分解!
  • [行业动态] 基于大数据构建实时数仓的实践
    前言:数据处理现状,当前基于Hive的离线数据仓库已经非常成熟,数据平台体系也基本上是围绕离线数仓进行建设。但是随着实时计算引擎的不断发展以及业务对于实时报表的产出需求不断膨胀,业界最近几年就一直聚焦并探索于两个相关的热点问题:实时数仓建设和大数据架构的批流一体建设。实时数仓建设:实时数仓1.0        传统意义上我们通常将数据处理分为离线数据处理和实时数据处理。对于实时处理场景,我们一般又可以分为两类,一类诸如监控报警类、大屏展示类场景要求秒级甚至毫秒级;另一类诸如大部分实时报表的需求通常没有非常高的时效性要求,一般分钟级别,比如10分钟甚至30分钟以内都可以接受。        对于第一类实时数据场景来说,业界通常的做法比较简单粗暴,一般也不需要非常仔细地进行数据分层,数据直接通过Flink计算或者聚合之后将结果写入MySQL/ES/HBASE/Druid/Kudu等,直接提供应用查询或者多维分析。如下所示:        而对于后者来说,通常做法会按照数仓结构进行设计,我们称后者这种应用场景为实时数仓,将作为本篇文章讨论的重点。从业界情况来看,当前主流的实时数仓架构基本都是基于Kafka+Flink的架构(为了行文方便,就称为实时数仓1.0)。下图是基于业界各大公司分享的实时数仓架构抽象的一个方案:        这套架构总体依然遵循标准的数仓分层结构,各种数据首先汇聚于ODS数据接入层。再接着经过这些来源明细数据的数据清洗、过滤等操作,完成多来源同类明细数据的融合,形成面向业务主题的DWD数据明细层。在此基础上进行轻度的汇总操作,形成一定程度上方便查询的DWS轻度汇总层(注:这里没有画出DIM维度层,一般选型为Redis/HBase,下文架构图中同样没有画出DIM维度层,在此说明)。最后再面向业务需求,在DWS层基础上进一步对数据进行组织进入ADS数据应用层,业务在数据应用层的基础上支持用户画像、用户报表等业务场景。        基于Kafka+Flink的这套架构方案很好的解决了实时数仓对于时效性的业务诉求,通常延迟可以做到秒级甚至更短。基于上图所示实时数仓架构方案,笔者整理了一个目前业界比较主流的整体数仓架构方案:        上图中上层链路是离线数仓数据流转链路,下层链路是实时数仓数据流转链路,当然实际情况可能是很多公司在实时数仓建设中并没有严格按照数仓分层结构进行分层,与上图稍有不同。        然而基于Kafka+Flink的实时数仓方案有几个非常明显的缺陷:Kafka无法支持海量数据存储。对于海量数据量的业务线来说,Kafka一般只能存储非常短时间的数据,比如最近一周,甚至最近一天;Kafka无法支持高效的OLAP查询。大多数业务都希望能在DWD\DWS层支持即席查询的,但是Kafka无法非常友好地支持这样的需求;无法复用目前已经非常成熟的基于离线数仓的数据血缘、数据质量管理体系。需要重新实现一套数据血缘、数据质量管理体系;Lambad架构维护成本很高。很显然,这种架构下数据存在两份、schema不统一、 数据处理逻辑不统一,整个数仓系统维护成本很高;Kafka不支持update/upsert。目前Kafka仅支持append。实际场景中在DWS轻度汇聚层很多时候是需要更新的,DWD明细层到DWS轻度汇聚层一般会根据时间粒度以及维度进行一定的聚合,用于减少数据量,提升查询性能。假如原始数据是秒级数据,聚合窗口是1分钟,那就有可能产生某些延迟的数据经过时间窗口聚合之后需要更新之前数据的需求。这部分更新需求无法使用Kafka实现。        所以实时数仓发展到现在的架构,一定程度上解决了数据报表时效性问题,但是这样的架构依然存在不少问题,随着技术的发展,相信基于Kafka+Flink的实时数仓架构也会进一步往前发展。那会往哪里发展呢?        大数据架构的批流一体建设。        带着上面的问题我们再来接着聊一聊最近一两年和实时数仓一样很火的另一个概念:批流一体。对于批流一体的理解,笔者发现有很多种解读,比如有些业界前辈认为批和流在开发层面上都统一到相同的SQL上是批流一体,又有些前辈认为在计算引擎层面上批和流可以集成在同一个计算引擎是批流一体,比如Spark/Spark Structured Streaming就算一个在计算引擎层面实现了批流一体的计算框架,与此同时另一个计算引擎Flink,目前在流处理方面已经做了很多的工作而且在业界得到了普遍的认可,但在批处理方面还有一定的路要走。实时数仓2.0        笔者认为无论是业务SQL使用上的统一还是计算引擎上的统一,都是批流一体的一个方面。除此之外,批流一体还有一个最核心的方面,那就是存储层面上的统一。在这个方面业界也有一些走在前面的技术,比如最近一段时间开始流行起来的数据湖三剑客-- delta/hudi/iceberg,就在往这个方向走。存储一旦能够做到统一,上述数据仓库架构就会变成如下模样(以Iceberg数据湖作为统一存储为例),称为实时数仓2.0:         这套架构中无论是流处理还是批处理,数据存储都统一到数据湖Iceberg上。那这么一套架构将存储统一后有什么好处呢?很明显,可以解决Kafka+Flink架构实时数仓存在的前面4个问题:可以解决Kafka存储数据量少的问题。目前所有数据湖基本思路都是基于HDFS之上实现的一个文件管理系统,所以数据体量可以很大。DW层数据依然可以支持OLAP查询。同样数据湖基于HDFS之上实现,只需要当前的OLAP查询引擎做一些适配就可以进行OLAP查询。批流存储都基于Iceberg/HDFS存储之后,就完全可以复用一套相同的数据血缘、数据质量管理体系。Kappa架构相比Lambad架构来说,schema统一,数据处理逻辑统一,用户不再需要维护两份数据。        有的同学说了,这不,你直接解决了前4个问题嘛,还有第5个问题呢?对,第5个问题下文会讲到。        又有的同学会说了,上述架构确实解决了Lambad架构的诸多问题,但是这套架构看起来就像是一条离线处理链路,它是怎么做到报表实时产出呢?确实,上述架构图主要将离线处理链路上的HDFS换成了数据湖Iceberg,就号称可以实现实时数仓,听起来容易让人迷糊。这里的关键就是数据湖Iceberg,它到底有什么魔力?        为了回答这个问题,笔者就上述架构以及数据湖技术本身做一个简单的介绍(接下来也会基于Iceberg出一个专题深入介绍数据湖技术)。上述架构图中有两条数据处理链路,一条是基于Flink的实时数据链路,一条是基于Spark的离线数据链路。通常数据都是直接走实时链路处理,而离线链路则更多的应用于数据修正等非常规场景。这样的架构要成为一个可以落地的实时数仓方案,数据湖Iceberg是需要满足如下几个要求的:支持流式写入-增量拉取。流式写入其实现在基于Flink就可以实现,无非是将checkpoint间隔设置的短一点,比如1分钟,就意味每分钟生成的文件就可以写入到HDFS,这就是流式写入。没错,但是这里有两个问题,第一个问题是小文件很多,但这不是最关键的,第二个问题才是最致命的,就是上游每分钟提交了很多文件到HDFS上,下游消费的Flink是不知道哪些文件是最新提交的,因此下游Flink就不知道应该去消费处理哪些文件。这个问题才是离线数仓做不到实时的最关键原因之一,离线数仓的玩法是说上游将数据全部导入完成了,告诉下游说这波数据全部导完了,你可以消费处理了,这样的话就做不到实时处理。        数据湖就解决了这个问题。实时数据链路处理的时候上游Flink写入的文件进来之后,下游就可以将数据文件一致性地读走。这里强调一致性地读,就是不能多读一个文件也不能少读一个文件。上游这段时间写了多少文件,下游就要读走多少文件。我们称这样的读取叫增量拉取。解决小文件多的问题。数据湖实现了相关合并小文件的接口,Spark/Flink上层引擎可以周期性地调用接口进行小文件合并。支持批量以及流式的Upsert(Delete)功能。批量Upsert/Delete功能主要用于离线数据修正。流式upsert场景上文介绍了,主要是流处理场景下经过窗口时间聚合之后有延迟数据到来的话会有更新的需求。这类需求是需要一个可以支持更新的存储系统的,而离线数仓做更新的话需要全量数据覆盖,这也是离线数仓做不到实时的关键原因之一,数据湖是需要解决掉这个问题的。支持比较完整的OLAP生态。比如支持Hive/Spark/Presto/Impala等OLAP查询引擎,提供高效的多维聚合查询性能。        这里需要备注一点,目前Iceberg部分功能还在开发中。具体技术层面Iceberg是怎么解决上述问题的,请持续关注本号,接下来一篇文章会详细讲解哦。实时数仓3.0        按照批流一体上面的探讨,如果计算引擎做到了批流一体的统一,就可以做到SQL统一、计算统一以及存储统一,这时就迈入实时数仓3.0时代。对于以Spark为核心技术栈的公司来说,实时数仓2.0的到来就意味着3.0的到来,因为在计算引擎层面Spark早已做到批流一体。基于Spark/数据湖的3.0架构如下图:        假如未来Flink在批处理领域成熟到一定程度,基于Flink/数据湖的3.0架构如下图:        上面所介绍的,是笔者认为接下来几年数据仓库发展的一个可能路径。对于业界目前实时数仓的一个发展预估,个人觉得目前业界大多公司都还往实时数仓1.0这个架构上靠;而在接下来1到2年时间随着数据湖技术的成熟,实时数仓2.0架构会成为越来越多公司的选择,其实到了2.0时代之后,业务同学最关心的报表实时性诉求和大数据平台同学最关心的数据存储一份诉求都可以解决;随着计算引擎的成熟,实时数仓3.0可能和实时数仓2.0一起或者略微滞后一些普及。        目前,华为云FusionInsight MRS云原生数据湖,助力客户一个架构可持续演进,构建离线、实时、逻辑三种数据湖。通过LakeHouse范式,缩短数据分析链路和数据冗余,数据分析不出湖,在离线数据湖内实现常见批处理、流处理和全文检索等;通过Hudi实现数据实时增量Upsert入湖,通过ClickHouse使PB级数据实时OLAP毫秒级分析,实现全链路实时数据湖。通过HetuEngine,实现数据虚拟化,提供统一SQL接口访问,可跨湖跨仓跨云协同计算,将传统天级的人工摆渡数据,转变为跨湖跨仓跨云协同计算分钟级,实现逻辑数据湖。基于云原生能力,采用OBS实现大数据存算分离,提供企业级EC,将传统3副本降至1.2,TCO降低60%;采用BMS裸金属更好支持大数据高密集型计算场景,独家SDI技术彻底打通大数据所需的“CPU、内存、磁盘、网络”等资源的最后一环,释放100%数据基础设施算力。转载自过往记忆大数据,作者:大数据平台  https://mp.weixin.qq.com/s/cK6VA7Mnn6F6zdpdiBODPg免责声明:转载文章版权归原作者所有。如涉及作品内容、版权等问题,请及时联系文章编辑!
  • [学习交流] 只看到了MySQL和jdbc的资料,大数据老师课堂中提到的资料有吗
  • [测试] 常用测试模型:TPCDS
    【摘要】 TPCDS是模拟OLAP应用的典型场景,因其贴近真实场景,且有工具直接生成数据,而成为SQL引擎测试组最常用的测试模型。,本文将从几个角度分别进行分析:模型、场景、语句、数据.1 前言   TPCDS是模拟OLAP应用的典型场景,因其贴近真实场景,且有工具直接生成数据,而成为SQL引擎测试组最常用的测试模型。然而实际手工用例编写过程中,并没有使用TPCDS完整模型,而只是选择部分表作为测试表,同时测试用例编写中主要考虑语法、及与相关特性结合,而没有结合实际应用场景。为了提高手工用例的质量,更贴近用户使用,同时结合TPCDS场景,构建集成测试和系统测试的测试用例、测试场景,深入分析TPCDS是非常有必要的,本文将从几个角度分别进行分析:模型、场景、语句、数据。2 TPCDS模型   2.1 TPCDS场景概述   TPCDS场景中,包含了一个成熟的决策支持系统所具有的两项最重要的因素:1.         用户查询语句,将数据操作转化为商业智能。TPCDS的语句可以分为以下四类决策支持语句:l  报告型,这类语句通常是预定义的,会周期性地运行,来判断企业的财务和运行状况,比如月度、季度、年度财务报表。通常为静态的,改变的只是时间段、地理位置或商品名称。l  即席查询(Ad hoc),这类语句主要用于即时、特定的商业问题。它与报告型语句的主要差别在于预知程度(报告型都是计划中的,而Ad hoc通常是临时性的)。l  迭代OLAP,这类语句主要通过对数据进行研究分析来判断事物之间的联系和发展趋势。与Ad hoc语句相似,区别为该类语句基于一个具体的用户场景,且会提交一系列的复杂或简单语句。比如,通过某类客户过去几年的购买力分析,预测将来的购买力趋势。l  数据挖掘,这类语句是对大量数据进行分析,挖掘潜在的、无法直观得出的结论,从而支持商业决策。比如购物网站的购买推荐。说明:报告型语句通常可预先优化,因此执行时间短,而即席查询正常相反。TPCDS中,catalog 渠道相关语句模拟报告型语句,而store和web渠道相关语句模拟即席查询部分。2.         数据维护,对于决策分析所依赖的源数据需要同步管理。在实际生产环境中,数据维护的过程通常包括三个步骤:数据抽取、数据转换、数据加载(ETL)。TPCDS数据维护过程为:l  加载要更新的数据集,包括insert/delete/update的数据l  加载要更新的数据集到数据仓库,进行数据转换l  插入新的事实表记录,并根据时间删除某些记录举例说明TPCDS模拟的商业活动:1.       记录各个销售渠道的所有客户购买信息与退货信息2.       根据促销信息修改价格3.       维护仓库存货信息4.       创建**页5.       维护客户信息2.2 TPCDS模型介绍   2.2.1 概念在多维分析的商业智能解决方案中,根据事实表和维度表的关系,常见的模型分为星型模型和雪花型模型。星型模型:中央表包含事实数据,多个表以中央表为中心呈放射状分布,它们通过数据库的主键和外键相互连接,是一种使用关系数据库实现多维分析空间的模式,其基本形式必须实现多维空间,以使用关系数据库的基本功能。同时星型模型也是一种非正规化的模型,多维数据集的每一个维度直接与事实表连接,没有渐变维度,所以存在冗余数据。在星型模型中,只需要扫描事实表就可以进行查询,主要的数据都在庞大的事实表中,所以查询效率较高,同时每个维度表和事实表关联,非常直观,很容易组合出各种查询。雪花型模型:雪花模型在星型模型的基础上,维度表进一步规范化为子维度表,这些子维度表没有直接与事实表连接,而是通过其他维度表连接到事实表上,看起来就像一片雪花,故称雪花模型。也就是说雪花模型是星型模型的进一步扩展,将其维度表扩展为更小的维度表,形成一种层次。这样就通过最大限度的减少数据存储量以及联合较小的维度表来改善查询性能,且去除了星型模型中的冗余数据。                                                                                 两种模型比较:星型模型雪花型模型特点1.         非正规化;2.         多维数据集中的每一个维度都与事实表连接(通过主键和外键);3.         不存在渐变维度;4.         有冗余数据;5.         查询效率可能会比较高;6.         不用过多考虑正规化因素,设计维护较为简单1.         正规化;2.         数据冗余少;3.         有些数据需要连接才能获取,可能效率较低;4.         规范化操作较复杂,导致设计及后期维护复杂;2.2.2 TPCDS模型概述TPCDS模型模拟一个全国连锁的大型零售商的销售系统,其中含有三种销售渠道:store(实体店)、web(网店)、catalog(电话订购),每种渠道使用两张表分别模拟销售记录和退货记录,同时包含商品信息和促销信息的相关表结构。TPCDS采用雪花型数据模型,三种渠道的销售、退货表、及总体的存货清单作为事实表,其他商品相关信息、用户相关信息、时间信息等其他信息等都作为维度表,同时各表命名达到见名识义,详细如下表所示:事实表维度表Store Sales、Store ReturnsCatalog Sales、 Catalog   ReturnsWeb Sales、 Web   ReturnsInventoryStore、Call Center、Web_siteWarehouse 、Catalog_page、Web_pageCustomer、Customer_address、Customer_demographicsHousehold_demographics、Income_bandDate_dim、Time_dimItem、Promotion、Reason、Ship_mode上述维度表具体分为三类:1.         静态的:导入数据库以后,数据将永远保持不变,如date_dim、time_dim2.         历史相关的:即数据记录跟时间相关,每条记录只在对应的时间段内有效。比如:item(如一月份有商品1,二月份有商品2)3.         非历史相关的:即数据记录跟时间无关,不需要保留历史数据,比如:customer它包含几组模型关系图,详细如下:l  Store_sales 的ER图l  Store_returns 的ER图l  Catalog Sales 的ER图l  Catalog Returns 的ER图l  Web Sales 的ER图l  Web Returns的ER图l  Inventory的ER图Schema说明:1)        表、索引可以使用水平和垂直分区2)        除了基表,可以建立其他的辅助表结构(EADS),如索引、物化视图(只允许事实表与维度表间的主外键关系连接)。3)        可以使用主外键、NOT NULL约束2.3 TPCDS数据   TPCDS中,以SF定义数据量,如下图:具体对应的行数如下图:2.4 TPCDS语句   TPCDS所有99个Query,覆盖SQL99和2003的核心部分以及OLAP。下面我们从语法和语义两个角度进行分析。1.       语法l  语句特点,总结如下:SQL特征查询数量Correlated   subquery10Non-correlated   subquery34Group by81Order by89Rollup11Exists5Union18Intersect3Case29Substr9Having7Over15CTE28l  过滤条件主要用在维度表上,具体集中在如下几张表:date_dim(d_year/d_date/ d_qoy/d_dom)、item(i_category/i_current_price/i_manufact_id/i_class)、customer_address(ca_state/ca_zip/ca_gmt_offset/ca_city/ca_county)、customer_demographics(cd_gender/cd_marital_status/cd_education_status)、houshold_demographics(hd_vehicle_count/hd_buy_potential/hd_dep_count)、store(s_state);l  连接条件为表间的PK-FK关系上l  聚集运算主要集中在事实表上,例如:价格、数量等。2.       语义TPCDS中每个语句都回答一个商业问题,重点在于各种统计,可以分为从客户、商品两个维度进行,统计通常只针对某个具体的时间、具体的类别,进行环比、同比等各种分析,各语句语义参见附录。语句可以进行修改,但不能改变语义。2.5 TPCDS测试流程   TPC-DS 测试流程包括:1)        数据加载测试l  数据加载分为两种方式:a)使用生成完的数据进行导入;b)使用dsdgen边生成边导入。l  数据加载时间包括:测试基础表创建、数据加载、约束验证、辅助数据结构( 如索引) 创建、表和辅助数据统计分析等。l  Power测试之前,不应重启系统2)        查询顺序执行( Power)测试l  评测数据库对单个查询流的处理能力。3)        第一次查询并行执行测试l  用于测试DBMS对多个查询流并发查询和操作的处理能力,最小值为4(记为Sq)。例如,模拟20个用户同时进行操作,则同时启动20个session。l  每个session会是一个不同的语句执行顺序(由dsdgen可生成,该顺序是固定的)。l  每个session一次只运行一条语句。4)        第一次数据维护测试l  更新次数为并发测试中的并发数除以2,即Sq/2。例如,模拟20个用户同时操作,则其中10个用户会有更新操作。l  单次更新中的语句可以顺序或并发执行,更新语句只涉及事实表。l  更新数据由dedgen生成,更新的顺序与dsdgen生成保持顺序一致。l  第一步中创建的EADS,会随之进行更新维护。l  数据维护过程中需要有硬件故障注入。5)        第二次查询并行执行测试6)        第二次数据维护测试2.6 TPCDS度量方法   TPC-DS 基准定义了两个评价指标:1.         反映每秒的有效查询数据量的性能指标,其计算公式为:各个参数的含义如下:l  SF,即数据量l  Q= Sq * 99,Sq 指并发测试中并发的个数l  TPT=TPower*Sq ,TPower 指Power测试的总执行时间l  TTT= TTT1+TTT2 ,TTT1指并发第一次测试的总执行时间,TTT2指并发第二次测试的总执行时间l  TDM= TDM1+TDM2,TDM1指第一次数据维护的总执行时间,TDM2指第二次数据维护的总执行时间l  TLD=0.01*Sq*TLoad ,TLoad指数据加载时间l  上述的时间单位要精确到秒2.         反映每秒每查询数据量的性价比指标,值越小说明性价比越高,其计算公式为:其中 P 是测试总花费。3 测试指导   3.1 用例   根据上文TPCDS的具体分析,用于手工用例的指导原则如下:1.       选择的表应为上文中的某个具体的ER图中的全部或部分表,根据使用频率,选取最小集示例如下: 2.       分布键主要建在PK键上,分区键主要建在常用的过滤条件上,在常用的过滤条件和PK、FK上建立单列、多列索引3.       实际编写用例时,注意如下几点:l  表之间的连接条件,主要根据上图中的PK-FK关系建立连接l  过滤条件主要放在维度表l  聚集运算主要放在事实表l  窗口函数、OLAP函数的灵活使用l  条件结合函数使用(如字符串函数、类型转换函数、数学运算函数)l  表达式的灵活使用(与条件结合、与聚集运算结合)l  灵活运用子查询、相关子查询l  多处使用同样的临时结果集时,考虑使用CTE,即CTE通常在多处被引用l  集合运算主要用在同一类操作、不同的事实表上3.2 场景   集成测试、系统测试、专项测试等都可以利用TPCDS场景,或根据TPCDS场景构建新的测试场景,构建场景注意:1.         场景测试应包括创建、加载、查询、更新等整体流程,做到一键式测试。测试结果可分析、可重现。2.         查询语句,依据2.1中四类语句进行构建,查询语句包含简单、复杂语句,结果集有大有小,同时查询语句可选择串行、并发运行。3.         更新语句,更新与查询语句交替进行测试,更新以事实表为主,更新的并发度与查询的并发度对应。原文链接:https://bbs.huaweicloud.com/blogs/198087【推荐阅读】【最新活动汇总】DWS活动火热进行中,互动好礼送不停(持续更新中)  HOT  【博文汇总】GaussDB(DWS)博文汇总1,欢迎大家交流探讨~(持续更新中)【维护宝典汇总】GaussDB(DWS)维护宝典汇总贴1,欢迎大家交流探讨(持续更新中)【项目实践汇总】GaussDB(DWS)项目实践汇总贴,欢迎大家交流探讨(持续更新中)【DevRun直播汇总】GaussDB(DWS)黑科技直播汇总,欢迎大家交流学习(持续更新中)【培训视频汇总】GaussDB(DWS) 培训视频汇总,欢迎大家交流学习(持续更新中)扫码关注我哦,我在这里↓↓↓
  • [二次开发] 【大数据Spark2X】【编包运行程序】 提交到华为集群后运行失败,提示入口类找不到
    【功能模块】【操作步骤&问题现象】1、本地环境测试正常2、按照FusionInsight 产品文档上IDEA打包方式打包提交到yarn集群后运行失败,提示入口类找不到【截图信息】【日志信息】(可选,上传日志内容或者附件)
  • [获奖公告] 【已结束】【华为云·微话题48期】如何提升AI模型的可解释性
    【活动时间】3月15日~3月28日 【本期微话题】如何提升AI模型的可解释性 本期微话题由用户“千江有水千江月”提供,欢迎大家参与讨论,争当Talk King 【参与方式】1、      直接回复本帖,就微话题题目进行回答讨论2、      为置顶的优质回复楼层点赞或发表评论 【活动规则】1、      开发者用户回复的内容,必须与本期的微话题相关,回复其他内容均视为无效内容,取消该用户获奖资格2、      开发者用户回复内容的字数需≥30字,禁止复制其他楼层内容或改编自其它楼层内容(包括本人发布在其他楼层的内容),如经发现,取消该用户获奖资格3、      本次活动不限用户的总回复数及连续回复数,但需保证回复质量,如华为云社区工作人员认定参与用户有恶意刷楼嫌疑,则取消该用户获奖资格4、      评论置顶的优质回复楼层的内容在不违反华为云社区规则的前提下,需与该楼层内容相关即可5、      如开发者用户发布的内容经华为云社区工作人员认定为无效内容,取消该用户获奖资格 【评奖方式】1、      在本帖所有有效回复的用户中抽取若干名幸运开发者获得幸运回复奖。奖品及数量见下方活动奖励。2、      在所有参加回复的用户中,根据其回复条数和回复质量,综合评选出1位优秀奖,奖品见活动奖励。3、      被置顶的优质回复获得的点赞数+评论数+版主票(版主票数量+10,仅投给一人)综合排名第一的发布者,可额外获得“Talk King”奖励。如出现并列第一,则按发布时间顺序排名。未达到最低要求,则本期“Talk King”奖项轮空。奖品及附加条件请见下方活动奖励。4、      为被置顶的优质回复楼层点赞或评论的用户均可参加幸运参与奖的抽奖,奖品及数量见活动奖励。5、      本次活动将根据实际参与情况发放奖励,包括但不限于用户百分之百中奖或奖项轮空的情况。6、      每期活动预计于结束后三天内完成奖项公示,并于结束后15个工作日内完成邮寄。 【活动奖励】Talk King综合排名奖品点赞+评论数需达到第一名无线榨汁机20注:点赞+评论数不包含版主票 优秀奖华为mini蓝牙音箱 幸运回复奖奖品抽取数量有效回复楼层数需达到罗技键鼠套装150折叠帆布包120精装数据线4不限 幸运参与奖奖品抽取数量有效参与数需达到定制笔记本套装110盲盒/扑克/普通数据线随机一件4不限 【注意事项】1、为保证您顺利领取活动奖品,请您提前填写奖品收货信息。每期活动结束前如您没有填写,视为放弃奖励。您在微话题系列活动中,只需填写一次收获信息即可,我们将按照您最后一次填写的信息为准。【点击此处填写信息】2、本次活动幸运奖抽奖将采用巨公摇号平台(https://www.jugong.wang/random-portal/)进行抽取,话题质量相关奖项将由华为云社区工作人员进行评选,如您对评奖方式有异议,请勿参加本次活动。本活动最终解释权归华为云所有。3、其他事宜请参考【华为云社区常规活动规则】 【温馨提示】请务必使用个人账号参与活动(IAM、企业账号等账号参与无效)。所有获得华为电子产品奖项的获奖用户,请于获奖后3日内完成实名认证,否则视为放弃奖励。本次活动如一个实名认证对应多个账号,只有一个账号可领取奖励。本次活动一个实名认证账号只能对应一个收件人,如同一账号填写多个不同收件人或不同账号填写同一收件人,均不予发放奖励。
  • [技术干货] 【转载】隐私计算项目评估的“偏见”
    引用自“https://blog.csdn.net/hellompc/article/details/107088399”针对tics可信智能计算项目,可以参考下这块的一些理念。如何评估一个项目是不是值得投资,这件事情可能VC最有专业性,本文站在一线工作者的角度,阐述目前隐私计算项目的深浅。(有些东西,一定是老百姓口中说出来的可能更贴近现实)做硬件的拼技术荷兰ASML公司是全球最大的光刻机制造商,也是全球唯一可以提供EUV光刻机的厂商,在全球高端光刻机市场处于垄断地位。简单讲,硬件厂商如果要做成功,核心是技术和工艺,我们国家出现不了Intel、ARM、英伟达这样的企业,原因之一就是技术与工艺的落后。做软件,我觉得不太一样,软件的可复制性比较强。为了说明问题需要,我这里把软件重新作一个定义:包括数据、基础、业务系统、算法、人工智能等在硬件环境里面存储和运行的,我都把它暂且归类为”软件“。做软件的拼业务在这蓬勃发展的十年中,Cloudera和Paltantir始终是绕不开的两家公司,它们一直代表着大数据公司的两个方向:一个向左,聚焦大数据基础软件平台,一直没有过多行业属性,希望更多用户群体能够采用大数据基础软件;一个向右,自开始就聚焦在一两个行业之中,为行业用户打造从大数据基础软件到行业应用的全栈式解决方案,多年以来行业属性明显。(摘自:BigDataCoffee)。这两家公司,做大数据的同学应该都有所了解,码农可能对Cloudera更加熟悉一些,hadoop的基础服务企业之一;Paltantir则是一家将大数据技术深入应用于政府、金融、医疗、航空等领域的全栈式解决方案企业。时至如今,Cloudera的市值维持在37亿美元左右,正在考虑出售;Palantir计划于几周之内上市,目前估值达到了410亿美元。评估早期的隐私计算项目隐私计算一定属于软件项目(除非有国内的企业从0开始设计一个国人的TEE硬件可信环境)。早期的隐私计算项目,五花八门、品种繁多,参与者从大厂到名不见经传的小企业,如何去评估这些项目,我觉得有几点可以参考。1、看POC阶段POC一定是toB业务的重要指标,代表着可能性的市场份额。我来举个例子:如果隐私计算的最核心的客户是数据源和金融机构,那么国内数据源(大的一手数据源不超过100家,头部的比如三大运营商、银联体系、SDK设备厂商、征信数据、电商数据、社交媒体等)、金融机构(银行、保险、消费金融,这个方向的客户不超过200家)。VC在选择投资对象时,可以重点关注BP里面介绍当前阶段的POC数量,当然最好可以做一些客户背调,从POC阶段的客户得到对项目的反馈。比如半年内数据源POC有20家,金融机构客户有50家,至少在业内的认知是不错的。2、看业务穿透如果一家做隐私计算的公司一年下来只做了POC,没有实际的业务落地,基本上这家公司在后续的产能上是很疲软的。为什么如此说?做隐私计算的公司如果要看到增长,一定不是看它卖了多少套软件的软件设施费用,而是看这个解决方案解决的业务规模。这就是“安全即服务”的业务模式。结合业务与隐私计算解决方案,赋能数据源和甲方,具有这样的能力的项目团队,是值得加分的。业务必须穿透技术本身,隐私计算虽然很难,但是只要是软件,就会被聪明的程序员复制,时间问题。但是带着业务能力,就像在混凝土里植入钢筋,变的坚不可摧。我想举个例子,第四范式是一家发展很快的人工智能企业,从和他们创业初期聊的经历到今天的规模可以看到,第四范式的成功不是说他们的AI技术有多么超乎寻常的牛逼(当然已经算牛逼),更重要的是他们把AI和银行业务已经吃透了,他们的收入来自与将AI赋能银行,并给客户带来价值。因此,我想说,做AI的很多,给银行做赋能的不少,但是,第四范式很独特。因此,如果你看的隐私计算项目中,如果有一个running中的数据源和银行的风控建模评分项目,看看调用量,可能会成为下一个第四范式。尝试多和业务团队做背调,可以问的不能再细,如果这个团队是能carry业务的,那它一定能回答具体到哪个客户在3方数据建模的KS提高到多少、调用量多少、过程中出现过的问题。3、看团队深度早期项目,核心团队非常重要。一般都会有一两个大牛站台。但是如果只是看站台的人,那我觉得可能就眼瞎了。真正能做出一个商业化的隐私计算产品,我觉得除了看合伙人基本的核心团队,更需要看这个团队的其他四个关键要素:算法团队,团队需要有比较强的密码学专家、机器学习分布式算法专家,如果有GPU、芯片等更底层的算法应用专家,则团队能力加分;工程团队,团队需要有精通高并发、大数据的服务端架构师,需要有比较完整的企业级平台软件开发经验的工程技术团队;工程团队必须有交叉学科能力的架构师和程序员(隐私计算里面的重中之重是)方案团队,我把商务也算在这里,因为要在这个阶段把隐私计算软件卖出去,卖给银行、卖给运营商,不是简单的吃饭喝酒,需要有专业的解决方案能力,帮助客户如何将隐私计算结合实际业务需求,产生 1+1 大于2 的效果,这是将产品推向市场最重要的环节。交付团队,隐私计算软件不像一个office光盘或者oracle的数据库,如果客户采购了这套软件,我们交付过去的不仅仅是软件本身,更重要的是隐私计算的解决方案,从方案确定到方案落地的整个环节,都需要有专业的实施人员来服务好客户。算法、工程、方案、交付,这四个是我从实际经验中看到最关键的几个组成部分,换句话来说,如果一个早期的隐私计算项目,把钱都投入在一两个大牛身上,它还有钱投入到真正落地做强的其他几个花钱的地方吗?4、看生态布局如果把隐私计算技术比喻成寄主,那它要生存必须依赖宿主,这就是说做隐私计算的公司如果要做大做强,需要在布局上形成生态。某种意义上,耕耘于哪些行业应用,占领多少数据资源,为决定这个生态是不是可持续的。如果某天隐私计算的概念再放大3倍,成为二级市场比如同花顺的一个概念,那我再来写A股市场哪几家上市公司与这个概念真的有关系。5、看背书专利背书、专利不能100%证明一个项目技术有多牛逼,但是能成为佐证。目前比较有共识的是信通院的多方安全计算证书、多方安全计算标准、联邦学习标准等。如果能进入这些标准,再有十几项专利,至少可以说明在学术理论上,能排的上第一阵营。“安全即业务”是隐私计算的趋势“我们卖的不仅仅是隐私计算软件,我们卖的是隐私计算解决方案,这是有区别的!“安全即业务”,最大限度用隐私计算技术来修正数据业务的安全偏差,提高业务效能,这是行业刚需。隐私计算的创业公司,是选择走Cloudera路线,还是走Paltantir路线,我相信本身并没有对错,就从回报率来看,后者也许更加可复制。很幸运,隐私计算是国内发展快于国外,期待早日出现”隐私计算的Paltantir!”
  • [全栈开发者] (活动已结束)【大数据全栈成长计划】Spark学习篇·问答官排位赛活动帖
      活动时间:2020.3.8-2020.4.11 23:59  参与方式:用户在本帖里发布自己在学习大数据全栈学习中产生的疑惑或实践问题,其他用户可通过在楼层下评论参与回答。由专家经过评审,同一问题下确定一名最佳答案。提问者可获得10积分,被采纳的回答者可获得4积分。  参与规则:1. 同一ID不可自问自答;2. 同一ID可回复其他同一ID问题数量需≤2次,如,A最多可回答B的三个问题,但A可回答B、C、D、E、F等多人次问题。3. 每个人最多可发布2个有效问题,不可重复,不可灌水。4. 每个ID回答次数不设上限,但是否被采纳要依据专家评审后的结果。 全系列活动奖励 本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器,HUAWEI 无线耳机 等智能硬件,还有华为云定制机械键盘、背包等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 请务必按照上述要求提交内容,以免影响积分增加;3. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡4. 其他积分获取方式请查看活动主贴。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
  • [全栈开发者] (活动已结束)【大数据全栈成长计划】Spark学习篇 · 大数据技术文章征集帖
    为了巩固大家的学习成果,紧跟学习进度请将需要完成的大数据技术文章内容按要求回复到本帖下方按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~征集时间2020.3.8-2020.4.11 23:59征集要求1.本学习阶段任意时间内,在【华为云】-【博客】发表与大数据开发的任意博客内容,可以是开发技术技巧,可以是开发心得体会,不可以发布课程笔记作为博文,将文章链接回复至本帖内2.文章需为原创,在发布博客时,需要勾选文章创作类型:原创文章一项。用户承诺,发表的文章不存在任何知识产权问题并自行承担全部责任3.文章字数≥600字,图文并茂,不得抄袭网站课程,需写自己的理解和技术分享4.回复格式:华为云ID+博客文章链接5.如果曾在外部博客发表过的文章,可将文章迁移到华为云博客即可6.技术文章由华为技术专家评审,评审通过会对应的积分,不过专家会给出对应的评语且积分为0奖励方式每阶段每篇有效博客文章可获得10积分,每阶段获取上限20分,每阶段评选1篇最佳博文,奖励定制机械键盘~ 全系列活动奖励本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器等智能硬件,还有华为云定制机械键盘、背包等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 本次活动通过完成客观题打卡任务,可获得的积分上限为5分/每篇;3. 请务必按照上述要求提交内容,以免影响积分增加;4. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡5. 其他积分获取方式请查看活动社群公告。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
  • [全栈开发者] (活动已结束)【大数据全栈成长计划】Spark学习篇 · 每周学习笔记征集帖
    了巩固大家的学习成果,紧跟学习进度请将需要完成的每周学习笔记按要求回复到本帖下方按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~每周打卡一次即可,多发无效征集时间2020.3.8-2020.4.11 23:59征集要求在本帖中,回复自己本周课程内容的学习笔记回复格式:华为云ID+笔记内容(字数≥200字)奖励方式每章有效学习打卡可获得2积分每周在本周内提交随堂测试的用户中,抽取1名幸运奖励华为云定制鼠标*1全系列活动奖励本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器等智能硬件,还有华为云定制机械键盘、背包等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 本次活动通过完成客观题打卡任务,可获得的积分上限为5分/每篇;3. 请务必按照上述要求提交内容,以免影响积分增加;4. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡5. 其他积分获取方式请查看活动社群公告。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
  • [全栈开发者] (活动已结束)【大数据全栈成长计划】Spark学习篇 · 每章随堂测验打卡帖
    让大家巩固学习成果,紧跟学习进度请将需要完成的每章随堂测验按要求回复到本帖下方按要求格式回复即可获得积分累计阶段奖品,还能有机会获得附加幸运奖哦~征集时间2020.3.8-2020.4.11 23:59征集要求在本帖中,回复自己本章随堂测验内容打卡要求在本帖中,回复对应章节的随堂测验并提交截图 ↓章节作业位置:打卡回复格式:华为云ID+课程完成截图,如图所示↓↓↓华为云ID:grandmaster每人有两次提交机会没有作业的章节提交学习进度即可奖励方式每章有效学习打卡可获得2积分每周在本周内提交随堂测试的用户中,抽取1名幸运奖励华为云定制鼠标*1全系列活动奖励本次活动不仅免费跟大牛学习技术,更有积分大礼等着大家~每次有效提交的学习任务都会得到对应积分,累计积分最高者即可获得路由器等智能硬件,还有华为云定制机械键盘、背包等你拿!*活动奖品颜色、型号随机,且部分奖品数量有限发完即止,,若有缺货或其他情况将替换为同价值的其他奖品邀请好友有礼邀请好友参与【大数据全栈成长计划】活动即有机会赢取华为5G手机,华为手环,华为无线耳机和华为移动电源了解邀请活动详情请点击这里活动注意事项1. 学习任务提交后,小助手会在本阶段学习周期内,按序完成审核,并增加活动积分;2. 本次活动通过完成客观题打卡任务,可获得的积分上限为2分/每章节;3. 请务必按照上述要求提交内容,以免影响积分增加;4. 若积分值相同则以完成学习任务的时间先后排序,其中任务完成时间的判定优先级为:结业考核>问答官排位赛>每章随堂测试打卡5. 其他积分获取方式请查看活动社群公告。想了解更多关于全栈成长计划课程内容请移步主帖:https://bbs.huaweicloud.com/forum/forum.php?mod=viewthread&tid=90396&page=1
总条数:1416 到第
上滑加载中