-
本帖最后由 DevCloud 于 2018-6-19 15:26 编辑本活动参加华为云社区全云总动员盛夏狂欢趴,携云女郎火热来袭,详情请戳 华为云社区全云总动员 17007 21天精品课程强势推出,众多华为专家倾情加盟,学习前沿技术,享受多重好礼! 15884 什么是21天转型大数据?华为云DevCloud作为一站式云端DevOps平台,集成华为近30年研发实践和前沿理念,面向开发者提供研发工具服务,让软件开发简单高效。MapReduce服务(MRS)提供租户完全可控的企业级大数据集群云服务,轻松运行Hadoop、Spark、HBase、Kafka、Storm等大数据组件。借鉴21天形成习惯的理念,DevCloud联合MapReduce服务推出”21天转型大数据实战营“活动,发布21天精品课程,引导用户学习前沿的大数据知识并动手实践,助力玩转大数据。活动规则:1. 活动时间:2018年6月5日至2018年7月16日;课程时间:2018年6月26日至2018年7月16日;2. 活动流程:1) 注册华为云账号并登录;2) 扫描二维码,添加群助手微信,回复“大数据”,即可报名实战营;15885 3) 微信社群助手每日发布当日课程内容及规则,学员完成任务并打卡成功,获得阶段性奖励;3. 打卡规则:1) 打卡时间:每日10:00~22:00;2) 打卡方式:每日完成课程后,按要求上传一张截图作为打卡日记,即可完成打卡;3) 打卡须知:①打卡截图需按要求截图,社群助手将会每日提供打卡示例;②打卡截图中需显示华为云账号,且必须为当日操作截图;③采用闯关打卡模式,每日只计算一次有效打卡;④若当日未进行打卡,后续不可补打卡;⑤社群助手将对每日的打卡内容进行审核,审核周期为3~5个工作日,未按照要求上传截图的打卡,将被视为无效打卡,不计入打卡天数;4. 评奖方式:在规定小程序内完成打卡,点亮徽章,转发至朋友圈,将截图回复至微信社群,可获得抽奖机会,仅在规定统计日期有效,过期判定为无效。1) 完成第一天打卡完成第一天打卡任务即可获得500元MRS代金券,开营第2天号召完成第一天打卡任务的用户将第一天的打卡日记截图发到群内,社群助手将线上发放代金券,用户线上领取即可;15886 2) 连续打卡3天开营第4天号召点亮“坚持打卡3天”徽章的用户将成就卡转发朋友圈,转发后将朋友圈截图发回群内,可获得抽奖机会,奖品为定制电动小风扇一个,截图过期无效;15887 3) 连续打卡7天开营第8天号召点亮“坚持打卡7天”徽章的用户将成就卡转发朋友圈,转发后将朋友圈截图发回群内,可获得抽奖机会,奖品为定制超大鼠标垫一个,截图过期无效;15888 4) 连续打卡14天开营第15天号召点亮“坚持打卡14天”徽章的用户将成就卡转发朋友圈,转发后将朋友圈截图发回群内,可获得抽奖机会,奖品为大数据专业书籍一本,截图过期无效;15889 5) 连续打卡21天开营第22天号召点亮“坚持打卡21天”徽章的用户将成就卡转发朋友圈,转发后将朋友圈截图发回群内,可获得抽奖机会,奖品为机械键盘一个,截图过期无效;15890 5. 奖品发放说明:获奖用户在领奖界面填写邮寄信息,活动结束后奖品将统一发放,所有奖品均包邮,不额外收取任何费用。 这是大数据的时代,还等什么,速来加入我们吧!
-
随着企业的数据越来越多,越来越多的企业选择使用Spark/Hive等技术来进行分析,由于数据量大,处理任务繁重,资源的消耗比较高,因此使用成本也是比较高。MRS在和客户的交流中,识别到并不是每个企业在每时每刻在进行分析,而一般是在一天的一个时间段内进行分析汇总,因此MRS提供了弹性伸缩能力,可以自动在业务在繁忙时申请额外资源,业务不繁忙时释放闲置资源,让用户按需使用,尽可能的帮助客户降低使用成本,聚焦核心业务。 [*]降低使用成本: 部分企业在进行批量分析时,并不是时时刻刻都在进行分析,例如一般都存在数据持续接入,而到了特定时间段(例如凌晨3点)进行批量分析,可能仅需要消耗2小时。MRS提供的弹性伸缩能力,可以帮助客户,在晚上的时候,将分析节点扩容到指定规模,而计算完毕后,则自动释放计算节点,尽可能的降低使用成本。 14880 XX行每日处理1T增量数据分析成本 [*]平衡突发查询: 大数据集群上,由于有大量的数据,企业会经常面临临时的分析任务,例如政府的临时审计要求、支撑企业决策的临时数据报表、突发热点事件等,都会导致对于资源的消耗在极短时间内剧增。MRS提供的弹性伸缩能力,可以让突发大数据分析时,可以及时的补充计算节点,避免因为计算能力不足,导致业务宕机,使用户无需购买额外资源,当突发事件结束后,MRS会自动判断缩容时机,自动完成缩容。下图展示的是使用非弹性伸缩集群20节点和使用弹性伸缩集群,从10节点,当业务突增时弹性到20节点时的性能影响。14881 XX行使用弹性伸缩特性,面对业务突发场景的性能影响 [*]聚焦核心业务: 大数据作为二次开发平台,要开发人员判断具体的资源消耗,还是比较困难的,因为查询分析的条件复杂性(例如全局排序,过滤,合并等)以及数据的复杂性,例如增量数据的不确定性等,都会导致预估多少计算量是非常困难的行为,而使用弹性伸缩能力,可以让业务人员专注于业务开发,无需分心再做各种资源评估。 MRS作为大数据软件开发平台,专注于将业界最通用的大数据开源产品提供给客户使用,开源,开放,让客户最方便使用大数据完成核心业务的开发。
-
本帖最后由 Broaddata 于 2018-4-27 11:43 编辑14599 一、 产品介绍 上海宽数倾力打造的企业大数据智能平台EDI (Enterprise Data Intelligence),以建设企业数据PaaS层为切入点, 帮助企业/机构快速构建新一代数据仓库和基于其上的数据产品,帮忙企业在DT时代快速数字化转型,实现数据智能,对接人工智能。EDI平台基于目前业界领先的大数据技术和理念,融合结构化、非结构化数据,实现了统一的数据架构(Unified Data Architecture)。通过部署EDI,快速的让企业/机构拥有大数据处理的能力,帮助用户在单一平台下,实现对海量数据、全类型数据、外部数据的存储归档、 搜索访问、计算加工、价值挖掘、安全控制、以及数据资产全生命周期管理。 14600 二、 产品功能及特点 上海宽数的大数据智能平台EDI通过把: 现代化的数据基础设施, 所有数据之间的关联融合, 企业对数据加工、服务的需求, 进行统一的封装,构建一个企业大数据集成和管理的PaaS平台,减少用户对于数据技术的直接使用。 数据底层 通过丰富的数据适配器,采用配置式的、自由组合的方式,适配各类现代化数据基础设施。通过统一的数据采集配置,统一调用数据基础设施,融合关联所有数据。 数据应用层 通过统一的数据API,向数据应用提供透明访问的数据服务,保证数据安全的同时,减少使用数据技术的复杂性。 数据PaaS层 剥离数据源和数据应用的复杂性,构建强大的数据管理中台,提供数据管理的各种工具。在数据管理中台,实现一体化的数据架构,在统一管理界面下,实现对海量异构数据的数据治理、存储归档、信息组织、搜索访问、安全控制、分析可视化、以及数据挖掘等。 EDI平台在架构体系层面具有一下一些特点及优势。 高可扩展设计 基于PC服务器的简单快速部署的,无需购买昂贵的传统数据仓库软件和硬件。分布式计算和存储架构,增加服务器即可获得系统性能的线性增长。 高可适应设计 适用小数据量到海量大数据项目,部署可以从3台物理机开始到超大集群,项目启动快。可以根据用户的数据量级和不同的数据类型,选择适合的基础设施,如:海量价值密度低的RFID数据可以选择Hadoop作为数据仓库,而高价值密度的业务数据可以选择GreenPlum作为数据仓库等。 统一数据架构UDA 融合了结构化和非结构化数据的管理,实现了统一数据架构UDA(Unified Data Architecture),结构化数据和非结构化数据在一个统一的数据模型-数据对象(Dataobject)下管理。 数据高可用性和丰富API 实现全数据的全文检索,同时支持基于SQL的数据查询分析。提供丰富的数据服务API,包括元数据服务,数据搜索服务,数据聚合服务,数据任务调度等。外部数据应用要使用和共享数据,可以调用已经注册的API服务。 统一元数据管理和全面数据治理 提供统一的元数据管理工具,全面管理数据各类信息,包括类型,位置和访问信息,数据格式,数据血缘等。提供全面数据治理功能,实现数据的标准化,编码的标准化和映射,数据质量检查等。 统一数据加工框架 提供了一个统一的数据加工的框架,实现了任务调度,任务执行,运行结果显示等。目前支持以下任务: 数据批处理任务,指标计算,标签计算,关系发现,音视频文件语音识别等。 数据安全 支持灵活的用户权限管理配置,通过用户、组、角色进行多方位的用户权限管理。提供统一的数据安全模型,对所有数据的访问提供灵活定义的访问控制。记录所有关于数据访问的安全审计信息,以满足未来数据安全审计的要求。 三、 产品应用于哪些行业 EDI平台应用于各行各业进行数字化转型,包括公安、政府、教育、制造、电商等。可应用的邻域包括: 大数据管理平台 大数据采集工具 大数据处理工具 大数据分析建模 大数据业务咨询 政务网应用 业务基础及应用开发 人工智能应用开发 四、 产品能够解决什么问题 EDI平台帮助企业在DT时代迅速拥有数据能力,快速实现数字化转型: 海量业务数据分析: 更快的SQL查询、数据批处理 和 BI 报表 全类型数据全文检索: 类似“企业百度”,快速搜索企业全量,全类型数据 全面数据治理: 元数据管理,数据标准,数据质量,数据资产清单等 统一数据加工:数据清洗,指标/标签计算,关系发现,音视频文件/文本分析等 数据挖掘:预测,分类,关联分析,深度学习,挖掘数据价值等 数据API:给业务系统,BI系统,AI系统提供API服务,实现企业内数据共享 数据产品: 基于平台快速构建新的数据产品,如360度数据画像(客户,员工,设备等),推荐系统,… 14597
-
14010 【下午茶时光——业界热点陪你喝咖啡】 云计算时代下的存储该何去何从? 天下大势,合久必分,分久必合。纵观整个存储发展史,数据中心的存储方案也大致经历了合-分-合3个阶段。 14011 从IBM在1956年推出世界上第一台真正意义上的机械硬盘,到上世纪70年代,存储与服务器是融于一体的。直到DAS的出现,存储与服务器开始逐渐脱离,此后存储功能更加专业化,职责更加细化。随着网络技术的发展及数据集中管理需求的增长,80年代存储局域网络(SAN)应势而生。90年代则因数据类型的改变,出现了适合非结构化大容量数据的NAS产品。而今云计算时代,存储与服务器分化的趋势再度发生了转变。X86架构计算性能的崛起以及网络带宽的进一步发展,计算及网络资源过剩,一系列机遇下催生了基于X86服务器的SDS软件定义存储。其开放、易扩展、性价比高等特点以及对云架构天生的友好,使这类存储迅速在云计算市场兴起并扩散。存储与服务器再度有了融合的趋势。然而目前为止,国内数据中心的存储大部分依然是传统集中式的SAN存储以及NAS存储,其虽有着成熟、稳定、专业的优势,但由于其封闭、异构、昂贵的特点,已满足不了现今越来越多用户的需求。但我们清楚地知道,其短时间内又不可能被全部替代。 我们已知新兴存储技术爆发性增长、存储与计算融合化已成主流趋势、可存储层面传统需求仍大量遗留,用户数据中心成为了一个存储大杂烩。如何将存储规范化、标准化,并统一起来? 技术快速革新,存储行业如何平衡用户需求与行业发展?传统存储到新型存储是时候转型了,但用户面临的阵痛如何最大限度的避免?基于用户存储面临的现状,我们可以进行一波未来存储发展趋势性分析。目前来看云计算时代下的存储已表现出了3大趋势: 融合化 存储与服务器又将趋于“合”之大势,怎么“合”,“合”成什么样,就是我们需要考虑的问题。首先,存储会与x86服务器融合,我们称为“纵向融合”。纵向融合最具代表性的产品形态就是最近大火的超融合架构。超融合将分布式存储、网络、虚拟化等一切数据中心必备资源装入一台标准的x86服务器中,省去了一系列繁复的设备,数据中心逻辑结构也因超融合的引入而精炼清晰了许多。解决了存储与服务器的问题,还应该解决存储与存储之间的问题,即存储与存储之间的融合化管理、监控、使用,我们称之为“横向融合”。 横向融合的一个典型例子就是IBM早些年推出的SVC产品——存储虚拟化网关。SVC可以通过网络接管不同存储的逻辑卷,这些原本要直接映射给服务器的逻辑卷被SVC统一纳入,形成存储池,然后虚拟化后的逻辑卷再统一分发给服务器。这种方式解决了存储之间的孤井问题,弥补了存储与存储之间的功能差异,但同时也带来一个问题,就是单点故障——所有数据IO都通过SVC单一节点流动,如果SVC发生宕机,则会影响所有接入的存储。所以一般在SVC方案中,双活架构居多,主要就是为了解决数据安全性问题。 标准化 云计算数据中心早已脱离了以设备为核心的运营思路。服务器、网络等资源由于虚拟化技术的发展,使用方式和管理方式有了极大变化,已由面向设备改变为面向业务。用户不再关心底层的设备信息,而是更多的去思考如何业务创新以及创造价值。但数据中心存储层却在这样的趋势下依然处于传统运维模式。前面提到,目前大多用户拥有着很多的传统集中式存储,由于各存储厂商之间技术封锁,其存储设备之间互不兼容,正是这样的存储设备不规范性,导致了不同厂商甚至同一厂商不同型号存储之间的异构化需逐台设备各自管理、监控,这对业务运行产生了极大的不便。用户亟需一个能够使存储像服务器、网络资源一样可以实现智能化调度的技术或标准,从而告别零散的存储现状。而存储的标准化就成为了业务创新的前提,否则在巨大的开发成本和对接成本下,任何存储业务自动化及智能化的尝试都会成为幻想。可惜目前并没有厂商意识到这一点并提出有效的解决方案。 开放化 我们知道,云计算的理念就是以“服务”为核心,最终达到一切IT资源都是服务的效果。而最近IT界又出现了一个时髦词汇——API经济。API经济将“服务”的概念进一步扩大了,不仅是IT资源,甚至产品能力、企业价值也能够以服务的形式向外界输送。API经济作为将来商业模式的发展方向之一已初具苗头。API的开放使各厂商不同平台之间可以进行深度的合作和联动,从而形成了跨厂商甚至跨行业的价值共享。越来越细化的存储领域也有这样的趋势特点,只不过范围缩小到了数据中心内部。API经济是跨厂商甚至跨行业的合作,数据中心内部也需要不同资源层次、不同业务部门之间的合作,我们称之为“存储的开放化”。在这种场景下,存储不再只是服务器后端挂载的附属设备,不是通过一个预先设定的方式,仅仅对外提供数据空间。而是应该成为一种独立的存储服务,能提供多样化的价值。而存储由设备转化为服务这一过程,则需要前端应用的补充与配合。这就要求未来的存储能以更开放的姿态与各类应用对接,至少各类管理API或控制接口是开放的,可以交由用户灵活定义。现代存储技术自出现起到现在,经历了近一个世纪的发展,其发展史就是整个IT应用的发展史。存储的形态也随着不同时代业务模式的变化而不断变化。虽然业界传统存储依然存在着一系列问题,但可喜的是,随着技术的飞速发展,用户也正在以更开放包容的胸怀去接纳新的产品、新的架构。这样就给传统存储的持续创新提供了良好的外部条件。我们也期待着能有更多可以改变规则,甚至创造规则的存储新物种出现。 来源: CIO时代网
-
00后加入求职大军 95后求职者人数剧增 每年的三四月份都是一年中求职招聘的黄金时期。据重庆晨报报道,近日,汇博网发布了2018重庆第一季度人才供需分析报告。 报告显示,从求职者的学历方面来看,越来越多的本科、硕士求职者也加入了求职大军。从求职者学历构成来看,第一季度求职者学历水平大幅度提升,本科、硕士涨幅分别约达到14.33%、18.08%,极大地改变了以往大专学历是求职主体的状况。 从求职者年龄层段来看,虽90后求职者依旧为求职主体,但其涨幅不是很明显,涨幅最大的是95后,达到了78.34%,求职人数超4万人。 汇博网人力资源专家李春杰分析,虽然90后依旧是人才市场中的求职主体,但随着求职者人数越来越趋于稳定,竞争指数不再持续上涨,而95后求职者纷纷毕业步入社会,该年龄层段的求职人数持续地不断上涨,逐渐成为了就业市场的新兴力量,导致95后成为了不少岗位竞争指数越来越大的原因之一。 值得一提的是,2018年开始之后,不少00后相继成年,开始加入求职的大军行列。 哪些领域最缺人?你学相关专业吗? 百万年薪“砸”向新经济领域 据《经济参考报》报道,“与人工智能、区块链、大数据相关的技术研发人员,包括算法工程师、高级数据分析员、架构工程师等岗位目前薪酬普遍都在百万左右。”长期研究人力资源市场的瑞元投资咨询公司高级合伙人白睿向记者透露,某区块链公司员工规模为200人,其中60多人薪资达到百万级别。 据腾讯研究院发布的《2017全球人工智能人才白皮书》则显示,人工智能岗位平均招聘薪资远高于一般技术类岗位。此外,几乎50%人工智能岗位的职位描述上会提到为员工提供股票期权。 “机器人工程”专业成热门 10年前,如果说人们已经进入人工智能时代的话,很多人会觉得有些牵强附会;然而,就在过去的几年时间里,人工智能技术带着众多人工智能产品,已经走进了千家万户,人们确实正在进入人工智能时代。 据《 人民日报海外版 》报道,教育部国际合作与交流司司长许涛表示,当前,中国人工智能发展迅猛,中国政府也高度重视人工智能领域的发展。预计到2020年,中国人工智能产业规模将超过1500亿元,带动相关产业规模超过1万亿元,如此快速的增长和发展必然会产生大量的人才需求。 据数据显示,中国人工智能人才缺口已超过500万。 教育部近日公布的2017年度普通高等学校本科专业备案和审批结果显示,最“热门”的专业均与信息技术相关。其中,250所高校新增了“数据科学与大数据技术”专业,60所高校新增了“机器人工程”专业。在新增审批本科专业中,也有18所高校新增了“网络空间安全”专业,16所高校新增了“信息安全”专业。 除了传统的学院教育,中国人工智能人才的培养渠道也日渐丰富。日前,由教育部、创新工场人工智能工程院、北京大学联合主办的人工智能人才国际培养计划,是中国首个高校人工智能人才国际培养计划,其目标是探索实践适合中国高等人工智能人才培养的教学内容和教学方法,培养中国人工智能产业的应用型人才。 许涛透露,教育部将进一步完善中国高校人工智能学科体系,正在研究设立人工智能专业,推动人工智能一级学科建设。据介绍,教育部正在研究制定《高等学校引领人工智能创新行动计划》,通过科教融合、学科交叉,进一步提升高校人工智能科技创新能力和人才培养能力。 最热门:250所高校盯上大数据 (阿里·张北·大数据中心) 数据科学与大数据技术专业,共有250所高校设置,包括中国人民大学、北京师范大学、厦门大学等21所教育部直属高校;河南省共有21所高校新增该专业,在各省份中数量最多,河北、山东、安徽、广东、江苏等省也有较多高校成功获批。 自2013年以来,教育部每年年初都会公布上一年度本科专业备案和审批结果。回溯历史可发现,数据科学与大数据技术是在最近两三年才“蹿红”的,2015年度的审批结果中,北京大学、对外经济贸易大学、中南大学就成为首批获批设立该专业的高校;2016年度,又有32所高校设立该专业;到了2017年度,获批设立这一专业的高校数量达到250所,比上年增加218所。 该专业的急剧升温与国家大力支持大数据行业发展的背景密切相关。早在2015年8月,国务院就发布《关于印发促进大数据发展行动纲要的通知》,鼓励高校设立数据科学和数据工程相关专业,重点培养专业化数据工程师等大数据专业人才。 众多高校也意识到,大数据技术已成为引导社会变革的新兴力量。2016年,北京大学在全国率先开设数据科学与大数据技术专业。2016年5月,人民大学宣布新增3个本科专业,其中之一就是数据科学与大数据技术,该专业的目标是培养既掌握统计分析、计算技术和计算机技术专业知识,又熟悉应用领域的全面型数据科学复合型人才,以满足国家对数据科学人才的迫切需求。 培养大数据相关人才,并非局限于这一个专业。教育部透露,截至2016年9月,我国已开设的与大数据相关的本科专业主要包括数据科学与大数据技术、信息与计算科学、统计学、应用统计学、计算机科学与技术、软件工程、信息管理与信息系统7种,共布点2638个。 在研究生教育方面,西南财经大学等多所高校设置了与大数据相关的二级学科和交叉学科,培养研究生。2014年,中国人民大学等五所大学还宣布联合培养大数据分析硕士。 最看涨:机器人工程开设校增59倍 (2017年柯洁与谷歌AlphaGo围棋大战) 全球瞩目的人机围棋大战,让人类见识了人工智能机器人的厉害。最近几年,“机器人工程”也成为方兴未艾的火爆专业,2016年全国仅东南大学开设这一专业,去年增至24所,今年则增至60所,相当于三年间增加了59倍。开设院校以理工科院校为主,包括北京航空航天大学、北京工业大学、天津理工大学、成都信息工程大学等。值得一提的是,本次江苏省属高校中设置这一专业的院校最多,包括南京信息工程大学、淮阴工学院、南通大学等8所学校。 在人口红利逐渐消失的大背景下,我国试图大力发展智能机器人,以促进装备制造业转型升级。2013年,工信部曾发布《关于推进工业机器人产业发展的指导意见》,其中指出,培育3到5家具有国际竞争力的龙头企业和8到10个配套产业集群,在机器人密度方面,每万名员工使用机器人台数要达到100以上。 国务院2015年8月公布的《中国制造2025》提出,要发展高档数控机床和机器人等十大重点领域。 此前,我国开设机器人相关专业的院校以职业院校为主,学生主要是学习简单的编程、系统软件操作、机器人调试等基本技术,有专家指出,这样的学生并不能满足人工智能领域的需求。而大学里也有机器人相关的专业,但多依托于机械、自动化、精密仪器、电气工程、计算机等专业,并未自成一家。正是在这种背景下,2016年,东南大学成立全国首个机器人工程本科专业,当年招生名额30人左右,放在自动化大类下录取,该专业旨在培养以机器人为核心的自动化生产线、成套设备设计、研发和应用的系统工程师。 不得不提的是,“机器人工程”专业的走红,离不开如火如荼的人工智能行业。2017年7月,国务院发布《新一代人工智能发展规划》,这是我国首部国家层面的人工智能发展规划。规划宣布将举全国之力在2030年抢占人工智能全球制高点,将加快培养聚集人工智能高端人才。 自去年以来,中国科学院大学、中山大学、上海交通大学、南京大学等纷纷成立人工智能相关的学院。去年12月底,清华大学同时推出脑与智能实验室、未来实验室两大实验室,也发力研究人工智能。 互联网行业人才紧缺 区块链火了 BOSS直聘研究院发布的《2018求职旺季人才趋势报告》显示,从2018年求职旺季全行业的人才供需情况来看,矿产地质、房地产开发、广播影视和传统银行业是人才较为饱和的行业,新开放的职位需求均较大比例少于求职者人数。 互联网行业再次成为人才最紧缺行业,其中在线教育、互联网金融和企业服务三个细分领域人才稀缺程度最高。 在最为紧缺的TOP10岗位中,大数据、人工智能、算法类岗位占据半壁江山。 数据显示,各产业间平均薪资水平的分化进一步加剧,排名第一的互联网行业,平均薪酬是排名末尾的食品/饮料行业的1.79倍。 进入2018年,区块链一夜之间成为一大风口。 BOSS直聘研究院数据显示,区块链相关岗位的招聘需求自2017年下半年开始快速增长,2017年11月进入第一个明显爆发点。 2018年前两个月,区块链相关人才的招聘需求已经达到2017年同期的9.7倍。1-2月,发布区块链相关岗位的公司数量同比增长4.6倍。截至2月底,区块链相关岗位占到互联网行业总体岗位量的0.41% ,AI相关岗位占比0.91%。 目前,区块链相关岗位的发布地区分布高度集中,北上杭深占比超8成。 2018年求职旺季,超过600家公司在招纳区块链相关人才。按细分领域划分,属于互联网金融、计算机软件、企业服务三个领域的公司数量最多,三者总占比超过50%。 超过80%的相关职位对求职者的技能要求在3项及以上,技术类人才除了需掌握常用开发语言外(C++,Java,Go),还需要对密码学、共识算法、超级账本、智能合约等有足够了解。 新一线城市发力“抢人” 北京平均招聘薪酬排第一 据《 人民日报海外版 》报道,西安、南京、武汉等20多个城市却接连出台一系列人才引进政策,送房、送钱、送户口,政策力度之大前所未有。 来源:《 人民日报海外版 》 智联招聘发布的《2018年春季中国雇主需求与白领人才供给报告》数据显示,新一线城市就业市场火爆,其中,成都最受求职者追捧,竞争指数位列新一线城市榜首。 但北京仍然是人才吸引的头部区域。 数据显示,2018年第一季度,北京平均招聘薪酬为10197元,排名第一。上海、深圳分别以9621元、9134元位列第二和第三。
-
2018年年3月30日,上海宽数EDF产品正式入驻华为云市场,在华为云市场发布了数据智能产品,能够提供大数据集成、数据治理、数据管理、数据检索、数据敏捷分析等数据智能的能力,帮助企业和用户快速便捷解决构建新一代企业级数据仓库难的问题。这款产品有哪些功能,又如何使用呢?一起来了解一下。一、产品介绍上海宽数倾力打造的企业大数据智能平台EDI (Enterprise Data Intelligence),以建设企业数据PaaS层为切入点, 帮助企业/机构快速构建新一代数据仓库和基于其上的数据产品,帮忙企业在DT时代快速数字化转型,实现数据智能,对接人工智能。EDI平台基于目前业界领先的大数据技术和理念,融合结构化、非结构化数据,实现了统一的数据架构(Unified Data Architecture)。通过部署EDI,快速的让企业/机构拥有大数据处理的能力,帮助用户在单一平台下,实现对海量数据、全类型数据、外部数据的存储归档、搜索访问、计算加工、价值挖掘、安全控制、以及数据资产全生命周期管理。二、产品功能及特点上海宽数的大数据智能平台EDI通过把:现代化的数据基础设施,所有数据之间的关联融合,企业对数据加工、服务的需求,进行统一的封装,构建一个企业大数据集成和管理的PaaS平台,减少用户对于数据技术的直接使用。 数据底层通过丰富的数据适配器,采用配置式的、自由组合的方式,适配各类现代化数据基础设施。通过统一的数据采集配置,统一调用数据基础设施,融合关联所有数据。 数据应用层通过统一的数据API,向数据应用提供透明访问的数据服务,保证数据安全的同时,减少使用数据技术的复杂性。 数据PaaS层剥离数据源和数据应用的复杂性,构建强大的数据管理中台,提供数据管理的各种工具。在数据管理中台,实现一体化的数据架构,在统一管理界面下,实现对海量异构数据的数据治理、存储归档、信息组织、搜索访问、安全控制、分析可视化、以及数据挖掘等。EDI平台在架构体系层面具有一下一些特点及优势。 高可扩展设计基于PC服务器的简单快速部署的,无需购买昂贵的传统数据仓库软件和硬件。分布式计算和存储架构,增加服务器即可获得系统性能的线性增长。 高可适应设计适用小数据量到海量大数据项目,部署可以从3台物理机开始到超大集群,项目启动快。可以根据用户的数据量级和不同的数据类型,选择适合的基础设施,如:海量价值密度低的RFID数据可以选择Hadoop作为数据仓库,而高价值密度的业务数据可以选择GreenPlum作为数据仓库等。 统一数据架构UDA融合了结构化和非结构化数据的管理,实现了统一数据架构UDA(Unified DataArchitecture),结构化数据和非结构化数据在一个统一的数据模型-数据对象(Dataobject)下管理。数据高可用性和丰富API实现全数据的全文检索,同时支持基于SQL的数据查询分析。提供丰富的数据服务API,包括元数据服务,数据搜索服务,数据聚合服务,数据任务调度等。外部数据应用要使用和共享数据,可以调用已经注册的API服务。 统一元数据管理和全面数据治理提供统一的元数据管理工具,全面管理数据各类信息,包括类型,位置和访问信息,数据格式,数据血缘等。提供全面数据治理功能,实现数据的标准化,编码的标准化和映射,数据质量检查等。 统一数据加工框架提供了一个统一的数据加工的框架,实现了任务调度,任务执行,运行结果显示等。目前支持以下任务: 数据批处理任务,指标计算,标签计算,关系发现,音视频文件语音识别等。 数据安全支持灵活的用户权限管理配置,通过用户、组、角色进行多方位的用户权限管理。提供统一的数据安全模型,对所有数据的访问提供灵活定义的访问控制。记录所有关于数据访问的安全审计信息,以满足未来数据安全审计的要求。三、产品应用于哪些行业EDI平台应用于各行各业进行数字化转型,包括公安、政府、教育、制造、电商等。可应用的邻域包括: 大数据管理平台 大数据采集工具 大数据处理工具 大数据分析建模 大数据业务咨询 政务网应用 业务基础及应用开发 人工智能应用开发四、产品能够解决什么问题EDI平台帮助企业在DT时代迅速拥有数据能力,快速实现数字化转型: 海量业务数据分析:更快的SQL查询、数据批处理 和 BI 报表 全类型数据全文检索:类似“企业百度”,快速搜索企业全量,全类型数据 全面数据治理: 元数据管理,数据标准,数据质量,数据资产清单等 统一数据加工:数据清洗,指标/标签计算,关系发现,音视频文件/文本分析等 数据挖掘:预测,分类,关联分析,深度学习,挖掘数据价值等 数据API:给业务系统,BI系统,AI系统提供API服务,实现企业内数据共享 数据产品: 基于平台快速构建新的数据产品,如360度数据画像(客户,员工,设备等),推荐系统
-
13527 【下午茶时光——云存储知识点陪你喝咖啡】 主存储优化仍将克服的一系列挑战 如今,企业积极采用不同的产品、技术和工具来优化主存储,以克服数据存储的挑战,并提高网络存储部署的效率。 用于存储应用程序和活跃数据的主存储是数据中心的重要设备,并成为了日常业务流程。然而,企业在维护其联网的主存储部署时面临许多挑战。 根据行业媒体TechTarget Research的调查,在受访者中,有29%的人认为缺乏足够的容量是主存储所面临的主要挑战。18%的人认为是业绩不佳,16%的人认为是持续管理困难或耗时。15%的人认为是配置和管理,15%的人认为是带宽约束,14%的人认为是可扩展性,以及13%的人认为是系统延迟,有太多的孤立存储系统需要管理,这些都是主存储需要克服的问题。 如果企业还没有解决这些主存储所面临的挑战,那么很可能最终不堪重负。值得庆幸的是,还有很多提高数据存储效率的方法。 在这些方法中,固态存储位居榜首,有35%的受访者认为它是主存储优化的一种主要 方法。其次是自动存储分层(30%),随后是重复数据删除和压缩(28%),精简配置(26%),存储虚拟化(24%),数据归档和云存储(均为21%),存储资源管理软件(12%),以及自动配置软件(8%)。 13529 主存储的采购情况 在接受调查的人当中,78%的人表示已经为主存储采购了存储区域网络(SAN),22%的人拥有网络附属存储(NAS)系统。同时,有41%的人计划在未来一年内购买更多的网络存储。其中,59%的人将使用SAN(块存储)和28%NAS(文件存储)。另有37%的受访者表示他们希望购买统一存储阵列。 统一存储阵列很具吸引力,因为它们可以存储用于在同一设备上运行和管理块、文件或两种协议的应用程序和数据。多协议存储阵列可以通过提供一个管理系统来降低资本支出,并简化管理。然而,如果企业只需要其中的一个,那么其支付文件和块存储的费用就可能太昂贵。 在支持存储阵列的受访者中,有近四分之三(73%)的人表示希望增加存储容量,32%的人希望是性能提升。 接下来是某些应用程序和数据的性能改进(28%),更好的数据管理、迁移、分层和效率(26%),已安装存储的利用率更高(22%),重新构建存储基础设施以扩展数据中心的虚拟化(19%),整合存储空间(17%),以及降低对专业SAN管理技能的依赖(15%)。 13530 13531 与当前的存储部署一样,组织计划部署主存储优化技术以及即将到来的主存储采购措施,但存在一些显著差异。虽然固态存储仍处于领先地位,但受访者认为即将到来的存储购买量(43%)高于当前部署,这反映了闪存作为企业主存储器得以巩固。虽然自动存储分层产品为31%,但数据削减则上升12个百分点,上升至40%。随后是存储虚拟化(28%),数据归档(25%),云存储集成(23%),以及精简配置(21%),而存储资源管理软件(16%)和自动配置(13%)名列其后。 主存储优化的采购情况 作为即将到来的主要存储优化采购的一部分,企业正在考虑采用几种较新的存储技术。其中,34%的人表示是基于对象的存储,33%的人表示是云存储,27%的人表示是软件定义存储,12%的人表示是可以整合云存储资源的网关设备。只有3%的受访者表示他们不会考虑采用任何新兴的存储技术,另有29%的受访者表示他们会采购,但没有具体说明哪些存储技术。 评估主存储供应商的主要因素是价格(74%)和性能(68%)。其次是特性和功能(35%)和可扩展性(33%)。市场领先地位和技术支持与服务分别为27%,与其他技术的集成(17%),供应商已经提供的其他技术(7%),供应商的财务稳定性(5%)等。 三分之一的受访者将通过经销商为其最新项目购买主存储优化技术,另有11%的受访者表示他们将直接通过制造商购买。四分之一的受访者表示将同时从经销商和制造商购买主存储的技术和服务,还有32%的受访者还没有确定。 作者:James Alan Miller 来源:企业网D1Net
-
本帖最后由 Broaddata 于 2018-3-30 17:54 编辑2018年年3月30日,上海宽数EDF产品正式入驻华为云市场,在华为云市场发布了数据智能产品,能够提供大数据集成、数据治理、数据管理、数据检索、数据敏捷分析等数据智能的能力,帮助企业和用户快速便捷解决构建新一代企业级数据仓库难的问题。这款产品有哪些功能,又如何使用呢?一起来了解一下。 一、产品介绍 上海宽数倾力打造的企业大数据智能平台EDI (Enterprise Data Intelligence),以建设企业数据PaaS层为切入点, 帮助企业/机构快速构建新一代数据仓库和基于其上的数据产品,帮忙企业在DT时代快速数字化转型,实现数据智能,对接人工智能。EDI平台基于目前业界领先的大数据技术和理念,融合结构化、非结构化数据,实现了统一的数据架构(Unified Data Architecture)。通过部署EDI,快速的让企业/机构拥有大数据处理的能力,帮助用户在单一平台下,实现对海量数据、全类型数据、外部数据的存储归档、搜索访问、计算加工、价值挖掘、安全控制、以及数据资产全生命周期管理。 二、产品功能及特点 上海宽数的大数据智能平台EDI通过把:现代化的数据基础设施,所有数据之间的关联融合,企业对数据加工、服务的需求,进行统一的封装,构建一个企业大数据集成和管理的PaaS平台,减少用户对于数据技术的直接使用。 数据底层通过丰富的数据适配器,采用配置式的、自由组合的方式,适配各类现代化数据基础设施。通过统一的数据采集配置,统一调用数据基础设施,融合关联所有数据。 数据应用层通过统一的数据API,向数据应用提供透明访问的数据服务,保证数据安全的同时,减少使用数据技术的复杂性。 数据PaaS层剥离数据源和数据应用的复杂性,构建强大的数据管理中台,提供数据管理的各种工具。在数据管理中台,实现一体化的数据架构,在统一管理界面下,实现对海量异构数据的数据治理、存储归档、信息组织、搜索访问、安全控制、分析可视化、以及数据挖掘等。EDI平台在架构体系层面具有一下一些特点及优势。 高可扩展设计基于PC服务器的简单快速部署的,无需购买昂贵的传统数据仓库软件和硬件。分布式计算和存储架构,增加服务器即可获得系统性能的线性增长。 高可适应设计适用小数据量到海量大数据项目,部署可以从3台物理机开始到超大集群,项目启动快。可以根据用户的数据量级和不同的数据类型,选择适合的基础设施,如:海量价值密度低的RFID数据可以选择Hadoop作为数据仓库,而高价值密度的业务数据可以选择GreenPlum作为数据仓库等。 统一数据架构UDA融合了结构化和非结构化数据的管理,实现了统一数据架构UDA(Unified DataArchitecture),结构化数据和非结构化数据在一个统一的数据模型-数据对象(Dataobject)下管理。 数据高可用性和丰富API实现全数据的全文检索,同时支持基于SQL的数据查询分析。提供丰富的数据服务API,包括元数据服务,数据搜索服务,数据聚合服务,数据任务调度等。外部数据应用要使用和共享数据,可以调用已经注册的API服务。 统一元数据管理和全面数据治理提供统一的元数据管理工具,全面管理数据各类信息,包括类型,位置和访问信息,数据格式,数据血缘等。提供全面数据治理功能,实现数据的标准化,编码的标准化和映射,数据质量检查等。 统一数据加工框架提供了一个统一的数据加工的框架,实现了任务调度,任务执行,运行结果显示等。目前支持以下任务: 数据批处理任务,指标计算,标签计算,关系发现,音视频文件语音识别等。 数据安全支持灵活的用户权限管理配置,通过用户、组、角色进行多方位的用户权限管理。提供统一的数据安全模型,对所有数据的访问提供灵活定义的访问控制。记录所有关于数据访问的安全审计信息,以满足未来数据安全审计的要求。 三、产品应用于哪些行业 EDI平台应用于各行各业进行数字化转型,包括公安、政府、教育、制造、电商等。可应用的邻域包括: 大数据管理平台 大数据采集工具 大数据处理工具 大数据分析建模 大数据业务咨询 政务网应用 业务基础及应用开发 人工智能应用开发 四、产品能够解决什么问题 EDI平台帮助企业在DT时代迅速拥有数据能力,快速实现数字化转型: 海量业务数据分析: 更快的SQL查询、数据批处理 和 BI 报表 全类型数据全文检索: 类似“企业百度”,快速搜索企业全量,全类型数据 全面数据治理: 元数据管理,数据标准,数据质量,数据资产清单等 统一数据加工:数据清洗,指标/标签计算,关系发现,音视频文件/文本分析等 数据挖掘:预测,分类,关联分析,深度学习,挖掘数据价值等 数据API:给业务系统,BI系统,AI系统提供API服务,实现企业内数据共享 数据产品: 基于平台快速构建新的数据产品,如360度数据画像(客户,员工,设备等),推荐系统,…
-
本帖最后由 Sabrina 于 2018-3-28 15:15 编辑 13236【下午茶时光——业界热点陪你喝咖啡】基于新型存储的大数据存储管理1 引言大数据已经成为目前的一个研究热点。如何改进现有的数据存储与管理技术或者设计全新的体系结构,以满足大数据应用中的大数据量和高速数据流实时处理需求,是大数据技术中的核心问题之一。如果采用传统数据库管理系统(database management system, DBMS)的集中式数据存储方式,大数据存取性能就会受到极大的影响。Hadoop技术虽然提供了对大规模数据的快速、低成本存储和管理,但它是一个离线、批量的数据处理系统,对于实时数据处理与分析的支持较弱,难以满足许多应用的要求。例如,在城市公共安全中,通常要求能够对高达每秒几千帧的高清监控视频流进行实时处理与分析。但目前在传统计算体系结构下,单台计算机只能支持每秒150~300帧的低分辨率图像实时异常事件检测。如果要做进一步的目标识别,根据目前的处理技术,性能将下降到每秒16帧左右,远远不能满足每秒几千帧高清图像的实时处理要求。因此,迫切需要研究能够满足大数据高效存储与实时处理的新型体系结构与新方法。针对大数据高效存储与管理问题,目前除了Hadoop技术之外,学术界和工业界也提出了一些其他的设计,包括以NoSQL数据库为代表的大规模分布式数据库系统设计、基于动态随机存取存储器(dynamic random access memory, DRAM)的内存数据库技术等。但现有的NoSQL分布式数据库技术仍以磁盘存储或者“磁盘+闪存(flash memory)”混合存储的方式存储数据,本质上还是传统的“CPU-DRAM-二级存储”的存储架构,依然存在着内存和磁盘之间的“存储墙”问题,难以从本质上解决大数据实时存取的问题。此外,由于DRAM能耗和成本较高,也限制了其在大规模数据处理中的应用。过去5年来,闪存作为新型存储的代表性技术取得了快速发展,对现有的数据管理技术提出了极大的挑战,同时也带来了许多新的机遇.但是,闪存由于其存取方式(按页)、存取性能(1次存取通常需要约2[17个CPU时钟周期)的限制,仍适合作为二级存储器。基于闪存的数据管理只是优化了I/O延迟,并没有从本质上改变计算架构。除了闪存之外,近年来另一种新型存储介质——相变存储器(phase change memory,PCM)引起了学术界和工业界的广泛关注。与闪存相比,PCM可以被CPU直接按位存取,而且存取性能更高。因此PCM可以与DRAM一样与CPU交互。但与DRAM相比,PCM存储具有非易失性,能够进行持久的数据存储。传统硬盘基于磁性存储机理存储数据,闪存基于微型电容储存电荷的机理存储数据,存储密度都有理论上限,而PCM基于微型相变单元存储数据的机理使其能够迅速超越固态盘的存储密度,并且在未来还有更大的提升空间。IBM公司把PCM这一类具有DRAM的存取性能,同时又具有持久存储能力的介质称为存储级主存(storage class memory,SCM)。PCM等存储级主存以其非挥发、存储速度快、易实现高密度等技术特点,在高速与海量存储方面具有巨大的潜能,已被认为是下一代非易失存储技术的发展方向。另外,因该技术兼有DRAM的高速随机访问和闪存的非易失特性,模糊了主存和外存的界限,有望突破原有的存储架构,实现更高性能的存储。因此,如果能够利用PCM等新型存储器件设计出适合大数据存储与管理的新型存储架构(如图1所示),同时设计新的分布式多节点存储技术,则可以将大数据存取集中在DRAM和PCM上,充分发挥DRAM和PCM的高性能特性以及PCM的随机存取和非易失优点,而且可以利用分布式多节点存储的优势建立高扩展的大数据存储系统,从而有望彻底解决大数据存取中的性能与容量问题,为大规模的大数据分析与应用提供有力的支撑。图1 引入PCM等存储级主存后的存储体系结构目前,公共安全、智能交通、物联网等许多应用都要求实现大数据的实时存取。但是,现有的Hadoop等技术还很难达到这一目标,主要的困难在于无法提供低延迟、高吞吐的大数据实时存取能力。新型存储的出现为解决这一难题提供了可能。首先,PCM等非易失内存的出现为实现大规模的内存计算奠定了基础,使得人们有可能在内存中支持高并发的事务处理,而不需要传统DRAM导致的大量I/O操作,从而实现低延迟的大数据存取。其次,借助基于新型存储的分布式内存文件系统等技术,可以大规模提升外存和内存的写吞吐速率。本文综述了基于新型存储的大数据存储管理技术,分析了现有大数据存储技术的局限性,介绍了新型存储的特点和发展概况,总结了基于新型存储的大数据存储架构、基于新型存储的大数据存储管理等方向的研究现状,在此基础上给出了基于新型存储的大数据存储与管理的若干未来研究方向。2 大数据存储技术2.1 常见的大数据存储技术目前,大数据存储一般采用分布式存储技术,主要应用在NoSQL数据库系统中。现有的主流的NoSQL数据库系统,例如文档数据库系统MongoDB、列存储数据库系统HBase、内存数据库系统Redis等,均采用了分布式集群架构实现大数据的存储。也有一些分布式数据库系统在存储架构设计上考虑了异构存储的特性,例如RAMCloud和RethinkDB,从而有效提升了系统的存取性能。但是,现有的大数据存储技术还存在着以下的局限性。[*]以NoSQL数据库为代表的大规模分布式数据库系统设计了基于磁盘存储的读写方式、索引结构、查询执行、查询优化、恢复策略,但是磁盘固有的读写性能差等弊端限制了大数据存取尤其是大数据分析性能的提升。 [*]在以Hadoop分布式文件系统(Hadoop distributed file system,HDFS)为代表的大规模分布式文件系统中,虽然它们提供了大数据的存储支持能力,但由于这些文件系统在设计时并没有考虑对实时、高性能的数据处理的支持,因此无法满足日益增长的大数据在线分析的需求。此外,随着数据量的急剧增加,元数据的大小也急剧增加,传统的元数据架构、元数据备份管理、元数据动态负载均衡等越来越难适应大数据应用需求。 [*]基于DRAM的内存数据管理技术旨在通过海量的内存提高大数据的处理性能。但是,由于DRAM本身能耗高、价格相对昂贵,使得构建基于大内存的大数据存储集群在环境支持、成本上存在较大的困难。此外,DRAM的掉电易失特性导致的大数据环境下的数据一致性也是一个棘手的问题。2.2 新型存储技术鉴于磁盘存储、内存存储在面临大数据管理与分析时的困难,学术界和工业界开始将目光转向新型存储技术。目前,从技术成熟度和应用前景上看,闪存和相变存储器最有可能形成大规模应用,因此也吸引了国内外学者的关注。闪存是一种可以被电子化擦除和重写的非易失性存储设备。基于闪存的固态盘(solid state drive,SSD)是目前市场上常见的闪存存储设备。与传统的磁存储介质相比,闪存具有传输速率高、低延迟、低能耗、低噪音、抗震等优良特性。同时也有一些特殊性质:写前擦除,对闪存的写操作不是简单地改变某个二进制位,而是需要将整个擦除块的所有二进制位置改为1,这带来了闪存的读写不对称性,一般采用异地更新的方式缓解写前擦除带来的延迟,减少读写不对称带来的影响;寿命限制,目前企业级闪存能耐受3万次写循环,消费级闪存仅为3 000次;读写与擦除的单位不一致,一个擦除块中包含若干个闪存页,擦除的单位是一个闪存擦除块,读写的单位是闪存页。相变存储器是一种非易失类型的存储器,由硫系玻璃材质构成。由于这种材质的特质,通过施以电脉冲热,它可以在非晶态和多晶态这两种状态之间进行切换。PCM兼具速度快、耐用、非挥发性和高密度性等多种优势,其读写数据和恢复数据的速度是闪存的100倍。随着云计算和物联网等新一代信息技术的涌现,对海量存储系统的低能耗、高速及高可靠性的需求日益凸显,以新型存储取代传统存储介质的呼声越来越高,而PCM有望成为未来新型存储的主要技术。与DRAM、闪存等存储介质相比,PCM具有非易失性、存取速度快、节能、可字节寻址、写寿命长等优点。韩国三星(Samsung)公司与美国美光(Micron)公司是目前在PCM技术方面较为领先的两家公司,其中三星公司开发出的65 nm制程、512 MB容量的PCM芯片已投入量产,并应用在三星公司的手机存储卡中;同时三星公司已经推出了20 nm制程、8GB容量的相变内存颗粒。美光公司已经成功研制了45 nm制程、1GB容量的LPDDR2接口的PCM芯片产品,并已经量产。我国中国科学院上海微系统与信息技术研究所近年来也研制了中国自主知识产权的PCM芯片(8 MB),为研制我国自主产权的新型存储系统奠定了基础。此外,华中科技大学自2007年开始研究高密度低功耗的电阻式相变存储器、相变存储器功能芯片、相变存储器芯片的关键材料以及相关专用测试设备等,已经自主研制出具有简单读、擦、写功能的相变存储器功能芯片。总体而言,传统的磁盘存储技术在大数据存储与管理方面面临着严重的性能瓶颈。内存数据管理技术由于价格、容量以及易失等特点难以作为PB级大数据存储的最终解决方案,但在大数据存储与管理中可以借鉴内存数据处理的一些思路。闪存、PCM等新型存储器件提供了高性能、非易失的数据存储支持。从目前的技术发展现状看,PCM是现有最为成熟,且性能、容量与DRAM最为接近的存储技术。PCM以其非挥发、存储速度快、易实现高密度等技术特点以及与CMOS工艺兼容性好、易于与CPU集成形成片上系统(system on chip,SoC)芯片等优点,具有广泛的应用前景。3 大数据存储架构新型存储的出现为构建新的大数据存储架构提供了可能。目前,学术界针对基于新型存储的大数据存储架构提出了多种设计,包括基于PCM的主存架构、基于闪存的主存扩展架构、分布式存储与缓存架构等。3.1 基于PCM的主存架构PCM与闪存相比,其存取延迟更短,而且可以直接按位存取,因此能够被CPU直接存取,更适合作为DRAM的扩展。与DRAM相比,PCM具有非易失性特点,因此适合存储文件等静态数据。总而言之, PCM可以看作兼有DRAM和闪存的优点。从存储架构设计的角度来看,PCM既可以作为主存使用,也可以作为外存使用。但由于PCM的可字节寻址特性(与闪存不同),目前学术界对基于PCM的主存架构研究相对较多。在利用PCM替代DRAM方面,理论上可以有两种架构,即纯PCM主存架构和DRAM/PCM混合主存架构。在纯PCM主存架构中,PCM完全替代DRAM作为唯一的主存,而在DRAM/PCM混合主存架构中,DRAM和PCM共同作为主存。在后一种架构中,又存在着两种可能的设计:一是将DRAM作为PCM缓存的层次架构,另一种是DRAM和PCM并列的平等架构。目前,大多数的研究都假设DRAM/PCM的混合主存架构。研究者针对DRAM/PCM的混合主存架构,提出了多种PCM写操作优化以及负载均衡算法。由于PCM的写次数有限制,因此如何在混合主存中减少PCM上的写操作是目前的研究重点。基于PCM的主存架构为实现大数据的实时处理提供了可能。首先,PCM的低能耗特性使得在集群系统中使用大量的PCM存储代替DRAM成为可能,从而降低系统成本。其次,PCM的持久存储特性可以通过设计有效的算法提高分布式存储环境中的数据一致性。第三,PCM的高密度特性可以为内存计算提供有力的支持。3.2 基于闪存的主存扩展架构闪存是目前相对较成熟的新型存储技术。基于闪存的SSD已经大量装备在服务器上,成为企业级存储解决方案中的重要组成。由于闪存的整体存取性能优于磁盘,因此理论上可以借助闪存提升大数据存储和管理的性能。在早期的一些研究工作中,研究人员往往假设未来存储系统中闪存可以完全替代磁盘作为外存,但是,由于闪存的读写不均衡特性以及寿命问题,目前实际的系统中往往是DRAM、闪存和磁盘共存。在DRAM、闪存、磁盘共存的存储架构下,闪存通常作为主存的扩展,即作为DRAM和磁盘之间的中间层,提升大数据存取的性能。SSDAlloc是基于闪存的主存扩展系统,它将闪存作为磁盘的缓存,实现了系统整体性能的提升。也有一些学者提出了将闪存作为虚拟内存,在DRAM容量不够的情况下,将闪存作为虚拟内存设备进行页面交换。由于闪存性能总体优于磁盘,因此这种以闪存作为虚拟内存的架构理论上在大数据应用场景下性能优于传统的DRAM+磁盘的架构。对于大数据处理而言,基于PCM的主存扩展总体上比基于闪存的主存扩展更具可行性。这是因为大容量的闪存本身仍然采用按页存取的方式,与CPU按位存取模式之间存在不一致性,而且在存取性能上PCM也高于闪存,因此更有望减小与CPU之间的性能差距,构建能够充分发挥CPU、DRAM和PCM各自优势的高性能数据处理系统。3.3 分布式存储与缓存架构目前,基于分布式观点的数据管理是大数据存储与管理研究中的一个热点。一种观点是将闪存应用于分布式文件系统中进行元数据存储。元数据对于整个大数据管理系统的性能起着决定性作用,对于大数据解析、大数据统计、大数据操作优化等起着重要作用。基于闪存的分布式文件系统元数据管理的基本思路是在元数据服务器(metadata server,MDS)上使用SSD作为存储设备加速文件系统,如参考文献在Lustre分布式文件系统架构中的元数据服务器上使用闪存作为存储介质,加速元数据的读写速度。此外,基于Memcached的内存分布式缓存技术也被广泛用来加速大规模数据的访问,而在更为复杂的大数据环境下,其局限性主要体现在:一方面内存分布式缓存受限于集群内存容量,只能服务容量较小的热点数据,会造成性能下降;另一方面,如果采取扩大集群内存容量满足更多数据缓存需求,会带来高额的成本和巨大的能耗。现阶段解决方法是将小容量、高I/O负载的缓存处理与大容量、中低等I/O负载的缓存处理分离,形成“热缓存”与“冷缓存”的缓存策略,其中在“冷缓存”方面主要采用了闪存技术。例如,Facebook设计了基于闪存的键—值存储系统McDipper,代替Memcached为大量访问频率较低的图片提供缓存服务,降低成本和能耗,为了减少闪存I/O延迟,将闪存层分成两个区域,一个区域存放数据,另一个区域配置散列桶存放键值数据的指针,并将散列桶元数据放入内存。分布式存储技术将是解决大数据存储与管理问题的主要途径之一。一方面是由于Hadoop分布式技术已经为现有的大数据管理提供了一种行之有效的存储方案,而且已经在Google、Facebook等公司的实际应用中得到了验证,为大数据未来研究提供了有用的借鉴;另一方面也是因为在大数据应用中数据来源、用户等本身存在天然的分布特性,适合采用分布式存储技术。4 大数据存储管理闪存、PCM等新型存储的物理特性、读写特性等均与磁盘有着非常显著的不同,而目前已有的大数据数据库,其设计理念均是基于磁盘存储,在面对闪存、PCM等新型存储时,并不能最大限度地发挥新型存储的性能。目前,在基于新型存储的大数据存储管理方面也有一些研究工作。在基于PCM的存储管理方面,Ramos L E等人提出了一种针对DRAM/PCM混合主存的硬件驱动的页面置换策略。该策略依赖一个内存控制器(memory controller,MC)监控内存页面的使用频率和写密集程度。MC在DRAM和PCM之间进行页面迁移,保证性能攸关的页面和频繁写的页面保存在DRAM中,而性能不太敏感以及很少写的页面存储在PCM中。Qureshi M K等人提出了一个层次型混合主存系统。他们将DRAM设计为CPU和PCM之间的缓冲区。所有的数据页都存储在PCM中,只有当DRAM发生页面置换或者需要访问新的页面时系统才存取PCM。Wu Z L等人在PCM存储管理方面也提出了动态桶列表(dynamic bucket list)以及写敏感的混合时钟存储管理方法。索引作为优化数据存取性能的重要技术,是数据存储管理中的关键问题之一。传统的B+树索引在数据库系统和文件系统中被广泛应用,近年来在云计算、位置服务等应用中也有一些针对B+树的优化工作。虽然B+树具有很好的搜索性能,但它常常导致较高的更新代价。在面向闪存的数据库领域,研究人员提出了多种针对B+树的改进设计,例如μ*-Tree、BF-Tree、LA-Tree、HashTree、BloomTree等。这些方法以减少对闪存的写操作为主要目标,采用了利用溢出节点延迟更新、利用额外的缓存节点的更新等方法,最终减少B+树叶节点的更新次数以及索引的合并和分裂操作。虽然目前在基于闪存的索引设计方面已经有了不少的工作,但由于在大数据存储中引入了PCM等其他类型的新型存储介质,而且在计算架构上产生了根本性的变化(闪存定位在二级存储,而PCM则可以用于直接的内存扩展),因此,近年来研究人员也探讨了针对PCM的B+树索引优化问题。Chen S M等人最早在2011年的国际创新数据库研究会议(International Conference on Innovative Database Research,CIDR)上测试了B+树在采用了PCM主存技术的服务器上的性能。其研究结果表明,当PCM技术应用到数据库服务器上后,因其具备高速随机访问特性,传统的索引技术应进行新的设计。他们在后续的工作中继续研究了针对PCM等非易失内存的B+树索引结构,类似的工作还有Hu W W等人提出的BP-tree、Chi P等人提出的写优化B+树以及Li L等人提出的面向PCM的读写趋势感知的CB+-tree索引。这些工作基本都采用了针对PCM特性优化传统的B+树的思路。5 未来研究展望5.1 基于新型存储的大数据存储架构以PCM为代表的新型存储技术进一步提升了非易失存储的性能极限。PCM类似于DRAM的高速随机访问模式使其有机会直接与CPU连接,而其高密度潜力也使它能够适应大数据时代的容量需求。当存储静态数据的非易失存储允许CPU通过直接寻址的方式访问时,存储体系的进化不仅仅带来性能的大幅提升,同时还将改变应用程序访问数据的方式。由于PCM等存储级主存能够直接支持随机读写,因此可以将其与DRAM共同连接于主存控制器上,与DRAM实现统一编址,CPU可直接寻址到PCM的任何地址。由于计算机系统的系统集成度较高、构成复杂,不易完成架构改动,因此基于新型存储的大数据存储架构可以采用嵌入式系统方式构建验证用的硬件平台,在平台上直接实现新存储架构及相应软件,从而能够准确地评估新存储架构带来的性能优势。通过搭建新型嵌入式存储架构软硬件验证平台,实现对存储系统的硬件级访问检测,为验证软件系统性能提供准确的数据。5.2 基于新型存储的分布式内存文件系统PCM等存储级主存的出现及应用打破了传统的硬盘驱动器(hard disk drive,HDD)/SDD+DRAM的存储架构,为适应PCM等存储级主存PCM和DRAM共存的新存储架构,需研究新型的可支持以内存访问形式访问各种文件数据的新型文件系统。同时,由于大数据时代数据一般需要分布式存储与计算,因此在文件管理上还需要考虑对分布式环境的支持。因此,需要结合新型存储架构和分布式环境的需求,研究新型的大数据文件系统。该方向的一些研究要点包括以下几方面。(1)支持新型存储架构的单节点文件系统单节点文件系统是研制分布式随机访问内存文件系统的基础,具体包括新型存储架构下的文件原位访问技术、文件系统管理与控制技术、基于新型存储架构的内存管理机制等。(2)支持新型存储架构的分布式文件系统本地节点的数据访问仅能够提升应用程序访问本地数据时的效率。分布式存储技术可以基于新型存储架构搭建支持海量数据存储的分布式环境,从而满足大数据存储的容量需求。因此,将单节点文件系统向多节点扩充,完成支持新型存储架构的分布式内存文件系统,是实现基于新型存储的大数据存储管理的关键,研究要点包括分布式文件系统虚拟访问接口、基于统一寻址的分布式文件管理技术、存储空间的全局划分和寻址技术等。5.3 基于新型存储的大数据管理PCM等存储级主存给存储与计算架构带来了极大的挑战,包括异构存储上的数据分配与调整机制、异质缓存管理机制、基于新型存储的大数据索引技术等。(1)基于新型存储架构的数据存储分配与调整机制由于DRAM、PCM、SSD/HDD等多种存储介质同时用于数据存储,因此需要研究一种自适应的多粒度数据存储分配机制。具体而言,该机制首先根据数据访问频度将数据划分为3种状态:热(hot)、温(warm)、冷(cold),然后根据数据的状态进行存储分配与调整。所谓多粒度是指在存储分配时,同时采用文件和页两种粒度。在PCM与SSD/HDD之间进行数据分配时,PCM作为持久存储介质,采用文件粒度进行数据分配;在DRAM与SSD/HDD之间进行数据分配时,DRAM作为缓存,采用页粒度进行数据分配;在DRAM与PCM之间进行数据分配时,以键值记录粒度进行数据迁移和交换。在数据存储调整方面,一种可能的方法是基于应用对数据的访问模式变化,自适应、动态地调整数据存储策略。访问模式的度量基于数据的访问频度以及存取方式(读/写)两类因素,通过周期性考察的方法确定当前数据访问模式的变化程度,并基于访问模式的变化程度确定是否重新执行数据存储分配。一旦确定了新的数据存储分配策略,将对相应的数据进行介质之间的迁移操作。(2)基于新型存储架构的异质缓存管理数据缓存是传统数据库领域中的核心技术之一,它对于提升系统存取性能有着非常重要的作用。在大数据环境下,由于数据量的急剧增加,数据缓存的重要性尤为突出,因为如果让每个应用直接在全部的大数据上运行将很难保证访问性能。目前一种普遍的观点认为,虽然大数据环境下数据量很大,但对一个具体应用而言,涉及的只是大数据集合中的一部分(小数据)。但是,在新型存储架构下,数据存储涉及了DRAM、PCM、SSD等具有完全不同访问特性的存储介质,在缓存层也同样面临着多种介质共存的局面,例如数据既可以缓存在DRAM中,也可以缓存在PCM中,甚至也可以缓存在SSD中。这类异质缓存管理问题是传统数据缓存研究中不曾面临的新问题,也是构建基于新型存储的高效大数据管理系统的关键所在,需要首先分析异质缓存管理中的普遍性问题,阐明异质缓存管理的一些新的准则,在此基础上研究新的方法。(3)基于新型存储架构的大数据索引在传统的基于“DRAM+SSD/HDD”的存储架构下,DRAM与外存之间的I/O是影响系统查询处理性能的瓶颈。但在基于新型存储架构的大数据应用系统中,索引的设计不仅要考虑内外存之间的I/O代价,还要考虑异质内存之间的数据迁移代价(从DRAM到PCM以及从PCM到DRAM),此外还要考虑PCM等新型存储的器件特性(例如芯片写次数有限制)。另一方面,大数据应用系统往往构建在分布式环境之上,由于数据的分布以及涉及的数据量过大,传统的单一索引机制不能从根本上解决问题。因此,需要针对新型存储和分布式查询处理要求,设计相应的大数据索引结构以及操作算法。6 结束语高效的大数据存储与管理如果仅从软件体系结构考虑很难取得本质性突破,因为在大数据环境下内存与外存之间的I/O瓶颈很难克服。以PCM为代表的新型存储为大数据高效存储与实时处理提供了可能。研究适合高效大数据存储和管理的新型存储架构,借助创新的系统软件设计,改变大数据处理过程中对外存I/O的依赖,有望克服目前大数据存储与管理中的性能瓶颈,并进一步带动大数据技术的未来发展。本文讨论了新型存储的特点以及现有大数据存储技术的局限性,在此基础上综述了基于新型存储的大数据存储管理领域的研究现状,最后给出了未来研究展望,以期能对新型存储与大数据管理的未来研究提供有价值的参考。目前,由于非易失内存技术仍处于研发阶段,工业界还没有推出真正可用的新型存储系统,因此目前的研究还只能在新型存储模拟器上展开。随着非易失内存芯片工艺上的突破,预计几年内会出现可用的新型存储系统。届时,可以基于实际的平台开展理论和实验,对基于新型存储的理论研究成果进行验证。本文转载自《大数据期刊》作者:BDR
-
1.99元能买什么?一瓶矿泉水?两个鸡蛋?三个馒头? 什么?专业级大数据服务?! #华为云#EI·大数据MRS服务发布两节点集群,价格最低低至1.99元每小时! 本次大数据MRS服务支持2节点小集群:在创建集群的时候可以配置Master节点是否开启HA,在关闭HA的时候,只需要申请一台节点作为集群的管理节点,从而大量节省成本。成本降低的同时,集群中包含的组件并没有减少,仍然包含大数据处理的全套组件,如Hadoop、HBase、Hive、Spark、Kafka等等。单Master节点集群,让客户灵活配置集群节点,为企业使用大数据提供更多便利。 13237
-
13083 【下午茶时光——业界热点陪你喝咖啡】 超融合架构的本质之层次存储 本篇文章将进一步解释在超融合架构中,层次存储为什么是提升数据的I/O性能的最好选择。首先,让我们追溯到现代计算机体系结构中,解决系统性能瓶颈的关键策略:Cache。现代计算机体系结构是基于冯·诺依曼体系结构构建的,冯.诺依曼体系结构将程序指令当做数据对待,程序和数据存储在相同的存储介质(内存)中,CPU通过系统总线从内存中加载程序指令和相应的数据,进行程序的执行。 13080 冯·诺依曼体系结构解决了计算机的可编程性问题,但是带来了一个缺点,因为程序指令和数据都需要从内存中载入,尽管CPU的速度很快,却被系统总线和内存速度的限制,不能快速的执行。为解决这个问题,Cache的理念被提出,通过在CPU和内存之间加入更快速的访问介质(CPU Cache),将CPU经常访问的指令和数据,放置到CPUCache中,系统的整体执行速度大幅度提升。 I/O性能瓶颈问题转移到了存储 如果内存的访问速度相对CPU太慢,那么磁盘的I/O访问速度相对CPU来说就是“不能忍”了。下表是不同存储介质的访问延时,在虚拟化环境下或云环境下,由于I/O基本都是随机I/O,每次访问都需要近10ms的寻道延时,使得CPU基本处于“等待数据”的状态,这使得核心业务系统运转效率和核心应用的用户体验都变得很差,直观的感受就是业务系统和桌面应用“很卡”。 参考:http://norvig.com/21-days.html#answers13081 基于SSD构建平衡系统 和前人解决内存访问延时问题的思路类似,现在的主流方法是使用内存和SSD作为Cache来解决I/O性能瓶颈。存储系统能够分析出数据块的冷热程度,将经常访问的数据块缓存到内存和SSD中,从而加速访问。不论是全闪存存储,还是混合介质存储,从某种意义上讲都是层次存储,只不过混合阵列多了一层磁盘介质。学过计算机体系结构的人都听说过著名的Amdahl定律,这里我们要介绍一个Amdahl提出的“不那么著名”的经验法则:在一个平衡的并行计算环境中,每1GHz的计算能力需要1Gbps的I/O速度与之匹配。 假设一台服务器有2颗E5-4669 v3的CPU,每颗CPU有18个核,36个超线程,主频是2.1GHz,那么我们可以计算一下,这样的一台服务器需要151Gbps (即~19GBps)的带宽。在大规模的云计算(虚拟机算)环境中,极端情况下,大量的I/O并发使得存储收到的I/O都变成随机I/O,在这么一个并发环境中,假设我们的访问大部分都是8KB的读写,根据上面的计算,我们需要为一台服务器配备近250万的IOPS读取速度。在不考虑系统总线的情况下,如果我们用SAS/SATA硬盘来提供这个IOPS,即使每个SAS/SATA盘可以提供近250的IOPS(实际数值更小),仅为构建一台平衡的服务器计算存储环境,就需要大概1万个SAS/SATA硬盘。在稍大规模的虚拟化环境,想要搭出一个平衡的系统,用传统的SAS/SATA硬盘几乎不可能完成任务。但是如果采用能够提10万“写IOPS”的SSD设备,25块SSD就够了。 层次存储的优势 “层次存储”是相对“全闪存”而言,是指将容量大但是速度较慢的HDD和速度快的SSD同时构建在系统中,通过数据的访问特性,将经常访问的热数据放置在SSD中,而冷数据放置在HDD中。 首先,为构建一个平衡的虚拟化环境,需要大量的SSD设备来提供足够的IOPS。但是SSD也不是完美的。目前的SSD擦写次数有限、价格高。层次存储将热数据放置在SSD层中,而大量的冷数据仍然放置在SATA硬盘上,热数据周期性的同步到HDD硬盘,既为用户热数据提供了高IOPS的保障,也通过SATA硬盘提供了更大的容量和可靠性。下图是对11个开发人员桌面负载的I/O统计,包含了对5.1TB大小的存储上的76亿次IO访问和28TB的数据传输。首先值得注意的是,有3.1TB(62%)的数据,在一年内从来没有被访问过,这意味着这些数据无论是放置在SSD上,还是SATA上,甚至放到U盘上拔走,对系统都没有影响。 图引自:《The 80/20 rule… for storage systems》by Andy Warfield13082 作者:佚名来源:SmartX超融合
-
本帖最后由 KING 于 2018-3-19 15:29 编辑12719 【下午茶时光——业界热点陪你喝咖啡】 带你快速读懂块存储、文件存储、对象存储 产品和市场需求有各种相互影响的关系,但不管是哪一种,最终呈现都是产品和应用需求需要对应匹配。应用需求越多样化,市场也就划分得更加细,产品种类也就更加丰富。在存储行业,我们也可以从“应用适配”这个角度来聊聊各类存储。 传统认知上来说,IT设备分为计算/存储/网络三大类,相互之间是有明显的楚河汉界的。计算大家都清楚,服务器,小型机,大型机;网络也就是路由器交换机;存储有内置存储和外置存储,最常见的就是磁盘阵列。在HCI(超融合)这个概念没被热炒之前,计算网络存储还都是泾渭分明,各担其责的。今天我们先不讨论超融合的情况,仅基于传统理解,看看存储的情况。从逻辑上存储通常分为块存储,文件存储,对象存储。这三类存储在实际应用中的适配环境还是有着明显的不同的。 12720 块存储(DAS/SAN)通常应用在某些专有的系统中,这类应用要求很高的随机读写性能和高可靠性,上面搭载的通常是Oracle/DB2这种传统数据库,连接通常是以FC光纤(8Gb/16Gb)为主,走光纤协议。如果要求稍低一些,也会出现基于千兆/万兆以太网的连接方式,MySQL这种数据库就可能会使用IPSAN,走iSCSI协议。通常使用块存储的都是系统而非用户,并发访问不会很多,经常出现一套存储只服务一个应用系统,例如如交易系统,计费系统。典型行业如金融,制造,能源,电信等。 12721 文件存储(NAS)相对来说就更能兼顾多个应用和更多用户访问,同时提供方便的数据共享手段。毕竟大部分的用户数据都是以文件的形式存放,在PC时代,数据共享也大多是用文件的形式,比如常见的的FTP服务,NFS服务,Samba共享这些都是属于典型的文件存储。几十个用户甚至上百用户的文件存储共享访问都可以用NAS存储加以解决。在中小企业市场,一两台NAS存储设备就能支撑整个IT部门了。CRM系统,SCM系统,OA系统,邮件系统都可以使用NAS存储统统搞定。甚至在公有云发展的早几年,用户规模没有上来时,云存储的底层硬件也有用几套NAS存储设备就解决的,甚至云主机的镜像也有放在NAS存储上的例子。文件存储的广泛兼容性和易用性,是这类存储的突出特点。但是从性能上来看,相对SAN就要低一些。NAS存储基本上是以太网访问模式,普通千兆网,走NFS/CIFS协议。 12722 对象存储概念出现得晚一些,存储标准化组织SINA早在2004年就给出了定义,但早期多出现在超大规模系统,所以并不为大众所熟知,相关产品一直也不温不火。一直到云计算和大数据的概念全民强推,才慢慢进入公众视野。 前面说到的块存储和文件存储,基本上都还是在专有的局域网络内部使用,而对象存储的优势场景却是互联网或者公网,主要解决海量数据,海量并发访问的需求。基于互联网的应用才是对象存储的主要适配(当然这个条件同样适用于云计算,基于互联网的应用最容易迁移到云上,因为没出现云这个名词之前,他们已经在上面了),基本所有成熟的公有云都提供了对象存储产品,不管是国内还是国外。对象存储常见的适配应用如网盘、媒体娱乐,医疗PACS,气象,归档等数据量超大而又相对“冷数据”和非在线处理的应用类型。这类应用单个数据大,总量也大,适合对象存储海量和易扩展的特点。网盘类应用也差不多,数据总量很大,另外还有并发访问量也大,支持10万级用户访问这种需求就值得单列一个项目了(这方面的扫盲可以想想12306)。归档类应用只是数据量大的冷数据,并发访问的需求倒是不太突出。 另外基于移动端的一些新兴应用也是适合的,智能手机和移动互联网普及的情况下,所谓UGD(用户产生的数据,手机的照片视频)总量和用户数都是很大挑战。毕竟直接使用HTTPget/put就能直接实现数据存取,对移动应用来说还是有一定吸引力的。对象存储的访问通常是在互联网,走HTTP协议,性能方面,单独看一个连接的是不高的(还要解决掉线断点续传之类的可靠性问题),主要强大的地方是支持的并发数量,聚合起来的性能带宽就非常可观了。 12723 从产品形态上来看,块存储和文件存储都是成熟产品,各种规格形态的硬件已经是琳琅满目了。但是对象存储通常你看到都是一堆服务器或者增强型服务器,毕竟这东西现在还是互联网行业用得多点,DIY风格。 关于性能容量等方面,我做了个图,对三种存储做直观对比。 12724 块存储就像超跑,根本不在意能不能多载几个人,要的就是极限速度和高速下的稳定性和可靠性,各大厂商出新产品都要去纽北赛道刷个单圈最快纪录,千方百计就为提高一两秒,跑不进7分以内都看不到前三名。(块存储容量也不大,TB这个数量级,支持的应用和适用的环境也比较专业(FC+Oracle),在乎的都是IOPS的性能值,厂商出新产品也都想去刷个SPC-1,测得好的得意洋洋,测得不好自动忽略。)文件存储像集卡,普适各种场合,又能装数据(数百TB),而且兼容性好,只要你是文件,各种货物都能往里塞,在不超过性能载荷的前提下,能拉动常见的各种系统。标准POXIS接口,后车门打开就能装卸。卡车也不挑路,不像块存储非要上赛道才能开,普通的千兆公路就能畅通无阻。速度虽然没有块存储超跑那么块,但跑个80/100码还是稳稳当当。而对象存储就像海运货轮,应对的是"真·海量",几十上百PB的数据,以集装箱/container(桶/bucket)为单位码得整整齐齐,里面装满各种对象数据,十万客户发的货(数据),一条船就都处理得过来,按照键值(KeyVaule)记得清清楚楚。海运速度慢是慢点,有时候遇到点网络风暴还不稳定,但支持断点续传,最终还是能安全送达的,对大宗货物尤其是非结构化数据,整体上来看是最快捷便利的。 从访问方式来说,块存储通常都是通过光纤网络连接,服务器/小机上配置FC光纤HBA卡,通过光纤交换机连接存储(IPSAN可以通过千兆以太网,以iSCSI客户端连接存储),主机端以逻辑卷(Volume)的方式访问。连接成功后,应用访问存储是按起始地址,偏移量Offset的方法来访问的。而NAS文件存储通常只要是局域网内,千兆/百兆的以太网环境皆可。网线连上,服务器端通过操作系统内置的NAS客户端,如NFS/CIFS/FTP客户端挂载存储成为一个本地的文件夹后访问,只要符合POXIS标准,应用就可以用标准的open,seek, write/read,close这些方法对其访问操作。对象存储不在乎网络,而且它的访问比较有特色,只能存取删(put/get/delete),不能打开修改存盘。只能取下来改好后上传,去覆盖原对象。(因为中间是不可靠的互联网啊,不能保证你在修改时候不掉线啊。所谓你在这头,对象在那头,所爱对象隔山海,山海不可平。) 另外再说一点分布式存储的问题,以上三种存储都可以和分布式概念结合,成为分布式文件系统,分布式块存储,还有天生分布式的对象存储。对象存储的定义就把元数据管理和数据存储访问分开在不同的节点上,多个节点应对多并发的访问,这自然就是一个分布式的存储产品。而分布式文件系统就很多了,各种开源闭源的产品数得出几十个,在不同的领域各有应用。至于分布式的块存储产品就比较少,也很难做好。我个人认为这个产品形态有点违和,分布式的思想和块存储的设计追求其实是冲突的。前面讲过,块存储主要是图快,一上分布式肯定严重拖后腿,既然都分布开了,节点之间的通信必然增加额外负担,再加上CAP,为了保持一致性牺牲响应速度,得到的好处就是扩展性。这就像把超跑弄个铁索连环,哪里还可能跑出高速?链条比车都重了,穿起来当火车开吗?而文件存储原来也就是集装箱货车,大家连起来扮火车还是有可行性的。 作者:EricChan
-
12201 【下午茶时光——业界热点陪你喝咖啡】 农业变革,看看“区块链+农业”能做什么 从去年起,“区块链”成为最火的名词,有人认为这是一场大忽悠,也有人认为这是一场大变革,被徐小平称为一场“顺之者昌、逆之者亡的伟大技术革命”。到了2018年,轰轰烈烈的区块链猝不及防进入了农业。区块链到底是什么?区块链会为农业带来什么? 12202 一、区块链到底是什么? 通俗一点说,区块链技术是指一种全民参与记账的方式。所有的系统背后都有一个数据库,你可以把数据库看成是一个大账本。那么谁来记这个账本就变得很重要。目前是谁的系统谁来记账,微信的账本就是腾讯在记,淘宝的账本就是阿里在记。但现在区块链系统中,系统中的每个人都可以有机会参与记账。在一定时间段内如果有任何数据变化,系统中每个人都可以来进行记账,系统会评判这段时间内记账又快又好的人,把他记录的内容写到账本,并将这段时间内账本内容发给系统内所有的其他人进行备份。这样系统中的每个人都了一本完整的账本。这种方式,我们就称它为区块链技术。区块链行业应用最显著的优势在于优化业务流程、降低运营成本、提升协同效率,这个优势已经在金融服务、物联网、公共服务、社会公益和供应链管理等社会领域逐步体现出来。 12203 二、区块链和农业有关系吗? 目前农业发展的问题源自农产品供需不平衡。而造成供需不平衡的主要原因是在农业生产、流通、消费三大环节中,生产者和消费者过于分散、弱小,双方无法实现信息对称,无法直接对接,无法决定价格。双方只能做出理性但无奈的选择:生产者用一切降低成本的方式生产;消费者只能选择价格更低的产品;流通商只能打价格战,造成恶性循环。行业人士认为,区块链恰恰可以解决这个痛点,“从消费者端看,通过区块链技术可以满足知情权,选择自己信任的农产品;从采购商角度来讲,担心批量购买的农产品质量不好,则可以通过对种植过程以及大数据分析,选择信任的农户。” 动作最快的是中南建设,公司与北大荒公司合作的区块链农业公司“善良味道”,第一批区块链认证大米产品现已推向市场。以土豆生产为例解释,整个土豆生产过程的数据将全部上传到分布式账本存储,形成不可篡改账本内容,提供给消费者、采购商查阅。 12204 例如,把化肥、农药的采购过程记录在册,从根源上避免重金属超标和农药残留超标的问题;通过大数据分析,建立种植户、采购商的信用评级参考;利用智能合约在种植户和采购商之间保证公平交易。销售过程也把分选加工等信息用分布式账本存储起来,保证完整透明的信息给利益相关方。那么,在此过程中,区块链最大的特长,即分布式账簿的优势是如何体现的呢?对此,以往采购商在采购前会派人给土豆种植户开出一个高价。但是,当农民从地里把土豆挖出来后,农民往往就联系不上这个人了,这时采购商再派另一个人,利用土豆在地头不容易存储的因素,大幅压低土豆价格。而采用区块链技术之后,每笔交易都是向所有人公开的,就可以解决这个问题。 利用区块链技术实现充分分布化,让消费者、种植户、采购商,批发商等都同步记账防止篡改,可以利用相互之间的利益不相容机制来制衡保证数据的真实,避免利益趋同下一致行动的风险。传统的追溯体系是单一公司的个体行为,自己既当运动员又当裁判员,公信力弱。而采用区块链技术后,分布式账本将农民、合作社、经销商、消费者组织起来共同记录种植信息,利用不可篡改的特性起到信息透明的作用。 12205 三、区块链可能改变农业哪些领域? 区块链市场开始孕育,短期尚不具备大规模落地条件,关注上下游产业链和未来商业场景的落地。农业部**康春鹏博士认为区块链将会在物联网农业、农产品溯源、农村金融等6大领域运用,并推动产业发展。 1、农业物联网: 目前制约农业物联网大面积推广的主要因素就是应用成本和维护成本高、性能差。而且物联网是中心化管理,随着物联网设备的暴增,数据中心的基础设施投入与维护成本难以估量。物联网和区块链的结合将使这些设备实现自我管理和维护,这就省去了以云端控制为中心的高昂的维护费用,降低互联网设备的后期维护成本,有助于提升农业物联网的智能化和规模化水平。 2、农业大数据: 传统数据库的三大成就,关系模型、事务处理、查询优化,数据库技术在不停发展。未来随着农业大数据采集体系的建立,如何以规模化的方式来解决数据的真实性和有效性,将是全社会面临的难题。以区块链为代表的技术,对数据真实有效不可伪、无法篡改的这些要求,相对于现在的数据库来讲,是一个新的起点。 3、农产品质量安全追溯: 农业产业化过程中,生产地和消费地距离远,消费者对生产者使用的农药、化肥以及运输、加工过程中使用的添加剂等信息根本无从了解,消费者对生产的信任度降低。基于区块链技术的农产品追溯系统,所有的数据一旦记录到区块链账本上将不能被改动,依靠不对称加密和数学算法的先进科技从根本上消除了人为因素,使得信息更加透明。 4、农村金融: 农民贷款整体上比较难,主要原因是缺乏有效抵押物,归根到底就是缺乏信用抵押机制。区块链技术公开、不可篡改的属性,为去中心化的信任机制提供了可能。 5、农业保险: 农业保险品种小、覆盖范围低,经常会出现骗保事件。将区块链与农业保险结合之后,农业保险在农业知识产权保护和农业产权交易方面将有很大的提升空间,而且会极大的简化农业保险流程。另外,因为智能合约是区块链的一个重要概念,所以将智能合约概念用到农业保险领域,会让农业保险赔付更加智能化。以前如果发生大的农业自然灾害,相应的理赔周期会比较长。将智能合约用到区块链之后,一旦检测到农业灾害,就会自动启动赔付流程,这样赔付效率更高。 6、农产业供应链: 区块链技术有助于提升供应链管理效率。由于数据在交易各方之间公开透明,从而在整个供应链条上形成一个完整且流畅的信息流,这可确保参与各方及时发现供应链系统运行过程中存在的问题,并针对性地找到解决问题的方法,进而提升供应链管理的整体效率。 12207 区块链技术可以避免供应链纠纷。所具有的数据不可篡改和时间戳的存在性证明的特质能很好地运用于解决供应链体系内各参与主体之间的纠纷,实现轻松举证与追责。区块链技术可以用于产品防伪。数据不可篡改与交易可追溯两大特性相结合,可根除供应链内产品流转过程中的假冒伪劣问题。
-
11595 【下午茶时光——每日精选小知识陪你喝咖啡】有人说虚拟化解决方案就好像游历一个虚拟现实的主题公园。当游客想象他正在城市上空滑翔时,传感器就会把相应的真实感觉传递给游客,如同身历其境。同样,一个好的虚拟化工具可以对企业的存储设备做相同的工作,让数据感觉自己是存储在一个真实的物理环境里,之后就可以任意改变数据存储的位置了。以下这篇文章就是聊聊在云存储中虚拟化技术的使用,有兴趣的小伙伴多加关注啦~从今日起,下午茶时光每日精选与大家分享云计算领域中的各种小知识,继续陪大家喝咖啡( ̄︶ ̄)> 云存储的核心技术:虚拟化存储 导语虚拟化改变了计算机使用存储的方式。就像物理机器抽象成虚拟机(VM:Virtual Machine)一样,物理存储设备也被抽象成虚拟磁盘(Virtual Disk)。今天我们就来聊聊虚拟化存储(Storage Virtualization)技术,究竟虚拟磁盘是怎样实现的?11577 [*]虚拟磁盘的实现 我们知道,服务器扩展存储的手段主要有直连存储(DAS)、存储区域网络(SAN)和网络附加存储(NAS)这三种类型。那么哪种存储类型可以用来实现虚拟磁盘呢? 在虚拟化环境中,类似VMWare这样的虚拟机管理程序hypervisor,要同时给很多VM分配存储空间。这个过程中,我们需要先把物理存储资源重新划分成虚拟磁盘,然后再分配给VM。 显然我们不能用DAS方式把物理磁盘直连到VM上,如果这样,需要的物理磁盘就太多了。SAN是以逻辑单元(LUN:Logic Unit)的形式提供存储资源,但虚拟环境下的VM数量很大,LUN的数量也不足以支撑这么多虚拟磁盘。 更重要的一点,虚拟磁盘对于众多的VM来说是共享的,因为VM需要随时创建、删除或者迁移,在迁移VM的时候就需要共享存储,只有这样原来的数据才不会丢失。无论DAS还是SAN,都不适合共享存储。 考虑到资源分配以及共享的问题,hypervisor采用NAS的方式来实现虚拟磁盘。VMware通常采用VMFS(Virtual Machine File System)或NFS协议来实现虚拟磁盘,VMFS是专门针对虚拟机环境的文件系统协议。 每个虚拟机的数据实际上就是一堆文件,最主要的文件就是虚拟磁盘文件(VMDK文件),此外还有交换分区文件(vswp文件,相当于swap)、非易失性内存文件(nvram相当于bios)等。每个VM对虚拟磁盘的IO操作,实际上是对这个虚拟磁盘文件的读写。 VMFS的设计、构建和优化针对虚拟服务器环境,可让多个虚拟机共同访问一个整合的群集式存储池,从而显著提高了资源利用率。采用 VMFS 可实现资源共享,使管理员轻松地从更高效率和存储利用率中直接获益。 11593 [hr]那么我们如何在云计算中使用虚拟磁盘呢? [*]实例存储 最主要的一种使用虚拟磁盘的方式就是实例存储,每一个VM就是一个虚拟机实例,hypervisor在每个实例中提供仿真的硬件环境,包括CPU、内存和磁盘。这种方式,使得虚拟磁盘成为虚拟机实例的一部分,就像物理世界一样。VM删除后,虚拟磁盘也会被删除。 这种实例存储模型中,虚拟磁盘与虚拟机之间的存储关系,实际上是DAS存储。但虚拟磁盘的底层实现,上面我们说了,是用NAS方式实现的。而hypervisor的作用就是把VM层的存储模型,与虚拟机下层的实现协议(VMFS或NFS)分离开了。 [*]卷存储 实例存储有它的限制,开发者一般希望把实例数据(比如OS以及安装的一些服务器应用软件)和用户数据分开,这样重建VM的时候可以保留用户的数据。 这个需求衍生出另外一种存储模型:卷存储。卷是存储的主要单位,相当于一个虚拟的磁盘分区。不属于虚拟机实例的一部分,可以认为是虚拟机的外置存储设备。 卷可以从一个VM卸下,然后附加给另外一个VM。这样我们就实现了实例数据与用户数据的分离。 [*]对象存储 很多云应用需要在不同的VM之间共享数据,经常需要跨越多个数据中心,对象存储可以解决这个问题。 在对象存储模型中,数据存储在存储段(bucket)中,按字面意思bucket也可以被称为“桶“。我们可以用硬盘进行类比,对象就好比文件,存储段就像是文件夹(或目录)。对象和存储段可以通过统一资源标识符(URI: Uniform Resource Identifier)查找。 对象存储的核心设计思想其实也是虚拟化,具体说来,就是把文件的物理存储位置,比如卷、目录、磁盘等,虚拟化为bucket,把文件虚拟化为对象。对应用层来说,简化了对数据的存取访问,屏蔽了底层存储技术的异构性和复杂性。 11591 NAS与对象存储各有所长当然你也许会问,NAS存储技术不是也可以解决数据共享的问题吗?由于对象存储的规模优势和成本优势,很多云环境采用对象存储来代替NAS。 由于对象存储将遍布于很多节点且最新的数据并非总是可用, 所以对象存储的数据一致性不强。如果对强一致性有要求,那么可以使用NAS。目前在云计算环境下,NAS和对象存储是共存的关系。 和NAS一样,对象存储也是软件架构,不是硬件架构。应用直接通过REST API来访问对象存储。[hr] 结语在实际的云平台应用中,我们需要根据自己的实际情况来合理运用不同的虚拟化存储技术。 [*]对于非结构化的静态数据文件,如音视频、图片等,我们一般使用对象存储。 [*]对于系统镜像以及应用程序,我们需要使用云主机实例存储或者卷存储。 [*]对于应用产生的动态数据,我们一般还需要利用云数据库来对数据进行管理。 本文转载自《微说互联网》
-
本帖最后由 KING 于 2018-2-13 15:48 编辑11047 【下午茶时光——业界热点陪你喝咖啡】 【国内首家区块链租房平台已运行一月,雄安推行租房积分制度】 此前2月10日,雄安新区宣布推行住房租赁积分制度。雄安已建成区块链租房应用平台,并且已经低调上线近一个月。这也是国内首例。在这一政府主导的区块链统一平台上,挂牌房源信息,房东房客的身份信息,房屋租赁合同信息将得到多方验证,不得篡改。未来,雄安新移民租房时,将不再用担心遇到假的房东,租到假的房子,因为当租房各个环节信息都记在区块链上,它们之间会相互验证。 11048 据悉,中国建设银行,链家,蚂蚁金服等机构参与了这一租房模式的建设。其中,蚂蚁金服是核心区块链技术提供方,链家和建行则负责提供房源租赁信息等服务。 吃瓜群众表示:科技发展这么快,租房行业都玩得这么花了 【马斯克:“Delta IV”要能在2023年前上天 我把帽子吃了】 上周,SpaceX成功发射了“重型猎鹰”火箭。本周一,SpaceXCEO埃隆·马斯克(Elon Musk)在Twitter上讨论了火箭助推器的性能。喷气式推进实验室可视化内容制作人道格·埃里森(Doug Ellison)在Twitter上分享了一些计算结果,表明Delta IV重型火箭可以达到“重型猎鹰”的性能,从而完成某些飞往**外的任务。对此,马斯克回应称,埃里森的数据基于有缺陷的基础数据。即便数据正确,“重型猎鹰”的成本也要远低于竞争对手。随后,联合发射联盟CEO托里·布鲁诺(Tory Bruno)也加入了争论。11049 马斯克甚至发布Twitter消息称,他敢于打赌,竞争对手的火箭不可能在2023年之前承担美国的国家安全太空飞船发射任务;如若不然,他“把帽子吃了”(eatmy hat)。而布鲁诺只回复了一个词:“哇”(Wow)。 吃瓜群众表示:大佬开撕,一言不合就开“吃”。 【华为携手熙菱信息共同打造海淀视频云】 日前,华为携手熙菱信息共同建设的北京市海淀区“网格化图像信息系统微卡口(大数据)平台”项目首战告捷。本次项目中熙菱信息采用了视频图侦及车辆大数据分析系统作,同时采用了华为云中视频云产品“一云一池”的理念,以及华为云相关的云计算产品,旨在更好的解决客户在图片接入转发及存储、图片二次解析、车辆大数据应用上云与数据整合的所产生的问题需求。 11050 吃瓜群众表示:已经沐浴在华为视频云带来的春风中了。。。 【春晚首次采用4K技术转播 比电影还清晰】 近日央视对外发布了春晚新技术应用情况。央视2018年春晚,将提供4K超高清春晚点播服务。春节期间,北、上、广、贵的用户,可通过“央视专区”互动电视平台点播4K超高清央视春晚。 11051 目前,我国的电影院的放映清晰度是2K。而此次央视春晚采用4K技术,使千家万户的观众能收看到远比电影院看电影,还要清晰和精彩的画面。央视4K的主要技术指标为:分辨率为3840X2160,帧率为50P,图像量化bit为10bit,具备HDR高动态范围,色域为ST 2020,声音为5.1环绕声和三维声。同时央视春晚节目和主分会场,还会推出30多个春晚VR短视频,可通过“中央电视台”移动客户端直接收看到二维立体视频,或借助头盔收看三维立体视频。 11053 今年的春晚可谓是科技感十足啊!!! 吃瓜群众表示:没想到今年春节档最火大片名字叫做“2018春节联欢晚会”。 【往期下午茶回顾】[下午茶时光] 【Day 23--2018/2/12】VanFraud病毒疯狂来袭,18家下载站已中招[下午茶时光] 【Day 22--2018/2/11】今日,比特币中国出让100%股权[下午茶时光] 【Day 21--2018/2/8】美国听证会不完全解读:没有比特币就没有区块链[下午茶时光] 【Day 20--2018/2/7】装上AI大脑的无人机能担当“无人机警察”吗[下午茶时光] 【Day 19--2018/2/5】太执着于让别人喜欢,这是很多创业者的通病
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签