• [技术干货] 数据湖治理:优势、挑战和入门
    成功的数据治理计划会利用政策、标准和流程来创建高质量数据,并确保在整个组织中正确利用这些数据。数据治理最初侧重于关系数据库和传统数据仓库中的结构化数据,但后来情况发生变化。如果你的企业拥有数据湖环境,并希望从中获得准确的分析结果,那么你还需要部署适当的数据湖治理,作为整体治理计划的一部分。 但数据湖对企业数据管理的所有领域(包括数据治理)带来各种挑战。下面我们将探讨一些主要的治理挑战,以及有效治理数据湖的好处。不过,首先让我们定义什么是数据湖:这是指一个拥有大量原始数据的数据平台,通常包括各种结构化、非结构化和半结构化数据类型。它通常建立在Hadoop、Spark和其他大数据技术之上。 虽然大多数数据仓库将数据存储在关系表中,但数据湖使用扁平架构。每个数据元素都被分配一个唯一标识符,并用一组元数据标签进行标记。因此,数据湖不像数据仓库那么结构化。数据通常以其原始格式保留,并根据特定分析用途的需要进行分类、整理和过滤,而不是在将其加载到数据湖中时。数据湖与数据沼泽 如果数据湖没有得到很好的管理和治理,它可能会变成沼泽而不是湖泊。数据在没有适当监督和记录的情况下被转储到平台中,使数据管理和治理团队难以跟踪数据湖中的内容。这可能会导致数据质量、一致性、可靠性和可访问性方面出现问题。 因此,数据科学家、数据工程师和其他最终用户可能无法为分析应用程序找到相关数据。更糟糕的是,数据沼泽可能会导致分析错误,并最终导致糟糕的业务决策。数据安全和隐私保护可能无法正确应用,从而使企业的数据资产及其商业声誉面临风险。为了避免这种沼泽地情况,企业必须管理数据湖环境。数据湖治理的好处 有效的数据治理使企业能够提高数据质量,并最大限度地利用数据进行业务决策,这可以带来运营改进、更强大的业务战略和更好的财务绩效。这个道理同样适用于治理数据湖,就像它与其他类型的系统一样。数据湖治理提供的具体好处包括: 增加对相关数据的访问以进行高级分析。在管理良好的数据湖中,数据科学家和分析团队的其他成员更容易找到机器学习、预测分析和其他数据科学应用所需的数据。 为分析用途准备数据所花费的时间更少。虽然数据湖中的数据通常以原始形式保留,知道特定应用程序需要它,但在受监管的环境中可以缩短数据准备过程。例如,前期数据清理减少以后修复数据错误和其他问题的时间。 降低IT和数据管理成本。通过防止数据湖失控,可以减少所需的数据处理和存储资源。通过提高数据准确性、整齐度和一致性,还可以降低总体数据管理需求。 提高敏感数据的安全性和监管合规下。数据湖的常见用例是帮助营销和销售。因此,他们通常包含有关客户的敏感信心。数据湖的强大治理有助于帮助此类数据得到适当保护,并且不会被滥用。数据湖治理挑战 数据治理的配套数据管理学科包括数据质量、元数据管理和数据安全,所有这些因素都会影响数据湖治理及其挑战。以下是数据湖部署中遇到的五个常见数据治理挑战。 1. 识别和维护正确的数据源。在很多数据湖实施中,源元数据没有被捕获或根本不可用,这使得数据湖内容的有效性值得怀疑。例如,记录系统或数据集的业务所有者没有被列出,或者明显冗余数据可能会给数据分析师带来问题。至少,应记录数据湖中所有数据的源元数据,并提供给用户以深入了解其来源。 2. 元数据管理问题。元数据为数据集的内容提供背景信息,使数据在应用程序中易于理解和使用,元数据是重要组成部分。但是很多数据湖部署没有将正确的数据定义应用于收集的数据。此外,由于原始数据通常加载到数据湖中,很多企业没有部署步骤来验证数据或应用组织数据标准。由于缺乏适当的元数据管理,数据湖中的数据对分析没什么用处。 3. 数据治理和数据质量缺乏协调。不协调数据湖治理和数据质量工作可能会导致低质量数据进入数据湖。当数据用于分析和推动业务决策时,这可能会导致结果不准确,从而导致对数据湖的信心丧失以及整个组织对数据的普遍不信任。有效的数据湖实施需要数据质量分析师和工程师与数据治理团队和业务数据管理员密切合作,以应用数据质量策略、分析数据并采取必要措施来提高其质量。 4. 数据治理和数据安全缺乏协调。在这种情况下,未在治理过程中正确应用的数据安全标准和策略,可能会导致访问受隐私法规保护的个人数据和其他类型的敏感数据时出现问题。尽管数据湖旨在成为相当开放的数据源,但仍需要安全和访问控制措施,并且数据治理和数据安全团队应共同努力处理数据湖设计和加载过程以及持续的数据治理工作。 5. 使用相同数据湖的业务部门之间的冲突。不同部门可能对相似数据有不同的业务规则,这可能导致无法协调数据差异以进行准确分析。拥有一个强大的数据治理计划,具有数据策略、标准、程序和定义的企业视图,包括企业业务术语表,可以减少多个业务部门使用一个数据湖时出现的问题。如果企业有多个数据湖,则每个数据湖都应包含在数据湖治理流程中,并为其分配业务数据管理员。如何开始管理数据湖 与其他类型系统中的数据治理一样,数据湖治理的常见初始步骤包括: 记录管理数据湖的业务案例,包括数据质量指标和其他衡量管理工作收益的方法。 寻找高管或业务发起人,以帮助为治理工作获得批准和资金支持。 如果你还没有适当的数据治理架构,请创建一个架构,其中包括治理团队、数据管理严以及数据治理委员会-由业务主管和其他相关数据所有者组成。 与治理委员会合作,为数据湖环境制定数据标准和治理政策。另一个好的初始步骤是构建数据目录,以帮助最终用户定位和理解存储在数据湖中的数据。或者,如果你已经拥有其他数据资产的目录,则可以将其扩展为包括数据湖。数据目录捕获元数据并创建可用数据的清单,用户可以搜索以找到他们需要的数据。你还可以在目录中嵌入有关你组织的数据治理策略的信息,以及强制执行规则和限制的机制。 总之,通过在设计、加载和维护数据环境中涵盖强大的数据治理以及元数据管理、数据质量和数据安全流程,可以显着提高数据湖的价值。经验丰富的专业人员在所有这些领域的积极参与也至关重要。否则,你的数据湖可能确实会变成更多的数据沼泽。来源:TechTarget中国
  • [技术干货] 数据目录——企业数据资产的一个有序清单
    简而言之,数据目录就是关于企业数据资产的一个有序清单。它可以使用元数据来帮助企业管理数据,帮助数据专业人员收集、组织、访问和充实元数据,从而为数据发现和治理提供支持。—  01  — 数据目录的定义和类比在上文我们简单介绍数据目录的定义,也就是使用元数据来帮助企业管理数据。接下来,我们使用图书馆作类比,带您详细了解数据目录。当您前往图书馆查找某一图书时,您可以使用图书目录来查找该图书是否存在,了解它的版本、位置以及相关描述。您可以使用所有这些信息来决定是否真的需要这本书,了解如何找到它。当今的许多对象存储、数据库和数据仓库就相当于一座座图书馆。我们再回到图书馆和图书目录。现在,我们对图书目录进行扩展,涵盖整个国家的所有图书馆。想象一下,这样您就可以在一个界面中查找整个国家中储藏了您所需图书的所有图书馆,查找关于您所需的每一本图书的所有详细信息。企业数据目录之于数据,正如图书目录之于图书。它可以为您提供一个整体视图,提供关于您所有数据的深度可见性,而不仅仅是一次只查看某一项数据。您为什么需要这样一个视图呢?—  02  — 数据目录可以解决哪些问题?与过去相比,想从如今前所未有的数据海洋中找到正确的数据更加困难。同时,关于数据的监管条例和法规(例如 GDPR)也比过去更多、更严格。在这一背景下,除了数据访问之外,数据治理也成为了一个严峻的挑战。您不仅要了解当前您所拥有数据的类型、哪些人在移动数据、数据的用途以及如何保护数据,还必须避免过多的数据层和封装,避免数据因太难使用而毫无用处。遗憾的是,很多企业和用户在查找和访问数据上面临着很多问题,包括: 需耗费大量时间和精力查找和访问数据数据湖变成了数据沼泽无通用业务词汇难以理解“黑暗数据”的结构和类别难以评估数据来源、质量和可靠性无法捕获部落知识或丢失的知识难以重用知识和数据资产需手动和临时进行数据准备 —  03  — 哪些用户应使用数据目录?数据工程师、数据科学家、数据管理员和首席数据官等用户无不受到以上数据管理问题的困扰,无不希望能够轻松访问可靠的数据。他们面临的一些常见的挑战包括: 数据工程师想知道任意更改将对整个系统产生哪些影响,他们可能会问:我们 CRM 应用中的模式变更将产生哪些影响?Peoplesoft 和 HCM 数据结构有何不同? 数据科学家希望能够轻松访问数据并进一步了解数据质量,他们想了解以下信息:从何处可以找到和查看一些地理位置数据?如何轻松访问数据湖中的数据? 数据管理员负责管理数据流程,关注概念、利益相关者间协议以及数据生命周期管理。他们希望了解:我们是否真的在改善运营数据质量?我们是否为重要的关键数据元素定义了标准?首席数据官关心哪些人在组织中做了哪些事,一般不使用数据目录。但是,他们仍然希望了解:哪些人可以访问客户的个人信息?我们是否为所有数据定义了保留策略?有了数据目录,这些问题就能迎刃而解。 —  04  — 数据目录使用场景 在过去几年中,随着需要管理和访问的数据的数量日益增长,数据目录这一概念开始流行起来。在这一切的背后,是云、大数据分析、人工智能和机器学习正逐渐改变人们查看、管理和使用数据的方式 — 不仅要管理数据,还要访问和充分利用数据。使用数据目录,您可以更好地使用数据,获得以下优势:节省成本提高运营效率增强竞争优势改善客户体验减少欺诈,降低风险等等这些只是数据目录的一部分使用场景。实际上,数据目录的使用方式多种多样。从根本上说,它的宗旨就是提供更广泛的数据可见性和更深入的数据访问支持。 1.自助分析 许多用户难以找到正确的数据,同时,除了查找数据外,他们还难以判断数据是否有用。例如,您可能会发现一个名为 customer_info.csv 的文件,而又恰好需要一个关于客户的文件。但这并不意味着它就是您需要的,它可能只是 50 个类似文件中的一个。同时,该文件可能包含许多字段,您可能并不了解所有这些数据元素代表什么。对此,您需要通过一种更简单的方法来查看数据的业务上下文,例如它是否是来自正确的数据存储的托管资源以及它与其他数据工件之间的关系。 数据发现还包括通过各种方式来理解数据的形态和特征,例如简单的值分布和统计信息,或者重要且复杂的个人身份信息 (PII) 或个人健康信息 (PHI)。2.审计、合规和变更管理随着关于数据的政府监管法规数量不断增长,企业经常需要证明数据的来源,例如特定数据工件的来源,或在实现最终目标之前进行了哪些数据转换;在查看表格、报告或文件时,数据用户通常也希望理解数据的具体来源以及数据通过各种方式在整个组织中的移动过程。同时,对于变更管理来说,一项重要任务就是查看数据管道中某部分的变更将如何影响系统的其他部分。这就是为什么客户希望详细了解数据沿袭的原因。 3.使用业务术语表增强数据治理 如今大多数企业都建立了一个所有人都认可的术语表,就业务概念达成了一致。通常,业务术语表记录在 Excel 工作簿中。其实,数据目录比 Excel 工作簿更适合存储和管理这一重要业务信息。 此外,数据目录还支持在业务术语之间建立链接,从而创建分类;可以记录业务术语与实物资产(例如表和列)之间的关系;可以帮助用户理解哪些业务概念与哪些技术工件相关;可以帮助用户按业务概念线对数据资产分类,随后直接使用业务概念(而不是技术名称)来进行数据搜索和发现。数据目录让用户可以看到与数据相关的所有内容,增强对所查看内容的信任度,为数据治理奠定一个绝佳的起点。 —  05  — 如何充分利用数据目录中的数据?许多人可能不熟悉元数据,我们有必要先介绍一些简单的概念。元数据是什么?元数据分为 3 类:技术元数据:模式、表、列、文件名、报告名 — 源系统中记录的所有信息业务元数据:通常指用户具备的关于组织资产的业务知识,包括业务描述、备注、注释、分类、适用性、评级等等。操作元数据:这一对象的刷新时间?它由哪一个 ETL 作业创建?表格被访问次数有多少?具体有哪些?在过去几年里,这些宝贵的元数据的使用方式发生了一次细微的变革。曾经,元数据仅用于审计、来历追溯和报告。如今,无服务器处理、图形数据库等技术创新,尤其是全新、更加便捷的 AI 和机器学习技术正在突破元数据的界限,带来新的可能。在今天,元数据可增强数据管理。从自助数据准备到角色和数据内容库访问控制,自动化数据打通,异常监视和警报,自动化资源供应和扩展等等,元数据可以全面增强所有这些功能。数据目录可以使用元数据帮助您实现比数据管理更强大的功能。—  06  — 数据目录应当具备哪些功能? 一个优秀的数据目录应当具备以下功能:①数据搜索和发现:数据目录应当具备灵活的搜索和过滤选项,从而赋能用户快速找到相关数据集,以实施数据科学、分析或数据工程;按照数据资产的技术层级来浏览元数据。此外,如支持用户输入技术信息、自定义标签或业务术语,数据目录可以进一步改善搜索功能。②从各种数据源收集元数据:请确保您的数据目录可以从各种互联数据资产中收集技术元数据,包括对象存储、自治驾驶数据库、本地部署系统等等。③元数据管理:数据目录应支持主题专家通过企业业务术语表、标签、关联、用户自定义注释、分类、评级等形式来贡献业务知识。④自动化和数据智能:对于大规模数据,人工智能和机器学习通常必不可少。因此,数据目录应利用 AI 和机器学习技术来处理所收集的元数据,让所有可以自动化的手动任务都实现自动化。此外,人工智能和机器学习还可以切实增强数据功能,例如为数据目录用户以及现代化数据平台上其他服务的用户提供数据建议。⑤企业级功能:您需要利用强大的企业级功能来正确使用您至关重要的数据资产,例如身份与访问管理功能以及基于 REST API 的重要功能。同时,这还意味着客户和合作伙伴可以贡献元数据(例如自定义收集器),通过 REST 公开其应用中的数据目录功能。除此之外,您的数据目录还应当成为事实上的系统目录,从而为所有持久层(例如对象存储、Hadoop、数据库和数据仓库)以及跨所有数据存储运行的查询服务提供抽象。正是因为如此,数据目录已不再仅仅是锦上添花,而是成为了一项必不可少的工具。来源:https://www.oracle.com/cn/big-data/data-catalog/what-is-a-data-catalog/
  • [技术干货] 数据架构建设方法及案例
    数据架构的本质是数据模型和数据流(或叫数据分布),《华为数据之道》将数据架构分为数据资产目录、数据标准、数据模型及数据分布,DAMA将数据架构分为数据模型和数据流设计,差不多就是这个意思。但数据架构到底如何构建?有没有现成的案例可以参考呢?今天就结合企业管理信息域MSS具体案例跟大家讲一讲数据架构建的建设方法论,主要分为五个步骤:架构现状分析、数据实体梳理、数据主题域划分、数据概念模型及数据分布规划。1、架构现状分析每个企业面临的数据架构问题都是不一样的,这里给出某企业管理信息域(MSS)面临的信息架构挑战:MSS域数据缺乏统一的数据分布规划,数据认责不明确,各个部门只负责自己业务范围内的数据管理,对于跨部门,跨系统的数据管理职责没有明确定义。MSS域数据分散在众多小系统中,每个系统都在局部进行数据定义,数据分类,数据主题域划分,数据模型维护,缺乏统一的、全局视角的数据视图,导致多个系统间数据不一致,难以支撑跨系统、跨部门的数据分析。2、数据实体梳理根据应用功能架构,列出核心数据实体,描述核心实体的主要信息内容,根据应用框架,考察数据实体完整性,寻找差异点,弥补空白点。第一步:依据应用蓝图,从功能模块中提炼核心数据实体,同时可参考业界最佳实践,对缺失数据实体做有效补充,如下图所示,如果企业应用蓝图不全面,那这一步的梳理工作就比较艰难。第二步:依据应用蓝图所划分的领域,对核心数据实体做初步归并,识别MSS域核心实体类别,如下图所示:3、数据主题域划分参考行业最佳实践,结合企业实际情况,划分MSS域数据主题域,如下图所示:下图是针对采购与供应商主题域的详细说明:4、数据概念模型数据概念模型描述了数据实体及其关系,通过数据概念模型能够体现企业运营和管理过程中涉及的所有业务概念和逻辑规则,下图是概念模型的示例:下图是采购与供应商主题域概念模型:5、数据分布规划描述企业数据模型在企业IT系统如何分布,通过了解数据分布可以清楚定义企业数据在IT系统中是如何产生和使用。第一步:明确数据主题域所归属的系统第二步:明确CRUD(CRUD 是建立 (Create)、读取 (Read)、更新 (Update)及删除(Delete)这四项操作的缩写),即系统中的核心数据由哪些系统产生,哪些系统有权利去读取这些数据,这些数据的更新权和删除权又属于哪些系统,通过数据CRUD规划,确保数据的安全以及在数据不一致时很容易确定以哪个系统的数据为准。下图示例了采购与供应商主题域CRUD规划:通过以上五步,数据架构的设计就基本完成了,至于逻辑模型、物理模型那就是操作层面的事情了。来源:ITPUB
  • [技术干货] 全国首批“数据经纪人”在广州海珠区诞生
    近年来,数字经济发展速度之快、辐射范围之广、影响程度之深前所未有,成为拉动经济增长的重要动力。数据作为数字经济发展的核心引擎,已成为与土地、劳动力、资本、技术并列的“第五新型生产要素”,是政府、企业和社会组织的重要资产与战略资源。数据是一种生产要素,只有能流动、可流转、快流通,才能产生价值。如何让海量丰富的数据有序高效“动起来”,是推动数字经济健康可持续发展的“必答题”。5月23日,经广东省政务服务数据管理局批准同意,在市政务服务数据管理局支持下,海珠区率先推出全国首批“数据经纪人”名单,分别是广东电网能源投资有限公司、广州金控征信服务有限公司、广州唯品会数据科技有限公司。首批入选的三家“数据经纪人”企业,涉及电力行业、电子商务、金融等领域。拥有丰富的社会数据和成熟的运营经验,期待通过此次试点能为全面推行数据经纪人制度积累可复制、可推广的“海珠经验”,为数据要素市场化配置改革输出数据流通创新的“海珠解法”。1、为什么率先诞生在珠海?海珠区作为广州市唯一被珠江前后航道环绕的岛区,拥有国家级新型工业化产业示范基地——琶洲人工智能与数字经济试验区,正构建“一区一谷一圈”发展布局,聚焦“算法、算力、算量”人工智能发展三大支柱,打造“琶洲算谷”。数字产业基础雄厚,拥有数字创意相关规上企业218家,形成了从场景应用、宣传推广、互动体验、投融资一体化的产业生态。数字支撑能力突出,汇集国家级重点实验室、工程技术开发中心、企业技术中心9家,省级重点实验室、企业技术中心35家。数字场景应用丰富,创新推出数字孪生、泛在感知、AI文旅、数图治理、智慧城管等十大智慧应用场景。据海珠区政协副主席、区政务服务数据管理局局长黄津介绍,广东省在全国率先开展数据要素市场化配置改革,提出包括“数据经纪人”在内的制度性创新举措。在省、市关心下,海珠区成为全省唯一的“数据经纪人”“首席数据官”“数据生产要素统计核算”创新改革“三试点”单位。海珠区积极落实省、市关于数据要素市场化配置改革的工作要求,紧扣数据要素市场化配置改革发展主题,在2021年12月出台了全国首份“数据经纪人”试点工作方案,充分凸显区域特色,探索打造数据要素市场化配置改革“先行地”。2、什么是“数据经纪人”?理解何为“数据经纪人”,是推动试点工作的基石。 为厘清“数据经纪人”的准确概念,由海珠区政务服务数据管理局牵头,在多轮深入市场一线调研、组织多场专家学者讨论、多次到相关单位走访学习后,盖在“数据经纪人”脸上的“面纱”慢慢被揭开。海珠区政务服务数据管理局负责人称,“数据经纪人”是在政府的监管下,具备开展数据经纪活动资质的机构。该机构要具备生态协同能力、数据运营能力、技术创新能力、数据安全能力和组织保障能力,围绕重点领域开展数据要素市场中介服务,推动数据流通规范化。3、“数据经纪人”主要有三方面的职责一是受托行权,即数据拥有者可以授权数据经纪人行使权力;二是风险控制,在数据流通交易过程中起到中介担保作用;三是价值挖掘,挖掘数据要素价值,充当数据价值发现者、数据交易组织者、交易公平保障者、交易主体权益维护者等多重角色。4、如何产生“数据经纪人”——首创珠海标准明晰“数据经纪人”概念后,接下来要解决的就是如何选取“数据经纪人”,海珠区独辟蹊径,首创“海珠标准”。经海珠区政务服务数据管理局深入研究,海珠区首创了“数据经纪人”分类分级标准:根据“数据经纪人”自身基础及业务范围可划分为技术赋能型、数据赋能型、受托行权型三个类别;按照企业数据管理能力成熟度等级、信息安全等级保护等级、企业自有(或实际控制)数据规模等条件,以及相关试点企业数据采集和处理是否符合国家相关安全要求等因素,将“数据经纪人”分为三个等级。海珠区首创的分类分级标准,进一步明确“试点门槛”,提升试点覆盖度,为专业评估和专家评审提供标准依据,能更具针对性、科学性地筛选“数据经纪人”,为形成可复制、可推广的试点经验打牢基础。5、“数据经纪人”怎么干?——鼓励大胆探索选出优质的“数据经纪人”试点企业,只是“万里长征”第一步。如何指导试点企业开展探索工作,是试点创新的关键所在。海珠区的做法是 “规定动作”和“自选动作”相搭配,有收有放,有合有开,鼓励“数据经纪人”创造性开展试点工作。据海珠区政务服务数据管理局负责人介绍: 一方面,为“数据经纪人”设立“规定动作”,优先在电力、金融、电子商务等社会数据丰富的重点领域进行试点,明确试点工作机制、工作内容、业务范围、业务场景等相关内容,并指导“数据经纪人”配合开展相关调研、检查和评估; 另一方面,鼓励“数据经纪人”创新“自选动作”,根据各自领域特色,科学有序地探索数据经纪业务。6、如何保障“数据经纪人”的健康发展——包容审慎监管开展数据要素流通探索,尚无样板可借鉴,可依循经验寥寥。海珠区注重把握包容与审慎的辩证统一,通过与试点企业签订“信任协议”来兼顾安全可控与创新突破,既为新兴业态活动留出充足空间、避免错失发展机遇,又稳妥审慎监管、避免造成严重后果。值得期待的是,海珠区将探索引入“监管沙盒”模式,以“慎监管、重引导、抓责任”为主线,对“数据经纪人”做到“充分指导”“无事不扰”,为数字新业态新模式的萌芽成长提供深厚“土壤”。
  • [云实验室] 论《 数据库服务实践》如何避坑,100%完成
    评价问题,均以解答:实验链接:沙箱实验室_在线实验_上云实践_云计算实验_AI实验_华为云官方实验平台-华为云 (huaweicloud.com)1、ping RDS连接的公网IP(无法直接ping通,需要放通ICMP协议端口2、-h (RDS连接公网IP) -uroot   -p(无需空格)自定义RDS密码完成
  • [技术干货] 数据资产如何确权认责?
    2020年04月10日,中共中央、国务院印发《关于构建更加完善的要素市场化配置体制机制的意见》,《意见》将数据定义为与土地、劳动力、资本、技术并列的第五大生产要素——数字化时代的一种新型的生产要素。数据的价值越来越重要!然鹅!土地有土地产权,劳动力有劳动产权,资本有资本所有权,技术有知识产权,这四大生产要素在法律上都有明确的权益和职责归属。但对于“数据”,各个国家的法律似乎还没有准确界定数据资产权责体系。今天我们来聊聊数据资产管理中的确权认责问题。 01 数据确权,确的是什么权? 所谓数据确权,就是确定数据的权利属性,主要包含两个层面:第一是确定数据的权利主体,即谁对数据享有权利。第二是确定权利的内容,即享有什么样的权利。 从这两个层面看,数据从产生到消亡的整个生命周期中,主要涉及四类角色,即:数据所有者、数据生产者、数据使用者和数据管理者。而确权就是针对特定的数据资产明确定义这四类角色的过程。也就是说,不同的数据资产其所有者、生产者、使用者和管理者可能不同。引用我的新书《一本书讲透数据治理》关于这四类数据角色的定义: 1、数据所有者 即拥有或实际控制数据的组织或个人。数据所有者负责特定数据域内的数据,确保其域内的数据能够支持跨系统和业务线受到管理。数据所有者需要主导或配合数据治理委员会完成相关数据标准、数据质量规则、数据安全策略、管理流程的制定。数据所有者一般由企业的相关业务部门人员组成,根据企业发布的数据治理策略、数据标准和数据治理规则要求,执行数据标准,优化业务流程,提升数据质量,释放数据价值。在企业中,数据所有者并不是管理数据库的部门,而是生产和使用数据的主体单位。 2、数据管理者 数据管理者不一定拥有数据的所有权,而是由数据所有者授权自行数据管理的职能。在很多传统企业,数据管理者往往隶属于数据所有者。数据管理者并不包揽所有的数据治理和管理工作,部分数据治理和管理工作需要由业务部门和IT部门共同承担。 3、数据生产者 即数据的提供方,对于企业来说,数据生产者来自人、系统和设备。例如:企业员工的每一次出勤、财务人员的每一笔账单、会员的每一次消费都能一一被记录;企业的ERP、CRM等系统每天都会产生大量的交易数据和日志数据;企业的各类设备会源源不断地生产大量数据,并通过IoT整合到企业的数据平台中。 4、数据使用者 即使用数据的组织或个人,例如:申请数据、下载数据、分析数据等。在企业中,数据的生产者、所有者和使用者有可能是同一个部门。例如,销售部门以CRM系统为依托,既是客户数据的生产者,也是客户数据的使用者,还是客户数据的所有者。 02 数据资产管理为什么要确权? “数据资产管理为什么一定要确权,在过去的很多年,没有明确数据确权不一样也能用吗?”,这可能是很大一部分人的疑问。 笔者认为数据资产管理之所以要进行确权,主要有以下3方面原因: 1、数据确权是数据资产化的基础 “数据资产的是由组织合法拥有或控制并且能够给企业带来经济效益和社会效益的数据资源”,这是数据资产的定义,从这个定义中也不难看出,数据要成为资产,必须要有一个明确的权属主体。从会计的角度,没有明确的数据权属,数据资产永远也进入不了企业的财务报表。从法律的角度,没有明确的数据权属,数据滥用的问题将无法解决。从数据的管理和使用角度,没有明确的数据权属,数据的质量问题将无法溯源、无法解决。2、数据确权是数据交易和流通的前提 任何东西要实现交易,首先都需要确权。数据同样如此! 由于数据复制成本相对生产成本来说极低,数据易被复制和传播,造成数据使用者损害数据所有者权益的情况十分普遍。故而合理界定数据权属是亟须解决的问题。只有明确了数据的权属,才能对数据进行估值,之后才是交易和流通。 3、数据确权是保护个人数据安全的重要手段 由于数据权属一直是一个模糊不清问题,在ToC端尤为突出。互联网用户每天产生的大量的数据,到底是归互联网公司所有,还是归用户个人所有?从法律角度讲,个人信息归个人所有,但事实上我们从来没有享受到拥有这些数据的权益。而互联网公司往往是通过所谓的用户协议、个人信息保护协议,约定了用户产生的数据归企业所有。由数据权属界定不明,导致了信息滥用,大数据杀熟,网络诈骗、非法数据交易等侵害个人信息的问题日趋严重。 03 数据认责,认的什么责? 权利和责任是一定是并存的,在享有数据权益的同时需要对数据负责。在企业数据资产管理实践中,所谓的数据认责,更多的是指“谁对数据的质量属性负责”! 通常,企业中数据的所有者、生产者、使用者、管理者都是比较容易识别的,但是一旦出现数据质量问题,在追责问责时候,它就常常会变成一个部门之间或业务与IT之间相互推诿的问题。 举个例子,企业在盘点库存时,经常会发现ERP系统中的物料库存数据与实物的库存数据存在差异。业务部门会说IT部门没有提供完善的系统功能,导致数据错误,而IT部门则可能责怪业务部门操作不规范。事实上,出现这种问题,最大的可能是业务的出入库操作重复或在列出库存项目时有遗漏,或者库存物料的描述不准确,位置不正确。 当涉及库存时,通常是由仓库管理员负责确保库存数量准确。作为数据质量改进和控制的一部分,这可能需要对系统中的物料建立统一的编码规则并实施数据清洗,还可能需要对实物库存进行重新贴标签。而这些决策永远不会成为单纯的IT问题,也不会落入IT部门,这很明显。 很多企业搞数据治理项目,建立了数据问责制度。但在笔者看来,数据问责制只是数据治理的手段,而不是数据治理的目的,企业要做的是提高数据质量和实现业务目标,而不是在发生了数据问题后去追究责任。 数据问题的重点在于预防,问题发生了再去追责则为时已晚。谁对数据质量负责?当你遇到这样的困惑时,不妨试着先回答以下几个问题。 认识问题:什么是好的数据质量?为什么它很重要? 定义问题:测量数据质量的维度有哪些?数据一致性、完整性、正确性、及时性? 衡量问题:数据质量对业务使用和管理决策有何影响? 分析问题:找到数据质量问题的根本原因,是管理问题、业务问题还是技术问题? 改善问题:哪些关键业务流程的改善有利于提高数据质量?如何改善? 控制问题:是否有数据质量管理章程,包括问题和目标描述、范围、里程碑、角色和职责、沟通计划? 把以上问题都想清楚之后,究竟“谁该对数据负责”就不是那么重要了。 笔者认为,数据质量人人有责,谁生产谁负责,谁拥有谁负责,谁管理谁负责,谁使用负责。数据所有者主要负责制定数据管理政策,维护数据资产目录并分配数据认责权限,确保所拥有的数据可查、可用、可共享;数据生产者负责执行数据管理规则,按照数据标准进行规范化录入各项数据并解决相关数据问题;数据使用者要确保数据的正确、合规使用,以及数据在使用过程中不失真;数据管理者主要协助数据所有者制定数据标准、质量规则、安全规则并监控相关数据问题,同时制定确保数据管理的流程,并确保其有效执行。 那么,IT部门在这个过程中,扮演什么角色,承担什么责任? 从笔者经历的项目实践来看,在大部分数据治理项目中IT部门都起着推动者的作用。而在数据运维/运营过程中,IT部门往往是承担数据保管员的职责,同时为数据管理者提供技术支持,推动数据架构、标准和规则等内容的落地。 有人可能会提出质疑:数据管理员和数据保管员不是一回事吗?你是不是又造概念了?这还真的不是在造概念。接来下,我们就详细分解。 04 数据管理员 VS 数据保管员 1、数据管理员 数据管理员——顾名思义,就是数据管理者的一员。哈哈,这个定义是不是很接地气! 大多数数据管理员来自各自的业务部门,他们隶属于数据所有者,通常由数据所有者指定或授权执行数据的定义和控制活动。因此,在DAMA-DMBOK2中,也称为他们“业务数据管理员”(Business Data Stewards),一般都是业务领域的专业人士,公认的业务领域专家,对一个数据域负责。 以财务部门为例,CFO或财务总监很可能是所有财务数据的数据所有者,那么财务部门的每个小组的负责人将被任命为数据管理员,例如:核算数据管理员——负责财务核算数据的管理,并出具企业财务报表和管理集团合并报表;资金数据管理员——负责资金数据管理,以及统计和分析;预算数据管理员——负责各企业经营预算执行情况的数据的管理,以及统计和分析。 我们经常看到,在很多数据治理组织结构体系中的数据管理员都是其中的一个重要组成部分,他们负责企业数据的运营和管理,并在数据管理的各种例行会议或专题会议中作为数据所有者的代表,提出数据管理的改进意见和建议。 在数字化时代,每个企业都需要培养起来一批懂业务、懂数据、甚至懂数据分析、数据管理的相关技术的数据管理员。这批人将是企业数字化转型的中坚力量! 2、数据保管员 数据保管人通常由是 IT 部门负责,其职责与其他角色,如:数据所有者和数据管理员存在根本不同,业务数据管理员侧重域业务,而数据保管员专注于技术。他们通常在其技术专业领域进一步划分不同的角色,例如:数据建模、数据架构、数据集成、数据开发等,当然还有传统的DBA(数据库管理),他们主要负责维护、归档、恢复、备份数据、防止数据丢失/损坏等。 关于数据保管员在DAMA-DMBOK2中也有相关的定义,DMBOK2称其为:技术数据管理专员(Technical Data Stewards),即:某个知识领域内工作的IT专业人员,如数据集成专家、数据库管理员、商务智能专家、数据质量分析师或元数据管理员。 数字化时代,企业需要培养或引入一批具备专业的技术知识、技能和经验,具有良好的数据管理最佳实践的人才,他们是企业数据管理域组的一部分,是企业数字化转型的主要支撑。 如果你觉得数据管理员、数据保管员实在不好区分,那就按DAMA的叫法:业务数据管理员、技术数据管理员。 笔者之前写的《企业数字化转型:IT部门的未来!》的时候,称提到:企业数字化转型需要技术和业务要深度融合,让IT走进业务,让业务融入IT。那么,让业务数据管理员和技术数据管理员一起工作就是一个很好实践。 05 数据确权认责,怎么做? 权利和责任就像一个硬币的正反两面一样密不可分,享有多大大的权利就需要承担多大的责任。 数据的确权认责首先需要破除的一个认知误区:“认为数据是由IT部门负责的”。然而,从前文中的数据确权认责相关条例来看,企业数据质量和安全真的不应该由IT部门责任,IT部门也负不了这个责任。事实上,IT部门只是企业信息系统的实施者、维护者或为数据管理提供技术支持,在企业的数据治理过程中,数据的生产者、所有者、使用者、管理者才需要真正对数据负责。 企业的数据资产项千千万,数据确权认责是一个巨大的工程量,不可一蹴而就,需要分批次、分阶段,循序渐进的去完成。企业数据资产确权认责流程如下: 1、数据梳理和盘点 划分数据域,按数据域开展资源盘点工作,梳理本专业数据资源,梳理数据实体,识别数据属性。数据资源盘点完成后,数据管理部门发起数据资源登记注册,形成数据资产目录。一般建议企业采用“问题+价值”双驱动的策略,优先对问题多发且对业务影响较大的数据项开展认责管理,通过责任落实改善和提升数据质量,从而控制和解决问题,支撑业务发挥价值。 2、建立认责关系矩阵 基于数据资源目录,识别各专业领域认责的数据实体,建立数据实体与组织机构各方(集团公司、分子公司的相关责任部门)之间的权责矩阵。认责关系矩阵需要将相关数据责任落实到对应岗位人员的日常工作和数据操作中。责任的落实需要结合数据标准的贯标开展,强调认责与规范录入行为同步,避免数据问题的发生。 3、梳理操作细则 在公司层面梳理出认责数据项所对应的关键业务流程、节点名称、系统名称及其它关联数据项,并组织数据管理者和使用者梳理所属企业的数据管理要求,并明确到具体的二级部门、业务操作岗位,以及数据操作权限(CURD),明确相关岗位应用承担的数据责任,明确岗位认责数据范围,对数据录入、审核责任给出相应的操作指南。 4、制定认责制度 在认责矩阵和操作细则基础之上,企业应从专业层面梳理相关数据实体、属性的数据管理要求,例如:数据质量要求、数据安全和个人隐私保护要求、数据标准规范等,形成数据管理制度手册。为进一步规范数据相关方的管理和使用行为提供制度约束。 06 数据确权认责,需要注意什么? 数据的确权认责是一个复杂的系统工程,需要结合企业的数据战略、数据标准、数据管理制度和流程以及IT系统的建设,有目标、有重点、有范围、有针对性的推进。 切记:一口吃不了个胖子,更不能眉毛胡子一把抓!要注意以下六个“明确”: 1、认责目标要明确,数据认责数据治理并行,要能够体现治理的价值,认责的效果。 2、认责范围要明确,“问题+价值”双驱动,优先对问题多发且对业务影响大的数据项开展认责管理。 3、认责粒度要明确,数据粒度,具体到数据库、数据表还是数据字段级别;责任主体粒度,具体到部门、岗位还是人员级别。 4、认责角色要明确,数据的应用价值链和生命周期中,谁是所有者、谁是生产者、谁是管理者、谁是使用者需要定义清楚。 5、认责职责要明确,配合认责关系矩阵和CURD,明确定义:谁,在什么系统,操作什么,操作规范。 6、认责机制要明确,制定及发布数据标准,编制数据认责管理办法及流程,数据标准与管理制度并举,确保数据确权认责常态化运转。
  • [技术干货] 数据资产盘点原则与方法
    导读:在当前的大数据背景下,数据作为数字经济的关键要素已经得到广泛认可。企业需要为广泛的数据消费需求提供优质数据供给,而数据资产盘点是实现这一需求的基础性工作。近年来,随着生产力水平的逐渐提高、社会关系的不断进步、经济活动的日益发展及移动互联网、物联网、智能终端等技术的广泛应用,各类数据资源的积累呈现出爆炸性增长的趋势。 数据资产概念的理论研究大致经历了从信息资产、数字资产到数据资产的发展过程。“信息资产”最早由Stuart Kaback于1977 年介绍一款索引系统时提及,他认为该系统是一种无价的信息资产,1981年,Forest W. Horton给出信息资产定义,并指出信息资产与其他资产存在重大差异。 1995年,英国路透社的《信息作为一种资产:无形的金矿》一文报道了对500名英国公司高管进行关于信息资产的调查情况,调查显示超过25%的公司表示信息是其最重要的资产。上世纪90年代开始,“数字资产”开始成为研究热点。1996年,Helen Meyer最早提出了数字资产概念。2006年Albert Va n Niekerk给了数据资产定义。2009年,国际数据管理协会《DAMA数据管理知识体系指南》指出:数据被认为是一项重要资产。数据资产的概念早在1974年便被学者Richard Peters提出,他认为数据资产包括持有的政府债券、公司债券和实物债券等资产。随着时间的推移,人们对数据资产的认识不断深入,其重要性愈发显著。 2011年,世界经济论坛发布的《个人数据:一种新资产类别的出现》报告中指出个人数据正成为一种新的经济“资产类别”。2018年4月,中国信通院发布的《数据资产管理实践白皮书(2.0版)》中将数据资产定义为“由企业拥有或者控制的、能够为企业带来未来经济利益的、以物理或电子的方式记录的数据资源,如文件资料、电子数据等”。现阶段的数据资产发展已经进入智能数据基础阶段,企业将数据供应链上的各个环节通过智能化、自动化方式进行改造,实现程式化的数据采集与数据应用,规范管理的数据湖,智能化的数据接入、数据管理和数据供给,广泛的自助分析,并为数据消费提供智能数据供给服务。为实现数据供给的要求,一项重要的基础性工作便是数据资产盘点。只有通过全面梳理企业中作为资产的数据,才能使数据从业者了解数据资产全貌、绘制数据资产地图、有机串联数据的技术面与业务面,以便让企业中的数据能看清、可理解、相关联,进而为制定更好的数据策略、搭建更强的数据信任、实现更智能的数据应用打下坚实基础。01 目标和价值目前,国内各大企业经过多年的信息化建设,已积累了种类繁多、体量庞大的数据,并且随着业务的持续发展,业务范围、资产规模、客户规模均不断扩大,产生的数据规模也在快速增长。而数据规模的快速增长为企业带来了数字化转变、智能化变革的机遇,同时也对数据资产的掌控能力提出更高要求。 因此,全面推进数据资产盘点工作,是摸清数据资产家底、明确数据资产存量、识别数据资产范围、搭建数据资产地图的重要手段,也是准确识别出有价值的数据资产,并对数据资产开展统一规范管理,进而实现数据资产价值最大化和良性循环的重要基础性工作,开展数据资产盘点工作正当其时。总体上来讲,企业开展数据资产盘点工作的目标是通过开展企业级的数据资产盘点,明确企业数据资产全貌,助推数据资产全生命周期的统一管控,为数据资产的增值利用提供良好基础,促进数据价值变现。02 盘点范围企业开展数据资产盘点的过程中,需要结合所盘点的系统情况,划定系统中需要进行盘点的数据表范围。原则上仅针对各系统在业务环节源端产生的基础表,以及终端产生直接应用结果的数据表进行盘点。 具体来讲,可以结合数据资产的概念圈定盘点范围,即对“企业在运营活动中形成的,由企业拥有、全过程可控,并能给企业带来价值的数据”开展盘点,当拥有、可控、具有价值三个条件全部满足时,识别为数据资产盘点的对象范畴。企业数据资产可分为如下几个类型:(1)基础表:系统直接产生、直接反应业务运营情况的基础数据表,同时具有由该系统拥有、可控、具备应用价值的特征,是数据资产盘点的主要内容。需要注意的是,根据数据资产概念,仅对该系统拥有的数据表进行盘点,调用其他系统的数据不进行盘点,例如分析系统中调用的业务数据不进行盘点。(2)代码表:系统中的代码相关数据,属于参考数据,需要进行盘点。 (3)中间过程表:中间过程表由于具有临时性、变动性大的特点,不具备数据资产的可控性特征,且大数据分析、应用价值不高,因此不进行盘点。 (4)报表、指标:属于分析数据,是系统在运营分析后产生的相关结果,具有分析、共享价值。盘点时需要根据情况进行识别,仅对业务系统和分析系统中的固定报表进行盘点,对于变化频率高、自定义的报表不进行盘点。 此外,针对系统中不同数据表的特殊情况,进行实际盘点工作时,可根据数据特征、数据应用场景、数据分析价值进行进一步识别。03 盘点原则与方法3.1盘点原则为了更好地开展企业数据资产盘点工作,保证盘点过程安全稳定,保证盘点结果准确可靠,应遵循如下原则开展具体工作: (1) 前瞻性:数据资产盘点应该站在整个盘点旅程的角度进行规划和实践,充分考虑数据资产规范、搜索获取、分析应用、绩效评估、可视化展示等需求。 (2) 全面性:数据资产盘点范围要全面覆盖企业的所有数据资产,但在落地实践过程中,企业也可以分阶段开展盘点工作。 (3) 基础性:选择数据资产最稳定的本质属性或特征作为盘点内容,确保盘点内容不因环境因素而发生变化。 (4) 系统性:将需要盘点的数据资产的属性或特征按一定排列顺序予以系统化,并形成一个合理的分类体系。 (5) 确定性:对于盘点范围内的任何一项数据资产,在分类体系中应该有唯一确定的基本单元与之相应。 (6) 可拓展性:目录框架应满足数据资产不断发展和变化的需求,允许在目录框架中增加新的盘点内容而不影响原有内容。为使用者进行延拓细化创造条件。 (7) 安全性:减少数据盘点工作对于业务活动和系统运行的影响,避免出现数据丢失或泄露等失误,给企业带来损失。 (8) 保密性:数据是企业重要资产,数据资产盘点过程中,盘点人员要严格遵守保密要求,避免触及敏感信息。3.2盘点方法数据资产盘点工作,整体包括准备阶段、盘点阶段、汇总阶段三部分流程,其中,盘点阶段根据所盘点系统的不同类型和特征,包含4个子流程,分别针对套装软件、自开发系统、分析系统、数据仓库开展盘点工作。3.2.1 准备阶段不同系统对于盘点文档的需求存在差异,盘点开始前,需对获取或生成的业务及技术文档准备情况进行核查,确认文档可供盘点使用。同时,向各盘点系统运维支持人员申请各系统查询权限并确认。准备阶段主要工作可分为:(1) 确认操作权限由各系统运维支持人员提供各系统前台显示和后台数据库查询权限,盘点人员对所需用户权限在目标系统进行验证,为后续进行数据资产盘点打下基础。 (2) 形成数据字典系统数据字典是系统盘点过程中的重要依据,如技术支持人员能提供盘点系统的完整数据字典,由技术支持人员提供;如技术支持人员不能提供完整数据字典,需由技术盘点人员通过数据库工具导出该系统完整数据字典。(3) 形成功能操作清单针对系统功能文档不全的历史遗留系统,由盘点业务人员创建系统功能操作清单,支撑系统功能与业务分类的关系对照。(4) 进行业务分类根据盘点系统的业务定位,参考组织已有的业务分类体系,补充完善业务分类体系。(5) 确认盘点文档完整根据收集与自主生成的文档,确认盘点文档是否完整。3.2.2 盘点阶段(1) 定位数据资产 圈定需要盘点的数据资产范围,明确盘点对象清单,为后续进行数据资产盘点打下基础。 1) 定位数据资产:对照文档及系统,判断文档与系统一致性,定位业务流程涉及的数据资产和其它在套装软件中自开发数据资产的盘点范围。 2) 自动生成盘点表格:以数据资产名称为基础,自动生成盘点表格,盘点表格仅包括《数据资产盘点表格》部分,生成的盘点表格会自动填写数据资产分类、系统名称、指标编码三部分内容,并根据系统情况自动填写其他属性的部分内容,供后续盘点使用。(2) 填写盘点表格由业务盘点组和技术盘点组根据系统前台信息及后台数据情况,分别进行数据资产盘点表格初步填写,并收集需要沟通的业务及技术问题。 1) 明确业务分类:基于系统业务流程设计,根据已有的业务分类体系,对已经与业务流程关系的数据资产的业务分类进行识别。 2) 查询数据量:打开数据浏览器,查询数据量,计算新增条数(每月)。 3) 根据数据字典填写盘点表格:根据数据字典的信息,填写《数据资产盘点表格》的管理属性、技术属性和技术属性,以及《数据资产项盘点表格》的管理属性和技术属性。(3) 沟通及补充完善基于已收集的问题,与相关业务部门、技术支持组进行集中沟通或现场讨论,并对数据资产盘点表格进行补充完善。沟通业务部门,完善管理属性。 针对相关的业务及管理问题,集中与相关业务部门开展讨论,可采用集中会议、邮件等形式。 针对相关的技术及资产问题,集中与系统开发厂商,即技术支持组开展讨论可采用集中会议、现场讨论等形式。 (4) 汇总整理汇总形成数据资产目录:在数据资产盘点初步完成后,业务人员对数据资产盘点表格进行汇总,并使用工具对部分内容进行生成或批量标准化转换。3.2.3汇总阶段汇总阶段需要将所有盘点系统的盘点结果合并,形成统一的数据资产目录,并完善关联资产名称和数据资产编码。 主要工作包括:1)汇总形成数据资产目录:汇总各类盘点子系统形成的数据资产目录,合并生成统一的《数据资产盘点目录》。 2)完善关联资产名称:使用自动化工具,将《数据资产盘点目录》中关联资产内容中的代码转换为数据资产名称。 3)形成数据资产编码:使用组织规划数据资产统一编码规则,生成数据资产编码。04 总结本文综述了信息资产、数字资产、数据资产的概念形成和发展过程,讨论了企业进行数据资产盘点的重要性和必要性。在此基础上,本文给出了包含基础表、代码表、指标和报表的企业数据资产盘点范围,并详细阐述了企业数据资产盘点的具体实施步骤,包括准备阶段、盘点阶段和汇总阶段。研究结果表明,全面推进企业数据资产盘点工作,并正确地划定企业数据资产盘点范围并形成完善的资产盘点方法论,能够摸清企业数据资产家底,明确数据资产存量,识别数据资产范围,并深入促进数据资产应用,更好地发挥数据资产价值。
  • [技术干货] 数据质量管理办法
    数据质量管理(Data Quality Management),是指对数据从计划、获取、存储、共享、维护、应用、消亡生命周期的每个阶段里可能引发的各类数据质量问题,进行识别、度量、监控、预警等一系列管理活动,并通过改善和提高组织的管理水平使得数据质量获得进一步提高。数据质量管理是循环管理过程,其终极目标是通过可靠的数据提升数据在使用中的价值,并最终为企业赢得经济效益。1 范围本标准规定了XX公司数据质量管理内容、管理机制和工作流程。本标准适用于XX所有项目整个生命周期的数据质量管理,非项目可参照使用。 2 术语和定义下列术语和定义适用于本文件数据质量data quality客观反映业务数据固有特性的程度。 注:“固有的” (其反义是“赋予的”)就是指在某事或某物中本来就有的,尤其是永久的特性。 数据质量管理 data quality management对数据从计划、获取、存储、共享、维护、应用、消亡生命周期的每个阶段里可能引发的各类数据质量问题,进行识别、监控、预警、处理等一系列管理活动,并通过改善和提高管理水平使得数据质量获得进一步提高。 技术评估 technology assessment科技主管部门对已审批的业务需求,组织相关部门和人员进行技术可行性评估,并作出评估结论的活动。 数据质量监控 data quality control获取业务各环节的数据质量信息,结合有关检查规则和采集规则,对数据质量情况进行诊断,并及时向数据质量管理实施部门报告的活动。 数据质量评估 data quality assessment由数据质量管理实施部门根据需要发起,得到评估结果并作为依据评估指标和评估方法进行评价,数据质量改进的参考和依据。 数据质量报告 data quality report对数据质量日常监控以及质量评估等过程累积的各种信息进行汇总、梳理、统计和分析,形成统计报告的过程。 数据质量知识 data quality knowledge在数据质量管理活动中获取的有关数据质量问题处理的经验和成果。 3 数据质量管理内容与评价原则3.1管理目标与内容数据质量管理目标数据质量分为绝对质量和过程质量,绝对质量是指业务数据的真实性、完备性和自洽性,过程质量指业务数据的使用质量、存储质量和传输质量。数据质量管理目标包括:a)建立稳定运行的数据质量测控体系,及时发现并改正数据质量问题; b)建立可靠的数据质量评估流程,判断改进趋势,衡量数据质量改进效果; c)建立一套改进、提升数据质量的管理机制。 数据质量管理内容数据质量管理内容包括: a)制定、修订数据质量管理遵循的标准; b)确立、修订数据质量管理工作流程、优化部门协同机制; c)制定数据质量管理决策机制; d)监督日常数据质量管理的有序进行; e)数据质量的核查。 数据质量影响要素数据质量影响要素包括: a)信息类要素:由于对数据本身的描述、理解及其度量标准偏差而造成数据质量问题的影响要素; b)技术类要素:由于具体数据处理的各技术环节异常而造成数据质量问题的影响要素,技术实现上的某种缺陷是其产生的主要原因; c)流程类要素:由于系统作业流程和人工操作流程设置不当造成数据质量问题的影响要素; d)管理类要素:指由于人员素质及管理机制方面的原因造成数据质量问题的影响要素。 3.2 数据质量评价原则数据质量评价原则包括: a)完整性:数据是充分的,任何有关操作的数据都没有被遗漏。主要包括实体不缺失、属性不缺失、记录不缺失和字段值不缺失; b)唯一性:数据值被约束成一组独特的条目,每个值都是唯一的。主要包括主键唯一和候选键唯一; c)准确性 :数据必须真实准确的反映实际发生的业务; d)精确性:计量误差、度量单位等方面的精确度应符合业务需求; e)一致性:描述数据结构、数据值和他们的相互关系符合逻辑规则的程度。如统一数据来源、统一存储和统一数据口径; f)及时性:数据更新、修改和提取等的快速性程度,应符合业务需求; g)合规性:数据格式、类型、域值和业务规则的有效性。 4 相关部门职责4.1概述相关部门包括以下部门:业务主管部门、技术主管部门、技术承办单位和数据质量管理实施部门。 4.2业务主管部门职责主要职责包括: a)对于拟开发的应用项目,对相关业务提出数据质量约束性需求; b)对于在开发的应用项目,从业务角度提供数据质量检测方法和验收标准; c)对于已运行的应用项目,根据应用状况提出数据质量问题和改进建议; d)受理与本部门业务相关的数据质量管理协同通告,并作出处理反馈。 4.3技术主管部门职责技术主管部门是数据质量的主管部门,主要职责包括: a)组织制定、颁布数据质量管理、保障、控制和维护流程; b)组织制定、颁布数据质量管理和技术相关标准; c)监督数据质量问题处理的整个流程并对数据质量的监控结果进行评估; d)组织、协调相关部门,解决数据质量管理活动中的异常问题; e)受理、审批数据质量需求变更; f)针对已处理的数据质量问题发起处理效能评估; g)数据质量管理其他有关事项。 4.3技术承办单位职责主要职责包括: a)协助数据质量管理实施部门解决业务应用系统数据质量问题; b)协助业务主管部门提出数据质量管理的业务需求; c)协助数据质量管理实施部门处理数据质量需求变更评估。 4.4数据质量管理实施部门职责受技术主管部门委托,负责数据质量管理的具体实施。主要职责包括: a)监控数据质量问题; b)提出数据质量问题改进建议; c)依据数据质量管理处理流程,负责数据质量管理系统运维; d)处理数据质量监控系统告警,并向相关部门通告数据质量问题; e)经主管部门授权后,负责组织解决相关的数据质量问题; f)组织处理数据质量需求变更的评估; g)形成报告并报技术主管部门; h)协助业务主管部门提出数据质量管理的业务需求。5 数据质量管理工作流程 工作流程图,数据质量管理流程工作流程见图 1。注:图中虚线表示为可选流程。 关键环节说明 业务需求提出业务主管部门依据业务工作的实际情况,向技术主管部门提出相关业务系统的业务需求。需求提出过程中,技术承办部门和数据管理实施部门应协助业务主管部门,就特定业务应用系统,归纳并提出业务需求。 业务需求审批技术主管部门在受理业务主管部门提交的业务需要后,应对业务需求在规定时限内进行审批,并将审批意见告知业务需求提出部门。 技术评估对于审批通过的业务需求,数据质量管理实施部门应在规定时限内,组织相关部门和人员,对业务需求进行技术评估,并给出评估结论。 技术承办单位,应协助科技主管部门开展业务需求的技术评估。 系统设计开发技术承办单位对已完成技术评估的业务需求,应依据业务需求组织并实施应用系统的设计与开发。 测试验收对于技术承办单位已完成开发的应用系统,其业务主管部门应在规定时限内组织测试与验收。 技术承办单位和数据质量管理实施部门应协助业务主管部门,完成测试与验收。 系统上线运维对业务主管部门已验收的应用系统,数据质量管理实施部门应组织实施应用系统的上线和日常运维工作。 技术承办单位应协助、配合数据质量管理实施部门开展应用系统的上线工作。 数据质量监控对已上线的应用系统,数据质量管理实施部门应利用数据质量管理系统,开展数据质量监控,并定期提供数据质量监控报告。 告警分析与问题通告在数据质量监控过程中产生的告警信息,数据质量管理实施部门应在规定的时限内开展告警信息分析,并对告警产生的原因作出判定。 对于一般性告警信息,数据质量管理实施部门可直接按照操作规程给予处理,如:系统断电等原因产生的告警;对于严重告警信息,应将告警产生的问题通告技术主管部门和相关业务部门。 注:一般性告警是指系统运行环境异常或操作失误等导致的、具有偶发性、在短期内恢复且不产生严重后果的数据质量监控告警。 问题处理授权技术主管部门在受理数据质量管理实施部门通告的数据质量问题后,应组织协调问题所涉及的相关部门,协同确认并授权数据质量管理实施部门解决问题。 问题解决数据质量管理实施部门在获得授权后,应组织开展解决问题的工作并予以完成。 技术承办单位应协助数据质量管理实施部门解决问题的工作。 处理结果确认对已处理的数据质量问题,数据质量管理实施部门应将问题处理结果在规定时限内通告技术主管部门、业务主管部门和技术承办单位。 处理结果反馈各相关部门收到数据质量问题处理结果后,应在规定时限内对问题处理结果给予确认,并将确认结果和建议反馈数据质量管理实施部门和其他相关部门。 数据质量管理报告数据质量管理实施部门应定期编写数据质量监控报告,归档备查。 数据质量问题处理解决后应编写数据质量问题分析报告,报送相关部门。 对数据质量监控报告和问题分析报告进行总结,编写数据质量定期总结报告,报送相关部门。6 数据管理管理活动 数据质量管理活动主要如下: 数据资源变更管理数据资源变更会引起系统内部和系统外部的数据质量问题。数据资源变更管理主要是利用元数据管理的分析功能对系统变更信息进行影响评估,并将变更信息及时告知数据质量管理相关部门,协同各部门完成数据资源变更处理工作,避免变更引起的数据质量问题。 数据质量监控数据质量管理业务应在HG业务系统数据处理相关环节采集数据,供数据质量监控分析使用并存档。 数据质量分析根据监控数据对象性质的不同,采用多种定性或定量预警分析方法进行数据质量评价。 告警管理根据告警所反映的数据质量现象的严重程度、影响范围,设定严重性程度不同的告警级别。每一级别告警信息的发送都应具备多种送达手段。从数据采集、预警分析到告警生成,每个阶段都需进行程序化管理。 数据质量问题处理指对数据质量管理中产生的各类问题进行分析,并根据分析结果,方法进行处理,选择适当的方式、并根据处理效果归纳总结的处理过程。关键环节包括:问题发现、问题分析、问题通告、问题解决指派、问题处理方法设计、审评、实施和问题总结。 数据质量评估指利用各种评估方法(如:直接评估法和间接评估法),根据数据质量问题影响程度的不同,以评估报告等形式,对数据质量的给以评价和改进建议。 数据质量报告数据质量报告是对数据资源变更管理、数据监控、数据质量分析、问题处理以及数据质量评估等过程积累的各种信息进行汇总、梳理、统计和分析,形成统计报告的过程。数据质量报告的发布具有一定的时效性。用户应在所赋权限范围内查看质量报告,防止信息泄露。数据质量报告的归档要求将相关报告按照分类,作为后续数据质量问题处理和分析的参照。 数据质量知识管理历史数据质量知识的积累为数据质量问题的解决提供参考方法。数据质量知识主要来源于对数据质量问题的记录与总结,以及对问题解决过程自身的知识评价。数据质量知识的产生与利用过程是一个互相促进改良的过程,为数据质量管理的其他活动提供重要的支撑。 文章来源:“企业数字化咨询”
  • [技术干货] 《数据管理能力成熟度评估模型》概述
    《数据管理能力成熟度评估模型》(以下简称DCMM)是我国在数据管理领域首个正式发布的国家标准,旨在帮助企业利用先进的数据管理理念和方法,建立和评价自身数据管理能力,持续完善数据管理组织、程序和制度,充分发挥数据在促进企业向信息化、数字化、智能化发展方面的价值。信息技术与经济社会的交汇融合引发了数据爆发式增长。数据蕴含着重要的价值,已成为国家基础性战略资源,正日益对全球生产、流通、分配、消费活动以及经济运行机制、社会生活方式和国家治理能力产生重要影响。数据价值发挥的前提是管理好数据,然而,数据规模的增加、数据格式的复杂化等都给企业数据管理提出了挑战。《数据管理能力成熟度评估模型》(以下简称DCMM)是我国在数据管理领域首个正式发布的国家标准,旨在帮助企业利用先进的数据管理理念和方法,建立和评价自身数据管理能力,持续完善数据管理组织、程序和制度,充分发挥数据在促进企业向信息化、数字化、智能化发展方面的价值。1.  DCMM评估概述1.1 评估依据数据管理能力成熟度评估的依据是国家标准GB/T 36073-2018《数据管理能力成熟度评估模型》,该标准借鉴了国际上数据管理理论框架和方法,在综合考虑国内数据管理情况发展的基础上,整合了标准规范、管理方法论、数据管理模型、成熟度分级等多方面内容。1.2 评估内容DCMM数据管理能力成熟度评估模型定义了数据战略、数据治理、数据架构、数据应用、数据安全、数据质量、数据标准和数据生存周期八个核心能力域及28个能力项,并以组织、制度、流程和技术作为八个核心域评价维度。1.3 能力等级DCMM将数据管理能力成熟度划分为五个等级,自低向高依次为初始级、受管理级、稳健级、量化管理级和优化级,不同等级代表企业数据管理和应用的成熟度水平不同。2.DCMM贯标与评估流程2.1 贯标流程DCMM贯标流程主要分为三个阶段:差距分析:贯标启动,进行差距分析;能力提升:建立数据管理组织,完善制度,内部运行并开展自评估;评估确认:组建评估队伍,开展第三方评估,获取评估报告和能力证书。2.2 评估流程(1)评估工作部遴选试点评估单位。(2)入选的试点评估单位向评估机构提交有效的申请材料。(3)评估机构受理评估申请后,组织实施文件评审和现场评审并出具评估报告,给予评估等级的推荐意见,并报评估工作部备案。(4)评估工作部对评估机构报送的评估结果进行合规性审查。对于合规性审查中发现存在较大问题的评估结果有权驳回。对于评估机构推荐的量化管理级和优化级评估结论,评估工作部需组织专家对评估结果进行评议。(5)评估工作部对通过审查、复核或评议的,进行为期一周的公示。对公示后无异议的,由评估机构颁发数据管理能力成熟度评估证书。具体评估流程图如下:2.3 评估交付物(1)评分结果:全面展示企业数据管理各能力项成熟度评估等级。(2)评估报告:分析企业数据管理现状,识别数据管理问题及改进项,给出数据管理能力成熟度等级推荐建议。(3)数据管理发展路线图(可选):根据企业管理的需要,以及业界最佳实践,制定针对性的企业数据管理发展路线图,并且根据现状制定针对性的行动计划。(4)评估证书:颁发企业数据管理能力成熟度评估证书。3.DCMM评估企业收益(1)帮助和指导企业获得当前数据管理现状,识别与行业最佳实践差距,找准关键问题,提出数据管理改进建议和方向。(2)开展人员培训,提升企业数据管理人员技能,提高企业数据管理能力成熟度。(3)有机会参与数据管理优秀案例遴选以及成果展示系列活动。(4)以第三方客观评估结果为依据,对外展示企业数据管理能力,满足监管要求,传递信任。 4.DCMM主要适用对象(1)数据拥有方:金融与保险机构、互联网企业、电信运营商、工业企业、数据中心所属主体、高校、政务数据中心等;(2)数据解决方案提供方:数据开发/运营商、信息系统建设和服务提供商、信息技术服务提供商等。文章来源:http://www.360doc.com/content/22/0224/10/43305802_1018792250.shtml
  • [技术干货] 非结构化数据将在2022年继续影响数据管理
    2022年,非结构化数据将继续重塑数据管理的格局,现在不仅产生了空前数量的数据,而且还在多个地方收集、存储、处理和分析,并在这些环境之间移动。  企业正在使用视频、图像、物联网传感器数据、社交媒体和类似的信息,作为他们执行的很多分析、机器学习和商业智能任务的基础。随着我们进入2022年,非结构化数据将继续成为企业数据管理工作的重点。  那么,2022年我们还能期待哪些数据管理趋势呢?我们往下看:      IT领导者将专注于利用云技术从非结构化数据中获取价值  IT行业的领导者们知道,云计算远远不止是对本地基础设施的替代。它是一个弹性计算平台,组织可以利用它来提供竞争优势和灵活性。但我们还不知道如何利用云来分析非结构化数据。  随着人们对机器学习和人工智能的兴趣日益浓厚,我们将看到更多的投资用于实现这一目标的非结构化数据分析和数据管理解决方案。由于非结构化数据非常庞大且难以处理,而且其中很多数据都是在云之外的边缘发展起来的,因此跨边界到云的数据管理、简化非结构化数据的吸收、云分析将成为一个显著的趋势。  非结构化数据分析工作流解决方案将会出现  处理和索引PB级的非结构化数据现在主要是手工工作。大型组织雇佣大量的数据专业人员来搜索、分类和移动这些数据,以便分析工具能够吸收和操作这些数据。现在迫切需要简化和自动化这些过程,在多个文件和云存储之间轻松索引文件,并自动化系统数据移动的解决方案将会越来越多。  此外,非结构化数据的数据分析解决方案可能是垂直的,因此它们是特定于行业或应用。例如,医学图像及其解释方式是一个上下文事件,需要临床数据集的特定知识。许多组织正在创建自定义工作流,其中包括基于云的分析工具。商业数据管理解决方案的时机已经成熟,这些解决方案可以在全球企业中轻松搜索特定的数据集,并不断地将这些数据流化,以系统地自动化非结构化数据分析的工作流程。  “数据货币化”和相关策略将在2022年流行  “数据货币化”的传统概念是围绕着挖掘CRM、ERP和其他核心业务系统来获取关于客户行为、产品需求和库存趋势的情报。然而,机器学习是一种改变游戏规则的工具,它依赖于非结构化数据。  教一辆汽车自主驾驶需要与在不同路面和交通灯模式的道路上驾驶有关的数据。如果您想提高客户支持电话的满意率,您需要能够分析对话。这就是为什么我们看到像雪花这样的公司宣布支持非结构化数据。  他们在云中提供数据仓库,让人们可以很容易地回答那些任意和开放式的问题。当前的趋势是,“数据货币化”正从结构化数据转向非结构化数据,因为这是利用数据改善客户关系和收入、降低风险并获得竞争优势的主要机会。  IT是时候拥抱数据竖井了  数据竖井不会消失,而且没有人愿意为了避免竖井而锁定供应商。答案是不要担心这些竖井,而是要寻求能够查看数据的解决方案,而不是强迫你把所有数据放在一个位置或技术上。如今,存储数据的角色也在演变,包括数据管理和实现业务结果,而不仅仅是管理基础设施。  数据管理将继续成为风险投资家的热门市场  数据管理受到强劲势头的推动,应该会继续支撑其市场增长。非结构化数据的爆炸式增长,边缘数据和云数据的兴起,以及数据分析向非结构化数据货币化的转变,都是市场中数据管理相关性背后的巨大推动力。  风险投资家看到了雪花这样公司的成功,不想错过下一个大数据管理机会。投资者总是在寻找下一个大事件。你如何利用市场趋势来创造优势?解决这一问题的一个好方法是寻找一个您非常了解的数据管理问题,这个问题还没有被其他人解决,它在一些细分市场中普遍存在,并且是可以解决的。数据管理的热点领域包括云数据管理、数据分析管理、数据安全和非结构化数据管理。  在2022年,非结构化数据将成为企业关注的焦点,但在这个充满活力的行业中,它不会是唯一的关注点。企业会想要利用风险资本的资金来扩展他们的能力,将机器学习和非结构化数据带来的新能力,确保他们的劳动力足够多样化,还能利用过去相对未开发的社会领域中新兴的人才。文章来源:https://server.it168.com/a2022/0114/6609/000006609014.shtml
  • [技术干货] 数据架构的本质到底是什么 by 傅一平
    我们搞数据的,按道理对数据架构应该比较熟悉吧,但自己最近却越来越迷糊了,因为发现很多讲数据管理的书,对数据架构的定义并不一致,有些出入还比较大。 自己赶紧去找权威的定义,发现搜出来的信息也是一地鸡毛,因此特意写这篇文章来探个究竟,即耳熟能详的数据架构到底是什么? ## 一、业界看法 首先我们来看看DAMA、华为、工业界、DCMM及央行等各领域对于数据架构的具体描述: ### 1、DAMA:《DAMA数据管理知识体系指南 第二版》 **定义:** 识别企业的数据需求,并设计和维护总蓝图以满足需求,使用总蓝图来指导数据集成、控制数据资产、并使数据投资与业务战略保持一致。 **目标:** 识别数据存储和处理要求;设计结构和计划以满足企业当前和长期的数据需求;战略性地位组织做好准备,快速的发展其产品、服务和数据,以利用新兴技术中固有的商机。 **构成:** (1)**数据模型:** 企业数据模型是一个整体的、企业级的、独立实施的概念或逻辑数据模型,为企业提供通用的、一致的数据视图。企业数据模型包括数据实体(如业务概念),数据实体间的关系、关键业务规则和一些关键属性,它为所有数据和数据相关的项目奠定了基础。 (2)**数据流设计:** 定义数据库、应用、平台和网络(组件)之间的需求和主蓝图。这些数据流展示了数据在业务流程、不同存储位置、业务角色和技术组件间的流动。 ### 2、工业大数据应用技术国家工程实验室:《数据治理:工业企业数字化转型之道》 **定义:** 讲企业业务实体抽象为信息对象,将企业的业务运作模式抽象为信息对象的属性和方法,建立面向对象的企业数据模型,数据架构实现从业务模式向数据模型的转变,业务需求向信息功能的映射,企业基础数据向企业信息的抽象。 **构成:** (1)**数据分布:** 包括数据目录、数据资源全景图、数据地图分布应用。 **数据目录:** 作为数据共享交换的基础数据,对促进企业内部数据共享与交换、对外上报和公示相关信息都非常重要; **数据资源全景图:** 是企业全部数据资产的总体视图,既包括分布、流向和交互关系,又包括数据治理、数据服务和数据后期应用的完整视图。 **数据地图分布应用:** 是指站在数据资产全景图的视角查看企业各数据域,在每一个数据域下,可以识别企业各项业务的核心数据主题,明确各个主题间的交互关系,将数据实体分类、形成企业级数据地图。 (2)**数据主题域:** 是最高层级的、以各个主题概念及其之间的关系为基本构成单元的数据主题集合。企业应划分统一的数据主题域,形成统一的企业数据视图。 (3)**数据关联关系:** 首先包括实体、属性、主键、外键、关系及基数,其次包括数据血缘关系,最后包括数据流转关系。 (4)**数据模型:** 包括概念数据模型、逻辑数据模型及物理数据模型。 ### 3、华为:《华为数据之道》 **定义:** 是指以结构化的方式描述在业务运作和管理决策中所需要的各类信息及其关系的一套整体组件规范。 **目标:** 定义好整个运作过程中涉及的各种人、事、物资源,并实施有效的治理,从而确保各类数据在企业各业务单元间高效、准确地传递,上下游流程快速地执行和运作。 **构成:** (1)**数据资产目录:** 通过分层结构的表达,实现对数据的分类和定义,建立数据模型的输入,形成完善的企业资产地图,也在一定程度上为企业数据治理、业务变革提供了指引。基于数据资产目录可以识别数据管理责任,解决数据问题争议,帮助企业更好地对业务变革进行规划设计,避免重复建设。 (2)**数据标准:** 数据标准定义公司层面需共同遵守的属性层数据含义和业务规则,是公司层面对某个数据的共同理解,这些理解一旦确定下来,就应作为企业层面的标准在企业内被共同遵守。 (3)**数据模型:** 是从数据视角对现实世界特征的模拟和抽象,根据业务需求抽取信息的主要特征,反映业务信息(对象)之间的关联关系。数据模型不仅能比较真实地模拟业务(场景),同时也是对重要业务模式和规则的固化。 (4)**数据分布:** 定义了数据产生的源头及在各流程和IT系统间的流动情况。 ### 4、国标:《DCMM数据管理成熟度模型》及央行:《金融业数据能力建设指引》 **定义:** 通过组织级数据模型定义数据需求,指导对数据资产的分**制和整合,部署数据的共享和应用环境,以及元数据管理的规范。 **构成:** (1)数据模型:使用结构化的语言将收集到的组织业务经营、管理和决策中使用的数据需求进行综合分析,按照模型设计规范将需求重新组织。从模型覆盖的内容粒度看,数据模型一般分为主题域模型、概念模型、逻辑模型和物理模型。 主题域模型是最高层级的、以主题概念及其之间的关系为基本构成单元的模型,主题是对数据表达事物本质概念的高度抽象。 概念模型是以数据实体及其之间的关系为基本构成单元的模型,实体名称一般采用标准的业务术语命名。 逻辑模型是在概念模型的基础上细化,以数据属性为基本构成单元。 物理模型是逻辑模型在计算机信息系统中依托于特定实现工具的数据结构。 (2)数据分布:针对组织级数据模型中数据的定义,明确数据在系统、组织和流程等方面的分布关系,定义数据类型,明确权威数据源,为数据相关工作提供参考和规范。通过数据分布关系的梳理,定义数据相关工作的优先级,指定数据的责任人,并进一步优化数据的集成关系。 (3)数据集成和共享:是建立起组织内各应用系统、各部门之间的集成共享机制,通过组织内部数据集成共享相关制度、标准、技术等方面的管理,促进组织内部数据的互联互通。 (4)元数据管理:元数据管理是关于元数据的创建、存储、整合与控制等一整套流程的集合。 ## 二、架构的本质 可以看到,业界各方对于数据架构都给出了自己的解释,似乎都有道理,但又有不一致的地方,为什么呢? 我觉得这些都是表象,关键是还是要能深入数据架构概念的本质,看看它的底层逻辑到底是什么,然后才能给出更好的解答。 首先来理解架构这个概念。 先举一个例子: 在最早期,每个人都完全独立生活,衣、食、住、行等等全部都自己搞定,这个时候效率不是很高,但一旦出现了分工,力量就强大多了,因为分工后,每个人可以做最为擅长的事情,但这个时候必须要通过某些机制合在一起,让每个人能交易到自己不擅长生产的东西。 在每个人都必须自己完成所有生活必须品的生产的时候,是没有架构的,一旦产生的分工,就把所有的事情,切分成由不同角色的人来完成,最后再通过交易,使得每个个体都拥有生活必须品,这实际上就形成了社会的架构。 **那么怎么定义架构呢?** 把一个整体(完成人类生存的所有工作)切分成不同的部分(分工),由不同角色来完成这些分工,并通过建立不同部分相互沟通的机制,使得这些部分能够有机的结合为一个整体,并完成这个整体所需要的所有活动,这就是架构。 再拿建筑来举例加强一下理解。 最开始人类是住在山洞里,住在树上的,主要是为了躲避其他猛兽的攻击,以及减少自然环境的变化。为了完成这些目标,人类开始学会在平地上用树木和树叶来建立隔离空间的设施,这就是建筑的开始。但是完全隔离也有很多坏处,慢慢就产生了门窗等设施。建筑的本质就是从自然环境中,划出一块独占的空间,但是仍然能够通过门窗等和自然环境保持沟通。这个时候架构就已经开始了。 人们对建筑的需求慢慢的越来越多,空间的切分也会变成很多种,组合的方式也会有很多种,比如每个人住的房子,需要区分厨房、洗手间、书房、卧室等等,这个时候人们就开始有意识的去设计房子,架构师就慢慢的出现了。一切都是为了满足人的越来越高的需求,提升质量,减少时间,更有效率的切分空间,并且让空间之间更加有机的进行沟通。这就是建筑的架构以及建筑的架构的演变。 总结一下,什么是架构,就是: (1)根据要解决的问题,对目标系统的边界进行界定。 (2)并对目标系统按某个原则的进行切分。切分的原则,要便于不同的角色,对切分出来的部分,并行或串行开展工作,一般并行才能减少时间。 (3)并对这些切分出来的部分,设立沟通机制。 (4)根据(3),使得这些部分之间能够进行有机的联系,合并组装成为一个整体,完成目标系统的所有工作。 看了上面的例子,你就能完全理解DAMA对架构做的一个更抽象的定义,即架构是**对组件要素的设计,旨在优化整个结构或系统的功能、性能、可行性、成本和用户体验**。在国际标准ISO/IEC/IEEE 42010:2011中,将架构定义为:“**系统的基本结构、具体体现在架构构成的组件、组件之间的相互关系以及管理其设计和演变的原则**”。 ## 三、数据架构的本质 ### 1、数据是业务的映射 建筑架构的目的是让人们住的更舒服,那数据架构的目的当然是让存储和使用数据的应用或系统能够更顺畅的运转,因此,无论是DAMA还是《华为数据之道》都在强调这一点,特别是华为,直接点出了数据架构的目的就是“**确保各类数据在企业各业务单元间高效、准确地传递,上下游流程快速地执行和运作**”。 企业为实现价值创造,从输入客户要求开始到交付产品及服务给客户获得客户满意并实现企业自身价值的E2E(端对端)业务过程就是业务流。 业务对象是指业务流中涉及的人、事、物,业务对象承载了业务运作和管理涉及的重要信息,业务对象会随着事件的驱动在业务流中流转,业务对象的载体是数据,流动的信息也是数据,这些数据只有满足下游的要求,业务流才能顺畅流动起来,否则价值创造过程就会受阻或停滞。 IT承载的是业务流以及数据,IT支撑每一个作业以及作业输出的数据,通过IT实现数据之间的集成,流程的自动化。 可以这么说,业务是由业务对象和业务流构成的,数据则是业务的映射。 ### 2、数据如何有效切分 业务一般是非常复杂的,为了方便管理业务,首先需要切分业务,每个切分的子业务域最好是高内聚,松耦合。高内聚的目的就是为了专业化,这样子业务域的运作效率就高,松耦合的目的是子业务域之间的沟通成本最好低一点,这样整体的运作效率就越高,现在DDD(领域驱动的设计)本质就是为了达成这个目标。 子业务域是专业化的业务对象的集合,对业务的要求自然映射到了对业务对象的要求,那如何实现业务对象“高内聚,松耦合”的设计呢? 这自然是数据模型要完成的事情,数据模型代表了业务切分的结果。 因此,数据模型是数据架构的核心构件,国标DCMM对于数据模型的描述非常到位,分为四个层级,主题域模型、概念模型、逻辑模型和物理模型,这些模型的设计体现了切分的思维,也体现了切分的粒度变化。 ### 3、数据如何有效流转 切分只是完成了数据架构的第一步,切分后还需要确保各子领域能够高效的沟通,这依赖数据流的合理设计,数据流可以用于描述不同层级模型的映射关系,无论是主题域、业务实体、乃至属性层面的映射关系,体现了数据在流程和IT系统上流动的全景视图,其至少需要达成以下目标: (1)明确数据实体在哪个源头产生 (2)数据实体出现在业务流的哪个环节 ![image.png](https://bbs-img.huaweicloud.com/data/forums/attachment/forum/202201/11/101109m0gczqwmduoqbd8z.png) (3)数据实体出现在哪个流转系统 数据流设计要确保数据语言的一致性,促进业务流能够顺利的运转,就好比人类分工了以后,需要通过统一货币才能促进交易一样。现在数据治理特别强调数据源的一致性,要求业务数据必须认证数据源,在公司范围内统一发布,目的就是统一语言。 因此,无论是叫数据流还是数据分布,都属于数据架构的核心构件,这是业界的共识。 **我认为数据模型和数据流(或叫数据分布)是数据架构最本质的东西,其让业务切分的合理并且切分后沟通顺畅。** ### 四、数据架构的衍生 DCMM将**数据集成和共享**纳入数据架构的范畴,我觉得主要是业务流的内涵扩大导致的结果,因为以前的业务流仅局限在OLTP系统内部,OLAP起来后,通过集成多方业务流的数据,可以产生更有价值的数据。 这些价值数据通过共享手段反哺到业务流,可以促进业务流的进一步优化,从这个角度来讲,数据集成和共享应该纳入数据架构,因为它起到了提升沟通效率的作用,这是与时俱进的结果。 随着数据被纳入生产要素,这个趋势估计会越来越明显吧,当然,这仅是我的一个猜测,毕竟只有DCMM一家这么做。 华为把**数据资产目录**和**数据标准**当成数据架构的组件,应该是管理提升的需要,但并不是数据架构必需的。 以前数据模型的设计都是一堆乱七八糟的PDM,PDM实例化后,其数据架构已经在系统实现了,但如果你要去修改完善,会发现这些数据模型的设计信息没人管、找不到、看不懂,这阻碍了数据架构的进一步优化,因此搞个数据资产目录作为指引。现在数据资产目录作用越来越大,因为数据集成和共享的时候特别需要。 数据标准的制定则让各环节数据流上的数据可以更好的保持一致性,它是数据流的增强。 DCMM将**元数据管理**纳入数据架构的范畴,估计跟华为也类似,只是范围进一步扩大了。 工业大数据的**数据主题域**属于数据模型的一部分,**数据关联关系的实体、属性**等属于数据模型一部分,**数据血缘关系**和**流转关系**则属于数据流一部分。 因此,虽然DAMA、华为、工业、DCMM及央行对于数据架构的构成有不同的描述,但都包括了数据架构最本质的东西,即数据模型和数据流,至于其它的东西,那就见仁见智了。
  • [赛事资讯] 【大赛报名】“华为云杯”2020深圳开放数据应用创新大赛 ·粤港澳大湾区强降水临近预测
    https://competition.huaweicloud.com/information/1000040092/introduction?track=107“华为云杯”2020深圳开放数据应用创新大赛,大赛以“数聚粤港澳,智汇大湾区”为主题,面向全球征集基于开放数据的创新应用解决方案及优秀算法代码。举办方:深圳市政务服务数据管理局、南山区人民政府主办,南山区政务服务数据管理局、华为技术有限公司【大赛介绍】由深圳市政务服务数据管理局、南山区人民政府主办,南山区政务服务数据管理局、华为技术有限公司承办的“华为云杯”2020深圳开放数据应用创新大赛(Shenzhen Open Data Innovation Contest,简称SODiC),以“数聚粤港澳,智汇大湾区”为主题,面向全球高等院校、专业研究机构、数据分析公司、开发者征集基于开放数据的创新应用解决方案和算法模型。本次SODiC大赛共设置4个赛道:算法赛、数据创意赛、数据分析赛和南山专题赛。大赛紧扣城市治理和民生服务主题,开放政府数据资源,创新社会治理方式,推进深圳市智慧城市建设,并携手江门,以大数据链接深江两地文旅资源,为大湾区一体化协同发展探路。新冠疫情尚未结束,本次SODiC大赛特别在数据创意赛赛道提出了“数据战疫方向”,期待参赛者发挥聪明才智,利用开放数据在防控救治、优化资源调配、推进复工复产、促进经济恢复等方面做出更多更好的创新和应用。【大赛时间安排】l 启动仪式(2020年3月27日)l 报名时间(本赛题为算法赛,算法赛报名时间即日起至6月3日18:00)l 高校线上推介会(2020年4月20日至5月4日)l 初赛作品提交(2020年5月5日至6月19日)l 线上AI训练营(2020年5月14日)l 才企交流活动(2020年5月30日)l 初赛评审(2020年6月20日至27日)l 公布晋级决赛名单(2020年6月28日至30日)l 决赛作品提交(算法赛为7月1日至7月10日)l 国际AI青年科学家高峰论坛l 颁奖晚会(2020年7月17日)【面向对象】全球高等院校、专业研究机构、数据分析公司等专业对象【组队要求】选手可自由组队参赛,赛队人数1-6人1、参赛团队应至少由一人组成,参赛人员的年龄、国籍不限,一名参赛人员仅允许参与一支参赛队伍。2、所有参赛团队应自行完成组队,并以团队身份提交各阶段的作品材料。3、直接参与大赛策划、组织、技术服务提供、评审的雇员、专家及其直系亲属不得参加大赛。4、参加大赛的团队应按要求提供每一个参赛人员的个人身份信息(未满18周岁的参赛者需额外提供监护人身份信息),参赛者应当保证身份信息的真实性。大赛组织方承诺个人信息仅用于赛事数据授权与奖金发放,对其中所有涉及个人隐私的内容予以保密。5、参赛团队提交的队伍名中不能包含任何可以使评委直接识别团队个人或其所代表企业的信息。【奖项设置】此赛题奖项设置如下:一等奖,1个团队,奖金:6万现金+3万云资源二等奖,2个团队,奖金:3万现金+2万云资源三等奖,3个团队,奖金:2万现金+1万云资源【提交作品要求】参赛者需登录到华为云人工智能大赛平台,生活垃圾图片分类赛题提交算法模型,强降水临近预测赛题、交通拥堵指数预测赛题提交结果,人工智能大赛平台支持自动判题,返回评比结果。【赛制规则】初赛中每道赛题最高得分前20名选手,进入决赛。决赛每道赛题最高得分第一名获一等奖,最高得分第二名、第三名获二等奖,最高得分第四名、第五名、第六名获三等奖。【评审标准】本次比赛将通过华为云大赛平台对参赛者提交的作品进行自动判题评分,参赛者可基于评分结果和排名,对作品进行优化后及提交,每日评分结果以当天最后一次提交的作品进行打分。大赛将取参赛者最高一次得分进行评奖。【更多说明】更多赛程赛制信息请登录大赛官网sodic.com.cn关注【赛事机构介绍】指导单位广东省政务服务数据管理局中共深圳市委宣传部中共深圳市委网络安全和信息化委员会办公室中共深圳市委推进粤港澳大湾区建设领导小组办公室主办单位深圳市政务服务数据管理局深圳市南山区人民政府承办单位深圳市南山区政务服务数据管理局华为技术有限公司
  • [赛事资讯] 【大赛报名】“华为云杯”2020深圳开放数据应用创新大赛 ·深圳北站周边交通拥堵指数预测
    https://competition.huaweicloud.com/information/1000040088/introduction?track=107“华为云杯”2020深圳开放数据应用创新大赛,大赛以“数聚粤港澳,智汇大湾区”为主题,面向全球征集基于开放数据的创新应用解决方案及优秀算法代码。举办方:深圳市政务服务数据管理局、南山区人民政府主办,南山区政务服务数据管理局、华为技术有限公司【大赛介绍】由深圳市政务服务数据管理局、南山区人民政府主办,南山区政务服务数据管理局、华为技术有限公司承办的“华为云杯”2020深圳开放数据应用创新大赛(Shenzhen Open Data Innovation Contest,简称SODiC),以“数聚粤港澳,智汇大湾区”为主题,面向全球高等院校、专业研究机构、数据分析公司、开发者征集基于开放数据的创新应用解决方案和算法模型。本次SODiC大赛共设置4个赛道:算法赛、数据创意赛、数据分析赛和南山专题赛。大赛紧扣城市治理和民生服务主题,开放政府数据资源,创新社会治理方式,推进深圳市智慧城市建设,并携手江门,以大数据链接深江两地文旅资源,为大湾区一体化协同发展探路。新冠疫情尚未结束,本次SODiC大赛特别在数据创意赛赛道提出了“数据战疫方向”,期待参赛者发挥聪明才智,利用开放数据在防控救治、优化资源调配、推进复工复产、促进经济恢复等方面做出更多更好的创新和应用。【大赛时间安排】l 启动仪式(2020年3月27日)l 报名时间(本赛题为算法赛,算法赛报名时间即日起至6月3日18:00)l 高校线上推介会(2020年4月20日至5月4日)l 初赛作品提交(2020年5月5日至6月19日)l 线上AI训练营(2020年5月14日)l 才企交流活动(2020年5月30日)l 初赛评审(2020年6月20日至27日)l 公布晋级决赛名单(2020年6月28日至30日)l 决赛作品提交(算法赛为7月1日至7月10日)l 国际AI青年科学家高峰论坛l 颁奖晚会(2020年7月17日)【面向对象】全球高等院校、专业研究机构、数据分析公司等专业对象【组队要求】选手可自由组队参赛,赛队人数1-6人1、参赛团队应至少由一人组成,参赛人员的年龄、国籍不限,一名参赛人员仅允许参与一支参赛队伍。2、所有参赛团队应自行完成组队,并以团队身份提交各阶段的作品材料。3、直接参与大赛策划、组织、技术服务提供、评审的雇员、专家及其直系亲属不得参加大赛。4、参加大赛的团队应按要求提供每一个参赛人员的个人身份信息(未满18周岁的参赛者需额外提供监护人身份信息),参赛者应当保证身份信息的真实性。大赛组织方承诺个人信息仅用于赛事数据授权与奖金发放,对其中所有涉及个人隐私的内容予以保密。5、参赛团队提交的队伍名中不能包含任何可以使评委直接识别团队个人或其所代表企业的信息。【奖项设置】此赛题奖项设置如下:一等奖,1个团队,奖金:6万现金+3万云资源二等奖,2个团队,奖金:3万现金+2万云资源三等奖,3个团队,奖金:2万现金+1万云资源【提交作品要求】参赛者需登录到华为云人工智能大赛平台,生活垃圾图片分类赛题提交算法模型,强降水临近预测赛题、交通拥堵指数预测赛题提交结果,人工智能大赛平台支持自动判题,返回评比结果。【赛制规则】初赛中每道赛题最高得分前20名选手,进入决赛。决赛每道赛题最高得分第一名获一等奖,最高得分第二名、第三名获二等奖,最高得分第四名、第五名、第六名获三等奖。【评审标准】本次比赛将通过华为云大赛平台对参赛者提交的作品进行自动判题评分,参赛者可基于评分结果和排名,对作品进行优化后及提交,每日评分结果以当天最后一次提交的作品进行打分。大赛将取参赛者最高一次得分进行评奖。【更多说明】更多赛程赛制信息请登录大赛官网sodic.com.cn关注【赛事机构介绍】指导单位广东省政务服务数据管理局中共深圳市委宣传部中共深圳市委网络安全和信息化委员会办公室中共深圳市委推进粤港澳大湾区建设领导小组办公室主办单位深圳市政务服务数据管理局深圳市南山区人民政府承办单位深圳市南山区政务服务数据管理局华为技术有限公司
  • [赛事资讯] 【大赛报名】“华为云杯”2020深圳开放数据应用创新大赛·生活垃圾图片分类
    https://competition.huaweicloud.com/information/1000038439/introduction?track=107“华为云杯”2020深圳开放数据应用创新大赛,大赛以“数聚粤港澳,智汇大湾区”为主题,面向全球征集基于开放数据的创新应用解决方案及优秀算法代码。举办方:深圳市政务服务数据管理局、南山区人民政府、南山区政务数据管理局、华为技术有限公司【大赛介绍】由深圳市政务服务数据管理局、南山区人民政府主办,南山区政务服务数据管理局、华为技术有限公司承办的“华为云杯”2020深圳开放数据应用创新大赛(Shenzhen Open Data Innovation Contest,简称SODiC),以“数聚粤港澳,智汇大湾区”为主题,面向全球高等院校、专业研究机构、数据分析公司、开发者征集基于开放数据的创新应用解决方案和算法模型。本次SODiC大赛共设置4个赛道:算法赛、数据创意赛、数据分析赛和南山专题赛。大赛紧扣城市治理和民生服务主题,开放政府数据资源,创新社会治理方式,推进深圳市智慧城市建设,并携手江门,以大数据链接深江两地文旅资源,为大湾区一体化协同发展探路。新冠疫情尚未结束,本次SODiC大赛特别在数据创意赛赛道提出了“数据战疫方向”,期待参赛者发挥聪明才智,利用开放数据在防控救治、优化资源调配、推进复工复产、促进经济恢复等方面做出更多更好的创新和应用。【大赛时间安排】l 启动仪式(2020年3月27日)l 报名时间(本赛题为算法赛,算法赛报名时间即日起至6月3日18:00)l 高校线上推介会(2020年4月20日至5月4日)l 初赛作品提交(2020年5月5日至6月19日)l 线上AI训练营(2020年5月14日)l 才企交流活动(2020年5月30日)l 初赛评审(2020年6月20日至27日)l 公布晋级决赛名单(2020年6月28日至30日)l 决赛作品提交(算法赛为7月1日至7月10日)l 国际AI青年科学家高峰论坛l 颁奖晚会(2020年7月17日)【面向对象】全球高等院校、专业研究机构、数据分析公司等专业对象【组队要求】选手可自由组队参赛,赛队人数1-6人1、参赛团队应至少由一人组成,参赛人员的年龄、国籍不限,一名参赛人员仅允许参与一支参赛队伍。2、所有参赛团队应自行完成组队,并以团队身份提交各阶段的作品材料。3、直接参与大赛策划、组织、技术服务提供、评审的雇员、专家及其直系亲属不得参加大赛。4、参加大赛的团队应按要求提供每一个参赛人员的个人身份信息(未满18周岁的参赛者需额外提供监护人身份信息),参赛者应当保证身份信息的真实性。大赛组织方承诺个人信息仅用于赛事数据授权与奖金发放,对其中所有涉及个人隐私的内容予以保密。5、参赛团队提交的队伍名中不能包含任何可以使评委直接识别团队个人或其所代表企业的信息。【奖项设置】此赛题奖项设置如下:一等奖,1个团队,奖金:6万现金+3万云资源二等奖,2个团队,奖金:3万现金+2万云资源三等奖,3个团队,奖金:2万现金+1万云资源【提交作品要求】参赛者需登录到华为云人工智能大赛平台,生活垃圾图片分类赛题提交算法模型,强降水临近预测赛题、交通拥堵指数预测赛题提交结果,人工智能大赛平台支持自动判题,返回评比结果。【赛制规则】初赛中每道赛题最高得分前20名选手,进入决赛。决赛每道赛题最高得分第一名获一等奖,最高得分第二名、第三名获二等奖,最高得分第四名、第五名、第六名获三等奖。【评审标准】本次比赛将通过华为云大赛平台对参赛者提交的作品进行自动判题评分,参赛者可基于评分结果和排名,对作品进行优化后及提交,每日评分结果以当天最后一次提交的作品进行打分。大赛将取参赛者最高一次得分进行评奖。【更多说明】更多赛程赛制信息请登录大赛官网sodic.com.cn关注【赛事机构介绍】指导单位广东省政务服务数据管理局中共深圳市委宣传部中共深圳市委网络安全和信息化委员会办公室中共深圳市委推进粤港澳大湾区建设领导小组办公室主办单位深圳市政务服务数据管理局深圳市南山区人民政府承办单位深圳市南山区政务服务数据管理局华为技术有限公司
  • [技术干货] 好望云服务特性介绍--好望/国标设备接入
    好望/国标设备接入【特性描述】仅好望设备支持扫码添加好望协议还不支持批量添加,国标协议支持支持GB/T 28181-2016设备接入;支持接入满足国标协议的IPC、NVR等设备支持好望协议的C系列、D系列SDC、NVR800、IVS1800等系列设备;支持第三方厂家集成好望SDK后接入【适用平台】      IVM Portal √好望云企业APP √好望云个人APP √    北向接口API √ 【IVM-视频演示】 【IVM-操作步骤】第一步:SDC 通过网线连接 NVR ;第二步:登录 NVR,根据 SDC mac 地址查询 SDC IP 地址 ,例如192.168.1.128;第三步:PC 连接到与 SDC 相同的网段第四步:打开 PC 浏览器,输入 SDC IP 地址,登录 SDC第五步:依次点击 [设置] -> [网络] -> [平台对接参数] -> [云服务对接],              进入 华为好望 界面,修改域名为 DAS 服务器地址,              此处的 DAS 服务所在环境需要和后续的 IVM 和 app 访问环境相同。第六步:打开 好望 App 企业版,此时 App 连接的环境应该与 SDC 连接的 DAS 的环境相同,              进入想添加的企业及设备组,点击添加设备,扫描第五步操作中界面出现的二维码,              即可将该 SDC 添加到该设备组中;第七步:登录 IVM Protal,IVM 访问的环境应与 SDC 连接的 DAS 的环境相同,             找到刚添加的 SDC 设备,开通收录服务,即可在 App 上查看实况浏览。
总条数:104 到第
上滑加载中