首页 > 其他分享 >数据摄取最佳实践

数据摄取最佳实践

时间:2023-05-30 21:32:25浏览次数:29  
标签:提取 数据源 清理 实践 最佳 摄取 全局 数据


数据是为企业的许多任务关键型引擎提供动力的动力,从商业智能到预测分析; 数据科学到机器学习。为了充分发挥作用,数据与任何燃料一样,必须丰富,容易获得并且干净。数据摄取过程 - 准备分析数据 - 通常包括称为提取(从当前位置获取数据),转换(清理和规范化数据)和加载(将数据放在可以分析数据的数据库中)的步骤。企业通常在提取和加载方面很容易,但很多都遇到转换问题。结果可能是分析引擎处于空闲状态,因为它没有要处理的数据。

鉴于这一现实,这里有一些关于数据摄取的最佳实践。

期待困难并据此制定计划

数据摄取的肮脏秘密在于,据报道,收集和清理数据需要占用任何分析项目预定时间的60%到80%。我们想象数据科学家花费大部分时间来运行算法,检查结果,然后为下次运行改进算法。这是工作中令人振奋的部分,但现实情况是,数据科学家花费大部分时间试图将数据形成争论,以便他们可以开始分析工作。随着大数据的规模不断扩大,这部分工作一直在变大。许多企业在不了解这一点的情况下开始数据分析项目,然后当数据提取过程不符合其初始计划时,他们会感到惊讶或失望。与此同时,其他团队已经开发出分析引擎,假设存在干净的摄取数据,并且在数据摄取工作陷入困境时等待空闲。没有灵丹妙药可以帮助你避免这些困难。期待他们,并为他们做计划。例如,您可能希望为数据摄取安排更多时间,为其分配更多人员,引入外部专业知识或推迟开发分析引擎,直到项目的数据提取部分正在进行中。

自动化数据提取

在过去的好时候,当数据很小并且最多只有几十个表时,可以手动执行数据摄取。人类定义了一个全局模式,然后为每个本地数据源分配了一个程序员,以了解它应该如何映射到全局模式。各个程序员用他们喜欢的脚本语言编写映射和清理例程,然后相应地运行它们。今天,数据在规模和种类上都变得太大,无法手动策划。您需要开发尽可能自动化摄取过程的工具。例如,用户应该能够在电子表格中定义此信息,然后由强制执行指定元数据的工具读取,而不是手动定义表格的元数据,例如其模式或有关最小和最大有效值的规则。这种类型的自动化本身可以减少数据摄取的负担。但是,在很多情况下,考虑到所涉及的表格数量庞大,它并没有消除摄入瓶颈。当必须摄取数千个表时,填写数千个电子表格比编写数千个摄取脚本更好。但是,它仍然不是可扩展或可管理的任务。

使用人工智能

已经开发了各种产品,其使用机器学习和统计算法来自动推断关于被摄取的数据的信息并且在很大程度上消除了对手工劳动的需要。其中包括Data Tamer等开源系统以及Tamr,Trifacta和Paxata等商业产品。这些系统可以自动化的一些过程示例包括:

  • 从映射到它的本地表中推断全局模式。
  • 给定一个本地表,推断它应该被摄入哪个全局表。
  • 推断数据规范化的同义词。例如,缩写“in。”和“in”,直的双引号(“)和单词”inches“都是同义词。
  • 基于模糊匹配检测重复记录。例如,“Moshe Kranc”和“M。克兰克“是同一个人。

这些系统依靠人类提供训练数据并解决算法无法做出明确判断的灰色区域。较新的系统,如Informatica的CLAIRE或开源的ActiveClean项目,被吹捧为可以彻底消灭人类的工具。

最重要的是,这些产品是真实的,它们可以工作,它们应该成为任何企业数据提取路线图的一部分。

让它自助服务

在中型企业中,每周需要摄取数十个新的数据源。必须实现每个请求的集中式IT组织将不可避免地成为瓶颈。解决方案是通过提供易于使用的工具为数据提取自助服务,以便为想要摄取新数据源的用户提供数据。例如,为用户提供自助服务工具,以便在尝试将数据提取到全局数据库之前检测并清除缺失值,异常值和重复记录。

管理数据以保持清洁

一旦您解决了清理数据的麻烦,您将希望保持清洁。这意味着引入数据管理,数据管理员负责每个数据源的质量。

此职责包括以下内容:定义架构和清理规则,决定应将哪些数据提取到每个数据源,以及管理脏数据的处理。当然,数据治理还包括除数据质量之外的其他方面,例如数据安全性和遵守法规标准(如GDPR和主数据管理)。实现所有这些目标需要组织与数据相关的方式发生文化转变,并且需要数据管理员能够支持所需的工作并对结果负责。

宣传您的清洁数据

清理完特定数据源后,其他用户是否可以轻松找到它?如果您的数据集成总是按照客户的要求进行点对点完成,那么任何客户都无法找到已经为不同客户清理的数据,这些数据可能很有用。您的组织应实现pub-sub(发布 - 订阅)模型,其中包含可供所有用户查找的先前已清理数据的注册表。

最终,这些最佳实践在一起使用时,可能是您的特定数据提取项目成功与失败之间的差异。

 

标签:提取,数据源,清理,实践,最佳,摄取,全局,数据
From: https://blog.51cto.com/u_16145034/6382111

相关文章

  • Feign使用实践
    Feign是一个声明式的HTTP客户端,用于简化微服务架构中的服务调用。它基于注解和接口定义,可以与服务发现组件(例如Eureka)和负载均衡组件(例如Ribbon)集成,提供了更简洁、可读性更高的代码来实现服务间的通信。下面是使用Java代码实现Feign入门示例的详细步骤:添加依赖项:在您的Java......
  • Ribbon使用实践
    Ribbon是Netflix开源的一个负载均衡客户端库,用于在微服务架构中实现客户端的负载均衡。它可以与服务发现组件(例如Eureka)集成,自动地根据可用的服务实例来分发请求。下面是使用Java代码实现Ribbon入门示例的详细步骤:添加依赖项:在您的Java项目中,添加以下依赖项以使用Ribbon客户......
  • Nacos使用实践
    Nacos(全称为"阿里巴巴服务注册中心和配置中心")是一个开源的分布式服务发现和配置管理系统,由阿里巴巴集团开发。它提供了服务注册与发现、动态配置管理、服务健康监测等功能,旨在帮助构建和管理云原生应用。下面是使用Java代码实现Nacos入门示例的详细步骤:准备工作:下载Nacos:从......
  • Seata使用实践
    Seata是一个开源的分布式事务解决方案,它提供了一种简单且可靠的方式来处理分布式环境中的事务一致性。Seata通过支持三个核心组件(TransactionCoordinator、ResourceManager和TransactionManager)来实现分布式事务的管理。下面是Seata的介绍以及使用Java代码实现的入门示例:Seata......
  • OAuth2使用实践
    OAuth2是一种授权框架,用于授权第三方应用程序访问受保护的资源,而无需共享用户凭据。它通过标准化的授权流程和令牌机制来实现安全的身份验证和授权机制。下面是OAuth2的介绍以及使用Java代码实现的入门示例:OAuth2的介绍:OAuth2定义了一种委托机制,允许用户授权第三方应用程序代表......
  • Apollo使用实践
    Apollo是携程开源的一款分布式配置中心,用于集中管理和动态配置应用程序的配置项。它提供了实时的配置更新、配置版本管理、灰度发布等功能,可以帮助开发团队更好地管理和控制应用程序的配置。下面是使用Java代码实现Apollo入门示例的详细步骤:添加依赖项:在您的Java项目中,添加......
  • ServiceComb使用实践
    ServiceComb是一个开源的微服务框架,提供了丰富的功能和工具,用于构建和管理分布式微服务架构。它基于ApacheServiceComb社区项目的成果,并提供了可靠性、可扩展性和易用性。下面是ServiceComb的介绍以及使用Java代码实现的入门示例:ServiceComb的介绍:ServiceComb旨在简化构建和管......
  • ByteTCC使用实践
    ByteTCC是一种基于字节码技术的分布式事务框架,用于在分布式环境中实现两阶段提交(2PC)的事务。它通过对方法进行字节码增强,实现了事务的Try-Confirm-Cancel(TCC)语义,从而提供了更细粒度的事务控制和灵活性。下面是ByteTCC的介绍以及使用Java代码实现的入门示例:ByteTCC的介绍:ByteTCC......
  • 3PC使用实践
    3PC(Three-PhaseCommit)是一种分布式事务协议,用于确保分布式环境中的事务一致性。与2PC相比,3PC引入了一个额外的阶段来解决2PC的阻塞问题。下面是3PC的介绍以及使用Java代码实现的入门示例:3PC的介绍:3PC是一种协议,它包含三个阶段的操作来协调分布式事务的提交或回滚。与2PC相比,3PC......
  • 2PC使用实践
    2PC(Two-PhaseCommit)是一种分布式事务协议,用于确保分布式环境中的事务一致性。它通过协调参与者节点的操作来实现分布式事务的提交或回滚。下面是2PC的介绍以及使用Java代码实现的入门示例:2PC的介绍:2PC是一种协议,它包含两个阶段的操作来协调分布式事务的提交或回滚。在第一阶段(......