首页 > 数据库 >国际“论”剑!天翼云数据库论文被EDBT收录!

国际“论”剑!天翼云数据库论文被EDBT收录!

时间:2024-10-31 18:11:10浏览次数:3  
标签:天翼云 Taste 检测 数据库 语义 EDBT 数据

近日,由天翼云数据库团队、中国电信云计算研究院和深圳北理莫斯科大学合作完成的《Taste: Towards Practical Deep Learning-based Approaches for Semantic Type Detection in the Cloud》(构建云上基于深度学习的大规模语义类型识别系统)论文被28th International Conference on Extending Database Technology(EDBT)长文收录

EDBT是数据库领域的知名国际会议,也是中国计算机学会CCF推荐的重点学术会议,已连续举办27届。此次天翼云数据库产品线所著论文被EDBT收录,代表着天翼云的科技创新能力再次获得数据库工业界和学术界的权威认可。

该论文专注于数据管理系统中的语义类型检测(Semantic Type Detection)问题的研究,并在检测性能和安全性方面实现了突破。语义类型可以显示出复杂数据的语义含义,如人名、地址、身份证号等,不仅能够帮助人类更好地理解数据,还能辅助数据管理系统提供搜索、转换和清洗等一系列关键服务,例如:数据管理系统识别出“身份证号”这一语义类型后,可将该数据标记为敏感信息,进而智能地提供数据脱敏服务。

然而,现有语义类型检测技术在每次检测时都需要扫描数据列中的具体内容,存在着两个显著弊端:一方面,扫描数据列会极大增加额外的I/O和网络开销,降低检测效率,还可能对云用户的业务产生不利影响;另一方面,扫描数据列本身耗时较长,加之基于数据列进行特征提取和推理,进一步增加了模型的处理时间,导致整体检测效率较低。伴随AI技术的迅猛发展,采用深度学习来实现语义类型检测的研究日益增加,虽在检测成功率方面取得巨大进展,但仍难以满足云环境下的大规模语义类型识别。

两项创新检测技术 实现高效精准检测

作为云服务国家队,天翼云坚持核心技术自主攻关,针对现有语义检测技术的不足,该论文创新性提出两阶段语义类型检测框架(Two-phase semantic type detection framework,简称为Taste)。

Taste框架的整体执行流程可分为两个阶段(如图1所示):第一阶段,仅利用数据源的元数据(如表名、列名、列注释等)进行初步快速的语义类型检测,以减少对数据源的扫描操作;第二阶段则是按需进行,在需要进一步确认第一阶段中不确定的语义类型时,再将列内容与元数据结合起来,完成更精确的检测。

通过两个阶段的结合,Taste不仅有效提升了检测效率,减少了对用户数据源的影响,还可在元数据质量不佳的情况下保持系统较强的鲁棒性。同时,Taste具有较强的灵活性,云上租户可根据自身的数据隐私需求选择完全禁用第二阶段,从而进一步保护数据。此外,Taste通过将每个阶段划分为数据准备和语义推理两个步骤,并利用流水线机制并行执行不同的步骤,充分利用I/O、CPU和GPU资源,显著提升了整体执行效率,可更好地适用于云环境下海量数据表和列的处理。

图1  两阶段语义类型检测框架概览图

此外,该论文进一步设计了一种新颖的非对称双塔检测模型(Asymmetric Double-Tower Detection,简称 ADTD),通过引入多任务学习来支持Taste的两阶段检测过程。ADTD模型结构分为Metadata塔和Content塔(如图2所示),前者是对元数据特征进行编码,后者是结合元数据信息对列内容特征进行编码。在Taste的两阶段检测中,第一阶段仅利用Metadata塔进行推理,并将Metadata塔加入到缓存中,供第二阶段使用,以减少重复推理;第二阶段则是结合Metadata塔的缓存和Content塔进行推理。在训练过程中,两个阶段的输出可以结合在一起做多任务学习,使得模型只需训练一次,即可应用于两个阶段的推理过程。

图2  非对称双塔检测模型结构图

该论文的实验表明,Taste框架在执行效率、准确性、降低数据列扫描侵入性等多个方面均表现优异,且在不同的数据隐私设置下表现出较强的鲁棒性,并具备云端大规模部署的潜力。

目前,Taste框架已在天翼云数据管理服务(DMS)进行落地。天翼云DMS是TeleDB的一款数据库工具产品,作为一站式数据生命周期管理平台,其支持多云异构数据库统一纳管,提供数据资产管理、客户端工具等功能。依托Taste框架的性能优势,天翼云DMS可帮助客户进行高效、灵活的语义类型检测,实现更加快捷且智能化的敏感数据识别,显著提升云端数据管理的安全性和稳定性,为企业充分释放数据价值提供有力支撑。

科技创新是发展新质生产力的核心要素。面向未来,天翼云将秉持央企使命责任,发挥数字中国建设主力军作用,持续推进数据库等云计算技术攻关,筑牢国云智算底座,以科技创新引领产业发展。

标签:天翼云,Taste,检测,数据库,语义,EDBT,数据
From: https://www.cnblogs.com/developer-tianyiyun/p/18518574

相关文章

  • 云行 | “云”启新篇 “智”赋百业,天翼云为金华数字经济发展注入新动能!
    10月17日,以“婺云启航翼领未来”为主题的天翼云中国行·浙江金华站活动圆满落幕。金华市政府有关领导、合作伙伴企业代表等嘉宾出席活动,共话云计算发展新趋势,共探金华市产业数智化升级新路径。现场重磅举行金华市算力公共服务平台、金华市数据交易平台,以及天翼云息壤智算一体机发......
  • Python SQLite数据库编程
    Python内置 SQLite库直接使用,简单,适合初学者。做更复杂软件,建议重新选用数据库从例子开始:示例代码:#导入模块importsqlite3#连接数据库,返回连接对象conn=sqlite3.connect("D:/my_test.db")#调用连接对象的execute()方法,执行SQL语句#(此处执行的是DDL语句,创......
  • 云行 | 雪域高原“智变”数智高地,天翼云助力西藏开启发展新程!
    10月12日,以“国云注智安全启航赋能西藏数字经济新未来”为主题的天翼云中国行活动在西藏成功举办。中共西藏自治区委员会网络安全和信息化委员会办公室副主任汪刘艳,西藏自治区经济和信息化厅党组成员、副厅长、区数据管理局局长旺堆,中国电信西藏分公司党委书记、总经理周清久出......
  • 云行 | 雪域高原“智变”数智高地,天翼云助力西藏开启发展新程!
    10月12日,以“国云注智安全启航赋能西藏数字经济新未来”为主题的天翼云中国行活动在西藏成功举办。中共西藏自治区委员会网络安全和信息化委员会办公室副主任汪刘艳,西藏自治区经济和信息化厅党组成员、副厅长、区数据管理局局长旺堆,中国电信西藏分公司党委书记、总经理周清久......
  • 软考-数据库知识
    7.数据库知识Oracle服务器由Oracle实例和Oracle数据库组成Oracle实例系统进程在支持多线程的操作系统中,假设进程P创建了T1、T2、T3线程,那么该进程中T1、T2、T3的栈指针不能被共享栈是由每个线程私有管理的,用来保存函数的局部变量和临时变量等。用户进程......
  • 科普文:软件架构数据库系列之【MySQL:InnoDB预读Ahead-read(线性预读linear read-ahead和
    概叙操作系统文件预读(Prefetching)科普文:软件架构Linux系列之【Linux的文件预读readahead】-CSDN博客前面文章我们从操作系统角度解释了文件预读readahead,指Linux系统内核将指定文件的某区域预读进页(OSpagecache)缓存起来,便于接下来对该区域进行读取时,不会因缺页(pagefault)......
  • 揭秘!SpringBoot与MongoDB连接池配置,高效数据库操作的秘密武器
    在SpringBoot中整合MongoDB并配置连接池,可以通过以下步骤实现。我们将使用SpringDataMongoDB来简化与MongoDB的交互,并配置连接池以提高性能和资源利用率。一、添加依赖首先,在你的pom.xml文件中添加必要的依赖:<dependencies><!--SpringBootStarterDataMongoDB-......
  • 【全】Go 操作Redis数据库
    操作Redis数据库在Go语言中是一项常见的任务,尤其是在构建高性能应用时。以下是一个关于如何使用Go操作Redis的详细指南,涵盖了从安装、配置到不同数据类型操作的各个层次(初级、中级、高级)。1.Go操作Redis实战介绍Redis是一个开源的内存数据结构存储,支持多种数......
  • 数据库
    数据库事务事务(Transaction)指一个操作,由多个步骤组成,要么全部成功,要么全部失败。举例:转账,假设A账户向B账号转账,那么涉及两个操作:从A账户扣钱。往B账户加入等量的钱。在这种场景下,不能A账户扣了钱,B账户却没加钱的情况,要么同时成功,要么同时失败并回滚。事务四大特性A......
  • 《向量数据库指南》——Milvus Cloud 过滤功能:轻松驾驭大规模数据搜索
    各位向量数据库领域的探索者们,大家好!我是大禹智库的向量数据库高级研究员王帅旭,也是《向量数据库指南》的作者。今天,咱们就来聊聊在使用MlivusCloud时,标量过滤这一强大功能是如何发挥作用的,以及如何通过这一功能实现更高效、更精准的向量数据处理。相信我,这不仅仅是一场技术盛......