国内外AI大模型层出不穷,训练数据复杂程度更是呈指数级增加。如今,在万亿级参数时代,单个资源池已无法满足大模型训练场景中动辄PB级的数据存储量,对于企业来说,启用多个资源池构成的分布式存储势在必行。
为了应对AI大模型训练对数据存储的需求,天翼云推出并行文件服务HPFS(CT-HPFS,High Performance File Storage),旨在为AI时代提供高性能存储底座,助力企业构建基于云资源的、更高效的大型模型训练平台,实现大模型的连续训练。天翼云HPFS可通过分布式存储实现数据的并发读取,同时提供最高百万IOPS和百GBPS的吞吐能力,显著提升了数据的读取速度,从而大大提升GPU卡的利用率,为提升HPC和AI等场景的训练效率赋能。
天翼云HPFS为AI场景的数据训练提供高并发、低延时、高吞吐的存储解决方案:
高并发
天翼云HPFS在保证文件一致性的前提下,将数据分布存储在多个节点上,通过分布式锁机制,实现多客户端同时对同一文件的不同部分进行读写,显著提升并发性能,单客户端的单流IO性能可提升200%以上,并发访问同一文件的性能提升300%以上。
低延迟
天翼云HPFS采用 RDMA(Remote Direct Memory Access,远程直接内存访问)技术,同时支持通过InfiniBand、RoCE和TCP/IP进行数据交互,大幅降低了网络传输的延迟,提高数据传输的效率,实现高速互联。
高吞吐
天翼云HPFS基于 NVMe 存储架构做出深度优化,能够充分释放SSD性能,显著提高了吞吐量等性能表现;基于并发传输通道的并行访问,增强了服务器处理高并发请求的能力。更重要的是,随着节点规模的增加,系统性能可实现线性增长。
基于多重优势能力,天翼云HPFS可为自动驾驶、智能客服、工业制造、基因测序、语音导航、AI训练等场景,提供高性能并行文件存储底座。
HPFS助力客户构建高速大模型训练平台
凭借卓越的技术实力,天翼云HPFS在“华彩杯”算力应用创新大赛中,荣获一等奖,代表着业界对天翼云HPFS创新能力的充分肯定。
作为云服务国家队,天翼云将继续坚持科技创新,以满足高性能计算场景存储需求为己任,不断提升产品的性能和可靠性,为客户打造高性能存储底座,持续为我国大模型产业发展提质增速。
标签:存储,训练,天翼云,AI,HPFS,并发 From: https://www.cnblogs.com/developer-tianyiyun/p/18060458