大语言模型微调数据竞赛，冠军！

时间：2023-12-18 17:44:37浏览次数：30

近日，天池FT-Data Ranker竞赛落下帷幕，天翼云智能边缘事业部AI团队（后称天翼云AI团队）凭借在大语言模型（LLM）训练数据增强方面的卓越研究，荣获大语言模型微调数据竞赛——7B模型赛道冠军。

FT-Data Ranker竞赛是一场面向大语言模型研究、以数据为中心的竞赛，吸引了包括来自北京大学、Hantec等知名高校、研究机构、企业的近400支优秀队伍参赛。天翼云在激烈的角逐中脱颖而出，展现出强大的技术创新能力。

数据在大语言模型（LLM）的能力打造中发挥着至关重要的作用，更好地构建和处理数据集成为大语言模型领域研究的重点。本次竞赛的核心在于独立、精确地评估和提升数据集质量，加速形成基准驱动的数据开发流程，增强大语言模型数据处理能力，提高该领域对数据质量和数据优化的理解能力。本次竞赛特别关注微调（Fine-tuning）阶段的数据，要求参赛者对原始数据集进行清洗、过滤和增强，利用新数据集对特定模型进行微调，并在测试集上进行性能排名。

面向竞赛通用选择任务，天翼云AI团队自主构建了数据处理流程，使用多个文档去重、字符串过滤算子对低质的大规模原始语料进行处理，从而获得高质量的模型训练数据；同时，面向文本摘要任务，天翼云AI团队创新地采用范式迁移（Paradigm Transfer）和模型能力蒸馏（Distillation）的方法，在设定模型随机性为0的前提下，利用生成式模型将原始语料中的问答进行数据处理和迁移，作为摘要数据，间接扩充训练数据。基于以上方法和策略，团队在原始语料基础上构建了一个内容丰富、多样化的任务训练集，帮助模型更好地学习和理解竞赛任务。该方案的创新性和实用性得到了评委的高度认可。

本次竞赛团队采用的大语言模型训练数据增强技术，已在天翼云团队模型研发和生产业务中广泛应用。例如，在天翼云政务大模型“慧泽”的研发中，通过广泛采用训练数据增强策略和算法来提升模型的各项能力，使得“慧泽“具备了政务知识全面、意图理解能力强、应用广泛以及安全可靠等优势，可高效赋能政策咨询、政务导办、12345坐席辅助、智能办公等场景，助力提升城市治理水平。

未来，天翼云将继续推进人工智能相关技术创新以及实践应用，以更加全面、智能的产品与服务，赋能千行百业数字化转型。

标签：竞赛,语言,天翼云,模型,微调,冠军,团队,数据
From： https://www.cnblogs.com/developer-tianyiyun/p/17911786.html

学科竞赛管理系统-计算机毕业设计源码+LW文档
摘要随着国家教育体制的改革，全国各地举办的竞赛活动数目也是逐年增加，面对如此大的数目的竞赛信息，传统竞赛管理方式已经无法满足需求，为了提高效率，竞赛管理系统应运而生。本学科竞赛管理系统以实际运用为开发背景，基于SpringBoot框架、Vue框架，运用了Java语言和MYSQL数据库进行开......
ChatGLM2-6B模型的微调
概述GLM、ChatGLM的相关基础知识说明：GLM模型底层还是基于Transformer，因此其设计、优化都是围绕Transformer的各个组件的。从注意力层的掩码、位置编码等方面优化与设计。ChatGLM3/ChatGLM2的源码中，比如finetune、trainer等代码，其实是copy自HuggingFace，而且其使用流程与调用机......
第1-14届河南省大学生程序设计竞赛（ICPC-ACM河南省赛）
河南省大学生程序设计竞赛又称为河南省内的ACM，是河南省内大学生程序设计的盛宴 2021年5月22日至23日,河南省第十三届大学生程序设计竞赛在河南农业大学举行,2022年 4月16日，中原工学院我院2022年（第14届）ACM程序设计竞赛决赛在学院基础实验楼举行。5月20日至21日,2023年......
一文带你了解LoRa微调语言大模型的实用技巧
微调定制化的大型语言模型需要投入大量时间和精力，但掌握恰当的微调方法和技巧能显著提高效率。比如用LoRa（LLM的低秩适配Low-RankAdaptation）微调大模型，能够利用少量显卡和时间对大模型进行微调，降低成本。通过矩阵秩的分解，将原始模型的参数分解成两个小的矩阵乘积，仅训练这两个矩阵......
F. 纪念品 - 2023HBUCM程序设计竞赛/CSP-J2019
题面小伟突然获得一种超能力，他知道未来\(T\)天\(N\)种纪念品每天的价格。某个纪念品的价格是指购买一个该纪念品所需的金币数量，以及卖出一个该纪念品换回的金币数量。每天，小伟可以进行以下两种交易无限次：任选一个纪念品，若手上有足够金币，以当日价格购买该纪念品；卖出持有的......
D. 相似基因 - 2023HBUCM程序设计竞赛
题面p哥作为一名湖中医信息工程学院的同学，不仅对信息有兴趣，同时对生物也很有兴趣。相信大家从初高中生生物基本知识都知道，DNA基因可以看作一个碱基对序列。它包含了\(4\)种核苷酸，简记作\(A,C,G,T\)。现在假设想计算两个基因的相似程度，相似度的计算方法如下：对于两个已知基因，......
C++ Qt开发：SpinBox数值微调框组件
Qt是一个跨平台C++图形界面开发库，利用Qt可以快速开发跨平台窗体应用程序，在Qt中我们可以通过拖拽的方式将不同组件放到指定的位置，实现图形化开发极大的方便了开发效率，本章将重点介绍QSpinBox精度数值组件的常用方法及灵活运用。QSpinBox是Qt框架中的一个部件（Widget），用于提供一个方......
算法竞赛模板整理
图论最短路structSPFA{vector<i64>dis;vector<bool>vis;vector<int>from;intn;SPFA(vector<vector<pair<int,i64>>>&g,ints):n(g.size()){dis.assign(n,INF),vis.assign(n,false),f......
使用双卡/8卡3090微调llama2-70B/13B模型
写在前面本篇博文将会教大家如何在消费级的设备（或者各种超级便宜的洋垃圾上）实现13B/70B等无法在单张消费级显卡上加载（但可以在一台机器上的多张卡上加载）的模型的微调。由于绝大部分做实验，仅要求实现推理，或者在微调时没有资源上到全量/13B+级别的真·大模型的微调，没有涉及到将一......
使用8卡3090微调llama2-70B模型
写在前面很多问题尚未弄清，还在进一步调整目前已知我用8卡的3090采用deepspeedZeRO3进行运行，下面是deepspeed3的配置1{2"fp16":{3"enabled":"auto",4"loss_scale":0,5"loss_scale_window":1000,6......

大语言模型微调数据竞赛，冠军！

相关文章

赞助商

阅读排行