首页 > 其他分享 >转行大模型?看完这篇少走三年弯路,新人应该如何转行大模型赛道?

转行大模型?看完这篇少走三年弯路,新人应该如何转行大模型赛道?

时间:2024-12-15 17:03:34浏览次数:6  
标签:赛道 工程师 AI 转行 部署 算法 数据 模型

这篇文章,我将结合自己在大模型领域的经验,给大家详细聊聊新人应该如何转行大模型赛道?

比如大模型都有哪些方向?各方向的能力要求和岗位匹配?新手转行大模型常踩的坑和常见的误区?以及入行大模型最顺滑的路径?

如果你是正打算入行大模型的校招/社招同学,请一定看完,可能会让你在入行大模型的路上,少走很多弯路。

01 大模型都有哪些方向?

如果你在求职网站搜索"大模型"关键词,看一下招聘 JD,基本可以了解现在业内对大模型工程师的需求方向和能力要求.。

总结一下,大致可以分为 4 类:

  • 做数据的(大模型数据工程师,爬虫/清洗/ETL/Data Engine/Pipeline)

  • 做平台的(大模型平台工程师,分布式训练/大模型集群/工程基建)

  • 做应用的(大模型算法工程师,搜/广/推/对话机器人/AIGC)

  • 做部署的(大模型部署工程师,推理加速/跨平台/端智能/嵌入式)

02 大部分新手的误区

如果是你,看到这几个方向,会怎么选?我估计很多人都直奔第三点去了,坚定的要做应用,走在所有工种的最前沿,做出让老板,用户都看得到的核心"产品"。

不过这里我不禁要给各位泼一点冷水,在 AI 算法这个行业,三是很吃业务经验的,如果你之前本身就是做算法的,比如是做 NLP,又或者是做语音助手,对话机器人这类的,再顺水推舟做相关方向的大模型算法工程师,这是比较合适的。

在自身业务里融入一些大模型的算法和技法,拿到实际的业务产出,去市面上也比较好找这类岗位。

但如果你是 CS 方向的实习生/应届毕业生,或者其他 IT 方向转行大模型,3 未必是一个最好的选择,大家不要带着一个误区:大模型算法工程师就是调模型,调超参,做一做预训练,做一做 finetune,SFT 之类的活。

实际上呢,这部分工作只有很少人做,基本一个 team 中只有个位数的人,或者只是算法工作的很小的一部分。

注意一点,新人进去 90% 以上都不可能直接让你干算法模型调优的活,大部分可能还是让你配环境,搭链路,清洗数据,分析数据,调研,写一写 function,tools。

这些体力活都干熟了以后,可能才会让你跑一些模型实验。其中比较出色的,脑子比较灵活的同学,才会慢慢让他们开始接触线上业务。

也有很多同学,干了好几年,还是在干一些边角料,脏活,杂活,根本接触不到核心业务。对于刚入行的新人,如果你学历背景好点,可以去大公司做 intern 然后转正,背景差一点,可以去中小公司,积累业务经验。

03 数据很重要!

然后很多人可能往往忽视了上面的 1,2,4,觉得我学了这么多算法知识,学了机器学习,深度学习,还了解大模型,再去做数据,有点屈才了。

但我想告诉你的是,1 是更多转行大模型同学更容易上岸的方式。条条大路通罗马,不是只有一条路走到黑。

首先,目前国外的大模型技术至少领先国内两年,虽然国内已经有几十上百个“大模型”了,但真正能打的并没有几个。探究原因,还是有很多技术没有突破。

算法本身来说,GPT 已经不是什么秘密了。那剩下还有什么呢,一是数据,二是工程技巧

拿数据来说,先说通用的大模型训练,数据的来源,从哪里采,数据的质量怎么把控,如何过滤有毒信息,语言的筛选与比例,数据的去重,以及数据的规范化处理,评测集的构建。这些既是体力活,又是技术活。

对于垂直领域,比如金融,电商,法律,车企,这种领域数据的构建就更考验技术了,业务数据怎么来,数据不够怎么办,完全没有数据怎么办?如果构建高质量的微调数据?

能把这些问题解决好,模型也就成功了一大半。因此,就目前的现状,对于数据工程师,特别是有经验的数据工程师,是非常稀缺的。

04 大模型平台干些啥?

然后说下 2,大模型平台工程师。如果你之前是做工程的,或者对工程比较感兴趣,我比较建议你选 2。

这二者其实并没有本质的区别,都是为了大模型业务服务的,也叫大模型基础设施的建设,作用就是让大模型 train 得更好,大模型跑得更快。

这块主要是干些啥呢?

从计算层面来说,有分布式计算,并行计算,高性能计算,有些公司对这三者也不加区分。

从硬件层面来说,有搞大模型训练集群,GPU 集群,CPU/GPU 混部集群,池子里要管理几百上千张卡,还要负责他们的利用率,机器的健康状况,有没有挂的,中小公司这块基本都是开发和运维一体的,一个工作干两个工种的活。

从平台层面来说,有做 LLMOps 的,也就是 pipeline。集数据 IO,模型训练,预测,上线,监控于一体,这种就是跟着业务团队走,做适配,造很多高效的轮子,方面业务团队使用,减少他们额外重复开发的时间。

这块整体上来说,在大模型时代稳中有升,因为实际上很多公司这方面的人都是从之前搞深度学习平台,大规模机器学习平台的人招过来的,技术上的 gap 相对比较小。因此,对于 AI 工程感兴趣的,可以选这个方向。

05 大模型部署干些啥?

最后说一下 4,大模型部署工程师。这个岗位之前也有,不过在大模型这一两年尤其的火热。

什么原因呢?

因为部署大模型太费钱了。首先模型延迟本身就高,30B 以上的模型,对算力,显存要求很高。

老板关心什么?一方面是大模型产品,也就是业务指标要好看,方便 PR。另一方面也要求控制成本(大厂/独角兽除外)。

一般企业里面,一个 P8 级别的 leader,要在公司里面抢业务,拉资源,找人力,本身就是一个不容易的事。

“降本增效”是 23 年以来,几乎所有公司的一个主旋律。所以老板们很关心你节约了多少钱,比如你把推理效率提高一倍,那就实实在在降低了一倍的成本。

回到大模型部署工程师来,这个岗位总体有两个方向的工作:云端部署和端侧部署

云端比较好理解,可以做推理加速平台,也可以随着业务走,做大模型定制化加速。

比如 Qwen-7b 的加速,还可以做大模型推理引擎,比如搜索/问答的推理引擎,一般是在高并发用户场景下,在保证用户 SLO 的前提下,最优化 latency 和 throughput。

另一个大方向是端侧的部署。也就是在消费级 GPU/NPU 以及边端设备下,部署大模型,同时让领域大模型小型化,让业务能实际工程落地。

总的来说,大模型部署工程师对工程能力,系统能力,以及硬件等方面都要有一定的了解,现在各种推理框架出来以后,降低了一点难度,但仍然是一个比较有竞争力的工种。

你得了解计算图和 OP 的优化,得了解各种推理框架,缓存/显存优化,还有 LLM 结构运行时的系统架构。这个岗位一般不推荐新人入场,因为太吃经验了。建议先从 2 进场,然后逐步转到 4。

06 如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

/i/ll/?i=img_convert/05840567e2912bcdcdda7b15cba33d93.jpeg

在这里插入图片描述

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范

第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署

第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建

第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。

如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

/i/ll/?i=img_convert/05840567e2912bcdcdda7b15cba33d93.jpeg

标签:赛道,工程师,AI,转行,部署,算法,数据,模型
From: https://blog.csdn.net/l01011_/article/details/144488463

相关文章

  • 程序员转行到大模型,最全面的分析,快来了解一下你是否适合
    大模型算是当之无愧最火的一个方向了,算是新时代的风口。有小伙伴觉得,既然是新领域、新方向,那么,人才需求肯定比较大,相应的人才缺乏,竞争也会更少,那转行去做大模型是不是一个更好的选择呢?是不是更好就业呢?是不是就暂时能抵抗35岁中年危机呢?分享一下我的看法,希望给想要在大模型......
  • 旋转位置编码(RoPE):Transformer 模型中的创新位置编码技术
    一、引言        在自然语言处理(NLP)领域,Transformer模型因其强大的并行计算能力和优秀的性能而广受关注。然而,原始Transformer模型的一个重要缺点是无法有效捕捉输入序列中token的位置信息。为了解决这一问题,研究人员开发了多种位置编码方法,其中旋转位置编码(Rota......
  • 微软推出Phi-4生成式AI模型 改进数学能力与训练数据质量
    微软宣布,其Phi系列生成式AI模型迎来了新成员——Phi-4。与之前的版本相比,Phi-4在多个方面有所改进,尤其在数学问题的解决能力上表现突出,这得益于训练数据质量的提升。截至周四晚上,Phi-4的访问权限相对有限,仅在微软最新推出的AzureAIFoundry开发平台上可用,且仅限于微软研究......
  • 大模型如何全面赋能呼叫中心呼入与呼出?(转)
    大模型如何全面赋能呼叫中心呼入与呼出?(转)原作者:开源呼叫中心FreeIPCC大模型在呼叫中心呼入与呼出方面的全面赋能,主要体现在以下几个方面:一、呼入方面的赋能语音识别与合成:通过语音识别技术,大模型呼入系统能够将客户的语音请求转化为文本信息,为后续的处理提供基础。利用......
  • 人工智能大语言模型起源篇,低秩微调(LoRA)
    上一篇:《规模法则(ScalingLaw)与参数效率的提高》序言:您在找工作时会不会经常听到LoRA微调,这项技术的来源就是这里了。(12)Hu、Shen、Wallis、Allen-Zhu、Li、LWang、SWang和Chen于2021年发表的《LoRA:Low-RankAdaptationofLargeLanguageModels》,https://arxiv.org/a......
  • ECCV-2024 | NavGPT-2:释放视觉语言大模型的导航推理能力
    作者:GengzeZhou,YicongHong,ZunWang,XinEricWang,andQiWu阿德莱德大学,AdobeResearch,上海人工智能实验室,加利福尼亚大学圣克鲁斯分校原文链接:NavGPT-2:UnleashingNavigationalReasoningCapabilityforLargeVision-LanguageModels(https://link.spring......
  • Python 潮流周刊#81:在个人电脑上运行 GPT-4 级别的大模型(摘要)
    本周刊由Python猫出品,精心筛选国内外的250+信息源,为你挑选最值得分享的文章、教程、开源项目、软件工具、播客和视频、热门话题等内容。愿景:帮助所有读者精进Python技术,并增长职业和副业的收入。分享了12篇文章,12个开源项目,2则音视频,全文2200字。以下是本期摘要:......
  • 使用PyTorch框架来训练语义分割模型——航空影像输电线路与输电塔分割数据集,使用U-Net
    航空影像的输电线路与输电塔分割数据集。该数据集包含1234张图像,超高分辨率(约3840×2160)标注了11447个对象,属于5个不同的类别,包括电缆(cable)、铁塔(tower_lattice)、木塔(tower_wooden)以及其他两种类型:混凝土或钢结构混合塔(tower_tucohy)和空白肉眼不可见线缆(void),共3GB好的......
  • 使用Javelin AI Gateway简化你的大语言模型开发
    引言在当今快速发展的技术世界中,大语言模型(LLM)被广泛应用于各种AI应用中。然而,随着各种LLM提供商的涌现,如何高效地管理和集成这些模型成为了开发者面临的重大挑战。JavelinAIGateway是一个企业级API网关服务,专门为AI应用而设计。它能够简化与多个大语言模型提供商(如OpenA......
  • Java IO模型
    JavaIO模型  一、什么是IO? I/O(Input/Output)即输入/输出。 1. 从计算机结构的角度来解读I/O 根据冯.诺依曼结构,计算机结构分为5大部分:运算器、控制器、存储器、输入设备、输出设备。如下图:  从计算机结构的视角来看的话,I/O描述了计算机系统与外部设备之......