使用TensorRT-LLM进行高性能推理

时间：2023-10-22 09:33:25浏览次数：40

LLM的火爆之后，英伟达(NVIDIA)也发布了其相关的推理加速引擎TensorRT-LLM。TensorRT是nvidia家的一款高性能深度学习推理SDK。此SDK包含深度学习推理优化器和运行环境,可为深度学习推理应用提供低延迟和高吞吐量。而TensorRT-LLM是在TensorRT基础上针对大模型进一步优化的加速推理库，它号称可以增加4倍的推理速度。

所以本文将对其做一个简单的使用介绍。

https://avoid.overfit.cn/post/9601a73924024e2895957627f8e35bda

标签：TensorRT,高性能,LLM,深度,推理,SDK
From： https://www.cnblogs.com/deephub/p/17779916.html

SP9683高频准谐振、集成650V氮化镓功率器件，30W高性能ACDC芯片
SP9683E是一款集成GaN功率器件的高频准谐振反激控制器，集成650VGaN功率器件，适合设计在离线式USB-PD和USBType-C等快速充电器和电源供应器方案，待机功耗小于75mW。芯片内置精确的初级限流电路，在输出电压在PD/PPS调节时，保证恒定的输出限流，容易满足安规的LPS要求。VDD工作范围9V~54V......
.NET高性能开发-位图索引（一）
.NET高性能开发-位图索引（一）首先来假设这样一个业务场景，大家对于飞机票应该不陌生，大家在购买机票时，首先是选择您期望的起抵城市和时间，然后选择舱等(公务舱、经济舱)，点击查询以后就会出现航班列表，随意的点击一个航班，可以发现有非常多组价格，因为机票和火车票不一样，它的权益、规......
LLM探索：为ChatGLM2的gRPC后端增加连续对话功能
前言之前我做AIHub的时候通过gRPC的方式接入了ChatGLM等开源大模型，对于大模型这块我搞了个StarAI框架，相当于简化版的langchain，可以比较方便的把各种大模型和相关配套组合在一起使用。主要思路还是用的OpenAI接口的那套，降低学习成本，但之前为了快速开发，就只搞了个简单......
.NET高性能开发-位图索引
原文：.NET高性能开发-位图索引(qq.com)首先来假设这样一个业务场景，大家对于飞机票应该不陌生，大家在购买机票时，首先是选择您期望的起抵城市和时间，然后选择舱等(公务舱、经济舱)，点击查询以后就会出现航班列表，随意的点击一个航班，可以发现有非常多组价格，因为机票和火车票不一样，它的......
.NET高性能开发-位图索引（一）
首先来假设这样一个业务场景，大家对于飞机票应该不陌生，大家在购买机票时，首先是选择您期望的起抵城市和时间，然后选择舱等(公务舱、经济舱)，点击查询以后就会出现航班列表，随意的点击一个航班，可以发现有非常多组价格，因为机票和火车票不一样，它的权益、规则更加的复杂，比如有机票中有针对......
轻松掌握组件启动之Redis集群扩展秘籍：轻松扩容与缩容，释放高性能潜能
扩展集群操作扩容在我们原始的集群基础上，我们决定增加一台主节点(8007)和一台从节点(8008)，这样新增的节点将会在下图中以虚线框的形式显示在集群中。1:首先，在/usr/local/redis-cluster目录下创建两个文件夹，分别命名为8007和8008。接下来，将8001文件夹下的redis.conf文......
轻松掌握组件启动之Redis集群扩展秘籍：轻松扩容与缩容，释放高性能潜能
扩展集群操作扩容在我们原始的集群基础上，我们决定增加一台主节点(8007)和一台从节点(8008)，这样新增的节点将会在下图中以虚线框的形式显示在集群中。1:首先，在/usr/local/redis-cluster目录下创建两个文件夹，分别命名为8007和8008。接下来，将8001文件夹下的redis.conf......
解密Prompt系列17. LLM对齐方案再升级 WizardLM & BackTranslation & SELF-ALIGN
话接上文的指令微调的样本优化方案，上一章是通过多样性筛选和质量过滤，对样本量进行缩减，主打经济实惠。这一章是通过扩写，改写，以及回译等半监督样本挖掘方案对种子样本进行扩充，提高种子指令样本的多样性和复杂度，这里我们分别介绍Microsoft，Meta和IBM提出的三个方案。Microsoft：WizardL......
七个 LLM 的狼人杀之夜；马斯克的星链残骸会“砸死人”？OpenAI 安全漏洞曝光丨RTE开发者
开发者朋友们大家好：这里是「RTE开发者日报」，每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享RTE（RealTimeEngagement）领域内「有话题的新闻」、「有态度的观点」、「有意思的数据」、「有思考的文章」、「有看点的会议」，但内容仅代表编辑的个人观点，欢迎大家留......
LLM采样后处理总结：LLM的后处理的cpp实现
LLM采样后处理总结：LLM的后处理的cpp实现在经过LLM的lm_head之后，会得到[batch,vocab_size]大小的矩阵向量，此时需要对输出的逻辑张量进行采样，除了beam_search的贪心策略，还有repetition_penalty、temperature、top_k、top_p等几种控制采样的方法。repetition_penaltyrepetition_p......

使用TensorRT-LLM进行高性能推理

相关文章

赞助商

阅读排行