Langchain-Chatchat项目：1-整体介绍

时间：2023-10-07 23:47:06浏览次数：44

标签：ai 模型介绍 Chatchat text2vec base Langchain model

基于Langchain与ChatGLM等语言模型的本地知识库问答应用实现。项目中默认LLM模型改为THUDM/chatglm2-6b[2]，默认Embedding模型改为moka-ai/m3e-base[3]。

一.项目介绍
1.实现原理
本项目实现原理如下图所示，过程包括加载文件->读取文本->文本分割->文本向量化->问句向量化->在文本向量中匹配出与问句向量最相似的topk个->匹配出的文本作为上下文和问题一起添加到prompt中->提交给LLM生成回答。

2.支持LLM模型
本地LLM模型接入基于FastChat实现，支持模型如下：

meta-llama/Llama-2-7b-chat-hf
Vicuna, Alpaca, LLaMA, Koala
BlinkDL/RWKV-4-Raven
camel-ai/CAMEL-13B-Combined-Data
databricks/dolly-v2-12b
FreedomIntelligence/phoenix-inst-chat-7b
h2oai/h2ogpt-gm-oasst1-en-2048-open-llama-7b
lcw99/polyglot-ko-12.8b-chang-instruct-chat
lmsys/fastchat-t5-3b-v1.0
mosaicml/mpt-7b-chat
Neutralzz/BiLLa-7B-SFT
nomic-ai/gpt4all-13b-snoozy
NousResearch/Nous-Hermes-13b
openaccess-ai-collective/manticore-13b-chat-pyg
OpenAssistant/oasst-sft-4-pythia-12b-epoch-3.5
project-baize/baize-v2-7b
Salesforce/codet5p-6b
StabilityAI/stablelm-tuned-alpha-7b
THUDM/chatglm-6b
THUDM/chatglm2-6b
tiiuae/falcon-40b
timdettmers/guanaco-33b-merged
togethercomputer/RedPajama-INCITE-7B-Chat
WizardLM/WizardLM-13B-V1.0
WizardLM/WizardCoder-15B-V1.0
baichuan-inc/baichuan-7B
internlm/internlm-chat-7b
Qwen/Qwen-7B-Chat
HuggingFaceH4/starchat-beta
FlagAlpha/Llama2-Chinese-13b-Chat and others
BAAI/AquilaChat-7B
all models of OpenOrca
Spicyboros + airoboros 2.2
VMware's OpenLLaMa OpenInstruct
任何EleutherAI的pythia模型，比如pythia-6.9b
在以上模型基础上训练的任何Peft适配器

说明：在线LLM模型目前已支持：ChatGPT、智谱AI、MiniMax、讯飞星火和百度千帆。

3.支持Embedding模型
本项目支持调用HuggingFace中的Embedding模型：

moka-ai/m3e-small
moka-ai/m3e-base
moka-ai/m3e-large
BAAI/bge-small-zh
BAAI/bge-base-zh
BAAI/bge-large-zh
BAAI/bge-large-zh-noinstruct
sensenova/piccolo-base-zh
sensenova/piccolo-large-zh
shibing624/text2vec-base-chinese-sentence
shibing624/text2vec-base-chinese-paraphrase
shibing624/text2vec-base-multilingual
shibing624/text2vec-base-chinese
shibing624/text2vec-bge-large-chinese
GanymedeNil/text2vec-large-chinese
nghuyong/ernie-3.0-nano-zh
nghuyong/ernie-3.0-base-zh
OpenAI/text-embedding-ada-002

4.安装FastChat

git clone https://github.com/lm-sys/FastChat.git
cd FastChat
pip3 install -e ".[model_worker,webui]"

二.设置配置项
1.LLM模型配置
配置Langchain-Chatchat/configs/model_config.py文件中的llm_model_dict参数：

llm_model_dict = {
    "chatglm2-6b": {
        "local_model_path": "L:/20230713_HuggingFaceModel/chatglm2-6b",
        "api_base_url": "http://localhost:8888/v1",  # URL需要与运行fastchat服务端的server_config.FSCHAT_OPENAI_API一致
        "api_key": "EMPTY"
    },
......
}

2.Embedding模型配置
配置Langchain-Chatchat/configs/model_config.py文件中的embedding_model_dict参数：

embedding_model_dict = {
    ......
    "text2vec": "L:/20230713_HuggingFaceModel/text2vec-large-chinese",
    "m3e-base": "L:/20230620_LLM模型/20230918_通用/20230918_ChatGLM/m3e-base",
    ......
}

3.知识库初始化与迁移
首次运行项目，需要初始化或重建知识库，如下所示：

python3 init_database.py --recreate-vs

三.启动API服务和Web UI
一键启动所有Fastchat服务、API服务、WebUI服务：
1.启动命令

python3 startup.py -a

2.FastAPI docs界面

3.Web UI对话界面

4.Web UI知识库管理页面

参考文献：
[1]Langchain-Chatchat：https://github.com/chatchat-space/Langchain-Chatchat
[2]https://huggingface.co/THUDM/chatglm2-6b
[3]https://huggingface.co/moka-ai/m3e-base
[4]https://github.com/lm-sys/FastChat
[5]https://github.com/chatchat-space/Langchain-Chatchat/issues

标签：ai,模型,介绍,Chatchat,text2vec,base,Langchain,model
From： https://www.cnblogs.com/shengshengwang/p/17747777.html

Langchain-Chatchat项目：1.1-ChatGLM2项目整体介绍
ChatGLM2-6B是开源中英双语对话模型ChatGLM-6B的第2代版本，引入新的特性包括更长的上下文(基于FlashAttention技术，将基座模型的上下文长度由ChatGLM-6B的2K扩展到了32K，并在对话阶段使用8K的上下文长度训练)；更高效的推理(基于Multi-QueryAttention技术，ChatGLM2-6B有更高效的推理......
Langchain-Chatchat项目：1.2-Baichuan2项目整体介绍
由百川智能推出的新一代开源大语言模型，采用2.6万亿Tokens的高质量语料训练，在多个权威的中文、英文和多语言的通用、领域benchmark上取得同尺寸最佳的效果，发布包含有7B、13B的Base和经过PPO训练的Chat版本，并提供了Chat版本的4bits量化。一.Baichuan2模型 Baichuan2模型在......
Langchain-Chatchat项目：2.1-通过GPT2模型来检索NebulaGraph
在官方例子中给出了通过chain=NebulaGraphQAChain.from_llm(ChatOpenAI(temperature=0),graph=graph,verbose=True)来检索NebulaGraph图数据库。本文介绍了通过GPT2替换ChatOpenAI的思路和实现，暂时不考虑效果。之所以没用ChatGLM2是因为加载模型太慢，调试不方便，不过将GPT2......
Langchain-Chatchat项目：3-Langchain计算器工具Agent思路和实现
本文主要讨论Langchain-Chatchat项目中自定义Agent问答的思路和实现。以"计算器工具"为例，简单理解就是通过LLM识别应该使用的工具类型，然后交给相应的工具（也是LLM模型）来解决问题。一个LLM模型可以充当不同的角色，要把结构化的Prompt模板写好，充分利用LLM的Zero/One/Few-Shot能力......
Linux---0.11---asm.s硬件中断类型介绍
_divide_error这是一个标记，通常用于表示与除法错误相关的处理程序或函数。当发生除以零的错误时，处理器可能会跳转到与此标记关联的处理程序，以处理该错误。_debug_debug：这是一个标记，通常用于表示与调试相关的处理程序或函数。调试处理程序通常用于在调试模式下捕获和处理调试事......
Serverless平台knative第九章配置文件介绍
knative配置文件[root@ip-172-17-11-227~]#kubectlgetcm-nknative-servingNAMEDATAAGEconfig-autoscaler12d2hconfig-defaults12d2hconfig-deployment22d2hconfig-domain22d2h......
Python 图片管理工具介绍（筛像素+从文件夹取出图片并放到文件夹内+excel读取）
功能介绍：这是一个Python脚本工具，用于批量管理和复制图片。其主要功能如下：从Excel表格读取数据：程序使用openpyxl库从Excel文件中读取数据，其中A列包含源图片的路径（可以有多个路径，用逗号分隔），B列包含目标目录。图片筛选：仅复制最小维度大于800像素的图片，这可以确保目标目录中的......
gpio模拟功能介绍
gpio模拟状态是gpio功能的一种，此状态下，gpio斯密特触发器关闭状态，上下拉状态开关关闭一般低功耗的模式下会将不用的gpio设置为模拟状态。参考：基于CubeMx管脚配置时的ADC_IN与GPIO_Analog选项话题-知乎(zhihu.com)......
SQL_Duckdb-数据库一些介绍
数据处理数据处理的本质是：针对不同需求，读取并标准化数据集后，施加不同的变换组合shell-Unix管道也有缺点——只能进行线性的流水线排布SQL-关系型数据库是数据处理系统的集大成者。spark数据集和算子一层层细化数据库基本组件对于一个数据库来说，解析器......
Spring Boot中配置文件介绍及其使用教程
一、配置文件介绍SpringBoot项目中，大部分配置都有默认值，但如果想替换默认配置的话，就可以使用application.properties或者application.yml或者application.yaml进行配置。SpringBoot默认会从resources目录下加载application.properties或application.yml文件。其中，application.prop......

Langchain-Chatchat项目：1-整体介绍

相关文章

赞助商

阅读排行