介绍
LMDeploy 是一个用于大型语言模型(LLMs)和视觉-语言模型(VLMs)压缩、部署和服务的 Python 库。 其核心推理引擎包括 TurboMind 引擎和 PyTorch 引擎。前者由 C++ 和 CUDA 开发,致力于推理性能的优化,而后者纯 Python 开发,旨在降低开发者的门槛。
创建虚拟环境
# 创建虚拟环境
conda create -n lmdeploy python=3.12
# 激活虚拟环境
conda activate lmdeploy
# 安装lmdeploy
pip install lmdeploy
启动API Serve
lmdeploy serve api_server internlm/internlm2_5-7b-chat
此命令将在本地主机上的端口 23333 启动一个与 OpenAI 接口兼容的模型推理服务。你可以使用 --server-port 选项指定不同的服务器端口。 更多选项,请通过运行 lmdeploy serve api_server --help 查阅帮助文档。这些选项大多与引擎配置一致。