开发无需 API Key
vLLM
高吞吐、显存高效的 LLM 推理与服务引擎
0下载
0安装
86,947星标
vLLM
高吞吐、显存高效的 LLM 推理与服务引擎
vLLM 通过 PagedAttention 等技术实现高吞吐、低显存占用的 LLM 推理与服务,是生产级大模型部署的热门选择。
功能特性
-
维护者:vllm-project
-
许可证:Apache-2.0
-
来源:GitHub(无需 API Key)
-
标签:推理引擎、大模型、高吞吐
安装
git clone https://github.com/vllm-project/vllm
也可直接访问仓库获取最新代码与文档:https://github.com/vllm-project/vllm
许可证
Apache-2.0
