Nvidia Tesla P100 Running vLLM Qwen 3 GPTQ SPEED 950 Tokens/s (60 Req) Legacy-vLLM
Visão inovadora
0:00 / 0:00
Nvidia Tesla P100 Running vLLM Qwen 3 GPTQ SPEED 950 Tokens/s (60 Req) Legacy-vLLM
757 просмотров · 1 месяц назад
Visão inovadora
13 подписчиков
757 просмотров · 1 месяц назад
Placa de video Nvidia Tesla P100 HBM2 executando o vLLM custom (Legacy-vLLM) 950 tk/s com 60 requisições simultâneos e 107 tk/s Throughput one user chat .
TUTORIAL
https://github.com/Legacy-vLLM/Nvidia...
STEP 1
Use your 12-hour trial Get your trial key via the form:
https://docs.google.com/forms/d/e/1FA...
STEP 2
docker pull legacyvllm/legacy-vllm-tesla-p100-openai-lora:020826
RUN:
docker run --gpus all \ -e LEGACY_VLLM_LICENSE_KEY="Request it via the form, then fill it in here.(STEP 1)" \ -p 8000:8000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ legacyvllm/legacy-vllm-tesla-p100-openai-lora:300726 \ --model Qwen/Qwen2.5-1.5B-Instruct \ --gpu-memory-utilization 0.8 \ --max-model-len 2048 \ --swap-space 0