Перейти к содержимому

Nvidia Tesla P100 Running vLLM Qwen 3 GPTQ SPEED 950 Tokens/s (60 Req) Legacy-vLLM

Visão inovadora

0:00 / 0:00

Nvidia Tesla P100 Running vLLM Qwen 3 GPTQ SPEED 950 Tokens/s (60 Req) Legacy-vLLM

757 просмотров · 1 месяц назад
Visão inovadora
13 подписчиков
757 просмотров · 1 месяц назад
Placa de video Nvidia Tesla P100 HBM2 executando o vLLM custom (Legacy-vLLM) 950 tk/s com 60 requisições simultâneos e 107 tk/s Throughput one user chat . TUTORIAL https://github.com/Legacy-vLLM/Nvidia... STEP 1 Use your 12-hour trial Get your trial key via the form: https://docs.google.com/forms/d/e/1FA... STEP 2 docker pull legacyvllm/legacy-vllm-tesla-p100-openai-lora:020826 RUN: docker run --gpus all \ -e LEGACY_VLLM_LICENSE_KEY="Request it via the form, then fill it in here.(STEP 1)" \ -p 8000:8000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ legacyvllm/legacy-vllm-tesla-p100-openai-lora:300726 \ --model Qwen/Qwen2.5-1.5B-Instruct \ --gpu-memory-utilization 0.8 \ --max-model-len 2048 \ --swap-space 0