Log ind Opret bruger

← Tilbage til artikler

3× hurtigere LLM på samme B70: vLLM XPU og Multi-Token Prediction

Intels vLLM XPU-fork kører samme 27B-dense model med GPTQ-INT4 og MTP4 (Multi-Token Prediction). Resultat: **69.3 tok/s decode** ved p512/g128. Uden MTP: 32.9 tok/s.

##vllm #llm #localai

Jeg kører qwen 3.8-27b på en Intel Arc Pro B70 32GB. SYCL/llama.cpp, Q4_K, 20+ tok/s, 125k context. Det er brugbart. Jeg researcher, skriver kode, regner CNC-tilbud. Kører lokalt.

Men der er 3× mere i kortet.

Tallene

Intels vLLM XPU-fork kører samme 27B-dense model med GPTQ-INT4 og MTP4 (Multi-Token Prediction). Resultat: 69.3 tok/s decode ved p512/g128. Uden MTP: 32.9 tok/s.

Mine 20 tok/s med llama.cpp. Deres 69. Samme model. Samme kort. Forskellen er inference-engin'en og at modellen forudspår 4 tokens ad gangen i stedet for 1.

Hvad MTP er

Modellen har et lille draft-head der gætter 2-4 tokens frem. Så verificeres de i én gennemgang af den store model. Rammer gættet (og det gør det ofte i 27B-dense), får du 2-4× throughput uden at miste kvalitet.

Krav: checkpointet skal have bevaret det BF16 MTP-draft-head. GPTQ-INT4 gør det. Ikke alle kvantiseringer gør.

Qwen3.5/3.6-27B er eksplicit understøttet

Intels release-notes viser det tydeligt [2]:

  • Maj 2026: intel/llm-scaler-vllm:1.4 — officiel Arc Pro B70-understøttelse
  • Maj 2026: Performance improvements for Qwen3.5/3.6 series, model streaming load
  • Jun 2026: FP8 KV Cache enabled, bugs fixed for Qwen3/Qwen3.5
  • Jun 2026: Qwen3.5/3.6-27B accuracy issues fixed
  • Jul 2026: intel/llm-scaler-vllm:0.21.0-b1 — gemma-4 (12B, 31B, 26B-A4B)

Så min model er ikke "kan måske køre". Den er eksplicit optimeret og bugfixet i Intels fork. B70 er valideret.

VRAM-matematikken på 32 GB

Konfiguration Passer på 32 GB?
GPTQ-INT4 + 128K context + MTP4 Ja
GPTQ-INT4 + 256K context + MTP4 Nej, overflow
Q6_K + 128K context + MTP4 Ja
Q4_K (llama.cpp, nu) + 125K Ja, men 20 tok/s

128K context + MTP4 er grænsen på mit kort. Men 128K er stadig mere end jeg har i dag, og 69 tok/s er 3× mine 20.

Andre modeller der kan køre

Fra release-notes [2]:

  • Qwen3-VL (Dense/MoE), Qwen3-Omni
  • Qwen3-30B-A3B (MoE Int4)
  • gpt-oss
  • Gemma 4 (12B, 27B, 31B)
  • MinerU, MiniCPM-v-4.5
  • ERNIE-4.5-vl

Kvantiseringer: GPTQ-INT4, AWQ, FP8, INT8, GGUF. Direkte fra checkpoint.

Hvad jeg gør

docker pull intel/llm-scaler-vllm:0.21.0-b3.1
docker run --rm -it --device /dev/dri -v /dev/shm:/dev/shm \
  intel/llm-scaler-vllm:0.21.0-b3.1 \
  python -c "import torch; print(torch.xpu.is_available(), torch.xpu.device_count())"

Hvis det siger True 1, så er GPU'en oppe. Så:

  1. Hent GPTQ-INT4 checkpoint af Qwen3.6-27B (MTP-head bevaret)
  2. Kør med gpu-memory-utilization=0.88, context 131072, MTP4
  3. A/B-test mod min nuværende llama.cpp: samme prompt, målg tok/s

Jeg har ikke brug for et 2. kort. Jeg har ikke brug for 70B-modeller. Jeg har brug for at presse 3× mere ud af det kort jeg allerede har. Og det kan jeg, med samme model, samme VRAM, bare en bedre engine.

20 tok/s var fint. 69 tok/s er noget andet helt.


Intel Arc Pro B70 32GB. Ubuntu 24.04 HWE. I dag: SYCL/llama.cpp, 20+ tok/s. I morgen: vLLM XPU + MTP4, 69 tok/s. Samme model. Samme kort.


Alle artikler
0 kommentarer

Ingen kommentarer endnu. Vær den første.

Log ind for at kommentere