Jeg kører qwen 3.8-27b på en Intel Arc Pro B70 32GB. SYCL/llama.cpp, Q4_K, 20+ tok/s, 125k context. Det er brugbart. Jeg researcher, skriver kode, regner CNC-tilbud. Kører lokalt.
Men der er 3× mere i kortet.
Tallene
Intels vLLM XPU-fork kører samme 27B-dense model med GPTQ-INT4 og MTP4 (Multi-Token Prediction). Resultat: 69.3 tok/s decode ved p512/g128. Uden MTP: 32.9 tok/s.
Mine 20 tok/s med llama.cpp. Deres 69. Samme model. Samme kort. Forskellen er inference-engin'en og at modellen forudspår 4 tokens ad gangen i stedet for 1.
Hvad MTP er
Modellen har et lille draft-head der gætter 2-4 tokens frem. Så verificeres de i én gennemgang af den store model. Rammer gættet (og det gør det ofte i 27B-dense), får du 2-4× throughput uden at miste kvalitet.
Krav: checkpointet skal have bevaret det BF16 MTP-draft-head. GPTQ-INT4 gør det. Ikke alle kvantiseringer gør.
Qwen3.5/3.6-27B er eksplicit understøttet
Intels release-notes viser det tydeligt [2]:
- Maj 2026:
intel/llm-scaler-vllm:1.4— officiel Arc Pro B70-understøttelse - Maj 2026: Performance improvements for Qwen3.5/3.6 series, model streaming load
- Jun 2026: FP8 KV Cache enabled, bugs fixed for Qwen3/Qwen3.5
- Jun 2026: Qwen3.5/3.6-27B accuracy issues fixed
- Jul 2026:
intel/llm-scaler-vllm:0.21.0-b1— gemma-4 (12B, 31B, 26B-A4B)
Så min model er ikke "kan måske køre". Den er eksplicit optimeret og bugfixet i Intels fork. B70 er valideret.
VRAM-matematikken på 32 GB
| Konfiguration | Passer på 32 GB? |
|---|---|
| GPTQ-INT4 + 128K context + MTP4 | Ja |
| GPTQ-INT4 + 256K context + MTP4 | Nej, overflow |
| Q6_K + 128K context + MTP4 | Ja |
| Q4_K (llama.cpp, nu) + 125K | Ja, men 20 tok/s |
128K context + MTP4 er grænsen på mit kort. Men 128K er stadig mere end jeg har i dag, og 69 tok/s er 3× mine 20.
Andre modeller der kan køre
Fra release-notes [2]:
- Qwen3-VL (Dense/MoE), Qwen3-Omni
- Qwen3-30B-A3B (MoE Int4)
- gpt-oss
- Gemma 4 (12B, 27B, 31B)
- MinerU, MiniCPM-v-4.5
- ERNIE-4.5-vl
Kvantiseringer: GPTQ-INT4, AWQ, FP8, INT8, GGUF. Direkte fra checkpoint.
Hvad jeg gør
docker pull intel/llm-scaler-vllm:0.21.0-b3.1
docker run --rm -it --device /dev/dri -v /dev/shm:/dev/shm \
intel/llm-scaler-vllm:0.21.0-b3.1 \
python -c "import torch; print(torch.xpu.is_available(), torch.xpu.device_count())"
Hvis det siger True 1, så er GPU'en oppe. Så:
- Hent GPTQ-INT4 checkpoint af Qwen3.6-27B (MTP-head bevaret)
- Kør med
gpu-memory-utilization=0.88, context 131072, MTP4 - A/B-test mod min nuværende llama.cpp: samme prompt, målg tok/s
Så
Jeg har ikke brug for et 2. kort. Jeg har ikke brug for 70B-modeller. Jeg har brug for at presse 3× mere ud af det kort jeg allerede har. Og det kan jeg, med samme model, samme VRAM, bare en bedre engine.
20 tok/s var fint. 69 tok/s er noget andet helt.
Intel Arc Pro B70 32GB. Ubuntu 24.04 HWE. I dag: SYCL/llama.cpp, 20+ tok/s. I morgen: vLLM XPU + MTP4, 69 tok/s. Samme model. Samme kort.
Ingen kommentarer endnu. Vær den første.
Log ind for at kommentere