At køre sin egen lokale AI er ikke uden udfordringer — men det bliver bedre og bedre. Jeg har haft et RTX 5070 Ti 16 GB i et år, kørt LM Studio og llama.cpp med Qwen 3.6 35B A3B (MoE). Det har fungeret ok til mindre projekter — den her hjemmeside for eksempel — men jeg har aldrig rigtig fået det op at køre ordentligt. 16 GB VRAM er stramt til den model, og NVIDIA-økosystemet er nemt, men det løser ikke altid at modellen bare er for stor til kortet.
Nu har jeg fornylig anskaffet mig et Intel Arc Pro B70 (32 GB) til min server. Der kører jeg Qwen 3.8 27B Q4 — en quantised dense model — ud gennem OpenWebUI. Og det har været overraskende positivt: stabil, brugbar til mindre kodningsprojekter, serveropsætning og research på nettet.
Intel vs det man er vant til
Man kan tydeligt mærke, at Intel-arkitekturen ikke er helt optimeret endnu i llama.cpp eller Ollama.
Jeg startede med Ollama + Vulkan. Det var ekstremt langsomt — næsten ubrugeligt til dagligt arbejde.
Så skiftede jeg til SYCL + llama.cpp og fik omkring 40 % bedre hastighed. Stadig ikke i nærheden af det CUDA kan på NVIDIA, men nok til at det føles som et værktøj og ikke et eksperiment.
Problemet er ikke primært hardwaren. Det er softwaren.
Hvad videoen viser
Den her video gennemgår Arc Pro B70 grundigt — specs, llama.cpp med SYCL og Vulkan, og vLLM via Intels LLM Scaler-fork. Pointen der matcher min oplevelse:
- llama.cpp + SYCL virker, men matrix-kerneacceleration (Xe Matrix Extensions) er ikke fuldt implementeret endnu. Du får tokens ud, men ikke det kortet reelt kan.
- vLLM / LLM Scaler er hvor Intel-kortet pludselig konkurrerer — i benchmarks ligger det sammen med AMD Radeon AI Pro R7900 på understøttede modeller.
- 32 GB VRAM er det sweet spot til Qwen 3.x i Q4 lige nu. Det var derfor jeg skiftede væk fra 16 GB-kortet.
Kort sagt: samme GPU, to helt forskellige oplevelser afhængigt af hvilken stack du vælger.
vLLM: hurtigt, men indsnævret
Med Intel LLM Scaler (Intels fork af vLLM) kommer hastigheden op på et niveau, der faktisk giver mening. Llama 3.1 8B og Qwen 3.5 9B kører imponerende hurtigt på B70 i deres benchmarks.
Men du er begrænset i modelvalg. Det er ikke upstream vLLM — det er Intels kuraterede version med kerner skræddersyet til Battlemage/Xe2. Nyere modeller og mange quant-formater (AWQ osv.) er ikke med endnu. Du venter på Intel, ikke på community.
Er det et problem? Til det jeg laver — nej, indtil videre. Qwen 3.8 27B dækker kodning, opsætning og research fint. Hvis jeg skal køre hver ny MoE-model dagen efter release, ja — så er llama.cpp-økosystemet vigtigere, og der halter Intel stadig.
Min nuværende opsætning
| Del | Valg |
|---|---|
| GPU (server) | Intel Arc Pro B70, 32 GB |
| GPU (desktop, ældre) | RTX 5070 Ti 16 GB — stadig til LM Studio/legetøj |
| Inference | llama.cpp + SYCL (dagligd), vLLM/LLM Scaler (når hastighed tæller) |
| UI | OpenWebUI |
| Model | Qwen 3.8 27B Q4 (dense) |
OpenWebUI gør det nemt at dele modellen på LAN uden at sende kundedata ud af huset — samme logik som i mit open source på fabrikken-indlæg, bare på hjemmefronten.
Bottom line
Lokal LLM er ikke plug-and-play på Intel endnu. Vulkan via Ollama var en død ende for mig. SYCL + llama.cpp er brugbart. vLLM/LLM Scaler er hvor kortet viser hvad det kan — men med færre modeller at vælge imellem.
Jeg holder øje med llama.cpp SYCL-backend. Når matrix-kerneacceleration lander ordentligt, bliver modelvalget mindre af et kompromis. Indtil da: kør den model der passer i VRAM, brug den stack der er hurtig nok, og læs diffs — uanset om det er Cursor i skyen eller Qwen på serveren.
Det er bedre end for et år siden. Det er ikke færdigudviklet. For mit brug er det godt nok.
Ingen kommentarer endnu. Vær den første.
Log ind for at kommentere