Log ind Opret bruger

← Tilbage til artikler

Pi Agent

det bedste, jeg har kørt en lokal LLM med

#pi #coding agent #lokal llm #intel #arc pro b70 #vllm #qwen #homelab
Pi Agent

Jeg har for nylig installeret Pi agent på min server. Intel Arc Pro B70, 32 GB VRAM, Ubuntu. Serveren er ikke en powerhouse i andre henseender — men 32 GB er dét, der tæller. Jeg kører qwen 3.8 på vLLM.

Og resultatet er virkelig godt.

Hvorfor Pi

Pi er en minimal agent-harness, skrevet af Mario Zechner. Filosofien er det modsatte af de store coding-agents: ingen sub-agents, ingen plan mode, ingen MCP, ingen indbyggede to-dos. I stedet får du fire værktøjer — read, write, edit, bash — og resten bygger du selv, eller så beder du agenten bygge det.

Det vigtigste for mig: system-prompten er lille. System-prompt og tool-definitioner ligger samlet under 1000 tokens. De andre agents pumper tusindvis af tokens ind i konteksten, før du overhovedet har bedt om noget. Pi gør det ikke.

Hvorfor det betyder noget på en lokal model

På en lokal LLM er konteksten den knappe ressource. Hver token koster VRAM i KV-cachen. Jeg kører 140k context med Q4 KV-cache. Med en oppustet system-prompt fra en anden agent er en god del af cachen brændt op, før du er i gang.

Med Pi er der plads. Og 140k viser sig at være rigeligt til de codebases, jeg arbejder med. Pi taler direkte mod vLLM via det OpenAI-kompatible API, så der var ikke noget ekstra at sætte op.

Hastigheden

Lad være med at spinne: det er ikke hurtigt. 600-700 tokens/sek på prompt processing, og omkring 20 i generation. Men på hardware som min er det fornuftige tal. Ikke hurtigt, men brugbart.

Det der overraskede mig

Stabiliteten. Andre agenter, jeg har kørt lokalt, har kørt i loop, glemt hvad de var i gang med, eller kastet fejl, når konteksten blev komprimeret. Det har jeg kun set få gange med Pi. Den komprimerer samtalen, når den nærmer sig grænsen, og kører videre.

Det tror jeg skyldes, at der er mindre, der sker bag kulisserne. Minimal scaffold, få bevægelige dele, mindre der kan gå galt.

Kan anbefale at prøve Pi, hvis du kører lokale LLMs. Den er super responsiv, spilder ikke context, og er ærlig om hvad den er: en harness du former, ikke et produkt der former dig.

Hastigheden er, hvad hardwaren leverer uanset hvad. Men stabiliteten, context-brugen og fornemmelsen af at arbejde med den — det er der, agenten gør forskel. Og det er der, jeg mener Pi er det bedste, jeg har kørt en lokal model med.

Installere

curl -fsSL https://pi.dev/install.sh | sh


Alle artikler
0 kommentarer

Ingen kommentarer endnu. Vær den første.

Log ind for at kommentere