ki

Pi Coding Agent - Speedtest

Von peter portmann,

Veröffentlicht am 20. Juli 2026   —   5 min Lesezeit

codemacosselfhostedtools
pi.dev
🤖
Ein Video von c't uplink über die Nutzung von lokaler KI und das kürzliche Erscheinen von Kimi K3 hat mich veranlasst lokale LLMs mit Cloud LLMs zu vergleichen. Dabei verwende ich den Pi Coding Agent, da dieser einen sparsamen Tokenverbrauch aufweist. Das beschleunigt lokal gehostete Modelle und senkt die Kosten bei Verwendung von Cloud-Modellen.

Die Videos sind ganz unten verlinkt.


Lokaler KI-Server

Im Moment verwende ich meistens LM Studio auf meinen Mac Studio, um die LLMs zu betreiben. Ollama und oMLX verwende ich manchmal für Vergleichstests.

Aktuell laufen diese Modelle permanent auf meinem Server:

Modell Fokusbereich
openai/gpt-oss-120b Text
qwen/qwen3.6-27b Code
qwen/qwen3.6-35b-a3b Code, Visuell
google/gemma-4-26b-a4b Visuell

Lokale KI sicher betreiben

Lokale KI zu betreiben ist heute kein Hexenwerk mehr.

Eine andere Komplexitätsstufe ist es jedoch Agenten sicher zu betreiben.
Das benötigt einiges an Wissen und Erfahrung. Ich arbeite daran.

Damit beschäftige ich mich:

  • Isolation des Host-Systems
  • Netzwerk absichern
  • Passwörter sicher verwenden
  • Das Arbeitsverzeichnis schützen vor destruktiven Befehlen
  • Versionierung des Codes

Micro-AI-Agent (net-function ag)

Eine weitere Möglichkeit ist es den Agenten auf separater Hardware zu betreiben. Die net-function ag hat eine spezielle Hardware entwickelt, welche kurz vor der Markteinführung steht. Die CE-Zertifizierung ist noch in Arbeit. Einige Vorteile:

  • Vollständige Isolation da separate Hardware
  • Sehr stromsparend (ca. 1 Watt)
  • Zero Configuration, automatisierte Anbindung

LLMs in Pi Coding Agent

Modelle können bei Pi mit dem Shortcut crtl-P auch mitten in der Session gewechselt werden. Dabei spielt es keine Rolle, ob es ein Cloud-Modell ist (ollama, openrouter) oder ein lokales Modell (lmstudio.)


Pi Extension 'pi-token-speed'

Mit der Erweiterung pi-token-speed wird in der Fusszeile automatisch die Geschwindigkeit des Modells in tok/s angezeigt, einfacher geht es nicht.


Speedtest mit der Extension 'wetter'

Für den Geschwindigkeitstest habe ich eine Wetter-App verwendet, die ich mit Pi entwickelt habe. Das sind etwa 700 Zeilen Python Code.

Die Extension wetter.ts ist eine TypeScript-Modul-Erweiterung für pi, die dem LLM zwei benutzerdefinierte Tools (weather und weather_html) sowie einen Slash-Command (/wetter) zur Verfügung stellt. Bei Aufruf wird über pi.exec() ein Python-Skript (weather_query.py) mit dem Stadtnamen als Argument ausgeführt, das die Wetterdaten abruft und formatiert. Das Skript liefert dabei einen tabellarischen Terminal-Output sowie eine HTML-Datei mit der Wettervorhersage, die in den Tool-Ergebnissen als Detailinformation zurückgemeldet wird.

Resultate

Provider LLM Speed (TPS) Preis
LM Studio (MLX) qwen3.6-27b (Q4) 38.4 tok/s Lokal (kostenlos)
LM Studio (MLX) qwen3.6-35b-a3b (Q8) 79.0 tok/s Lokal (kostenlos)
OpenRouter deepseek/deepseek-v4-pro 78.2 tok/s $0.002
OpenRouter moonshotai/kimi-k3 33.6 tok/s $0.015
  • Schnellstes lokales LLM: Qwen 35B Q8 mit 79 TPS
  • Schnellstes Cloud-LLM: DeepSeek V4 Pro mit 78.2 TPS (und günstiger!)
  • Preiswerteste Cloud: DeepSeek V4 Pro ($0.002) — deutlich günstiger als Kimi K3
  • Bestes Preis-Leistungs-Verhältnis: LM Studio Qwen 35B Q8 lokal — gratis und mit 79 TPS konkurrenzfähig

openrouter LLMs

openrouter bietet eine sehr breite Palette an LLMs an. Diese werden per API verbunden. Abgerechnet wird per Tokenverbrauch. Dieser wird mit Caching optimiert.

Da mein Verbrauch aktuell keine teure Flatrate rechtfertigt und ich die Cloud-Modelle dank performanter lokaler KI selektiv einsetzen kann, ist für mich openrouter optimal. Ich muss nicht jeden einzelnen Cloudanbieter separat einbinden, sondern nur die Verbindung zu openrouter konfigurieren.

openrouter: The Unified Interface For LLMs
Better prices, better uptime, no subscriptions.
https://openrouter.ai/

DeepSeek V4Pro | Kimi K3 | Anthropic Claude Fable 5

Die Token sind bei Claude Fable 5 massiv teurer als Kimi K3 bei ähnlicher Performance. Letzlich kann die Leistung aber erst bei einem realen Anwendungsfall beurteilt werden, wenn klar ist, wie viel der gesamte Job gekostet hat.


Artificial Analysis

Hier eine Zusammenstellung über die Kosten einer Aufgabe die ein LLM bewältigen musste. Der Preis pro Token allein reicht nicht für eine gesamtheitliche Beurteilung. Quelle: artificialanalysis.ai

Cost per Intelligence Index Task

Intelligence Index vs. Cost per Intelligence Index Task


openrouter Zero Data Retention

Leider können nicht alle Modelle mit ZDR betrieben werden. Das spricht für die lokalen Modelle, dort gelangen gar keine Daten auf fremde Rechner.

Hier bin ich mir nicht ganz sicher, da ich widersprüchliche Informationen gefunden habe:
Laut der OpenRouter-Dokumentation zu Zero Data Retention sind MoonshotAI Kimi K3 und DeepSeek V4 Pro als Zero Retention Endpoints gelistet und können damit vermutlich über OpenRouter unter ZDR-Routing genutzt werden.

Recherche mit Gemini

was ist zero data retention
  • Live-Verarbeitung: Die KI liest die Daten, generiert die Antwort und schickt diese zurück.
  • 🗑️ Sofortige Löschung: Im selben Moment, in dem die Antwort generiert wurde, werden die Eingabe und die Antwort komplett aus dem Arbeitsspeicher des Servers gelöscht.
  • 🚫 Kein Training & Logs: Es werden keine Logfiles (Protokolle) angelegt, keine Chat-Verläufe gespeichert und die Daten werden nicht zum Training zukünftiger KI-Modelle verwendet.

Quellen


Videos

c't uplink, 17.07.2026

Bei lokalen KI-Modellen muss man nicht jedes Token auf die Goldwaage legen. Statt teurer Abos für KI-Dienste fallen leichter zu überblickende Hardware- und Stromkosten an. Wir sprechen darüber, was mit einem lokalen KI-Server für privat oder kleine Teams möglich ist, welche Hardware man dafür braucht und welche coolen Dinge man damit tun kann.

Kimi K3 + OpenCode is REALLY good

Brandon Melville, 19.7.2026

Kimi K3 ist da, und es könnte eine der grössten Veröffentlichungen von Open-Weight-KI-Codingmodellen bisher sein. In diesem Video teste ich Kimi K3 anhand von Benchmarks, Preisen, Frontend-Coding, Spieleentwicklung, OpenCode-Workflows und echten Coding-Agent-Aufgaben, um zu sehen, wie viel Mehrwert man tatsächlich daraus ziehen kann.

Ich vergleiche Kimi K3 mit führenden Frontier-Modellen, prüfe seine Artificial-Analyse-Ergebnisse, teste es über OpenRouter und setze es in OpenCode mit dem Superpowers-Plugin ein. Zudem unterziehe ich es realen Experimenten: dem Erstellen von Frontend-Designs, dem Entwickeln eines 3D-Minispieles, dem Versuch einer Django-zu-Next.js-Migration und der Nutzung von Kimi K3 als Sub-Agent, wobei ein anderes Modell als Orchester fungiert.


Auf Facebook teilen Auf Linkedin teilen Auf Twitter teilen Per E-Mail senden