ki

Pi Coding Agent - Speedtest

Von peter portmann,

Veröffentlicht am 20. Juli 2026   â€”   6 min Lesezeit

codemacosselfhostedtools
pi.dev
🤖
Ein Video von c't uplink ĂĽber die Nutzung von lokaler KI und das kĂĽrzliche Erscheinen von Kimi K3 hat mich veranlasst lokale LLMs mit Cloud LLMs zu vergleichen. Dabei verwende ich den Pi Coding Agent, da dieser einen sparsamen Tokenverbrauch aufweist. Das beschleunigt lokal gehostete Modelle und senkt die Kosten bei Verwendung von Cloud-Modellen.

Die Videos sind ganz unten verlinkt.


Lokaler KI-Server

Im Moment verwende ich meistens LM Studio auf meinen Mac Studio, um die LLMs zu betreiben. Ollama und oMLX verwende ich manchmal fĂĽr Vergleichstests.

Aktuell laufen diese Modelle permanent auf meinem Server:

Modell Fokusbereich
openai/gpt-oss-120b Text
qwen/qwen3.6-27b Code
qwen/qwen3.6-35b-a3b Code, Visuell
google/gemma-4-26b-a4b Visuell

Lokale KI sicher betreiben

Lokale KI zu betreiben ist heute kein Hexenwerk mehr.

Eine andere Komplexitätsstufe ist es jedoch Agenten sicher zu betreiben.
Das benötigt einiges an Wissen und Erfahrung. Ich arbeite daran.

Damit beschäftige ich mich:

  • Isolation des Host-Systems
  • Netzwerk absichern
  • Passwörter sicher verwenden
  • Das Arbeitsverzeichnis schĂĽtzen vor destruktiven Befehlen
  • Versionierung des Codes

Micro-AI-Agent (net-function ag)

Eine weitere Möglichkeit ist es den Agenten auf separater Hardware zu betreiben. Die net-function ag hat eine spezielle Hardware entwickelt, welche kurz vor der Markteinführung steht. Die CE-Zertifizierung ist noch in Arbeit. Einige Vorteile:

  • Vollständige Isolation da separate Hardware
  • Sehr stromsparend (ca. 1 Watt)
  • Zero Configuration, automatisierte Anbindung

LLMs in Pi Coding Agent

Modelle können bei Pi mit dem Shortcut crtl-P auch mitten in der Session gewechselt werden. Dabei spielt es keine Rolle, ob es ein Cloud-Modell ist (ollama, openrouter) oder ein lokales Modell (lmstudio.)


Pi Extension 'pi-token-speed'

Mit der Erweiterung pi-token-speed wird in der Fusszeile automatisch die Geschwindigkeit des Modells in tok/s angezeigt, einfacher geht es nicht.


Speedtest mit der Extension 'wetter'

FĂĽr den Geschwindigkeitstest habe ich eine Wetter-App verwendet, die ich mit Pi entwickelt habe. Das sind etwa 700 Zeilen Python Code.

Die Extension wetter.ts ist eine TypeScript-Modul-Erweiterung fĂĽr pi, die dem LLM zwei benutzerdefinierte Tools (weather und weather_html) sowie einen Slash-Command (/wetter) zur VerfĂĽgung stellt. Bei Aufruf wird ĂĽber pi.exec() ein Python-Skript (weather_query.py) mit dem Stadtnamen als Argument ausgefĂĽhrt, das die Wetterdaten abruft und formatiert. Das Skript liefert dabei einen tabellarischen Terminal-Output sowie eine HTML-Datei mit der Wettervorhersage, die in den Tool-Ergebnissen als Detailinformation zurĂĽckgemeldet wird.

Resultate

Provider LLM Speed (TPS) Preis
LM Studio (MLX) qwen3.6-27b (Q4) 38.4 tok/s Lokal (kostenlos)
LM Studio (MLX) qwen3.6-35b-a3b (Q8) 79.0 tok/s Lokal (kostenlos)
OpenRouter deepseek/deepseek-v4-pro 78.2 tok/s $0.002
OpenRouter moonshotai/kimi-k3 33.6 tok/s $0.015
  • Schnellstes lokales LLM: Qwen 35B Q8 mit 79 TPS
  • Schnellstes Cloud-LLM: DeepSeek V4 Pro mit 78.2 TPS (und gĂĽnstiger!)
  • Preiswerteste Cloud: DeepSeek V4 Pro ($0.002) — deutlich gĂĽnstiger als Kimi K3
  • Bestes Preis-Leistungs-Verhältnis: LM Studio Qwen 35B Q8 lokal — gratis und mit 79 TPS konkurrenzfähig

openrouter LLMs

openrouter bietet eine sehr breite Palette an LLMs an. Diese werden per API verbunden. Abgerechnet wird per Tokenverbrauch. Dieser wird mit Caching optimiert.

Da mein Verbrauch aktuell keine teure Flatrate rechtfertigt und ich die Cloud-Modelle dank performanter lokaler KI selektiv einsetzen kann, ist fĂĽr mich openrouter optimal. Ich muss nicht jeden einzelnen Cloudanbieter separat einbinden, sondern nur die Verbindung zu openrouter konfigurieren.

openrouter: The Unified Interface For LLMs
Better prices, better uptime, no subscriptions.
https://openrouter.ai/

DeepSeek V4Pro | Kimi K3 | Anthropic Claude Fable 5

Claude Fable 5 ist etwa 7x teurer als Kimi K3 bei ähnlicher Performance.


openrouter Zero Data Retention

Leider können diese Modelle nicht mit ZDR betrieben werden. Das spricht für die lokalen Modelle, dort gelangen gar keine Daten auf fremde Rechner.

Recherche mit Gemini

was ist zero data retention
  • ⚡ Live-Verarbeitung: Die KI liest die Daten, generiert die Antwort und schickt diese zurĂĽck.
  • 🗑️ Sofortige Löschung: Im selben Moment, in dem die Antwort generiert wurde, werden die Eingabe und die Antwort komplett aus dem Arbeitsspeicher des Servers gelöscht.
  • đźš« Kein Training & Logs: Es werden keine Logfiles (Protokolle) angelegt, keine Chat-Verläufe gespeichert und die Daten werden nicht zum Training zukĂĽnftiger KI-Modelle verwendet.
# quelle
https://openrouter.ai/settings/privacy

# task
haben folgende modelle zdr:
deepseek v4pro
kimik3
claude fable 5

Aktuell hat keines dieser drei spezifischen Modelle eine garantierte Zero Data Retention (ZDR) auf OpenRouter.

Das liegt an der Art der Modelle selbst und den jeweiligen Provider-Richtlinien. Hier ist die genaue AufschlĂĽsselung, warum das so ist und worauf du achten musst:

Claude 3.5/4/5 Fable

  • Status: Kein ZDR möglich.
  • Hintergrund: Anthropic hat extrem strikte Sicherheits- und Missbrauchsmonitoring-Richtlinien. Anthropic selbst erlaubt ĂĽber Drittanbieter-Schnittstellen (wie OpenRouter) keine Zero Data Retention. Wenn du in deinen OpenRouter-Einstellungen das Flag zdr: true (bzw. die Option "Only allow Zero Data Retention providers") erzwingst, werden Anfragen an Anthropic-Modelle blockiert und schlagen mit einem Fehler fehl.

DeepSeek v4 Pro

  • Status: Standardmässig kein ZDR.
  • Hintergrund: Die offiziellen Endpunkte von DeepSeek behalten Prompts fĂĽr einen unbestimmten Zeitraum zur Fehlerbehebung und zum Missbrauchsmonitoring ein (auch wenn sie standardmässig nicht darauf trainieren).
  • Ausnahme: Falls ein Drittanbieter auf dem OpenRouter-Marktplatz (wie z.B. DeepInfra, Together oder Groq) das Modell hostet und fĂĽr seine API-Endpunkte ZDR garantiert, könnte eine ZDR-Route existieren. FĂĽr die "Pro"- oder Erstanbieter-Infrastruktur direkt von DeepSeek gilt ZDR auf OpenRouter jedoch nicht.

Kimi v3 / k3 (Moonshot AI)

  • Status: Kein ZDR.
  • Hintergrund: Moonshot AI (die Macher von Kimi) speichert Daten standardmässig fĂĽr regulatorische Zwecke und zur Systemverbesserung. Sie bieten ĂĽber das OpenRouter-Netzwerk derzeit keine verifizierten ZDR-Endpunkte an.

Quellen


Videos

c't uplink, 17.07.2026

Bei lokalen KI-Modellen muss man nicht jedes Token auf die Goldwaage legen. Statt teurer Abos für KI-Dienste fallen leichter zu überblickende Hardware- und Stromkosten an. Wir sprechen darüber, was mit einem lokalen KI-Server für privat oder kleine Teams möglich ist, welche Hardware man dafür braucht und welche coolen Dinge man damit tun kann.

Kimi K3 + OpenCode is REALLY good

Brandon Melville, 19.7.2026

Kimi K3 ist da, und es könnte eine der grössten Veröffentlichungen von Open-Weight-KI-Codingmodellen bisher sein. In diesem Video teste ich Kimi K3 anhand von Benchmarks, Preisen, Frontend-Coding, Spieleentwicklung, OpenCode-Workflows und echten Coding-Agent-Aufgaben, um zu sehen, wie viel Mehrwert man tatsächlich daraus ziehen kann.

Ich vergleiche Kimi K3 mit fĂĽhrenden Frontier-Modellen, prĂĽfe seine Artificial-Analyse-Ergebnisse, teste es ĂĽber OpenRouter und setze es in OpenCode mit dem Superpowers-Plugin ein. Zudem unterziehe ich es realen Experimenten: dem Erstellen von Frontend-Designs, dem Entwickeln eines 3D-Minispieles, dem Versuch einer Django-zu-Next.js-Migration und der Nutzung von Kimi K3 als Sub-Agent, wobei ein anderes Modell als Orchester fungiert.


Auf Facebook teilen Auf Linkedin teilen Auf Twitter teilen Per E-Mail senden