Die Videos sind ganz unten verlinkt.
Lokaler KI-Server
Im Moment verwende ich meistens LM Studio auf meinen Mac Studio, um die LLMs zu betreiben. Ollama und oMLX verwende ich manchmal fĂĽr Vergleichstests.
Aktuell laufen diese Modelle permanent auf meinem Server:
| Modell | Fokusbereich |
|---|---|
| openai/gpt-oss-120b | Text |
| qwen/qwen3.6-27b | Code |
| qwen/qwen3.6-35b-a3b | Code, Visuell |
| google/gemma-4-26b-a4b | Visuell |
Lokale KI sicher betreiben
Lokale KI zu betreiben ist heute kein Hexenwerk mehr.
Eine andere Komplexitätsstufe ist es jedoch Agenten sicher zu betreiben.
Das benötigt einiges an Wissen und Erfahrung. Ich arbeite daran.
Damit beschäftige ich mich:
- Isolation des Host-Systems
- Netzwerk absichern
- Passwörter sicher verwenden
- Das Arbeitsverzeichnis schĂĽtzen vor destruktiven Befehlen
- Versionierung des Codes
Micro-AI-Agent (net-function ag)
Eine weitere Möglichkeit ist es den Agenten auf separater Hardware zu betreiben. Die net-function ag hat eine spezielle Hardware entwickelt, welche kurz vor der Markteinführung steht. Die CE-Zertifizierung ist noch in Arbeit. Einige Vorteile:
- Vollständige Isolation da separate Hardware
- Sehr stromsparend (ca. 1 Watt)
- Zero Configuration, automatisierte Anbindung
LLMs in Pi Coding Agent
Modelle können bei Pi mit dem Shortcut crtl-P auch mitten in der Session gewechselt werden. Dabei spielt es keine Rolle, ob es ein Cloud-Modell ist (ollama, openrouter) oder ein lokales Modell (lmstudio.)

Pi Extension 'pi-token-speed'
Mit der Erweiterung pi-token-speed wird in der Fusszeile automatisch die Geschwindigkeit des Modells in tok/s angezeigt, einfacher geht es nicht.

Speedtest mit der Extension 'wetter'
FĂĽr den Geschwindigkeitstest habe ich eine Wetter-App verwendet, die ich mit Pi entwickelt habe. Das sind etwa 700 Zeilen Python Code.
Die Extension wetter.ts ist eine TypeScript-Modul-Erweiterung fĂĽr pi, die dem LLM zwei benutzerdefinierte Tools (weather und weather_html) sowie einen Slash-Command (/wetter) zur VerfĂĽgung stellt. Bei Aufruf wird ĂĽber pi.exec() ein Python-Skript (weather_query.py) mit dem Stadtnamen als Argument ausgefĂĽhrt, das die Wetterdaten abruft und formatiert. Das Skript liefert dabei einen tabellarischen Terminal-Output sowie eine HTML-Datei mit der Wettervorhersage, die in den Tool-Ergebnissen als Detailinformation zurĂĽckgemeldet wird.



Resultate
| Provider | LLM | Speed (TPS) | Preis |
|---|---|---|---|
| LM Studio (MLX) | qwen3.6-27b (Q4) | 38.4 tok/s | Lokal (kostenlos) |
| LM Studio (MLX) | qwen3.6-35b-a3b (Q8) | 79.0 tok/s | Lokal (kostenlos) |
| OpenRouter | deepseek/deepseek-v4-pro | 78.2 tok/s | $0.002 |
| OpenRouter | moonshotai/kimi-k3 | 33.6 tok/s | $0.015 |
- Schnellstes lokales LLM: Qwen 35B Q8 mit 79 TPS
- Schnellstes Cloud-LLM: DeepSeek V4 Pro mit 78.2 TPS (und gĂĽnstiger!)
- Preiswerteste Cloud: DeepSeek V4 Pro ($0.002) — deutlich günstiger als Kimi K3
- Bestes Preis-Leistungs-Verhältnis: LM Studio Qwen 35B Q8 lokal — gratis und mit 79 TPS konkurrenzfähig
openrouter LLMs
openrouter bietet eine sehr breite Palette an LLMs an. Diese werden per API verbunden. Abgerechnet wird per Tokenverbrauch. Dieser wird mit Caching optimiert.
Da mein Verbrauch aktuell keine teure Flatrate rechtfertigt und ich die Cloud-Modelle dank performanter lokaler KI selektiv einsetzen kann, ist fĂĽr mich openrouter optimal. Ich muss nicht jeden einzelnen Cloudanbieter separat einbinden, sondern nur die Verbindung zu openrouter konfigurieren.
openrouter: The Unified Interface For LLMs
Better prices, better uptime, no subscriptions.
https://openrouter.ai/
DeepSeek V4Pro | Kimi K3 | Anthropic Claude Fable 5
Claude Fable 5 ist etwa 7x teurer als Kimi K3 bei ähnlicher Performance.





openrouter Zero Data Retention
Leider können diese Modelle nicht mit ZDR betrieben werden. Das spricht für die lokalen Modelle, dort gelangen gar keine Daten auf fremde Rechner.
Recherche mit Gemini
was ist zero data retention- ⚡ Live-Verarbeitung: Die KI liest die Daten, generiert die Antwort und schickt diese zurück.
- 🗑️ Sofortige Löschung: Im selben Moment, in dem die Antwort generiert wurde, werden die Eingabe und die Antwort komplett aus dem Arbeitsspeicher des Servers gelöscht.
- 🚫 Kein Training & Logs: Es werden keine Logfiles (Protokolle) angelegt, keine Chat-Verläufe gespeichert und die Daten werden nicht zum Training zukünftiger KI-Modelle verwendet.
# quelle
https://openrouter.ai/settings/privacy
# task
haben folgende modelle zdr:
deepseek v4pro
kimik3
claude fable 5Aktuell hat keines dieser drei spezifischen Modelle eine garantierte Zero Data Retention (ZDR) auf OpenRouter.
Das liegt an der Art der Modelle selbst und den jeweiligen Provider-Richtlinien. Hier ist die genaue AufschlĂĽsselung, warum das so ist und worauf du achten musst:
Claude 3.5/4/5 Fable
- Status: Kein ZDR möglich.
- Hintergrund: Anthropic hat extrem strikte Sicherheits- und Missbrauchsmonitoring-Richtlinien. Anthropic selbst erlaubt ĂĽber Drittanbieter-Schnittstellen (wie OpenRouter) keine Zero Data Retention. Wenn du in deinen OpenRouter-Einstellungen das Flag
zdr: true(bzw. die Option "Only allow Zero Data Retention providers") erzwingst, werden Anfragen an Anthropic-Modelle blockiert und schlagen mit einem Fehler fehl.
DeepSeek v4 Pro
- Status: Standardmässig kein ZDR.
- Hintergrund: Die offiziellen Endpunkte von DeepSeek behalten Prompts für einen unbestimmten Zeitraum zur Fehlerbehebung und zum Missbrauchsmonitoring ein (auch wenn sie standardmässig nicht darauf trainieren).
- Ausnahme: Falls ein Drittanbieter auf dem OpenRouter-Marktplatz (wie z.B. DeepInfra, Together oder Groq) das Modell hostet und für seine API-Endpunkte ZDR garantiert, könnte eine ZDR-Route existieren. Für die "Pro"- oder Erstanbieter-Infrastruktur direkt von DeepSeek gilt ZDR auf OpenRouter jedoch nicht.
Kimi v3 / k3 (Moonshot AI)
- Status: Kein ZDR.
- Hintergrund: Moonshot AI (die Macher von Kimi) speichert Daten standardmässig für regulatorische Zwecke und zur Systemverbesserung. Sie bieten über das OpenRouter-Netzwerk derzeit keine verifizierten ZDR-Endpunkte an.
Quellen
- OpenRouter Privacy Settings – Die offizielle Einstellungsseite für die Aktivierung von Zero Data Retention (ZDR).
- OpenRouter Providers Overview – Übersicht aller Hoster auf OpenRouter, auf der die jeweiligen Datenhaltungsrichtlinien (inklusive ZDR-Flags) eingesehen werden können.
- Anthropic (Claude) Privacy Policy & Terms – Details zum Missbrauchsmonitoring und den Datenaufbewahrungsfristen von Anthropic.
- DeepSeek Platform Terms of Service – Die offiziellen Nutzungsbedingungen von DeepSeek bezüglich Datenverarbeitung und temporärer Speicherung für API-Anfragen.
Videos
KI lokal nutzen: Günstig, sicher & datenschutzfreundlich | c’t uplink
c't uplink, 17.07.2026
Bei lokalen KI-Modellen muss man nicht jedes Token auf die Goldwaage legen. Statt teurer Abos für KI-Dienste fallen leichter zu überblickende Hardware- und Stromkosten an. Wir sprechen darüber, was mit einem lokalen KI-Server für privat oder kleine Teams möglich ist, welche Hardware man dafür braucht und welche coolen Dinge man damit tun kann.
Kimi K3 + OpenCode is REALLY good
Brandon Melville, 19.7.2026
Kimi K3 ist da, und es könnte eine der grössten Veröffentlichungen von Open-Weight-KI-Codingmodellen bisher sein. In diesem Video teste ich Kimi K3 anhand von Benchmarks, Preisen, Frontend-Coding, Spieleentwicklung, OpenCode-Workflows und echten Coding-Agent-Aufgaben, um zu sehen, wie viel Mehrwert man tatsächlich daraus ziehen kann.
Ich vergleiche Kimi K3 mit fĂĽhrenden Frontier-Modellen, prĂĽfe seine Artificial-Analyse-Ergebnisse, teste es ĂĽber OpenRouter und setze es in OpenCode mit dem Superpowers-Plugin ein. Zudem unterziehe ich es realen Experimenten: dem Erstellen von Frontend-Designs, dem Entwickeln eines 3D-Minispieles, dem Versuch einer Django-zu-Next.js-Migration und der Nutzung von Kimi K3 als Sub-Agent, wobei ein anderes Modell als Orchester fungiert.