Blog / Tutorials / VPS-Dimensionierung für selbst gehostete KI-Agenten 2026
(last updated: )

VPS-Dimensionierung für selbst gehostete KI-Agenten 2026

Vor jeder konkreten Spezifikation musst du eine Frage klären: Ruft dein Agent eine externe API wie OpenAI, Claude oder Gemini auf oder läuft das Modell lokal? Bei externen APIs übernimmt der VPS nur die Orchestrierung. Dieser schlanke Prozess benötigt überraschend wenig Hardware. Für die meisten…

11 Min. Lesezeit

Vor jeder konkreten Spezifikation musst du eine Frage klären: Ruft dein Agent eine externe API wie OpenAI, Claude oder Gemini auf oder läuft das Modell lokal? Bei externen APIs übernimmt der VPS nur die Orchestrierung. Dieser schlanke Prozess benötigt überraschend wenig Hardware. Für die meisten API-basierten Produktionsumgebungen, einschließlich Multi-Agent-Orchestrierungsplattformen wie Paperclip mit bis zu 20 gleichzeitig aktiven Agenten, bietet der Cloud VPS 4 eine passende Basis: 4 vCPU, 8 GB RAM und NVMe-Speicher. Wenn du selbst einen VPS auswählst, suche gezielt nach einem Cloud VPS 4 oder einem gleichwertigen Plan mit diesen Spezifikationen. Planname und Spezifikationen gehören zusammen. Lokale LLM-Inferenz verändert die Anforderungen vollständig und benötigt eine eigene Hardwareklasse.

VPS-Spezifikationen für KI-Agenten im Überblick: Leistungsklassen

Die folgende Tabelle deckt die fünf wichtigsten Workloads für selbst gehostete Agenten ab, vom einzelnen API-basierten Agenten bis zur lokalen LLM-Inferenz. Alle Werte sind praxistaugliche Ausgangspunkte für den Produktivbetrieb und keine absoluten Mindestwerte.

VPS-Spezifikationen für KI-Agenten im Überblick (2026): Leistungsklassen nach Workload
WorkloadvCPURAMSpeicherGPUContabo Produkt
Einzelner API-basierter Agent (Hermes, OpenClaw, n8n)2 vCPU4 GB40 GB NVMeNeinCloud VPS 4
API-basierte Multi-Agent-Orchestrierung, ≤20 Agenten (Paperclip, CrewAI, LangGraph)4 vCPU8 GB80 GB NVMeNeinCloud VPS 4
Browserautomatisierung (Playwright/Selenium + Agenten)4 vCPU16 GB100 GB NVMeNeinCloud VPS 6
RAG + Vektordatenbank + Agenten (Qdrant + Multi-Agent)4–8 vCPU16 GB200 GB NVMeNeinCloud VPS 6
Lokales LLM, 7B-Modell (Ollama + Agenten)8 vCPU32 GB200 GB NVMeOptionalCloud VPS 8
Lokales LLM, 13B+-Modell / produktiver KI-SDR8+ vCPU64 GB+500 GB+ NVMeJa (16–48 GB VRAM)Cloud VDS oder GPU VPS

Die Werte sind praxistaugliche Ausgangspunkte für den Produktivbetrieb und keine absoluten Mindestwerte. Prüfe vor der Bereitstellung die aktuellen Preise und Spezifikationen auf contabo.com.

Die grundlegende Entscheidung: API oder lokale Inferenz

Wenn ein Agent OpenAI, Claude, Gemini oder eine ähnliche externe API aufruft, führt der VPS nur die Orchestrierungsschicht aus: einen Node.js- oder Python-Prozess, eine Postgres- oder SQLite-Datenbank, etwas HTTP-Routing und möglicherweise einige Docker-Container als Agent-Sandboxes. Die rechenintensive Arbeit, also die eigentliche Inferenz des Sprachmodells, findet im GPU-Cluster des API-Anbieters statt und nicht auf deinem Server. Deshalb benötigt ein API-basierter Agent beim Hosting erstaunlich wenige Ressourcen.

Bei einem lokalen LLM über Ollama, vLLM oder llama.cpp sieht das anders aus. Der VPS wird zum Inferenzserver und der RAM-Bedarf steigt je nach Modellgröße von einstelligen Gigabyte-Werten auf 16 bis 64 GB. Die meisten selbst gehosteten Agenten-Deployments sind 2026 API-basiert; du solltest diesen Unterschied verstehen, bevor du einen Server dimensionierst.

API-basierte Agenten: Paperclip, Hermes, n8n und CrewAI

Bei den meisten selbst gehosteten Agenten-Setups im Jahr 2026 laufen auf dem VPS ein Orchestrierungsprozess, etwa Node.js für Paperclip, Python für CrewAI oder LangGraph beziehungsweise eine Workflow-Engine wie n8n, eine Postgres- oder SQLite-Datenbank für Statusdaten und Audit-Logs, ein Web-Dashboard und optional Docker-Container mit isolierten Sandboxes für einzelne Agenten.

Die Paperclip-Dokumentation nennt mindestens 1 vCPU und 1–2 GB RAM; für den Einstieg reichen demnach 2 vCPU und 2 GB. Eine praxistaugliche Basis für den Produktivbetrieb mit etwa 20 gleichzeitig aktiven Agenten, PostgreSQL, Docker-Sandboxes und einem aktiven Web-Dashboard sind 4 vCPU und 8 GB RAM. Hermes Agent hat noch geringere Mindestanforderungen: 1 vCPU und 1 GB RAM, wenn die gesamte Inferenz über externe APIs läuft. n8n als zusätzliche Workflow-Automatisierungsschicht benötigt ungefähr 512 MB bis 1 GB RAM, bei den meisten Workloads bleibt der Gesamtbedarf aber innerhalb der 8-GB-Klasse. Der Cloud VPS 4 von Contabo mit 4 vCPU, 8 GB RAM und NVMe-SSD deckt alle diese Konfigurationen mit ausreichend Reserven ab.

Hoher RAM-Bedarf durch Browserautomatisierung: Playwright und Selenium

Eine häufige Ursache für zu knapp dimensionierte KI-Agenten-Deployments ist der unterschätzte RAM-Verbrauch der Browserautomatisierung. Wenn ein Agent selbstständig im Web recherchiert, Seiten ausliest, Formulare ausfüllt oder Playwright-basierte Workflows ausführt, benötigt jede Headless-Chromium-Instanz allein 1–2 GB RAM. Ein Agenten-Stack, der zunächst problemlos mit 8 GB auskommt, kann diese Grenze nach dem Hinzufügen der Browserautomatisierung schnell überschreiten.

Für einen Agenten-Stack mit Browserautomatisierung solltest du mindestens 16 GB RAM einplanen: 8 GB für Orchestrierungsschicht, Datenbank und Anwendung sowie weitere 4–8 GB für gleichzeitig laufende Browserinstanzen. Der Cloud VPS 6 von Contabo mit 8 vCPU und 16 GB RAM ist die passende Klasse für Agenten-Setups mit Playwright, Selenium oder ähnlichen Werkzeugen zur Webautomatisierung.

RAG-Pipelines und Vektordatenbanken

Retrieval-Augmented Generation (RAG) verbindet Agenten mit einer Vektordatenbank, damit sie vor einer Antwort eine private Wissensbasis durchsuchen können. Dadurch steigen RAM- und Speicherbedarf gegenüber den Basisspezifikationen für die Orchestrierung.

Qdrant, ChromaDB und Weaviate gehören zu den häufigsten Vektorspeichern in selbst gehosteten Agenten-Stacks. Eine mittelgroße Sammlung mit 100.000 bis 1 Million Vektoren benötigt üblicherweise zusätzlich 2–4 GB RAM sowie 50–100 GB Speicher für Index und Embeddings. Ein vollständiger RAG-Stack aus Agenten, Vektordatenbank und Embedding-Pipeline läuft mit 16 GB RAM und 200 GB NVMe-Speicher komfortabel. Beachte, dass die Erzeugung der Embeddings durch das Embedding-Modell zusätzliche Last verursacht. Eine externe Embedding-API wie OpenAI, Voyage AI oder Cohere vermeidet diese Last, übermittelt den Dokumenttext dafür aber an einen Drittanbieter.

Lokale LLM-Inferenz ohne Datenübermittlung an externe APIs

Ein lokal ausgeführtes Sprachmodell, meist über Ollama, ist sinnvoll, wenn Datenschutz an erster Stelle steht. Dazu gehören sensible Kundendaten, regulierte Branchen oder Compliance-Vorgaben, nach denen Daten deine Infrastruktur nicht verlassen dürfen. Lokale Inferenz kann sich auch lohnen, wenn die API-Kosten pro Token bei hoher Nutzung deutlich steigen.

Consumer-GPU-Optionen nach Modellgröße (2026)Prüfe aktuelle Spezifikationen und Verfügbarkeit direkt beim Anbieter. Consumer-GPU-Reihen ändern sich; die Werte basieren auf einer Quantisierung der Q4-Familie, einem verbreiteten Kompromiss für den Produktivbetrieb.
ModellgrößeBenötigter VRAMAktuelles GPU-Beispiel
7B-Modell (Q4-quantisiert)8–12 GB VRAMRTX 5080 (16 GB) oder besser
13B-Modell (Q4-quantisiert)16–20 GB VRAMRTX 5080 (16 GB), knapp bemessen; RTX 5090 (32 GB) mit mehr Reserve
34B-Modell (Q4-quantisiert)24–32 GB VRAMRTX 5090 (32 GB)
70B+-Modell (Q4-quantisiert)48+ GB VRAMRTX PRO 6000 Blackwell (96 GB) oder Multi-GPU

Der Quantisierungsgrad wirkt sich direkt auf diese Werte aus. Ein Q8-quantisiertes Modell benötigt ungefähr doppelt so viel VRAM wie dasselbe Modell mit Q4. Eine niedrigere Quantisierung wie Q3 oder Q2 benötigt weniger VRAM, beeinträchtigt die Ausgabequalität aber stärker.

Ollama ist nicht die einzige Option für lokale Inferenz. llama.cpp ist eine verbreitete Alternative, besonders für Teams, die das Quantisierungsformat, meist GGUF, direkt steuern möchten, statt die stärker automatisierte Modellverwaltung von Ollama zu verwenden. Der gewählte Quantisierungsgrad verändert den VRAM-Bedarf unmittelbar: Die GPU-Dimensionierung oben setzt eine Quantisierung der Q4-Familie voraus, die im Produktivbetrieb einen gängigen Kompromiss zwischen Größe und Ausgabequalität darstellt. Eine Quantisierung mit höherer Präzision benötigt für dasselbe Modell mehr VRAM; eine niedrigere benötigt weniger, beeinträchtigt die Ausgabequalität aber stärker. Wenn keinerlei Daten, weder der Prompt noch andere Teile einer Anfrage, die eigene Infrastruktur verlassen dürfen, erfüllt nur ein vollständig lokaler Betrieb mit Ollama oder llama.cpp auf eigener Hardware diese echte Air-Gap-Anforderung. Ein API-basierter Agent sendet Anfrageinhalte auch dann an den API-Anbieter, wenn er in der EU gehostet wird.

Eine wichtige Unterscheidung: Wenn Datenschutz der Grund für das Self-Hosting ist, du aber keine lokale Inferenz benötigst, bleiben beim Hosting eines API-basierten Agenten auf einem Contabo VPS im Hub Europe in Lauterbourg deine Orchestrierungsschicht, der Agentenstatus und die Kundendaten in einer EU-Infrastruktur bei einem deutschen Hosting-Anbieter. Das gilt auch dann, wenn die LLM-Aufrufe an Anthropic oder OpenAI gehen. So lassen sich Anforderungen an die DSGVO-Datenresidenz erfüllen, ohne lokale Inferenz oder einen Server mit 32 GB RAM zu benötigen.

Contabo Produkte für die einzelnen Leistungsklassen

Contabo Produkte nach Leistungsklasse für selbst gehostete KI-Agenten (2026)
KlasseTypischer WorkloadContabo ProduktHinweise
EinstiegEinzelner API-basierter Agent (Hermes, OpenClaw, einfaches n8n)Cloud VPS 4, 4 vCPU / 8 GB / NVMeÜbertrifft die Mindestanforderungen von Paperclip und Hermes und bietet Reserven für Wachstum.
Produktiv-APIMulti-Agent mit ≤20 Agenten, Paperclip, CrewAI, n8n + AgentenCloud VPS 4, 4 vCPU / 8 GB / NVMeAusreichend für dauerhaft laufende Produktionsworkloads mit Postgres und Docker.
ErweitertBrowserautomatisierung (Playwright) oder RAG + VektordatenbankCloud VPS 6, 8 vCPU / 16 GB / NVMe16 GB decken Headless-Browserinstanzen und den zusätzlichen Bedarf von Qdrant oder ChromaDB ab.
Lokales LLM (klein)Ollama 7B zusammen mit AgentenCloud VPS 8, 24 GB RAMCPU-Inferenz; geeignet für Batch- und asynchrone Aufgaben, nicht für Echtzeit-Chats.
Lokales LLM (Produktivbetrieb)13B+-Modelle, rechenintensiver KI-SDR, Hermes 4Cloud VDS oder GPU VPSDedizierte CPU plus GPU-Option; prüfe die aktuelle Verfügbarkeit von GPU VPS auf contabo.com.

Produktnamen und Spezifikationen ändern sich. Prüfe vor der Veröffentlichung die aktuelle Auswahl und die Preise auf contabo.com.

Alle Contabo Pläne enthalten unbegrenzten Traffic ohne Abrechnung ausgehender Datenübertragungen. Das ist für Agenten-Workloads relevant, die Daten aus dem Web abrufen, API-Antworten streamen oder große Mengen an Orchestrierungs-Logs übertragen. Prüfe vor der Bereitstellung die aktuellen Preise und genauen Spezifikationen auf contabo.com, da sich Produktnamen und Spezifikationen mit der Zeit ändern.

FAQ: VPS-Spezifikationen für KI-Agenten

Welche VPS-Spezifikationen brauche ich für Paperclip mit mehreren Agenten?

Für Paperclip mit mehreren gleichzeitig aktiven Agenten und externen APIs wie Claude, GPT-4 oder Gemini sind 4 vCPU, 8 GB RAM und 80 GB NVMe eine praxistaugliche Basis für bis zu etwa 20 Agenten. Das dokumentierte Minimum von Paperclip beträgt 1 vCPU und 1–2 GB RAM. In der Praxis belegen PostgreSQL-Datenbank, Web-Dashboard und Docker-Sandboxes jedoch bereits den Großteil dieser Ressourcen, bevor die Agenten arbeiten. Der Cloud VPS 4 von Contabo deckt diese Klasse mit ausreichend Reserven ab.

Wie viel RAM benötigt ein KI-Agent auf einem VPS?

Für einen einzelnen API-basierten Agenten reichen 2–4 GB. Bei einer Multi-Agent-Orchestrierung mit Datenbank und Web-Dashboard sind 8 GB eine praxistaugliche Basis. Mit Browserautomatisierung über Playwright oder Selenium solltest du 16 GB einplanen. Für ein lokales LLM brauchst du je nach Modellgröße mindestens 16–32 GB. Ein häufiger Fehler besteht darin, nur den Agenten einzuplanen und Datenbank, Container sowie den zusätzlichen Bedarf von Browser oder Modell zu vergessen.

Brauche ich einen GPU VPS für KI-Agenten?

Nein. Für API-basierte Agenten reicht ein normaler CPU-VPS. Eine GPU wird erforderlich, wenn ein lokales LLM auf demselben Server läuft: 7B-Modelle können technisch auf einer CPU ausgeführt werden, arbeiten dort aber langsam. Ab 13B ist eine GPU für praxistaugliche Inferenzgeschwindigkeiten erforderlich. Wenn Datenschutz dein Ziel ist, bleiben beim Hosting eines API-basierten Agenten auf einem Contabo VPS in der EU deine Daten in einer EU-Infrastruktur, ohne dass du lokale Inferenz benötigst.

Welcher VPS eignet sich 2026 am besten für selbst gehostete KI-Agenten?

Für die meisten API-basierten Agenten-Setups bietet der Cloud VPS 4 von Contabo mit 4 vCPU, 8 GB RAM und NVMe in dieser Klasse ein gutes Verhältnis von RAM zu Preis und enthält unbegrenzten Traffic. Das ist für Agenten relevant, die Daten aus dem Web abrufen oder viel API-Traffic erzeugen. Für Browserautomatisierung oder RAG-Workloads passt der Cloud VPS 6 mit 8 vCPU und 16 GB. Bei lokaler LLM-Inferenz verarbeitet der Cloud VPS 8 mit 24 GB 7B-Modelle; ab 13B brauchst du Cloud VDS oder GPU VPS.

Ich möchte eigene KI-Agenten betreiben, ohne Daten an Drittanbieter-APIs zu senden. Welche Hardware brauche ich?

Das hängt davon ab, wie streng du „ohne Datenübermittlung an Dritte“ auslegst. Reicht die Speicherung in einer Infrastruktur unter EU-Recht, erfüllt ein API-basierter Agent auf einem Contabo VPS in der EU mit 4 vCPU und 8 GB RAM diese Anforderung ohne GPU. Orchestrierungsschicht und Kundendaten bleiben in der EU, obwohl der eigentliche LLM-Aufruf an den API-Anbieter geht. Wenn sämtliche Inferenz lokal erfolgen und nichts deine Hardware verlassen darf, brauchst du eine GPU: 8–12 GB VRAM für ein 7B-Modell und bis zu 48+ GB VRAM für ein 70B+-Modell, ausgeführt über Ollama oder llama.cpp auf einem Contabo GPU VPS oder Cloud VDS.

Welche VPS-Spezifikationen brauche ich, um eine KI-Orchestrierungsplattform wie Paperclip mit mehreren gleichzeitig laufenden Agenten selbst zu hosten?

Der Cloud VPS 4 von Contabo mit 4 vCPU, 8 GB RAM und NVMe-Speicher ist eine praxistaugliche Basis für Paperclip mit bis zu 20 gleichzeitig über externe APIs wie OpenAI, Anthropic oder OpenRouter laufenden Agenten. Der Node.js-Server und das PostgreSQL-Backend von Paperclip benötigen zusammen bereits ungefähr 2 GB RAM. Die restlichen Ressourcen decken gleichzeitige Agenten-Heartbeats und die Nutzung von Werkzeugen in Docker-Sandboxes ab. Wenn du lokale LLMs auf demselben Server ausführen möchtest, statt externe APIs aufzurufen, brauchst du einen Cloud VPS 12 oder höher mit GPU-Beschleunigung. Dann bestimmen die Modellgewichte und nicht der Orchestrator die Mindestanforderungen an die Hardware.

Hinweis: Die in diesem Artikel genannten Produktspezifikationen, Funktionen und Preise können sich ändern und je nach Region, Abrechnungszeitraum und laufenden Angeboten abweichen. Prüfe die offiziellen Websites der jeweiligen Anbieter oder Marken auf aktuelle Werte, Preise und lokale Wechselkurse.