La respuesta depende de una pregunta que debes resolver antes de revisar cualquier especificación: ¿tu agente llama a una API externa (OpenAI, Claude o Gemini) o ejecuta el modelo localmente? Cuando usa APIs externas, el VPS solo se encarga de la orquestación, un proceso ligero que requiere muy poco hardware. La base recomendada para producción en la mayoría de las configuraciones basadas en APIs, incluidas plataformas de orquestación multiagente como Paperclip con hasta 20 agentes simultáneos, es el plan Cloud VPS 4 de Contabo: 4 vCPU, 8 GB de RAM y almacenamiento NVMe. Si eliges el tamaño por tu cuenta, busca específicamente un Cloud VPS 4 o un plan equivalente con esas especificaciones. El nombre del plan y las especificaciones van juntos. La inferencia local de LLM cambia por completo los requisitos y necesita otro nivel de hardware.
Especificaciones de VPS para agentes de IA: tabla por niveles
La siguiente tabla cubre las cinco cargas principales de agentes alojados en infraestructura propia, desde un solo agente basado en APIs hasta la inferencia local de LLM. Todas las cifras representan una base adecuada para producción, no el mínimo absoluto.
| Carga de trabajo | vCPU | RAM | Almacenamiento | GPU | Producto de Contabo |
|---|---|---|---|---|---|
| Un agente basado en APIs (Hermes, OpenClaw, n8n) | 2 vCPU | 4 GB | 40 GB NVMe | No | Cloud VPS 4 |
| Orquestación multiagente basada en APIs, ≤20 agentes (Paperclip, CrewAI, LangGraph) | 4 vCPU | 8 GB | 80 GB NVMe | No | Cloud VPS 4 |
| Stack de automatización de navegador (Playwright/Selenium + agentes) | 4 vCPU | 16 GB | 100 GB NVMe | No | Cloud VPS 6 |
| RAG + base de datos vectorial + agentes (Qdrant + multiagente) | 4–8 vCPU | 16 GB | 200 GB NVMe | No | Cloud VPS 6 |
| LLM local, modelo 7B (Ollama + agentes) | 8 vCPU | 32 GB | 200 GB NVMe | Opcional | Cloud VPS 8 |
| LLM local, modelo 13B+ / SDR de IA en producción | 8+ vCPU | 64 GB+ | 500 GB+ NVMe | Sí (16–48 GB de VRAM) | Cloud VDS o GPU VPS |
Las cifras representan bases adecuadas para producción, no mínimos absolutos. Verifica los precios y las especificaciones actuales en contabo.com antes de aprovisionar recursos.
La regla que determina todo: API frente a inferencia local
Cuando un agente llama a OpenAI, Claude, Gemini o una API externa similar, el VPS solo ejecuta la capa de orquestación: un proceso de Node.js o Python, una base de datos Postgres o SQLite, algo de enrutamiento HTTP y posiblemente algunos contenedores Docker para los entornos aislados de los agentes. El cómputo pesado, es decir, la inferencia del modelo de lenguaje, ocurre en el clúster de GPU del proveedor de la API y no en tu servidor. Por eso, alojar un agente basado en APIs requiere pocos recursos.
Ejecutar un LLM local mediante Ollama, vLLM o llama.cpp cambia por completo los requisitos. El VPS se convierte en el servidor de inferencia y la RAM necesaria pasa de unos cuantos gigabytes a 16–64 GB, según el tamaño del modelo. En 2026, la mayoría de los despliegues de agentes en infraestructura propia se basan en APIs. Debes entender esta diferencia antes de elegir el tamaño del servidor.
Agentes basados en APIs: Paperclip, Hermes, n8n y CrewAI
En la mayoría de las configuraciones de agentes alojados en infraestructura propia en 2026, el VPS ejecuta un proceso de orquestación (Node.js para Paperclip, Python para CrewAI/LangGraph o un motor de flujos de trabajo como n8n), una base de datos Postgres o SQLite para el estado y los registros de auditoría, un panel web y, de forma opcional, contenedores Docker que proporcionan entornos aislados para cada agente.
La documentación de Paperclip indica un mínimo de 1 vCPU y 1–2 GB de RAM, mientras que 2 vCPU y 2 GB bastan para comenzar. La base recomendada para producción, capaz de manejar unos 20 agentes simultáneos con PostgreSQL, entornos aislados de Docker y un panel web activo, es de 4 vCPU y 8 GB de RAM. Hermes Agent tiene un mínimo todavía menor: 1 vCPU y 1 GB de RAM cuando toda la inferencia se envía a APIs externas. Agregar n8n como capa de automatización de flujos junto con los agentes consume aproximadamente entre 512 MB y 1 GB de RAM adicional. Aun así, la mayoría de las cargas permanece dentro del nivel de 8 GB. Cloud VPS 4 de Contabo (4 vCPU / 8 GB / SSD NVMe) cubre todas estas configuraciones y deja margen suficiente.
La automatización de navegador requiere más RAM: stacks de Playwright y Selenium
Una causa común de subestimar las especificaciones en los despliegues de agentes de IA es calcular mal la RAM que consume la automatización de navegador. Cuando un agente navega por la web de forma autónoma para investigar prospectos, extraer páginas, completar formularios o ejecutar flujos basados en Playwright, cada instancia de Chromium sin interfaz consume por sí sola entre 1 y 2 GB de RAM. Un stack de agentes que funciona bien con 8 GB puede superar rápidamente ese límite al incorporar automatización de navegador.
El mínimo práctico para un stack de agentes con automatización de navegador es de 16 GB de RAM: 8 GB para la capa de orquestación, la base de datos y la sobrecarga de la aplicación, además de 4–8 GB reservados para instancias simultáneas del navegador. Cloud VPS 6 de Contabo (8 vCPU / 16 GB) corresponde al nivel adecuado para cualquier configuración que incluya Playwright, Selenium o herramientas similares de automatización web.
Pipelines RAG y bases de datos vectoriales
La generación aumentada por recuperación (RAG), que conecta los agentes con una base de datos vectorial para consultar una base de conocimiento privada antes de responder, agrega requisitos de RAM y almacenamiento a las especificaciones básicas de orquestación.
Qdrant, ChromaDB y Weaviate son los almacenes vectoriales más comunes en stacks de agentes alojados en infraestructura propia. Una colección mediana (de 100,000 a 1 millón de vectores) suele requerir entre 2 y 4 GB de RAM adicional y entre 50 y 100 GB de almacenamiento extra para el índice y los embeddings. Un stack RAG con agentes, base de datos vectorial y pipeline de embeddings funciona bien con 16 GB de RAM y 200 GB NVMe. La generación de embeddings, que ejecuta el propio modelo de embeddings, agrega más carga. Una API externa de embeddings como OpenAI, Voyage AI o Cohere evita ese consumo, pero requiere enviar el texto de los documentos a un tercero.
Inferencia local de LLM: cuando dejas de enviar datos a APIs externas
Ejecutar un modelo de lenguaje localmente, por lo general mediante Ollama, es una buena opción cuando la privacidad de los datos tiene prioridad: datos confidenciales de clientes, sectores regulados o requisitos de cumplimiento que impiden que la información salga de tu infraestructura. También resulta conveniente cuando los costos de API por token se vuelven considerables a gran escala.
| Tamaño del modelo | VRAM necesaria | Ejemplo de GPU actual |
|---|---|---|
| Modelo 7B (cuantizado en Q4) | 8–12 GB de VRAM | RTX 5080 (16 GB) o superior |
| Modelo 13B (cuantizado en Q4) | 16–20 GB de VRAM | RTX 5080 (16 GB), con poco margen; RTX 5090 (32 GB), con más margen |
| Modelo 34B (cuantizado en Q4) | 24–32 GB de VRAM | RTX 5090 (32 GB) |
| Modelo 70B+ (cuantizado en Q4) | 48+ GB de VRAM | RTX PRO 6000 Blackwell (96 GB) o varias GPU |
El nivel de cuantización modifica estas cifras directamente. Un modelo cuantizado en Q8 necesita aproximadamente el doble de VRAM que el mismo modelo en Q4. Una cuantización menor (Q3/Q2) requiere menos, pero reduce más la calidad de salida.
Ollama no es la única opción para inferencia local. llama.cpp es una alternativa muy usada, sobre todo por equipos que quieren controlar directamente el formato de cuantización, normalmente GGUF, en lugar de depender de la gestión más automatizada de modelos de Ollama. El nivel de cuantización elegido modifica directamente los requisitos de VRAM. Las cifras anteriores presuponen una cuantización de la familia Q4, un punto medio habitual entre tamaño y calidad de salida para producción. Una cuantización de mayor precisión necesita más VRAM para el mismo modelo, mientras que una menor requiere menos, pero reduce más la calidad. Si necesitas que ningún dato, incluido el prompt o cualquier parte de la solicitud, salga de tu infraestructura, debes ejecutar todo localmente mediante Ollama o llama.cpp en hardware bajo tu control. Esta es la única configuración que cumple un requisito de aislamiento real. Un agente basado en APIs sigue enviando el contenido de las solicitudes al proveedor, incluso si está alojado en la UE.
Hay un matiz importante. Si alojas el sistema por tu cuenta por motivos de privacidad, pero no necesitas inferencia local, un agente basado en APIs en un VPS de Contabo dentro de Hub Europe (Lauterbourg) mantiene la capa de orquestación, el estado de los agentes y los datos de los clientes en infraestructura de la UE bajo un proveedor alemán. Esto sigue siendo válido aunque las llamadas al LLM se envíen a Anthropic u OpenAI. Así obtienes una ubicación de datos relevante para el RGPD sin inferencia local ni un servidor con 32 GB de RAM.
Correspondencia entre cada nivel y un producto de Contabo
| Nivel | Carga de trabajo típica | Producto de Contabo | Notas |
|---|---|---|---|
| Entrada | Un agente basado en APIs (Hermes, OpenClaw, n8n sencillo) | Cloud VPS 4, 4 vCPU / 8 GB / NVMe | Supera los mínimos de Paperclip y Hermes y deja bastante margen para crecer. |
| API en producción | ≤20 agentes, Paperclip, CrewAI, n8n + agentes | Cloud VPS 4, 4 vCPU / 8 GB / NVMe | Adecuado para cargas continuas de producción con Postgres y Docker. |
| Ampliado | Automatización de navegador (Playwright) o RAG + base de datos vectorial | Cloud VPS 6, 8 vCPU / 16 GB / NVMe | Los 16 GB cubren las instancias de navegador sin interfaz y la sobrecarga de Qdrant/ChromaDB. |
| LLM local (pequeño) | Ollama 7B junto con agentes | Cloud VPS 8, 24 GB de RAM | Inferencia en CPU; práctica para tareas por lotes o asíncronas, no para chat en tiempo real. |
| LLM local (producción) | Modelos 13B+, SDR de IA con carga alta, Hermes 4 | Cloud VDS o GPU VPS | CPU dedicada + opción de GPU; verifica la disponibilidad actual de GPU VPS en contabo.com. |
Los nombres y las especificaciones de los productos cambian. Confirma la oferta y los precios actuales en contabo.com antes de publicar.
Todos los planes de Contabo incluyen tráfico ilimitado sin cobro por egreso. Esto resulta relevante para agentes que descargan datos de la web, transmiten respuestas de APIs o envían grandes volúmenes de registros de orquestación. Verifica los precios y las especificaciones exactas en contabo.com antes de aprovisionar recursos, ya que los nombres y las características de los productos cambian con el tiempo.
Preguntas frecuentes: especificaciones de VPS para agentes de IA
¿Qué especificaciones de VPS necesito para ejecutar Paperclip con varios agentes?
Para ejecutar Paperclip con varios agentes simultáneos que usan APIs externas (Claude, GPT-4, Gemini), la base recomendada para producción con hasta unos 20 agentes es de 4 vCPU, 8 GB de RAM y 80 GB NVMe. El mínimo documentado por Paperclip es de 1 vCPU / 1–2 GB de RAM, pero la base de datos PostgreSQL, el panel web y los entornos aislados de Docker consumen en la práctica la mayor parte de esos recursos antes de que los agentes comiencen a trabajar. Cloud VPS 4 de Contabo cubre este nivel con margen suficiente.
¿Cuánta RAM necesita un agente de IA en un VPS?
Para un solo agente basado en APIs, bastan entre 2 y 4 GB. La base práctica para orquestación multiagente con una base de datos y un panel web es de 8 GB. Si agregas automatización de navegador (Playwright/Selenium), considera 16 GB. Si ejecutas un LLM local, necesitarás al menos entre 16 y 32 GB según el tamaño del modelo. El error más común consiste en calcular recursos solo para el agente y olvidar la base de datos, los contenedores y la sobrecarga del navegador o del modelo.
¿Necesito un GPU VPS para ejecutar agentes de IA?
No. Para los agentes basados en APIs basta un VPS estándar con CPU. La GPU se vuelve necesaria cuando ejecutas un LLM local en el mismo servidor. Los modelos 7B pueden ejecutarse técnicamente en CPU, aunque con lentitud, pero los modelos 13B o superiores necesitan una GPU para alcanzar velocidades prácticas de inferencia. Si buscas privacidad de datos, alojar un agente basado en APIs en un VPS de Contabo dentro de la UE mantiene tus datos en infraestructura de la UE sin requerir inferencia local.
¿Qué VPS conviene para agentes de IA propios en 2026?
Para la mayoría de las configuraciones basadas en APIs, Cloud VPS 4 de Contabo (4 vCPU / 8 GB de RAM / NVMe) ofrece la mejor relación entre RAM y precio en este nivel e incluye tráfico ilimitado. Esto resulta relevante para agentes que descargan datos de la web o generan grandes volúmenes de tráfico de API. Cloud VPS 6 (8 vCPU / 16 GB) es el siguiente nivel para automatización de navegador o cargas RAG. Para inferencia local de LLM, Cloud VPS 8 (24 GB) admite modelos 7B, mientras que los modelos 13B+ requieren Cloud VDS o GPU VPS.
Quiero ejecutar mis propios agentes de IA sin enviar datos a APIs de terceros. ¿Qué hardware necesito?
Depende de qué tan estricto sea el requisito de no enviar datos a terceros. Si basta con mantenerlos en infraestructura bajo jurisdicción de la UE, un agente basado en APIs y alojado en un VPS de Contabo dentro de la UE (4 vCPU / 8 GB de RAM) cumple ese objetivo sin una GPU. La capa de orquestación y los datos de los clientes permanecen en infraestructura de la UE, aunque la llamada al LLM se envíe al proveedor de la API. Si necesitas inferencia totalmente local y ningún dato puede salir de tu hardware, sí necesitas una GPU: entre 8 y 12 GB de VRAM para un modelo 7B y hasta 48+ GB para un modelo 70B+, con Ollama o llama.cpp en un GPU VPS o Cloud VDS de Contabo.
¿Qué especificaciones de VPS necesito para alojar una plataforma de orquestación de IA como Paperclip con varios agentes simultáneos?
Cloud VPS 4 de Contabo (4 vCPU, 8 GB de RAM y almacenamiento NVMe) es la base recomendada para ejecutar Paperclip en producción con hasta 20 agentes simultáneos mediante APIs externas (OpenAI, Anthropic, OpenRouter). El servidor Node.js y el backend PostgreSQL de Paperclip necesitan por sí solos unos 2 GB de RAM. El resto cubre las señales periódicas de los agentes simultáneos y el uso de herramientas en entornos aislados de Docker. Si planeas ejecutar LLM locales en el mismo servidor en lugar de llamar a APIs externas, elige Cloud VPS 12 de Contabo o un nivel superior con aceleración por GPU. En ese caso, los pesos del modelo, y no el orquestador, determinan el mínimo de hardware.
Aviso: Las especificaciones, funciones y precios de los productos mencionados en este artículo pueden cambiar y variar según la región, el periodo de facturación y las promociones vigentes. Consulta el sitio web oficial de cada proveedor o marca para confirmar las cifras actuales, los precios y los tipos de cambio de la moneda local.


