Aloje su propio agente de IA con OpenClaw: instalación gratuita en un solo clic!

LiteLLM vs Portkey, Kong y Cloudflare: gateways de IA comparados

LiteLLM vs Portkey, Kong & Cloudflare: AI Gateways Compared

Si LiteLLM es el gateway de código abierto y autoalojado por defecto para enrutar tráfico de LLM, cada una de las alternativas principales se inclina hacia un lado distinto. Portkey suma gobernanza y guardrails, Kong AI Gateway le queda a las empresas que ya operan Kong, y Cloudflare AI Gateway es la opción gestionada y nativa de su propio ecosistema.

Esta comparación revisa las cuatro. Y aclara dónde encajan realmente vLLM y Ollama, porque no son gateways en absoluto.

Veredicto rápido

  • Elige LiteLLM si quieres un gateway de código abierto que autoalojas y controlas por completo.
  • Elige Portkey si la gobernanza, los guardrails y la observabilidad profunda son prioridad.
  • Elige Kong AI Gateway si ya operas una malla de APIs con Kong.
  • Elige Cloudflare AI Gateway si tu aplicación vive en el ecosistema de Cloudflare y quieres cero operación.

Gateways de IA de un vistazo

Gateway¿Autoalojable?¿Código abierto?GuardrailsCarga operativaIdeal para
LiteLLMSí (MIT)BásicosBajaEquipos que autoalojan con código abierto
PortkeyLimitadoNúcleo abierto más gestionadoFuertes (caché semántico, guardrails)Baja (gestionado)Gobernanza y observabilidad
Kong AI GatewayNúcleo abiertoVía pluginsAltaKong ya en marcha, empresa
Cloudflare AI GatewayNoNoFunciones de plataformaCasi nulaApps en el ecosistema de Cloudflare

LiteLLM vs Kong AI Gateway

Kong AI Gateway lleva el enrutamiento de LLM a la madura plataforma de gestión de APIs de Kong, con un ecosistema fuerte de plugins, SSO y capacidades como el enmascaramiento de datos personales. Ese poder viene con peso: es más pesado de operar y da por sentada una infraestructura Kong debajo. LiteLLM es la opción más ligera, más simple y más autocontenida. La regla honesta es elegir Kong si ya corres una malla de APIs con Kong y quieres gobernar el tráfico de LLM de la misma forma. En cualquier otro caso, LiteLLM es mucho menos que operar.

LiteLLM vs Cloudflare AI Gateway

Cloudflare AI Gateway es totalmente gestionado y su carga operativa es casi nula. Pone caché y analítica delante de tus proveedores, y brilla cuando tu aplicación ya vive en el ecosistema de Cloudflare. El intercambio es el clásico de los servicios gestionados: cedes algo de control sobre tus datos a cambio de no operar nada. LiteLLM es la elección opuesta. Tú lo operas, y a cambio la ruta completa de los datos se queda en tu infraestructura.

Dónde encajan vLLM y Ollama (no son gateways)

Esta es la comparación que más se equivoca la gente. vLLM y Ollama no son gateways, son motores de inferencia y runtimes que ejecutan los modelos de verdad. Un gateway como LiteLLM se coloca delante de ellos: enruta una petición hacia un backend de vLLM o de Ollama igual que la enrutaría hacia un proveedor en la nube. Así que “LiteLLM vs vLLM” o “LiteLLM vs Ollama” es un error de categoría. El patrón real es usarlos juntos, un gateway para enrutar y controlar, un runtime para la inferencia. Si tu meta es la inferencia autoalojada, las guías de Ollama que enlazamos son el punto de partida.

¿Qué gateway de IA deberías elegir?

  • Código abierto y autoalojado: LiteLLM.
  • Gobernanza, guardrails, observabilidad: Portkey.
  • Kong ya en marcha o necesidades de empresa: Kong AI Gateway.
  • App en el ecosistema de Cloudflare, cero operación: Cloudflare AI Gateway.
  • Modelos propios en marcha: combina LiteLLM como gateway con vLLM u Ollama como runtime.

Cómo autoalojar LiteLLM en un VPS

De los cuatro, LiteLLM es el más amigable con el autoalojamiento, un proxy limitado por CPU con una base de datos PostgreSQL pequeña que corre cómodo en un servidor virtual modesto. Un VPS te da acceso root para Docker, control total sobre tus datos y la opción de mantener los datos en la UE. Si además quieres autoalojar los modelos, puedes combinar el gateway con una instancia GPU que corra vLLM u Ollama. En Contabo, la línea Core VPS ofrece una fuerte relación entre RAM y euro para el gateway, con opciones GPU disponibles para la inferencia. Para desplegarlo, revisa la guía de Docker que enlazamos.

Preguntas frecuentes: LiteLLM y otros gateways de IA

¿Cuál es la mejor alternativa a LiteLLM?

Depende de lo que necesites. Portkey es la alternativa más cercana si quieres gobernanza y guardrails como plano de control gestionado. Kong AI Gateway le queda a empresas que ya están sobre Kong, y Cloudflare AI Gateway encaja en instalaciones gestionadas y nativas de su ecosistema. Para autoalojamiento con código abierto en concreto, LiteLLM sigue siendo la opción principal.

¿LiteLLM o Portkey, cuál es mejor?

Ninguno es mejor de forma universal. LiteLLM es mejor si quieres un gateway de código abierto que autoalojas y del que eres dueño. Portkey es mejor si quieres gobernanza gestionada, guardrails, caché semántico y observabilidad sin operar la infraestructura. La decisión gira sobre todo en torno al modelo de entrega, es decir propiedad al autoalojar frente a un plano de control gestionado.

¿vLLM es una alternativa a LiteLLM?

No. vLLM es un motor de inferencia que ejecuta modelos, mientras que LiteLLM es un gateway que enruta peticiones hacia backends de modelos. Operan en capas distintas y suelen usarse juntos, con LiteLLM delante enrutando hacia un backend de vLLM. Así que vLLM complementa a LiteLLM en lugar de reemplazarlo.

¿Ollama es un gateway de LLM?

No. Ollama es un runtime local para ejecutar modelos en tu propio hardware, no un gateway. Un gateway como LiteLLM puede colocarse delante de Ollama y enrutar peticiones hacia él, junto a otros proveedores. Si quieres inferencia local, usarías Ollama como backend detrás de tu gateway, no en lugar de él.

Scroll al inicio