← volver Consola de centralita telefónica abandonada con cables enredados, iluminada por luz de ventana nublada, grano de película de 35 mm

Vercel AI Gateway: Enrutamiento, conmutación por error y qué realmente ahorra

Un cliente me llamó a las 8 a.m. un jueves. Su resumidor de documentos impulsado por IA había estado devolviendo 503 desde la medianoche porque OpenAI tenía una interrupción parcial en el endpoint gpt-4o. Estaban en un contrato SaaS de £40k/mes y su cliente empresarial gritaba. Tenía exactamente una pregunta en la cabeza: ¿por qué nadie había integrado un fallback de reintento hacia Anthropic en esto?

Eso fue hace ocho meses. Vercel AI Gateway es lo más parecido que he visto a una respuesta lista para usar a ese problema exacto. Pero "lo más parecido" está haciendo mucho trabajo en esa frase. Déjame decirte qué hace realmente, cómo se ven los números y dónde deberías seguir siendo escéptico.

---

Qué es realmente Vercel AI Gateway

La mayoría de las personas ven el nombre y asumen que es un proxy con un buen registro. Es un poco más que eso, pero no tanto más como implica la copia de marketing.

En su núcleo, Vercel AI Gateway se sitúa entre tu código de aplicación y múltiples proveedores de LLM: OpenAI, Anthropic, Mistral, Google Gemini y otros. Envías una única solicitud al endpoint del gateway. El gateway decide qué modelo/proveedor llamar, maneja reintentos, almacena en caché respuestas semánticas y devuelve el resultado. Obtienes una línea de facturación en lugar de cuatro dashboards de API.

La integración del SDK es genuinamente pulida. Si ya estás usando el Vercel AI SDK, cambias tu importación de proveedor por el cliente del gateway y pasas una configuración de proveedores. Tal vez quince minutos de trabajo en un proyecto existente.

Lo que no es es un reductor de costos mágico por sí solo. Los ahorros provienen de tres comportamientos específicos: enrutamiento por costo, almacenamiento en caché de prompts repetidos y evitar inicios en frío después de fallos del proveedor. Si no estás obteniendo valor de al menos uno de esos tres, el gateway agrega sobrecarga sin beneficio.

---

Cómo funciona la lógica de enrutamiento

Prioridad del proveedor y enrutamiento ponderado

Configuras una lista de proveedores con un orden de prioridad o una distribución de peso. El enrutamiento por prioridad es simple: intenta el proveedor A, y si devuelve un 429 o un 5xx, cae al proveedor B. El enrutamiento ponderado divide el tráfico por porcentaje, para que puedas decir "70% OpenAI, 30% Mistral" y probar diferencias de costo en tráfico real sin una migración completa.

Usé enrutamiento ponderado en una herramienta de generación de contenido que Seahawk construyó para una empresa de medios el trimestre pasado. Ejecutamos gpt-4o-mini al 60% contra mistral-medium al 40% durante un mes. Mistral costaba alrededor de 34% más barato por millón de tokens en ese momento, pero la calidad de salida para extracción de JSON estructurado era notablemente más débil. Terminamos en 80/20 a favor de OpenAI. El punto es: el gateway hizo esa prueba A/B sin esfuerzo. Sin él habríamos estado conectando dos clientes SDK separados y administrando la división en la lógica de la aplicación.

Comportamiento de conmutación por error

La conmutación por error es la característica principal y funciona como se anuncia, en su mayoría. Cuando OpenAI devuelve un 5xx, el gateway reintenta en el siguiente proveedor configurado en aproximadamente 800ms en mi prueba. Para respuestas en streaming es un poco más desordenado: el stream puede reiniciarse silenciosamente desde el proveedor alternativo, y si no estás manejando el stream correctamente en el lado del cliente puedes obtener un chunk de apertura duplicado. Eso nos sorprendió una vez.

Una cosa que debes saber: el gateway no hace conmutación por error semántica. No sabe que tu respuesta Anthropic claude-3-5-sonnet podría expresar las cosas de manera diferente que el equivalente de OpenAI. Eres responsable de la compatibilidad del prompt entre proveedores. Para la mayoría de las interfaces de chat eso está bien. Para salidas estructuradas con esquemas estrictos, prueba cada proveedor en tu cadena de conmutación por error independientemente antes de ir en vivo.

---

La capa de almacenamiento en caché: dónde vive el dinero real

Esta es la parte que la mayoría de las personas no aprecian. Vercel AI Gateway incluye almacenamiento en caché semántico, no solo almacenamiento en caché de coincidencia exacta.

El almacenamiento en caché de coincidencia exacta es lo básico: si el mismo string de prompt llega al gateway dos veces, devuelve la respuesta en caché. El almacenamiento en caché semántico va más allá. Usando similaridad de embeddings, reconoce que "resume este párrafo en tres oraciones" y "dame un resumen de tres oraciones de este párrafo" son la misma solicitud y sirve el resultado en caché.

Para el proyecto de resumidor de documentos (el que casi causa un infarto a mi cliente), instrumentalizamos la tasa de aciertos de caché después de habilitar el caché semántico con un umbral de similitud de coseno de 0.92. Durante dos semanas de tráfico en producción: 41% de tasa de aciertos de caché. A £0.015 por cada 1K tokens de salida en GPT-4o, eso no es trivial en 2 millones de tokens de salida diarios.

Haz las cuentas rápidas por tu cuenta:

  1. 2.000.000 tokens de salida/día
  2. 41% servidos desde caché = 820.000 tokens no facturados
  3. A £0.015/1K son £12.30 ahorrados por día
  4. Durante un mes: aproximadamente £370

No cambia la vida para una gran empresa. Es significativo para un operador indie de SaaS que vigila el margen. Y eso es solo un proyecto, un mes.

La función de prompt caching de OpenAI ahora maneja el caché de prefijo de forma nativa, así que para prompts de sistema largos ya estás obteniendo parte de esto gratis. El caché semántico de Vercel se suma a eso, manejando la variación en el contenido del turno del usuario.

---

Observability: Better Than Nothing, Not Good Enough Alone

Cada solicitud a través del gateway se registra: latencia, conteos de tokens, proveedor utilizado, acierto/fallo de caché, estimación de costo. Lo ves en el dashboard de Vercel. Es limpio y legible.

Aquí está el punto. Si estás ejecutando un sistema serio en producción, ya tienes algo como Datadog, Grafana, o como mínimo LangSmith en tu pipeline de trazas. El dashboard de Vercel te da visibilidad a nivel de gateway. No te da trazas a nivel de span en toda tu aplicación. No puedes ver que la solicitud de un usuario en particular tardó 4.2 segundos porque 3.1 de esos segundos se gastaron en tu paso de recuperación antes de que el LLM siquiera fuera llamado.

Así que trato la observabilidad integrada del gateway como un primer filtro: ¿está el problema a nivel de la llamada al LLM o en otro lugar? Para cualquier cosa más profunda, sigo exportando a una herramienta de trazas adecuada.

Un número específico que vale la pena conocer: el gateway añade aproximadamente 15-30ms de latencia por solicitud en promedio según lo que he medido en despliegues de región EU. Para voz en tiempo real o requisitos de UX por debajo de 100ms, eso importa. Para procesamiento de documentos asincrónico, no importa.

---

Cuánto cuesta realmente ejecutarlo

Vercel AI Gateway está incluido en el plan Pro (£17/mes en el momento de escribir esto) y superiores. No hay cargo por solicitud de Vercel. Sigues pagando directamente los costos de tokens del proveedor subyacente.

El costo oculto es operacional: ahora estás añadiendo Vercel como una dependencia en tu camino de inferencia. Si Vercel tiene un problema en su red de edge, tus llamadas al LLM fallan independientemente de si OpenAI está perfectamente saludable. He visto esto suceder una vez en los últimos seis meses, una interrupción parcial de ~12 minutos en el edge de Vercel en la región EU-West. Para la mayoría de aplicaciones eso es aceptable. Para cualquier cosa con compromisos de SLA medidos en nueves, factorízalo.

También está la cuestión de la residencia de datos. Tus prompts y completaciones pasan a través de la infraestructura de Vercel. Para la mayoría de aplicaciones de consumidor: irrelevante. Para sanidad, finanzas, o cualquier cosa que toque datos personales sensibles bajo GDPR de manera significativa: lee el acuerdo de procesamiento de datos cuidadosamente antes de enviar cualquier cosa. He tenido que decirle a dos clientes fintech que saltaran el gateway completamente por esta razón y manejaran el enrutamiento en la aplicación en su lugar.

---

Cuándo usarlo y cuándo saltárselo

Seré directo sobre esto porque el marketing de desarrolladores alrededor de herramientas de IA tiende a vender demasiado.

Usa Vercel AI Gateway si:

  • Ya estás en Vercel y usas el AI SDK (cero fricción extra)
  • Tienes una estrategia multiproveedor y quieres failover sin escribir lógica de reintento
  • Tu aplicación tiene suficientes prompts repetidos o semánticamente similares para que el caché valga la pena
  • Quieres un dashboard de costos sin configurar integraciones de facturación de proveedor separadas

Omítelo o piénselo bien si:

  • Tiene requisitos estrictos de residencia de datos (GDPR, HIPAA)
  • Necesita una latencia total de inferencia inferior a 50ms y cada salto cuenta
  • Ejecuta en infraestructura que no es Vercel y agregar su edge introduce más complejidad de la que resuelve
  • Su variedad de prompts es extremadamente alta y la tasa de acierto del caché semántico será cercana a cero de todas formas

En 2022 construimos una herramienta de análisis de documentos legales en un stack auto-hospedado para una empresa de la City of London. Incluso si Vercel AI Gateway hubiera existido entonces, habría estado descartado inmediatamente. Los prompts contenían información privilegiada del cliente y el equipo de cumplimiento de TI de la empresa nunca habría aprobado un proxy de terceros. Implementamos nuestra propia capa de abstracción de proveedores en aproximadamente cuatro horas de trabajo. Manejaba conmutación por error entre dos proveedores con una cola de prioridad simple. Nada glamoroso. Totalmente adecuado.

---

La Configuración Práctica (Versión Corta)

Si ha decidido que es correcto para su proyecto, aquí está la secuencia que sigo:

  1. Habilite la puerta de enlace en la configuración de su proyecto Vercel en la pestaña "AI"
  2. Instale o actualice ai y @ai-sdk/openai (y cualesquiera otros paquetes de proveedores que necesite) a las versiones más recientes
  3. Reemplace la instanciación directa del cliente del proveedor con el cliente de puerta de enlace de @vercel/ai-gateway (consulte la documentación oficial para la ruta de importación exacta ya que ha cambiado una vez)
  4. Defina su lista de proveedores en orden de prioridad en el objeto de configuración de la puerta de enlace
  5. Establezca su umbral de similitud de caché semántico: comienzo en 0.90 y ajusto según las tasas de acierto observadas después de una semana de tráfico
  6. Implemente en un entorno de staging y active deliberadamente fallos del proveedor para verificar que la cadena de conmutación por error funciona como espera
  7. Supervise la tasa de acierto del caché y la latencia p95 durante las primeras dos semanas antes de sacar conclusiones

Eso es todo. Genuinamente no es complicado.

---

FAQ

¿Vercel AI Gateway soporta respuestas en streaming?

Sí, el streaming funciona a través de la puerta de enlace. El único inconveniente es la conmutación por error durante el streaming: si el proveedor principal se desconecta durante una respuesta en streaming, la puerta de enlace reintentará con el siguiente proveedor, pero el stream se reinicia. Dependiendo de cómo su UI del lado del cliente maneje contenido parcial, esto puede causar un parpadeo visible o una primera oración duplicada. Pruébelo explícitamente en su UI antes de desplegar.

¿Puedo usar Vercel AI Gateway sin el SDK de IA de Vercel?

Técnicamente puede golpear directamente el endpoint de la puerta de enlace sobre HTTP, pero la integración con el SDK es donde se vuelve ergonómica. Sin el SDK está escribiendo sus propios wrappers de fetch alrededor de la URL de la puerta de enlace, manejando streaming usted mismo, y gestionando reintentos manualmente. En ese punto bien podría construir su propia abstracción de proveedores. El valor de la puerta de enlace está estrechamente acoplado al SDK en la práctica.

¿Cómo maneja el caché semántico datos sensibles o personalizados?

No lo hace, automáticamente. Si envía prompts que incluyen datos específicos del usuario (nombres, números de cuenta, contexto de sesión), el caché intentará coincidir con prompts semánticamente similares independientemente de si esos datos difieren entre usuarios. Esto puede causar aciertos incorrectos del caché en flujos personalizados. Debe deshabilitar el caché semántico para esas rutas o incluir una clave de caché con alcance de usuario si la puerta de enlace lo soporta en su nivel de plan.

¿Qué sucede con mis solicitudes si Vercel tiene una interrupción?

Fallan. La puerta de enlace está en la ruta crítica. Si necesita una resiliencia genuina multi-nube, debe tener un circuit-breaker en la capa de aplicación que pueda omitir completamente la puerta de enlace e ir directamente a los proveedores. Mantengo clientes SDK del proveedor inicializados como respaldo en cualquier aplicación donde el tiempo de actividad realmente importa.

---

El resumen honesto: Vercel AI Gateway es una pieza de infraestructura bien construida que se merece su lugar en un stack de IA nativo de Vercel. No va a revolucionar tu economía unitaria, pero una tasa de caché del 35-40% en la carga de trabajo correcta más failover automático es una mejora operacional real frente a conectar todo manualmente. Solo asegúrate de saber qué no puede hacer antes de comprometerte con ello. La llamada telefónica de las 8 a.m. de un cliente asustado es una forma miserable de descubrir dónde estaban equivocadas tus suposiciones.

← volver