Um cliente ligou para mim às 8 da manhã de uma quinta-feira. Seu resumidor de documentos alimentado por IA estava retornando 503s desde a meia-noite porque OpenAI tinha uma indisponibilidade parcial no endpoint gpt-4o. Eles estavam num contrato SaaS de £40k/mês e o cliente enterprise estava gritando. Tinha exatamente uma pergunta na minha cabeça: por que ninguém havia construído um fallback de retry para Anthropic nessa coisa?
Isso foi oito meses atrás. Vercel AI Gateway é a coisa mais próxima que vi de uma solução pronta para esse problema exato. Mas "mais próxima" está carregando muito peso nessa frase. Deixa eu te contar o que realmente faz, como ficam os números e onde você ainda deve desconfiar.
---
O Que Vercel AI Gateway Realmente É
A maioria das pessoas vê o nome e assume que é um proxy com alguns logs legais. É um pouco mais que isso, mas não tão mais quanto o texto de marketing implica.
No seu núcleo, Vercel AI Gateway fica entre seu código de aplicação e múltiplos provedores de LLM: OpenAI, Anthropic, Mistral, Google Gemini e outros. Você envia uma única requisição para o endpoint do gateway. O gateway decide qual modelo/provedor chamar, lida com retries, cacheia respostas semânticas e retorna o resultado. Você recebe um item de fatura em vez de quatro dashboards de API.
A integração do SDK é genuinamente elegante. Se você já está usando Vercel AI SDK, troca o import do seu provedor pelo cliente do gateway e passa uma config de providers. Talvez quinze minutos de trabalho em um projeto existente.
O que não é é um redutor mágico de custos por si só. A economia vem de três comportamentos específicos: roteamento por custo, cache de prompts repetidos e evitar cold restarts após falhas de provedor. Se você não está tirando valor de pelo menos um desses três, o gateway adiciona overhead sem benefício.
---
Como a Lógica de Roteamento Funciona
Prioridade de Provedor e Roteamento Ponderado
Você configura uma lista de provedores com uma ordem de prioridade ou distribuição de peso. Roteamento por prioridade é simples: tente provedor A, e se retornar um 429 ou um 5xx, caia para provedor B. Roteamento ponderado divide o tráfego por percentual, então você pode dizer "70% OpenAI, 30% Mistral" e testar diferenças de custo em tráfego real sem migração completa.
Usei roteamento ponderado em uma ferramenta de geração de conteúdo que Seahawk construiu para uma empresa de mídia no trimestre passado. Rodamos gpt-4o-mini em 60% contra mistral-medium em 40% por um mês. Mistral saiu cerca de 34% mais barato por milhão de tokens na época, mas a qualidade de saída para extração de JSON estruturado era notavelmente mais fraca. Terminamos em 80/20 a favor de OpenAI. O ponto é: o gateway tornou esse teste A/B trivial. Sem ele teríamos estado conectando dois clientes SDK separados e gerenciando a divisão na lógica da aplicação.
Comportamento de Failover
Failover é o recurso em destaque e funciona como anunciado, principalmente. Quando OpenAI retorna um 5xx, o gateway tenta novamente no próximo provedor configurado em aproximadamente 800ms nos meus testes. Para respostas em streaming é um pouco mais bagunçado: o stream pode reiniciar silenciosamente do provedor fallback, e se você não estiver tratando o stream corretamente no lado do cliente você pode ter um chunk de abertura duplicado. Isso nos pegou uma vez.
Uma coisa a saber: o gateway não faz failover semântico. Ele não sabe que sua resposta Anthropic claude-3-5-sonnet pode formular as coisas diferentemente que o equivalente OpenAI. Você é responsável pela compatibilidade de prompt entre provedores. Para a maioria das interfaces de estilo chat tudo bem. Para saídas estruturadas com schemas rígidos, teste cada provedor em sua cadeia de failover independentemente antes de ir ao ar.
---
A Camada de Cache: Onde o Dinheiro Real Fica
Essa é a parte que a maioria das pessoas subestima. Vercel AI Gateway inclui semantic caching, não apenas cache de correspondência exata.
Cache de correspondência exata é básico: se a mesma string de prompt bate no gateway duas vezes, retorne a resposta cacheada. Semantic caching vai além. Usando similaridade de embedding, reconhece que "resuma esse parágrafo em três frases" e "me dê um resumo de três frases desse parágrafo" são a mesma requisição e serve o resultado em cache.
Para o projeto de resumidor de documentos (aquele que quase deu um infarto no meu cliente), instrumentamos a taxa de acerto de cache depois de habilitar cache semântico com um limiar de similaridade de cosseno de 0.92. Durante duas semanas de tráfego em produção: 41% de taxa de acerto de cache. A £0.015 por 1K tokens de saída no GPT-4o, isso não é trivial considerando 2 milhões de tokens de saída diários.
Faça as contas no guardanapo você mesmo:
- 2.000.000 tokens de saída/dia
- 41% servidos do cache = 820.000 tokens não cobrados
- A £0.015/1K isso são £12.30 economizados por dia
- Durante um mês: aproximadamente £370
Não é transformador para uma grande empresa. Significativo para um operador indie SaaS observando a margem. E isso é um projeto, um mês.
O recurso de prompt caching do OpenAI agora lida nativamente com cache de prefixo, então para prompts de sistema longos você já está recebendo parte disso de graça. O semantic cache do Vercel é aditivo a isso, lidando com a variação no conteúdo da vez do usuário.
---
Observability: Better Than Nothing, Not Good Enough Alone
Toda solicitação através do gateway é registrada: latência, contagens de tokens, provedor utilizado, acerto/falha de cache, estimativa de custo. Você vê isso no dashboard do Vercel. É limpo e legível.
Mas aqui está a questão. Se você está rodando um sistema de produção sério, já tem algo como Datadog, Grafana, ou no mínimo LangSmith no seu pipeline de rastreamento. O dashboard do Vercel oferece visibilidade no nível do gateway. Não oferece traces no nível de span pela sua aplicação inteira. Você não consegue ver que a solicitação de um usuário específico levou 4.2 segundos porque 3.1 desses segundos foram gastos no seu passo de recuperação antes mesmo do LLM ser chamado.
Então eu trato a observabilidade integrada do gateway como um primeiro filtro: o problema está no nível da chamada do LLM ou em outro lugar? Para algo mais profundo, ainda exporto para uma ferramenta de rastreamento adequada.
Um número específico vale a pena saber: o gateway adiciona aproximadamente 15-30ms de latência por solicitação em média pelo que medi em deployments da região EU. Para voz em tempo real ou requisitos de UX abaixo de 100ms, isso importa. Para processamento de documentos assíncrono, não.
---
O Que Realmente Custa Rodar
Vercel AI Gateway está incluído no plano Pro (£17/mês no momento da escrita) e superiores. Não há taxa por solicitação do Vercel. Você ainda paga os custos de tokens do provedor subjacente diretamente.
O custo oculto é operacional: agora você está adicionando Vercel como uma dependência no seu caminho de inferência. Se Vercel tem um problema de rede edge, suas chamadas de LLM falham independente se OpenAI está perfeitamente saudável. Vi isso acontecer uma vez nos últimos seis meses, uma falha parcial de ~12 minutos na edge do Vercel na região EU-West. Para a maioria das apps isso é aceitável. Para qualquer coisa com commitments de SLA medidos em nines, considere isso.
Há também a questão de residência de dados. Seus prompts e completions passam pela infraestrutura do Vercel. Para a maioria das apps de consumidor: irrelevante. Para saúde, finanças, ou qualquer coisa tocando dados pessoais sensíveis de GDPR de forma significativa: leia o acordo de processamento de dados cuidadosamente antes de canalizar qualquer coisa através disso. Tive que dizer a dois clientes fintech para pular o gateway inteiramente por essa razão e lidar com roteamento dentro da aplicação em vez disso.
---
Quando Usar e Quando Pular
Vou ser direto sobre isso porque o marketing de desenvolvedor em torno de ferramentas de IA tende a vender demais.
Use Vercel AI Gateway se:
- Você já está no Vercel e usando o AI SDK (zero atrito extra)
- Você tem uma estratégia multi-provedor e quer failover sem escrever lógica de retry
- Sua app tem prompts repetidos ou semanticamente similares o suficiente para o caching compensar
- Você quer um dashboard de custos sem configurar integrações de faturamento de provedor separadas
Pule ou pense cuidadosamente se:
- Você tem requisitos rigorosos de residência de dados (GDPR, HIPAA)
- Você precisa de latência total inferior a 50ms e cada salto conta
- Você está rodando em infraestrutura que não é Vercel e adicionar a edge deles traz mais complexidade do que resolve
- Sua variedade de prompts é extremamente alta e a taxa de acerto do cache semântico será próxima de zero mesmo assim
Lá em 2022 construímos uma ferramenta de análise de documentos legais em um stack auto-hospedado para uma firma da City of London. Mesmo que Vercel AI Gateway existisse então, estaria fora de cogitação imediatamente. Os prompts continham informações privilegiadas dos clientes e o time de conformidade de TI da firma nunca teria aprovado um proxy de terceiros. Montamos nossa própria camada de abstração de provedor em cerca de quatro horas de trabalho. Ela gerenciava failover entre dois provedores com uma fila de prioridades simples. Nada glamoroso. Totalmente adequado.
---
A Configuração Prática (Versão Curta)
Se você decidiu que é certo para seu projeto, aqui está a sequência que sigo:
- Ative o gateway nas configurações do seu projeto Vercel na aba "AI"
- Instale ou atualize
aie@ai-sdk/openai(e quaisquer outros pacotes de provedor que você precisar) para as versões mais recentes - Substitua a instanciação direta do cliente do provedor pelo cliente gateway do
@vercel/ai-gateway(verifique a documentação oficial para o caminho exato de importação, pois já mudou uma vez) - Defina sua lista de provedores em ordem de prioridade no objeto de configuração do gateway
- Configure seu limiar de similaridade do cache semântico: começo em 0.90 e ajusto com base nas taxas de acerto observadas depois de uma semana de tráfego
- Deploy em um ambiente de staging e dispare deliberadamente falhas de provedor para verificar que a cadeia de failover funciona como você espera
- Monitore a taxa de acerto do cache e o p95 de latência nas primeiras duas semanas antes de tirar conclusões
É isso. Genuinamente não é complicado.
---
FAQ
O Vercel AI Gateway suporta respostas em streaming?
Sim, o streaming funciona através do gateway. O único detalhe é o failover no meio do stream: se o provedor principal cai durante uma resposta em streaming, o gateway tentará novamente no próximo provedor, mas o stream reinicia. Dependendo de como sua UI no lado do cliente lida com conteúdo parcial, isso pode causar um flicker visível ou uma primeira sentença duplicada. Teste isso explicitamente em sua UI antes de fazer deploy.
Posso usar Vercel AI Gateway sem o SDK de IA da Vercel?
Tecnicamente você pode bater no endpoint do gateway direto via HTTP, mas a integração com o SDK é onde se torna ergonômico. Sem o SDK você está escrevendo seus próprios wrappers fetch ao redor da URL do gateway, gerenciando streaming por conta própria e tratando retries manualmente. Nesse ponto você também construiria sua própria abstração de provedor. O valor do gateway está fortemente acoplado ao SDK na prática.
Como o cache semântico lida com dados sensíveis ou personalizados?
Não o faz, automaticamente. Se você está enviando prompts que incluem dados específicos do usuário (nomes, números de conta, contexto de sessão), o cache tentará corresponder prompts semanticamente similares independentemente de esse dados diferir entre usuários. Isso pode causar acertos incorretos do cache em fluxos personalizados. Você deveria ou desabilitar o cache semântico para essas rotas ou incluir uma chave de cache com escopo de usuário se o gateway suportar isso no seu nível de plano.
O que acontece com meus requests se a Vercel tiver uma interrupção?
Falham. O gateway está no caminho crítico. Se você precisa de genuína resiliência multi-cloud, você deveria ter um circuit-breaker na camada de aplicação que possa ignorar completamente o gateway e bater nos provedores diretamente. Eu mantenho clientes do SDK do provedor inicializados como fallback em qualquer app onde o uptime realmente importa.
---
O resumo honesto: Vercel AI Gateway é uma peça de infraestrutura bem construída que merece seu lugar em uma stack de IA nativa do Vercel. Não vai revolucionar sua economia de unidades, mas uma taxa de acerto de cache de 35-40% na carga de trabalho certa mais failover automático é uma melhoria operacional real em relação a conectar tudo manualmente. Só saiba o que ele não consegue fazer antes de se comprometer com ele. A ligação às 8 da manhã de um cliente em pânico é uma forma miserável de descobrir onde suas suposições estavam erradas.
