API unificada, compatível com OpenAI, para rodar os modelos open-source que ninguém mais serve. Troque a base_url. Pronto.
Funciona com qualquer SDK OpenAI · streaming SSE · tool_calls · sem cartão pra começar
// por que existe
Milhares de modelos open-source não têm nenhum provedor de inferência. Você não tem GPU, não quer gerenciar servidor e não quer pagar em dólar. É pra isso que a gente existe.
Modelo sem provedor? A gente sobe ele sob demanda e você chama pelo mesmo endpoint. Do Llama gigante ao fine-tune obscuro de 7B.
Provedor caiu ou devolveu 429? A request re-roteia pra outro backend do mesmo modelo. Transparente. Seu app nem fica sabendo.
Créditos pré-pagos, cobrança por token, nota fiscal. Sem cartão internacional, sem IOF, sem surpresa na fatura.
Endpoint /v1/chat/completions padrão. LangChain, Vercel AI SDK, LlamaIndex, cursor da sua IDE — tudo funciona só trocando a URL.
SSE de ponta a ponta, tool_calls, JSON mode. O que o modelo suporta, a API repassa — sem gambiarra no meio.
Uso por chave, custo por modelo, latência por provedor. Você vê exatamente pra onde cada centavo de token foi.
// como funciona
Cadastro com e-mail ou GitHub. Créditos grátis pra testar sem colocar cartão.
Aponte seu SDK OpenAI pra api.qualquermodelo.com/v1. Uma linha de diff.
Passe o ID do modelo no campo model. Se não estiver de pé, a gente sobe pra você.
// preços
Sem mensalidade, sem mínimo, sem plano enterprise escondido atrás de "fale com vendas".
Deposite quanto quiser, gaste por token. O preço de cada modelo fica público na página dele — o que o provedor cobra, mais nossa margem. Simples assim.