// início rápido

API compatível com OpenAI.

Crie uma chave no painel, troque a base_url e continue usando o SDK que já conhece.

Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.qualquermodelo.com/v1",
    api_key="qm_sua_chave",
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B:fastest",
    messages=[{"role": "user", "content": "Explique computação quântica."}],
)

print(response.choices[0].message.content)

Streaming

stream = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B:fastest",
    messages=[{"role": "user", "content": "Escreva um haicai."}],
    stream=True,
)

for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

Tool calling

tools = [{
    "type": "function",
    "function": {
        "name": "consultar_pedido",
        "description": "Consulta um pedido pelo ID",
        "parameters": {
            "type": "object",
            "properties": {"id": {"type": "string"}},
            "required": ["id"],
            "additionalProperties": False,
        },
    },
}]

response = client.chat.completions.create(
    model="openai/gpt-oss-120b:cerebras",
    messages=[{"role": "user", "content": "Consulte o pedido 123"}],
    tools=tools,
    tool_choice="auto",
)

Agente de terminal

npm install -g https://qualquermodelo.com/downloads/qualquermodelo-agent-0.2.1.tgz
qm login
qm -C ./meu-projeto

O comando qm abre a TUI, mostra somente rotas verificadas com tool calling e identifica as cotas grátis de Qwen3 4B, GLM-4.7 Flash e Gemma 4 31B. Todo novo cadastro recebe também 100 tokens. Use qm memory-mcp para expor o vault por MCP ou visite a página do Agent.

curl

curl https://api.qualquermodelo.com/v1/chat/completions \
  -H "Authorization: Bearer $QM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3.6-27B:fastest",
    "messages": [{"role": "user", "content": "Olá!"}]
  }'

Modelos

curl https://api.qualquermodelo.com/v1/models \
  -H "Authorization: Bearer $QM_API_KEY"

O campo free_routes mostra providers com cota diária patrocinada e seus limites. Para usar uma cota grátis, envie o model exatamente como o route_id.

Endpoint dedicado

# Liste os endpoints e copie o ID desejado
curl https://api.qualquermodelo.com/v1/endpoints \
  -H "Authorization: Bearer $QM_API_KEY"

# Invoque um endpoint em status running
curl https://api.qualquermodelo.com/v1/endpoints/ID_DO_ENDPOINT/invoke \
  -H "Authorization: Bearer $QM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"inputs":"Responda apenas OK","parameters":{"max_new_tokens":32}}'

A requisição usa apenas sua chave qm_. A credencial da infraestrutura Hugging Face fica protegida no gateway.

Gerar imagem

curl https://api.qualquermodelo.com/v1/images/generations \
  -H "Authorization: Bearer $QM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "black-forest-labs/FLUX.1-schnell",
    "prompt": "Uma cidade solar brasileira, fotografia cinematográfica",
    "size": "1024x1024",
    "response_format": "b64_json"
  }'

Imagem e vídeo assíncronos

# Cria um vídeo na fila
curl https://api.qualquermodelo.com/v1/media/jobs \
  -H "Authorization: Bearer $QM_API_KEY" \
  -H "Idempotency-Key: video-demo-0001" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tencent/HunyuanVideo-1.5",
    "task": "text-to-video",
    "prompt": "Drone sobrevoando uma floresta ao amanhecer",
    "parameters": {"resolution":"480p","aspect_ratio":"16:9"}
  }'

# Consulte o ID retornado; quando concluir, content_url fica disponível
curl https://api.qualquermodelo.com/v1/media/jobs/ID_DO_JOB \
  -H "Authorization: Bearer $QM_API_KEY"

Arquivos ficam privados por sete dias. Modelos da categoria adulta são listados separadamente e ficam disponíveis por padrão; conteúdo ilegal, não consensual ou envolvendo menores é proibido.

Console e Model Lab

O painel inclui um playground para texto, imagem e vídeo, catálogo unificado com busca e filtros e inspeção de modelos sob demanda. No Model Lab, cole uma URL do Hugging Face para verificar providers serverless, tamanho dos pesos, GPU recomendada e preço estimado por hora antes de registrar qualquer solicitação.

A API usa tokens pré-pagos (100 tokens = US$ 1 de crédito). Antes da inferência, o custo máximo é reservado; depois da resposta, apenas o uso real é debitado e o restante é liberado.