Pesquisa · 03 out 2026 · cota NIM + OpenRouter

Agents internos · inference brief

Cota boa no NIM. Roteador no OpenRouter.

O NVIDIA Build (NIM hosted) largou créditos e ficou em taxa: até 40 RPM e 10 mil requests/dia, sem teto de tokens, OpenAI-compatible. OpenRouter entra como failover, modelos fechados e providers com política de dado. Juntos, dá para montar agents internos baratos — com um asterisco gordo de privacidade.

Ir para o stack recomendado
40 RPMTeto publicado do free tier NIM. Não sobe por conta.
10k / diaRequests diários no catálogo trial. Sem cap de tokens.
15+Endpoints gratuitos úteis para agent (tool call + contexto longo).
$0.02Input / 1M no DeepSeek V4.1 Flash via OpenRouter — workhorse pago.

Veredito

Use NIM para volume de prototipagem. Use OpenRouter para produção e dado sensível.

A “cota muito boa” do NIM hoje é isso: taxa, não crédito. A NVIDIA retirou o sistema de 1.000 / 5.000 créditos. O trial do Developer Program não tem prazo. O que limita é 40 requests por minuto (cap publicado, não ajustável) e 10.000 requests por dia. Para um agent interno com poucas dezenas de usuários, isso é generoso em tokens e apertado em concorrência.

Camada 1

NIM hosted

Dev, eval, loops baratos, modelos open grandes (Kimi K3, GLM 5.3, Nemotron Ultra, DeepSeek V4.1 Flash). Sem cartão. Telefone no cadastro.

Camada 2

OpenRouter

Produção, fallback, modelos fechados, Auto Exacto em tool-calling, data_collection: deny e ZDR. Paga o token, não o markup do modelo.

Camada 3

NIM self-host

Dado interno de verdade. Sobe Nemotron / GLM no teu GPU. Trial hosted grava input/output para melhorar produto NVIDIA.


NVIDIA NIM

O que a cota realmente é

Catálogo: build.nvidia.com/models. API: https://integrate.api.nvidia.com/v1. Chave no Developer Program, verificação por SMS. Sem cartão. Compatível com o SDK OpenAI.

O que entra de graça

Endpoints marcados “Free Endpoint”. Tool calling, streaming, visão em alguns. Modelos open de Moonshot, Z.ai, DeepSeek, NVIDIA, Meta, Google, OpenAI OSS, Poolside. IDs mudam sem aviso — copia do catálogo, não de memória.

O que a cota não é

Não é crédito mensal. Não é SLA. 40 RPM é compartilhado com tráfego de outros usuários e varia por modelo. Fórum da NVIDIA: aumento de RPM no free tier não existe. Produção pede AI Enterprise ou deploy próprio.

Agent loop come RPM. Cada round de tool é um request. Um agent de 8 passos a 40 RPM segura ~5 loops concorrentes. O teto de 10k/dia é ~7 RPM médios se você queimar o dia inteiro. Cache de system prompt e batch de tools importam mais que o modelo.

Chamada mínima

curl -s https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_NIM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3-flash",
    "messages": [{"role":"user","content":"liste 3 tools para um agent de CRM"}],
    "tools": []
  }'

Modelos NIM · free endpoint

O que botar no agent, no hosted grátis

Lista verificada em 1–2 out 2026 (awesome-free-ai-coding + catálogo NVIDIA). IDs para model no chat completions.

Papel Modelo Por quê ID
Worker GLM 5.3 Flash Nativo multimodal, coding e agent de horizonte longo, barato de rodar no loop. z-ai/glm-5.3-flash
Worker DeepSeek V4.1 Flash MoE 552B, 8B/16B ativos, coding, terminal e computer-use. KV cache comprimido — agent longo fica viável. deepseek-ai/deepseek-v4.1-flash
Worker rápido Nemotron 3.5 Lightning 30B-A3B MoE pequeno, “fastest 30B A3B” no catálogo para tarefa agentic especializada (classificar, roteador, tool simples). nvidia/nemotron-3.5-lightning-30b-a3b
Planner GLM 5.3 Flagship Z.ai. Software engineering e agent longo. Reasoning sempre ligado. z-ai/glm-5.3
Planner / coding Kimi K3 ~2.8T MoE multimodal. Tool use, repo grande, 1M de contexto. O “free endpoint” mais forte do catálogo agora. moonshotai/kimi-k3
Orquestrador Nemotron 3 Ultra 550B-A55B Híbrido Mamba-Transformer, 1M ctx, tool calling. TauBench ~70. Feito pela NVIDIA para agent enterprise. nvidia/nemotron-3-ultra-550b-a55b
Meio-termo Nemotron 3 Super 120B-A12B Mesma família, menor. Planning, coding, tool calling, 1M ctx. Quando Ultra estiver throttled. nvidia/nemotron-3-super-120b-a12b
Visão + tools Muse Glimmer 30B Texto + imagem, tool-calling nativo, reasoning separado. Bom para agent que lê screenshot. meta/muse-glimmer-30b
Omni Nemotron 3 Nano Omni Imagem, vídeo, fala, texto. Reasoning. Para agent que ingere anexo misto. nvidia/nemotron-3-nano-omni-30b-a3b-reasoning
Leve / OSS GPT-OSS 20B Pequeno, tool call, útil como classifier ou fallback quando o grande 429. openai/gpt-oss-20b
Código interno Laguna XS 2.1 Poolside, focado em software. Vale eval no teu repo antes de virar default. poolside/laguna-xs-2.1
Visão legado Llama 3.2 90B / 11B Vision Ainda no free list. Prefira Glimmer ou Kimi K3 se o endpoint estiver no ar. meta/llama-3.2-90b-vision-instruct

Também no free list: google/gemma-4-31b-it, google/diffusiongemma-26b-a4b-it. Gemma 4 31B é denso, bom raciocínio; DiffusionGemma é outra classe (geração paralela).


OpenRouter

Mesma interface, providers de verdade

OpenRouter não hospeda peso. Roteia. Preço do provider com ~5,5% no crédito. Tool-calling chega padronizado no formato OpenAI. Trocar modelo é trocar a string.

Em requests com tools, o Auto Exacto já está ligado: a cada ~5 min reordena providers por throughput, taxa de tool call válida e bench. Não precisa do sufixo :exacto nesses casos. :nitro prioriza throughput; :floor prioriza preço (e libera flex tier).

Modelos para agent — uso real, 7 dias (out 2026)

Ranking de tool-calling no OpenRouter por tokens. Adoção, não qualidade pura. Preços de catálogo no dia da pesquisa; o router pode achar mais barato.

UsoModeloIn / out · 1MPapel no teu stack
1º · 37T Space Bunny Alpha stealth/space-bunny-alpha $0 / $0 Stealth, provider anônimo, preview. Fora de agent interno com dado de cliente.
2º · 27T DeepSeek V4.1 Flash deepseek/deepseek-v4.1-flash $0.02 / $0.60 Workhorse. Coding, terminal, computer-use, 1.05M ctx. Default pago.
3º · 10.5T GLM 5.3 Flash z-ai/glm-5.3-flash $0.035 / $0.50 Loop barato com tool estável. Espelha o ID do NIM.
4º · 10.3T MiMo-V2.6-Flash xiaomi/mimo-v2.6-flash $0.11 / $0.28 MoE 309B/15B, 1M ctx, agentic. Output barato — bom em traces longos.
5º Hy4 preview tencent/hy4-preview $0.75 / $2.25 Coding agent e workflow multi-passo. 770B / 49B ativos.
7º · free Nemotron 3 Ultra nvidia/nemotron-3-ultra-550b-a55b:free $0 / $0 Mesmo Ultra do NIM, no router. Free endpoint costuma treinar no prompt — veja privacidade.
volume GPT-6 Luna openai/gpt-6-luna $0.10 / $0.50 Chat, classificar, agent leve com JSON limpo. First-party OpenAI via router.
qualidade GLM 5.3 z-ai/glm-5.3 $0.12 / $4.00 Planner. Output caro — reserva para plano, não para cada tool ping.
teto Claude Opus 5.5 anthropic/claude-opus-5.5 $4 / $20 Escalation. Code review, bug em repo grande, quando o Flash erra duas vezes.
teto GPT-6 Sol / Astra Sol $2/$10 · Astra $10/$50 Sol para coding agent pesado. Astra só em tarefa que justifica o ticket.
repo Kimi K3 moonshotai/kimi-k3 ~$0.99 / $13 Mesmo K3 do NIM, pago e com escolha de provider. Output caro.
multimodal MiniMax M3 minimax/minimax-m3 $0.23 / $0.96 Texto, imagem, vídeo. Agent longo com MSA (atenção esparsa a 1M).
Google Gemini 3.8 Flash google/gemini-3.8-flash $0.75 / $3.75 Agent + multimodelo Google. Bom se o resto do stack já é Gemini.
τ²-Bench Airline no OpenRouter (2 out 2026): Claude Fable 5 lidera qualidade; GLM 5.3 Flash lidera valor (~$0.006/task); GLM 5.3 lidera velocidade nesse recorte. Para agent de política rígida (CRM, financeiro), eval no teu harness bate ranking público.

Providers

Quem de fato serve o peso

No OpenRouter o “modelo” é um apelido. O provider é o GPU. Tool call quebra mais por parser/quantização do host do que pelo card do laboratório. Pin conscientemente.

ProviderQuando usarDado / complianceComo pin
Fireworks GLM 5.3 / Flash, DeepSeek V4.1 Flash, Kimi K3. Qualidade estável em open weights. SOC 2, HIPAA. Open models com zero retention (sem opt-in). provider.order: ["fireworks"]
Groq Latência. GPT-OSS 20B/120B, Llama 3.3 70B. Centenas de tok/s. Tool ping, classifier, voz. SOC 2. BAA HIPAA (com exclusões). Retention padrão. sort: "latency" ou slug :nitro
Cerebras Mesma ideia do Groq: throughput extremo em um subset pequeno de modelos. Ver policy no card do modelo. Poucos SKUs. provider.only: ["cerebras"]
DeepInfra Preço. Open weights baratos. Quantização agressiva — Auto Exacto decide se o tool call aguenta. SOC 2 + ISO 27001. Zero retention (metadata). Google models são exceção. :floor ou sort: "price"
Together / Novita / Relace Spread de preço. Relace aparece como floor em GLM e DeepSeek em vários snapshots de out 2026. Varia. Novita costuma ser barato e FP4. Confere a tag Data Policy. Deixa o router, ou ignore os que falham no teu eval.
NVIDIA (hosted / Switchyard) Nemotron no OpenRouter, ou o router nvidia/switchyard (barato ↔ forte no meio da tarefa). Trial hosted NVIDIA grava I/O. Switchyard herda a policy do endpoint escolhido. Modelo nvidia/switchyard
Anthropic / OpenAI / Google First-party para teto de qualidade, structured output e computer-use maduro. ZDR/enterprise no contrato do lab. No router: zdr: true. provider.only: ["anthropic"] etc.

Request de agent interno (pago, sem treino)

{
  "model": "deepseek/deepseek-v4.1-flash",
  "models": ["deepseek/deepseek-v4.1-flash", "z-ai/glm-5.3-flash", "openai/gpt-6-luna"],
  "messages": [],
  "tools": [],
  "provider": {
    "data_collection": "deny",
    "zdr": true,
    "require_parameters": true,
    "allow_fallbacks": true,
    "ignore": ["stealth"]
  }
}

openrouter/auto escolhe modelo pago pela tarefa. openrouter/free é o router só-grátis — quase sempre treina no prompt. Para interno, não use free + deny ao mesmo tempo: o 404 “no endpoints matching data policy” é exatamente isso.


Stack

Como plugar isso num agent interno amanhã

  1. Dois clientes OpenAI-compatible

    NIM em integrate.api.nvidia.com/v1 com NVIDIA_NIM_API_KEY. OpenRouter em openrouter.ai/api/v1. Mesmo schema de tools. Um wrapper com retry 429 → cai no outro.

  2. Papéis, não um modelo só

    Router / classificador: Nemotron Lightning ou GPT-OSS 20B no NIM, Groq no OpenRouter.
    Worker: GLM 5.3 Flash ou DeepSeek V4.1 Flash (NIM até 429, depois OpenRouter).
    Planner: GLM 5.3, Kimi K3 ou Nemotron Ultra.
    Escalation: Claude Opus 5.5 ou GPT-6 Sol, só no OpenRouter, com ZDR.

  3. Respeita o RPM

    Fila local (token bucket 35/min no NIM, folga de 5). Junta tools. Cacheia system + RAG. Agents longos no OpenRouter; NIM para fan-out barato e eval.

  4. Eval no teu harness

    Roda 30 tarefas reais (CRM, código interno, WhatsApp, PDF) nos quatro workers. Mede tool JSON válido, passos até terminar, custo. O ranking do OpenRouter é tráfego global, não o teu domínio.

Mapeamento de env

NIM_BASE=https://integrate.api.nvidia.com/v1
NIM_WORKER=z-ai/glm-5.3-flash
NIM_PLANNER=moonshotai/kimi-k3
NIM_FAST=nvidia/nemotron-3.5-lightning-30b-a3b

OR_BASE=https://openrouter.ai/api/v1
OR_WORKER=deepseek/deepseek-v4.1-flash
OR_PLANNER=z-ai/glm-5.3
OR_ESCALATE=anthropic/claude-opus-5.5
OR_FAST=openai/gpt-oss-120b

Privacidade

Onde o dado interno não pode ir

Trial NIM: “Your input and output will be recorded to provide you with this trial experience and to improve NVIDIA products and services, including AI models.” Sem PII, sem ticket de cliente, sem código fechado. Isso é prototipagem.
Pode no NIM hosted

Synth, docs públicos, eval

Prompts sintéticos, runbooks públicos, playground de tool schema, carga de RPM. Qualquer coisa que você colaria num fórum.

Vai no OpenRouter ZDR ou GPU próprio

Cliente, financeiro, código

data_collection: deny + zdr: true. Ignore stealth e :free. Produção longa: Fireworks / first-party / NIM self-host com AI Enterprise.


Fontes

O que foi lido