NIM hosted
Dev, eval, loops baratos, modelos open grandes (Kimi K3, GLM 5.3, Nemotron Ultra, DeepSeek V4.1 Flash). Sem cartão. Telefone no cadastro.
Agents internos · inference brief
O NVIDIA Build (NIM hosted) largou créditos e ficou em taxa: até 40 RPM e 10 mil requests/dia, sem teto de tokens, OpenAI-compatible. OpenRouter entra como failover, modelos fechados e providers com política de dado. Juntos, dá para montar agents internos baratos — com um asterisco gordo de privacidade.
Ir para o stack recomendadoVeredito
A “cota muito boa” do NIM hoje é isso: taxa, não crédito. A NVIDIA retirou o sistema de 1.000 / 5.000 créditos. O trial do Developer Program não tem prazo. O que limita é 40 requests por minuto (cap publicado, não ajustável) e 10.000 requests por dia. Para um agent interno com poucas dezenas de usuários, isso é generoso em tokens e apertado em concorrência.
Dev, eval, loops baratos, modelos open grandes (Kimi K3, GLM 5.3, Nemotron Ultra, DeepSeek V4.1 Flash). Sem cartão. Telefone no cadastro.
Produção, fallback, modelos fechados, Auto Exacto em tool-calling, data_collection: deny e ZDR. Paga o token, não o markup do modelo.
Dado interno de verdade. Sobe Nemotron / GLM no teu GPU. Trial hosted grava input/output para melhorar produto NVIDIA.
NVIDIA NIM
Catálogo: build.nvidia.com/models. API: https://integrate.api.nvidia.com/v1. Chave no Developer Program, verificação por SMS. Sem cartão. Compatível com o SDK OpenAI.
Endpoints marcados “Free Endpoint”. Tool calling, streaming, visão em alguns. Modelos open de Moonshot, Z.ai, DeepSeek, NVIDIA, Meta, Google, OpenAI OSS, Poolside. IDs mudam sem aviso — copia do catálogo, não de memória.
Não é crédito mensal. Não é SLA. 40 RPM é compartilhado com tráfego de outros usuários e varia por modelo. Fórum da NVIDIA: aumento de RPM no free tier não existe. Produção pede AI Enterprise ou deploy próprio.
curl -s https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_NIM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3-flash",
"messages": [{"role":"user","content":"liste 3 tools para um agent de CRM"}],
"tools": []
}'
Modelos NIM · free endpoint
Lista verificada em 1–2 out 2026 (awesome-free-ai-coding + catálogo NVIDIA). IDs para model no chat completions.
| Papel | Modelo | Por quê | ID |
|---|---|---|---|
| Worker | GLM 5.3 Flash | Nativo multimodal, coding e agent de horizonte longo, barato de rodar no loop. | z-ai/glm-5.3-flash |
| Worker | DeepSeek V4.1 Flash | MoE 552B, 8B/16B ativos, coding, terminal e computer-use. KV cache comprimido — agent longo fica viável. | deepseek-ai/deepseek-v4.1-flash |
| Worker rápido | Nemotron 3.5 Lightning 30B-A3B | MoE pequeno, “fastest 30B A3B” no catálogo para tarefa agentic especializada (classificar, roteador, tool simples). | nvidia/nemotron-3.5-lightning-30b-a3b |
| Planner | GLM 5.3 | Flagship Z.ai. Software engineering e agent longo. Reasoning sempre ligado. | z-ai/glm-5.3 |
| Planner / coding | Kimi K3 | ~2.8T MoE multimodal. Tool use, repo grande, 1M de contexto. O “free endpoint” mais forte do catálogo agora. | moonshotai/kimi-k3 |
| Orquestrador | Nemotron 3 Ultra 550B-A55B | Híbrido Mamba-Transformer, 1M ctx, tool calling. TauBench ~70. Feito pela NVIDIA para agent enterprise. | nvidia/nemotron-3-ultra-550b-a55b |
| Meio-termo | Nemotron 3 Super 120B-A12B | Mesma família, menor. Planning, coding, tool calling, 1M ctx. Quando Ultra estiver throttled. | nvidia/nemotron-3-super-120b-a12b |
| Visão + tools | Muse Glimmer 30B | Texto + imagem, tool-calling nativo, reasoning separado. Bom para agent que lê screenshot. | meta/muse-glimmer-30b |
| Omni | Nemotron 3 Nano Omni | Imagem, vídeo, fala, texto. Reasoning. Para agent que ingere anexo misto. | nvidia/nemotron-3-nano-omni-30b-a3b-reasoning |
| Leve / OSS | GPT-OSS 20B | Pequeno, tool call, útil como classifier ou fallback quando o grande 429. | openai/gpt-oss-20b |
| Código interno | Laguna XS 2.1 | Poolside, focado em software. Vale eval no teu repo antes de virar default. | poolside/laguna-xs-2.1 |
| Visão legado | Llama 3.2 90B / 11B Vision | Ainda no free list. Prefira Glimmer ou Kimi K3 se o endpoint estiver no ar. | meta/llama-3.2-90b-vision-instruct |
Também no free list: google/gemma-4-31b-it, google/diffusiongemma-26b-a4b-it. Gemma 4 31B é denso, bom raciocínio; DiffusionGemma é outra classe (geração paralela).
OpenRouter
OpenRouter não hospeda peso. Roteia. Preço do provider com ~5,5% no crédito. Tool-calling chega padronizado no formato OpenAI. Trocar modelo é trocar a string.
Em requests com tools, o Auto Exacto já está ligado: a cada ~5 min reordena providers por throughput, taxa de tool call válida e bench. Não precisa do sufixo :exacto nesses casos. :nitro prioriza throughput; :floor prioriza preço (e libera flex tier).
Ranking de tool-calling no OpenRouter por tokens. Adoção, não qualidade pura. Preços de catálogo no dia da pesquisa; o router pode achar mais barato.
| Uso | Modelo | In / out · 1M | Papel no teu stack |
|---|---|---|---|
| 1º · 37T | Space Bunny Alpha stealth/space-bunny-alpha |
$0 / $0 | Stealth, provider anônimo, preview. Fora de agent interno com dado de cliente. |
| 2º · 27T | DeepSeek V4.1 Flash deepseek/deepseek-v4.1-flash |
$0.02 / $0.60 | Workhorse. Coding, terminal, computer-use, 1.05M ctx. Default pago. |
| 3º · 10.5T | GLM 5.3 Flash z-ai/glm-5.3-flash |
$0.035 / $0.50 | Loop barato com tool estável. Espelha o ID do NIM. |
| 4º · 10.3T | MiMo-V2.6-Flash xiaomi/mimo-v2.6-flash |
$0.11 / $0.28 | MoE 309B/15B, 1M ctx, agentic. Output barato — bom em traces longos. |
| 5º | Hy4 preview tencent/hy4-preview |
$0.75 / $2.25 | Coding agent e workflow multi-passo. 770B / 49B ativos. |
| 7º · free | Nemotron 3 Ultra nvidia/nemotron-3-ultra-550b-a55b:free |
$0 / $0 | Mesmo Ultra do NIM, no router. Free endpoint costuma treinar no prompt — veja privacidade. |
| volume | GPT-6 Luna openai/gpt-6-luna |
$0.10 / $0.50 | Chat, classificar, agent leve com JSON limpo. First-party OpenAI via router. |
| qualidade | GLM 5.3 z-ai/glm-5.3 |
$0.12 / $4.00 | Planner. Output caro — reserva para plano, não para cada tool ping. |
| teto | Claude Opus 5.5 anthropic/claude-opus-5.5 |
$4 / $20 | Escalation. Code review, bug em repo grande, quando o Flash erra duas vezes. |
| teto | GPT-6 Sol / Astra | Sol $2/$10 · Astra $10/$50 | Sol para coding agent pesado. Astra só em tarefa que justifica o ticket. |
| repo | Kimi K3 moonshotai/kimi-k3 |
~$0.99 / $13 | Mesmo K3 do NIM, pago e com escolha de provider. Output caro. |
| multimodal | MiniMax M3 minimax/minimax-m3 |
$0.23 / $0.96 | Texto, imagem, vídeo. Agent longo com MSA (atenção esparsa a 1M). |
Gemini 3.8 Flash google/gemini-3.8-flash |
$0.75 / $3.75 | Agent + multimodelo Google. Bom se o resto do stack já é Gemini. |
Providers
No OpenRouter o “modelo” é um apelido. O provider é o GPU. Tool call quebra mais por parser/quantização do host do que pelo card do laboratório. Pin conscientemente.
| Provider | Quando usar | Dado / compliance | Como pin |
|---|---|---|---|
| Fireworks | GLM 5.3 / Flash, DeepSeek V4.1 Flash, Kimi K3. Qualidade estável em open weights. | SOC 2, HIPAA. Open models com zero retention (sem opt-in). | provider.order: ["fireworks"] |
| Groq | Latência. GPT-OSS 20B/120B, Llama 3.3 70B. Centenas de tok/s. Tool ping, classifier, voz. | SOC 2. BAA HIPAA (com exclusões). Retention padrão. | sort: "latency" ou slug :nitro |
| Cerebras | Mesma ideia do Groq: throughput extremo em um subset pequeno de modelos. | Ver policy no card do modelo. Poucos SKUs. | provider.only: ["cerebras"] |
| DeepInfra | Preço. Open weights baratos. Quantização agressiva — Auto Exacto decide se o tool call aguenta. | SOC 2 + ISO 27001. Zero retention (metadata). Google models são exceção. | :floor ou sort: "price" |
| Together / Novita / Relace | Spread de preço. Relace aparece como floor em GLM e DeepSeek em vários snapshots de out 2026. | Varia. Novita costuma ser barato e FP4. Confere a tag Data Policy. | Deixa o router, ou ignore os que falham no teu eval. |
| NVIDIA (hosted / Switchyard) | Nemotron no OpenRouter, ou o router nvidia/switchyard (barato ↔ forte no meio da tarefa). |
Trial hosted NVIDIA grava I/O. Switchyard herda a policy do endpoint escolhido. | Modelo nvidia/switchyard |
| Anthropic / OpenAI / Google | First-party para teto de qualidade, structured output e computer-use maduro. | ZDR/enterprise no contrato do lab. No router: zdr: true. |
provider.only: ["anthropic"] etc. |
{
"model": "deepseek/deepseek-v4.1-flash",
"models": ["deepseek/deepseek-v4.1-flash", "z-ai/glm-5.3-flash", "openai/gpt-6-luna"],
"messages": [],
"tools": [],
"provider": {
"data_collection": "deny",
"zdr": true,
"require_parameters": true,
"allow_fallbacks": true,
"ignore": ["stealth"]
}
}
openrouter/auto escolhe modelo pago pela tarefa. openrouter/free é o router só-grátis — quase sempre treina no prompt. Para interno, não use free + deny ao mesmo tempo: o 404 “no endpoints matching data policy” é exatamente isso.
Stack
NIM em integrate.api.nvidia.com/v1 com NVIDIA_NIM_API_KEY. OpenRouter em openrouter.ai/api/v1. Mesmo schema de tools. Um wrapper com retry 429 → cai no outro.
Router / classificador: Nemotron Lightning ou GPT-OSS 20B no NIM, Groq no OpenRouter.
Worker: GLM 5.3 Flash ou DeepSeek V4.1 Flash (NIM até 429, depois OpenRouter).
Planner: GLM 5.3, Kimi K3 ou Nemotron Ultra.
Escalation: Claude Opus 5.5 ou GPT-6 Sol, só no OpenRouter, com ZDR.
Fila local (token bucket 35/min no NIM, folga de 5). Junta tools. Cacheia system + RAG. Agents longos no OpenRouter; NIM para fan-out barato e eval.
Roda 30 tarefas reais (CRM, código interno, WhatsApp, PDF) nos quatro workers. Mede tool JSON válido, passos até terminar, custo. O ranking do OpenRouter é tráfego global, não o teu domínio.
NIM_BASE=https://integrate.api.nvidia.com/v1 NIM_WORKER=z-ai/glm-5.3-flash NIM_PLANNER=moonshotai/kimi-k3 NIM_FAST=nvidia/nemotron-3.5-lightning-30b-a3b OR_BASE=https://openrouter.ai/api/v1 OR_WORKER=deepseek/deepseek-v4.1-flash OR_PLANNER=z-ai/glm-5.3 OR_ESCALATE=anthropic/claude-opus-5.5 OR_FAST=openai/gpt-oss-120b
Privacidade
Prompts sintéticos, runbooks públicos, playground de tool schema, carga de RPM. Qualquer coisa que você colaria num fórum.
data_collection: deny + zdr: true. Ignore stealth e :free. Produção longa: Fireworks / first-party / NIM self-host com AI Enterprise.
Fontes