Quanto Meus Agentes de IA Realmente Custam: DeepSeek vs as Grandes APIs

Publicado em
11 julho 2026
Atualizado em
14 agosto 2026
Por
Jacob Lloyd — escrito com ajuda de IA, depois do projeto
Tempo de leitura
10 min de leitura

Em termos simples: Um olhar sobre quanto custa de verdade manter assistentes de IA rodando o tempo todo. Dois meses de uso pesado ficaram em cerca de $31 num serviço de IA econômico — apenas $6.49 em julho. Esse serviço está aumentando os preços em 16 de agosto, então o mesmo mês de uso em breve custará cerca de duas a quatro vezes mais, e o novo nível mais barato da OpenAI se torna a opção menos cara para esse tipo de carga de trabalho. O truque que mantém isso barato é o cache — a maior parte do texto enviado à IA se repete, e texto repetido é cobrado com um desconto enorme.

Minha pilha de agentes domésticos — oito agentes nomeados rodando 24 horas por dia na API do DeepSeek — acaba de completar dois meses inteiros. Puxei as exportações de uso de julho e fiz as contas de novo: quanto isso realmente custou, e quanto a mesma carga de trabalho custaria nas grandes APIs?

Resumo

  • Julho de 2026, mês inteiro: $6.49 no total ($1.81 flash + $4.68 pro) em 22 dias ativos. Junho custou $24.08; os dois meses juntos, $30.57.
  • Volume: 323M tokens em ~5.8k requisições em julho; ~974M tokens nos dois meses.
  • O detalhe principal: 95% dos tokens de entrada de julho foram acertos de cache — essa proporção, não o preço de tabela, é o que torna agentes sempre ativos viáveis.
  • A mesma carga de trabalho em outro lugar (estimado): julho: aproximadamente $135–$300 nos modelos de ponta, $12–$85 nos níveis econômicos — e a nova GPT-5.6 Luna da OpenAI é agora a opção não-DeepSeek mais barata, com ~$12 (junho: $33–$915).
  • Aviso (adicionado em 2026-08-14): o DeepSeek aumenta os preços em 16 de agosto com cobrança pico/fora de pico. Minha carga de julho teria custado ~$14–$27 nas novas taxas em vez de $6.49 — o que torna a GPT-5.6 Luna, com ~$12, a nova opção mais barata. Detalhamento antigo vs. novo abaixo.

Os números reais

O volume do mês inteiro de julho: 305.5M tokens de entrada em cache, 15.6M tokens de entrada com falha de cache, 1.9M tokens de saída — 323M tokens, por $6.49 ($1.81 no flash, $4.68 no pro). Junho foi o mês pesado, com ~560.8M acertos de cache, ~86.2M falhas de cache e ~3.8M tokens de saída, por $24.08. Juntos, isso dá ~866M em cache, ~102M com falha e ~5.7M de saída — cerca de 974M tokens e $30.57 em dois meses. Julho também teve um período calmo de nove dias (20 a 28) com zero tráfego de API; nos 22 dias em que rodou, a média foi de $0.30/dia.

Essa taxa de acerto de cache de 95% (acima dos 87% de junho) não é sorte — é a forma natural do tráfego de agentes. Cada turno reenvia o mesmo prompt de sistema, as mesmas definições de ferramentas e o mesmo histórico de conversa, e os provedores cobram esse prefixo repetido por uma fração minúscula do preço normal de entrada. O DeepSeek cobra $0.0028–$0.003625 por milhão de tokens em cache (até 15 de agosto — veja a próxima seção); sem cache, só a conta de entrada de julho teria sido ~14–19× maior.

O aumento de preço do DeepSeek em 16 de agosto: antigo vs. novo

Doze dias após a última atualização deste post, o DeepSeek avisou os desenvolvedores sobre um aumento significativo de preços, e a página de preços agora traz os detalhes: a partir de 16 de agosto de 2026 às 16:00 UTC, a API passa a cobrar por pico/fora de pico, com o fora de pico pela metade da taxa de pico. As horas de pico são 01:00–04:00 e 06:00–10:00 UTC — no Japão, 10:00–13:00 e 15:00–19:00 JST, ou seja, exatamente quando o tráfego diurno de agentes de uma casa é mais intenso.

Aqui está cada taxa, antiga vs. nova:

Taxa ($/M tokens)AntigaNova fora de picoNova picoAumento
v4 flash — entrada em cache$0.0028$0.007$0.0142.5–5×
v4 flash — entrada (falha)$0.14$0.22$0.441.6–3.1×
v4 flash — saída$0.28$0.66$1.322.4–4.7×
v4 pro — entrada em cache$0.003625$0.022$0.0446–12×
v4 pro — entrada (falha)$0.435$0.66$1.321.5–3×
v4 pro — saída$0.87$1.98$3.962.3–4.6×

Os aumentos mais íngremes caem exatamente onde vivem os agentes sempre ativos: na entrada em cache. A taxa de acerto de cache do pro sobe 6–12×, a do flash 2.5–5× — exatamente o item que tornava essa pilha barata.

Quanto meus meses reais teriam custado nas novas taxas — mesmas misturas de tokens de acima, mesma divisão de modelos (julho rodou aproximadamente 50/50 flash/pro em volume; junho cerca de dois terços flash), com três cenários de horário, já que a nova cobrança depende de quando o tráfego roda:

MêsReal (taxas antigas)Novo: tudo fora de picoNovo: distribuído 24/7Novo: tudo em pico
Julho de 2026$6.49~$14~$18~$27
Junho de 2026$24.08~$43~$55~$85

Chame de 2–4× dependendo de quando seu tráfego roda. Ainda é barato em termos absolutos — a pilha inteira fica abaixo de $30/mês mesmo no pior caso — mas isso reorganiza a tabela comparativa abaixo: com ~$12, a GPT-5.6 Luna agora fica abaixo até do melhor cenário do DeepSeek, tudo fora de pico (~$14), para essa carga exata. Pela primeira vez desde que essa pilha existe, a forma mais barata de rodá-la não é o DeepSeek. Se vale a pena migrar é outra questão — o aumento mexe na minha conta em cerca de dez dólares por mês, e deslocar os trabalhos cron para as janelas fora de pico (o pico são só 7 de 24 horas) recupera boa parte disso.

Mesma carga de trabalho, outros provedores

Estimativa comparando maçãs com maçãs: a mistura exata de tokens de cada mês precificada segundo as mesmas taxas atualmente publicadas de cada provedor (todas verificadas em 2026-08-14 — DeepSeek, Anthropic, OpenAI, xAI, Moonshot). Acertos de cache cobrados na taxa de entrada em cache de cada provedor; falhas na taxa normal de entrada (a Anthropic cobra um adicional de 1.25× de escrita de cache nas falhas, o que está incluído). A linha do DeepSeek mostra as taxas anteriores a 16 de agosto pelas quais minhas contas foram realmente cobradas — as novas taxas estão na seção acima.

Provedor / modeloCache de entrada $/MEntrada $/MSaída $/MCarga de trabalho de junhoCarga de trabalho de julho
DeepSeek v4 flash+pro (real, taxas antigas)$0.0028–0.0036$0.14–0.44$0.28–0.87$24.08$6.49
DeepSeek v4 flash+pro (novas taxas, a partir de 16 de agosto)$0.007–0.044$0.22–1.32$0.66–3.96~$43–85~$14–27
OpenAI GPT-5.6 Luna$0.02$0.20$1.20~$33~$12
Anthropic Claude Haiku 4.5$0.10$1.00 (+escrita)$5.00~$185~$60
xAI Grok 4.3$0.20$1.25$2.50~$230~$85
OpenAI GPT-5.6 Terra$0.20$2.00$12.00~$330~$115
xAI Grok 4.5$0.30$2.00$6.00~$365~$135
Moonshot Kimi K3 (topo de linha)$0.30$3.00$15.00~$485~$165
xAI Grok 4.6 (topo de linha, 12 de agosto)$0.50$2.00$6.00~$475~$195
OpenAI GPT-5.6 Sol (topo de linha)$0.50$5.00$30.00~$825~$290
Anthropic Claude Opus 5 / 4.8 (topo de linha)$0.50$5.00 (+escrita)$25.00~$915~$300

Premissas: valores arredondados para os ~$5 mais próximos; mistura de junho (560.8M acertos / 86.2M falhas / 3.8M saída) e mistura de julho (305.5M acertos / 15.6M falhas / 1.9M saída); estimativas de junho precificadas às taxas atuais (a GPT-5.6 só foi lançada em 9 de julho; a Grok 4.6 em 12 de agosto); assume que cada provedor alcançaria a mesma taxa de acerto de cache (realista — o formato do tráfego é idêntico); ignora descontos por lote, a sobretaxa de contexto longo da xAI e — exceto pela linha das novas taxas do DeepSeek — preços por horário. Duas mudanças na lista desde a última atualização: a xAI lançou a Grok 4.6 como seu novo topo de linha e reduziu a taxa em cache da Grok 4.5 de $0.50 para $0.30, e a Anthropic lançou a Claude Opus 5 nas mesmas taxas da Opus 4.8, então essa linha cobre as duas.

Os cortes de preço da OpenAI de 30 de julho moveram a parte de baixo desta tabela mais do que a de cima, e o aumento do DeepSeek em 16 de agosto termina o serviço. A taxa de entrada em cache da Luna ($0.02/M) é aproximadamente 6–7× a taxa antiga em cache do DeepSeek, e é por isso que a mesma carga de trabalho com 95% de acerto de cache chegou a ~$12 na Luna contra $6.49 no DeepSeek. Contra as taxas novas do DeepSeek ($0.007–0.044/M em cache), os ~$12 da Luna vencem os ~$14–$27 do DeepSeek de forma clara — o desconto de cache que mantinha a diferença a favor do DeepSeek é exatamente o que foi reprecificado.

A parte honesta: a qualidade é diferente

Isso não é “o DeepSeek equivale à Claude por 4% do preço”. Os modelos de ponta — Claude Opus, GPT-5.6, Grok 4.5 — são visivelmente mais fortes em trabalho complexo, de longo prazo e agêntico. Mas o burburinho rotineiro dos agentes, a triagem de mensagens, os rascunhos, as tarefas agendadas e a automação de costura não precisam de inteligência de ponta, e isso é ~95% do que uma pilha sempre ativa faz. Essa é exatamente a divisão que minha configuração explora: tokens baratos para o trabalho braçal, cérebros de ponta para o que é difícil — a mesma divisão de trabalho de quando a pilha de agentes quebrou e o Claude Code consertou.

A metade de ponta do meu uso passa pelo Claude Code na assinatura Max — uma taxa mensal fixa, então o trabalho pesado de codificação e depuração nunca encosta na cobrança por token. Os dólares do DeepSeek cobrem apenas os agentes 24 horas por dia.

A outra conta: Claude Code no Max

Para completar, o lado de ponta, medido a partir do histórico de sessões locais desta máquina: junho de 2026: 412 sessões do Claude Code em 13 dias ativos. 1 a 11 de julho: 297 sessões em 8 dias ativos — cerca de 709 sessões e ~314 MB de transcrições em seis semanas. São execuções agênticas de codificação longas e com uso pesado de ferramentas, não conversas avulsas.

Tudo isso é coberto de forma fixa pela assinatura Claude Max de $200/mês. O uso da assinatura não é medido, então não há uma cifra exata equivalente de API — mas centenas de sessões longas de agente classe Opus, a preços de tabela ($5/$25 por milhão de tokens), plausivelmente chegariam à casa dos quatro dígitos mensais. O total honesto para a pilha inteira:

  • ~$200/mês fixo — assinatura Max, toda a codificação e depuração de ponta
  • ~$15/mês medido — DeepSeek, os agentes 24 horas por dia ($30.57 em junho + julho; digamos ~$30–45/mês quando as taxas de 16 de agosto entrarem)

Ciladas

  • Proteja sua taxa de acerto de cache. Um timestamp ou ID aleatório perto do topo de um prompt de sistema invalida o prefixo em cache a cada requisição — nessas proporções isso é um multiplicador de 10–30× na conta.
  • Os tokens de saída quase não importam aqui. 5.7M de saída contra ~968M de entrada nos dois meses (1.9M contra 321M só em julho); os agentes leem muito mais do que escrevem.
  • Os preços mudam rápido — nas duas direções. A OpenAI cortou a GPT-5.6 Terra em 20% e a Luna em 80% em 30 de julho; a xAI lançou a Grok 4.6 em 12 de agosto e baixou a taxa em cache da Grok 4.5 para $0.30; e o DeepSeek — a premissa inteira deste post — aumenta os preços em 16 de agosto. Reconfirme as páginas de preços antes de planejar qualquer coisa com base em qualquer número acima.
  • A cobrança por horário recompensa o agendamento. Com a nova divisão pico/fora de pico do DeepSeek, o pico são apenas 7 de 24 horas (01:00–04:00 e 06:00–10:00 UTC) e custa o dobro. Trabalhos cron, consolidação noturna e trabalho em lote podem simplesmente ser agendados para o fora de pico; é o tráfego diurno interativo que paga o preço cheio.

← Mais de IA e LLM Local