Quanto Meus Agentes de IA Realmente Custam: DeepSeek vs as Grandes APIs
- Categoria
- IA e LLM Local
- Publicado em
- 11 julho 2026
- Atualizado em
- 14 agosto 2026
- Por
- Jacob Lloyd — escrito com ajuda de IA, depois do projeto
- Tempo de leitura
- 10 min de leitura
Em termos simples: Um olhar sobre quanto custa de verdade manter assistentes de IA rodando o tempo todo. Dois meses de uso pesado ficaram em cerca de $31 num serviço de IA econômico — apenas $6.49 em julho. Esse serviço está aumentando os preços em 16 de agosto, então o mesmo mês de uso em breve custará cerca de duas a quatro vezes mais, e o novo nível mais barato da OpenAI se torna a opção menos cara para esse tipo de carga de trabalho. O truque que mantém isso barato é o cache — a maior parte do texto enviado à IA se repete, e texto repetido é cobrado com um desconto enorme.
Minha pilha de agentes domésticos — oito agentes nomeados rodando 24 horas por dia na API do DeepSeek — acaba de completar dois meses inteiros. Puxei as exportações de uso de julho e fiz as contas de novo: quanto isso realmente custou, e quanto a mesma carga de trabalho custaria nas grandes APIs?
Resumo
- Julho de 2026, mês inteiro: $6.49 no total ($1.81 flash + $4.68 pro) em 22 dias ativos. Junho custou $24.08; os dois meses juntos, $30.57.
- Volume: 323M tokens em ~5.8k requisições em julho; ~974M tokens nos dois meses.
- O detalhe principal: 95% dos tokens de entrada de julho foram acertos de cache — essa proporção, não o preço de tabela, é o que torna agentes sempre ativos viáveis.
- A mesma carga de trabalho em outro lugar (estimado): julho: aproximadamente $135–$300 nos modelos de ponta, $12–$85 nos níveis econômicos — e a nova GPT-5.6 Luna da OpenAI é agora a opção não-DeepSeek mais barata, com ~$12 (junho: $33–$915).
- Aviso (adicionado em 2026-08-14): o DeepSeek aumenta os preços em 16 de agosto com cobrança pico/fora de pico. Minha carga de julho teria custado ~$14–$27 nas novas taxas em vez de $6.49 — o que torna a GPT-5.6 Luna, com ~$12, a nova opção mais barata. Detalhamento antigo vs. novo abaixo.
Os números reais
O volume do mês inteiro de julho: 305.5M tokens de entrada em cache, 15.6M tokens de entrada com falha de cache, 1.9M tokens de saída — 323M tokens, por $6.49 ($1.81 no flash, $4.68 no pro). Junho foi o mês pesado, com ~560.8M acertos de cache, ~86.2M falhas de cache e ~3.8M tokens de saída, por $24.08. Juntos, isso dá ~866M em cache, ~102M com falha e ~5.7M de saída — cerca de 974M tokens e $30.57 em dois meses. Julho também teve um período calmo de nove dias (20 a 28) com zero tráfego de API; nos 22 dias em que rodou, a média foi de $0.30/dia.
Essa taxa de acerto de cache de 95% (acima dos 87% de junho) não é sorte — é a forma natural do tráfego de agentes. Cada turno reenvia o mesmo prompt de sistema, as mesmas definições de ferramentas e o mesmo histórico de conversa, e os provedores cobram esse prefixo repetido por uma fração minúscula do preço normal de entrada. O DeepSeek cobra $0.0028–$0.003625 por milhão de tokens em cache (até 15 de agosto — veja a próxima seção); sem cache, só a conta de entrada de julho teria sido ~14–19× maior.
O aumento de preço do DeepSeek em 16 de agosto: antigo vs. novo
Doze dias após a última atualização deste post, o DeepSeek avisou os desenvolvedores sobre um aumento significativo de preços, e a página de preços agora traz os detalhes: a partir de 16 de agosto de 2026 às 16:00 UTC, a API passa a cobrar por pico/fora de pico, com o fora de pico pela metade da taxa de pico. As horas de pico são 01:00–04:00 e 06:00–10:00 UTC — no Japão, 10:00–13:00 e 15:00–19:00 JST, ou seja, exatamente quando o tráfego diurno de agentes de uma casa é mais intenso.
Aqui está cada taxa, antiga vs. nova:
| Taxa ($/M tokens) | Antiga | Nova fora de pico | Nova pico | Aumento |
|---|---|---|---|---|
| v4 flash — entrada em cache | $0.0028 | $0.007 | $0.014 | 2.5–5× |
| v4 flash — entrada (falha) | $0.14 | $0.22 | $0.44 | 1.6–3.1× |
| v4 flash — saída | $0.28 | $0.66 | $1.32 | 2.4–4.7× |
| v4 pro — entrada em cache | $0.003625 | $0.022 | $0.044 | 6–12× |
| v4 pro — entrada (falha) | $0.435 | $0.66 | $1.32 | 1.5–3× |
| v4 pro — saída | $0.87 | $1.98 | $3.96 | 2.3–4.6× |
Os aumentos mais íngremes caem exatamente onde vivem os agentes sempre ativos: na entrada em cache. A taxa de acerto de cache do pro sobe 6–12×, a do flash 2.5–5× — exatamente o item que tornava essa pilha barata.
Quanto meus meses reais teriam custado nas novas taxas — mesmas misturas de tokens de acima, mesma divisão de modelos (julho rodou aproximadamente 50/50 flash/pro em volume; junho cerca de dois terços flash), com três cenários de horário, já que a nova cobrança depende de quando o tráfego roda:
| Mês | Real (taxas antigas) | Novo: tudo fora de pico | Novo: distribuído 24/7 | Novo: tudo em pico |
|---|---|---|---|---|
| Julho de 2026 | $6.49 | ~$14 | ~$18 | ~$27 |
| Junho de 2026 | $24.08 | ~$43 | ~$55 | ~$85 |
Chame de 2–4× dependendo de quando seu tráfego roda. Ainda é barato em termos absolutos — a pilha inteira fica abaixo de $30/mês mesmo no pior caso — mas isso reorganiza a tabela comparativa abaixo: com ~$12, a GPT-5.6 Luna agora fica abaixo até do melhor cenário do DeepSeek, tudo fora de pico (~$14), para essa carga exata. Pela primeira vez desde que essa pilha existe, a forma mais barata de rodá-la não é o DeepSeek. Se vale a pena migrar é outra questão — o aumento mexe na minha conta em cerca de dez dólares por mês, e deslocar os trabalhos cron para as janelas fora de pico (o pico são só 7 de 24 horas) recupera boa parte disso.
Mesma carga de trabalho, outros provedores
Estimativa comparando maçãs com maçãs: a mistura exata de tokens de cada mês precificada segundo as mesmas taxas atualmente publicadas de cada provedor (todas verificadas em 2026-08-14 — DeepSeek, Anthropic, OpenAI, xAI, Moonshot). Acertos de cache cobrados na taxa de entrada em cache de cada provedor; falhas na taxa normal de entrada (a Anthropic cobra um adicional de 1.25× de escrita de cache nas falhas, o que está incluído). A linha do DeepSeek mostra as taxas anteriores a 16 de agosto pelas quais minhas contas foram realmente cobradas — as novas taxas estão na seção acima.
| Provedor / modelo | Cache de entrada $/M | Entrada $/M | Saída $/M | Carga de trabalho de junho | Carga de trabalho de julho |
|---|---|---|---|---|---|
| DeepSeek v4 flash+pro (real, taxas antigas) | $0.0028–0.0036 | $0.14–0.44 | $0.28–0.87 | $24.08 | $6.49 |
| DeepSeek v4 flash+pro (novas taxas, a partir de 16 de agosto) | $0.007–0.044 | $0.22–1.32 | $0.66–3.96 | ~$43–85 | ~$14–27 |
| OpenAI GPT-5.6 Luna | $0.02 | $0.20 | $1.20 | ~$33 | ~$12 |
| Anthropic Claude Haiku 4.5 | $0.10 | $1.00 (+escrita) | $5.00 | ~$185 | ~$60 |
| xAI Grok 4.3 | $0.20 | $1.25 | $2.50 | ~$230 | ~$85 |
| OpenAI GPT-5.6 Terra | $0.20 | $2.00 | $12.00 | ~$330 | ~$115 |
| xAI Grok 4.5 | $0.30 | $2.00 | $6.00 | ~$365 | ~$135 |
| Moonshot Kimi K3 (topo de linha) | $0.30 | $3.00 | $15.00 | ~$485 | ~$165 |
| xAI Grok 4.6 (topo de linha, 12 de agosto) | $0.50 | $2.00 | $6.00 | ~$475 | ~$195 |
| OpenAI GPT-5.6 Sol (topo de linha) | $0.50 | $5.00 | $30.00 | ~$825 | ~$290 |
| Anthropic Claude Opus 5 / 4.8 (topo de linha) | $0.50 | $5.00 (+escrita) | $25.00 | ~$915 | ~$300 |
Premissas: valores arredondados para os ~$5 mais próximos; mistura de junho (560.8M acertos / 86.2M falhas / 3.8M saída) e mistura de julho (305.5M acertos / 15.6M falhas / 1.9M saída); estimativas de junho precificadas às taxas atuais (a GPT-5.6 só foi lançada em 9 de julho; a Grok 4.6 em 12 de agosto); assume que cada provedor alcançaria a mesma taxa de acerto de cache (realista — o formato do tráfego é idêntico); ignora descontos por lote, a sobretaxa de contexto longo da xAI e — exceto pela linha das novas taxas do DeepSeek — preços por horário. Duas mudanças na lista desde a última atualização: a xAI lançou a Grok 4.6 como seu novo topo de linha e reduziu a taxa em cache da Grok 4.5 de $0.50 para $0.30, e a Anthropic lançou a Claude Opus 5 nas mesmas taxas da Opus 4.8, então essa linha cobre as duas.
Os cortes de preço da OpenAI de 30 de julho moveram a parte de baixo desta tabela mais do que a de cima, e o aumento do DeepSeek em 16 de agosto termina o serviço. A taxa de entrada em cache da Luna ($0.02/M) é aproximadamente 6–7× a taxa antiga em cache do DeepSeek, e é por isso que a mesma carga de trabalho com 95% de acerto de cache chegou a ~$12 na Luna contra $6.49 no DeepSeek. Contra as taxas novas do DeepSeek ($0.007–0.044/M em cache), os ~$12 da Luna vencem os ~$14–$27 do DeepSeek de forma clara — o desconto de cache que mantinha a diferença a favor do DeepSeek é exatamente o que foi reprecificado.
A parte honesta: a qualidade é diferente
Isso não é “o DeepSeek equivale à Claude por 4% do preço”. Os modelos de ponta — Claude Opus, GPT-5.6, Grok 4.5 — são visivelmente mais fortes em trabalho complexo, de longo prazo e agêntico. Mas o burburinho rotineiro dos agentes, a triagem de mensagens, os rascunhos, as tarefas agendadas e a automação de costura não precisam de inteligência de ponta, e isso é ~95% do que uma pilha sempre ativa faz. Essa é exatamente a divisão que minha configuração explora: tokens baratos para o trabalho braçal, cérebros de ponta para o que é difícil — a mesma divisão de trabalho de quando a pilha de agentes quebrou e o Claude Code consertou.
A metade de ponta do meu uso passa pelo Claude Code na assinatura Max — uma taxa mensal fixa, então o trabalho pesado de codificação e depuração nunca encosta na cobrança por token. Os dólares do DeepSeek cobrem apenas os agentes 24 horas por dia.
A outra conta: Claude Code no Max
Para completar, o lado de ponta, medido a partir do histórico de sessões locais desta máquina: junho de 2026: 412 sessões do Claude Code em 13 dias ativos. 1 a 11 de julho: 297 sessões em 8 dias ativos — cerca de 709 sessões e ~314 MB de transcrições em seis semanas. São execuções agênticas de codificação longas e com uso pesado de ferramentas, não conversas avulsas.
Tudo isso é coberto de forma fixa pela assinatura Claude Max de $200/mês. O uso da assinatura não é medido, então não há uma cifra exata equivalente de API — mas centenas de sessões longas de agente classe Opus, a preços de tabela ($5/$25 por milhão de tokens), plausivelmente chegariam à casa dos quatro dígitos mensais. O total honesto para a pilha inteira:
- ~$200/mês fixo — assinatura Max, toda a codificação e depuração de ponta
- ~$15/mês medido — DeepSeek, os agentes 24 horas por dia ($30.57 em junho + julho; digamos ~$30–45/mês quando as taxas de 16 de agosto entrarem)
Ciladas
- Proteja sua taxa de acerto de cache. Um timestamp ou ID aleatório perto do topo de um prompt de sistema invalida o prefixo em cache a cada requisição — nessas proporções isso é um multiplicador de 10–30× na conta.
- Os tokens de saída quase não importam aqui. 5.7M de saída contra ~968M de entrada nos dois meses (1.9M contra 321M só em julho); os agentes leem muito mais do que escrevem.
- Os preços mudam rápido — nas duas direções. A OpenAI cortou a GPT-5.6 Terra em 20% e a Luna em 80% em 30 de julho; a xAI lançou a Grok 4.6 em 12 de agosto e baixou a taxa em cache da Grok 4.5 para $0.30; e o DeepSeek — a premissa inteira deste post — aumenta os preços em 16 de agosto. Reconfirme as páginas de preços antes de planejar qualquer coisa com base em qualquer número acima.
- A cobrança por horário recompensa o agendamento. Com a nova divisão pico/fora de pico do DeepSeek, o pico são apenas 7 de 24 horas (01:00–04:00 e 06:00–10:00 UTC) e custa o dobro. Trabalhos cron, consolidação noturna e trabalho em lote podem simplesmente ser agendados para o fora de pico; é o tráfego diurno interativo que paga o preço cheio.