Como economizar tokens
sem piorar a resposta
Todo mundo já ouviu que precisa economizar token. Quase ninguém sabe onde o token some.
Vale pra qualquer LLM. Os exemplos usam Claude porque é o que rodo no dia a dia, mas os princípios são de arquitetura, não de fornecedor. Pra ir mais fundo em Claude Code: Trilha Claude Code.
7
partes
35+
ferramentas
∞
ROI
Começa aqui
As três de maior retorno
Converta PDF pra markdown antes de anexar.
A economia se multiplica pelo número de turnos da conversa.
Comece conversa nova quando trocar de assunto.
Contexto carregado que você não vai usar é aluguel que você paga em toda mensagem.
Não mande print de dashboard. Mande o dado.
Imagem é o item mais caro por unidade de informação que existe.
Parte 1: os princípios

1.1 O custo é cumulativo, não por mensagem
O modelo não lembra de nada entre uma mensagem e outra. A cada nova pergunta, a ferramenta reenvia a conversa inteira. Aquele anexo de 80 páginas não custou uma vez — custou uma vez por turno, até o fim da conversa.
É por isso que comprimir o que entra tem retorno multiplicado, e conversa longa e suja é o maior vilão silencioso da conta.
1.2 A pergunta que resolve a maioria dos casos
💡Antes de anexar qualquer coisa, pergunte:
Se a resposta está em 3 páginas de um documento de 200, mande as 3. Se o que importa é a tabela e não o layout, mande o dado sem formatação.

1.3 Não é só dinheiro, é qualidade
Contexto mais longo piora a resposta. A Chroma testou 18 modelos de ponta e encontrou queda de desempenho em todos eles, bem antes da janela encher. Some o efeito lost in the middle: a atenção tem formato de U.
1.4 Onde o token some de verdade
Anexos não tratados
PDF, xlsx e pptx crus carregam o que o modelo descarta
Imagens
O item mais caro por unidade de informação
Conversa sem limpeza
Custo multiplicado por cada turno
Saída de ferramenta inteira
Ler 3k linhas pra usar 20
MCP desnecessário ligado
Definição ocupa contexto sem ser usado
Parte 2: formato de entrada

2.1 A tabela de conversão
| Você tem | Converta para | Por quê |
|---|---|---|
| Markdown ou texto | PDF carrega layout, fonte e posicionamento que o modelo descarta | |
| XLSX | CSV | xlsx é um zip de XML com estilo, fórmula e metadado junto do dado |
| PPTX | Texto ou markdown | Slide é imagem com texto por cima, e imagem é cara |
| JSON tabular | CSV ou TSV | JSON repete o nome de toda chave em toda linha |
| DOCX | Markdown | Mesmo motivo do PDF |
| Print de tela | O dado por trás | Sempre |
2.2 Ferramentas que rodam na sua máquina
Pandoc
Conversão entre quase todos os formatos. Docx, epub, html, latex, markdown.
MarkItDown (Microsoft)
PDF, Office e mais, com saída pensada pra LLM.
anydoc (Firecrawl)
Converte Word, PPTX, Excel, PDF, RTF, EPUB e CSV para Markdown limpo em milissegundos. Escrito em Rust, com bindings Node.js e Python. Zero dependência de nuvem.
LibreOffice --headless
soffice --headless --convert-to csv arquivo.xlsx — já instalado em mais máquina do que você imagina.
2.3 Ferramentas que sobem o arquivo
Rápidas e sem instalação, mas o arquivo sai da sua máquina. Para documento confidencial, use a seção anterior.
2.4 PDF escaneado e imagens
⚠️PDF escaneado é imagem, não texto.
ocrmypdf antes — resolve bem e roda local.2.5 Repositórios de código
Repomix
--compress usa tree-sitter para cortar o corpo das funções (~70% de redução). --token-count-tree mostra qual arquivo está comendo seu orçamento.
files-to-prompt
Junta só os arquivos que você escolheu. Seleção cirúrgica.
ripgrep
Buscar o trecho é sempre mais barato que ler o arquivo inteiro.
Parte 3: higiene de contexto
3.1 Chat comum
🔄A regra que quase ninguém segue:
Esticar uma conversa antiga só faz sentido quando você vai usar aquele contexto. Se não vai, você está pagando aluguel por ele em toda mensagem.
3.2 Ferramentas agênticas
Limpa tudo
Use quando trocar de tarefa
Troca por resumo
Use quando continuar na mesma tarefa. Rode num intervalo natural, não no meio de um raciocínio
Volta a turno anterior
A melhor opção quando o caminho deu errado — volta pra estado que já está em cache

💸Trocar de modelo no meio da sessão custa caro.
Se precisa de um modelo leve pra uma subtarefa, abra sessão nova com um resumo curto.
3.3 Ferramentas avançadas para agentes
Três ferramentas que atacam os pontos cegos que os comandos nativos não cobrem — saída de terminal, grafo de codebase e skills esquecidas.
RTK — Rust Token Killer
Hook que intercepta saídas de CLI (git, ls, curl, gh) e filtra o ruído antes de entrar no contexto. Zero config. Um dev mediu 89% de economia em 15.720 comandos — mas JetBrains mediu resultado neutro em trabalho de alta complexidade. Mede antes de adotar.
code-review-graph
Grafo de conhecimento local e persistente do codebase. Em vez de ler arquivos inteiros a cada sessão, o Claude consulta o grafo e lê só o que importa. Projeto da Juspay mede 6,8× menos tokens em code review e até 49× em tarefas diárias.
context-mode
Sandboxeia saídas grandes de MCP (builds, fetches, greps) em subprocessos separados. Só o resumo entra na janela. Projeto alega 98% de redução em outputs de ferramenta — equivale a quase não pagar pelo resultado de tool call.
claude-code-optimize
Skill que escaneia o histórico da sessão, identifica skills carregadas mas não usadas e as silencia. Menos definições de ferramenta no prefixo = menos tokens por turno, sem perder acesso a nada.
⚠️Sobre RTK especificamente:
Parte 4: o lado da saída

Tudo até aqui foi sobre o que entra. Mas o token de saída custa várias vezes mais caro que o de entrada.
✋O jeito grátis: pedir.
caveman — compressão sistemática de saída
Uma skill que faz o modelo responder em prosa comprimida, cortando algo em torno de 65% dos tokens de saída. Código, diff e caminho de arquivo passam intactos.
npx skills add JuliusBrussee/cavemancaveman
Comprime a resposta do modelo
caveman-compress
Reescreve CLAUDE.md e arquivos de memória
middleware MCP
Comprime a descrição das ferramentas conectadas
Parte 5: medir
Otimizar sem medir é chute.
Antes de mandar
Endpoint de contagem da Anthropic, gratuito. Aceita o mesmo payload da mensagem real.
Documentação →Versão código
repomix --token-count-tree mostra a distribuição por arquivo e diretório.
Documentação →Durante a sessão
cache_read_input_tokens e cache_creation_input_tokens no Claude Code. Criação alta turno após turno = algo no prefixo muda o tempo todo.
Parte 6: quem chama API
6.1 Prompt caching
A regra de ouro:
"O que é estável vem primeiro no prompt. O que varia vem por último."
O cache casa pelo início da requisição. Uma mudança em qualquer ponto invalida tudo o que vem depois.
Leitura de cache custa cerca de 10% do preço normal de input. O cache curto se paga já na primeira releitura.
6.2 Duas alavancas que empilham
Batch
Para tudo que não é tempo real. O desconto acumula com o cache.
Roteamento de modelo
Classificação, extração e formatação rodam bem no modelo pequeno.
6.3 Armadilha do prefixo implícito (OpenAI)
cached_tokens zero enquanto você paga escrita repetida. Corrija com prompt_cache_breakpoint explícito.Quando você troca de geração de modelo, revalide sua taxa de acerto de cache.
Referência viva
O que muda em cada IA
Quase toda técnica vale para qualquer modelo. Comece pela primeira aba — as outras três existem só onde a implementação diverge de verdade.
Se você aplicar só o que está nesta aba, já resolveu a maior parte do problema.
01 · Custo
O contexto é reenviado a cada turno. Nenhum modelo lembra da mensagem anterior. O que você anexou na primeira pergunta é recobrado em todas as seguintes. Aquele anexo de 80 páginas não custou uma vez — custou uma vez por turno.
02 · Formato
Markdown e CSV ganham de PDF e XLSX em qualquer fornecedor. Layout, estilo e metadado são peso que o modelo descarta depois de pagar.
03 · Ordem
Estável primeiro, variável por último. Os três casam cache pelo começo da requisição. Timestamp ou nome de usuário no topo do prompt derruba a taxa de acerto dos três do mesmo jeito.
04 · Janela
Janela grande não é desconto. Caber não é o mesmo que valer a pena. Contexto de um milhão de tokens significa que você pode mandar tudo, não que devia.
05 · Qualidade
Contexto longo piora a resposta, em todos eles. A Chroma testou 18 modelos e achou degradação antes da janela encher, em todos. Some o lost in the middle. Context Rot, Chroma
06 · Saída
Cache desconta entrada, nunca saída. Toda conta que promete economia em cima do total da fatura está errada.
Preço e limite mudam mês a mês — esta seção descreve comportamento, não número. Conferido em 04/08/2026.
Parte 7: o nível acima

"O nível mais alto de economia é não precisar mandar."
Quando o processo está documentado direito, ele vira contexto reaproveitável. Documentação não é burocracia, é cache.
É a mesma ideia por trás do VibeDocs.
Skill: lab-map-process
Passagem de bastão
Quando alguém vai assumir o trabalho
Runbook
Para tarefa recorrente que precisa sair igual toda vez
Mapa de processo
Para enxergar o fluxo ponta a ponta
⚙️Instalação:
Perguntas frequentes
O que é um token?
Por que o custo aumenta ao longo de uma conversa?
Trocar para um modelo mais barato no meio economiza?
Converter PDF para markdown economiza mesmo?
Economizar token piora a resposta?
Prompt caching vale a pena?
Índice de ferramentas
Tudo que aparece na página, num lugar só. 📦 local = o arquivo não sai da sua máquina.
Converter documento
Pandoc
Conversão geral entre quase todos os formatos
MarkItDown
PDF e Office para markdown, saída pensada pra LLM
anydoc (Firecrawl)
Word, PPTX, Excel, PDF, RTF, EPUB e CSV para Markdown. Rust, Node.js e Python. Sub-5ms.
LibreOffice --headless
XLSX para CSV em lote, via linha de comando
ocrmypdf
OCR em PDF escaneado, antes de qualquer conversão
iLovePDF
PDF para markdown, sem instalar nada
Convertio
PPT para TXT, sem instalar nada
Preparar código
Reduzir saída
Agentes — avançado
RTK (Rust Token Killer)
Intercepta saídas de CLI e filtra ruído antes de entrar no contexto. Mede antes de adotar.
code-review-graph
Grafo de conhecimento local do codebase — 6.8× menos tokens em code review
context-mode
Sandboxeia saídas de MCP em subprocessos. ~98% de redução em outputs de ferramenta
claude-code-optimize
Identifica skills carregadas mas não usadas e as silencia