Saltar para o conteúdo
goppo

Notícias · IA resumida para perceber o essencial

Voltar às notícias

Ferramentas

Publicado em

Anthropic explica como poupar tokens no Claude Code

A Anthropic publicou um guia prático para reduzir o desperdício de tokens no Claude Code. As recomendações passam por escolher o modelo certo, preservar o prompt cache, limitar o contexto e separar tarefas longas ou ruidosas.

  • anthropic
  • claude-code
  • tokens
  • produtividade
  • desenvolvimento

Resumo

A Anthropic publicou um guia com recomendações para usar o Claude Code de forma mais eficiente e evitar que tokens sejam gastos em contexto, leituras ou respostas que não contribuem para a tarefa. A empresa sublinha que poupar tokens não significa usar sempre menos, mas fazer com que os tokens usados sirvam o objetivo pedido.

Na prática

A primeira decisão é escolher o modelo e o nível de esforço de acordo com o trabalho: modelos maiores e mais raciocínio para problemas difíceis ou ambíguos; configurações mais leves para tarefas rotineiras. A Anthropic recomenda verificar `/model` e `/effort` no início de uma sessão e evitar alterá-los a meio, porque a mudança pode invalidar o cache da conversa.

O prompt caching reduz o custo de reenviar partes que não mudaram. Para o preservar, a recomendação é fazer alterações de modelo, esforço ou modo rápido no início da sessão, usar `/rewind` para remover apenas os últimos turnos quando necessário e reservar `/compact` para resumir uma conversa que ainda vai continuar.

Contexto

Cada turno envia novamente o que ficou na conversa: ficheiros lidos, resultados de comandos, instruções e saídas de testes. Mesmo quando esses tokens são servidos a partir da cache, continuam a ocupar espaço no contexto e a ser considerados pelo modelo. Por isso, a Anthropic recomenda indicar diretamente o ficheiro relevante, por exemplo com `@ficheiro`, manter instruções gerais curtas no `CLAUDE.md` e deslocar instruções específicas para skills.

A empresa também aconselha a reduzir saídas de comandos com opções silenciosas, `tail` ou relatórios mais compactos. Para tarefas que produzem muita informação mas não precisam de ficar na conversa principal — como analisar logs — um subagente pode trabalhar num contexto separado e devolver apenas a conclusão. O ganho depende do caso: para tarefas pequenas, o custo de criar esse contexto adicional pode não compensar.

Porque importa

  • Escolher um modelo e um nível de esforço adequados pode evitar pagar capacidade de raciocínio que a tarefa não exige.
  • Preservar a cache torna mais barato continuar uma sessão, mas mudanças a meio, compactações e pausas longas podem obrigar a reconstruir o contexto.
  • `/clear` entre tarefas, `/compact` quando uma tarefa termina e saídas de comandos mais silenciosas mantêm a conversa mais curta e relevante.
  • A recomendação não garante uma redução fixa de custos: o resultado depende do modelo, do plano, da duração da sessão, das ferramentas usadas e da complexidade do trabalho.