Conta de IA alta quase nunca é falta de plano melhor — é uso ineficiente. Estas recomendações vêm da documentação oficial da Anthropic.
Limpe o contexto entre tarefas
Toda a conversa anterior viaja junto a cada nova mensagem. Quando você muda de assunto, esse histórico vira custo puro.
Use o comando de limpar contexto ao trocar de tarefa. Em conversas longas, compactar o histórico com foco no que importa também ajuda.
Escolha o modelo certo para cada tarefa
É o ajuste de maior impacto. A recomendação oficial é usar o modelo intermediário para a maioria do trabalho e reservar o mais caro para o que exige raciocínio de várias etapas, como decisão de arquitetura.
Para tarefas simples e repetitivas, o modelo mais leve resolve por uma fração do preço.
Aproveite o cache
Quando o mesmo conteúdo é reenviado, o sistema pode reaproveitá-lo em vez de cobrar tudo de novo: leitura em cache custa cerca de 10% do preço de entrada.
Na prática isso premia quem trabalha em sessões contínuas, em vez de recomeçar do zero a cada pergunta.
Mais quatro ajustes que somam
- Instruções sob demanda: instrução que carrega sempre pesa em toda mensagem. A orientação oficial é manter o arquivo de contexto do projeto enxuto e mover o resto para o que carrega só quando necessário;
- Prefira ferramentas de linha de comando a integrações pesadas quando ambas resolvem;
- Delegue tarefas verbosas: processar um log gigante em um subprocesso devolve só o resumo;
- Planeje antes de executar em tarefas complexas: retrabalho é o gasto mais caro.
Um alerta sobre paralelismo
Rodar vários agentes ao mesmo tempo é sedutor, mas a documentação registra que equipes de agentes consomem cerca de 7 vezes mais tokens que uma sessão comum. Use quando o ganho de tempo justificar — não por padrão.