O que é um token, na prática
Modelos de linguagem não leem letra por letra nem palavra por palavra. Eles trabalham com tokens — pedaços de texto que um algoritmo chamado tokenizador recorta e converte em números. Cada pedaço vira um código que o modelo entende e manipula.
Um token pode ser uma palavra curta inteira ("casa"), um fragmento de uma palavra maior ("inteligência" pode virar dois ou três tokens) ou até um espaço e um ponto final. A regra mais famosa vem da OpenAI: em inglês, um token equivale a mais ou menos 4 caracteres, ou cerca de 0,75 de uma palavra.
Como funciona a tokenização
Tokenização é o processo de picar o texto nesses blocos. A técnica mais usada hoje se chama Byte Pair Encoding (BPE): ela aprende, a partir de bilhões de textos, quais sequências de caracteres aparecem juntas com mais frequência e as trata como uma unidade só.
Por isso palavras comuns costumam virar um único token, enquanto palavras raras, nomes próprios ou termos técnicos são fatiados em vários. Emojis, código de programação e caracteres acentuados também podem consumir mais tokens do que você imagina.
| Texto | Tokens aproximados | Observação |
|---|---|---|
| "Bom dia" | 2 a 3 | Palavras curtas e comuns rendem bem |
| "paralelepípedo" | 4 a 6 | Palavra longa e acentuada é fatiada |
| Um parágrafo de ~100 palavras em pt-BR | ~150 a 170 | Português quase sempre gasta mais que inglês |
| Uma imagem enviada ao modelo | centenas a milhares | Imagens também são convertidas em tokens |
Por que o português gasta mais tokens
Aqui está um detalhe que pega muita gente de surpresa: a mesma ideia escrita em português consome mais tokens do que em inglês. Nossas palavras são mais longas, temos acentuação, conjugações verbais cheias de variações e uma morfologia mais complexa.
Na prática, isso significa que um texto em pt-BR pode custar de 15% a 50% mais tokens que o equivalente em inglês. Se você paga por uso de API, ou está tentando encaixar um documento grande dentro do limite do modelo, vale ter isso no radar.
Token, preço e limite de contexto
Duas coisas importantes são medidas em tokens: quanto você paga e quanto o modelo consegue "lembrar" de uma vez.
No preço, as plataformas não cobram por token avulso — tabelam por 1 milhão de tokens, e separam entrada (o que você manda) de saída (o que a IA gera). A saída quase sempre é mais cara. Em julho de 2026, por exemplo, o Claude Sonnet 4.5 ficava em torno de US$ 3 por milhão de tokens de entrada e US$ 15 na saída; modelos econômicos custam frações disso. Confira sempre a tabela oficial, porque muda com frequência.
Já o limite de contexto é o total de tokens que cabe em uma única conversa ou requisição — somando o que você enviou e o que o modelo respondeu. Muitos modelos de produção trabalham na faixa de 128 mil a 200 mil tokens, e alguns já oferecem janelas de 1 milhão. Estourou o limite? O modelo começa a "esquecer" o começo da conversa.
Por que isso importa pra você
Entender token não é preciosismo técnico. É o que explica por que uma resposta ficou cortada, por que a IA "esqueceu" uma instrução dada lá no início de um chat longo, e por que um projeto que usa API pode ficar caro sem você perceber.
Se você escreve prompts enxutos, reaproveita contexto e evita mandar textos gigantes sem necessidade, gasta menos tokens e costuma ter respostas mais focadas. É a mesma lógica de quem sabe [dar bom contexto ao ChatGPT](/como-usar-chatgpt-do-zero) e de quem estuda [como escrever prompts melhores](/como-criar-prompts-melhores).
Perguntas frequentes
1 token é igual a 1 palavra?
Como sei quantos tokens meu texto tem?
Por que a resposta da IA veio cortada?
Token de IA tem a ver com criptomoeda?
Termos relacionados
LLM (Modelo de Linguagem de Grande Escala)
O que é LLM, como funciona e exemplos práticos. Explicação de modelos de linguagem de grande escala em linguagem acessível, sem termos técnicos desnecessários.
Ler →
Temperatura em IA
Temperatura é o parâmetro (0 a 1) que controla o quão criativa ou previsível é a resposta de um LLM: perto de 0 vira respostas consistentes, perto de 1 vira respostas variadas. Quando usar cada valor, com exemplos.
Ler →
Prompt Engineering
O que é prompt engineering, para que serve e como aprender do zero. Definição clara com exemplos práticos em português.
Ler →
Como criar prompts melhores para IA: 7 técnicas que funcionam
7 técnicas práticas de prompt engineering para tirar respostas muito melhores do ChatGPT, Claude e outras IAs. Com exemplos prontos em português.
Ler →
Como usar o ChatGPT do zero: guia completo para iniciantes
Aprenda a usar o ChatGPT do zero com este guia passo a passo em português. Do cadastro ao primeiro prompt, sem complicação.
Ler →