GLM no vibe coding: como derrubar o custo de um produto de IA
Guilherme Saraiva abriu a fatura ao vivo: 191.000 tokens no modelo caro deram 61 centavos de dólar, e 11 milhões de tokens no GLM deram 2,25. A conta que decide o preço do produto.
A conta de um produto que chama IA é decidida na hora em que você escolhe qual modelo atende cada chamada. A parte do trabalho que consome muito token vai para um modelo barato, e o modelo caro fica com o pedaço pequeno, aquele em que você faz questão de pagar mais.
Guilherme Saraiva mostrou o tamanho dessa diferença com a própria fatura aberta na tela, no meio da live em que constrói um sistema de RPG com IA. Ele parou a explicação para ler as linhas em voz alta, "aqui a conta, ó":
Com 191.000 tokens foi o equivalente a 61 centavos de dólar, mano. E com 11 milhões de tokens foi 2,25, mano.
Os 191.000 tokens rodaram no modelo que ele vinha usando. Os outros 11 milhões rodaram no GLM, um modelo chinês que ele acessa por um agregador, e essa é a fatura do projeto dele.
Um motor de RPG consome token em outra escala
O volume vem do desenho do produto. O que ele está construindo tem um motor que carrega a partida inteira a cada resposta:
É o que ele tá carregado com o contexto da história, ele tá carregado com os personagens, com os capítulos.
Cada jogada do jogador chega ao modelo carregando a história inteira e os personagens já registrados. Um produto assim não tem como fazer chamada curta, e a escolha do modelo vira decisão de custo antes de virar decisão técnica. Ele nem chegou a testar esse volume no modelo que vinha usando, disse que sairia caro demais.
A conta apareceu 2 vezes na mesma live
No começo da live ele já tinha aberto o painel do agregador para mostrar o gasto:
eu botei cincão e eu tô com dois de gasto só, velho, ainda com 8 milhão de token
Horas depois, quando o assunto voltou, o número tinha subido para 11 milhões de tokens e 2,25. Parte disso ele estava queimando ao vivo, testando o sistema na frente de quem assistia: "Tô queimando dinheiro para testar."
O saldo baixo apareceu junto:
Inclusive, eu já tô com poucos créditos. Tem que botar mais cincão aqui.
Todo o teste do sistema, mais de 11 milhões de tokens, coube dentro de uma recarga do tamanho da que ele chama de cincão.
O que ele diz que a economia compra
O custo é metade da decisão dele. A outra metade é a avaliação que ele faz da qualidade do modelo barato, e essa parte é opinião: nenhum teste comparativo apareceu na tela.
Então eu vou pegar a qualidade da chinesa, vou colocar no sistema de RPG, vou vender em real e a rapaziada vai se amarrar porque eles vão ter um produto de qualidade num preço justo, tá ligado? E eu não vou ter altos custos para manter isso.
O plano de negócio inteiro está nessa frase. Ele viu o mercado de RPG com IA cobrando em dólar e quis vender em real, e vender em real só fecha se o custo por partida for baixo. A lacuna, resumida por ele:
hoje em dia o que a gente tem é tudo localizado em dólar, tudo com modelo que não fala português
O preço que ele consegue cobrar depende do que ele paga por token, e é por isso que a escolha do modelo decide qual produto ele consegue vender.
Onde encaixar o modelo barato no seu vibe coding
Separe as chamadas do seu projeto em 2 grupos antes de escolher qualquer modelo. De um lado, o que roda a cada interação do usuário e carrega contexto grande. Do outro, o que roda pouco: uma revisão, ou uma tarefa em que errar sai caro. O primeiro grupo é onde o preço por token decide se o produto existe, e é para lá que o modelo barato vai primeiro.
A qualidade você vai ter que testar no seu caso. Guilherme escolheu um modelo chinês para o produto dele e disse por quê, mas não mediu qualidade no ar, e um motor de RPG em português não tem a mesma exigência de um sistema que você entrega para um cliente pagante. Num projeto de vibe coding a troca de modelo custa uma linha de configuração, então rodar o mesmo prompt nos 2 e comparar é barato. O que a live prova é o lado do custo, e prova com a fatura aberta.
Feita a escolha, abra o painel do seu agregador uma vez por semana. Esse número é o que responde se dá para cobrar em real e o que você mostra quando perguntarem sua margem. Quem só descobre o custo por usuário no primeiro mês de uso real definiu o preço no escuro; ele já tinha o número na mão antes de ter o primeiro usuário.
Ler a fatura em voz alta, com o saldo baixando enquanto testa, deixa a conta conferível por qualquer um que esteja assistindo, e é o que as leis do movimento cobram de quem constrói em público. É também o que o vibe coding feito à vista entrega antes do resultado bonito. Dá para assistir à live e ver a tela do painel, com ele procurando as linhas da conta enquanto fala.