Como criar um chatbot no vibe coding: 1000 pessoas em 300ms
Como criar um chatbot com cache: 1000 pessoas, 3 perguntas sobre beber, resposta em 300ms e custo praticamente zero. Cardia, 2 camadas.
Quando 1000 pessoas perguntam a mesma coisa com palavras diferentes, o chatbot que gera resposta nova para cada uma paga 1000 vezes. Thiago leu na tela o Cardia, o cérebro do chat do Bíblo, com as 1000 pessoas já resolvidas no cache: se essas 1000 pessoas escrevem "Crente pode beber cerveja?", "Cristão pode tomar álcool?" ou "É pecado beber?", o sistema reconhece a equivalência semântica e devolve o cache em 300ms, custando praticamente zero.
O VOLUME
Gerar de novo
1000 respostas novas. Paga 1000 vezes
Cache do Cardia
Equivalência semântica em 300ms. Custo praticamente zero
A peça barata no volume são as 2 camadas. Pergunta idêntica já feita volta na hora. Pergunta com o mesmo significado reutiliza a resposta.
Ele nomeou a peça:
"o cardia é o cérebro por trás da do chat ali."
As 3 perguntas sobre beber que caem no mesmo cache
Ele estava olhando o Cardia como cérebro do chat do Bíblo e queria as poucas etapas na tela. Pediu à IA um resumo:
"Só queria um resumo de como funciona esse ágio aí."
A tela devolveu uma caixa em 2 camadas e um exemplo de volume. Respostas instantâneas para perguntas idênticas já feitas. Layer semântico que reutiliza a resposta para perguntas com o mesmo significado. Em seguida o caso das 1000 pessoas, com as 3 frases sobre beber, lidas em voz alta.
Ele leu o exemplo completo na tela: se 1000 pessoas perguntarem "Crente pode beber cerveja?", "Cristão pode tomar álcool?" ou "É pecado beber?", o sistema reconhece a equivalência semântica e devolve a resposta do cache em 300ms, custando praticamente zero. As 3 frases pedem a mesma resposta. O Cardia guarda uma e devolve para as outras.
Ele apontou o resumo:
"Eh, ó lá como funciona hoje em poucas etapas."
As poucas etapas começam no cache. A pessoa 1000 recebe a mesma resposta da pessoa 1, em 300ms, sem pagar de novo a geração. Para quem está vendo como criar um chatbot, o número que segura o volume é este: 1000 pessoas, 300ms, custo praticamente zero.
2 camadas: pergunta idêntica e mesmo significado
Na primeira camada, alguém já fez a frase exata. O chatbot devolve a resposta guardada em 300ms, sem modelo no caminho. Na segunda camada a pessoa digita cerveja numa frase, álcool na outra, pecado na terceira. O layer semântico reutiliza a resposta porque o significado é o mesmo.
Nas 3 frases da tela o caminho aparece inteiro. "Crente pode beber cerveja?" entra e fica no cache. "Cristão pode tomar álcool?" não é a mesma string, então a primeira camada não pega. A segunda reconhece o significado e devolve o que já estava guardado. "É pecado beber?" faz o mesmo caminho. A volta sai em 300ms e o custo daquelas 1000 pessoas fica praticamente zero.
"Crente" e "cristão" não batem como string. Batem no layer semântico, e as 1000 pessoas sobre beber saem do mesmo cache.
O Cardia levou 13 versões até ele gostar. Ele falou das 13 versões depois de ler o resumo de como aquilo funciona hoje. O cache de pergunta equivalente é uma das etapas que ficaram, com volta em 300ms.
No vibe coding, o cache entra na frente do modelo
No vibe coding desta sessão o cache ficou na frente do modelo porque ele pediu o resumo, leu a caixa das 1000 pessoas e segurou as 2 camadas. Pergunta equivalente com resposta pronta não chama o modelo. Os 1000 pedidos sobre beber não viram 1000 gerações. O custo some onde a pergunta já foi respondida. O cérebro do chat continua no Cardia. A fila começa na pergunta idêntica e na pergunta equivalente, e o modelo só entra depois.
A outra lição do Cardia nessa live está em Embeddings: como um vibe coder traduz gíria antes da busca.
Escreva as 3 perguntas equivalentes do seu chatbot
Amanhã pegue o assunto que mais vai repetir no seu chat. Escreva 3 frases que um usuário digitaria, no molde das 3 sobre beber. "Crente pode beber cerveja?" é a frase direta. "Cristão pode tomar álcool?" é o mesmo pedido com outras palavras. "É pecado beber?" é o mesmo pedido em tom de regra. As suas 3 cobrem string nova e significado igual. Coloque 2 camadas na frente do modelo: match idêntico e equivalência de significado. Cronometre a volta. Se a pessoa 1000 recebe em 300ms e o custo fica praticamente zero, o chatbot já tem a peça que o Cardia mostrou na tela.
Esse corte de custo aparece quando você pede o resumo no vibe coding e lê o que a tela devolveu.
Quem quer ouvir o "cérebro por trás do chat" e o resumo das 1000 pessoas pode assistir à live. Outras sacadas da série: como criar agentes de IA no vibe coding só no projeto do zero e marketing orgânico: como um vibe coder gera 30 dias no piloto automático.