Vibe coding para extrair fatos do PDF uma vez só: 10 a 20 no upload
No Taurus, PDF de 30 páginas vira 10 a 20 fatos no upload. Na pergunta vão 2 ou 3: 600 a 900 tokens, 250 ms, menos de 4 centavos.
Um PDF de 30 páginas, no simulador do Taurus, é lido 1 vez no upload e vira 10 a 20 fatos-chave no banco. Na pergunta, o sistema manda 2 ou 3. Thiago constrói o produto de audiência com IA, receita R$0, e parou com a tabela de fatos zerada. Queria saber se a IA lê o PDF ou se outra etapa extrai o texto, e se o custo e os tokens estouram na hora de enviar e receber.
Thiago fechou as 2 dúvidas com vibe coding para extrair fatos do PDF uma vez só. No upload, o documento vira 10 a 20 fatos. Na pergunta, o simulador recebe os 2 ou 3 mais relevantes, consome 600 a 900 tokens e responde em 250 ms.
A tabela de fatos zerada e a dúvida do token
A tela mostrava a tabela vazia. O agente já tinha dito que, se tiver PDF, o fluxo usa. Thiago pediu o mecanismo:
Tá, agora você me deixou com dúvida. Você falou para mim que se tiver PDF vai usar, tá? Como que vai funcionar isso? Ah, a IA ela consegue ler PDF, eh, ou ela manda para uma outra extraí o texto desse PDF. Outra dúvida que ficou é nos custos, no valor, e se não vai estourar o o a quantidade de tokens que precisa para eh enviar e receber.
Ele juntou quem lê o arquivo e o que isso faz com o token da pergunta. Sem fato no banco, o PDF que entrasse ainda era um bloco de 30 páginas, e mandar esse bloco de novo a cada pergunta faz o custo seguir o tamanho do arquivo.
10 a 20 fatos no upload, 1 vez só
O agente na tela descreveu o que aconteceria se o PDF inteiro de 30 a 50 páginas fosse enviado toda vez que o usuário pergunta no simulador: ficaria lento e muito caro, com milhares de tokens desperdiçados. A arquitetura que ele propôs tem extração de fatos atômicos, em 2 etapas.
COMPARAÇÃO
PDF inteiro a cada pergunta
30 a 50 páginas, lento, caro
Extração 1 vez no upload
10 a 20 fatos; 2 ou 3 na pergunta, 600 a 900 tokens, 250 ms
No upload, numa aba de gestão, o sistema lê o documento todo, resume em 10 a 20 fatos-chave e grava cada fato no banco. A extração roda 1 vez; daí em diante o sistema não manda o PDF original na requisição.
No vibe coding, a pergunta leva 2 ou 3 fatos
Na pergunta, o simulador recebe os 2 ou 3 fatos mais relevantes daqueles 10 a 20, e os outros ficam no banco.
A janela do modelo chega a 164.000 tokens por requisição. O pacote do sistema (briefing + fatos relevantes + pergunta) consome 600 a 900, menos de 1,5% da capacidade. O código trava a resposta em 250 tokens de saída, proteção de custo. No relato da tela, a resposta veio em 250 ms. 250 ms é o tempo da resposta; 250 tokens é o teto do que o modelo pode escrever.
Com os fatos extraídos, o custo para o usuário ficou em menos de 4 centavos.
A escolha de modelo neste mesmo simulador está em escolher modelo pela persona. Aqui o recorte é o PDF no upload e os 2 ou 3 fatos na pergunta.
Thiago ouviu o relato e fechou:
Tá bom. me convenceu.
Extraia 1 vez e abra o payload da pergunta
Amanhã, se o seu fluxo aceita PDF, separe o upload da pergunta. No upload, extraia 10 a 20 fatos-chave e grave. Na pergunta, mande 2 ou 3. Abra o payload: se o PDF original ainda estiver lá, a extração única não rodou.
O vibe coding deste trecho é gravar o fato no upload e deixar o original de fora da pergunta. A tela da tabela zerada e o "me convenceu" estão na gravação. Vale assistir à live para ouvir a dúvida com a tabela vazia e a conta dos 600 a 900 tokens depois.