VIBE IN PUBLIC_

Vibe coding para extrair fatos do PDF uma vez só: 10 a 20 no upload

No Taurus, PDF de 30 páginas vira 10 a 20 fatos no upload. Na pergunta vão 2 ou 3: 600 a 900 tokens, 250 ms, menos de 4 centavos.

Um PDF de 30 páginas, no simulador do Taurus, é lido 1 vez no upload e vira 10 a 20 fatos-chave no banco. Na pergunta, o sistema manda 2 ou 3. Thiago constrói o produto de audiência com IA, receita R$0, e parou com a tabela de fatos zerada. Queria saber se a IA lê o PDF ou se outra etapa extrai o texto, e se o custo e os tokens estouram na hora de enviar e receber.

Thiago fechou as 2 dúvidas com vibe coding para extrair fatos do PDF uma vez só. No upload, o documento vira 10 a 20 fatos. Na pergunta, o simulador recebe os 2 ou 3 mais relevantes, consome 600 a 900 tokens e responde em 250 ms.

A tabela de fatos zerada e a dúvida do token

A tela mostrava a tabela vazia. O agente já tinha dito que, se tiver PDF, o fluxo usa. Thiago pediu o mecanismo:

Tá, agora você me deixou com dúvida. Você falou para mim que se tiver PDF vai usar, tá? Como que vai funcionar isso? Ah, a IA ela consegue ler PDF, eh, ou ela manda para uma outra extraí o texto desse PDF. Outra dúvida que ficou é nos custos, no valor, e se não vai estourar o o a quantidade de tokens que precisa para eh enviar e receber.

Ele juntou quem lê o arquivo e o que isso faz com o token da pergunta. Sem fato no banco, o PDF que entrasse ainda era um bloco de 30 páginas, e mandar esse bloco de novo a cada pergunta faz o custo seguir o tamanho do arquivo.

10 a 20 fatos no upload, 1 vez só

O agente na tela descreveu o que aconteceria se o PDF inteiro de 30 a 50 páginas fosse enviado toda vez que o usuário pergunta no simulador: ficaria lento e muito caro, com milhares de tokens desperdiçados. A arquitetura que ele propôs tem extração de fatos atômicos, em 2 etapas.

COMPARAÇÃO

PDF inteiro a cada pergunta

30 a 50 páginas, lento, caro

Extração 1 vez no upload

10 a 20 fatos; 2 ou 3 na pergunta, 600 a 900 tokens, 250 ms

No upload, numa aba de gestão, o sistema lê o documento todo, resume em 10 a 20 fatos-chave e grava cada fato no banco. A extração roda 1 vez; daí em diante o sistema não manda o PDF original na requisição.

No vibe coding, a pergunta leva 2 ou 3 fatos

Na pergunta, o simulador recebe os 2 ou 3 fatos mais relevantes daqueles 10 a 20, e os outros ficam no banco.

A janela do modelo chega a 164.000 tokens por requisição. O pacote do sistema (briefing + fatos relevantes + pergunta) consome 600 a 900, menos de 1,5% da capacidade. O código trava a resposta em 250 tokens de saída, proteção de custo. No relato da tela, a resposta veio em 250 ms. 250 ms é o tempo da resposta; 250 tokens é o teto do que o modelo pode escrever.

Com os fatos extraídos, o custo para o usuário ficou em menos de 4 centavos.

A escolha de modelo neste mesmo simulador está em escolher modelo pela persona. Aqui o recorte é o PDF no upload e os 2 ou 3 fatos na pergunta.

Thiago ouviu o relato e fechou:

Tá bom. me convenceu.

Extraia 1 vez e abra o payload da pergunta

Amanhã, se o seu fluxo aceita PDF, separe o upload da pergunta. No upload, extraia 10 a 20 fatos-chave e grave. Na pergunta, mande 2 ou 3. Abra o payload: se o PDF original ainda estiver lá, a extração única não rodou.

O vibe coding deste trecho é gravar o fato no upload e deixar o original de fora da pergunta. A tela da tabela zerada e o "me convenceu" estão na gravação. Vale assistir à live para ouvir a dúvida com a tabela vazia e a conta dos 600 a 900 tokens depois.