VIBE IN PUBLIC_

RAG IA no vibe coding: você sobe o PDF, o agente só pergunta

O harness já comeu 12% da janela e as mensagens só 3%. No RAG IA do MP, você sobe o PDF no NotebookLM e o agente só pergunta e lê a citação.

No RAG IA dos autos do MP, você sobe o PDF no NotebookLM. O agente só pergunta e lê a citação. ia.de.gabinete abriu o usage da conversa: 12% da janela já estava gasto, e as mensagens sozinhas davam 3%.

No vibe coding do MP, o PDF de centenas de páginas fica no caderno. A resposta cita o trecho e a origem. A janela desta conversa, com o harness nesses 12%, ainda precisa desse espaço para investigar.

O harness já ocupou 12% da janela

A janela que ele mostra é de 1 milhão de tokens de contexto. System prompt, ferramentas, customização dos agentes, arquivos de memória e skills já estavam carregados. As mensagens da conversa, sozinhas, ocupavam 3%. Com o harness carregado, a janela já ia em 12%.

Ele já usou ã 12% da janela de contexto dele. Só essas perguntinhas que a gente tá fazendo aqui. [...] só essas mensagens foi 3%.

Se o harness estivesse limpo, o system prompt mais as mensagens de 3% dariam uns 5%. Com as skills e a memória que ele escolhe carregar, já está em 12%. Ele chama esse 12% de preço que gosta de pagar, e diz que o resultado fica melhor. Um PDF grande nessa janela obriga o modelo a ler o arquivo inteiro. Depois ainda entra investigação e minuta. Quase não sobra passo para essa investigação.

não é efetivo, não é não é bom jogar o PDF inteiro do processo aqui direto na LLM

O PDF que ele jogaria nesta conversa é o que vai para o NotebookLM.

O PDF

Direto na LLM

O modelo lê o arquivo inteiro. A janela já está em 12%. Depois ainda entra investigação e minuta

No caderno do NotebookLM

O agente só pergunta e lê a citação. O PDF de centenas de páginas fica no caderno

Em outra live ele mostrou como não jogar o PDF inteiro no modelo. O mesmo problema apareceu em ia alucina. Isso aparece também em prompt escrito por ia no vibe coding.

Você cria o caderno e manda o link

NotebookLM é o lugar dos autos digitalizados de cada procedimento. Ele pergunta ao caderno como a um assistente de pesquisa que já leu tudo. Ele leu a trava em voz alta, no harness:

Eu nunca crio o caderno e nem subo PDF nele. Você quem cria o caderno Notebook LM sobe os autos e me manda o link. Minha ferramenta só faz perguntas e lê as respostas.

A ferramenta pergunta ao NotebookLM via Python e traz a resposta sozinha. O agente lê as citações numeradas.

Os PDFs do MP vêm partidos. Se o agente sobe o caderno e deixa um pedaço de fora, some um trecho em que o procedimento inteiro teria que girar. Ele chama isso de alucinação que não está vendo. Vale ver como isso terminou em vibe coding para taxonomia lida em 500 decisoes e nao chutada. Foi o mesmo caminho de vibe coding para comparar dois acordaos lado a lado.

os eu costumo pegar os PDFs partido [...] se ele deixa de subir um um uma parte do PDF [...] acaba que vai contaminar todo o meu trabalho

QUEM SOBE

O agente cria o caderno

Os PDFs vêm partidos. Se falta 1 pedaço, some o trecho e contamina o trabalho

Você cria e manda o link

Sobe os autos. A ferramenta só pergunta e lê as respostas

Cada pergunta carrega o ID do caderno, para não misturar autos de um procedimento com outro. A skill de triagem puxa vários procedimentos de uma vez. Foi o mesmo caminho de canary release.

2 contadores no vibe coding da janela

Na mesma tela ele separa a janela desta conversa da cota do plano. A cota do plano de R$ 100 é o que cabe em 5 horas e na semana. A janela de 12% é só desta conversa.

eu tenho um plano de R$ 100. [...] são dois dois contadores diferentes. Aqui é o contexto do da conversa, dessa conversa específica que lá é o contador do seu plano todo.

O 12% e o 3% são desta conversa. Esta conversa puxa da janela, então cota no plano de R$ 100 não abre espaço no 12%.

O NotebookLM indexa o processo uma vez. Ele nomeia o risco de um detalhe enterrado na página 800. A pergunta pontual (qual foi o valor do dano apontado no laudo) devolve o trecho e a página. Na mesma live ele já tinha o modelo barato na execução e o caro na auditoria.

Amanhã, no vibe coding dos autos, crie o caderno no NotebookLM com todos os pedaços do PDF partido e mande o link. O agente pergunta e lê a citação.

Dá para assistir à live e ouvir o 12% da janela e a trava de quem cria o caderno.