RAG IA no vibe coding: você sobe o PDF, o agente só pergunta
O harness já comeu 12% da janela e as mensagens só 3%. No RAG IA do MP, você sobe o PDF no NotebookLM e o agente só pergunta e lê a citação.
No RAG IA dos autos do MP, você sobe o PDF no NotebookLM. O agente só pergunta e lê a citação. ia.de.gabinete abriu o usage da conversa: 12% da janela já estava gasto, e as mensagens sozinhas davam 3%.
No vibe coding do MP, o PDF de centenas de páginas fica no caderno. A resposta cita o trecho e a origem. A janela desta conversa, com o harness nesses 12%, ainda precisa desse espaço para investigar.
O harness já ocupou 12% da janela
A janela que ele mostra é de 1 milhão de tokens de contexto. System prompt, ferramentas, customização dos agentes, arquivos de memória e skills já estavam carregados. As mensagens da conversa, sozinhas, ocupavam 3%. Com o harness carregado, a janela já ia em 12%.
Ele já usou ã 12% da janela de contexto dele. Só essas perguntinhas que a gente tá fazendo aqui. [...] só essas mensagens foi 3%.
Se o harness estivesse limpo, o system prompt mais as mensagens de 3% dariam uns 5%. Com as skills e a memória que ele escolhe carregar, já está em 12%. Ele chama esse 12% de preço que gosta de pagar, e diz que o resultado fica melhor. Um PDF grande nessa janela obriga o modelo a ler o arquivo inteiro. Depois ainda entra investigação e minuta. Quase não sobra passo para essa investigação.
não é efetivo, não é não é bom jogar o PDF inteiro do processo aqui direto na LLM
O PDF que ele jogaria nesta conversa é o que vai para o NotebookLM.
O PDF
Direto na LLM
O modelo lê o arquivo inteiro. A janela já está em 12%. Depois ainda entra investigação e minuta
No caderno do NotebookLM
O agente só pergunta e lê a citação. O PDF de centenas de páginas fica no caderno
Em outra live ele mostrou como não jogar o PDF inteiro no modelo. O mesmo problema apareceu em ia alucina. Isso aparece também em prompt escrito por ia no vibe coding.
Você cria o caderno e manda o link
NotebookLM é o lugar dos autos digitalizados de cada procedimento. Ele pergunta ao caderno como a um assistente de pesquisa que já leu tudo. Ele leu a trava em voz alta, no harness:
Eu nunca crio o caderno e nem subo PDF nele. Você quem cria o caderno Notebook LM sobe os autos e me manda o link. Minha ferramenta só faz perguntas e lê as respostas.
A ferramenta pergunta ao NotebookLM via Python e traz a resposta sozinha. O agente lê as citações numeradas.
Os PDFs do MP vêm partidos. Se o agente sobe o caderno e deixa um pedaço de fora, some um trecho em que o procedimento inteiro teria que girar. Ele chama isso de alucinação que não está vendo. Vale ver como isso terminou em vibe coding para taxonomia lida em 500 decisoes e nao chutada. Foi o mesmo caminho de vibe coding para comparar dois acordaos lado a lado.
os eu costumo pegar os PDFs partido [...] se ele deixa de subir um um uma parte do PDF [...] acaba que vai contaminar todo o meu trabalho
QUEM SOBE
O agente cria o caderno
Os PDFs vêm partidos. Se falta 1 pedaço, some o trecho e contamina o trabalho
Você cria e manda o link
Sobe os autos. A ferramenta só pergunta e lê as respostas
Cada pergunta carrega o ID do caderno, para não misturar autos de um procedimento com outro. A skill de triagem puxa vários procedimentos de uma vez. Foi o mesmo caminho de canary release.
2 contadores no vibe coding da janela
Na mesma tela ele separa a janela desta conversa da cota do plano. A cota do plano de R$ 100 é o que cabe em 5 horas e na semana. A janela de 12% é só desta conversa.
eu tenho um plano de R$ 100. [...] são dois dois contadores diferentes. Aqui é o contexto do da conversa, dessa conversa específica que lá é o contador do seu plano todo.
O 12% e o 3% são desta conversa. Esta conversa puxa da janela, então cota no plano de R$ 100 não abre espaço no 12%.
O NotebookLM indexa o processo uma vez. Ele nomeia o risco de um detalhe enterrado na página 800. A pergunta pontual (qual foi o valor do dano apontado no laudo) devolve o trecho e a página. Na mesma live ele já tinha o modelo barato na execução e o caro na auditoria.
Amanhã, no vibe coding dos autos, crie o caderno no NotebookLM com todos os pedaços do PDF partido e mande o link. O agente pergunta e lê a citação.
Dá para assistir à live e ouvir o 12% da janela e a trava de quem cria o caderno.