Benchmark de IA no vibe coding: plante 8 a 10 defeitos na peça aprovada
ia.de.gabinete abriu o leaderboard e plantou 8 a 10 defeitos numa peça aprovada. Sonet 10/10 no T1, o mais rápido. Tempo total das 5 provas: 23 min contra 47 min do Luna.
ia.de.gabinete abriu o LLM Leaderboard na live de 100 min e leu o que a arena premiava naquele momento: escrita criativa com Fable 5, código com 4.6 high, instrução com Opus 4.6 high. A tabela pontua tarefas que ele não vai repetir na peça de arquivamento. No vibe coding, o benchmark de IA que escolhe modelo começa numa minuta já aprovada: você planta 8 a 10 defeitos que só o juiz conhece, manda o mesmo briefing para cada modelo e conta quantos defeitos reais o modelo acha e quantos inventa.
O acervo já tem gabarito: 37 análises e 15 peças em minuta.
A arena mede o que ele não vai usar na peça
Ele ainda tinha o leaderboard na tela quando falou:
Só que eu não conheço as métricas deles, não sei que que eles dão para medir. Muuit das vezes o que eles usam lá vai ser uma coisa que eu não vou usar. Então o melhor jeito de fazer isso é medindo nas minhas tarefas do dia a dia aqui.
A arena pontua escrita criativa, código e instrução. A tarefa dele é a peça de arquivamento do dia a dia. Como ele não conhece as métricas da tabela e não vai usar o que medem lá, a medição entra no acervo que já passou.
Pensei em partir do que você produz no dia a dia, que já existe provado no acervo. 37 análise, 15 peças em minutas feitas. E o critério, cada peste, cada teste precisa ter um padrão ouro verificável, a peça barra análise real aprovada ou métrica objetiva, senão o juiz vira opinião.
O T1 planta 8 a 10 defeitos que só o juiz conhece
O protocolo usa uma peça de arquivamento já aprovada. Ele insere 8 a 10 defeitos conhecidos só por quem vai medir o recall. Os tipos que ditou: movimento truncado, artigo errado, valor alterado, jurisprudência alterada, quebra de voz. Cada modelo recebe o briefing idêntico e revisa.
Ele pega uma peça de arquivamento que já foi aprovada, ele planta de 8 a 10 defeitos conhecidos só pelo juiz. Movimento truncado, artigo errado, valor alterado, citação de jurisprudência literada alterada, quebra de voz suficiente e cada modelo revisa. A métrica dura: recal e precisão. Quantos defeitos reais achou? Quantos falsos alarmes inventou?
A métrica que ele cobra é essa conta, na peça, com os 8 a 10 que só o juiz conhece.
:::comparacao rotulo: O TESTE titulo_a: Leaderboard texto_a: Escrita criativa, código e instrução. Ele não vai usar na peça titulo_b: Peça aprovada texto_b: 8 a 10 defeitos que só o juiz conhece. Quantos achou, quantos inventou ::: Foi o mesmo caminho de [jurimetria o que é](/jurimetria-o-que-e).
DeepSeek travou e saiu da rodada. Ficaram Sonet, Gemini e Luna, com o mesmo briefing.
Vibe coding escolhe o modelo no recall da peça
Na caça-defeitos, os 3 acharam os 10. O Sonet fez 10/10 sem falso alarme. No T1 o Sonet foi o mais rápido. No tempo total de execução das 5 provas, 23 min contra 47 min do Luna. O Luna também achou os 10 e somou 8 críticas de mérito extras. Ele conferiu se os 10 do Sonet eram os certos:
Foi o mais rápido. Eu achei que seria o Geminai. Olha só. Ele achou 10, ó. Exatamente. Vamos ver se são os 10 certos. Sonet é bom. Sonet é bom. Entregou.
O Gemini afirmou dado ausente nas fontes com confiança alta e comitou 3 vezes contra ordem explícita. Ele deixou o modelo na extração. Mérito sem revisão humana ficou fora do papel.
No Python, todos acertaram 100%, e o Sonet foi o mais rápido de novo.
O juiz da rodada era Fable 5 avaliando o Sonet.
Limitação. O juiz é Cláudia avaliando Sonet. Até mas eu não tinha outro para para avaliar. Então, mas é o Fabon, né?
Ele não tinha outro modelo para avaliar o Sonet, então o juiz ficou no Fable 5. Os 8 a 10 defeitos plantados continuam sendo a lista que só ele conhece.
O roteamento que o placar autorizou
Com o placar na mesa, o roteamento que ele aceitou foi Sonet no papel de executor, Luna Max como challenger, Gemini só na extração. Ele já tinha mandado o modelo barato executar e o caro auditar. Nesta live o critério do roteamento saiu dos 8 a 10 defeitos plantados na peça aprovada.
Amanhã você pega uma minuta que já assinou, planta 8 a 10 defeitos que só você conhece e copia o briefing. Conta quantos cada modelo acha e quantos inventa. O roteamento sai desse número.
Quem quiser o momento em que ele lê o leaderboard, descreve o T1 e fecha o roteamento pode assistir à live de 100 min. Medir o modelo na sua tarefa, com gabarito seu, é o jeito do vibe coding quando você precisa escolher quem executa, quem desafia e quem só extrai.