Vibe coding para o modelo barato executar e o caro auditar
DeepSeek caiu de 63.000 para 3.800. Mimo ganhou 98% em 200 e executa as 10.769. Opus audita. Fable F pensa o plano, não roda as 10.000.
ia.de.gabinete fez o vibe coding para o modelo barato executar e o caro auditar num concurso cego: gabarito de 200 decisões, 2 juízes (Opus e GPT Sol) e 4 motores (DeepSeek Flash, Mimo, Gemini 3.7, Luna). Mimo 2.5 acertou 98% e ficou com a classificação das 10.769 decisões do Conselho Superior do Ministério Público de Goiás. Os 2% o revisor corrige. Opus audita a entrega, e o Fable F fica no plano porque mandar esse modelo nas 10.000 pediria 20 contas.
No MP, o arquivo vira acervo e playbook investigativo. O Cloud já tinha escrito o classificador em Python. Faltava um motor que aguentasse o lote sem quebrar o plano.
DeepSeek caiu de 63.000 para 3.800 na janela de 5 horas
O DeepSeek era o motor barato da janela de 5 horas. O plano cobria 63.000 requisições. Depois do reajuste, cobriu 3.800.
o que antes permitia 63.000 requisições a janela de 5 horas. Agora o plano só cobre [...] 3800. [...] tava parecendo token infinito, mas vamos aproveitar agora esse daqui que é o mimo, né, 2.5. [...] coloquei o Opus para auditar o que ele fez e aí ficou que a qualidade está impecável. Teve zero erros em 30
Ele também conta 63.300 na janela de 5 horas. Com o preço novo, 3.800. O Mimo ainda está em 30.000. Ontem ele usou bastante DeepSeek e comeu quase a metade do uso mensal. Isso aparece também em rag ia.
O classificador em Python passou a puxar o Mimo 2.5 no plano Open Code, no projeto do trabalho que ele faz todo dia. Ele esperava o barato lento, e o Mimo veio rápido. Ele tomou o zero erros em 30 como prova da auditoria do Opus.
O gabarito de 200 escolheu o Mimo com 98%
O DeepSeek Flash ainda entrou no teste porque o concurso foi antes do aumento. O gabarito de 200 teve Opus e GPT Sol de juiz, e os 4 motores classificaram o mesmo lote.
Aí eu rodei um teste de 200 decisões com dois juízes, eram um Opus e um GPT Sol. E e aí ele eu usei quatro modelos que era o Deepsic Flash [...] Um mimo, o Gemini 3.7 e o Luna. Ah, e por custo e pela qualidade entrega, Mimo ganhou e ele acertou 98%, teve esses 2% de erro que é corrigido pelo revisor.
Ele escolheu o Mimo pelo custo e pela qualidade da entrega. O lote inteiro das 10.769 vai nesse motor. O Fable F permanece no plano. Isso aparece também em vibe coding para taxonomia lida em 500 decisoes e nao chutada. Foi o mesmo caminho de vibe coding para comparar dois acordaos lado a lado.
Vibe coding com Fable F no plano e Mimo nas 10.769
Ele começa conversando com o Fable F, o modelo mais capaz, até achar o caminho e deixar o plano escrito. Esse plano vai para o GPT Sol, que ajusta detalhe até fechar. Só então começa a execução. O Fable F orquestra os outros, a qualidade continua sendo de Fable F, e o revisor aponta o erro de execução para o Mimo corrigir.
COMO FUNCIONA
- 01Fable F acha o caminho e deixa o plano escrito
- 02GPT Sol ajusta o detalhe até fechar
- 03Começa a execução. Fable F orquestra os outros
- 04O revisor aponta o erro de execução para o Mimo corrigir
Fica mais barato do que eu só mandar o Fable F. Pensa quanto que ia ficar, sabe? Fazer o Fable F rodar 10.000 decisões. É uma loucura. Ia precisar de 20 conta 20x.
São 10.769 execuções no dia a dia do MP. Se o lote sair errado, ele refaz tudo e o plano já foi. Fable F nas 10.000 pediria 20 contas. Ele deixou o Fable F no plano e mandou o Mimo nas 10.769. O mesmo problema apareceu em canary release.
O PLANO
Fable F nas 10.000
20 contas. Se o lote sair errado, refaz tudo e o plano já foi
Fable F no plano, Mimo no lote
Fable F no plano, Mimo nas 10.769. Sem as 20 contas
O padrão do caro no plano e do barato na execução também está no Fable IA. Aqui o recorte é o concurso de 200 e a auditoria nas 10.769. O hábito do revisor que aponta e não reescreve já estava em o revisor apontar o erro e não reescrever. Vale ver como isso terminou em o que e prd.
Amanhã, no vibe coding, faça o gabarito no barato e reserve o caro para o plano e a auditoria.
Dá para assistir à live e ouvir o 63.000 virar 3.800, o Mimo ganhar 98% em 200 e a conta das 20 contas para o Fable F rodar 10.000.