VIBE IN PUBLIC_

Vibe coding para benchmark com os seus prompts reais: 480 dos últimos 30 dias

Danilix pegou 480 prompts dos últimos 30 dias, fez 30 e rodou nas LLMs. Artificial Analysis ele trata como vestibular. Sonnet para uma tarefa, Opus para outra.

Danilix escolhe modelo com a própria fila. Ele pegou os 480 prompts dos últimos 30 dias, fez 30 a partir deles e rodou nas LLMs que tinha. Sonnet ficou numa tarefa, Opus noutra. Antes de trocar de modelo por um ranking de lab, o gesto que ele defende é esse lote.

A Artificial Analysis, nesta live, entra como ranking feito para ganhar ponto. O teste dele sai dos 480 prompts que ele já tinha escrito.

A Artificial Analysis publica teste feito para ganhar ponto

Ele fala em "a gente": o descrédito é do time. O objeto é o conjunto que a Artificial Analysis divulga.

a gente não acredita nos benchmark são divulgados pela Artificial Analysis, que a gente acredita que aqueles testes eles são feitos para ganhar ponto.

"Feitos para ganhar ponto" é a acusação que ele coloca em cima desses testes. Ele amarra o ganhar ponto a uma prova que o candidato já conhece.

tu estudar para um vestibular, tá ligado? Tu já sabe quais são as perguntas e respostas.

A prova do lab já tem pergunta e resposta. A fila dos últimos 30 dias é outro conjunto. Danilix mede o que ele mesmo pediu nesse período. A tarefa que ele manda amanhã está nesse histórico.

2 CONJUNTOS

Ranking do lab

Artificial Analysis feito para ganhar ponto, como vestibular

Lote dos seus 480

480 prompts dos últimos 30 dias. Fez 30 e rodou nas LLMs que tinha

O ranking continua existindo. Ele recusa usar esse número para escolher a LLM da próxima tarefa.

480 prompts dos últimos 30 dias viraram 30

Ele montou um lote menor a partir do histórico.

eu peguei os meus 480 prompts que eu tinha dos últimos 30 dias e baseado nesses eu fiz 30 prompts

480 é o que ele já tinha escrito nos últimos 30 dias. 30 é o lote que ele fez a partir daquele histórico. Ele rodou esses 30 nas LLMs disponíveis e ouviu qual modelo serve para cada tarefa. Os 30 saem dos 480. Os 2 números não se somam.

"Baseado nesses" é a ponte. Os 480 já existiam. Os 30 foram feitos em cima deles. A rodada que ele descreve usa o lote, não o ranking publicado.

Sonnet resolve uma tarefa, Opus resolve outra

O que ele trouxe da rodada é um modelo por tarefa.

a melhor LLM para fazer isso aqui é o Sonnet. A melhor LLM para fazer aquilo ali é o Opus

Sonnet fica no "isso aqui". Opus fica no "aquilo ali", no recorte que ele ouviu do lote. Uma tarefa ficou com Sonnet, outra ficou com Opus.

Ele ouviu as LLMs no lote que ele mesmo montou. A melhor LLM, nesta frase, é melhor para um pedido concreto. Trocar a tarefa troca o modelo.

Do lab ele citou um teste pelo nome curto.

SW2.1 É um teste de benchmark. Ninguém sabe sobre o que que é aquele teste de benchmark.

SW2.1 fica SW2.1. Ele não expandiu o nome. O teste existe, tem esse rótulo curto, e ele diz que ninguém sabe o que aquele teste mede. Esse número não escolhe o modelo da tarefa que está na fila dele. Se a unidade do teste é opaca, o ponto que o lab atribui não aponta para o "isso aqui" nem para o "aquilo ali".

O recorte do limite Claude é cravar o barato quando o agente sobe sozinho. Aqui a escolha começa nos seus prompts. Vale ver como isso terminou em como conseguir os primeiros clientes.

O benchmark IA do Thiago compara chaves no produto. O de Danilix é o lote que sai da sua própria história de prompts.

Vibe coding para benchmark com os seus prompts reais começa na sua fila

No vibe coding, o teste que ele defende começa na fila que você já escreveu.

Amanhã, antes de trocar de modelo por um número da Artificial Analysis, abra os prompts dos seus últimos 30 dias, monte um lote menor e rode nas LLMs que você tem. O modelo que fica é o que resolveu a sua tarefa.

AMANHÃ NO SEU LOTE

  1. 01Abra os prompts dos últimos 30 dias
  2. 02Monte um lote menor
  3. 03Rode nas LLMs que você tem

Dá para assistir à live e ouvir os 480, os 30 e o SW2.1.