Relatório do 7º encontro, reconstruído inteiramente dos registros do servidor. Foram 30 participantes com 23 modelos diferentes rodando em notebooks na mesma sala, o World mais cheio de todos os encontros, duas rodadas de SVG e 716 votos, quase o dobro do encontro anterior. E, pela primeira vez, nenhuma geração se perdeu no caminho: 6 pessoas que caíram no meio do envio entraram na votação assim mesmo.
Tráfego HTTP no servidor central, das primeiras conexões até o último snapshot. Pico de 526 requisições por minuto e nenhum erro de limite de taxa, terceiro encontro seguido sem um único 429.
O elenco completo do dia, em ordem alfabética, com o modelo que cada um trouxe na mochila. São 30 pessoas e 23 modelos distintos: quase um modelo por participante, sem ninguém combinar nada antes.
qwen2.5-coder:3bqwen3.5:2bqwen3.5:2bqwen3-vl:8bqwen3-vl:4bgemma4:12bministral-3:8bgemma4:e2bgoogle/gemma-4-e4bllama3.2:3bgemma3:12Bqwen3.5:latestlfm2.5-texto:latestdeepseek-coder:latestdeepseek-coder:latestgemma4:31b-clouddeepseek-coder:latestqwen3.5:4bgemma3:4bgemma4:latestqwen3.5:0.8bqwen3.5:4bgemma4:e4bqwen3.5:4bhf.co/LiquidAI/LFM2.5-350M-GGUF:latestgranite4.1:3bgemma4:e2bgemma4:e4b-mlxhf.co/LiquidAI/LFM2.5-350M-GGUF:latestornith:latestO frame real do pico, às 11:03:39, com 20 agentes simultâneos no mapa. As posições, as falas e a comida são exatamente as que estavam lá: cada retrato vem dos snapshots que o servidor grava a cada cinco segundos.
Placar do mundo, contando apenas as comidas coletadas com o modelo decidindo. Como a partida nunca foi encerrada pelo painel, ele foi reconstruído a partir dos 1060 snapshots do dia. Campeão: guilhermy, com 118 comidas.
🎮 Por que este placar desconta o modo manual. O cliente do agente permite dirigir a criatura pelo teclado, sem o LLM, e existe para testar a conexão antes de a partida valer. 7 participantes o usaram em algum momento e estão marcados com 🎮. Como o clube compete para ver o que os modelos conseguem fazer, as comidas coletadas com o modo ligado saem da conta: no bruto o topo seria Cumaru com 139, dos quais cerca de 47 vieram no teclado. Nada foi escondido: o total sem desconto de cada participante aparece ao passar o mouse na barra. A medição é aproximada, porque o servidor fotografa o mundo de cinco em cinco segundos e guarda a última ação de cada agente, então o que existe é uma amostragem e não a contagem movimento a movimento.
Vale registrar que o critério não nasceu depois do jogo: ele foi anunciado durante a partida, com o placar ainda correndo no telão. "O pessoal que está andando manualmente aí, o relatório vai associar ao modelo ou ao modo manual? Se sair manual, eu vou de alguma forma balancear."
O prompt clássico do clube, pelo terceiro encontro seguido: "Crie o SVG de uma capivara dançando frevo". 21 gerações e 444 votos, a rodada mais votada da história do clube. O critério é a média das notas de 0 a 5, o mesmo que o telão revelou posição a posição.
O prompt desta rodada foi escrito ao vivo, a partir de uma sugestão da plateia: alguém pediu "a maior gambiarra possível", e a frase virou "crie um SVG e retorne uma tag <svg></svg> com o desenho de uma antena enfiada na lama com Chico Science do lado", com direito a "não alucine" e "use o potencial máximo do seu cerebelo" no fim. 16 gerações e 272 votos.
Todos os desenhos das duas rodadas, exatamente como saíram dos modelos, token a token, em notebooks nesta sala. Nada de recorte de pódio: se você gerou, está aqui.
Na Rodada 2, Farofa e Cumaru entregaram desenhos byte a byte idênticos: os mesmos 955 tokens, na mesma ordem, em notebooks diferentes.
| Participante | Modelo que gerou | tokens | tokens/s | 1º token |
|---|---|---|---|---|
| Farofa | qwen3.5:latest | 955 | 8.7 | 15.2 s |
| Cumaru | qwen3.5:9b | 955 | 7.3 | 20.7 s |
O fenômeno foi percebido na hora, no telão, enquanto os dois desenhos cresciam lado a lado: "modelo um mais lento que o outro, mas está desenhando igual, exatamente igual, deterministicamente. Isso é lindo. São dois modelos em computadores diferentes recebendo o mesmo prompt."
Não foi coincidência nem cola: é assim que um modelo de linguagem funciona. Gerar texto é aplicar uma função matemática, sempre a mesma, sobre os pesos do modelo e o que já foi escrito até ali. A cada passo o modelo calcula a probabilidade de cada token possível e escolhe um. Se duas máquinas partem exatamente das mesmas condições, elas percorrem o mesmo caminho e chegam à mesma resposta, token por token.
E as condições eram mesmo idênticas, porque a arena faz questão disso: quando a rodada começa, o servidor manda para todo mundo o mesmo prompt, a mesma temperatura (0.7) e a mesma semente aleatória (987874). A semente é o que transforma o sorteio do próximo token em algo repetível: mesma semente, mesmos sorteios. Faltava só a última peça, e ela estava escondida no nome: um dos dois cadastrou qwen3.5:latest e o outro qwen3.5:9b, que no Ollama são apelidos para o mesmo modelo, os mesmos pesos no disco.
Mesmos pesos, mesmo prompt, mesma temperatura, mesma semente. O resultado tinha que ser igual, e foi. O que a máquina muda é o relógio, não o desenho: repare na tabela acima que os dois levaram tempos bem diferentes para produzir exatamente os mesmos 955 tokens. Hardware define a velocidade da geração; o modelo e seus parâmetros definem o conteúdo.
Vale a inversão também, e ela explica o resto da galeria: como cada participante escolheu um modelo diferente, ninguém mais no encontro produziu nada parecido. É por isso que o clube junta modelos variados numa sala só. Se todos rodassem o mesmo modelo com os mesmos parâmetros, a votação seria entre desenhos idênticos, e não haveria encontro nenhum.
A melhor colocação que cada modelo alcançou em cada desafio, e quem o pilotava. Os desafios cobram coisas diferentes: o World exige decisão rápida em loop fechado, enquanto as rodadas de SVG pedem capricho visual.
| Modelo | 🌍 World | 🎨 R1 | 🎨 R2 |
|---|---|---|---|
llama3.2:3b | 🥇 Cumaru | 14º Cumaru | 🥇 Cumaru |
deepseek-coder:latest | — | 🥇 gaguinho | — |
qwen3.5:latest | 9º Farofa | 🥈 Farofa | 🥈 Farofa |
gemma4:e4b | 🥉 Minhaqui | — | 🥉 Minhaqui |
gemma3:4b | 🥈 guilhermy | 9º guilhermy | — |
gemma4:e4b-mlx | 11º Rev | 🥉 Rev | 13º Rev |
ornith:latest | 14º zordon | 4º zordon | — |
qwen3.5:4b | 16º millerzinho de … | 8º gelo bahiano | 4º gelo bahiano |
qwen3.5:2b | 4º Bielzinho | 5º Bielzinho | 5º Bielzinho |
qwen3.5:0.8b | 5º miilanez | 18º miilanez | 10º miilanez |
ministral-3:8b | 6º Carangueijo0 | 20º Carangueijo0 | 7º Carangueijo0 |
gemma4:12b | 12º bsc2 | 6º bsc2 | 8º bsc2 |
google/gemma-4-e4b | 15º clock | 13º clock | 6º clock |
gemma4:31b-cloud | 7º Gago | — | — |
gemma4:e2b | 10º Carangueijofit | 7º carangueijofit | 15º carangueijofit |
hf.co/LiquidAI/LFM2.5-350M-GGUF:latest | 8º shaolin_the_pig… | 19º porco_matador_d… | — |
qwen2.5-coder:3b | — | 17º Atrasado | 9º Atrasado |
gemma3:12B | 20º Fantasma | 10º Fantasma | — |
gemma4:latest | — | 11º Itinho | 16º Itinho |
granite4.1:3b | 19º pounela | 16º pounela | 12º pounela |
lfm2.5-texto:latest | 18º GabrielMS | — | — |
qwen3-vl:8b | — | 21º Bob Esponja | — |
Estes participantes geraram seus desenhos por inteiro, e o telão mostrou tudo, mas a conexão caiu antes do aviso de conclusão chegar ao servidor. Até o encontro passado, isso bastava para sumirem da votação. Desta vez o servidor foi buscar o texto no buffer e colocou cada um na urna.
| Participante | tokens recuperados |
|---|---|
| clock | 932 tokens |
| Onixyus | 891 tokens |
| bsc2 | 459 tokens |
| Fantasma | 411 tokens |
| Itinho | 1025 tokens |
| bsc2 | 488 tokens |
A plataforma guarda o aparelho de quem vota. O celular dominou a urna, como era de esperar de uma votação por QR code, mas apareceu bastante gente votando do próprio notebook onde o modelo estava rodando.
O que mudou de um encontro para o outro, medido pelos mesmos critérios:
| Métrica | 6º (11/07) | 7º (22/08) |
|---|---|---|
| Participantes | 26 | 30 |
| Modelos diferentes | 16 | 23 ✅ |
| Votos no dia | 367 | 716 ✅ |
| Votantes únicos | 14 | 22 ✅ |
| Pico de agentes no World | 17 | 20 ✅ |
| Comidas do campeão | 93 (Almir) | 118 (guilhermy) ✅ |
| Erros 429 (rate limit) | 0 | 0 ✅ |
| Gerações perdidas por queda | invisíveis na votação | 6 resgatadas ✅ |
Entre uma rodada e outra, o encontro vira aula. Estes trechos foram transcritos do áudio do dia e explicam justamente o que o site do clube não cobre: por que as métricas desta página são o que são, e por que os desafios têm a cara que têm.
Toda vez tem um benchmark novo, até porque os modelos começam a pegar o benchmark e usar como treinamento. A proposta de ser uma coisa para avaliar virou propriedade de treinamento: ele já sabe a resposta. Aqui a gente experimenta sem se preocupar com isso.
Foi uma brincadeira para fazer um benchmark de modelo, tirando onda com benchmark. Inspirado em Simon Willison, que fez um pelicano andando de bicicleta. Eu quis dar uma regionalizada.
Isso não é um modelo de geração de imagem, é um modelo de texto. Cada coisinha dessa é um pontinho na tela que ele está descrevendo. Quem desenha aquilo ali é o browser. O modelo precisa abstrair a estrutura da imagem sem nunca ver imagem nenhuma.
Quantizar é pegar um modelo que guarda cada peso em 16 bits e representar aquilo em 4 ou 8 bits. Você perde as nuances entre um ponto e outro, então ele vai tomando decisões piores no meio do caminho. A gente deixa o modelo mais rápido e cabendo na memória, mas o preço é a qualidade.
O tempo até o primeiro token é o tempo de carregar o modelo na memória. Às vezes demora 30 segundos, tem computador que demora um minuto, porque ele está transferindo do disco para a RAM ou para a VRAM. Quando não tem VRAM suficiente, fica fazendo swap, e o computador pode até travar.
Peguem modelos pequenos, até para ser mais engraçado. Modelo grande responde tudo certo: capital de Pernambuco, Recife. A graça é quando aparece Olinda, quando aparece Rio de Janeiro. E eu não digo qual modelo baixar, porque quero diversidade: se eu digo um, todo mundo baixa aquele e fica tudo igual.
gemma3:4b rodando no notebook dele. Levou o World no critério que interessa ao clube, o de deixar o modelo dirigir.llama3.2:3b e sem asterisco nenhum: 4.59 de média, a melhor do dia.deepseek-coder. Ganhou no capricho e na pressa./no_think, o comando que desliga o raciocínio passo a passo dos modelos Qwen. Menos deliberação, mais reflexo. Uma gambiarra de prompt no sentido mais puro do termo.