---
title: "Testámos os nossos LLMs self-hosted e sem querer construímos um jogo | Guardian360"
description: "Um prompt one-shot que usamos para testar cada LLM self-hosted transformou-se no Lighthouse Run, um jogo de browser. Porque é que um teste fixo e repetível vale mais do que uma demo de fornecedor, porque é que a escolha do modelo é agora uma decisão de segurança, e o que devem os engenheiros fazer enquanto os agentes de IA fazem a escrita."
url: https://guardian360.net/pt/blog/we-tested-our-self-hosted-llms-and-accidentally-built-a-game/
locale: en
source: guardian360.net
---
[← Todos os artigos](https://guardian360.net/pt/blog/)

Opinião

# Testámos os nossos LLMs self-hosted e sem querer construímos um jogo

Por Jan Martijn Broekhof · 1 de outubro de 2026

Soa como o início de uma piada: uma empresa de cibersegurança decide testar os seus modelos de IA e acaba com um jogo. Mas foi mesmo isso que aconteceu, e levanta uma pergunta justa que espero ouvir dos parceiros na primeira semana depois deste blog ir para o ar. Porque é que estás a construir um jogo quando o teu agente de IA ainda não está pronto?

Deixa-me responder antes que alguém pergunte. Não estávamos de todo a construir um jogo. Estávamos a testar large language models, e um jogo foi o que saiu daí.

Essa distinção importa mais do que parece. A maioria dos MSPs e líderes de IT com quem falo está a debater-se com as mesmas perguntas que nós: em que large language models podemos confiar, devemos alojá-los nós próprios, e o que devem as nossas pessoas estar a fazer enquanto os agentes de código IA fazem a escrita? O nosso jogo acidental, o subproduto de um simples teste de prompting one-shot, acabou por ser uma lente surpreendentemente útil sobre as três perguntas.

## Como é que um teste de modelo se transformou num jogo?

O nosso Lead SRE tem um teste padrão para cada novo modelo. Dá-lhe um prompt fixo: construir um jogo de plataformas completo de uma só vez. Isto é prompting one-shot; uma instrução, sem correções de seguimento, sem orientação passo a passo. O quão perto um modelo chega diz muito sobre o seu raciocínio, a qualidade do seu código e a sua capacidade de manter uma tarefa grande coesa. Corremos esse teste nos LLMs open-source self-hosted que usamos e, como substituímos esses modelos regularmente à medida que surgem melhores, um teste que se mantém exatamente igual vale mais do que qualquer leaderboard.

Desta vez ele foi mais longe. Em vez de parar no resultado one-shot, deixou o modelo recorrer ao nosso site público e à informação que este expõe através do Model Context Protocol (MCP), e pediu-lhe que tecesse isso no jogo. Em sessões paralelas, enquanto outras sessões de código IA estavam a correr, a experiência cresceu até ao Lighthouse Run: seis níveis e 24 zonas cheias de referências ao nosso setor, bosses de fim, um relatório de scan no final de cada nível e um nível Daily Scan gerado de forma semi-aleatória que muda todos os dias. O jogo inteiro vive num único ficheiro HTML autónomo, e o projeto à sua volta inclui testes para que a IA possa correr e verificar as suas próprias alterações.

Joguei alguns níveis. Não são fáceis, o que digo como um elogio. Podes experimentá-lo em [https://guardian360.net/lighthouse-run/](https://guardian360.net/lighthouse-run/); sobe o som, e também funciona num telemóvel ou com um comando.

## Porquê testar um LLM com um prompt one-shot?

Porque as nossas impressões sobre IA não são fiáveis. Num inquérito a 349 trabalhadores técnicos publicado em maio de 2026, a METR verificou que os participantes autorrelataram uma mudança mediana de 1,4 a 2 vezes no valor do seu trabalho devido às ferramentas de IA, e uma mudança mediana de velocidade de 3 vezes. A própria METR avisa contra levar isso ao pé da letra: o seu estudo do início de 2025 concluiu que as pessoas sobrestimavam o efeito da IA no tempo gasto em tarefas em 40 pontos percentuais em média.

Se pessoas técnicas experientes se enganam sobre as ferramentas que usam todos os dias, uma demo polida de um fornecedor não é uma base sólida para escolher um modelo. Um prompt fixo e repetível é rudimentar, mas é honesto. A mesma tarefa, cada modelo, resultados lado a lado. Uma oficina que faz um test-drive a cada carro no mesmo percurso aprende mais do que uma que se fia na brochura.

## O que fazem os engenheiros enquanto os agentes de IA fazem a escrita?

O trabalho conduzido por agentes já não é uma experiência. O Developer Ecosystem Survey 2026 da JetBrains, a mais de 15.000 programadores profissionais, concluiu que, em maio a julho de 2026, 90% usavam agentes de código IA no trabalho pelo menos semanalmente, e 68% usavam-nos diariamente.

Isso muda a forma do dia de um engenheiro. Gasta-se menos tempo a escrever, mais a instruir, rever e esperar. A METR deparou-se com isto quando tentou repetir a sua investigação sobre produtividade. Viu um aumento significativo de programadores que optaram por não participar porque não queriam trabalhar sem IA, e concluiu que as suas medições de tempo não eram fiáveis para programadores que usam múltiplos agentes de IA em simultâneo.

É exatamente assim que o nosso Lead SRE trabalha. Várias sessões correm em paralelo, e há intervalos enquanto cada uma termina. O que acontece nesses intervalos é uma questão de liderança. Podes fingir que não existem, enchê-los com mais do mesmo, ou deixar as pessoas usá-los para testar ideias. Temos uma cultura de prototipagem rápida: construir pequeno, testar depressa, guardar o que funciona e deitar fora o que não funciona. Esses intervalos são onde as hipóteses são testadas a baixo custo.

## Porque é que a escolha do modelo é uma decisão de segurança?

Escolher um modelo de IA já não é só uma questão de capacidade; é uma questão de segurança. O 2026 GenAI Code Security Report da Veracode testou mais de 100 modelos e verificou que estes tinham, em média, uma taxa de aprovação de segurança de 56%, pouco diferente de 2025, mesmo com as taxas de aprovação de sintaxe a aproximarem-se dos 100%. Os modelos focados em código não eram mais seguros do que os de uso geral. A própria conclusão da Veracode é que a seleção de modelo se tornou discretamente uma decisão de segurança.

Para uma empresa que trabalha em cibersegurança, isto resolve a questão. Não podemos escolher modelos pela reputação nem por benchmarks publicados pelos seus criadores. Precisamos de ver por nós próprios como um modelo se comporta numa tarefa substancial, que é precisamente o que um teste one-shot mostra. Alojar os modelos nós próprios dá-nos controlo sobre para onde vão os nossos dados. E incorporar testes no projeto significa que a IA pode verificar o seu próprio trabalho, em vez de termos de confiar nela. Como diz a Veracode, o código gerado por IA deve ser tratado como qualquer código não revisto.

## O que podem os MSPs e líderes de IT retirar disto?

A primeira lição é testar antes de confiar. Escolhe uma tarefa substancial e repetível que reflita o teu próprio trabalho e faz passar por ela cada modelo que consideres. Não precisa de ser um jogo; precisa de ser igual todas as vezes.

A segunda é tratar o output da IA como código não revisto. Incorpora verificação no processo, idealmente para que a IA possa correr testes contra o seu próprio trabalho, e mantém uma pessoa responsável pelo que vai para produção.

A terceira é dar limites à experimentação em vez de a proibir. Pequena, autónoma, com tempo definido e com um propósito claro. Dentro desses limites, um resultado inesperado é um bónus bem-vindo em vez de uma distração preocupante.

## As boas experiências dão mais do que aquilo que procuravas

Procurávamos uma resposta fiável sobre que modelos podemos confiar. Conseguimos isso, e um jogo de que estamos ligeiramente orgulhosos de mais. Experimenta; há alguns extras escondidos para quem sabe onde procurar, e para quem conhece os memes da internet.

E depois diz-me: como é que testas os modelos de IA em que a tua equipa se apoia antes de confiares neles?

## Fontes

- JetBrains Research, [AI Coding Agents: Adoption Trends (Developer Ecosystem Survey 2026)](https://blog.jetbrains.com/research/2026/08/ai-coding-agent-adoption-2026/)
- METR, [Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity](https://metr.org/blog/2026-05-11-ai-usage-survey/)
- METR, [We are Changing our Developer Productivity Experiment Design](https://metr.org/blog/2026-02-24-uplift-update/)
- Veracode, [LLMs Are Getting Smarter, But Not Safer: 2026 GenAI Code Security Report](https://www.veracode.com/news/llms-are-getting-smarter-but-not-safer-veracode-2026-genai-code-security-report-finds-ai-generated-code-security-has-stalled-at-56%25-pass-rate/)
