---
title: "We testten onze self-hosted LLMs en bouwden per ongeluk een game | Guardian360"
description: "Een one-shot prompt waarmee we elke self-hosted LLM testen, veranderde in Lighthouse Run, een browsergame. Waarom een vaste, herhaalbare test beter is dan een leveranciersdemo, waarom modelkeuze nu een securitybeslissing is, en wat engineers moeten doen terwijl AI-agents het typwerk doen."
url: https://guardian360.net/nl-be/blog/we-tested-our-self-hosted-llms-and-accidentally-built-a-game/
locale: en
source: guardian360.net
---
[← Alle posts](https://guardian360.net/nl-be/blog/)

Opinie

# We testten onze self-hosted LLMs en bouwden per ongeluk een game

Door Jan Martijn Broekhof · 1 oktober 2026

Het klinkt als het begin van een grap: een cybersecuritybedrijf wil zijn AI-modellen testen en houdt er een game aan over. Maar zo is het echt gegaan, en het roept een terechte vraag op die ik binnen een week na publicatie van deze blog van partners verwacht. Waarom bouw je een game terwijl je AI-agent nog niet af is?

Laat ik hem beantwoorden voordat iemand hem stelt. We waren helemaal geen game aan het bouwen. We testten large language models, en een game is wat eruit kwam.

Dat onderscheid doet meer ter zake dan het klinkt. De meeste MSPs en IT-leiders die ik spreek, worstelen met dezelfde vragen als wij: welke large language models kunnen we vertrouwen, moeten we ze zelf hosten, en wat moeten onze mensen doen terwijl AI-codeeragents het typwerk doen? Onze toevallige game, het bijproduct van een simpele one-shot prompttest, bleek een verrassend bruikbare bril op alle drie.

## Hoe werd een modeltest een game?

Onze Lead SRE heeft een standaardtest voor elk nieuw model. Hij geeft het één vaste prompt: bouw in één keer een compleet platformspel. Dit is one-shot prompting; één instructie, geen vervolgcorrecties, geen handje helpen. Hoe dicht een model erbij komt, zegt veel over zijn redeneervermogen, de kwaliteit van zijn code en zijn vermogen om een grote taak bij elkaar te houden. We draaien die test op de self-hosted open-source LLMs die we gebruiken, en omdat we die modellen regelmatig vervangen zodra er betere verschijnen, is een test die exact hetzelfde blijft meer waard dan welk leaderboard dan ook.

Deze keer ging hij verder. In plaats van te stoppen bij het one-shot-resultaat liet hij het model putten uit onze publieke website en de informatie die die blootgeeft via het Model Context Protocol (MCP), en vroeg hij het dat in de game te verweven. In zijsessies, terwijl andere AI-codeersessies liepen, groeide het experiment uit tot Lighthouse Run: zes levels en 24 zones vol verwijzingen naar onze sector, eindbazen, een scanrapport aan het eind van elk level en een semi-willekeurig gegenereerd Daily Scan-level dat elke dag verandert. De hele game zit in één op zichzelf staand HTML-bestand, en het project eromheen bevat tests zodat de AI zijn eigen wijzigingen kan draaien en verifiëren.

Ik heb een paar levels gespeeld. Ze zijn niet makkelijk, wat ik als compliment bedoel. Je kunt het proberen op [https://guardian360.net/lighthouse-run/](https://guardian360.net/lighthouse-run/); zet het geluid aan, en het werkt ook op een telefoon of met een controller.

## Waarom test je een LLM met een one-shot prompt?

Omdat onze indrukken van AI onbetrouwbaar zijn. In een onderzoek onder 349 technische medewerkers, gepubliceerd in mei 2026, vond METR dat deelnemers zelf een mediane verandering van 1,4 tot 2 keer in de waarde van hun werk door AI-tools rapporteerden, en een mediane snelheidsverandering van 3 keer. METR waarschuwt zelf om dat niet voor zoete koek aan te nemen: de studie uit begin 2025 liet zien dat mensen het effect van AI op hun tijdsbesteding aan taken gemiddeld met 40 procentpunten overschatten.

Als ervaren technische mensen de tools die ze elke dag gebruiken verkeerd inschatten, is een gelikte leveranciersdemo geen solide basis om een model te kiezen. Een vaste, herhaalbare prompt is grof, maar eerlijk. Dezelfde taak, elk model, resultaten naast elkaar. Een garage die elke auto op dezelfde route proefrijdt, leert meer dan een die op de brochure vertrouwt.

## Wat doen engineers terwijl AI-agents het typwerk doen?

Agent-gedreven werk is geen experiment meer. JetBrains’ 2026 Developer Ecosystem Survey onder meer dan 15.000 professionele ontwikkelaars vond dat per mei tot juli 2026 90% minstens wekelijks AI-codeeragents op het werk gebruikte, en 68% dagelijks.

Dat verandert de vorm van de werkdag van een engineer. Er wordt minder tijd aan typen besteed, meer aan instrueren, reviewen en wachten. METR liep hier tegenaan toen het zijn productiviteitsonderzoek wilde herhalen. Het zag een flinke toename van ontwikkelaars die niet meer wilden meedoen omdat ze niet zonder AI wilden werken, en vond dat zijn tijdmetingen onbetrouwbaar waren voor ontwikkelaars die meerdere AI-agents tegelijk gebruikten.

Zo werkt onze Lead SRE precies. Meerdere sessies lopen parallel, en er zitten gaten tussen terwijl elke sessie afrondt. Wat er in die gaten gebeurt, is een leiderschapsvraag. Je kunt doen alsof ze niet bestaan, ze vullen met meer van hetzelfde, of mensen ze laten gebruiken om ideeën te testen. Wij hebben een cultuur van snel prototypen: klein bouwen, snel testen, houden wat werkt en weggooien wat niet werkt. In die gaten worden hypothesen goedkoop getest.

## Waarom is modelkeuze een securitybeslissing?

Een AI-model kiezen is niet langer alleen een kwestie van capaciteit; het is een securityvraag. Veracode’s 2026 GenAI Code Security Report testte meer dan 100 modellen en vond dat ze gemiddeld op een securityslagingspercentage van 56% uitkwamen, nauwelijks veranderd ten opzichte van 2025, zelfs toen de syntaxslagingspercentages de 100% naderden. Modellen gericht op coderen waren niet veiliger dan algemene modellen. Veracode’s eigen conclusie is dat modelselectie stilletjes een securitybeslissing is geworden.

Voor een bedrijf dat in cybersecurity werkt, is daarmee de kous af. We kunnen modellen niet kiezen op reputatie of op benchmarks die hun makers publiceren. We moeten met eigen ogen zien hoe een model zich gedraagt op een substantiële taak, en dat is precies wat een one-shot test laat zien. Modellen zelf hosten geeft ons controle over waar onze data heengaat. En tests in het project bouwen betekent dat de AI zijn eigen werk kan controleren, in plaats van dat wij erop moeten vertrouwen. Zoals Veracode het stelt, moet AI-gegenereerde code behandeld worden als elke niet-gereviewde code.

## Wat kunnen MSPs en IT-leiders hieruit meenemen?

De eerste les is om te testen voordat je vertrouwt. Kies één substantiële, herhaalbare taak die jouw eigen werk weerspiegelt en laat elk model dat je overweegt erdoorheen gaan. Het hoeft geen game te zijn; het moet elke keer hetzelfde zijn.

De tweede is om AI-output als niet-gereviewde code te behandelen. Bouw verificatie in het proces, idealiter zo dat de AI tests tegen zijn eigen werk kan draaien, en houd een mens verantwoordelijk voor wat er in productie gaat.

De derde is om experimenteren grenzen te geven in plaats van het te verbieden. Klein, op zichzelf staand, in tijd afgebakend en met een helder doel. Binnen die grenzen is een onverwacht resultaat een welkome bonus in plaats van een zorgwekkende afleiding.

## Goede experimenten leveren meer op dan je zocht

We zochten een betrouwbaar antwoord op welke modellen we kunnen vertrouwen. Dat kregen we, plus een game waar we een tikje te trots op zijn. Probeer hem eens; er zitten een paar verborgen extra’s in voor wie weet waar te kijken, en voor wie zijn internetmemes kent.

En vertel me dan: hoe test jij de AI-modellen waar je team op vertrouwt voordat je ze vertrouwt?

## Bronnen

- JetBrains Research, [AI Coding Agents: Adoption Trends (Developer Ecosystem Survey 2026)](https://blog.jetbrains.com/research/2026/08/ai-coding-agent-adoption-2026/)
- METR, [Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity](https://metr.org/blog/2026-05-11-ai-usage-survey/)
- METR, [We are Changing our Developer Productivity Experiment Design](https://metr.org/blog/2026-02-24-uplift-update/)
- Veracode, [LLMs Are Getting Smarter, But Not Safer: 2026 GenAI Code Security Report](https://www.veracode.com/news/llms-are-getting-smarter-but-not-safer-veracode-2026-genai-code-security-report-finds-ai-generated-code-security-has-stalled-at-56%25-pass-rate/)
