---
title: "Abbiamo testato i nostri LLM self-hosted e senza volerlo abbiamo creato un gioco | Guardian360"
description: "Un prompt one-shot che usiamo per testare ogni LLM self-hosted si è trasformato in Lighthouse Run, un gioco per browser. Perché un test fisso e ripetibile batte una demo di un fornitore, perché la scelta del modello è ormai una decisione di sicurezza, e cosa dovrebbero fare gli ingegneri mentre gli agenti IA scrivono il codice."
url: https://guardian360.net/it/blog/we-tested-our-self-hosted-llms-and-accidentally-built-a-game/
locale: en
source: guardian360.net
---
[← Tutti i post](https://guardian360.net/it/blog/)

Opinione

# Abbiamo testato i nostri LLM self-hosted e senza volerlo abbiamo creato un gioco

Di Jan Martijn Broekhof · 1 ottobre 2026

Sembra l’inizio di una barzelletta: un’azienda di cybersecurity si mette a testare i suoi modelli IA e finisce con un gioco. Ma è davvero quello che è successo, e solleva una domanda legittima che mi aspetto dai partner entro una settimana dall’uscita di questo blog. Perché state costruendo un gioco quando il vostro agente IA non è ancora finito?

Lascia che risponda prima che qualcuno lo chieda. Non stavamo affatto costruendo un gioco. Stavamo testando dei large language model, e un gioco è ciò che ne è uscito.

Questa distinzione conta più di quanto sembri. La maggior parte degli MSP e dei responsabili IT con cui parlo si sta facendo le nostre stesse domande: di quali large language model possiamo fidarci, dovremmo ospitarli noi stessi, e cosa dovrebbero fare le nostre persone mentre gli agenti di coding IA scrivono il codice? Il nostro gioco accidentale, sottoprodotto di un semplice test di prompting one-shot, si è rivelato una lente sorprendentemente utile su tutti e tre i fronti.

## Come si è trasformato il test di un modello in un gioco?

Il nostro Lead SRE ha un test standard per ogni nuovo modello. Gli dà un unico prompt fisso: costruisci un gioco a piattaforme completo in una sola volta. Questo è il prompting one-shot; una sola istruzione, nessuna correzione successiva, nessun accompagnamento. Quanto ci si avvicina un modello ti dice moltissimo sul suo ragionamento, sulla qualità del suo codice e sulla sua capacità di tenere insieme un compito ampio. Eseguiamo quel test sugli LLM open-source self-hosted che usiamo, e poiché sostituiamo quei modelli regolarmente man mano che ne compaiono di migliori, un test che resta esattamente lo stesso vale più di qualsiasi classifica.

Questa volta è andato oltre. Invece di fermarsi al risultato one-shot, ha lasciato che il modello attingesse al nostro sito web pubblico e alle informazioni che espone attraverso il Model Context Protocol (MCP), e gli ha chiesto di intrecciare quel materiale nel gioco. In sessioni collaterali, mentre altre sessioni di coding IA erano in esecuzione, l’esperimento è cresciuto fino a diventare Lighthouse Run: sei livelli e 24 zone piene di riferimenti al nostro settore, boss finali, un report di scansione alla fine di ogni livello e un livello Daily Scan generato in modo semi-casuale che cambia ogni giorno. L’intero gioco vive in un unico file HTML autonomo, e il progetto che lo circonda include test così che l’IA possa eseguire e verificare le proprie modifiche.

Ho giocato qualche livello. Non sono facili, e lo intendo come un complimento. Puoi provarlo su [https://guardian360.net/lighthouse-run/](https://guardian360.net/lighthouse-run/); alza il volume, e funziona anche su un telefono o con un controller.

## Perché testare un LLM con un prompt one-shot?

Perché le nostre impressioni sull’IA sono inaffidabili. In un sondaggio su 349 lavoratori tecnici pubblicato a maggio 2026, METR ha rilevato che i partecipanti riferivano autonomamente una variazione mediana da 1,4 a 2 volte nel valore del proprio lavoro grazie agli strumenti IA, e una variazione mediana di velocità di 3 volte. METR stessa mette in guardia dal prenderlo per buono: il suo studio di inizio 2025 ha rilevato che le persone sovrastimavano l’effetto dell’IA sul tempo impiegato nei compiti di 40 punti percentuali in media.

Se persone tecniche esperte giudicano male gli strumenti che usano ogni giorno, una demo rifinita di un fornitore non è una base solida per scegliere un modello. Un prompt fisso e ripetibile è rozzo, ma è onesto. Stesso compito, ogni modello, risultati affiancati. Un’officina che prova su strada ogni auto sullo stesso percorso impara più di una che si affida alla brochure.

## Cosa fanno gli ingegneri mentre gli agenti IA scrivono il codice?

Il lavoro guidato dagli agenti non è più un esperimento. Il Developer Ecosystem Survey 2026 di JetBrains, condotto su oltre 15.000 sviluppatori professionisti, ha rilevato che, a maggio-luglio 2026, il 90% usava agenti di coding IA al lavoro almeno settimanalmente, e il 68% li usava quotidianamente.

Questo cambia la forma della giornata di un ingegnere. Si passa meno tempo a scrivere e più tempo a istruire, revisionare e attendere. METR si è imbattuta in questo quando ha provato a ripetere la sua ricerca sulla produttività. Ha osservato un aumento significativo di sviluppatori che sceglievano di non partecipare perché non volevano lavorare senza IA, e ha scoperto che le sue misurazioni del tempo erano inaffidabili per gli sviluppatori che usavano più agenti IA contemporaneamente.

È esattamente così che lavora il nostro Lead SRE. Diverse sessioni girano in parallelo, e ci sono pause mentre ciascuna si completa. Cosa succede in quelle pause è una questione di leadership. Puoi fingere che non esistano, riempirle con altro dello stesso, o lasciare che le persone le usino per testare idee. Abbiamo una cultura della prototipazione rapida: costruisci in piccolo, testa in fretta, tieni ciò che funziona e scarta ciò che non funziona. Quelle pause sono il luogo in cui le ipotesi si testano a basso costo.

## Perché la scelta del modello è una decisione di sicurezza?

Scegliere un modello IA non è più soltanto una questione di capacità; è una questione di sicurezza. Il GenAI Code Security Report 2026 di Veracode ha testato più di 100 modelli e ha rilevato che in media raggiungevano un tasso di superamento in sicurezza del 56%, poco cambiato rispetto al 2025, anche se i tassi di superamento sulla sintassi si avvicinavano al 100%. I modelli orientati al coding non erano più sicuri di quelli generalisti. La conclusione di Veracode è che la selezione del modello è silenziosamente diventata una decisione di sicurezza.

Per un’azienda che lavora nella cybersecurity, questo chiude la questione. Non possiamo scegliere i modelli sulla base della reputazione o dei benchmark pubblicati dai loro creatori. Dobbiamo vedere con i nostri occhi come si comporta un modello su un compito sostanzioso, che è esattamente ciò che un test one-shot mostra. Ospitare i modelli noi stessi ci dà il controllo su dove vanno i nostri dati. E integrare i test nel progetto significa che l’IA può verificare il proprio lavoro, invece di doverci fidare. Come dice Veracode, il codice generato dall’IA dovrebbe essere trattato come qualsiasi codice non revisionato.

## Cosa possono trarne MSP e responsabili IT?

La prima lezione è testare prima di fidarsi. Scegli un compito sostanzioso e ripetibile che rifletta il tuo lavoro ed esegui attraverso di esso ogni modello che consideri. Non serve che sia un gioco; serve che sia lo stesso ogni volta.

La seconda è trattare l’output dell’IA come codice non revisionato. Integra la verifica nel processo, idealmente così che l’IA possa eseguire test sul proprio lavoro, e tieni una persona responsabile di ciò che va in produzione.

La terza è dare dei confini alla sperimentazione invece di vietarla. Piccola, autonoma, limitata nel tempo e con uno scopo chiaro. Entro quei confini, un risultato inatteso è un bonus gradito invece che una distrazione preoccupante.

## I buoni esperimenti danno più di quello che cercavi

Cercavamo una risposta affidabile su quali modelli possiamo fidarci. L’abbiamo ottenuta, insieme a un gioco di cui siamo un po’ troppo orgogliosi. Provalo; ci sono alcuni extra nascosti per chi sa dove guardare, e per chi conosce i propri meme di internet.

E poi dimmi: come testi i modelli IA su cui il tuo team fa affidamento prima di fidartene?

## Fonti

- JetBrains Research, [AI Coding Agents: Adoption Trends (Developer Ecosystem Survey 2026)](https://blog.jetbrains.com/research/2026/08/ai-coding-agent-adoption-2026/)
- METR, [Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity](https://metr.org/blog/2026-05-11-ai-usage-survey/)
- METR, [We are Changing our Developer Productivity Experiment Design](https://metr.org/blog/2026-02-24-uplift-update/)
- Veracode, [LLMs Are Getting Smarter, But Not Safer: 2026 GenAI Code Security Report](https://www.veracode.com/news/llms-are-getting-smarter-but-not-safer-veracode-2026-genai-code-security-report-finds-ai-generated-code-security-has-stalled-at-56%25-pass-rate/)
