---
title: "Testowaliśmy nasze samodzielnie hostowane modele LLM i przypadkiem zbudowaliśmy grę | Guardian360"
description: "Prompt typu one-shot, którym testujemy każdy samodzielnie hostowany model LLM, zmienił się w Lighthouse Run, grę przeglądarkową. Dlaczego stały, powtarzalny test bije prezentację dostawcy, dlaczego wybór modelu stał się decyzją dotyczącą bezpieczeństwa i co powinni robić inżynierowie, podczas gdy agenci AI piszą kod."
url: https://guardian360.net/pl/blog/we-tested-our-self-hosted-llms-and-accidentally-built-a-game/
locale: en
source: guardian360.net
---
[← Wszystkie wpisy](https://guardian360.net/pl/blog/)

Opinia

# Testowaliśmy nasze samodzielnie hostowane modele LLM i przypadkiem zbudowaliśmy grę

Autor Jan Martijn Broekhof · 1 października 2026

To brzmi jak początek dowcipu: firma z branży cyberbezpieczeństwa postanawia przetestować swoje modele AI, a kończy z grą. Ale tak właśnie się stało i rodzi to uzasadnione pytanie, którego spodziewam się od partnerów w ciągu tygodnia od publikacji tego wpisu. Dlaczego budujecie grę, skoro wasz agent AI nie jest jeszcze gotowy?

Pozwolą Państwo, że odpowiem na nie, zanim ktokolwiek je zada. Wcale nie budowaliśmy gry. Testowaliśmy duże modele językowe, a gra jest tym, co z tego wyszło.

To rozróżnienie ma większe znaczenie, niż się wydaje. Większość dostawców usług zarządzanych (MSP) i liderów IT, z którymi rozmawiam, zmaga się z tymi samymi pytaniami co my: którym dużym modelom językowym możemy zaufać, czy powinniśmy hostować je samodzielnie i co nasi ludzie powinni robić, podczas gdy agenci kodujący AI piszą kod. Nasza przypadkowa gra, produkt uboczny prostego testu promptu typu one-shot, okazała się zaskakująco użytecznym pryzmatem dla wszystkich trzech kwestii.

## Jak test modelu zmienił się w grę?

Nasz Lead SRE ma standardowy test dla każdego nowego modelu. Daje mu jeden stały prompt: zbuduj kompletną grę platformową za jednym razem. To prompting typu one-shot; jedna instrukcja, bez kolejnych korekt, bez prowadzenia za rękę. To, jak blisko celu dociera model, mówi bardzo wiele o jego zdolności rozumowania, o jakości jego kodu i o jego umiejętności utrzymania w całości dużego zadania. Przeprowadzamy ten test na samodzielnie hostowanych modelach LLM o otwartym kodzie źródłowym, z których korzystamy, a ponieważ regularnie wymieniamy te modele, gdy pojawiają się lepsze, test, który pozostaje dokładnie taki sam, jest wart więcej niż jakikolwiek ranking.

Tym razem poszedł dalej. Zamiast zatrzymać się na wyniku one-shot, pozwolił modelowi skorzystać z naszej publicznej strony internetowej oraz informacji, które udostępnia ona poprzez Model Context Protocol (MCP), i poprosił go o wplecenie tego w grę. W sesjach pobocznych, podczas gdy trwały inne sesje kodowania AI, eksperyment rozrósł się do Lighthouse Run: sześć poziomów i 24 strefy pełne odniesień do naszej branży, bossowie końcowi, raport ze skanu na końcu każdego poziomu oraz generowany częściowo losowo poziom Daily Scan, który zmienia się każdego dnia. Cała gra mieści się w jednym samodzielnym pliku HTML, a projekt wokół niej zawiera testy, dzięki czemu AI może uruchamiać i weryfikować własne zmiany.

Zagrałem w kilka poziomów. Nie są łatwe, co mówię jako komplement. Mogą Państwo spróbować pod adresem [https://guardian360.net/lighthouse-run/](https://guardian360.net/lighthouse-run/); proszę podgłośnić dźwięk, działa też na telefonie lub z kontrolerem.

## Dlaczego testować model LLM promptem typu one-shot?

Ponieważ nasze wrażenia na temat AI są zawodne. W badaniu 349 pracowników technicznych opublikowanym w maju 2026 roku METR stwierdził, że uczestnicy sami zgłaszali medianę zmiany wartości swojej pracy dzięki narzędziom AI od 1,4 do 2 razy oraz medianę zmiany tempa 3 razy. Sam METR przestrzega przed przyjmowaniem tego za dobrą monetę: jego badanie z początku 2025 roku wykazało, że ludzie przeceniali wpływ AI na czas poświęcany zadaniom średnio o 40 punktów procentowych.

Jeśli doświadczeni specjaliści techniczni błędnie oceniają narzędzia, których używają na co dzień, dopracowana prezentacja dostawcy nie jest solidną podstawą do wyboru modelu. Stały, powtarzalny prompt jest prymitywny, ale uczciwy. To samo zadanie, każdy model, wyniki obok siebie. Warsztat, który testuje każdy samochód na tej samej trasie, dowie się więcej niż ten, który polega na folderze reklamowym.

## Co robią inżynierowie, podczas gdy agenci AI piszą kod?

Praca sterowana przez agentów nie jest już eksperymentem. Przeprowadzone przez JetBrains badanie Developer Ecosystem Survey 2026 wśród ponad 15 000 profesjonalnych programistów wykazało, że według stanu na okres od maja do lipca 2026 roku 90% korzystało z agentów kodujących AI w pracy co najmniej raz w tygodniu, a 68% korzystało z nich codziennie.

To zmienia kształt dnia inżyniera. Mniej czasu poświęca się na pisanie kodu, więcej na instruowanie, przeglądanie i czekanie. METR natknął się na to, gdy próbował powtórzyć swoje badanie nad produktywnością. Zaobserwował znaczący wzrost liczby programistów, którzy decydowali się nie brać udziału, ponieważ nie chcieli pracować bez AI, i stwierdził, że jego pomiary czasu były zawodne w przypadku programistów korzystających jednocześnie z wielu agentów AI.

Dokładnie tak pracuje nasz Lead SRE. Kilka sesji działa równolegle i powstają przerwy, gdy każda z nich się kończy. To, co dzieje się w tych przerwach, jest kwestią przywództwa. Można udawać, że nie istnieją, wypełnić je większą ilością tego samego albo pozwolić ludziom wykorzystać je do testowania pomysłów. Mamy kulturę szybkiego prototypowania: buduj w małej skali, testuj szybko, zatrzymaj to, co działa, i wyrzuć to, co nie działa. Te przerwy są miejscem, w którym hipotezy są testowane tanim kosztem.

## Dlaczego wybór modelu jest decyzją dotyczącą bezpieczeństwa?

Wybór modelu AI nie jest już wyłącznie kwestią jego możliwości; jest to kwestia bezpieczeństwa. Veracode w raporcie 2026 GenAI Code Security Report przetestował ponad 100 modeli i stwierdził, że osiągały one średnio 56% wskaźnika pozytywnych wyników pod względem bezpieczeństwa, niewiele zmienionego względem 2025 roku, mimo że wskaźniki poprawności składni zbliżały się do 100%. Modele ukierunkowane na kodowanie nie były bezpieczniejsze od tych ogólnego przeznaczenia. Własny wniosek Veracode brzmi, że wybór modelu po cichu stał się decyzją dotyczącą bezpieczeństwa.

Dla firmy działającej w obszarze cyberbezpieczeństwa to przesądza sprawę. Nie możemy wybierać modeli na podstawie reputacji ani benchmarków publikowanych przez ich twórców. Musimy sami zobaczyć, jak model zachowuje się przy poważnym zadaniu, a właśnie to pokazuje test typu one-shot. Samodzielne hostowanie modeli daje nam kontrolę nad tym, dokąd trafiają nasze dane. A wbudowanie testów w projekt oznacza, że AI może sprawdzić własną pracę, zamiast tego, byśmy musieli jej ufać. Jak ujmuje to Veracode, kod wygenerowany przez AI należy traktować jak każdy niezrecenzowany kod.

## Co MSP i liderzy IT mogą z tego wyciągnąć?

Pierwsza lekcja to testować, zanim się zaufa. Proszę wybrać jedno poważne, powtarzalne zadanie, które odzwierciedla Państwa własną pracę, i przepuścić przez nie każdy rozważany model. Nie musi to być gra; musi być za każdym razem takie samo.

Druga to traktować wynik pracy AI jak niezrecenzowany kod. Proszę wbudować weryfikację w proces, najlepiej tak, by AI mogła uruchamiać testy na własnej pracy, i zachować odpowiedzialność człowieka za to, co trafia na produkcję.

Trzecia to wyznaczyć eksperymentowaniu granice, zamiast go zakazywać. Małe, samodzielne, ograniczone czasowo i z jasnym celem. W ramach tych granic nieoczekiwany wynik jest mile widzianym bonusem, a nie niepokojącym rozpraszaczem.

## Dobre eksperymenty dają więcej, niż się szukało

Szukaliśmy wiarygodnej odpowiedzi na pytanie, którym modelom możemy zaufać. Otrzymaliśmy ją, a do tego grę, z której jesteśmy odrobinę zbyt dumni. Proszę spróbować; jest tam kilka ukrytych dodatków dla tych, którzy wiedzą, gdzie szukać, i dla tych, którzy znają swoje internetowe memy.

A potem proszę mi powiedzieć: jak testują Państwo modele AI, na których polega Państwa zespół, zanim im Państwo zaufają?

## Źródła

- JetBrains Research, [AI Coding Agents: Adoption Trends (Developer Ecosystem Survey 2026)](https://blog.jetbrains.com/research/2026/08/ai-coding-agent-adoption-2026/)
- METR, [Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity](https://metr.org/blog/2026-05-11-ai-usage-survey/)
- METR, [We are Changing our Developer Productivity Experiment Design](https://metr.org/blog/2026-02-24-uplift-update/)
- Veracode, [LLMs Are Getting Smarter, But Not Safer: 2026 GenAI Code Security Report](https://www.veracode.com/news/llms-are-getting-smarter-but-not-safer-veracode-2026-genai-code-security-report-finds-ai-generated-code-security-has-stalled-at-56%25-pass-rate/)
