---
title: "Kendi sunucumuzda barındırdığımız LLM'leri test ettik ve kazara bir oyun yaptık | Guardian360"
description: "Kendi sunucumuzda barındırdığımız her LLM'i test etmek için kullandığımız tek seferlik bir komut, tarayıcıda oynanan Lighthouse Run oyununa dönüştü. Sabit ve tekrarlanabilir bir testin neden bir satıcı demosundan üstün olduğunu, model seçiminin neden artık bir güvenlik kararı olduğunu ve yapay zeka ajanları yazma işini yaparken mühendislerin ne yapması gerektiğini anlatıyoruz."
url: https://guardian360.net/tr/blog/we-tested-our-self-hosted-llms-and-accidentally-built-a-game/
locale: tr
source: guardian360.net
---
[← Tüm yazılar](https://guardian360.net/tr/blog/)

Opinion

# Kendi sunucumuzda barındırdığımız LLM'leri test ettik ve kazara bir oyun yaptık

Yazan Jan Martijn Broekhof · 1 Ekim 2026

Kulağa bir fıkranın başlangıcı gibi geliyor: bir siber güvenlik şirketi yapay zeka modellerini test etmeye koyuluyor ve elinde bir oyunla kalıyor. Ama gerçekten olan tam da bu ve bu durum, bu blog yayınlandıktan sonra bir hafta içinde ortaklarımızdan gelmesini beklediğim haklı bir soruyu gündeme getiriyor. Yapay zeka ajanınız daha bitmemişken neden bir oyun yapıyorsunuz?

Kimse sormadan yanıtlayayım. Aslında hiç oyun yapmıyorduk. Büyük dil modellerini test ediyorduk ve ortaya çıkan şey bir oyun oldu.

Bu ayrım, kulağa geldiğinden çok daha önemli. Konuştuğum MSP’lerin ve BT liderlerinin çoğu, bizimle aynı soruların üzerinde çalışıyor: hangi büyük dil modellerine güvenebiliriz, bunları kendi sunucumuzda mı barındırmalıyız ve yapay zeka kodlama ajanları yazma işini yaparken çalışanlarımız ne yapmalı? Basit bir tek seferlik komut testinin yan ürünü olan kazara yaptığımız oyun, bu üç konunun hepsine şaşırtıcı derecede faydalı bir bakış açısı sundu.

## Bir model testi nasıl oyuna dönüştü?

Lead SRE’miz her yeni model için standart bir teste sahip. Modele tek bir sabit komut veriyor: tek seferde eksiksiz bir platform oyunu yap. Bu, tek seferlik komutlamadır; tek bir talimat, sonradan düzeltme yok, elinden tutma yok. Bir modelin bu işe ne kadar yaklaştığı, size onun muhakemesi, kodunun kalitesi ve büyük bir görevi bir arada tutabilme becerisi hakkında çok şey anlatır. Bu testi, kendi sunucumuzda barındırdığımız açık kaynaklı LLM’ler üzerinde çalıştırıyoruz ve daha iyileri ortaya çıktıkça bu modelleri düzenli olarak değiştirdiğimiz için, tamamen aynı kalan bir test, herhangi bir lider tablosundan daha değerlidir.

Bu kez daha da ileri gitti. Tek seferlik sonuçta durmak yerine, modelin halka açık web sitemizden ve bu sitenin Model Context Protocol (MCP) aracılığıyla sunduğu bilgilerden yararlanmasına izin verdi ve bunları oyuna işlemesini istedi. Diğer yapay zeka kodlama oturumları çalışırken yürüttüğü yan oturumlarda, deney Lighthouse Run’a dönüştü: sektörümüze dair göndermelerle dolu altı seviye ve 24 bölge, son patronlar, her seviyenin sonunda bir tarama raporu ve her gün değişen, yarı rastgele oluşturulan bir Daily Scan seviyesi. Oyunun tamamı tek, kendine yeten bir HTML dosyasında yaşıyor ve etrafındaki proje, yapay zekanın kendi değişikliklerini çalıştırıp doğrulayabilmesi için testler içeriyor.

Birkaç seviye oynadım. Kolay değiller, ki bunu bir iltifat olarak söylüyorum. [https://guardian360.net/lighthouse-run/](https://guardian360.net/lighthouse-run/) adresinden deneyebilirsiniz; sesi açın, telefonda veya kumandayla da çalışıyor.

## Bir LLM’i neden tek seferlik bir komutla test etmeli?

Çünkü yapay zekaya dair izlenimlerimiz güvenilir değil. METR’nin Mayıs 2026’da yayımladığı, 349 teknik çalışanla yapılan bir ankette, katılımcıların yapay zeka araçları sayesinde çalışmalarının değerinde ortanca 1,4 ila 2 kat bir değişim ve ortanca 3 kat bir hız değişimi bildirdiği bulundu. METR’nin kendisi bunu olduğu gibi kabul etmeye karşı uyarıyor: 2025 başındaki çalışmasında, insanların yapay zekanın görevlere harcadıkları zaman üzerindeki etkisini ortalama 40 yüzde puanı fazla tahmin ettikleri bulundu.

Deneyimli teknik insanlar her gün kullandıkları araçları yanlış değerlendiriyorsa, cilalı bir satıcı demosu bir model seçmek için sağlam bir temel değildir. Sabit, tekrarlanabilir bir komut kabadır, ama dürüsttür. Aynı görev, her model, sonuçlar yan yana. Her arabayı aynı rotada test süren bir servis, broşüre güvenen bir servisten daha çok şey öğrenir.

## Yapay zeka ajanları yazma işini yaparken mühendisler ne yapar?

Ajan odaklı çalışma artık bir deney değil. JetBrains’in 15.000’den fazla profesyonel geliştiriciyle yaptığı 2026 Developer Ecosystem Survey, Mayıs-Temmuz 2026 itibarıyla %90’ının işte en az haftalık olarak yapay zeka kodlama ajanları kullandığını ve %68’inin bunları günlük olarak kullandığını buldu.

Bu, bir mühendisin gününün şeklini değiştiriyor. Yazmaya daha az zaman, talimat vermeye, inceleme yapmaya ve beklemeye daha çok zaman harcanıyor. METR, verimlilik araştırmasını tekrarlamaya çalıştığında tam da bununla karşılaştı. Yapay zeka olmadan çalışmak istemedikleri için katılmamayı seçen geliştiricilerde belirgin bir artış gördü ve aynı anda birden fazla yapay zeka ajanı kullanan geliştiriciler için zaman ölçümlerinin güvenilmez olduğunu buldu.

Lead SRE’miz tam olarak böyle çalışıyor. Birkaç oturum paralel olarak yürüyor ve her biri bitene kadar aralar oluyor. Bu aralarda ne olacağı bir liderlik sorusudur. Bunların var olmadığını varsayabilir, onları aynı işin daha fazlasıyla doldurabilir ya da insanların fikirleri test etmek için kullanmasına izin verebilirsiniz. Hızlı prototipleme kültürümüz var: küçük inşa et, hızlı test et, işe yarayanı sakla ve yaramayanı at. Bu aralar, hipotezlerin ucuza test edildiği yerlerdir.

## Model seçimi neden bir güvenlik kararıdır?

Bir yapay zeka modeli seçmek artık yalnızca bir yetenek sorusu değildir; bir güvenlik sorusudur. Veracode’un 2026 GenAI Code Security Report’u 100’den fazla modeli test etti ve bunların, sözdizimi geçiş oranları %100’e yaklaşsa bile, 2025’e göre pek değişmeyen ortalama %56’lık bir güvenlik geçiş oranına sahip olduğunu buldu. Kodlamaya odaklı modeller, genel amaçlı olanlardan daha güvenli değildi. Veracode’un kendi sonucu, model seçiminin sessizce bir güvenlik kararı haline geldiğidir.

Siber güvenlik alanında çalışan bir şirket için bu, meseleyi kapatır. Modelleri itibara veya yapımcıları tarafından yayımlanan kıyaslamalara göre seçemeyiz. Bir modelin önemli bir görevde nasıl davrandığını kendi gözlerimizle görmemiz gerekir ve tek seferlik bir test tam olarak bunu gösterir. Modelleri kendi sunucumuzda barındırmak, verilerimizin nereye gittiği üzerinde bize kontrol sağlar. Ve testleri projeye yerleştirmek, yapay zekaya güvenmek zorunda kalmak yerine onun kendi çalışmasını kontrol edebilmesi anlamına gelir. Veracode’un dediği gibi, yapay zeka tarafından üretilen kod, incelenmemiş herhangi bir kod gibi ele alınmalıdır.

## MSP’ler ve BT liderleri bundan ne çıkarabilir?

İlk ders, güvenmeden önce test etmektir. Kendi işinizi yansıtan önemli, tekrarlanabilir bir görev seçin ve değerlendirdiğiniz her modeli bundan geçirin. Bir oyun olması gerekmiyor; her seferinde aynı olması gerekiyor.

İkincisi, yapay zeka çıktısını incelenmemiş kod olarak ele almaktır. Doğrulamayı sürece, ideal olarak yapay zekanın kendi çalışmasına karşı testler çalıştırabileceği şekilde yerleştirin ve üretime neyin girdiğinden bir insanı sorumlu tutun.

Üçüncüsü, deneye yasak koymak yerine ona sınırlar çizmektir. Küçük, kendine yeten, zaman sınırlı ve net bir amacı olan. Bu sınırlar içinde, beklenmedik bir sonuç, endişe verici bir sapma değil, hoş bir ikramiyedir.

## İyi deneyler aradığınızdan fazlasını verir

Hangi modellere güvenebileceğimize dair güvenilir bir yanıt arıyorduk. Onu bulduk ve biraz fazla gurur duyduğumuz bir oyun da elde ettik. Bir deneyin; nereye bakacağını bilenler ve internet mem’lerini bilenler için birkaç gizli ekstra var.

Ve sonra bana söyleyin: ekibinizin güvendiği yapay zeka modellerini, onlara güvenmeden önce nasıl test ediyorsunuz?

## Kaynaklar

- JetBrains Research, [AI Coding Agents: Adoption Trends (Developer Ecosystem Survey 2026)](https://blog.jetbrains.com/research/2026/08/ai-coding-agent-adoption-2026/)
- METR, [Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity](https://metr.org/blog/2026-05-11-ai-usage-survey/)
- METR, [We are Changing our Developer Productivity Experiment Design](https://metr.org/blog/2026-02-24-uplift-update/)
- Veracode, [LLMs Are Getting Smarter, But Not Safer: 2026 GenAI Code Security Report](https://www.veracode.com/news/llms-are-getting-smarter-but-not-safer-veracode-2026-genai-code-security-report-finds-ai-generated-code-security-has-stalled-at-56%25-pass-rate/)
