Genel amaçlı bir modelin yetenekleri ile belirli bir uygulamanın güvenilirliği aynı değerlendirme değildir. Uyarlama, bilgi erişimi ve araç yetkileri yeni davranışlar oluşturabilir.
Görsellerdeki sayılar, dağılımlar ve senaryolar kavramları açıklamak için oluşturulmuştur. Gerçek bir ürünün performans ölçümü veya bir kurumun test sonucu değildir.
foundation model: görev değil, zemin
Foundation modeller geniş veri üzerinde eğitilir ve farklı görevlere uyarlanabilir. Terim teknik bir sınıflandırmadır. AI Act’teki GPAI modeli kategorisi ise kendi hukuki tanımına dayanır; terimler birbirinin yerine koşulsuz kullanılmaz.
Teknik çekirdek şaşırtıcı derecede sade: model, "bu metnin bir sonraki parçası (token) ne olmalı?" sorusuna cevap verecek şekilde eğitilir. Bu sade hedefin ölçekle (parametre sayısı + veri + hesaplama gücü) birleşmesi, çeviri, özetleme, kod yazma gibi açıkça öğretilmemiş yeteneklerin ortaya çıkmasını sağladı. Validasyon açısından bu iki ucu keskin bir kılıç: yetenek geniş, ama yeteneğin sınırları hiçbir spesifikasyonda yazmıyor — çünkü kimse önceden bilmiyor.
Zihinsel model olarak şunu kullan: foundation model bir çalışan değil, işe aldığın ama CV'sini tam göremediğin bir yetenek havuzudur. Ne bildiğini işe başladıktan sonra, davranışına bakarak öğrenirsin. Validasyonun görevi tam olarak bu: davranış üzerinden yetkinlik ve sınır haritası çıkarmak.
nasıl eğitilir: üç aşamaya tıkla
Kullandığın modelin davranışı, üç eğitim aşamasının bileşkesidir. Her aşama farklı bir şeyi şekillendirir — ve farklı bir risk üretir. Aşamalara tıkla.
aşama 1
Pretraining
İnternet ölçeğinde metinde "sonraki token" tahmini. Bilginin ve dilin kaynağı.
→
aşama 2
SFT (Instruction Tuning)
Örnek talimat–cevap çiftleriyle "asistan gibi davranmayı" öğrenir.
→
aşama 3
RLHF / Tercih Eğitimi
İnsan tercihiyle davranış cilalanır: yardımseverlik, üslup, reddetme.
Bu zincirin validasyon açısından en önemli sonucu: modelin "bilgisi" 1. aşamada donar (knowledge cutoff), ama "davranışı" 2–3. aşamalarda ve ilgili sistemindeki prompt katmanında şekillenmeye devam eder. Yani "model güncel mi?" ve "model uyumlu davranıyor mu?" iki ayrı sorudur ve iki ayrı testle cevaplanır.
RLHF'in bilinen yan etkisi sycophancy (dalkavukluk): insan değerlendiriciler kendilerini onaylayan cevapları beğenme eğiliminde olduğundan, model kullanıcıya katılmayı öğrenebilir. Bankacılık bağlamında bu masum değildir: "bu krediyi onaylamak istiyorum, uygun mu?" sorusuna modelin "evet" eğilimi taşıması, karar destek kullanımında sistematik yanlılıktır. Test edilmesi gereken bir davranış boyutudur.
ne bilir, ne bilmez: soru tipine göre güven
Modelin bilgisi iki kaynaktan gelir: eğitimde içselleşen parametrik bilgi (ağırlıklara gömülü, güncellenmesi eğitim gerektirir) ve çıkarım anında bağlama konan getirilen bilgi (RAG, doküman, kullanıcı girdisi). Aşağıda soru tipini seç; salt parametrik bilgiyle (RAG olmadan) cevap veren bir modelin güven profilini gör.
soru tipi → güven profili
Parametrik bilgi yeterliliği
—
Halüsinasyon riski
—
Mimari çözümün gerekliliği
—
Bir soru tipi seç.
Bu örnek, güncel ve kuruma özel bilginin yalnız model ağırlıklarına bırakılmasının sınırlarını gösterir. Harici bilgi erişimi, hesap araçları ve kaynak denetimi yardımcı olabilir; bunların her biri ayrıca doğrulanması gereken sistem bileşenleridir. Başarı kullanılan modele, göreve ve verilere bağlıdır.
Validasyon lensi: Use-case onayında ilk kontrol sorusu: "bu görevin bilgi ihtiyacı hangi sınıfta ve mimari buna uygun mu?" Kurum politikası soran bir chatbot RAG'sız kurulmuşsa, davranış testine gerek kalmadan tasarım bulgusu yazılır: sistem, yapısal olarak bilemeyeceği soruya cevap verecek şekilde kurulmuş.
adaptasyon spektrumu: prompting, rag, fine-tuning
Foundation modeli kendi use-case'ine üç yolla uyarlarsın; her yolun maliyeti, kontrolü ve validasyon yükü farklıdır. Kartlara tıkla.
Prompting
Talimatla yönlendir; model ağırlıkları dokunulmaz
maliyet
davranış kontrolü
bilgi güncelliği
validasyon yükü
geri alınabilirlik
RAG
Bilgiyi çıkarım anında dışarıdan getir
maliyet
davranış kontrolü
bilgi güncelliği
validasyon yükü
geri alınabilirlik
Fine-tuning
Ağırlıkları kendi verilerinle güncelle
maliyet
davranış kontrolü
bilgi güncelliği
validasyon yükü
geri alınabilirlik
Sık görülen tasarım hatası: bilgi problemine fine-tuning ile çözüm aramak. Fine-tuning davranışı (üslup, format, alan dili) şekillendirmekte iyidir; güncel/kurumsal bilgiyi güvenilir biçimde eklemekte kötüdür — bilgi yine ağırlıklara gömülür, kaynağa bağlanamaz, güncellenemez ve halüsinasyonla karışır. Kural: bilgi için RAG, davranış için fine-tuning, hızlı iterasyon için prompting. Bu kuralın ihlali başlı başına challenge konusudur.
gpai ve eu ai act: değer zincirindeki yerin
EU AI Act, foundation model dünyasını GPAI modeli (genel amaçlı model: geniş görev yelpazesi, birçok sisteme entegre edilebilir) ve onun üstüne kurulan AI sistemi olarak ikiye ayırır. Eğitimde kullanılan toplam hesaplamanın 10²⁵ FLOP'u aşması, modelin "sistemik riskli GPAI" yeteneklerine sahip olduğu yönünde yasal bir karine oluşturur; Komisyon ölçütlerden bağımsız olarak da model belirleyebilir veya karinenin aksini kabul edebilir. Bu sınıf daha ağır değerlendirme, olay bildirimi ve siber güvenlik yükümlülükleri taşır. Değer zinciri üç rol üretir:
GPAI Sağlayıcı
OpenAI, Anthropic, Google… Teknik dokümantasyon, eğitim verisi özeti, telif uyumu yükümlülükleri onda.
→
Downstream Sağlayıcı
GPAI üstüne sistem kuran taraf — banka da olabilir. Sisteminin AI Act sınıfına göre yükümlü.
→
Deployer (Kullanan)
Sistemi işinde kullanan kurum. İnsan gözetimi, kullanım uyumu, izleme yükümlülükleri.
Banka, kullanımına göre sistemi kullanan veya geliştiren/sağlayan rolünde olabilir. Rol yalnız müşteriyle etkileşime göre belirlenmez; geliştirme, kendi adını kullanma ve önemli değişiklik gibi koşullar birlikte incelenir. Model ve sistem katmanlarının yükümlülükleri ayrıdır.
GPAI ve sistem yükümlülüklerinin uygulama tarihleri Modül 19’daki güncel takvimde birlikte ele alınır. Modelin piyasaya sunulma tarihi, aktörün rolü ve geçiş hükümleri ayrıca önem taşır.
AI Omnibus 27 Temmuz 2026’da yürürlüğe girdi. Takvim ve kapsam, düzenleme modülünde; Türkiye kaynaklarının farklı statüleri Modül 20’de açıklanır.
Model ve uygulama ayrımı
Genel amaçlı bir modelin yetenekleri ile belirli bir uygulamanın güvenilirliği aynı değerlendirme değildir. Uyarlama, bilgi erişimi ve araç yetkileri yeni davranışlar oluşturabilir.
Sağlayıcı belgeleri başlangıç kanıtıdır. Yerel kullanım için veri, dil, görev, sürüm ve kontrol tasarımı ayrıca sınanır; erişilemeyen bilgi kalan belirsizlik olarak kaydedilir.
anahtar çıkarımlar
bilgi pretraining'de donar, davranış sonradan şekillenir
"Model güncel mi?" ve "model uyumlu davranıyor mu?" iki ayrı sorudur. İlkinin çözümü mimaridedir (RAG/tool), ikincisinin kanıtı davranışsal testtedir.
zayıflıklar hata değil, mimari özelliktir
Güncel bilgi, kuruma özel bilgi, hassas hesap ve birebir atıf — parametrik bilginin yapısal zayıf noktalarıdır. Bunları model içinde "düzeltmeye" çalışan tasarım, challenge edilmesi gereken tasarımdır.
bilgi için rag, davranış için fine-tuning, iterasyon için prompting
Adaptasyon yönteminin seçimi validasyon yükünü belirler. Fine-tuning en yüksek kontrolü ve en yüksek validasyon yükünü birlikte getirir; geri alınabilirliği de en düşüktür.
gpai dünyasında rolün, yükümlülüğünü belirler
Deployer ile downstream provider farklı yükümlülük setleri taşır; sistem üzerinde ciddi değişiklik rolü kaydırabilir. Use-case onayına rol analizi eklenmelidir — ve AI Act takvimi hareketli olduğundan tarihler canlı takip edilmelidir.
Uygulama örneği · kurgusal vaka
karar masası: RAG mı fine-tuning mi?
Senaryo: İç politika asistanında bilgi her ay değişiyor. Ürün ekibi “kuruma özel olsun” diye fine-tuning istiyor; kaynak gösterimi ve eski politikanın hızla kaldırılması kritik.
Örnek değerlendirmeyi aç
DeğerlendirmeÖnce kaynak-zorunlu, sürüm kontrollü RAG çözümünü tercih et; fine-tuning’i ancak ayrı bir davranış/format ihtiyacı kanıtlanırsa değerlendir. Güncel gerçeği ağırlıklara gömmeyi varsayılan yapma.
Gerekli kanıtGüncellik SLA’sı; kaynak sahipliği/yayın süreci; RAG testleri; fine-tuning veri hakları ve güncelleme riski; vendor/GPAI yükümlülükleri; maliyet ve rollback.
Karar kaydıMimari risk kararı: seçilen yol, reddedilen alternatif, dayanak kanıtı, veri/vendor sorumlulukları ve revalidation tetikleyicileri.