AI Risk & Validation Framework · 01

Model riskinden AI sistemlerinin değerlendirilmesine

AI risk değerlendirmesi, sistemin hangi kararı etkilediğiyle başlar. Aynı model, bir metin taslağında ve kredi kararının gerekçesinde farklı riskler taşır. Envanter kaydı; amaç, kullanıcı, veri, yetki ve bağımlılıkları birlikte tanımlar.

önce sağlam zemin: model risk dünyası

Model riski, kullanılan modelin hata veya yanlış kullanım yoluyla kararları olumsuz etkilemesidir. Geleneksel bankacılık modellerinden üretken AI uygulamalarına geçerken bu soru geçerliliğini korur; incelenen sistemin sınırları ve hata yolları genişler.

ABD’de SR 11-7 tarihsel bir referanstır. 17 Nisan 2026 tarihli SR 26-2 onun yerini almıştır. Yeni rehber, üretken ve ajan tabanlı AI modellerini açıkça kapsam dışında bırakır; bu araçlar için uygun yönetişim ve kontrollerin kurumun risk yönetimi uygulamalarıyla belirlenmesini ifade eder. Bu seride klasik model risk ilkeleri AI değerlendirmesine kavramsal bir köprü olarak kullanılır.

Karşılaştırma için sabit bir skorkart ile açık uçlu bir üretken asistan ele alınabilir. Bunlar tüm model türlerini temsil eden iki kesin sınıf değildir:

Örnek: sabit skorkart
1 · Tekrarlanabilir tahminSabit veri ve parametrelerle aynı nicel tahmin üretilir. Rastlantısal yöntemler ve ortam değişimleri ayrıca kontrol edilir.
2 · Tanımlı görevÖrneğin belirli vadede PD tahmini üretir. Çıktının başka bir kararda yanlış kullanılması yine mümkündür.
3 · İncelenebilir yapıKatsayılar, dönüşümler ve uygulama incelenir; ayrıca gerçek sonuçlar ve kullanım davranışı test edilir.
Örnek: üretken asistan
1 · Değişken yanıtÖrnekleme ve bağlam nedeniyle aynı isteme farklı yanıtlar gelebilir. Çalıştırma ayarları ve sürümler kaydedilir.
2 · Geniş görev alanıModel farklı istekleri yanıtlamaya çalışabilir. İzin verilen kullanım, teknik ve operasyonel sınırlarla belirlenir.
3 · Karmaşık temsilİç temsilleri anlamak güç olabilir. Davranış testleri, mimari ve erişilebilir model bilgisiyle birlikte değerlendirilir.

AI riski, model riskinin reddi değil genişlemesidir. Etkin challenge, bağımsızlık, envanter, fitness for purpose — bunların hepsi aynen geçerli. Değişen şey: bu ilkelerin uygulandığı nesnenin doğası. Validasyonun cevaplamaya çalıştığı soru aynı ("bu sistem amacına uygun mu?"), ama kanıt üretme yöntemi kökten değişiyor.

Hem klasik model hem AI sistemi değerlendirmesi yöntem, veri, uygulama ve çıktı davranışını kapsar. Üretken AI’da açık uçlu yanıtlar ve araç kullanımı, bu incelemeye yeni test tasarımları ekler.

temel fark: aynı soruyu 20 kez sor

Aşağıdaki panel, önceden yazılmış cevaplar arasından ağırlıklı seçim yapar. Gerçek bir LLM çağrısı değildir. Sıcaklık yükseldikçe bu örnekte cevap ağırlıkları birbirine yaklaşır; bu kurgu, belirli bir modelin sıcaklık ile doğruluk ilişkisini ölçmez.

aynı soru, 20 cevap simülasyonu
Kurgusal kullanıcı sorusu“Arşiv portalında dışa aktarma izni kimde, bağlantı ne kadar süre geçerli?” Referans politika: yalnız yetkili kullanıcı; bağlantı 24 saat geçerli.
Sıcaklık (temperature)
0.7
doğru
kısmen doğru
uydurma
Sıcaklığı ayarla ve "20 kez sor" düğmesine bas. Aynı ayarla tekrar basınca bile sonucun değiştiğine dikkat et — mesele tam olarak bu.
Sabit veri, parametre ve çalışma ortamında lojistik regresyonun tahmini tekrarlanır. Bu, tüm klasik ML yöntemlerinin deterministik olduğu anlamına gelmez; üretken modellerde de sabit çözümleme ayarları tekrarlanabilirliği artırabilir.

Tekrarlı ölçüm, davranış değişkenliğini görünür kılar. Ancak aynı soruya verilen 20 yanıt, kullanım evreninden seçilmiş 20 bağımsız soru değildir. Sıcaklık sıfır olsa da doğruluk garanti edilmez; kabul ölçütü, test birimi ve örnekleme planı birlikte tanımlanır.

Validasyon lensi: Geliştirici ekip sana "100 soruluk testte %98 başarı" raporu getirdiğinde ilk soruların şunlar olmalı: Bu %98 kaç çalıştırmanın ortalaması? Örneklem hangi evrenden seçildi? %95 güven aralığı ne? Aynı test setini yarın tekrar koşsam sonuç kaç puan oynar? Bu sorular Modül 14'te (LLM Evaluation) sistematikleşecek.

ai'a özgü hata modları: her satıra tıkla

Geleneksel modeller de hata yapar — ama öngörülebilir biçimlerde: kalibrasyon kayar, ayrışma gücü düşer, girdi verisi bozulur. AI sistemleri bunlara ek olarak yeni hata sınıfları getirir. Her satıra tıkla; hatanın ne olduğunu, geleneksel dünyada karşılığı olup olmadığını ve validator olarak ne soracağını gör.

Kendinden emin yanlış (hallucination)
yeni sınıf
Sessiz bozulma (silent degradation)
şiddetlenen sınıf
Girdi yoluyla manipülasyon (prompt injection)
yeni sınıf
Amaç dışı kullanım kayması (scope creep)
şiddetlenen sınıf
Beklenmedik davranış (emergent behaviour)
yeni sınıf
Geri besleme döngüsü ve otomasyon yanlılığı
şiddetlenen sınıf
Ortak payda şu: bu hataların hiçbiri kod hatası değildir. Sistem tasarlandığı gibi çalışırken üretilirler. Bu yüzden "kod review + birim testi geçti" hiçbir AI hata modu için güvence sağlamaz — güvence ancak davranışsal test, kısıtlayıcı kontroller (guardrail, insan onayı) ve sürekli izlemeden gelir.

kapsam genişliyor: modelden ai sistemine

İkinci büyük değişim tanımsal. Geleneksel envanterde birim "model"di. Şimdi gözetim nesnesi üç katmana yayılıyor:

Model
PD skorkartı, XGBoost fraud modeli. Tanımlı girdi-çıktı, tek görev.
AI Sistemi
Model + prompt + RAG + guardrail + arayüz. Davranış bileşimin ürünü.
GPAI / Foundation
Genel amaçlı model (GPT, Claude, Gemini). İçine bakamazsın; üstüne sistem kurulur.

EU AI Act bu ayrımı hukuken de kalıcılaştırdı: AI sistemi (belirli bir amaç için konuşlandırılan, çıkarım yapan sistem) ile GPAI modeli (genel amaçlı, birçok sisteme temel olan model) ayrı yükümlülük setlerine tabi. Envanter ve validasyon kapsamı de artık üç soruya cevap vermek zorunda: Hangi modeller var? Hangi AI sistemleri var? Hangi sistem hangi üçüncü taraf modelin üstüne kurulu?

Bunun pratik sonucu ağır: bir vendor, temel modeli güncellediğinde (ör. Copilot'un altındaki model değiştiğinde) ilgili hiçbir kod satırın değişmeden sistemin davranışı değişir. Geleneksel çerçevede "model değişikliği" versiyon numarasıyla izlenirdi; AI dünyasında değişiklik ilgili haberin olmadan, tedarik zincirinin yukarısında gerçekleşebilir. Modül 21 (vendor AI) bu problemi derinlemesine işleyecek.

Sık yapılan kurumsal hata: "LLM'ler model envanterine girmez, çünkü bizim geliştirdiğimiz bir model değil" yaklaşımı. Sonuç: kimilgili validate etmediği, kimilgili izlemediği ama kredi müşterisine cevap veren sistemler. Envanter tanımını genişletmek — neyin kayda gireceğine karar vermek — AI risk yönetiminin ilk ve en politik işlerinden biridir (Modül 09).

Kullanım bağlamı ve zarar yolu

AI risk değerlendirmesi, sistemin hangi kararı etkilediğiyle başlar. Aynı model, bir metin taslağında ve kredi kararının gerekçesinde farklı riskler taşır. Envanter kaydı; amaç, kullanıcı, veri, yetki ve bağımlılıkları birlikte tanımlar.

Model başarısı, sistemin uygunluğu için tek başına yeterli değildir. Hata türü, ortaya çıkma sıklığı, etkilenebilecek kişi sayısı ve hatanın geri alınabilirliği birlikte değerlendirilir.

anahtar çıkarımlar

ai riski, model riskinin genişlemesidir — reddi değil
Etkin sorgulama, envanter ve amaca uygunluk değerlendirmesi ortak temellerdir. Üretken AI; açık uçlu çıktı, harici bilgi ve araç kullanımı gibi ek inceleme alanları getirir.
davranış bir dağılımdır
Aynı girdi farklı çıktılar üretebilir. Tek demo, tek test koşusu genel güvenilirliği kanıtlamaz. Kabul kriterleri istatistiksel olmalı: örneklem, güven aralığı, tekrar edilebilirlik protokolü.
yeni hata modları kod hatası değildir
Halüsinasyon, prompt injection, scope creep, sessiz bozulma — sistem "doğru çalışırken" oluşurlar. Güvence kod incelemesinden değil; davranışsal test, guardrail ve sürekli izlemeden gelir.
onay artık yaşayan bir karardır
AI sisteminin onayı koşullarla verilir ve izleme + revalidation tetikleyicileriyle ayakta tutulur. Uygunluk görüşü statik bir sertifika değil, koşullu ve izlenen bir görüştür.
Uygulama örneği · kurgusal vaka

karar masası: AI asistanı için ilk onay kapısı

Senaryo: Kredi ekipleri vendor tabanlı RAG asistanını iki hafta içinde pilotlamak istiyor. “Yalnız karar desteği” deniyor; fakat cevaplar müşteri ret gerekçesine kopyalanabilecek, aynı soruda farklı yanıtlar görülmüş ve sistem sahibi tanımlanmamış.
Örnek değerlendirmeyi aç
DeğerlendirmeGerçek müşteri kararına kullanımı beklet; yalnız sentetik veri ve kapalı kullanıcı grubuyla keşif pilotuna izin ver. Sistem sınırı, insan kontrolü ve zarar yolu netleşmeden düşük risk kabul etme.
Gerekli kanıtHedeflenen/yasak kullanım; model–RAG–prompt–guardrail–insan–vendor haritası; tekrarlı davranış testi; kritik hata örnekleri; insan kontrolü etkinliği; sahip ve eskalasyon hattı.
Karar kaydıTek sayfalık kapsam ve tier önerisi: pilot sınırı, go-live ön koşulları, belirsizlikler, sahip/termin ve yeniden görüş tetikleyicisi.