Yapay Zekâ Riski, Validasyon & Governance
AI Risk & Validation Framework
Yapay zekâ sistemlerinin nasıl çalıştığını, nerede hata yapabildiğini ve hangi kanıtlarla değerlendirilebileceğini ele alan bir seri. Model ve veri temellerinden LLM, RAG ve ajanlara; risk ölçümünden izleme, yönetişim ve düzenlemelere uzanan görsel örnekler.
26
modül
7
bölüm
24+
etkileşimli örnek
Model Risk→
AI Sistemleri→
Risk Taksonomisi→
Validasyon Çerçevesi→
LLM & GenAI Validasyonu→
Governance & Regülasyon→
Uygunluk görüşü
bölüm 1
Zemin: Model Risk'ten AI Risk'e
Model riski, sistem bileşenleri, makine öğrenmesi ve genel amaçlı modeller.
01
Model riskinden AI sistemlerinin değerlendirilmesine
AI risk değerlendirmesi, sistemin hangi kararı etkilediğiyle başlar. Aynı model, bir metin taslağında ve kredi kararının gerekçesinde farklı riskler taşır. Envanter kaydı; amaç, kullanıcı, veri, yetki ve bağımlılıkları birlikte tanımlar.
→
02
AI Sistem Anatomisi: LLM Tek Model Değildir
Model, istem, bilgi deposu, araçlar ve insan kontrolü tek bir hizmetin parçalarıdır. İnceleme sınırı yalnız model API’sinde biterse erişim yetkisi, güncel olmayan belge veya hatalı işlem gibi önemli riskler görünmez kalır.
→
03
Validator Gözüyle Makine Öğrenmesi
Eğitim başarısı ile yeni gözlemler üzerindeki başarı ayrılır. Veri sızıntısı, temsil sorunu ve hedef değişkenin yanlış tanımı iyi görünen bir metriğin anlamını değiştirebilir.
→
04
Foundation Modeller ve GPAI: Ne Bilir, Ne Bilmez?
Genel amaçlı bir modelin yetenekleri ile belirli bir uygulamanın güvenilirliği aynı değerlendirme değildir. Uyarlama, bilgi erişimi ve araç yetkileri yeni davranışlar oluşturabilir.
→
bölüm 2
AI Risk Evreni
Hata türleri, adalet, sağlamlık, güvenlik ve mahremiyet.
05
AI risk taksonomisi ve zarar yolları
Bir risk kaydı, olayın nasıl oluştuğunu ve kim üzerinde hangi etkiyi yaratabileceğini açıklamalıdır. “Halüsinasyon riski” başlığı ancak somut bir zarar yolu ile birlikte test edilebilir hale gelir.
→
06
Halüsinasyon ve Robustness
Bir yanıtın belgelerle desteklenmesi, belgelerin doğru veya güncel olduğunu garanti etmez. Kaynağa bağlılık, doğruluk ve soruya yeterli cevap verme ayrı ölçülür.
→
07
Bias ve Fairness: Kredi Skoru Örneğiyle
Onay oranı, doğru pozitif oranı ve onaylananların sonuçları farklı adalet sorularını temsil eder. Ölçüt seçimi kullanımın zarar yapısı, veri kalitesi ve geçerli hukukla birlikte gerekçelendirilir.
→
08
Güvenlik ve Mahremiyet: Prompt Injection'dan Veri Sızıntısına
Harici metin, kullanıcı girdisi ve araç çıktısı güvenilir talimat olarak ele alınmamalıdır. Araç yetkilendirmesi ve veri erişimi modelin ürettiği metinden bağımsız kontrollerle sınırlandırılır.
→
bölüm 3
Validasyon çerçevesi
Envanter, risk sınıflandırması, kapsam, kanıt ve bağımsız inceleme.
09
AI Envanteri, Tiering ve Validasyon Takvimi
İç risk sınıfı, inceleme önceliğini ve derinliğini belirlemek için kullanılır. Hukuki sınıflandırmanın yerine geçmez; farklı bağlamlar aynı teknik modele farklı öncelikler verebilir.
→
10
Validasyon Yaşam Döngüsü ve Scoping
İlk değerlendirme, önemli değişiklikler, düzenli izleme ve kullanım sonlandırma aynı kayıt zincirinin parçalarıdır. Kapsam, amaç ve sürüm değiştiğinde eski görüşün geçerliliği yeniden ele alınır.
→
11
Kanıt incelemesi: geliştirici belgeleri ve yeterlilik
Bir belgenin bulunması, içindeki iddianın doğrulanmış olduğu anlamına gelmez. İddia, yöntem, veri, sonuç ve yeniden üretilebilirlik birbirine bağlanır.
→
12
Etkin Bağımsız Challenge
Etkin sorgulama, varsayımları sınayan ve kararı değiştirebilecek kanıt arayan bir incelemedir. Geliştirme ekibinden farklı bir görüş üretmek tek başına bağımsızlık kanıtı değildir.
→
13
Klasik ve ML Validasyon Teknikleri Köprüsü
Örneklem ayrımı, veri sızıntısı, ayrım gücü ve kalibrasyon klasik ML ile üretken AI değerlendirmesi arasında yararlı köprülerdir. Ancak açık uçlu yanıtlar için etiket ve başarı tanımı ayrıca tasarlanır.
→
bölüm 4
LLM & GenAI Validasyonu
LLM ölçümü, RAG, koruyucu kontroller, ajanlar ve izleme.
14
LLM Evaluation Temelleri
Başarı oranı, test birimi ve örnekleme planı açıklanmadan yorumlanamaz. Tek sorunun tekrarları bağımsız yeni sorular gibi sayılırsa belirsizlik olduğundan küçük görünebilir.
→
15
RAG Validasyonu
RAG sisteminde doğru belgenin getirilmesi ve yanıtın o belgeyi doğru kullanması ayrı aşamalardır. Retrieval başarısı düşükse yalnız yanıt istemini iyileştirmek yeterli olmayabilir.
→
16
Guardrails ve Red Teaming
Bir filtre hem zararlı içeriği kaçırabilir hem de meşru isteği engelleyebilir. Eşik seçimi yalnız iki test oranına değil, gerçek trafik hacmine ve hataların sonuçlarına dayanır.
→
17
Agentic AI ve Tool Use Riski
Bir ajanın yanıt üretmesi ile dış sistemde işlem yapması farklı sonuçlar doğurur. Araçlar en az yetki, işlem sınırı ve uygun onay noktalarıyla tasarlanır.
→
18
AI Monitoring: Drift, Metrikler, Revalidation
İzleme bir gösterge panelinden fazlasıdır: eşik, olayın sahibi ve uygulanacak müdahale birlikte tanımlanır. Kullanım hacmi değiştiğinde oranlarla birlikte mutlak olay sayıları da takip edilir.
→
bölüm 5
Governance & Regülasyon
AI Act, NIST, ISO ve Türkiye kaynaklarının kapsam ve statüsü.
19
EU AI Act: kapsam, roller ve teknik kanıt
AI Act değerlendirmesi coğrafi kapsam, sağlayıcı veya kullanan rolü ve kullanım amacıyla başlar. Teknik validasyon kanıtı bu değerlendirmeyi destekler; tüm hukuki yükümlülükleri tek başına karşılamaz.
→
20
NIST AI RMF, ISO 42001 ve Türkiye Katmanı
NIST AI RMF gönüllü bir risk yönetim çerçevesidir; ISO/IEC 42001 bir yönetim sistemi standardıdır. Bu çerçevelerle çalışmak, belirli bir ürünün güvenilirliğini veya mevzuata uyumunu kendiliğinden kanıtlamaz.
→
21
Third-Party ve Vendor AI Değerlendirmesi
Dışarıdan alınan model veya hizmette bilgiye erişim sınırlı olabilir. Kullanım kapsamı, yerel testler, sözleşmedeki değişiklik bildirimleri ve çıkış seçenekleri bu belirsizlikle birlikte değerlendirilir.
→
bölüm 6
Uygunluk görüşü ve bankacılık uygulamaları
Uygunluk görüşü, bankacılık senaryoları ve sürdürülebilir işleyiş.
22
Fitness for Purpose: Görüş, Rapor, Komite
Uygunluk görüşü; değerlendirilen kullanım, sürüm, kanıtlar, açık bulgular ve sınırlar arasında anlaşılır bir ilişki kurar. Sonuç yalnız bir renk veya puan olarak sunulmaz.
→
23
Banka Use-Case Atlası
Müşteri asistanı, kredi karar desteği, kod üretimi ve operasyon ajanı aynı test paketiyle değerlendirilemez. Etkilenen karar, veri ve işlem yetkileri değerlendirme kapsamını belirler.
→
24
AI risk yönetiminde sürdürülebilir işleyiş
AI risk işleyişi; sahiplik, envanter, orantılı inceleme, değişiklik kontrolü ve izleme arasında süreklilik gerektirir. Organizasyon şeması tek başına bu akışın çalıştığını göstermez.
→
Seri 26 modülden oluşur. Her modül tek başına açılabilir, ancak ilk turda sırayı izlemek kavram zincirini korur. Seri, mevcut DS ve Capital serilerini tekrar etmez; onların üstüne AI'a özgü risk ve validasyon katmanını kurar.
bölüm 7Kapanış ve başvuru
Kavramları bir kararda birleştiren vaka; terimler ve kaynakların statüsü.
25Kapanış vakası: RAG asistanı için kullanım kararı
Test dilimleri, güven aralığı, kullanım sınırları ve görev hacmiyle etkileşimli değerlendirme.
Sözlük ve kaynaklar
54 kavram, modül bağlantıları ve resmî kaynakların kapsamı.