Kurumsal RAG Mimarisi, şirket içi bilgi yönetiminde devrim yaratıyor. Şirketinizin İnsan Kaynakları (İK) departmanını düşünün. Yüzlerce PDF; izin yönetmelikleri, disiplin prosedürleri, yan haklar paketleri ve sürekli güncellenen sağlık sigortası poliçeleri…
Bir çalışan “Diş tedavim sigorta kapsamında mı?” diye sorduğunda, klasik bir arama motoru (Intranet) ona 50 sayfalık bir PDF dosyasını fırlatır ve “İçinde ara, bul” der. Standart bir Yapay Zeka (ChatGPT vb.) ise eğer şirket verinizle eğitilmediyse genel geçer cevaplar vererek halüsinasyon görebilir.
İşte bu noktada RAG (Retrieval-Augmented Generation) devreye girer. Ancak kurumsal dünyada RAG, sadece “dokümanla konuşmak” demek değildir. Asıl mesele; cevabın doğruluğunu, hangi belgenin kaçıncı sayfasındaki hangi maddeye dayandığını kanıtlayabilmektir.
Bu yazıda, verilerin dışarı çıkmadığı bir Private AI altyapısında, İK dokümanları için uçtan uca güvenilir, denetlenebilir bir RAG mimarisini nasıl kuracağımızı inceleyeceğiz.

Neden Sadece “Yapay Zeka” Değil de Kurumsal RAG Mimarisi?
Bir LLM’i (Büyük Dil Modeli) bir üniversite öğrencisine benzetirsek;
- Fine-Tuning (İnce Ayar): Öğrenciyi sınavdan aylar önce kütüphaneye kapatıp her şeyi ezberletmektir. Bilgi eskidiğinde (yeni bir yönetmelik çıktığında) öğrenciyi tekrar eğitmeniz gerekir. Pahalı ve hantaldır.
- RAG (Getirme Destekli Üretim): Öğrencinin önüne sınav anında “Açık Kitap” (Şirket Dokümanları) koymaktır. Öğrenci cevabı ezberinden değil, önündeki kitaptan bakarak ve kaynak göstererek verir.
Güvenilir bir Kurumsal RAG Mimarisi senaryosunda ihtiyacımız olan tam olarak budur: Ezberleyen değil, araştıran bir sistem.

Adım 1: Veri Hazırlığı ve “Kirli” PDF Gerçeği (Ingestion)
Mühendisliğin %80’i veriyi temizlemektir. İK dokümanları genellikle süslü PDF formatındadır. Header (üst bilgi), footer (alt bilgi) ve sayfa numaraları, yapay zekanın kafasını karıştıran “gürültü”lerdir.

Burada iki kritik zorlukla karşılaşırız:
- Metin Temizliği: “Gizli” veya “Şirkete Özel” ibareleri her sayfada tekrar eder. Kurumsal RAG Mimarisi pipeline’ına (hattına) girmeden önce bu gürültülerin temizlenmesi gerekir.
- Tablolar ve Ekler: İK dokümanları bolca tablo (örn: kıdem tazminatı katsayıları) içerir. Standart metin ayrıştırıcılar tabloları bozup anlamsız karakter yığınlarına çevirebilir.
Mühendislik Notu: Basit metinler için standart kütüphaneler yeterlidir. Ancak yoğun tablolu dokümanlarda, tablonun yapısını koruyan veya tabloyu Markdown formatına çeviren daha gelişmiş parser stratejileri veya multimodal (görseli de okuyan) yaklaşımlar düşünülmelidir. Veri kalitesi, performansı belirler.
Adım 2: Parçalama Stratejisi (Chunking)
50 sayfalık bir yönetmeliği tek seferde modele veremezsiniz (context window sınırı). Dokümanı küçük, anlamlı parçalara (chunk) bölmeliyiz.
- Sabit Boyutlu Bölme (Fixed-Size Chunking): En basit yöntemdir. Metni her 500 karakterde bir bölersiniz. Hızlıdır ancak bir cümlenin yarısı bir parçada, yarısı diğer parçada kalabilir.
- Anlamsal Bölme (Semantic Chunking): Metni karakter sayısına göre değil, konu bütünlüğüne göre böler. “İzin kuralları bitti, disiplin kuralları başladı” ayrımını yapmaya çalışır.

Adım 3: Vektör Arama ve Getirme (Retrieval)
Parçaladığımız metinleri, bilgisayarın anlayacağı sayısal formatlara (vektörlere/embedding) çevirip bir Vektör Veritabanına (örneğin ChromaDB) kaydederiz. Kullanıcı “Yıllık izin hakkım ne kadar?” diye sorduğunda sistem, soruya matematiksel olarak en yakın olan parçaları bulur.

İleri Seviye Not: Gelişmiş bir Kurumsal RAG Mimarisi senaryosunda yalnızca vektör benzerliği yeterli olmayabilir. Bu durumlarda vektör arama, anahtar kelime tabanlı (BM25) arama ile hibrit çalıştırılabilir ve sonuçlar bir Reranker modeliyle yeniden sıralanabilir. Bu yaklaşım özellikle madde numarası (“Madde 4.2”) gibi kesin aramaların yapıldığı İK dokümanlarında isabet oranını artırır.
Adım 4: Üretim ve Kaynak Gösterimi (Generation)
Artık elimizde kullanıcının sorusu ve veritabanından bulduğumuz ilgili doküman parçaları var. Şimdi bunları yerel olarak çalışan bir LLM’e (Örn: Llama 3 veya Qwen) göndeririz. Ancak burada kritik bir mühendislik detayı vardır:
Mühendislik Notu (Metadata Injection): Kaynak gösterimin güvenilir olması için her doküman parçasına (chunk) yalnızca metin değil; doküman adı, sayfa numarası ve başlık hiyerarşisi gibi metadata’lar eklenir. Üretim aşamasında modelden, cevabı bu metadata’ya referans vererek üretmesi zorunlu kılınır. Böylece kaynak bilgisi modelin “tahmini” değil, sistemin dayattığı bir kanıttır.
Sistem şu çıktıyı üretir:
“1 yıldan 5 yıla kadar (5 yıl dahil) kıdemi olan çalışanların yıllık ücretli izin hakkı 14 gündür. (Kaynak: İzin Yönetmeliği v3.pdf, Sayfa 4, Madde 2.a)“
Adım 5: Kurumsal RAG Başarısını Ölçmek (Evaluation)
Kurumsal RAG Mimarisinizi kurdunuz ve çalışıyor gibi görünüyor. Peki gerçekten güvenilir mi? Bir mühendis olarak “Cevaplar bana mantıklı geldi” diyerek sistemi canlıya alamayız.
Sistemi şu metriklerle test etmeliyiz:
- Context Recall (Bağlam Yakalama): Aranan bilgi, veritabanından getirilen parçalar içinde var mı?
- Kaynağa Bağlılık (Sadakat): Yapay zeka, cevabı sadece verilen metne dayanarak mı üretti?

Pratik Başlangıç: Eval dünyasına girmek için karmaşık framework’lere boğulmayın. Gerçek kullanımdan alınmış 20–50 soruluk bir “Golden Set” (Altın Veri Seti) oluşturun. Her güncelleme (prompt değişimi, yeni doküman ekleme vb.) sonrası aynı setle yapılan testler, sistemin geriye gidip gitmediğini (regression) size hemen gösterecektir.
Sonuç: Kendi Sisteminizi İnşa Edin
Bu yazıda ele aldığımız kaynak zorunlu ve denetlenebilir Kurumsal RAG Mimarisi, Private AI & RAG Engineering programının teknik temelini oluşturur.
Bu Kurumsal RAG Mimarisi yapısını programa geçmeden önce kendi hızında, uygulamalı örneklerle incelemek isteyenler için,
video destekli ve self-paced “Teknik Hazırlık İçerikleri” sunulmaktadır.
Bu içerikler zorunlu değildir; ancak mimarinin güçlü ve zayıf yönlerini önceden görmek isteyenler için şiddetle önerilir.
👉 Teknik Hazırlık İçerikleri Hakkında Bilgi Alın
🎓 Bir sonraki adım:
Sprint’i tamamlayan katılımcılar, mimariyi daha derinlemesine ele aldığımız
TAÜ-SEM onaylı Private AI & RAG Engineering programına doğrudan geçiş yapabilir.




Bir yanıt yazın