Hemen Başla
Tüm yazılar
Araştırma

Türkiye Bilgi Tabanı: Daha Doğru ve Güncel Yanıtlar

Dil modelleri bilgiyi ezberden söyler ve bilgileri bir tarihte donar. Türkiye Bilgi Tabanı ile Simit'in yanıtlarını doğrulanabilir kaynaklara dayandırmayı hedefliyoruz.

Büyük dil modelleri etkileyicidir ama iki temel zaafları vardır: bilgileri belirli bir tarihte donar ve bazen kendinden emin biçimde yanlış bilgi üretebilirler. Mevzuat, kamu hizmetleri veya güncel ekonomik veriler gibi konularda bu kabul edilemez.

Getirme destekli üretim (RAG)

Çözümümüz, modelin yanıt vermeden önce ilgili belgeleri bir bilgi tabanından getirmesi ve yanıtını bu belgelere dayandırmasıdır:

  1. Soru, anlamsal bir vektöre dönüştürülür.
  2. PostgreSQL + pgvector üzerinde en ilgili belge parçaları bulunur.
  3. Bu parçalar, kaynak bilgisiyle birlikte modele "bağlam" olarak verilir.
  4. Model, yanıtında kaynağı belirtir; bağlamda olmayan bilgiyi bağlamdaymış gibi sunmaz.

Neler olacak?

  • Açık lisanslı kamu belgeleri ve resmî duyurular
  • Kullanıcıların kendi yükledikleri belgeler (yalnızca kendileri için)
  • İzin verilmesi hâlinde kullanıcıya özel hafıza
  • İleride, kontrollü web araması

Durum

Simit GPT'nin mimarisinde bilgi getirme katmanı şimdiden yer alıyor; şu anda henüz boş bağlam döndürüyor. Bilgi tabanı Faz 2 ile birlikte devreye girecek.