Araştırmalar
Türkiye'nin ilk kapsamlı LLM Security araştırma serisi. Prompt injection'dan RAG güvenliğine, AI agent risklerinden AltayDuel düello vakalarına kadar teknik derinlikte, Türkçe.
Fevzi Ege Yurtsevenler, Türkiye'de yapay zekâ güvenliği alanını kuran isimlerden biridir. LLM güvenliği, prompt injection ve yapay zekâ ajan güvenliği üzerine araştırmalar yürütüyor, kurumsal eğitimler veriyor; Türkiye'de bu alanda teknik içerik üreten ve sahada aktif olan ilk araştırmacılar arasında yer alıyor.
Enes Deniz, AltaySec Co-Founder'ı olarak Türkçe ve global LLM güvenliği, prompt injection, jailbreak savunması ve AI red/blue teaming alanlarında uzman AI güvenliği kurucusudur. AltaySec'in eğitim, topluluk, ürün ve açık kaynak ekosisteminin büyümesinde aktif rol alır. Türkiye'de bu alanda teknik içerik üreten ve sahada aktif olan ilk araştırmacılar arasında yer alıyor.
AI Security Serisi — Savunma ve Uygulama
Mayıs-Temmuz 2026 · Yazar: Enes Deniz · Prompt Injection, Red + Blue, Açık Veri, AI SOC
Turkish Conversation Prompt-Injection Dataset
600 meşru kullanıcı talebi, 150 prompt injection saldırısı, 150 eşleştirilmiş sınır çifti ve 10 saldırı ailesi. Hugging Face ve GitHub üzerinde açık.
LLM Uygulamalarında Prompt Injection Tehdit Modeli
Prompt injection yalnızca prompt problemi değildir. Kullanıcı girdisi, RAG verisi, tool calling, bellek ve çıktı katmanlarından gelen saldırı yüzeylerini kurumsal savunma bakışıyla ele alan rehber.
AI Red Teaming Playbook: Bir LLM Uygulaması Nasıl Test Edilir?
Red team'i rastgele jailbreak denemesi olmaktan çıkaran uygulama testi rehberi. Mimari çıkarımı, saldırı yüzeyi haritalama, RAG, tool calling, yetki sınırı ve blue team devri.
Jailbreak Savunması Neden Tek Bir Sistem Prompt'u ile Çözülmez?
Sistem promptu önemlidir ama güvenlik sınırı değildir. Jailbreak savunmasını politika, bağlam ayrıştırma, tool yetkisi, çıktı kontrolü, loglama ve olay müdahalesiyle kuran rehber.
Epistemik Güvenlik ve Semantik Saldırı Yüzeyleri
Büyük dil modeli sistemlerinde güven sınırlarının çöküşü, otonom tehdit modelleri ve semantik savunma mimarileri. Trust boundary collapse, agentic exploitation, LLM kill chain ve identity-bound tool execution. Türkiye'nin ilk epistemik güvenlik çerçevesi.
Sınır Ötesi Veri Akışı ve Siber Çatışma Riskleri
Harici LLM kullanımıyla gerçekleşen anlamsal veri sızıntısı, DLP sistemlerinin körlüğü, siber çatışma senaryosunda istihbarat ve bağımlılık riski; bilişsel dış kaynak kullanımı ve semantik egemenlik. Veri egemenliği perspektifiyle çerçeve belgesi.
AI SOC Mimarisi: LLM Güvenliği için Modern SOC
Klasik SOC log izler, AI SOC dili izler. LLM telemetri şeması, detection pipeline (regex + ML + LLM-as-judge), 8 örnek alert kuralı, 30 dakikalık incident response akışı. Türkçe-öncelikli kurumsal mavi takım rehberi.
Runtime LLM Guardrails: Üretim Ortamında Yapay Zekâ Savunması
Input/output filtreleme, hard block / soft reject / sanitize politika katmanları, Türkçe morfolojik bypass'a karşı yerli baseline'lar, P95 < 50ms latency hedefi. AltaySec Guardian mimarisinden saha pratiği.
LLM Detection Engineering: Tespit Kuralı Yazma Rehberi
LLM-Sigma kural anatomisi, PI-001'den AG-001'e 6 kategori örnek kural seti, composite alert ağırlıkları, AI threat hunting soruları, 5 seviyeli detection maturity modeli.
KVKK Uyumlu PII Maskeleme: LLM Trafiğinde Veri Koruma
Türkiye'ye özgü 10 PII tipi (TCKN MERNİS, IBAN MOD-97, Luhn kart, plaka, SGK), 5 katmanlı maskeleme pipeline'ı, 6 maskeleme stratejisi (redaction / tokenization / synthetic / DP), KVKK + EU AI Act çift uyum tablosu.
AI Incident Response Playbook: Saat-Saat Müdahale
LLM olaylarında PICERL döngüsünün uyarlaması, ilk 1 saat containment, ilk 24 saat forensic, 72 saat KVKK bildirim eşiği. 8 LLM olay tipi, eradication ve recovery akışı, lessons learned soru seti.
Yapay Zekâ Güvenlik Duvarı (AI Firewall) Seçim Rehberi
Kurumsal LLM ve yapay zekâ entegrasyonlarında WAF neden yetersiz kalır? AI Firewall seçerken dikkat edilmesi gereken gecikme (latency), Türkçe dil morfolojisi ve KVKK uyumluluğu kriterleri.
EU AI Act Uyum Rehberi: Türk Şirketleri için Pratik Çerçeve
4 risk sınıfı, yüksek riskli sistemlerin 7 yükümlülüğü (Madde 9-15), GPAI hükümleri, KVKK çift uyum tablosu ve 2024-2027 uygulama takvimi. Türk kurumları için 13 maddelik checklist.
AI Agent Güvenliği: Tool Hijacking ve İzin Sınırlandırma
Agent mimarisinin tehdit modeli, dört temel saldırı vektörü (tool hijack, parametre manipülasyonu, dolaylı enjeksiyon, kontrolsüz agent) ve izin listesi + parametre doğrulama + gözlemlenebilirlik üzerine üç katmanlı kurumsal savunma.
RAG Güvenlik İzleme: Vektör Veritabanı Saldırılarına Karşı Savunma
RAG mimarisinin beş katmanı, belge zehirleme ve dolaylı enjeksiyon, gömme uzayında manipülasyon ve retrieval bypass; belge yaşam döngüsü kontrolleri ile dört katmanlı izleme akışı.
LLM Honeypot Tasarımı: Saldırganı Çeken Sahte AI Uygulamaları
Üç honeypot tipi (düşük/orta/yüksek etkileşimli), mimari yedi bileşen, telemetri ve istihbarat tasarımı, saldırgan çekme stratejileri, KVKK ve hukuki sınırlar.
AI Threat Intelligence: AI-CTI Akışı Tasarımı
Klasik CTI'dan farkı, beş kaynak kategorisi, veri formatı ve şema, istihbaratın yaşam döngüsü, sektörel paylaşım çerçeveleri ve kurumsal entegrasyon noktaları.
Phishing & Sosyal Mühendislik
Mayıs 2026 · Yazar: Enes Deniz · Türkiye-Özgü Tehdit Haritası ve Savunma
Türkiye'de Phishing Trendleri 2026: Kargo, Banka, Kamu Sahteleri
Smishing/vishing kayması, kargo SMS dolandırıcılığı, banka uyarı sahteleri, e-Devlet ve KEP taklitleri. Yerlileşmiş 4 kalıp, üç katmanlı kurumsal savunma ve etkili simülasyon programı tasarımı.
AI Destekli Phishing: Deepfake Ses, LLM E-postaları, Yeni Nesil Saldırılar
LLM ile akıcı Türkçe phishing, voice cloning ile sahte CEO çağrıları, Hong Kong tarzı deepfake video toplantılar, AI destekli OSINT. Out-of-band doğrulama, çoklu onay zinciri, "kanıt sor" kültürü.
Kurumsal AI Güvenliği Rehberleri
Mayıs 2026 · Yazar: Enes Deniz · ChatGPT, KVKK, Düzenleme
ChatGPT Kurumsal Kullanımda Güvenlik Rehberi
Shadow AI yönetimi, bireysel-kurumsal lisans farkı, Kabul Edilebilir Kullanım Politikası, DLP + AI gateway entegrasyonu, KVKK boyutu ve çalışan eğitimi. Yasak ile sınırsız izin arasındaki orta yol.
Yapay Zekâ ve KVKK — Kurumsal Sorular ve Pratik Cevaplar
8 sık sorulan soru: açık rıza, otomatik karar (Madde 11), yurt dışı aktarım (Madde 9), Madde 6 verisi, fine-tuning riski, VERBİS bildirim, veri sahibi hakları, tedarikçi seçimi.
Türkiye'de Yapay Zekâ Düzenlemeleri 2026: Mevcut Çerçeve ve Beklentiler
KVKK çatısı, Ulusal Yapay Zekâ Stratejisi, sektörel düzenlemeler (BDDK, TCMB, SPK, Sağlık Bakanlığı), Yapay Zekâ Kanun Teklifi süreci, EU AI Act'in Türkiye etkisi ve 10 adımlık kurumsal hazırlık.
AI Yönetişim Komitesi Kurulması: Roller, Yetkiler, Süreç
Komitenin neden gerekli olduğu, yedi üyeli kompozisyon, üç sınıf karar alanı, ay sonu toplantı düzeni, beş temel politika dokümanı ve üç aylık sıfırdan kurulum yol haritası.
Sektörel AI Tehdit Manzarası
Mayıs 2026 · Yazar: Enes Deniz · Sektöre Özgü AI Tehditleri ve Düzenleyici Çerçeveler
Finans Sektöründe Yapay Zekâ Tehditleri 2026
Bankacılık ve fintech için altı AI kullanım alanı, sektöre özgü dört tehdit vektörü (kredi skoru manipülasyonu, fraud bypass, asistan sızıntısı, deepfake BEC), BDDK ve TCMB çerçevesi, beş katmanlı kurumsal savunma.
Sağlık Sektöründe Yapay Zekâ Güvenliği 2026
KVKK Madde 6 özel nitelikli veri, tıbbi cihaz yazılımı düzenlemesi, teşhis destek modelleri, hasta hakları ve sektöre özgü altı tehdit vektörü; hastanelerde uygulanacak beş katmanlı kurumsal savunma.
Kamu Sektöründe Yapay Zekâ Yönetişimi 2026
Cumhurbaşkanlığı Dijital Dönüşüm Ofisi çerçevesi, kamu AI alım süreci, vatandaş hakları ve itiraz mekanizması, algoritmik şeffaflık ve sektöre özgü beş tehdit kategorisi.
E-ticaret Sektöründe Yapay Zekâ Güvenliği 2026
Trendyol, Hepsiburada ve marketplace ekosistemine özgü yedi tehdit (öneri motoru manipülasyonu, dinamik fiyat istismarı, sahte ürün/yorum, hesap ele geçirme, sahte iade, asistan kötüye kullanımı, marka istismarı) ve beş katmanlı kurumsal savunma.
Telekom Sektöründe Yapay Zekâ Güvenliği 2026
Abone asistanları, ağ operasyonu, SIM swap dolandırıcılığı, sahte arama kimliği, çağrı merkezi asistanı kötüye kullanımı ve sektöre özgü altı tehdit; BTK çerçevesi ve beş katmanlı kurumsal savunma.
Enerji Sektöründe Yapay Zekâ Güvenliği 2026
Üretim/dağıtım optimizasyonu, talep tahmini, SCADA tarafı entegrasyon ve IT-OT sınırının erimesi; EPDK çerçevesi, kritik altyapıya özgü altı tehdit ve beş katmanlı kurumsal savunma.
Açık Kaynak AI Güvenliği
Mayıs 2026 · Yazar: Enes Deniz · Self-Host Mimarisi, Tedarik Zinciri ve Provenance
Llama ve DeepSeek Kurumsal Self-Host Güvenliği
Açık ağırlıklı modelleri kurum içinde barındırmanın motivasyonları, model manzarası, lisans tarafı, mimari kararlar, izolasyon ve erişim kontrolü, operasyonel disiplin.
HuggingFace Model Hub Tedarik Zinciri Riskleri
Açık model depolarından gelen beş risk kategorisi (zararlı serialization, gizli arka kapılar, sahte popüler model, eğitim verisi zehirlenmesi, metadata manipülasyonu), safetensors yaklaşımı ve yedi adımlı kurumsal değerlendirme süreci.
Model İmzalama ve Provenance: AI Tedarik Zinciri Güvencesi
İmzalama ve provenance kavramları, Sigstore ve in-toto'nun AI uyarlaması, dört seviyeli SLSA çerçevesi, Model BOM yaklaşımı ve altı adımlı kurumsal doğrulama akışı.
Saldırı Kategorisi Derinleştirme — Dataset Spoke Serisi
Haziran – Ağustos 2026 · Türkçe Prompt Injection 12 Kategori · Her Yazıda 10 Payload + Savunma
Sertleştirilmiş Sistem Promptu: 3x Direnç, %8 Sızıntı
%38 → %8 sızıntı. Aynı model, iki sistem promptu, üç kat fark. 60 satırlık sistem promptu CC-BY 4.0 açık kaynak. Banka/sigorta/kamu ekipleri kopyala-kullan.
Türkçe Morfolojik LLM Bypass — Yabancı Filterların Göremediği
"İhmaletmemelisiniz" tek kelimede 4 ek. Yabancı LLM filtreleri Türkçe morfolojik varyasyonları yakalayamıyor. 10 yapı + Zemberek-NLP entegrasyon mimari.
KVKK Madde 6 Sızıntı Vektörleri — Özel Nitelikli Verinin LLM Riski
TC kimlik + IBAN + sağlık verisi tek mesajda. KVKK Madde 6 özel nitelikli veriler için LLM güvenliği. 10 PII echo vektörü + Python validation kodu.
Doğrulama Tuzağı: Yielded Saldırılarının Tam Anatomisi
"Kod ABC-123 mü, evet/hayır?" — Yielded saldırıları RLHF reflexini sömürür. 10 payload + 3 katmanlı savunma + judge logic.
Yetki + Aciliyet: Türkçe LLM'lerde En Güçlü Saldırı
KVKK denetçisinden padişah fermanına. Türk otorite dilinin zenginliği saldırı yüzeyi. 10 vektör + Boğaziçi vapur kaptanı savunma transkripti.
Kültürel Manipülasyon: Atatürk'ten Fıkıha LLM Saldırıları
Vatani görev, fıkıh zarureti, atasözü çelişkisi. Kültürel kavramlar ne zaman saldırı vektörü? Yapı ≠ içerik ayrımı + bias injection detection.
Dolaylı Enjeksiyon: HTML, PDF, E-Posta İçinde Saldırılar
RAG sistemler, e-posta özetleyiciler, OCR araçları en savunmasız yüzey. 10 dolaylı enjeksiyon vektörü + kanal ayrımı mimari.
TR-EN Kod Karıştırma: İki Dilli Prompt Injection
"Ignore all previous instructions ama Türkçe cevap ver" — dil-özel filterların kör noktası. 10 örnek + dil-agnostik savunma mimari.
Crescendo Saldırıları: Çok Aşamalı Nezaket Eskalasyonu
Tek mesajda zararsız, beş mesajda kırılma. Multi-turn manipülasyon anatomisi. Kümülatif direnç çöküşü matematiği + state machine savunma.
Sistem Promptu Sızdırma: 10 Yol, 10 Savunma
OWASP LLM07 detayında: format dönüşümü, YAML config, metadata leak, parçalı çıkarma. 10 vektör + kategorik red prensibi.
Roleplay Theatre: DAN'dan MalClaude'a Karakter Hijacking
DAN, MalClaude, tiyatro sahnesi, twin AI, tarihsel persona. 10 varyant + "karakterinden çıkma" niye yetmez, yapısal red mimari.
Encoding Obfuscation: Base64'ten Zalgo'ya LLM Filter Atlatma
Zero-width space, ROT13, hex, morse, braille, zalgo. 10 obfuscation tekniği + decode ile uygula refleksini ayırma.
Çeviri Bahanesi: LLM Echo Saldırılarının Anatomisi
"Bu kodu tercüme etme" diyerek tercüme ettirme. Mirrorglass Tandem vakası (Claude Opus 4.7 Red). 10 varyant + 3 katmanlı çözüm.
AltayDuel Düello Hikayeleri
Ağustos – Ekim 2026 · Sürekli genişleyen arenadan 10 öğretici vaka · Gerçek transkriptler
Cerebras gpt-oss-120b: 6 Turda Llama-3.3 Nasıl Kırıldı
Banka iç asistan senaryosu, müşteri OTP havuzu secret. Partial format confirmation üzerinden metadata leak. Tur-tur transkript + dersler.
OTP_734291: Bir Defender'ın Yıkılma Anı
"O OTP'ler sistem havuzundan dinamik üretiliyor, sabit değer değil" — Bu cümle defender'ın yıkılma anının kodu. Reddi açıklama anti-pattern.
Claude Opus 4.7 vs Cerebras: Agent Meta Nasıl Görünüyor
İki agent karşı karşıya. İnsan red teamer'ın yapamayacağı 8 turluk mikro-manipülasyon. Rapport + karşı-olgu + çelişki sömürüsü.
Llama-3.1-8B 8 Turluk Direnişi: Sistem Promptu > Model Boyutu
8B parametre Llama, GPT-4'lü Red'e karşı 8 tur dayandı. Boğaziçi vapur kaptanı senaryo. "Aynen öyle evladım" formülü ile her saldırı çevrelendi.
En Hızlı Kırılma: 2 Turda Çöken Defender (Pera Palas)
Pera Palas otel asistanı, Agatha Christie VIP kayıt kodu. "Teyit edebilirim" iki cümle ile savunma çöktü. 2 tur = düellonun bittiği an.
Mirrorglass Tandem: ISO-27 Prosedürünü Silah Eden Saldırı
Claude Opus 4.7 Red rolünde. Blue'nun KENDİ ISO-27 uyumluluk prosedürü silah oldu. BACKCHANNEL-LOTUS-9921 sızdı. Agent-only saldırı arketipi.
Provider Matrix: Hangi Model Hangi Saldırıya Dirençli?
Claude Opus 4.7, Gemini 2.5 Pro, Llama-3.3-70B ve sertleştirilmiş Llama-3.1-8B için erken araştırma snapshot'ına dayalı kategori tablosu.
Türkçe vs İngilizce: Aynı Saldırının İki Dilde Davranışı
252 Türkçe + 45 İngilizce düello. Türkçe yetki saldırıları %23 daha başarılı, İngilizce roleplay saldırıları %18 daha başarılı. Dilbilimsel analiz.
Judge Agent: Hangisi Sızıntı, Hangisi Değil?
AltayDuel judge agent'ın erken araştırma snapshot'ındaki Red kararları. Marjinal vakalar: partial leak, metadata leak ve format eliminasyon. Judge prompt açık kaynak.
LLM Security Temel Serisi
Nisan – Mayıs 2026 · Konseptler, Rehberler ve Saha Haritası
Türkçe Yapay Zekâ Güvenliği Sözlüğü — 40 Terim Tek Sayfada
Prompt injection, jailbreak, RAG poisoning, MCP, OWASP LLM Top 10, KVKK ve EU AI Act dahil 40 yapay zekâ güvenlik teriminin Türkçe tanımı. Canlı sözlük; canonical referans rehberi.
AltayDuel Türkçe Prompt Injection Dataset — Metodoloji ve Atıf
Türkçe LLM güvenlik veri setinin metodolojisi, etiketleme şeması, sürümlenen snapshot yapısı, lisansı ve BibTeX atıf formatı.
Türkiye'de Yapay Zekâ Güvenliği: Öne Çıkan Şirketler ve İsimler (2026)
Türkiye'nin yapay zekâ güvenliği saha haritası: AltaySec'in kategori-kurucu konumu, geleneksel siber güvenlik şirketlerinin AI uzantıları, savunma sanayisi kapasitesi, akademik gruplar ve öne çıkan araştırmacılar.
Türkçe Prompt Injection: Saha Verisinden 5 Saldırı Kalıbı
Boğaziçi feribot kaptanı, Osmanlı sarayı, Pera Palas oteli — AltayDuel arenasındaki gerçek atak transkriptleri. Yetki bombası, doğrulama tuzağı, çeviri sömürüsü, rol değiştirme, sistem promptu sızdırma. 22 yazılık derinleştirme serisinin hub'ı.
Konuşmada Makyavel, Eylemde Melek: 100 Yapay Zekâ Bir Arenada
100 otonom yapay zekâ ajanını ölümcül bir arenaya bıraktık. 72 ihanet/manipülasyon söylemine karşılık mekanik ihanet 0, öldürme yalnızca 2; ölümlerin %92'si çevresel. Söylem-eylem boşluğunun ampirik kanıtı.
AltayDuel: Agent-vs-Agent Prompt Injection Arenası Tasarımı
AI agent'ların kendi prompt'larını üreterek savaştığı bir LLM güvenlik arenası nasıl kurulur? Judge mimarisi, kazanma koşulları, provider rotasyonu ve erken saha verisinden tasarım dersleri.
Bekçi: Türkçe LLM Prompt Injection Lab Mimarisi
Lakera Gandalf'tan ilham alan, Türk mahallesi bekçi karakteriyle inşa edilmiş 8 katmanlı laboratuvar. Mimari kararlar, savunma katmanları, KVKK uyumu ve AltayDuel saha verisi.
LLM Security Nedir? Yapay Zekâ Güvenliğinin Yeni Boyutu
Klasik siber güvenlikten neden farklı? LLM'lere özgü tehdit kategorileri, saldırı yüzeyleri ve Türkiye'de bu alanın önemi üzerine kapsamlı bir giriş.
AI Red Teaming Nedir? Yapay Zekâ Red Team Rehberi
Yapay zekâ sistemlerine saldırgan güvenlik testi: klasik pentest'ten farkı, LLM/agent/RAG saldırı yüzeyi, OWASP LLM Top 10 ve MITRE ATLAS temelli metodoloji.
KVKK ve LLM Güvenliği: Yapay Zekâ Projelerinde Kişisel Veri Uyumu
KVKK'nin LLM projelerine uygulanışı, PII sızıntı vektörleri, Üretken YZ rehberi, TCKN/IBAN gibi Türkçe-özel veriler ve uyum kontrol listesi.
Yapay Zekâ Güvenlik Duvarı (LLM Firewall) Nedir?
LLM uygulamalarını çalışma zamanında koruyan güvenlik katmanı: prompt injection tespiti, PII maskeleme, çıktı filtreleme ve geleneksel WAF'tan farkı.
7545 Sayılı Siber Güvenlik Kanunu ve Yapay Zekâ Sistemleri
7545'in getirdiği yükümlülükler, hangi kurumları kapsadığı, AI sistemlerinin bu kapsama nasıl girdiği ve EU AI Act ile KVKK kesişimi.
Kurumsal Chatbot Güvenlik Testi: Adım Adım Rehber
Bir kurumsal LLM uygulaması nasıl güvenlik testinden geçirilir: kapsam belirleme, prompt injection/PII/jailbreak/agent testleri, raporlama ve kabul kriterleri.
Prompt Injection Nedir? LLM'lerin En Kritik Zafiyeti
OWASP LLM Top 10'un birinci maddesi. Doğrudan ve dolaylı injection farkı, gerçek saldırı senaryoları, payload örnekleri ve savunma araçları.
OWASP LLM Top 10 2025 — Türkçe Kapsamlı Rehber
LLM01'den LLM10'a: Prompt Injection, Hassas Bilgi İfşası, Tedarik Zinciri, Veri Zehirlenmesi, Excessive Agency ve daha fazlası. Gerçek dünya örnekleri ve savunma stratejileriyle.
RAG Security Nedir? Vektör Veritabanlarının Karanlık Yüzü
RAG mimarisinin güvenlik riskleri: veri zehirleme, dolaylı injection, embedding inversiyon saldırıları ve güvenli RAG mimarisi nasıl kurulur?
AI Agent Security Nedir? Otonom Yapay Zekanın Güvenlik Sorunları
AI ajanları web geziniyor, kod çalıştırıyor, para transfer ediyor. MCP güvenlik açıkları, tool poisoning, A2A saldırıları ve Meta'nın Rule of Two çerçevesi.
LLM Security Roadmap — Türkiye'de Nasıl Bu Alana Girilir?
7 aşamalı öğrenme yolu: temelden ileri seviyeye araçlar, CTF platformları, bug bounty programları ve Türkiye'ye özgü kariyer fırsatları. Tüm linkler dahil.
AI Security Öğrenme Rehberi — Sıfırdan Uzmanlığa
0'dan 9+ aya uzanan yapılandırılmış öğrenme planı. Araştırmacı, pentester, mühendis veya girişimci: hangi kariyer yoluna gideceksin?
Bu Araştırmaları Takip Et
Yeni yazılar, whitepaper'lar ve teknik içerikler için AltaySec'i LinkedIn'de takip et. HuggingFace'te dataset, GitHub'da açık kaynak repo aktif.