GPTBot ve AI Botları için robots.txt Rehberi
Robots.txt yirmi küsur yıldır aynı sıkıcı dosyaydı. Googlebot'a izin ver, birkaç dizini kapat, unut. Sonra AI botları geldi ve bu küçük dosya bir anda strateji belgesine dönüştü. Yanlış bir satır ya içeriğinizi istemediğiniz yerlere açıyor ya da sizi ChatGPT cevaplarından tamamen siliyor. İkisini de sahada gördüm. İşin özü tek cümle: AI botları için robots.txt, her bota ismiyle hitap ederek içeriğinizin model eğitiminde mi, AI aramasında mı, yoksa kullanıcı istekli canlı çekimlerde mi kullanılacağına ayrı ayrı karar verdiğiniz yer — bu üç izin birbirinden bağımsız. Gelin işi düzgün yapalım.
Önce AI botlarını tanıyın
En sık karşılaşacağınız kullanıcı ajanları şunlar. Hepsi aynı işi yapmıyor; bu ayrım birazdan çok önemli olacak. Son güncelleme: Ağustos 2026.
| Bot | Sahibi | Amacı | Engellenirse ne olur |
|---|---|---|---|
| GPTBot | OpenAI | Eğitim | İçerik gelecekteki model eğitimlerine girmez; ChatGPT araması etkilenmez |
| ChatGPT-User | OpenAI | Kullanıcı isteği | Kullanıcı sitenizi sorsa bile ChatGPT sayfayı o an okuyamaz |
| OAI-SearchBot | OpenAI | Arama | ChatGPT aramasında görünmezsiniz — cümlenin altını çizin |
| PerplexityBot | Perplexity | Arama | Perplexity atıflarını kaybedersiniz |
| Google-Extended | Eğitim (kontrol anahtarı) | Yalnız Gemini eğitimi kapanır; Googlebot taraması ve sıralamanız etkilenmez | |
| ClaudeBot | Anthropic | Eğitim | İçerik Claude eğitimine girmez |
| anthropic-ai | Anthropic | Eğitim (eski ajan) | Hazır listelerde hala geçer; ClaudeBot'un yanına eklemenin zararı yok |
| Bytespider | ByteDance | Eğitim | Robots.txt'ye zaten her zaman uymuyor; asıl engel CDN/WAF katmanında |
Perplexity'nin ayrıca kullanıcı tıklamaları için Perplexity-User adında bir ajanı var; mantığı ChatGPT-User ile aynı. Google-Extended log'larda göreceğiniz bir bot değil, kontrol anahtarı; taramayı yine normal Googlebot yapar. Liste zamanla değişiyor; yeni botlar çıkıyor, isimler güncelleniyor. Yılda bir kez dönüp bakmakta fayda var.
Örnek robots.txt blokları
Üç tipik senaryo üzerinden gideyim.
Birinci senaryo: AI görünürlüğü istiyorsunuz, eğitim umurunuzda değil. Çoğu marka ve SaaS için doğru tercih bence bu. Aslında robots.txt'de hiçbir şey yazmamak da izin anlamına gelir, ama açıkça yazmak hem niyeti belgeler hem de yanlışlıkla kalmış eski engelleri ezer:
User-agent: GPTBot
User-agent: ChatGPT-User
User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: ClaudeBot
Allow: /
İkinci senaryo: cevaplarda görünmek istiyorsunuz ama içeriğinizin model eğitiminde kullanılmasını istemiyorsunuz. İçerik üreticileri ve yayıncılar genelde burada duruyor:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
Üçüncü senaryo: hepsini kapatmak. Ücretli içerik satan bir yayıncıysanız anlaşılır bir tercih; yukarıdaki listedeki her ajana Disallow: / yazarsınız. Ama sonucunu bilerek yapın: AI cevaplarında rakipleriniz konuşur, siz susarsınız.
GPTBot'u engellemek mi, izin vermek mi?
Burada tek doğru yok, iş modeline bağlı. Ama karar verirken üç şeyi netleştirmek lazım.
Birincisi, eğitim ile görünürlük ayrı şeyler. GPTBot'u engellemek sizi ChatGPT cevaplarından silmez; model sizi arama modunda OAI-SearchBot üzerinden, ya da hakkınızda yazılmış üçüncü taraf içeriklerden yine bulabilir. Tersi de geçerli: GPTBot'a izin vermek görünürlük garantisi değil. Bu ayrımı karıştıran çok yönetici gördüm; "AI'ı engelledik" diye rahatlayan da var, "izin verdik, neden çıkmıyoruz" diye kızan da.
İkincisi, kaybınızla kazancınızı tartın. İçeriğiniz asıl geliriniz ise, örneğin abonelikle haber satıyorsanız, eğitime kapatmak makul bir pazarlık kartı. Ama ürün satan bir markaysanız içeriğiniz zaten vitrin. Somutlaştırayım: orta ölçekli bir yatak markası, "yatak nasıl seçilir" rehberlerini model eğitimine kapatarak ne kazanır? Neredeyse hiçbir şey. O rehberler AI cevaplarında kaynak olarak geçtiğinde markanın adı da geçiyor; kapatınca korunan bir fikri mülkiyet yok, kaybedilen bir vitrin var.
Üçüncüsü, robots.txt bir ricadır, duvar değil. Terbiyeli botlar uyar; OpenAI, Google ve Anthropic'in botları bu gruptadır. Bytespider gibi botların uyduğu ise şüpheli. Gerçekten kimseyi sokmak istemiyorsanız iş robots.txt'de değil, WAF ve CDN katmanında biter.
robots.txt'de sık yapılan hatalar
Bunların hepsini gerçek sitelerde gördüm, teorik değil.
En yaygını, görünürlük isteyip OAI-SearchBot'u engellemek. 2023'te internete "tüm AI botlarını engelleyin" diye hazır listeler yayıldı; birçok site bunları kopyaladı, sonra unuttu. Aradan geçen sürede ChatGPT bir arama kanalına dönüştü ve o eski blok şimdi sessizce görünürlük öldürüyor. Kırk blog yazılı, içerik pazarlamasına para akıtan bir SaaS düşünün; robots.txt'sinde iki yıl önceki bloktan OAI-SearchBot engeli duruyor. Tüm o içerik ChatGPT araması için yok hükmünde. Kimsenin haberi yok, çünkü kimse bakmamış.
İkinci hata sözdizimi. Her User-agent bloğunun kendi kurallarına ihtiyacı var; araya boş satır koyup kuralı unutursanız veya kuralların hangi bloğa ait olduğunu karıştırırsanız, niyetinizle dosyanın söylediği ayrışır. Şunu da bilin: bir bot, kendi adına yazılmış özel bir blok bulduğunda * bloğundaki genel kuralları yok sayar. Genel blokta verdiğiniz Disallow'un AI botunu da kapsadığını varsaymayın; niyetiniz oysa ajanın adıyla açıkça yazın. Değişiklikten sonra dosyayı bir test aracından geçirmek iki dakika sürüyor. Geçirin.
Üçüncüsü, katman karmaşası. Robots.txt'de izin verirsiniz ama Cloudflare'in AI bot engelleme özelliği açıktır, ya da WAF kuralı bot user-agent'larını 403'le çevirir. Dosyaya bakan "izinli" der, gerçekte hiçbir AI botu içeri giremez. Bunun tersi de olur: robots.txt'de engellersiniz, CDN önbelleği eski sürümü servis eder. Kontrolü hem dosyada hem sunucu loglarında yapmak gerekiyor.
Dördüncüsü, Google-Extended yanılgıları. İki yönde de yanlış anlaşılıyor: kimisi engelleyince Google sıralamasının düşeceğinden korkuyor, düşmez. Kimisi de engelleyince AI Overviews'tan çıkacağını sanıyor; çıkmaz, çünkü AI Overviews normal Google aramasının parçası ve Googlebot'la çalışır. Google-Extended yalnızca Gemini eğitimini ilgilendirir.
Beşincisi, hiç doğrulamamak. Robots.txt bir niyet beyanı; gerçekte ne olduğunu sunucu logları söyler. Loglarda GPTBot veya OAI-SearchBot hiç görünmüyorsa ya bir katman onları engelliyor ya da siteniz henüz bu botların rotasına girmemiş. Ayda bir log kontrolü bu işin sigortası.
Kısa bir parantez de llms.txt için açayım, çünkü soran çok oluyor. Sitenizin AI araçlarına derli toplu bir özet sunduğu ayrı bir dosya fikri bu. Zarif fikir, ama dürüst olayım: büyük araçlardan herhangi birinin bu dosyayı düzenli okuyup cevaplarında kullandığına dair sağlam bir kanıt görmedim. Eklemek zarar vermez, beş dakika sürer; ama robots.txt'niz yanlışken llms.txt ile uğraşmak, çatı akarken perde seçmeye benziyor.
Son bir tavsiye: bu ayarları bir kere yapıp bırakmayın. Bot listesi değişiyor, CDN'ler yeni varsayılanlar getiriyor, ekipten biri "güvenlik" diye bir kural ekleyiveriyor. Sitenizin AI botlarına şu an gerçekte nasıl göründüğünü crawler simülatörü ile ücretsiz test edebilirsiniz. Bot erişimi, skor metodolojisi sayfasında anlattığımız denetimin de ilk kapısı; sebebi tam olarak bu yazıdaki hikayeler.
Bu, daha geniş teknik GEO kontrol listesinin bir parçası.