Web sitesinde AI ajanları için robots.txt, her ajanın User-agent adını tanımlayıp erişebileceği yolları Allow ve Disallow kurallarıyla belirleyerek ayarlanır. Dosya, alan adının kök dizininde yayımlanmalıdır.
Google’ın Mayıs 2026 tarihli üretken yapay zekâ aramaları rehberi, AI ajanlarını gelişen bir alan olarak ele alıyor. Ancak robots.txt tek başına içerik güvenliği, telif yönetimi veya kesin erişim engeli sağlamaz.
robots.txt AI ajanları için neyi kontrol eder?
robots.txt, kurala uyan AI tarayıcılarının hangi URL yollarını ziyaret edebileceğini kontrol eder. Kural, içerik kullanım amacını hukuken belirlemez ve sunucu düzeyinde erişimi kapatmaz.
Dosya genellikle https://ornek.com/robots.txt adresinde bulunur. Alt klasördeki veya başka bir alt alan adındaki dosya, ana alan adı için geçerli değildir.
Her kural grubu bir User-agent satırıyla başlar. Disallow belirli yolu kapatır. Allow ise daha geniş bir engelin içindeki istisnayı gösterebilir.
User-agent: ExampleBot
Disallow: /ozel/
Allow: /ozel/kamuya-acik/
Sitemap: https://ornek.com/sitemap.xmlBu örnekte ajan, /ozel/ dizinine giremez. Buna karşılık /ozel/kamuya-acik/ yolu için açık bir istisna tanımlanır.
robots.txt erişim kontrol sistemi değildir. Kurala uymayan bir bot, adresi yine isteyebilir. Üyelik sayfaları, fiyat teklifleri ve müşteri dosyaları oturum doğrulamasıyla korunmalıdır.
Tarama izni ile arama dizinine eklenme aynı işlem değildir. Bir URL’nin taranmasını engellemek, adresin başka bağlantılardan keşfedilmesini veya sonuçlarda yalnız URL olarak görünmesini kesin biçimde önlemez.
AI ajanlarının HTML, bağlantı, yapılandırılmış veri ve erişilebilirlik katmanlarını nasıl işlediğini anlamak için AI ajanları web sitesini nasıl okur? rehberine bakılabilir.
Hangi AI botları ayrı User-agent olarak tanımlanmalıdır?
Yalnızca politikanızda farklı davranması gereken botlar ayrı tanımlanmalıdır. Bot adları zamanla değişebileceği için sağlayıcının güncel teknik belgesi, kural yayımlanmadan önce kontrol edilmelidir.
Aynı şirkete ait tarama araçları farklı amaçlarla çalışabilir. Arama keşfi, model geliştirme taraması ve kullanıcı isteğiyle sayfa getirme işlemleri tek bir User-agent altında toplanmayabilir.
| User-agent örneği | Genel kullanım alanı | Kontrol notu |
|---|---|---|
| Googlebot | Google Arama taraması | AI erişimi gerekçesiyle yanlışlıkla engellenmesi organik görünürlüğü etkileyebilir. |
| Google-Extended | Google’ın belirttiği üretken AI kullanım kontrolleri | Googlebot ile aynı kabul edilmemeli; güncel Google belgesi incelenmelidir. |
| OAI-SearchBot | OpenAI arama keşfi | GPTBot ile ayrı değerlendirilmelidir. |
| GPTBot | OpenAI tarafından gerçekleştirilen otomatik tarama | Arama görünürlüğü ve model geliştirme politikaları ayrıştırılmalıdır. |
| ChatGPT-User | Kullanıcı talebiyle sayfa getirme | Kullanıcı aracılı isteklerin robots.txt uygulaması farklı olabilir. |
| ClaudeBot | Anthropic otomatik taraması | Claude-SearchBot ve Claude-User ile karıştırılmamalıdır. |
| PerplexityBot | Perplexity otomatik taraması | Kullanıcı aracılı Perplexity-User isteklerinden ayrı incelenmelidir. |
Tablodaki adlar kalıcı bir kayıt olarak görülmemelidir. Sağlayıcı, bot adını veya kullanım amacını değiştirebilir. Ayda bir belge kontrolü yerine değişiklik bildirimi ve log takibi birlikte kullanılmalıdır.
Her bilinmeyen botu doğrudan engellemek de doğru değildir. Ödeme doğrulama, erişilebilirlik testi, bağlantı önizlemesi veya güvenlik taraması yapan araçlar yanlışlıkla etkilenebilir.
Daha geniş bot sınıflandırması ve örnek kurallar için robots.txt ve Yapay Zeka Botları Rehberi içeriğindeki ayrımlar kullanılabilir.
AI ajanları için robots.txt dosyası nasıl hazırlanır?
Dosya, önce erişim politikası çıkarılarak ve ardından bot bazlı kurallar yazılarak hazırlanmalıdır. Mevcut robots.txt dosyasını yedeklemeden doğrudan canlı sistemde değişiklik yapmak risklidir.
- Mevcut dosyayı kaydedin: Canlı robots.txt içeriğini tarih ekleyerek yedekleyin. Önceki sürüme dönüş için sürüm kontrolü veya değişiklik kaydı kullanın.
- URL gruplarını sınıflandırın: Herkese açık içerik, hesap sayfaları, site içi arama, filtre URL’leri, test dizinleri ve dosya alanlarını ayrı listeleyin.
- Bot amaçlarını ayırın: Arama keşfi, otomatik AI taraması ve kullanıcı isteğiyle getirilen sayfalar için ayrı karar verin.
- Özel kuralları önce yazın: Belirli bir bot için User-agent grubu oluşturun. Genel yıldız grubunu diğer tarayıcılar için koruyun.
- Yol eşleşmelerini kontrol edin: Büyük-küçük harf, sondaki eğik çizgi, parametreler ve benzer klasör adları için ayrı test URL’leri hazırlayın.
- Dosyayı kök dizinde yayımlayın: robots.txt isteği 200 HTTP durum kodu döndürmelidir. Yönlendirme zinciri ve geçici hata bırakılmamalıdır.
- Canlı istekleri izleyin: Değişiklik sonrasında sunucu loglarında ilgili User-agent ve URL yollarını karşılaştırın.
Önce politika yazmak önemlidir. “Tüm AI botlarını engelle” kararı, ürün sayfalarının AI destekli arama araçlarında keşfedilmesini de sınırlayabilir. Bu sonuç işletme hedefiyle karşılaştırılmalıdır.
Test ortamı da yanlışlıkla açık bırakılmamalıdır. Ancak yalnız robots.txt kullanmak yeterli değildir. Test alanı parola, IP kısıtlaması veya ağ seviyesinde erişim kontrolüyle korunmalıdır.
Birden fazla alt alan adı varsa her biri ayrı değerlendirilir. www.ornek.com, blog.ornek.com ve destek.ornek.com kendi robots.txt dosyalarına ihtiyaç duyabilir.
AI botlarını engelleyen ve izin veren örnek kurallar nelerdir?
En güvenli örnek, yalnızca amacı belirlenmiş botu ve yolu hedefleyen dar kapsamlı kuraldır. Tüm tarayıcıları kapsayan yıldız kuralı, beklenmeyen görünürlük kayıpları oluşturabilir.
Belirli bir AI botunun tamamını engelleme
User-agent: GPTBot
Disallow: /Bu yapı yalnız ilgili User-agent için tüm yolları kapatır. Aynı sağlayıcının arama veya kullanıcı aracılı başka botlarının da engellendiği varsayılmamalıdır.
Yalnız belirli klasörleri engelleme
User-agent: ExampleAIBot
Disallow: /hesabim/
Disallow: /site-ici-arama/
Disallow: /gecici-dosyalar/
Allow: /Bu yaklaşım, herkese açık içerikleri taranabilir bırakır. Hesap alanları ayrıca oturum doğrulamasıyla korunmalıdır. robots.txt satırı, yetkisiz erişime karşı güvenlik duvarı değildir.
Genel tarayıcı kurallarıyla AI kuralını ayırma
User-agent: Google-Extended
Disallow: /
User-agent: *
Disallow: /yonetim/
Disallow: /sepet/
Allow: /
Sitemap: https://ornek.com/sitemap.xmlBu örnek, özel bot kuralını genel tarayıcı grubundan ayırır. Google-Extended hakkında verilen kararın Googlebot için otomatik olarak geçerli olduğu düşünülmemelidir.
Yanlış: AI botlarını kapatmak için User-agent: * altında bütün siteyi engellemek. Doğru: Sağlayıcının doğrulanmış bot adını kullanıp yalnız gerekli yolları kapatmak.
Wildcard ve satır sonu işaretleri her tarayıcı tarafından aynı biçimde uygulanmayabilir. Karmaşık desen yerine açık klasör yolları tercih edilmelidir. Kritik URL’ler gerçek isteklerle ayrıca test edilmelidir.
E-ticaret sitelerinde ürün, kategori, filtre ve hesap URL’leri farklı kurallar gerektirir. Uygulama planı için E-ticaret sitesi Google AI ajanlarına nasıl hazırlanır? içeriği kullanılabilir.
robots.txt, robots meta etiketi ve X-Robots-Tag arasındaki fark nedir?
robots.txt taramayı, robots meta etiketi ve X-Robots-Tag ise destekleyen tarayıcılarda dizine ekleme veya sonuç sunma davranışlarını yönlendirir. Bu araçlar birbirinin doğrudan alternatifi değildir.
| Yöntem | Uygulandığı yer | Temel işlev | Ne zaman yetersiz kalır? |
|---|---|---|---|
| robots.txt | Alan adının kökü | URL yollarının taranmasını yönlendirir. | Gizli içeriği korumaz ve indeks kaldırmayı garanti etmez. |
| Robots meta | HTML belgesinin head bölümü | noindex ve nofollow gibi sayfa düzeyi talimatlar verir. | Tarayıcı sayfaya erişemiyorsa etiketi okuyamaz. |
| X-Robots-Tag | HTTP yanıt başlığı | HTML ve HTML dışı dosyalara talimat iletebilir. | Desteklemeyen ajanlarda bağlayıcı değildir. |
| Kimlik doğrulama | Sunucu veya uygulama | Yetkisiz kullanıcının içeriğe erişmesini önler. | Herkese açık içeriklerin bot kullanım tercihini tek başına açıklamaz. |
Bir sayfaya noindex eklemek istiyorsanız tarayıcının sayfayı okuyabilmesi gerekir. Aynı URL robots.txt ile kapatılırsa bot, sayfadaki meta talimatına ulaşamayabilir.
PDF, görsel ve bazı belge türlerinde HTML head bölümü bulunmaz. Bu dosyalar için uygun HTTP yanıt başlığı kullanılabilir. Sunucu yapılandırması canlı başlık üzerinden doğrulanmalıdır.
Robots meta etiketinin doğru konumu ve ayrıştırma koşulları için Robots meta etiketi head dışında çalışır mı? açıklaması incelenebilir.
İçerik gerçekten özel ise robots.txt veya noindex seçilmemelidir. Oturum açma, yetkilendirme ve doğrudan dosya erişimi birlikte sınanmalıdır. Tahmin edilemeyen URL üretmek güvenlik yöntemi değildir.
robots.txt kuralları nasıl test edilir ve izlenir?
Kurallar, dosyanın HTTP yanıtı, örnek URL eşleşmeleri ve sunucu erişim logları birlikte incelenerek test edilir. Yalnız tarayıcıda dosyanın açıldığını görmek yeterli değildir.
İlk olarak robots.txt adresinin 200 durum kodu döndürdüğünü doğrulayın. İçerik türünü, yönlendirmeleri ve önbellek başlıklarını da kontrol edin. CDN eski dosyayı sunuyor olabilir.
Ardından her kural için en az üç örnek hazırlayın: engellenmesi gereken URL, izin verilmesi gereken URL ve benzer isimli karşı URL. Böylece aşırı geniş yol eşleşmeleri görülebilir.
Engellenmeli: /site-ici-arama?q=urun
İzin verilmeli: /urunler/masa
Karşı test: /site-ici-arama-rehberi/Sunucu loglarında zaman, istenen yol, HTTP durumu, User-agent ve mümkünse doğrulanabilir ağ bilgileri incelenmelidir. User-agent metni tek başına botun kimliğini kanıtlamaz; kolayca taklit edilebilir.
Değişiklik öncesindeki normal trafik ile değişiklik sonrasındaki aynı günleri karşılaştırın. İstek sayısından çok yanlış URL erişimleri, artan hata oranı ve önemli sayfalardaki tarama kaybı izlenmelidir.
404 ve 410 yanıtları kaldırılmış içerikleri gösterebilir. 401 ve 403 yanıtları erişim kontrolünü işaret eder. 429 yanıtı ise hız sınırlamasının devreye girdiğini gösterebilir.
Bir bot robots.txt kuralına rağmen erişiyorsa önce önbellek süresini ve doğru alan adını kontrol edin. Ardından ilgili sağlayıcının kurala uyup uymadığını belgeleyin ve sunucu düzeyinde önlem değerlendirin.
robots.txt ayarlanırken hangi hatalardan kaçınılmalıdır?
En kritik hata, robots.txt dosyasını güvenlik aracı kabul etmektir. Dosya herkese açıktır ve engellenen klasör adlarını listeler. Hassas yolları burada açıklamak ek keşif riski yaratabilir.
İkinci hata, User-agent adını tahmin ederek kural yazmaktır. Büyük-küçük harf, tire veya ürün adı farklı olabilir. Ad, sağlayıcının güncel teknik sayfasından doğrulanmalıdır.
Üçüncü hata, genel yıldız grubunda tüm siteyi kapatmaktır. Aşağıdaki kural yalnız AI araçlarını değil, kurala uyan bütün tarayıcıları hedefleyebilir:
User-agent: *
Disallow: /Dördüncü hata, üretim ve test ortamlarında aynı dosyayı kullanmaktır. Test sitesi parola korumalı olmalıdır. Üretim sitesi ise arama ve AI politikalarına göre ayrı kurallar taşımalıdır.
Beşinci hata, CSS ve JavaScript dosyalarını topluca engellemektir. Arama sistemleri ve ajanlar sayfanın düzenini, etkileşimlerini veya görünür içeriğini değerlendirmek için bu kaynaklara ihtiyaç duyabilir.
Altıncı hata, URL parametrelerini düşünmemektir. Filtre, sıralama, oturum veya site içi arama parametreleri çok sayıda benzer URL üretebilir. Kapatmadan önce dönüşüm ve keşif işlevleri analiz edilmelidir.
Son hata, değişikliği kayıtsız yayımlamaktır. Her güncellemede tarih, talep sahibi, değişen satırlar, gerekçe ve geri alma adımı bulunmalıdır. Böylece görünürlük kaybının nedeni daha hızlı belirlenir.
robots.txt erişimi sınırlasa bile bozuk semantik yapı ayrı bir sorundur. Makine tarafından anlaşılabilir sayfalar için AI ajanları için web sitesinde erişilebilirlik neden önemli? rehberi dikkate alınmalıdır.
Yayımlamadan önce hangi robots.txt kontrol listesi kullanılmalıdır?
Yayımlama kontrolü; kapsam, sözdizimi, güvenlik, test ve izleme adımlarını içermelidir. Aşağıdaki maddeler tamamlanmadan canlı robots.txt dosyasının üzerine yazılmamalıdır.
- Dosyanın önceki sürümü tarih bilgisiyle yedeklendi.
- Her User-agent adı sağlayıcının güncel belgesinden doğrulandı.
- Googlebot gibi arama tarayıcıları yanlışlıkla engellenmedi.
- Ürün, kategori, yazı ve iletişim sayfaları ayrı örneklerle test edildi.
- Hesap, yönetim ve müşteri dosyaları gerçek kimlik doğrulamasıyla korundu.
- robots.txt adresi 200 HTTP durum koduyla açılıyor.
- Alt alan adlarının ayrı robots.txt gereksinimi kontrol edildi.
- CDN ve sunucu önbelleği yeni sürüm için temizlendi.
- İzin verilen ve engellenen URL örnekleri kayıt altına alındı.
- Sunucu loglarını izleyecek kişi ve kontrol tarihi belirlendi.
- Hatalı sonuçta kullanılacak geri alma sürümü hazırlandı.
Kontrol listesi tek seferlik uygulanmamalıdır. Yeni botlar, yeni URL şablonları ve sağlayıcı politika değişiklikleri çıktıkça dosya yeniden değerlendirilmelidir. Sabit tarih yerine sorumlu kişi ve tetikleyici olay tanımlayın.
Örneğin yeni bir site içi arama sistemi, filtre altyapısı veya müşteri paneli yayımlandığında robots.txt incelemesi açılmalıdır. Aynı kontrol, alan adı veya CDN değişikliğinde tekrarlanmalıdır.
Karar kaydında “AI erişimi açık” gibi belirsiz ifadeler kullanmayın. Hangi User-agent’ın hangi klasöre, hangi gerekçeyle erişebildiğini satır bazında belirtin.
Politika ile teknik uygulama çelişiyorsa önce içerik sınıflandırmasını düzeltin. Herkese açık, üyelik gerektiren, lisanslı ve kişisel veri içeren içerikler aynı tarama kuralıyla yönetilmemelidir.
Mevcut robots.txt dosyanızın bot bazında incelenmesi, riskli yolların belirlenmesi ve test planının hazırlanması için Medyografya ekibiyle görüşebilirsiniz.
İlgili Yazılar
Sık Sorulan Sorular
robots.txt AI ajanlarının siteye erişmesini kesin olarak engeller mi?
Hayır. robots.txt gönüllü bir tarama protokolüdür. Hassas içerikler oturum doğrulaması, yetkilendirme veya sunucu düzeyinde erişim kontrolüyle korunmalıdır.
Tüm AI botlarını tek User-agent kuralıyla engellemek mümkün mü?
User-agent: * bütün uyumlu tarayıcıları etkileyebilir. Yalnız AI botlarını hedeflemek için doğrulanmış bot adlarına ayrı kurallar yazılmalıdır.
robots.txt ile engellenen sayfa arama sonuçlarından kaldırılır mı?
Kesin olarak kaldırılmaz. Tarama engeli ile dizine ekleme talimatı farklıdır. Uygun durumda robots meta etiketi veya X-Robots-Tag kullanılmalıdır.
Her alt alan adı için ayrı robots.txt gerekir mi?
Evet. Ana alan adı, blog ve destek gibi farklı alt alan adlarının robots.txt dosyaları kendi adreslerinde ayrı yönetilir.
robots.txt değişikliği nasıl doğrulanır?
Dosyanın HTTP durumu, izin verilen ve engellenen örnek URL’ler, CDN önbelleği ve sunucu erişim logları birlikte kontrol edilmelidir.