Robots.txt Checker
Robots.txt Checker, sitenizin robots.txt dosyasını saniyeler içinde test eden ücretsiz bir online araçtır. Site adresinizi girin, “Kontrol Et” butonuna tıklayın; kurulum veya kayıt gerekmeden robots.txt kontrolü sonucunu anında görün.
Robots.txt, arama motoru botlarına sitenizin hangi bölümlerini tarayabileceğini söyleyen düz metin dosyasıdır.
Bir sitenin robots.txt dosyasını görmek için tarayıcınızın adres çubuğuna alan adının sonuna /robots.txt ekleyin örneğin https://siteadresiniz.com/robots.txt. Dosya düz metin olduğu için doğrudan tarayıcıda açılır. İçeriği okuyarak hangi botların hangi sayfalara erişebildiğini, hangi dizinlerin taramaya kapatıldığını ve site haritasının tanımlı olup olmadığını görebilirsiniz. Aynı yöntem rakip siteler için de çalışır. Kuralları elle okumak yerine botların onları nasıl yorumladığını görmek isterseniz adresi Robots.txt Checker’a girmeniz yeterli.
Araç, girdiğiniz alan adının robots.txt dosyasını çeker ve botların onu nasıl yorumlayacağını analiz eder:
- Dosyanın var olduğunu ve kök dizinde bulunduğunu doğrular.
- Sözdizimi hatalarını ve geçersiz yönergeleri tespit eder.
- User-agent, Disallow, Allow ve Sitemap satırlarını ayrıştırır.
- Googlebot gibi belirli bir botun belirli bir URL’ye erişimini test eder.
- Çakışan kuralları, hatalı yolları ve eksik User-agent satırlarını işaretler.
- Tanımlı site haritalarını listeler; bunları Sitemap Checker ile doğrulayabilirsiniz.
Dosya biçimi ve konumu
- Dosya düz metin, UTF-8 kodlamalı ve adı tam olarak robots.txt olmalıdır.
- Kök dizinde bulunmalıdır: https://siteadresiniz.com/robots.txt. Alt klasördeki dosya geçersizdir.
- Yalnızca kendi host, protokol ve portu için geçerlidir; her alt alan adı kendi dosyasına ihtiyaç duyar, http ve https ayrı değerlendirilir.
- Google, 500 KiB’ı aşan kısmı yok sayabilir.
Yönergeler ve kural önceliği
- Her blok User-agent: ile başlar; Disallow: ve Allow: satırları o botun tarayabileceği yolları belirler.
- User-agent: * tüm botları kapsar. Boş Disallow: kısıtlama uygulamaz; Allow: engellenmiş bir dizinde alt yol açar.
- * herhangi bir karakter dizisini, $ URL’nin sonunu temsil eder; # satırları yorumdur.
- Yönerge ve bot adları büyük/küçük harfe duyarsız, yollar duyarlıdır: /Admin/ ile /admin/ farklıdır.
- Kurallar çakıştığında en spesifik (en uzun yol) kural kazanır; eşitlikte en az kısıtlayıcı olan, yani Allow uygulanır.
- Google crawl-delay yönergesini desteklemez; Bing ve Yandex destekler.
Tarama ve indeksleme davranışı
- 4xx dönen robots.txt yok sayılır, site tamamen taranabilir kabul edilir. Kalıcı 5xx ise Google’ın siteyi geçici olarak taramaya kapalı saymasına yol açabilir.
- Google dosyayı 24 saate kadar önbelleğe alır; değişiklikler anında yansımaz.
- Robots.txt indekslemeyi engellemez: engellenen bir URL, dış bağlantılarla keşfedilirse snippet’siz olarak arama sonuçlarında görünebilir. Bir sayfayı indeks dışı tutmak için noindex kullanın ancak noindex yalnızca sayfa taranabilirse çalışır; aynı sayfayı Disallow ile engellerseniz Google etiketi göremez.
Örnek bir robots.txt dosyası:
User-agent: *
Disallow: /yonetim/
Allow: /yonetim/genel/
Sitemap: https://siteadresiniz.com/sitemap.xml
Yanlış eklenen bir Disallow: / satırı tüm sitenin taranmasını durdurabilir; sonucu indeks ve trafik kaybıdır. Düzenli robots.txt kontrolü bu riski önceden görmenizi, deploy, CMS güncellemesi veya site taşıma sonrasında dosyanın hâlâ doğru çalıştığını teyit etmenizi ve rakip sitelerin yapılandırmasını incelemenizi sağlar.
- Site adresinizi giriş alanına yazın.
- “Kontrol Et” butonuna tıklayın.
- Raporda listelenen kuralları, hataları ve uyarıları inceleyin.
- Gerekirse dosyanızı düzenleyip yeniden test edin.
- Değişiklikleri Google Search Console üzerinden takip edin.
Yönetim paneli, arama sonucu sayfaları ve geçici dizinleri Disallow ile kapatın; blog ve ürün sayfalarını engellemeyin. Site haritanızı Sitemap: satırıyla ekleyin ve dosyayı her önemli güncellemeden sonra yeniden test edin. Robots.txt Checker’ı hemen ücretsiz deneyin.