Robots.txt Nedir, Nasıl Oluşturulur? Örnek Dosya ve Hatalar

Robots.txt Nedir, Nasıl Oluşturulur?
İçindekiler

Robots.txt, arama motoru botlarının bir internet sitesinde hangi adresleri tarayıp hangilerini taramaması gerektiğini bildiren metin dosyasıdır. Özellikle çok sayıda sayfası bulunan sitelerde gereksiz filtre, yönetim ve sistem adreslerinin taranmasını sınırlandırarak botların önemli sayfalara yönlendirilmesine yardımcı olabilir.

Dosyada yapılacak küçük bir hata, önemli sayfaların Googlebot tarafından taranamamasına neden olabilir. Özellikle Disallow: / komutu bütün siteyi taramaya kapatabileceği için robots.txt değişiklikleri dikkatle yapılmalıdır. Robots.txt bir güvenlik veya kesin dizinden çıkarma aracı değil, tarama yönetimi aracıdır.

Robots.txt Nedir ve Ne İşe Yarar?

Robots.txt, Robots Exclusion Protocol kurallarına göre hazırlanan düz metin dosyasıdır. Arama motoru botları bir siteyi taramadan önce kök dizindeki robots.txt dosyasını kontrol ederek kendileri için tanımlanan kuralları okur. Herhangi bir engelleme kuralı bulunmadığında URL’lerin taranmasına izin verildiği kabul edilir.

Dosya; yönetim alanları, dahili arama sonuçları, gereksiz parametreler veya botların taramasına ihtiyaç duyulmayan kaynaklar için kullanılabilir. Ancak robots.txt içinde engellenen bir adres kullanıcılar tarafından ziyaret edilmeye devam edebilir. Ayrıca kötü niyetli botların bu kurallara uyması zorunlu değildir.

Robots.txt Dosyası Nasıl Çalışır?

Robots.txt kuralları belirli botlara veya bütün tarayıcılara yönelik oluşturulabilir. User-agent satırı kuralın hangi bot için geçerli olduğunu, Disallow satırı taranmaması gereken yolu, Allow satırı ise engellenen bir yol içindeki izin verilen bölümü belirtir. Bot, kendisiyle eşleşen gruptaki kuralları değerlendirir.

Dosyanın kapsamı bulunduğu protokol, alan adı, alt alan adı ve bağlantı noktasıyla sınırlıdır. https://www.ornek.com/robots.txt dosyası, https://blog.ornek.com/ alt alan adını otomatik olarak yönetmez. Alt alan adları için gerektiğinde ayrı robots.txt dosyası hazırlanmalıdır.

Robots.txt ile Noindex Arasındaki Fark Nedir?

Robots.txt bir sayfanın taranmasını engellerken noindex, sayfanın arama motoru dizinine alınmasını önler. Arama motoru taraması ile dizine ekleme aynı işlem değildir. Robots.txt ile engellenen bir URL, başka sayfalardan bağlantı alıyorsa içeriği taranmadan URL biçiminde arama sonuçlarında görünebilir.

Bir sayfanın Google sonuçlarında bulunmaması isteniyorsa sayfa taramaya açık bırakılarak HTML içinde <meta name="robots" content="noindex"> etiketi veya HTTP yanıtında X-Robots-Tag: noindex kullanılabilir. Google’ın noindex yönergelerine göre robots.txt dosyasına noindex satırı yazılması desteklenmez. Googlebot’un noindex etiketini görebilmesi için sayfayı tarayabilmesi gerekir.

AmaçKullanılması gereken yöntem
Botun belirli yolu taramasını sınırlandırmakRobots.txt
Sayfayı arama sonuçlarından çıkarmakNoindex
Özel bilgileri korumakGiriş, parola veya sunucu yetkilendirmesi
Silinen sayfayı kaldırmak404 veya 410 durum kodu
Geçici ve hızlı sonuç kaldırmaSearch Console kaldırma aracı

Robots.txt Dosyası Nasıl Oluşturulur ve Nereye Eklenir?

Dosya herhangi bir düz metin düzenleyicisinde oluşturulabilir ve tam olarak robots.txt adıyla kaydedilmelidir. Büyük-küçük harf veya farklı uzantı kullanılmamalıdır. Dosya sitenin kök dizinine yüklenmeli ve https://ornek.com/robots.txt adresinden herkese açık olarak görüntülenebilmelidir.

Google’ın robots.txt oluşturma rehberinde süreç; dosyayı oluşturma, kuralları ekleme, kök dizine yükleme ve test etme şeklinde açıklanmaktadır. WordPress gibi içerik yönetim sistemlerinde dosya SEO eklentisi, hosting paneli veya dosya yöneticisi üzerinden düzenlenebilir. Wix ve benzeri hazır platformlarda ise doğrudan dosya yerine arama görünürlüğü ayarları sunulabilir.

Bütün botların siteyi taramasına izin veren temel dosya örneği şöyledir:

User-agent: *
Disallow:

Sitemap: https://www.ornek.com/sitemap.xml

Robots.txt dosyası bulunmayan bir sitede de varsayılan davranış taramaya izin verilmesidir. Bu nedenle bütün sayfalar taramaya açık olacaksa dosya oluşturmak zorunlu değildir.

Robots.txt Komutları Nelerdir?

En yaygın komutlar User-agent, Disallow, Allow ve Sitemap satırlarıdır. * işareti bütün botları veya bir URL içindeki farklı karakterleri temsil etmek için, $ işareti ise URL’nin belirli ifadeyle bitmesini eşleştirmek için kullanılabilir. # işaretinden sonraki metin yorum olarak değerlendirilir.

Başlıca robots.txt komutları şunlardır:

KomutGöreviÖrnek
User-agentKuralın uygulanacağı botu belirlerUser-agent: Googlebot
DisallowBelirtilen yolun taranmasını engellerDisallow: /yonetim/
AllowEngellenen alan içindeki belirli yola izin verirAllow: /yonetim/genel-dosya/
SitemapXML site haritasının adresini bildirirSitemap: https://ornek.com/sitemap.xml
*Herhangi bir karakter dizisini eşleştirirDisallow: /*?filtre=
$URL’nin belirtilen ifadeyle bitmesini sağlarDisallow: /*.pdf$
#Açıklama veya yorum ekler# Yönetim alanı

Crawl-delay, nofollow ve robots.txt içindeki noindex komutları Googlebot tarafından desteklenmez. Farklı arama motorlarının robots.txt kuralları ve özel komutlara yaklaşımı değişebileceği için hedeflenen botun güncel dokümanı kontrol edilmelidir.

Örnek Robots.txt Dosyaları

Belirli bir klasörün taranmasını engellemek için klasör yolu Disallow satırına eklenebilir. Sonuna / işareti eklenmesi ilgili klasör ve altındaki yolların hedeflendiğini daha açık hâle getirir. Aşağıdaki örnek bütün botların /yonetim/ ve /gecici/ klasörlerini taramasını sınırlandırır:

User-agent: *
Disallow: /yonetim/
Disallow: /gecici/

Sitemap: https://www.ornek.com/sitemap.xml

Bütün siteyi taramaya kapatan örnek ise aşağıdaki gibidir. Bu kod canlı bir sitede yanlışlıkla kullanılırsa Googlebot bütün siteyi tarayamaz. Genellikle geliştirme ortamlarında bile robots.txt yerine parola koruması tercih edilmelidir.

User-agent: *
Disallow: /

Belirli bir botu engelleyip diğer botlara izin vermek için ayrı gruplar oluşturulabilir:

User-agent: OrnekBot
Disallow: /

User-agent: *
Disallow:

Sitemap: https://www.ornek.com/sitemap.xml

Bot adının gerçekten doğru olduğundan ve istenen tarayıcıyı temsil ettiğinden emin olunmalıdır. Sahte botlar kendilerini farklı bir user-agent adıyla tanıtabileceği için robots.txt güvenlik duvarı yerine kullanılmamalıdır.

WordPress ve E-Ticaret Sitelerinde Robots.txt Nasıl Düzenlenir?

WordPress sitelerinde çoğunlukla yönetim dizininin taranması sınırlandırılırken sitenin çalışması için gereken admin-ajax.php dosyasına izin verilir. Site haritası adresi kullanılan SEO eklentisine göre değişebileceğinden dosyaya eklenmeden önce tarayıcıda açılarak kontrol edilmelidir.

Temel bir WordPress robots.txt örneği şu şekilde hazırlanabilir:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://www.ornek.com/sitemap_index.xml

E-ticaret sitelerinde sepet, ödeme, hesap, filtre ve sıralama adresleri çok sayıda gereksiz URL oluşturabilir. Ancak bu yolların tamamını doğrudan engellemek doğru değildir. İndekslenmiş bir sayfaya noindex uygulanacaksa Googlebot’un etiketi okuyabilmesi için sayfa önce taramaya açık olmalıdır. Filtre URL’leri ise talep ve kategori yapısına göre organik trafik fırsatı taşıyabileceğinden engelleme kararları teknik analiz sonrasında verilmelidir.

Sitemap Robots.txt Dosyasına Nasıl Eklenir?

XML site haritası robots.txt dosyasına tam URL kullanılarak eklenebilir. Sitemap satırı belirli bir User-agent grubuna bağlı değildir ve dosyanın herhangi bir uygun bölümünde yer alabilir. Birden fazla site haritası varsa her biri ayrı satırda belirtilebilir.

Örnek kullanım şöyledir:

Sitemap: https://www.ornek.com/sitemap.xml
Sitemap: https://www.ornek.com/image-sitemap.xml
Sitemap: https://www.ornek.com/news-sitemap.xml

Site haritasını robots.txt dosyasına eklemek Google’ın bütün URL’leri kesin olarak tarayacağı veya dizine alacağı anlamına gelmez. Sitemap yalnızca önemli URL’lerin keşfedilmesine yardımcı olur. Dosya ayrıca Google Search Console üzerinden gönderilmeli ve içerdiği adreslerin durum kodları düzenli olarak kontrol edilmelidir.

Robots.txt Dosyası Nasıl Test Edilir?

İlk kontrol için gizli tarayıcı penceresinde alanadi.com/robots.txt adresi açılmalıdır. Dosya görüntülenmiyor, başka adrese yönleniyor veya sunucu hatası veriyorsa botlar kuralları doğru şekilde alamayabilir. Yazım hataları, yanlış klasör yolları ve canlı siteyi kapatan komutlar satır satır incelenmelidir.

Search Console’daki robots.txt raporu erişilebilir dosyaları ve ayrıştırma sorunlarını kontrol etmek için kullanılabilir. Belirli bir URL’nin Googlebot tarafından engellenip engellenmediği URL Denetleme aracıyla incelenebilir. Dosya güncellendiğinde Googlebot yeni sürümü otomatik olarak bulur; gerekli durumlarda önbelleğe alınan robots.txt dosyasının yenilenmesi talep edilebilir.

Kontrol sırasında şu sorulara yanıt aranmalıdır:

  • Dosya doğru kök dizinde mi?
  • Dosya 200 durum koduyla açılıyor mu?
  • Önemli sayfalar yanlışlıkla engellenmiş mi?
  • CSS, JavaScript ve görseller taramaya açık mı?
  • Sitemap adresi doğru ve erişilebilir mi?
  • Alt alan adları için ayrı dosya gerekiyor mu?
  • Kurallar doğru bot grubunda mı?
  • Noindex uygulanacak sayfalar robots.txt ile engellenmiş mi?

En Sık Yapılan Robots.txt Hataları

En tehlikeli hata, canlı sitede Disallow: / komutunu bırakmaktır. Site taşıma veya geliştirme sürecinde eklenen bu satır yayına geçerken kaldırılmazsa arama motorları yeni ve güncellenen içerikleri tarayamaz. Önemli CSS, JavaScript veya ürün görsellerinin bulunduğu klasörleri engellemek de sayfaların Google tarafından doğru işlenmesini zorlaştırabilir.

Sık karşılaşılan diğer hatalar şunlardır:

  • Dosyayı kök dizin yerine alt klasöre yüklemek
  • Dosya adını Robots.txt veya robots.txt.txt olarak kaydetmek
  • Disallow yollarında yazım hatası yapmak
  • Özel içerikleri robots.txt ile korumaya çalışmak
  • Robots.txt içine noindex yazmak
  • Noindex etiketi bulunan sayfayı aynı anda taramaya kapatmak
  • Bütün URL parametrelerini kontrol etmeden engellemek
  • Site haritasına hatalı veya yönlenen URL eklemek
  • Alt alan adlarının aynı dosyayla yönetildiğini düşünmek
  • Güncelleme sonrasında dosyayı test etmemek
  • Google tarafından desteklenmeyen crawl-delay komutuna güvenmek

Robots.txt dosyası herkese açık olduğundan gizli klasör ve dosya yollarını burada listelemek güvenlik sağlamaz. Müşteri verileri, yönetim panelleri veya özel belgeler giriş ve sunucu yetkilendirmesiyle korunmalıdır. Tarama yönetimi ile güvenlik önlemleri birbirinden ayrı planlanmalıdır.

Webonya ile Teknik SEO Hatalarınızı Tespit Edin

Webonya, robots.txt dosyasını sitenin dizine eklenme durumu, XML site haritası, yönlendirmeler ve teknik altyapıyla birlikte inceler. Engellenen önemli sayfalar, gereksiz taranan URL’ler ve noindex çakışmaları belirlenerek siteye özel düzenleme planı hazırlanır. Böylece botların önemli içeriklere daha sağlıklı erişmesi amaçlanır.

Sitenizdeki tarama ve dizine ekleme sorunlarını belirlemek için ücretsiz SEO analizi talep edebilirsiniz. Robots.txt, sitemap ve teknik SEO çalışmalarını profesyonel biçimde yönetmek için Webonya SEO Ajansı hizmetini inceleyebilir veya Webonya ile iletişime geçebilirsiniz.

Benzer İçerikler
Pop-up Form

pop-up-webonya