Crawl budget gerçekten sorun mu? Hangi sitede önemli, nasıl ölçülür

Birkaç yüz sayfalık bir sitenin sahibi, sayfaları dizine girmediğinde çoğu zaman crawl budget'ı suçlar. Oysa bu ölçekteki sitelerde tarama bütçesi neredeyse hiçbir zaman gerçek sebep değildir. Sorun genelde içerikte, iç linklerde ya da teknik bir engeldedir.

Öte yandan yüz binlerce URL'si olan bir e-ticaret sitesinde crawl budget gerçekten can yakar. Aradaki çizgiyi doğru çekmek, yanlış probleme saatler harcamamak için önemli.

Crawl budget nedir, ne değildir?

Google'ın büyük site sahipleri için yazdığı tarama bütçesi rehberinde kavram iki parçaya ayrılır:

  • Tarama kapasitesi sınırı (crawl capacity limit): Googlebot'un sunucunuzu yormadan aynı anda kaç bağlantı açabileceği ve istekler arasında ne kadar bekleyeceği. Sunucu hızlı ve hatasız yanıt verdikçe bu sınır yükselir; yavaşladıkça ya da 5xx hataları arttıkça düşer.
  • Tarama talebi (crawl demand): Google'ın sitenizdeki URL'leri ne kadar taramak istediği. Popüler sayfalar, sık güncellenen sayfalar ve yeni keşfedilen URL'ler talebi artırır. Talep düşükse kapasite yüksek olsa bile Googlebot fazla gelmez.

Crawl budget, bu ikisinin birlikte belirlediği, Googlebot'un sitenize ayırabileceği ve ayırmak istediği tarama miktarıdır. Dikkat edilmesi gereken nokta şu: bütçe, dizine eklemeyi değil, taramayı etkiler. Taranan bir sayfanın dizine girip girmemesi ayrı bir kalite kararıdır.

Hangi sitede önemli?

Google'ın kendi rehberi hedef kitlesini açıkça tarif ediyor: kabaca bir milyondan fazla benzersiz sayfası olan ve içeriği orta sıklıkta değişen siteler, ya da on binden fazla sayfası olup içeriği günlük olarak çok hızlı değişen siteler. Buna ek olarak, "Keşfedildi - şu anda dizine eklenmemiş" (Discovered - currently not indexed) satırında çok sayıda URL biriken siteler de bu konuya bakmalı.

Küçük bir kurumsal site ya da birkaç bin yazılık bir blog için Google, yeni sayfaları genelde yayınlandıkları gün ya da birkaç gün içinde tarar. Bu tür sitelerde dizine ekleme sorunu varsa sebebi başka yerde aramak gerekir; çoğu zaman Tarandı, şu anda dizine eklenmedi yazısındaki kalite ve kopya konularıdır.

Nasıl ölçülür?

Tarama istatistikleri raporu

Search Console'da raporun yeri kolay gözden kaçar: sol menüde Ayarlar (Settings) altında, Tarama istatistikleri (Crawl stats). Burada son 90 günün toplam tarama isteklerini, indirilen toplam boyutu ve ortalama yanıt süresini görürsünüz. Asıl işe yarayan kısım alttaki kırılımlar:

  • Yanıta göre: 200, 301, 404, 5xx oranları. Yönlendirme ve hata oranı yüksekse bütçe israf ediliyor olabilir.
  • Dosya türüne göre: HTML, görsel, JavaScript, CSS. Taramanın büyük kısmı HTML dışına gidiyorsa bunu not ederim.
  • Amaca göre: Keşif (discovery) ve yenileme (refresh). Yeni sayfa yayınlayan bir sitede keşif oranının çok düşük olması, yeni URL'lerin geç bulunduğunu gösterebilir.
  • Googlebot türüne göre: Akıllı telefon, masaüstü, görsel ve diğerleri.
  • Ana makine durumu (host status): robots.txt erişimi, DNS çözümlemesi ve sunucu bağlantısında son 90 günde sorun yaşanıp yaşanmadığı.

Ortalama yanıt süresinin grafiğine özellikle bakıyorum. Yanıt süresi yükseldiğinde toplam istek sayısının düştüğünü görüyorsanız, sunucu kapasitesi taramayı sınırlıyor demektir.

Sunucu logları

Rapor özet verir; hangi URL'nin kaç kez tarandığını ise loglar söyler. Googlebot'un zamanının ne kadarının parametreli URL'lere, ne kadarının önemli sayfalara gittiğini görmenin tek güvenilir yolu budur. Komut satırıyla nasıl yapılacağını cPanel loglarından Googlebot analizi yazısında anlattım; tarayıcıda çalışan log analiz aracım da aynı kırılımları çıkarır.

Benim ölçütüm basit: son 30 günde Googlebot'un istediği benzersiz URL'lerin ne kadarı gerçekten dizinde olmasını istediğim sayfalar? Bu oran düşükse ve site büyükse, crawl budget konuşmaya değer.

En sık israf kaynakları

  1. Filtre ve facet URL'leri: Renk, beden, marka, fiyat aralığı kombinasyonları sonsuz sayıda URL üretir. Hangi kombinasyonların taranıp dizine girmesi gerektiğini filtreli kategori sayfaları yazısında ayrıntılı ele aldım.
  2. Parametreler: Sıralama, oturum kimliği, takip parametreleri (utm_), sayfa başına ürün sayısı. Her biri aynı içeriğin yeni bir URL'si demektir.
  3. Sonsuz takvimler ve alanlar: "Sonraki ay" linki sonsuza kadar giden etkinlik takvimleri, sonu gelmeyen sayfalama, göreli linklerin iç içe geçmesiyle oluşan /a/b/a/b/ gibi yollar.
  4. Yönlendirme zincirleri: Her atlama ayrı bir istektir. İç linkler eski URL'yi gösterdikçe Googlebot aynı zinciri tekrar tekrar izler.
  5. Soft 404'ler: 200 dönen boş sayfalar Google tarafından tekrar tekrar kontrol edilir. Gerçekten olmayan sayfa 404 ya da 410 döndürmeli.
  6. Yavaş sunucu: Yanıt süresi uzadıkça tarama kapasitesi düşer. Bu, bütün diğer maddelerin etkisini büyütür.

Nasıl düzeltilir?

  • Taranmaması gereken URL alanlarını robots.txt ile kapatın. Sıralama parametreleri, iç arama sonuçları, sepete ekleme linkleri gibi. Unutmayın, robots.txt taramayı engeller, dizine eklemeyi değil; dizinde olan bir URL'yi çıkarmak için önce noindex ile çıkarmak, sonra engellemek gerekir.
  • noindex'i bütçe aracı olarak kullanmayın. Google'ın rehberi de bunu belirtiyor: noindex'li sayfa yine taranır, sadece dizine alınmaz. Aynı şey canonical için de geçerli; canonical taramayı durdurmaz.
  • İç linkleri temizleyin. İç linkler her zaman nihai, 200 dönen, canonical URL'yi göstermeli. Parametreli linkleri mümkünse link olmaktan çıkarın.
  • Kaldırılan sayfalar için doğru kod döndürün. 404 ya da 410; ana sayfaya toplu yönlendirme değil.
  • Sitemap'i sadeleştirin. Sitemap'te sadece dizine girmesini istediğiniz, 200 dönen, canonical URL'ler olsun. lastmod değerini sadece içerik gerçekten değiştiğinde güncelleyin.
  • Sunucuyu hızlandırın. Önbellekleme ve sıkıştırma gibi temel ayarlar paylaşımlı hostingte bile ciddi fark yaratır; ayrıntılar paylaşımlı hostingte hızlı site yazısında.

Bir not: Search Console'daki eski tarama hızı sınırlama ayarı ve URL parametreleri aracı artık yok. Googlebot'u geçici olarak yavaşlatmanız gerekirse Google'ın önerdiği yol, kısa süreliğine 503 ya da 429 döndürmek; bunu uzun süre yaparsanız sayfalar dizinden düşmeye başlayabilir.

Site büyüklüğüne göre karar tablosu

Site profiliCrawl budget önemli mi?Neye bakmalı?
Birkaç yüz sayfalık kurumsal site ya da blogHayırİçerik kalitesi, iç linkler, teknik engeller
1.000 - 10.000 sayfa, az değişen içerikNadirenKopya sayfalar, yönlendirme zincirleri, sitemap temizliği
10.000+ sayfa, günlük çok değişen içerik (haber, ilan)EvetKeşif hızı, sunucu yanıt süresi, loglardaki URL dağılımı
Filtreli e-ticaret, yüz binlerce olası URLEvetFacet ve parametre kontrolü, robots.txt, iç link yapısı
1 milyon+ benzersiz sayfaKesinlikleTarama istatistikleri, düzenli log analizi, sunucu kapasitesi
Herhangi bir boyut, ama "Keşfedildi" satırı hızla büyüyorMuhtemelenSunucu hızı, URL üreten kalıplar, iç linkleme

Özetle

Küçük bir sitede crawl budget'a harcayacağınız zamanı içeriğe ve iç linklere harcamak neredeyse her zaman daha iyi sonuç verir. Büyük ve hızlı değişen bir sitede ise işe ölçerek başlayın: önce Ayarlar altındaki tarama istatistiklerine, sonra loglara bakın, Googlebot'un zamanını nereye harcadığını görün ve israfı kaynağında kesin. Taramanın asıl amacı her URL'yi taratmak değil, önemli URL'lerin hızlı ve düzenli taranmasını sağlamak.

Comments / questions

If you have a question about any topic or wish to contact me: Telegram or send an email to [email protected] Thanks!

Related pages