Crawling

How search engine bots discover and fetch pages.

CMS taşımasından sonra kaybolan URL'leri curl ile bulmak

Site taşımalarında en sık gördüğüm hata şu: yeni site güzel, hızlı, her şey yerinde görünüyor. Ama eski sitede trafik getiren sayfaların bir kısmı hiçbir yere yönlenmiyor. Sonuç: iki ay sonra "trafik neden düştü?" toplantısı. Bunu önceden yakalamanın en ucuz yolu, eski sitenin arşivdeki URL'lerini alıp yenisinde tek tek denemek.

robots.txt dosyasına yorum yazmak: tarayıcılar neyi görmezden gelir?

robots.txt standardının sevdiğim bir özelliği var: anlamadığı her şeyi sessizce görmezden geliyor. Bu da dosyaya not, açıklama, hatta ASCII çizim eklemeyi mümkün kılıyor. # Merhaba bot. Bu site John Flaxman'a ait. # Sorun olursa: https://t.me/flaxizm user-agent: * disallow: /admin/ disallow: /*?preview= sitemap: https://johnflaxman.com/sitemap.xml

hreflang hatalarını Python ile denetlemek

hreflang'in en sık bozulan kuralı şu: bağlantılar karşılıklı olmalı. A sayfası B'yi gösteriyorsa, B de A'yı göstermeli. Göstermiyorsa arama motoru ikisini de görmezden gelebilir. Elle kontrol etmek on sayfada eğlenceli, bin sayfada değil.