Crawl (Tarama) Nedir? Googlebot Sitenizi Nasıl Keşfeder?

Bu yazıda neler öğreneceksiniz:
  • Crawl (tarama) kavramının tam olarak ne anlama geldiği ve Googlebot’un nasıl çalıştığı
  • Aramanın beş aşaması: keşif, tarama, render, indeksleme ve sıralamanın birbiriyle ilişkisi
  • Google’ın sitenizi hangi yollarla keşfettiği ve taramayı nasıl hızlandıracağınız
  • Tarama bütçesi (crawl budget) nedir, hangi siteler için önemlidir
  • robots.txt ile taramayı yönetmenin doğru yolu ve en sık yapılan kritik hata
  • Crawl ile index arasındaki farkın Search Console raporlarını okumanıza etkisi

Yeni bir yazı yayınladınız, aradan günler geçti, ama sayfa Google’da hâlâ görünmüyor. Çoğu site sahibi bu noktada içeriği suçlar ve başlığı değiştirmeye başlar. Oysa sorun çoğu zaman daha baştadır: Google o sayfayı henüz tarayamamıştır. Arama görünürlüğünün ilk şartı, bir sorguya doğru cevap vermek değil; arama motorunun sayfanıza ulaşıp içeriğini okuyabilmesidir.

Bu yazıda taramanın ne olduğunu, arama sürecinin neresinde durduğunu ve bu süreci nasıl kolaylaştırabileceğinizi baştan sona anlatıyorum. Teknik SEO’nun büyük kısmı, aslında bu ilk adımı sağlıklı tutmakla ilgilidir.

Crawl Ne Demek?

Crawl, Türkçesiyle tarama, arama motorlarının internetteki sayfaları otomatik yazılımlarla ziyaret edip içeriğini okuması işlemidir. Google özelinde bu yazılıma Googlebot denir. Googlebot bir sayfaya girer, HTML’ini indirir, içindeki bağlantıları toplar ve o bağlantılar üzerinden yeni sayfalara ilerler. Kelimenin kökeni de bunu anlatır: İngilizcede “crawl”, ağır ağır ilerleyerek her yeri gezmek demektir.

Buradaki kritik nokta şudur: Googlebot sitenizi tararken yalnızca bir keşif ve okuma yapar. Bir sayfanın taranması, onun Google’a ekleneceği anlamına gelmez. Tarama, uzun bir zincirin yalnızca ilk halkasıdır.

Aramanın Aşamaları: Taramanın Zincirdeki Yeri

Bir sayfanın Google’da görünür olması için tek bir işlem değil, sıralı bir zincir tamamlanır. Halkalardan biri koptuğunda sayfa görünmez olur:

  1. Keşif: Google, URL’nin var olduğunu öğrenir (site haritası, iç veya dış bağlantı yoluyla).
  2. Tarama (Crawl): Googlebot sayfayı ziyaret eder ve HTML’ini indirir.
  3. Render: Sayfadaki JavaScript çalıştırılır, içerik kullanıcının gördüğü hale getirilir.
  4. İndeksleme: İçerik anlaşılır ve Google’ın dev veritabanına (dizin) kaydedilir.
  5. Sıralama: Bir arama yapıldığında Google, dizininden en uygun sayfayı seçip sıralar.

Bu zincirin mantığı nettir: sayfanız taranmadıysa asla indekslenemez; indekslenmediyse hiçbir sorguda sıralanamaz. Bu yüzden bir görünürlük sorununu çözerken önce zincirin hangi halkasında koptuğunu bulmak gerekir. Konunun bütününü teknik SEO nedir yazısında ele alıyorum.

Googlebot Sayfalarınızı Nasıl Keşfeder?

Google bir URL’yi taramadan önce onun var olduğunu bilmelidir. Bunu üç ana yoldan öğrenir:

  • XML site haritası: Sitenizdeki önemli URL’lerin listesini Search Console üzerinden Google’a sunarsınız. Yeni ve derin sayfaların keşfini hızlandırır.
  • İç bağlantılar: Bir sayfadan diğerine verdiğiniz linkler, Googlebot’un siteyi dolaşırken izlediği yollardır. Hiçbir sayfadan link almayan bir sayfa (orphan page) neredeyse görünmezdir.
  • Dış bağlantılar: Başka sitelerin size verdiği linkler, Google’ın sitenizi ilk kez keşfetmesini sağlayabilir.

İpucu: Yeni bir sayfayı hızlı taratmanın en pratik yolu, Search Console’daki URL İnceleme aracına URL’yi girip “Dizine eklenmesini iste” demektir. Bu, doğal keşfi beklemeden Googlebot’u davet eder.

Tarama Bütçesi (Crawl Budget) Nedir?

Google’ın kaynakları sonsuz değildir. Her siteye, belirli bir zaman diliminde tarayacağı sayfa sayısı için örtük bir sınır ayırır. Buna tarama bütçesi denir ve iki bileşenden oluşur: sunucunuzun kaldırabileceği tarama hızı (kapasite) ve sayfalarınızın ne kadar ilgi gördüğü (talep). Yavaş veya hata veren bir sunucu bütçeyi düşürür; popüler ve sık güncellenen sayfalar ise daha çok taranır.

Birkaç yüz sayfalık siteler için tarama bütçesi genelde sorun değildir. Ancak binlerce URL’li e-ticaret siteleri için kritiktir: filtre ve sıralama parametreleriyle üreyen sayısız gereksiz URL, bütçeyi tüketir ve asıl önemli ürün sayfaları geç taranır. Bu israfın önüne geçmenin yolları arasında gereksiz parametreli URL’leri sınırlamak ve site hızını iyileştirmek gelir.

Sayfalarınız taranmıyor ya da geç indeksleniyor mu? Sitenizin Googlebot’a nasıl göründüğünü kısa bir teknik denetimle çıkarıp öncelikli tıkanıklıkları belirleyebiliriz. WhatsApp’tan yazın veya iletişim formunu doldurun.

robots.txt ile Taramayı Yönetmek

robots.txt, sitenizin kök dizininde bulunan ve arama motoru botlarına hangi bölümleri tarayabileceklerini söyleyen bir metin dosyasıdır. Örneğin yönetim panelinizi veya site içi arama sonuç sayfalarınızı taramaya kapatabilirsiniz.

Sık yapılan kritik hata: robots.txt ile bir sayfayı taramaya kapatmak, onu dizinden çıkarmaz. Google o URL’yi başka yerlerden görüp, içeriğini okuyamadan bile indeksleyebilir. Bir sayfayı Google’dan tamamen çıkarmak istiyorsanız yöntem robots.txt değil, sayfaya noindex etiketi eklemektir. İkisini aynı anda kullanmayın: taramaya kapalı bir sayfadaki noindex etiketini Google zaten göremez.

Crawl (Tarama) ile Index (Dizine Ekleme) Arasındaki Fark

Bu iki kavram sık karıştırılır ama tamamen ayrıdır. Farkı net görmek, Search Console raporlarını doğru yorumlamanın anahtarıdır:

KriterCrawl (Tarama)Index (Dizine Ekleme)
Ne yapar?Sayfayı ziyaret edip içeriğini okurOkunan içeriği veritabanına kaydeder
SonucuGoogle sayfayı “gördü”Google sayfayı “hafızasına aldı”
Aramada çıkar mı?Hayır, tek başına yetmezEvet, sıralanmaya aday olur
Engelleme aracırobots.txtnoindex etiketi

Search Console’da “Taranırken bulundu, henüz dizine eklenmedi” uyarısını görüyorsanız, sayfa tarama halkasını geçmiş ama Google onu dizine değecek kadar kaliteli veya özgün bulmamış demektir. Bu, bir tarama değil, bir içerik değeri sorunudur. Çoğaltılmış URL’lerin taramayı nasıl boşa harcadığını canonical URL yazısında ayrıca ele alıyorum.

Sitenizin Tarama Durumunu Nasıl Kontrol Edersiniz?

  • Search Console, Sayfalar raporu: Hangi sayfaların indekslendiğini ve hangilerinin neden dışarıda kaldığını gösterir.
  • URL İnceleme aracı: Tek bir URL’nin son tarama tarihini ve Googlebot’un onu nasıl gördüğünü verir.
  • Sunucu log analizi: İleri seviye bir yöntemdir. Sunucu kayıtlarından Googlebot’un gerçekte hangi sayfalara, ne sıklıkla uğradığını, dolayısıyla tarama bütçesinin nereye harcandığını en net biçimde gösterir.

Crawl Hakkında Sık Sorulan Sorular

Sayfam taranıyor ama Google’da çıkmıyor, neden?

Taranmak, indekslenmeyi garanti etmez. Google sayfayı görmüş ama içeriği yeterince özgün, kaliteli veya kullanışlı bulmadıysa dizine eklemez. Bu durumda çözüm genelde teknik değil, içerik ve özgünlük tarafındadır.

Google sitemi ne sıklıkla tarar?

Sabit bir süre yoktur. Sık güncellenen, hızlı ve otoriteli siteler günde birçok kez taranır; durgun siteler daha seyrek. Tarama sıklığını içerik tazeliği ve sunucu performansı belirler.

robots.txt ile engellersem sayfa Google’dan silinir mi?

Hayır. robots.txt yalnızca taramayı durdurur; sayfa başka linklerden zaten indekslendiyse dizinde kalabilir. Bir sayfayı kalıcı olarak çıkarmak için noindex etiketi kullanılır.

Yeni sayfamın taranmasını nasıl hızlandırırım?

Sayfayı site haritasına ekleyin, indekslenmiş güçlü bir sayfadan ona iç link verin ve Search Console’daki URL İnceleme aracından dizine eklenmesini isteyin.

Tarama bütçesi benim sitem için önemli mi?

Birkaç yüz sayfalık siteler için genelde değil. Ancak on binlerce URL üreten e-ticaret veya ilan siteleri için, bütçenin gereksiz sayfalara harcanması ciddi bir sorundur.

İlgili Rehberler

Teknik temelleri bütün olarak görmek için teknik SEO nedir yazısına, çoğaltılmış URL’leri tek adreste toplamak için canonical URL rehberine ve genel görünürlük stratejisi için Google’da üst sıralara çıkmak yazısına göz atabilirsiniz.