AI Botları Web Sitenizi Nasıl Tarıyor?

12.08.2026

AI Botları Web Sitenizi Nasıl Tarıyor?

OAI-SearchBot, GPTBot, PerplexityBot, ClaudeBot ve Google-Extended için teknik erişim rehberi

Önce botun amacını doğru tanımlayın

Bir web isteğinde görülen “AI” user-agent’ı dört farklı role sahip olabilir:

  • Arama crawler’ı: Güncel web sayfalarını keşfeder ve AI destekli arama yanıtlarında kaynak kullanılmasına yardımcı olur.
  • Model eğitim crawler’ı: Herkese açık içeriğin gelecekteki model geliştirme süreçlerinde kullanılıp kullanılmayacağını kontrol eder.
  • Kullanıcı tetiklemeli agent: Bir kullanıcı isteği üzerine sayfayı ziyaret eder; örneğin bir linki açar veya görev yürütür.
  • Geleneksel arama botu: Googlebot gibi klasik indeksleme ve sıralama amacıyla çalışır; üretken özellikler bu indeks üzerinden de içerik kullanabilir.

Bu ayrım önemlidir çünkü bir botu engellemenin etkisi diğerine otomatik olarak uygulanmayabilir.

Başlıca AI botları ve kontrolleri

OpenAI: OAI-SearchBot, GPTBot ve ChatGPT-User

OpenAI’nin yayıncı rehberine göre OAI-SearchBot, ChatGPT arama sonuçlarında web sayfalarını keşfetmek ve bağlantı göstermek için kullanılır. GPTBot ise içeriğin olası model geliştirme kullanımını kontrol eden ayrı bir user-agent’tır. ChatGPT-User, kullanıcı isteğiyle gerçekleştirilen ziyaretlerde kullanılabilir; robots.txt kuralları kullanıcı tarafından başlatılan bu tür isteklerde farklı uygulanabilir.

Bir marka ChatGPT Search içinde bulunmak istiyor ama içeriğinin model eğitiminde kullanılmasını istemiyorsa, OAI-SearchBot’a izin verip GPTBot’u engelleme politikasını değerlendirebilir. OpenAI ayrıca erişimin yalnızca user-agent metnine güvenilerek değil, yayınlanan IP aralıklarıyla doğrulanmasını önerir.

Perplexity: PerplexityBot ve Perplexity-User

PerplexityBot, arama sonuçlarını desteklemek üzere web sayfalarını keşfeder ve Perplexity’nin açıklamasına göre foundation model eğitimi için kullanılmaz. Perplexity-User ise belirli bir kullanıcı talebi üzerine sayfa getirir. Güvenlik duvarı veya CDN ayarlarında yalnızca user-agent değil, Perplexity’nin yayınladığı IP listeleri de dikkate alınmalıdır.

Anthropic: ClaudeBot

Anthropic, ClaudeBot ve ilgili crawler’lar için robots.txt desteği sunduğunu, ayrıca crawl-delay talimatına uyduğunu belirtir. Site sahibi bot erişimini içerik politikası ve altyapı kapasitesine göre düzenleyebilir.

Google: Googlebot ve Google-Extended

Google-Extended bir tarama user-agent’ı değildir; robots.txt içindeki bir product token’dır. Google’ın Gemini modellerinin geliştirilmesi ve grounding kullanımını kontrol eder. Google Search’e dahil olmayı veya sıralamayı etkilemez. AI Overviews ve AI Mode için görünürlük, Google Search’in normal tarama ve indeksleme sistemleri üzerinden yürür; burada Googlebot ve standart Search kontrolleri geçerlidir.

Aynı bot değil, farklı amaçlar
Aynı bot değil, farklı amaçlar

Örnek robots.txt yaklaşımı

Aşağıdaki örnek yalnızca mantığı gösterir; işletmenin hukuk, veri ve görünürlük kararına göre uyarlanmalıdır:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Disallow: /private-research/

Robots.txt bir erişim yetkilendirme veya veri güvenliği mekanizması değildir. Hassas sayfalar kimlik doğrulama, yetkilendirme ve sunucu tarafı kontrollerle korunmalıdır. Ayrıca yanlış yazılmış user-agent, CDN bot koruması veya WAF kuralı robots.txt izin verse bile botu engelleyebilir.

Sunucu loglarında neyi kontrol etmelisiniz?

Teknik GEO denetiminde sunucu veya CDN logları önemli kanıt sağlar:

  1. İlgili bot gerçekten siteye geliyor mu?
  2. Hangi URL’leri, hangi sıklıkta tarıyor?
  3. 200, 3xx, 4xx ve 5xx yanıt dağılımı nasıl?
  4. JavaScript, CSS veya görsel kaynakları engelleniyor mu?
  5. Kritik içerik HTML yanıtında mevcut mu?
  6. Canonical, noindex ve snippet kontrolleri beklenen şekilde mi?
  7. Bot trafiği user-agent ve IP aralığı birlikte doğrulanabiliyor mu?
  8. Tarama sunucu performansını olumsuz etkiliyor mu?

Bot isimleri taklit edilebilir. Güvenlik politikaları yalnızca user-agent dizesine dayanırsa kötü niyetli trafik izinli bot gibi görünebilir.

AI botları sayfanın “kalitesini” nasıl değerlendirir?

Crawler’ın sayfayı getirmesi ile bir AI sisteminin içeriği seçmesi aynı aşama değildir. Teknik erişim yalnızca ilk koşuldur. Sonraki süreç; sistemin indeksine, sorgunun niyetine, içeriğin konuyla ilişkisine, güncelliğine, güvenilirliğine ve diğer kaynaklarla uyumuna bağlıdır.

Bu nedenle bot erişimini açmak, ChatGPT veya başka bir platformda önerilme garantisi vermez. Aynı şekilde schema eklemek ya da llms.txt dosyası yayınlamak tek başına görünürlük sağlamaz. Resmî platform rehberleri ve gerçek log verileri, iddialı üçüncü taraf “garanti”lerinden daha güvenilir başlangıç noktalarıdır.

Crawl, index ve citation aynı şey değildir
Crawl ≠ index ≠ citation

Teknik kontrol listesi

  • robots.txt dosyasını bot bazında gözden geçirin.
  • X-Robots-Tag ve meta robots değerlerini kontrol edin.
  • CDN/WAF kurallarında doğrulanmış bot trafiğini test edin.
  • Kritik içerikleri yalnızca istemci tarafı JavaScript’e bırakmayın.
  • XML site haritasını güncel ve temiz tutun.
  • Hatalı canonical ve yönlendirme zincirlerini düzeltin.
  • Sunucu loglarında bot erişimini düzenli raporlayın.
  • Hassas içerikleri robots.txt yerine gerçek erişim kontrolüyle koruyun.
  • Bot politikası için hukuk, güvenlik, içerik ve pazarlama ekiplerini aynı masaya alın.

Sonuç: crawler yönetimi bir görünürlük ve yönetişim kararıdır

AI botlarını yönetmek, yalnızca teknik ekibin robots.txt dosyasına birkaç satır eklemesi değildir. Marka görünürlüğü, fikrî mülkiyet, model eğitimi politikası, güvenlik ve kullanıcı deneyimi birlikte değerlendirilmelidir. En doğru yapı, botların görevlerini ayırır ve her biri için açık bir işletme kararı uygular.

Sık Sorulan Sorular

OAI-SearchBot’u engellersem ChatGPT’de hiç görünmez miyim?

OpenAI’ye göre botu engellemek sayfanın ChatGPT Search sonuçlarında keşfedilmesini ve kaynak gösterilmesini sınırlayabilir. Ancak marka başka web kaynaklarında geçiyorsa sistem markadan yine söz edebilir.

Google-Extended’ı engellemek Google sıralamamı düşürür mü?

Google, bu kontrolün Google Search dahil etme veya sıralamayı etkilemediğini açıkça belirtir.

llms.txt zorunlu mu?

Hayır. Bazı siteler deneysel olarak kullanır; büyük platformların görünürlük için zorunlu tuttuğu evrensel bir standart değildir.

Diverseffect perspektifi: Diverseffect’in teknik GEO denetimi; robots.txt satırlarının ötesine geçerek CDN/WAF, log analizi, render edilebilir içerik, indeksleme kontrolleri ve marka görünürlüğü hedeflerini tek bir politika içinde birleştirebilir. GEO danışmanlığı, web tasarım ve yazılım ile yapay zekâ entegrasyonu bu denetimin uygulama tarafını destekler.

İlgili içerikler

BİZE ULAŞIN