SEO

llms.txt mi robots.txt mi: Yapay Zekâ Sizi Hangisiyle Okur?

robots.txt hangi yapay zekâ tarayıcılarının sayfalarınızı çekebileceğine karar verir; llms.txt yalnızca neyin okunacağını önerir. Biri erişimi kontrol eder, diğeri içeriği tanımlar.

Kısa cevap: Yapay zekâ sistemlerinin sitenizi okuyup okuyamayacağına robots.txt karar verir, çünkü hangi tarayıcıların sayfalarınızı çekebileceğini o belirler. llms.txt ise yalnızca hangi sayfaların okunmaya değer olduğunu tanımlar. robots.txt bir cevap motoru tarayıcısını engelliyorsa, hiçbir llms.txt sizi o motorda kaynak yapamaz. robots.txt ile başlayın, llms.txt'yi rehber olarak ekleyin.

Her dosya ne yapar?

robots.txt llms.txt
Amaç Tarayıcılara izin vermek ya da engellemek Modelleri önemli sayfalara yönlendirmek
Durum Standart (RFC 9309, 2022) Topluluk önerisi (2024)
Kim okur Kurallara uyan her tarayıcı Bazı yapay zekâ araçları ve ajanlar
Google Arama kullanır mı Evet Google hayır diyor
Erişimi engelleyebilir mi Evet Hayır
Biçim User-agent ve Disallow kuralları Bağlantılı Markdown

İki dosya birbirinin rakibi değildir. robots.txt bir kapıdır; llms.txt ise insanlar içeri girdikten sonra masaya bıraktığınız bir haritadır.

Yapay zekâ görünürlüğünde robots.txt neden daha önemli?

Çünkü önce erişim gelir. Her yapay zekâ cevap motoru kendi tarayıcısını kullanır ve her tarayıcı bir sayfayı çekmeden önce robots.txt'ye bakar:

  • ChatGPT araması OAI-SearchBot'u kullanır. OpenAI, onu engelleyen sitelerin ChatGPT arama cevaplarında görünmeyeceğini söylüyor.
  • Perplexity, arama sonuçları için PerplexityBot'u kullanır.
  • Claude'un araması Claude-SearchBot ile çalışır.
  • Google AI Overviews, Arama'nın bir parçasıdır ve Googlebot'a dayanır.

Bunlardan biri engelliyse, o motor sayfalarınızı alıntılamak için çekemez. Çok güzel yazılmış bir llms.txt hiçbir şeyi değiştirmez, çünkü tarayıcı kapıdan hiç geçemez.

Hangi botları engellemeli, hangilerine izin vermelisiniz?

Önemli olan karar budur ve çoğu robots.txt dosyası her yapay zekâ botunu aynı sayarak burada yanılır. İki tür vardır:

  • Cevap motoru tarayıcıları sayfaları cevaplarda göstermek ve bağlantı vermek için çeker. Onları engellemek sizi o motorun sonuçlarından çıkarır.
  • Yalnız eğitim amaçlı tarayıcılar model eğitmek için metin toplar. Onları engellemek bir lisans tercihidir. Sizi cevaplardan çıkarmaz.

İsimler kolayca karışır. GPTBot, OpenAI'nin eğitim tarayıcısıdır; ChatGPT aramasını besleyen OAI-SearchBot'tur. ClaudeBot, Anthropic'in eğitim tarayıcısıdır; aramayı Claude-SearchBot besler. Google-Extended ve Applebot-Extended ise tarayıcı bile değildir: eğitim kullanımını kontrol eden robots.txt işaretleridir ve Google da Apple da bunların aramayı etkilemediğini söylüyor.

Kaynak gösterilmek isteyen ama eğitimde kullanılmak istemeyen bir işletme için yaygın ve makul bir politika şöyle görünür:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

Bu, OAI-SearchBot, Claude-SearchBot ve PerplexityBot dahil cevap motoru tarayıcılarını genel grup üzerinden izinli bırakırken, adı verilen eğitim kullanımlarından çıkar. Eğitimden çıkıp çıkmamak sizin kararınız; önemli olan bunu bilinçli yapmak. Yapay zekâ tarayıcı listemiz, takip ettiğimiz her ajanı ve hangi gruba ait olduğunu gösterir.

En sık hangi hataları görüyoruz?

  • Genel kuralla engellemek. User-agent: * ile Disallow: /, kendi grubu olmayan her tarayıcıyı, cevap motorları dahil engeller.
  • Bir forumdan "yapay zekâ engel listesi" kopyalamak. Bu listeler çoğu zaman eğitim botlarının yanında OAI-SearchBot ve PerplexityBot'u da içerir ve siteyi sessizce yapay zekâ cevaplarından çıkarır.
  • robots.txt'nin sayfaları dizinden çıkardığını sanmak. robots.txt taramayı kontrol eder. Engellenmiş bir adres, başka sayfalar ona bağlantı verirse yine görünebilir. Bir sayfayı dışarıda tutmak için taranabilir bir sayfada noindex kullanın.
  • Aslında HTML sayfası olan bir llms.txt. Birçok site /llms.txt adresinde kendi 404 sayfasını 200 koduyla döndürür. Yalnızca durum koduna bakan araçlar dosyanın var olduğunu sanır.

llms.txt nerede hâlâ işe yarar?

Erişim doğru olduktan sonra llms.txt, büyük ya da teknik sitelerde bir modelin işini kolaylaştırabilir: modeli menüden tahmin etmeye bırakmak yerine gerçek sorulara cevap veren sayfalara yönlendirir. En çok belgeler, API'ler ve SaaS ürünleri için faydalıdır. Nasıl yazılacağını llms.txt nedir yazısında anlatıyoruz.

Klasik SEO açısından durum ne?

robots.txt on yıllardır SEO'nun bir parçası ve aynı kurallar geçerli: dizine girmesini istediğiniz sayfaları engellemeyin, hassas içeriği saklamak için kullanmayın ve denetlenebilecek kadar kısa tutun. Yeni olan, artık düşünülmesi gereken çok daha fazla user-agent olması ve bir eğitim botuyla bir arama botu arasındaki farkın, bir engelin size neye mal olduğunu değiştirmesi.

Kendi sitenizi nasıl kontrol edersiniz?

Ücretsiz robots.txt ve llms.txt kontrol aracımız robots.txt'nizi okur, hangi cevap motoru ve eğitim tarayıcılarına izin verdiğinizi söyler ve llms.txt'nizin gerçek bir dosya olup olmadığını kontrol eder. Tek istek yeterli, kayıt gerekmez.

Sıkça sorulan sorular

GPTBot'u engellersem ChatGPT beni kaynak göstermeyi bırakır mı?

Hayır. GPTBot eğitim için kullanılır. ChatGPT araması OAI-SearchBot'u kullanır. GPTBot'u engellemek sizi ChatGPT aramasından değil, eğitimden çıkarır.

robots.txt'm doğruysa llms.txt'ye ihtiyacım var mı?

Kesin olarak hayır. Şart olan doğru bir robots.txt'dir; llms.txt büyük ya da teknik sitelerde bazı yapay zekâ araçlarına yardım eden isteğe bağlı bir rehberdir.

Google llms.txt okur mu?

Google, Google Arama'nın llms.txt kullanmadığını söyledi. robots.txt'yi ise okur.

robots.txt gizli içeriği korur mu?

Hayır. robots.txt herkese açıktır ve tarayıcılardan yalnızca sayfayı çekmemelerini ister. Gizli olan her şey kimlik doğrulaması gerektirir.

Web sitenizi analiz edin