Skip to main content

AI Crawler dan robots.txt: Daftar Token, Cara Mengatur, dan Konsekuensinya

• 7 menit

Daftar perayap AI beserta token robots.txt-nya menurut dokumentasi resmi masing-masing - plus kenapa sebagian perayap yang dipicu pengguna tidak mengikuti robots.txt sama sekali.

AI crawler — mengontrol akses GPTBot, PerplexityBot, dan Google Extended

Tiga Jenis Perayap AI

Perayap AI tidak semuanya sama, dan perbedaannya menentukan apakah robots.txt Anda berpengaruh.

Ada tiga kelompok, dan mencampurnya adalah sumber kesalahan yang paling sering terjadi:

  1. Perayap pelatihan — mengumpulkan konten untuk melatih model. Memblokirnya tidak memengaruhi kemunculan Anda di hasil pencarian.
  2. Perayap pencarian — mengindeks halaman supaya bisa muncul sebagai sumber di jawaban. Memblokirnya berarti Anda hilang dari jawaban mesin itu.
  3. Pengambil yang dipicu pengguna — mengambil halaman saat seseorang menempelkan tautan atau bertanya. Sebagian tidak mengikuti robots.txt karena permintaannya datang dari manusia.

Daftar Token Menurut Dokumentasi Resmi

Google

TokenUntuk apa
GooglebotPerayapan untuk Google Search, termasuk sumber AI Overviews dan AI Mode
Google-ExtendedMengatur pemakaian konten untuk melatih dan menyokong model Gemini
GoogleOtherKeperluan lain di luar pencarian

Yang paling sering disalahpahami: Google menyatakan Google-Extended tidak memengaruhi keberadaan situs di Google Search dan bukan sinyal peringkat. Memblokirnya bukan cara keluar dari AI Overview.

OpenAI

TokenUntuk apa
GPTBotMelatih model. Memblokirnya menyatakan konten tidak boleh dipakai untuk pelatihan
OAI-SearchBotMengindeks untuk fitur pencarian ChatGPT. Situs yang menolak tidak muncul di jawaban pencarian ChatGPT
OAI-AdsBotMemeriksa halaman tujuan iklan; datanya tidak dipakai melatih model
ChatGPT-UserPenjelajahan yang dipicu pengguna di ChatGPT dan Custom GPT

Anthropic

TokenUntuk apa
ClaudeBotMengumpulkan konten yang mungkin dipakai untuk pelatihan
Claude-SearchBotMenelusuri web untuk memperbaiki kualitas hasil pencarian
Claude-UserMengakses halaman saat pengguna bertanya ke Claude

Perplexity

TokenUntuk apa
PerplexityBotMenampilkan dan menautkan situs di hasil Perplexity; tidak dipakai untuk melatih model
Perplexity-UserMengambil halaman saat pengguna bertanya

Perplexity menyatakan Perplexity-User umumnya mengabaikan aturan robots.txt karena pengambilannya diminta pengguna. Untuk memblokirnya, dokumentasinya mengarahkan ke aturan di lapisan WAF atau server, bukan robots.txt.

Keputusan yang Sebenarnya Anda Ambil

Sebelum menyalin blok robots.txt dari mana pun, jawab dulu satu pertanyaan: apa yang ingin dicegah?

  • Tidak ingin kontennya dipakai melatih model → blokir perayap pelatihan (GPTBot, ClaudeBot, Google-Extended). Kemunculan Anda di hasil pencarian dan jawaban AI tidak berubah.
  • Tidak ingin muncul sebagai sumber di jawaban AI → blokir perayap pencarian (OAI-SearchBot, PerplexityBot, Claude-SearchBot). Ini berarti Anda memilih tidak terlihat di sana.
  • Ingin muncul sebanyak mungkin → jangan blokir apa pun, dan pastikan robots.txt Anda tidak tanpa sengaja memblokir aset yang dibutuhkan untuk merender halaman.

Untuk Google secara khusus, kendali yang lebih halus ada di tingkat halaman: nosnippet, data-nosnippet, max-snippet, dan noindex.

Contoh Konfigurasi

Menolak pelatihan, tetap muncul di jawaban:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Menolak semuanya dari satu penyedia:

User-agent: PerplexityBot
Disallow: /

Perlu diingat bahwa aturan ini bersifat sukarela. Robots.txt adalah permintaan yang dihormati perayap yang patuh — bukan penghalang teknis.

Yang Perlu Diperiksa Sekarang

  1. Buka robots.txt situs Anda dan baca isinya. Banyak situs memblokir sesuatu yang tidak disadari pemiliknya, warisan dari tema atau pengembang sebelumnya.
  2. Pastikan aset render tidak diblokir — CSS dan JavaScript yang dibutuhkan untuk menampilkan halaman.
  3. Pastikan yang diblokir memang yang dimaksud. Memblokir perayap pencarian karena mengira itu perayap pelatihan adalah kesalahan yang mahal dan sunyi.
  4. Periksa log server untuk melihat perayap mana yang benar-benar datang. Penyedia besar menerbitkan daftar alamat IP-nya untuk verifikasi.
  5. Tinjau ulang setiap beberapa bulan. Daftar token bertambah, dan yang baru tidak akan tercakup aturan lama.

Yang Perlu Diluruskan

  • Memblokir perayap AI tidak mengembalikan trafik. Kalau pembaca tidak mengklik, penyebabnya bukan perayapnya.
  • Robots.txt tidak menghapus konten yang sudah dipakai melatih model. Aturannya berlaku ke depan.
  • Halaman yang diblokir robots.txt masih bisa terindeks kalau ditaut dari luar — ini berlaku di pencarian klasik dan tidak berubah.
  • Tidak ada berkas khusus untuk “mengundang” AI. Google menyatakan Anda tidak perlu membuat berkas teks khusus AI.

FAQ

Apakah memblokir GPTBot memengaruhi peringkat di Google?

Tidak sama sekali. GPTBot milik OpenAI dan tidak ada hubungannya dengan Google Search.

Apakah memblokir Google-Extended mengeluarkan saya dari AI Overview?

Tidak. Google menyatakan token itu tidak memengaruhi keberadaan situs di Google Search dan bukan sinyal peringkat. Untuk membatasi kemunculan di fitur AI, gunakan nosnippet, data-nosnippet, atau noindex.

Kenapa halaman saya tetap diambil meski sudah diblokir?

Kemungkinan besar yang mengambil adalah pengambil yang dipicu pengguna. Perplexity menyatakan Perplexity-User umumnya mengabaikan robots.txt karena permintaannya datang dari manusia; pemblokirannya perlu dilakukan di lapisan WAF atau server.

Kontrol crawler adalah salah satu lapisan teknis GEO, bukan pengganti kesiapan konten dan entity. Periksa dampaknya lewat checklist website siap AI Search dan gunakan schema untuk GEO untuk memperjelas makna halaman yang tetap dapat diakses.