Tiga Jenis Perayap AI
Perayap AI tidak semuanya sama, dan perbedaannya menentukan apakah robots.txt Anda berpengaruh.
Ada tiga kelompok, dan mencampurnya adalah sumber kesalahan yang paling sering terjadi:
- Perayap pelatihan — mengumpulkan konten untuk melatih model. Memblokirnya tidak memengaruhi kemunculan Anda di hasil pencarian.
- Perayap pencarian — mengindeks halaman supaya bisa muncul sebagai sumber di jawaban. Memblokirnya berarti Anda hilang dari jawaban mesin itu.
- Pengambil yang dipicu pengguna — mengambil halaman saat seseorang menempelkan tautan atau bertanya. Sebagian tidak mengikuti robots.txt karena permintaannya datang dari manusia.
Daftar Token Menurut Dokumentasi Resmi
| Token | Untuk apa |
|---|---|
Googlebot | Perayapan untuk Google Search, termasuk sumber AI Overviews dan AI Mode |
Google-Extended | Mengatur pemakaian konten untuk melatih dan menyokong model Gemini |
GoogleOther | Keperluan lain di luar pencarian |
Yang paling sering disalahpahami: Google menyatakan Google-Extended tidak memengaruhi keberadaan situs di Google Search dan bukan sinyal peringkat. Memblokirnya bukan cara keluar dari AI Overview.
OpenAI
| Token | Untuk apa |
|---|---|
GPTBot | Melatih model. Memblokirnya menyatakan konten tidak boleh dipakai untuk pelatihan |
OAI-SearchBot | Mengindeks untuk fitur pencarian ChatGPT. Situs yang menolak tidak muncul di jawaban pencarian ChatGPT |
OAI-AdsBot | Memeriksa halaman tujuan iklan; datanya tidak dipakai melatih model |
ChatGPT-User | Penjelajahan yang dipicu pengguna di ChatGPT dan Custom GPT |
Anthropic
| Token | Untuk apa |
|---|---|
ClaudeBot | Mengumpulkan konten yang mungkin dipakai untuk pelatihan |
Claude-SearchBot | Menelusuri web untuk memperbaiki kualitas hasil pencarian |
Claude-User | Mengakses halaman saat pengguna bertanya ke Claude |
Perplexity
| Token | Untuk apa |
|---|---|
PerplexityBot | Menampilkan dan menautkan situs di hasil Perplexity; tidak dipakai untuk melatih model |
Perplexity-User | Mengambil halaman saat pengguna bertanya |
Perplexity menyatakan Perplexity-User umumnya mengabaikan aturan robots.txt karena pengambilannya diminta pengguna. Untuk memblokirnya, dokumentasinya mengarahkan ke aturan di lapisan WAF atau server, bukan robots.txt.
Keputusan yang Sebenarnya Anda Ambil
Sebelum menyalin blok robots.txt dari mana pun, jawab dulu satu pertanyaan: apa yang ingin dicegah?
- Tidak ingin kontennya dipakai melatih model → blokir perayap pelatihan (
GPTBot,ClaudeBot,Google-Extended). Kemunculan Anda di hasil pencarian dan jawaban AI tidak berubah. - Tidak ingin muncul sebagai sumber di jawaban AI → blokir perayap pencarian (
OAI-SearchBot,PerplexityBot,Claude-SearchBot). Ini berarti Anda memilih tidak terlihat di sana. - Ingin muncul sebanyak mungkin → jangan blokir apa pun, dan pastikan
robots.txtAnda tidak tanpa sengaja memblokir aset yang dibutuhkan untuk merender halaman.
Untuk Google secara khusus, kendali yang lebih halus ada di tingkat halaman: nosnippet, data-nosnippet, max-snippet, dan noindex.
Contoh Konfigurasi
Menolak pelatihan, tetap muncul di jawaban:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Menolak semuanya dari satu penyedia:
User-agent: PerplexityBot
Disallow: /
Perlu diingat bahwa aturan ini bersifat sukarela. Robots.txt adalah permintaan yang dihormati perayap yang patuh — bukan penghalang teknis.
Yang Perlu Diperiksa Sekarang
- Buka
robots.txtsitus Anda dan baca isinya. Banyak situs memblokir sesuatu yang tidak disadari pemiliknya, warisan dari tema atau pengembang sebelumnya. - Pastikan aset render tidak diblokir — CSS dan JavaScript yang dibutuhkan untuk menampilkan halaman.
- Pastikan yang diblokir memang yang dimaksud. Memblokir perayap pencarian karena mengira itu perayap pelatihan adalah kesalahan yang mahal dan sunyi.
- Periksa log server untuk melihat perayap mana yang benar-benar datang. Penyedia besar menerbitkan daftar alamat IP-nya untuk verifikasi.
- Tinjau ulang setiap beberapa bulan. Daftar token bertambah, dan yang baru tidak akan tercakup aturan lama.
Yang Perlu Diluruskan
- Memblokir perayap AI tidak mengembalikan trafik. Kalau pembaca tidak mengklik, penyebabnya bukan perayapnya.
- Robots.txt tidak menghapus konten yang sudah dipakai melatih model. Aturannya berlaku ke depan.
- Halaman yang diblokir robots.txt masih bisa terindeks kalau ditaut dari luar — ini berlaku di pencarian klasik dan tidak berubah.
- Tidak ada berkas khusus untuk “mengundang” AI. Google menyatakan Anda tidak perlu membuat berkas teks khusus AI.
FAQ
Apakah memblokir GPTBot memengaruhi peringkat di Google?
Tidak sama sekali. GPTBot milik OpenAI dan tidak ada hubungannya dengan Google Search.
Apakah memblokir Google-Extended mengeluarkan saya dari AI Overview?
Tidak. Google menyatakan token itu tidak memengaruhi keberadaan situs di Google Search dan bukan sinyal peringkat. Untuk membatasi kemunculan di fitur AI, gunakan nosnippet, data-nosnippet, atau noindex.
Kenapa halaman saya tetap diambil meski sudah diblokir?
Kemungkinan besar yang mengambil adalah pengambil yang dipicu pengguna. Perplexity menyatakan Perplexity-User umumnya mengabaikan robots.txt karena permintaannya datang dari manusia; pemblokirannya perlu dilakukan di lapisan WAF atau server.
Kontrol crawler adalah salah satu lapisan teknis GEO, bukan pengganti kesiapan konten dan entity. Periksa dampaknya lewat checklist website siap AI Search dan gunakan schema untuk GEO untuk memperjelas makna halaman yang tetap dapat diakses.