← 戻る 薄暗いサーバールームの廊下、遠端の半開きドアから琥珀色の光が漏れている

ClaudeBot と GPTBot にサイトをクロールさせるべきか?

昨年10月、あるクライアントから電話がありました。かなりパニックに陥っていました。ホスティングダッシュボードには3週間でクロールトラフィックが34%急増していて、スクレイパー攻撃を受けたと確信していたのです。サーバーログを確認してみました。スクレイパーではありませんでした。ClaudeBot と GPTBot が、彼の800ページの WooCommerce カタログを数日ごとに時計のように正確にクロールしていました。そんなものが存在することすら知らなかったのです。

この会話は今、あらゆるところで起きています。そしてオンラインで人々が受けているアドバイスはまちまちです。すべてをブロックしろ、すべて許可しろ、どちらでもいい、非常に重要だ。ほとんどは、ここ数ヶ月サーバーログを実際に見たことのない人によって書かれています。

私は見てきました。Seahawk Media で構築された12,000以上のサイト、そして私自身のクライアントポートフォリオにおいて、実際に起きていることと異なるタイプのサイトにとって正しい判断が何かについて、かなり明確な全体像を持つようになりました。一緒に見ていきましょう。

ClaudeBot と GPTBot の実態

まず簡単に整理しておきます。人々はこれらを混同しているため。

GPTBot は OpenAI のクローラーです。将来の GPT モデルの訓練データを収集するために使用されており、2023年中盤から活動しています。OpenAI は GPTBot のドキュメントを公開し、それをブロックしても ChatGPT があなたの既存コンテンツについてどう答えるかには影響しないこと、これは純粋に将来の訓練のためのものであることを明確に述べています。

ClaudeBot は Anthropic の同等のもので、Claude モデルの訓練に使用されます。基本的なストーリーは同じです。ClaudeBot ユーザーエージェント文字列でログに表示され、誠実に自分自身を識別します。これについては彼らにクレジットをあげます。

他にもあります。Google の Google-Extended は Gemini 訓練専用で、Googlebot とは別です。CCBot(Common Crawl)は何年も前からあります。ByteDance の Bytespider もあります。リストは増え続けています。

ただし注意点があります。GPTBot と ClaudeBot は robots.txt を尊重します。Bytespider は...私の経験では、信頼性が低いです。

ブロックメカニズム:robots.txt と実際にできること

GPTBot をブロックしたい場合、robots.txt に以下を追加します。

`` User-agent: GPTBot Disallow: / ``

ClaudeBot、Google-Extended などについても同じパターンです。シンプルです。Yoast や Rank Math のような WordPress プラグインなら30秒で設定できますし、ファイルを直接編集することもできます。

ただし、これが実際に意味することは、これはポライトなリクエストであり、ロックではないということです。法的および評判のために皮膚を張っている企業(OpenAI、Anthropic、Google)からの正当なクローラーはそれを尊重します。競合ツールを構築している疑わしいスクレイパー?彼らはそれを完全に無視します。したがって、あなたの懸念が悪意のある人物によるデータ盗難の防止にあるなら、robots.txt はあなたの防衛線ではありません。Cloudflare のボット管理またはサーバーレベルの IP ブロッキングが必要です。

2時間かけて robots.txt ルールを構成して、絶対に注意を払うことはなかった無名の AI クローラーをブロックしているサイト所有者を見かけてきました。時間の無駄です。エネルギーを正当なクローラーに集中させてください。そこに実際の選択肢があるのですから。

誰も話さない本当のトレードオフ

よし。ここが最もディスカッションが失われるところです。

ブロックの論拠はこのようなものです。「彼らは私のコンテンツを持ち去ってモデルを訓練しているのに、私は何ももらっていない」公正です。本当に。オリジナル編集コンテンツ、法的データベース、詳細なチュートリアルのライブラリを持つパブリッシャーであれば、それはあなたの知的財産であり、価値交換はせいぜい曖昧です。

許可を認める側の主張はこうだ:「AI回答での引用は新しいバックリンクだ。学習データに含まれたいはずだ」。それも一理あるが、学習データとAI引用の関係がそこまで直接的ではないため、人々が認めるより根拠は薄い。

1年以上にわたってクライアントサイトでこれが展開されるのを見た後の、実際の私の見解だ。

問題は「グローバルにブロックするか許可するか」ではない。「どのコンテンツを、どのクローラーに対して、実際に何を保護する必要があるのか」だ。

SaaS ブログは認知を生み出すために存在する。GPTBot をブロックすれば、潜在的な流通チャネルを切断していることになり、目に見える利益は得られない。有料レシピデータベースやプレミアム研究アーカイブなら、損益計算は全く逆になる。

2024年初頭、サブスクリプション型の業界レポート提供サービスを運営するクライアントと仕事をしていた。月間4万訪問者程度の良好なトラフィックだが、ほぼペイウォール保護されている。「見える化が増える」という理由で全AI クローラーを許可していた。ボットが実際にクロール可能な内容を調べたら、Google に noindex を指示されていた18ヶ月分のフルテキストプレミアムレポートが含まれていた。AI クローラーをそれらのディレクトリからブロックした。20分で済んだ。公開マーケティングページは開いたままにした。

これが「全部ブロック」か「全部許可」の一枚岩な議論から抜けている微妙さだ。

これが SEO にどう影響するか(そしてしないか)

ハッキリ言う:ClaudeBot と GPTBot をブロックしても Google ランキングに影響は0だ。ゼロだ。Googlebot は完全に独立したシステムだ。GPTBot と ClaudeBot は Google Search に流入しない。何を言われても信じてはいけない。

潜在的に影響するのは AI 生成回答内での認知度だ。ChatGPT、Claude、Perplexity。特に Perplexity はライブウェブ取得を行うため、学習データとは異なるメカニズムだ。

新興する AEO の側面

Answer Engine Optimisation は今、人々が追跡している実在のものだ。AI 回答のソースとして引用されることは18ヶ月前より重要になっているが、それでもクリーンに測定するのは難しい。理論としては、学習データ内のコンテンツがモデルにブランドやサイトへの親和性を発展させるのに役立ち、時間をかけて引用に影響を与える可能性があるというものだ。もっともらしい。ただし証明されていない。

この推測だけでブロック判断は下さない。コンテンツの性質と商業的な機密性に基づいて判断しろ。

サーバー負荷:小規模ホスト向けの正当な懸念事項

哲学的な議論では見落とされる退屈な実務的なものだ。

ClaudeBot と GPTBot は興味深いサイトで積極的にクロールできる。前述の800ページの WooCommerce クライアント?共有ホスティングは本当に負荷を感じていた。完全ブロックではなく、Cloudflare の Bot Fight Mode 経由でクロール速度制限をして、完全に遮断することなく緩和した。

大規模サイトなら共有ホストにいるはずだ。ログをチェックしろ。実際に見ろ。cPanel の「Raw Access」またはアクセスログを素早くパースできる無料で優秀な GoAccess みたいなツールで可能だ。AI クローラーが上位10リクエスターに現れていてリソースが限られているなら、それは本当の会話だ。

VPS または適切なスペックの専用サーバーなら、おそらく問題ではない。ただし想定するな。

プラットフォーム固有の注釈

WordPressサイト

Yoast SEO と Rank Math は、ファイルに直接触れずに robots.txt を編集できる。Yoast の SEO > Tools > File Editor 下のインターフェースはこれでいい。Rank Math は General Settings > Edit robots.txt の下に同様のパスがある。

より詳細な制御が必要な場合、Yoast Premium の Crawl Optimization 設定を使うと、全般的に不要なクロール対象を削減できるため、全ボットで役立つ。

Shopify とホストされたプラットフォーム

Shopify は robots.txt.liquid を自動生成し、AI クローラー ルールをいくつか含むように更新されているが、制御は限定的だ。2021年以来、robots.txt.liquid カスタマイズパスが利用可能だが、テーマ編集が必要だ。いつも明確とは限らない。

スタティックサイト(Gatsby、Astro、Next.js)

完全なコントロール。public ディレクトリに robots.txt をスタティックファイルとして配置するだけで完了です。これを意図的に設定していない言い訳はありません。

私の現在の推奨フレームワーク

サイトによって異なるデフォルト設定が必要です。現在の考え方は以下の通りです:

デフォルトで許可する場合:

  1. コンテンツが主にマーケティング、教育、認知向上を目的としており、有料コンテンツがない。
  2. ブランドの認知度をできるだけ広げようとしている小企業である。
  3. 自由に利用可能な情報を公開しており、より広い配信から実際に恩恵を受ける。
  4. きめ細かなブロック戦略を維持する技術的なリソースがない。

ブロックまたは制限する場合:

  1. 技術的にクローラブルなプレミアム有料コンテンツがある(一般的な見落とし)。
  2. パブリッシャー、ニュース組織、またはデータベースを運営しており、コンテンツが製品である。
  3. クローラーからのサーバー負荷が制限されたホスティングのパフォーマンスに測定可能な影響を与えている。
  4. 医療、法律、金融コンテンツなど、規制対象のコンテキストでのデータ収集を制限する法的理由がある。

検討する価値がある中間的なアプローチ:

  • 高価値コンテンツディレクトリからは AI トレーニング用クローラーをブロックし、ブログ/マーケティングセクションでは許可する。
  • 負荷が懸念事項の場合は、完全ブロックではなく Cloudflare のレート制限を使用する。
  • 四半期ごとに再検討する。これは急速に変化しており、今日が正しくても明日も正しいとは限りません。

実際に今クローラーがあなたをクロールしているか確認する方法

推測しないで確認しましょう。

  • Cloudflare Analytics(無料版)はボットトラフィックカテゴリを表示し、ユーザーエージェント別にフィルタリングできます。
  • 生のアクセスログに対して GoAccess を実行するのが、どのボットが何をヒットしているか正確に確認する最速の方法です。
  • Google Search Console は AI クローラーのデータを表示しませんが、比較用のクロール基準を提供します。
  • access.log ファイルで直接「GPTBot」または「ClaudeBot」を検索します:grep -i "GPTBot" /var/log/nginx/access.log | wc -l を実行すれば、特定のログファイル内のリクエスト数がすぐにわかります。

Seahawk は今年初めに、クライアントがパフォーマンス問題の原因が AI クローラーだと確信していたプロジェクトがありました。ログ分析を実施したところ、GPTBot は 30 日間で 47 回のリクエストしかしていませんでした。全く関係がありません。実際の原因は、6 時間ごとに完全なサイトスキャンを実行する設定ミスをしたバックアップフラグインでした。ボットの議論に気を取られずに、実際のログを確認してください。

FAQ

GPTBotをブロックするとChatGPTの表示順位は落ちますか?

すでにインデックスされ、トレーニングデータに含まれているコンテンツなら、いいえ。GPTBotをブロックすると、今後のトレーニング実行にのみ影響します。今日robots.txtルールを追加しても、ChatGPTの既存知識は変わりません。そもそもChatGPTのブラウジング機能はライブウェブ取得を行うため、別のメカニズムで管理されています。

ClaudeBotを許可すると、Anthropicは私のサイトをクレジットしてくれますか?

自動的にはいいえです。トレーニングデータの使用に帰属表示は伴いません。Claudeが回答であなたのサイトを引用した場合、それはどのようにトレーニングされたか、また実時間で何を取得したかに基づくもので、クローラーを許可したことの直接的な契約結果ではありません。

AIクローラーから特定のディレクトリだけをブロックできますか?

はい、もちろんです。robots.txtは必要なだけ細かく設定できます。GPTBotには「Disallow: /premium/」を指定しながら「/blog/」は開放するといった設定は完全に有効な構文です。これが実際には、ほとんどのコンテンツビジネスに対して私がお勧めしたい方法です。

AI企業が私のコンテンツでトレーニングしないよう要求する法的根拠はありますか?

これは本当に決着がついていない領域です。New York TimesがOpenAIを相手取った訴訟が最も有名な事例です。今のところ、robots.txtが利用可能な実務的メカニズムです。法的枠組みはこのテクノロジーに数年遅れています。

すべてのAIクローラーはrobots.txtを尊重しますか?

資金力があり、評判に敏感な企業(OpenAI、Anthropic、Google)の主要なクローラーは一般的に尊重します。小規模で説明責任が低いスクレーパーは無視することが多いです。robots.txtは紳士協定であり、技術的障壁ではありません。

---

つまり、ここに普遍的な正解はありません。私はクライアントによってはAIクローラーをブロックし、他のクライアントについては明確に許可している—同じ日に行うこともあります。この決定は、先週Twitterで読んだ何かに基づく一律ポリシーではなく、コンテンツ戦略とホスティング設定と同じ会話の中に置かれるべきです。

ログを確認してください。何があなたをクロールしているか把握してください。そして、設定したことのないデフォルトを継承するのではなく、意図的な選択をしてください。

← 戻る