Cloudflareの新設定が、Googlebotまで締め出していた|検索とAI学習が同じ一本のクローラーだったという話
9月15日、少し前に書いた記事の当日を迎えた。
うちはCloudflareを使っていないから関係ない、と思っていた。
その決めつけのほうが甘かった。
9月15日という日付を見て、少し前に自分で書いた記事を思い出した。
Cloudflareが「広告のあるページだけAIクローラーを締め出す」設定を有効にする、その当日だ。
うちのサーバーはCloudflareを使っていないから関係ない、と当時は書いた。
調べ直すと、その決めつけのほうが甘かった。
何があったのか
Cloudflareは9月15日から、新規に導入したドメインと、設定を変えていない既存の無料ユーザーに対して、広告のあるページで「トレーニング」「エージェント」用のクローラーを既定でブロックする設定へ切り替えた。
検索用のクローラーだけは通す、という説明だった。
問題はその「検索用」と「トレーニング用」の線引きにあった。
GooglebotやBingbotは検索インデックス作成と生成AIモデルの学習の両方に、同じ一本のクロールを使い回している。
Cloudflareはこれを「検索とトレーニングが混ざったクローラー」に分類し、複数の役割を持つクローラーには「いちばん厳しいルールを当てはめる」方式を採っていた。
結果として、トレーニング用クローラーをブロックする設定にしていたサイトでは、Googlebot自体への応答が403(拒否)に変わってしまった。
僕がひっかかったところ
ひっかかったのは、Cloudflare側の設計そのものより、「検索」と「それ以外」を機械的に線引きすることの難しさのほうだった。
Googlebotから見れば、一回のアクセスで検索のためにも学習のためにも使われている。
サイト側からは、そのアクセスが検索目的なのか学習目的なのか区別する手段がない。
ネットワークの層で見えているのは一本のクローラーだけで、目的ごとに分けて許可を出すという発想自体が、そもそも噛み合っていなかった。
うちのサーバーはCloudflareを経由していないので、今回の403は直接には起きない。
それでも「うちは関係ない」で片付けていいかというと、そうでもなかった。
自分のサイトのrobots.txtやAI関連の設定を見直すと、検索クローラーとAI学習クローラーをひとまとめに許可したままの箇所が残っていた。
相手の実装が変わらなくても、こちら側の許可の出し方が雑であれば、いずれ同じ種類のすれ違いを起こす。
で、僕はどうするか
Cloudflareを使う予定はいまのところないが、AI関連クローラーの許可設定は個別に見直すことにした。
検索用と学習用をひとまとめの「AI」として扱っている項目がないか、robots.txtとAIクローラー設定の両方を棚卸しする。
もうひとつは、他社のインフラで起きた不具合を「うちは対象外」で終わらせない癖をつけることだった。
今回のGooglebotの一件も、影響を受けたのはCloudflareのユーザーだけだが、根っこにあるのは「複数の目的を持つアクセスを、単純な許可・拒否だけで割り切ろうとする」という発想そのものの限界だ。
これは自分のサイトの設定にも、形を変えて同じように潜んでいる。
出典
ほかにも書いています
note・スタンプ※noteは運営者が個人で書いているものです。
