2026 年に Web クローラー アクセスを管理するには、従来の検索エンジン (Googlebot、Bingbot) を AI 検索およびトレーニング ボット (GPTBot、PerplexityBot、ClaudeBot、Google-Extended) から分離する必要があります。高度な遅延しきい値管理については、AI ボットのクロール ディレクティブと遅延しきい値 を読み、llms.txt 標準のガイド でコンテキスト インデックスを構造化し、[AI エージェント用の llms.txt] で生成例を参照してください。標準の実装](/blog/implementing-llms-txt-standard-ai-agents/)。
1. Google トレンド検索データ: AI クローラー ルール
「trends-mcp」経由で取得されたデータは、AI スクレーパー権限の制御に大きな関心を示しています。
| Google Trends Search Query | Relative Interest Index | 12-Month Query Growth | Crawler Action |
|---|---|---|---|
| GPTBot Robots.txt Rules | 98 / 100 | +320% (Breakout Query) | Search Citation Management |
| PerplexityBot Allow Directive | 92 / 100 | +260% Growth | Answer Engine Citation |
| Block AI Scraping vs Allow Search | 89 / 100 | +210% Growth | Content Protection |
| ClaudeBot User Agent Rules | 86 / 100 | +180% Growth | Anthropic Crawler Rule |
2. プロダクション「robots.txt」設定テンプレート
User-agent: *
Allow: /
# Permit Search Engine AI Assistants & Search Bots
User-agent: GPTBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
# Sitemap & LLM Directory Context
Sitemap: https://marketlens.work/sitemap.xml
# LLM Context File: https://marketlens.work/llms.txt
PerplexityBot ユーザー エージェント Robots.txt のガイドラインとドキュメント
公式 PerplexityBot ユーザー エージェント robots.txt ガイドライン とクローラーのドキュメントに従って、Perplexity の RAG インデクサーはヒット レート制限なしでコンテンツをフェッチできるようになります。 Perplexity 応答エンジンへの組み込みを保証するために、「ユーザー エージェント: PerplexityBot」の明示的なアクセスを許可します。
3. 結論のまとめとアクションステップ
「robots.txt」ファイルを適切に構成すると、データ収集の制御を維持しながら、AI 検索エンジンが Web コンテンツをクロールして引用できるようになります。 「robots.txt」内で「/llms.txt」ファイルを直接リンクすると、AI モデルのインデックス作成が高速化されます。
4. 関連するインフラストラクチャ ガイド
- llms.txt標準ファイルを実装します。
- エッジキャッシングとCloudflare WAFルールを設定します。
- LLM および AI スクレイパー用の JSON-LD スキーマ について学習します。
MarketLens