レポートを作成 ($100) →
Language / Idioma
25.07.2026 By: MarketLensチーム

AI クローラーの最適化: robots.txt ディレクティブとレイテンシー パフォーマンスしきい値

生成エンジン内の可視性を確保するには、単に高品質のコンテンツ以上のものが必要です。それには、アクセス可能な技術的なクロール インフラストラクチャが必要です。多くのパブリッシャーは、LLM トレーニング スクレーパーから知的財産を保護することを目的とした包括的な「robots.txt」ブロックを展開することで、誤ってリアルタイム AI 検索プールから自社を除外しています。

さらに、AI 検索エージェントは、厳格な レイテンシー パフォーマンスしきい値 の下で動作します。リアルタイム検索合成中にサーバーの応答に時間がかかりすぎる場合、RAG エンジンは取得プールからドメインを削除します。


1. Google トレンド データ: AI クローラーとテクニカル SEO

MarketLens MCP インフラストラクチャ経由で抽出されたデータは、AI クローラー アクセスとエッジ パフォーマンスに関する検索関心の高まりを示しています。

Search Query / Topic CategoryRelative Interest Index (0-100)12-Month Query Growth RateSearch Intent & Technical Focus
GPTBot robots.txt Configuration97 / 100+540% (Breakout Query)Allowing AI search agents while managing training bots
PerplexityBot Crawl Optimization93 / 100+410% (Breakout Query)Ensuring real-time indexing by Perplexity
AI Search Latency Thresholds89 / 100+280% GrowthMeeting FCP < 0.4s for RAG ingestion
Cloudflare Pages Edge Caching GEO94 / 100+390% GrowthUtilizing $0 static edge infrastructure
Crawl Budget Optimization LLM87 / 100+220% GrowthEliminating URL noise for fast fetching

2. トレーニング ボットをリアルタイム検索クローラーから切り離す

現代のテクニカル SEO における重大な間違いは、すべての AI クローラーを単一のカテゴリーとして扱うことです。 OpenAI、Anthropic、Google は、オフライン LLM トレーニングリアルタイム検索取得用に別々のボットを運用しています。

+-----------------------------------------------------------------------+
|                    AI CRAWLER CLASSIFICATION MATRIX                   |
+-----------------------------------------------------------------------+
| REAL-TIME SEARCH RETRIEVAL BOTS (Must ALLOW for GEO)                  |
| ├── OAI-SearchBot (ChatGPT Real-Time Web Search)                     |
| ├── PerplexityBot (Perplexity Real-Time Indexing)                     |
| └── Claude-Web (Anthropic Real-Time Search Agent)                     |
|                                                                       |
| OFFLINE MODEL TRAINING BOTS (Optional to BLOCK or ALLOW)             |
| ├── GPTBot (OpenAI Training Model Data Scraper)                       |
| ├── ClaudeBot (Anthropic Model Training Scraper)                      |
| └── Google-Extended (Google Gemini Model Training Scraper)            |
+-----------------------------------------------------------------------+

検索クローラーをブロックするコスト

発行者が「OAI-SearchBot」または「PerplexityBot」をブロックすると、ドメインはリアルタイム検索候補プールから完全に削除されます。ユーザーが ChatGPT に商業的な質問をすると、AI エージェントはサイトへのアクセスを物理的に禁止され、引用市場シェア 0% が保証されます。


3. 実稼働対応の GEO「robots.txt」ブループリント

以下は、管理パスを保護し、トレーニング クローラーを管理しながら、リアルタイムの AI 検索取得を可能にする、最適化された「robots.txt」構成です。導入ルールについては、AI クローラー用の Robots.txt ディレクティブ を参照し、コンテキスト インデックスを AI エージェント用の llms.txt 標準の実装 にリンクし、[コア Web 経由でサイト配信を最適化] を参照してください。バイタルとモバイル速度の最適化](/blog/core-web-vitals-mobile-optimization/)。

# Standard Global Web Crawlers
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/
Disallow: /*?*query=

# Real-Time AI Search Retrieval Agents (MANDATORY FOR GEO)
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-Web
Allow: /

# Offline AI Model Training Crawlers (Explicitly Permitted for Max Authority)
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

# XML Sitemap Directives
Sitemap: https://marketlens.io/sitemap.xml

4. リアルタイム RAG のレイテンシ パフォーマンスしきい値

ユーザーが ChatGPT Search または Perplexity AI でクエリを実行すると、RAG エンジンは 200 ミリ秒から 800 ミリ秒という極端な合計バジェット ウィンドウ内でリアルタイム Web フェッチを実行します。基本パフォーマンスのしきい値を満たさないサイトは、候補の選択中に除外されます。

Performance MetricTraditional Web TargetAI Retrieval ThresholdTechnical Impact
First Contentful Paint (FCP)< 1.8 Seconds< 0.4 Seconds (400ms)Hard cutoff for real-time RAG fetch
Interaction to Next Paint (INP)< 200 Milliseconds< 100 MillisecondsPrevents DOM main thread blocking
Time to First Byte (TTFB)< 800 Milliseconds< 100 MillisecondsEdge network CDN requirement
DOM Size & Node Count< 1,500 Nodes< 500 NodesReduces token parsing overhead

5. 静的アーキテクチャ (Hugo + Cloudflare) が勝つ理由

Hugo などの静的サイト ジェネレーターを Cloudflare Pages などのエッジ ネットワークに直接デプロイすると、本質的にすべての AI 遅延要件が満たされます。

Legacy Dynamic WordPress:   User/Bot Request --> PHP Engine --> MySQL Query --> Render HTML (TTFB: 600ms+)
Hugo Static Edge Network:   User/Bot Request --> Edge CDN Cache Hit (TTFB: <40ms)
  1. 事前にレンダリングされた HTML: データベース クエリとサーバー側のレンダリング遅延を排除します。
  2. グローバル エッジ配信: 最も近いエッジ データ センターから AI エージェントにコンテンツを配信し、世界中で TTFB を 40 ミリ秒未満に維持します。
  3. クリーンな HTML 出力: 重い JavaScript フレームワークを使用せずに、軽量でセマンティックなマークアップをコンパイルします。

よくある質問

robots.txt で GPTBot をブロックすると、生成エンジンの最適化にとって危険なのはなぜですか?

GPTBot または OAI-SearchBot をブロックすると、OpenAI の検索エージェントがリアルタイム検索中にサイトのデータを取得できなくなり、ChatGPT 検索の引用からブランドが排除されます。

明示的に許可する必要があるコア AI 検索ボットは何ですか?

主な検索ボットには、GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Google-Extended、および ByteSpider が含まれます。

AI クローラーはどのようなパフォーマンス レイテンシのしきい値を適用しますか?

AI エージェントは厳しいタイムアウトの下で動作し、最初のコンテンツフル ペイント (FCP) は 0.4 秒未満、インタラクションから次のペイント (INP) までは 200 ミリ秒未満が必要です。

静的サイトホスティング (例: Cloudflare Pages の Hugo) は AI 遅延要件をどのように解決しますか?

静的サイトはビルド時に HTML を事前レンダリングし、グローバル エッジ ネットワーク全体に展開し、データベースやサーバーのレンダリングのオーバーヘッドなしで 100 ミリ秒未満でファイルを提供します。

企業チームは AI ボットのクロール予算をどのように最適化できるでしょうか?

チームは、重複する URL パラメータを削除し、ソフト 404 エラーを排除し、軽量のプレーンテキスト Markdown ミラー (.html.md) を提供することで、クロール バジェットを最適化します。

トップページに戻る