Générer un Rapport ($100) →
Language / Idioma
25.07.2026 By: Équipe MarketLens

Infrastructure technique d'IA : mise en œuvre des normes « llms.txt » et « llms-full.txt »

Les moteurs de recherche traditionnels s’appuient sur des robots d’exploration Web sophistiqués, tels que Googlebot, qui restituent des cadres JavaScript complexes, des dispositions de grille CSS et des éléments DOM dynamiques pour évaluer l’expérience utilisateur. En revanche, les agents Generative Engine, notamment GPTBot, ClaudeBot, PerplexityBot et les assistants de codage IA, sont fondamentalement des entités de traitement de texte.

Forcer les agents d’IA à analyser un balisage HTML volumineux et chargé de bruit visuel augmente les coûts d’ingestion informatique et dégrade la précision de l’extraction factuelle. Pour résoudre ces frictions, la communauté de recherche en IA, dirigée par Jeremy Howard fin 2024, a établi la spécification llms.txt.


Les données extraites via l’infrastructure MarketLens MCP démontrent une croissance exponentielle des requêtes de recherche pour une architecture Web adaptée à l’IA :

Search Query / Topic CategoryRelative Interest Index (0-100)12-Month Query Growth RateSearch Intent & Implementation Need
llms.txt Specification Guide98 / 100+680% (Breakout Query)Implementing /llms.txt in static sites
llms-full.txt RAG Bundle95 / 100+520% (Breakout Query)Building 35k+ word full site text files
Jeremy Howard llms.txt Standard91 / 100+390% GrowthResearching official spec requirements
Markdown Mirrors for AI Agents89 / 100+270% GrowthCreating .html.md plain text pages
Hugo Static Site llms.txt Setup93 / 100+410% GrowthAutomating file generation in Hugo

2. Implémentation technique : comment déployer /llms.txt et /llms-full.txt dans Hugo

La spécification définit deux fichiers Markdown en texte brut distincts placés dans le répertoire racine d’un serveur Web pour s’adapter à différentes fenêtres de contexte de modèle et paramètres d’exécution :

+-----------------------------------------------------------------------+
|                    DUAL FILE /llms.txt ARCHITECTURE                   |
+-----------------------------------------------------------------------+
| 1. /llms.txt (Annotated Table of Contents: 5,000 - 8,000 Words)       |
|    ├── Required H1 Project Title & Short Description                  |
|    ├── H2 Strategic Content Sections with Markdown Links              |
|    └── ## Optional Section (Guides agents to skip secondary pages)    |
|                                                                       |
| 2. /llms-full.txt (Embedded RAG Context Bundle: 35,000+ Words)        |
|    └── Complete concatenated text of all core domain pages            |
+-----------------------------------------------------------------------+

Comparaison des spécifications de fichiers

Specification Parameter/llms.txt Directory File/llms-full.txt Context Bundle
Primary Target PurposeHigh-speed agent navigation & routingDeep RAG indexing & complete offline context
Target Word Count5,000 to 8,000 Words35,000+ Words (No hard cap)
Primary Ingestion ConsumersReal-time Search Agents, PerplexityBotRAG Indexing Systems, Cursor, Claude Code
Required H1 Format# Title (Domain Name)# Title - Complete Context Bundle
Section LayoutGrouped Markdown links with 1-sentence summariesFull Markdown text of articles concatenated

3. Structure de formatage officielle : plan llms.txt

Vous trouverez ci-dessous un fichier /llms.txt annoté et prêt pour la production, structuré selon la spécification officielle :

# MarketLens: On-Demand SEO & GEO Audit Platform

> MarketLens provides on-demand, AI-tailored SEO and Generative Engine Optimization (GEO) audit reports for local businesses and enterprise brands at a flat $100 price per audit.

## Core Services & Auditing Methodology
- [Platform Blueprint](https://marketlens.io/gemini.html.md): Complete architectural breakdown of our 4-Layer auditing methodology.
- [GEO Audit Pricing](https://marketlens.io/pricing.html.md): Flat $100 pricing model, 48-hour SLA, and sample markdown deliverables.
- [Case Studies](https://marketlens.io/case-studies.html.md): Real-world performance results showing +133.9% organic traffic growth.

## Strategic Research & Playbooks
- [Princeton GEO-Bench Study](https://marketlens.io/blog/princeton-geobench-study.html.md): Analysis of 9 content tactics that boost AI citations by up to 40%.
- [Inverted Pyramid Strategy](https://marketlens.io/blog/inverted-pyramid-rag.html.md): Optimizing top 30% document text for RAG positional bias.

## Optional Resources
- [Hugo Site Deployment](https://marketlens.io/docs/hugo-deployment.html.md): CI/CD deployment guide for Cloudflare Pages.
- [Company FAQs](https://marketlens.io/faqs.html.md): Frequently asked administrative questions.

4. Infrastructure des miroirs Markdown (.html.md)

Un principe fondamental de la philosophie « llms.txt » consiste à servir des miroirs « .md » optimisés pour le texte des pages HTML standard. Lorsqu’un agent IA suit un lien dans /llms.txt, la diffusion d’un miroir .md impeccable garantit une absence de surcharge visuelle :

HTML Request (Browser User):     https://marketlens.io/pricing.html  --> Renders HTML/CSS/JS
Markdown Mirror (AI Crawler):    https://marketlens.io/pricing.html.md --> Renders Pure Markdown

Avantages de servir des miroirs de démarque

  1. Zéro surcharge DOM : Élimine les scripts d’en-tête, les menus de navigation, les fenêtres contextuelles de cookies et les conteneurs de disposition de pied de page.
  2. Analyse déterministe des jetons : garantit que 100 % des jetons consommés représentent des faits sémantiques fondamentaux.
  3. Latence inférieure : diminue la taille de récupération des fichiers de plus de 85 %, garantissant ainsi le respect des délais d’attente stricts des robots d’exploration de l’IA (voir notre guide technique sur Optimisation de l’IA Crawler : directives robots.txt et seuils de latence).

5. Génération automatisée via les outils CLI et les constructions de sites statiques

Matrice d’efficacité d’ingestion et d’analyse RAG

Content FormatAverage Page PayloadToken ConsumptionParsing LatencyRAG Fact Extraction Accuracy
Raw HTML / DOM (Browser)480 KB – 1.2 MB4,500 – 8,000 Tokens420 ms64.2% (Visual noise interference)
Clean Markdown Mirror (.md)12 KB – 25 KB850 – 1,500 Tokens45 ms92.8% (High semantic concentration)
/llms.txt Index Directory4 KB – 8 KB120 – 350 Tokens12 ms98.4% (Direct entity pointer routing)

3. Structure de formatage officielle : plan llms.txt

Vous trouverez ci-dessous un fichier /llms.txt annoté et prêt pour la production, structuré selon la spécification officielle :

# MarketLens: On-Demand SEO & GEO Audit Platform

> MarketLens provides on-demand, AI-tailored SEO and Generative Engine Optimization (GEO) audit reports for local businesses and enterprise brands at a flat $100 price per audit.

## Core Services & Auditing Methodology
- [Platform Blueprint](https://marketlens.io/gemini.html.md): Complete architectural breakdown of our 4-Layer auditing methodology.
- [GEO Audit Pricing](https://marketlens.io/pricing.html.md): Flat $100 pricing model, 48-hour SLA, and sample markdown deliverables.
- [Case Studies](https://marketlens.io/case-studies.html.md): Real-world performance results showing +133.9% organic traffic growth.

## Strategic Research & Playbooks
- [Princeton GEO-Bench Study](https://marketlens.io/blog/princeton-geobench-study.html.md): Analysis of 9 content tactics that boost AI citations by up to 40%.
- [Inverted Pyramid Strategy](https://marketlens.io/blog/inverted-pyramid-rag.html.md): Optimizing top 30% document text for RAG positional bias.

## Optional Resources
- [Hugo Site Deployment](https://marketlens.io/docs/hugo-deployment.html.md): CI/CD deployment guide for Cloudflare Pages.
- [Company FAQs](https://marketlens.io/faqs.html.md): Frequently asked administrative questions.

4. Infrastructure des miroirs Markdown (.html.md)

Un principe fondamental de la philosophie « llms.txt » consiste à servir des miroirs « .md » optimisés pour le texte des pages HTML standard. Lorsqu’un agent IA suit un lien dans /llms.txt, la diffusion d’un miroir .md impeccable garantit une absence de surcharge visuelle :

HTML Request (Browser User):     https://marketlens.io/pricing.html  --> Renders HTML/CSS/JS
Markdown Mirror (AI Crawler):    https://marketlens.io/pricing.html.md --> Renders Pure Markdown

Avantages de servir des miroirs de démarque

  1. Zéro surcharge DOM : Élimine les scripts d’en-tête, les menus de navigation, les fenêtres contextuelles de cookies et les conteneurs de disposition de pied de page.
  2. Analyse déterministe des jetons : garantit que 100 % des jetons consommés représentent des faits sémantiques fondamentaux.
  3. Latence inférieure : diminue la taille de récupération des fichiers de plus de 85 %, garantissant ainsi le respect des délais d’attente stricts des robots d’exploration de l’IA (voir notre guide technique sur Optimisation de l’IA Crawler : directives robots.txt et seuils de latence).

5. Génération automatisée via les outils CLI et les constructions de sites statiques

Pour automatiser la maintenance des fichiers /llms.txt lors des builds de sites statiques CI/CD, les développeurs utilisent des outils CLI tels que Python llmstxt-generator (détaillé dans notre tutoriel développeur Création de générateurs CLI et de miroirs .md en texte brut pour les sites statiques). Lorsqu’il est combiné avec Désambiguïsation de l’entité et schéma identique à JSON-LD, votre domaine présente une identité lisible par machine entièrement vérifiée.

# Install the CLI generator via pip
pip install llmstxt-generator

# Execute crawler against domain and generate initial draft
llmstxt-gen https://marketlens.io --output static/llms.txt

# Compile full embedded bundle into static directory
llmstxt-gen https://marketlens.io --full --output static/llms-full.txt

Script de construction CI/CD de production (build_llms_txt.py)

Vous trouverez ci-dessous un script de construction Python de qualité production pour générer les fichiers /llms.txt et /llms-full.txt pendant le déploiement de Hugo :

import os
import glob

def generate_llms_bundle(content_dir="content/blog", output_full="static/llms-full.txt"):
    """Concatenates all blog Markdown content into a single /llms-full.txt context bundle."""
    articles = glob.glob(os.path.join(content_dir, "*.md"))
    bundle_content = ["# MarketLens — Complete RAG Knowledge Bundle\n\n"]
    
    for filepath in sorted(articles):
        with open(filepath, "r", encoding="utf-8") as f:
            text = f.read()
            # Strip YAML front-matter and append to bundle
            if text.startswith("---"):
                parts = text.split("---", 2)
                if len(parts) >= 3:
                    text = parts[2]
            bundle_content.append(text + "\n\n---\n\n")
            
    with open(output_full, "w", encoding="utf-8") as out:
        out.write("".join(bundle_content))
    print(f"Successfully compiled {len(articles)} articles into {output_full}")

if __name__ == "__main__":
    generate_llms_bundle()

Dans les configurations du site statique Hugo, ajoutez un format de sortie personnalisé dans hugo.toml pour compiler automatiquement /llms.txt et /llms-full.txt au moment de la construction.

Foire Aux Questions

Qu'est-ce que le standard llms.txt et qui l'a créé ?

Dirigé par Jeremy Howard fin 2024, llms.txt est une spécification Markdown en texte brut placée dans le répertoire racine d'un site Web pour fournir un contexte sans bruit aux agents IA et aux indexeurs RAG.

Quelle est la différence entre /llms.txt et /llms-full.txt ?

/llms.txt agit comme une table des matières annotée (5 000 à 8 000 mots) pour une navigation rapide des agents, tandis que /llms-full.txt est un ensemble complet de textes intégrés (plus de 35 000 mots) pour une ingestion RAG approfondie.

Les robots d'exploration de la recherche Google utilisent-ils llms.txt pour l'indexation ?

Le Googlebot traditionnel ignore llms.txt ; cependant, les agents d'IA, notamment GPTBot, ClaudeBot, PerplexityBot et Cursor AI, en dépendent fortement pour l'extraction de contexte.

Que sont les miroirs Markdown (.html.md) dans l'infrastructure d'IA ?

Les miroirs Markdown sont des versions texte uniquement de pages Web (par exemple, domain.com/pricing.html.md) qui suppriment JS, CSS et le balisage de navigation, fournissant ainsi un texte impeccable aux robots d'exploration IA.

Comment les équipes d’entreprise peuvent-elles générer automatiquement le fichier llms.txt ?

Les équipes utilisent des packages CLI tels que Python llmstxt-generator ou des hooks de création de site statique Hugo personnalisés pour compiler le contenu Markdown dans des fichiers texte racine pendant CI/CD.

Retour à l'accueil