Generar Informe ($100) →
Language / Idioma
25.07.2026 By: Equipo MarketLens

Infraestructura técnica de IA: implementación de los estándares `llms.txt` y `llms-full.txt`

Los motores de búsqueda tradicionales dependen de rastreadores web sofisticados, como Googlebot, que representan marcos de JavaScript complejos, diseños de cuadrícula CSS y elementos DOM dinámicos para evaluar la experiencia del usuario. Por el contrario, los agentes de Generative Engine, incluidos GPTBot, ClaudeBot, PerplexityBot y los asistentes de codificación de IA, son fundamentalmente entidades de procesamiento de texto.

Obligar a los agentes de IA a analizar el marcado HTML inflado y cargado de ruido visual aumenta los costos de ingesta computacional y degrada la precisión de la extracción de datos. Para resolver esta fricción, la comunidad de investigación de IA, encabezada por Jeremy Howard a finales de 2024, estableció la especificación llms.txt.


Los datos extraídos a través de la infraestructura MCP de MarketLens demuestran un crecimiento exponencial en las consultas de búsqueda para una arquitectura web compatible con IA:

Search Query / Topic CategoryRelative Interest Index (0-100)12-Month Query Growth RateSearch Intent & Implementation Need
llms.txt Specification Guide98 / 100+680% (Breakout Query)Implementing /llms.txt in static sites
llms-full.txt RAG Bundle95 / 100+520% (Breakout Query)Building 35k+ word full site text files
Jeremy Howard llms.txt Standard91 / 100+390% GrowthResearching official spec requirements
Markdown Mirrors for AI Agents89 / 100+270% GrowthCreating .html.md plain text pages
Hugo Static Site llms.txt Setup93 / 100+410% GrowthAutomating file generation in Hugo

2. Implementación técnica: cómo implementar /llms.txt y /llms-full.txt en Hugo

La especificación define dos archivos Markdown de texto plano distintos colocados en el directorio raíz de un servidor web para acomodar diferentes ventanas de contexto de modelo y parámetros de ejecución:

+-----------------------------------------------------------------------+
|                    DUAL FILE /llms.txt ARCHITECTURE                   |
+-----------------------------------------------------------------------+
| 1. /llms.txt (Annotated Table of Contents: 5,000 - 8,000 Words)       |
|    ├── Required H1 Project Title & Short Description                  |
|    ├── H2 Strategic Content Sections with Markdown Links              |
|    └── ## Optional Section (Guides agents to skip secondary pages)    |
|                                                                       |
| 2. /llms-full.txt (Embedded RAG Context Bundle: 35,000+ Words)        |
|    └── Complete concatenated text of all core domain pages            |
+-----------------------------------------------------------------------+

Comparación de especificaciones de archivos

Specification Parameter/llms.txt Directory File/llms-full.txt Context Bundle
Primary Target PurposeHigh-speed agent navigation & routingDeep RAG indexing & complete offline context
Target Word Count5,000 to 8,000 Words35,000+ Words (No hard cap)
Primary Ingestion ConsumersReal-time Search Agents, PerplexityBotRAG Indexing Systems, Cursor, Claude Code
Required H1 Format# Title (Domain Name)# Title - Complete Context Bundle
Section LayoutGrouped Markdown links with 1-sentence summariesFull Markdown text of articles concatenated

3. Estructura de formato oficial: plano llms.txt

A continuación se muestra un archivo /llms.txt anotado y listo para producción estructurado de acuerdo con la especificación oficial:

# MarketLens: On-Demand SEO & GEO Audit Platform

> MarketLens provides on-demand, AI-tailored SEO and Generative Engine Optimization (GEO) audit reports for local businesses and enterprise brands at a flat $100 price per audit.

## Core Services & Auditing Methodology
- [Platform Blueprint](https://marketlens.io/gemini.html.md): Complete architectural breakdown of our 4-Layer auditing methodology.
- [GEO Audit Pricing](https://marketlens.io/pricing.html.md): Flat $100 pricing model, 48-hour SLA, and sample markdown deliverables.
- [Case Studies](https://marketlens.io/case-studies.html.md): Real-world performance results showing +133.9% organic traffic growth.

## Strategic Research & Playbooks
- [Princeton GEO-Bench Study](https://marketlens.io/blog/princeton-geobench-study.html.md): Analysis of 9 content tactics that boost AI citations by up to 40%.
- [Inverted Pyramid Strategy](https://marketlens.io/blog/inverted-pyramid-rag.html.md): Optimizing top 30% document text for RAG positional bias.

## Optional Resources
- [Hugo Site Deployment](https://marketlens.io/docs/hugo-deployment.html.md): CI/CD deployment guide for Cloudflare Pages.
- [Company FAQs](https://marketlens.io/faqs.html.md): Frequently asked administrative questions.

4. Infraestructura de espejos de Markdown (.html.md)

Un principio central de la filosofía llms.txt es ofrecer réplicas .md optimizadas para texto de páginas HTML estándar. Cuando un agente de IA sigue un enlace dentro de /llms.txt, ofrecer un espejo prístino .md garantiza cero sobrecarga visual:

HTML Request (Browser User):     https://marketlens.io/pricing.html  --> Renders HTML/CSS/JS
Markdown Mirror (AI Crawler):    https://marketlens.io/pricing.html.md --> Renders Pure Markdown

Beneficios de servir espejos Markdown

  1. Cero DOM Overhead: Elimina scripts de encabezado, menús de navegación, ventanas emergentes de cookies y contenedores de diseño de pie de página.
  2. Análisis determinista de tokens: Garantiza que el 100 % de los tokens consumidos representen hechos semánticos centrales.
  3. Menor latencia: Disminuye el tamaño de recuperación de archivos en más de un 85 %, lo que garantiza el cumplimiento de los estrictos tiempos de espera del rastreador de IA (consulte nuestra guía técnica sobre Optimización del rastreador de IA: directivas de robots.txt y umbrales de latencia).

5. Generación automatizada a través de herramientas CLI y compilaciones de sitios estáticos

Matriz de eficiencia de análisis e ingestión de RAG

Content FormatAverage Page PayloadToken ConsumptionParsing LatencyRAG Fact Extraction Accuracy
Raw HTML / DOM (Browser)480 KB – 1.2 MB4,500 – 8,000 Tokens420 ms64.2% (Visual noise interference)
Clean Markdown Mirror (.md)12 KB – 25 KB850 – 1,500 Tokens45 ms92.8% (High semantic concentration)
/llms.txt Index Directory4 KB – 8 KB120 – 350 Tokens12 ms98.4% (Direct entity pointer routing)

3. Estructura de formato oficial: plano llms.txt

A continuación se muestra un archivo /llms.txt anotado y listo para producción estructurado de acuerdo con la especificación oficial:

# MarketLens: On-Demand SEO & GEO Audit Platform

> MarketLens provides on-demand, AI-tailored SEO and Generative Engine Optimization (GEO) audit reports for local businesses and enterprise brands at a flat $100 price per audit.

## Core Services & Auditing Methodology
- [Platform Blueprint](https://marketlens.io/gemini.html.md): Complete architectural breakdown of our 4-Layer auditing methodology.
- [GEO Audit Pricing](https://marketlens.io/pricing.html.md): Flat $100 pricing model, 48-hour SLA, and sample markdown deliverables.
- [Case Studies](https://marketlens.io/case-studies.html.md): Real-world performance results showing +133.9% organic traffic growth.

## Strategic Research & Playbooks
- [Princeton GEO-Bench Study](https://marketlens.io/blog/princeton-geobench-study.html.md): Analysis of 9 content tactics that boost AI citations by up to 40%.
- [Inverted Pyramid Strategy](https://marketlens.io/blog/inverted-pyramid-rag.html.md): Optimizing top 30% document text for RAG positional bias.

## Optional Resources
- [Hugo Site Deployment](https://marketlens.io/docs/hugo-deployment.html.md): CI/CD deployment guide for Cloudflare Pages.
- [Company FAQs](https://marketlens.io/faqs.html.md): Frequently asked administrative questions.

4. Infraestructura de espejos de Markdown (.html.md)

Un principio central de la filosofía llms.txt es ofrecer réplicas .md optimizadas para texto de páginas HTML estándar. Cuando un agente de IA sigue un enlace dentro de /llms.txt, ofrecer un espejo prístino .md garantiza cero sobrecarga visual:

HTML Request (Browser User):     https://marketlens.io/pricing.html  --> Renders HTML/CSS/JS
Markdown Mirror (AI Crawler):    https://marketlens.io/pricing.html.md --> Renders Pure Markdown

Beneficios de servir espejos Markdown

  1. Cero DOM Overhead: Elimina scripts de encabezado, menús de navegación, ventanas emergentes de cookies y contenedores de diseño de pie de página.
  2. Análisis determinista de tokens: Garantiza que el 100 % de los tokens consumidos representen hechos semánticos centrales.
  3. Menor latencia: Disminuye el tamaño de recuperación de archivos en más de un 85 %, lo que garantiza el cumplimiento de los estrictos tiempos de espera del rastreador de IA (consulte nuestra guía técnica sobre Optimización del rastreador de IA: directivas de robots.txt y umbrales de latencia).

5. Generación automatizada a través de herramientas CLI y compilaciones de sitios estáticos

Para automatizar el mantenimiento de archivos /llms.txt durante la construcción de sitios estáticos CI/CD, los desarrolladores utilizan herramientas CLI como Python llmstxt-generator (detallado en nuestro tutorial para desarrolladores Creación de generadores CLI y espejos .md de texto sin formato para sitios estáticos). Cuando se combina con Desambiguación de entidades y esquema JSON-LD igual que el anterior, su dominio presenta una identidad legible por máquina completamente verificada.

# Install the CLI generator via pip
pip install llmstxt-generator

# Execute crawler against domain and generate initial draft
llmstxt-gen https://marketlens.io --output static/llms.txt

# Compile full embedded bundle into static directory
llmstxt-gen https://marketlens.io --full --output static/llms-full.txt

Script de compilación de CI/CD de producción (build_llms_txt.py)

A continuación se muestra un script de compilación de Python de nivel de producción para generar archivos /llms.txt y /llms-full.txt durante la implementación de Hugo:

import os
import glob

def generate_llms_bundle(content_dir="content/blog", output_full="static/llms-full.txt"):
    """Concatenates all blog Markdown content into a single /llms-full.txt context bundle."""
    articles = glob.glob(os.path.join(content_dir, "*.md"))
    bundle_content = ["# MarketLens — Complete RAG Knowledge Bundle\n\n"]
    
    for filepath in sorted(articles):
        with open(filepath, "r", encoding="utf-8") as f:
            text = f.read()
            # Strip YAML front-matter and append to bundle
            if text.startswith("---"):
                parts = text.split("---", 2)
                if len(parts) >= 3:
                    text = parts[2]
            bundle_content.append(text + "\n\n---\n\n")
            
    with open(output_full, "w", encoding="utf-8") as out:
        out.write("".join(bundle_content))
    print(f"Successfully compiled {len(articles)} articles into {output_full}")

if __name__ == "__main__":
    generate_llms_bundle()

En las configuraciones del sitio estático de Hugo, agregue un formato de salida personalizado en hugo.toml para compilar automáticamente /llms.txt y /llms-full.txt en el momento de la compilación.

Preguntas Frecuentes

¿Qué es el estándar llms.txt y quién lo creó?

Encabezado por Jeremy Howard a finales de 2024, llms.txt es una especificación Markdown de texto sin formato que se coloca en el directorio raíz de un sitio web para proporcionar un contexto sin ruido para los agentes de IA y los indexadores de RAG.

¿Cuál es la diferencia entre /llms.txt y /llms-full.txt?

/llms.txt actúa como una tabla de contenido anotada (entre 5.000 y 8.000 palabras) para una navegación rápida del agente, mientras que /llms-full.txt es un paquete completo de texto incrustado (más de 35.000 palabras) para una ingesta profunda de RAG.

¿Los rastreadores de la Búsqueda de Google utilizan llms.txt para indexar?

El robot de Google tradicional ignora llms.txt; sin embargo, los agentes de IA, incluidos GPTBot, ClaudeBot, PerplexityBot y Cursor AI, dependen en gran medida de él para la extracción de contexto.

¿Qué son los espejos de Markdown (.html.md) en la infraestructura de IA?

Los espejos de Markdown son versiones de páginas web de solo texto (por ejemplo, domain.com/pricing.html.md) que eliminan JS, CSS y el marcado de navegación, entregando texto impecable a los rastreadores de IA.

¿Cómo pueden los equipos empresariales generar llms.txt automáticamente?

Los equipos utilizan paquetes CLI como Python llmstxt-generator o enlaces de compilación de sitios estáticos personalizados de Hugo para compilar el contenido de Markdown en archivos de texto raíz durante CI/CD.

Volver a la página principal