ELÉVATEDIGITAL Auditoría gratuita

Guía técnica · GEO

Bots de IA en tu robots.txt Quién te está leyendo. Y a quién dejas entrar.

Doce rastreadores de inteligencia artificial pasan por tu web. Qué hace cada uno, qué pierdes exactamente si lo bloqueas, y la configuración concreta — con el error más caro y más repetido de los últimos dos años.

El punto de partida

Tu robots.txt decide si la IA puede nombrarte.

Cuando alguien le pregunta a ChatGPT por una asesoría en Valencia o a Perplexity por un fontanero en Miami, el modelo construye la respuesta con las fuentes que ha podido leer. Si tu robots.txt le cerró la puerta a ese rastreador, tu web no está en la baraja. No es que salgas peor: es que no sales.

Y aquí está lo incómodo: la mayoría de webs que bloquean estos bots no lo decidieron. Se lo puso un plugin de seguridad, una plantilla copiada de un foro, o un hosting que añadió reglas «de protección de contenido» sin explicar qué apagaba.

El mapa

Los doce que importan.

No son intercambiables. Cada uno alimenta un producto distinto, y bloquear uno tiene una consecuencia muy concreta.

RastreadorDe quién esPara qué entraSi lo bloqueas
GPTBotOpenAIAlimenta el conocimiento de ChatGPTSales del catálogo de ChatGPT
OAI-SearchBotOpenAIConstruye el índice de búsqueda de ChatGPTNo apareces cuando ChatGPT busca
ChatGPT-UserOpenAIAbre tu página cuando un usuario se lo pideNi pegando tu URL en el chat se ve
ClaudeBotAnthropicRastrea para ClaudeClaude no puede citarte
PerplexityBotPerplexitySu índice de búsquedaDesapareces de Perplexity
Perplexity-UserPerplexityVisita a petición de una personaNo se puede abrir tu web desde ahí
Google-ExtendedGoogleUso en Gemini y Vertex AISales de Gemini. Tu Google sigue igual
ApplebotAppleSiri y SpotlightSiri deja de encontrarte
Applebot-ExtendedAppleUso para entrenamientoSolo afecta al entrenamiento
AmazonbotAmazonAlexa y sus respuestasAlexa no te conoce
meta-externalagentMetaMeta AIFuera de Meta AI
CCBotCommon CrawlCorpus abierto que usan muchos modelosSales de un montón de modelos a la vez

El error caro

Bloquear no protege nada. Solo te esconde.

La lógica de «que no me roben el contenido» suena razonable y es falsa. El robots.txt no impide copiar: cualquiera con el botón derecho puede hacerlo, y un scraper malicioso se lo salta sin despeinarse.

Lo único que consigue un bloqueo es que los sistemas que respetan la convención — OpenAI, Anthropic, Google, Apple, Perplexity — dejen de poder mencionarte. Le cierras la puerta al educado y se la dejas abierta al que entra por la ventana.

Merece la pena bloquear cuando el contenido es el producto: un medio de pago, un archivo de fotografía, una base de datos por suscripción. En una web de servicios que quiere que la llamen, es tirarse piedras al tejado.

El malentendido

Google-Extended no toca tu posición en Google.

Es la confusión más extendida y la que más dinero cuesta, porque va en las dos direcciones.

AgenteQué gobiernaQué NO gobierna
GooglebotRastreo, indexación y posición en el buscadorNada de Gemini
Google-ExtendedUso de tu contenido en Gemini y Vertex AINi rastreo, ni indexación, ni ranking

Traducido: bloquear Google-Extended no te penaliza en Google, y permitirlo no te sube. Son dos grifos separados. Quien te diga que permitir Google-Extended mejora tu SEO, no ha leído la documentación.

La configuración

Cómo queda, en concreto.

Va en tudominio.com/robots.txt, en la raíz. Un bloque por agente: no se pueden encadenar varios User-agent con una sola regla y esperar que se apliquen a todos por separado.

## Buscadores clásicos: acceso total.
User-agent: *
Allow: /

## Rastreadores de IA. Se permiten a propósito:
## si no pueden leer la web, no pueden citarla.
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

Sitemap: https://tudominio.com/sitemap.xml

La última línea hace más trabajo del que parece: el Sitemap le da a cada rastreador la lista completa de tus URLs en vez de obligarle a adivinarlas saltando de enlace en enlace.

Una advertencia que nos ha costado aprender: no metas aquí una línea LLM-Content apuntando a tu archivo llms.txt. Circula mucho por foros, pero no es una directiva válida de robots.txt: Lighthouse y el probador de Google la marcan como error de validación, y no la lee nadie. El llms.txt se descubre por convención en la raíz del dominio; para asegurarte de que se encuentra, enlázalo desde alguna página.

Si no citas el llms.txt desde aquí y no lo enlazas desde ninguna página, no lo encuentra nadie. Es un fallo que hemos visto — y cometido — en webs por lo demás impecables.

Cómo comprobarlo

Tres minutos para saber si estás dentro o fuera.

  1. Abre tu robots.txt. Escribe tu dominio seguido de /robots.txt. Si da 404, no tienes archivo: todos entran, que en este caso es mejor que bloquearlos por error.
  2. Busca la palabra Disallow. Cualquier Disallow: / bajo un agente de la tabla de arriba es una puerta cerrada. Es el hallazgo más frecuente.
  3. Comprueba que el sitemap está citado. Si falta la línea Sitemap:, estás obligando a cada rastreador a descubrir tus páginas a ciegas.
  4. Pregúntale a la IA por tu negocio. Sin decir el nombre: «asesoría fiscal en Valencia». Si no apareces, ya sabes por dónde empezar — aquí tienes el método completo para comprobarlo.

Preguntas

Lo que siempre se pregunta.

¿Bloquear los bots de IA protege mi contenido?

No lo protege: lo esconde. Bloquear GPTBot o ClaudeBot no impide que nadie copie tu texto, solo hace que ChatGPT y Claude dejen de poder citarte. Si tu negocio vive de que te encuentren, es tirarte piedras al tejado.

¿Bloquear Google-Extended me baja en Google?

No. Google-Extended solo controla si tu contenido se usa en Gemini y en Vertex AI. No afecta al rastreo, ni a la indexación, ni a tu posición en el buscador: eso lo gobierna Googlebot, que es otro agente distinto.

¿Qué diferencia hay entre GPTBot y ChatGPT-User?

GPTBot rastrea la web por su cuenta para construir el conocimiento del modelo. ChatGPT-User entra a tu página solo cuando una persona le pide a ChatGPT que la abra. Si bloqueas el segundo, ni siquiera un cliente que pega tu URL en el chat podrá ver lo que pone.

¿El robots.txt obliga a los bots?

No es una barrera técnica, es una convención. Los rastreadores de OpenAI, Anthropic, Google, Apple y Perplexity la respetan y lo documentan públicamente. Un bot malicioso la ignorará, así que para bloquear de verdad hace falta cortar por servidor o cortafuegos.

¿Hace falta también un archivo llms.txt?

Ayuda, pero no sustituye al robots.txt. El robots.txt dice quién puede entrar; el llms.txt resume de qué va tu sitio en un formato que los modelos leen fácil. Y si no lo citas desde el robots.txt ni lo enlazas, no lo encuentra nadie.

¿Cuándo sí tiene sentido bloquear?

Cuando el contenido es el producto que vendes: un medio de pago, un archivo de fotografía, una base de datos por suscripción. Ahí la visibilidad no compensa. En una web de servicios que quiere clientes, casi nunca.

Esto es una pieza del trabajo de posicionamiento en buscadores de IA. El robots.txt abre la puerta; que además te citen depende de cómo esté escrita y estructurada la página que hay detrás.

Empecemos

¿Te está leyendo la IA?

En la auditoría gratuita lo primero que miramos es esto: qué rastreadores tienes abiertos, qué encuentran y qué contestan hoy los modelos cuando les preguntan por lo que tú haces.

Pedir auditoría gratuita
Auditoría gratis