Guía técnica · GEO
Bots de IA en tu robots.txt Quién te está leyendo. Y a quién dejas entrar.
Doce rastreadores de inteligencia artificial pasan por tu web. Qué hace cada uno, qué pierdes exactamente si lo bloqueas, y la configuración concreta — con el error más caro y más repetido de los últimos dos años.
El punto de partida
Tu robots.txt decide si la IA puede nombrarte.
Cuando alguien le pregunta a ChatGPT por una asesoría en Valencia o a Perplexity por un fontanero en Miami, el modelo construye la respuesta con las fuentes que ha podido leer. Si tu robots.txt le cerró la puerta a ese rastreador, tu web no está en la baraja. No es que salgas peor: es que no sales.
Y aquí está lo incómodo: la mayoría de webs que bloquean estos bots no lo decidieron. Se lo puso un plugin de seguridad, una plantilla copiada de un foro, o un hosting que añadió reglas «de protección de contenido» sin explicar qué apagaba.
El mapa
Los doce que importan.
No son intercambiables. Cada uno alimenta un producto distinto, y bloquear uno tiene una consecuencia muy concreta.
| Rastreador | De quién es | Para qué entra | Si lo bloqueas |
|---|---|---|---|
| GPTBot | OpenAI | Alimenta el conocimiento de ChatGPT | Sales del catálogo de ChatGPT |
| OAI-SearchBot | OpenAI | Construye el índice de búsqueda de ChatGPT | No apareces cuando ChatGPT busca |
| ChatGPT-User | OpenAI | Abre tu página cuando un usuario se lo pide | Ni pegando tu URL en el chat se ve |
| ClaudeBot | Anthropic | Rastrea para Claude | Claude no puede citarte |
| PerplexityBot | Perplexity | Su índice de búsqueda | Desapareces de Perplexity |
| Perplexity-User | Perplexity | Visita a petición de una persona | No se puede abrir tu web desde ahí |
| Google-Extended | Uso en Gemini y Vertex AI | Sales de Gemini. Tu Google sigue igual | |
| Applebot | Apple | Siri y Spotlight | Siri deja de encontrarte |
| Applebot-Extended | Apple | Uso para entrenamiento | Solo afecta al entrenamiento |
| Amazonbot | Amazon | Alexa y sus respuestas | Alexa no te conoce |
| meta-externalagent | Meta | Meta AI | Fuera de Meta AI |
| CCBot | Common Crawl | Corpus abierto que usan muchos modelos | Sales de un montón de modelos a la vez |
El error caro
Bloquear no protege nada. Solo te esconde.
La lógica de «que no me roben el contenido» suena razonable y es falsa. El robots.txt no impide copiar: cualquiera con el botón derecho puede hacerlo, y un scraper malicioso se lo salta sin despeinarse.
Lo único que consigue un bloqueo es que los sistemas que sí respetan la convención — OpenAI, Anthropic, Google, Apple, Perplexity — dejen de poder mencionarte. Le cierras la puerta al educado y se la dejas abierta al que entra por la ventana.
Merece la pena bloquear cuando el contenido es el producto: un medio de pago, un archivo de fotografía, una base de datos por suscripción. En una web de servicios que quiere que la llamen, es tirarse piedras al tejado.
El malentendido
Google-Extended no toca tu posición en Google.
Es la confusión más extendida y la que más dinero cuesta, porque va en las dos direcciones.
| Agente | Qué gobierna | Qué NO gobierna |
|---|---|---|
| Googlebot | Rastreo, indexación y posición en el buscador | Nada de Gemini |
| Google-Extended | Uso de tu contenido en Gemini y Vertex AI | Ni rastreo, ni indexación, ni ranking |
Traducido: bloquear Google-Extended no te penaliza en Google, y permitirlo no te sube. Son dos grifos separados. Quien te diga que permitir Google-Extended mejora tu SEO, no ha leído la documentación.
La configuración
Cómo queda, en concreto.
Va en tudominio.com/robots.txt, en la raíz. Un bloque por agente: no se pueden encadenar varios User-agent con una sola regla y esperar que se apliquen a todos por separado.
## Buscadores clásicos: acceso total. User-agent: * Allow: / ## Rastreadores de IA. Se permiten a propósito: ## si no pueden leer la web, no pueden citarla. User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: ClaudeBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: / Sitemap: https://tudominio.com/sitemap.xml
La última línea hace más trabajo del que parece: el Sitemap le da a cada rastreador la lista completa de tus URLs en vez de obligarle a adivinarlas saltando de enlace en enlace.
Una advertencia que nos ha costado aprender: no metas aquí una línea LLM-Content apuntando a tu archivo llms.txt. Circula mucho por foros, pero no es una directiva válida de robots.txt: Lighthouse y el probador de Google la marcan como error de validación, y no la lee nadie. El llms.txt se descubre por convención en la raíz del dominio; para asegurarte de que se encuentra, enlázalo desde alguna página.
Si no citas el llms.txt desde aquí y no lo enlazas desde ninguna página, no lo encuentra nadie. Es un fallo que hemos visto — y cometido — en webs por lo demás impecables.
Cómo comprobarlo
Tres minutos para saber si estás dentro o fuera.
- Abre tu robots.txt. Escribe tu dominio seguido de
/robots.txt. Si da 404, no tienes archivo: todos entran, que en este caso es mejor que bloquearlos por error. - Busca la palabra
Disallow. CualquierDisallow: /bajo un agente de la tabla de arriba es una puerta cerrada. Es el hallazgo más frecuente. - Comprueba que el sitemap está citado. Si falta la línea
Sitemap:, estás obligando a cada rastreador a descubrir tus páginas a ciegas. - Pregúntale a la IA por tu negocio. Sin decir el nombre: «asesoría fiscal en Valencia». Si no apareces, ya sabes por dónde empezar — aquí tienes el método completo para comprobarlo.
Preguntas
Lo que siempre se pregunta.
¿Bloquear los bots de IA protege mi contenido?
No lo protege: lo esconde. Bloquear GPTBot o ClaudeBot no impide que nadie copie tu texto, solo hace que ChatGPT y Claude dejen de poder citarte. Si tu negocio vive de que te encuentren, es tirarte piedras al tejado.
¿Bloquear Google-Extended me baja en Google?
No. Google-Extended solo controla si tu contenido se usa en Gemini y en Vertex AI. No afecta al rastreo, ni a la indexación, ni a tu posición en el buscador: eso lo gobierna Googlebot, que es otro agente distinto.
¿Qué diferencia hay entre GPTBot y ChatGPT-User?
GPTBot rastrea la web por su cuenta para construir el conocimiento del modelo. ChatGPT-User entra a tu página solo cuando una persona le pide a ChatGPT que la abra. Si bloqueas el segundo, ni siquiera un cliente que pega tu URL en el chat podrá ver lo que pone.
¿El robots.txt obliga a los bots?
No es una barrera técnica, es una convención. Los rastreadores de OpenAI, Anthropic, Google, Apple y Perplexity la respetan y lo documentan públicamente. Un bot malicioso la ignorará, así que para bloquear de verdad hace falta cortar por servidor o cortafuegos.
¿Hace falta también un archivo llms.txt?
Ayuda, pero no sustituye al robots.txt. El robots.txt dice quién puede entrar; el llms.txt resume de qué va tu sitio en un formato que los modelos leen fácil. Y si no lo citas desde el robots.txt ni lo enlazas, no lo encuentra nadie.
¿Cuándo sí tiene sentido bloquear?
Cuando el contenido es el producto que vendes: un medio de pago, un archivo de fotografía, una base de datos por suscripción. Ahí la visibilidad no compensa. En una web de servicios que quiere clientes, casi nunca.
Esto es una pieza del trabajo de posicionamiento en buscadores de IA. El robots.txt abre la puerta; que además te citen depende de cómo esté escrita y estructurada la página que hay detrás.
Empecemos
¿Te está leyendo la IA?
En la auditoría gratuita lo primero que miramos es esto: qué rastreadores tienes abiertos, qué encuentran y qué contestan hoy los modelos cuando les preguntan por lo que tú haces.
Pedir auditoría gratuita