Blog/technical seo7 minRead in English

¿Tu pyme debería bloquear los rastreadores de IA en 2026?

Bloquear los bots protege tu contenido y tu ancho de banda, pero la regla equivocada te borra de las respuestas con IA. Así se decide.

Filas de servidores en un centro de datos, donde la mayoría de las peticiones ya vienen de rastreadores de IA

Por primera vez en la historia de la web, la mayoría de las visitas a tu sitio no son personas. Cloudflare informó de que los bots automatizados superaron el 57,5% de todas las peticiones HTML de su red a mediados de 2026, y los rastreadores específicos de IA que hay dentro de esa cifra crecen más rápido que ninguna otra cosa: AWS calcula que el tráfico de bots de IA aumenta más de un 300% interanual.

Esto dejó de ser un asunto de nicho el 15 de septiembre de 2026, cuando Cloudflare empezó a bloquear por defecto los rastreadores de IA de «uso mixto» en cualquier página que muestre anuncios, un cambio que alcanza a millones de sitios cuyos dueños nunca abrieron un panel de ajustes. Da igual que tengas una gestoría, una tienda en Shopify o un medio local: ahora tienes que decidir a conciencia qué pueden hacer los bots de IA con tu contenido.

El instinto de muchos dueños es cerrar la puerta de golpe. Pero bloquear los rastreadores de IA es un intercambio, no una victoria gratis: hecho sin cuidado, borra tu negocio de ChatGPT, Perplexity y las respuestas con IA de Google justo cuando esas superficies empiezan a enviar tráfico real. Esta guía explica qué hacen de verdad estos bots, qué cambia al bloquearlos y las cuatro políticas que tienen sentido para una pyme.

No todos los bots de IA quieren lo mismo

Lo más importante que hay que entender en 2026 es que las grandes empresas de IA ahora usan rastreadores distintos para tareas distintas, y esos rastreadores reaccionan de forma muy diferente cuando los bloqueas.

Rastreadores de entrenamiento

GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Google-Extended y Bytespider (TikTok) recogen texto para entrenar o mejorar modelos de lenguaje. Bloquearlos mantiene tu contenido fuera del entrenamiento de futuros modelos. No te saca de ningún producto de búsqueda y no tiene ningún efecto sobre tu posicionamiento en Google: estos bots son totalmente independientes de Googlebot.

Rastreadores de búsqueda y asistentes

OAI-SearchBot alimenta la función de búsqueda de ChatGPT, PerplexityBot nutre las respuestas de Perplexity, y Googlebot junto con la indexación con IA de Google impulsan los AI Overviews y el AI Mode. Si bloqueas estos, tu negocio no puede aparecer citado cuando alguien le pide a un asistente una recomendación de tu sector. Para la mayoría de negocios locales y de e-commerce, ese es el tráfico que de verdad quieres.

El matiz

Algunos rastreadores hacen doble función y los proveedores han tardado en documentar cuál es cuál. Esa ambigüedad es justo el motivo de que el ajuste por defecto de Cloudflare de septiembre apunte a los bots de «uso mixto», y de que una política ajustada a mano gane a una regla general.

Qué consigue bloquear de verdad (y qué no)

  • No perjudica tu posicionamiento en Google. Los rastreadores de IA como GPTBot y ClaudeBot son independientes de Googlebot, así que bloquearlos es invisible para la búsqueda clásica.
  • Te saca de la respuesta que bloqueaste. Sin rastreo no hay cita. Bloquear OAI-SearchBot significa que la búsqueda de ChatGPT no puede mostrar tus páginas.
  • Es voluntario. robots.txt es un sistema de confianza. Los bots serios de OpenAI, Anthropic, Google y Perplexity lo respetan; los scrapers que lo ignoran necesitan una regla de firewall, no un archivo de texto.
  • Es reversible y granular. Puedes permitir un bot, bloquear otro y cambiar de idea la semana siguiente sin daño duradero.

Las cuatro políticas que tienen sentido

1. Permitirlo todo

La opción correcta si tu contenido son sobre todo páginas de marketing y promoción: quieres el máximo alcance y tienes poco texto propio que proteger. Aun así, deberías limitar la frecuencia de los rastreadores abusivos en el borde (política 3), pero no necesitas bloqueos en robots.txt.

2. Política mixta: bloquear entrenamiento, permitir búsqueda

Cerca del 30% de los 1.000 sitios más grandes ya usa esta configuración: bloquear GPTBot, CCBot, ClaudeBot, Google-Extended y Bytespider, y permitir de forma explícita OAI-SearchBot, PerplexityBot y Googlebot. Mantienes tu visibilidad en las respuestas de IA y a la vez dejas tus textos, tu investigación o tus fotos originales fuera de los conjuntos de entrenamiento. Es la mejor opción por defecto para cualquier negocio que publique contenido realmente original.

3. Limitar la frecuencia en el CDN

Si tu problema es la carga del servidor o el coste de ancho de banda, y no una cuestión de principios, resúelvelo en el borde. AI Crawl Control de Cloudflare, las reglas de gestión de bots o un simple límite de frecuencia en el WAF frenan a los rastreadores agresivos sin la brusquedad de un bloqueo total. Mantén los bots de búsqueda y asistentes en la lista de permitidos.

4. Pago por rastreo

El pago por rastreo de Cloudflare devuelve un HTTP 402 «Pago requerido» a los rastreadores de IA y te deja fijar un precio o bloquearlos del todo; ahora evoluciona hacia un modelo de «pago por uso» ligado a la frecuencia con que tu contenido se usa realmente en las respuestas. Siendo realistas, solo los sitios con bibliotecas de contenido grandes y demandadas ganarán dinero significativo, pero no cuesta nada activar un cobro a los bots de entrenamiento y dejar permitidos los asistentes que envían visitas.

Configura tu política en 30 minutos

Edita robots.txt

Añade un bloque como este cerca del principio de tu robots.txt y ajústalo a la política que elegiste. Los rastreadores de IA serios leen el archivo en su siguiente visita.

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Revisa los ajustes por defecto de tu CDN antes de fiarte del archivo

Si usas Cloudflare, abre el panel de AI Crawl Control y revisa qué cambió en torno al 15 de septiembre de 2026. Confirma que los bots de búsqueda con IA que quieres siguen permitidos y que el ajuste gestionado por defecto coincide con tu intención: una regla del CDN tiene prioridad sobre robots.txt.

De momento, olvídate de llms.txt (casi siempre)

llms.txt, un archivo propuesto que entrega a los modelos de IA un mapa curado de tu sitio, ronda el 8–10% de adopción pero casi no tiene uso medible: un estudio de 500 millones de visitas de bots de IA encontró solo 408 que tocaran un archivo llms.txt, y Google ha dicho que no lo va a admitir. Añadirlo no hace daño, pero no es donde debería ir tu primera hora.

Vigila tus registros

Déjalo dos semanas y luego revisa los registros del servidor o la analítica para ver la actividad de rastreadores y cualquier cambio en el tráfico de referencia de IA. Ajusta un bot cada vez para saber qué hizo cada cambio.

Qué debería hacer la mayoría de las pymes

Si vendes servicios o productos locales, permite los rastreadores de búsqueda y asistentes con IA y dedica tu esfuerzo a tener datos estructurados limpios para que esos bots entiendan de verdad tu horario, tu ubicación y tu catálogo. Si publicas contenido original, añade encima la política mixta. Resuelve el dolor de ancho de banda en tu CDN, no a martillazos en robots.txt. Y revisa la decisión cada trimestre: el panorama de rastreadores en 2026 cambia de un mes a otro.

¿No sabes qué está rastreando tu sitio ni si tus páginas son legibles para un asistente de IA? La auditoría web gratuita de Clariola revisa tu robots.txt, tus datos estructurados, tus Core Web Vitals y tu preparación para las respuestas con IA en una sola pasada y te dice exactamente qué arreglar primero. También puedes leer nuestra guía para aparecer citado en los AI Overviews de Google y nuestro repaso a la optimización para motores generativos.

Preguntas frecuentes

¿Bloquear los rastreadores de IA perjudica mi posición en Google? No. GPTBot, ClaudeBot, CCBot y Google-Extended son independientes de Googlebot. Bloquearlos no afecta al posicionamiento clásico de Google ni a que Google pueda indexar tu sitio.

¿Si bloqueo GPTBot, ChatGPT puede seguir recomendando mi negocio? Solo si dejas permitido OAI-SearchBot. GPTBot es para entrenamiento; OAI-SearchBot es lo que usa la búsqueda de ChatGPT para encontrar y citar páginas en vivo, así que bloquea solo GPTBot y seguirás siendo citable.

¿Necesito llms.txt para que la IA me cite? No. La adopción está por debajo del 10% y el uso medido por los rastreadores es casi cero. Los datos estructurados correctos y el contenido rastreable importan mucho más.

Seguí leyendo