Content Signals y grounding: el nuevo estándar de robots.txt para decirle a la IA qué puede usar de tu web

Añádenos como fuente

Content Signals es una propuesta impulsada por Cloudflare que permite expresar en robots.txt si el contenido de una web puede utilizarse para búsqueda, como entrada de sistemas de IA o para entrenar modelos. En una estrategia de Generative Engine Optimization (GEO), introduce una distinción relevante: una cosa es permitir que un sistema acceda al contenido y otra indicar para qué usos quieres autorizarlo.

El problema es que estas señales no funcionan como un bloqueo técnico y su cumplimiento depende de cada proveedor. Por eso, para una empresa no se trata simplemente de bloquear bots de IA, sino de decidir qué usos del contenido quiere facilitar y cuáles quiere restringir sin perjudicar su visibilidad en los nuevos entornos de búsqueda. En este artículo veremos cómo funcionan Content Signals en robots.txt, qué significan ai-input y ai-train y por qué no todos los crawlers y fetchers de IA deben gestionarse de la misma manera.

* Transforma tu estrategia digital con nuestra guía sobre la Generative  Engine Optimization (GEO) y aprende a mejorar tu visibilidad y autoridad con  nuestra guía.¡Clica y descarga!

content signals que es

Qué es Content Signals y qué problema intenta resolver en tu estrategia de marketing digital

Content Signals es una propuesta de Cloudflare que añade al archivo robots.txt señales legibles por máquinas para expresar qué usos se permiten sobre el contenido. Su principal aportación es separar tres finalidades que hasta ahora podían quedar mezcladas:

  • search. Permite utilizar el contenido para crear un índice de búsqueda y mostrar enlaces o fragmentos.
  • ai-input. Indica si puede introducirse en modelos de IA para generar respuestas en tiempo real, mediante grounding o sistemas similares.
  • ai-train. Expresa si puede utilizarse para entrenar o ajustar modelos.

La diferencia es relevante para cualquier estrategia de marketing digital. Permitir que un crawler acceda a una página no implica necesariamente querer que ese contenido termine formando parte del entrenamiento de un modelo. Content Signals intenta dar a las empresas un control más granular: distinguir entre ser encontradas, alimentar una respuesta generativa y ceder contenido para entrenamiento.

Además, no indicar una de estas señales no equivale a conceder ni a denegar permiso: simplemente significa que el propietario no ha expresado una preferencia mediante este mecanismo. Por eso, antes de modificar robots.txt conviene decidir qué papel quieres que tenga tu contenido en cada uno de estos tres usos, en lugar de aplicar un bloqueo general a toda la actividad de IA.

Por qué no es un bloqueo real, sino una petición

Content Signals sirve para expresar preferencias, pero no crea por sí mismo una barrera técnica. Un ai-train=no, por ejemplo, comunica que el propietario no autoriza el uso del contenido para entrenamiento, pero la señal solo resulta efectiva si quien accede a la web decide reconocerla y respetarla. Cloudflare plantea estas restricciones también como una reserva expresa de derechos, aunque su efecto jurídico puede depender de la jurisdicción.

Aquí está su principal limitación: según la información recopilada por Ayuda WordPress, ninguna de las grandes compañías de IA —OpenAI, Google, Anthropic o Meta— se ha comprometido públicamente a adoptar Content Signals como norma propia. Por eso no conviene confundir una declaración de uso permitido con un mecanismo capaz de impedir técnicamente el acceso al contenido.

Esto no significa que configurarlo carezca de utilidad. Permite dejar constancia explícita de las preferencias de la empresa y añade una capa de control más precisa que el robots.txt tradicional. La decisión relevante no es elegir entre permitir o bloquear toda la IA, sino definir qué usos del contenido encajan con los objetivos de visibilidad, protección y negocio de la marca.

 

bloquear-bots-ia

No todos los bots de IA se comportan igual (la parte que nadie explica bien)

Agrupar todos los bots de IA bajo una misma etiqueta puede llevar a decisiones poco precisas. No cumplen la misma función ni acceden a una web por el mismo motivo. La diferencia clave está entre los sistemas que rastrean contenido de forma automatizada y los que acceden a una URL porque un usuario ha pedido expresamente consultar esa página.

Por un lado, están los crawlers utilizados para descubrir contenido, alimentar buscadores o recopilar información para determinados usos de IA. Aquí entran bots como GPTBot, ClaudeBot o PerplexityBot, mientras que OAI-SearchBot está orientado específicamente a búsqueda. Google-Extended funciona de forma distinta: no es un crawler independiente, sino un token de control que permite indicar a Google si puede usar contenido para determinados productos de IA.

Por otro lado, existen fetchers activados por el usuario, como ChatGPT-User o Claude-User. Cuando una persona pide directamente a una herramienta que consulte una URL, estos sistemas pueden acceder al contenido en un contexto distinto al de un rastreo automatizado. Por eso, bloquear un crawler en robots.txt no garantiza que ningún sistema de IA vuelva a acceder a esa página bajo ninguna circunstancia.

Esta distinción importa especialmente al decidir si conviene bloquear bots de IA. Un bloqueo general puede proteger determinados usos del contenido, pero también puede reducir la capacidad de una marca para aparecer en experiencias de búsqueda o respuesta asistidas por IA. La estrategia debería separar entrenamiento, búsqueda y acceso solicitado por el usuario antes de definir reglas para cada bot.

Cómo configurar Content Signals paso a paso

La configuración se realiza dentro del robots.txt mediante la directiva Content-Signal. Antes de añadirla, conviene decidir qué usos quieres permitir, porque no existe una configuración correcta para todas las empresas: depende de cuánto quieras priorizar visibilidad, uso en respuestas generativas o protección frente al entrenamiento.

Una configuración básica podría ser esta:

User-Agent: *

Content-Signal: search=yes, ai-input=yes, ai-train=no

Allow: /

En este caso, la web expresa tres preferencias: permite que el contenido se utilice para búsqueda (search=yes), acepta su uso como entrada de sistemas generativos (ai-input=yes) y rechaza que se emplee para entrenar o ajustar modelos (ai-train=no). Cloudflare también permite omitir una señal cuando la empresa no quiere pronunciarse sobre ese uso concreto.

 

fletchers-de-ia

 

Para una marca que quiere ganar presencia en respuestas de IA sin autorizar el entrenamiento, esta combinación puede resultar coherente. El objetivo es evitar el planteamiento de “todo permitido” o “todo bloqueado” y definir cada uso del contenido por separado.

Después de modificar el archivo, conviene comprobar que robots.txt sigue siendo accesible y que las reglas existentes para buscadores o bots concretos no entran en conflicto con la nueva configuración. Si además utilizas un archivo llms.txt, recuerda que cumple una función diferente: puede facilitar a los sistemas de IA la localización de contenido relevante, mientras que Content Signals expresa preferencias sobre cómo puede utilizarse ese contenido.

Cloudflare también ofrece una configuración gestionada que, por defecto, puede declarar search=yes y ai-train=no. Automatizar esta parte simplifica la implementación, pero la decisión sobre qué usos autorizar debería seguir respondiendo a la estrategia de cada negocio.

Qué hacen ya otras webs: el enfoque selectivo es la norma

Los datos disponibles apuntan a que las webs con una estrategia activa frente a la IA no suelen optar por un bloqueo absoluto. Un estudio de BuzzStream sobre los 100 principales sitios de noticias de Estados Unidos y Reino Unido, recogido por ALM Corp, encontró que solo el 14% bloqueaba todos los bots de IA analizados, mientras que el 18% no bloqueaba ninguno. La mayoría se situaba, por tanto, en algún punto intermedio.

La selección también cambia según la función del bot. El 79% de los sitios analizados bloqueaba al menos un bot relacionado con entrenamiento, mientras que el 71% hacía lo mismo con algún bot de búsqueda o recuperación de información. Incluso dentro de cada categoría existen diferencias considerables: GPTBot, ClaudeBot, OAI-SearchBot o PerplexityBot no reciben el mismo tratamiento.

La tendencia relevante para una empresa no es bloquear más, sino decidir con mayor precisión qué accesos aportan valor y cuáles no encajan con su estrategia. Para una marca que quiere mantener presencia en respuestas generativas, por ejemplo, puede tener sentido restringir determinados crawlers de entrenamiento sin cerrar las vías que contribuyen a la búsqueda y al grounding. Content Signals intenta trasladar esa misma lógica selectiva desde el acceso del bot hacia el uso que puede hacerse del contenido.

Esta decisión debería formar parte de una estrategia más amplia sobre cómo mejorar tu visibilidad en IA con SEO (GEO), combinando presencia en sistemas generativos, control sobre el uso del contenido y una configuración técnica coherente con los objetivos de negocio.

Ebook del SEO al GEO

Preguntas frecuentes sobre Content Signals

Foto de Cláudia Huguet

Cláudia Huguet

Inbound Marketing Specialist en Cyberclick. Responsable de la estrategia y desarrollo de campañas de clientes.

Inbound Marketing Specialist at Cyberclick. Responsible for developing strategy and managing client campaigns.