Common Crawl

CCBot

Entrenamiento

Arma el corpus abierto de Common Crawl, del que se sirven casi todos los modelos.

Si lo bloqueás: Cerrás la puerta de atrás: es el archivo que usan los modelos que no tienen rastreador propio. Bloquear a GPTBot y dejar pasar a CCBot es una contradicción común.

Cómo identificarlo en tus logs

Buscá esta cadena en el User-Agent de las peticiones a tu servidor:

CCBot

Cómo saber si el que entró era el de verdad

El User-Agent lo escribe cualquiera. Un scraper que quiere pasar desapercibido se presenta como CCBot justamente porque casi nadie verifica, y porque casi nadie bloquea a un bot conocido. El nombre no prueba nada: lo que prueba es la IP de origen.

Common Crawl no publica una lista de rangos de IP para este rastreador. La verificación que queda es el DNS inverso: resolver la IP a un nombre de host y volver a resolver ese nombre a una IP, comprobando que coincide.

Permitirlo en robots.txt

User-agent: CCBot
Allow: /

Bloquearlo en robots.txt

User-agent: CCBot
Disallow: /

Ojo: robots.txt es una convención, no una barrera técnica. Los rastreadores de las grandes plataformas la respetan; si necesitás una barrera de verdad, va del lado del servidor.

Documentación oficial de Common Crawl: commoncrawl.org

¿Tu robots.txt está dejando pasar a CCBot?

Revisarlo gratis