Shopping cart

Subtotal $0.00

View cartCheckout

Building better devs

TnewsTnews
  • Home
  • Dicas
  • Cloudflare Vai Bloquear Bots de IA por Padrão em Setembro
Dicas

Cloudflare Vai Bloquear Bots de IA por Padrão em Setembro

Email : 5

Seu site está alimentando IAs de graça. A Cloudflare acabou de dar um jeito nisso.

Enquanto você dorme, dezenas de crawlers visitam seu site. Alguns indexam suas páginas para buscadores. Outros copiam seu conteúdo inteiro para treinar modelos de linguagem. Até ontem, a Cloudflare só oferecia uma opção: bloquear tudo ou liberar tudo. Agora, a empresa separou os bots de IA em três categorias distintas, e a partir de 15 de setembro de 2026, sites novos na plataforma vão bloquear crawlers de treinamento por padrão.

Eu acompanho o debate sobre crawlers de IA desde que o GPTBot apareceu pela primeira vez nos logs de acesso de sites mundo afora. A reação inicial foi pânico: “a OpenAI está raspando meu conteúdo!”. Depois veio a resignação. E agora, finalmente, ferramentas reais para lidar com isso.

Vamos direto ao que importa.

As três categorias de bots de IA

A Cloudflare redesenhou completamente sua taxonomia de bots. Em vez de tratar todo crawler de IA como uma coisa só, agora existem três classificações baseadas em comportamento:

Categoria O que faz Exemplo de bots Você recebe algo em troca?
Search Indexa seu conteúdo para resultados de busca GoogleBot, BingBot, OAI-SearchBot, Claude-SearchBot Sim: tráfego de referência
Agent Busca conteúdo em tempo real a pedido de um usuário ChatGPT-User, Claude-User, PerplexityBot Parcialmente: citação, às vezes link
Training Coleta dados para treinar ou ajustar modelos GPTBot, CCBot, anthropic-ai, Bytespider Não: seu conteúdo vira peso do modelo

Essa separação é o ponto central do anúncio. Antes, se você quisesse impedir que seu conteúdo fosse usado para treinamento, precisava bloquear tudo e perdia visibilidade em buscas com IA. Agora dá para ser cirúrgico: bloquear treinamento, liberar busca, decidir caso a caso sobre agentes.

Por que isso importa (e o problema dos crawlers “multiuso”)

A sacada mais importante, e que quase ninguém está falando, é sobre os crawlers que servem mais de um propósito. O GoogleBot, por exemplo, indexa páginas para o Google Search, mas o Google também usa dados de crawling para treinar o Gemini. O BingBot alimenta tanto o Bing quanto o treinamento de modelos da Microsoft.

A Cloudflare chama isso de “multi-purpose crawlers”. E aqui mora o perigo: se você ativar uma política restritiva para Training a partir de setembro, pode acabar afetando crawlers que também servem para Search. A empresa avisou que vai notificar todos os clientes existentes antes da mudança, mas o opt-out precisa ser feito manualmente.

Na prática, isso significa que você precisa entender exatamente quais bots visitam seu site antes de sair bloqueando. Que é justamente onde entra a próxima novidade.

BotBase: o catálogo de todos os bots conhecidos

Para clientes Enterprise com Bot Management, a Cloudflare lançou o BotBase: um diretório pesquisável de todos os bots rastreados pela rede. Dá para:

  • Buscar um bot específico pelo nome
  • Ver sua classificação (Search, Agent, Training ou combinação)
  • Filtrar tráfego por bot individual
  • Copiar IDs de detecção para usar em regras de segurança personalizadas
  • Ver o perfil comportamental completo de cada crawler

Junto com o BotBase, veio o Attribution Business Insights, um dashboard que mostra quanto valor cada crawler realmente retorna para o seu site: volume de tráfego de referência, sinais de intenção comercial e a proporção entre crawls e visitas reais. Isso é ouro para quem está negociando licenciamento de conteúdo com empresas de IA.

Infelizmente, essas ferramentas são exclusivas do plano Enterprise. Para quem está no plano gratuito ou Pro, o controle por categoria (Search/Agent/Training) já resolve o grosso do problema.

O que muda em 15 de setembro de 2026

A Cloudflare anunciou que, a partir dessa data, todos os novos domínios adicionados à plataforma terão uma política padrão mais restritiva em páginas com monetização por anúncios:

  • Search: liberado por padrão
  • Agent: bloqueado por padrão
  • Training: bloqueado por padrão

Para domínios já existentes na Cloudflare, nada muda automaticamente. Mas a empresa vai enviar notificações sugerindo a adoção das novas configurações. Você pode ativar ou desativar a qualquer momento nas configurações de segurança da zona.

Esse é o tipo de default que faz diferença real. A maioria dos donos de sites nunca mexe em configuração de bots. Com o padrão invertido, o ônus passa para quem quer liberar o acesso, não para quem quer bloquear.

Como configurar agora (passo a passo)

Você não precisa esperar setembro. Os controles já estão disponíveis para todos os planos, incluindo o gratuito. Veja como configurar:

No painel da Cloudflare

  1. Acesse o dashboard da Cloudflare e selecione seu domínio
  2. Vá em Security > Bots
  3. Na seção “AI Crawlers”, você vai ver três toggles:

– AI Search Crawlers

– AI Agent Crawlers

– AI Training Crawlers

  1. Desative o que não quiser permitir

Via robots.txt (para qualquer site)

Se você não usa Cloudflare, ou quer uma camada extra de controle, o robots.txt continua sendo a primeira linha de defesa. Aqui está uma configuração que bloqueia treinamento mas permite busca:


# Bloquear crawlers de treinamento
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: cohere-ai
Disallow: /

# Permitir crawlers de busca com IA
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Manter buscadores tradicionais
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

Uma coisa que muita gente erra: bloquear o GPTBot não afeta em nada seu ranking no Google. São sistemas completamente separados. Mas bloquear o OAI-SearchBot remove seu site dos resultados do ChatGPT Search. Então pense bem antes de bloquear tudo que tenha “AI” no nome.

Os bots da Anthropic (detalhes que importam)

A Anthropic roda três bots diferentes, e vale entender cada um:

Bot Função Respeita robots.txt?
anthropic-ai Treinamento de modelos Sim
Claude-SearchBot Indexação para busca Sim
Claude-User Fetch em tempo real a pedido do usuário Sim

Se você quer aparecer nas respostas do Claude quando alguém pergunta algo, precisa liberar o Claude-SearchBot. Se quer que o Claude possa ler seu artigo quando um usuário cola o link no chat, precisa liberar o Claude-User. Bloquear só o anthropic-ai impede o treinamento sem afetar a experiência de busca.

A OpenAI segue padrão similar: GPTBot é treinamento, OAI-SearchBot é busca, ChatGPT-User é fetch ao vivo.

O novo parâmetro use no robots.txt

A Cloudflare está propondo uma extensão ao robots.txt com o parâmetro use, que define como bots podem armazenar e redistribuir conteúdo. Os valores possíveis são:

  • immediate: o bot pode usar o conteúdo apenas para responder à consulta atual, sem armazenar
  • reference: pode armazenar referências (como cache), mas não redistribuir o conteúdo completo
  • full: uso irrestrito, incluindo treinamento


User-agent: ChatGPT-User
Allow: /
Use: immediate

User-agent: OAI-SearchBot
Allow: /
Use: reference

Esse parâmetro ainda não é um padrão oficial. A Cloudflare está usando sua escala (20% da web passa por seus servidores) para tentar estabelecer um novo protocolo. Se outras CDNs e empresas de IA adotarem, pode virar o padrão de fato.

O elefante na sala: robots.txt não tem força legal

Preciso ser honesto sobre uma limitação fundamental. O robots.txt é um acordo de cavalheiros. Bots “bem comportados” respeitam as diretivas. Mas nada impede um crawler mal intencionado de simplesmente ignorar o arquivo e raspar tudo mesmo assim.

A Cloudflare resolve parte desse problema porque opera na camada de rede. Quando você bloqueia uma categoria de bot pelo painel, não é um pedido educado: é um bloqueio real de tráfego. O bot recebe um 403 e não consegue acessar o conteúdo.

Porém, crawlers que se disfarçam com user-agents falsos (spoofing) podem burlar até isso. A Cloudflare usa fingerprinting de TLS e análise comportamental para detectar spoofing, mas é um jogo de gato e rato permanente.

Para a grande maioria dos sites, a combinação de robots.txt + bloqueio na Cloudflare é mais do que suficiente. Se você lida com conteúdo ultra-premium, vale considerar autenticação de conteúdo ou paywalls como camada adicional.

O contexto maior: quem paga pelo conteúdo que treina a IA?

Esse lançamento da Cloudflare não existe no vácuo. Ele faz parte de um movimento maior de “content independence” que ganhou força em 2025 e explodiu em 2026.

O New York Times processou a OpenAI. O Reddit fechou acordos milionários de licenciamento. O Stack Overflow vendeu acesso ao seu conteúdo para empresas de IA. E milhares de sites menores simplesmente bloquearam tudo, perdendo visibilidade em troca de princípio.

A abordagem da Cloudflare é a mais pragmática que eu já vi: em vez de forçar uma escolha binária, dá ferramentas para negociar. O Attribution Business Insights é basicamente uma planilha de “quanto meu conteúdo vale para cada crawler”, que pode ser usada em negociações de licenciamento.

Se você administra um blog com tráfego relevante, começa a fazer sentido pensar no seu conteúdo como um ativo que pode ser licenciado. Não estou falando de cobrar por artigo, mas de ter dados concretos sobre quanto tráfego cada empresa de IA retorna ao seu site versus quanto conteúdo ela consome.

Impacto no SEO: o que você precisa saber

A pergunta que todo mundo faz: “se eu bloquear bots de IA, meu SEO vai sofrer?”

A resposta curta: não, desde que você não bloqueie o GoogleBot ou o BingBot.

A resposta longa: existe uma zona cinzenta com o Google-Extended. Esse user-agent foi criado pelo Google especificamente para controlar o uso de dados em treinamento de IA, separado do GoogleBot tradicional. Bloquear o Google-Extended impede que o Google use seu conteúdo para treinar o Gemini, mas NÃO afeta seu ranking no Google Search.

A Cloudflare classifica o Google-Extended como Training, então se você bloquear a categoria Training pelo painel, ele será bloqueado automaticamente. Isso é o comportamento desejado para a maioria dos sites.

Onde complica: alguns bots de IA também contribuem para resultados de busca do futuro. Se você bloquear o PerplexityBot, seu conteúdo não vai aparecer nas respostas do Perplexity. Se bloquear o OAI-SearchBot, adeus ChatGPT Search. Cada um desses canais pode representar tráfego significativo.

Minha recomendação: comece bloqueando só Training, monitore o impacto por 30 dias, e depois decida sobre Agent e Search caso a caso. Dados antes de decisões.

Uma configuração recomendada para desenvolvedores

Se você tem um blog técnico (como esse que você está lendo), aqui vai a configuração que eu recomendo:


# === BLOQUEIO: Treinamento ===
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: cohere-ai
Disallow: /

User-agent: FacebookBot
Disallow: /

# === LIBERADO: Busca com IA ===
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

# === LIBERADO: Buscadores tradicionais ===
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

User-agent: *
Allow: /

Na Cloudflare: Training OFF, Agent ON, Search ON. Essa combinação protege seu conteúdo de ser usado em treinamento, mas mantém visibilidade máxima em todos os canais de busca, tradicionais e com IA.

O que esperar nos próximos meses

A Cloudflare deixou claro que isso é só o começo. A empresa planeja adicionar mais controles até o final do ano, incluindo gerenciamento de tráfego automatizado a partir da mesma interface.

O parâmetro use no robots.txt é a jogada mais ambiciosa. Se for adotado como padrão da indústria, pode criar um framework real para licenciamento automatizado de conteúdo. Imagina um futuro onde seu robots.txt diz “pode usar para busca, mas para treinamento precisa de licença”, e o crawler automaticamente negocia os termos via API.

Parece ficção científica, mas é exatamente para onde o mercado está caminhando. E a Cloudflare, com 20% do tráfego web passando pelos seus servidores, tem poder real para empurrar essa mudança.

Por enquanto, o mais importante é simples: entre no painel da Cloudflare, configure as três categorias, e revise seu robots.txt. Setembro está chegando, e é melhor decidir suas regras antes que alguém decida por você.


Fonte de inspiração: Your site, your rules: new AI traffic options for all customers (Cloudflare Blog)

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts