
O site de origem bloqueia a coleta: o que o Telematic faz
Explicamos o que acontece quando uma fonte de conteúdo bloqueia tecnicamente a coleta automática e por que isso nem sempre significa que o projeto vai perder o conteúdo.

Explicamos o que acontece quando uma fonte de conteúdo bloqueia tecnicamente a coleta automática e por que isso nem sempre significa que o projeto vai perder o conteúdo.
Mais cedo ou mais tarde, isso acontece com qualquer pessoa que configura a coleta automática de conteúdo de fontes externas: ontem o feed trazia artigos normalmente, mas hoje a fonte de repente fica em silêncio. A primeira reação costuma ser de pânico — “a fonte parou de funcionar, pronto, o piloto automático travou”. Na prática, em nove de cada dez casos, não é uma falha, mas uma proteção do site: ele simplesmente percebeu que não era um navegador de uma pessoa, mas uma solicitação automatizada, e decidiu não entregar o conteúdo.
A diferença entre “a fonte está realmente indisponível” e “a fonte está temporariamente se protegendo contra bots” é fundamental. No segundo caso, o sistema não deve desistir após a primeira tentativa malsucedida, porque por trás de um mesmo bloqueio pode haver qualquer coisa: desde um simples tempo limite até um sistema anti-bot avançado, que analisa o comportamento do navegador. Na Telematic, desenvolvemos a coleta de conteúdo pensando justamente em situações como essa — e não em um mundo ideal, no qual todo site sempre entrega HTML limpo na primeira solicitação.
A seguir, explicamos como isso funciona por dentro e o que significa para quem só quer receber conteúdo novo todos os dias no projeto, em vez de erros sem fim no registro de execuções.
A maioria dos sites, especialmente os de notícias e os especializados, convive há muito tempo com a pressão dos bots: alguns roubam conteúdo, outros manipulam o tráfego e outros simplesmente sobrecarregam o servidor com solicitações frequentes. A resposta do setor é uma proteção em várias camadas: desde limites simples de solicitações por IP até verificações complexas, que analisam se o “visitante” se comporta como um navegador de verdade — se executa JavaScript, move o cursor e carrega fontes e imagens na ordem correta.
Para um sistema de coleta automática, isso significa que não dá para depender de uma única forma de obter a página. O que funcionou ontem pode ser bloqueado amanhã — não porque a fonte saiu do ar, mas porque a proteção ficou mais rigorosa ou o sistema identificou um padrão de solicitações e o marcou temporariamente como suspeito.
É por isso que a coleta de conteúdo na Telematic não para após a primeira tentativa malsucedida: ela passa por vários níveis de obtenção da página antes de considerar a fonte realmente indisponível:
Só quando não é possível obter o conteúdo em nenhum desses níveis a fonte é marcada como temporariamente indisponível, e não como “quebrada para sempre”. Isso é fundamental: uma falha de rede pontual ou um bloqueio temporário não deve invalidar uma fonte que funcionou normalmente por meses.
Obter a página é apenas metade do trabalho. Em seguida, entra em ação o filtro temático de conteúdo: se o projeto tiver um tema configurado, o sistema filtra, no nível do projeto, os materiais que vieram da fonte, mas não são relevantes — por exemplo, quando um feed especializado publica de repente um comunicado de imprensa publicitário ou um conteúdo que não tem relação com o tema do canal. Isso acontece antes mesmo de o conteúdo passar pelo processamento mais caro de IA, economizando tokens e poupando o trabalho de quem, caso contrário, teria que vasculhar rascunhos “fora do tema”.
O que passa pelo filtro é então avaliado de acordo com os limiares de análise automática: o próprio sistema decide quais materiais correspondem aos critérios do projeto com confiança suficiente para seguir automaticamente pelo fluxo de trabalho e quais devem permanecer como rascunhos para revisão manual. Não é um botão binário de “confiar ou não na fonte”, mas um limite de confiança configurável, que permite automatizar os casos óbvios e deixar a decisão sobre os casos duvidosos para uma pessoa.
Tivemos um caso ilustrativo durante os testes: um dos sites especializados, que vinha fornecendo conteúdo regularmente havia várias semanas, de repente parou de entregar qualquer coisa além de uma página de bloqueio com CAPTCHA. A primeira reação foi dar a fonte como morta e removê-la do projeto. Mas, ao investigar, descobrimos que o site simplesmente havia ativado uma proteção mais rigorosa após uma onda de scraping em massa por parte de serviços de terceiros — todos que acessavam o site automaticamente foram afetados, inclusive nós.
Foi justamente a abordagem em várias camadas que salvou a situação: a solicitação simples realmente deixou de funcionar, mas a emulação do navegador continuou obtendo a página normalmente, porque a proteção bloqueava principalmente as solicitações mais primitivas, sem sinais de um navegador real. Se o sistema desistisse já no primeiro nível, a fonte seria classificada como “indisponível” sem motivo — enquanto o conteúdo continuaria sendo coletado normalmente.
Também acontece o contrário: em determinado momento, a fonte ativa uma proteção tão rigorosa que nenhum dos níveis consegue passar. Nesses casos, o sistema registra honestamente a fonte como indisponível, em vez de ficar “batendo” indefinidamente em uma porta fechada e desperdiçar recursos. Essa também é uma escolha consciente: é melhor indicar claramente no registro de execuções que a fonte precisa de atenção do que mascarar o problema com tentativas silenciosas sem fim.
A conclusão prática é simples: se você encontrar uma falha isolada de uma fonte no registro de execuções, isso não é motivo para entrar em pânico, migrar o feed inteiro para outro serviço ou verificar manualmente as configurações. Antes de informar o problema, o sistema já percorreu o caminho da solicitação simples até as técnicas avançadas de contorno — ou seja, quando o erro aparece, vale mesmo a pena prestar mais atenção à fonte.
O ideal é configurar o filtro temático com a maior precisão possível desde o início. Isso economiza não apenas tempo de moderação manual, mas também tokens que seriam gastos processando conteúdos fora do tema. Já os limiares de análise automática devem ser definidos de forma conservadora no começo e flexibilizados gradualmente, à medida que você constatar que o conteúdo aceito automaticamente realmente corresponde às suas expectativas. Assim, o piloto automático conquista sua confiança aos poucos, em vez de passar por uma mudança brusca de uma só vez.
Em última análise, o objetivo desse mecanismo é tirar das pessoas a tarefa rotineira de “verificar se a fonte ainda está no ar”, deixando para elas apenas as decisões editoriais: se o conteúdo merece ser publicado, se o tom é adequado e se precisa de ajustes manuais. A parte técnica da disponibilidade do site, o sistema tenta resolver por conta própria antes de incomodar quem administra o projeto.
Conteúdo que conhece o leitor: como a personalização com IA está mudando as regras do jogo
Arquivamento automático de rascunhos: projeto organizado sem limpeza manual