Léo Pereira e Ciência de Dados: Como a Análise Preditiva Avalia Zagueiros de Elite no Futebol Moderno

Por Pedro Lealdino Filho, PhD — Cientista de Dados Sênior · 15 de julho de 2026

O nome Léo Pereira voltou a dominar as buscas no Google Brasil — seja por grandes atuações com o Flamengo, convocações para a Seleção ou rumores de transferência. Mas o que poucos sabem é que, nos bastidores dos maiores clubes do mundo, equipes inteiras de cientistas de dados trabalham exatamente para responder a uma pergunta simples: esse zagueiro realmente entrega o que parece entregar aos olhos?

Neste artigo, vou mostrar como a ciência de dados e a inteligência artificial estão revolucionando a avaliação de defensores no futebol — usando o perfil de jogadores como Léo Pereira como estudo de caso concreto. Se você é fã de futebol e curioso sobre dados, vai adorar o que vem por aí.

1. Por Que Avaliar Zagueiros é um Problema Difícil de Dados

Durante décadas, avaliar um atacante foi relativamente simples: gols, assistências, finalizações. Zagueiros, por outro lado, vivem num território estatisticamente nebuloso. Um grande zagueiro frequentemente não precisa agir — porque ele se posiciona tão bem que o perigo nunca chega.

Esse é o chamado paradoxo do defensor invisível: quanto melhor ele é, menos ações de defesa ele precisa registrar. Isso torna métricas brutas como "cortes por jogo" ou "duelos ganhos" profundamente enganosas se usadas isoladamente.

É aqui que a ciência de dados entra com força total. Modelos modernos conseguem:

No caso de Léo Pereira, por exemplo, dados públicos do Opta e da StatsBomb mostram um zagueiro com altíssima taxa de duelos aéreos ganhos (acima de 70% em temporadas recentes) combinada com boa capacidade de saída de bola — uma combinação rara que os modelos conseguem capturar e valorizar adequadamente.

2. As Métricas Avançadas que Definem um Zagueiro de Élite

Vamos detalhar as principais métricas que cientistas de dados utilizam para ranquear defensores centrais em ligas competitivas:

PPDA (Passes Permitidos por Ação Defensiva): mede a intensidade da pressão defensiva. Quanto menor o PPDA do setor defensivo onde o zagueiro atua, mais eficiente é a defesa como sistema — e os dados individuais ajudam a identificar quem lidera esse esforço.

xGA (Gols Esperados Contra): compara os gols esperados que o time sofreria (baseado na qualidade dos chutes adversários) com o que realmente sofreu. Um zagueiro que consistentemente ajuda o time a performar abaixo do xGA está agregando valor real.

Progressive Passes Received (PPR): zagueiros modernos precisam construir o jogo. O PPR mede quantos passes progressivos (que avançam o campo) o jogador recebe e processa — indicando sua participação na transição defensiva-ofensiva.

Pressures e Pressure Regains: quantas vezes o jogador pressionou adversários e, dentro de 5 segundos, o time recuperou a bola. Essa métrica captura a efetividade da pressão, não apenas o volume.

💡 Insight de Dados: Um estudo publicado no MIT Sloan Sports Analytics Conference mostrou que métricas baseadas em tracking data conseguem prever o valor de mercado de zagueiros com 23% mais precisão do que estatísticas tradicionais. Isso equivale a diferenças de dezenas de milhões de euros em negociações reais.

3. Como os Modelos de Machine Learning Funcionam na Prática

Nos departamentos de análise de clubes como Flamengo, Palmeiras e nos gigantes europeus, os cientistas de dados constroem modelos supervisionados para classificar e projetar a performance de defensores. Veja o pipeline típico:

Coleta de dados: APIs de provedores como StatsBomb, Opta, Wyscout e SkillCorner fornecem dados de eventos (passes, chutes, duelos) e de rastreamento (posição XY a cada 0,1 segundo). Um único jogo pode gerar mais de 3 milhões de pontos de dados de rastreamento.

Feature Engineering: Os dados brutos são transformados em variáveis significativas. Por exemplo, a distância média do zagueiro em relação à linha defensiva do time, calculada ao longo de todos os momentos defensivos da partida, é uma feature poderosa para identificar organização tática.

Modelos utilizados: Gradient Boosting (XGBoost, LightGBM) domina para previsão de valor de mercado e ranking de performance. Redes neurais recorrentes (LSTM) são usadas para modelar sequências temporais de jogo. Modelos de sobrevivência (Survival Analysis) estimam por quanto tempo um jogador manterá determinado nível de performance.

Validação: O grande desafio é que dados de futebol sofrem de alta variância — o futebol é um esporte de baixa pontuação onde a aleatoriedade tem papel enorme. Por isso, os melhores modelos incorporam intervalos de confiança bayesianos para comunicar incerteza, algo que decisores de clubes cada vez mais exigem.

4. O Caso Prático: Construindo um Índice de Performance Defensiva

Vou mostrar como, conceitualmente, um cientista de dados construiria um índice simples para comparar zagueiros. Em Python, o processo seria:

Primeiro, normalizamos cada métrica individualmente usando z-score para que todas fiquem na mesma escala. Depois, aplicamos pesos baseados em análise de componentes principais (PCA) ou, em abordagens mais interpretáveis, pesos definidos por especialistas táticos do clube.

Um índice composto poderia ter a seguinte estrutura de pesos para um zagueiro moderno de clube que joga com saída de bola:

Esse índice, quando aplicado a dados de temporadas completas, permite comparações objetivas entre jogadores de ligas diferentes — algo essencial para decisões de mercado. Um zagueiro com índice alto na Série A brasileira tem real correspondência com o nível europeu? Os dados dizem que sim, quando ajustados pela qualidade da liga.

5. O Futuro: IA Generativa e Vídeo na Análise de Defensores

A próxima fronteira já está sendo explorada pelos maiores clubes do mundo. Modelos de visão computacional baseados em redes neurais convolucionais (CNNs) conseguem analisar automaticamente horas de vídeo para extrair padrões de posicionamento que nem os dados de rastreamento capturam completamente.

Imagine um modelo que assiste a todos os jogos de Léo Pereira na temporada e automaticamente identifica: em quais situações ele tende a avançar demais sobre o atacante? Em quais tipos de cruzamento ele é mais vulnerável? Qual é o padrão de comunicação posicional com o outro zagueiro?

Empresas como a Stats Perform já oferecem produtos nesse sentido, e o Flamengo — um dos clubes brasileiros mais avançados em análise de dados — utiliza ferramentas similares. O resultado é uma camada qualitativa de inteligência que complementa os números e torna as decisões de escalação, mercado e treinamento muito mais embasadas.

Além disso, IA generativa (como os modelos de linguagem de grande escala) começa a ser usada para sintetizar relatórios de scouting automaticamente — combinando dados quantitativos com observações táticas em linguagem natural, economizando dezenas de horas de analistas por semana.

O futebol sempre foi uma mistura de arte e ciência. O que a ciência de dados faz não é eliminar a intuição dos treinadores — é dar a ela uma base muito mais sólida. Quando um Flamengo decide renovar ou vender um Léo Pereira, os números estão na mesa. E cada vez mais, esses números são produzidos por algoritmos sofisticados rodando em clusters de computação em nuvem, não em planilhas manuais.

Se você quiser se aprofundar em como montar um pipeline de dados para esportes ou entender mais sobre modelos preditivos aplicados a contextos reais, explore os outros artigos do blog.

Perguntas Frequentes

Quais dados são necessários para analisar a performance de um zagueiro com ciência de dados?

Os dados essenciais são: dados de eventos (duelos, interceptações, passes, chutes bloqueados), dados de rastreamento (posição XY dos jogadores em tempo real), métricas físicas (velocidade, aceleração, distância percorrida) e dados contextuais (qualidade dos adversários enfrentados, sistema tático do time). Provedores como StatsBomb, Opta e SkillCorner são as principais fontes utilizadas por clubes profissionais.

É possível comparar zagueiros de ligas diferentes usando modelos de dados?

Sim, mas com ajustes importantes. Técnicas como "league adjustment" normalizam as métricas pela qualidade média da liga — medida pelo ranking UEFA, nível dos adversários enfrentados ou métricas próprias de qualidade. Dessa forma, é possível comparar um zagueiro da Série A brasileira com um da Bundesliga de forma mais justa e objetiva do que apenas olhando para os números brutos.

Como clubes brasileiros como o Flamengo usam ciência de dados na prática?

Clubes como Flamengo, Palmeiras e Red Bull Bragantino possuem departamentos de análise de desempenho com analistas de dados dedicados. Eles utilizam plataformas como Wyscout e InStat para scouting, combinadas com ferramentas próprias desenvolvidas internamente. As aplicações vão desde análise de adversários antes de jogos até decisões de mercado e personalização de treinamentos para recuperação física de jogadores.

← Voltar para o Blog

Kit Gratuito

50 Prompts de IA
prontos para usar

Um kit prático com os melhores prompts para produtividade, escrita, análise de dados e tomada de decisão.

Sem spam. Seus dados ficam só com você.

50 Prompts de IA
prontos para usar

Baixe agora e comece a usar IA de forma prática no seu dia a dia.