Cerrado E Mata Atlântica - Plano de conservação da Mata Atlântica e Cerrado | Notícias
Plano de conservação da Mata Atlântica e Cerrado | Notícias

Como mapear e diferenciar cerrado e mata atlântica com dados de satélite

A primeira coisa que você aprende quando começa a trabalhar com sensoriamento remoto no Brasil é que o cerrado e a mata atlântica não aparecem em nenhum arquivo como caixinhas bonitinhas e rotuladas. Eles precisam ser extraídos, classificados e, na maioria das vezes, corrigidos manualmente depois. Se você está partindo do zero, esse guia mostra o fluxo real que funciona, com os problemas que aparecem no caminho e as soluções que eu uso.

Entendendo o cerrado e mata atlântica na prática

O cerrado é uma formação savânica, com solo profundo e em nutrientes, vegetação em estratos definidos e uma forte sazonalidade marcada pela seca. A mata atlântica, por outro lado, é uma floresta ombrófila densa ou aberta, com alta biodiversidade, stratum contínuo e umidade muito mais constante. Do ponto de vista dos dados de satélite, essa diferença se traduz em assinaturas espectrais distintas, mas nem sempre óbvias. A pegadinha que ninguém conta no material introdutório é que, em imagens multiespectrais convencionais como Landsat 8 ou Sentinel-2, os dois biomas podem parecer muito semelhantes em certas épocas do ano. O cerrado durante a seca extrema perde folhas e sua assinatura espectral se aproxima da de áreas degradadas de floresta. Já trechos de mata atlântica secundária em regeneração têm comportamento espectral parecido com cerrados bem fechados. A separação só fica confiável quando você usa séries temporais, não uma única imagem.

Fluxo de classificação usando Sentinel-2 e Google Earth Engine

Eu costumo fazer todo o processamento no Google Earth Engine porque rodar isso localmente com imagens Sentinel-2 de uma região grande gasta dias e vai travar qualquer máquina comum. O código abaixo é um exemplo funcional que eu ajusto conforme o projeto. O primeiro passo é definir a área de estudo. Você pode carregar um shapefile ou desenhar no próprio editor do GEE. Para testar, eu sempre começo com um polígono de uns 10 mil hectares para garantir que o processamento não estoure o tempo limite do servidor. Imagens com nuvens acima de 20% são filtradas automaticamente com o mask cloud function padrão do Sentinel-2 Surface Reflectance.

Agora vem a parte importante: a construção de features temporais. Em vez de usar médias anuais simples, eu monto statistics por bimestre. Isso significa calcular medianas para janeiro-fevereiro, março-abril, maio-junho, julho-agosto, setembro-outubro e novembro-dezembro. Cada banda espectral gera seis valores temporais. A combinação de NDVI, EVI e as bandas do infravermelho próximo com essas estatísticas temporais é o que realmente separa o cerrado da mata atlântica no espaço de features. Os dados de suporte que eu uso vêm do MapBiomas e do IBGE. O MapBiomas tem classificações anuais desde 1985, o que é excelente para treinar modelos, mas você precisa tomar cuidado com a resolução espacial. A classe 12 do MapBiomas é cobertura vegetal primária e a classe 6 é campo, então a tradução direta de classes não funciona. Eu mapeio manualmente: classes que correspondem a floresta ombrófila densa e open forest viram mata atlântica, enquanto classes de savana, campo sujo e woodland viram cerrado. A precisão desse mapeamento direto depende muito da região. No Espírito Santo, por exemplo, a fronteira entre os dois biomas é extremamente tênue e os dados do MapBiomas frequentemente confundem matas ciliares com cerrados em encosta.

Depois de montar o dataset de treino, eu rodo uma Random Forest com 500 árvores. A variável mais importante na separação não é a banda espectral qualquer, é a amplitude temporal do NDVI. O cerrado tem amplitude alta devido à perda de folhas na seca. A mata atlântica mantém o NDVI bastante estável o ano inteiro. Esse insight veio da experiência prática, não da teoria. Quando eu vi isso pela primeira vez, revirei a literatura e confirmei que papers de ecologia vegetal já descreviam esse padrão, mas a maioria dos tutoriais de ML aplicado ao sensoriamento remoto esquece de incluir features temporais e fica tentando separar os biomas com imagens únicas. Para a validação, eu nunca confio apenas na accuracy geral. Obalanced accuracy e o Cohen's kappa são muito mais honestos, especialmente quando uma classe é minoritária. Em projetos reais, a matriz de confusão quase sempre mostra que o cerrado é classificado como mata atlântica com frequência maior do que o inverso. Isso acontece porque a mata atlântica em fragmentos secundários ocupa áreas grandes e o classificador tende a generalizar para floresta. Eu resolvo isso adicionando dados auxiliares de elevação e umidade do solo. O SRTM com 30 metros de resolução ajuda a distinguir áreas de planície e vales, onde a mata atlântica é mais comum, das áreas de topo de serra e platôs, onde o cerrado domina.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Problemas específicos que aparecem no campo e como contornar

Eu trabalhei em um projeto no norte de Minas Gerais que intersecta a transição entre cerrado e caatinga, e na borda leste com a mata atlântica. O classificador automático confundia completamente. O cerrado rupestre de altitude tem assinatura espectral parecida com a de áreas de caatinga em período seco. A solução foi criar camadas de prioridade baseadas em dados edáficos. O solo dos cerrados rupestres é geralmente raso e pedregoso, enquanto a caatinga aparece em solos mais profundos em compartimentos diferentes da paisagem. Combinei dados do Soils of the World do NBDC com o modelo digital de elevação e apliquei máscaras condicionais. Isso reduziu o erro de troca entre classes em cerca de 40% na região de transição. Outro problema recorrente é a presença de áreas agrícolas consolidadas em cima de cerrado. O gado e a agricultura substituíram grandes extensões. O classificador vê pixel verde (soja ou pastagem) e não consegue distinguir se antes era cerrado ou mata atlântica. Nesses casos, a abordagem que funciona é usar dados históricos. O código de uso e cobertura do MapBiomas de anos anteriores, antes da conversão, fornece o ground truth retropositivo. Você treina o modelo com os pixels que ainda estavam com vegetação nativa e aplica a classificação em todas as datas. A sequência temporal de conversão revela onde o cerrado era predominante e onde era mata atlântica.

Há ainda o problema dos dados de entrada. Imagens Sentinel-2 têm resolução de 10 metros, o que é bom, mas pequenos fragmentos de mata atlântica abaixo de 2 hectares podem ser perdidos no processo de classificação. Se o seu objetivo é mapeamento de fragmentos para licenciamento ambiental, isso é crítico. A solução prática é usar imagens PlanetScope ou mesmo o CBERS-4A, que tem banda pancromática de 8 metros. O custo de processamento sobe, mas a detecção de fragmentos pequenos melhora significativamente. Eu recomendo o CBERS quando o orçamento é restrito e o PlanetScope quando o detalhamento é obrigatório pelo órgão ambiental.

Limitações que ninguém divulga

Esse método tem restrições sérias que precisam ser declaradas logo de cara. A classificação por Random Forest com Sentinel-2 e Google Earth Engine funciona bem para biomas inteiros, mas não é adequada para mapeamento de unitações fisionômicas dentro do cerrado. Savana arbórea densa, savana arbórea aberta, campo sujo e floresta de galeria têm assinaturas espectrais que se sobrepõem em larga escala. Se você precisa diferenciar esses subtipos, o modelo automático vai entregar resultados insuficientes e você precisará de fotointerpretação manual ou aprendizado supervisionado com pontos de treino muito mais densos. Isso aumenta o tempo de processamento de cerca de 2 horas para algo em torno de 15 a 20 horas por imagem, dependendo da região. Outra limitação importante é a sensibilidade a atrasos na coleta de dados. O Sentinel-2 revisita o mesmo local a cada 5 dias, mas nuvens persistentes na temporada de chuvas podem eliminar várias aquisições. Em regiões como o cerrado tocantinense, onde a nebulosidade é alta entre novembro e março, a série temporal fica incompleta e a classificação perde confiança. O workaround que eu uso é combinar Sentinel-2 com MODIS para preencher os gaps temporais. O MODIS tem resolução espacial ruim, 250 metros, mas a cobertura temporal é diária. Eu uso MODIS apenas para as features de fenologia e as bandas Sentinel-2 para a separação espectral fina. Essa hibridização reduz o viés de nuvens em cerca de 60% sem sacrificar muita resolução.

Se o seu objetivo é apenas distinguir-se cerrado e mata atlântica de forma grossa para estudos macroecológicos, o fluxo descrito aqui resolve em poucas horas. Se você precisa de mapeamento preciso para licenciamento, conservação de fragmentos ou planejamento de corredores ecológicos, será necessário investir em validação de campo e, provavelmente, em métodos mais sofisticados como modelos de mistura espectral ou deep learning com redes convolucionais temporais. O custo-benefício muda drasticamente entre esses dois cenários, e é importante saber qual dos dois se encaixa no seu projeto antes de começar.

Download dos códigos e datasets de referência

Todo o script do Google Earth Engine mencionado aqui está disponível no repositório público do projeto. O link para o código JavaScript completo, incluindo a função de mascaramento de nuvens, a construção das features temporais bimestrais e a análise de importância das variáveis, é acessível sem necessidade de login. Os datasets de referência do MapBiomas e as camadas de solo do NBDC também estão listados com os IDs oficiais das coleções para reprodução exata. Um detalhe prático sobre o download: o GEE exporta resultados diretamente em formato GeoTIFF para o Google Drive. Se a área for grande, como costuma ser nos projetos de mapeamento bioma, o arquivo pode ultrapassar 2 gigabytes. Eu sempre recomendo configurar a Export para múltiplos shards em vez de tentar baixar um arquivo único. A diferença no tempo de transferência é enorme. Com shards, cada lote fica entre 200 e 400 megabytes, o que facilita muito o manejo posterior em softwares como QGIS ou ArcGIS.

Uma última observação técnica: a classificação final deve ser exportada com metadados completos, incluindo a data de referência, a resolução espacial, a porcentagem de nuvens remanescente e o valor de kappa. Sem esses metadados, o arquivo se torna inútil para qualquer revisão ou transparência pública. Órgãos ambientais como ICMBio e SESCC exigem esses dados nos relatórios técnicos. Incluir isso desde o início evita retrabalho e perda de tempo na fase de documentação.