Sistema de Transferência de Dados

Logo COIDS

MONAN • Verificação de modelos

Skill Scores categóricos

Os Skill Scores categóricos avaliam a capacidade do modelo de prever a ocorrência ou a não ocorrência de um evento. Para precipitação, o campo contínuo é transformado em um evento binário usando um limiar, por exemplo 1, 2, 5, 10, 20 ou 50 mm em 24 horas.


1. Conversão da precipitação em evento

Para um limiar $T$, define-se:

$$I(x)=\begin{cases}1, & P(x)\geq T \\ 0, & P(x)<T\end{cases}$$

A previsão e a referência são comparadas ponto a ponto, formando uma tabela de contingência.


2. Tabela de contingência

Observado: simObservado: não
Previsto: simH — acerto do evento, hitF — falso alarme
Previsto: nãoM — evento perdido, missCN — não evento corretamente previsto
$$N=H+F+M+CN$$

3. ACC — Accuracy

Representa a fração de previsões corretas, considerando eventos e não eventos.

$$ACC=\frac{H+CN}{H+F+M+CN}$$

Faixa: 0 a 1. Valor ideal: 1.

Em eventos raros, a ACC pode ser elevada apenas porque existem muitos não eventos corretamente previstos. Por isso, deve ser analisada junto com outras métricas.


4. POD — Probability of Detection

Mede qual fração dos eventos realmente observados foi corretamente prevista pelo modelo.

$$POD=\frac{H}{H+M}$$

Faixa: 0 a 1. Valor ideal: 1. Um POD alto significa que poucos eventos observados foram perdidos, mas o índice não penaliza falsos alarmes.


5. POFD — Probability of False Detection

Mede a fração dos não eventos observados que foram incorretamente previstos como eventos.

$$POFD=\frac{F}{F+CN}$$

Faixa: 0 a 1. Valor ideal: 0.


6. FAR — False Alarm Ratio

Entre todos os eventos previstos, indica qual fração correspondeu a falsos alarmes.

$$FAR=\frac{F}{H+F}$$

Faixa: 0 a 1. Valor ideal: 0.


7. CSI — Critical Success Index

O CSI, também conhecido como Threat Score, mede os acertos do evento em relação a todos os casos em que o evento foi previsto ou observado. Os acertos de não evento não entram na fórmula.

$$CSI=\frac{H}{H+F+M}$$

Faixa: 0 a 1. Valor ideal: 1.


8. ETS — Equitable Threat Score

O ETS é semelhante ao CSI, mas desconta a parcela de acertos esperada apenas pelo acaso.

$$H_{\mathrm{random}}=\frac{(H+M)(H+F)}{N}$$
$$ETS=\frac{H-H_{\mathrm{random}}}{H+F+M-H_{\mathrm{random}}}$$

Valor ideal: 1. ETS = 0: desempenho equivalente ao esperado aleatoriamente. ETS < 0: desempenho pior que o esperado ao acaso.


9. F1 Score

O F1 combina a confiabilidade das previsões de evento com a capacidade de detectar os eventos observados.

$$Precision=\frac{H}{H+F}$$
$$Recall=\frac{H}{H+M}=POD$$
$$F1=2\frac{Precision\cdot Recall}{Precision+Recall}=\frac{2H}{2H+F+M}$$

Faixa: 0 a 1. Valor ideal: 1.


10. F0.5 Score

O F0.5 pertence à família $F_\beta$. Como $\beta<1$, ele dá maior peso à Precision do que ao Recall e, portanto, valoriza mais a confiabilidade das previsões de evento.

$$F_\beta=(1+\beta^2)\frac{Precision\cdot Recall}{\beta^2 Precision+Recall}$$
$$F_{0.5}=1.25\frac{Precision\cdot Recall}{0.25\,Precision+Recall}$$

Faixa: 0 a 1. Valor ideal: 1.


11. F2 Score

O F2 pertence à família $F_\beta$. Como $\beta>1$, ele dá maior peso ao Recall do que à Precision e, portanto, valoriza mais a capacidade de detectar eventos.

$$F_\beta=(1+\beta^2)\frac{Precision\cdot Recall}{\beta^2 Precision+Recall}$$
$$F_{2}=5\frac{Precision\cdot Recall}{4\,Precision+Recall}$$

Faixa: 0 a 1. Valor ideal: 1.


12. Como interpretar os índices em conjunto

ÍndicePrincipal perguntaIdeal
ACCQual fração de todos os casos foi prevista corretamente?1
PODQuantos eventos observados foram detectados?1
POFDQuantos não eventos foram incorretamente previstos como eventos?0
FARQuantas previsões de evento foram falsos alarmes?0
CSIQual foi o desempenho considerando hits, misses e falsos alarmes?1
ETSQual foi o desempenho após descontar acertos esperados ao acaso?1
F1Qual é o equilíbrio entre detecção e confiabilidade?1
F0.5Qual é o desempenho dando maior peso à confiabilidade (precision)?1
F2Qual é o desempenho dando maior peso à detecção (recall)?1

Os resultados dependem também do limiar de precipitação, do prazo de previsão, da região avaliada e da referência observacional.


12. Heatmaps do portal

Nos heatmaps, um eixo representa os prazos de previsão e o outro os limiares de precipitação. Assim, é possível visualizar como o desempenho muda tanto com o avanço do prazo quanto com a intensidade do evento considerado.


Referências

Wilks, D. S. (2019). Statistical Methods in the Atmospheric Sciences, 4ª edição.
Jolliffe, I. T., e Stephenson, D. B. (2012). Forecast Verification: A Practitioner's Guide in Atmospheric Science, 2ª edição.