Os Skill Scores categóricos avaliam a capacidade do modelo de prever a ocorrência ou a não ocorrência de um evento. Para precipitação, o campo contínuo é transformado em um evento binário usando um limiar, por exemplo 1, 2, 5, 10, 20 ou 50 mm em 24 horas.
1. Conversão da precipitação em evento
Para um limiar $T$, define-se:
A previsão e a referência são comparadas ponto a ponto, formando uma tabela de contingência.
2. Tabela de contingência
| Observado: sim | Observado: não | |
| Previsto: sim | H — acerto do evento, hit | F — falso alarme |
| Previsto: não | M — evento perdido, miss | CN — não evento corretamente previsto |
3. ACC — Accuracy
Representa a fração de previsões corretas, considerando eventos e não eventos.
Faixa: 0 a 1. Valor ideal: 1.
Em eventos raros, a ACC pode ser elevada apenas porque existem muitos não eventos corretamente previstos. Por isso, deve ser analisada junto com outras métricas.
4. POD — Probability of Detection
Mede qual fração dos eventos realmente observados foi corretamente prevista pelo modelo.
Faixa: 0 a 1. Valor ideal: 1. Um POD alto significa que poucos eventos observados foram perdidos, mas o índice não penaliza falsos alarmes.
5. POFD — Probability of False Detection
Mede a fração dos não eventos observados que foram incorretamente previstos como eventos.
Faixa: 0 a 1. Valor ideal: 0.
6. FAR — False Alarm Ratio
Entre todos os eventos previstos, indica qual fração correspondeu a falsos alarmes.
Faixa: 0 a 1. Valor ideal: 0.
7. CSI — Critical Success Index
O CSI, também conhecido como Threat Score, mede os acertos do evento em relação a todos os casos em que o evento foi previsto ou observado. Os acertos de não evento não entram na fórmula.
Faixa: 0 a 1. Valor ideal: 1.
8. ETS — Equitable Threat Score
O ETS é semelhante ao CSI, mas desconta a parcela de acertos esperada apenas pelo acaso.
Valor ideal: 1. ETS = 0: desempenho equivalente ao esperado aleatoriamente. ETS < 0: desempenho pior que o esperado ao acaso.
9. F1 Score
O F1 combina a confiabilidade das previsões de evento com a capacidade de detectar os eventos observados.
Faixa: 0 a 1. Valor ideal: 1.
10. F0.5 Score
O F0.5 pertence à família $F_\beta$. Como $\beta<1$, ele dá maior peso à Precision do que ao Recall e, portanto, valoriza mais a confiabilidade das previsões de evento.
Faixa: 0 a 1. Valor ideal: 1.
11. F2 Score
O F2 pertence à família $F_\beta$. Como $\beta>1$, ele dá maior peso ao Recall do que à Precision e, portanto, valoriza mais a capacidade de detectar eventos.
Faixa: 0 a 1. Valor ideal: 1.
12. Como interpretar os índices em conjunto
| Índice | Principal pergunta | Ideal |
| ACC | Qual fração de todos os casos foi prevista corretamente? | 1 |
| POD | Quantos eventos observados foram detectados? | 1 |
| POFD | Quantos não eventos foram incorretamente previstos como eventos? | 0 |
| FAR | Quantas previsões de evento foram falsos alarmes? | 0 |
| CSI | Qual foi o desempenho considerando hits, misses e falsos alarmes? | 1 |
| ETS | Qual foi o desempenho após descontar acertos esperados ao acaso? | 1 |
| F1 | Qual é o equilíbrio entre detecção e confiabilidade? | 1 |
| F0.5 | Qual é o desempenho dando maior peso à confiabilidade (precision)? | 1 |
| F2 | Qual é o desempenho dando maior peso à detecção (recall)? | 1 |
Os resultados dependem também do limiar de precipitação, do prazo de previsão, da região avaliada e da referência observacional.
12. Heatmaps do portal
Nos heatmaps, um eixo representa os prazos de previsão e o outro os limiares de precipitação. Assim, é possível visualizar como o desempenho muda tanto com o avanço do prazo quanto com a intensidade do evento considerado.
Referências
Jolliffe, I. T., e Stephenson, D. B. (2012). Forecast Verification: A Practitioner's Guide in Atmospheric Science, 2ª edição.

