Decomposição de R²
- Entrada
- SSR=7,5, SST=570
- Saída esperada
- R²=0,986842
1 − 7,5÷570: a reta absorve 98,68% da variância total da nota, deixando só 1,32% em resíduo.
r² e qualidade do modelo de regressão
R² mede a fração da variância de Y que a reta de regressão explica, um número entre 0 e 1 (ou 0% e 100%). Só que R² alto não confirma que a relação é realmente linear: uma curva perfeita, ajustada com uma reta, ainda pode gerar R² alto, escondendo o formato real dos dados.
1 − 7,5÷570: a reta absorve 98,68% da variância total da nota, deixando só 1,32% em resíduo.
Mais de 96% de variância "explicada" por uma reta aplicada a dados que na verdade seguem uma parábola: R² alto não é prova de linearidade.
O padrão simétrico em U nos resíduos denuncia a curva escondida atrás do R² alto, visível só ao plotar resíduo contra X.
Regressão linear simples é um modelo estatístico que descreve a relação entre uma variável independente X e uma dependente Y como uma reta, Ŷ = β₀ + β₁X. A inclinação β₁ diz quanto Y muda a cada aumento de uma unidade em X, e o intercepto β₀ é o valor previsto de Y quando X vale zero. É a base de boa parte da análise de dados, usada tanto para entender uma relação quanto para prever valores.
Não necessariamente: ajustando uma reta aos pontos (1,1) a (5,25), que seguem Y=X², o R² chega a 0,962567, mais de 96%, mesmo a relação real sendo uma parábola. R² mede proximidade aos pontos, não se a forma escolhida (reta) é a certa.
Plotando os resíduos (Y real menos Y previsto) contra X: no exemplo de Y=X², eles formam um U simétrico, 2, −1, −2, −1, 2, positivos nas pontas e negativos no meio, um padrão que R² sozinho não revela.
SST é a variância total de Y sem nenhum modelo, e SSR é o que sobra depois de ajustar a reta; R² = 1 − SSR÷SST mede quanto dessa variância a reta absorveu. No exemplo de horas e nota, SST=570 e SSR=7,5 dão R²=0,986842.
Um par x, y por linha. Máximo de 200 pares.
Os dados ficam apenas no navegador. Nenhum dado é enviado ao servidor.