Wednesday, June 26, 2019

Intervalos de confiança simultâneos (Tukey)


Antes de tratar intervalo de confiança, é importante lembrar dois conceitos básicos:  estimativa por ponto e estimativa por intervalo. Toda estatística amostral é, por definição, uma estimativa por ponto de algum parâmetro populacional.  Por exemplo, imagine que você mediu a altura de 10 homens adultos de uma região e encontrou média de 170 cm. Esse valor é uma estimativa por ponto da altura média dos homens adultos daquela região.

        Uma estimativa por intervalo busca fornecer um intervalo de valores dentro do qual está, com certa confiança, o verdadeiro valor do parâmetro. Continuando o exemplo, após cálculos com a mesma amostra, você poderia afirmar que tem 95% de confiança que a média populacional de altura está entre 165 cm e 175 cm. Isso amplia a informação, pois em vez de um único número, você oferece uma faixa com chance de conter o verdadeiro valor.

Exemplo

Comparação de grupos com ANOVA e intervalos de confiança

Agora, vamos aplicar o conceito em uma situação real de análise estatística, onde são comparadas as médias de quatro grupos, cada um com cinco repetições. Suponha os seguintes dados fictícios, fáceis de digitar, apresentados na Tabela 1. As médias estão no rodapé da tabela.

Tabela 1

Dados (fictícios) para comparação de grupos


⚠️Pergunta: As diferenças entre as médias dos grupos são grandes o suficiente para concluir que os grupos são estatisticamente diferentes?Para responder, utilizamos a análise de variância (ANOVA), que testa a hipótese:

·  H₀: todas as médias populacionais são iguais.

·  H₁: pelo menos uma média de grupo é diferente das demais.

A análise de variância (ANOVA) produz uma estatística F que indica se há diferença global entre os grupos. Se F for significante, é comum seguir com comparações duas a duas (pairwise comparisons), em geral usando o teste de Tukey.

                                                                 Tabela 2

                                                   Análise de variância    


      

No caso do exemplo, o valor calculado de F é altamente significante (comparado com o valor crítico de F, para 3 e 16 graus de liberdade, no nível de significância 0,05​, que é 3,24). Portanto, há pelo menos uma média de grupo é diferente das demais. Mas em lugar de comparar médias duas a duas usando o teste de Tukey, vamos calcular os intervalos de confiança das diferenças entre médias que também indicam quais grupos realmente se diferenciam.

  Intervalos simultâneos de confiança com o teste de Tukey

O teste de Tukey permite calcular intervalos de confiança simultâneos para todas as diferenças entre as médias. Esse método é conservador, mantendo o controle sobre o erro tipo I quando se fazem múltiplas comparações.

Para grupos de mesmo tamanho (como no exemplo), os intervalos para diferenças de médias são dados por:                             

Onde:

·  qα,k,gl  é o valor da tabela de Tukey, dado o número de grupos (k), graus de liberdade do erro (gl) e nível de significância (α, por exemplo, 0,05);

·  QMR: quadrado médio do resíduo da ANOVA;

·  r: número de repetições por grupo.

No caso do exemplo:

                   🔺 Valor de q de Tukey

                         Para α=0,05, k=4 , gl = 16, da tabela de Tukey:

                                             q=4,05

                   🔺 Cálculo do erro padrão conjunto (EP)

                                              

                                                                        Tabela 3

                                             Diferenças de médias       

             🔺 Intervalos de confiança (95%) para as diferenças

                                                                   Tabela 5

                            Intervalos de confiança simultâneos  95% (Tukey)  


   

Um gráfico com médias e desvios padrão pode ilustrar a comparação entre grupos.


   Gráfico 1  
Intervalos de confiança simultâneos  95% (Tukey)  

       
Se um intervalo não contiver o zero, as médias correspondentes serão significantemente diferentes.

VEJA: 
Cheung, S. H.e Chan, W. S. Simultaneous confidence intervals  for pairwise multiple comparisons in a two-way unbalanced   design. Biometrics 52 (2)pp.463-472. 1996.








Tuesday, January 01, 2019

Tendências: a arte de conectar os pontos

                                      
Se você usa o Excel, já encontrou, quando faz um diagrama de dispersão, a possibilidade de colocar no gráfico uma linha de tendência. Algumas linhas caem mais sobre os pontos do que outras. Se você procurar as opções, verá que pode achar a equação da curva e o valor de R2. Mas você sabe o que significam função exponencial, função logarítmica, função potência e função polinomial? Vamos começar por aí.

Função exponencial

Na função exponencial a variável explicativa X (ou independente) fica no expoente, como mostra o modelo matemático:


Tabela 1- Função exponencial
Figura 1- Função exponencial

Se b =1, Y = a +1 para qualquer valor de X e se b = 0, Y = a para qualquer valor de X. Se b < 0, Y pode assumir como valor um número imaginário como, por exemplo, quando X=½.

Função logarítmica

Na função logarítmica toma-se como variável explicativa o logaritmo de X (em qualquer base, desde que maior que zero). O modelo fica como segue, desde que X não assuma valor zero:

Valores de X e valores de Y são dados na Tabela 1. Para desenhar o gráfico, foram usados os logaritmos neperianos de X.
Tabela 2- Função logarítmica

Figura 2- Função logarítmica

Função potência

Na função potência a variável explicativa (ou independente), que não deve ser igual a zero, é elevada a um expoente, como mostra o modelo matemático:
A linha de tendência potência foi ajustada aos dados da Tabela 3 e apresentada em gráfico na Figura 3.
Tabela 3- Função potência

Figura 3- Função potência

Função polinomial

A função é polinomial quando o valor da variável dependente ou variável resposta é função de um polinômio. Polinômio é uma expressão que envolve adição, subtração, multiplicação e exponenciação (com expoentes inteiros e não negativos) da variável explicativa e seus coeficientes. Por exemplo, foi ajustado (só para você conferir) aos dados da Tabela 4 o polinômio dado em seguida, fazendo a opção ordem 3 (você tem três variáveis., X, X2, X3):


                                     Tabela 4- Função polinomial
                                      
                                   Figura 4- Função polinomial

Linha de tendência
Vimos, até aqui, ajustes perfeitos, matemáticos, para deixar claro como é a equação. Na prática, porém, você encontrará dados para os quais a função não será matemática, mas estatística. Veja os dados da Tabela 5. Se você unir os pontos, não verá sentido no fenômeno.
                                                  Tabela 5 - Dados
                                        
                                       Figura 5 – Dados

No entanto, se você traçar uma linha de tendência, verá que o fenômeno cresce linearmente. Veja a Figura 6. Traçar a linha de tendência é uma maneira de mostrar como se comporta o fenômeno.
Figura 6 – Linha de tendência linear

A linha de tendência é um conceito de séries temporais. A variável resposta pode ter determinada tendência ao longo do tempo, subindo ou descendo, mas também existem fenômenos cíclicos e fenômenos sazonais. No Excel, você só estuda a tendência, sem considerações sobre a natureza probabilística ou estocástica do processo. Então, não é uma análise de regressão.

             VEJA também as postagens: 

             Parâmetros da regressão linear simples: estimar e testar    
          
             Regressão linear simples passando pela origem
               




Sunday, December 23, 2018

Regressão linear simples

Y = a + b X + e

Regressão linear simples é um método estatístico que permite estudar a relação entre duas variáveis quantitativas, que chamaremos de X e Y.

X é a variável explicativa ou independente.
Y é a variável resposta ou dependente.

A regressão linear simples recebe o nome de “simples” porque trabalha como uma só variável explicativa. Quando a variável resposta é função de duas ou mais variáveis explicativas, a regressão linear é múltipla.
                                                             EXEMPLOS
1.    Dados peso e altura de pessoas adultas, você pode pensar em uma regressão linear simples que coloque peso como função da variável  altura. Então peso é a variável dependente e altura a variável independente.
2.    Dados peso e altura de pessoas com 6 a 10 anos de idade, você pode pensar em uma regressão linear múltipla que coloque peso com variável resposta (ou dependente) de duas variáveis explicativas (ou independente): idade e altura.Em outras palavras, o peso de uma criança depende da idade e da altura.

     RELAÇÕES DETERMINÍSTICAS E RELAÇÕES PROBABILÍSTICAS
   Antes de continuar, é preciso lembrar que duas variáveis, X e Y, podem ter uma relação determinística, ou seja, matemática, como é a relação entre graus Fahrenheit e graus Celsius:
Quando colocados em diagrama de dispersão, os pontos caem exatamente sobre uma reta, como mostra a Figura 1. Isto acontece porque a equação da reta é a descrição exata da relação entre as duas variáveis.
Figura 1

Diagrama de dispersão: pontos sobre uma reta


   Vamos estudar aqui a relação estatística entre uma variável resposta Y e uma variável explicativa X. Para começo de conversa, imagine que o fenômeno que você está estudando é bem descrito por uma reta porque, quando coloca os dados empíricos em um diagrama de dispersão, os pontos formam uma “nuvem” em torno de uma reta. Mas nessa “nuvem” caberia uma infinidade de retas. Veja a Figura 2, em que X poderia ser, por exemplo, a altura de pessoas e Y seria o peso. É preciso traçar, então, a reta que melhor se ajusta aos dados. A questão é: qual é a melhor reta?
Figura 2

Diagrama de dispersão: pontos em torno de uma reta



     É preciso estabelecer um critério para determinar a melhor reta, mas qualquer que seja a reta será sempre apenas uma aproximação para o verdadeiro fenômeno: não há como fazer previsões exatas com base em dados empíricos. E temos que nos haver com a questão estatística de estimação dos parâmetros porque a reta será ajustada usando os dados de uma amostra e não de toda a população. Quais são esses parâmetros, quando se fala em uma reta?

       A equação de uma reta é dada por
Y = a + b X,
     Nessa equação, a é o intercepto porque é o valor que Y assume quando X = 0, ou seja, quando a reta corta (intercepta) o eixo das ordenadas; b é uma medida da inclinação da reta. Não é preciso saber mais do que isto para entender a equação de uma reta, mas não custa lembrar você de que b  é a tangente trigonométrica do ângulo q  delimitado pela reta de equação Y = a + bX e pela reta paralela ao eixo das abscissas que passa pelo ponto a. Veja a Figura 3.

     Quando Y é uma variável aleatória, você pode descrever Y em função de X com o modelo:
                                              Y = a + b X + e


    Nesse modelo,  a e b são parâmetros e e é o erro aleatório. Para entender o que é o erro aleatório, observe a Figura 3: e é a distância entre a resposta de uma observação e a reta de regressão para toda a população.

Figura 3
O erro aleatório


    Se você tem dados de uma amostra, pode obter os valores a e b que estimam os parâmetros a e b da reta. Mas, para isso, é necessário fazer algumas pressuposições.

                           PRESSUPOSIÇÕES BÁSICAS

  Pressuposição 1: A relação entre as duas variáveis é linear.

Você só deve traçar uma reta para descrever um fenômeno se, no intervalo estudado, a relação entre as duas variáveis é expressa por uma reta. Para saber se a reta é, de fato, o modelo adequado para  descrever o fenômeno, existem dois procedimentos: ou você conhece a teoria que diz que o fenômeno é linear ou você “vê que a relação é  linear”, olhando o gráfico.

Pressuposição 2: A variabilidade de Y, para qualquer valor dado de X, é sempre a mesma.
A variabilidade é medida pela variância. Então esta pressuposição estabelece que a variância de Y é constante, qualquer que seja o valor de X. 

Pressuposição 3: O erro de uma observação não está correlacionado com o erro de outra observação.
As observações devem ser independentes. O que isto significa? Por exemplo, fazer a mesma pergunta 20 vezes para uma única pessoa não é igual a fazer a mesma pergunta para 20 pessoas diferentes. No primeiro caso, as respostas não são independentes: uma pessoa responde da mesma maneira (ou de maneira similar) a perguntas iguais. No segundo caso, é razoável supor que as respostas sejam independentes, desde que as pessoas tenham sido retiradas ao acaso da mesma população ( e não de um grupo fechado).

Pressuposição 4: Para qualquer valor de X, os valores de Y têm distribuição normal.
Para qualquer valor de X, os valores de Y têm distribuição normal ou, o que é o mesmo, os desvios (Y – Ŷ) têm distribuição normal. Mas esta pressuposição  só é essencial para proceder aos testes estatísticos. Os programas estatísticos geralmente fazem uma análise dos resíduos. Algumas dessas análises são gráficas e constituem a maneira fácil de visualizar se os desvios fogem muito da pressuposição de normalidade.

Pressuposição 5: Os valores de X são fixos, isto é, X não é variável aleatória.
Cabe, aqui, um comentário: essa pressuposição não é, na realidade, essencial. Em certas condições, mesmo que X seja uma variável aleatória, pode ser ajustada uma reta aos pares de valores X e Y.
Estimativas dos parâmetros

    Para obter a e b, você aplica as fórmulas dadas em seguida ou, melhor ainda, faz os cálculos usando um computador. A dedução dessas fórmulas será apresentada em nova postagem. As fórmulas são:

EXEMPLO

Este exemplo é do tutorial do SPSS: 

Uma empresa quer saber se é possível medir o desempenho no trabalho a partir de escores de QI. A empresa então faz medidas desempenho no trabalho e QI em 10 funcionários. Veja os dados apresentados na Tabela 1.
Tabela 1

Dados de QI e desempenho de dez funcionários


Para obter os valores de a e b, os cálculos intermediários estão apresentados na Tabela 2.

Tabela 2

Cálculos intermediários para obtenção de a e b


Para obter o valor de b, é preciso calcular:


    Para obter o valor de a, é preciso calcular as médias de X e de Y:


    Então:


    Obtidos os valores de a e b, pode-se escrever a equação da reta:


    Agora, é fácil traçar a reta no gráfico. Basta dar dois valores quaisquer para X (como zero e 5) e calcular os valores de Y. Para X = 0, tem-se que:

    Para X=5:


    De posse de dois pares de valores de X e Y, é possível construir o gráfico apresentado na Figura 4.
Figura 4
 Reta de regressão 

Variâncias dos parâmetros
    Para obter V(b) e V(a), você aplica as fórmulas dadas em seguida ou, melhor ainda, faz os cálculos usando um computador. As fórmulas, lembrando que s2 é um parâmetro, são:
    A questão é obter uma estimativa de s2. Sem aplicar uma análise de variância, que veremos em nova postagem, você calcula, para o exemplo que estamos desenvolvendo, a estimativa de s2:
    A Tabela 3 apresenta os cálculos intermediários para obter s2. Lembre-se de que os valores estimados da reta são dados por

Tabela 3
Cálculos intermediários para obtenção de s2

    Você obtém o erro padrão de a e de b extraindo a raiz quadrada das respectivas variâncias. Para o exemplo:
     Para testar as hipóteses de que os parâmetros a e b são iguais a zero, contra as alternativas de que são diferentes de zero, aplique o teste t ao nível de significância desejado:
    Compare os valores calculados de t com os valores da distribuição de t com n-2 graus de liberdade e ao nível de significância estabelecido.
Para o exemplo que estamos desenvolvendo:
    No nível de 5% de significância e com n-2=8 graus de liberdade, t = 2,306. Logo, a hipótese de que b = 0 deve ser rejeitada.

    Você pode, também, obter os intervalos de confiança para os parâmetros a e b. Sendo t0 o valor crítico de t com n-2 graus de liberdade e ao nível escolhido de significância, você ontem os intervalos como segue: 

        Para o exemplo:


Se você usar o SPSS, vai obter, para o que foi visto aqui:



                       VEJA REGRESSÃO LINEAR PASSANDO PELA ORIGEM EM OUTRA POSTAGEM.