Saturday, November 12, 2016

Teste de Student-Newman-Keuls para comparação de médias

O teste Student-Newman-Keuls (SNK) e o teste de Tukey (HSD) são métodos post-hoc para a comparação de médias após uma ANOVA. Ambos se baseiam na distribuição da amplitude estudentizada q. A principal vantagem do SNK sobre o Tukey é ter maior poder estatístico.

 

Isto acontece porque o SNK é um teste passo a passo (stepwise). As médias são ordenadas e comparadas passo a passo, começando pela maior e pela menor. O valor crítico diminui à medida que diminui o número de médias entre os grupos em comparação.  Por isso, o SNK é mais poderoso que o Tukey em certas situações. Mas qual é a explicação?

 

Tukey x SNK: qual é a diferença? 

 O teste de Tukey usa um único valor crítico para todas as comparações.

🔸 O teste SNK, por sua vez, é um teste stepwise (passo a passo) e usa valores críticos diferentes, que diminuem conforme as médias comparadas estão mais próximas na lista ordenada.

👉 Por isso, o SNK costuma ter maior poder estatístico, ou seja, maior chance de detectar diferenças reais quando elas existem.

Procedimento para os testes

Imagine que você tem quatro grupos (k = 4) com médias já ordenadas:

O teste de Tukey compara todas as médias duas a duas, sempre com o mesmo valor crítico.  Já o teste SNK:

·        Ordena as médias

·        Compara a maior média com a menor (m = 4)

·        Depois, compara pares com uma média intermediária entre elas (m = 3)

·        E por fim, compara médias consecutivas (m = 2).

Veja o esquema:

O valor crítico diminui com o número de médias (m) que ficam entre as médias em comparação. Quanto menor é o valor de m menor, menor é o valor crítico do teste.

 

                               Conservador ou liberal?

A escolha entre os testes depende do compromisso entre rigor e sensibilidade:

🔸  O teste de Tukey é mais conservador, controla melhor o erro Tipo I (falsos positivos).

🔸 O teste SNK é mais liberal; tem, portanto, mais chance de encontrar diferenças reais, mas não controla a taxa de erro do experimento como um todo.

📌 Conclusão:

                    🔸Se o controle do erro Tipo I for prioritário, use o teste de Tukey.

🔸Quando se busca maior sensibilidade, principalmente nas análises exploratórias, use o teste SNK.


📢 Procedimento para o teste SNK


Para cada par de médias a serem comparadas, calcule a diferença mínima significativa dm​:

Onde:


qa,m,GL  é o valor da amplitude estudentizada para o nível de significância α, número m de médias ordenadas entre os grupos e GL graus de liberdade do resíduo da ANOVA;


QMR é quadrado médio do resíduo da ANOVA;


 r é o número de observações por grupo (pressupõe-se grupos de mesmo tamanho).

Duas médias são consideradas estatisticamente diferentes se a diferença observada entre elas for maior ou igual a dm.

 📢  Exemplo

Considere os dados (fictícios) de diminuição da pressão arterial apresentados na Tabela 1. Esses dados foram submetidos à análise de variância, que está apresentada na Tabela 2. Como o valor de F é significante ao nível de 5%, existe pelo menos uma média diferente das demais. As médias amostrais calculadas estão na Tabela 3.

 

Tabela 1 - Diminuição da pressão arterial, em mmHg, 

segundo o grupo


  Tabela 2 - Análise de variância

  

Tabela 3 - Média de diminuição da pressão arterial, em mmHg,

 segundo o grupo

  

Quais são as médias estatisticamente diferentes?  A pergunta pode ser respondida com a aplicação do teste de Student-Newman-Keuls. Para proceder ao teste, é preciso escrever as médias de grupos em ordem crescente (ou decrescente), como mostra a Tabela 4. 

 

Tabela 4 - Média de diminuição da pressão arterial em mmHg,

 na ordem decrescente, segundo o grupo

                     

A lista ordenada de k = 6 médias do nosso exemplo está na Tabela 4. A maior média amostral é 29, do grupo D e a menor é 2, do controle. Vamos calcular a diferença crítica dm  para comparar essas médias. Então m = 6. Já sabemos, da Tabela 2, que o resíduo da ANOVA tem 24 graus de liberdade e quadrado médio  QMR = 36,00. Na Tabela 1, temos r = 5. O valor de qa,m é 4,3727. Então

A diferença entre o tratamento D e o controle (29-2=27) é maior do que a diferença crítica 11,733. Então em média o tratamento D determina maior diminuição da pressão arterial que o controle.

 

Vamos calcular a dm para comparar médias que abrangem m = 5 médias ordenadas médias. 

Então, para comparar as médias de D com B e de A com o controle: a diferença das médias dos grupos D e B (29-8=21) e A e controle (21-2=19) são   maiores do que 11,179. São, portanto, significantes no nível de 5%.


Considerações finais

O teste SNK é mais flexível e sensível que o Tukey em alguns cenários, especialmente com muitos grupos e diferenças graduais entre médias. No entanto, não é ideal quando se busca rigor no controle do erro Tipo I.

🔍 Use com cautela e sempre considere o contexto da pesquisa e os objetivos da análise.



Sunday, November 06, 2016

O Teste de Bonferroni Protege as Conclusões nas Comparações de Médias Duas a Duas


As análises de variância (ANOVA) são muito frequentes na literatura científica, sempre seguidas por testes de comparação de médias. No entanto, é comum que os autores não expliquem por que escolheram determinado teste nem mencionem as limitações associadas à escolha. Em muitos trabalhos, o teste utilizado sequer é citado.

Neste post, trataremos das comparações a posteriori (ou não planejadas, unplanned comparisons) de médias duas a duas, utilizando testes paramétricos. Tais testes baseiam-se nas distribuições t, F ou q (amplitude studentizada). Nenhum deles é universalmente superior aos demais — cada um tem seus prós e contras.

O teste LSD de Fisher

O teste mais simples é o LSD de Fisher (least significant difference), que utiliza a distribuição t com os graus de liberdade do quadrado médio do resíduo da ANOVA. É um teste poderoso, mas fixa o erro tipo I por comparação (comparisonwise Type I error rate). Quando usado para múltiplas comparações entre grupos, o erro tipo I global (experimentwise error rate) aumenta rapidamente.

Por isso, Fisher recomendou que o LSD fosse aplicado apenas quando o teste F da ANOVA for significante — o chamado LSD protegido.

Ajuste de Bonferroni

O ajuste de Bonferroni é uma forma simples e conservadora de controlar o erro tipo I global. A ideia é a seguinte: se há m comparações a serem feitas, e se desejamos manter o nível de significância do experimento em α, então devemos aplicar cada teste com um nível de significância α/m.

Exemplo ilustrativo

Considere três grupos: A, B e C. As comparações possíveis são:

·     A × B

·     A × C

·     B × C

Total: m = 3 comparações.

Se o nível de significância do experimento é α = 0,05, então cada comparação deve ser testada com 

                                          αajustado = α/m = 0,05/3 ≈ 0,0167.

Com isso, garantimos que a probabilidade de cometer pelo menos um erro tipo I em todas as comparações será, no máximo, α.

Como aplicar o teste de Bonferroni

1.   Calcule o número total de comparações m=k(k−1)2, onde k é o número de grupos.

2.   Determine o nível ajustado de significância:

3.   Realize os testes duas a duas, usando esse novo nível de significância.

4.   Compare as diferenças entre as médias: considere significativas aquelas cujos valores absolutos ultrapassarem o limite calculado.

Exemplo aplicado

A Tabela 1 apresenta os dados de um ensaio fictício com seis tratamentos, medindo a redução da pressão arterial (em mmHg) ao longo do tempo.

Tabela 1. Diminuição da pressão arterial segundo o tratamento

A análise de variância desses dados resultou em um F significante (ver Tabela 2), indicando diferenças entre as médias.

Tabela 2. Resultados da ANOVA

Como o F foi significante, procedemos às comparações duas a duas pelo teste de Bonferroni. Para k = 6, o número de comparações possíveis é

Com α = 0,05, o nível de significância por comparação será:

A Tabela 3 apresenta as comparações de médias duas a duas, com asterisco (*) indicando diferenças significantes no nível de significância ajustado. Veja também a Figura 1, que ajuda na percepção das diferenças.

Tabela 3. Comparação de médias pelo teste de Bonferroni

Figura 1. Comparação de médias pelo teste de Bonferroni



LIVROS







Sunday, October 30, 2016

Teste de Médias: Escolher o Mais Liberal ou o Mais Conservador?

 

Após realizar uma análise de variância (ANOVA) para testar a hipótese de igualdade entre médias populacionais, e constatada a significância do teste F, o pesquisador busca uma forma de comparar as médias entre si. Para isso, são aplicados os chamados testes post hoc ou a posteriori.

Diversos testes estão disponíveis na literatura e nos softwares estatísticos. Mas surge a dúvida: qual deles escolher?

Segundo Winner (1962), os testes de comparação de médias podem ser ordenados do mais liberal ao mais conservador da seguinte forma:

🔹        MRT de Duncan

🔹        Student-Newman-Keuls

🔹       LSD de Fisher

🔹        HSD de Tukey

🔹        S de Scheffé

Testes mais liberais apontam mais facilmente diferenças significantes entre médias. Assim, espera-se que o teste de Duncan identifique mais diferenças do que o teste de Scheffé. Mas... seria adequado escolher sempre o teste que acusa mais diferenças?

                      🔔   A ESCOLHA DEVE SER DEFENSÁVEL

O critério fundamental para a escolha do teste é a sua adequação ao contexto experimental. Por exemplo:

Se um pesquisador da área da saúde compara o efeito de uma nova droga com medicamentos convencionais no tratamento de uma doença grave, deve aplicar um teste mais conservador, como o de Tukey ou o de Scheffé. Nesses casos, não se deve proclamar uma descoberta sem um grau razoável de certeza.

Já em experimentos da área agrícola, como a comparação entre 12 linhagens de soja em fase preliminar de avaliação, a aplicação de um teste mais liberal, como o de Duncan, pode ser vantajosa. Ele permite reduzir o número de linhagens a serem mantidas para testes futuros, economizando tempo e recursos.

🔔 A IMPORTÂNCIA DO NÚMERO DE COMPARAÇÕES

Na prática, pesquisadores raramente são questionados sobre os critérios que adotaram para escolher um teste de médias. No entanto, quanto maior for o número de comparações realizadas, maior será a probabilidade de obter conclusões diferentes, dependendo do teste aplicado.

Se apenas dois grupos forem comparados, todos os testes listados anteriormente levarão à mesma conclusão. Mas com vários grupos, as diferenças aparecem.

Considere um experimento com k grupos. Suponha que você decida comparar todas as médias duas a duas após uma ANOVA. Haverá

                                       

comparações, cada uma realizada com nível de significância α.

Se a hipótese nula de igualdade das médias for verdadeira, o risco de rejeição incorreta (erro tipo I) em uma comparação é α. A probabilidade de não cometer erro tipo I em uma comparação é 1−α. Em m comparações, a probabilidade de nenhum erro tipo I ocorrer é (1−α)m. Assim, a probabilidade de pelo menos um erro tipo I ocorrer (ou seja, de rejeitar H₀ em pelo menos uma comparação) é:  

                            

        EXEMPLO                     

Após uma ANOVA com três grupos — A, B e C — você decide aplicar comparações duas a duas, com nível de significância de 5%. As médias populacionais são, na verdade, iguais.

Se você optar por um teste liberal, pode esperar mais rejeições da hipótese nula. Utilizando a distribuição binomial, você pode calcular as probabilidades de aceitar (A) ou rejeitar (R) H₀ nas três comparações:

                                              A x B

                                              A x C

                                              B x C

A tabela abaixo ilustra os possíveis desfechos (A = aceitar H₀, R = rejeitar H₀) e suas respectivas probabilidades.

Comparações

Probabilidade

A, A, A

0,857375

R, A, A

0,045125

A, R, A

0,045125

A, A, R

0,045125

R, R, A

0,002375

R, A, R

0,002375

A, R, R

0,002375

R, R, R

0,000125

A soma das probabilidades em que ao menos uma hipótese é rejeitada (ou seja, ocorre erro tipo I) é:

                                0,045125 × 3 + 0,002375 × 3 + 0,000125= 0,142625

Assim, mesmo tendo adotado α=0,05, a probabilidade real de cometer pelo menos um erro tipo I nas três comparações é de aproximadamente 14,3%.

📝 CONSIDERAÇÕES FINAIS

A escolha do teste post hoc não deve ser feita de forma automática, nem baseada apenas no número de diferenças que ele aponta. O contexto do experimento, as possíveis consequências da decisão e o objetivo da pesquisa devem guiar essa escolha.

Em ciência, a estatística é essencial — mas deve ser usada com uma boa dose de ética e bom senso.


        VEJA:

      1. Winner (1962) Apud Kris E. Berg e Richard W. Latin Research Methods in Health, Physical Education,             Exercise Sciences and Recreation. 3ed. Lippincott. 2008. p 155.

      2.  Megan Goldman. disponível em http://www.stat.berkeley.edu/users/mgoldman. Acesso em 29 de                          outubro de 2016.

Monday, October 03, 2016

Comparações múltiplas: como evitar conclusões erradas?

Quando fazemos uma análise de variância (ANOVA) para comparar grupos, o teste F nos diz se existe diferença entre médias — mas não   diz entre quais grupos está a diferença. Por isso, quando o teste F rejeita a hipótese de que todas as médias são iguais, o pesquisador quer um teste para comparar as médias, duas a duas, ou em grupos de seu interesse. É aí que entram os testes a posteriori (post hoc).

Mas para escolher o teste, o pesquisador precisa tomar uma decisão importante: o que ele quer?

🔺   Controlar o risco de erro em cada comparação de duas médias?
                                       (comparisonwise error rate)

🔺  Controlar o risco de erro no conjunto de comparações feitas?

(experimentwise error rate)

Vamos entender este dilema com exemplos.

                                         Exemplo: 3 grupos (A, B e C)

Imagine que queremos comparar três tratamentos(grupos). São possíveis 3 comparações de médias: A e B, A e C e B e C. Vamos repetir esse experimento 10 vezes. Então, no total, serão feitas 30 comparações, como mostra a Tabela 1.

Tabela 1

   

Vamos supor que todas as médias populacionais são iguais (não sabemos disso quando fazemos o experimento). Para comparar médias, podemos escolher:

🔺    Um teste que controle o risco de erro Tipo I em cada comparação de médias. Neste caso, se – para cada comparação de duas médias – for estabelecido um nível de significância de 10%, espera-se que cerca de 10% das 30 comparações (ou seja, 3) indiquem, erradamente (erro tipo I), diferença que não existe. Note bem: essas 3 comparações erradamente significantes podem estar em só. ou em 3 dos 10 experimentos.

🔺  Um teste que controle o risco de erro Tipo I por experimento. Neste caso, se – para cada experimento – for estabelecido o nível de significância de 10%, espera-se que apenas 1 dos 10 experimentos (ou seja, 10%) indique, erradamente (erro tipo I), diferença que não existe.

                                  Exemplo: 20 grupos

Vamos pensar agora em um cenário maior: vamos comparar 20 tratamentos (grupos) dois a dois. São possíveis combinação de 20, dois a dois, que é (20x19) /2 = 190 comparações de médias. Vamos repetir esse experimento 10 vezes. Então, no total, serão feitas 190 x 10 = 1.900 comparações de médias. Novamente, vamos supor que as médias são todas iguais. Não sabemos disso, mas podemos escolher:

🔺 Um teste que controle o erro tipo I em cada comparação de médias. Se for estabelecido o nível de 10% de significância podem ocorrer até 190 falsos positivos (10% das 1.900 comparações de médias). Então quase todo experimento teria erros. O nível de erro se aproximaria, portanto, de 100%!

🔺  Um teste que controle o risco de erro Tipo I por experimento. Se for estabelecido o nível de significância de 10%, espera-se que ocorra erro tipo I em apenas 1 experimento, mesmo com 1.900 comparações no total.

                                       Comparação entre os testes

O teste DMS de Fisher e o teste das amplitudes múltiplas de Duncan não controlam o nível de significância de experimentos. São testes liberais, pois apontam significância com muita facilidade. Mas têm grande poder, pois nível de significância e poder do teste crescem juntos. De qualquer modo, é preciso evitar o "fishing for significance". Comparar muitas médias sem controle aumenta o risco de achar diferenças que não existem.

 

Já o teste DHS de Tukey, o teste de Dunnet e o teste S de Scheffé são conservadores, pois controlam o nível de significância de experimentos. Se o nível de significância para experimentos for 5%, o nível de significância para comparação de médias será menor do que 5%. Conclusões baseadas em experimentwise α são mais confiáveis em estudos com múltiplos grupos.

 

No entanto, quando se comparam apenas dois grupos, o nível de significância para experimentos é igual ao nível de significância para comparação de médias. Mas é preciso cuidado quando se comparam vários grupos, pois pode haver diferença nas conclusões.

                                                    ✅ Conclusão

     🔺  Testes liberais (como DMS e Duncan) têm maior poder, mas também maior risco de erro tipo I.

     🔺  Testes conservadores (como Tukey, Dunnett e Scheffé) protegem melhor contra erros, mas podem deixar de detectar diferenças reais.

    🔺  Em poucas comparações, a diferença entre os erros é pequena.

  🔺 Em muitas comparações, o controle do erro por experimento é essencial.