Thursday, August 28, 2025

Teste de Tukey (HSD), Teste de Student Newman Keuls (SNK)e teste de Duncan (DMRT)

      

        1.    Introdução

Uma análise de variância (ANOVA) pode mostrar que existem diferenças significativas entre médias de grupos, mas não informa quais grupos diferem entre si. Para isso, aplicamos testes post hoc — ou testes de comparações múltiplas.

O mais conhecido é o teste de Tukey, mas existem outros testes também conhecidos como o teste de Student Newman Keuls e o teste de Duncan. Os três testes comparam médias após a ANOVA, mas seguem lógicas diferentes. Neste texto, vamos ver o que cada teste oferece e em que situações é mais adequado.

2. Questões de significância

O teste de Tukey, ou seja, o teste das diferenças honestamente significantes (HSD – Honest Significant Difference) é bastante conservador. Controla bem o erro tipo I (rejeita H0 quando H0 é verdadeira).  Na prática, isto significa que, quando comparado aos outros dois testes, o teste de Tukey identifica menor número de diferenças como estatisticamente significantes, mas isso significa também que protege você de obter falsos resultados positivos.

O teste de Student -Newman-Keuls é menos conservador que o teste de Tukey. Na prática, isto significa que tem a probabilidade de identificar maior número de diferenças estatisticamente significantes que o teste de Tukey, mas significa também que protege menos você de obter resultados falsos positivos.

O teste de Duncan, ou seja, o teste das amplitudes múltiplas (MRT-multiple range test) é o mais liberal dos testes. Na prática, isto significa que tem alta probabilidade de identificar diferenças estatisticamente significantes, mas significa também que conduz a muitos resultados falsos positivos. Por conta disso, muitos estatísticos não o recomendam.

Como é um teste conservador, o teste de Tukey pode deixar de detectar algumas diferenças sutis entre grupos. O teste de Student-Newman-Keuls, mais poderoso, pode revelar padrões que o Tukey não mostra. Duncan é o teste com maior poder (rejeitar H0 quando H0 é falsa), mas isso leva a um aumento deliberado do risco de erro tipo I para comparações, aceitandocom maior probabilidade os falsos positivos.

3. Diferenças conceituais

O teste de Tukey utiliza um único valor crítico da distribuição da amplitude studentizada para todas as comparações. Controla o erro do experimento inteiro (experimentwise error rate, EER).

O teste de Student -Newman-Keuls usa o mesmo α (geral, fixo, ex. 5%) quando faz o passo a passo do teste sequencial. Controla apenas o erro por comparação (comparisonwise error rate, CER), não o do experimento inteiro.

O teste de Duncan também é stepwise, mas o nível de significância não é constante. Para amplitudes menores (com poucos grupos), usa um valor maior de alfa, o que facilita encontrar diferenças. Por isso, há tabelas próprias para teste de Duncan (as de Harter, 1960 são clássicas).

4.Procedimento 

Você encontra, para cada um dos três testes, o respectivo procedimento em postagens deste mesmo blog. Mas vale lembrar que tanto o teste de Tukey como o de Student-Newman-Keuls se baseiam na amplitude estudentizada. A diferença está no fato de que o teste de Tukey usa um único valor crítico da distribuição da amplitude studentizada para todas as comparações enquanto o Student-Newman-Keuls é um teste sequencial (stepwise); começa comparando a maior amplitude, depois vai para intervalos menores. O teste de Duncan também é sequencial (stepwise), mas o nível de significância não é constante. Para amplitudes menores (com poucos grupos), usa um valor maior de alfa, o que facilita encontrar diferenças.

5.     Quando usar cada um?

A escolha entre os três testes apresentados não é apenas uma questão de estatística; é também uma questão de ética, porque importam as consequências de decisão errada.

 

Utilize testes tais tonservadores (Tukey, Scheffé) quando as consequências de um falso positivo forem altas. Por exemplo, em ensaios farmacêuticos e pesquisas clínicas ou qualquer cenário em que agir com base em uma falsa descoberta seja custoso ou perigoso. Esses testes controlam rigorosamente a taxa de erro do experimento.

 

Utilize o teste de SNK quando quiser uma abordagem mais equilibrada e moderada. Você ainda está interessado em poder, mas deseja mais controle sobre falsas descobertas do que o oferecido por Duncan. É uma boa opção intermediária.

Utilize o teste de Duncan quando estiver em uma fase exploratória de geração de hipóteses. Você quer ter certeza de não perder nenhum efeito possível (precisa de alto poder) e está disposto a aceitar um número maior de falsos positivos. Isso é comum em pesquisas de degustação de vinhos e de café, onde diferenças sutis de aroma e sabor podem interessar mesmo que não sejam muito robustas estatisticamente.

6.     Exemplo prático (dados fictícios)

Na Tabela 1 estão dados fictícios que foram submetidos à análise de variância (ANOVA). O valor de p (ANOVA) é 0,00105, o que é altamente significativo. Isso confirma que existem diferenças estatisticamente significativas entre pelo menos algumas das médias dos grupos. Justifica-se a realização de testes post-hoc. A comparação dos resultados está na Tabela 2.

Tabela 1. Dados

   Tabela 2. Comparação de resultados



Interpretação

  • Teste de Tukey: D está em seu próprio grupo, mas o teste não rejeita que D é diferente de B, nem que B seja diferente C e A
  • SNK: mais poderoso que o Tukey, detecta que D é significativamente maior  que B, C e A, o que Tukey não conseguiu fazer no nível de 5%.
  • Duncan: coloca D  como maior que todos os outros e A como menor que todos os outros.

   7.    Conclusão

    Os testes post hoc ou testes de comparações múltiplas devem ser escolhidos levando em consideração a tolerância em relação ao erro tipo I vs. erro tipo II e não à busca do resultado desejado.


Sunday, August 24, 2025

Duncan’s Multiple Range Test (MRT)

 Introduction

An Analysis of Variance (ANOVA) indicates whether there is at least one significant difference between group means, but it does not specify which groups differ from each other. Therefore, ANOVA is considered a global or omnibus test. To identify the specific differences, it is necessary to perform comparisons between the group means after the global test.

The methods used to compare means after an ANOVA are called a posteriori tests or post hoc comparisons. Among the most well-known tests—and widely available in statistical packages—are the Tukey test (covered previously) and the Duncan test, which will be detailed here.

The Duncan test, also known as Duncan’s Multiple Range Test (MRT or DMRT), is applied after a significant ANOVA to identify which pairs of means differ statistically in experiments with three or more groups. Unlike the Tukey test, which performs independent pairwise comparisons, the Duncan test is a sequential procedure based on the calculation of minimum significant ranges.

Although more laborious to perform manually—as it requires calculating different critical ranges—the Duncan test is widely used in some fields. Its operation will be demonstrated with an example. However, it should be noted that DMRT is not widely accepted as Tukey or SNK procedures and is declared for some statisticians to perform poorly.

Example

Consider the fictional data on blood pressure reduction (in mmHg) presented in Table 1. This data was subjected to a one-way ANOVA, the results of which are in Table 2. Since the F-value was significant at the 5% significance level, the null hypothesis is rejected, concluding that there is at least one difference between the group means. The sample means for each group are in Table 3.

          Table 1 – Blood pressure reduction (mmHg) by treatment group

Table 2 – ANOVA table for blood pressure reduction data

Table 3 – Mean blood pressure reduction (mmHg) by group

Question: Which means are statistically different?

To answer this question, the Duncan test is applied. First, it's important to understand its logic.

How the Duncan Test Works

The Duncan test compares the range (the difference) between sets of ordered sample means with a calculated minimum significant range (Rm).

·        If the observed difference between the largest and smallest mean in a set is greater than the calculated minimum range (Rm), it is concluded that the corresponding population means are different at the chosen significance level.


·        The test is sequential (stepwise). It begins by comparing the largest and smallest mean of the entire set (k means). If the difference is significant, the algorithm proceeds, comparing subsets of means. Crucially, if a difference at a particular step is not significant, all comparisons within that specific subset are considered not significant and are halted.

Steps of the Test

1.               Order the means in ascending or descending order.

 Table 4 – Means ordered in descending order (blood pressure reduction, mmHg)

2.             Calculate the minimum significant range (Rm) for different values of m, where m is the number of means spanned in the interval being compared (e.g., when comparing the 1st and 5th mean in a list of 6, m=5). The formula is:

Where:

· Rm= critical value of the studentized range for a given m and for the residual degrees of freedom, found in specific tables (e.g., Harter, 1960);

· MSE = mean square error (residual) from the ANOVA;

· r = number of replications per group (assuming groups of equal size).

Application to the Example

·  Number of treatments (means): k = 6

·  MSE = 36.00 (Table 2)

·  n = 5 replications (Table 1)

·  Residual degrees of freedom = 24


Standard Error Calculation:


Comparisons:

1.                   m = 6: Compare the largest (D, 29.0) and smallest (Control, 2.0) mean.

Comparison:

               Difference: 29.0 - 2.0 = 27.0

                                       27.0 > 8.79 → Significant.


2.                   m = 5: Compare the ranges spanning 5 means.

                                                                     

Comparisons:

               Difference: D (29.0) vs. B (9.0): 20.0 > 8.66 → Significant.

               Difference: A (17.0) vs. Control (2.0): 15.0 > 8.66 → Significant.


3.                   m = 4: Compare the ranges spanning 4 means.

                                                        

Comparisons:

                    Difference: D (29.0) vs. C (13.2): 15.8 > 8.48 → Significant.

                    Difference: A (17.0) vs. B (9.0): 8.0 < 8.48 → Not Significant.

*Since A and B do not differ, their subset (A, C, E, B) is homogeneous. Internal comparisons (e.g., C vs. B, E vs. B) are not performed for m=4, m=3, m=2.

                     Difference: E (12.6) vs. Control (2.0): 10.6 > 8.48 → Significant.


4.                   m = 3: Compare the remaining ranges spanning 3 means.

                                                                      

Comparisons:

               Difference: D (29.0) vs. E (12.6): 16.4 > 8.23 → Significant.

               Difference: A (17.0) vs.C(13.2): 3.8<8.23 → Not  Significant. (Consistent with the previous halt).

5.                   m= 2: Compare the remaining intervals for adjacent pairs or pairs of interest.

                                                                     
          Comparisons:

              Difference: D (29.0) vs. A (17.0): 12.0 > 7.83 → Significant.

*Other comparisons within the homogeneous block (A, C, E, B) are not necessary.

Presentation of Results

The standard way to present the results is to assign the same letter to means that do not differ significantly from each other.

Table 6 – Mean comparison by Duncan's test


      Alternatively, means can be presented in order with an underscore connecting those that           do not differ.

                          Control      B          E            C            A          D

                              2.0 d    9.0 c   12.6 bc   13.2 bc   17.0 b   29.0 a

Final Notes

1.If the groups have unequal sizes (different number of replications), n in the formula is replaced by the harmonic mean of the group sizes.

2. DMRT is not widely accepted as Tukey or SNK procedures; it is declared for some statisticians to perform poorly. We will discuss these issues in a next post.

 Further reading

1.   Montgomery DC. Design and Analysis of Experiments. 4ed. New York: Wiley; 1997.

2.    Zar, J.H. 4ed.Upper Saddle River, Prentice Hall.

3. University of York. Tables for Duncan's multiple range tests Critical values https://www.york.ac.uk › maths › tables › duncan.

4.    Critical care. National Library of Medicine. http://www.ncbi.nlm.nih.gov/pmc/articles/PMC420045/