{{HeadCode}}

에 의해

저스틴 웡

일원분산분석(ANOVA) 및 사후 검정: 명확한 단계별 가이드

저스틴 웡

성장 책임자

글로벌 비즈니스 및 디지털 예술에서 학사 학위를 받았으며, 기업가 정신을 부전공으로 수학했습니다.

ANOVA와 사후 분석(post hoc) 테스트는 셋 이상의 집단 평균을 비교하는 데 필수적입니다. 대신 반복적인 t-검정을 사용하면 위양성률이 팽창하여 연구 결과가 손상될 수 있습니다.

이 가이드는 분산의 기본부터 올바른 사후 분석 테스트 선택에 이르기까지 전체 워크플로우를 제공합니다. 자신 있게 ANOVA 결과를 실행, 해석 및 보고하는 방법을 배우게 됩니다.

<CTA title="명확한 데이터 분석" description="가이드 프롬프트를 통해 통계 워크플로우를 구조화하고 결과를 더 빠르게 해석해 보세요." buttonLabel="Jenni 무료 체험하기" link="https://app.jenni.ai/register" />

ANOVA가 실제로 테스트하는 것

분산 분석의 약자인 ANOVA는 셋 이상의 집단에서 얻은 평균 점수가 실제로 다른지 확인합니다. 이는 두 가지 유형의 변동을 비교하여 수행됩니다.

이러한 통계 구조에 대한 기초적인 이해를 얻으려면 데이터 집단이 어떻게 상호 작용하는지 시각화하는 데 ANOVA 최종 가이드가 도움이 될 수 있습니다.

데이터의 총 변동은 두 가지 부분으로 나뉩니다:

  • 집단 간 분산(Between-group variance): 처리나 조건에 의해 발생할 수 있는 관찰된 차이입니다.

  • 집단 내 분산(Within-group variance): 동일한 집단 내 개인 간의 자연스럽고 무작위적인 차이로, 본질적으로 배경 소음과 같습니다.

핵심 계산은 F-통계량입니다. 이는 단지 집단 간 분산을 집단 내 분산으로 나눈 값입니다. 일반적으로 p-값이 0.05 미만인 큰 F-통계량은 집단 간 차이가 우연히 발생할 수 있는 것보다 더 크다는 것을 알려줍니다.

논리 분석하기

간단한 비유로 서로 다른 교실의 시험 점수를 비교하는 것이 있습니다. 모든 학급의 평균 점수가 비슷하다면 학급 간의 변동은 작습니다. 하지만 한 학급이 일관되게 훨씬 더 높은 점수를 받는다면 학급 간 변동은 급격히 증가합니다.

ANOVA는 그 효과를 정량화합니다. 이 객관적인 접근 방식은 가설을 증명하거나 반증하기 위해 수치 데이터를 사용하는 질적 연구 vs 양적 연구의 특징입니다.

ANOVA 표의 핵심 구성 요소

표준 ANOVA 결과물에서 다음 요소들을 찾을 수 있습니다:

  • 제곱합 (SS): 총 제곱 변동입니다.

  • 자유도 (df): 독립적인 정보 조각의 수입니다.

  • 평균 제곱 (MS): 평균 변동 (SS/df)입니다.

  • F 통계량: 유의성 검정에 사용되는 최종 비율 (집단 간 MS / 집단 내 MS)입니다.

각 부분은 관찰된 차이가 의미 있는 것인지 아니면 단순한 무작위 소음인지 파악하는 데 도움을 줍니다.

<ProTip title="💡 프로 팁:" description="더 강력한 해석을 위해 p-값과 함께 항상 에타 제곱과 같은 효과 크기를 보고하세요." />

1단계: ANOVA 가정 먼저 확인하기

핵심 가정을 먼저 확인하지 않고 ANOVA를 실행하지 마세요. 이 단계를 건너뛰면 쉽게 오해의 소지가 있는 결과를 얻을 수 있습니다.

세 가지 핵심 가정

ANOVA는 다음 세 가지 조건이 합리적으로 충족되는지에 달려 있습니다:

  • 정규성: 데이터가 대략적으로 정규 분포를 따라야 합니다.

  • 등분산성: 점수의 퍼짐 정도(분산)가 모든 집단에서 유사해야 합니다.

  • 독립성: 각 관측치는 다른 관측치와 서로 관련이 없어야 합니다.

이것들은 단지 형식적인 절차가 아니라 편향되거나 잘못된 결론을 내리지 않도록 방지해 줍니다.

실제 테스트 방법

  • 정규성의 경우, 잔차의 Q-Q 플롯을 보거나 Shapiro-Wilk 검정을 실행하세요.

  • 등분산성의 경우, Levene 검정이 가장 일반적인 확인 방법입니다.

  • 독립성은 통계적으로 검정되지 않으며, 연구 설계의 특징입니다. 하나의 관측치가 다른 관측치와 연결되는 방식으로 데이터가 수집되지 않았는지 확인하세요.

이것이 연구 질문을 작성하는 방법을 효과적으로 배우는 것이 중요한 이유입니다. 이는 실험 설정이 처음부터 논리적으로 타당하도록 보장합니다.

가정이 충족되지 않으면 어떻게 해야 할까요?

데이터가 이러한 규칙을 위반하는 경우 다른 테스트가 필요합니다.

  • 분산이 다른 경우, Welch 및 Brown-Forsythe 일원 분산 분석을 살펴보아야 합니다.

  • 데이터가 정규 분포를 따르지 않는 경우, Kruskal-Wallis 검정이 좋은 비모수적 대안입니다.

  • 독립성이 위배되는 반복 측정의 경우, Friedman 검정을 고려해 보세요.

이러한 확인을 무시하는 것은 흔히 발생하는 실수입니다. 예를 들어, 국립보건원(NIH)의 한 검토에 따르면 생물의학 연구에서 ANOVA 가정을 위반하면 보고된 유의 수준이 심각하게 왜곡될 수 있다고 지적합니다.

<ProTip title="📊 리마인더:" description="표본 크기가 작으면 유의미한 ANOVA 결과가 나온 후에도 사후 분석 테스트의 검정력이 떨어지는 경우가 많습니다." />

2단계: ANOVA 테스트 실행하기

ANOVA 테스트를 실행한다는 것은 총 데이터 분산을 여러 부분으로 나누고 이를 F-통계량과 비교하는 것을 의미합니다.

이 프로세스는 실증적 증거와 객관적 측정을 우선시하는 특정 연구 패러다임에 깊이 뿌리를 두고 있습니다.

일원 분산 분석(One-Way ANOVA) 예시

세 가지 서로 다른 교수법에 따른 학생들의 시험 점수를 비교한다고 가정해 보겠습니다. 분석을 실행한 후 소프트웨어에서 다음과 같은 결과를 출력합니다: F(3, 56) = 17.66, p < .001

이는 교수법 집단 간의 변동이 집단 내의 무작위 변동보다 훨씬 크다는 것을 알려줍니다. p-값이 .001보다 작다는 것은 통계적으로 유의미한 차이가 있음을 의미하며, 즉 적어도 한 집단의 평균 점수가 다른 집단과 같지 않음을 나타냅니다.

이원 분산 분석(Two-Way ANOVA) 및 상호작용

이원 분산 분석을 사용하면 두 가지 요인을 동시에 테스트할 수 있습니다. 예를 들어, 교수법과 학생의 성별을 모두 살펴볼 수 있습니다. 여기서는 두 가지를 확인합니다:

  • 주효과(Main effects): 교수법 자체가 점수에 영향을 미칩니까? 성별 자체가 점수에 영향을 미칩니까?

  • 상호작용 효과(Interaction effects): 교수법의 효과가 성별에 따라 달라집니까? 아마도 한 방법이 다른 집단보다 특정 집단에 훨씬 더 잘 작동할 수 있습니다.

균형 설계 vs. 불균형 설계

이 부분은 표본 크기에 관한 것입니다.

  • 균형 설계(Balanced design)는 모든 집단에 동일한 수의 관측치가 있습니다 (예: 각 교수법당 20명의 학생).

  • 불균형 설계(Unbalanced design)는 집단 크기가 동일하지 않습니다.

균형 설계가 더 간단하고 강력하며 더 명확한 결과를 제공합니다. 불균형 설계는 수학적 계산을 복잡하게 만들고, 테스트의 민감도(통계적 검정력)를 떨어뜨리며, 때로는 상호작용을 포착하기 어렵게 만들 수 있습니다.

신뢰할 수 있는 비즈니스 또는 연구 결론을 위해서는 균형 잡힌 설정이 바람직합니다. 실험 설계에 관한 하버드 비즈니스 리뷰(Harvard Business Review)의 기사에 따르면 균형 잡힌 집단은 더 해석하기 쉬운 비교를 가능하게 하고 편향을 최소화하는 데 도움이 됩니다.

3단계: 사후 분석 테스트가 필요한 이유 이해하기

유의미한 ANOVA 결과는 단지 모든 집단의 평균이 동일하지 않다는 것만을 알려줍니다. 어떤 특정 집단들이 서로 다른지는 알려주지 않습니다. 이를 알아내려면 가능한 모든 집단 쌍 간의 비교를 실행해야 합니다.

이것은 통계적 문제를 야기합니다. 각 쌍에 대해 단순히 일련의 일반 t-검정을 실행하면, 실제로 차이가 존재하지 않는데도 차이를 발견하게 되는 위양성 가능성이 크게 증가합니다. 이를 1종 오류 팽창(Type I error inflation)이라고 합니다.

사후 분석 테스트는 이를 해결하기 위해 존재합니다. 사후 분석은 모든 쌍별 비교를 수행하지만, 전체 실험에 대한 전반적인 오류율을 선택한 알파 수준(보통 0.05)으로 유지하기 위해 각 개별 테스트의 유의 수준을 조정합니다.

사후 분석 테스트가 실제로 하는 일

  • 모든 집단을 다른 모든 집단과 비교합니다.

  • 일관된 전체 오류율을 유지하기 위해 보정을 적용합니다.

  • 신뢰할 수 있는 조정된 p-값을 제공합니다.

  • 어떤 차이가 통계적으로 의미가 있는지 해석하는 데 도움을 줍니다.

실질적인 측면에서, 사후 분석은 위험을 증가시키지 않으면서 ANOVA 결과를 더 깊이 파고들 수 있게 해줍니다. 안전장치가 내장된 상태에서 상세한 비교를 얻을 수 있습니다.

연구에서의 흔한 좌절

전체 ANOVA 결과는 유의미하게 나왔지만 사후 분석 테스트에서는 유의미한 쌍별 차이가 발견되지 않는 것은 매우 흔하고 완벽히 정상적인 현상입니다. 이것은 오류나 모순이 아닙니다. 대개 연구의 통계적 검정력이 제한적이었음을 의미합니다.

보통 다음과 같은 상황이 원인입니다:

  • 제한된 통계적 검정력: 표본 크기가 너무 작아서 쌍별 차이를 감지하지 못할 수 있습니다.

  • 작은 효과 크기: 집단 간의 차이가 존재하지만 미미합니다.

  • 높은 집단 내 가변성: 데이터의 소음으로 인해 명확한 차이를 분리하기가 더 어렵습니다.

따라서 집단 전체의 전반적인 변동은 감지할 수 있을 만큼 충분히 강하지만, 보정이 적용되고 나면 개별 비교는 임계값을 통과하지 못합니다.

이는 ANOVA와 사후 분석 테스트가 약간 다른 질문에 답한다는 것을 상기시켜 줍니다. 하나는 무언가 일어나고 있는지를 알려주고, 다른 하나는 정확히 어디에서 일어나는지 알려주는데, 때로는 데이터를 통해 이를 명확하게 짚어내기에는 충분히 강하지 않을 수 있습니다.

<ProTip title="⚠️ 경고:" description="보정 방법 없이 ANOVA 이후에 여러 번의 t-검정을 실행하지 마십시오." />

4단계: 올바른 사후 분석 테스트 선택하기

올바른 사후 분석 테스트를 선택하는 것은 매우 중요합니다. 이러한 조정 뒤에 숨겨진 특정 수학적 원리를 더 자세히 알아보려면 사후 분석 테스트 ANOVA에 대한 상세한 자료를 살펴보십시오.

일반적인 사후 분석 테스트 비교

테스트

가장 적합한 사례

보수성

핵심 특징

Tukey HSD

집단 평균의 가능한 모든 쌍을 비교할 때.

보통

모든 쌍별 비교에 대한 패밀리별 오류율(familywise error rate)을 제어합니다.

Bonferroni

사전에 계획된 소수의 비교만 수행할 때.

매우 높음

간단한 방법: 알파 수준(예: 0.05)을 테스트 수로 나눕니다.

Dunnett

여러 처리 집단을 단일 대조군 집단과 비교할 때.

보통

이 특정하고 집중된 목적에 대해 Tukey보다 더 강력합니다.

Scheffé

복잡하고 계획되지 않은 대비를 테스트할 때 (예: 두 집단의 평균을 세 번째 집단과 비교).

극도로 높음

매우 유연하지만 매우 보수적이어서 검정력이 감소합니다.

실제 적용되는 Tukey HSD

Tukey의 HSD(Honestly Significant Difference)는 대부분의 상황, 특히 균형 설계(동일한 표본 크기)를 가질 때 기본적으로 선택되는 검정입니다.

실제 차이를 찾아내기 위한 합리적인 통계적 검정력을 유지하면서 전체 오류율을 효과적으로 제어합니다.

Bonferroni의 단순성

Bonferroni 보정은 이해하고 적용하기 쉽습니다. 원하는 알파 수준을 가져와 수행 중인 비교 횟수로 나누면 됩니다.

가장 큰 단점은 집단이 많을 때 지나치게 엄격해져서 유의미한 결과를 찾기가 매우 어려워진다는 것입니다.

Games-Howell을 사용해야 하는 경우

Levene 검정에서 집단 간 분산이 같지 않다고 나타나면 Tukey나 Bonferroni를 사용하지 마십시오. 대신 Games-Howell 검정을 사용해야 합니다.

이 검정은 등분산성을 가정하지 않으며 이러한 상황에서 강력하고 신뢰할 수 있는 쌍별 비교를 제공하여 잘못된 결론을 방지합니다.

<ProTip title="🧠 참고:" description="사후 분석 테스트를 ANOVA 설계 및 데이터 조건에 맞추십시오." />

5단계: 결과 올바르게 해석하기

결과를 읽는다는 것은 단지 p-값 너머를 바라보는 것을 의미합니다. 유의미한 p-값은 통계적으로 차이를 감지할 수 있음을 알려주지만, 그것이 실제로 의미가 있을 만큼 큰 차이인지는 알려주지 않습니다.

쌍별 차이에 집중하기

이것은 사후 분석 테스트의 핵심 결과물입니다. 어떤 집단들이 서로 다른지 정확히 보여줍니다. 결과는 다음과 같을 수 있습니다:

  • 집단 A vs. 집단 B: p = .003 (유의미함)

  • 집단 A vs. 집단 C: p = .015 (유의미함)

  • 집단 B vs. 집단 C: p = .210 (유의미하지 않음)

이는 집단 A의 처리가 B 또는 C와 다르게 작용했지만, 집단 B와 C는 비슷하게 수행되었음을 알려줍니다.

효과 크기 포함하기

집단 간의 실제 차이가 아주 미미하더라도 p-값은 유의미하게 나올 수 있습니다. 효과 크기는 그 차이의 크기를 측정합니다. ANOVA에서 흔히 쓰이는 척도는 에타 제곱(η²) 또는 부분 에타 제곱입니다.

이것들은 총 분산 중 독립 변수에 의해 설명되는 비율이 얼마인지 알려줍니다. p-값은 크게 유의미하지만 η²이 아주 작다면 실제로는 대수롭지 않은 발견일 수 있습니다.

신뢰 구간의 중요성

항상 평균 차이에 대한 신뢰 구간을 확인하십시오. 95% CI는 두 집단 평균 간의 실제 차이에 대한 타당한 범위를 제공합니다. 유의미한 p-값이 있더라도 구간이 넓으면 불확실성이 크다는 것을 시사합니다.

영(0)을 포함하지 않는 구간은 유의성을 확인해 주지만, 그 경계는 효과의 잠재적 크기를 보여주어 p-값 단독보다 훨씬 더 유용한 정보를 제공합니다.

6단계: 고급 ANOVA 설계 다루기

표준 일원 분산 분석이 모든 연구 시나리오를 다룰 수는 없습니다. 더 복잡한 설계가 흔히 사용되며 특정 접근 방식이 필요합니다.

반복 측정 ANOVA (Repeated Measures ANOVA)

치료 전, 치료 중, 치료 후 환자의 통증 수준을 테스트하는 것과 같이 서로 다른 조건에서 동일한 사람 또는 대상 집단을 여러 번 측정할 때 사용합니다.

여기서 핵심 가정은 구형성(sphericity)이며, 이는 Mauchly 검정으로 확인합니다. 검정이 실패하면 자유도에 보정을 적용합니다.

두 가지 주요 보정 방법은 Greenhouse-Geisser(더 보수적임)와 Huynh-Feldt(덜 보수적임) 보정입니다.

혼합 ANOVA 모델 (Mixed ANOVA Models)

이 설계는 동일한 분석에서 집단 간 요인과 집단 내 요인을 혼합합니다. 예를 들어, 4주간의 주간 평가(집단 내)를 통해 두 가지 다른 훈련 프로그램(집단 간)을 비교할 수 있습니다.

서로 다른 집단에 걸쳐 사전 테스트/사후 테스트 설계를 사용하는 종단적 연구나 실험에 강력한 도구입니다.

요인 ANOVA 설계 (Factorial ANOVA Designs)

요인 분산 분석은 둘 이상의 독립 변수(요인)가 있을 때 사용됩니다. 예를 들어, 2x2 설계를 사용하면 요인 A의 효과, 요인 B의 효과, 그리고 결정적으로 A와 B 사이의 상호작용 효과를 분석할 수 있습니다.

여기서는 한 변수의 효과가 다른 변수의 수준에 따라 달라지는지 확인하여 데이터에서 가장 흥미로운 통찰력을 제공하는 경우가 많습니다.

연구자들이 흔히 범하는 실수

대부분의 문제는 이론을 실제로 적용하려고 할 때 발생합니다.

상황을 너무 복잡하게 만들기

복잡하게 얽힌 연구 설계는 결과를 흐리게 만들고 실수를 유발하기 쉽습니다. 본인을 포함하여 아무도 정말 이해할 수 없는 모델로 끝나는 경우가 많습니다.

P-값만 바라보기

일부 논문은 결과 섹션에 p-값만 덩그러니 남겨두고 마무리합니다. 그것은 그 발견이 실제로 실질적인 의미에서 중요한지 여부에 대해 많은 것을 말해주지 않습니다.

사후 분석 테스트 오류

초기 ANOVA 결과가 유의미하지 않았다면 단순히 여러 사후 분석 비교를 실행해서는 안 됩니다. 그리고 결과를 얻은 후 무언가 "유의미해" 보이는 것을 찾기 위해 데이터를 이리저리 뒤지는 것은 나쁜 습관입니다.

가정을 확인하지 않음

이것이 가장 흔한 실수일 수 있습니다. 정규성이나 등분산성 같은 것들을 확인하지 않는다면 전체 분석은 불안정한 기초 위에 구축된 것입니다.

<ProTip title="🚀 전략:" description="데이터 피싱을 피하기 위해 ANOVA를 실행하기 전에 대비(contrast)를 계획하십시오." />

결과를 빠르게 이해해야 할 때

출력값을 빤히 쳐다보며 무엇이 중요한지 파악하려고 하지만, 숫자가 지저분하고 설명하기 어렵게 느껴질 수 있습니다. 혼란스러워집니다. 명확한 접근 방식이 없으면 결과를 의심하거나 데이터가 실제로 말하려는 바를 놓치기 쉽습니다.

<CTA title="통계 워크플로우 강화하기" description="안내형 작성 및 구조화된 프롬프트를 통해 복잡한 분석을 명확한 단계로 전환해 보세요." buttonLabel="Jenni 무료 체험하기" link="https://app.jenni.ai/register" />

여기서 Jenni가 상황을 정리하고 명확하게 느껴지는 방식으로 결과를 제시하도록 도와줄 수 있습니다. 연구 결과를 일관성 있게 작성하고 분석 내용을 설명하는 방식을 지원합니다. 짐작하는 대신, 더 쉽게 신뢰하고 공유할 수 있는 결과를 바탕으로 앞으로 나아갈 수 있습니다.

목차

오늘 당신의 가장 위대한 작업에서 진전을 이루세요.

오늘 Jenni와 함께 첫 번째 논문을 작성하고 결코 뒤돌아보지 마세요

무료로 시작하기

신용카드 불필요

언제든지 취소할 수 있습니다

5m 이상

전 세계의 학술 활동

5.2시간 절약됨

논문당 평균

15m 이상

젠니에 관한 논문들

오늘 당신의 가장 위대한 작업에서 진전을 이루세요.

오늘 Jenni와 함께 첫 번째 논문을 작성하고 결코 뒤돌아보지 마세요

무료로 시작하기

신용카드 불필요

언제든지 취소할 수 있습니다

5m 이상

전 세계의 학술 활동

5.2시간 절약됨

논문당 평균

15m 이상

젠니에 관한 논문들

오늘 당신의 가장 위대한 작업에서 진전을 이루세요.

오늘 Jenni와 함께 첫 번째 논문을 작성하고 결코 뒤돌아보지 마세요

무료로 시작하기

신용카드 불필요

언제든지 취소할 수 있습니다

5m 이상

전 세계의 학술 활동

5.2시간 절약됨

논문당 평균

15m 이상

젠니에 관한 논문들