-
728x90반응형

그림. 검정 이름보다 먼저 관측치의 독립성·대응 구조와 비교 질문을 확인합니다.
reader_decision: T-test와 Mann-Whitney 중 하나를 고르기 전에 비교 질문·독립/paired 구조·측정 척도·분포를 확인하고, 두 검정으로 닫을 수 없는 경우에는 억지로 선택하지 않습니다.
한 줄 결론
정규성 검사 결과 하나로 검정을 고르지 않습니다. 무엇을 비교하는지, 관측치가 독립인지 대응되는지, 측정값의 척도와 분포가 어떤지를 먼저 고정한 뒤 그 질문에 맞는 검정을 선택합니다.검정 이름보다 비교 질문이 먼저입니다
T-test와 Mann-Whitney는 버튼 두 개 중 하나를 누르는 문제가 아닙니다. 독립된 두 집단의 평균을 묻는지, 같은 대상의 전후 차이를 묻는지, 순위나 분포의 위치를 묻는지에 따라 질문 자체가 달라집니다. 같은 숫자라도 독립 표본을 paired로 바꾸거나 paired 관측치를 독립 표본으로 바꾸면 분석 대상이 달라집니다.
독립표본 t-검정은 무엇을 묻나
서로 다른 두 집단에서 관측치가 독립이고 결과가 연속형이라면 독립표본 t-검정으로 두 모평균의 차이를 묻을 수 있습니다. 두 집단의 분산을 같다고 둘 근거가 약하면 pooled t-test 대신 Welch t-test를 고려합니다. “두 집단이 다르다”는 문장만 쓰지 말고 평균 차이의 방향과 신뢰구간을 함께 적습니다.
대응표본 t-검정은 차이값을 분석합니다
한 사람의 전후 점수, 같은 기계에서 바꾸기 전과 후의 측정처럼 관측치가 짝지어져 있으면 각 쌍의 차이값을 먼저 만듭니다. 원자료 각각의 정규성만 보는 것이 아니라 차이값의 분포와 이상치를 살펴야 합니다. NIST가 설명하듯 대응표본 t-검정의 표준오차와 자유도는 쌍별 차이에서 나옵니다.
Mann-Whitney U는 중앙값 버튼이 아닙니다
Mann-Whitney U는 서로 독립된 두 표본의 순위를 사용합니다. 정규성 가정이 불편하거나 순서형 자료를 다룰 때 유용한 선택지가 될 수 있지만, 결과를 항상 “중앙값 차이”라고 번역하면 안 됩니다. 두 집단의 분포 모양과 산포가 비슷해 위치 이동으로 해석할 수 있을 때에만 중앙값 또는 위치 차이로 좁혀 말합니다. 모양이 다르면 순위 검정의 신호에 분포 모양과 산포 차이도 섞일 수 있습니다.
실행 전 분기표를 만들었습니다
- 먼저 귀무가설과 독자가 알고 싶은 차이를 한 문장으로 적습니다.
- 독립·paired 여부와 매칭 단위를 데이터 사전에서 확인합니다.
- 결과 척도와 단위, 이상치와 분포 모양을 확인합니다.
- 독립 t-test라면 pooled와 Welch 중 어느 variant인지, 대응 자료라면 paired t-test인지 Wilcoxon signed-rank인지 사전에 적습니다.
- 효과크기·절대 차이·신뢰구간·p-value를 같이 보고, 실행 후 더 예쁜 결과가 나온 검정으로 갈아타지 않습니다.
코드는 선택 뒤에 실행합니다
from scipy import stats # 독립 두 집단: equal_var 여부를 설계에서 먼저 정함 stats.ttest_ind(group_a, group_b, equal_var=False) # 같은 대상의 전후 측정 stats.ttest_rel(before, after) # 독립 두 집단의 순위 기반 비교 stats.mannwhitneyu(group_a, group_b, alternative="two-sided") # 대응 자료의 비모수 대안 stats.wilcoxon(before, after)이 코드는 검정을 자동 선택하는 코드가 아닙니다. 독립성·paired 구조·척도·분포를 먼저 확인한 뒤 사전에 선택한 검정을 실행하는 예시입니다. 데이터 구조가 불명확하면 코드부터 실행하지 않는 것이 더 정확한 결정입니다.
기존 통계 글과 이 글의 경계
P-Value, T-Test, Z-Test 설명은 기본 용어와 기존 예제를 읽는 연결점입니다. p-value가 작다는 사실을 효과크기·절대 차이와 함께 읽는 방법은 Q03의 합성 실험에서 다루고, 이 글은 검정 선택에 필요한 질문과 자료 구조를 소유합니다.
결론
T-test와 Mann-Whitney를 고르는 첫 질문은 “정규성 검사를 통과했나”가 아닙니다. 독립 표본인지 paired인지, 무엇의 평균이나 위치를 비교하는지, 결과 척도와 분포가 어떤지부터 확인해야 합니다. 두 검정으로 질문을 닫을 수 없다면 선택을 보류하고 다른 설계를 찾는 것도 분석 결과입니다.
728x90반응형'Machine Learning > 데이터과학을 위한 통계' 카테고리의 다른 글