각 집단에서 하나씩 뽑으면 표본평균의 분산도 같을까

A점수0,2와 B점수4,6에서 각각 하나를 같은 확률로 독립 선택하면 평균의 분산1/2입니다. 전체 네 점수에서 독립2회 선택하면5/2입니다. 평균은 둘 다3이지만 추출 규칙이 다릅니다.

여러 실제 쌀알이 모여 있는 사진

사진: IRRI Images · CC BY 2.0 · 원본 출처

점수0,2인 집단 A와 점수4,6인 집단 B에서 각각 한 점수를 같은 확률로 독립적으로 뽑는다. 두 점수의 평균을 M이라 한다. 네 점수 전체에서 독립적으로 두 번 뽑은 평균 N과 분산을 비교하라.

M=2,3,3,4각 기록의 확률 1/4.M=2,3,3,4\quad\text{각 기록의 확률 }1/4.

M의 평균은3이고 분산은(1+0+0+1)/4=1/2다. M=3인 값의 확률은1/2이므로 서로 다른 평균 세 값을 같은 확률로 세면 안 된다.

전체 네 점수의 평균은3, 분산은(9+1+1+9)/4=5다. 전체에서 독립적으로 두 번 뽑는 N의 분산은5/2다. 두 방법의 평균은 모두3이지만 분산은 다르다.

각 집단에서 하나씩 뽑는 방법은 두 관측값이 전체 네 점수에서 각각 같은 분포를 따르는 방법이 아니다. 첫 값은0,2만, 둘째 값은4,6만 가능하다. 표본 크기2라는 숫자만 보고 전체 모분산을2로 나누면 잘못된 모형을 적용한다.

M에는 집단별 선택의 우연성이 있지만 집단 인원 비중의 우연성은 없다. N에서는 두 값 모두 A에 속하거나 둘 다 B에 속할 수도 있다. 두 추출 규칙이 만든 가능한 기록을 실제로 비교하면 분산 차이를 설명할 수 있다.

교사는 ‘무작위 두 개’라는 짧은 표현 대신 어디에서 어떻게 고르는지 적는다. 각 집단의 하나를 고르는 조건이 전체에서 두 번 고르는 조건과 다르다는 점이 정답에 필요하다.

분산이 작다는 이유만으로 모든 모집단에서 앞 방법을 쓰면 된다는 결론도 피한다. 여기서는 두 집단의 크기가 같아 같은 비중 평균이 전체 평균과 일치한다. 집단의 크기를 바꾸면 목표 평균의 비중도 다시 확인해야 한다.

출처·착안: Allan Rossman, 「#5 A below-average joke」. 문항과 예시 답안은 새로 작성했다.