점수0,2인 집단 A와 점수4,6인 집단 B에서 각각 한 점수를 같은 확률로 독립적으로 뽑는다. 두 점수의 평균을 M이라 한다. 네 점수 전체에서 독립적으로 두 번 뽑은 평균 N과 분산을 비교하라.
M의 평균은3이고 분산은(1+0+0+1)/4=1/2다. M=3인 값의 확률은1/2이므로 서로 다른 평균 세 값을 같은 확률로 세면 안 된다.
전체 네 점수의 평균은3, 분산은(9+1+1+9)/4=5다. 전체에서 독립적으로 두 번 뽑는 N의 분산은5/2다. 두 방법의 평균은 모두3이지만 분산은 다르다.
각 집단에서 하나씩 뽑는 방법은 두 관측값이 전체 네 점수에서 각각 같은 분포를 따르는 방법이 아니다. 첫 값은0,2만, 둘째 값은4,6만 가능하다. 표본 크기2라는 숫자만 보고 전체 모분산을2로 나누면 잘못된 모형을 적용한다.
M에는 집단별 선택의 우연성이 있지만 집단 인원 비중의 우연성은 없다. N에서는 두 값 모두 A에 속하거나 둘 다 B에 속할 수도 있다. 두 추출 규칙이 만든 가능한 기록을 실제로 비교하면 분산 차이를 설명할 수 있다.
교사는 ‘무작위 두 개’라는 짧은 표현 대신 어디에서 어떻게 고르는지 적는다. 각 집단의 하나를 고르는 조건이 전체에서 두 번 고르는 조건과 다르다는 점이 정답에 필요하다.
분산이 작다는 이유만으로 모든 모집단에서 앞 방법을 쓰면 된다는 결론도 피한다. 여기서는 두 집단의 크기가 같아 같은 비중 평균이 전체 평균과 일치한다. 집단의 크기를 바꾸면 목표 평균의 비중도 다시 확인해야 한다.
출처·착안: Allan Rossman, 「#5 A below-average joke」. 문항과 예시 답안은 새로 작성했다.
