평균 낸 뒤 나눌까, 나눈 뒤 평균 낼까? 비율이 달라진다

비율의 복제값을 먼저 만든 후 공식 비율에서의 제곱편차를 계산한다; 평균 비율로 공식 추정값을 대체하지 않는다.

얼음과 레몬이 들어 있는 투명한 물잔

사진: Jon Sullivan · Public domain · 원본 출처

공식 추정값은 분자 30, 분모 70이다. 복제 추정값 (20,40), (40,100)을 각각 40행씩 반복한다. 비율의 추정 분산을 아래 식으로 구하라. 두 복제 비율의 평균을 공식 비율 대신 써도 되는가?

q^=3070,qr=NrDr,V=480∑r=180(qr−q^)2.\hat q=\frac{30}{70},\quad q_r=\frac{N_r}{D_r},\quad V=\frac4{80}\sum_{r=1}^{80}(q_r-\hat q)^2.

복제 비율은 1/2와 2/5다. 공식 비율은 3/7이며 두 비율의 단순 평균 9/20과 다르다. 공식값을 기준으로 계산하면

V=2[(114)2+(−135)2]=292450.V=2\left[\left(\frac1{14}\right)^2+\left(-\frac1{35}\right)^2\right]=\frac{29}{2450}.

기준을 9/20로 바꾸면 1/100이 되어 다른 계산을 한다.

여기서 분모와 분자의 평균은 각각 70과 30이라 평균값의 비는 공식값과 일치한다. 그러나 이것이 비율들의 평균도 같다는 뜻은 아니다. 분모가 큰 복제 행과 작은 행을 같은 비중으로 평균한 연산이 나눗셈보다 먼저 들어갔기 때문이다.

실제 Census 문서는 비율을 공식 추정값과 각 복제 추정값에서 각각 구성하도록 설명한다. 이 예는 그 연산 순서만 축소해서 확인하며 미국 인구 비율의 실제 값은 쓰지 않았다. 분모 0의 특수 규칙도 여기에는 필요하지 않도록 모든 분모를 양수로 정했다.

교사는 계산 결과보다 먼저 식의 기준점 3/7을 표시하게 한다. 복제값을 평균해서 기준점까지 새로 만드는 풀이에는 원래 공식 추정값을 어떤 근거로 바꾸었는지 묻는다.

착안: Documentation for the 2020–2024 Variance Replicate Estimates Tables. 수치·문항·해설은 자체 교육용으로 작성했다.