각각의 오차가 같아도 합계의 오차는 달라진다

같은 주변 편차라도 복제 번호별 결합 방향이 달라지면 합계의 추정 분산이 달라진다.

검은 바탕 위 노란 밧줄의 굵은 매듭

사진: Frank van Mierlo, May 1, 2006 · Public domain · 원본 출처

두 항목의 공식 추정값은 각각 100이다. 아래 두 모형에서 각 행을 40번씩 반복해 80개 복제 추정값을 만든다. 합계 200의 추정 분산은 같은 번호끼리 더한 뒤 주어진 식으로 구한다. 어느 모형의 합계 오차가 더 큰가?

복제 행 A 모형 (x,y) B 모형 (x,y)
1~40 (101,101) (101,99)
41~80 (99,99) (99,101)
V(t^)=480∑r=180(tr−t^)2V(\hat t)=\frac4{80}\sum_{r=1}^{80}(t_r-\hat t)^2

각 항목만 보면 어느 모형이나 편차가 ±1이어서 분산 추정값은 4다. A의 합계 복제값은 202와 198, B는 모두 200이다. 따라서

VA(x+y^)=16,VB(x+y^)=0.V_A(\widehat{x+y})=16,\qquad V_B(\widehat{x+y})=0.

각각의 분산 4를 더해 8로 쓰면 두 모형의 결합 관계를 놓친다.

A에서는 두 항목의 편차가 같은 방향이고 B에서는 서로 상쇄된다. 각 열의 값 목록을 그대로 두고 어느 행끼리 결합하는지만 바꾼 것이므로, 열별 오차 크기만으로 합계 오차가 정해지지 않는 반례다. B의 0은 이 가상 복제 체계의 산출값이지 실제 조사 전체가 오차 없이 정확하다는 보증은 아니다.

미국 Census의 복제 추정 방식은 합계를 각 복제 번호 안에서 먼저 만든다. 여기에 쓰인 80은 독립 관측 80명을 뜻하지 않는다. 번호 대응을 지운 두 열로는 이 계산을 복구할 수 없다.

수업에서는 두 열을 따로 정렬한 학생에게 원래 행 번호를 되돌리게 한다. 단순 합 분산 공식을 암기하기 전에, 합계 편차의 제곱에서 교차항이 어떤 부호로 남는지 확인한다.

착안: Documentation for the 2020–2024 Variance Replicate Estimates Tables. 수치·문항·해설은 자체 교육용으로 작성했다.