두 항목의 공식 추정값은 각각 100이다. 아래 두 모형에서 각 행을 40번씩 반복해 80개 복제 추정값을 만든다. 합계 200의 추정 분산은 같은 번호끼리 더한 뒤 주어진 식으로 구한다. 어느 모형의 합계 오차가 더 큰가?
| 복제 행 | A 모형 (x,y) | B 모형 (x,y) |
|---|---|---|
| 1~40 | (101,101) | (101,99) |
| 41~80 | (99,99) | (99,101) |
각 항목만 보면 어느 모형이나 편차가 ±1이어서 분산 추정값은 4다. A의 합계 복제값은 202와 198, B는 모두 200이다. 따라서
각각의 분산 4를 더해 8로 쓰면 두 모형의 결합 관계를 놓친다.
A에서는 두 항목의 편차가 같은 방향이고 B에서는 서로 상쇄된다. 각 열의 값 목록을 그대로 두고 어느 행끼리 결합하는지만 바꾼 것이므로, 열별 오차 크기만으로 합계 오차가 정해지지 않는 반례다. B의 0은 이 가상 복제 체계의 산출값이지 실제 조사 전체가 오차 없이 정확하다는 보증은 아니다.
미국 Census의 복제 추정 방식은 합계를 각 복제 번호 안에서 먼저 만든다. 여기에 쓰인 80은 독립 관측 80명을 뜻하지 않는다. 번호 대응을 지운 두 열로는 이 계산을 복구할 수 없다.
수업에서는 두 열을 따로 정렬한 학생에게 원래 행 번호를 되돌리게 한다. 단순 합 분산 공식을 암기하기 전에, 합계 편차의 제곱에서 교차항이 어떤 부호로 남는지 확인한다.
착안: Documentation for the 2020–2024 Variance Replicate Estimates Tables. 수치·문항·해설은 자체 교육용으로 작성했다.
