가구 수 표에 −1이 나왔다면, 계산이 틀린 걸까?

오차 산출을 위한 복제 추정값과 실제 관측 결과의 확률분포를 구별한다.

덮개를 펼친 빈 갈색 판지 상자

사진: ArnoldReinhold · CC BY-SA 3.0 · 원본 출처

공식 가구 수 추정값은 10이다. 가상 복제 추정값 80개 중 40개는 −1, 나머지는 21이다. 주어진 식의 분산과 표준오차를 구하라. 이 표만 보고 “실제 가구 수가 음수일 확률이 1/2”라고 말할 수 있는가?

V=480∑r=180(tr−10)2,SE=V.V=\frac4{80}\sum_{r=1}^{80}(t_r-10)^2,\qquad SE=\sqrt V.

두 복제값 모두 공식값에서 11만큼 떨어져 있다. 따라서

V=484,SE=22.V=484,\qquad SE=22.

복제값은 실제 가구 수를 반복 관측한 결과가 아니므로 음수의 개수를 실제 가구 수의 확률로 읽을 수 없다.

“80개의 수”라는 겉모양만으로 각 수를 동일한 확률의 관측값으로 해석하면 자료의 역할이 바뀐다. 실제 가구 수는 음이 아닌 정수지만, 추정 절차가 오차를 산출하기 위해 만든 수에는 다른 제약이 적용될 수 있다. 이 표가 주는 정보는 지정된 공식으로 계산한 추정 오차다.

Census 문서는 복제 추정값이 음수나 0일 수 있고 독립적인 의미를 갖지 않는다고 설명한다. 다만 여기의 −1과 21은 원문 자료를 복사한 값이 아니다. 실제 조사 결과가 얼마나 정확한지도 이 작은 모형만으로 판단하지 않는다.

교사는 학생에게 표의 열 제목을 “관측한 가구 수”와 “분산 산출용 복제 추정값” 중에서 고르게 한다. 같은 계산표를 어느 자료로 읽었는지가 확률 문장의 타당성을 결정한다.

착안: Documentation for the 2020–2024 Variance Replicate Estimates Tables. 수치·문항·해설은 자체 교육용으로 작성했다.