추정 비율을 0과 1 사이로 고치면, 더 정확해질까?

음수나 1보다 크게 나온 추정 비율을 허용 범위로 고칩니다. 두 보고만 있는 모형에서 제곱오차는 줄어들지만, 추정값의 평균은 실제 비율에서 벗어납니다. 범위를 맞추는 일과 평균을 맞추는 일을 비교합니다.

나무 책상 위 밀봉된 봉투 두 장과 작은 동전

이미지: AI 생성 · 수학 이야기

자체 이진 응답 장치는 실제 속성 X∈{0,1}을 3/4 확률로 그대로, 1/4 확률로 뒤집어 Y를 보고한다. 두 응답자의 속성·장치 동작은 모두 독립이고 모집단의 실제 1 비율을 π라 한다. 두 보고 중 1의 비율이 Ȳ일 때 아래 보정값을 쓰고, 범위를 벗어나면 0 또는 1로 잘라낸다. π=0인 모형에서 두 추정값의 기댓값과 평균 제곱오차를 구하라.

π~=2Yˉ−12,π^=min⁡(1,max⁡(0,π~)).\widetilde\pi=2\bar Y-\frac12,\qquad \widehat\pi=\min(1,\max(0,\widetilde\pi)).

일반 π에서 보고 1 확률은 1/4+π/2라 비제약 보정값의 기댓값은 π다. 그러나 π=0이면 실제 속성은 항상 0이어도 장치가 보고 1을 낼 확률은 1/4다. 두 보고 중 1인 값의 개수를 K라 하면 정확 분포는 다음과 같다.

K 확률 비제약 보정값 범위 제한값
0 9/16 −1/2 0
1 6/16 1/2 1/2
2 1/16 3/2 1
E(π~)=0,E(π^)=14,MSE(π~)=38,MSE(π^)=532.E(\widetilde\pi)=0,\quad E(\widehat\pi)=\frac14,\qquad \mathrm{MSE}(\widetilde\pi)=\frac38,\quad \mathrm{MSE}(\widehat\pi)=\frac5{32}.

참값이 0이므로 MSE는 추정값의 제곱을 같은 확률로 더한 값이다. 범위 제한은 음수 기여를 0으로 없애고 3/2를 1로 바꿔 편향 1/4를 만들지만 제곱오차는 더 작아진다. 일반 참값 0≤π≤1에서도 범위 밖 값을 가장 가까운 끝점으로 바꾸면 각 결과의 거리 |추정−π|가 늘지 않는다. 이는 오차 감소의 근거이지 불편성 보존의 근거가 아니다. 제한된 π 영역에서 우도를 최대로 하는 값도 이 작은 표에서는 0,1/2,1이다.

Warner 원문의 실제 각주는 보정 비율이 0~1 밖으로 나올 수 있음을 인정한다. 여기서는 원문의 큰 표본 표를 옮기지 않고 두 보고만 있는 자체 설계에서 범위 제한·불편성·제곱오차를 각각 검산했다. 실제 응답 협조율을 주장하지 않는다.

교사는 0~1 안이라는 결과 형식과 평균이 참값이라는 성능을 분리하게 한다. 범위를 고친 뒤 단순히 평균도 고쳤다고 쓰지 않는다. 편향이 생겼다는 이유만으로 모든 오차 기준에서 나빠졌다고 결론 내리면 두 MSE가 반례가 된다.

착안 원문: Stanley L. Warner, Randomized Response: A Survey Technique for Eliminating Evasive Answer Bias (1965). 두 보고만 있는 반전 장치와 보정값·제곱오차 표는 자체 구성했으며 실제 설문 응답 자료나 협조율을 보고한 것이 아니다.