차를 더한 뒤 제곱하면 분산이 언제나 0이 된다

0,2,4를 각각 같은 확률로 고릅니다. 정확한 평균을 뺀 차의 합을 먼저 제곱하면 0입니다. 분산은 각 차를 먼저 제곱하여 8/3입니다. 모두 2인 경우와 비교하면 괄호의 범위 오류가 드러납니다.

양쪽 접시가 서로 다른 높이에 놓인 작은 저울

사진: Roger Culos · CC BY-SA 4.0 · 원본 출처

세 값0,2,4 중 하나를 같은 확률로 고르는 확률변수 X가 있다. 평균은2다. 학생이 다음 식을 분산이라고 썼다.

{(0−2)+(2−2)+(4−2)}23=0.\frac{\{(0-2)+(2-2)+(4-2)\}^2}{3}=0.

어느 연산의 위치가 바뀌었는지 찾고 올바른 분산을 구하라.

각 값에서 평균을 뺀 뒤 각각 제곱해야 한다.

V(X)=(0−2)2+(2−2)2+(4−2)23=83.V(X)=\frac{(0-2)^2+(2-2)^2+(4-2)^2}{3}=\frac83.

차를 먼저 더하면 −2와2가 서로 없어지고0만 남는다. 퍼진 값을 재기 위해 만든 제곱이 합의 바깥으로 이동하면서 정보가 사라졌다.

이 오답은 특별히 대칭인 세 값에서만0이 되는 것이 아니다. n개 값을 같은 확률로 고를 때 평균 m은 합을 n으로 나눈 값이므로

∑i=1n(xi−m)=∑i=1nxi−nm=0.\sum_{i=1}^{n}(x_i-m)=\sum_{i=1}^{n}x_i-nm=0.

따라서 차의 합을 제곱하는 식은 어떤 자료에도0을 출력한다. 값을 다르게 바꾸는 검산으로는 이 잘못을 해결할 수 없다.

교사는 계산식이 자료의 퍼짐을 구별하는지 테스트할 예를 준비한다. 모두2인 자료의 분산은0이고0,2,4의 분산은8/3이어야 한다. 잘못된 식은 두 자료에 같은0을 주므로 필요한 성질을 만족하지 않는다.

컴퓨터에 입력하기 전 괄호의 범위를 수식으로 표시하게 한다. 각 차의 제곱을 합한 것인지, 차들을 합한 다음 한 번 제곱한 것인지 확인한다. 제곱 기호 하나의 위치가 통계량의 뜻을 바꾼다.

평균을 정확히 쓴다는 조건도 남긴다. 평균에 근삿값을 먼저 넣으면 차의 합이0이라는 일반 확인에 별도의 오차가 생긴다.

출처·착안: Dr Nic, 「Spreadsheets, statistics, mathematics and computational thinking」. 문항과 예시 답안은 새로 작성했다.