← 기출문제 완전분석으로

기출문제 완전분석

Statistics and Probability

최근 5년(2021M~2025M) 기출 47개 시험지의 확통 문항을 세부코드별로 실측한 결과입니다. 7개 테마로 묶어 20문항을 새로 제작했습니다. 코드를 눌러 골라보세요.

공개된 20문항은 실제 제작한 변형문항 중 일부입니다. 더 많은 문항은 HC Mathematics N제 교재에서 확인하실 수 있습니다.

Statistics and Probability 세부코드별 출제 비중 (최근 5년 실측)

PS-PRB Standard 9 marks

A Two-Way Table and a Test for Independence

200 students were surveyed about whether they study Physics (P) and whether they study Music (M). Of these, 60 study both P and M, 90 study P but not M, and 30 study M but not P.

(a)  Find the number of students who study neither subject. [2]

(b)  Find $P(M\mid P)$. [3]

(c)  Determine whether studying Physics and studying Music are independent events, showing your reasoning. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(c)에서 $P(M\mid P)$와 $P(M)$이 "비슷한 값"이면 독립이라고 대충 판단해버립니다. 소수점까지 정확히 비교하지 않습니다.

2왜 막히는가

독립의 정의가 $P(M\mid P)=P(M)$의 "완전한 등식"이라는 걸 느슨하게 이해하기 때문입니다. 근사적으로 비슷해도 정확히 같지 않으면 독립이 아닙니다.

3어떻게 복구하는가

(a) $P$인원$=60+90=150$, $M$인원$=60+30=90$. 최소 한 과목 이상$=60+90+30=180$. 둘 다 아님$=200-180=20$.

(b) $P(M\mid P)=\dfrac{60}{150}=0.4$.

(c) $P(M)=\dfrac{90}{200}=0.45$. $P(M\mid P)=0.4\neq0.45=P(M)$이므로 독립이 아닙니다.

4어디로 확장되는가

등식을 정확히 검증하는 이 원칙은 두 사건이 배반(mutually exclusive)인지 판정하는 문제, 그리고 이산확률변수가 특정 분포를 따르는지 확인하는 문제 전반에서 "근사치가 아니라 정확한 등식"을 요구하는 감각으로 이어집니다.

PS-PRB Advanced 11 marks

Sampling Without Replacement

A bag contains 5 red balls and 3 blue balls. Two balls are drawn at random from the bag, one after another, without replacement.

(a)  Find the probability that both balls are red. [3]

(b)  Find the probability that the two balls are different colours. [4]

(c)  Given that the two balls are different colours, find the probability that the first ball drawn was red. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(c)에서 다시 처음부터 확률을 계산하려 하거나, (b)에서 이미 구한 값을 재활용하지 않고 새로 트리 다이어그램을 그립니다.

2왜 막히는가

조건부확률 공식 $P(A\mid B)=\dfrac{P(A\cap B)}{P(B)}$에서, (c)의 $B$(다른 색)와 (b)에서 구한 값이 정확히 같은 사건이라는 걸 연결 짓지 못하기 때문입니다.

3어떻게 복구하는가

(a) $P(RR)=\dfrac58\times\dfrac47=\dfrac{5}{14}$.

(b) $P(RB)+P(BR)=\dfrac58\times\dfrac37+\dfrac38\times\dfrac57=\dfrac{15}{56}+\dfrac{15}{56}=\dfrac{15}{28}$.

(c) $P(\text{첫 번째 빨강}\mid\text{다른 색})=\dfrac{P(RB)}{P(\text{다른 색})}=\dfrac{15/56}{15/28}=\dfrac12$.

4어디로 확장되는가

이전 소문항의 계산 결과를 조건부확률의 분자·분모로 재활용하는 이 절차는 베이즈 정리를 활용하는 모든 문제, 그리고 이산확률변수의 조건부 기댓값을 구하는 AHL 문제에서 그대로 요구됩니다.

PS-PRB Standard 8 marks

The Addition Rule, Independence, and De Morgan

Events $A$ and $B$ are such that $P(A)=0.4$, $P(B)=0.35$, and $P(A\cup B)=0.62$.

(a)  Find $P(A\cap B)$. [2]

(b)  Determine whether $A$ and $B$ are independent. [3]

(c)  Find $P(A'\cap B')$. [3]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(c)에서 $P(A'\cap B')$를 $1-P(A\cap B)$처럼 잘못된 식으로 구하려 합니다.

2왜 막히는가

"$A$도 $B$도 아님"이 "$A$와 $B$가 동시에 일어나지 않음"과 다른 사건이라는 걸 구분하지 못하기 때문입니다. 드모르간 법칙 $A'\cap B'=(A\cup B)'$을 써야 합니다.

3어떻게 복구하는가

(a) $P(A\cup B)=P(A)+P(B)-P(A\cap B)\Rightarrow0.62=0.75-P(A\cap B)\Rightarrow P(A\cap B)=0.13$.

(b) 독립이려면 $P(A\cap B)=P(A)P(B)=0.4\times0.35=0.14$이어야 하는데 실제는 $0.13$이므로 독립이 아닙니다.

(c) $P(A'\cap B')=P((A\cup B)')=1-P(A\cup B)=1-0.62=0.38$.

4어디로 확장되는가

드모르간 법칙으로 "둘 다 아님"을 "합집합의 여집합"으로 바꾸는 이 변환은 여러 조건을 동시에 배제하는 모든 확률 문제, 그리고 벡터·기하에서 "어느 쪽에도 속하지 않는 영역"을 다루는 문제와 같은 논리 구조입니다.

PS-PRB Standard 6 marks

A Combinatorial Probability

A committee of 4 people is selected at random from a group of 6 men and 5 women.

Find the probability that the committee contains exactly 2 men and 2 women. [6]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

분자를 $\binom62+\binom52$처럼 더해버리거나, 순서를 고려한 순열로 계산해서 값이 틀립니다.

2왜 막히는가

"남자 2명을 뽑는 것"과 "여자 2명을 뽑는 것"이 동시에 일어나야 하는 사건이라는 걸 놓치고, 곱해야 할 것을 더해버리기 때문입니다.

3어떻게 복구하는가

전체 경우의 수: $\binom{11}{4}=330$. 남자 2명·여자 2명을 뽑는 경우: $\binom62\times\binom52=15\times10=150$. 확률 $=\dfrac{150}{330}=\dfrac5{11}$.

4어디로 확장되는가

"동시에 만족해야 하는 독립적 선택은 곱한다"는 이 원칙은 카드게임에서 특정 조합이 나올 확률, 그리고 이항정리의 특정 항의 계수를 구하는 문제(NA-BIN)와 같은 조합론적 사고를 공유합니다.

PS-PRB Advanced 8 marks

Reversing a Conditional Probability

In a certain population, 2% of people have a particular disease. A test for the disease gives a positive result for 95% of people who have the disease, and gives a (false) positive result for 10% of people who do not have the disease.

A person is chosen at random and tested. Given that the test result is positive, find the probability that the person actually has the disease. [8]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

"95% 정확한 검사"라는 말을 듣고 답을 직관적으로 $0.95$ 근처라고 추측해버립니다. 실제 계산 없이 감으로 답을 씁니다.

2왜 막히는가

구하는 것은 $P(\text{검사 정확도})$가 아니라 $P(\text{질병}\mid\text{양성})$이라는, 방향이 반대인 조건부확률이라는 걸 놓치기 때문입니다. 유병률(2%)이 워낙 낮아서, 양성이어도 실제 질병일 확률은 훨씬 낮아집니다.

3어떻게 복구하는가

트리 다이어그램으로 정리: $P(\text{양성})=P(\text{양성}\mid\text{질병})P(\text{질병})+P(\text{양성}\mid\text{무질병})P(\text{무질병})=0.95(0.02)+0.10(0.98)=0.019+0.098=0.117$. $P(\text{질병}\mid\text{양성})=\dfrac{0.019}{0.117}\approx0.162$.

질병 0.02 무질병 0.98 양성 0.95 음성 0.05 양성 0.10 음성 0.90

4어디로 확장되는가

"방향이 반대인 조건부확률"을 트리 다이어그램의 전체확률로 뒤집는 이 기법이 바로 베이즈 정리이고, 품질검사·스팸필터 같은 응용문제, 그리고 이산확률변수의 조건부 분포 문제(AHL)에서 형태만 바뀌어 반복됩니다.

PS-PRB Standard 5 marks

"At Least One": the Complement Trick

A fair six-sided die is rolled 5 times.

Find the probability that at least one roll results in a 6. [5]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

"적어도 하나"를 정확히 1번, 정확히 2번, … 5번 나오는 경우를 전부 더하려고 시도해서 계산이 복잡해집니다.

2왜 막히는가

"적어도 하나"의 여사건이 "한 번도 없음" 단 하나뿐이라는 걸 활용하지 않기 때문입니다. 여사건이 훨씬 단순할 때는 그쪽을 구해서 빼는 게 표준 전략입니다.

3어떻게 복구하는가

$P(\text{적어도 하나의 }6)=1-P(\text{6이 한 번도 안 나옴})=1-\left(\dfrac56\right)^5=1-\dfrac{3125}{7776}=\dfrac{4651}{7776}\approx0.598$.

4어디로 확장되는가

"적어도 하나"를 여사건으로 뒤집는 이 트릭은 이항분포에서 $P(X\ge1)$을 구하는 문제, 그리고 여러 독립시행이 반복되는 거의 모든 확률 문제에서 계산량을 극적으로 줄여주는 표준 전략입니다.

PS-DRV Standard 6 marks

A Probability Distribution Table

The random variable $X$ has the following probability distribution: $P(X=0)=0.1$, $P(X=1)=k$, $P(X=2)=2k$, $P(X=3)=0.3$.

(a)  Find the value of $k$. [3]

(b)  Find $E(X)$. [3]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

$k$를 구하는 데 필요한 조건이 어디 숨어있는지 못 찾고 멈춥니다. 문제에 "합이 1"이라는 말이 직접 쓰여있지 않기 때문입니다.

2왜 막히는가

확률분포표의 가장 기본적인 성질 — 모든 확률의 합이 반드시 $1$이라는 것 — 이 암묵적으로 항상 전제되어 있다는 걸 습관적으로 떠올리지 못하기 때문입니다.

3어떻게 복구하는가

(a) $0.1+k+2k+0.3=1\Rightarrow3k=0.6\Rightarrow k=0.2$.

(b) $E(X)=0(0.1)+1(0.2)+2(0.4)+3(0.3)=0.2+0.8+0.9=1.9$.

4어디로 확장되는가

"암묵적 조건(합이 1)"을 놓치지 않는 이 습관은 연속확률변수의 pdf에서 미지수를 구하는 문제(PS-CRV), 그리고 이항분포·정규분포의 매개변수를 역산하는 모든 문제의 출발점입니다.

PS-DRV Advanced 7 marks

A Fair Game

In a game, a player pays $\$5$ to play, then rolls a fair six-sided die. If they roll a 6, they win $\$w$. If they roll a 1, 2, or 3, they win nothing. If they roll a 4 or 5, they win $\$3$. Let $X$ be the player's net gain (winnings minus the $\$5$ cost).

(a)  Write down the probability distribution of $X$. [3]

(b)  Given that the game is fair (i.e. $E(X)=0$), find the value of $w$. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

"이긴 금액"과 "순이익"을 혼동해서, $5달러 참가비를 빼지 않고 그대로 $X$ 값으로 씁니다.

2왜 막히는가

$X$가 "당첨금"이 아니라 "순이익(당첨금$-$참가비)"으로 정의되어 있다는 걸 문제 서두에서 놓치기 때문입니다. 모든 경우에서 $5$를 빼야 합니다.

3어떻게 복구하는가

(a) $X=-5$ (확률 $\frac12$, 1·2·3), $X=-2$ (확률 $\frac13$, 4·5), $X=w-5$ (확률 $\frac16$, 6).

(b) $E(X)=(-5)\left(\frac12\right)+(-2)\left(\frac13\right)+(w-5)\left(\frac16\right)=0$. 양변에 $6$을 곱하면 $-15-4+(w-5)=0\Rightarrow w=24$.

4어디로 확장되는가

"게임이 공정하다 = 기댓값이 0"이라는 이 번역은 보험료 산정, 도박의 기댓값 문제, 그리고 연속확률변수의 기댓값을 이용한 공정성 판단 문제에서 똑같은 방식으로 등장합니다.

PS-DRV Standard 8 marks

Variance and a Linear Transformation

The random variable $X$ has probability distribution given by $P(X=1)=0.2$, $P(X=2)=0.5$, $P(X=3)=0.3$.

(a)  Find $E(X)$ and $\text{Var}(X)$. [5]

(b)  Find $E(3X-2)$ and $\text{Var}(3X-2)$. [3]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(b)에서 $\text{Var}(3X-2)$를 구할 때 $-2$까지 제곱해서 $9\text{Var}(X)-4$처럼 계산해버립니다.

2왜 막히는가

분산은 "퍼진 정도"를 재는 값이라, 전체를 평행이동(상수를 더하기)해도 퍼진 정도 자체는 변하지 않는다는 걸 모르기 때문입니다. 상수항은 분산에 전혀 영향을 주지 않습니다.

3어떻게 복구하는가

(a) $E(X)=1(0.2)+2(0.5)+3(0.3)=2.1$. $E(X^2)=1(0.2)+4(0.5)+9(0.3)=4.9$. $\text{Var}(X)=4.9-2.1^2=0.49$.

(b) $E(3X-2)=3(2.1)-2=4.3$. $\text{Var}(3X-2)=3^2\text{Var}(X)=9(0.49)=4.41$ (상수 $-2$는 분산에 영향 없음).

4어디로 확장되는가

"기댓값은 상수도 그대로 따라가지만 분산은 곱셈 계수만 제곱으로 반영된다"는 이 규칙은 표준화 변환 $Z=\dfrac{X-\mu}{\sigma}$(PS-NRM)가 왜 평균 0, 분산 1을 만드는지 설명하는 바로 그 원리입니다.

PS-DRV Standard 9 marks

The Binomial Distribution

A biased coin has probability $0.3$ of landing on heads. The coin is tossed 8 times, and $X$ is the number of heads obtained.

(a)  State the distribution of $X$, including its parameters. [2]

(b)  Find $P(X=3)$. [3]

(c)  Find $P(X\ge2)$. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(c)에서 $X=2,3,\ldots,8$의 확률을 전부 하나씩 계산해서 더하려다 시간을 크게 낭비합니다.

2왜 막히는가

여사건을 쓰면 단 두 항($X=0,1$)만 계산하면 된다는 걸 확률분포 문제에도 적용할 수 있다는 걸 놓치기 때문입니다. "적어도"라는 말이 여사건 신호라는 감각이 아직 부족합니다.

3어떻게 복구하는가

(a) $X\sim B(8,0.3)$.

(b) $P(X=3)=\binom83(0.3)^3(0.7)^5\approx0.254$.

(c) $P(X\ge2)=1-P(X=0)-P(X=1)=1-(0.7)^8-8(0.3)(0.7)^7\approx1-0.0576-0.1977\approx0.745$.

4어디로 확장되는가

"적어도"를 여사건으로 뒤집는 전략은 PS-PRB의 독립시행 문제에서 이미 봤고, 여기서 이항분포라는 구체적인 분포에 적용됩니다. 정규분포로 근사하는 문제(대표본)에서도 같은 발상이 이어집니다.

PS-CRV Advanced 8 marks

Normalising a Probability Density Function

The continuous random variable $X$ has probability density function $f(x)=kx(4-x)$ for $0\le x\le4$, and $f(x)=0$ otherwise.

(a)  Find the value of $k$. [4]

(b)  Find $P(1\le X\le3)$. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(a)에서 $k$를 구하는 조건이 이산확률변수처럼 "확률의 합이 1"이 아니라 "적분값이 1"이라는 걸 떠올리지 못해 멈춥니다.

2왜 막히는가

이산확률변수에서 익힌 "$\sum P=1$" 감각을 연속확률변수로 그대로 옮기려 하기 때문입니다. 연속에서는 합이 적분으로 바뀝니다: $\int f(x)\,dx=1$.

3어떻게 복구하는가

(a) $\displaystyle\int_0^4kx(4-x)\,dx=k\left[2x^2-\dfrac{x^3}3\right]_0^4=k\cdot\dfrac{32}3=1\Rightarrow k=\dfrac3{32}$.

(b) $\displaystyle\int_1^3\dfrac3{32}(4x-x^2)\,dx=\dfrac3{32}\left[2x^2-\dfrac{x^3}3\right]_1^3=\dfrac3{32}\left(9-\dfrac53\right)=\dfrac{11}{16}$.

4어디로 확장되는가

"합이 적분으로 바뀐다"는 이 번역은 연속확률변수의 기댓값·중앙값을 구하는 모든 문제, 그리고 Calculus에서 넓이·부피를 적분으로 구하는 문제와 정확히 같은 사고 전환입니다.

PS-CRV Advanced 6 marks

Finding the Median of a Continuous Distribution

The continuous random variable $Y$ has probability density function $f(y)=\dfrac18y$ for $0\le y\le4$, and $f(y)=0$ otherwise.

Find the median of $Y$. [6]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

중앙값을 정의역의 중점인 $y=2$로 그냥 답해버립니다.

2왜 막히는가

이 분포는 균등분포가 아니라 $y$가 커질수록 밀도가 높아지는 분포라서, "구간의 중점"과 "확률을 반으로 나누는 점"이 다르다는 걸 놓치기 때문입니다.

3어떻게 복구하는가

중앙값 $m$은 $\displaystyle\int_0^m\dfrac y8\,dy=0.5$를 만족합니다. $\left[\dfrac{y^2}{16}\right]_0^m=\dfrac{m^2}{16}=0.5\Rightarrow m^2=8\Rightarrow m=2\sqrt2\approx2.83$.

4어디로 확장되는가

확률을 정확히 반으로 나누는 점을 적분방정식으로 찾는 이 절차는 사분위수를 구하는 문제, 그리고 지수분포·정규분포 같은 다른 연속분포에서 특정 백분위수를 찾는 문제에서 형태만 바뀌어 반복됩니다.

PS-CRV Standard 6 marks

Using Symmetry to Skip a Calculation

The continuous random variable $X$ has probability density function $f(x)=\dfrac32x^2$ for $-1\le x\le1$, and $f(x)=0$ otherwise.

(a)  Show that $f$ is a valid probability density function. [3]

(b)  Find $E(X)$. [3]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(b)에서 $\displaystyle\int_{-1}^1x\cdot\dfrac32x^2\,dx$를 처음부터 끝까지 계산하다가, 부호 실수로 $0$이 아닌 값을 답으로 냅니다.

2왜 막히는가

피적분함수 $x\cdot\frac32x^2=\frac32x^3$이 기함수(odd function)이고, 그 적분 구간이 원점에 대해 대칭이라는 걸 알아채면 계산 없이 답이 $0$임을 바로 알 수 있는데, 이 지름길을 모르기 때문입니다.

3어떻게 복구하는가

(a) $\displaystyle\int_{-1}^1\dfrac32x^2\,dx=\dfrac32\left[\dfrac{x^3}3\right]_{-1}^1=\dfrac32\cdot\dfrac23=1$이고 $f(x)\ge0$이므로 유효한 pdf입니다.

(b) $\dfrac32x^3$은 기함수이고 적분 구간 $[-1,1]$이 원점 대칭이므로, 대칭인 양의 부분과 음의 부분이 정확히 상쇄되어 $E(X)=0$입니다.

4어디로 확장되는가

기함수·우함수의 대칭성으로 적분 계산을 생략하는 이 지름길은 Calculus의 정적분 문제, 그리고 표준정규분포가 대칭이라서 $E(Z)=0$이 성립하는 이유를 설명하는 것과 정확히 같은 원리입니다.

PS-NRM Standard 6 marks

Normal Probabilities, Both Directions

The heights of adult males in a certain population are normally distributed with mean 175 cm and standard deviation 7 cm.

(a)  Find the probability that a randomly selected male is taller than 185 cm. [3]

(b)  Find the height that is exceeded by 10% of the population. [3]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(b)에서 (a)와 똑같이 정규분포 확률을 "구하는" 방향으로 계산기를 쓰려다, GDC에 넣을 수 있는 형태가 아니라는 걸 깨닫고 멈춥니다.

2왜 막히는가

(a)는 "값 → 확률"(정방향, normalcdf류), (b)는 "확률 → 값"(역방향, invNorm류)이라는, GDC에서 완전히 다른 기능을 써야 한다는 걸 구분하지 못하기 때문입니다.

3어떻게 복구하는가

(a) $Z=\dfrac{185-175}7\approx1.43$. $P(X>185)\approx0.0766$.

(b) 상위 10%이므로 $P(X

h≈184 10%

4어디로 확장되는가

정방향·역방향 계산기 기능을 구분하는 이 감각은 이항분포·포아송분포의 역산 문제, 그리고 신뢰구간을 구하는 통계 추론 문제(더 상위 과정)에서 동일하게 요구됩니다.

PS-NRM Advanced 6 marks

Solving for an Unknown Mean

The random variable $X$ is normally distributed with mean $\mu$ and standard deviation $5$. It is known that $P(X>40)=0.2$.

Find the value of $\mu$. [6]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

정규분포 문제인데 미지수가 확률이나 $x$값이 아니라 평균 $\mu$ 자체라는 걸 보고, 어떤 GDC 기능을 써야 할지 몰라 멈춥니다.

2왜 막히는가

$\mu$가 미지수여도 표준화 공식 $Z=\dfrac{X-\mu}{\sigma}$은 여전히 성립하고, 이걸 $\mu$에 대한 방정식으로 풀 수 있다는 연결을 못 하기 때문입니다.

3어떻게 복구하는가

$P(X>40)=0.2$이므로 대응하는 $z$값은 $z=\text{invNorm}(0.8)\approx0.8416$. 표준화 공식에서 $\dfrac{40-\mu}5=0.8416\Rightarrow40-\mu=4.208\Rightarrow\mu\approx35.8$.

4어디로 확장되는가

표준화 공식을 $\mu$나 $\sigma$에 대한 방정식으로 뒤집어 푸는 이 기술은 품질관리에서 규격을 벗어나는 비율을 목표치로 맞추기 위해 공정 평균을 조정하는 실제 응용 문제로 그대로 이어집니다.

PS-NRM Standard 7 marks

A Normal Model in Context

The times taken by students to complete a test are normally distributed with mean 45 minutes and standard deviation 8 minutes.

(a)  Find the probability that a randomly selected student completes the test in less than 38 minutes. [3]

(b)  Given that 15% of students take longer than $t$ minutes to complete the test, find the value of $t$. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(b)에서 "15%가 더 걸린다"는 조건을 $P(X

2왜 막히는가

"더 걸린다"는 "초과"를 의미하는데, 이걸 자동으로 "이하"의 확률로 바꿔 쓰는 실수입니다. 문장을 부등호로 정확히 번역하는 단계를 건너뛰기 때문입니다.

3어떻게 복구하는가

(a) $Z=\dfrac{38-45}8=-0.875$. $P(X<38)\approx0.191$.

(b) "$t$분보다 오래 걸리는 학생이 15%" $\Rightarrow P(X>t)=0.15\Rightarrow P(X

4어디로 확장되는가

문장 속 "이상/이하/초과/미만"을 정확한 부등호로 번역하는 이 훈련은 모든 확률 문제의 출발점이고, 특히 이산확률변수에서 "적어도"·"많아야"를 부등식으로 옮기는 문제에서 계속 반복됩니다.

PS-BIV Standard 6 marks

Calculating the Correlation Coefficient

For a sample of 10 data pairs $(x,y)$: $\sum x=150$, $\sum y=220$, $\sum x^2=2400$, $\sum y^2=5100$, $\sum xy=3450$.

(a)  Calculate the product-moment correlation coefficient $r$. [5]

(b)  Comment on the correlation between $x$ and $y$. [1]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

공식에 있는 $n\sum xy$와 $(\sum x)(\sum y)$를 혼동해서, $\sum x\sum y$ 대신 $\sum(xy)$를 또 쓰는 식으로 항을 중복 사용합니다.

2왜 막히는가

공식이 길어서 각 기호가 정확히 무엇을 가리키는지(합산 기호의 위치) 놓치고 기계적으로 숫자만 대입하기 때문입니다.

3어떻게 복구하는가

$r=\dfrac{n\sum xy-\sum x\sum y}{\sqrt{[n\sum x^2-(\sum x)^2][n\sum y^2-(\sum y)^2]}}$. 분자 $=10(3450)-150(220)=34500-33000=1500$. 분모 안: $[10(2400)-150^2][10(5100)-220^2]=[1500][2600]=3{,}900{,}000$. $r=\dfrac{1500}{\sqrt{3{,}900{,}000}}\approx0.760$.

(b) $r\approx0.76$은 $x$와 $y$ 사이에 꽤 강한 양의 선형 상관관계가 있음을 나타냅니다.

4어디로 확장되는가

공식의 각 기호를 정확히 추적하는 이 꼼꼼함은 분산·표준편차의 계산 공식(요약통계에서), 그리고 카이제곱 검정통계량(더 상위 과정)을 계산하는 문제로 이어집니다.

PS-BIV Standard 4 marks

Prediction and the Danger of Extrapolation

The regression line of $y$ on $x$ for a set of data is given by $y=2.5x+12$. The data values of $x$ range from 10 to 50.

(a)  Use the regression line to estimate the value of $y$ when $x=30$. [2]

(b)  Explain why it would not be appropriate to use this regression line to estimate the value of $y$ when $x=100$. [2]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

(b)에서도 그냥 $x=100$을 대입해서 $y$값을 계산해버리고, "왜 부적절한지"를 설명하라는 지시를 놓칩니다.

2왜 막히는가

회귀직선이 원래 데이터가 관찰된 범위 안에서만 신뢰할 수 있다는 걸 모르고, 수식으로 대입만 하면 언제나 유효한 계산 도구라고 여기기 때문입니다.

3어떻게 복구하는가

(a) $y=2.5(30)+12=87$.

(b) $x=100$은 원래 데이터의 범위($10\sim50$)를 크게 벗어난 외삽(extrapolation)입니다. 그 범위 밖에서 선형 관계가 계속 유지된다는 보장이 없으므로 추정값을 신뢰할 수 없습니다.

4어디로 확장되는가

"모델이 유효한 범위"를 확인하는 이 습관은 함수 모델(FN-QUAD, FN-EXPLOG)의 실생활 응용 문제, 그리고 미분방정식으로 만든 성장 모델을 장기간 적용할 때의 한계를 논하는 Calculus 문제에서 똑같이 요구됩니다.

PS-DES Standard 6 marks

Finding an Unknown Frequency from the Mean

The table shows the distribution of the number of siblings for a group of students:

Number of siblings: $0,\ 1,\ 2,\ 3$   Frequency: $8,\ x,\ 10,\ 4$

Given that the mean number of siblings for this group is $1.2$, find the value of $x$. [6]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

도수의 합(분모)에도 $x$가 들어있다는 걸 잊고, 분모를 고정된 숫자로 놓은 채 방정식을 세워 틀린 답을 얻습니다.

2왜 막히는가

평균 공식 $\dfrac{\sum(\text{값}\times\text{도수})}{\sum\text{도수}}$에서 분모와 분자 모두에 미지수 $x$가 등장하는 걸 놓치고, 분자만 미지수라고 생각하기 때문입니다.

3어떻게 복구하는가

전체 인원 $=8+x+10+4=22+x$. 합 $=0(8)+1(x)+2(10)+3(4)=x+32$. 평균: $\dfrac{x+32}{22+x}=1.2\Rightarrow x+32=1.2(22+x)=26.4+1.2x\Rightarrow5.6=0.2x\Rightarrow x=28$.

4어디로 확장되는가

분모에도 미지수가 있는 방정식을 정리하는 이 감각은 이산확률변수의 확률 자체가 미지수인 문제, 그리고 가중평균이 낀 화학·물리 응용 문제에서 똑같이 요구됩니다.

PS-LIN Standard 4 marks

The Regression Line Passes Through the Mean Point

For a set of 8 data pairs, $\bar x=12$, $\bar y=45$, and the regression line of $y$ on $x$ has gradient $2.5$.

Find the equation of the regression line of $y$ on $x$ in the form $y=mx+c$. [4]

IB식 풀이 보기 4단계로 뜯어봅니다

1어디서 막히는가

기울기는 있는데 $y$절편을 구할 점이 없다고 생각해서 막힙니다. 평균값 $\bar x,\bar y$가 왜 주어졌는지 연결하지 못합니다.

2왜 막히는가

회귀직선이 항상 데이터의 평균점 $(\bar x,\bar y)$을 지난다는 핵심 성질을 모르기 때문입니다. 이 사실이 바로 "점 하나"를 제공합니다.

3어떻게 복구하는가

회귀직선은 $(\bar x,\bar y)=(12,45)$를 지나므로 $45=2.5(12)+c\Rightarrow45=30+c\Rightarrow c=15$. 직선: $y=2.5x+15$.

4어디로 확장되는가

"평균점을 지난다"는 이 성질은 $x$와 $y$ 두 회귀직선(y-on-x, x-on-y)이 서로 다른 직선이면서도 항상 한 점(평균점)에서 만난다는 사실, 그리고 상관계수 $r$과 두 회귀직선 기울기의 곱의 관계로 이어지는 더 깊은 통계 이론의 출발점입니다.