전체 글 · 게시일 2026-07-23

핸디 990이 TOEIC 점수를 추정하는 방법

호기심 많은 독자를 위한 기술 설명서입니다. 확률, 평균, 표준편차가 무엇인지 알고 있는 등 기본적인 확률과 통계 지식을 갖추고 있다고 가정하지만, 그 이상의 개념은 몰라도 괜찮습니다. 필요한 나머지 내용은 기초부터 차근차근 설명합니다.

해결하고자 하는 문제

연습 문제를 풀 때마다 여러분은 앱에 정답 또는 오답이라는 1비트의 정보를 제공하게 됩니다. TOEIC의 7개 파트에 걸쳐 쌓인 1과 0의 긴 데이터 스트림으로부터, 우리는 여러분의 예상 점수(990점 만점)라는 하나의 숫자를 추정하고자 합니다. 그리고 우리는 이 숫자가 신뢰할 수 있고, 안정적이며, 스스로의 불확실성에 대해 정직하기를 바랍니다.

이 작업은 보기보다 까다로우며, 그 이유는 네 가지가 있습니다:

  1. 응답 데이터에는 노이즈가 존재합니다. 실력이 일정하더라도 순전히 우연에 의해 연달아 맞히거나 틀릴 수 있습니다. 좋은 추정 모델이라면 한두 번 실수했다고 해서 점수가 크게 요동쳐서는 안 됩니다.
  2. 여러분의 실력은 계속 변합니다. 여러분은 공부를 하고 있으니까요. 3주 전의 풀이 기록은 오늘의 기록보다 가치가 떨어집니다. 모든 데이터에 동일한 가중치를 부여하는 추정 방식은 실력 향상을 제대로 반영하지 못합니다.
  3. 콜드 스타트(Cold start) 문제. 겨우 3문제를 풀었을 때도 무언가 결과를 보여주어야 하지만, 3문제가 300문제만큼의 정보를 준다고 과장해서는 안 됩니다.
  4. 우리가 무엇을 모르는지 스스로 알아야 합니다. "리딩 320점"이라는 표현과 "리딩 320점이지만 아직 불확실성이 큼"이라는 표현은 완전히 다릅니다. 앱은 이 둘을 명확히 구분할 수 있어야 합니다.

이 글에서는 핸디 990이 사용하는 방식인 감쇠 베타-베르누이 사후 분포(decayed Beta–Bernoulli posterior) 모델이 위의 네 가지 문제를 어떻게 동시에 해결하는지, 그리고 왜 더 직관적인 대안들 대신 이 방식을 선택했는지 설명합니다.


초기 시도들과 한계점

단순 누적 평균

가장 단순한 아이디어는 각 파트별로 (맞힌 문제 수) / (푼 문제 수)를 기록하는 것입니다.

이 방식은 편향이 없고 극도로 단순하지만, 기억 감쇠(memory decay)가 전혀 없습니다. 500문제를 푼 후에는 문제 하나를 더 풀어도 평균값에 거의 영향이 없습니다. 실력이 평생 변하지 않는다면 문제없겠지만, 실력이 변하는 상황에서는 쓸모가 없습니다. 3주 전에 정답률이 50%였고 오늘 75%가 된 학습자라면, 누적 평균이 그 중간 어디쯤에 아주 오랫동안 머물러 있는 것을 보게 될 것입니다. 또한 어제 푼 문제 하나와 풀 모의고사 한 회를 똑같이 취급합니다. 우리에게는 오래된 과거를 통제된 속도로 잊어버리는 알고리즘이 필요합니다.

고정 지수 이동 평균 (핸디 990이 이전에 사용했던 방식)

고전적인 해결책은 지수 이동 평균(exponential moving average, EMA)입니다. 추정치 m이라는 하나의 숫자를 유지하면서, 문제를 풀 때마다 최신 결과 방향으로 추정치를 조금씩 이동시킵니다:

mα·(100 if correct, else 0)+(1α)m,α=0.1

새로운 응답마다 10%의 가중치를 주고, 과거 전체 기록에는 90%의 가중치를 둡니다. 이 방식은 과거를 잊기는 합니다. 실질 기억 범위는 대략 최근 1/α ≈ 10–20개 문제에 해당하며, 이것이 핸디 990이 처음에 사용했던 방식입니다. 그러나 여기에는 세 가지 치명적인 결함이 있습니다:

  • 학습률이 절대 변하지 않습니다. 3번째 문제를 풀 때도, 3,000번째 문제를 풀 때도 α = 0.1로 동일합니다. 초반에는 학습 속도가 너무 느리고(가장 귀한 데이터의 90%를 버리는 셈입니다), 후반에는 영구적인 노이즈의 원인이 됩니다.
  • 수렴하지 않고 영원히 요동칩니다. 매 응답마다 고정된 비율만큼 추정치가 이동하므로, 실제 실력이 완전히 일정하더라도 추정치는 계속해서 미세하게 덜컹거립니다. 실제 정답률이 50%인 파트의 경우, 고정 α EMA의 장기 표준편차는 대략 다음과 같습니다:
sdα2α·p(1p)·100±11 percentage points, forever.

이것을 각 파트에 적용해 영역별 점수로 환산하면, 학습 성과가 아니라 순전한 운에 의해 990점 산출 스케일상에서 수십 점씩 흔들리는 결과로 이어집니다. - 신뢰도 개념이 없습니다. m은 단순한 숫자일 뿐입니다. 이 숫자가 3개의 응답에 기반한 것인지 3,000개의 응답에 기반한 것인지 알 수 없기 때문에, 정직한 오차 범위를 보여줄 수 없고 데이터가 부족할 때 과도하게 반응하는 것을 막을 수 없습니다.

우리는 이러한 세 가지 단점 없이 EMA의 장점(제한된 기억 범위)만을 취하고자 합니다. 이를 달성하는 방법은 단일 숫자를 추적하는 것을 그만두고 분포(distribution)를 추적하기 시작하는 것입니다.


베이지안 아이디어: 단일 점이 아닌 신념(Belief)을 추적하기

특정 파트에서의 여러분의 정답률을 미지의 확률 p(해당 유형의 임의 문제를 맞힐 확률)라고 생각해 봅시다. 각 응답은 확률 p로 "정답"이 나오는 동전 던지기, 즉 베르누이 시행(Bernoulli trial)입니다. 우리는 p를 모르며, 동전 던지기 결과들로부터 p를 알아내고자 합니다.

베이지안 방식의 핵심은 p에 대해 단 하나의 추정값만 고수하는 대신, p가 될 수 있는 값들에 대한 전체 확률 분포(우리의 신념, belief)를 유지하고, 새로운 증거가 들어올 때마다 그 신념을 갱신(update)하는 것입니다. 데이터가 적을 때는 신념 분포가 넓게 퍼져 있고(불확실함), 데이터가 쌓일수록 실제값 주변으로 좁게 집중됩니다(확신함). 이 분포의 넓이가 바로 EMA에는 없었던 신뢰도 정보입니다.

베타 분포

0과 1 사이의 값을 갖는 확률 p에 대해, 이러한 신념을 표현하기에 가장 자연스러운 형태는 Beta(a, b)로 표기되는 베타 분포(Beta distribution)입니다. 이 분포의 두 매개변수를 가상 횟수(pseudo-counts)로 이해할 수 있습니다:

  • a는 정답을 맞힌 횟수의 누적 카운트처럼 작동하고,
  • b는 오답을 낸 횟수의 누적 카운트처럼 작동합니다.

베타 분포는 이 문제에 적용하기에 완벽한 두 가지 특성을 가지고 있습니다:

1. 평균값이 우리가 직관적으로 기대하는 값과 정확히 일치합니다:

estimated accuracy=mean[Beta(a,b)]=aa+b

실제 집계 대신 가상 횟수를 사용했을 뿐, 본질적으로 "전체 푼 문제 중 정답 비율"과 같습니다.

2. 갱신 과정이 매우 간단합니다. 베타 분포는 베르누이 시행에 대한 켤레 사전 분포(conjugate prior)입니다. 이는 수학적인 행운 덕분에 갱신 규칙이 동일한 분포 족(family) 내에 유지됨을 의미합니다. 정답을 맞히면 새로운 신념은 단순히 Beta(a+1, b)가 되고, 오답을 내면 Beta(a, b+1)이 됩니다. 적분이나 근사 계산이 전혀 필요 없이, 단순히 카운터에 1을 더하기만 하면 됩니다. 이것이 전체 알고리즘이 응답당 약간의 덧셈/곱셈 연산만으로 작동하며 사용자의 기기 내에서 완전히 수행될 수 있는 이유입니다.

시작점 (사전 분포)

문제를 하나도 풀지 않은 초기 상태에서는 Beta(3, 3)에서 시작합니다. 이 분포의 평균은 3/6 = 50%로 중립적인 초기 추정값이며, 총합 a + b = 6은 의도적으로 작게 설정되어 "50%로 추정하지만 확신은 약하므로, 실제 데이터가 들어오면 빠르게 이동한다"라는 의미를 담고 있습니다. 문제를 몇 개만 풀어도 여러분이 기여한 가상 횟수가 초기 사전 분포를 압도하며, 50%라는 초기 가정은 자연스럽게 희미해집니다.

신뢰도(오차 범위)를 자동으로 얻게 됩니다

전체 분포를 유지하기 때문에 추가적인 계산 복잡도 없이 분산(variance)을 바로 얻을 수 있습니다. 베타 분포의 분산은 다음과 같습니다:

Var(mean)=m(1m)N+1,m=aa+b,N=a+b

이 식이 의미하는 바를 살펴보세요: 분자 m(1−m)은 일반적인 동전 던지기의 분산이고, 분모는 전체 증거 수인 N에 비례하여 커집니다. 응답 수 증가 ⇒ 분산 감소 ⇒ 더 정밀한 추정. 앱은 이 분산의 제곱근(표준편차)을 계산하여 점수 옆에 표시되는 "±" 오차 범위로 변환합니다. 연습을 거듭할수록 이 범위는 줄어들며, 이는 통계적으로 정직할 뿐만 아니라 학습 동기를 부여하는 요소가 됩니다.


"감쇠(Decayed)" 요소: 통제된 속도로 잊기

순수한 베이지안 갱신 방식은 누적 평균의 문제를 그대로 답습합니다. 즉, 과거를 결코 잊지 않는다는 점입니다. 500개의 응답이 쌓이면 N = 506이 되어 새로운 응답의 영향력이 거의 없어지므로, 실력이 향상되는 학습자에게는 적합하지 않습니다.

해결책은 코드 한 줄입니다. 각 새로운 응답을 반영하기 전에, 기존의 가상 횟수에 1보다 약간 작은 감쇠 인자 ρ를 곱해 살짝 줄여주는 것입니다. 각 응답에 대해(정답이면 x = 1, 오답이면 0):

{aρa+xbρb+(1x)ρ=1140=0.975

매 단계마다 ab를 조금씩 줄여줌으로써 전체 증거 수의 무한한 증가를 방지합니다. 총 증거 수는 일정한 상한선에 수렴하게 됩니다:

steady-state total evidenceN*=11ρ=40 answers.

따라서 수천 문제를 풀더라도 각 파트는 가장 최근 응답에 매끄럽게 가중치를 두면서 최근 40개 문제 정도만을 기억하는 것처럼 작동합니다. 이것이 우리가 EMA에서 가져오고자 했던 "제한된 기억 범위"이며, 여기에 두 가지 추가적인 이점이 더해집니다.

보너스 1: 학습률이 스스로 적응합니다

가장 우아한 부분이 바로 이것입니다. 단 하나의 응답에 의해 평균값이 얼마나 이동하는지 계산해 봅시다. 응답 전 증거 수를 N = a + b, 응답 직후 증거 수를 N′ = ρN + 1로 적고 대수학을 몇 줄 정리하면 다음과 같이 간단해집니다:

mnew=m+xmN

이것은 정확히 EMA의 형태입니다. 하지만 보폭(step size)에 해당하는 1/N′고정되어 있지 않습니다. N이 작을 때(막 시작했을 때)는 N′도 작아서 — 아주 첫 번째 응답에서는 약 7이 되므로 보폭이 약 1/7 ≈ 0.15가 되어 추정치가 귀중한 데이터를 적극적으로 반영하며 빠르게 이동합니다. N이 상한선에 다다르면 N′은 40으로 안정되고, 보폭은 1/40 = 0.025로 정착하면서 추정치가 차분하고 안정적으로 변합니다. 다시 말해:

감쇠 베타 사후 분포(decayed Beta posterior)는 본질적으로 지수 이동 평균(EMA)입니다. 다만 학습률이 높은 상태에서 시작하여 스스로 낮은 값으로 담금질(anneal)되고, 증거 카운터를 내장하고 있어 얼마나 확신할 수 있는지를 항상 스스로 파악하는 지수 이동 평균입니다.

고정 EMA는 이러한 적응성을 버린 특수한 경우에 불과합니다.

보너스 2: 노이즈가 절반으로 줄어들고 수렴합니다

수렴된 학습률(≈ 0.025)이 기존의 고정된 α = 0.1보다 훨씬 작기 때문에, 장기적인 덜컹거림(jitter)의 표준편차가 절반 수준(분산 기준 약 1/4)으로 줄어듭니다. 추정치가 순전한 운에 의해 요동치는 현상이 사라지므로, 트렌드 차트와 "이번 세션 획득 점수" 지표가 단순 노이즈가 아닌 실제 실력 변화를 반영하게 됩니다. 그러면서도 감쇠 메커니즘 덕분에 결코 동결되지 않으며, 거짓 정밀도(false precision) 없이 진정한 실력 향상을 정확히 반영해 냅니다.


"모든 증거의 가치가 같지는 않다"라는 두 가지 관점

이 시스템 구조는 단순한 EMA로는 표현할 방법이 없어 담아낼 수 없었던 정교한 개선 사항들을 자연스럽게 흡수합니다.

경과 시간에 따른 에이징(Aging)

제한된 기억 범위는 응답 수를 카운트하지만, 중간에 문제를 전혀 풀지 않았더라도 2개월 동안 공부를 쉬었다면 신뢰도가 낮아져야 마땅합니다. 따라서 특정 파트의 연습이 1주일의 유예 기간을 지나 방치되면, 미활동 일수당 가상 횟수를 조금씩 줄입니다(하루에 0.99 배율 적용). 핵심은 ab동일한 배율로 줄인다는 점입니다. 이렇게 하면 평균값 a/(a+b)는 변하지 않지만 총합 N은 줄어듭니다. 그 결과 화면에 표시되는 점수는 그대로 유지되지만 ± 오차 범위가 넓어지며, 공부를 다시 시작했을 때 초기 몇 문제의 가중치가 높아집니다. "당신의 이전 위치를 잊지는 않았지만, 여전히 유효한지는 확신할 수 없다"라는 개념을 단 한 번의 곱셈 연산으로 표현한 것입니다.

개별 응답에 대한 가중치 부여

모든 응답이 동일한 양의 정보를 담고 있는 것은 아니므로, 각 응답을 반영할 때 가중치 w를 적용합니다(갱신 공식은 a ← ρa + w·x, b ← ρb + w·(1−x)가 됩니다):

  • 이전에 보았던 문제는 절반의 가중치(0.5)로 반영됩니다. 재출제된 문제를 맞히는 것은 실력보다는 기억력에 일부 의존하므로, 새로운 문제만큼 추정치를 크게 이동시켜서는 안 됩니다. 이는 또한 미묘한 편향을 상쇄합니다. 특정 카테고리의 문제를 모두 풀고 나면 앱이 이전에 틀렸던 문제를 다시 제공하기 시작하는데, 가중치 조정이 없다면 추정치가 부당하게 하락할 수 있기 때문입니다.
  • 응답의 출처(환경)가 중요합니다. 실제 시험 환경(시간 제한이 있는 풀 모의고사)에서의 응답은 가벼운 연습 문제보다 가치가 높으므로 더 높은 가중치(최대 2배)로 반영됩니다. 약 40개 문제라는 기억 상한선 하에서, 완출된 모의고사는 다음 날 바로 희석되어 사라지는 대신 해당 파트의 최근 증거 데이터로서 지배적인 비중을 차지하게 됩니다.
  • 실제 제출된 정기 시험 점수(사용자가 입력한 경우)는 해당 정답률에 맞춰 약 25개 응답에 해당하는 강력한 사전 분포(prior) 신념으로 반영됩니다. 따라서 이후에 연습 문제를 한두 개 풀었다고 해서 이 기록이 사라지지는 않지만, 수십 문제를 풀다 보면 결국 자연스럽게 대체됩니다.

이 중 어느 것도 새로운 시스템 구조를 필요로 하지 않았습니다. 단지 가중치 w와 두 개의 카운터만으로 구현되었습니다. 이러한 유연성은 불투명한 단일 숫자 대신 "증거의 양"이라는 명시적 개념을 갖춘 모델을 선택한 직관적인 결과입니다.


파트별 신념을 990점 점수로 변환하기

10개의 문제 카테고리는 각각 독립된 감쇠 베타 사후 분포를 유지합니다. 이를 영역별 점수로 변환하기 위해, 실제 시험에 출제되는 각 카테고리별 문항 수(영역당 총 100문항)를 각 카테고리의 평균값에 가중치로 곱하여 100문항 만점 기준의 예상 정답 수를 계산합니다. 이 예상 정답 수는 공식 TOEIC 정답 수 → 환산 점수 변환표를 거쳐 5~495점의 영역별 점수가 되며, 두 영역의 점수를 더해 최종 990점 만점의 예상 점수가 산출됩니다.

불확실성(오차) 역시 동일한 경로를 거쳐 전파됩니다. 각 카테고리가 독립적이므로, 카테고리별 분산은 시험 문항 수의 제곱으로 가중되어 직교합(add in quadrature) 방식으로 더해지며, 이렇게 합성된 표준오차가 영역 및 총점의 ± 오차 범위가 됩니다.

리딩 영역 특화 현실 검증(Reality Check)

TOEIC 리딩은 속도전입니다. 75분 동안 100문제를 풀어야 하므로 1문제당 평균 45초가 주어지며, 시간을 늘릴 방법은 없습니다. 따라서 시간 제한이 없는 연습에서의 정답률은 풀이가 느린 학습자에게 과도하게 넉넉한 점수를 주게 됩니다. 실제 시험 제한 시간 내에서는 마지막 문제들에 도달조차 하지 못하며, 풀지 못한 문제는 연습 시 정답률이 아니라 찍기 확률인 25%(4지 선다 중 1개)로 계산되기 때문입니다.

그래서 앱은 간단한 시뮬레이션을 실행합니다. 각 리딩 파트에서 측정된 문제당 풀이 속도를 바탕으로, 실제 시험 순서(Part 5 → Part 6 → Part 7)대로 75분의 시간을 "소진"시키며, 시간이 부족하여 도달하지 못할 문제들에 대해서는 실제 정답률 대신 0.25점의 정답률을 부여합니다.

구체적인 예를 들어보겠습니다. 여러분의 풀이 속도가 Part 5에서 문제당 30초, Part 6에서 45초, Part 7에서 80초라고 가정해 봅시다. Part 5와 Part 6(30문항 + 16문항)을 푸는 데 30×30 + 16×45 = 1,620초가 소요되어 Part 7에는 2,880초가 남습니다. 문제당 80초가 걸린다면 Part 7의 54문항 중 약 36문항만 풀 수 있고, 나머지 18문항은 풀지 못하게 됩니다. 여러분의 Part 7 정답률이 70%인 경우, 이 18문항의 정답률은 각각 0.70에서 0.25로 떨어지며, 약 0.45 × 18 ≈ 8점의 원점수 손실(환산 리딩 점수 기준 대략 30~40점 감점)이 발생합니다. 풀이 속도가 빨라질수록 실제 정답률로 풀 수 있는 문항 수가 늘어나 페널티가 줄어들며, 여유로운 속도에 도달하면 페널티는 완전히 사라집니다.

이처럼 풀이 속도로 인해 점수 손실이 예상될 때, 앱은 "시험 페이스 기준" 지표를 별도로 명시하여 보여줍니다. 리딩은 단지 맞히는 것뿐만 아니라 속도도 중요하다는 점을 상기시켜 주기 위함입니다. (리스닝은 기계적으로 재생 속도가 정해지므로 이러한 조정이 필요 없습니다.)


다른 대안들보다 우수한 이유

우리는 일반적인 후보 모델들을 다각도로 검토했습니다. 다음은 이에 대한 솔직한 비교입니다.

접근 방식 제공하는 기능 이 방식에 머무르지 않은 이유
단순 누적 평균 편향 없음, 매우 단순함 과거를 잊지 못함; 실력 향상을 추적할 수 없음; 모든 응답을 동일하게 취급함
고정-α EMA 제한된 기억 범위, 적은 연산량 고정된 학습률; 영구적인 요동(jitter); 불확실성 표시 불가; 가중치를 적용할 공간이 없음
감쇠 베타 사후 분포 (핸디 990 적용) 적응형 학습률, 제한된 기억 범위, 내장된 신뢰도, 자연스러운 가중치 반영
문항 반응 이론(Item-Response Theory, IRT) 능력 측정의 "골드 표준" 모델 각 문항의 난이도를 수천 명의 응답자 데이터로 보정(calibration)해야 함 — 기기 내 단독 실행 환경에서는 불가능한 데이터
엘로 / 글릭코(Elo / Glicko) 레이팅 우아함, 적응형 마찬가지로 신뢰할 수 있는 문항별 "상대" 난이도가 필요함; 불확실성 관리 방식이 당사의 감쇠 메커니즘과 중복됨
칼만 필터(Kalman filter) 불확실성을 포함하여 변화하는 양을 추적 이분법(맞춤/틀림) 데이터에서는 본질적으로 당사 모델로 귀결되나 우도 함수가 더 어색함; 베타 분포 형태가 가장 자연스러운 조합임

결정적인 차이점은 다음과 같습니다. 더 "정교한" 두 가지 모델인 IRT와 Elo는 모든 역량을 문항별 난이도 파라미터에 집중하며, 이를 신뢰성 있게 추정하려면 동일한 문항을 푼 거대한 응답자 풀이 필요합니다. 핸디 990은 어떠한 중앙 집계 통계도 없이 사용자의 기기 내에서 비공개로 실행됩니다. 이러한 모델에 미보정된 난이도 라벨을 입력한다면 불안정한 입력값 위에 올라앉은 복잡한 기계 장치에 불과할 것입니다.

반면, 사용자가 실제로 체감하는 문제들 — 점수의 요동, 과거 기록의 망각, 오차 범위의 부재, 모의고사와 가벼운 풀이의 동일 취급 등 — 은 문항 난이도가 아니라 갱신 규칙(update rule)에 존재합니다. 감쇠 베타 사후 분포는 이 모든 문제를 동시에 해결하는 가장 간결하고 원칙적인 모델입니다:

  • 진정한 베이지안(Bayesian) 방식이므로, 추정치와 불확실성이 억지로 덧붙여진 것이 아니라 동일한 명확한 규칙에서 도출됩니다.
  • 적응형 이득(adaptive-gain) EMA이므로, 초반에는 빠르게 반응하고 이후 안정화되며 결코 동결되지 않습니다.
  • 켤레(conjugate) 특성을 가지므로, 매 갱신 연산이 몇 번의 덧셈과 곱셈으로 끝나며 빠르고 정확하게 오프라인에서 동작합니다.
  • 명시적인 증거 카운트를 유지하므로 최신성, 반복 풀이, 출처 환경에 따른 가중치 부여가 자연스럽게 적용됩니다.

한마디로, 우리가 확보한 실제 데이터 수준에 가장 적합한 최적의 통계 모델입니다.


정직하게 밝히는 한계점

  • 이 기능은 학습 보조 도구일 뿐, 공식 점수가 아닙니다. 실제 TOEIC은 보안 처리된 문항들에 IRT 스케일링을 적용하며, 앱에서는 연습 데이터를 바탕으로 이를 추정할 뿐입니다.
  • 상수들은 합리적 추론에 의해 설정되었으며 데이터 맞춤(fitting) 결과가 아닙니다. 기억 상한선(~40), 사전 분포 강도, 감쇠율, 응답 가중치는 수많은 보정 데이터셋으로 튜닝된 값이 아니라 합리적인 기본값들입니다. 사용자가 실제 정기 시험 점수를 입력하면, 향후 이러한 상수들을 더욱 정교화할 수 있도록 추정치와 실제 점수 사이의 오차를 (비공개로) 기록합니다.
  • 데이터가 적으면 추정도 거칠어집니다. 초반에는 대부분의 파트가 50% 사전 분포에 머물러 있어 초기 추정치가 거칠 수밖에 없습니다. 이것이 바로 앱이 더 많은 데이터를 얻기 전까지 넓은 ± 오차 범위를 보여주는 이유입니다.

우리가 모든 변수를 담아내지는 못했으며, 우리 역시 이 점을 잘 알고 있습니다. 위에 언급된 요소들은 연습 기록을 통해 모델링할 수 있었던 것들입니다(최신성, 반복 여부, 시험 환경 가중치, 리딩 속도 등). 그러나 실제 시험은 이곳에서는 파악할 수 없는 수많은 요소들 — 시험 당일의 긴장감과 피로도, 당일 배정받은 시험지 유형, 생소한 어휘나 문장 표현, 당사 문제 은행의 난이도와 실제 시험과의 일치도, 당일 찍기 운 등에 따라 결과가 달라집니다. 여러 요소를 고려했지만 모든 것을 담아내지는 못했으므로 추정치는 완벽히 정확할 수 없으며, 그렇게 의도되지도 않았습니다. 실제 TOEIC 시험을 치른 후 결과가 앱에서 보여준 예측과 크게 달랐다면(더 높든 더 낮든), 앱 내 피드백 기능을 통해 의견을 남겨주시면 감사하겠습니다. 점수에 어떤 요인이 영향을 주었는지 피드백해 주시면 놓친 요소들을 발굴하고 모든 사용자를 위한 추정 모델을 다듬는 데 큰 도움이 됩니다.

우리가 드릴 수 있는 정직한 약속은 다음과 같습니다. 더 많은 파트에서, 더 현실적인 조건으로, 더 많은 문제를 풀수록 추정치는 진짜 실력에 가까워지고 스스로 더 확실해졌음을 알려줄 것입니다. 이것이 바로 감쇠 베이지안 추정 모델이 제공하도록 설계된 핵심 가치입니다.


속편이 나왔습니다. 실제 성적표가 도착했을 때 이 추정 모델은 그것을 어떻게 활용할까요 — 그리고 대부분이 지나치는 ABILITIES MEASURED 능력 분석으로 무엇을 할 수 있을까요? TOEIC 성적표에는 점수만 있는 게 아닙니다를 읽어 보세요.

← 전체 글