전체 글 · 게시일 2026-08-28
토익 예상 점수 정확도: 수험생 4명이 보내온 실제 성적표와 데이터를 펼쳐놓고 따져보았습니다
8/16 시험의 토익 성적이 발표된 날, 수험생 4명이 실제 성적표를 보내왔습니다 — 핸디 990의 예상 점수가 실제 정기 시험을 상대로 본격적인 검증을 받은 것은 이번이 처음입니다. 결론부터 말씀드리면, 리스닝은 놀라울 정도로 정확했고(4명 중 2명은 오차가 단 5점에 불과했습니다), 리딩에는 제각기 이름이 붙을 만한 3가지 체계적 편향이 존재했으며, 4명의 점수 순위는 완벽하게 적중했습니다. 이 글에서는 4명의 일일 예상 점수 궤적과 4장의 실제 성적표를 나란히 펼쳐 대조해 보며, 더 본질적인 질문인 '예상 점수가 수렴한다는 것은 과연 무엇을 보장하는가?'에 대해 답해 봅니다.
핸디 990이 TOEIC 점수를 추정하는 방법의 말미에서 우리는 한 가지 약속을 했습니다. 이 점수 추정 모델은 스스로의 불확실성에 대해 솔직할 것이라는 점이었습니다. 당시에는 아무도 이를 검증할 수 없었기에 약속을 적기는 쉬웠습니다. 하지만 이제는 상황이 달라졌습니다 — 시험일이 지나면 앱에서 "시험은 잘 보셨나요?"라는 질문을 건네는데, 8/28 성적 발표 날 아침, 2시간 만에 실제 성적표 4장이 연달아 도착한 것입니다. 4명 모두 창립 회원이었고, 모두 8/16 시험에 응시했습니다. 표본은 4명뿐이며, 이 글은 처음부터 끝까지 이 한계를 잊지 않을 것입니다. 하지만 4명만으로도 어떤 패턴들은 숨길 수 없을 만큼 뚜렷하게 드러났습니다.
4장의 성적표, 하나의 표
'시험 전 예상 점수'는 각 수험생이 시험 전날 마지막으로 기록한 일일 예상 점수의 스냅샷입니다 — 즉, 시험장에 들어가기 직전 앱 화면에 떠 있던 바로 그 숫자입니다.
| 수험생 | 연습량 | 시험 전 예상(리스닝/리딩) | 실제 점수(리스닝/리딩) | 오차 |
|---|---|---|---|---|
| A | 1,477문제 | 540(310/230) | 495(315/180) | 45점 과대평가 |
| B | 731문제 | 685(395/290) | 760(400/360) | 75점 과소평가 |
| C | 307문제 | 795(395/400) | 855(430/425) | 60점 과소평가 |
| D | 2,697문제 | 815(460/355) | 895(495/400) | 80점 과소평가 |
먼저 전체적인 결과부터 살펴보겠습니다. 총점의 평균 절대 오차는 65점(990점 만점 기준)이었으며, 4명 모두 오차 80점 이내에 들어왔습니다. 그리고 4명의 순위 — 누가 점수가 더 높고 낮은지, 그리고 대략 얼마나 높은지의 순서 — 는 완벽하게 일치했습니다. 4명의 순위를 무작위 추측으로 맞힐 확률은 1/24에 불과합니다. 이것 하나로 샴페인을 터뜨릴 생각은 없지만, 적어도 예상 점수가 '상대적 위치'를 정확하게 측정했음을 보여줍니다. 그리고 상대적 위치야말로 "목표까지 얼마나 남았는가?"라는 질문에 답하기 위해 진정으로 필요한 정보입니다.
진짜 흥미로운 이야기는 총점을 영역별로 분해했을 때 시작됩니다.
리스닝은 왜 오차가 5점에 불과할 정도로 정확했을까?
4명의 리스닝 오차는 각각 +5, +5, +35, +35점으로 — 평균 절대 오차는 20점이었습니다. 비교하자면, ETS 자체의 《TOEIC Listening and Reading Score User Guide》에 명시된 바에 따르면 공식 시험 각 섹션의 측정 표준오차(SEM)는 약 25점입니다 — 즉, 동일한 수험생이 일주일 뒤에 공식 시험을 다시 치르더라도 한 섹션 점수가 이 정도 범위 내에서는 자연스럽게 요동칠 수 있다는 뜻입니다. 핸디 990의 리스닝 예상 오차는 공식 시험 자체가 스스로에 대해 갖는 오차와 동일한 규모입니다.
수험생 A는 특히 주목할 만합니다. 예상 리스닝은 310점, 실제 점수는 315점이었습니다. 게다가 본인이 보내준 피드백에 따르면, 이전 7/28 시험에서도 "리스닝 점수가 거의 일치했다"고 합니다. 한 사람, 두 번의 시험, 두 번의 연속 적중 — 이것은 단순한 행운으로 보이지 않습니다.
리스닝은 왜 이렇게 정확할 수 있었을까요? 우리의 결론은 다소 싱겁습니다. 연습 환경과 시험 환경이 완전히 일치하기 때문입니다. 리스닝의 페이스는 응시자가 아니라 음원 파일이 결정합니다 — 앱에서 Part 3 세트를 풀든 고사장에서 Part 3을 풀든, 시간적 압박은 완전히 동일합니다. 예상 점수는 '이러한 조건에서의 정답률'을 측정하는데, 실제 시험 역시 정확히 이 조건 그대로 치러집니다.
【8/29 추가】 글이 공개된 다음 날, 다섯 번째 성적표가 도착했습니다. 시험 전 예상 810(리스닝 435/리딩 375), 실제 점수 805(리스닝 405/리딩 400). 총점은 단 5점 차이였고, 다섯 명의 순위도 여전히 전부 적중했습니다 — 하지만 리스닝의 축배는 잠시 미뤄야 합니다. 이번에는 처음으로 리스닝을 무려 30점이나 과대평가했기 때문입니다. 원인은 수험생 본인이 먼저 짚어냈습니다. 피드백에 "리스닝은 가끔 여러 번 다시 듣는데, 그래서 점수가 부정확해질 수 있을 것 같다"라고 적혀 있었는데 — 정확한 지적입니다. 반복 재생이 리스닝에 미치는 영향은, 시간 무제한이 리딩에 미치는 영향과 같습니다. 연습 조건이 시험장보다 느슨하면 예상 점수는 느슨한 쪽으로 기울어집니다. 총점이 완벽해 보였던 이유는 동시에 리딩이 25점 과소평가되었기 때문입니다(이 수험생의 예상 점수는 시험 전 3주 동안 475에서 830까지 뛰어올랐고, 후행 지표는 여느 때처럼 그 속도를 따라잡지 못했습니다). 두 편향이 공교롭게도 서로 상쇄된 것입니다. 그러니 이 절의 "연습 환경과 시험 환경이 완전히 일치한다"는 문장에는 단서가 하나 붙어야 합니다. 단, 모든 음원을 한 번만 재생할 때의 이야기입니다.
리딩은 정반대입니다.
리딩의 3가지 오차, 각각의 이유와 이름
4명의 리딩 오차는 −50, +70, +25, +45점으로 — 평균 절대 오차는 48점이었으며, 이는 리스닝의 거의 2.5배에 달했고 오차의 방향도 제각각이었습니다. 4명의 데이터를 자세히 들여다보니, 3가지 체계적 편향이 뚜렷하게 모습을 드러냈습니다.
첫째, 시간 제한 없는 실력 ≠ 시간 압박 속의 성과. 수험생 A의 리딩 점수는 50점 과대평가되었으며, 7/28 시험에서도 똑같은 결과가 있었습니다("리딩 점수 차이가 매우 컸다"는 본인의 표현). 평소 문제를 풀 때는 시간 제한이 없으므로 Part 7 지문 하나를 여유롭게 끝까지 읽을 수 있습니다. 하지만 실제 시험의 리딩 섹션은 75분 100문제이며, 다 읽지 못하면 그대로 끝납니다. 수험생 D 역시 피드백에서 리딩이 "시간이 촉박했다(하마터면 다 못 풀 뻔했다)"고 언급했는데 — 본인은 895점을 받았음에도 시간이 빠듯하다고 느꼈습니다. 예상 점수는 시간 제한이 없을 때의 정답률을 측정하지만, 시험은 시간 압박 속에서의 정답률을 평가합니다. 이 둘 사이에는 '속도'라는 별개의 능력이 자리 잡고 있습니다.
둘째, 취약 파트만 집중 공략하면 예상 점수도 취약점을 따라간다. 수험생 B는 75점 과소평가되었는데, 본인이 피드백에서 스스로 정확한 진단을 내렸습니다. "취약한 파트(4, 5, 6)를 집중적으로 연습하다 보니 예상 점수가 더 낮게 나왔습니다." 정확한 분석입니다. 시험 전 연습이 가장 취약한 문제 유형에만 집중되다 보니, 점수 추정기에 입력된 데이터 표본 자체가 취약점 쪽으로 의도적으로 편향되어 있었습니다 — 하지만 실제 시험은 취약한 파트만 출제되지 않습니다. 이는 표본 선택 편향(selection bias)의 교과서적인 사례이며, 이번에는 수험생이 직접 그 교과서를 쓴 셈입니다. (참고로 본인은 다른 점수 예측 앱도 함께 사용했는데, 그 앱은 640점으로 추정했습니다. 두 앱 모두 이 수험생을 과소평가한 것입니다. 핸디 990은 75점 낮게 예측했고, 다른 앱은 120점 낮게 예측했습니다. 진지하게 시험을 준비하는 사람을 과소평가하는 것은 이 업계 전반의 만성적인 현상인 듯합니다.)
셋째, 예상 점수는 태생적으로 후행 지표인데, 여러분의 실력은 계속 상승한다. 수험생 C는 4명 중 가장 적은 307문제만 풀었지만, 두 번째로 작은 오차의 예상 점수를 받았습니다. 더욱 흥미로운 것은 본인의 실제 기준점 2개였습니다. 준비 없이 치른 6월 시험에서 720점, 8월 시험에서 855점 — 2달 만에 135점이 오른 것입니다. 이 기간 동안 핸디 990의 일일 예상 점수는 735점에서 795점으로 올랐습니다. 출발점은 정확했고(2달 전 실제 720점에 대응하는 735점), 방향도 맞았지만, 상승 속도를 완전히 따라잡지는 못했습니다. 이는 결함에 대한 변명이 아니라 통계적 설계의 필연적인 결과입니다. 점수 추정기는 과거 데이터에 시간 감쇠를 적용하여 '최근 몇 주간의 평균적인 여러분'을 측정하지만, 시험장에 들어서는 것은 '시험 당일 가장 기량이 뛰어난 여러분'입니다. 실력이 빠르게 향상될수록 이 둘 사이의 격차는 더 벌어집니다. 수험생 D에게는 네 번째 미세 편향인 천장 압축(ceiling compression)까지 겹쳤습니다. 그 리스닝 예상 점수는 시험 전 마지막 1주일 동안 460점에 고정되어 움직이지 않았는데(중간에 단 한 번 455점으로 깜빡였을 뿐입니다), 정답률 90% 이상의 구간에서는 표본 노이즈가 점수 구간 단위보다 커져서 더 이상 올라가지 못하기 때문입니다. 실제 리스닝 점수는 만점인 495점이었습니다.
그렇다면, 예상 점수는 과연 '수렴'했는가?
이것은 우리가 가장 답하고 싶었던 질문이며, 솔직한 대답은 다음과 같습니다. '수렴'에는 두 가지 의미가 있는데, 우리는 첫 번째는 달성했고 두 번째는 절반만 달성했습니다.
첫 번째 의미는 통계적 수렴, 즉 예상 점수가 더 이상 요동치지 않는 상태입니다. 이 항목은 4명 모두 달성했습니다. 시험 전 2주 동안 4명의 일일 예상 총점 표준편차는 각각 19, 34, 20, 22점이었습니다 — 그리고 여기서 34점이었던 수험생 B의 수치는 단순 노이즈가 아니라, 본인의 리스닝 예상 점수가 2주 만에 320점에서 395점으로 실제로 상승하면서 그 추세가 표준편차에 포함되었기 때문입니다. 비교하자면, 핸디 990이 TOEIC 점수를 추정하는 방법에서 설명했던 과거의 방식(고정 EMA)은 영원히 약 ±11%포인트 수준의 요동을 유지했습니다. 반면 현재의 방식은 수백 문제를 풀고 나면 날마다 단 몇 점씩만 움직입니다. 앱에 표시되는 불확실성 구간 역시 정직하게 좁아졌습니다. 수험생 B의 시험 전 화면에는 리스닝 395±28, 리딩 290±20으로 표시되어 있었습니다.
두 번째 의미는 참값(true value)으로의 수렴입니다. 리스닝은 이에 성공했습니다. 4명의 오차 모두 불확실성 구간의 합리적인 범위 내에 안착했습니다. 하지만 리딩은 그렇지 못했습니다. 수험생 B의 실제 리딩 점수는 360점으로, 290±20 구간에서 무려 50점이나 벗어났습니다. 여기서 분명히 짚고 넘어가야 할 사실이 있습니다 — 화면에 표시되는 ± 오차 범위는 표본 추출의 불확실성을 측정한 것입니다. 즉, "실제 시험 문제가 여러분이 연습한 문제와 비슷하고, 여러분의 실력이 최근 몇 주간과 동일하다면 점수가 이 범위 안에 들어온다"는 뜻입니다. 이 오차 범위는 시간 압박, 취약 파트에 편중된 연습, 그리고 여러분의 실력이 지금도 향상되고 있다는 사실에 대해 전혀 알지 못합니다. 수렴이 곧 정확성을 뜻하지는 않습니다. 그것은 전제 조건이 충족될 때의 정확성만을 보장할 뿐이며, 공교롭게도 이 4명의 수험생은 저마다 그 전제 조건을 하나씩 깨뜨렸습니다.
우리가 바꿀 것 (그리고 바꾸지 않을 것)
리스닝은 그대로 유지합니다. 연습과 시험 조건이 일치하고, 오차도 공식 SEM과 동일한 수준이므로 이보다 더 나아지기는 어렵습니다.
리딩의 3가지 편향 중 2가지는 사실 이미 대응할 수 있는 도구가 마련되어 있었지만, 이전에는 충분히 명확하게 설명해 드리지 못했습니다. 시간 압박 문제는 타이머가 작동하는 실전 모의고사로 훈련하고, Part 7의 속도 자체를 별도로 집중 훈련할 수 있습니다(속독을 배우면 내 리딩 시험을 구할 수 있을까?). 실력 향상의 후행 문제는 시험이 끝난 뒤 실제 성적표를 앱에 입력하면 공식 성적표를 기반으로 예상 점수를 재보정합니다(TOEIC 성적표에는 점수만 있는 게 아닙니다). 취약점 집중 공략으로 인한 편향이 가장 까다로운 부분입니다 — 가장 올바른 시험 준비 방식(취약점 훈련)을 실천한 수험생에게 불이익을 주는 것은 불합리하므로, 수정은 연습 방식이 아니라 점수 추정 알고리즘에서 이루어져야 합니다. 우리는 존재하지 않는 데이터를 조작하지 않으면서 이를 보정할 수 있는 방안을 연구하고 있습니다. 그전까지는 솔직한 사실을 여기에 적어 둡니다. 시험 전 몇 주 동안 취약 파트만 집중적으로 훈련했다면, 여러분의 실제 실력은 예상 점수보다 높을 확률이 큽니다.
잠깐만요 — 이 숫자를 인용하기 전에
첫째, n=4입니다. 이는 몇 가지 사례 연구일 뿐 본격적인 검증 연구가 아니며, 이 4개의 데이터만으로 모델의 파라미터를 단 하나도 수정하지 않았습니다. 둘째, 성적 제출은 자발적인 참여로 이루어졌으므로 표본 자체가 '할 말이 있는 사람' 쪽으로 기울어질 수밖에 없습니다 — 예상보다 시험을 잘 본 수험생이 기쁜 마음으로 성적표를 공유할 가능성이 높고(실제로 4명 중 3명이 그랬습니다), 따라서 '예상 점수가 다소 보수적이다'라는 패턴 자체가 성적 제출 편향(reporting bias)의 그림자일 수 있습니다. 셋째, 4명 모두 동일한 회차의 시험을 치렀습니다. 서로 다른 시험 회차 간의 난이도 조정(equating) 오차는 이 데이터로는 전혀 확인할 수 없습니다. 넷째, 설령 모델이 완벽하다 할지라도 ETS 공식 시험 섹션별 SEM 자체가 25점입니다 — 공식 시험이 스스로를 예측하는 것보다 더 정확하게 공식 시험을 예측하는 것은 수학적으로 이길 수 없는 게임입니다. 우리의 목표는 결코 점수를 신점 보듯 예언하는 것이 아닙니다. "내가 대략 어느 위치에 있는지, 목표까지 얼마나 남았는지, 다음에는 무엇을 연습해야 하는지"를 솔직하게 알려주는 것입니다. 이 기준에서 볼 때, 이번 4장의 성적표는 우리에게 하나의 합격점, 2가지 명확한 숙제, 그리고 계속해서 성적표를 수집해야 할 이유를 안겨주었습니다.
만약 여러분도 8/16 또는 그 이후 시험을 치르셨다면 — 성적이 발표되었을 때 앱이 시험 결과를 물어볼 것입니다. 꼭 알려주세요. 이 글의 후속편은 여러분의 성적표로 완성됩니다.
예상 점수 카드는 핸디 990 홈 화면에 위치해 있습니다. '예상 점수 계산 방식'을 탭하면 각 섹션의 불확실성 구간과 일일 추세를 확인할 수 있습니다. 점수 추정 방식에 대한 자세한 설명은 핸디 990이 TOEIC 점수를 추정하는 방법을 참고하세요. 시험 후 실제 성적을 입력하여 오차를 보정하는 메커니즘은 TOEIC 성적표에는 점수만 있는 게 아닙니다에서, 리딩 시간 제한 훈련은 속독을 배우면 내 리딩 시험을 구할 수 있을까?에서 확인하실 수 있습니다.