전체 글 · 게시일 2026-08-27
TOEIC 성적표에는 점수만 있는 게 아닙니다: ABILITIES MEASURED 능력 분석이란 무엇이고, 예상 점수를 어떻게 보정하는가
TOEIC 성적표에는 크게 인쇄된 두 개의 점수 아래에, 대부분의 사람이 한 번 훑고 다시는 보지 않는 가로 막대 그래프가 있습니다 — ABILITIES MEASURED, 열 가지 능력의 정답률입니다. 이 글에서는 그 막대들이 사실 성적표 전체에서 정보 밀도가 가장 높은 부분이라는 것, 그리고 실제 성적을 핸디 990에 입력했을 때 앱이 그것으로 예상 점수를 어떻게 "보정"하는지를 설명합니다 — 몇 달의 연습이 쌓아 올린 강점과 약점의 모양은 그대로 두고, 전체 높이만 공식적인 진실에 맞추는 것입니다. 솔직히 고백할 점도 하나 있습니다. 첫 번째 버전에서는 이 부분을 잘못 처리했습니다.
핸디 990이 TOEIC 점수를 추정하는 방법의 말미에서 우리는 한 가지를 약속했습니다. 실제 시험 결과가 들어올수록 추정은 더 정확해질 거라고요. 이 글은 그 약속의 속편입니다 — 성적표가 도착했습니다. 그럼 이제 어떻게 할까요?
장면을 구체적으로 그려 봅시다. 당신은 앱으로 3개월 동안 연습하며 일곱 개 파트에 걸쳐 수백 문항을 풀었습니다. 앱은 Part 5를 85%, Part 7을 55%로 추정하고 레이더 차트도 그려 줍니다. 그리고 실제 TOEIC을 치르고, 2~3주 뒤 성적표가 도착합니다. 이제 당신 손에는 "당신의 영어 실력"에 관한 자료가 두 개 있습니다. 하나는 수백 문항의 연습으로 쌓아 올린 정밀한 프로필, 다른 하나는 ETS의 도장이 찍힌 공식 숫자. 이 둘은 거의 확실히 일치하지 않습니다.
앱은 어느 쪽을 믿어야 할까요?
직관적인 두 가지 방법, 둘 다 틀렸습니다
방법 1: 성적표가 우선 — 전부 덮어쓰기. 공식 점수가 우리 추정보다 권위 있는 건 당연하니, 추정을 지우고 성적표에서 다시 시작하면 됩니다. 문제는 성적표에 숫자가 두 개뿐이라는 것입니다. 리스닝 하나, 리딩 하나. 당신의 Part 5 정답률이 Part 7보다 30퍼센트포인트 높다는 것도, 단일 지문은 잘 읽는데 삼중 지문에서 무너진다는 것도 성적표는 모릅니다 — 그건 3개월, 수백 문항을 들여 얻은 정보이고, 숫자 두 개에는 담기지 않습니다. 추정을 덮어쓰는 것은 앱이 가진 가장 값진 것을 버리는 일입니다.
방법 2: 성적표는 "참고용" — 추정은 그대로 유지. 반대의 직관으로, 자기 모델을 계속 믿는 겁니다. 하지만 지난 글에서 인정했듯이, 모델의 상수들은 추론으로 정한 것이지 데이터에 맞춰 조정된 것이 아닙니다. 우리 문제 은행의 난이도와 실제 시험 사이에는 편차가 있고, 그 편차는 사람마다 다릅니다. 앱이 750이라 하고 성적표가 680이라 하는데 계속 750을 표시하는 것은 자신감이 아니라 귀를 막는 것입니다.
두 방법 모두 정보의 절반을 버립니다. 정답은 하나의 관찰 속에 숨어 있습니다 — 이 두 자료는 잘하는 일이 다릅니다.
성적표는 "고도"를 알고, 연습 기록은 "능선"을 압니다
당신의 실력을 하나의 산맥이라고 생각해 보세요. 일곱 개 파트는 높이가 제각각인 일곱 개의 봉우리입니다.
당신의 연습 기록 — 몇 주에 걸친 수백 문항, 한 문항씩의 기록 — 은 이 산맥의 능선을 그려 왔습니다. 어느 봉우리가 높고 어느 골짜기가 낮은지, 그 차이는 얼마나 되는지. 이 능선은 매우 정밀해서, Part 7의 단일·이중·삼중 지문을 세 가지 다른 경사로 구분할 수 있을 정도입니다. 하지만 구조적인 약점이 하나 있습니다. 능선 전체의 고도가 잘못 표시되어 있을 수 있다는 것입니다. 우리 문제는 ETS가 낸 것이 아니라서 난이도 보정에는 체계적인 편차가 불가피합니다 — 능선의 모양은 맞는데, 산맥 전체가 수십 미터 높게, 혹은 낮게 그려져 있을 수 있습니다.
성적표는 정확히 그 반대입니다. ETS의 점수는 대규모 동등화를 거친 고도의 진실입니다. 하지만 능선에 대해서는 거의 침묵합니다. 리스닝 하나, 리딩 하나 — "평균 봉우리" 두 개가 전부입니다.
그러니 올바른 방법은 하나뿐입니다. 성적표로 고도를 보정하고, 연습 기록으로 능선을 지킨다.
ABILITIES MEASURED란 무엇인가요?
다만 성적표가 능선에 대해 완전히 침묵하는 것은 아닙니다 — 여기서 그동안 지나쳐 버렸던 막대들이 등장합니다.
정식 TOEIC 성적표(종이 성적표 — 대만 공식 일정 기준으로 시험 후 16번째 영업일쯤 발송되고, 온라인 점수는 10번째 영업일부터 조회할 수 있지만 점수만 확인할 수 있습니다)의 하단에는 ABILITIES MEASURED가 인쇄되어 있습니다. 리스닝 다섯 항목, 리딩 다섯 항목, 각각 정답률 퍼센트가 붙어 있습니다. 파트별이 아니라 "능력"별 구분입니다 — 리스닝 다섯은 대략 "짧은 대화의 요지", "긴 대화의 요지", "짧은 대화의 세부 정보", "긴 대화의 세부 정보", "화자의 함축된 의미"이고, 리딩 다섯은 "추론", "특정 정보 찾기", "문장과 지문을 넘나드는 정보 연결", "어휘", "문법"입니다.
이 열 개의 숫자는 당신이 푼 바로 그 시험 — 리스닝 백 문항, 리딩 백 문항 — 에서 ETS가 계산한 것입니다. 다시 말해, 공식적이지만 세분화 수준은 낮은 능선 정보입니다. 핸디 990의 성적 입력 화면에는 이 열 개의 퍼센트를 그대로 옮겨 적을 수 있는 펼침 패널이 추가되었습니다. 앱 안의 열 줄은 일부러 성적표에 인쇄된 원문 그대로의 문구를, 인쇄된 순서 그대로 사용합니다. 성적표를 한 손에 들고 위에서 아래로 옮겨 적기만 하면 됩니다. 열 칸 모두 선택 사항입니다 — 적을 수 있는 만큼만 적으면 되고, 하나도 안 적어도 됩니다.
보정은 어떻게 계산되나요?
세 단계입니다.
1단계: 능선을 지킨다. 각 파트의 출발점은 당신의 연습이 확립한 정답률입니다 — 성적표의 평균값이 아닙니다. Part 5가 강하고 Part 7이 약하다? 보정 후에도 그대로입니다.
2단계: 능력 분석을 반영한다 — 진실이 아니라 증거로. 여기 놓치기 쉬운 디테일이 있습니다. 열 개의 능력별 백분율이 근거로 삼는 문항 수는 서로 크게 다릅니다. 시험 한 회분에 Part 1은 겨우 6문항, Part 3은 39문항입니다 — 그러니 "짧은 대화의 세부 정보"에 관한 그 막대의 근거는 보기보다 훨씬 얇습니다. 우리는 각 능력별 수치를 시험의 해당 문항 수만큼 새로운 관찰이 추가된 것으로 보고, 그 문항 수를 가중치로 삼아 대응하는 여러 파트의 추정치에 반영합니다. Part 3의 증거는 39문항의 무게로, Part 1은 6문항의 무게로. 그리고 저울의 반대편에는 당신 자신의 연습 기록이 놓여 있습니다 — 어느 파트에 이미 수십 문항의 유효한 증거가 쌓여 있다면, 능력 숫자는 추정을 조금 밀 뿐 대체하지 않습니다. 반대로 이제 막 시작해서 기록이 없는 사용자라면 능력 숫자가 거의 전부를 결정합니다. 같은 공식 하나가 두 부류의 사용자를 자동으로 포괄하며, "신규냐 기존이냐"의 분기는 어디에도 없습니다.
3단계: 섹션 전체를 평행이동해 고도를 맞춘다. 앞의 두 단계를 마치면, 그 섹션의 모든 파트 추정치에 같은 이동량을 더해, 추정에서 역산한 리스닝(또는 리딩) 점수가 입력한 공식 점수와 정확히 일치하게 만듭니다. 이 단계는 수학적으로 정확합니다 — 각 섹션의 파트별 문항 수 합계가 정확히 백이라서, 모든 파트를 1퍼센트포인트 올리면 섹션 점수는 정확히 한 문항만큼 올라갑니다. 즉 앞에서 모양이 어떻게 움직였든, 마지막에 역산되는 점수는 반드시 성적표의 그 숫자입니다. 공식 점수가 언제나 최종 권위이고, 능력 분석은 배분만 맡을 뿐 총량은 건드리지 못합니다.
레이더 차트도 같은 논리입니다. ETS의 열 가지 능력과 앱 육각 레이더의 여섯 축은 거의 일대일로 대응합니다("문법"은 문법으로, "정보 연결"은 추론으로…). 입력된 능력 분석은 레이더를 성적표 방향으로 밀어 줍니다 — 미는 것이지, 덮어쓰는 것이 아닙니다.
우리의 첫 번째 버전은 틀렸습니다
솔직히 말하면, 이 기능이 처음 출시된 버전은 바로 앞서 말한 "방법 1"이었습니다. 성적을 입력하면 추정 전체가 지워지고 다시 만들어졌습니다. 처음부터 시작하는 신규 사용자에게는 문제가 없습니다 — 지킬 능선이 애초에 없으니까요. 하지만 몇 달을 연습해 온 사용자에게 이것은 수백 문항의 기록을 숫자 두 개와 맞바꾸는 일이었습니다. 출시 후 우리 스스로 "3개월 연습하고 시험 보러 가기" 시나리오를 따라가 보다가 잘못됐다는 걸 발견했고, 며칠 안에 지금의 보정 방식으로 바꿨습니다. 기록으로 남겨 둡니다 — 권위 있는 데이터도 값진 정보를 지울 수 있습니다. "더 권위 있다"는 "덮어써야 한다"가 아닙니다.
시험 2주 뒤, 앱이 알려 드립니다
더 근본적인 문제도 있었습니다. 애초에 성적표를 입력할 가치가 있다는 걸 아는 사람이 많지 않다는 것입니다. 예전 앱의 동작은 — 시험 날짜가 지나면 홈 화면의 카운트다운이 조용히 사라지고, 그다음엔 아무 일도 없었습니다. 마치 시험에 후일담이 없는 것처럼요.
이제는 시험 날짜로부터 2주 뒤부터(온라인 성적은 이미 조회할 수 있고 종이 성적표도 곧 도착할 시점), 그 회차의 성적을 아직 입력하지 않았다면 홈 화면에 카드가 나타납니다. "성적표를 받으셨나요?" 누르면 성적 입력이 바로 열립니다 — 점수, 능력 분석, 그리고 같은 흐름에서 다음 시험을 위한 파트별 목표 재설계까지 한 번에 이어집니다. 원치 않으면 닫을 수 있고, 같은 회차에 대해서는 다시 묻지 않으며, 다음으로 등록한 시험에 대해서는 시험이 끝난 뒤 다시 알림이 활성화됩니다. 알림은 시험 후 3개월까지만 나타납니다 — 3개월이나 지나서 "성적표 받으셨나요?"라고 묻는 건 앱이 아무 관심도 없었다는 증거일 뿐이니까요.
솔직히 밝히는 한계
늘 그렇듯, 한계를 분명히 적어 둡니다.
- 능력과 파트의 대응표는 우리의 판단이지 ETS의 공식이 아닙니다. ETS는 어떤 문항이 어떤 능력에 산입되는지 공개하지 않으므로, "문법 70%를 Part 5와 Part 6에 얼마씩 나눌지"는 우리가 추론한 가중치입니다. 다만 3단계의 평행이동 덕분에, 대응표가 아무리 부정확해도 달라지는 것은 배분의 모양뿐이며 역산되는 총점은 바뀌지 않습니다.
- 시험 한 번은 표본 하나입니다. 같은 사람이 2주 간격으로 다시 시험을 보면 점수는 그 자체로 흔들립니다 — 당일의 컨디션, 배정받은 문제지, 찍기 운. 성적표는 얻을 수 있는 최고의 단일 데이터 포인트지만, 그래도 단일 데이터 포인트입니다. 능력 분석을 "대체"가 아니라 "반영"으로 처리하는 또 하나의 이유입니다.
- 성적표는 낡아 갑니다. 입력하는 것은 3주 전 시험의 성적일 수 있고, 당신은 그 3주 동안에도 연습을 계속했습니다. 보정은 그것을 "현재 시점의 증거"로 다루므로 약간의 시차가 있습니다 — 그래도 무시하거나 통째로 베끼는 것보다는 낫고, 이후의 연습은 평소처럼 추정을 계속 갱신합니다.
- 입력된 성적은 우리를 채점하기도 합니다. 공식 성적을 입력할 때마다 앱은 보정을 하기 전에 "그때의 추정"과 "실제 점수"의 차이를 (비공개로) 기록합니다. 지난 글에서 약속한 "상수는 실제 데이터로 다듬어진다"는 바로 이 차이로 굴러갑니다. 당신이 앱을 보정하는 동안, 당신은 우리도 보정하고 있는 것입니다.
성적 입력은 핸디 990 홈 화면의 목표 카드에서 시작하는 목표 상담 흐름 안에 있습니다(이 경로는 이 글에서 설명한 보정을 즉시 실행합니다. 시험 2주 뒤부터는 홈 화면이 먼저 제안하기도 합니다). "설정 → 공식 TOEIC 점수 입력"은 먼저 기록해 두었다가 다음 상담 때 적용됩니다. 이 추정의 바탕이 되는 모델—감쇠형 베이지안 사후분포, 불확실성 범위, IRT를 사용하지 않는 이유—에 관해서는 핸디 990이 TOEIC 점수를 추정하는 방법을 읽어 보세요.