전체 글 · 게시일 2026-08-01
난이도 총론: "실제 시험과 똑같이 어렵다"는 것은 무슨 뜻일까? — 우리가 측정한 방식, 비교 대상, 그리고 주장하지 않는 것들
궁금해하시는 분들을 위한 기술적 설명입니다. 이 글은 난이도 시리즈의 총론이며, 이후 각 Part별로 개별 글이 이어집니다. 본 글에서는 이후 모든 문서에서 공통으로 다루는 내용을 정리합니다: 측정학에서 말하는 난이도의 공식 정의, 왜 아무도(우리 포함) 이를 직접 측정할 수 없는지, 우리가 외부 참조 표준으로 사용한 대상, 그리고 우리가 자신 있게 주장하는 바와 주장하지 않는 바의 구분입니다. 이 글을 읽고 나면 각 Part별 글에서는 해당 Part만의 고유한 난이도 유발 요인에 바로 집중할 수 있습니다. 통계학적 배경지식은 전혀 필요하지 않습니다.
왜 '난이도'를 직관이나 느낌에 의존하면 안 될까
문제은행 속 모든 연습 문제는 '쉬움', '보통', '어려움'과 같은 난이도 태그를 달고 있습니다. 이 항목은 지극히 당연해 보이지만, 사실 문제은행 전체에서 가장 오류가 생기기 쉬운 부분입니다 — 왜냐하면 오류가 발생하더라도 아무런 경고 신호가 발생하지 않기 때문입니다.
문제의 정답이 틀렸다면 사용자가 오류를 제보합니다. 음성 파일이 손상되었다면 재생 버튼을 누르는 순간 바로 알 수 있습니다. 하지만 '어려움'으로 표기되어 있지만 실제로는 매우 쉬운 문항은 아무런 징후도 남기지 않습니다: 그저 정상적으로 출제되고, 정상적으로 채점되며, 겉으로는 난도가 높은 문제처럼 보일 뿐입니다.
그러나 이 난이도 태그는 두 가지 중요한 역할을 수행합니다. 첫째, 학습자가 풀게 되는 문제 조합을 결정합니다 — 연습 문제와 모의고사가 실질적인 의미를 가지려면 난이도의 단계적 기울기가 형성되어야 하며, 이는 '어려움'이 실제로 어려운 문제를 의미할 때만 성립합니다. 둘째, '고난도 문제를 어떻게 대비할 것인가'를 명확하게 설명할 수 있게 해 줍니다: 어떤 문항이 왜 어려운지 설명하지 못한다면, 결국 "연습을 더 많이 하세요" 같은 올바르지만 유용하지 않은 조언밖에 줄 수 없습니다; 반대로 난이도를 구체적이고 식별 가능한 몇 가지 요인으로 분해할 수 있다면, 그 요인들 자체가 곧 훌륭한 학습 리스트가 됩니다.
난이도의 공식 정의, 그리고 냉정한 전제 조건
계량심리학에서 정의하는 난이도는 매우 명확합니다:
한 문항의 난이도는 실제 응시자가 해당 문제를 맞힌 비율입니다.
전문 용어로는 p값이라고 부릅니다. 정답률 85%인 문제는 쉬운 문항이고, 정답률 40%인 문제는 어려운 문항입니다. 매우 직관적입니다. 이는 전문가가 느끼는 난이도가 아니라, 실제로 얼마나 많은 사람이 틀렸는가를 나타내는 수치입니다.
하지만 이 정의에는 한 가지 냉정한 전제 조건이 붙습니다: 먼저 수많은 응시자에게 해당 문제를 풀게 해 보아야 한다는 점입니다. ETS는 이러한 데이터를 보유하고 있습니다 — 모든 정식 문항은 실제 시험에 출제되기 전 사전 평가를 거치기 때문입니다. 반면 그 어떤 제3자도 이런 데이터를 갖고 있지 않습니다: 우리가 숨기는 것이 아니라, 모든 출판사, 모든 학원, 모든 앱이 예외 없이 갖고 있지 않은 것입니다.
따라서 문제 옆에 '난이도: 상'이라고 표기하는 모든 이는 사실 일종의 대체 지표를 사용하는 셈입니다. 대체 지표를 사용하는 것 자체는 문제가 없으며, 이 분야에서는 지극히 일반적인 방식입니다. 진짜 차이는 오직 다음에 있습니다:
그 대체 지표가 한 개인의 주관적 판단인가, 아니면 재실행과 검증이 가능하며 반증될 수도 있는 규칙 체계인가?
우리는 후자를 선택했습니다. 작동 방식은 다음과 같습니다: 사람이 매긴 난이도 표기는 일절 배제하고, 오직 문제 텍스트 자체로부터 구조적으로 난이도를 높이는 특성 요소들을 추출하여 문항별로 하나씩 측정합니다. 특성 요소는 텍스트로부터 도출되므로, 동일한 프로그램 코드로 우리의 문제은행은 물론 종이로 인쇄된 그 어떤 모의고사 시험지도 동일하게 측정할 수 있습니다 — 이 점이 바로 다음 절에서 다룰 핵심 내용입니다.
'실제 시험과 똑같이 어렵다'는 말이 솔직하게 의미할 수 있는 세 가지
이 문장은 흔히 하나의 의미처럼 쓰이지만, 실제로는 세 가지 차원이 섞여 있으며, 오늘날 누구나 검증할 수 있는 것은 앞의 두 가지뿐입니다.
| 주장 | 검증 가능 여부 | |
|---|---|---|
| 1 | 동일한 출제 구조 — 동일한 문항 유형, 동일한 비율, 매 회차 동일한 시험지 구조 | 가능함, 객관적 |
| 2 | 동일한 난이도 분포 — 외부 참조 표준 기준, 쉬움/보통/어려움의 비율이 동일함 | 가능함, 단 '누가 판정했는지' 명시 필요 |
| 3 | 동일한 정답률 — 실제 응시자가 각 문항을 맞히는 비율이 동일함 | 불가능함, 공식 데이터나 대규모 응시 데이터가 없는 한 |
우리는 (1)을 강력하게 지지하며, 명확한 단서 조항 하에 (2)를 지지하고, (3)은 아직 확립되지 않았음을 명확히 밝힙니다.
대규모 응시 데이터 없이 (3)을 주장하는 사람이 있다면, 그것은 추측에 불과합니다. 이는 우리 자신에게도 해당되는 이야기이며 — 본 시리즈의 모든 글 마지막에서 다시 강조될 것입니다.
우리가 비교 대상으로 삼은 것: 시판 모의고사 6회분 세트
측정 척도는 스스로 만들어낼 수 없으며, 외부 참조 표준에 맞춰야 합니다. 우리가 비교 기준으로 삼은 것은 《全新!新制多益 TOEIC 題庫解析 狠準 6 回》(해커스 어학연구소(Hackers Academia)의 모의고사 6회분 세트 대만판, 國際學村 출판)로, 완결된 6회분으로 구성되어 있으며 시중에서 완성도가 매우 높다고 평가받는 모의고사 교재입니다.
이 교재를 선택한 데에는 매우 실질적인 이유가 있습니다: 교재의 모든 문제에 출판사 자체 난이도 등급(상/중/하)이 인쇄되어 있다는 점입니다. 덕분에 전문 편집자의 손을 거친 수천 개의 문항별 평가 데이터를 확보할 수 있었으며 — 이는 우리 측정 도구의 정확도를 검증하는 데 꼭 필요한 기준이 되었습니다.
그리고 이어지는 전체 방법론의 핵심 단계는 다음과 같습니다:
동일한 특성 추출 프로그램을 사용하여 우리 문제은행과 참조 교재의 문제를 모두 분석합니다.
하나의 측정 도구로 두 개의 코퍼스를 분석하는 것입니다. 이것이야말로 유의미한 비교의 전제 조건입니다 — 우리는 스스로 정한 기준으로 자신을 평가하는 것이 아니라, 두 대상을 동일한 잣대 위에 놓는 것입니다.
이 잣대는 집단 측정에는 정확하지만, 개별 문항 측정에는 한계가 있습니다
이 점은 전체 방법론에서 가장 중요하면서도 간과하기 쉬운 부분이므로, 비유를 들어 명확히 설명하고자 합니다.
오차가 ±5kg인 체중계가 있다고 가정해 봅시다. 이 체중계로 "이번 주에 1kg이 쪘나?"를 확인하는 것은 불가능합니다 — 오차가 측정하려는 변화량보다 크기 때문에 측정된 숫자는 거의 의미가 없습니다. 하지만 동일한 체중계로 1,000명의 체중을 재고, 다른 1,000명 집단의 체중을 잰다면, 두 집단의 평균값은 비교할 수 있습니다: 오차가 때로는 크게, 때로는 작게 나타나면서 1,000번의 측정 과정을 거치는 동안 서로 상쇄되고, 남아 있는 차이는 실제 차이이기 때문입니다.
우리의 구조 분류기가 바로 그 체중계와 같습니다. 단일 문항의 난이도를 판정할 때 이 분류기는 그다지 미더우지 못합니다 — 이는 겸손이 아니라 실제 측정 오차를 확인했기 때문이며, 구체적인 수치와 검증 방식은 Part 5 문서에 작성해 두었습니다(공개 예정). 하지만 동일한 규칙을 1,000개가 넘는 문항에 적용하면, 개별 문항의 분류 오류는 양쪽으로 분산되어 서로 상쇄되고, 결과적으로 도출된 전체 비율은 신뢰할 수 있게 됩니다.
따라서 명확한 경계선은 다음과 같습니다:
- 주장할 수 있는 것: 우리 문제은행 Part 5에서 '4개의 독립된 내용어' 유형은 42.3%를 차지하며, 참조 교재는 33.1%를 차지합니다. ✓
- 주장할 수 없는 것: 이 문제는 분류기가 가장 어려운 유형으로 분류했으므로 고난도 문제이다. ✗
실무적 귀결은 분명합니다: 우리는 분류기의 결과를 가지고 개별 문항의 난이도 태그를 덮어쓰지 않습니다. 이 잣대는 타당성이 입증된 영역 — 단일 문항의 점수 매기기가 아닌 신규 콘텐츠의 전체적인 구성 균형을 검증하는 데에만 사용됩니다. 본 시리즈의 모든 난이도 비교는 이러한 제한 조건 하에서 해석되어야 합니다.
참조 표준의 한계점을 있는 그대로 밝힙니다
- 이는 출판사의 모의고사이며, ETS 공식 출제 자료가 아닙니다. 따라서 문제 형식 측면에서는 강력한 근거가 되지만(6회분 간 편차가 거의 없어 공식 출제 구조를 충실히 복제함), 난이도 측면에서는 상대적으로 약한 근거입니다(문항은 출판사가 자체 작성했고 등급은 편집자의 판단임). 이에 따라 우리는 형식 비교에 대해서는 확신 있는 어조로, 난이도 비교에 대해서는 신중한 어조로 보고합니다.
- 분량이 6회분에 불과합니다. 매 시험지마다 고정적으로 등장하는 구조적 특성을 확인하기에는 6회분으로 충분하지만, 비율의 미세한 차이를 검증하기에는 부족한 분량입니다.
현재 분석 결과: 우리 문제는 참조 교재보다 결코 쉽지 않습니다
먼저 가장 오해하기 쉬운 수치부터 살펴보겠습니다. 양측이 직접 표기한 '어려움' 난이도 비율만 본다면, 우리가 전반적으로 더 쉬운 것처럼 보입니다:
| Part | 참조 평가 '상' 비율 | 우리 표기 '어려움' 비율 |
|---|---|---|
| 2 | 20% | 18.9% |
| 3 | 12% | 21.7% |
| 4 | 18% | 16.2% |
| 5 | 33% | 10.3% |
| 6 | 28% | 25.8% |
| 7 | 29% | 21.6% |
6개 Part 중 4개는 불과 몇 퍼센트포인트 차이에 불과합니다. Part 5의 23퍼센트포인트 차이는 꽤 커 보이지만, 이는 시리즈 전체에서 가장 중요한 교훈을 전해 줍니다. 단순 태그 비교가 아닌 객관적 구조 분석 방식으로 측정했을 때 결론이 완전히 뒤바뀌었기 때문입니다:
| Part 5 선지 구성 방식 | 우리 문제은행 | 참조 교재 |
|---|---|---|
| 동일 어형 및 주변 단서 존재(가장 쉬움) | 3.6% | 2.9% |
| 동일 어형, 단서 없음 | 29.4% | 28.4% |
| 기능어/연어 선택 | 24.7% | 25.6% |
| 4개의 독립된 내용어(가장 어려움) | 42.3% | 33.1% |
우리가 보유한 '가장 어려운 선지 구성' 비율은 참조 교재보다 약 9퍼센트포인트 적은 것이 아니라 오히려 더 많습니다. 중간 두 유형은 거의 완전히 일치합니다.
다시 말해, 23퍼센트포인트의 격차는 주관적 표기가 만들어낸 착시일 뿐, 콘텐츠 자체의 격차가 아닙니다. 우리 출제자들은 까다로운 문법 문제를 고난도로 표기하는 경향이 있는 반면, 참조 교재의 평가 기준은 어휘와 연어(콜로케이션) 부하가 큰 문제를 가장 어렵다고 판단한 것입니다. 즉 두 주체가 서로 다른 잣대로 동일한 대상을 측정한 셈입니다. 우리의 난이도 표기 기준이 보수적이었을 뿐, 우리 콘텐츠가 보수적이거나 쉬운 것이 아닙니다.
이것이 현재 내릴 수 있는 결론이며, 이는 개별 문항이 아닌 전체 조합 수준에 적용됩니다: 우리가 객관적으로 측정할 수 있는 유일한 축에서, 우리 문제는 참조 교재와 최소한 동등한 수준이며, 가장 어려운 유형에서는 오히려 더 높은 비중을 차지합니다. 그렇다고 해서 우리가 "실제 TOEIC 시험보다 어렵다"고 선언하지는 않습니다 — 그것을 증명하려면 (3)이 필요한데, (3)은 아직 아무도 입증할 수 없기 때문입니다.
우리가 주장하지 않는 것들
- 우리는 실시간 정답률 데이터를 가지고 있지 않습니다. 여기 포함된 그 어떤 내용도 특정 문항이 실제 응시자에게 실제 시험 문제만큼 어렵다는 점을 확증해주지 않습니다.
- 비교 대상은 출판사의 모의고사이며 ETS가 아닙니다. 문제 형식에 관한 결론은 견고하지만, 난이도에 관한 결론은 편집자의 판단을 따릅니다.
- 우리의 리스닝 음성은 실제 시험보다 한결 깨끗합니다. 리스닝 음성은 신경망 TTS로 생성되어 말하기 속도와 억양 분포를 제어하고 측정할 수 있습니다. 하지만 실제 현장 녹음에서의 생략음, 음성 겹침, 환경 백그라운드 노이즈는 당장 재현하기 어렵습니다. 이 때문에 우리의 리스닝은 자체 지표로는 파악할 수 없는 방식으로 실제 시험보다 약간 쉽게 느껴질 수 있습니다 — 시험 당일에야 이 사실을 알게 하는 것보다 미리 솔직하게 말씀드리는 편이 낫다고 생각합니다.
- 우리는 개별 문항 하나의 난이도를 단정하지 않습니다. 이유는 앞서 언급한 체중계 비유와 같습니다. 이 잣대는 집단 비교 시에는 신뢰할 수 있지만, 단일 문항 측정 시에는 신뢰하기 어렵습니다. 모든 비교는 '두 문제은행의 전체 구성 비율'에 관한 것이지, '이 문항 하나가 얼마나 어려운가'에 대한 것이 아닙니다.
- 두 잣대는 결국 동일한 잣대가 아닙니다. 참조 교재의 상/중/하는 편집자의 판단이며, 우리의 난이도 태그는 출제자의 판단입니다. 커다란 격차가 있을 때에만 유의미한 행동 기준으로 삼을 수 있으며, 미세한 차이는 노이즈입니다.
무엇이 이 분석을 더욱 확실하게 만들 것인가
가치 순위별 정리:
- 학습자들로부터 축적되는 실제 정답률. 이것이야말로 진정한 의미의 측정입니다. 문항별 풀이 결과는 이미 익명으로 축적되고 있으며, 현재 부족한 것은 데이터의 양입니다. 데이터가 충분히 쌓이는 날, 이 구조적 잣대는 실제 데이터를 통해 재교정되거나 — 심지어 대체될 것입니다.
- 예측 점수와 공식 시험 점수 간의 격차. 학습자가 공식 시험 점수를 입력해 줄 때마다, 우리는 "우리의 예측 점수가 공식 점수를 몇 점 오차 범위 내에서 추적해 내는지" 검증할 수 있으며, 이는 단 몇 십 개의 샘플만 확보되어도 충분히 참조 가치가 있습니다.
이어지는 글
공통된 바탕이 마련되었으므로, 각 Part별 글에서는 곧바로 해당 Part만의 주제로 들어갈 수 있습니다: 해당 Part의 난이도가 구체적으로 어디서 비롯되는지, 그리고 이를 알게 된 후 어떻게 문제를 풀어야 하는지.
- Part 1: 사진 묘사. 난이도는 문장의 '상(Aspect)' — 상태와 동작의 미세한 대립에 있습니다.
- Part 2: 질의응답. 난이도는 질문의 유형과 응답의 간접성 정도에 있습니다.
- Part 3/Part 4: 대화 및 단독 담화. 난이도는 추론형 문항과 시각 자료, 의도 파악 문항에 있습니다.
- Part 5: 단문 공란 메우기. 난이도는 사실상 전부 4개 선지의 배열 방식에 있습니다.
- Part 6: 장문 공란 메우기. 난이도는 문장 간의 문맥 연관성과 문장 삽입 문항에 있습니다.
- Part 7: 독해. 난이도는 패러프레이징 거리에 있습니다 — 정답 선지는 지문의 어휘를 그대로 반복하는 경우가 거의 없습니다.
각 글의 후반부에서는 해당 Part의 난이도 유발 요인을 역발상하여 실전 문제 풀이 전략으로 전환합니다: 문제를 어렵게 만드는 모든 출제 기법은 정답이 어디에 숨어 있는지를 알려주는 신호입니다.