전체 글 · 게시일 2026-08-04
Part 6의 난이도는 '지문이 정말로 필요했는가'에 달려 있습니다 — 지문을 가리고 진행한 측정 실험
궁금증을 가진 여러분을 위한 기술 설명입니다. 난이도 시리즈는 Part별로 한 편씩 순서대로 발행되며, 이번 글은 여섯 번째 편입니다. Part 5의 난이도가 네 개의 선지를 어떻게 배치할 것인가에 집중되어 있고, Part 7의 난이도가 지문 전체에 흩어져 있다면, 그 사이에 위치한 Part 6의 난이도는 쉽게 간과하기 쉬운 한 지점에서 비롯됩니다. 바로 <strong>'이 빈칸을 풀기 위해 정말로 지문을 읽어야 하는가?'</strong>라는 질문입니다. 이번 글에서는 저희가 이 질문을 어떻게 측정 가능한 수치로 바꾸었는지, 이 측정이 '누군가의 주관적 느낌'에 그치지 않도록 어떤 방법을 사용했는지, 그 측정 결과가 어떠했는지(처음 측정한 결과는 저희에게 매우 불리한 수치였고, 저희는 이 결과에 맞춰 문제은행을 한차례 전면 수정했습니다), 그리고 여러분에게 가장 유용한 내용인 Part 6에 두 가지 전혀 다른 성격의 빈칸이 존재한다는 점을 바탕으로 실제 시험장에서 시간을 어떻게 배분해야 하는지 설명합니다. 통계학적 배경지식은 전혀 필요하지 않습니다.
Part 6에서는 무엇을 평가해야 하는가
Part 6은 독해 영역의 131번부터 146번까지의 문제입니다. 4개의 짧은 지문이 제시되며, 지문당 4개의 빈칸이 뚫려 있고, 각 빈칸에는 4개의 선지가 딸려 있습니다.
겉보기에는 'Part 5 문제를 지문 속에 밀어 넣은 것'처럼 보일 수 있습니다. 하지만 그래선 안 됩니다. Part 5는 고립된 단일 문장을 제시하므로 답은 반드시 그 문장 안에서만 찾아야 합니다. 반면 Part 6은 지문 전체를 제시합니다. 이는 정답이 '다른 문장'에 숨겨져 있을 수 있음을 의미합니다.
이것이야말로 Part 6가 존재하는 이유입니다. 만약 모든 빈칸을 해당 문장 하나만으로 해결할 수 있다면, 지문은 단순한 장식품에 불과하며 Part 6라는 영역이 별도로 존재할 이유도 없을 것입니다.
아주 간단한 테스트: 지문을 가려보기
특정 빈칸이 정말로 '지문'을 평가하고 있는지 판단하는 매우 명확한 방법이 있습니다.
지문 전체를 가리고 빈칸이 포함된 해당 문장과 4개의 선지만 남겨둡니다. 그리고 이렇게 물어봅니다. '지금 이 상태에서 말이 되는 선지는 몇 개인가?'
만약 말이 되는 선지가 단 하나뿐이라면, 그 빈칸은 지문이 전혀 필요 없는 문제입니다. 즉, 지문 속에 숨어 있는 Part 5 문제일 뿐입니다.
만약 말이 되는 선지가 2개 이상 남아 있다면, 이는 오직 지문만이 정답을 결정할 수 있다는 것을 의미합니다. 이러한 빈칸이야말로 진짜 Part 6를 평가하는 빈칸입니다.
저희는 후자에 해당하는 빈칸을 '문맥에 의존하는 빈칸'이라고 부릅니다. 이 글에서 앞으로 언급할 모든 수치는 바로 이 빈칸의 개수를 세어 집계한 것입니다.
세 가지 실제 예시 보기
예시 1: 지문을 가려도 영향이 없는 경우
Before entering, all staff must put on a full protective suit, gloves, and a face mask in the ------- room. (A) checking (B) changing (C) charging (D) chilling
지문을 읽을 필요가 없습니다. 보호복, 장갑, 마스크를 착용하는 장소는 changing room(탈의실)입니다. 다른 세 선지는 앞뒤 문맥에 무엇이 나오든 답이 될 수 없습니다. 이 문제는 지문 전체를 삭제하더라도 난이도가 전혀 바뀌지 않습니다.
예시 2: 지문을 가리면 답을 찾을 수 없는 경우
Bring your friends. ------- groups of six or more should book ahead. (A) Because of this, (B) That said, (C) For that reason, (D) In the meantime,
네 개의 선지 모두 문법적으로 옳고 의미도 자연스러운 문두 연결어입니다. 이 문장 하나만 봐서는 A가 아닌 B를 선택할 아무런 이유가 없습니다.
오직 앞 문장인 "Bring your friends.(친구들을 데려오세요)"를 읽어야만 뒤 문장이 조건을 제한하고 있다는 점을 알 수 있습니다. 친구 동반을 환영하지만, 6인 이상 단체는 미리 예약해야 한다는 뜻입니다. "하지만/그렇기는 하나"에 해당하는 표현이 바로 That said입니다.
이 문제에서 지문은 정답 도출의 필수 조건입니다.
예시 3: 지문을 가리면 무엇에 관한 글인지조차 알 수 없는 경우
Even stubborn ------- don't stand a chance against our gentle, modern process. (A) sprains (B) strains (C) stains (D) streams
이 문장만 단독으로 보면 이 글이 세탁소 광고인지 재활의학과 병원 광고인지조차 판단할 수 없습니다. sprains(염좌)와 stains(얼룩) 모두 이 문장에서 똑같이 자연스럽게 성립합니다.
오직 지문만이 이 글이 무엇에 관한 내용인지 알려줄 수 있습니다. 이는 문맥 의존도가 가장 극단적인 형태입니다.
'말이 된다'는 주관적 판단을 어떻게 신뢰할 수 있는 수치로 만들었는가
여기까지는 어디까지나 '내 생각에는'에 불과합니다. 그러나 '내 생각'은 측정이 아닙니다.
난이도는 계량심리학에서 명확한 정의를 갖습니다. 한 문항의 난이도는 실제 응시자가 맞힌 정답률입니다. 이는 수천, 수만 명의 응시자가 먼저 시험을 치러야만 얻을 수 있는 데이터로, ETS를 제외하면 그 누구도 이러한 자료를 가지고 있지 않습니다. 이에 대한 자세한 설명은 〈난이도 총론〉에서 다루고 있습니다. 여기서 해결하고자 하는 문제는 더 작지만 훨씬 까다로운 문제입니다. 바로 "'지문을 가렸을 때 말이 되는 선지가 몇 개 남는가'라는 판단이 한 사람의 주관적인 생각에 치우치지 않게 하려면 어떻게 해야 하는가?"입니다.
저희는 세 가지 조치를 취했습니다.
1. 문제를 '해당 문장 하나만 남도록' 분리하기
프로그램을 사용하여 각 문항에서 빈칸이 포함된 문장만 단독으로 추출하고, 동일한 지문 내 다른 빈칸에는 정답을 직접 채워 넣었습니다(그래야 문장 구조가 완결되기 때문입니다). 이렇게 하여 전체 490개 빈칸을 성공적으로 분리해 냈습니다.
이 단계에서 이미 한 가지 주요 문제 유형이 제외됩니다. 바로 문장 전체를 채워 넣는 '문장 삽입' 유형(선지가 4개의 완결된 문장으로 구성된 유형)입니다. 해당 유형은 정의상 무조건 문맥에 의존하므로, 이를 측정 대상에 포함하는 것은 데이터 수치를 부풀리는 것에 불과합니다. 게다가 저희 문제은행의 문장 삽입 문제 비율은 이미 실제 시험의 비중(4문제당 1문제)과 일치합니다. 따라서 여기서 측정한 대상은 나머지 3개의 빈칸입니다.
2. 서로 결과를 볼 수 없는 두 명의 채점자에게 맡기기
저희는 '해당 문장 하나 + 4개 선지' 세트를 독립된 두 AI 채점자에게 전달했습니다. 두 채점자 모두 완전히 동일한 서면 채점 기준표를 부여받았으며, 정답이 무엇인지는 알리지 않았습니다(정답을 미리 아는 것은 판단에 심각한 편향을 유발하기 때문입니다). 채점자들이 답해야 할 질문은 단 하나였습니다. '이 4개 선지 중, 이 문장 단독으로 보았을 때 말이 되는 것은 몇 개인가?'
단 한 명의 채점자만 사용하지 않고 두 명을 둔 이유는, 채점자가 한 명뿐이면 신뢰성을 검증할 방법이 없기 때문입니다. 채점자가 둘이면 두 채점자가 얼마나 일관되게 일치하는지 다음과 같이 계산할 수 있습니다.
| 일치율 | Cohen's κ | |
|---|---|---|
| 저희 문제은행 (490문제) | 80.4% | 0.51 |
| 참조 모의고사 (72문제) | 90.3% | 0.81 |
κ(kappa)는 '우연히 일치할 확률'을 제하고 남은 순수한 일치도를 나타냅니다. 참조 모의고사 수치인 0.81은 매우 높은 편에 속하며, 저희 문제은행의 0.51은 중간 수준에 해당합니다. 이는 저희 문제은행에 모호한 경계선에 걸린 문제 사례가 상대적으로 많았음을 의미하며, 이 사실 자체가 유의미한 정보입니다.
3. 두 채점자 모두 동의한 수치만 반영하기
두 채점자의 의견이 일치하지 않는 문제들에 대해 저희가 직접 검토를 진행했습니다. 16문제를 무작위로 추출하여 한 문제씩 검증한 결과, 두 채점자 중 한 쪽이 명백히 관대한 기준을 적용하고 있음을 확인했습니다. 실제로 답이 하나만 성립하는 문제까지 포함시켰던 것입니다(예를 들어 위에서 든 탈의실 문제의 경우 2개 선지가 가능하다고 판단했습니다). 게다가 그 관대함의 정도가 양쪽 집단에서 서로 달랐습니다 — 저희 문제은행에 대해서는 18%나 더 높게 판정하였고, 참조 모의고사 문제에 대해서는 10%만 더 높게 판정했습니다.
이 점은 매우 중요합니다. 만약 해당 채점자의 판단만 반영한다면 어느 한쪽을 편향되게 미화하는 결과가 초래됩니다. 따라서 최종 수치에는 두 채점자 모두 동의한 문항만을 집계에 반영했습니다.
(저희는 채점자 중 한 명이라도 해당한다고 판단하면 집계에 포함하는 완화된 방식도 계산해 보았습니다. 결론은 아래에서 설명하듯 완전히 동일했습니다.)
측정 결과
첫 번째 측정 당시의 결과는 저희 입장에서 매우 납득하기 힘든 수치였습니다.
| 문맥에 의존하는 빈칸 | 95% 신뢰구간 | |
|---|---|---|
| 저희 문제은행 (첫 측정) | 82 / 490 = 16.7% | 13.7%–20.3% |
| 참조 모의고사 | 35 / 72 = 48.6% | 37.4%–59.9% |
참조 모의고사는 대략 빈칸 2개당 1개 꼴로 실제로 지문을 읽어야만 풀 수 있었습니다. 반면 저희 문제은행은 대략 6개당 1개 꼴에 불과했습니다.
두 95% 신뢰구간은 서로 겹치지 않았습니다(저희 상한값 20.3%, 상대측 하한값 37.4%). 따라서 이는 단순한 표본 오차로 설명될 수 있는 격차가 아니었습니다. 기준을 완화한 방식으로 재계산했을 때도 저희 36.3%, 상대측 58.3%로 역시 겹치지 않았습니다 — 계산 방식을 바꾸더라도 결론은 달라지지 않습니다.
이를 뒷받침하는 하나의 증거: 저희가 의도적으로 문맥 의존 빈칸으로 개작한 문항들에 대해, 두 채점자는 해당 사실을 전혀 모르는 상태에서 모두 식별해 냈습니다. 만약 자가 만든 도구조차 측정해 내지 못하는 잣대라면 그 어떤 결과도 신뢰할 수 없을 것입니다.
그리고 저희는 이를 수정했습니다
측정 결과가 나온 후, 저희는 이 수치를 덮어두지 않고 측정값에 맞게 문제를 전면 개작했습니다. 수정 방식은 단순히 '새 지문을 더 추가하는 것'이 아니었습니다. 지문이 하나 늘어날 때마다 빈칸도 3개씩 함께 늘어나 분모가 커지기 때문에 그런 방식으로는 해결할 수 없기 때문입니다. 비율을 올리는 유일한 방법은 기존의 빈칸들을 하나하나 실제로 지문이 필요한 문항으로 개작하는 것이었습니다.
수정을 마친 후 동일한 잣대, 서로의 판단을 볼 수 없는 동일한 두 채점자, 두 채점자가 모두 동의한 항목만을 반영하는 동일한 방식으로 다시 측정했습니다.
| 문맥에 의존하는 빈칸 | 95% 신뢰구간 | 지문당 평균 | |
|---|---|---|---|
| 저희 문제은행 (첫 측정) | 82 / 490 = 16.7% | 13.7%–20.3% | 0.50 |
| 저희 문제은행 (현재) | 239 / 490 = 48.8% | 44.4%–53.2% | 1.46 |
| 참조 모의고사 | 35 / 72 = 48.6% | 37.4%–59.9% | 1.46 |
양측의 점추정치는 0.2%p 차이에 불과하며, 지문당 평균 밀도는 완전히 동일한 1.46을 기록했습니다. 신뢰구간 역시 대폭 겹칩니다.
쉽게 말해, '이 빈칸이 과연 지문을 필요로 하는가'라는 지표에 있어서는 이제 저희 문제은행과 참조 모의고사 간의 차이를 통계적으로 검출할 수 없는 수준이 되었습니다.
여기서 과도한 주장을 하지 않도록 주의해야 합니다. 이것이 저희 문제가 '실제 시험만큼 어렵다'는 것을 의미하지는 않습니다. 난이도에는 수많은 측면이 존재하며, 이번 글에서 측정한 것은 그중 단 하나일 뿐입니다. 또한 저희가 상대보다 뛰어나다는 뜻도 아닙니다. 48.8%와 48.6%의 차이는 측정 오차범위보다 훨씬 작기 때문에 어느 한쪽이 우세하다고 말할 수 없습니다. 저희가 확실히 말할 수 있는 사실은 단 하나입니다. '이 측면에서 존재했던 통계적으로 명확히 보이던 격차가 이제 사라졌다'는 점입니다.
솔직한 후기 한 가지: 개작 작업을 마친 뒤 이 글에 기술된 예시들을 직접 대조해 보던 중, 개작 과정에서 4문항에 오류가 발생했음을 발견했습니다 — 선지가 동일한 지문 내 다른 빈칸의 위치로 잘못 배치되어 해당 4문항에 정답이 존재하지 않게 된 것입니다. 이 문항들은 즉시 수정 완료되었으며, 향후 동일한 유형의 오류가 출시 전 자동으로 차단되도록 검증 시스템을 추가했습니다. 이 오류를 발견할 수 있었던 이유 역시 이 글에 실린 예시들을 실제 문제은행 데이터와 일일이 대조해 보았기 때문입니다.
왜 이런 일이 발생하는가
누군가 게을러서가 아닙니다. 문제 출제의 자연스러운 경향성 자체가 이러하기 때문입니다.
'해당 문장 하나만 보고도 풀 수 있는' 빈칸을 출제하는 편이 훨씬 쉽고 안전합니다. 정답이 단 하나임을 확실히 할 수 있고, 논란의 여지가 없으며, 문법적 타당성도 쉽게 확보됩니다. 반면 '반드시 앞 문장을 봐야만 정답을 정할 수 있는' 빈칸을 만들려면 두 문장 간의 관계를 동시에 제어해야 할 뿐만 아니라, 4개의 선지가 문장 단독으로 보았을 때는 모두 그럴듯하게 성립하도록 설계해야 합니다 — 그렇지 않으면 결국 Part 5 문제로 퇴화해 버리기 때문입니다.
따라서 별도로 측정하지 않는 한, 모든 문제은행은 자연스럽게 'Part 5 문제를 지문 속에 집어넣는' 방향으로 흘러가게 됩니다. 저희 역시 그렇게 표류했던 것입니다. 그리고 지문을 직접 가려보기 전까지는 이 사실을 전혀 알아차릴 수 없었습니다 — 개별 문제 하나하나만 놓고 보면 모두 훌륭한 문제였기 때문입니다.
저희가 이 측정 과정을 제도화하여 문제를 개작할 때마다 매번 재측정을 실행하는 이유가 바로 여기에 있습니다. 편향 경향은 저절로 멈추지 않으며, 오직 지표로 측정할 때만 제어할 수 있습니다.
여러분에게 가장 유용한 부분: Part 6 풀이 전략
Part 6에 두 가지 전혀 다른 성격의 빈칸이 존재한다는 사실을 알았다면, 시험장에서의 전략은 매우 명확해집니다. 먼저 분류하고, 그 다음에 다시 읽을지 결정하는 것입니다.
1단계: 선지를 보고 어떤 유형의 빈칸인지 판단하기
문제를 접하면 먼저 4개의 선지가 어떻게 생겼는지 확인하세요.
- 네 선지 모두 동일한 단어의 변형 형태인 경우 (apply / applied / applying / application) → 거의 100% 단일 문장 빈칸입니다. 빈칸 앞뒤만 확인하고, 지문 전체로 돌아가 읽지 마세요.
- 네 선지가 서로 다른 어휘(명사, 동사, 형용사)인 경우 → 대부분 단일 문장 빈칸이지만, 예시 3처럼 '무엇에 관한 글인지조차 알 수 없는' 상황을 주의해야 합니다. 먼저 해당 문장만으로 풀어보고, 답이 나오지 않을 때 지문으로 돌아가세요.
- 네 선지 모두 문두 연결어인 경우 (However, / As a result, / Even so, / In the meantime,) → 반드시 앞 문장을 돌아가 읽어야 합니다. 이런 문제는 해당 문장 단독으로는 절대로 풀 수 없으며, 해당 문장만 쳐다보고 있는 것은 시간 낭비일 뿐입니다.
- 네 선지 모두 완결된 문장인 경우 → 문장 삽입 문제입니다. 이 유형은 앞뒤 두 문장을 함께 확인해야 하며, 보통 세트의 가장 마지막에 푸는 것이 좋습니다.
2단계: 연결어 문제는 앞의 '단 한 문장'만 다시 읽기
이것은 가장 기억해 둘 만한 핵심 팁입니다. 연결어 문제는 지문 전체를 다시 읽을 필요가 전혀 없으며, 오직 바로 앞 문장 하나만 다시 읽고 스스로에게 다음과 같이 질문하면 됩니다.
앞 문장과 이 문장은 어떤 관계인가?
- 뒷 문장이 앞 문장의 결과인 경우 → As a result, / Therefore, / Accordingly,
- 뒷 문장이 앞 문장을 반박하거나 제한하는 경우 → However, / That said, / Even so,
- 뒷 문장이 앞 문장의 구체적 예시인 경우 → For example,
- 뒷 문장이 앞 문장의 수단으로 인한 효과인 경우 → That way, / In this way,
- 앞 문장이 조건이고 뒷 문장이 이행하지 않았을 때의 결과인 경우 → Otherwise,
두 문장 간의 관계를 파악하면 정답은 바로 나옵니다. 이 단계는 10초 이내에 완료되어야 합니다. 만약 20초가 넘도록 망설이고 있다면, 보통 해당 문장 자체에서 힌트를 찾으려 하기 때문일 가능성이 높습니다 — 그리고 해당 문장에는 단서가 전혀 존재하지 않습니다.
3단계: 절약한 시간을 문장 삽입 문제에 투자하기
Part 6의 각 지문에는 4개의 빈칸이 있으며, 그중 보통 1문항이 문장 삽입 문제입니다. 이 문제는 앞 문장 및 뒤 문장 양쪽 모두와 자연스럽게 연결되는지 동시에 확인해야 하므로 Part 6 전체에서 가장 많은 시간이 소요되는 유형입니다.
앞선 단계들의 핵심은 간단합니다. 단일 문장 빈칸 문제를 풀 때는 지문으로 돌아가 읽느라 시간을 허비하지 말고, 실제로 지문 독해가 필요한 1~2문제에 시간을 집중 투자하라는 것입니다.
이 측정 방식의 한계점
솔직하게 세 가지를 짚고 넘어가고자 합니다.
참조 모의고사 표본이 72개 빈칸에 불과합니다. 이는 모의고사 6회분에 포함된 모든 비(非)삽입 문항 빈칸의 총합으로 저희가 가진 데이터 전체이지만, 72개는 여전히 적은 수치입니다 — 따라서 48.6%라는 값의 신뢰구간 폭이 22%p로 매우 넓게 나타납니다. 반면 저희의 490개 표본은 전수 조사에 해당하여 신뢰구간이 훨씬 좁습니다.
채점자가 실제 응시자가 아닌 AI입니다. 채점자들이 판단한 기준은 '문장 단독으로 성립하는가' 여부이며, 이는 어디까지나 대체 지표일 뿐 실제 응시자의 정답률 그 자체는 아닙니다. 실제 난이도와 합리적인 상관관계를 가지지만, 두 개념이 완전히 동일한 것은 아닙니다.
저희는 개별 문항 단위가 아닌 전체 분포 차원에서만 타당성을 주장합니다. 마치 오차 범위가 ±5kg인 체중계로 한 사람의 몸무게를 재는 것은 의미가 없지만, 1,000명의 평균을 내면 집단 간 차이를 파악할 수 있는 것과 같습니다. 이 측정을 통해서는 "두 문제은행이 이 측면에서의 난이도 분포가 명백히 다르다"고 말할 수 있을 뿐, "이 특정 문제가 저 문제보다 문맥 의존도가 더 높다"고 말할 수는 없습니다.