전체 글 · 게시일 2026-08-04

Part 3의 어려움은 ‘누가 무슨 말을 했는가’에 ‘정답의 표현이 얼마나 바뀌었는가’가 더해진 결과다——측정으로 확인한 사실과, 그에 따라 우리가 고친 두 가지

궁금한 분을 위한 기술 설명입니다. 난이도 시리즈는 Part별로 한 편씩 순서대로 공개하며, 이번이 세 번째 글입니다. Part 5의 난이도는 네 선택지 안에 모여 있고, Part 7의 난이도는 글 전체에 흩어져 있습니다. 대화 문제인 Part 3는 그 중간에 걸쳐 있습니다. 90초도 안 되는 대화 하나에 문제가 세 개 붙고, 난이도는 동시에 ‘들을 때 무슨 일이 일어나는가’와 ‘읽을 때 선택지가 어떤 식으로 쓰였는가’에서 생깁니다. 이 글에서는 우리 문제은행과 시중 모의고사 6회분을 <strong>항목별로 측정해 대조</strong>합니다——대화 길이, 발화 차례 수, 화자 수, 문제 유형 구성——그리고 어디를 맞췄고 어디를 의도적으로 더 어렵게 두었는지 설명합니다. 측정이 끝난 뒤 두 가지 빈틈——질문이 너무 얕고, 정답을 너무 쉽게 짐작할 수 있다는 점——을 발견했고, 이제 둘 다 메웠습니다. 문제은행의 575개 문항과 434개 선택지 세트를 다시 쓰고, 대화 108개도 새로 만들었습니다. 통계 지식은 전혀 필요하지 않습니다.

먼저 Part 3가 어떤 모양인지부터

실제 시험에서 Part 3는 대화 13개, 대화마다 3문제, 총 39문제입니다——듣기 전체에서 문항 수가 가장 많은 부분입니다(100문제 중 39문제). 각 대화는 한 번만 나오고, 세 문제는 문제지에 인쇄되어 있어 듣는 동시에 답해야 합니다.

현재 우리 문제은행에는 대화 694개, 2,082문제가 있습니다(이 글을 쓰는 동안 대화 586개, 1,758문제에서 이 수치까지 늘었고, 그 이유는 아래에 나옵니다). 하지만 ‘얼마나 많은가’는 핵심이 아닙니다. 중요한 것은 모양이 맞는가입니다. 그래서 시중 모의고사 6회분의 Part 3 대화 원문을 모두 추출해(어떤 자료를 참조했고 어떤 한계가 있는지는 뒤에서 한 절을 따로 할애해 설명합니다), 같은 자로 양쪽을 재었습니다.

항목 참조 시험지(6회, 대화 69개) 우리 문제은행(대화 586개)
대화당 단어 수 평균 85(중앙값 87, 범위 45–110) 평균 87(중앙값 89, 범위 43–148)
대화당 발화 차례 수 평균 4.5회 평균 5.4회
3인 대화 13.0%(매회 대화 13개 중 1–2개) 25.6%(대화 150개)

첫 번째 행은 안심할 만합니다. 길이가 거의 똑같습니다. 85대 87단어, 중앙값은 87대 89입니다. Part 3 대화가 어느 정도 길어야 하는지에 관해서는 우리가 빗나가지 않았습니다. (유일한 차이는 최댓값입니다. 우리 쪽 최장은 148단어, 참조 쪽 최장은 110단어입니다. 유난히 긴 소수의 대화는 우리 문제은행의 긴 꼬리일 뿐, 출제 구조의 일부는 아닙니다.)

진짜 차이는 두 번째와 세 번째 행에 있고, 둘은 같은 사실을 가리킵니다.

  • 단어 수는 같은데, 우리는 발화 차례를 더 많이 나눴습니다. 평균적으로 거의 한 차례가 더 많습니다. 단어 수는 그대로인데 차례가 늘었다는 것은 한 차례가 더 짧고, 화자가 더 자주 바뀐다는 뜻입니다.
  • 3인 대화의 비율은 참조 시험의 거의 두 배입니다. 실제 출제 구조에서는 매회 대화 13개 중 3인 대화가 1–2개인데, 우리 문제은행은 4분의 1까지 넣었습니다.

이 두 가지를 합치면 ‘추적 비용’이 됩니다. 그리고 3인 대화가 실제로 더 어렵다는 사실은 추측이 아니라 측정 결과입니다. 3인 대화 문제는 29.1%가 어려움으로 표시된 반면, 2인 대화는 19.1%뿐이었습니다. 사람이 한 명 늘면 해야 할 일도 하나 늘어납니다——내용만 듣는 것이 아니라 누가 말했는지도 기억해야 합니다. 문제가 “남자는 무엇을 제안하는가”, “두 번째 여자는 무엇을 걱정하는가”라고 직접 묻기 때문입니다.

다시 말해 우리 Part 3는 정보량이 아니라 추적에서 어렵습니다. 이 결론을 기억해 두면 아래의 ‘우리가 참조보다 8%포인트 어렵다’는 수치도 더 이상 미제가 아니라 설명 가능한 결과가 됩니다.

추출 방식에 관한 단서: 참조 시험지의 대화 원문은 해설서에 인쇄되어 있고 텍스트 레이어가 없어, 이미지 인식으로 복원했습니다(2단 편집은 텍스트 좌표를 이용해 다시 구성해야 했습니다. 그렇지 않으면 두 단이 한 줄로 읽힙니다). 6회분에 대화가 총 78개 있었고, 69개(88%)를 성공적으로 복원했습니다. 나머지는 인식 오류 때문에 신뢰할 수 있게 분리하지 못했습니다. 위 표의 참조 수치는 이 대화 69개의 통계입니다.


대화 한 편은 어떤 방향으로 어려워질 수 있는가

아래는 우리가 Part 3의 각 문항에 대해 실제로 계산하거나 표시한 주요 특성입니다. 이 시리즈의 다른 글과 마찬가지로, 이 목록은 뒤에서 거꾸로 여러분의 풀이 전략이 됩니다.

1. 화자 수와 발화 차례 수——추적 비용

2인 대화와 3인 대화의 차이, 그리고 대화가 몇 차례로 나뉘는지는 첫 절에서 설명했습니다. 3인 대화의 어려움은 정보량이 아니라 귀속에 있습니다. 같은 말이라도 누가 했느냐에 따라 세 문제 중 적어도 하나의 답이 달라집니다. 발화 차례 수는 이 문제의 연속형입니다——화자가 바뀔 때마다 주의를 새 화자에게 다시 걸어야 합니다.

2. 문제 유형——무엇을 하라고 요구받는가

우리는 문제의 문구를 바탕으로 각 문항이 실제로 무엇을 묻는지 역추적하는 프로그램을 만들었습니다. 이 프로그램은 우리 문제은행 전체뿐 아니라 참조 시험 6회분의 Part 3 문제 230개도 전부 처리했습니다——같은 프로그램으로 두 문제은행을 분석해야 비교에 의미가 있습니다.

문제 유형 참조 시험 개정 전 개정 후 해야 할 일
세부 사항 문제 35.7% 52.8% 35.7% 언급된 사실 하나를 찾아내기
요청/제안 11.7% 4.3% 11.6% 누가 누구에게 무엇을 해 달라고 하는지 파악하기
시각 자료 연계 문제 7.8% 2.4% 7.8% 음원과 표를 대조해 답 찾기
이유 문제(Why…?) 7.4% 16.4% 7.4% 보통 두 차례의 발화에 걸친 인과관계 찾기
장소 문제 6.5% 2.7% 6.4% 장소가 어디인지 파악하기
다음 행동(What will… do next?) 6.5% 4.4% 6.5% 대화가 끝난 뒤 일어날 일 파악하기
추론 문제 6.5% 1.1% 6.5% 두 사실을 결합해 말로 드러나지 않은 결론 내리기
화자 의도 문제 5.7% 0.9% 5.9% “이 말을 한 의도는 무엇인가?”
문제점(What problem…?) 4.3% 6.3% 4.2% 불평하거나 지적한 장애 요인 포착하기
신분 문제 3.5% 1.1% 3.5% 화자가 누구인지 파악하기
주제 문제 3.0% 1.9% 2.9% 어느 한 문장이 아니라 대화 전체 요약하기
목적 문제 1.3% 1.8% 1.3% 이 전화/대화가 왜 이루어졌는지 파악하기
시간/수량 문제 0% 3.8% 0.3% 한 지점의 정보 찾기
추론형 문제 합계 30.9% 12.6% 31.9%

이 표는 앞 절의 표보다 훨씬 중요합니다. 여기서 말하는 것은 눈금이 아니라 내용이기 때문입니다.

개정 전에는 참조 시험의 세부 사항 문제가 3분의 1에 불과했지만, 우리는 절반이 넘었습니다. 반대로 한 단계 더 생각해야 하는 유형——추론, 의도, 주제, 목적, 다음 행동, 시각 자료 연계——은 참조 시험에서 30.9%였지만 우리는 12.6%로 절반도 되지 않았습니다. 당시 결론은 이랬습니다. 실제 출제 구조에서 ‘듣고 이해한 뒤 한 단계 더 생각하기’를 요구하는 비율은 우리의 두 배가 넘었습니다.

그 버전은 이미 모두 고쳤습니다. 위 표의 네 번째 열이 현재 문제은행입니다. 14가지 문제 유형이 모두 참조 시험과 2%포인트 이내로 맞아떨어지고, 추론형 합계는 31.9%대 30.9%입니다.

이 격차를 메우는 데에는 전혀 다른 두 가지 방식이 쓰였습니다. 분명히 설명할 가치가 있습니다.

  • 11가지 문제 유형은 ‘묻는 방식을 바꾸는’ 방법으로 보충했습니다. 같은 대화와 같은 음원을 두고 문제 자체를 다시 썼습니다——다른 것을 묻고, 선택지도 완전히 새로 만들었습니다. 문제 음성은 각자 독립된 클립이므로 음원은 한 단어도 손대지 않았습니다. 이렇게 만든 것은 실제로 다른 문제이지, “왜…?”를 다른 말로 바꾼 것이 아닙니다. 후자는 수치만 보기 좋게 할 뿐 문제를 더 어렵게 만들지는 않습니다.
  • 시각 자료 연계 문제와 화자 의도 문제는 보충만으로 해결할 수 없어 새로 써야 했습니다. 시각 자료 연계 문제는 대화가 대조할 정보의 한쪽만 정확히 언급해야 합니다. 의도 문제는 어떤 말의 문자 그대로의 뜻과 실제 뜻이 달라야 합니다——기존 49만 단어 분량의 대화에서 이런 표현은 2곳밖에 찾지 못했습니다. 따라서 이 두 유형은 새로 쓴 대화 108개(새로 녹음한 음원 포함)를 통해 들어왔고, 이 부분이 전체 작업에서 가장 오래 걸렸습니다.

이참에 두 가지도 함께 고쳤습니다. 시간/수량 문제는 3.8%에서 0.3%로 줄였습니다(참조 시험 6회에는 단 한 문제도 없었습니다. 6회 내내 쓰지 않은 것이 우연일 가능성은 낮습니다——“그들은 몇 시에 만나는가” 같은 단일 정보 받아쓰기는 Part 2에 더 가까운 일입니다). 또 선택지의 정답 위치도 손봤습니다. 새 문제는 한때 정답의 70%가 A에 몰렸지만, 지금은 네 글자가 각각 4분의 1을 차지합니다.

마지막으로 이 분류기를 진지하게 받아들여도 좋다는 근거가 되는 성질이 하나 있습니다. 분류기는 난이도 라벨을 본 적이 없는데도 라벨과 일치하는 순서로 문제 유형을 배열했습니다——화자 의도 문제는 96.7%가 어려움으로 표시되었고, 추론 문제는 58.6%, 이유 문제는 33.6%였습니다. 반면 목적 문제는 0.8%, 수량 문제는 0%뿐이었습니다. 답을 본 적 없는 분류기가 이 순서를 재현할 수 있어야 ‘문제 유형’이라는 특성에 정말 정보가 있다고 볼 수 있습니다.

(참조 열 역시 이미지 인식으로 얻었습니다. 6회분 총 234문제 가운데 230문제(98%)를 성공적으로 복원했습니다. 서로 독립적인 두 가지 확인 결과 덕분에 추출이 왜곡되지 않았다고 판단합니다——프로그램이 센 시각 자료 연계 문제는 정확히 매회 3.0문제, 의도 문제는 매회 약 2.2문제로, 이전에 전혀 다른 방법으로 측정했던 출제 구조의 할당량과 일치했습니다.)

3. 바꿔쓰기 거리——정답의 표현이 원문에서 얼마나 멀어졌는가

이것은 Part 3에서 가장 치명적인 항목이며, 아래에서 다룰 두 번째 구멍의 주인공이기도 합니다.

대화에서는 이렇게 말합니다. I'll revise the interview guide before tomorrow's sessions. 너무 쉬운 선택지는 이렇습니다. Revise the interview guide(그대로 베끼기). 실제 시험의 선택지는 이렇습니다. Update some materials——‘revise’가 ‘update’로, ‘interview guide’가 ‘materials’로 바뀝니다. 뜻은 같지만 단어는 전부 달라집니다.

차이는 전자는 키워드 대조만으로 맞힐 수 있지만 후자는 반드시 이해해야 한다는 데 있습니다. 우리는 모든 문항에서 선택지와 원문의 어휘 중복도를 계산했습니다.

4. 함정 밀도——정답처럼 보이는 오답 선택지

바꿔쓰기 거리의 거울상입니다. 오답 선택지에 대화에서 실제로 나온 단어를 넣어 키워드만 훑는 사람을 낚습니다. 현재 우리 문제은행의 평균은 정답 선택지와 원문의 어휘 중복도가 0.72, 오답 선택지는 0.21입니다. 차이가 너무 큽니다——바로 이것이 문제입니다. 다음 절에서 설명하겠습니다.

5. 근거 위치와 문제 순서

우리는 각 문항에 근거 문장(대화의 어느 문장을 바탕으로 답을 정하는지)을 표시했습니다. 모든 문항에 있어 적용률은 100%입니다. 앱에서 답을 고른 뒤 대본의 해당 문장이 바로 강조되는 것도 이 때문입니다.

근거 위치가 있으면 매우 실용적인 사실을 하나 측정할 수 있습니다. 세 문제의 근거는 94%가 음원의 순서대로 등장합니다. 첫 문제의 답은 앞부분에, 세 번째 문제의 답은 뒷부분에 있습니다. 실제 시험도 이렇게 설계되므로 이는 우리의 단순화가 아닙니다——활용할 수 있는 규칙이며, 전략 절에서 사용법을 설명하겠습니다.

6. 시각 자료 연계 문제와 의도 문제——구조상 정해진 할당량

참조 시험은 6회 내내 변동 없이 고정되어 있습니다. 매회 Part 3에 시각 자료 연계 문제 3개, 화자 의도 문제 2개가 나옵니다. 이는 출제 구조이지 우연이 아닙니다.

우리 문제은행에는 원래 두 유형이 모두 없었습니다. 지금은 둘 다 있으며, 문항 수보다 더 중요한 점은 모의고사가 이 할당량에 맞춰 문제를 뽑는다는 것입니다. 운에 맡기지 않습니다. 어떤 유형이 문제은행에 있어도 모의고사에서 절대 만나지 못한다면 없는 것과 같습니다.


참조 시험과 비교해 나온 결과: 우리가 더 어렵고, 바꿀 생각은 없다

눈금을 스스로 만들어서는 안 됩니다. 외부 참조에 맞춰야 합니다. 우리가 사용한 자료는 《全新!新制多益 TOEIC 題庫解析 狠準 6 回》(Hackers Academia 저, 國際學村 출판)입니다——6회분이 완전하게 들어 있고, 모든 문항에 출판사 자체 난이도 등급(상/중/하)이 인쇄되어 있어 1,200개의 전문 판단을 바로 대조할 수 있었습니다.

Part 3의 결과는 다음과 같습니다.

하(쉬움) 상(어려움)
참조 시험(205문제) 41% 47% 12%
우리 문제은행 23.8% 54.5% 21.7%

우리가 어려움으로 표시한 문제는 참조 시험보다 약 8%포인트 많습니다.

이런 차이가 보일 때 가장 먼저 물어야 할 것은 ‘조정할 것인가’가 아니라 ‘내용의 차이인가, 자의 차이인가’입니다. 이 시리즈의 Part 5 글에서 이미 한 번 보여 드렸습니다. 그쪽은 라벨이 참조 시험과 크게 달라 보였지만, 파고들어 보니 우리 문제는 구조상 조금도 더 쉽지 않았습니다——달랐던 것은 양쪽이 ‘어려움’을 정의하는 방식이지 문제 자체가 아니었습니다. 이 점을 먼저 구분한 뒤 내용을 손댈지 결정하는 것이 이 시리즈 전체에서 가장 실용적인 교훈입니다.

Part 3의 이 8%포인트는 Part 5와 반대 방향이고, 우리의 처리 방식은 그대로 둔다입니다.

이유는 두 겹입니다. 첫째, 두 자는 애초에 서로 환산할 수 없습니다——한쪽은 편집자의 판정이고 다른 쪽은 출제자의 판단이며, 8%포인트의 차이는 잡음과 실제 차이 모두로 설명할 수 있는 범위입니다. 둘째, 더 현실적인 이유로, 연습 문제은행이 기준에서 어느 한쪽으로 치우쳐야 한다면 더 어려운 쪽이 학습자에게 안전합니다. 시험보다 어렵게 연습하면 실전에서 여유가 생기지만, 반대라면 뜻밖의 일이 생깁니다.

우리가 더 어려운지는 첫 절의 표가 이미 답을 주었고, 그 답은 ‘우리가 더 엄격해서’ 같은 말보다 훨씬 탄탄합니다. 우리 대화는 참조 시험보다 길지 않지만 발화 차례가 더 많고, 3인 대화는 두 배입니다. 3인 대화 자체에 어려운 문제가 10%포인트 더 많고(29.1%대 19.1%), 우리 문제은행에서 차지하는 비율은 25.6%인 반면 참조 시험에서는 13.0%입니다. 이 한 항목의 비중 차이만으로도 라벨상의 8%포인트 가운데 대부분을 설명할 수 있습니다.

다시 말해 우리가 모든 문항을 더 까다롭게 쓴 것이 아니라, 원래부터 더 어려운 종류의 대화를 문제은행에 더 많이 넣은 것입니다. 차이의 원인이 ‘기법’이 아니라 ‘구성’임을 알아야 비로소 제대로 규명한 셈입니다——언젠가 이를 되돌리려면 개별 문제를 고칠 것이 아니라 3인 대화의 비중을 조정해야 합니다.

하지만 당시 반드시 짚어야 했던 모순이 하나 있었고, 그것이 다음 절의 도입부이기도 합니다. 라벨은 우리가 더 어렵다고 하는데, 문제 유형 구성은 우리가 더 얕다고 말했습니다. 같은 문제은행에서 듣는 쪽(3인, 다회 발화)은 더 어렵고, 묻는 쪽(절반 이상이 세부 사항 문제)은 더 쉬웠습니다. 두 사실 모두 측정 결과이며 둘 다 진짜입니다. 바로 이 때문에 우리는 난이도 라벨을 결론으로 삼지 않습니다——라벨은 출제자가 ‘얼마나 복잡하게 들리는가’를 느낀 결과이지, ‘이 문제에서 얼마나 어려운 일을 하라고 요구하는가’를 반영한 것이 아닙니다.

솔직히 밝혀 둘 단서

  • 참조 도서는 출판사의 모의고사이지 ETS 공식 자료가 아닙니다. 형식 면에서는 매우 신뢰할 만합니다(6회 사이에 거의 변동이 없다는 점이 공식 구조를 충실히 복제한 모습입니다). 그러나 난이도는 실제 수험자의 정답률이 아니라 편집자의 판단을 담고 있습니다.
  • Part 3의 난이도 라벨은 출제자가 붙였으며, 규칙으로 계산한 것이 아닙니다. 이것이 Part 3와 Part 1의 핵심 차이입니다. Part 1은 모든 라벨을 프로그램 하나가 문제 자체에서 다시 계산했고 문제은행 335개 문항과 전부 일치했습니다. Part 3에는 아직 그런 것이 없습니다. 위의 특성 목록 가운데 일부(인원, 길이, 문제 유형, 근거 위치, 어휘 중복)는 이미 측정하고 있지만, 라벨을 덮어쓸 하나의 난이도 점수로 아직 합치지 못했습니다. 따라서 우리가 말하는 Part 3의 난이도 분포는 출제자 집단이 내린 판단의 분포입니다.
  • 더 객관적인 심판을 찾으려다 실패한 적도 있습니다. AI 모델을 ‘모의 수험자’로 삼아 참조 시험을 풀게 하고, 정답률이 출판사가 표시한 난이도 순서를 재현하는지 보려는 구상이었습니다——된다면 두 문제은행을 동시에 잴 자가 생깁니다. 결과는 이랬습니다. 성능이 한 자릿수 차이 나는 두 모델의 정답률은 각각 89.8%/89.9%였고, 난이도에는 전혀 반응하지 않았습니다(상관계수는 약 0). 이유는 어렵지 않게 이해할 수 있습니다. 학습자를 막는 것은 단어와 연어에 대한 숙달인데, 쓸 만한 모델이라면 이미 갖추고 있기 때문입니다. 이 자는 버렸지만 기록할 가치는 있다고 판단했습니다.
  • 진짜 종착점은 여전히 정답률입니다. 익명 응답 통계가 쌓이면 각 문항은 차츰 실제 p값을 얻게 됩니다. 그전까지는 이것이 우리가 할 수 있는 가장 정직한 측정 방식입니다.

우리가 직접 측정해 찾아낸 두 구멍, 이제 모두 메웠다

이 절은 전체 모습을 보고 싶은 분을 위해 씁니다. 위의 라벨 차이 8%포인트는 사실 이 글에서 가장 중요하지 않은 수치입니다——눈금의 문제이기 때문입니다. 진짜 문제는 두 가지이며, 둘 다 내용의 문제이고 우리가 직접 측정해 찾아냈습니다.

구멍 하나: 질문이 너무 얕다——이 구멍은 이제 메웠다

바로 문제 유형 표의 이야기입니다. 원래 세부 사항 문제는 52.8%로 참조 시험의 35.7%보다 많았고, 추론형 문제 합계는 12.6%로 참조 시험의 30.9%보다 적었습니다. 이는 우리 Part 3 전체를 연습한 사람이 ‘듣고 이해한 뒤 한 단계 더 생각하기’를 연습하는 양이 실제 시험에서 요구되는 양의 약 40%에 불과하다는 뜻입니다. 대화에서 언급된 사실 하나를 찾아내는 데에는 매우 능숙해지겠지만, 추론, 의도, 그리고 ‘남자가 여자에게 무엇을 해 달라고 하는가’처럼 통합이 필요한 문제 유형은 연습량이 심각하게 부족했습니다.

이제 14가지 문제 유형이 모두 참조 시험과 2%포인트 이내로 맞아떨어지고, 추론형 합계는 31.9%대 30.9%입니다. 방법은 제2절에서 설명했습니다. 575개 문제를 다시 쓰고, 새로운 대화 108개와 새 음원을 더했습니다. 그 결과 문제은행도 1,758문제에서 2,082문제로 늘었습니다.

솔직하게 표시해 둘 점이 하나 있습니다. 이 수치는 우리 자체 분류기로 측정했습니다. 같은 프로그램으로 참조 시험도 처리했으므로 양쪽의 정의는 일치합니다. 하지만 결국 문제 문구에서 역추적한 결과이지, ‘이 문제가 실제로 얼마나 어려운가’에서 역추적한 결과는 아닙니다. 문제 유형을 맞췄다고 난이도까지 맞는 것은 아닙니다——그건 사용자의 실제 응답 데이터가 돌아와야 알 수 있습니다.

구멍 둘: 정답을 너무 쉽게 짐작할 수 있다——이 구멍도 메웠다

당시 Part 3에서는 653문제(37%)의 정답 선택지를 키워드 대조만으로 맞힐 수 있었습니다.

이는 scripts/option_source_overlap.py 스캔 프로그램의 결과입니다. 이 프로그램은 문항마다 정답 선택지와 음원 대본의 어휘 중복을 비교하고, 정답 선택지의 중복도가 세 오답 선택지보다 뚜렷하게 높으면 표시합니다. 새로운 발견은 아닙니다——이 문제는 처음에 한 사용자가 제보했습니다. 일부 문항은 “이해하지 않아도 키워드만 대조하면 풀린다”는 지적이었습니다. 이를 바탕으로 대규모 개정 작업을 벌여 Part 3의 선택지 576개를 다시 썼습니다(Part 4, Part 7까지 합하면 1,511개).

지금은 28문제(1.3%)이며, 이 28문제는 모두 의도적으로 남겼습니다(아래에서 설명합니다). 실제로 고쳐야 할 문제는 하나도 남지 않았습니다.

이 수치는 두 단계에 걸쳐 내려왔습니다.

  1. 앞 절에서 말한 575개 문제 개정이 절반 이상을 함께 없앴습니다. 다시 쓴 모든 문제는 같은 스캐너의 검사를 통과해야 데이터베이스에 들어갈 수 있었으므로, 문제 유형을 맞추는 동시에 문제은행의 5분의 1에서도 이 문제가 해결됐습니다. 이 절을 시작할 때는 이미 462문제(22.2%)까지 줄어 있었습니다.
  2. 남은 434문제는 하나씩 직접 고쳤습니다. 방법은 두 가지였고, 두 번째가 핵심입니다. 정답 선택지는 바꿔 써서 표현했고, 바꿔쓰기만으로 부족할 때는 대본의 단어를 오답 선택지에 넣었습니다. 실제 시험이 바로 이런 모양입니다——원문을 그대로 옮긴 것이 함정이지 정답이 아닙니다.

실제 사례를 하나 들어 보겠습니다. 음식 주문에 관한 대화에서 남자는 마지막에 이렇게 말합니다. “3시 전에 방 번호를 보내 주시면 주문을 변경할 수 있어요.” 문제는 “여자는 무엇을 보내 달라는 요청을 받았는가?”라고 묻습니다.

개정 전 네 선택지는 방 번호/손님 명단/결제 영수증/메뉴 가격표였습니다. 음원에 나온 단어는 ‘방 번호’뿐이고, 나머지 세 선택지의 단어는 하나도 나오지 않았습니다. 그 문장의 뜻을 이해할 필요도, 심지어 누가 누구에게 말하는지 알 필요도 없었습니다——들은 단어와 선택지를 한 번 맞춰 보면 끝이었습니다.

개정 후 정답 선택지는 같은 뜻을 바꿔 쓴 ‘행사가 열리는 장소’입니다. 그리고 오답 중 하나는 ‘채식 식사의 수량’으로 바꿨습니다——이 단어들은 모두 음원에 나옵니다(여자가 앞에서 채식 식사를 다섯 개 추가해 달라고 말했습니다). 듣기에도 완전히 그럴듯합니다. 이제 단어가 맞아떨어지는 쪽은 오답입니다. 맞히려면 남자가 요구한 것이 방 번호이지 식사 수량이 아니라는 점을 이해해야 합니다.

그 28문제는 왜 고치지 않았을까요? 원래부터 정답을 바꿔 쓸 수 없기 때문입니다. 시각 자료 연계 문제의 네 선택지는 자료에 나온 행의 표기(‘6번 원뿔’, ‘4번 하역 구역’)이므로 그대로 적어야 합니다. 지명, 인명, 금액도 마찬가지입니다. 실제 시험도 똑같이 출제합니다. 우리는 문항별 이유를 적어 이들을 accepted.json에 등록했습니다. 그래야 스캐너의 수치를 의미 있게 읽을 수 있고, 프로그램을 조용히 시키려고 더 나쁜 표현으로 바꾸는 일도 피할 수 있습니다.

측정의 관점에서 말하면 정답 선택지와 원문의 어휘 중복도는 0.72에서 0.39로 낮아졌고, 오답 선택지는 0.25입니다. 두 수치가 이미 가까워졌으며, 바로 이것이 처음에 말한 ‘이상적인 Part 3의 모습’입니다.

솔직한 말을 하나 더 보태야 합니다. 스캐너를 통과했다는 것은 ‘공통 어휘가 더 이상 정답을 누설하지 않는다’는 뜻일 뿐, 문제가 더 어려워졌다는 뜻은 아닙니다. 진짜 검증은 여전히 사용자의 정답률입니다.

두 구멍은 원래 같은 문제의 양면이었습니다. 하나는 우리가 충분히 깊게 묻지 않았다는 것이고, 다른 하나는 정답을 너무 쉽게 주울 수 있게 했다는 것입니다. 둘을 합치면 ‘듣기에는 어려운데 풀어 보면 쉬운’ Part 3가 됩니다——앞 절의 모순과 정확히 대응합니다. 양쪽을 모두 메운 뒤에는 그 모순도 사라졌습니다.

더 어려운 한계가 하나 더 있다

우리 문제은행의 언어 사용역은 너무 한결같습니다. 대화와 독백 총 1,018개(거의 49만 단어) 안에 관용어가 2개뿐이며, ‘I guess’, ‘to be honest’ 같은 구어 표지는 하나도 없습니다. 이 사실은 화자 의도 문제를 보충하다 발견했습니다——의도 문제에는 ‘문자 그대로의 뜻과 실제 뜻이 다른’ 인용문이 필요한데, 찾을 수 없어 새로 써야 했습니다. 그러므로 부족했던 것은 그 문제 유형이 아니라 구어체 자체의 느슨함이었습니다.

구멍 하나를 메우는 일이 왜 그렇게 오래 걸렸는지도 이로써 설명됩니다. 의도 문제와 추론 문제에 필요한 것은 단지 질문 방식을 바꾸는 일이 아니라, 대화 자체에 먼저 추론할 만한 내용이 있어야 한다는 것입니다——마지막 대화 108개는 고쳐 쓴 것이 아니라 새로 썼습니다. 이는 새로운 콘텐츠를 만들 때마다 여전히 유효한 제약입니다.


구조를 알았다면: Part 3는 어떻게 듣고 어떻게 풀 것인가

위의 특성 목록을 거꾸로 읽어 봅시다.

세 문제가 곧 듣기의 개요다——반드시 먼저 읽기

Part 3에서 가장 가치 있는 단 하나의 습관은 음원이 시작되기 전에 세 문제의 질문을 모두 읽는 것입니다. 문제는 문제지에 인쇄되어 있고, 규정상 허용될 뿐 아니라 이 파트의 설계 전제이기도 합니다. 세 문제를 다 읽으면 이름을 들어야 하는지, 시간을 들어야 하는지, 특정인의 제안을 들어야 하는지 알 수 있습니다——‘대화 전체를 기억하려고 애쓰는 상태’에서 ‘특정한 세 가지가 나오기를 기다리는 상태’로 바뀝니다.

앞 문제의 해설이 나오는 동안 손에 시간이 남으면 아래 문제를 읽으세요. 이것이 Part 3에서 가장 중요한 리듬입니다.

순서를 믿어라: 94%의 문제는 음원을 따라간다

첫 문제의 답은 거의 반드시 대화 앞부분에, 세 번째 문제의 답은 뒷부분에 있습니다. 그러니 들으면서 아래로 계속 나아가세요. 첫 문제의 답을 들으면 바로 고르고, 주의를 즉시 두 번째 문제로 넘기세요. 대화가 끝난 뒤 첫 문제를 다시 생각하지 마세요——그때는 문제와 싸우는 것이 아니라 기억과 싸우게 됩니다.

동시에 이 원칙은 손절 신호도 줍니다. 대화가 이미 끝나 가는데 첫 문제의 실마리가 없다면 그 문제는 놓고 두 번째와 세 번째 문제를 지키세요. 대화 하나에서 한 문제를 잃는 것이 세 문제를 잃는 것보다 훨씬 낫습니다.

‘누가 말했는가’를 정보로 기억하라

문제에는 the man / the woman / the second speaker라고 쓰입니다. 특히 3인 대화에서 그렇습니다. 실전에서는 제안, 불평, 약속 같은 말을 들을 때 누가 했는지도 함께 기억하세요(남/여, 또는 몇 번째 사람). 내용을 맞게 기억해도 사람을 틀리면 답은 여전히 틀립니다——이것이 바로 3인 대화에서 어려운 문제가 10%포인트 더 생기는 이유입니다.

‘들은 말과 똑같은’ 선택지는 더 경계하라

함정 밀도라는 특성이 가르쳐 주는 점입니다. 선택지의 단어가 방금 들은 말과 한 글자도 다르지 않다면 먼저 의심하세요. 출제자는 시간에 쫓기는 사람이 키워드에 의존한다는 것을 압니다. 그래서 가장 손쉬운 함정은 원문의 단어를 잘못된 사람, 잘못된 시간, 잘못된 일에 붙이는 것입니다. 반대로 원문을 완전히 바꿔 쓴 선택지가 정답인 경우가 많습니다——실제 시험의 정답은 보통 그런 모습입니다.

(이 때문에 앞 절의 653문제가 우리에게 정말 중요했습니다. 현재 우리 문제은행은 이 점에서 실제 시험의 방식을 아직 완전히 따라잡지 못했습니다.)

특별히 다뤄야 할 세 가지 문제 유형

  • 다음 행동 문제(What will the man do next?)——답은 거의 항상 마지막 한두 문장에 있습니다. ‘I'll…’, ‘Let me…’, ‘I'd better…’가 들리면 바로 그것입니다. 대화 전체에서는 긴장을 풀어도 되지만 마지막 두 문장에서는 반드시 깨어 있어야 합니다.
  • 의도 문제(What does the woman mean when she says, "…"?)——인용된 문장은 문자 그대로 보면 대개 별것 없어 보이고, 진짜 답은 그 앞뒤 문장에 있습니다. 따옴표 안의 단어에 매달리지 말고 “이 말은 무엇에 대한 반응인가”라고 물으세요.
  • 시각 자료 연계 문제——음원이 나오기 전에 자료를 먼저 보고, 표의 열이 무엇을 뜻하는지 파악하세요(시간과 회차? 가격과 요금제?). 답은 언제나 ‘음원이 한 열을 주고, 시각 자료가 다른 열을 주는’ 식이며, 여러분이 할 일은 둘을 잇는 것입니다. 표를 먼저 읽으면 시작 전에 절반을 끝낸 셈입니다.

마지막으로: 여기서는 다시 할 수 없다

Part 3는 두 번 들려주지 않고 되돌아갈 수도 없습니다. 듣기 전체는 45분 동안 정해진 속도로 진행되며, 한 대화에서 뒤처지면 계속 뒤처집니다. 따라서 위 전략의 공통 목적은 사실 하나뿐입니다. 항상 다음 문제에 머물고, 이전 문제에 머물지 않는 것.


한 문장으로 요약

Part 3의 난이도는 측정 가능한 세 곳에서 나옵니다. 몇 명을 몇 차례에 걸쳐 추적해야 하는가, 문제가 얼마나 어려운 일을 요구하는가, 그리고 정답의 표현이 얼마나 많이 바뀌었는가입니다.

같은 프로그램으로 우리 문제은행과 시중 모의고사 6회분을 모두 분석한 결과, 세 가지 답은 이렇습니다. 대화 길이는 실제 출제 구조와 거의 똑같지만 우리의 발화 차례가 더 촘촘하고 3인 대화는 두 배입니다——이는 어려운 문제가 8%포인트 더 많은 이유를 설명하며, 우리는 그대로 두기로 했습니다. 문제 유형 구성에서는 질문이 너무 얕아 추론형 문제가 실제 비율의 40%밖에 되지 않았습니다. 선택지의 37%는 키워드 대조만으로 정답을 맞힐 수 있었습니다. 뒤의 두 항목은 콘텐츠의 빚이었고, 우리는 다 고친 뒤에야 말한 것이 아니라 바로 여기에 기록했습니다.

같은 목록을 거꾸로 읽으면 여러분의 풀이 전략이 됩니다. 세 문제를 먼저 읽고, 음원의 순서를 따라가고, 누가 말했는지 기억하고, 들은 말과 똑같은 선택지를 의심하세요.

← 전체 글