전체 글 · 게시일 2026-08-04

'문제풀이'를 위한 변론: 비트겐슈타인, 언어학자, 기억과학, 그리고 AI의 공동 증언

'문제풀이'라는 말에는 태생부터 오명이 붙어 있습니다. 학원가의 발명품처럼 들리고, 주입식 교육의 유산처럼 들리고, "시험은 잘 보는데 영어는 못 하는" 현상의 주범처럼 들립니다 — 진짜 언어 학습은 어딘가 다른 곳에 있고, 문제풀이는 그 값싼 대용품일 뿐이라는 듯이 말이죠. 이 글은 그 문제풀이를 진지하게 변호해 보려는 시도입니다. 증인석에 서는 이들은 20세기의 가장 중요한 언어철학자, 실제 언어 자료를 직접 세어 본 언어학자들, 백 년 넘게 검증되어 온 기억과학의 여러 효과 — 그리고 뜻밖의 증인, 거대 언어 모델 본인입니다. 결론부터 말하자면: 문제풀이는 언어 학습의 샛길이 아닙니다. 영어권으로 이주할 수 없는 한, 그것은 정공법에 가장 가까운 길입니다.

혐의는 무엇인가

먼저 고발장을 끝까지 들어 봅시다. 진지하게 받아들일 가치가 있는 고발이니까요.

비판은 대략 이렇습니다: 언어는 소통하려고 배우는 것이지 시험 보려고 배우는 것이 아니다. 하루 종일 객관식 문제만 풀어서 길러지는 것은 '시험 기술' — 소거법, 키워드 대조, 유형별 감각 — 이지 언어 자체가 아니다. 그래서 동아시아 수험생들이 "점수는 높은데 말은 못 한다"는 소리를 듣는 것이고, 그래서 '문제풀이'(줄여서 '문풀')라는 말이 학습이라기보다 시험에 대한 건강하지 못한 집착처럼 들리는 것이다.

이 고발이 그럴듯하게 들리는 이유는, 그 밑에 자명해 보이는 전제 하나가 숨어 있기 때문입니다:

언어란 규칙의 집합에 단어 목록을 더한 것이다. 규칙을 익히면 그 언어를 '할 줄 아는' 것이고, 문제는 할 줄 아는지를 재는 도구일 뿐이다. 측정을 반복한다고 측정 대상이 나아지지는 않는다.

이 전제가 옳다면 문제풀이는 정말로 수상합니다 — 건강검진을 백 번 받아도 몸이 건강해지지는 않으니까요.

문제는 이 전제가 틀렸다는 것입니다. 그리고 이 전제가 무너진 과정은 철학사에서 가장 유명한 '전향' 중 하나였습니다.


생각을 바꾼 철학자

Ludwig Wittgenstein(비트겐슈타인)은 책을 두 권 썼습니다. 언어를 바라보는 두 가지 관점을 각각 체현한 두 권이고 — 두 번째 책은 첫 번째 책을 허물기 위해 쓰였습니다.

첫 책 『논리-철학 논고』의 주장은 언어의 본질이 논리라는 것입니다. 문장은 사실의 그림이며, 논리 구조를 끝까지 분석하면 언어는 투명해진다. 이 책을 출간했을 때 그는 철학의 문제가 대부분 해결되었다고 여기고, 오스트리아 시골로 내려가 초등학교 교사가 됩니다. 이 전제가 앞 절의 그 전제와 얼마나 닮았는지 눈여겨보세요. 언어가 정말로 간결한 규칙 체계로 환원된다면, '규칙을 배우는 것'이 정도(正道)이고 '대량 노출'은 그저 먼 길일 것입니다.

그런데 그가 생각을 바꿉니다. 철학자가 공개적으로 자기 학설을 뒤집는 것은 희귀한 사건입니다 — 대부분은 젊은 시절의 논문을 평생 방어하며 삽니다 — 게다가 비트겐슈타인이 뒤집은 것은 자신의 출세작이었습니다. 후기의 『철학적 탐구』는 초기 입장을 거의 조목조목 해체해 나가는데, 거기서 떠오르는 핵심 주장은 이렇습니다. 단어의 의미는 정의 속에 있지 않고, 언어 속에서의 실제 쓰임 속에 있다. 언어는 허공에 떠 있는 논리 체계가 아니라 생활 속에 박혀 있는 무수한 '언어놀이'이며, 하나의 언어를 상상한다는 것은 하나의 삶의 형식을 상상하는 일입니다.

그는 학습자에게 특히 중요한 논증도 하나 남겼습니다. 훗날 '규칙 따르기 역설'이라 불리게 된 것입니다: 명시적으로 진술된 어떤 규칙도 자신이 어떻게 적용되어야 하는지까지는 결정하지 못한다 — 규칙을 쓰려면 '이 규칙을 어떻게 쓰는지 아는' 능력이 언제나 별도로 필요한데, 그 능력 자체는 더 이상 규칙이 아니라 실천 속에서 길러지는 감각이다. 수험의 언어로 번역하면 이렇습니다: 문법책의 모든 규칙은 '이미 충분히 많은 실례를 본' 독자를 전제한다. 규칙은 사후 정리이지, 사전 생성기가 아닙니다.

가장 흥미로운 것은 언어의 출발점을 묘사할 때 그가 고른 단어입니다. 아이가 모국어를 익히는 과정을 논하면서 그가 쓴 독일어 단어는 Abrichtung — 평소에는 동물 조련에 쓰이는 말로, 우리말로 옮기면 '훈련', '조련'쯤 됩니다. 그의 서술에서 언어 교육은 "설명이 아니라 훈련"입니다. 20세기의 가장 깊이 있는 언어철학자가 언어 학습을 묘사하며 고른 은유가 '해설'보다 '반복 훈련'에 훨씬 가까웠다는 이야기입니다.

바로 이것이 우리가 앱의 '팀 소개' 페이지에 이렇게 쓴 이유이기도 합니다: give와 in이라는 단어의 뜻을 각각 완벽히 안다고 해서, 이 둘이 합쳐진 give in이 '굴복하다(양보하다)'라는 의미가 된다는 걸 스스로 추론해 내기란 불가능에 가깝다 — 만약 언어가 그렇게 논리 정연하고 고분고분했다면, 진작에 여러분 앞에 give in 했을 것이라고.


언어학자들이 세어 보았다: 언어의 본체는 관습이다

철학이 방향을 제시했다면, 언어학은 숫자를 내놓았습니다.

1983년, Pawley와 Syder는 이후 이 분야가 피해 갈 수 없게 된 관찰 하나를 발표합니다: 문법 규칙이 생성하는 문장의 대부분은 "완벽하게 문법적이지만 아무도 그렇게 말하지 않는" 문장이라는 것입니다. 시간을 물을 때 문법은 "What is the hour?"도 "How late is it?"도 태연히 허가합니다(후자는 공교롭게도 네덜란드어의 발상입니다) — 모두 문법적으로 옳지만, 영어인 것은 "What time is it?" 하나뿐입니다. 원어민의 유창함은 규칙을 실시간으로 연산하는 데서 오는 것이 아니라, 거대한 관용 표현 저장고에서 바로 꺼내 쓰는 데서 옵니다.

코퍼스 언어학은 이후 이것을 정량화했습니다. Sinclair는 실제 코퍼스를 들여다본 끝에 '이디엄 원리(idiom principle)'를 제안합니다: 언어 사용의 제1원리는 규칙에 따른 자유 조립이 아니라 반제품 중에서 고르기라는 것입니다. Erman과 Warren(2000)은 실제로 세어 보았습니다: 진짜 영어 텍스트를 한 토막 집어 오면 그 대략 절반이 크고 작은 기성 조합으로 깔려 있습니다. Wray(2002)는 책 한 권 분량으로 같은 결론에 도달했습니다: 정형 표현은 언어의 자투리가 아니라 언어의 본체라고.

그리고 이 관습들은 정확히 논리로는 도출할 수 없는 것들입니다:

  • heavy rain을 strong rain으로 바꿀 수 없는데, strong coffee 역시 heavy coffee로 바꿀 수 없습니다;
  • 결정은 make a decision인데 숙제는 do homework입니다;
  • "Would you mind closing the window?"에 대한 승낙은 "Not at all" — 논리로 읽으면 "전혀 개의치 않아요", 관습으로 읽으면 "네, 닫아 드릴게요"입니다;
  • "You haven't sent the report, have you?"에 영어는 사실대로 "No"(안 보냈어요)라고 답하지만, 한국어 직관은 "네(아직 안 보냈어요)"라고 상대의 말에 동의하는 형태로 답합니다. 어느 쪽이 더 논리적이냐의 문제가 아니라, 서로 다른 두 관습일 뿐입니다.

이제 TOEIC이 무엇을 시험하는지 보십시오: Part 5는 연어(collocation)와 어법을, Part 2는 응답의 관습을, Part 3과 4는 직장 대화의 정해진 흐름을, Part 6과 7은 "Please find attached", "effective immediately" 같은 비즈니스 서신의 정형 표현을 시험합니다. 이것은 '수험 잡학'이 아니라 언어의 본체 그 자체입니다 — 언어학자들이 세어 본 결과 말뭉치의 절반을 차지한다던 바로 그 본체 말입니다. 좋은 TOEIC 문제은행이란, 본질적으로 '비즈니스 영어 관습 선집'을 객관식 판형으로 조판한 것입니다.


뇌는 원래 이렇게 배운다: 빈도와 통계

관습을 도출할 수 없다면 접촉해서 흡수하는 수밖에 없습니다. 다행히 뇌는 정확히 그 용도로 만들어져 있습니다.

Saffran, Aslin, Newport(1996)의 고전적 실험이 있습니다: 생후 8개월 된 아기는 인공 음절이 이어지는 소리를 단 2분 듣고도, 음절 연결의 통계적 규칙성만으로 '단어'의 경계를 잘라 냅니다. 뇌는 통계 기계입니다 — 그리고 통계 기계의 유일한 연료는 표본 수입니다.

Tomasello의 용법 기반 이론은 이 이야기를 언어 습득에 연결합니다: 아이는 문법을 먼저 받아 놓고 적용하는 것이 아니라, 하나하나의 구체적인 사용 장면으로부터 점점 더 추상적인 구문을 스스로 귀납해 냅니다. Nick Ellis(2002)는 그것을 제2언어로 연장했습니다: 성인의 외국어 학습도 대부분은 입력에 대한 암묵적 통계 집계입니다 — 한 번 한 번의 접촉이 어느 연어, 어느 구문에 한 표씩을 던집니다. 빈도는 보조 요인이 아닙니다. 주요인입니다.

이것은 사실 누구나 동의하는 그 조언 — "언어는 현지에 가서 사는 게 최고" — 의 원리이기도 합니다. 몰입 환경이 효과적인 이유는 공기 중에 영어가 떠다녀서가 아니라 복용량 때문입니다. 그 언어 속에서 산다는 것은 매일 수천 개의 관습 표본을 수동적으로 만나는 일이고, 그동안 통계 기계는 전속력으로 돌아갑니다. 비트겐슈타인이라면 이렇게 말할 겁니다: 당신은 그 삶의 형식에 참여한 것이라고.

이주할 수 없다면 복용량을 스스로 설계해야 합니다. 다독은 하나의 설계입니다. 문제풀이는 또 하나의 설계이고 — 다음 절에서 보듯, 실증된 이점을 가진 설계입니다.


기억과학: 풀기는 다시 읽기를 이기고, 틀리기는 안 틀리기를 이긴다

'대량 노출이 필요하다'까지는 인정한다고 합시다. 남는 질문은 하나입니다: 노출의 형식이 중요한가? 글 열 편을 읽는 것과, 해설 딸린 문제 열 개를 푸는 것은 같은 일인가?

같지 않습니다. 게다가 방향이 직관과 반대일 수 있습니다. 기억과학에서 가장 탄탄하게 재현되어 온 발견 중 하나가 '시험 효과'입니다: Roediger와 Karpicke(2006)는 같은 지문을 한 집단에게는 반복해서 읽게 하고, 다른 집단에게는 대신 시험을 치르게 했습니다. 일주일 뒤, 시험을 친 집단이 압승합니다. 다시 읽기는 "이제 알겠다"는 유창성의 착각만 키울 뿐, 흔적을 남기는 것은 인출입니다. Karpicke와 Blunt(2011)가 Science에 발표한 후속 실험은 더 셉니다: 인출 연습은 그 정교하다는 '개념도 그리기'까지 이겼습니다.

Bjork는 이 계열의 현상을 '바람직한 어려움(desirable difficulties)'으로 정리했습니다: 공부가 매끄럽게 느껴질수록 남는 것은 적고, 뇌가 애써서 꺼내 온 것이라야 자리를 잡는다. 그리고 문제를 푼다는 행위는 매번의 접촉을 강제로 인출로 바꿉니다 — 스와이프로 지나칠 수 없고, 반드시 판단을 내려야 하니까요.

틀리는 것조차 제 몫을 합니다. Kornell 등의 연구에 따르면, 먼저 틀리게 추측한 뒤 정답을 보는 쪽이 처음부터 정답을 보는 쪽보다 더 잘 기억됩니다. 그러니 오답 목록은 실패의 기록이 아닙니다 — 그것은 당신의 관습 공백 목록입니다. 한 문제에 하나씩, 좌표까지 찍혀서요. Part 5에서 "meet a deadline"을 한 번 놓치면 그 관습에는 당신 몫의 깃발이 꽂힙니다. 다음에 실제 이메일에서 마주칠 때, 그것은 더 이상 배경 소음이 아닙니다.

학습과학의 처방전과 문제풀이의 성질을 나란히 놓으면, 민망할 만큼 깔끔하게 맞아떨어집니다:

학습과학의 처방 문제풀이가 주는 것
진짜 관습에 대한 대량 노출 한 문제 한 문제가 농축된 관습 표본: 비즈니스 서신 한 통, 고객 전화 한 통, 살아 있는 응답 한 마디
다시 읽기가 아니라 인출 모든 문제가 판단을 강제 — 수동적인 훑어보기는 통하지 않음
즉각적인 피드백 맞았는지 그 자리에서 알고, 해설이 이유를 알려 줌
오류로부터의 학습 오답이 아직 내재화되지 않은 관습을 정확히 짚어 줌
간격을 둔 분산 학습 지하철에서 다섯 문제, 줄 서며 세 문제 — 자연히 여러 날에 분산되어 벼락치기를 이김

'문제풀이'라는 행위를 분해하면 이렇게 읽힙니다: 고밀도 관습 노출 × 강제 인출 × 즉각 피드백 × 자연 분산. 이 넷 중 '시험 기술'은 하나도 없습니다. 넷 다 학습과학의 장바구니에 들어 있는 품목입니다.


거대 언어 모델의 '거대'가 말해 주는 것

인간 쪽 증인들의 증언은 끝났습니다. 마지막 증인은 조금 특별합니다 — 사람이 아니고, 말문이 트인 것도 불과 몇 년 전입니다.

컴퓨터 과학자들이 처음 기계에게 언어를 가르치려던 방식은 이 글 서두의 그 전제와 판박이였습니다: 문법을 규칙으로 적고, 단어를 사전에 담고, 프로그램이 그것으로 분석하고 생성하게 하는 것. 이 노선은 수십 년간 진지하게 추진되었고, 결말은 다들 아는 대로입니다 — 장난감 예문에서는 되는데 실제 언어에 부딪히면 부서졌습니다. 규칙은 쓸수록 늘고 예외의 땜질은 촘촘해질 뿐, 언어의 실제 모습을 영원히 따라잡지 못했습니다. 음성인식의 선구자 Fred Jelinek은 이런 농담을 했다고 전해집니다: 언어학자를 한 명 해고할 때마다 인식률이 올라간다고요. 이 농담은 훗날 분야 전체의 이정표가 되었습니다.

진짜 돌파구는 '규칙 먼저'를 완전히 포기한 데서 왔습니다: 통계적 방법, 딥러닝, 그리고 거대 언어 모델로. 컴퓨터가 처음으로 자연어를 그럴듯하게 다루게 된 것은 누군가 마침내 문법을 다 써냈기 때문이 아니라, 모델을 수조 단어의 실제 텍스트에 담가 관습을 하나하나 통계로 집계하게 했기 때문입니다 — 비트겐슈타인이 가리킨 바로 그 길입니다. Rich Sutton은 이 역사를 유명한 에세이 "The Bitter Lesson"으로 압축했습니다: 인간 전문가의 지식을 시스템에 심는 노선은, 계산과 데이터로 스스로 배우는 노선에 거듭거듭 패배해 왔다고.

'거대'라는 글자가 바로 핵심입니다. 언어가 정말 몇 가지 규칙으로 환원된다면 모델은 클 필요가 전혀 없습니다 — 규칙을 넣어 주면 끝이고, 몇천 줄의 코드면 충분합니다. 모델이 거대해야 하고 말뭉치가 바다 같아야 하는 이유는, 언어의 본체가 하나하나 외우는 수밖에 없는, 환원 불가능한 관습의 목록이기 때문입니다. 거대 언어 모델의 파라미터 수는 "한 언어에 도대체 관습이 몇 개나 숨어 있는가"라는 질문에 대한 공학적 답변으로 읽을 수 있습니다 — 답은, 수십억, 수조 단위로 세어야 할 만큼입니다.

더 흥미로운 것은 훈련 방식인데, 분명 낯익을 겁니다: 다음 단어를 가린다. 모델이 맞히게 한다. 채점한다. 틀렸으면 조정한다. 다음 문제로. 이것을 하루에 수십억 문제씩. BERT의 훈련 목표는 논문에서 아예 cloze task(클로즈 테스트, 빈칸 채우기)라고 불립니다 — TOEIC Part 5, Part 6과 같은 문제 형식입니다. 바꿔 말해, 인류 역사상 유일하게 인간 아닌 '누군가'에게 자연어를 가르치는 데 성공한 대규모 프로젝트가 쓴 방법은 문제풀이였습니다 — 다만 천문학적인 분량의 문제풀이였을 뿐입니다.

물론 뇌는 transformer가 아니고, 이 유비를 너무 밀어붙여서는 안 됩니다. 그래도 이 대조 실험이 가리키는 방향을 외면하기는 어렵습니다. 기계는 철학이 없고, 동아시아 학습 문화에 대한 편견도 없습니다. 기계는 그저 무엇이 통했는지를 보고할 뿐입니다 — 규칙에서 언어를 도출하려던 노선은 실패했고, 관습에 대량으로 노출되는 노선은 지금 여러분이 대화할 수 있는 그 존재를 만들어 냈습니다.


구분할 것과 인정할 것

변론이 신뢰를 얻으려면 스스로 경계선을 그어야 합니다. 먼저 구분할 것 둘:

문제풀이는 기계적 패턴 반복이 아닙니다. 1960년대 행동주의의 '문형 연습' — 의미 없이 문형만 기계적으로 변환시키던 그것 — 은 언어 교육계에서 정당하게 도태되었습니다. 비판자들이 말하는 '드릴'이 그것이라면 비판이 옳습니다. 하지만 TOEIC 문제는 그런 것이 아닙니다: 모든 문제가 의미 처리를 요구합니다 — 지문을 읽어 내고 대화를 알아들은 다음, 의미에 관한 판단을 내려야 합니다. Krashen의 표현을 빌리면 이것은 '이해 가능한 입력'입니다. 좋은 문제은행이란 난이도순으로 정렬되고 해설이 붙은, 이해 가능한 입력의 묶음입니다.

이해력 시험에서는 '시험 대비'와 '학습'이 거의 일치합니다. TOEIC L&R에는 템플릿을 외울 작문도, 요행을 노릴 서술형도 없습니다. 200문제가 묻는 것은 결국 둘뿐입니다 — 읽고 이해했는가, 듣고 이해했는가. 이해를 재는 시험에서 최고의 시험 기술은 이해 그 자체입니다. 이것이 TOEIC이 '풀 만한' 구조적 이유입니다: 점수로 가는 길과 언어로 가는 길이, 드물게도 같은 길이니까요.

다음으로 인정할 것 셋:

  1. 문제풀이는 산출을 훈련하지 않습니다. Swain의 출력 가설과 Long의 상호작용 가설은 여전히 유효합니다: 말하고 쓰게 되려면 실제로 말하고 써야 합니다. 문제풀이가 챙겨 주는 것은 입력 쪽입니다. 출력 쪽은 따로 마련하십시오. (공정하게 말하면: TOEIC L&R이 재는 것도 애초에 입력 쪽뿐입니다.)
  2. 답만 외우는 것은 풀이가 아닙니다. '문풀'이 "이 문제는 B"를 외우는 일이라면 비판자들의 완승입니다. 배움은 문제의 내용물에 깃듭니다: 읽어야 할 지문, 들어야 할 음원, 파고들어야 할 해설, 다시 풀어야 할 오답. 여러분이 흡수해야 할 것은 문제 속의 영어이지, 보기 옆의 알파벳이 아닙니다.
  3. 문제의 품질이 노출의 품질을 결정합니다. 대량으로 흡수하는 것은 문제 속의 언어입니다. 그러니 문제 속의 언어는 진짜 영어여야 합니다. 조악한 문제은행은 존재하지 않는 관습을 대량으로 주입합니다 — 그것은 안 푸느니만 못합니다. 우리가 난이도와 독창성을 공학 문제로 다루는 이유가 바로 이것입니다(방법은 난이도 총론을 보십시오).

맺으며: 마음 놓고 푸십시오

처음의 고발로 돌아갑시다: "문제풀이는 시험 대비일 뿐, 학습이 아니다." 이제 빠짐없이 답할 수 있습니다.

언어가 정말 규칙의 집합이라면 고발은 성립합니다 — 측정은 측정 대상을 낫게 만들지 않으니까요. 하지만 한 철학자는 후반생을 바쳐 언어가 그런 종류의 것이 아님을 보였습니다. 언어학자들은 실제 텍스트의 절반이 관습으로 되어 있음을 세어 냈습니다. 심리학자들은 푸는 것이 다시 읽는 것보다 더 많이 남기고, 틀리는 것이 안 틀리는 것보다 더 많이 가르친다는 것을 증명했습니다. 그리고 엔지니어들이 살아 있는 증거를 내놓았습니다 — 자연어를 성공적으로 배운 역사상 유일한 '학생'은 천문학적 분량의 문제풀이로 훈련되었습니다. 네 갈래의 증언이 하나의 결론을 가리킵니다: 언어 학습의 중심 작업은 그 언어가 실제로 쓰이는 모습을 대량으로, 반복해서, 피드백과 함께 만나는 것 — 그리고 바로 그 일을 문제풀이가 값싸고 훌륭하게 해냅니다.

언어는 말이 통하지 않는 상대입니다. 그러니 자주 만나러 가는 수밖에요. 문제풀이는 그 만남의 일정을 잡는 방법입니다 — 지하철에서, 줄을 서며, 한 손으로.

이 앱의 중국어 이름은 單手刷990 — "한 손으로 문제를 풀어(刷) 990점까지"라는 뜻입니다. '풀다'를 뜻하는 刷 자가 이름에 처음부터 박혀 있습니다. 자조가 아니라, 선언입니다.

← 전체 글