所有文章 · 發布於 2026-08-04

刷題有用嗎?語言學、記憶科學與 AI 的共同證詞

「刷題」這個詞自帶原罪:它聽起來像補習班的發明、像應試教育的遺產、像「會考試但不會英文」的元兇——彷彿真正的語言學習在別的地方,而刷題只是它的廉價替身。這篇文章要認真地替刷題辯護。出庭作證的,有一位二十世紀最重要的語言哲學家、幾位認真數過真實語料的語言學家、記憶科學裡驗證了上百年的幾個效應——還有一位出乎意料的證人:大型語言模型本人。結論先講:刷題不是學語言的歪路;在你搬不去英語國家的前提下,它是最接近正路的一條。

罪名是什麼

先把控訴完整聽完,它值得被認真對待。

批評大致是這樣的:語言是拿來溝通的,不是拿來考的。整天做選擇題,練到的只是「應試技巧」——刪去法、關鍵字比對、題型直覺——而不是語言本身。所以東亞考生才會「分數很高但開不了口」;所以「刷題」聽起來才那麼像一種只屬於東亞的、不太健康的執念,一種對考試的崇拜,而不是對語言的學習。

這個控訴之所以聽起來有力,是因為它背後藏著一個看起來理所當然的前提:

語言是一套規則,加一批單字。掌握了規則,你就「會」了這個語言;題目只是檢查你會不會的工具。反覆做檢查,不會讓你更會。

如果這個前提成立,刷題確實可疑——體檢做一百次,身體也不會變好。

問題是,這個前提是錯的。而且推翻它的過程,是二十世紀哲學史上最著名的一次轉向。


一位改變心意的哲學家

路德維希·維根斯坦(Ludwig Wittgenstein)寫過兩本書,分別代表了看待語言的兩種方式——而第二本,是用來推翻第一本的。

第一本《邏輯哲學論》主張語言的本質是邏輯:語句是事實的圖像,把邏輯結構分析清楚,語言就透明了。這本書出版時,他認為哲學問題已經被他解決完畢,於是跑去奧地利鄉下當小學老師。注意這個前提和上一節那個前提的親緣關係:如果語言真的能化約成一套簡潔的規則系統,那麼「學規則」就是正路,「大量接觸」只是笨辦法。

然後他改變了心意。哲學家公開推翻自己是稀有事件——大多數人一輩子都在捍衛年輕時的那篇論文——而維根斯坦推翻的還是自己的成名作。後期的《哲學研究》幾乎逐條拆掉早年的立場,拆出來的核心主張是:一個字的意義,不在定義裡,而在它於語言中的實際用法裡。語言不是一套懸浮在空中的邏輯系統,而是無數個嵌在生活裡的「語言遊戲」;想像一個語言,就是想像一種生活形式。

他還留下一個對學習者特別重要的論證,後世稱為「規則追隨悖論」:任何一條明說出來的規則,都無法完全決定自己該怎麼被應用——你總是還需要「知道怎麼用這條規則」的能力,而那個能力本身不再是一條規則,是在實踐中練出來的手感。翻譯成備考語言:文法書上每一條規則,都預設了一個「見過夠多實例」的讀者。規則是事後的整理,不是事前的生成器。

最有意思的是他描述語言起點的用詞。談到兒童怎麼學會母語,他用的德文字是 Abrichtung——這個字平常用來說訓練動物,翻成中文,大概就是「操練」。在他筆下,語言的教學「不是解釋,而是訓練」。一位被公認為二十世紀最深刻的語言哲學家,描述語言學習時選的比喻,離「刷」比離「講解」近得多。

這也是為什麼我們在 App 的「關於我們」頁裡寫下:你不可能學會了 give 和 in,就自己推理出 give in 是「讓步」的意思——語言要是真的這麼講理,它早就先對你讓步了。


語言學家數過了:語言的主體是慣例

哲學給了方向,語言學給了數字。

1983 年,Pawley 與 Syder 提出了一個此後整個領域都繞不開的觀察:文法規則產生的絕大多數句子,是「完全合法,但沒有人這樣講」的句子。想問現在幾點,文法同樣允許 "What is the hour?"、"How late is it?"(這恰好是荷蘭文的邏輯)——全都合文法,但只有 "What time is it?" 是英文。母語者的流利,靠的不是即時運算規則,而是從一個巨大的慣用表達庫裡直接取件。

語料庫語言學隨後把這件事量化了。Sinclair 檢視真實語料後提出「慣用語原則」:語言使用的第一原則不是按規則自由組裝,而是從半成品裡挑。Erman 與 Warren(2000)實際去數:隨手抽一段真實英文,大約一半是由這種或大或小的既成組合鋪成的。Wray(2002)整本專著的結論也一樣:公式化序列不是語言的邊角料,是語言的主體。

而這些慣例,恰恰是邏輯推不出來的:

  • heavy rain 不能換成 strong rain,strong coffee 卻不能換成 heavy coffee;
  • 做決定是 make a decision,做功課卻是 do homework;
  • "Would you mind closing the window?" 的答應方式是 "Not at all"——按邏輯是「我一點都不介意」,按慣例是「好,我來關」;
  • "You haven't sent the report, have you?" 英文要照事實答 No(我還沒寄),中文的直覺卻是「對,我還沒寄」。這不是誰比較有邏輯,是兩套不同的慣例。

現在看看多益考什麼:Part 5 考搭配與慣用、Part 2 考應答慣例、Part 3 和 4 考職場對話的固定套路、Part 6 和 7 考商業書信裡那些 "Please find attached"、"effective immediately" 的定型表達。這些不是「應試冷知識」,這就是語言本體——語言學家數出來佔了語料一半的那個本體。一份好的多益題庫,本質上是一部「職場英語慣例選集」,只是排版成了選擇題。

Happysaur 專心把連在一起的常見搭配積木放入句子結構,表示可以從實際用法累積語言組合。


大腦本來就是這樣學的:頻率與統計

慣例既然推不出來,就只能靠接觸。幸運的是,大腦正是為此設計的。

Saffran、Aslin 與 Newport(1996)的經典實驗:八個月大的嬰兒,聽兩分鐘連續的人工音節流,就能從音節銜接的統計規律裡切出「字」的邊界。大腦是一台統計機器——而統計機器唯一的養分,是樣本量。

Tomasello 的用法本位理論把這條線接到了語言習得上:兒童不是先拿到一套文法再去套用;是從一次次具體的使用情境裡,自己歸納出越來越抽象的句式。Nick Ellis(2002)則把它接到了第二語言:成人學外語,大半也是對輸入的隱性統計——每一次接觸,都在替某個搭配、某個句型記上一筆。頻率不是輔助因素,是主要因素。

這其實解釋了那個人人都同意的建議:「學語言最好的方法是搬去當地。」沉浸式之所以有效,不是因為空氣裡有英文,是因為劑量——住在英語環境裡,每天被動接觸成千上萬個慣例樣本,統計機器全速運轉。維根斯坦會說,你加入了那個生活形式。

搬不去,劑量就得自己安排。大量閱讀是一種安排;刷題是另一種——而且,下一節會看到,是效率有實證優勢的那一種。


記憶科學:做題勝過重讀,答錯勝過沒錯

就算同意「大量接觸」是必要的,還有一個問題:接觸的形式重要嗎?讀十篇文章,和做十題附解析的題目,一樣嗎?

不一樣,而且方向可能跟直覺相反。記憶科學裡重複驗證得最結實的效應之一是「測驗效應」:Roediger 與 Karpicke(2006)讓受試者讀同一篇文章,一組反覆重讀,一組改成做測驗;一週後,測驗組的記憶明顯勝出。重讀給你「我會了」的流暢幻覺,提取才真正留下痕跡。Karpicke 與 Blunt(2011)後續在《科學》期刊的實驗更狠:提取練習連「畫概念圖」這種精緻的學習法都勝過。

Bjork 把這類現象總結成「合意困難」:學起來越順的方法,留下來的越少;讓大腦費力去取的,才記得牢。而做題正是把每一次接觸都變成一次提取——你不能滑過去,你得下判斷。

連答錯都有用。Kornell 等人的研究顯示:先猜錯、再看到正確答案,比直接看答案記得更牢。所以錯題不是失敗紀錄——它是你的慣例缺口清單,一題一條,附座標。你在 Part 5 錯過一次 "meet a deadline",這條慣例從此對你有了記號;下次在真實郵件裡見到它,它不再是背景雜訊。

把學習科學的處方和刷題的性質並排,會發現對得整整齊齊:

學習科學的處方 刷題給你的
大量接觸真實慣例 每一題都是一份濃縮的慣例樣本:一段商業書信、一通客服電話、一句道地的應答
提取,而不是重讀 每一題都逼你下一次判斷——被動瀏覽不算數
立即回饋 對完答案馬上知道對錯,解析告訴你為什麼
從錯誤中學習 錯題精準標出你還沒內化的那條慣例
間隔分散 通勤刷五題、排隊刷三題,天然分散在許多天,勝過考前一週狂嗑

「刷題」這個動作,拆開來就是:高密度的慣例接觸 × 強制提取 × 立即回饋 × 天然間隔。這四樣沒有一樣是「應試技巧」,四樣都是學習科學點名要的東西。

Happysaur 皺眉努力回想,先遮住答案,再準備翻開解析檢查修正,呈現提取與回饋的練習過程。


為什麼語言模型前面要加一個「大」字

人類這邊的證詞聽完了。最後一位證人比較特別——它不是人,而且是最近幾年才學會說話的。

電腦科學家最初教機器語言的做法,和本文開頭那個「規則加單字」的前提一模一樣:把文法寫成規則、把單字建成詞典,讓程式據此解析與生成語言。這條路線認真走了幾十年,結局眾所周知:在玩具例句上都行,一碰到真實語言就碎掉——規則越寫越多,例外越補越密,永遠追不上語言實際的樣子。語音辨識先驅 Fred Jelinek 據說曾半開玩笑地說:每開除一位語言學家,系統的辨識率就上升一點。這句玩笑話後來成了整個領域的路標。

真正的突破,來自徹底放棄「先寫規則」:統計方法、深度學習,一路走到大型語言模型。電腦第一次能像樣地處理自然語言,靠的不是誰終於把文法寫完整了,而是讓模型直接泡在幾兆字的真實語料裡,把慣例一條一條統計出來——跟維根斯坦指的是同一條路。Rich Sutton 把這段歷史總結成著名的〈The Bitter Lesson〉:把人類專家的知識寫進系統的路線,一再輸給用大量計算與資料自己學的路線。

那個「大」字正是重點。如果語言真的能化約成幾條規則,模型根本不需要大——把規則裝進去就好,幾千行程式碼綽綽有餘。模型必須大、語料必須海量,正是因為語言的主體是那些不可化約、只能一條一條記住的慣例。大型語言模型的參數量,可以看成「一個語言到底藏了多少慣例」這個問題的工程答案——答案是:多到得用十億、上兆為單位來裝。

更有意思的是它們的訓練方式,你會覺得眼熟:遮住下一個字,讓模型猜;猜完對答案;答錯就調整;換下一題。一天幾十億題。BERT 的訓練目標在論文裡就叫克漏字(cloze task)——跟多益 Part 5、Part 6 是同一種題型。換句話說,人類迄今唯一一次成功把自然語言教會「別人」的大規模工程,用的方法就是刷題——只是刷到了天文數字的量。

當然,人腦不是 transformer,這個類比不能推得太遠。但這場對照實驗的方向性結論很難迴避:機器不懂哲學,也不在乎東亞或西方的學習文化,它只回報什麼有效——想從規則生成語言的路線失敗了,大量接觸慣例的路線成功了。


該分清楚的,和該承認的

辯護要可信,就得把界線畫清楚。先分清楚兩件事:

刷題不是機械操練。1960 年代行為主義的「句型操練」——不帶意義地反覆變換句型——確實被語言教學界淘汰了,批評者如果指的是那個,他們是對的。但多益題不是那種東西:每一題都要求你處理意義——讀懂一段文字、聽懂一段對話,然後做一個關於意義的判斷。用 Krashen 的話說,這是「可理解輸入」;一本好題庫,就是一疊按難度排好、附解析的可理解輸入。

在理解測驗裡,「應試」與「學習」幾乎重合。多益 L&R 沒有作文可背模板、沒有申論可猜題;兩百題全是「看懂了嗎」「聽懂了嗎」。在一個測理解的考試裡,最好的應試技巧就是理解本身。這是多益值得刷的結構性原因——刷分數的路和學英文的路,難得地是同一條。

然後承認三件事:

  1. 刷題不練產出。Swain 的輸出假說與 Long 的互動假說都指出:說與寫,需要真的去說、去寫。刷題把輸入端顧好;輸出端請另外安排。(誠實地說:多益 L&R 本來也只考輸入端。)
  2. 只背答案不算刷。如果「刷」的意思是背「這題選 B」,那批評者全對。刷題的學習量藏在題目本身:文章要讀、音檔要聽、解析要看、錯題要回頭。刷的是題目裡的英文,不是題號旁邊的字母。
  3. 題目品質決定接觸品質。你大量接觸的是題目裡的語言,所以題目裡的語言必須是真的英文。品質差的題庫,等於讓你大量接觸不存在的慣例——這比不刷更糟。這也是我們把難度與原創性當成工程問題來處理的原因(做法見〈難度總論〉)。

結語:安心刷

回到最初的控訴:「刷題只是應試,不是學習。」現在可以完整地回答了。

如果語言真的是一套規則,控訴成立——檢查不會讓人變好。但一位哲學家用後半生說明了語言不是這種東西;語言學家數出慣例佔了真實語料的一半;心理學家證明了做題比重讀留下更多、答錯比不錯教得更多;工程師則補上了活的證據——人類唯一成功教會自然語言的「學生」,是用天文數字的刷題訓練出來的。四路證詞指向同一個結論:學語言的主要工作,就是大量地、反覆地、帶著回饋地接觸這個語言實際上怎麼被使用——而這件事,刷題做得又便宜又好。

語言不講理,所以你只能常常去見它。刷題,就是安排這些見面的方式——在捷運上、在排隊時,一隻手就夠。

我們把這個 App 取名叫「單手刷990」的時候,「刷」這個字就不是自嘲,是立場。

← 所有文章