所有文章 · 發布於 2026-08-01
多益題目難度怎麼判定?「跟真考一樣難」的檢驗方法
給好奇的你的技術說明。這是難度系列的總論,之後每個 Part 各有一篇。這篇處理所有後續文章共用的部分:難度在測驗學裡的正式定義、為什麼沒有人(包括我們)能直接測到它、我們拿什麼當外部參照、以及我們願意主張和不願意主張的分別。看完這篇,各 Part 那幾篇就可以直接談那個 Part 自己的難度來源。不需要任何統計背景。
為什麼「難度」不能靠感覺
每一題練習題在題庫裡都帶著一個標籤:簡單、中等、困難。這個欄位看起來理所當然,卻是整個題庫裡最容易出問題的一個——因為它出錯的時候不會有任何東西發出聲音。
一題答案錯了,會有人回報。一段音檔壞了,你按下播放就知道。但一題被標成「困難」、其實很簡單,不會有任何徵兆:它照樣出現、照樣計分、照樣看起來像一題難題。
而這個標籤做了兩件重要的事。第一,它決定你練到的題目組合——練習和模擬考要有意義,就必須在難易之間有梯度,而這只有在「難」真的代表難的時候才成立。第二,它讓「怎麼準備難題」變得可以說清楚:如果我們說不出一題為什麼難,就只能給你「多練習」這種正確但沒用的建議;反過來,只要能把難度拆成幾個具體、可辨認的來源,那些來源本身就是一份練習清單。
難度的正式定義,和一個殘酷的前提
心理計量學對難度的定義毫不含糊:
一題的難度,就是真實考生答對它的比例。
專業術語叫 p 值。答對率 85% 的題是簡單題,答對率 40% 的題是難題,就這麼直接。它不是專家覺得難不難,是實際上有多少人做錯。
但這個定義有一個殘酷的前提:你得先讓大量考生做過這一題。ETS 有這種資料——每一道正式題目在啟用前都經過預試。任何第三方都沒有:不是我們藏起來不說,是所有出版社、所有補習班、所有 app 都一樣沒有。
所以每一個在題目旁邊印上「難度:高」的人,用的其實都是某種替代指標。這件事本身沒有問題,替代指標是這個領域的常態。真正的差別只在於:
那個替代指標,是一個人的主觀判斷,還是一套可以重跑、可以驗證、也可以被推翻的規則?
我們選後者。做法是:完全不看任何人標的難度,只從題目本身的文字算出一組在結構上會讓題目變難的特徵,逐題去量。因為特徵是從文字算出來的,同一套程式可以量我們的題庫,也可以量任何一份印在紙上的試題——這一點是下一節的關鍵。
「跟真的考試一樣難」可以誠實地指三件事
這句話常常被當成一句話用,但它其實混了三個層次,而且只有前兩個是今天任何人都能檢查的。
| 主張 | 能不能檢查 | |
|---|---|---|
| 1 | 相同的命題架構 — 相同的題型、相同比例、每份試卷相同的結構 | 可以,客觀 |
| 2 | 相同的難度分布 — 依外部參照判定,簡單/中等/困難的比例相同 | 可以,但要附上「由誰判定」 |
| 3 | 相同的答對率 — 真實考生答對每一題的比例相同 | 不行,除非握有官方資料或大量作答樣本 |
我們可以強力支持 (1),在明確但書下支持 (2),並且明確說明 (3) 尚未確立。
任何人在沒有大量作答資料的情況下聲稱 (3),都是在猜。 這包含我們自己——本系列每一篇的結尾都會回到這一點。
我們拿什麼比:一套市售的六回模擬試題
刻度不能自己發明,得對到一個外部參照上。我們用的是《全新!新制多益 TOEIC 題庫解析 狠準 6 回》(Hackers Academia 著,國際學村出版),一套完整六回、市面上公認完成度很高的模擬試題。
選它有一個很實際的理由:書上每一題都印著出版社自己的難度評級(高/中/低)。這給了我們上千個現成的、出自專業編輯的逐題判斷可以對照——而這正是評估自己儀器準不準所需要的東西。
然後是整套方法的關鍵一步:
同一套特徵抽取程式,跑我們的題庫,也跑參照書的題目。
一個儀器、兩份語料。這才是比較有意義的前提——我們不是拿自己的標準去評自己,而是把兩邊放在同一把尺上。

這把尺量得準群體,量不準個人
這是整套方法最重要、也最容易被跳過的一點,值得用一個比喻說清楚。
想像一台誤差 ±5 公斤的體重計。你不能用它判斷「我這週是不是重了一公斤」——誤差比你想測的變化還大,量出來的數字幾乎沒有意義。但如果你用同一台體重計量了一千個人,再去量另一群一千個人,兩群的平均值仍然可以比較:因為誤差有時偏高、有時偏低,一千次之後大致互相抵銷,剩下的差距是真的。
我們的結構分類器就是那台體重計。判斷單獨一道題難不難時它很不可靠——這不是我們客氣,是我們實際測過它有多不可靠,數字和方法都寫在 Part 5 那篇(近期刊出)。但把同一套規則套用在一千多道題上,個別的誤判會往兩邊分散、彼此抵銷,剩下的比例是可信的。
所以界線在這裡:
- 可以說:我們的 Part 5 裡「四個獨立實詞」這一類佔 42.3%,參照書佔 33.1%。✓
- 不能說:這一題是難題,因為分類器把它歸在最難那一類。✗
實務上的後果很直接:我們不會用分類結果去覆寫任何一題的難度標籤。 這把尺被用在它站得住腳的地方——把關新內容的整體組成,而不是給單題打分。本系列所有的難度比較,都要放在這個限制底下讀。

這套參照的限制,我們不包裝掉
- 它是出版社的模擬試題,不是 ETS 官方材料。 因此它在格式上是強證據(六回之間幾乎零變異,正是忠實複製官方命題架構的樣子),在難度上是較弱的證據(題目是出版社自己寫的,評級是其編輯的判斷)。我們刻意用有信心的語氣報告格式比較,用帶保留的語氣報告難度比較。
- 它只有六回。 對於每份試卷都固定出現的結構特徵,六回已經足以確認;對於比例的細微差異,六回不夠。
目前的結果:我們的題目不比參照書簡單
先說最容易被誤讀的一組數字。如果只看雙方標籤上的「困難」比例,看起來我們到處都比較簡單:
| Part | 參照評為「高」 | 我們標為「難」 |
|---|---|---|
| 2 | 20% | 18.9% |
| 3 | 12% | 21.7% |
| 4 | 18% | 16.2% |
| 5 | 33% | 10.3% |
| 6 | 28% | 25.8% |
| 7 | 29% | 21.6% |
六個 Part 有四個落在幾個百分點內。Part 5 那個 23 個百分點的落差看起來很嚴重——但它是整個系列裡最重要的一次教訓,因為當我們改用結構去測、而不是比較兩邊的標籤時,結論反了過來:
| Part 5 選項排法 | 我們 | 參照 |
|---|---|---|
| 同一詞族且旁邊有線索(最簡單) | 3.6% | 2.9% |
| 同一詞族,無線索 | 29.4% | 28.4% |
| 功能詞/搭配選擇 | 24.7% | 25.6% |
| 四個各自獨立的實詞(最難) | 42.3% | 33.1% |
我們帶有的「最難排法」比參照書多了約 9 個百分點,不是少。 中間兩類幾乎完全重疊。
換句話說:那個 23 個百分點的落差是標記造成的假象,不是內容的差距。我們的出題者傾向把文法刁鑽的題目標成難題,而參照書的評分規準把字彙與搭配的負擔視為最難——兩邊在用不同的尺量同一件事。我們的標籤保守,不是我們的內容保守。
這是目前可以下的結論,而且它適用於整體而非單題:在我們唯一能客觀測量的軸上,我們的題目和參照書至少相當,在最難的那一類上還更多。 我們不會因此宣稱「我們比真實多益難」——那需要 (3),而 (3) 還沒有人能證明。
我們不主張什麼
- 我們沒有答對率。 這裡沒有任何內容能確立某一題對真實考生來說和真實題目一樣難。
- 參照是出版社模擬試題,不是 ETS。 格式結論強,難度結論承接編輯判斷。
- 我們的聽力音檔比真實測驗乾淨。 聽力是以神經網路 TTS 產生,語速和腔調分布我們能控制也能測量;但現場錄音中的省音、話語重疊與環境底噪,我們暫時重現不了。這讓我們的聽力以我們自己的指標看不見的方式,比真實考試稍微容易——我們寧可直接說出來,也不讓你在考試當天才發現。
- 我們不判定單獨一題的難度。 理由是上面那台體重計:這把尺量群體可信,量個人不可信。所有的比較都是「兩個題庫的組成」,不是「這一題有多難」。
- 兩個尺度終究不是同一個尺度。 參照的高/中/低是編輯判斷,我們的是作者判斷。只有大的差距才適合據以行動,小差距是雜訊。
什麼會讓這件事變得更確定
依價值排序:
- 來自學習者的答對率。 這才是真正的測量。逐題作答結果已經在匿名累積,缺的是數量。到那一天,這套結構尺會被真實資料重新校準——甚至被取代。
- 估計分數與官方分數的差距。 每當學習者回填一個官方分數,我們就能檢查「我們的估計能在幾分內追蹤官方分數」,而這只需要幾十個樣本就值得引用。
接下來
有了共同的基礎,各 Part 那幾篇就可以直接進入它們自己的主題:那個 Part 的難度具體從哪裡來,以及知道之後你該怎麼作答。
- Part 1:照片描述,難度在句子的「體」——狀態與動作的最小對立。
- Part 2:問答,難度在題幹型態與回應的間接程度。
- Part 3/Part 4:對話與獨白,難度在推論型題目與圖表、意圖題。
- Part 5:單句填空,難度幾乎全部在四個選項的排法。
- Part 6:短文填空,難度在跨句的連貫與插入句。
- Part 7:閱讀,難度在改寫距離——正解幾乎從不重複文章的用字。
每一篇的後半都會把該 Part 的難度來源反過來讀,變成一份作答策略:每一個把題目做難的手法,都預告了答案藏在哪裡。