所有文章 · 發布於 2026-08-01

多益題目難度怎麼判定?「跟真考一樣難」的檢驗方法

給好奇的你的技術說明。這是難度系列的總論,之後每個 Part 各有一篇。這篇處理所有後續文章共用的部分:難度在測驗學裡的正式定義、為什麼沒有人(包括我們)能直接測到它、我們拿什麼當外部參照、以及我們願意主張和不願意主張的分別。看完這篇,各 Part 那幾篇就可以直接談那個 Part 自己的難度來源。不需要任何統計背景。

為什麼「難度」不能靠感覺

每一題練習題在題庫裡都帶著一個標籤:簡單、中等、困難。這個欄位看起來理所當然,卻是整個題庫裡最容易出問題的一個——因為它出錯的時候不會有任何東西發出聲音

一題答案錯了,會有人回報。一段音檔壞了,你按下播放就知道。但一題被標成「困難」、其實很簡單,不會有任何徵兆:它照樣出現、照樣計分、照樣看起來像一題難題。

而這個標籤做了兩件重要的事。第一,它決定你練到的題目組合——練習和模擬考要有意義,就必須在難易之間有梯度,而這只有在「難」真的代表難的時候才成立。第二,它讓「怎麼準備難題」變得可以說清楚:如果我們說不出一題為什麼難,就只能給你「多練習」這種正確但沒用的建議;反過來,只要能把難度拆成幾個具體、可辨認的來源,那些來源本身就是一份練習清單。


難度的正式定義,和一個殘酷的前提

心理計量學對難度的定義毫不含糊:

一題的難度,就是真實考生答對它的比例。

專業術語叫 p 值。答對率 85% 的題是簡單題,答對率 40% 的題是難題,就這麼直接。它不是專家覺得難不難,是實際上有多少人做錯。

但這個定義有一個殘酷的前提:你得先讓大量考生做過這一題。ETS 有這種資料——每一道正式題目在啟用前都經過預試。任何第三方都沒有:不是我們藏起來不說,是所有出版社、所有補習班、所有 app 都一樣沒有。

所以每一個在題目旁邊印上「難度:高」的人,用的其實都是某種替代指標。這件事本身沒有問題,替代指標是這個領域的常態。真正的差別只在於:

那個替代指標,是一個人的主觀判斷,還是一套可以重跑、可以驗證、也可以被推翻的規則

我們選後者。做法是:完全不看任何人標的難度,只從題目本身的文字算出一組在結構上會讓題目變難的特徵,逐題去量。因為特徵是從文字算出來的,同一套程式可以量我們的題庫,也可以量任何一份印在紙上的試題——這一點是下一節的關鍵。


「跟真的考試一樣難」可以誠實地指三件事

這句話常常被當成一句話用,但它其實混了三個層次,而且只有前兩個是今天任何人都能檢查的。

主張 能不能檢查
1 相同的命題架構 — 相同的題型、相同比例、每份試卷相同的結構 可以,客觀
2 相同的難度分布 — 依外部參照判定,簡單/中等/困難的比例相同 可以,但要附上「由誰判定」
3 相同的答對率 — 真實考生答對每一題的比例相同 不行,除非握有官方資料或大量作答樣本

我們可以強力支持 (1),在明確但書下支持 (2),並且明確說明 (3) 尚未確立。

任何人在沒有大量作答資料的情況下聲稱 (3),都是在猜。 這包含我們自己——本系列每一篇的結尾都會回到這一點。


我們拿什麼比:一套市售的六回模擬試題

刻度不能自己發明,得對到一個外部參照上。我們用的是《全新!新制多益 TOEIC 題庫解析 狠準 6 回》(Hackers Academia 著,國際學村出版),一套完整六回、市面上公認完成度很高的模擬試題。

選它有一個很實際的理由:書上每一題都印著出版社自己的難度評級(高/中/低)。這給了我們上千個現成的、出自專業編輯的逐題判斷可以對照——而這正是評估自己儀器準不準所需要的東西。

然後是整套方法的關鍵一步:

同一套特徵抽取程式,跑我們的題庫,也跑參照書的題目。

一個儀器、兩份語料。這才是比較有意義的前提——我們不是拿自己的標準去評自己,而是把兩邊放在同一把尺上。

Happysaur 用同一個檢查模板查看自家題庫與外部參照的題卡,表示兩邊必須採用相同的結構規則比較。

這把尺量得準群體,量不準個人

這是整套方法最重要、也最容易被跳過的一點,值得用一個比喻說清楚。

想像一台誤差 ±5 公斤的體重計。你不能用它判斷「我這週是不是重了一公斤」——誤差比你想測的變化還大,量出來的數字幾乎沒有意義。但如果你用同一台體重計量了一千個人,再去量另一群一千個人,兩群的平均值仍然可以比較:因為誤差有時偏高、有時偏低,一千次之後大致互相抵銷,剩下的差距是真的。

我們的結構分類器就是那台體重計。判斷單獨一道題難不難時它很不可靠——這不是我們客氣,是我們實際測過它有多不可靠,數字和方法都寫在 Part 5 那篇(近期刊出)。但把同一套規則套用在一千多道題上,個別的誤判會往兩邊分散、彼此抵銷,剩下的比例是可信的。

所以界線在這裡:

  • 可以說:我們的 Part 5 裡「四個獨立實詞」這一類佔 42.3%,參照書佔 33.1%。✓
  • 不能說:這一題是難題,因為分類器把它歸在最難那一類。✗

實務上的後果很直接:我們不會用分類結果去覆寫任何一題的難度標籤。 這把尺被用在它站得住腳的地方——把關新內容的整體組成,而不是給單題打分。本系列所有的難度比較,都要放在這個限制底下讀。

Happysaur 仔細檢查整批題卡的組成,並擋住替單題蓋難度章的動作,提醒分類器的使用界線。

這套參照的限制,我們不包裝掉

  • 它是出版社的模擬試題,不是 ETS 官方材料。 因此它在格式上是強證據(六回之間幾乎零變異,正是忠實複製官方命題架構的樣子),在難度上是較弱的證據(題目是出版社自己寫的,評級是其編輯的判斷)。我們刻意用有信心的語氣報告格式比較,用帶保留的語氣報告難度比較。
  • 它只有六回。 對於每份試卷都固定出現的結構特徵,六回已經足以確認;對於比例的細微差異,六回不夠。

目前的結果:我們的題目不比參照書簡單

先說最容易被誤讀的一組數字。如果只看雙方標籤上的「困難」比例,看起來我們到處都比較簡單:

Part 參照評為「高」 我們標為「難」
2 20% 18.9%
3 12% 21.7%
4 18% 16.2%
5 33% 10.3%
6 28% 25.8%
7 29% 21.6%

六個 Part 有四個落在幾個百分點內。Part 5 那個 23 個百分點的落差看起來很嚴重——但它是整個系列裡最重要的一次教訓,因為當我們改用結構去測、而不是比較兩邊的標籤時,結論反了過來

Part 5 選項排法 我們 參照
同一詞族且旁邊有線索(最簡單) 3.6% 2.9%
同一詞族,無線索 29.4% 28.4%
功能詞/搭配選擇 24.7% 25.6%
四個各自獨立的實詞(最難) 42.3% 33.1%

我們帶有的「最難排法」比參照書多了約 9 個百分點,不是少。 中間兩類幾乎完全重疊。

換句話說:那個 23 個百分點的落差是標記造成的假象,不是內容的差距。我們的出題者傾向把文法刁鑽的題目標成難題,而參照書的評分規準把字彙與搭配的負擔視為最難——兩邊在用不同的尺量同一件事。我們的標籤保守,不是我們的內容保守。

這是目前可以下的結論,而且它適用於整體而非單題:在我們唯一能客觀測量的軸上,我們的題目和參照書至少相當,在最難的那一類上還更多。 我們不會因此宣稱「我們比真實多益難」——那需要 (3),而 (3) 還沒有人能證明。


我們不主張什麼

  • 我們沒有答對率。 這裡沒有任何內容能確立某一題對真實考生來說和真實題目一樣難。
  • 參照是出版社模擬試題,不是 ETS。 格式結論強,難度結論承接編輯判斷。
  • 我們的聽力音檔比真實測驗乾淨。 聽力是以神經網路 TTS 產生,語速和腔調分布我們能控制也能測量;但現場錄音中的省音、話語重疊與環境底噪,我們暫時重現不了。這讓我們的聽力以我們自己的指標看不見的方式,比真實考試稍微容易——我們寧可直接說出來,也不讓你在考試當天才發現。
  • 我們不判定單獨一題的難度。 理由是上面那台體重計:這把尺量群體可信,量個人不可信。所有的比較都是「兩個題庫的組成」,不是「這一題有多難」。
  • 兩個尺度終究不是同一個尺度。 參照的高/中/低是編輯判斷,我們的是作者判斷。只有大的差距才適合據以行動,小差距是雜訊。

什麼會讓這件事變得更確定

依價值排序:

  1. 來自學習者的答對率。 這才是真正的測量。逐題作答結果已經在匿名累積,缺的是數量。到那一天,這套結構尺會被真實資料重新校準——甚至被取代。
  2. 估計分數與官方分數的差距。 每當學習者回填一個官方分數,我們就能檢查「我們的估計能在幾分內追蹤官方分數」,而這只需要幾十個樣本就值得引用。

接下來

有了共同的基礎,各 Part 那幾篇就可以直接進入它們自己的主題:那個 Part 的難度具體從哪裡來,以及知道之後你該怎麼作答

  • Part 1:照片描述,難度在句子的「體」——狀態與動作的最小對立。
  • Part 2:問答,難度在題幹型態與回應的間接程度。
  • Part 3Part 4:對話與獨白,難度在推論型題目與圖表、意圖題。
  • Part 5:單句填空,難度幾乎全部在四個選項的排法
  • Part 6:短文填空,難度在跨句的連貫與插入句。
  • Part 7:閱讀,難度在改寫距離——正解幾乎從不重複文章的用字。

每一篇的後半都會把該 Part 的難度來源反過來讀,變成一份作答策略:每一個把題目做難的手法,都預告了答案藏在哪裡。

← 所有文章