所有筆記 · 發布於 2026-08-31

多益弱點分析可信嗎?我們把 5,680 題的題型標籤全部重審,錯誤率從 0.67% 到 94%

單手刷990 的閱讀題庫裡,每一題都帶著「題型標籤」——這題考細節、那題考推論。題型分析、策略實戰教學、學習診斷,全都站在這些標籤上。問題是:標籤是出題時順手寫的,從來沒有人驗過。在把「你的推論題比較弱」這句話說給使用者聽之前,我們決定先量一件事:標籤本身錯了多少?答案從 Part 5 的 0.67%,到 Part 7「綜合題」的 94% 都有。這篇是整趟稽核的完整帳目:怎麼量、錯在哪、修了什麼、什麼時候該停手,以及為什麼有兩個標籤到今天仍然被程式碼禁止對使用者開口。

一個差點就出貨的診斷

事情從一位使用者開始。他練了七週、答了一千四百多題,分數不動,我們把他的答題紀錄按題型拆開來看——推論題 51.5%、細節題 66.7%,差距明顯。結論似乎現成:加強推論題。

寫進報告之前,有人問了一句掃興的話:這些題目真的是推論題嗎?

「推論題」這個分類不是天上掉下來的。每一題的題型標籤,是出題當下順手標的,跟題目一起進了題庫,然後再也沒有人回頭看過。我們的分析引擎信任它、互動教學信任它、統計圖表信任它——但「大家都信任」和「它是對的」是兩件事。機器學習圈吃過一模一樣的虧:Northcutt、Athalye 與 Mueller(2021, NeurIPS Datasets and Benchmarks)重審了全世界最常用的十個測試集,平均 3.3% 的標籤是錯的,ImageNet 驗證集錯了約 6%——而那些是被幾萬篇論文當成地面真相的資料集。

我們的題庫有 5,680 題閱讀題(Part 5 有 1,216 題、Part 6 有 656 題、Part 7 有 3,808 題)。沒有理由假設我們比 ImageNet 幸運。

標籤為什麼會錯?——用鼻子分類

先看一題被抓到的 Part 5:

The venue coordinator confirmed that the main hall had a seating ___ of three hundred. (A) capacity (B) capable (C) capably (D) capacitate

四個選項是同一個字根的四種詞性——你根本不需要知道 capacity 是什麼意思,只要看得出空格要填名詞。這是教科書等級的字形題。它原本的標籤:「商業字彙」。

為什麼?因為 capacity 聞起來很商業。標籤描述的是題目聞起來像什麼,不是四個選項在考你什麼——我們把這個現象叫「用鼻子分類」。它在 Part 5 很罕見,但到了 Part 7 就成了主旋律。Part 7 有一題問「遊客為什麼不能餵動物?」,答案一字不差印在告示裡,掃過去就找得到。標籤:推論。大概因為「為什麼」聞起來像要推論。

更麻煩的是,錯的標籤在某些 Part 不只是躺著——它會蓋掉對的標籤。Part 6 的分類邏輯是先到先贏的優先序:一題同時標了「動詞變化」和「銜接」,銜接排在前面,所以一個時態線索明明就在空格同一句裡的題目,會被拿去教學生「要讀整段」。一個多餘的副標籤,就這樣悄悄改寫了這一題教你的東西。

錯誤率怎麼量?

方法很老實:每個 Part 抽一份固定亂數種子的分層隨機樣本(150 到 200 題),一題一題人工重讀——讀完整篇文章,不是只讀題目——判定它真正考什麼,再跟原標籤比。錯誤率只算「大分類」層級:把「搭配詞」標成「字彙」不算錯(學習者學到的分類沒變),把字形題標成字彙題才算。區間用 Wilson 95%。結構化的自動檢查(四個選項是否同字根、是否全是虛詞)只拿來產生嫌疑名單,每一件都要人工定罪——自動檢查本身的單題準確率,不足以當證據。

三個 Part 的結果:

樣本 大分類錯誤率 Wilson 95% 區間
Part 5 150 0.67% 0.12–3.68%
Part 6 150 3.33% 1.43–7.57%
Part 7 細節/目的/NOT/字彙 108 0%
Part 7 跨篇 32 15.6% 6.9–31.8%
Part 7 推論 43 86.0% 72.7–93.4%
Part 7 綜合 17 94.1% 73.0–99.0%

Part 5 比 ImageNet 還乾淨。Part 7 的細節題乾淨得發亮。而「綜合題」這個標籤錯誤率 94%——它唯一穩定傳達的資訊,是它自己不可信。

量完之後:一個弱點消失了,一個弱點活了下來

回到那位使用者。他的「推論題 51.5%」蓋在一個 86% 錯誤的標籤上——這個數字量到的不是推論能力,是「題目問句聞起來像不像推論」。我們把它從報告裡撤掉了。

但他的另一個數字活了下來:跨篇對照題 32.4%、細節題 66.7%(z = −4.52)。因為這兩個標籤恰好是全題庫最可靠的兩個,而且跨篇標籤僅有的污染方向是「混進了太簡單的題目」——修乾淨只會讓差距更大,不會更小。同一份報告、同一個人,一個弱點是標籤的幻覺,一個弱點是真的。不先量標籤,你分不出來。

Part 5 還有一個更安靜的發現。他的字形 43.9%、字彙 42.8%、文法 47.6%——卡方檢定 χ² = 2.44(p ≈ 0.30),三者沒有統計上的差異。天真的做法是把最低的那格圈起來說「你字形最弱」;正確的讀法是:他沒有哪個題型特別弱,他是三種題型一起卡在 45%,瓶頸在更底層的單字量和句子理解。診斷從「刷某個題型」變成「先把地基補起來」——這是完全不同的處方。

修得動的修掉:兩個互相看不見的 AI

86% 的錯誤率修不修?1,763 題涉案,人工一題一題重讀不現實,但全自動重標我們也不敢——所以設計成這樣:兩個不同家的模型,各自重新分類全部題目,過程中都看不到原標籤(看得到就會被錨定,稽核就失效了),然後只在「兩個模型一致、而且都不同意原標籤」的題目上考慮動手。

拿先前人工判定過的 250 題當黃金答案來驗收:在兩模型都說「要改」的題目上,原標籤只有 14.3% 是對的,模型的提議 81.0% 是對的;在兩模型都說「不用改」的題目上,原標籤 97.4% 是對的。也就是說,它們既不亂改對的,也真的抓得到錯的。

即使如此,我們仍按「改法的方向」分別驗收,只套用證據壓倒性的方向——例如「推論改細節」458 題(提議正確率 92.1%,原標籤 7.9%)。有 151 題「跨篇改細節」被擋下來:提議 57% 對、原標籤 43% 對,這種優勢不足以動別人的資料。最後套用 787 題,題庫裡的「推論」從 826 題縮到 297、「綜合」從 322 縮到 97。

第三個 AI 告訴我們該停手

還剩 727 題:兩個模型意見不合的,加上方向證據不足的。我們找了第三個模型來投票,三取二。

結果值得原文照登:在有黃金答案的題目上,照三取二的多數決去改,會修好 10 題、改壞 14 題——淨值 −4。全部套用會讓題庫變得更差。

這不是工具壞了,是問題的真實形狀:留到最後的 727 題,正是「細節還是推論」本來就見仁見智的那一群。第三個意見解決不了真正的模糊,它只是往擲硬幣裡再丟一枚硬幣。所以我們一題都沒動。知道什麼時候該停手,跟知道怎麼修一樣重要——這句話寫出來很像勵志語錄,但它在這裡是一行具體的算術:+10 − 14 < 0。

修不動的封起來

修完之後,「推論」和「綜合」剩下的題目反而濃縮了所有的模糊地帶——明確的錯都修掉了,留下的是連三個模型加一個人都吵不出結論的題目。這兩個標籤,還是不能拿來對使用者說話。

所以最後一道工不是修資料,是改程式:學習診斷引擎裡有一張寫死的白名單,每個標籤標明「可靠/有條件/封鎖」,只有量過而且量出來可靠的標籤,才允許出現在給使用者的句子裡。封鎖的不是藏起來——是引擎算得出那個數字,然後一個測試會暴力嘗試所有標籤組合,證明被封鎖的數字在任何情況下都到不了使用者眼前。報告沒有能力稽核自己,所以可信度不能是一種默契,得是一行編譯期就固定的程式碼。

誠實的但書

照例把話說清楚。第一,樣本就是樣本:0.67% 的區間上緣是 3.68%,我們主張的是「乾淨」,不是「無瑕」。第二,倖存的「推論/綜合」題目我們估計仍有三到四成標籤有問題,這正是它們被封鎖的原因——封鎖是結論,不是遺漏。第三,Part 6 的修正靠的是一次窮舉加一位裁決者,還沒有獨立複審,所以它在白名單上是「有條件」,不是「可靠」。第四,「細節還是推論」的邊界本來就有真實的模糊,任何標籤系統都會在那裡流血,包括修過的這一套。第五,也是最重要的:修好標籤只代表地基是實的,不代表蓋在上面的診斷對學習者有幫助——那是另一個問題,要用另一套證據來回答,而我們才剛開始收集。


題型標籤支撐著單手刷990 的題型分析、Part 5/6/7 的「策略實戰」互動教學,以及學習歷程裡的學習診斷報告。同一種「先量再說」的態度,我們也用在預估分數上——四位考生把真實成績寄回來的那次對帳,寫在〈多益預估分數準不準?〉;至於「難度」這個更難定義的標籤怎麼處理,請讀〈多益題目難度怎麼判定?〉。

← 所有筆記