所有文章 · 發布於 2026-08-28

多益預估分數準不準?四位考生把真實成績寄回來了,我們把帳攤開來算

8/16 場次的多益成績公布當天,四位考生把真實成績回報給我們——這是單手刷990 的預估分數第一次接受成套的真實檢驗。結論先講:聽力準得出乎意料(四位裡兩位只差 5 分),閱讀存在三種各有名字的系統性偏差,而四個人的分數排序全對。本文把四條每日預估軌跡與四張真實成績單攤開來對照,順便回答一個更難的問題:預估「收斂」,到底保證了什麼?

在〈多益預估分數怎麼算〉的結尾,我們寫下了一個承諾:這套估分方法對自身的不確定性誠實。承諾很好寫,因為當時沒有人能驗證它。現在不一樣了——考試日期過後,app 會主動問一句「考得如何?」,於是 8/28 成績公布那天早上,四份真實成績在兩小時內陸續寄到。四位都是創始會員,四位都考 8/16 場次。樣本只有四個人,這篇文章自始至終都記得這件事;但四個人已經足夠讓某些模式清楚得藏不住。

四張成績單,一張表

「考前預估」取的是每位考生考試前最後一天的每日預估快照——也就是他們走進考場前,app 螢幕上顯示的那個數字。

考生 練習量 考前預估(聽/讀) 真實成績(聽/讀) 差距
A 1,477 題 540(310/230) 495(315/180) 高估 45
B 731 題 685(395/290) 760(400/360) 低估 75
C 307 題 795(395/400) 855(430/425) 低估 60
D 2,697 題 815(460/355) 895(495/400) 低估 80

先講整體:總分的平均絕對誤差是 65 分(990 分制),四位全部落在 80 分以內。而四個人的排序——誰高誰低、高多少的次序——完全正確。四個人排序全對這件事,用猜的機率是 1/24;我們不打算靠這個開香檳,但它說明預估至少量對了「相對位置」,而相對位置正是「我離目標還差多遠」這個問題真正需要的東西。

有趣的事發生在把總分拆開之後。

聽力為什麼準到只差 5 分?

四位的聽力誤差分別是 +5、+5、+35、+35——平均絕對誤差 20 分。作為對照:ETS 自己的《TOEIC Listening and Reading Score User Guide》載明,官方考試每一節的測量標準誤(SEM)約為 25 分——意思是同一個人隔週重考一次官方考試,單節分數本來就會有這個量級的浮動。我們的聽力預估誤差,跟官方考試對它自己的誤差,是同一個量級。

考生 A 值得單獨一提:預估聽力 310,真實 315。而他在回報裡告訴我們,上一場 7/28 的考試也是「聽力分數接近」。同一個人、兩場考試、兩次都命中——這不太像運氣。

為什麼聽力可以這麼準?我們認為答案有點無聊:因為練習條件和考試條件一致。聽力的節奏是音檔決定的,不是你決定的——在 app 裡做 Part 3,和在考場裡做 Part 3,時間壓力一模一樣。預估分數量的是「你在這種條件下的答對率」,而考試恰好就是這種條件。

【8/29 補記】 文章上線隔天,第五張成績單到了:考前預估 810(聽力 435/閱讀 375),實考 805(聽力 405/閱讀 400)。總分只差 5 分,五個人的排序依然全對——但先別急著替聽力慶功:這是我們第一次高估聽力,整整 30 分。原因這位考生自己就先猜到了,回報裡寫著「聽力有時候會多聽幾次,可能會造成成績不準」——完全正確。重複播放之於聽力,就是不限時之於閱讀:練習條件比考場寬鬆,預估就會往寬鬆的那一邊偏。總分之所以看起來完美,是因為閱讀同時被低估了 25 分(這位考生考前三週的預估從 475 一路爬到 830,落後指標照舊追不上進步),兩個偏差恰好互相抵銷。所以本節那句「練習條件和考試條件一致」得加上一個但書:前提是,你每題只播一次。

閱讀,正好相反。

Happysaur 擔心地比較重播與單次播放的聽力卡,發現練習條件不同時,預估分數也需要一起解讀。

閱讀的三種不準,各有名字

四位的閱讀誤差是 −50、+70、+25、+45——平均絕對誤差 48 分,將近聽力的兩倍半,而且方向不一。攤開四個人的資料,三種系統性的偏差各自現形。

第一種:不限時的實力 ≠ 限時的表現。 考生 A 的閱讀被高估了 50 分,而且 7/28 那場也是同一個劇本(「閱讀差非常多」——他的原話)。平時刷題不限時,你可以在一題 Part 7 上從容地讀完整篇文章;真實考試的閱讀節是 75 分鐘 100 題,讀不完就是讀不完。考生 D 也在回報裡說閱讀「有點趕(差點沒寫完)」——他考了 895 都覺得趕。預估分數量的是不限時的答對率,考試考的是限時的答對率,這兩者之間隔著一項獨立的技能,叫做速度。

第二種:你專攻弱項,預估就跟著你的弱項走。 考生 B 被低估了 75 分,而他自己在回報裡就把診斷寫好了:「我會加強練習我比較弱的部分(四五六),所以分數就會更低一點。」完全正確。他考前的練習集中在自己最弱的題型上,於是餵給估分器的答題紀錄,是一份刻意偏向弱項的樣本——但真實考試不會只考你的弱項。這是選樣偏差的教科書案例,只是這次教科書是考生自己寫的。(順帶一提:他同時使用另一款估分 app,那款估他 640。兩款都低估了他;我們低 75,它低 120。低估認真備考的人,看來是這個行業的通病。)

第三種:預估天生是落後指標,而你在進步。 考生 C 只練了 307 題,是四人中最少的,卻拿到誤差第二小的預估。更有意思的是他的兩個真實錨點:6 月裸考 720,8 月考 855——兩個月進步 135 分。我們的每日預估在這期間從 735 爬到 795:起點準(735 對上兩個月前的 720),方向對,但幅度追不上。這不是缺陷的辯解,而是設計的必然:估分器對舊證據做時間衰減,量的是「最近幾週平均的你」;可是走進考場的,是「考試當天最好的你」。進步越快的人,這兩者差距越大。考生 D 還疊加了第四個小偏差——天花板壓縮:他的聽力預估在考前最後一週釘在 460 不動(中間只往下眨了一次 455),因為在 90% 以上的答對率區間,抽樣雜訊已經大於分數級距,估不上去了。他的真實聽力是 495。滿分。

那,預估「收斂」了嗎?

這是我們最想回答的問題,而誠實的答案是:「收斂」有兩個意思,我們做到了第一個,第二個只做到一半。

第一個意思是統計上的收斂:預估不再抖動。這一項四位都達成了。考前兩週,四人每日預估總分的標準差分別是 19、34、20、22 分——而其中 34 那位(考生 B)不是雜訊,是他的聽力預估在兩週內從 320 實打實爬到 395,趨勢被標準差算了進去。作為對照,〈多益預估分數怎麼算〉裡描述過的舊方法(固定 EMA)永遠會維持約 ±11 個百分點的抖動;現在的方法在幾百題之後,日與日之間只移動幾分。app 顯示的不確定區間也如實變窄:考生 B 考前的畫面上寫著聽力 395±28、閱讀 290±20。

第二個意思是收斂到真值。聽力做到了:四個誤差全部落在區間的合理範圍內。閱讀沒有:考生 B 的真實閱讀 360,落在 290±20 之外整整 50 分。這裡必須把話說透——我們顯示的 ± 量的是抽樣不確定性:「如果考題像你練的題、你的實力像最近幾週一樣,分數會落在這個範圍」。它對限時壓力、對你刻意偏向弱項的練習、對你正在進步這三件事,一無所知。收斂不等於正確;它只保證前提成立時的正確,而這四位考生,恰好每人打破了一條前提。

Happysaur 困惑地指著靶心,看見飛鏢雖然集中卻偏離中心,表示預估穩定不等於預估正確。

我們會改什麼(和不會改什麼)

聽力不動。條件一致、誤差與官方 SEM 同量級,沒有比這更好的了。

閱讀的三種偏差,兩種其實已經有對應的工具,只是我們過去沒有把話說得夠白:限時問題請用計時的模擬考練,Part 7 的速度本身可以專項訓練(〈Part 7 讀不完怎麼辦〉);進步的滯後問題,考完試把真實成績輸入 app,估計會用官方成績單重新校準(〈成績單不只有分數〉)。專攻弱項的偏差最難處理——懲罰使用者做最正確的備考行為(練弱項)是荒謬的,所以修正必須發生在估分端,而不是練習端。我們正在研究怎麼在不假裝資料存在的前提下修正它;在那之前,先把醜話印在這裡:如果你考前幾週都在專攻弱項,你的真實水準大概率比預估高。

秋豆麻袋,話先別說太滿

第一,n=4。這是一疊個案,不是一份驗證研究;四筆資料我們一個參數都還沒改。第二,回報是自願的,樣本天生偏向「有話想說的人」——考得比預估好的人可能更樂意回來報喜(四位裡三位如此),所以「預估偏保守」這個模式,本身可能是回報偏差的倒影。第三,四位都考同一場次;不同場次之間的難度校準(equating)誤差,這份資料完全看不見。第四,就算模型完美,ETS 自己的單節 SEM 就是 25 分——比官方考試更準地預測官方考試,在數學上不是一個能贏的遊戲。我們的目標從來不是預言分數,而是誠實地回答「我大概在哪、離目標還多遠、往哪裡練」。以這個標準,四份成績單給了我們一個及格、兩處明確的功課,和一個繼續收成績單的理由。

如果你也考了 8/16 或之後的場次——成績出來時,app 會問你考得如何。請告訴它。這篇文章的續集,由你的成績單寫。


預估分數卡片在單手刷990 的首頁上,點進「預估分數如何計算」可以看到每一節的不確定區間與每日趨勢;估分方法的完整說明在〈多益預估分數怎麼算〉。考後輸入真實成績的校準機制,見〈多益成績單不只有分數〉;閱讀限時訓練見〈Part 7 讀不完怎麼辦〉。

← 所有文章