所有文章 · 發布於 2026-08-04
多益 Part 6 段落填空的難點:你有沒有真的需要讀全文
給好奇的你的技術說明。難度系列每個 Part 一篇、依序刊出;這是第六篇。Part 5 的難度集中在四個選項怎麼排,Part 7 的難度散在整篇文章裡。Part 6 夾在中間,而它的難度來自一個很容易被忽略的地方:<strong>這個空格,到底需不需要你讀那篇文章?</strong> 這篇說明我們怎麼把這個問題變成一個可以測量的數字、我們用什麼方法讓這個測量不只是「某個人的感覺」、量出來的結果是什麼(第一次量出來的結果對我們自己很不好看,而我們照著它把題庫改了一輪),以及對你最有用的部分——知道 Part 6 有兩種完全不同的空格之後,你在考場上該怎麼分配時間。不需要任何統計背景。
Part 6 應該考什麼
Part 6 是閱讀測驗的第 131 到 146 題:四篇短文,每篇挖四個空格,每個空格四個選項。
從表面上看,它很像「把 Part 5 塞進一篇文章裡」。但它不該是那樣。Part 5 給你一個孤立的句子,所以答案必然只能從那個句子裡找。Part 6 給你一整篇文章——這代表答案「可以」藏在別的句子裡。
那才是 Part 6 存在的理由。如果每一個空格都能靠它自己那一句解決,那這篇文章就只是裝飾品,這個 Part 也就沒有必要單獨存在。
一個很簡單的測試:把文章遮起來
要判斷一個空格是不是真的在考「文章」,有一個非常乾脆的方法:
把整篇文章遮起來,只留下有空格的那一句,和四個選項。 然後問:現在還有幾個選項是說得通的?
如果只剩一個說得通,那這個空格根本不需要文章——它是一題躲在文章裡的 Part 5。
如果還有兩個以上說得通,那就代表:只有文章能決定答案。這個空格是真的在考 Part 6。
我們把符合後者的空格叫做「依賴上下文的空格」。這篇文章接下來講的所有數字,都是在數這個。
看三個實際的例子
例一:遮起來也不影響
Before entering, all staff must put on a full protective suit, gloves, and a face mask in the ------- room. (A) checking (B) changing (C) charging (D) chilling
不用看文章。穿防護衣、手套、口罩的地方是 changing room(更衣室)。其他三個選項不管前後文寫什麼都不會對。這一題就算把文章整篇刪掉,難度也完全不變。
例二:遮起來就答不出來
Bring your friends. ------- groups of six or more should book ahead. (A) Because of this, (B) That said, (C) For that reason, (D) In the meantime,
四個選項全部都是文法正確、意思也通順的句子開頭。單看這一句,你沒有任何理由選 B 而不選 A。
只有前面那句「Bring your friends.(歡迎揪朋友一起來)」才讓你知道:後面這句是在打折扣——歡迎揪團,不過六人以上要先訂位。「不過」就是 That said。
這一題,文章是解題的必要條件。
例三:遮起來連在講什麼都不知道
Even stubborn ------- don't stand a chance against our gentle, modern process. (A) sprains (B) strains (C) stains (D) streams
這句話單獨看,你甚至無法判斷它是洗衣店的廣告還是物理治療診所的廣告。sprains(扭傷)和 stains(污漬)在這句話裡一樣通順。
只有文章能告訴你這是在講什麼。這是依賴上下文最極端的一種。

怎麼把「說得通」變成一個可信的數字
到這裡為止,都還只是「我覺得」。而「我覺得」不是測量。
難度在測驗學裡有個正式定義:一題的難度就是真實考生答對它的比例。那需要成千上萬人先考過,除了 ETS 以外沒有人有這種資料。完整的說明在〈難度總論〉。這裡要處理的是一個更小、但更棘手的問題:「遮起來還剩幾個選項說得通」這件事,怎麼樣才不會變成一個人的主觀判斷?
我們做了三件事。
1. 先把題目切成「只剩那一句」
用程式把每一題的空格所在句子單獨切出來,同一篇文章裡的其他空格則直接填上正確答案(這樣句子才是完整的)。全部 490 個空格都成功切出來。
這一步就已經排除了一整類題目:整句填入的「插入句」題型(選項是四個完整句子的那種)。那種題目照定義就一定依賴上下文,把它算進來只會灌水。而且我們的插入句比例本來就符合真實測驗的配置——每四題一題。所以這裡量的是其餘那三個空格。
2. 交給兩個互相看不到的評分者
我們把「只剩一句 + 四個選項」交給兩個獨立的 AI 評分者,兩邊拿到完全相同的一份書面評分準則,而且都不告訴它們正確答案是哪一個(知道答案會嚴重影響判斷)。它們只需要回答一件事:這四個選項裡,有幾個單獨看是說得通的?
用兩個而不是一個,是因為一個評分者沒有辦法被檢查。兩個就可以算出它們有多常一致:
| 一致率 | Cohen's κ | |
|---|---|---|
| 我們的題庫(490 題) | 80.4% | 0.51 |
| 參照試題(72 題) | 90.3% | 0.81 |
κ(kappa)是扣掉「瞎猜也會碰巧一致」之後剩下的一致程度。參照試題那邊 0.81 屬於很高;我們自己這邊 0.51 只能算中等——這代表我們的題目裡有比較多模稜兩可的邊界案例,這件事本身就是資訊。
3. 只採計兩邊都同意的
兩個評分者不一致的地方,我們自己動手看。隨機抽 16 題逐題判斷之後發現:其中一個評分者明顯偏寬,會把「其實只有一個答案說得通」的題目也算進去(例如上面那題更衣室,它認為有兩個選項可以)。而且它偏寬的程度兩邊不一樣——在我們的題目上多標了 18%,在參照試題上只多標 10%。
這很重要:如果只採用它的判斷,就會不公平地美化其中一邊。所以最後的數字只採計兩個評分者都同意的題目。
(我們也算了寬鬆版本——只要有一個評分者說是就算。結論完全一樣,下面會說。)
量出來的結果
第一次量的時候,結果對我們自己非常不好看:
| 依賴上下文的空格 | 95% 信賴區間 | |
|---|---|---|
| 我們的題庫(第一次測量) | 82 / 490 = 16.7% | 13.7%–20.3% |
| 參照模擬試題 | 35 / 72 = 48.6% | 37.4%–59.9% |
參照試題大約每兩個空格就有一個真的需要文章。我們大約每六個才有一個。
兩個信賴區間沒有重疊(我們的上限 20.3%,對方的下限 37.4%),所以這不是抽樣誤差可以解釋的差距。用寬鬆版本重算,我們 36.3%、對方 58.3%,一樣沒有重疊——換一種算法不會改變結論。
一個佐證:我們刻意改寫成依賴上下文的空格,兩個評分者在完全不知情的狀況下全部都標出來了。如果一把尺連自己造的東西都量不到,那它量什麼都不能信。
然後我們把它修好了
量出來之後,我們沒有把這個數字收起來,而是照著它改題。改的方式不是「多出幾篇新文章」——那沒有用,因為每多一篇文章就多三個空格,分母跟著一起長。要提高比例,只能把既有的空格一個一個改成真的需要文章。
改完之後重新量,用的是同一把尺、同樣兩個互相看不到的評分者、同樣只採計兩邊都同意的:
| 依賴上下文的空格 | 95% 信賴區間 | 每篇文章平均 | |
|---|---|---|---|
| 我們的題庫(第一次測量) | 82 / 490 = 16.7% | 13.7%–20.3% | 0.50 |
| 我們的題庫(現在) | 239 / 490 = 48.8% | 44.4%–53.2% | 1.46 |
| 參照模擬試題 | 35 / 72 = 48.6% | 37.4%–59.9% | 1.46 |
兩邊的點估計相差 0.2 個百分點,每篇文章的平均密度則是一模一樣的 1.46。信賴區間大幅重疊。
講白一點:在「這個空格到底需不需要文章」這件事情上,現在已經量不出我們和參照試題的差別了。
這裡要很小心不要講過頭。這不代表我們的題目「和真題一樣難」——難度有很多面向,這篇量的只是其中一個。也不代表我們比對方好:48.8% 和 48.6% 的差距遠小於測量本身的誤差,任何一邊都不能說贏。能講的只有一句:這個面向上的差距,原本大到用統計就看得出來,現在沒有了。
一個誠實的附註:改完之後我們自己回頭核對這篇文章裡的例子,發現有四題在改寫過程中出了錯——選項被寫到了同一篇文章裡的另一個空格上,導致那四題沒有正確答案。它們已經修好,而且我們加了一個自動檢查,讓同一類錯誤以後會在上線前就被擋下來。會發現這件事,正是因為我們拿這篇文章裡印出來的例子去跟實際題庫對帳。
為什麼會變成這樣
不是因為誰偷懶,而是因為出題的自然傾向就是這樣。
寫一個「單看那一句就能解決」的空格,比較容易,也比較安全:你確定它有唯一解,確定它不會有爭議,確定它文法上站得住腳。而寫一個「必須看前一句才能決定」的空格,你必須同時控制兩個句子的關係,還要確保四個選項單獨看都通順——否則它就退化回一題 Part 5。
所以在沒有特別去量的情況下,任何題庫都會自然地往「Part 5 塞進文章裡」的方向漂移。我們就是漂了。 而在把文章遮起來之前,這件事完全看不出來——每一題單獨看都是好題目。
這也是為什麼我們把這個測量固定下來、每次改題都重跑一次:漂移不會自己停,只有量才會停。
對你最有用的部分:Part 6 該怎麼答
知道 Part 6 有兩種完全不同的空格之後,考場上的策略就很清楚了:先分類,再決定要不要回頭讀。
第一步:看選項,判斷這是哪一種空格
拿到一題,先看四個選項長什麼樣子:
- 四個都是同一個字的不同變化(apply / applied / applying / application)→ 幾乎一定是單句空格。看空格前後就好,不要回頭讀文章。
- 四個是不相干的實詞(名詞、動詞、形容詞)→ 通常是單句空格,但要小心例三那種「連在講什麼都不知道」的狀況。先試著只用這一句解,解不出來再回頭。
- 四個都是句首連接詞(However, / As a result, / Even so, / In the meantime,)→ 一定要回頭讀前一句。這種題目單看本句永遠解不出來,硬盯著它看只是浪費時間。
- 四個是完整的句子 → 插入句題。這種要看前後兩句,而且通常留到最後做。
第二步:連接詞題,只需要回讀一句
這是最值得記的一點。連接詞題不需要重讀整篇文章,只需要讀前面那一句,然後問自己一個問題:
前一句和這一句,是什麼關係?
- 後面是前面的結果 → As a result, / Therefore, / Accordingly,
- 後面推翻或限縮前面 → However, / That said, / Even so,
- 後面是前面的例子 → For example,
- 後面是前面的手段帶來的效果 → That way, / In this way,
- 前面是條件,後面是沒做的下場 → Otherwise,
判斷出關係,答案就出來了。這一步應該在 10 秒內完成;如果超過 20 秒還在猶豫,通常是你在試圖從本句找線索——而本句根本沒有線索。
第三步:把省下來的時間放在插入句題
Part 6 每篇文章有四個空格,其中通常有一題是插入句——那是整個 Part 6 最花時間的題型,因為你必須同時檢查它和前一句、後一句都接得上。
前三步的重點就是:在單句空格上不要浪費時間回頭讀文章,把時間集中在真正需要讀文章的那一兩題上。

這個測量的限制
老實說三件事:
參照試題只有 72 個空格。 這是六回模擬試題裡全部的非插入句空格,已經是我們手上完整的資料,但 72 個仍然不多——所以那個 48.6% 的信賴區間有 22 個百分點那麼寬。我們的 490 個是普查,所以窄得多。
評分者是 AI,不是真實考生。 它們判斷的是「單獨看說不說得通」,這是一個替代指標,不是真實的答對率。它跟真實難度的關係是合理的,但不是同一件事。
我們只在分佈層級主張,不在單題層級主張。 就像一台誤差 ±5 公斤的體重計,量一個人沒有意義,量一千個人的平均卻能看出族群差異。這個測量能說「兩個題庫在這個面向上的分佈明顯不同」,不能說「這一題比那一題更依賴上下文」。