所有文章 · 發布於 2026-08-04
多益 Part 3 對話題的難點:「誰說了什麼」與換句話說怎麼練
給好奇的你的技術說明。難度系列每個 Part 一篇、依序刊出;這是第三篇。Part 5 的難度集中在四個選項裡,Part 7 的難度散在整篇文章裡,Part 3 對話題則卡在中間:一段只有 90 秒不到的對話,配三題,而難度同時來自「你聽的時候發生了什麼」和「你讀的時候選項被寫成什麼樣」。這篇把我們的題庫和一套市售模擬試題六回<strong>逐項量出來對照</strong>——對話長度、輪數、說話人數、題型組合——說明我們哪裡對齊了、哪裡刻意偏難。量完發現兩個缺口——題型問得太淺、答案太好猜——現在都補完了:題庫改寫了 575 道題目、434 組選項,另外新寫了 108 段對話。不需要任何統計背景。
先講清楚 Part 3 是什麼形狀
真實考試裡,Part 3 是 13 段對話、每段 3 題,共 39 題——整個聽力部分裡題數最多的一塊(100 題中的 39 題)。每段對話只播一次,三題印在題本上,你在聽的同時就得作答。
我們題庫這一塊目前是 694 段對話、2,082 題(本文寫作期間從 586 段、1,758 題長到這個數字,原因就在下面)。但「我們有多少」不是重點,重點是形狀對不對。所以我們把一套市售模擬試題六回的 Part 3 對話原文全部抽出來(這套參照是什麼、以及它的限制,後面有一整節說明),拿同一把尺量兩邊:
| 項目 | 參照試卷(6 回,69 段) | 我們的題庫(586 段) |
|---|---|---|
| 每段字數 | 平均 85(中位數 87,範圍 45–110) | 平均 87(中位數 89,範圍 43–148) |
| 每段輪數 | 平均 4.5 輪 | 平均 5.4 輪 |
| 三人對話 | 13.0%(每回 13 段裡有 1–2 段) | 25.6%(150 段) |
第一列讓人放心:長度幾乎一模一樣。85 對 87 個字,中位數 87 對 89。一段 Part 3 對話該有多長,我們沒有寫歪。(唯一的差別在上限:我們最長 148 字,參照最長 110 字。少數特別長的對話是我們自己的長尾,不是命題架構的一部分。)
第二列和第三列才是真正的差別,而且兩者指向同一件事:
- 同樣的字數,我們切成更多輪。 平均多了將近一輪。字數沒變而輪數變多,等於每一輪更短、說話人交換得更頻繁。
- 三人對話我們幾乎是參照的兩倍。 真實命題架構每回 13 段裡放 1–2 段三人對話,我們的題庫放到四分之一。
這兩點合起來,就是「追蹤成本」。而三人對話確實比較難,這一點我們是量到的,不是猜的:三人對話的題目有 29.1% 被標為困難,兩人對話只有 19.1%。多一個人,你就多了一件事要做——不只聽內容,還要記住是誰說的,因為題目會直接問「男子建議什麼」「第二位女子擔心什麼」。
換句話說,我們的 Part 3 難在追蹤,不難在資訊量。記住這個結論,下面那個「我們比參照難 8 個百分點」的數字就不再是懸案,而是有解釋的。
抽取方法的但書:參照試卷的對話原文印在解析本裡,沒有文字層,我們是用影像辨識還原的(雙欄排版必須從文字座標重建,否則兩欄會被讀成同一行)。六回共 78 段,成功還原 69 段(88%),其餘因辨識失誤未能可靠切出。上表的參照數字是這 69 段的統計。
一段對話可以從哪幾個方向被做難
以下是我們對 Part 3 逐題實際計算或標記的主要特徵。和這個系列其他篇一樣,這份清單稍後會反過來當成你的作答策略。
1. 說話人數與輪數——追蹤成本
兩人 vs 三人、以及一段對話被切成幾輪,如第一節。三人對話的難處不在資訊量,在歸屬:同一句話由誰說出來,會改變三題裡至少一題的答案。輪數則是它的連續版本——每一次說話人交換,你的注意力就要重新掛一次。
![]()
2. 題型——你被要求做哪一種事
我們寫了一支程式,從題幹文字反推每一題實際在考什麼。它跑遍我們的題庫,也跑遍參照試卷六回的 230 道 Part 3 題目——同一支程式、兩份題庫,比較才有意義。
| 題型 | 參照試卷 | 改寫前 | 改寫後 | 你要做的事 |
|---|---|---|---|---|
| 細節題 | 35.7% | 52.8% | 35.7% | 定位一個講過的事實 |
| 請求/建議 | 11.7% | 4.3% | 11.6% | 誰要求誰做什麼 |
| 圖表題 | 7.8% | 2.4% | 7.8% | 音檔配一張表,兩邊對照才有答案 |
| 原因題(Why…?) | 7.4% | 16.4% | 7.4% | 找出因果,通常橫跨兩輪對話 |
| 地點題 | 6.5% | 2.7% | 6.4% | 場景在哪 |
| 下一步(What will… do next?) | 6.5% | 4.4% | 6.5% | 對話結束後才發生的事 |
| 推論題 | 6.5% | 1.1% | 6.5% | 把兩個事實組成沒說出口的結論 |
| 說話者意圖題 | 5.7% | 0.9% | 5.9% | 「他說這句話是什麼意思?」 |
| 問題點(What problem…?) | 4.3% | 6.3% | 4.2% | 抓出被抱怨或被指出的障礙 |
| 身分題 | 3.5% | 1.1% | 3.5% | 說話的是誰 |
| 主旨題 | 3.0% | 1.9% | 2.9% | 概括整段,不是任何單句 |
| 目的題 | 1.3% | 1.8% | 1.3% | 這通電話/這場對話為何發生 |
| 時間/數量題 | 0% | 3.8% | 0.3% | 單點資訊 |
| 推理型題目合計 | 30.9% | 12.6% | 31.9% |
這張表比上一節那張重要得多,因為它說的不是刻度,是內容。
改寫前,參照試卷的細節題只有三分之一,我們有一半以上。 反過來,需要多想一步的題型——推論、意圖、主旨、目的、下一步、圖表——參照佔 30.9%,我們只有 12.6%,不到一半。當時的結論是:真實命題架構要你「聽懂並且再想一步」的比例,是我們的兩倍以上。
那一版已經改完了。上表的第四欄是現在的題庫:十四種題型全部落在參照的兩個百分點以內,推理型合計 31.9% 對 30.9%。
補上這段落差用了兩種完全不同的工法,值得說清楚:
- 十一種題型是「換一種問法」補上的。 同一段對話、同一段音檔,改寫的是題目本身——問一件不同的事,配一組全新的選項。音檔一個字都沒有動,因為題目的語音是各自獨立的片段。這樣改出來的是真的另一道題,不是把「為什麼…?」換句話說;後者會讓數字好看,卻不會讓題目變難。
- 圖表題和說話者意圖題補不了,只能重寫。 圖表題需要對話剛好只講出可對照資料的其中一邊;意圖題需要一句話的字面意思和真正的意思不一樣——我們在既有的 49 萬字對話裡只找到 2 處這種說法。這兩種題型因此是新寫的 108 段對話(連同新錄的音檔)帶進來的,那也是整個工程裡最慢的一段。
順帶修掉的兩件事:時間/數量題從 3.8% 降到 0.3%(參照六回一題都沒有,六回全都不用不太可能是巧合——「他們幾點碰面」這種單點聽寫比較像 Part 2 的工作);還有選項的正確答案位置,新題一度有七成落在 A,現在四個字母各佔四分之一。
最後,這支分類器有一個好性質支持它值得被當真:它沒有看過難度標籤,卻把題型排出了和標籤一致的順序——說話者意圖題有 96.7% 被標為困難、推論題 58.6%、原因題 33.6%,而目的題只有 0.8%、數量題 0%。一個沒看過答案的分類器能重現這個排序,才表示「題型」這個特徵真的有東西。
(參照那一欄同樣是影像辨識取得的:六回共 234 題,成功還原 230 題(98%)。兩個獨立的印證讓我們相信這份抽取沒有走樣——程式數出的圖表題正好是每回 3.0 題、意圖題每回約 2.2 題,和我們先前用完全不同的方法量到的命題架構配額一致。)
3. 改寫距離——正確答案離原文的用字有多遠
這是 Part 3 最要命的一項,也是下面第二個洞的主角。
對話裡說:I'll revise the interview guide before tomorrow's sessions. 一個太簡單的選項長這樣:Revise the interview guide(照抄)。 真實考試的選項長這樣:Update some materials——「revise」變「update」,「interview guide」變「materials」。意思一樣,字全換了。
差別在於,前者可以用關鍵字比對答對,後者一定要聽懂。我們對每一題計算選項與原文的用字重疊度。

4. 陷阱密度——長得像答案的錯誤選項
改寫距離的鏡像。錯誤選項裡塞進對話真的出現過的字,專門釣掃描關鍵字的人。目前我們題庫的平均值是:正確選項與原文的用字重疊 0.72,錯誤選項 0.21。這個差距太大了——這正是問題所在,下一節說。
5. 證據位置與題目順序
我們替每一題標了它的證據句(答案根據對話裡的哪一句)。全部題目都有,覆蓋率 100%;這也是為什麼你在 app 裡答完題後,逐字稿會直接把那一句標亮。
有了證據位置就能量一件很實用的事:三題的證據,有 94% 是照著音檔的順序出現的。第一題的答案在前段,第三題的答案在後段。真實考試也是這樣設計的,所以這不是我們的簡化——是可以拿來用的規律,策略那節會講怎麼用。
6. 圖表題與意圖題——結構上的固定配額
參照試卷六回之間零變異地固定:每回 Part 3 有 3 題圖表題、2 題說話者意圖題。這是命題架構,不是巧合。
我們的題庫原本這兩種都是零。現在都有了,而且——比題數更重要的——模擬考是按照這個配額抽題的,不是碰運氣。一種題型存在於題庫、但你在模考裡永遠遇不到,等於沒有。
跟參照試卷比出什麼:我們比它難,而且我們不打算改
刻度不能自己發明,得對到外部參照上。我們用的是《全新!新制多益 TOEIC 題庫解析 狠準 6 回》(Hackers Academia 著,國際學村出版)——完整六回,而且每一題都印著出版社自己的難度評級(高/中/低),給了我們 1,200 個現成的專業判斷可以對照。
Part 3 的結果:
| 低(簡單) | 中 | 高(困難) | |
|---|---|---|---|
| 參照試卷(205 題) | 41% | 47% | 12% |
| 我們的題庫 | 23.8% | 54.5% | 21.7% |
我們標為困難的題目,比參照多了約 8 個百分點。
看到這種差距,第一個該問的問題不是「要不要調」,而是「這是內容的差距,還是尺的差距」。這個系列在 Part 5 那篇已經示範過一次:那裡的標籤看起來和參照差很多,追下去卻發現我們的題目在結構上一點也沒有比較簡單——差的是兩邊對「難」的定義,不是題目本身。先分清楚這件事,再決定要不要動內容,是這整個系列最實用的一條經驗。
Part 3 這 8 點的方向和 Part 5 相反,而我們的處理方式是:留著。
理由有兩層。第一,這兩把尺本來就不可通約——一邊是編輯的判定,一邊是出題者的判斷,8 點的差距落在雜訊和真實差異都能解釋的範圍內。第二,也是更實際的:如果一份練習題庫要在標準之外偏一邊,偏難的那一邊對學習者是安全的。練得比考試難,考場上是餘裕;反過來則是意外。
至於為什麼我們偏難,第一節那張表已經給了答案,而且它比「我們比較嚴格」這種說法紮實得多:我們的對話不比參照長,但輪數更多、三人對話是參照的兩倍。 三人對話本身就多帶 10 個百分點的困難題(29.1% 對 19.1%),而它在我們題庫裡的比重是 25.6%、在參照裡是 13.0%。光是這一項的比重差,就足以解釋標籤上那 8 個百分點的大部分。
換句話說,這不是我們把每一題寫得比較刁鑽,而是我們的題庫多放了一種本來就比較難的對話。知道差距的來源是「組合」而不是「手法」,這件事才算真的查清楚——如果哪天要把它調回去,該動的是三人對話的比重,不是去修單一題目。
但這裡有一個當時必須講出來的矛盾,它也是下一節的引子:標籤說我們比較難,題型組合卻說我們比較淺。 同一個題庫,聽的那一面(三人、多輪)偏難,問的那一面(一半以上是細節題)偏簡單。兩件事都是量出來的,都不假。這正好說明為什麼我們不把難度標籤當成結論——它反映的是出題者對「聽起來多複雜」的感覺,而不是「這題要求你做多難的事」。
誠實的但書
- 參照書是出版社的模擬試題,不是 ETS 官方材料。 格式面它極可信(六回之間近乎零變異,正是忠實複製官方架構的樣子);難度面它承載的是編輯的判斷,不是真實考生的答對率。
- Part 3 的難度標籤是出題者標的,不是規則算出來的。 這是 Part 3 和 Part 1 的關鍵差別:Part 1 的每一個標籤都由一支程式從題目本身重算、並且和題庫 335 題全部吻合;Part 3 還沒有這樣的東西。上面那份特徵清單,有些(人數、長度、題型、證據位置、用字重疊)已經在量,但還沒有合成一個會覆寫標籤的難度分數。所以我們談 Part 3 的難度分佈,談的是一群出題者判斷的分佈。
- 我們曾經想找一個更客觀的裁判,失敗了。 構想是讓 AI 模型當「模擬考生」去做參照試卷,看它的答對率能不能重現出版社印的難易順序——如果能,就有了一把能同時量兩個題庫的尺。結果是:兩個能力差一個量級的模型,答對率都是 89.8%/89.9%,而且對難易完全沒有反應(相關係數約等於 0)。原因不難理解:讓學習者卡住的是單字和搭配的掌握,而任何堪用的模型早就有了。這把尺被丟掉了,我們認為值得寫下來。
- 真正的終點還是答對率。 隨著匿名作答統計累積,每一題會慢慢得到真實的 p 值。在那之前,這是我們能做到的最誠實的量法。
我們自己量到的兩個洞,現在都補完了
這一節寫給願意看到全貌的人。上面那 8 個百分點的標籤差距,其實是這篇文章裡最不重要的一個數字——它是刻度問題。真正的問題有兩個,都是內容問題,而且都是我們自己量出來的。
洞一:問得太淺——這個洞現在補完了
就是題型那張表。原本細節題 52.8% 對參照的 35.7%,推理型題目合計 12.6% 對 30.9%。意思是:一個練完我們全部 Part 3 的人,練到的「聽懂之後還要再想一步」的量,大約只有真實考試要求的四成。他會非常擅長在對話裡定位一個講過的事實,但推論、意圖、以及「男子要女子做什麼」這類需要整合的題型,練習量嚴重不足。
現在十四種題型全部落在參照的兩個百分點以內,推理型合計 31.9% 對 30.9%。做法在第 2 節講過:575 題改寫,加上 108 段新對話與新音檔。題庫也因此從 1,758 題長到 2,082 題。
需要誠實標註的一件事:這條線是用我們自己的分類器量的,同一支程式同時跑過參照試卷,所以兩邊的定義一致;但它終究是從題幹文字反推,不是從「這題實際上有多難」反推。題型對齊了,不等於難度就對齊了——那要等使用者實際作答的資料回來才知道。
洞二:答案太好猜——這個洞也補完了
當時 Part 3 有 653 題(37%)的正確選項,可以靠關鍵字比對答對。
這是 scripts/option_source_overlap.py 這支掃描程式的結果:它逐題比對正確選項和音檔逐字稿的用字重疊,當正確選項的重疊明顯高過三個錯誤選項時就標記出來。這不是新發現——這個問題最早是一位使用者回報的,指出有些題目「不用聽懂,比對關鍵字就會了」。我們據此做過一輪大規模改寫,重寫了 Part 3 的 576 個選項(連同 Part 4、Part 7 共 1,511 個)。
現在是 28 題(1.3%),而且這 28 題全部是刻意保留的(下面說明)。真正該改的,一題都不剩。
這個數字分兩段下來:
- 上一節那 575 題改寫,順手清掉了一大半。 每一道被改寫的題目都必須通過同一支掃描器的檢查才准進資料庫,所以題型對齊的同時,這個問題也跟著解決了五分之一個題庫。開始這一節時已經降到 462 題(22.2%)。
- 剩下的 434 題是一題一題手改的。 做法有兩種,第二種才是關鍵:正確選項改寫成換句話說;當換句話說還不夠時,就把逐字稿的用字給錯誤選項。真實試卷正是這個形狀——原文照搬的那個,是陷阱,不是答案。
舉一個真實的例子。一段餐飲訂單的對話,男子最後說:「你三點前把房號傳給我,我就能改訂單。」題目問「女子被要求傳什麼?」
改寫前的四個選項是:房號/賓客名單/付款收據/菜單價目。只有「房號」兩個字出現在音檔裡,另外三個一個字都沒有。你不需要聽懂那句話在講什麼,甚至不需要知道誰在跟誰說話——把聽到的詞跟選項對一遍就結束了。
改寫後,正確選項是「活動在哪個地點舉行」,同一件事,換個說法;而其中一個錯誤選項換成了「素食餐點的份數」——這幾個字全都在音檔裡(女子前面才說要加五份素食),聽起來也完全合理。現在對得上字的是錯的那個。要選對,你得聽懂他要的是房號、不是餐點數量。
那 28 題為什麼不改? 因為答案本來就無法改寫。圖表題的四個選項就是圖表上那幾行的標籤(「六號錐」「四號卸貨區」),必須照著印;地名、人名、金額也是一樣。真實試卷同樣這樣出題。我們把它們登記在 accepted.json 裡,理由逐題寫明,這樣掃描器的數字才讀得出意思,也不會逼出為了讓程式閉嘴而變糟的改寫。
用測量的角度說:正確選項與原文的用字重疊,從 0.72 降到 0.39;錯誤選項是 0.25。兩個數字已經接近,這正是我們一開始說「理想的 Part 3 應該長的樣子」。
還要補一句誠實的話:掃描器過關,只證明「共用字彙不再洩題」,不等於題目就變難了。 真正的驗證仍然是使用者的答對率。
這兩個洞本來是同一件事的兩面:一個是我們問得不夠深,一個是我們讓答案太容易被撿到。 兩個加起來,就是一份「聽起來很難、做起來偏簡單」的 Part 3——正好對應上一節那個矛盾。兩邊都補完之後,那個矛盾也就不存在了。
還有一個更難的限制
我們題庫的語域太一致了。 全部 1,018 段對話與獨白(近 49 萬字)裡,只有 2 個慣用語,「I guess」「to be honest」這類口語標記則是零。這件事是在補說話者意圖題時發現的——意圖題需要一句「字面意思不等於實際意思」的話可以引用,而我們找不到,只好重新寫。所以缺的從來不是那個題型,是口語的鬆散度本身。
這也解釋了為什麼洞一補起來那麼慢:意圖題和推論題需要的不只是換一種問法,而是對話本身要先有可以被推論的東西——最後那 108 段對話是重寫的,不是改寫的。這對每一批新內容都還是有效的約束。
知道結構之後:Part 3 怎麼聽、怎麼答
把上面的特徵清單反過來讀。
三題就是你的聽力大綱——一定要先讀
Part 3 唯一最有價值的習慣:在音檔開始前把三個題幹讀完。 題目印在題本上,這是規則允許的,而且是這個部分的設計前提。讀完三題,你就知道要聽人名、聽時間、還是聽某個人的建議——你從「試圖記住整段對話」變成「等三個特定的東西出現」。
前一題的解說在播、你手上還有時間時,就往下讀。這是 Part 3 最重要的節奏。
相信順序:94% 的題目照著音檔走
第一題的答案幾乎一定在對話前段,第三題在後段。所以邊聽邊往下推進:聽到第一題的答案就選掉,注意力立刻交給第二題。不要在對話播完之後才回頭想第一題——那時你要跟記憶打仗,而不是跟題目。
同時這也給了你一個止損訊號:如果對話已經講到最後、你第一題還沒著落,那一題就放掉,保住第二、三題。一段對話丟一題,遠好過丟三題。
「誰說的」要當成資訊來記
題幹會寫 the man / the woman / the second speaker。三人對話裡尤其如此。實務上:聽到建議、抱怨、承諾這類的話,順手記住是誰講的(男/女、或第幾個人)。內容記對、人記錯,答案照樣是錯的——而這正是三人對話多出那 10 個百分點困難題的來源。
對「跟聽到的一模一樣」的選項提高警覺
這是陷阱密度那條特徵教你的事:選項裡的字和你剛剛聽到的一字不差時,先懷疑。 出題者知道趕時間的人靠關鍵字,所以最省力的陷阱就是把原話的字接到錯的人、錯的時間或錯的事情上。反過來,一個把原話徹底換句話說的選項,往往才是正解——真實考試的正解通常長那樣。
(也因為如此,上一節那 653 題對我們是真的要緊:我們的題庫目前在這一點上還沒有完全對齊真實考試的行為。)
三種需要特別對待的題型
- 下一步題(What will the man do next?)——答案幾乎總在最後一兩句。聽到「I'll…」「Let me…」「I'd better…」就是它。整段對話你可以放鬆,最後兩句必須醒著。
- 意圖題(What does the woman mean when she says, "…"?)——引用的那句話字面上通常無害,真正的答案在它前後那一句。不要盯著引號裡的字想,要問「她講這句話是在回應什麼」。
- 圖表題——音檔播放前先看圖,看懂那張表的欄位是什麼(時間對場次?價格對方案?)。答案永遠是「音檔給你一欄、圖表給你另一欄」,你要做的是連線。先讀表,等於把一半的工作在開始前做完。
最後:這裡不能重來
Part 3 沒有第二次播放,也沒有回頭。整個聽力部分 45 分鐘固定推進,一段落後就整段落後。所以上面每一條策略的共同目的其實只有一個:讓你永遠在下一題,而不是在上一題。
一句話總結
Part 3 的難度來自三個可測的地方:你要追蹤幾個人、幾輪、題目要求你做多難的事、以及正確答案被換過多少字。
把同一套程式同時跑過我們的題庫和一套市售模擬試題六回,三個答案分別是:對話的長度和真實命題架構幾乎一模一樣,但我們的輪數更密、三人對話是兩倍——這解釋了我們為什麼多出 8 個百分點的困難題,我們選擇留著;題型組合我們問得太淺,推理型題目只有真實比例的四成;選項還有 37% 可以靠關鍵字比對答對。後面兩項是內容欠債,我們把它寫在這裡,而不是等到補完才說。
而同一份清單反過來讀,就是你的作答策略:先讀三題、順著音檔走、記住誰說的、對一模一樣的選項起疑。