Tất cả bài viết · Đăng ngày 2026-08-04

Độ khó của Part 3 nằm ở việc “ai nói gì” cộng với “đáp án đã được đổi cách diễn đạt” — kết quả đo được và hai điều chúng tôi đã sửa theo kết quả ấy

Phần giải thích kỹ thuật dành cho những ai tò mò. Loạt bài về độ khó có một bài cho mỗi Part và được đăng lần lượt; đây là bài thứ ba. Độ khó của Part 5 tập trung trong bốn lựa chọn, độ khó của Part 7 trải khắp toàn bài đọc, còn các câu hội thoại Part 3 nằm ở giữa: một đoạn hội thoại chưa đến 90 giây đi kèm ba câu hỏi, và độ khó đến đồng thời từ “điều gì xảy ra khi bạn nghe” lẫn “các lựa chọn được viết lại ra sao khi bạn đọc”. Bài này đo từng hạng mục trong ngân hàng câu hỏi của chúng tôi rồi đối chiếu với 6 đề thi thử thương mại — độ dài hội thoại, số lượt thoại, số người nói, tổ hợp dạng câu hỏi — để giải thích chỗ nào đã khớp và chỗ nào chúng tôi cố ý làm khó hơn. Đo xong, chúng tôi phát hiện hai lỗ hổng — câu hỏi còn quá nông, đáp án còn quá dễ đoán — và giờ cả hai đã được lấp: ngân hàng đã viết lại 575 câu hỏi, 434 bộ lựa chọn, đồng thời viết mới 108 đoạn hội thoại. Bạn không cần có kiến thức thống kê nào để đọc bài này.

Trước hết, hãy nói rõ Part 3 có hình dạng thế nào

Trong bài thi thật, Part 3 gồm 13 đoạn hội thoại, mỗi đoạn 3 câu, tổng cộng 39 câu — phần có nhiều câu nhất trong toàn bộ bài nghe (39 trên 100 câu). Mỗi đoạn hội thoại chỉ được phát một lần, ba câu hỏi được in trong đề, và bạn phải trả lời ngay trong lúc nghe.

Phần này trong ngân hàng của chúng tôi hiện có 694 đoạn hội thoại, 2,082 câu hỏi (trong thời gian viết bài, con số đã tăng từ 586 đoạn, 1,758 câu lên mức này; lý do nằm ở phần dưới). Nhưng “chúng tôi có bao nhiêu” không phải trọng điểm; trọng điểm là hình dạng có đúng không. Vì vậy, chúng tôi trích toàn bộ lời thoại Part 3 từ 6 đề trong một bộ thi thử thương mại (bộ tham chiếu đó là gì và có những giới hạn nào sẽ được giải thích riêng ở phần sau), rồi dùng cùng một thước đo cho cả hai bên:

Hạng mục Đề tham chiếu (6 đề, 69 đoạn) Ngân hàng của chúng tôi (586 đoạn)
Số từ mỗi đoạn Trung bình 85 (trung vị 87, phạm vi 45–110) Trung bình 87 (trung vị 89, phạm vi 43–148)
Số lượt thoại mỗi đoạn Trung bình 4.5 lượt Trung bình 5.4 lượt
Hội thoại ba người 13.0% (1–2 trong 13 đoạn mỗi đề) 25.6% (150 đoạn)

Hàng đầu tiên khá yên tâm: độ dài gần như giống hệt nhau. 85 so với 87 từ, trung vị 87 so với 89. Về độ dài cần có của một đoạn hội thoại Part 3, chúng tôi không viết lệch. (Khác biệt duy nhất nằm ở giới hạn trên: đoạn dài nhất của chúng tôi có 148 từ, còn của bộ tham chiếu là 110 từ. Một số ít đoạn đặc biệt dài là phần đuôi dài riêng của ngân hàng chúng tôi, không phải một phần của cấu trúc ra đề.)

Hàng thứ hai và thứ ba mới là khác biệt thực sự, và cả hai cùng chỉ về một điều:

  • Với cùng số từ, chúng tôi chia thành nhiều lượt thoại hơn. Trung bình gần thêm một lượt. Số từ không đổi mà số lượt tăng, nghĩa là mỗi lượt ngắn hơn và người nói đổi qua lại thường xuyên hơn.
  • Tỷ lệ hội thoại ba người của chúng tôi gần gấp đôi bộ tham chiếu. Cấu trúc đề thi thật đặt 1–2 đoạn hội thoại ba người trong 13 đoạn mỗi đề; ngân hàng của chúng tôi nâng tỷ lệ lên một phần tư.

Gộp hai điểm này lại, ta có “chi phí theo dõi”. Và hội thoại ba người quả thực khó hơn; đây là điều chúng tôi đo được chứ không phải phỏng đoán: 29.1% câu hỏi trong hội thoại ba người được gắn nhãn khó, còn hội thoại hai người chỉ có 19.1%. Thêm một người là thêm một việc phải làm — không chỉ nghe nội dung mà còn phải nhớ ai đã nói, vì câu hỏi sẽ hỏi thẳng “Người đàn ông đề nghị điều gì?” hoặc “Người phụ nữ thứ hai lo lắng về điều gì?”.

Nói cách khác, Part 3 của chúng tôi khó ở việc theo dõi, không khó ở lượng thông tin. Hãy nhớ kết luận này; con số “chúng tôi khó hơn bộ tham chiếu 8 điểm phần trăm” ở dưới sẽ không còn là một bí ẩn mà đã có lời giải thích.

Lưu ý về phương pháp trích xuất: lời thoại của đề tham chiếu được in trong sách giải nhưng không có lớp văn bản, nên chúng tôi khôi phục bằng nhận dạng hình ảnh (bố cục hai cột phải được dựng lại từ tọa độ chữ, nếu không hai cột sẽ bị đọc thành cùng một dòng). Tổng cộng 6 đề có 78 đoạn, chúng tôi khôi phục thành công 69 đoạn (88%); số còn lại không thể tách một cách đáng tin cậy do lỗi nhận dạng. Các số liệu tham chiếu trong bảng trên là thống kê của 69 đoạn này.


Một đoạn hội thoại có thể bị làm khó theo những hướng nào

Dưới đây là các đặc trưng chính mà chúng tôi thực sự tính toán hoặc gắn nhãn cho từng câu Part 3. Cũng như các bài khác trong loạt này, lát nữa danh sách sẽ được đọc ngược lại để trở thành chiến lược làm bài của bạn.

1. Số người nói và số lượt thoại — chi phí theo dõi

Hai người so với ba người, và một đoạn hội thoại được chia thành bao nhiêu lượt, như ở phần đầu. Khó khăn của hội thoại ba người không nằm ở lượng thông tin mà ở việc quy đúng người: cùng một câu do ai nói sẽ làm thay đổi đáp án của ít nhất một trong ba câu hỏi. Số lượt thoại là phiên bản liên tục của vấn đề ấy — mỗi lần đổi người nói, bạn phải gắn lại sự chú ý của mình một lần.

2. Dạng câu hỏi — bạn được yêu cầu làm việc gì

Chúng tôi viết một chương trình suy ngược từ phần dẫn câu hỏi để xác định mỗi câu thực sự đang kiểm tra điều gì. Chương trình chạy qua toàn bộ ngân hàng của chúng tôi và cả 230 câu Part 3 trong 6 đề tham chiếu — cùng một chương trình, hai ngân hàng, như vậy phép so sánh mới có ý nghĩa.

Dạng câu hỏi Đề tham chiếu Trước khi viết lại Sau khi viết lại Việc bạn phải làm
Câu hỏi chi tiết 35.7% 52.8% 35.7% Xác định một sự thật đã được nói ra
Yêu cầu/đề nghị 11.7% 4.3% 11.6% Ai yêu cầu ai làm gì
Câu hỏi kèm hình ảnh 7.8% 2.4% 7.8% Đối chiếu audio với một bảng mới tìm ra đáp án
Câu hỏi nguyên nhân (Why…?) 7.4% 16.4% 7.4% Tìm quan hệ nhân quả, thường trải qua hai lượt thoại
Câu hỏi địa điểm 6.5% 2.7% 6.4% Bối cảnh ở đâu
Bước tiếp theo (What will… do next?) 6.5% 4.4% 6.5% Việc chỉ xảy ra sau khi hội thoại kết thúc
Câu hỏi suy luận 6.5% 1.1% 6.5% Ghép hai sự thật thành một kết luận không được nói thẳng
Câu hỏi ý định của người nói 5.7% 0.9% 5.9% “Người đó nói câu này có ý gì?”
Vấn đề (What problem…?) 4.3% 6.3% 4.2% Nắm được trở ngại đang bị phàn nàn hoặc chỉ ra
Câu hỏi danh tính 3.5% 1.1% 3.5% Người đang nói là ai
Câu hỏi ý chính 3.0% 1.9% 2.9% Khái quát cả đoạn, không phải bất kỳ câu đơn lẻ nào
Câu hỏi mục đích 1.3% 1.8% 1.3% Vì sao cuộc gọi/cuộc hội thoại này diễn ra
Câu hỏi thời gian/số lượng 0% 3.8% 0.3% Thông tin tại một điểm
Tổng các câu hỏi đòi hỏi suy luận 30.9% 12.6% 31.9%

Bảng này quan trọng hơn nhiều so với bảng ở phần trước, vì nó không nói về thang đo mà nói về nội dung.

Trước khi viết lại, câu hỏi chi tiết chỉ chiếm một phần ba trong đề tham chiếu, nhưng chiếm hơn một nửa ở chúng tôi. Ngược lại, những dạng phải nghĩ thêm một bước — suy luận, ý định, ý chính, mục đích, bước tiếp theo, câu hỏi kèm hình ảnh — chiếm 30.9% trong bộ tham chiếu nhưng chỉ 12.6% ở chúng tôi, chưa bằng một nửa. Kết luận lúc ấy là: tỷ lệ câu hỏi trong cấu trúc đề thật buộc bạn “nghe hiểu rồi nghĩ thêm một bước” cao hơn gấp đôi ngân hàng của chúng tôi.

Phiên bản đó đã được sửa xong. Cột thứ tư trong bảng là ngân hàng hiện tại: cả mười bốn dạng câu hỏi đều nằm trong khoảng hai điểm phần trăm so với bộ tham chiếu, tổng nhóm suy luận là 31.9% so với 30.9%.

Để lấp khoảng cách này, chúng tôi dùng hai cách làm hoàn toàn khác nhau; đáng để nói rõ:

  • Mười một dạng câu hỏi được bổ sung bằng cách “hỏi theo một hướng khác”. Vẫn đoạn hội thoại ấy, vẫn audio ấy, nhưng bản thân câu hỏi được viết lại — hỏi một việc khác và đi kèm một bộ lựa chọn hoàn toàn mới. Audio không thay đổi một chữ nào, vì phần âm thanh của từng câu hỏi là những đoạn độc lập. Kết quả tạo ra thực sự là một câu hỏi khác, không phải chỉ đổi cách nói của “Tại sao…?”; cách sau khiến số liệu đẹp hơn nhưng không làm câu hỏi khó hơn.
  • Câu hỏi kèm hình ảnh và câu hỏi ý định của người nói không thể bổ sung theo cách đó, chỉ có thể viết mới. Câu hỏi kèm hình ảnh cần hội thoại vừa khéo chỉ nói một phía của dữ liệu cần đối chiếu; câu hỏi ý định cần một câu có nghĩa đen khác với ý thực — trong 49 vạn chữ hội thoại hiện có, chúng tôi chỉ tìm thấy 2 cách nói như vậy. Vì thế, hai dạng này được đưa vào bằng 108 đoạn hội thoại viết mới (cùng audio thu mới), và đó cũng là phần chậm nhất của toàn bộ công việc.

Tiện thể, chúng tôi sửa luôn hai việc: câu hỏi thời gian/số lượng giảm từ 3.8% xuống 0.3% (trong 6 đề tham chiếu không có lấy một câu; việc cả 6 đề đều không dùng khó có thể là ngẫu nhiên — kiểu chép lại một điểm thông tin như “Họ gặp nhau lúc mấy giờ?” giống việc của Part 2 hơn); ngoài ra còn có vị trí đáp án đúng trong các lựa chọn: có lúc bảy phần mười câu mới rơi vào A, giờ bốn chữ cái mỗi chữ chiếm một phần tư.

Cuối cùng, có một đặc tính tốt khiến bộ phân loại này đáng được coi trọng: nó chưa từng nhìn nhãn độ khó, nhưng lại xếp các dạng câu hỏi theo đúng thứ tự của nhãn — 96.7% câu hỏi ý định của người nói được gắn nhãn khó, câu hỏi suy luận là 58.6%, câu hỏi nguyên nhân là 33.6%, trong khi câu hỏi mục đích chỉ có 0.8% và câu hỏi số lượng là 0%. Một bộ phân loại chưa nhìn đáp án mà vẫn tái tạo được thứ tự này mới cho thấy đặc trưng “dạng câu hỏi” thực sự có giá trị.

(Cột tham chiếu cũng được lấy bằng nhận dạng hình ảnh: tổng cộng 6 đề có 234 câu, khôi phục thành công 230 câu (98%). Hai kiểm chứng độc lập khiến chúng tôi tin rằng kết quả trích xuất không bị méo — chương trình đếm được đúng 3.0 câu hỏi kèm hình ảnh mỗi đề và khoảng 2.2 câu hỏi ý định mỗi đề, khớp với hạn mức cấu trúc đề mà trước đó chúng tôi đo được bằng một phương pháp hoàn toàn khác.)

3. Khoảng cách diễn đạt lại — từ ngữ của đáp án đúng cách nguyên văn bao xa

Đây là yếu tố chí mạng nhất của Part 3, đồng thời là nhân vật chính của lỗ hổng thứ hai ở dưới.

Trong hội thoại có câu: I'll revise the interview guide before tomorrow's sessions. Một lựa chọn quá đơn giản sẽ như thế này: Revise the interview guide (chép nguyên văn). Lựa chọn trong đề thi thật sẽ như thế này: Update some materials — “revise” đổi thành “update”, “interview guide” đổi thành “materials”. Nghĩa giống nhau, từ ngữ thay hết.

Khác biệt nằm ở chỗ: với lựa chọn trước, bạn có thể so từ khóa để trả lời đúng; với lựa chọn sau, bạn nhất định phải nghe hiểu. Chúng tôi tính mức độ trùng từ giữa lựa chọn và nguyên văn cho từng câu.

4. Mật độ bẫy — lựa chọn sai trông giống đáp án

Đây là hình ảnh phản chiếu của khoảng cách diễn đạt lại. Các lựa chọn sai được cài những từ thực sự xuất hiện trong hội thoại để nhử người chỉ quét từ khóa. Giá trị trung bình hiện tại của ngân hàng là: mức trùng từ giữa lựa chọn đúng và nguyên văn là 0.72, còn lựa chọn sai là 0.21. Khoảng cách này quá lớn — đó chính là vấn đề, phần sau sẽ nói rõ.

5. Vị trí bằng chứng và thứ tự câu hỏi

Chúng tôi gắn nhãn câu bằng chứng cho từng câu hỏi (đáp án dựa trên câu nào trong hội thoại). Tất cả câu hỏi đều có, độ bao phủ là 100%; đó cũng là lý do sau khi bạn trả lời trong app, phần lời thoại sẽ tô sáng trực tiếp câu ấy.

Có vị trí bằng chứng, ta đo được một điều rất hữu ích: ở 94% trường hợp, bằng chứng cho ba câu hỏi xuất hiện theo thứ tự của audio. Đáp án câu đầu nằm ở đoạn đầu, đáp án câu thứ ba nằm ở đoạn sau. Đề thi thật cũng được thiết kế như vậy, nên đây không phải sự đơn giản hóa của chúng tôi — mà là quy luật bạn có thể tận dụng; phần chiến lược sẽ nói cách dùng.

6. Câu hỏi kèm hình ảnh và câu hỏi ý định — hạn mức cố định trong cấu trúc

Giữa 6 đề tham chiếu, con số được cố định với độ biến thiên bằng không: mỗi Part 3 có 3 câu hỏi kèm hình ảnh, 2 câu hỏi ý định của người nói. Đây là cấu trúc ra đề, không phải ngẫu nhiên.

Ngân hàng của chúng tôi trước đây không có câu nào thuộc hai dạng này. Giờ thì đã có, và — quan trọng hơn số lượng — đề thi thử lấy câu theo đúng hạn mức ấy, chứ không phó mặc cho may rủi. Một dạng câu hỏi có trong ngân hàng nhưng bạn không bao giờ gặp trong đề thi thử thì cũng như không có.


So với đề tham chiếu, chúng tôi thấy gì: ngân hàng khó hơn, và chúng tôi không định sửa

Không thể tự nghĩ ra thang đo; phải căn nó vào một tham chiếu bên ngoài. Chúng tôi dùng bộ 《全新!新制多益 TOEIC 題庫解析 狠準 6 回》 (do Hackers Academia biên soạn, 國際學村 xuất bản) — đủ 6 đề, và mỗi câu đều in mức độ khó do chính nhà xuất bản đánh giá (cao/trung bình/thấp), cho chúng tôi 1,200 nhận định chuyên môn có sẵn để đối chiếu.

Kết quả của Part 3:

Thấp (dễ) Trung bình Cao (khó)
Đề tham chiếu (205 câu) 41% 47% 12%
Ngân hàng của chúng tôi 23.8% 54.5% 21.7%

Tỷ lệ câu được chúng tôi gắn nhãn khó cao hơn bộ tham chiếu khoảng 8 điểm phần trăm.

Khi thấy khoảng cách như vậy, câu đầu tiên cần hỏi không phải “có nên điều chỉnh không?” mà là “đây là khác biệt về nội dung hay khác biệt về thước đo?”. Bài Part 5 trong loạt này đã minh họa điều đó một lần: nhãn ở đó trông rất khác bộ tham chiếu, nhưng lần theo thì thấy câu hỏi của chúng tôi về mặt cấu trúc chẳng hề đơn giản hơn — khác biệt nằm ở định nghĩa “khó” của hai bên, không phải ở bản thân câu hỏi. Phân biệt rõ việc này trước rồi mới quyết định có sửa nội dung hay không là một trong những kinh nghiệm hữu ích nhất của cả loạt bài.

Với Part 3, hướng của 8 điểm này ngược với Part 5, và cách xử lý của chúng tôi là: giữ nguyên.

Có hai tầng lý do. Thứ nhất, hai thước đo này vốn không thể quy đổi trực tiếp — một bên là đánh giá của biên tập viên, một bên là phán đoán của người ra đề; khoảng cách 8 điểm nằm trong phạm vi mà cả nhiễu lẫn khác biệt thực đều có thể giải thích. Thứ hai, cũng thực tế hơn: nếu một ngân hàng luyện tập phải lệch về một phía so với chuẩn, lệch về phía khó là an toàn cho người học. Luyện khó hơn bài thi thì vào phòng thi sẽ có dư địa; ngược lại mới là bất ngờ.

Còn vì sao ngân hàng của chúng tôi khó hơn, bảng ở phần đầu đã trả lời, và câu trả lời vững hơn nhiều so với kiểu nói “chúng tôi nghiêm hơn”: hội thoại của chúng tôi không dài hơn bộ tham chiếu, nhưng có nhiều lượt thoại hơn và tỷ lệ hội thoại ba người gấp đôi. Bản thân hội thoại ba người đã có thêm 10 điểm phần trăm câu khó (29.1% so với 19.1%), trong khi chúng chiếm 25.6% ngân hàng của chúng tôi và 13.0% bộ tham chiếu. Chỉ riêng chênh lệch tỷ trọng này đã đủ giải thích phần lớn 8 điểm phần trăm trên nhãn.

Nói cách khác, không phải chúng tôi viết từng câu đánh đố hơn, mà là ngân hàng của chúng tôi đưa vào nhiều hơn một loại hội thoại vốn đã khó hơn. Chỉ khi biết nguồn gốc chênh lệch nằm ở “cơ cấu” chứ không phải “thủ pháp” thì mới coi là tìm hiểu đến nơi đến chốn — nếu một ngày cần điều chỉnh lại, thứ phải thay đổi là tỷ lệ hội thoại ba người, không phải sửa từng câu riêng lẻ.

Nhưng ở đây có một mâu thuẫn mà lúc ấy buộc phải nói ra, và nó cũng dẫn vào phần sau: nhãn nói ngân hàng của chúng tôi khó hơn, nhưng tổ hợp dạng câu hỏi lại nói chúng tôi hỏi nông hơn. Cùng một ngân hàng, phía nghe (ba người, nhiều lượt) thiên về khó, phía hỏi (hơn một nửa là câu hỏi chi tiết) thiên về dễ. Cả hai đều là kết quả đo được, đều đúng. Điều này cho thấy chính xác vì sao chúng tôi không coi nhãn độ khó là kết luận — nó phản ánh cảm nhận của người ra đề về “nghe phức tạp đến mức nào”, chứ không phải “câu này yêu cầu bạn làm một việc khó đến đâu”.

Lưu ý thẳng thắn

  • Sách tham chiếu là đề thi thử của nhà xuất bản, không phải tài liệu chính thức của ETS. Về định dạng, nó rất đáng tin (độ biến thiên giữa 6 đề gần bằng không, đúng dáng vẻ của việc sao chép trung thành cấu trúc chính thức); về độ khó, nó mang đánh giá của biên tập viên chứ không phải tỷ lệ trả lời đúng của thí sinh thật.
  • Nhãn độ khó của Part 3 do người ra đề gắn, không phải do quy tắc tính ra. Đây là khác biệt then chốt giữa Part 3 và Part 1: từng nhãn của Part 1 đều được một chương trình tính lại từ chính câu hỏi và khớp với toàn bộ 335 câu trong ngân hàng; Part 3 chưa có công cụ như vậy. Trong danh sách đặc trưng ở trên, một số yếu tố (số người, độ dài, dạng câu hỏi, vị trí bằng chứng, độ trùng từ) đã được đo, nhưng chưa được tổng hợp thành một điểm độ khó có thể ghi đè nhãn. Vì vậy, khi nói về phân bố độ khó Part 3, chúng tôi đang nói về phân bố phán đoán của một nhóm người ra đề.
  • Chúng tôi từng cố tìm một trọng tài khách quan hơn, nhưng thất bại. Ý tưởng là cho mô hình AI làm “thí sinh mô phỏng” để giải đề tham chiếu, xem tỷ lệ trả lời đúng của nó có tái tạo được thứ tự khó dễ do nhà xuất bản in hay không — nếu có, ta sẽ có một thước đo dùng được cho cả hai ngân hàng. Kết quả: hai mô hình có năng lực cách nhau một bậc độ lớn đều đạt 89.8%/89.9%, và hoàn toàn không phản ứng với độ khó (hệ số tương quan xấp xỉ 0). Lý do không khó hiểu: thứ làm người học mắc kẹt là mức độ nắm từ vựng và cách kết hợp từ, mà bất kỳ mô hình đủ dùng nào cũng đã có. Chúng tôi đã bỏ thước đo này, nhưng cho rằng việc ấy đáng được ghi lại.
  • Đích đến thực sự vẫn là tỷ lệ trả lời đúng. Khi số liệu trả lời ẩn danh tích lũy dần, mỗi câu sẽ dần có giá trị p thực. Trước lúc đó, đây là cách đo thành thật nhất chúng tôi có thể làm.

Hai lỗ hổng tự đo ra, giờ đều đã được lấp

Phần này dành cho những ai muốn thấy toàn cảnh. Khoảng cách nhãn 8 điểm phần trăm ở trên thực ra là con số ít quan trọng nhất trong bài này — đó là vấn đề thang đo. Vấn đề thật sự có hai, đều là vấn đề nội dung và đều do chính chúng tôi đo ra.

Lỗ hổng thứ nhất: hỏi quá nông — giờ đã lấp xong

Đó chính là bảng về dạng câu hỏi. Ban đầu, câu hỏi chi tiết chiếm 52.8% so với 35.7% của bộ tham chiếu, còn tổng câu hỏi suy luận là 12.6% so với 30.9%. Nghĩa là một người luyện xong toàn bộ Part 3 của chúng tôi chỉ nhận được lượng bài tập “nghe hiểu xong còn phải nghĩ thêm một bước” bằng khoảng bốn phần mười yêu cầu của bài thi thật. Người ấy sẽ rất giỏi xác định một sự thật đã được nói trong hội thoại, nhưng lại thiếu bài tập nghiêm trọng ở các dạng cần tổng hợp như suy luận, ý định và “người đàn ông muốn người phụ nữ làm gì”.

Giờ cả mười bốn dạng câu hỏi đều nằm trong khoảng hai điểm phần trăm so với bộ tham chiếu, tổng nhóm suy luận là 31.9% so với 30.9%. Cách làm đã nói ở phần 2: viết lại 575 câu hỏi, cộng thêm 108 đoạn hội thoại mới và audio mới. Nhờ vậy, ngân hàng cũng tăng từ 1,758 lên 2,082 câu.

Có một điều cần ghi chú thẳng thắn: đường này được đo bằng bộ phân loại của chính chúng tôi; cùng một chương trình chạy trên cả đề tham chiếu nên định nghĩa hai bên nhất quán, nhưng rốt cuộc nó vẫn suy ngược từ phần dẫn câu hỏi, không suy ngược từ “câu này thực tế khó đến đâu”. Dạng câu hỏi đã khớp không có nghĩa độ khó cũng đã khớp — phải chờ dữ liệu làm bài thực tế của người dùng mới biết.

Lỗ hổng thứ hai: đáp án quá dễ đoán — giờ cũng đã lấp xong

Khi ấy, Part 3 có 653 câu (37%) mà lựa chọn đúng có thể được tìm ra chỉ bằng cách đối chiếu từ khóa.

Đây là kết quả của chương trình quét scripts/option_source_overlap.py: chương trình so từng câu giữa lựa chọn đúng và lời thoại audio về mức độ trùng từ, rồi đánh dấu khi độ trùng của lựa chọn đúng cao hơn rõ rệt so với ba lựa chọn sai. Đây không phải phát hiện mới — vấn đề ban đầu do một người dùng phản hồi, cho biết có những câu “không cần nghe hiểu, chỉ cần đối chiếu từ khóa là làm được”. Từ đó, chúng tôi đã thực hiện một đợt viết lại quy mô lớn, viết lại 576 lựa chọn của Part 3 (tổng cộng 1,511 lựa chọn nếu tính cả Part 4 và Part 7).

Giờ còn 28 câu (1.3%), và cả 28 câu này đều được chủ ý giữ lại (giải thích bên dưới). Không còn sót một câu nào thực sự cần sửa.

Con số này giảm qua hai giai đoạn:

  1. Đợt viết lại 575 câu ở phần trước tiện thể dọn quá nửa số đó. Mỗi câu hỏi được viết lại đều phải vượt qua phép kiểm tra của cùng chương trình quét mới được đưa vào cơ sở dữ liệu, nên trong lúc cân chỉnh dạng câu hỏi, vấn đề này cũng được giải quyết ở một phần năm ngân hàng. Khi bắt đầu phần này, con số đã giảm xuống 462 câu (22.2%).
  2. 434 câu còn lại được sửa thủ công từng câu một. Có hai cách, và cách thứ hai mới là mấu chốt: viết lại lựa chọn đúng bằng một cách diễn đạt khác; khi đổi cách diễn đạt vẫn chưa đủ, chúng tôi đưa từ ngữ trong lời thoại sang lựa chọn sai. Đề thi thật có đúng hình dạng này — lựa chọn chép nguyên văn là bẫy, không phải đáp án.

Lấy một ví dụ thực tế. Trong đoạn hội thoại về đơn đặt món, cuối cùng người đàn ông nói: “Nếu cô gửi cho tôi số phòng trước ba giờ, tôi có thể sửa đơn đặt hàng.” Câu hỏi là “Người phụ nữ được yêu cầu gửi gì?”

Bốn lựa chọn trước khi viết lại là: số phòng/danh sách khách/biên lai thanh toán/bảng giá thực đơn. Chỉ hai từ “số phòng” xuất hiện trong audio; ba lựa chọn còn lại không có một từ nào. Bạn không cần hiểu câu ấy đang nói gì, thậm chí không cần biết ai đang nói với ai — chỉ cần đối chiếu từ nghe được với lựa chọn là xong.

Sau khi viết lại, lựa chọn đúng là “địa điểm tổ chức sự kiện”, cùng một việc nhưng nói cách khác; còn một lựa chọn sai được đổi thành “số suất ăn chay” — tất cả những từ này đều có trong audio (trước đó người phụ nữ vừa nói muốn thêm năm suất chay), nghe cũng hoàn toàn hợp lý. Bây giờ lựa chọn khớp từ lại là lựa chọn sai. Muốn chọn đúng, bạn phải nghe hiểu rằng anh ấy cần số phòng chứ không phải số suất ăn.

Vì sao không sửa 28 câu ấy? Vì đáp án vốn không thể viết lại. Bốn lựa chọn của câu hỏi kèm hình ảnh chính là các nhãn ở những dòng trên hình (“cọc tiêu số sáu”, “khu dỡ hàng số bốn”), nên phải giữ nguyên như bản in; địa danh, tên người và số tiền cũng vậy. Đề thi thật cũng ra câu theo cách này. Chúng tôi đăng ký chúng trong accepted.json, ghi rõ lý do cho từng câu, để con số của chương trình quét có thể được hiểu đúng và không ép chúng tôi viết lại theo hướng tệ đi chỉ để làm chương trình im tiếng.

Nói theo góc độ đo lường: mức trùng từ giữa lựa chọn đúng và nguyên văn giảm từ 0.72 xuống 0.39; với lựa chọn sai là 0.25. Hai con số đã gần nhau, và đó chính là điều ngay từ đầu chúng tôi gọi là “hình dạng lý tưởng của Part 3”.

Cần thêm một lời nói thật: vượt qua chương trình quét chỉ chứng minh “từ vựng dùng chung không còn làm lộ đáp án”, không có nghĩa câu hỏi đã trở nên khó hơn. Phép kiểm chứng thực sự vẫn là tỷ lệ trả lời đúng của người dùng.

Hai lỗ hổng này vốn là hai mặt của cùng một vấn đề: một bên là chúng tôi hỏi chưa đủ sâu, một bên là chúng tôi để đáp án quá dễ nhặt ra. Gộp lại, ta có một Part 3 “nghe thì khó, làm lại hơi dễ” — khớp chính xác với mâu thuẫn ở phần trước. Khi cả hai phía đều được lấp, mâu thuẫn ấy cũng biến mất.

Còn một giới hạn khó hơn

Ngữ vực trong ngân hàng của chúng tôi quá đồng nhất. Trong toàn bộ 1,018 đoạn hội thoại và độc thoại (gần 49 vạn chữ), chỉ có 2 thành ngữ, còn các dấu hiệu khẩu ngữ như “I guess”, “to be honest” thì bằng không. Chúng tôi phát hiện việc này khi bổ sung câu hỏi ý định của người nói — dạng này cần trích một câu “nghĩa đen không bằng ý thực”, nhưng chúng tôi không tìm thấy nên đành viết mới. Vì vậy, thứ thiếu chưa bao giờ chỉ là dạng câu hỏi đó, mà là chính độ tự nhiên, lỏng của khẩu ngữ.

Điều này cũng giải thích vì sao lấp lỗ hổng thứ nhất lại chậm đến vậy: câu hỏi ý định và suy luận không chỉ cần một cách hỏi khác, mà bản thân hội thoại trước hết phải có điều gì đó để suy luận — 108 đoạn hội thoại cuối cùng là viết mới chứ không phải viết lại. Đây vẫn là ràng buộc có hiệu lực với mọi lô nội dung mới.


Khi đã biết cấu trúc: nghe và trả lời Part 3 thế nào

Hãy đọc ngược danh sách đặc trưng ở trên.

Ba câu hỏi chính là dàn ý nghe của bạn — nhất định phải đọc trước

Thói quen có giá trị nhất trong Part 3: đọc xong phần dẫn của cả ba câu trước khi audio bắt đầu. Câu hỏi được in trong đề, quy tắc cho phép làm vậy và đó cũng là tiền đề thiết kế của phần này. Đọc xong ba câu, bạn sẽ biết mình cần nghe tên người, thời gian hay đề nghị của một người nào đó — bạn chuyển từ “cố nhớ toàn bộ hội thoại” sang “chờ ba thứ cụ thể xuất hiện”.

Khi phần giải thích của câu trước đang phát và bạn vẫn còn thời gian, hãy đọc xuống dưới. Đây là nhịp độ quan trọng nhất của Part 3.

Tin vào thứ tự: 94% câu hỏi đi theo audio

Đáp án câu đầu gần như chắc chắn nằm ở đoạn đầu hội thoại, câu thứ ba nằm ở đoạn sau. Vì vậy, vừa nghe vừa tiến xuống dưới: nghe thấy đáp án câu đầu thì chọn ngay, rồi lập tức chuyển sự chú ý sang câu thứ hai. Đừng chờ hội thoại phát xong mới quay lại nghĩ câu đầu — lúc ấy bạn đang vật lộn với trí nhớ, không phải với câu hỏi.

Điều này cũng cho bạn một tín hiệu cắt lỗ: nếu hội thoại đã gần hết mà câu đầu vẫn chưa có đáp án, hãy bỏ câu đó để giữ câu hai và câu ba. Mất một câu trong một đoạn vẫn tốt hơn nhiều so với mất cả ba.

Hãy ghi nhớ “ai nói” như một phần thông tin

Phần dẫn sẽ viết the man / the woman / the second speaker. Điều này đặc biệt quan trọng trong hội thoại ba người. Trong thực tế: khi nghe thấy lời đề nghị, phàn nàn hoặc cam kết, tiện thể nhớ luôn ai đã nói (nam/nữ hoặc người thứ mấy). Nhớ đúng nội dung nhưng nhầm người thì đáp án vẫn sai — và đây chính là nguồn gốc khiến hội thoại ba người có thêm 10 điểm phần trăm câu khó.

Cảnh giác hơn với lựa chọn “giống hệt những gì vừa nghe”

Đây là điều đặc trưng mật độ bẫy dạy bạn: khi từ ngữ trong một lựa chọn giống từng chữ với điều bạn vừa nghe, hãy nghi ngờ trước. Người ra đề biết người đang vội sẽ bám từ khóa, nên cái bẫy ít tốn công nhất là gắn từ trong nguyên văn vào sai người, sai thời gian hoặc sai sự việc. Ngược lại, một lựa chọn diễn đạt lại hoàn toàn lời thoại thường mới là đáp án đúng — đáp án đúng trong đề thi thật thường có hình dạng như vậy.

(Cũng vì thế, 653 câu ở phần trước thực sự quan trọng với chúng tôi: về điểm này, ngân hàng hiện tại của chúng tôi vẫn chưa hoàn toàn khớp với cách vận hành của đề thi thật.)

Ba dạng câu hỏi cần xử lý đặc biệt

  • Câu hỏi bước tiếp theo (What will the man do next?) — đáp án gần như luôn nằm ở một hai câu cuối. Nghe thấy “I'll…”, “Let me…”, “I'd better…” là nó. Bạn có thể thả lỏng trong cả đoạn, nhưng hai câu cuối phải tỉnh táo.
  • Câu hỏi ý định (What does the woman mean when she says, "…"?) — câu được trích thường vô hại về nghĩa đen; đáp án thật nằm ở câu ngay trước hoặc sau nó. Đừng nhìn chằm chằm vào từ trong ngoặc kép để nghĩ, hãy hỏi “Cô ấy nói câu này để phản hồi điều gì?”.
  • Câu hỏi kèm hình ảnh — trước khi audio phát, hãy nhìn hình trước và hiểu các cột trong bảng biểu thị điều gì (thời gian ứng với suất nào? giá ứng với gói nào?). Đáp án luôn là “audio cho bạn một cột, hình ảnh cho bạn cột kia”; việc của bạn là nối chúng lại. Đọc bảng trước tức là hoàn thành một nửa công việc trước khi bắt đầu.

Cuối cùng: ở đây không có cơ hội làm lại

Part 3 không phát lần thứ hai, cũng không quay lại. Toàn bộ phần nghe tiến liên tục trong 45 phút; chậm một đoạn là chậm cả đoạn. Vì vậy, mục đích chung của mọi chiến lược trên thực ra chỉ có một: giúp bạn luôn ở câu tiếp theo, không mắc lại ở câu trước.


Tóm lại trong một câu

Độ khó của Part 3 đến từ ba chỗ có thể đo được: bạn phải theo dõi bao nhiêu người, bao nhiêu lượt thoại, câu hỏi yêu cầu bạn làm việc khó đến mức nào, và đáp án đúng đã được thay đổi bao nhiêu từ.

Khi chạy cùng một chương trình trên cả ngân hàng của chúng tôi lẫn 6 đề trong một bộ thi thử thương mại, ba câu trả lời lần lượt là: độ dài hội thoại gần như giống hệt cấu trúc đề thật, nhưng lượt thoại của chúng tôi dày hơn và tỷ lệ hội thoại ba người gấp đôi — điều này giải thích vì sao chúng tôi có thêm 8 điểm phần trăm câu khó, và chúng tôi chọn giữ nguyên; về tổ hợp dạng câu hỏi, chúng tôi hỏi quá nông, tỷ lệ câu suy luận chỉ bằng bốn phần mười tỷ lệ thật; trong các lựa chọn, vẫn có 37% câu có thể trả lời đúng bằng cách đối chiếu từ khóa. Hai điểm sau là nợ nội dung; chúng tôi viết chúng ra ở đây, thay vì chờ sửa xong mới nói.

Còn nếu đọc ngược chính danh sách đó, bạn sẽ có chiến lược làm bài: đọc trước ba câu, đi theo audio, nhớ ai nói gì, nghi ngờ lựa chọn giống hệt nguyên văn.

← Tất cả bài viết