Tất cả bài viết · Đăng ngày 2026-08-04

Cái khó của Part 6 nằm ở câu hỏi: "Bạn có thực sự cần bài văn đó không?" — Một phép đo bằng cách che bài văn lại

Bài giải thích kỹ thuật dành cho những ai tò mò. Chuỗi bài về độ khó gồm mỗi Part một bài, đăng theo thứ tự; đây là bài thứ sáu. Độ khó của Part 5 tập trung vào cách sắp xếp bốn phương án, còn độ khó của Part 7 rải rác trong toàn bộ bài văn. Part 6 nằm ở giữa, và độ khó của nó đến từ một điểm rất dễ bị bỏ qua: <strong>Chỗ trống này, rốt cuộc có cần bạn đọc bài văn đó hay không?</strong> Bài viết này giải thích cách chúng tôi biến câu hỏi đó thành một con số có thể đo lường được, phương pháp chúng tôi sử dụng để phép đo này không chỉ là "cảm giác của một ai đó", kết quả đo được là gì (kết quả lần đo đầu tiên trông rất tệ đối với chúng tôi, và chúng tôi đã dựa vào đó để sửa lại toàn bộ ngân hàng câu hỏi), và phần hữu ích nhất dành cho bạn — sau khi biết Part 6 có hai loại chỗ trống hoàn toàn khác nhau, bạn nên phân bổ thời gian như thế nào trong phòng thi. Không cần bất kỳ nền tảng thống kê nào.

Part 6 nên kiểm tra điều gì

Part 6 là từ câu 131 đến 146 của phần thi Đọc: bốn bài văn ngắn, mỗi bài có bốn chỗ trống, mỗi chỗ trống có bốn phương án.

Nhìn từ bề ngoài, nó rất giống như "nhét Part 5 vào trong một bài văn". Nhưng nó không nên như vậy. Part 5 đưa cho bạn một câu đơn độc, vì vậy đáp án chắc chắn chỉ có thể tìm thấy trong chính câu đó. Part 6 đưa cho bạn toàn bộ một bài văn — điều này có nghĩa là đáp án "có thể" ẩn giấu trong các câu khác.

Đó mới là lý do Part 6 tồn tại. Nếu mỗi chỗ trống đều có thể giải quyết chỉ dựa vào chính câu chứa nó, thì bài văn này chỉ là đồ trang trí, và Part này cũng không cần thiết phải tồn tại độc lập.


Một bài kiểm tra rất đơn giản: Che bài văn lại

Để đánh giá xem một chỗ trống có thực sự kiểm tra kỹ năng đọc "bài văn" hay không, có một cách rất dứt khoát:

Che toàn bộ bài văn lại, chỉ giữ lại đúng câu có chứa chỗ trống và bốn phương án. Sau đó hỏi: Bây giờ còn bao nhiêu phương án là hợp lý?

Nếu chỉ còn đúng một phương án hợp lý, thì chỗ trống này hoàn toàn không cần bài văn — nó là một câu Part 5 trốn trong bài văn.

Nếu còn từ hai phương án trở lên hợp lý, điều đó có nghĩa là: chỉ có bài văn mới quyết định được đáp án. Chỗ trống này mới thực sự kiểm tra Part 6.

Chúng tôi gọi những chỗ trống thỏa mãn trường hợp sau là "chỗ trống phụ thuộc ngữ cảnh". Tất cả các con số được đề cập trong phần còn lại của bài viết này đều là đếm loại chỗ trống này.

Xem ba ví dụ thực tế

Ví dụ 1: Che lại cũng không ảnh hưởng

Before entering, all staff must put on a full protective suit, gloves, and a face mask in the ------- room. (A) checking (B) changing (C) charging (D) chilling

Không cần đọc bài văn. Nơi mặc đồ bảo hộ, găng tay và khẩu trang là changing room (phòng thay đồ). Ba phương án còn lại cho dù ngữ cảnh trước sau viết gì cũng không thể đúng. Câu này dù có xóa bỏ toàn bộ bài văn thì độ khó cũng hoàn toàn không thay đổi.

Ví dụ 2: Che lại là không trả lời được

Bring your friends. ------- groups of six or more should book ahead. (A) Because of this, (B) That said, (C) For that reason, (D) In the meantime,

Cả bốn phương án đều là những từ mở đầu câu đúng ngữ pháp và xuôi nghĩa. Nếu chỉ nhìn riêng câu này, bạn hoàn toàn không có lý do gì để chọn B thay vì A.

Chỉ khi có câu phía trước "Bring your friends." (Hoan nghênh rủ bạn bè đi cùng) bạn mới biết được: câu phía sau đang đặt điều kiện giới hạn — hoan nghênh đi theo nhóm, tuy nhiên nhóm từ sáu người trở lên phải đặt chỗ trước. "Tuy nhiên" chính là That said.

Trong câu này, bài văn là điều kiện bắt buộc để giải đề.

Ví dụ 3: Che lại thậm chí không biết đang nói về cái gì

Even stubborn ------- don't stand a chance against our gentle, modern process. (A) sprains (B) strains (C) stains (D) streams

Nếu chỉ nhìn câu này một cách độc lập, bạn thậm chí không thể xác định nó là quảng cáo của tiệm giặt ủi hay quảng cáo của phòng khám vật lý trị liệu. sprains (trật khớp) và stains (vết bẩn) đều xuôi nghĩa như nhau trong câu này.

Chỉ có bài văn mới có thể cho bạn biết câu này đang nói về cái gì. Đây là dạng phụ thuộc ngữ cảnh ở mức độ cực đoan nhất.


Làm thế nào để biến "hợp lý" thành một con số đáng tin cậy

Cho đến đây, tất cả mới chỉ dừng lại ở "tôi cảm thấy". Mà "tôi cảm thấy" thì không phải là phép đo.

Độ khó trong trắc nghiệm học có một định nghĩa chính thức: độ khó của một câu hỏi chính là tỷ lệ thí sinh thực tế trả lời đúng câu hỏi đó. Điều đó đòi hỏi phải có hàng nghìn người đã thi qua, ngoại trừ ETS ra thì không ai có loại dữ liệu này. Giải thích đầy đủ có trong bài Tổng quan về độ khó. Vấn đề cần xử lý ở đây là một câu hỏi nhỏ hơn nhưng hóc chuẩn hơn: Việc "che bài văn lại còn bao nhiêu phương án hợp lý" làm sao để không biến thành phán đoán chủ quan của một cá nhân?

Chúng tôi đã làm ba việc.

1. Trước tiên cắt câu hỏi thành "chỉ còn đúng câu đó"

Dùng chương trình máy tính để cắt riêng câu chứa chỗ trống của mỗi câu hỏi ra, các chỗ trống khác trong cùng bài văn thì điền trực tiếp đáp án đúng vào (để câu văn giữ được sự hoàn chỉnh). Toàn bộ 490 chỗ trống đều được cắt ra thành công.

Bước này đã loại trừ ngay một nhóm câu hỏi lớn: dạng bài điền cả câu "câu chèn" (loại có phương án là bốn câu hoàn chỉnh). Dạng câu hỏi đó theo định nghĩa chắc chắn phụ thuộc ngữ cảnh, nếu tính cả nó vào thì chỉ làm thổi phồng số liệu. Hơn nữa, tỷ lệ câu chèn của chúng tôi vốn dĩ đã phù hợp với cấu trúc của bài thi thực tế — cứ mỗi bốn câu thì có một câu. Do đó, phép đo ở đây là dành cho ba chỗ trống còn lại.

2. Giao cho hai người chấm điểm không nhìn thấy nhau

Chúng tôi giao "chỉ còn một câu + bốn phương án" cho hai người chấm điểm AI độc lập, cả hai bên đều nhận được cùng một bộ tiêu chí chấm điểm bằng văn bản giống hệt nhau, và hoàn toàn không tiết lộ cho chúng đáp án đúng là đáp án nào (biết đáp án sẽ ảnh hưởng nghiêm trọng đến phán đoán). Chúng chỉ cần trả lời một điều: Trong bốn phương án này, có bao nhiêu phương án nếu đứng độc lập là hợp lý?

Dùng hai thay vì một là bởi vì một người chấm điểm thì không thể kiểm tra được. Hai người chấm điểm có thể tính ra tần suất chúng đồng nhất với nhau:

Tỷ lệ đồng nhất Cohen's κ
Ngân hàng câu hỏi của chúng tôi (490 câu) 80.4% 0.51
Đề thi tham chiếu (72 câu) 90.3% 0.81

κ (kappa) là mức độ đồng nhất còn lại sau khi đã trừ đi "đoán mò ngẫu nhiên cũng tình cờ trùng hợp". Con số 0.81 bên đề thi tham chiếu thuộc mức rất cao; còn con số 0.51 bên phía chúng tôi chỉ ở mức trung bình — điều này thể hiện rằng các câu hỏi của chúng tôi có nhiều trường hợp ranh giới mơ hồ hơn, bản thân việc này đã là một thông tin.

3. Chỉ tính những câu cả hai bên đều đồng ý

Những chỗ hai người chấm điểm không đồng nhất, chúng tôi tự tay kiểm tra. Sau khi lấy ngẫu nhiên 16 câu để đánh giá từng câu một, chúng tôi phát hiện: một trong hai người chấm điểm tỏ ra nới tay hơn rõ rệt, tính cả những câu "thực ra chỉ có một đáp án hợp lý" vào (ví dụ như câu phòng thay đồ ở trên, nó cho rằng có hai phương án khả thi). Hơn nữa mức độ nới tay của nó ở hai bên lại không giống nhau — trên các câu hỏi của chúng tôi nó dán nhãn thừa 18%, còn trên đề thi tham chiếu chỉ dán nhãn thừa 10%.

Điều này rất quan trọng: Nếu chỉ sử dụng phán đoán của nó, kết quả sẽ làm đẹp một bên một cách bất công. Vì vậy con số cuối cùng chỉ tính những câu mà cả hai người chấm điểm đều đồng ý.

(Chúng tôi cũng đã tính phiên bản nới lỏng — chỉ cần một người chấm điểm cho là phải thì tính. Kết luận hoàn toàn giống nhau, sẽ nói ở phần dưới.)


Kết quả đo được

Lần đo đầu tiên, kết quả trông rất tệ đối với chính chúng tôi:

Chỗ trống phụ thuộc ngữ cảnh Khoảng tin cậy 95%
Ngân hàng câu hỏi của chúng tôi (Lần đo đầu tiên) 82 / 490 = 16.7% 13.7%–20.3%
Đề thi mô phỏng tham chiếu 35 / 72 = 48.6% 37.4%–59.9%

Đề thi tham chiếu khoảng cứ hai chỗ trống thì có một chỗ trống thực sự cần bài văn. Chúng tôi khoảng cứ sáu chỗ trống mới có một.

Hai khoảng tin cậy không hề chồng lấp (mức trần của chúng tôi là 20.3%, mức sàn của đối phương là 37.4%), do đó đây không phải là khoảng cách có thể giải thích bằng sai số mẫu. Tính lại bằng phiên bản nới lỏng, chúng tôi là 36.3%, đối phương là 58.3%, cũng hoàn toàn không chồng lấp — thay đổi cách tính không làm thay đổi kết luận.

Một bằng chứng hỗ trợ: những chỗ trống mà chúng tôi cố ý viết lại thành phụ thuộc ngữ cảnh, cả hai người chấm điểm trong tình trạng hoàn toàn không hay biết đều đã dán nhãn chính xác toàn bộ. Nếu một cây thước thậm chí không đo được thứ do chính nó tạo ra, thì nó đo bất cứ thứ gì cũng không thể tin tưởng được.

Sau đó chúng tôi đã sửa xong

Sau khi đo ra kết quả, chúng tôi không cất con số đó đi mà dựa vào đó để sửa đề. Cách sửa không phải là "viết thêm vài bài văn mới" — điều đó không có tác dụng, vì mỗi lần thêm một bài văn lại thêm ba chỗ trống, mẫu số cũng tăng theo. Để nâng cao tỷ lệ, chỉ có thể sửa từng chỗ trống hiện có thành thực sự cần bài văn.

Sửa xong đo lại, dùng cùng một cây thước, cùng hai người chấm điểm không nhìn thấy nhau, cùng chỉ tính những câu cả hai bên đều đồng ý:

Chỗ trống phụ thuộc ngữ cảnh Khoảng tin cậy 95% Trung bình mỗi bài văn
Ngân hàng câu hỏi của chúng tôi (Lần đo đầu tiên) 82 / 490 = 16.7% 13.7%–20.3% 0.50
Ngân hàng câu hỏi của chúng tôi (Hiện tại) 239 / 490 = 48.8% 44.4%–53.2% 1.46
Đề thi mô phỏng tham chiếu 35 / 72 = 48.6% 37.4%–59.9% 1.46

Ước lượng điểm giữa hai bên chỉ chênh lệch 0.2 điểm phần trăm, còn mật độ trung bình trên mỗi bài văn là hoàn toàn giống hệt nhau 1.46. Các khoảng tin cậy chồng lấp lên nhau một khoảng rất lớn.

Nói một cách thẳng thắn: về vấn đề "chỗ trống này rốt cuộc có cần bài văn hay không", hiện tại đã không còn đo ra sự khác biệt giữa chúng tôi và đề thi tham chiếu nữa.

Ở đây cần rất cẩn trọng không nói quá lời. Điều này không có nghĩa là các câu hỏi của chúng tôi "khó như đề thi thật" — độ khó có rất nhiều khía cạnh, bài viết này chỉ đo một trong số đó. Nó cũng không có nghĩa là chúng tôi tốt hơn đối phương: khoảng cách giữa 48.8% và 48.6% nhỏ hơn nhiều so với sai số của chính phép đo, không bên nào có thể tuyên bố chiến thắng. Điều duy nhất có thể nói là: khoảng cách ở khía cạnh này, vốn dĩ lớn tới mức nhìn thấy được bằng thống kê, giờ đã không còn nữa.

Một ghi chú thành thật: sau khi sửa xong chúng tôi tự mình đối chiếu lại các ví dụ trong bài viết này và phát hiện ra có bốn câu bị lỗi trong quá trình viết lại — các phương án bị nhầm sang một chỗ trống khác trong cùng bài văn, dẫn đến bốn câu đó không có đáp án đúng. Chúng đã được sửa xong, và chúng tôi đã thêm một bộ kiểm tra tự động để lỗi cùng loại sau này sẽ bị chặn lại trước khi đưa lên hệ thống. Phát hiện ra điều này chính là nhờ chúng tôi mang các ví dụ in trong bài viết này đi đối soát với ngân hàng câu hỏi thực tế.

Tại sao lại trở nên như vậy

Không phải vì ai đó lười biếng, mà là vì xu hướng tự nhiên khi ra đề chính là như vậy.

Viết một chỗ trống "chỉ nhìn riêng câu đó là giải quyết được" dễ hơn và an toàn hơn: bạn chắc chắn nó có đáp án duy nhất, chắc chắn nó không gây tranh cãi, chắc chắn về mặt ngữ pháp nó vững vàng. Còn khi viết một chỗ trống "bắt buộc phải nhìn câu phía trước mới quyết định được", bạn phải đồng thời kiểm soát mối quan hệ giữa hai câu, lại còn phải đảm bảo bốn phương án khi đứng riêng lẻ đều xuôi nghĩa — nếu không nó lại thoái hóa trở về một câu Part 5.

Vì vậy trong trường hợp không cố ý đo lường, bất kỳ ngân hàng câu hỏi nào cũng sẽ tự nhiên trôi về hướng "nhét Part 5 vào bài văn". Chúng tôi đã trôi theo hướng đó. Và trước khi che bài văn lại, điều này hoàn toàn không thể nhận ra — mỗi câu khi nhìn độc lập đều là một câu hỏi tốt.

Đó cũng là lý do tại sao chúng tôi cố định phép đo này và mỗi lần sửa đề đều chạy lại: sự trôi dạt sẽ không tự dừng lại, chỉ khi đo lường thì nó mới dừng lại.


Phần hữu ích nhất cho bạn: Cách làm bài Part 6

Sau khi biết Part 6 có hai loại chỗ trống hoàn toàn khác nhau, chiến lược trong phòng thi đã rất rõ ràng: Phân loại trước, rồi mới quyết định có đọc ngược lại hay không.

Bước 1: Nhìn vào các phương án, nhận biết đây là loại chỗ trống nào

Khi nhận một câu hỏi, trước tiên hãy xem bốn phương án trông như thế nào:

  • Cả bốn đều là các dạng biến đổi khác nhau của cùng một từ (apply / applied / applying / application) → Gần như chắc chắn là chỗ trống đơn câu. Chỉ cần nhìn trước và sau chỗ trống, không đọc ngược lại bài văn.
  • Cả bốn là các thực từ không liên quan đến nhau (danh từ, động từ, tính từ) → Thường là chỗ trống đơn câu, nhưng cần cẩn thận với tình huống kiểu Ví dụ 3 "thậm chí không biết đang nói về cái gì". Trước tiên hãy thử chỉ giải bằng câu này, nếu không giải được mới đọc ngược lại.
  • Cả bốn đều là từ nối đầu câu (However, / As a result, / Even so, / In the meantime,) → Nhất định phải đọc ngược lại câu phía trước. Loại câu hỏi này nếu chỉ nhìn riêng câu hiện tại thì vĩnh viễn không giải được, cố chằm chằm nhìn nó chỉ lãng phí thời gian.
  • Cả bốn là các câu hoàn chỉnh → Dạng câu chèn. Loại này phải xem cả câu trước lẫn câu sau, và thường để làm cuối cùng.

Bước 2: Câu hỏi từ nối, chỉ cần đọc ngược lại một câu

Đây là điểm đáng ghi nhớ nhất. Câu hỏi từ nối không cần đọc lại toàn bộ bài văn, chỉ cần đọc câu ngay phía trước, rồi tự hỏi bản thân một câu hỏi:

Câu phía trước và câu này có mối quan hệ gì?

  • Phía sau là kết quả của phía trước → As a result, / Therefore, / Accordingly,
  • Phía sau bác bỏ hoặc giới hạn phía trước → However, / That said, / Even so,
  • Phía sau là ví dụ của phía trước → For example,
  • Phía sau là hiệu quả từ biện pháp của phía trước → That way, / In this way,
  • Phía trước là điều kiện, phía sau là hậu quả nếu không làm → Otherwise,

Xác định được mối quan hệ là đáp án sẽ ra. Bước này nên hoàn thành trong vòng 10 giây; nếu quá 20 giây mà vẫn còn do dự, thường là do bạn đang cố tìm manh mối từ chính câu này — mà chính câu này vốn dĩ không có manh mối nào cả.

Bước 3: Dành thời gian tiết kiệm được cho dạng câu chèn

Part 6 mỗi bài văn có bốn chỗ trống, trong đó thường có một câu là câu chèn — đó là dạng câu hỏi tốn thời gian nhất trong toàn bộ Part 6, vì bạn phải đồng thời kiểm tra xem nó có nối khớp với cả câu trước lẫn câu sau hay không.

Trọng tâm của ba bước trên chính là: Không lãng phí thời gian đọc ngược bài văn ở các chỗ trống đơn câu, tập trung thời gian vào một hoặc hai câu thực sự cần đọc bài văn.


Hạn chế của phép đo này

Nói một cách thành thật ba điều:

Đề thi tham chiếu chỉ có 72 chỗ trống. Đây là toàn bộ các chỗ trống không phải câu chèn trong sáu đề thi mô phỏng, đã là toàn bộ dữ liệu chúng tôi có trong tay, nhưng 72 vẫn là con số không nhiều — vì vậy khoảng tin cậy 48.6% đó rộng tới 22 điểm phần trăm. Con số 490 của chúng tôi là điều tra toàn bộ, vì vậy hẹp hơn nhiều.

Người chấm điểm là AI, không phải thí sinh thực tế. Chúng đánh giá việc "nếu đứng độc lập thì có hợp lý hay không", đây là một chỉ số thay thế, không phải là tỷ lệ làm đúng thực tế. Mối quan hệ của nó với độ khó thực tế là hợp lý, nhưng không phải là cùng một thứ.

Chúng tôi chỉ đưa ra khẳng định ở cấp độ phân bố, không đưa ra khẳng định ở cấp độ từng câu hỏi. Giống như một chiếc cân có sai số ±5 kg, cân một người thì không có ý nghĩa, nhưng cân trung bình của một nghìn người thì lại có thể thấy được sự khác biệt giữa các nhóm. Phép đo này có thể nói "hai ngân hàng câu hỏi có sự phân bố khác biệt rõ rệt ở khía cạnh này", chứ không thể nói "câu này phụ thuộc ngữ cảnh nhiều hơn câu kia".


Chuỗi bài về độ khó: Tổng quan về độ khó · Part 5 · Part 6 (Bài này) · Part 7

← Tất cả bài viết