Tất cả bài viết · Đăng ngày 2026-08-01

Tổng quan về độ khó: "Giống như thi thật" có nghĩa là gì? — Cách chúng tôi đo lường, đối chiếu với cái gì, và không tuyên bố điều gì

Giải thích kỹ thuật dành cho những ai tò mò. Đây là bài tổng quan của chuỗi bài viết về độ khó, sau bài này mỗi Part sẽ có một bài viết riêng. Bài này xử lý phần chung cho tất cả các bài tiếp theo: định nghĩa chính thức của độ khó trong trắc lượng học (psychometrics), tại sao không một ai (bao gồm cả chúng tôi) có thể trực tiếp đo được nó, chúng tôi dùng cái gì làm tham chiếu bên ngoài, cũng như sự phân biệt giữa những điều chúng tôi sẵn sàng tuyên bố và không sẵn sàng tuyên bố. Sau khi đọc xong bài này, các bài về từng Part có thể đi thẳng vào nguồn gốc độ khó của riêng Part đó. Không cần bất kỳ kiến thức nền nào về thống kê.

Tại sao "độ khó" không thể dựa vào cảm giác

Mỗi câu hỏi luyện tập trong ngân hàng đề thi đều mang một nhãn dán: dễ, trung bình, khó. Trường thông tin này trông có vẻ hiển nhiên, nhưng lại là nơi dễ phát sinh vấn đề nhất trong toàn bộ ngân hàng đề thi — bởi vì khi nó bị sai, sẽ không có bất kỳ thứ gì phát ra âm thanh cảnh báo.

Một câu hỏi bị sai đáp án, sẽ có người báo cáo. Một đoạn file âm thanh bị hỏng, bạn bấm phát là biết ngay. Nhưng một câu hỏi được gán nhãn "khó" mà thực chất lại rất dễ thì sẽ không có bất kỳ dấu hiệu nào: nó vẫn xuất hiện bình thường, vẫn tính điểm bình thường và vẫn trông như một câu hỏi khó.

Và chiếc nhãn dán này thực hiện hai việc quan trọng. Thứ nhất, nó quyết định tổ hợp câu hỏi mà bạn luyện tập — luyện tập và thi thử muốn có ý nghĩa thì phải có sự phân cấp độ khó dễ rõ ràng, và điều này chỉ đúng khi "khó" thực sự đại diện cho khó. Thứ hai, nó giúp việc "chuẩn bị cho các câu hỏi khó thế nào" trở nên rõ ràng: nếu chúng tôi không thể nói ra tại sao một câu hỏi lại khó, chúng tôi chỉ có thể đưa ra lời khuyên đúng nhưng vô dụng như "luyện tập nhiều hơn"; ngược lại, chỉ cần có thể chia nhỏ độ khó thành nhiều nguồn cụ thể, dễ nhận biết, thì chính những nguồn đó đã là một danh sách luyện tập.


Định nghĩa chính thức của độ khó, và một tiền đề phũ phàng

Trắc lượng học (psychometrics) định nghĩa về độ khó một cách cực kỳ rõ ràng:

Độ khó của một câu hỏi chính là tỷ lệ thí sinh thực tế trả lời đúng câu hỏi đó.

Thuật ngữ chuyên môn gọi là giá trị p. Câu hỏi có tỷ lệ làm đúng 85% là câu dễ, câu hỏi có tỷ lệ làm đúng 40% là câu khó, đơn giản và trực tiếp như vậy. Nó không phụ thuộc vào việc chuyên gia cảm thấy khó hay không, mà dựa vào số lượng người thực tế làm sai.

Nhưng định nghĩa này có một tiền đề phũ phàng: bạn phải cho một lượng lớn thí sinh làm thử câu hỏi đó trước. ETS có loại dữ liệu này — mỗi câu hỏi chính thức trước khi đưa vào sử dụng đều trải qua thử nghiệm tiền kiểm. Không một bên thứ ba nào có dữ liệu này: không phải chúng tôi giấu đi không nói, mà tất cả các nhà xuất bản, tất cả các trung tâm luyện thi, tất cả các ứng dụng đều không hề có.

Vì vậy, bất kỳ ai in chữ "Độ khó: Cao" bên cạnh câu hỏi thực chất đều đang sử dụng một loại chỉ số thay thế. Bản thân việc này không có vấn đề gì, chỉ số thay thế là điều bình thường trong lĩnh vực này. Sự khác biệt thực sự chỉ nằm ở:

Chỉ số thay thế đó là đánh giá chủ quan của một cá nhân, hay là một tập hợp các quy tắc có thể chạy lại, có thể kiểm chứng và cũng có thể bị bác bỏ?

Chúng tôi chọn phương án sau. Cách làm là: hoàn toàn không nhìn vào nhãn độ khó do bất kỳ ai đánh dấu, mà chỉ dựa vào văn bản của chính câu hỏi để tính toán một tập hợp các đặc trưng về mặt cấu trúc làm cho câu hỏi trở nên khó hơn, và đo lường từng câu một. Bởi vì các đặc trưng được tính từ văn bản, cùng một chương trình có thể đo ngân hàng đề của chúng tôi, và cũng có thể đo bất kỳ đề thi nào được in trên giấy — điểm này chính là chìa khóa của phần tiếp theo.


"Giống như thi thật" có thể chỉ 3 điều một cách thành thực

Cụm từ này thường được dùng như một câu nói chung chung, nhưng thực tế nó trộn lẫn ba cấp độ, và chỉ có hai cấp độ đầu tiên là bất kỳ ai ngày nay cũng có thể kiểm tra được.

Tuyên bố Có thể kiểm tra hay không
1 Cấu trúc ra đề giống nhau — Cùng dạng bài, cùng tỷ lệ, cùng cấu trúc cho mỗi đề thi Có thể, khách quan
2 Phân bố độ khó giống nhau — Dựa trên tham chiếu bên ngoài để xác định, tỷ lệ dễ / trung bình / khó giống nhau Có thể, nhưng phải đính kèm "do ai xác định"
3 Tỷ lệ làm đúng giống nhau — Tỷ lệ thí sinh thực tế trả lời đúng từng câu hỏi là như nhau Không thể, trừ khi nắm giữ dữ liệu chính thức hoặc lượng lớn mẫu làm bài

Chúng tôi có thể ủng hộ mạnh mẽ (1), ủng hộ (2) đi kèm điều khoản làm rõ minh bạch, và tuyên bố rõ ràng rằng (3) vẫn chưa được xác lập.

Bất kỳ ai tuyên bố (3) khi không có lượng lớn dữ liệu làm bài thì đều là đang đoán. Điều này bao gồm cả chính chúng tôi — cuối mỗi bài viết trong chuỗi bài này đều sẽ quay trở lại điểm này.


Chúng tôi lấy cái gì để so sánh: Một bộ đề thi thử 6 đề bán trên thị trường

Thước đo không thể tự mình phát minh, mà phải đối chiếu với một tham chiếu bên ngoài. Chúng tôi sử dụng 《全新!新制多益 TOEIC 題庫解析 狠準 6 回》 (bộ đề của Hackers Academia, bản Đài Loan do 國際學村 xuất bản), một bộ đề thi thử hoàn chỉnh gồm 6 đề được thị trường công nhận có độ hoàn thiện rất cao.

Việc lựa chọn bộ đề này có một lý do rất thực tế: mỗi câu hỏi trong sách đều được in nhãn đánh giá độ khó của chính nhà xuất bản (Cao / Trung bình / Thấp). Điều này cung cấp cho chúng tôi hàng ngàn đánh giá từng câu có sẵn từ các biên tập viên chuyên nghiệp để đối chiếu — và đây chính là những gì cần thiết để đánh giá xem công cụ của chúng tôi có chính xác hay không.

Và sau đó là bước then chốt của toàn bộ phương pháp:

Cùng một chương trình trích xuất đặc trưng, chạy trên ngân hàng câu hỏi của chúng tôi và cũng chạy trên các câu hỏi của sách tham chiếu.

Một công cụ, hai bộ dữ liệu văn bản. Đây mới là tiền đề so sánh có ý nghĩa — chúng tôi không dùng tiêu chuẩn của chính mình để tự đánh giá mình, mà đặt cả hai bên lên cùng một cây thước.

Cây thước này đo chính xác tập thể, nhưng không đo chính xác cá nhân

Đây là điểm quan trọng nhất và cũng dễ bị bỏ qua nhất trong toàn bộ phương pháp, đáng để dùng một hình ảnh so sánh để giải thích rõ ràng.

Hãy tưởng tượng một chiếc cân sức khỏe có độ sai số ±5 kg. Bạn không thể dùng nó để xác định "tuần này mình có tăng thêm 1 kg hay không" — sai số lớn hơn cả sự thay đổi mà bạn muốn đo, con số đo ra hầu như không có ý nghĩa. Nhưng nếu bạn dùng cùng chiếc cân đó đo 1.000 người, rồi lại đi đo một nhóm 1.000 người khác, giá trị trung bình của hai nhóm vẫn có thể so sánh được: bởi vì sai số lúc thì thiên cao, lúc thì thiên thấp, sau 1.000 lần sẽ đại thể bù trừ lẫn nhau, và khoảng cách còn lại là có thực.

Bộ phân loại cấu trúc của chúng tôi chính là chiếc cân đó. Khi đánh giá một câu hỏi đơn lẻ có khó hay không, nó rất không đáng tin cậy — đây không phải là chúng tôi khiêm tốn, mà là chúng tôi đã thực tế đo lường xem nó không đáng tin đến mức nào, con số và phương pháp đều đã được ghi rõ trong bài viết về Part 5 (sắp đăng). Nhưng khi áp dụng cùng một tập quy tắc cho hơn 1.000 câu hỏi, các sai sót cá biệt sẽ phân tán sang hai phía, bù trừ lẫn nhau, và tỷ lệ còn lại là đáng tin cậy.

Vì vậy ranh giới nằm ở đây:

  • Có thể nói: Trong Part 5 của chúng tôi, loại "bốn thực từ độc lập" chiếm 42.3%, sách tham chiếu chiếm 33.1%. ✓
  • Không thể nói: Câu hỏi này là câu khó, vì bộ phân loại xếp nó vào loại khó nhất. ✗

Hệ quả thực tế rất trực tiếp: chúng tôi sẽ không dùng kết quả phân loại để ghi đè lên nhãn độ khó của bất kỳ câu hỏi nào. Cây thước này được sử dụng ở nơi mà nó đứng vững — kiểm soát cơ cấu tổng thể của nội dung mới, chứ không phải chấm điểm cho từng câu đơn lẻ. Tất cả các so sánh độ khó trong chuỗi bài này đều phải được đọc dưới sự hạn chế này.

Hạn chế của bộ tham chiếu này, chúng tôi không che giấu

  • Đó là đề thi thử của nhà xuất bản, không phải tài liệu chính thức của ETS. Do đó, nó là bằng chứng mạnh về mặt định dạng (biến đổi giữa 6 đề gần như bằng không, đúng với hình dáng sao chép trung thực cấu trúc ra đề chính thức), và là bằng chứng yếu hơn về mặt độ khó (câu hỏi do nhà xuất bản tự viết, việc đánh giá là nhận định của biên tập viên). Chúng tôi cố ý dùng giọng văn tin tưởng khi báo cáo so sánh định dạng, và dùng giọng văn dè dặt khi báo cáo so sánh độ khó.
  • Nó chỉ có 6 đề. Đối với các đặc trưng cấu trúc xuất hiện cố định trong mỗi đề thi, 6 đề đã đủ để xác nhận; đối với những khác biệt nhỏ về tỷ lệ, 6 đề là không đủ.

Kết quả hiện tại: Câu hỏi của chúng tôi không dễ hơn sách tham chiếu

Trước tiên hãy nói về một bộ số dễ bị hiểu nhầm nhất. Nếu chỉ nhìn vào tỷ lệ "khó" trên nhãn của cả hai bên, có vẻ như chúng tôi ở đâu cũng dễ hơn:

Part Tham chiếu đánh giá là "Cao" Chúng tôi đánh nhãn là "Khó"
2 20% 18.9%
3 12% 21.7%
4 18% 16.2%
5 33% 10.3%
6 28% 25.8%
7 29% 21.6%

Trong 6 Part thì có 4 Part nằm trong khoảng chênh lệch vài phần trăm. Chênh lệch 23 điểm phần trăm ở Part 5 trông có vẻ rất nghiêm trọng — nhưng đó lại là bài học quan trọng nhất trong toàn bộ chuỗi bài này, bởi vì khi chúng tôi chuyển sang đo bằng cấu trúc thay vì so sánh nhãn dán của hai bên, kết quả đã đảo ngược lại:

Cách sắp xếp lựa chọn Part 5 Chúng tôi Tham chiếu
Cùng họ từ và có manh mối bên cạnh (dễ nhất) 3.6% 2.9%
Cùng họ từ, không có manh mối 29.4% 28.4%
Từ chức năng / Lựa chọn kết hợp từ 24.7% 25.6%
Bốn thực từ độc lập (khó nhất) 42.3% 33.1%

"Cách sắp xếp khó nhất" mà chúng tôi có nhiều hơn sách tham chiếu khoảng 9 điểm phần trăm, chứ không phải ít hơn. Hai loại ở giữa gần như trùng khớp hoàn toàn.

Nói cách khác: khoảng chênh lệch 23 điểm phần trăm đó là ảo giác do việc gắn nhãn tạo ra, chứ không phải là sự chênh lệch về nội dung. Người ra đề của chúng tôi có xu hướng đánh nhãn những câu hỏi ngữ pháp hóc húa là câu hỏi khó, trong khi tiêu chí đánh giá của sách tham chiếu lại xem gánh nặng từ vựng và kết hợp từ là khó nhất — hai bên đang dùng những cây thước khác nhau để đo cùng một thứ. Nhãn dán của chúng tôi bảo thủ, chứ nội dung của chúng tôi không bảo thủ.

Đây là kết luận có thể đưa ra ở thời điểm hiện tại, và nó áp dụng cho tổng thể chứ không phải cho từng câu riêng lẻ: trên trục duy nhất mà chúng tôi có thể đo lường một cách khách quan, các câu hỏi của chúng tôi ít nhất cũng tương đương với sách tham chiếu, và ở loại khó nhất thì còn nhiều hơn. Chúng tôi không vì thế mà tuyên bố rằng "chúng tôi khó hơn TOEIC thực tế" — điều đó cần có (3), mà (3) thì chưa ai có thể chứng minh được.


Những gì chúng tôi không tuyên bố

  • Chúng tôi không có tỷ lệ làm đúng. Không có nội dung nào ở đây có thể xác lập rằng một câu hỏi nhất định đối với thí sinh thực tế là khó ngang bằng với câu hỏi thật.
  • Tham chiếu là đề thi thử của nhà xuất bản, không phải ETS. Kết luận về định dạng là mạnh, kết luận về độ khó tiếp nhận đánh giá của biên tập viên.
  • File âm thanh phần nghe của chúng tôi sạch hơn bài thi thật. Phần nghe được tạo ra bằng TTS mạng thần kinh (neural TTS), tốc độ nói và phân bố giọng điệu chúng tôi có thể kiểm soát và đo lường được; nhưng các hiện tượng nuốt âm, lời nói chồng chéo và tiếng ồn môi trường trong bản thu âm thực tế thì tạm thời chúng tôi chưa thể tái tạo được. Điều này khiến phần nghe của chúng tôi dễ hơn một chút so với kỳ thi thật theo những cách mà chỉ số của chính chúng tôi không thể thấy được — chúng tôi thà nói thẳng ra còn hơn để bạn chỉ phát hiện ra điều đó vào đúng ngày thi.
  • Chúng tôi không xác định độ khó của một câu hỏi đơn lẻ. Lý do là chiếc cân ở trên: cây thước này đáng tin khi đo tập thể, không đáng tin khi đo cá nhân. Tất cả so sánh đều là "cơ cấu của hai ngân hàng đề", chứ không phải "câu hỏi này khó đến mức nào".
  • Hai thang đo rốt cuộc không phải là cùng một thang đo. Nhãn Cao / Trung bình / Thấp của tham chiếu là đánh giá của biên tập viên, còn của chúng tôi là đánh giá của tác giả. Chỉ những khoảng chênh lệch lớn mới thích hợp để đưa ra hành động, còn chênh lệch nhỏ chỉ là nhiễu.

Điều gì sẽ làm cho việc này trở nên chắc chắn hơn

Sắp xếp theo giá trị:

  1. Tỷ lệ làm đúng từ người học. Đây mới là đo lường thực sự. Kết quả làm bài từng câu đã và đang được tích lũy ẩn danh, thứ duy nhất còn thiếu là số lượng. Đến ngày đó, cây thước cấu trúc này sẽ được dữ liệu thực tế hiệu chuẩn lại — hoặc thậm chí bị thay thế.
  2. Khoảng cách giữa điểm số ước tính và điểm số chính thức. Mỗi khi người học điền lại một điểm số chính thức, chúng tôi có thể kiểm tra "điểm số ước tính của chúng tôi có thể theo sát điểm số chính thức trong phạm vi bao nhiêu điểm", và điều này chỉ cần vài chục mẫu là đã đáng để dẫn chứng.

Tiếp theo

Khi đã có nền tảng chung, các bài viết về từng Part có thể đi thẳng vào chủ đề của riêng mình: độ khó của Part đó cụ thể đến từ đâu, và sau khi biết điều đó thì bạn nên làm bài như thế nào.

  • Part 1: Mô tả hình ảnh, độ khó nằm ở "thể" (aspect) của câu — sự đối lập tối thiểu giữa trạng thái và hành động.
  • Part 2: Hỏi & Đáp, độ khó nằm ở dạng câu hỏi và mức độ gián tiếp của câu trả lời.
  • Part 3 / Part 4: Hội thoại và Độc thoại, độ khó nằm ở các câu hỏi suy luận, câu hỏi kèm hình ảnh/biểu đồ và câu hỏi ý định.
  • Part 5: Hoàn thành câu, độ khó hầu như nằm toàn bộ ở cách sắp xếp bốn lựa chọn.
  • Part 6: Hoàn thành đoạn văn, độ khó nằm ở sự mạch lạc giữa các câu và câu chèn thêm.
  • Part 7: Đọc hiểu, độ khó nằm ở khoảng cách diễn đạt lại (paraphrase) — đáp án đúng hầu như không bao giờ lặp lại từ ngữ dùng trong bài đọc.

Nửa sau của mỗi bài viết đều sẽ đọc ngược lại các nguồn gây ra độ khó của Part đó, biến nó thành một chiến lược làm bài: mỗi thủ thuật làm cho câu hỏi trở nên khó hơn đều báo trước đáp án đang ẩn giấu ở đâu.

← Tất cả bài viết