Tất cả bài viết · Đăng ngày 2026-08-28

Dự đoán điểm TOEIC có chính xác không? Bốn thí sinh gửi lại bảng điểm thật, và chúng tôi đem toàn bộ số liệu ra đối chiếu

Vào ngày công bố kết quả kỳ thi TOEIC đợt 16/8, bốn thí sinh đã gửi lại điểm thi thật cho chúng tôi — đây là lần đầu tiên tính năng dự đoán điểm của Chinh Phục 990 được kiểm chứng bằng một loạt kết quả thi thật. Tóm tắt kết luận trước: phần Nghe chính xác đến bất ngờ (hai trong bốn người chỉ lệch đúng 5 điểm), phần Đọc tồn tại ba dạng sai số mang tính hệ thống đều có tên gọi riêng, và thuật toán dự đoán xếp hạng thứ tự của cả bốn người hoàn toàn chính xác. Bài viết này đặt bốn quỹ đạo dự đoán hằng ngày cạnh bốn bảng điểm thật để đối chiếu, đồng thời trả lời một câu hỏi hóc búa hơn: khi dự đoán "hội tụ", nó thực sự đảm bảo điều gì?

Ở phần kết của bài Cách Chinh Phục 990 ước tính điểm TOEIC của bạn, chúng tôi đã đưa ra một lời hứa: phương pháp ước tính này luôn trung thực về độ không chắc chắn của chính nó. Lời hứa thì rất dễ viết, vì vào thời điểm đó chưa ai có thể kiểm chứng được. Bây giờ mọi chuyện đã khác — sau ngày thi của bạn, ứng dụng sẽ chủ động hỏi một câu đơn giản: "Bạn thi thế nào?", và vào sáng ngày 28/8 khi điểm thi được công bố, bốn bảng điểm thật đã lần lượt được gửi về trong vòng hai tiếng đồng hồ. Cả bốn bạn đều là thành viên sáng lập, và cả bốn đều tham gia đợt thi ngày 16/8. Mẫu dữ liệu chỉ có bốn người, bài viết này từ đầu đến cuối luôn ghi nhớ điều đó; nhưng bốn người đã đủ để một số quy luật lộ diện rõ ràng không thể che giấu.

Bốn bảng điểm, một bảng tổng hợp

"Dự đoán trước thi" là ảnh chụp nhanh dự đoán hằng ngày vào ngày cuối cùng trước khi thi của mỗi thí sinh — tức là con số hiển thị trên màn hình ứng dụng ngay trước khi họ bước vào phòng thi.

Thí sinh Lượng luyện tập Dự đoán trước thi (Nghe/Đọc) Điểm thật (Nghe/Đọc) Sai lệch
A 1,477 câu 540 (310/230) 495 (315/180) Ước tính cao hơn 45
B 731 câu 685 (395/290) 760 (400/360) Ước tính thấp hơn 75
C 307 câu 795 (395/400) 855 (430/425) Ước tính thấp hơn 60
D 2,697 câu 815 (460/355) 895 (495/400) Ước tính thấp hơn 80

Trước hết hãy nhìn vào bức tranh tổng thể: sai số tuyệt đối trung bình của tổng điểm là 65 điểm (trên thang điểm 990), và cả bốn người đều có độ lệch nằm trong khoảng 80 điểm. Điều quan trọng hơn là thứ tự sắp xếp của cả bốn người — ai cao hơn ai, và thứ tự chênh lệch ra sao — hoàn toàn chính xác. Xác suất đoán mò ngẫu nhiên mà đúng được thứ tự của bốn người là 1/24; chúng tôi không định khui sâm-panh ăn mừng vì điều đó, nhưng nó chứng minh thuật toán dự đoán ít nhất đã đo đúng "vị trí tương đối", và vị trí tương đối mới chính là thứ thực sự cần thiết cho câu hỏi "mình còn cách mục tiêu bao xa?".

Điều thú vị chỉ xuất hiện khi tách riêng từng phần điểm số.

Tại sao phần Nghe lại chính xác đến mức chỉ lệch 5 điểm?

Sai số phần Nghe của bốn bạn lần lượt là +5, +5, +35, +35 — sai số tuyệt đối trung bình là 20 điểm. Để so sánh: tài liệu TOEIC Listening and Reading Score User Guide của chính ETS nêu rõ sai số chuẩn của phép đo (SEM) trong kỳ thi chính thức vào khoảng 25 điểm cho mỗi phần thi — nghĩa là cùng một người thi lại kỳ thi chính thức sau một tuần, điểm của từng phần thi vốn dĩ đã có độ dao động ở mức độ này. Sai số dự đoán phần Nghe của chúng tôi và sai số tự thân của kỳ thi chính thức nằm trên cùng một bậc độ lớn.

Thí sinh A xứng đáng được nhắc đến riêng: điểm Nghe dự đoán là 310, điểm thật là 315. Và trong phản hồi gửi về, bạn ấy cho biết ở đợt thi trước đó vào ngày 28/7, "điểm Nghe cũng rất sát". Cùng một người, hai kỳ thi, hai lần đều trúng đích — điều này khó có thể xem là ăn may.

Tại sao phần Nghe lại có thể chuẩn xác đến thế? Chúng tôi nghĩ câu trả lời hơi tẻ nhạt: bởi vì điều kiện luyện tập và điều kiện thi hoàn toàn trùng khớp. Nhịp độ phần Nghe do file âm thanh quyết định chứ không phải do bạn — làm một bài Part 3 trong ứng dụng hay làm Part 3 trong phòng thi thì áp lực thời gian đều y hệt nhau. Điểm dự đoán đo lường "tỷ lệ trả lời đúng của bạn trong điều kiện đó", và bài thi thật cũng diễn ra đúng trong điều kiện đó.

[Bổ sung ngày 29/8] Một ngày sau khi bài viết lên sóng, bảng điểm thứ năm đã được gửi về: dự đoán trước thi 810 (Nghe 435/Đọc 375), điểm thật 805 (Nghe 405/Đọc 400). Tổng điểm chỉ lệch đúng 5 điểm, và thứ tự xếp hạng của cả năm người vẫn hoàn toàn chính xác — nhưng khoan hãy mở tiệc ăn mừng cho phần Nghe: đây là lần đầu tiên chúng tôi ước tính phần Nghe cao hơn thực tế, tận 30 điểm. Nguyên nhân thì chính thí sinh này đã đoán ra trước, trong phản hồi có viết: "đôi khi mình nghe lại vài lần, có thể khiến điểm số không chính xác" — hoàn toàn đúng. Việc phát lại âm thanh đối với phần Nghe cũng giống như việc không giới hạn thời gian đối với phần Đọc: khi điều kiện luyện tập dễ thở hơn phòng thi, dự đoán sẽ lệch về phía dễ thở đó. Tổng điểm trông hoàn hảo chỉ vì phần Đọc đồng thời bị ước tính thấp hơn 25 điểm (dự đoán của thí sinh này leo từ 475 lên 830 trong ba tuần trước kỳ thi — chỉ số trễ như thường lệ không đuổi kịp đà tiến bộ), và hai sai lệch tình cờ triệt tiêu lẫn nhau. Vì vậy, câu "điều kiện luyện tập và điều kiện thi hoàn toàn trùng khớp" ở phần trên cần thêm một điều kiện kèm theo: với tiền đề là mỗi câu bạn chỉ phát audio đúng một lần.

Phần Đọc thì ngược lại hoàn toàn.

Ba kiểu sai lệch của phần Đọc, mỗi kiểu một cái tên

Sai số phần Đọc của bốn bạn lần lượt là −50, +70, +25, +45 — sai số tuyệt đối trung bình là 48 điểm, gấp gần hai lần rưỡi phần Nghe, và sai lệch theo cả hai chiều. Khi trải rộng dữ liệu của cả bốn người, ba dạng sai lệch mang tính hệ thống lần lượt lộ diện.

Thứ nhất: năng lực khi không giới hạn thời gian ≠ phong độ khi bị bấm giờ. Điểm Đọc của thí sinh A bị ước tính cao hơn 50 điểm — và đợt thi ngày 28/7 trước đó cũng diễn ra theo đúng kịch bản này ("phần Đọc lệch rất nhiều" — nguyên văn lời của bạn ấy). Lúc luyện tập bình thường không bị giới hạn thời gian, bạn có thể thong thả đọc hết cả bài trong Part 7; nhưng bài thi Đọc thực tế yêu cầu 100 câu trong 75 phút, không kịp đọc là coi như mất điểm. Thí sinh D trong phản hồi cũng chia sẻ rằng phần Đọc "hơi gấp (suýt nữa thì không làm kịp)" — một người đạt 895 điểm mà vẫn cảm thấy gấp gáp. Điểm dự đoán đo lường tỷ lệ đúng khi không bị ép thời gian, còn kỳ thi lại kiểm tra tỷ lệ đúng dưới áp lực đồng hồ, và ngăn cách giữa hai điều đó là một kỹ năng độc lập mang tên: tốc độ.

Thứ hai: bạn tập trung luyện phần yếu, điểm dự đoán sẽ bị kéo tụt theo điểm yếu. Thí sinh B bị ước tính thấp hơn 75 điểm, và chính bạn ấy đã tự chẩn đoán nguyên nhân trong phản hồi: "Mình tập trung luyện những phần bản thân còn yếu (Part 4, 5, 6), nên điểm số bị kéo xuống thấp hơn một chút." Hoàn toàn chính xác. Luyện tập trước ngày thi của bạn ấy dồn hết vào các dạng bài yếu nhất, khiến lịch sử làm bài nạp vào bộ ước tính là một mẫu dữ liệu bị lệch hẳn về phía điểm yếu — thế nhưng bài thi thật đâu chỉ kiểm tra mỗi phần yếu của bạn. Đây là trường hợp kinh điển của sai lệch chọn mẫu (selection bias), chỉ có điều lần này chính thí sinh là người viết nên cuốn sách giáo khoa đó. (Nói thêm: bạn ấy cũng đồng thời dùng một ứng dụng ước tính điểm khác, ứng dụng đó dự đoán bạn ấy được 640. Cả hai ứng dụng đều ước tính thấp hơn thực tế; chúng tôi thấp hơn 75 điểm, ứng dụng kia thấp hơn 120 điểm. Đánh giá thấp những người ôn thi nghiêm túc dường như là căn bệnh chung của toàn ngành.)

Thứ ba: điểm dự đoán bản chất là chỉ số trễ, trong khi bạn không ngừng tiến bộ. Thí sinh C chỉ luyện 307 câu, ít nhất trong bốn người, nhưng lại nhận được kết quả dự đoán có sai số nhỏ thứ hai. Điều thú vị hơn nằm ở hai mốc điểm thực tế của bạn ấy: kỳ thi tháng 6 không ôn trước được 720 điểm, kỳ thi tháng 8 đạt 855 điểm — tiến bộ 135 điểm trong hai tháng. Điểm dự đoán hằng ngày của chúng tôi trong giai đoạn đó đã leo từ 735 lên 795: điểm xuất phát chính xác (735 so với 720 điểm thật của hai tháng trước), chiều hướng đúng, nhưng tốc độ tăng không theo kịp đà tiến bộ thực tế. Đây không phải lời ngụy biện cho khiếm khuyết, mà là hệ quả tất yếu trong thiết kế: bộ ước tính áp dụng cơ chế suy giảm trọng số theo thời gian cho các bằng chứng cũ, nên nó phản ánh "con người trung bình của bạn trong vài tuần qua"; thế nhưng người bước vào phòng thi lại là "phiên bản tốt nhất của bạn vào ngày thi". Người tiến bộ càng nhanh thì khoảng cách giữa hai con người này càng lớn. Thí sinh D còn gặp thêm một sai lệch nhỏ thứ tư — hiện tượng nén ở trần điểm (ceiling compression): dự đoán phần Nghe của D đứng yên ở mức 460 trong suốt tuần cuối cùng (chỉ có đúng một lần nhích nhẹ xuống 455), bởi vì ở vùng độ chính xác trên 90%, độ nhiễu lấy mẫu đã lớn hơn khoảng cách chia điểm và hệ thống không thể nâng dự đoán lên cao hơn được nữa. Điểm Nghe thật của bạn ấy là 495. Điểm tối đa.

Vậy thì, dự đoán đã "hội tụ" chưa?

Đây là câu hỏi chúng tôi tha thiết muốn trả lời nhất, và câu trả lời thành thật là: "hội tụ" mang hai tầng ý nghĩa. Chúng tôi đã làm được tầng nghĩa thứ nhất, còn tầng nghĩa thứ hai mới chỉ được một nửa.

Ý nghĩa thứ nhất là sự hội tụ về mặt thống kê: điểm dự đoán không còn dao động mạnh. Cả bốn thí sinh đều đạt được tiêu chí này. Trong hai tuần trước khi thi, độ lệch chuẩn của tổng điểm dự đoán hằng ngày ở bốn người lần lượt là 19, 34, 20 và 22 điểm — trong đó con số 34 của thí sinh B không phải do nhiễu, mà là vì điểm dự đoán phần Nghe của bạn ấy thực sự đã leo từ 320 lên 395 trong hai tuần, và xu hướng tăng này đã được tính gộp vào độ lệch chuẩn. Để so sánh, phương pháp cũ từng được mô tả trong bài Cách Chinh Phục 990 ước tính điểm TOEIC của bạn — sử dụng EMA cố định — sẽ luôn duy trì mức dao động khoảng ±11 điểm phần trăm; phương pháp hiện tại sau vài trăm câu hỏi chỉ dịch chuyển vài điểm giữa các ngày. Khoảng không chắc chắn hiển thị trên ứng dụng cũng thu hẹp lại một cách trung thực: màn hình trước ngày thi của thí sinh B ghi rõ Nghe 395±28, Đọc 290±20.

Ý nghĩa thứ hai là hội tụ về giá trị thực. Phần Nghe đã làm được điều đó: cả bốn mức sai số đều nằm gọn trong khoảng hợp lý. Phần Đọc thì chưa: điểm Đọc thực tế của thí sinh B là 360, nằm ngoài khoảng 290±20 tới tận 50 điểm. Ở điểm này chúng tôi phải nói thật rõ ràng — ký hiệu ± mà chúng tôi hiển thị đo lường độ không chắc chắn do lấy mẫu: "nếu đề thi thật tương tự như các câu bạn đã luyện, và năng lực của bạn vẫn giống như vài tuần gần đây, thì điểm số sẽ rơi vào khoảng này". Nó hoàn toàn không biết gì về áp lực thời gian trong phòng thi, không biết gì về việc bạn cố tình tập trung luyện phần yếu, và cũng không biết gì về việc bạn đang tiến bộ từng ngày. Hội tụ không đồng nghĩa với chính xác; nó chỉ đảm bảo tính chính xác khi các tiền đề được thỏa mãn, thế nhưng bốn thí sinh này, mỗi người lại tình cờ phá vỡ một tiền đề.

Những gì chúng tôi sẽ thay đổi (và những gì giữ nguyên)

Phần Nghe giữ nguyên. Điều kiện luyện tập trùng khớp với điều kiện thi, sai số nằm cùng bậc với SEM của bài thi chính thức, không thể đòi hỏi gì tốt hơn thế.

Trong ba dạng sai lệch của phần Đọc, thực ra hai dạng đã có công cụ giải quyết tương ứng, chỉ là trước đây chúng tôi chưa nói đủ rõ ràng: với vấn đề giới hạn thời gian, hãy luyện các đề thi thử có bấm giờ, và bản thân tốc độ làm Part 7 có thể được rèn luyện chuyên biệt (Học đọc nhanh có cứu được bài thi Đọc của tôi không?); với vấn đề độ trễ của sự tiến bộ, sau khi thi xong hãy nhập điểm thật vào ứng dụng, thuật toán ước tính sẽ dùng phiếu điểm chính thức để tái hiệu chỉnh (Phiếu điểm TOEIC không chỉ có điểm số). Sai lệch do chuyên tâm luyện phần yếu là khó xử lý nhất — việc trừng phạt người dùng vì họ thực hiện hành động ôn tập đúng đắn nhất (tập trung vào điểm yếu) là điều hết sức phi lý, do đó việc điều chỉnh phải diễn ra ở thuật toán ước tính điểm chứ không phải ở phía người luyện. Chúng tôi đang nghiên cứu cách hiệu chỉnh mà không cần giả định những dữ liệu không có thực; trước khi làm được điều đó, chúng tôi xin nói thẳng một sự thật: nếu trong những tuần trước ngày thi bạn chỉ tập trung luyện phần yếu, trình độ thực tế của bạn nhiều khả năng sẽ cao hơn điểm dự đoán.

Khoan đã — trước khi bạn trích dẫn những con số này

Thứ nhất, n=4. Đây chỉ là một tập hợp các trường hợp đơn lẻ, không phải một nghiên cứu kiểm định diện rộng; chúng tôi chưa hề thay đổi bất kỳ tham số nào dựa trên bốn điểm dữ liệu này. Thứ hai, việc gửi điểm là hoàn toàn tự nguyện, do đó mẫu dữ liệu tự nhiên sẽ thiên vị những người "có điều muốn chia sẻ" — những người thi được điểm cao hơn dự đoán thường sẽ vui vẻ quay lại báo tin vui hơn (ba trong số bốn người ở đây là như vậy), vì thế quy luật "dự đoán có xu hướng thận trọng" bản thân nó có thể chỉ là sự phản chiếu của sai lệch báo cáo. Thứ ba, cả bốn bạn đều tham gia cùng một đợt thi; bất kỳ sai số cân bằng độ khó (equating) nào giữa các đợt thi khác nhau đều hoàn toàn không xuất hiện trong bộ dữ liệu này. Thứ tư, ngay cả khi mô hình hoàn hảo, SEM cho từng phần thi của chính ETS cũng đã là 25 điểm — dự đoán kỳ thi chính thức chính xác hơn mức kỳ thi tự dự đoán chính nó về mặt toán học không phải là một trò chơi có thể thắng. Mục tiêu của chúng tôi từ trước đến nay chưa bao giờ là tiên tri điểm số, mà là trả lời một cách trung thực câu hỏi: "mình đang ở đâu, còn cách mục tiêu bao xa, và nên luyện tập phần nào tiếp theo". Theo tiêu chuẩn đó, bốn bảng điểm này đã mang lại cho chúng tôi một kết quả qua môn, hai bài tập về nhà rõ ràng, và một lý do vững chắc để tiếp tục thu thập thêm bảng điểm.

Nếu bạn cũng đã tham gia đợt thi ngày 16/8 hoặc các đợt thi sau đó — khi có điểm, ứng dụng sẽ hỏi bạn thi thế nào. Xin hãy chia sẻ với ứng dụng. Phần tiếp theo của bài viết này sẽ do chính bảng điểm của bạn viết nên.


Thẻ dự đoán điểm nằm trên trang chủ của Chinh Phục 990; bấm vào "Cách tính điểm dự đoán" để xem khoảng không chắc chắn và xu hướng hằng ngày của từng phần thi. Toàn bộ phương pháp ước tính được giải thích chi tiết trong bài Cách Chinh Phục 990 ước tính điểm TOEIC của bạn; cơ chế hiệu chỉnh sau khi nhập điểm thật xem tại Phiếu điểm TOEIC không chỉ có điểm số; phần luyện tập đọc có giới hạn thời gian xem tại Học đọc nhanh có cứu được bài thi Đọc của tôi không?.

← Tất cả bài viết