Tất cả bài viết · Đăng ngày 2026-07-23

Cách Chinh Phục 990 ước tính điểm TOEIC của bạn

Bài giải thích kỹ thuật dành cho những ai tò mò. Bài viết giả định bạn đã biết một chút về xác suất và thống kê — bạn hiểu thế nào là xác suất, giá trị trung bình và độ lệch chuẩn — nhưng không cần gì nhiều hơn thế. Mọi khái niệm còn lại đều được xây dựng từ đầu.

Vấn đề

Mỗi lần bạn trả lời một câu hỏi luyện tập, bạn cung cấp cho ứng dụng một bit thông tin: đúng hoặc sai. Từ một chuỗi dài các số 1 và 0 này, trải dài trên cả 7 phần (Part) của bài thi TOEIC, chúng tôi muốn ước tính một con số duy nhất — điểm số nhiều khả năng nhất của bạn trên thang 990 — và chúng tôi muốn con số đó phải đáng tin cậy, ổn định và trung thực về độ không chắc chắn của chính nó.

Điều đó khó hơn so với cảm giác ban đầu, vì bốn lý do:

  1. Câu trả lời chứa nhiều nhiễu. Ngay cả ở một trình độ cố định, bạn vẫn có thể trải qua các chuỗi đúng hoặc sai hoàn toàn do ngẫu nhiên. Một ước tính tốt không nên chao đảo mỗi khi bạn sảy chân.
  2. Năng lực của bạn thay đổi. Bạn đang học tập. Bằng chứng từ ba tuần trước có giá trị thấp hơn bằng chứng của ngày hôm nay. Một phương pháp ước tính đánh trọng số mọi thứ như nhau sẽ không thể theo dõi sự tiến bộ của bạn.
  3. Khởi động lạnh (cold start). Sau ba câu hỏi, chúng tôi vẫn phải hiển thị một cái gì đó, mà không thể giả vờ rằng ba câu hỏi cho chúng tôi biết nhiều thông tin như ba trăm câu.
  4. Chúng ta nên biết điều mình chưa biết. "Reading 320" và "Reading 320, nhưng chúng tôi thực sự chưa chắc chắn" là hai tuyên bố rất khác nhau, và ứng dụng phải có khả năng phân biệt chúng.

Bài viết này giải thích phương pháp chúng tôi sử dụng — phân phối sau Beta–Bernoulli suy giảm (decayed Beta–Bernoulli posterior) — cách nó giải quyết đồng thời cả bốn vấn đề trên, và lý do tại sao chúng tôi lựa chọn nó thay vì các phương án thay thế phổ biến hơn.


Những thử nghiệm đầu tiên, và tại sao chúng chưa đủ tốt

Trung bình cộng dồn đơn thuần

Ý tưởng đơn giản nhất: đối với mỗi Part, theo dõi (số câu đúng) / (số câu đã làm).

Phương pháp này không chệch (unbiased) và cực kỳ đơn giản, nhưng nó không có sự suy giảm bộ nhớ. Sau 500 câu hỏi, một câu trả lời mới hầu như chẳng làm con số dịch chuyển — điều này ổn nếu kỹ năng của bạn không bao giờ thay đổi, nhưng lại vô dụng nếu bạn đang tiến bộ. Một người học đạt tỉ lệ đúng 50% cách đây ba tuần và đạt 75% hôm nay sẽ thấy trung bình cộng dồn bị mắc kẹt ở đoạn giữa trong một thời gian rất dài. Nó cũng coi một câu hỏi bạn làm ngày qua hoàn toàn giống như một bài thi thử đầy đủ. Chúng ta cần một cơ chế biết quên đi quá khứ xa xôi theo một tốc độ được kiểm soát.

Trung bình động mũ cố định (những gì chúng tôi từng dùng trước đây)

Giải pháp kinh điển là trung bình động mũ (exponential moving average (EMA)). Duy trì một con số, là giá trị ước tính m, và sau mỗi câu trả lời, dịch chuyển nhẹ con số đó về phía kết quả mới nhất:

mα·(100 if correct, else 0)+(1α)m,α=0.1

Mỗi câu trả lời mới chiếm trọng số 10%, và toàn bộ quá khứ chiếm 90%. Cách này thực sự quên đi quá khứ — dung lượng bộ nhớ hiệu dụng của nó xấp xỉ 1/α ≈ 10–20 câu trả lời gần nhất — và đó từng là phương pháp Chinh Phục 990 sử dụng ban đầu. Tuy nhiên, nó có ba nhược điểm thực sự:

  • Tốc độ học (learning rate) không bao giờ thay đổi. α = 0.1 ở câu trả lời thứ 3 cả ở câu trả lời thứ 3.000 của bạn. Giai đoạn đầu, tốc độ đó quá chậm (chúng ta đang lãng phí 90% lượng dữ liệu ít ỏi đang có); giai đoạn sau, nó lại trở thành nguồn tạo ra nhiễu vĩnh viễn.
  • Nó không bao giờ hội tụ — nó rung lắc vĩnh viễn. Vì mỗi câu trả lời liên tục dịch chuyển ước tính theo một tỉ lệ cố định, giá trị ước tính sẽ không ngừng giật cục ngay cả khi năng lực thực sự của bạn hoàn toàn đi ngang. Đối với một Part mà độ chính xác thực tế của bạn là 50%, một đường EMA với α cố định sẽ có độ lệch chuẩn về lâu dài khoảng
sdα2α·p(1p)·100±11 percentage points, forever.

Đưa biến động đó qua các Part của một kỹ năng, nó sẽ tạo ra sự trồi sụt hàng chục điểm trên thang 990, phản ánh sự may rủi chứ không phải tiến trình học tập. - Nó không thể hiện mức độ tin cậy. m chỉ là một con số trần trụi. Nó không thể cho bạn biết liệu nó dựa trên 3 câu trả lời hay 3.000 câu, nên nó không thể hiển thị một khoảng ước tính trung thực và cũng không thể tránh khỏi việc phản ứng quá đà khi dữ liệu còn thưa thớt.

Chúng tôi muốn giữ lại điểm tốt của EMA (bộ nhớ có giới hạn) mà không phải trả giá bằng ba nhược điểm trên. Con đường để đạt được điều đó là ngừng theo dõi một con số đơn lẻ và bắt đầu theo dõi một phân phối (distribution).


Ý tưởng Bayesian: theo dõi niềm tin, không phải một điểm

Hãy coi độ chính xác của bạn ở một Part nhất định là một xác suất chưa biết p — khả năng bạn làm đúng một câu hỏi ngẫu nhiên thuộc dạng đó. Mỗi câu trả lời là một phép thử Bernoulli (Bernoulli trial): một lần tung đồng xu rơi vào mặt "đúng" với xác suất p. Chúng ta không biết p; chúng ta muốn tìm ra nó từ các lần tung đồng xu.

Bước đi mang tính Bayesian là: thay vì chỉ đưa ra một dự đoán duy nhất cho p, hãy duy trì toàn bộ một phân phối xác suất về những giá trị khả dĩ của p — tức là niềm tin của chúng ta — và cập nhật niềm tin đó khi có thêm bằng chứng. Khi bạn mới làm ít dữ liệu, niềm tin sẽ trải rộng (chúng ta chưa chắc chắn); khi dữ liệu tích lũy nhiều hơn, nó hội tụ xung quanh giá trị thực (chúng ta tự tin). Chính độ rộng đó thông tin về mức độ tin cậy mà phương pháp EMA đã bỏ lỡ.

Phân phối Beta

Đối với một xác suất p nằm trong khoảng từ 0 đến 1, dạng tự nhiên nhất cho niềm tin này là phân phối Beta (Beta distribution), được viết là Beta(a, b). Bạn có thể hình dung hai tham số của nó như những đếm giả lập (pseudo-counts):

  • a hoạt động như một số đếm cộng dồn các câu trả lời đúng,
  • b hoạt động như một số đếm cộng dồn các câu trả lời sai.

Phân phối Beta có hai đặc tính khiến nó trở nên hoàn hảo cho bài toán này:

1. Giá trị trung bình của nó chính xác là những gì bạn mong đợi:

estimated accuracy=mean[Beta(a,b)]=aa+b

Chỉ đơn giản là "số câu đúng trên tổng số câu", nhưng sử dụng các số đếm giả lập thay vì kiểm đếm thô.

2. Việc cập nhật nó cực kỳ đơn giản. Phân phối Beta là phân phối tiên lượng liên hợp (conjugate prior) cho các phép thử Bernoulli — một sự may mắn về mặt toán học có nghĩa là quy tắc cập nhật luôn giữ nguyên trong cùng một họ phân phối. Khi ghi nhận một câu trả lời đúng, niềm tin mới của bạn chỉ đơn giản là Beta(a+1, b); một câu trả lời sai sẽ cho ra Beta(a, b+1). Không cần tính tích phân, không cần xấp xỉ: bạn chỉ cần cộng 1 vào một bộ đếm. Đây là lý do tại sao toàn bộ phương pháp chỉ tốn vài phép tính số học cho mỗi câu trả lời và chạy hoàn toàn trên thiết bị của bạn.

Điểm bắt đầu (phân phối tiên lượng - prior)

Trước khi bạn trả lời bất kỳ câu hỏi nào, chúng tôi bắt đầu tại Beta(3, 3). Giá trị trung bình của nó là 3/6 = 50% — một dự đoán khởi đầu trung lập — và tổng số của nó, a + b = 6, được cố ý chọn ở mức nhỏ, thể hiện ý nghĩa "chúng tôi đoán là 50%, nhưng ở mức yếu, để dữ liệu thực tế có thể làm thay đổi nhanh chóng." Chỉ cần làm một vài câu hỏi, các đếm giả lập bạn đóng góp sẽ lấn gạt phân phối tiên lượng ban đầu; giả định 50% sẽ tự động mờ nhạt đi.

Mức độ tin cậy đến một cách hoàn toàn tự nhiên

Vì chúng ta nắm giữ toàn bộ phân phối, chúng ta thu được phương sai (variance) của nó mà không cần ghi chép gì thêm. Đối với một phân phối Beta,

Var(mean)=m(1m)N+1,m=aa+b,N=a+b

Hãy xem những gì công thức này thực hiện: tử số m(1−m) là phương sai tung đồng xu thông thường, và mẫu số tăng lên theo N, tức là tổng lượng bằng chứng. Càng nhiều câu trả lời ⇒ phương sai càng nhỏ ⇒ ước tính càng thu hẹp. Độ lệch chuẩn của giá trị này (căn bậc hai của nó) chính là khoảng "±" mà ứng dụng hiển thị bên cạnh điểm số của bạn. Khoảng này sẽ thu hẹp lại khi bạn luyện tập, điều này vừa trung thực, vừa tạo động lực cho bạn.


Phần "suy giảm" (decayed): quên đi ở một tốc độ được kiểm soát

Việc cập nhật Bayesian thuần túy lại lặp lại đúng vấn đề của trung bình cộng dồn: nó không bao giờ quên. Sau 500 câu trả lời, N = 506 và một câu trả lời mới hầu như không mảy may tác động — điều này chẳng tốt chút nào cho một người học đang ngày càng tiến bộ.

Cách khắc phục chỉ gói gọn trong một dòng. Trước khi gộp từng câu trả lời mới vào, hãy giảm nhẹ các đếm giả lập hiện tại bằng một hệ số suy giảm ρ nhỏ hơn 1 một chút. Với mỗi câu trả lời (x = 1 nếu đúng, 0 nếu sai):

{aρa+xbρb+(1x)ρ=1140=0.975

Trừ bớt ab một chút ở mỗi bước sẽ ngăn tổng lượng bằng chứng tăng lên vô hạn. Nó sẽ dừng lại ở một mức trần cố định:

steady-state total evidenceN*=11ρ=40 answers.

Vì vậy, cho dù bạn có trả lời hàng nghìn câu hỏi đi nữa, mỗi Part sẽ hoạt động như thể nó chỉ ghi nhớ khoảng 40 câu gần nhất, được đánh trọng số giảm dần một cách mượt mà theo thời gian. Đó chính là "bộ nhớ có giới hạn" mà chúng tôi ưa thích ở EMA — nhưng giờ đây đi kèm thêm hai lợi ích vượt trội.

Lợi ích 1: tốc độ học tự điều chỉnh

Đây là phần tinh tế nhất. Hãy tính toán xem giá trị trung bình di chuyển bao nhiêu sau một câu trả lời. Gọi N = a + b là lượng bằng chứng trước câu trả lời và N′ = ρN + 1 là lượng bằng chứng ngay sau đó, chỉ qua vài dòng biến đổi đại số, nó thu gọn lại thành:

mnew=m+xmN

Công thức này chính xác là một EMA — nhưng bước tiến của nó là 1/N′, một giá trị không cố định. Khi N nhỏ (bạn mới bắt đầu), N′ cũng nhỏ — khoảng 7 ở câu trả lời đầu tiên của bạn, nên bước tiến đạt khoảng 1/7 ≈ 0.15 và ước tính dịch chuyển nhanh, tận dụng tối đa lượng dữ liệu ít ỏi ban đầu. Khi N tiến dần đến mức trần, N′ dừng lại ở 40, bước tiến ổn định ở mức 1/40 = 0.025, và ước tính trở nên êm ả và ổn định. Nói cách khác:

Phân phối sau Beta suy giảm chính là một trung bình động mũ — nhưng có tốc độ học khởi đầu ở mức cao và tự động hạ dần xuống mức thấp, đồng thời mang theo một bộ đếm bằng chứng để luôn biết rõ mức độ tin cậy của chính mình.

EMA cố định chỉ là một trường hợp đặc biệt mà ở đó bạn đã vứt bỏ khả năng tự điều chỉnh này.

Lợi ích 2: giảm một nửa độ nhiễu và có tính hội tụ

Vì tốc độ học khi đã ổn định (≈ 0.025) nhỏ hơn rất nhiều so với mức cố định trước đây α = 0.1, sự rung lắc về lâu dài giảm khoảng một nửa theo độ lệch chuẩn — tức chỉ bằng một phần tư phương sai. Ước tính không còn bị giật cục do may rủi, nhờ đó biểu đồ xu hướng và các con số "điểm tăng thêm trong phiên này" phản ánh sự thay đổi thực sự chứ không phải nhiễu. Tuy nhiên, nhờ có sự suy giảm (decay), nó không bao giờ bị đóng dính: sự tiến bộ thực sự vẫn được ghi nhận đầy đủ, chỉ là loại bỏ đi độ chính xác ảo.


Hai khía cạnh khác của nguyên lý "không phải bằng chứng nào cũng như nhau"

Cùng một bộ máy toán học này có thể dễ dàng tiếp nhận thêm một vài tinh chỉnh mà phương pháp EMA đơn thuần không thể hiện được, đơn giản vì EMA không có nơi nào để đưa chúng vào.

Sự suy giảm theo thời gian thực

Bộ nhớ có giới hạn sẽ đếm số câu trả lời, nhưng việc nghỉ học hai tháng cũng nên làm giảm độ tin cậy ngay cả khi bạn không làm thêm câu nào trong thời gian đó. Vì vậy, khi một Part không được luyện tập quá thời gian ân hạn một tuần, chúng tôi sẽ giảm nhẹ các đếm giả lập của nó cho mỗi ngày bỏ trống (theo hệ số 0.99 mỗi ngày). Điều quan trọng là chúng tôi giảm a b theo cùng một hệ số — giữ nguyên giá trị trung bình a/(a+b) nhưng làm giảm tổng số N. Kết quả là: điểm số hiển thị của bạn không thay đổi, nhưng khoảng ± của nó rộng ra, và những câu trả lời đầu tiên khi bạn quay lại luyện tập sẽ mang trọng số cao hơn. "Chúng tôi không quên bạn từng ở mức nào, nhưng chúng tôi bớt chắc chắn liệu điều đó có còn đúng không" — tất cả được thể hiện qua một phép nhân đơn giản.

Đánh trọng số cho từng câu trả lời riêng biệt

Không phải câu trả lời nào cũng mang lượng thông tin như nhau, vì vậy chúng tôi gộp câu trả lời vào với một trọng số w (quy tắc cập nhật trở thành a ← ρa + w·x, b ← ρb + w·(1−x)):

  • Một câu hỏi bạn từng gặp trước đây chỉ được tính một nửa trọng số. Làm đúng một câu lặp lại phụ thuộc một phần vào ghi nhớ hơn là năng lực, vì vậy nó không nên làm dịch chuyển giá trị ước tính nhiều như một câu hỏi mới. Điều này cũng triệt tiêu một thiên lệch tinh vi: khi bạn đã làm hết một dạng bài, hệ thống bắt đầu gửi lại các câu bạn từng làm sai, điều mà nếu tính như bình thường sẽ kéo ước tính của bạn xuống một cách bất công.
  • Nguồn gốc câu hỏi rất quan trọng. Một câu trả lời trong điều kiện thi thực tế (bài thi thử tính giờ đầy đủ) có giá trị hơn một bài luyện tập ngẫu nhiên, nên nó được gộp vào với trọng số cao hơn (lên đến gấp đôi). Với mức trần bộ nhớ khoảng ~40, một bài thi thử hoàn thành sẽ thực sự chi phối bằng chứng gần nhất của Part đó thay bị mờ nhạt đi vào ngày hôm sau.
  • Điểm thi thực tế được nhập vào (nếu bạn có nhập) sẽ khởi tạo niềm tin như một phân phối tiên lượng mạnh — tương đương khoảng 25 câu trả lời tự tin ở độ chính xác tương ứng — để một câu hỏi luyện tập sau đó không thể làm mất nó ngay, nhưng vài chục câu hỏi luyện tập sau đó sẽ dần dần cập nhật nó.

Không có tính năng nào trong số này đòi hỏi một kiến trúc mới. Tất cả chỉ là trọng số w và hai bộ đếm. Sự linh hoạt đó là hệ quả trực tiếp của việc lựa chọn một mô hình có khái niệm rõ ràng về "lượng bằng chứng là bao nhiêu", thay vì một con số mờ đục duy nhất.


Từ niềm tin từng Part đến điểm số 990

Mỗi danh mục trong số mười dạng câu hỏi đều duy trì phân phối sau Beta suy giảm riêng. Để chuyển đổi chúng thành điểm số cho từng kỹ năng (Listening / Reading), chúng tôi đánh trọng số giá trị trung bình của mỗi dạng câu hỏi theo số lượng câu hỏi của dạng đó xuất hiện trong bài thi thật (tổng số câu bằng 100 cho mỗi kỹ năng), cho ra ước tính số câu đúng trên 100 câu. Con số đó được ánh chiếu qua bảng quy đổi chính thức số câu đúng → điểm quy đổi của TOEIC để tạo ra điểm kỹ năng từ 5–495, và hai kỹ năng cộng lại sẽ cho ra ước tính tổng điểm trên 990 của bạn.

Độ không chắc chắn cũng truyền đi cùng tính toán này. Vì các danh mục là độc lập với nhau, các phương sai của chúng được cộng theo tổng bình phương (add in quadrature) (đánh trọng số bằng bình phương của số lượng câu thi tương ứng), và sai số chuẩn kết hợp sẽ trở thành dải ± trên điểm kỹ năng và điểm tổng của bạn.

Kiểm tra thực tế riêng cho kỹ năng Đọc (Reading)

Phần thi Reading của TOEIC chịu áp lực thời gian: 100 câu hỏi trong 75 phút — trung bình 45 giây cho mỗi câu, không thể mua thêm thời gian. Do đó, độ chính xác đo được khi luyện tập không tính giờ sẽ tạo ra sự tâng bốc điểm số cho người đọc chậm, vì khi chạy theo thời gian thực tế họ không bao giờ làm tới các câu hỏi cuối, và một câu hỏi không kịp làm sẽ tính điểm như một lần đoán ngẫu nhiên — 25%, xác suất một phần tư — chứ không phải độ chính xác khi bạn luyện tập.

Vì vậy, ứng dụng thực hiện một mô phỏng đơn giản. Sử dụng tốc độ làm mỗi câu đã đo được cho từng Part đọc, ứng dụng "tiêu" ngân sách 75 phút của bạn theo đúng thứ tự bài thi — Part 5, sau đó đến Part 6, rồi Part 7 — cho đến khi hết giờ, và chấm điểm mỗi câu hỏi bạn không kịp làm ở mức 0,25 thay vì độ chính xác thực sự của bạn.

Một ví dụ cụ thể. Giả sử tốc độ đọc của bạn là 30 giây/câu ở Part 5, 45 giây ở Part 6, và 80 giây ở Part 7. Part 5 và 6 (30 + 16 câu) tiêu tốn 30×30 + 16×45 = 1.620 giây, còn lại 2.880 giây cho Part 7. Với 80 giây mỗi câu, bạn chỉ hoàn thành 2.880 / 80 ≈ 36 trong số 54 câu của Part 7 — 18 câu còn lại bị bỏ trống. Nếu độ chính xác Part 7 của bạn là 70%, 18 câu đó đều tụt từ 0,70 xuống 0,25, mất khoảng 0,45 × 18 ≈ 8 điểm thô — tương đương tụt khoảng 30–40 điểm quy đổi Reading. Đọc nhanh hơn, nhiều câu hỏi hơn sẽ được chạm tới ở độ chính xác thực tế của bạn, nhờ đó điểm phạt thu hẹp lại; ở một tốc độ thoải mái, điểm phạt sẽ biến mất hoàn toàn.

Khi tốc độ của bạn làm mất điểm như vậy, ứng dụng sẽ hiển thị rõ con số "theo nhịp độ thi" — như một lời nhắc nhở rằng kỹ năng Đọc đòi hỏi tốc độ chứ không chỉ là sự chính xác. (Kỹ năng Nghe do máy ấn định nhịp độ nên không cần điều chỉnh này.)


Tại sao phương pháp này vượt trội hơn các phương án thay thế

Chúng tôi đã xem xét các ứng viên phổ biến. Đâu là sự so sánh trung thực.

Phương pháp Những gì nó mang lại Tại sao chúng tôi không dừng lại ở đó
Trung bình cộng dồn đơn thuần (Plain running average) Không chệch, đơn giản Không bao giờ quên; không thể theo dõi sự tiến bộ; coi mọi câu trả lời như nhau
EMA với α cố định (Fixed-α EMA) Bộ nhớ có giới hạn, chi phí tính toán thấp Tốc độ học hằng số; rung lắc vĩnh viễn; không có độ không chắc chắn; không có chỗ để thêm trọng số
Phân phối sau Beta suy giảm (Decayed Beta posterior - phương pháp của chúng tôi) Tốc độ tự điều chỉnh, bộ nhớ có giới hạn, tích hợp độ tin cậy, đánh trọng số tự nhiên
Lý thuyết Ứng đáp Câu hỏi (Item-Response Theory (IRT)) Mô hình năng lực "chuẩn mực vàng" Cần độ khó của mỗi câu hỏi được hiệu chuẩn từ hàng nghìn thí sinh — dữ liệu chúng tôi không có sẵn trên thiết bị
Hệ thống điểm Elo / Glicko (Elo / Glicko ratings) Tinh tế, linh hoạt Cũng cần độ khó "đối thủ" của từng câu hỏi mà chúng tôi không thể tin cậy; việc ghi nhận độ không chắc chắn của nó chỉ lặp lại những gì sự suy giảm của chúng tôi đã có
Bộ lọc Kalman (Kalman filter) Theo dõi một đại lượng thay đổi kèm độ không chắc chắn Với dữ liệu đúng/sai, mô hình này thu gọn về cơ bản giống mô hình của chúng tôi, nhưng với khả năng biến thiên (likelihood) vụng về hơn; dạng Beta là sự kết hợp tự nhiên nhất

Điểm mấu chốt mang tính quyết định là đây. Hai mô hình "phức tạp hơn" — IRT và Elo — dồn toàn bộ sức mạnh vào các tham số độ khó của từng câu hỏi, và việc ước tính các tham số đó một cách đáng tin cậy đòi hỏi một tập hợp lớn thí sinh cùng trả lời các câu hỏi đó. Chinh Phục 990 chạy riêng tư trên thiết bị của bạn, không có các thống kê trên toàn bộ tập người dùng như vậy. Nếu đưa vào các mô hình đó những nhãn độ khó chưa được hiệu chuẩn mà chúng tôi đang có, chúng sẽ trở thành những bộ máy phức tạp vận hành trên các đầu vào mong manh.

Trong khi đó, mọi vấn đề mà người dùng thực sự cảm nhận được — sự rung lắc, việc không thể quên quá khứ, khoảng tin cậy bị thiếu, sự đánh đồng giữa bài thi thử và bài khởi động — đều nằm ở quy tắc cập nhật, chứ không nằm ở độ khó của câu hỏi. Phân phối sau Beta suy giảm là mô hình nhỏ nhất, chuẩn mực nhất có thể giải quyết tất cả các vấn đề đó cùng một lúc:

  • Nó mang tính Bayesian thực sự, do đó ước tính và độ không chắc chắn của nó đến từ cùng một quy tắc mạch lạc duy nhất thay vì bị gượng ép ghép vào.
  • Nó là một EMA với hệ số thích ứng (adaptive-gain EMA), vì vậy nó bắt đầu nhanh, ổn định êm ả và không bao giờ bị đóng dính.
  • Nó có tính liên hợp (conjugate), do đó mỗi lần cập nhật chỉ là một vài phép cộng và phép nhân — nhanh chóng, chính xác và hoạt động ngoại tuyến (offline).
  • Nó có một số đếm bằng chứng rõ ràng, do đó việc đánh trọng số theo thời gian gần đây, sự lặp lại và nguồn câu hỏi đều diễn ra một cách tự nhiên.

Tóm lại, đó là lượng thống kê vừa đủ và phù hợp cho lượng dữ liệu mà chúng tôi thực sự có.


Những lưu ý trung thực

  • Đây là công cụ hỗ trợ học tập, không phải điểm số chính thức. Bài thi TOEIC thật sử dụng thang đo IRT trên các đề thi bảo mật; chúng tôi chỉ có thể đưa ra ước tính xấp xỉ từ quá trình luyện tập của bạn.
  • Các hằng số được suy luận lý thuyết, không phải khớp dữ liệu (fitted). Mức trần bộ nhớ (~40), độ mạnh của phân phối tiên lượng, tốc độ suy giảm và trọng số câu trả lời là những giá trị mặc định hợp lý, chứ không phải các giá trị được tinh chỉnh trên một tập dữ liệu hiệu chuẩn lớn. Khi bạn nhập một điểm thi thực tế, chúng tôi sẽ ghi lại khoảng cách giữa ước tính của chúng tôi và kết quả thực tế đó (một cách riêng tư) để các con số này có thể được hoàn thiện dần theo thời gian.
  • Dữ liệu thưa thớt vẫn là dữ liệu thưa thớt. Giai đoạn đầu, hầu hết các Part vẫn nằm ở mức tiên lượng 50%, nên ước tính ban đầu còn thô sơ — đó chính là lý do ứng dụng hiển thị khoảng ± rộng cho đến khi bạn cung cấp nhiều dữ liệu hơn để xử lý.

Chúng tôi chưa bao quát được mọi thứ — và chúng tôi biết điều đó. Các yếu tố ở trên là những gì chúng tôi có thể mô hình hóa từ những gì quá trình luyện tập của bạn phản ánh: mốc thời gian gần đây, sự lặp lại, trọng số điều kiện thi, tốc độ đọc. Nhưng một bài thi thật còn phụ thuộc vào những điều mà chúng tôi không thể thấy được từ đây — tâm lý căng thẳng và sự mệt mỏi trong ngày thi, đề thi cụ thể mà bạn nhận được, cách diễn đạt lạ lẫm, độ khó của ngân hàng câu hỏi của chúng tôi so với đề thi thật, và cả sự may mắn thuần túy khi bạn đoán mò hôm đó, cùng nhiều yếu tố khác. Chúng tôi đã cân nhắc nhiều yếu tố, nhưng chắc chắn không phải tất cả, vì vậy con số ước tính sẽ không bao giờ chính xác tuyệt đối và cũng không nhằm mục đích đó. Nếu bạn tham gia kỳ thi TOEIC thật và kết quả làm bạn bất ngờ — cao hơn hoặc thấp hơn con số chúng tôi hiển thị — chúng tôi rất mong nhận được phản hồi của bạn qua tùy chọn góp ý trong ứng dụng. Việc bạn chia sẻ điều gì đã làm thay đổi điểm số của bạn sẽ giúp chúng tôi nhận diện các yếu tố còn thiếu và làm cho ước tính ngày càng sắc bén hơn cho tất cả mọi người.

Phiên bản cam kết trung thực là: hãy trả lời nhiều câu hỏi hơn, trên nhiều Part hơn, trong các điều kiện thực tế hơn, và giá trị ước tính sẽ vừa tiến gần hơn đến sự thật, vừa báo cho bạn biết rằng nó đã trở nên tự tin hơn. Đó chính là mục tiêu hoạt động mà bộ ước tính Bayesian suy giảm được xây dựng để mang lại.


Phần tiếp theo đã ra mắt: khi phiếu điểm thật về tay, bộ ước tính này tận dụng nó ra sao — và phần ABILITIES MEASURED mà đa số bỏ qua có thể làm được gì? Mời đọc Phiếu điểm TOEIC không chỉ có điểm số.

← Tất cả bài viết