บทความทั้งหมด · เผยแพร่เมื่อ 2026-07-23
พิชิต 990 ประเมินคะแนน TOEIC ของคุณอย่างไร
คำอธิบายทางเทคนิคสำหรับผู้ที่สนใจใคร่รู้ โดยสมมติว่าคุณคุ้นเคยกับความน่าจะเป็นและสถิติพื้นฐานบ้างแล้ว — รู้จักความน่าจะเป็น ค่าเฉลี่ย และส่วนเบี่ยงเบนมาตรฐาน — แต่ไม่จำเป็นต้องรู้เกินไปกว่านั้น เนื้อหาที่เหลือทั้งหมดจะถูกปูพื้นฐานขึ้นใหม่ตั้งแต่เริ่มต้น
ปัญหาที่พบ
ทุกครั้งที่คุณตอบคำถามแบบฝึกหัด คุณกำลังส่งข้อมูลเพียงหนึ่งบิตให้กับแอป: ถูก หรือ ผิด จากสายธารข้อมูลตัวเลขหนึ่งและศูนย์อันยาวเหยียดนี้ ซึ่งกระจายอยู่ตามทั้ง 7 Part ของ TOEIC เราต้องการประเมินค่าตัวเลขเพียงตัวเดียว — นั่นคือคะแนนคาดการณ์ของคุณจากคะแนนเต็ม 990 — และเราต้องการให้ตัวเลขนั้น น่าเชื่อถือ มั่นคง และสะท้อนความไม่แน่นอนของตัวมันเองอย่างตรงไปตรงมา
เรื่องนี้ยากกว่าที่ฟังดูด้วยเหตุผล 4 ประการ:
- คำตอบมีความผันผวน (noisy). แม้ว่าระดับทักษะของคุณจะคงที่ แต่คุณก็อาจตอบถูกหรือผิดติดต่อกันได้จากความบังเอิญ การประเมินที่ดีไม่ควรแกว่งไปมาอย่างรุนแรงทุกครั้งที่คุณทำข้อสอบพลาด
- ความสามารถของคุณเปลี่ยนแปลงได้. คุณกำลังเรียนรู้และฝึกฝน หลักฐานจากเมื่อ 3 สัปดาห์ก่อนจึงมีค่าน้อยกว่าหลักฐานในวันนี้ การประเมินที่ถ่วงน้ำหนักทุกอย่างเท่ากันไม่สามารถติดตามการพัฒนาของคุณได้
- การเริ่มต้นจากศูนย์ (Cold start). หลังจากตอบไปเพียง 3 ข้อ แอปยังคงต้องแสดงผล บางอย่าง โดยไม่เสแสร้งว่าคำถาม 3 ข้อนั้นให้ข้อมูลมากเท่ากับคำถาม 300 ข้อ
- เราควรตระหนักในสิ่งที่เรายังไม่รู้. ข้อความว่า "Reading 320" กับ "Reading 320 แต่เรายังไม่แน่ใจนัก" เป็นข้อความที่แตกต่างกันอย่างสิ้นเชิง และแอปควรจะแยกแยะความแตกต่างนี้ได้
บทความนี้จะอธิบายวิธีการที่เราใช้ — นั่นคือ พารามิเตอร์หลังแบบเบต้า–แบร์นูลลีสลายตัว (decayed Beta–Bernoulli posterior) — ว่าวิธีนี้แก้ปัญหาทั้ง 4 ประการพร้อมกันได้อย่างไร และเหตุใดเราจึงเลือกวิธีนี้แทนทางเลือกอื่นๆ ที่ดูน่าจะเป็นไปได้
ความพยายามในตอนแรก และเหตุใดจึงยังไม่ดีพอ
ค่าเฉลี่ยสะสมแบบธรรมดา
แนวคิดที่เรียบง่ายที่สุด: สำหรับแต่ละ Part ให้ติดตาม (จำนวนข้อที่ตอบถูก) / (จำนวนข้อที่ตอบทั้งหมด)
วิธีนี้ไม่เอนเอียงและเรียบง่ายอย่างยิ่ง แต่กลับ ไม่มีการสลายตัวของความทรงจำ (memory decay) หลังจากทำโจทย์ไป 500 ข้อ คำตอบเพียงข้อเดียวแทบจะไม่ส่งผลต่อค่าเฉลี่ยเลย — ซึ่งเป็นเรื่องดีหากทักษะของคุณไม่เคยเปลี่ยนแปลง แต่จะไร้ประโยชน์ทันทีหากทักษะของคุณพัฒนาขึ้น ผู้เรียนที่เคยทำได้ 50% เมื่อ 3 สัปดาห์ก่อน และทำได้ 75% ในวันนี้ จะพบว่าค่าเฉลี่ยสะสมค้างติดอยู่ตรงกลางเป็นเวลานานมาก นอกจากนี้ ยังปฏิบัติกับคำถามที่คุณทำเมื่อวานเหมือนกับแบบทดสอบจำลองเต็มรูปแบบ เราจึงต้องการระบบที่สามารถลืมอดีตอันยาวนานในอัตราที่ควบคุมได้
ค่าเฉลี่ยเคลื่อนที่แบบถ่วงน้ำหนักด้วยเลขชี้กำลังคงที่ (สิ่งที่เราเคยใช้ก่อนหน้านี้)
แนวทางแก้ไขแบบคลาสสิกคือ ค่าเฉลี่ยเคลื่อนที่แบบถ่วงน้ำหนักด้วยเลขชี้กำลัง (exponential moving average (EMA)) โดยเก็บตัวเลขไว้เพียงตัวเดียว นั่นคือค่าประเมิน m และหลังจากตอบแต่ละข้อ ก็ขยับค่านั้นเข้าหาผลลัพธ์ล่าสุด:
คำตอบใหม่แต่ละข้อจะมีน้ำหนัก 10% และอดีตทั้งหมดจะมีน้ำหนัก 90% วิธีนี้ลืมอดีตได้จริง — โดยมีความทรงจำที่มีประสิทธิผลประมาณ 1/α ≈ 10–20 ข้อล่าสุด — และนี่คือสิ่งที่ พิชิต 990 เคยใช้ในตอนแรก ทว่าวิธีนี้มีข้อบกพร่องที่แท้จริงอยู่ 3 ประการ:
- อัตราการเรียนรู้ (learning rate) ไม่เคยเปลี่ยนแปลง. ค่า
α = 0.1เท่าเดิมทั้งในการตอบข้อที่ 3 และ ข้อที่ 3,000 ในช่วงแรกมันช้าเกินไป (เราทิ้งข้อมูลอันน้อยนิดที่มีไปถึง 90%) แต่ในช่วงหลังมันกลับกลายเป็นต้นเหตุของสัญญาณรบกวนถาวร - มันไม่เคยลู่เข้า (converge) — แต่จะสั่นแกว่งตลอดไป. เนื่องจากคำตอบทุกข้อขยับค่าประเมินด้วยสัดส่วนที่คงที่ ค่าประเมินจึงแกว่งขึ้นลงเรื่อยๆ แม้ว่าความสามารถที่แท้จริงของคุณจะราบเรียบสม่ำเสมอก็ตาม สำหรับ Part ที่ความแม่นยำแท้จริงของคุณอยู่ที่ 50% ค่า EMA ที่ใช้
αคงที่จะมีส่วนเบี่ยงเบนมาตรฐานในระยะยาวประมาณ
เมื่อนำผลนี้ไปคำนวณผ่าน Part ต่างๆ ของแต่ละส่วน มันจะกลายเป็นการแกว่งของคะแนนหลายสิบคะแนนบนสเกล 990 ซึ่งสะท้อนถึงดวง ไม่ใช่การเรียนรู้
- มันไม่ได้แสดงถึงความเชื่อมั่นใดๆ. m เป็นเพียงตัวเลขโดดๆ ตัวหนึ่ง มันไม่สามารถบอกได้ว่ามันมาจากคำตอบ 3 ข้อหรือ 3,000 ข้อ ดังนั้นมันจึงไม่สามารถแสดงช่วงคะแนนที่ตรงไปตรงมาได้ และไม่สามารถหลีกเลี่ยงการตอบสนองที่รุนแรงเกินไปเมื่อข้อมูลยังมีน้อย
เราต้องการส่วน ที่ดี ของ EMA (ความทรงจำที่มีขอบเขต) โดยไม่ต้องแบกรับต้นทุนทั้งสามนี้ วิธีการบรรลุเป้าหมายนั้นคือการเลิกติดตามตัวเลขเพียงตัวเดียว แล้วหันมาติดตาม การแจกแจง (distribution) แทน
แนวคิดแบบเบย์เซียน: ติดตามความเชื่อ ไม่ใช่จุดเดียว
ลองจินตนาการถึงความแม่นยำของคุณใน Part นั้นๆ ให้เป็นความน่าจะเป็นที่ไม่ทราบค่า p — นั่นคือโอกาสที่คุณจะตอบคำถามประเภทนั้นถูกแบบสุ่ม คำตอบแต่ละข้อเปรียบเสมือน การทดลองแบบแบร์นูลลี (Bernoulli trial): การโยนเหรียญที่ออกหัวเป็น "ถูกต้อง" ด้วยความน่าจะเป็น p เราไม่รู้ค่า p แต่เราต้องการเรียนรู้ค่านั้นจากการโยนเหรียญ
กลยุทธ์แบบเบย์เซียน (Bayesian) คือ: แทนที่จะฟันธงไปที่การคาดเดาค่า p เพียงค่าเดียว เราจะถือ การแจกแจงความน่าจะเป็นทั้งหมดว่า p น่าจะเป็นอะไรได้บ้าง — ซึ่งก็คือ ความเชื่อ (belief) ของเรา — และอัปเดตความเชื่อนั้นเมื่อมีหลักฐานใหม่เข้ามา เมื่อคุณเพิ่งเห็นข้อมูลเพียงเล็กน้อย ความเชื่อจะกระจายกว้าง (เรายังไม่แน่ใจ) แต่เมื่อข้อมูลสะสมมากขึ้น มันจะบีบตัวแคบลงรอบๆ ค่าที่แท้จริง (เรามีความมั่นใจ) ความกว้างนี้แหละ คือ ข้อมูลความเชื่อมั่นที่ EMA ขาดหายไป
การแจกแจงแบบเบต้า
สำหรับความน่าจะเป็น p ซึ่งมีค่าอยู่ระหว่าง 0 ถึง 1 รูปแบบที่เหมาะสมตามธรรมชาติสำหรับความเชื่อนี้คือ การแจกแจงแบบเบต้า (Beta distribution) เขียนแทนด้วย Beta(a, b) คุณสามารถนึกภาพพารามิเตอร์สองตัวนี้เป็น นับเสมือน (pseudo-counts):
aทำหน้าที่เหมือนนับสะสมของคำตอบที่ถูกต้องbทำหน้าที่เหมือนนับสะสมของคำตอบที่ผิด
การแจกแจงแบบเบต้ามีคุณสมบัติ 2 ประการที่ทำให้เหมาะอย่างยิ่งสำหรับงานนี้:
1. ค่าเฉลี่ยของมันตรงกับสิ่งที่คุณคาดหวังไว้พอดี:
ก็คือ "จำนวนข้อถูกหารด้วยจำนวนทั้งหมด" เพียงแต่ใช้นับเสมือนแทนการนับจำนวนจริง
2. การอัปเดตทำได้ง่ายดายอย่างยิ่ง. การแจกแจงแบบเบต้าเป็น ตัวแจกแจงก่อนแบบสังยุค (conjugate prior) สำหรับการทดลองแบบแบร์นูลลี — ซึ่งถือเป็นโชคดีทางคณิตศาสตร์ที่ทำให้กฎการอัปเดตยังคงอยู่ในตระกูลเดิม เมื่อพบคำตอบที่ถูกต้อง ความเชื่อใหม่ของคุณจะเป็นเพียง Beta(a+1, b) และหากตอบผิดจะได้ Beta(a, b+1) ไม่ต้องอินทิเกรต ไม่ต้องประมาณค่า: คุณแค่บวก 1 เข้าไปในตัวนับ นี่คือเหตุผลที่วิธีการทั้งหมดนี้ใช้การคำนวณทางคณิตศาสตร์เพียงเล็กน้อยต่อคำตอบหนึ่งข้อ และทำงานบนอุปกรณ์ของคุณได้อย่างสมบูรณ์
จุดเริ่มต้นของเรา (prior)
ก่อนที่คุณจะตอบคำถามใดๆ เราจะเริ่มต้นที่ Beta(3, 3) ค่าเฉลี่ยของมันคือ 3/6 = 50% — ซึ่งเป็นการคาดเดาเริ่มต้นแบบเป็นกลาง — และผลรวม a + b = 6 ก็ถูกตั้งไว้ให้มีขนาดเล็กโดยเจตนา เพื่อสื่อความหมายว่า "เราคิดว่า 50% แต่เป็นความเชื่อที่อ่อนมาก ดังนั้นข้อมูลจริงจะขยับค่านึ้อย่างรวดเร็ว" เมื่อตอบคำถามไปเพียงไม่กี่ข้อ นับเสมือนที่คุณส่งเข้ามาจะบดบังความเชื่อก่อนหน้า (prior) ไปเอง และข้อสมมติฐาน 50% ก็จะค่อยๆ เลือนหายไป
ได้ความเชื่อมั่นมาโดยไม่ต้องจ่ายอะไรเพิ่ม
เนื่องจากเราถือการแจกแจงทั้งชุด เราจึงได้ ความแปรปรวน (variance) ของมันมาโดยไม่ต้องบันทึกข้อมูลอะไรเพิ่มเติม สำหรับการแจกแจงแบบเบต้า
พิจารณาการทำงานของสูตรนี้: ตัวเศษ m(1−m) คือความแปรปรวนของการโยนเหรียญตามปกติ และตัวส่วนจะเติบโตขึ้นตาม N ซึ่งเป็นหลักฐานทั้งหมด ตอบคำถามมากขึ้น ⇒ ความแปรปรวนน้อยลง ⇒ การประเมินกระชับแม่นยำยิ่งขึ้น ส่วนเบี่ยงเบนมาตรฐานของสิ่งนี้ (รากที่สองของมัน) คือสิ่งที่แอปแปลงเป็นช่วง "±" ที่คุณเห็นข้างๆ คะแนนของคุณ มันจะหดแคบลงเรื่อยๆ เมื่อคุณฝึกฝน ซึ่งทั้งตรงไปตรงมา และหวังว่าจะช่วยสร้างแรงจูงใจให้คุณด้วย
ส่วนของการ "สลายตัว": การลืมในอัตราที่ควบคุมได้
การอัปเดตแบบเบย์เซียนแท้ๆ เจอปัญหาเดิมซ้ำรอยกับค่าเฉลี่ยสะสม: นั่นคือมันไม่เคยลืม หลังจากทำไป 500 ข้อ ค่า N = 506 และคำตอบใหม่แทบจะไม่มีผลใดๆ เลิย — ซึ่งไม่ดีเลยสำหรับผู้เรียนที่กำลังพัฒนา
ทางแก้นั้นมีเพียงบรรทัดเดียว ก่อน ที่จะรวมคำตอบใหม่แต่ละข้อเข้ามา ให้ลดขนาดนับเสมือนที่มีอยู่อย่างนุ่มนวลด้วยปัจจัยการสลายตัว (decay factor) ρ ซึ่งมีค่าน้อยกว่า 1 เล็กน้อย สำหรับคำตอบแต่ละข้อ (x = 1 หากถูก, 0 หากผิด):
การลดขนาด a และ b ลงทีละน้อยในแต่ละขั้นตอนจะหยุดไม่ให้หลักฐานทั้งหมดเติบโตอย่างไร้ขีดจำกัด มันจะคงที่อยู่ที่เพดานค่าหนึ่ง:
ดังนั้น ไม่ว่าคุณจะตอบคำถามไปกี่พันข้อ แต่ละ Part จะทำตัวเสมือนว่าจดจำเฉพาะ 40 ข้อล่าสุด โดยถ่วงน้ำหนักเข้าหาคำตอบล่าสุดอย่างราบรื่น นี่คือ "ความทรงจำที่มีขอบเขต" ที่เราชื่นชอบใน EMA — แต่ตอนนี้มาพร้อมกับประโยชน์เพิ่มเติมอีก 2 ประการ
ประโยชน์ข้อที่ 1: อัตราการเรียนรู้ปรับเปลี่ยนได้เอง
นี่คือส่วนที่สง่างาม คำนวณว่าค่าเฉลี่ยขยับไปเท่าใดต่อการตอบหนึ่งข้อ หากเขียน N = a + b แทนหลักฐานก่อนตอบ และ N′ = ρN + 1 แทนหลักฐานหลังตอบทันที พีชคณิตเพียงไม่กี่บรรทัดจะรวบยอดเหลือเป็น:
นี่คือ EMA อย่างแท้จริง — แต่ขนาดก้าว (step size) ของมันคือ 1/N′ ซึ่ง ไม่ได้คงที่ เมื่อ N มีขนาดเล็ก (คุณเพิ่งเริ่มต้น) N′ ก็จะมีขนาดเล็กเช่นกัน — ประมาณ 7 ในคำตอบข้อแรกสุดของคุณ ดังนั้นขนาดก้าวจะอยู่ที่ประมาณ 1/7 ≈ 0.15 ทำให้ค่าประเมินขยับอย่างรวดเร็วเพื่อใช้ข้อมูลที่มีอยู่อย่างกระตือรือร้น เมื่อ N ไต่ระดับขึ้นสู่เพดาน N′ จะคงที่อยู่ที่ 40 ขนาดก้าวจะปรับเข้าสู่ 1/40 = 0.025 และค่าประเมินจะสงบและมั่นคง กล่าวอีกนัยหนึ่งคือ:
พารามิเตอร์หลังแบบเบต้าสลายตัว (decayed Beta posterior) คือ ค่าเฉลี่ยเคลื่อนที่แบบถ่วงน้ำหนักด้วยเลขชี้กำลัง — เพียงแต่เป็นรูปแบบที่อัตราการเรียนรู้เริ่มต้นสูงและลดระดับลงสู่ค่าต่ำได้เองด้วยตัวเอง อีกทั้งยังพกพาตัวนับหลักฐานติดตัวไปด้วย มันจึงรู้เสมอว่าควรมีความมั่นใจมากน้อยเพียงใด
EMA แบบค่าคงที่ก็เป็นเพียงกรณีพิเศษที่คุณเขวี้ยงความสามารถในการปรับตัวนั้นทิ้งไป
ประโยชน์ข้อที่ 2: สัญญาณรบกวนลดลงครึ่งหนึ่ง และลู่เข้าสู่ความเป็นจริง
เนื่องจากอัตราการเรียนรู้ที่เสถียรแล้ว (≈ 0.025) มีขนาดเล็กกว่าค่าคงที่แบบเดิม α = 0.1 อย่างมาก การแกว่งในระยะยาวจึงลดลงประมาณครึ่งหนึ่งในแง่ส่วนเบี่ยงเบนมาตรฐาน — หรือลดลงเหลือประมาณหนึ่งในสี่ในแง่ความแปรปรวน ค่าประเมินหยุดแกว่งตามโชคชะตา ดังนั้นกราฟแนวโน้มและตัวเลข "คะแนนที่เพิ่มขึ้นในเซสชันนี้" จึงสะท้อนถึงการเปลี่ยนแปลงที่แท้จริงแทนที่จะเป็นสัญญาณรบกวน ถึงกระนั้น ด้วยการสลายตัว มันจึงไม่เคยหยุดนิ่งอย่างถาวร: การพัฒนาที่แท้จริงยังคงแสดงผลออกมา เพียงแต่ปราศจากความแม่นยำจอมปลอม
ข้อยืนยันอีก 2 ประการว่า "หลักฐานไม่ได้มีน้ำหนักเท่ากันทั้งหมด"
กลไกเดียวกันนี้ยังสามารถรองรับการปรับแต่งปลีกย่อยเพิ่มเติมอีกสองสามประการที่ EMA แบบธรรมดาไม่สามารถถ่ายทอดได้เลย เพราะมันไม่มีพื้นที่ให้ใส่ข้อมูลเหล่านี้
การเก่าเก็บตามเวลาปฏิทิน
ความทรงจำที่มีขอบเขตจะนับ จำนวนคำตอบ แต่การหยุดเว้นช่วงไปนาน 2 เดือนก็ควรจะทำให้ความเชื่อมั่นลดลงด้วย แม้ว่าคุณจะไม่ได้ตอบอะไรเลยในช่วงนั้นก็ตาม ดังนั้น เมื่อ Part ใดนิ่งสงบเกินระยะเวลาผ่อนผัน 1 สัปดาห์ เราจะลดนับเสมือนลงเล็กน้อยสำหรับทุกๆ วันที่ไม่ได้ใช้งาน (ตัวคูณ 0.99 ต่อวัน) ที่สำคัญคือ เราลดขนาดทั้ง a และ b ด้วยตัวคูณเดียวกัน — ซึ่งทำให้ค่าเฉลี่ย a/(a+b) ไม่เปลี่ยนแปลง แต่จะลดผลรวม N ลง ผลลัพธ์คือ: คะแนนที่แสดงของคุณจะไม่ขยับ แต่ช่วง ± จะกว้างขึ้น และคำตอบแรกๆ เมื่อคุณกลับมาทำจะได้รับน้ำหนักมากขึ้น "เรายังไม่ลืมว่าคุณเคยทำได้เท่าใด แต่เรามั่นใจน้อยลงว่าคุณยังทำได้เท่าเดิมอยู่หรือไม่" — สื่อความหมายทั้งหมดนี้ได้ด้วยการคูณเพียงครั้งเดียว
การถ่วงน้ำหนักคำตอบแต่ละข้อ
คำตอบทุกข้อไม่ได้ให้ข้อมูลในปริมาณเท่ากัน ดังนั้นเราจึงให้คำตอบแต่ละข้อถูกนำมารวมด้วย น้ำหนัก w (การอัปเดตกลายเป็น a ← ρa + w·x, b ← ρb + w·(1−x)):
- คำถามที่คุณเคยเห็นมาแล้ว จะถูกนับเพียงครึ่งน้ำหนัก การทำข้อสอบซ้ำถูก พึ่งพาความจำบางส่วนแทนที่จะเป็นความสามารถ ดังนั้นจึงไม่ควรขยับค่าประเมินมากเท่ากับข้อสอบใหม่ นอกจากนี้ยังช่วยขจัดอคติแนบเนียน: เมื่อคุณทำข้อสอบในหมวดนั้นจนหมด ระบบฝึกฝนจะเริ่มวนส่งข้อสอบที่คุณเคยตอบผิดกลับมา ซึ่งหากไม่มีการถ่วงน้ำหนัก มันจะฉุดค่าประเมินของคุณลงอย่างไม่เป็นธรรม
- แหล่งที่มาของข้อสอบมีความสำคัญ. คำตอบภายใต้สภาวะการสอบจริง (การสอบจำลองแบบจับเวลาเต็มรูปแบบ) มีค่ามากกว่าการฝึกซ้อมทั่วไป ดังนั้นจึงถูกรวมเข้ามาด้วยน้ำหนักที่สูงกว่า (สูงสุดถึงสองเท่า) ด้วยเพดานความทรงจำประมาณ ~40 ข้อ การสอบจำลองที่เสร็จสมบูรณ์จึงเข้ามามีอิทธิพลหลักเหนือหลักฐานล่าสุดของ Part นั้นอย่างแท้จริง แทนที่จะถูกลบล้างไปในวันถัดไป
- คะแนนจริงที่เคยรายงาน (หากคุณกรอกข้อมูลไว้) จะถูกสร้างเป็นความเชื่อก่อนหน้าที่แข็งแกร่ง — ซึ่งมีความเชื่อมั่นเทียบเท่าคำตอบประมาณ 25 ข้อที่ระดับความแม่นยำนั้น — ดังนั้นคำตอบจากแบบฝึกหัดเพียงข้อเดียวในภายหลังจึงไม่สามารถลบล้างมันได้ แต่การฝึกซ้อมอีกหลายสิบข้อจะค่อยๆ ปรับเปลี่ยนมันได้ในที่สุด
สิ่งเหล่านี้ไม่จำเป็นต้องสร้างสถาปัตยกรรมใหม่เลย ทุกอย่างเป็นเพียงแค่น้ำหนัก w และตัวนับ 2 ตัว ความยืดหยุ่นนั้นเป็นผลโดยตรงจากการเลือกโมเดลที่มีแนวคิดชัดเจนเกี่ยวกับ "ปริมาณหลักฐาน" แทนที่จะใช้ตัวเลขที่ทึบแสงเพียงตัวเดียว
จากความเชื่อแยกตาม Part สู่คะแนนเต็ม 990
หมวดหมู่คำถามทั้ง 10 หมวดต่างมีพารามิเตอร์หลังแบบเบต้าสลายตัว (decayed Beta posterior) เป็นของตัวเอง การแปลงค่าเหล่านั้นเป็นคะแนนของแต่ละส่วน (Listening/Reading) ทำได้โดยถ่วงน้ำหนักค่าเฉลี่ยของแต่ละหมวดหมู่ตาม จำนวนข้อของคำถามประเภทนั้นที่ปรากฏในข้อสอบจริง (ผลรวมนับเป็น 100 ข้อต่อส่วน) ซึ่งจะได้จำนวนข้อที่คาดว่าจะตอบถูกจาก 100 ข้อ ตัวเลขนั้นจะถูกนำไปเปรียบเทียบผ่าน ตารางแปลงจำนวนข้อถูกเป็นคะแนนมาตรฐานของ TOEIC อย่างเป็นทางการ เพื่อสร้างคะแนนแต่ละส่วนในช่วง 5–495 คะแนน และคะแนนของทั้ง 2 ส่วนจะนำมารวมกันเป็นค่าประเมินคะแนนเต็ม /990 ของคุณ
ความไม่แน่นอนถูกส่งผ่านไปด้วย เนื่องจากแต่ละหมวดหมู่เป็นอิสระต่อกัน ความแปรปรวนของพวกมันจึง บวกกันแบบกำลังสอง (add in quadrature) (ถ่วงน้ำหนักด้วยกำลังสองของจำนวนข้อสอบแต่ละประเภท) และค่าความคลาดเคลื่อนมาตรฐานรวมจะกลายเป็นแถบช่วง ± บนคะแนนส่วนนั้นๆ และคะแนนรวมของคุณ
การตรวจสอบความเป็นจริงเฉพาะสำหรับพาร์ท Reading
TOEIC Reading เป็นการสอบที่แข่งกับเวลา: 100 ข้อใน 75 นาที — เฉลี่ยข้อละ 45 วินาที โดยไม่สามารถซื้อเวลาเพิ่มได้ ความแม่นยำที่วัดจากการฝึกซ้อมแบบไม่จับเวลาจึงประเมินผู้อ่านช้าสูงเกินจริง เพราะในการสอบจริงพวกเขาสอบไม่ทันไปจนถึงข้อท้ายๆ และ ข้อสอบที่ทำไม่ทันจะมีคะแนนเหมือนการเดาสุ่ม — คือ 25% หรือ 1 ใน 4 โอกาส — ไม่ใช่ความแม่นยำจากการฝึกซ้อมของคุณ
ดังนั้น แอปจึงทำการจำลองแบบง่ายๆ โดยใช้ความเร็วต่อข้อที่วัดได้สำหรับแต่ละ Part ของ Reading แอปจะ "ใช้จ่าย" งบประมาณเวลา 75 นาทีของคุณตามลำดับข้อสอบ — Part 5 ตามด้วย 6 และ 7 — จนกว่าเวลาจะหมด และให้คะแนนคำถามทุกข้อที่คุณ ทำไม่ทัน ที่ 0.25 แทนที่จะเป็นความแม่นยำที่แท้จริงของคุณ
ตัวอย่างที่เป็นรูปธรรม สมมติว่าคุณอ่านด้วยความเร็ว 30 วินาที/ข้อ ใน Part 5, 45 วินาที ใน Part 6 และ 80 วินาที ใน Part 7 สำหรับ Part 5 และ 6 (30 + 16 ข้อ) จะใช้เวลา 30×30 + 16×45 = 1,620 วินาที เหลือเวลา 2,880 วินาทีสำหรับ Part 7 ที่ความเร็ว 80 วินาทีต่อข้อ คุณจะทำเสร็จเพียง 2,880 / 80 ≈ 36 ข้อ จากทั้งหมด 54 ข้อใน Part 7 — ส่วนอีก 18 ข้อทำไม่ทัน หากความแม่นยำใน Part 7 ของคุณอยู่ที่ 70% คำถาม 18 ข้อนั้นจะดรอปลงจาก 0.70 เหลือ 0.25 ทำให้สูญเสียคะแนนดิบไปประมาณ 0.45 × 18 ≈ 8 คะแนน — หรือคิดเป็นคะแนน Reading ที่ลดลงประมาณ 30–40 คะแนน หากคุณอ่านเร็วขึ้น คุณจะทำข้อสอบได้ทันมากขึ้นตามความแม่นยำจริง โทษการตัดคะแนนก็จะลดลง และเมื่อถึงความเร็วที่ผ่อนคลาย โทษนี้จะหายไปโดยสิ้นเชิง
เมื่อความเร็วของคุณอาจทำให้เสียคะแนนเช่นนี้ แอปจะแสดงตัวเลข "สปีดสอบจริง (at exam pace)" ไว้อย่างชัดเจน — เพื่อเตือนความจำว่าการอ่านเป็นเรื่องของความเร็ว ไม่ใช่แค่ความถูกต้อง ( Listening กำหนดจังหวะด้วยเสียงเทป จึงไม่ต้องปรับแต่งในส่วนนี้)
เหตุใดวิธีนี้จึงเหนือกว่าทางเลือกอื่น
เราได้พิจารณาทางเลือกทั่วไปแล้ว และนี่คือการเปรียบเทียบอย่างตรงไปตรงมา
| วิธีการ | สิ่งที่ได้รับ | เหตุใดเราจึงไม่หยุดอยู่แค่นั้น |
|---|---|---|
| ค่าเฉลี่ยสะสมแบบธรรมดา | ไม่เอนเอียง, เรียบง่าย | ไม่เคยลืม; ติดตามการพัฒนาไม่ได้; ปฏิบัติกับทุกคำตอบเหมือนกันหมด |
| EMA แบบ α คงที่ | มีความทรงจำจำกัด, คำนวณถูก | อัตราการเรียนรู้คงที่; แกว่งตลอดเวลา; ไม่มีความไม่แน่นอน; ไม่มีที่ให้ใส่น้ำหนัก |
| พารามิเตอร์หลังแบบเบต้าสลายตัว (ของเรา) | อัตราปรับเปลี่ยนได้, มีความทรงจำจำกัด, มีความเชื่อมั่นในตัว, ถ่วงน้ำหนักได้ตามธรรมชาติ | — |
| ทฤษฎีการตอบสนองข้อสอบ (Item-Response Theory (IRT)) | โมเดลวัดความสามารถระดับ "มาตรฐานทองคำ" | ต้องใช้ความยากของข้อสอบแต่ละข้อที่ ปรับเทียบจากผู้เข้าสอบหลายพันคน — ข้อมูลที่เราไม่มีบนอุปกรณ์ |
| ระบบจัดอันดับ Elo / Glicko | สง่างาม, ปรับตัวได้ | ต้องใช้ความยากแบบ "คู่ต่อสู้" ของแต่ละข้อสอบที่เราไม่สามารถวางใจได้; การบันทึกความไม่แน่นอนของมันซ้ำซ้อนกับสิ่งที่การสลายตัวของเรามีให้อยู่แล้ว |
| ตัวกรองคัลมาน (Kalman filter) | ติดตามปริมาณที่เปลี่ยนแปลงพร้อมความไม่แน่นอน | สำหรับข้อมูลแบบใช่/ไม่ใช่ วิธีนี้จะลดรูปเหลือคล้ายโมเดลของเรา แต่มีฟังก์ชันความน่าจะเป็น (likelihood) ที่อุ้ยอ้ายกว่า รูปแบบเบต้าจึงเหมาะสมตามธรรมชาติ |
จุดตัดสินใจที่สำคัญคือสิ่งนี้ โมเดลที่ "ซับซ้อนกว่า" สองโมเดล — ทฤษฎีการตอบสนองข้อสอบ (Item-Response Theory (IRT)) และ Elo — ทุ่มเทประสิทธิภาพทั้งหมดไปที่ พารามิเตอร์ความยากของคำถามแต่ละข้อ และการประเมินค่าเหล่านั้นอย่างน่าเชื่อถือต้องใช้กลุ่มผู้เข้าสอบขนาดใหญ่ที่ตอบคำถามชุดเดียวกัน แต่ พิชิต 990 ทำงานอย่างเป็นส่วนตัวบนอุปกรณ์ของคุณ โดยไม่มีสถิติระดับภาพรวมของผู้ใช้ทุกคน หากป้อนป้ายกำกับความยากที่ยังไม่ได้ปรับเทียบซึ่งเรา มี อยู่ให้กับโมเดลเหล่านั้น พวกมันก็จะเป็นเพียงเครื่องจักรซับซ้อนที่วางอยู่บนฐานข้อมูลที่ไม่มั่นคง
ในขณะเดียวกัน ปัญหาทุกประการที่ผู้ใช้สัมผัสได้จริง — การแกว่งของตัวเลข, การไม่ลืมข้อมูลเก่า, ช่วงความเชื่อมั่นที่ขาดหายไป, การปฏิบัติต่อแบบทดสอบจำลองกับการวอร์มอัปเหมือนกัน — ทั้งหมดนี้อยู่ใน กฎการอัปเดต (update rule) ไม่ใช่ความยากของคำถาม พารามิเตอร์หลังแบบเบต้าสลายตัว (decayed Beta posterior) เป็นโมเดลที่กะทัดรัดที่สุดและมีหลักการที่สุด ซึ่งแก้ไขปัญหาเหล่านั้นทั้งหมดได้ในคราวเดียว:
- มันเป็นแบบ เบย์เซียน (Bayesian) อย่างแท้จริง ดังนั้นค่าประเมินและความไม่แน่นอนของมันจึงมาจากกฎที่สะอาดสะอ้านเดียวกัน แทนที่จะถูกต่อเติมเข้ามาภายหลัง
- มันเป็น EMA แบบปรับเกนได้ (adaptive-gain EMA) ดังนั้นจึงเริ่มต้นอย่างรวดเร็ว ปรับตัวลงสู่ความสงบ และไม่เคยหยุดนิ่งค้าง
- มันเป็น สังยุค (conjugate) การอัปเดตแต่ละครั้งจึงใช้เพียงการบวกและการคูณไม่กี่ครั้ง — รวดเร็ว แม่นยำ และทำงานแบบออฟไลน์ได้
- มันมี นับหลักฐาน ที่ชัดเจน ดังนั้นการถ่วงน้ำหนักตามความใหม่ การซ้ำ และแหล่งที่มา จึงคลี่คลายออกมาได้อย่างเป็นธรรมชาติ
สรุปสั้นๆ ก็คือ มันเป็นปริมาณสถิติที่เหมาะสมที่สุดสำหรับข้อมูลที่เรามีอยู่อย่างตรงไปตรงมา
ข้อพิจารณาอย่างตรงไปตรงมา
- มันคือเครื่องมือช่วยเรียน ไม่ใช่คะแนนอย่างเป็นทางการ. TOEIC จริงใช้การปรับสเกลแบบ IRT กับข้อสอบที่ปลอดภัย เราทำได้เพียงประมาณค่าจากการฝึกซ้อมของคุณเท่านั้น
- ค่าคงที่ต่างๆ มาจากเหตุผล ไม่ใช่การฟิตข้อมูล. เพดานความทรงจำ (~40 ข้อ), ความแข็งแกร่งของ prior, อัตราการสลายตัว และน้ำหนักของคำตอบ เป็นค่าเริ่มต้นที่สมเหตุสมผล ไม่ใช่ค่าที่ปรับแต่งกับชุดข้อมูลปรับเทียบขนาดใหญ่ เมื่อคุณกรอกคะแนนจริงที่ได้รับ เราจะบันทึกช่องว่างระหว่างค่าประเมินของเรากับความจริงนั้น (อย่างเป็นส่วนตัว) เพื่อให้นำตัวเลขเหล่านี้ไปปรับปรุงให้แม่นยำยิ่งขึ้นตามเวลา
- ข้อมูลน้อยก็คือข้อมูลน้อย. ในช่วงแรก Part ส่วนใหญ่ยังคงอยู่ที่ 50% ของ prior ดังนั้นการประเมินในช่วงแรกจึงคร่าวๆ — ซึ่งเป็นเหตุผลที่แอปแสดงช่วง ± ที่กว้าง จนกว่าคุณจะป้อนข้อมูลให้มันทำงานได้มากขึ้น
เราไม่ได้ครอบคลุมทุกอย่าง — และเรารู้ดี. ปัจจัยข้างต้นคือปัจจัยที่เราสามารถสร้างโมเดลได้จากสิ่งที่การฝึกซ้อมของคุณบอกเรา: ความใหม่, การซ้ำ, การถ่วงน้ำหนักสภาวะการสอบ, ความเร็วในการอ่าน แต่การสอบจริงยังขึ้นอยู่กับสิ่งที่มองไม่เห็นจากตรงนี้ — ความตื่นเต้นและความเหนื่อยล้าในวันสอบ, ชุดข้อสอบเฉพาะที่คุณได้รับ, สำนวนภาษาที่ไม่คุ้นเคย, ความยากของคลังข้อสอบของเราตรงกับข้อสอบจริงเพียงใด และโชคชะตาในการเดาข้อสอบในวันนั้น เป็นต้น เราได้ถ่วงน้ำหนักปัจจัยหลายประการแล้ว แต่ไม่ใช่ทั้งหมดอย่างแน่นอน ดังนั้นค่าประเมินจึงไม่มีทางแม่นยำแบบสมบูรณ์และไม่ได้ถูกออกแบบมาให้เป็นเช่นนั้น หากคุณไปสอบ TOEIC จริงแล้วผลลัพธ์ทำให้คุณประหลาดใจ — สูงกว่าหรือต่ำกว่าที่เราแสดง — เราอยากฟังจากคุณผ่านช่องทางเสนอความคิดเห็นในแอป การบอกเราว่าคุณคิดว่าอะไรทำให้คะแนนเปลี่ยนไปจะช่วยให้เราพบปัจจัยที่มองข้ามและปรับปรุงการประเมินให้แหลมคมยิ่งขึ้นสำหรับทุกคน
คำสัญญาเวอร์ชันที่ตรงไปตรงมาที่สุดคือ: ตอบคำถามให้มากขึ้น ใน Part ที่หลากหลายขึ้น ภายใต้สภาวะที่สมจริงยิ่งขึ้น แล้วค่าประเมินจะทั้ง ขยับเข้าหาความจริง และ บอกคุณว่ามันมีความมั่นใจมากขึ้น นั่นคือพฤติกรรมที่ตัวประเมินเบย์เซียนแบบสลายตัว (decayed Bayesian estimator) ถูกสร้างมาเพื่อส่งมอบ
ภาคต่อมาแล้ว: เมื่อใบคะแนนจริงมาถึง ตัวประเมินนี้นำมันไปใช้อย่างไร — และ ABILITIES MEASURED ที่คนส่วนใหญ่มองข้ามทำอะไรได้บ้าง? อ่านได้ที่ ใบคะแนน TOEIC มีมากกว่าคะแนน