บทความทั้งหมด · เผยแพร่เมื่อ 2026-08-04
ความยากของ Part 6 อยู่ที่ "คุณจำเป็นต้องใช้บทอ่านนั้นจริง ๆ หรือไม่" — การวัดผลด้วยการบังบทอ่าน
คำอธิบายทางเทคนิคสำหรับผู้ที่สนใจใคร่รู้ ซีรีส์ว่าด้วยความยากมีบทความหนึ่งชิ้นต่อหนึ่ง Part เผยแพร่ตามลำดับ นี่คือชิ้นที่หก ความยากของ Part 5 กระจุกอยู่ที่การเรียงสี่ตัวเลือก ความยากของ Part 7 กระจายอยู่ทั่วทั้งบทอ่าน Part 6 อยู่ตรงกลางระหว่างสองส่วนนี้ และความยากของมันมาจากจุดที่มองข้ามได้ง่ายมาก: <strong>ช่องว่างนี้ จำเป็นต้องให้คุณอ่านบทอ่านนั้นจริง ๆ หรือไม่?</strong> บทความนี้จะอธิบายว่าเราเปลี่ยนคำถามนี้ให้กลายเป็นตัวเลขที่วัดได้อย่างไร เราใช้วิธีใดเพื่อให้การวัดนี้ไม่ได้เป็นเพียง "ความรู้สึกของใครคนหนึ่ง" ผลการวัดที่ออกมาเป็นอย่างไร (ผลการวัดครั้งแรกออกมาดูไม่ดีเลยสำหรับเราเอง และเราได้ปรับแก้คลังข้อสอบไปหนึ่งรอบใหญ่ตามผลนั้น) รวมถึงส่วนที่มีประโยชน์กับคุณที่สุด — เมื่อรู้ว่า Part 6 มีช่องว่างสองประเภทที่แตกต่างกันโดยสิ้นเชิงแล้ว คุณควรจัดสรรเวลาอย่างไรในห้องสอบ ไม่ต้องมีพื้นฐานสถิติใด ๆ
Part 6 ควรจะทดสอบอะไร
Part 6 คือข้อสอบการอ่านข้อ 131 ถึง 146: บทอ่านสั้น 4 บท แต่ละบทเว้นช่องว่างไว้ 4 ช่อง แต่ละช่องมี 4 ตัวเลือก
เมื่อมองจากภายนอก มันดูคล้ายกับ "การจับ Part 5 ไปยัดไว้ในบทอ่าน" แต่ความจริงมันไม่ควรเป็นเช่นนั้น Part 5 ให้ประโยคที่โดดเดี่ยวแก่คุณ ดังนั้นคำตอบจึงต้องหาจากประโยคนั้นเพียงอย่างเดียว แต่ Part 6 ให้บทอ่านทั้งบทแก่คุณ — ซึ่งหมายความว่าคำตอบ "สามารถ" ซ่อนอยู่ในประโยคอื่นได้
นั่นคือเหตุผลที่ Part 6 มีอยู่ หากทุกช่องว่างสามารถแก้ได้ด้วยประโยคของตัวมันเอง บทอ่านนั้นก็เป็นเพียงของประดับ และ Part นี้ก็ไม่มีความจำเป็นต้องแยกออกมาต่างหาก
การทดสอบง่าย ๆ: บังบทอ่านไว้
การจะตัดสินว่าช่องว่างช่องหนึ่งกำลังทดสอบ "บทอ่าน" จริง ๆ หรือไม่ มีวิธียอดเยี่ยมและตรงไปตรงมาวิธีหนึ่ง:
ปิดบังบทอ่านทั้งบทไว้ เหลือไว้เพียงประโยคที่มีช่องว่างและสี่ตัวเลือก จากนั้นถามว่า: ตอนนี้ยังมีอีกกี่ตัวเลือกที่ฟังดูสมเหตุสมผล?
หากเหลือเพียงตัวเลือกเดียวที่ฟังดูสมเหตุสมผล ช่องว่างนี้ก็ไม่จำเป็นต้องใช้บทอ่านเลย — มันคือข้อสอบ Part 5 ที่แอบซ่อนอยู่ในบทอ่าน
หากยังมีตั้งแต่สองตัวเลือกขึ้นไปที่ฟังดูสมเหตุสมผล นั่นหมายความว่า: มีเพียงบทอ่านเท่านั้นที่จะตัดสินคำตอบได้ ช่องว่างนี้จึงเป็นการทดสอบ Part 6 อย่างแท้จริง
เราเรียกช่องว่างที่เข้าข่ายกรณีหลังนี้ว่า "ช่องว่างที่พึ่งพาบริบท" ตัวเลขทั้งหมดที่จะกล่าวถึงต่อไปในบทความนี้ ล้วนเป็นการนับสิ่งนี้
ลองดูตัวอย่างจริงสามข้อ
ตัวอย่างที่ 1: บังไว้ก็ไม่มีผล
Before entering, all staff must put on a full protective suit, gloves, and a face mask in the ------- room. (A) checking (B) changing (C) charging (D) chilling
ไม่ต้องดูบทอ่าน สถานที่สำหรับสวมชุดป้องกัน ถุงมือ และหน้ากากอนามัย คือ changing room (ห้องเปลี่ยนเสื้อผ้า) อีกสามตัวเลือกที่เหลือไม่ว่าบริบทแวดล้อมจะเขียนว่าอย่างไรก็ไม่มีทางถูกต้อง ข้อนี้แม้จะลบบทอ่านออกไปทั้งบท ความยากก็ไม่เปลี่ยนเลยแม้แต่น้อย
ตัวอย่างที่ 2: บังไว้ก็ตอบไม่ได้
Bring your friends. ------- groups of six or more should book ahead. (A) Because of this, (B) That said, (C) For that reason, (D) In the meantime,
ทั้งสี่ตัวเลือกล้วนเป็นคำขึ้นต้นประโยคที่ถูกต้องตามหลักไวยากรณ์และมีความหมายราบรื่น หากมองแค่ประโยคนี้ประโยคเดียว คุณไม่มีเหตุผลใดเลยที่จะเลือก B แทนที่จะเป็น A
มีเพียงประโยคก่อนหน้าอย่าง "Bring your friends." (ชวนเพื่อนของคุณมาด้วยกัน) เท่านั้นที่ทำให้คุณรู้ว่า ประโยคหลังกำลังหักมุมหรือมีเงื่อนไขเพิ่มเติม — ยินดีให้มาเป็นกลุ่ม แต่กลุ่มตั้งแต่หกคนขึ้นไปต้องจองล่วงหน้า คำว่า "อย่างไรก็ตาม / แต่ถึงอย่างนั้น" ก็คือ That said
สำหรับข้อนี้ บทอ่านคือเงื่อนไขจำเป็นในการแก้โจทย์
ตัวอย่างที่ 3: บังไว้กระทั่งกำลังพูดถึงเรื่องอะไรยังไม่รู้เลย
Even stubborn ------- don't stand a chance against our gentle, modern process. (A) sprains (B) strains (C) stains (D) streams
หากดูประโยคนี้แยกต่างหาก คุณไม่สามารถตัดสินได้ด้วยซ้ำว่านี่คือโฆษณาร้านซักอบรีดหรือโฆษณาคลินิกกายภาพบำบัด คำว่า sprains (อาการข้อเคล็ด) และ stains (คราบสกปรก) ฟังดูราบรื่นเท่ากันในประโยคนี้
มีเพียงบทอ่านเท่านั้นที่บอกคุณได้ว่านี่กำลังพูดถึงเรื่องอะไร นี่คือรูปแบบขั้นสุดของการพึ่งพาบริบท
ทำอย่างไรให้คำว่า "ฟังดูสมเหตุสมผล" กลายเป็นตัวเลขที่น่าเชื่อถือ
ถึงตรงนี้ ทุกอย่างยังเป็นเพียง "ฉันรู้สึกว่า" และ "ฉันรู้สึกว่า" ไม่ใช่การวัดผล
จิตมิติมีนิยามความยากไว้อย่างเป็นทางการ: ความยากของข้อสอบข้อหนึ่ง คือสัดส่วนของผู้สอบจริงที่ตอบข้อนั้นถูก นั่นต้องอาศัยผู้สอบเป็นแสนเป็นพันคนทำมาก่อน ซึ่งนอกจาก ETS แล้วไม่มีใครมีข้อมูลชุดนี้ คำอธิบายโดยสมบูรณ์อยู่ในบทความ 〈ภาพรวมความยาก〉 สิ่งที่จะรับมือในบทความนี้คือปัญหาที่เล็กลงมา แต่รับมือยากกว่า: เรื่องที่ว่า "บังไว้แล้วเหลืออีกกี่ตัวเลือกที่ฟังดูสมเหตุสมผล" จะทำอย่างไรไม่ให้กลายเป็นการตัดสินเชิงอัตวิสัยของคนคนเดียว?
เราทำสิ่งนี้สามประการ
1. ตัดข้อสอบให้เหลือ "เพียงประโยคนั้น" ก่อน
ใช้โปรแกรมตัดประโยคที่มีช่องว่างของแต่ละข้อออกมาเดี่ยว ๆ ส่วนช่องว่างอื่นในบทอ่านเดียวกันจะถูกเติมด้วยคำตอบที่ถูกต้องโดยตรง (เพื่อให้ประโยคสมบูรณ์) ช่องว่างทั้งหมด 490 ช่องถูกตัดออกมาได้สำเร็จ
ขั้นตอนนี้ได้คัดข้อสอบออกไปกลุ่มหนึ่งแล้ว: โจทย์ประเภท "แทรกประโยค" ทั้งประโยค (ประเภทที่ตัวเลือกเป็นประโยคสมบูรณ์ 4 ประโยค) โจทย์ประเภทนั้นโดยนิยามแล้วต้องพึ่งพาบริบทอย่างแน่นอน การนับรวมมันเข้ามามีแต่จะทำให้ตัวเลขสูงเกินจริง และสัดส่วนประโยคแทรกของเราก็สอดคล้องกับการจัดวางของข้อสอบจริงอยู่แล้ว — คือ 1 ข้อในทุก ๆ 4 ข้อ ดังนั้นสิ่งที่วัดตรงนี้จึงเป็นช่องว่างอีก 3 ช่องที่เหลือ
2. ส่งให้ผู้ประเมินสองรายที่ไม่เห็นผลของกันและกัน
เราส่ง "เหลือเพียงประโยคเดียว + 4 ตัวเลือก" ให้แก่ผู้ประเมิน AI สองรายที่เป็นอิสระต่อกัน ทั้งสองฝ่ายได้รับเกณฑ์การประเมินลายลักษณ์อักษรที่เหมือนกันทุกประการ และไม่ได้บอกพวกมันว่าคำตอบที่ถูกต้องคือข้อใด (การรู้คำตอบจะส่งผลกระทบอย่างรุนแรงต่อการตัดสิน) พวกมันต้องตอบเพียงเรื่องเดียว: ในสี่ตัวเลือกนี้ มีกี่ข้อที่ดูแยกเดี่ยว ๆ แล้วฟังดูสมเหตุสมผล?
การใช้สองรายแทนที่จะเป็นรายเดียว เพราะผู้ประเมินรายเดียวไม่สามารถตรวจสอบได้ การใช้สองรายทำให้คำนวณได้ว่าพวกมันเห็นพ้องตรงกันบ่อยแค่ไหน:
| อัตราความเห็นตรงกัน | Cohen's κ | |
|---|---|---|
| คลังข้อสอบของเรา (490 ข้อ) | 80.4% | 0.51 |
| ข้อสอบอ้างอิง (72 ข้อ) | 90.3% | 0.81 |
κ (kappa) คือระดับความเห็นตรงกันที่เหลืออยู่หลังจากหัก "การสุ่มเดาแล้วเผอิญตรงกัน" ออกไปแล้ว ทางฝั่งข้อสอบอ้างอิง 0.81 ถือว่าสูงมาก ทางฝั่งเราเอง 0.51 ถือว่าอยู่ในระดับปานกลาง — นี่แสดงว่าในข้อสอบของเรามีกรณีคาบเกี่ยวที่ก้ำกึ่งอยู่ค่อนข้างมาก ซึ่งตัวมันเองก็เป็นข้อมูลที่มีความหมาย
3. นับเฉพาะข้อที่ทั้งสองฝ่ายเห็นตรงกัน
จุดที่ผู้ประเมินสองรายไม่เห็นตรงกัน เราลงมือตรวจด้วยตัวเอง เมื่อสุ่มมา 16 ข้อแล้วพิจารณาเป็นรายข้อ พบว่า: ผู้ประเมินรายหนึ่งมีแนวโน้มหลวมเกินไปอย่างเห็นได้ชัด โดยจะนับข้อที่ "ความจริงมีแค่คำตอบเดียวที่ฟังดูสมเหตุสมผล" รวมเข้าไปด้วย (เช่น ข้อห้องเปลี่ยนเสื้อผ้าด้านบน มันคิดว่ามีสองตัวเลือกที่ใช้ได้) และระดับความหลวมของมันทั้งสองฝั่งไม่เท่ากัน — ในข้อสอบของเรามันประเมินเกินไป 18% ส่วนในข้อสอบอ้างอิงประเมินเกินไปเพียง 10%
นี่เป็นเรื่องสำคัญมาก: หากใช้การตัดสินของมันเพียงอย่างเดียว จะเป็นการแต่งตัวเลขให้ฝั่งใดฝั่งหนึ่งดูดีขึ้นอย่างไม่ยุติธรรม ดังนั้นตัวเลขสุดท้ายจึงนับเฉพาะข้อที่ผู้ประเมินทั้งสองรายเห็นตรงกันเท่านั้น
(เราได้คำนวณเวอร์ชันแบบผ่อนปรนด้วย — ขอเพียงมีผู้ประเมินคนใดคนหนึ่งบอกว่าใช่ก็นับ ผลสรุปออกมาเหมือนกันทุกประการ ดังที่จะกล่าวต่อไป)
ผลลัพธ์จากการวัด
ในการวัดครั้งแรก ผลลัพธ์ที่ได้ดูไม่ดีอย่างยิ่งสำหรับพวกเราเอง:
| ช่องว่างที่พึ่งพาบริบท | 95% ช่วงความเชื่อมั่น | |
|---|---|---|
| คลังข้อสอบของเรา (การวัดครั้งแรก) | 82 / 490 = 16.7% | 13.7%–20.3% |
| ข้อสอบจำลองอ้างอิง | 35 / 72 = 48.6% | 37.4%–59.9% |
ข้อสอบอ้างอิงประมาณทุก ๆ สองช่องว่างจะมีหนึ่งช่องที่จำเป็นต้องใช้บทอ่านจริง ๆ ส่วนของเราประมาณทุก ๆ หกช่องจะมีเพียงหนึ่งช่อง
ช่วงความเชื่อมั่นทั้งสองไม่ซ้อนทับกัน (ขอบบนของเราคือ 20.3% ขอบล่างของเขาคือ 37.4%) ดังนั้นนี่ไม่ใช่ความแตกต่างที่อธิบายได้ด้วยความคลาดเคลื่อนจากการสุ่มตัวอย่าง เมื่อคำนวณใหม่ด้วยเวอร์ชันผ่อนปรน ของเราอยู่ที่ 36.3% ของเขาอยู่ที่ 58.3% ซึ่งไม่ซ้อนทับกันเช่นกัน — การเปลี่ยนวิธีคำนวณไม่ได้เปลี่ยนผลสรุป
หลักฐานสนับสนุนประการหนึ่ง: ช่องว่างที่เราตั้งใจปรับแก้ให้พึ่งพาบริบท ผู้ประเมินทั้งสองรายสามารถชี้ออกมารวมกันได้ทั้งหมดโดยที่ไม่รู้ข้อมูลล่วงหน้า หากไม้บรรทัดอันหนึ่งไม่สามารถวัดสิ่งที่ตัวเองสร้างขึ้นมาได้ สิ่งที่มันวัดได้ก็ไม่อาจเชื่อถือได้เลย
จากนั้นเราก็แก้ไขมันจนสำเร็จ
หลังจากวัดผลออกมา เราไม่ได้เก็บตัวเลขนี้ไว้ แต่ปรับแก้ข้อสอบตามผลนั้น วิธีการปรับไม่ใช่ "การสร้างบทอ่านใหม่เพิ่มขึ้นอีกหลายบท" — นั่นไม่มีประโยชน์ เพราะทุกบทอ่านที่เพิ่มขึ้นจะเพิ่มช่องว่างอีกสามช่อง ทำให้ตัวหารโตตามไปด้วย การจะเพิ่มสัดส่วน ทำได้เพียงเปลี่ยนช่องว่างที่มีอยู่เดิมทีละช่องให้จำเป็นต้องใช้บทอ่านจริง ๆ
หลังจากปรับแก้เสร็จแล้วได้วัดผลใหม่อีกครั้ง โดยใช้ไม้บรรทัดอันเดิม ผู้ประเมินสองรายที่ไม่เห็นผลของกันและกันคู่เดิม และนับเฉพาะข้อที่ทั้งสองฝ่ายเห็นตรงกันเช่นเดิม:
| ช่องว่างที่พึ่งพาบริบท | 95% ช่วงความเชื่อมั่น | เฉลี่ยต่อบทอ่าน | |
|---|---|---|---|
| คลังข้อสอบของเรา (การวัดครั้งแรก) | 82 / 490 = 16.7% | 13.7%–20.3% | 0.50 |
| คลังข้อสอบของเรา (ปัจจุบัน) | 239 / 490 = 48.8% | 44.4%–53.2% | 1.46 |
| ข้อสอบจำลองอ้างอิง | 35 / 72 = 48.6% | 37.4%–59.9% | 1.46 |
ค่าประมาณจุดของทั้งสองฝั่งต่างกันเพียง 0.2 จุดเปอร์เซ็นต์ ส่วนความหนาแน่นเฉลี่ยต่อบทอ่านคือเท่ากันเป๊ะที่ 1.46 ช่วงความเชื่อมั่นซ้อนทับกันอย่างมาก
พูดให้ชัดเจนขึ้น: ในเรื่องที่ว่า "ช่องว่างนี้จำเป็นต้องใช้บทอ่านหรือไม่" ตอนนี้ไม่สามารถวัดความแตกต่างระหว่างเรากับข้อสอบอ้างอิงได้อีกต่อไปแล้ว
ตรงนี้ต้องระมัดระวังเป็นอย่างยิ่งที่จะไม่พูดเกินจริง นี่ไม่ได้หมายความว่าข้อสอบของเรา "ยากเท่ากับข้อสอบจริง" — ความยากมีหลากหลายมิติ บทความนี้วัดเพียงมิติเดียวเท่านั้น และก็ไม่ได้หมายความว่าเราดีกว่าอีกฝ่าย: ความแตกต่างระหว่าง 48.8% กับ 48.6% นั้นเล็กน้อยกว่าค่าความคลาดเคลื่อนของการวัดเองเสียอีก ไม่มีฝ่ายใดอ้างว่าชนะได้ สิ่งที่พูดได้มีเพียงประโยคเดียว: ความแตกต่างในมิตินี้ ซึ่งเดิมทีใหญ่พอที่จะมองเห็นได้ด้วยสถิติ ตอนนี้ไม่มีอีกแล้ว
หมายเหตุอย่างตรงไปตรงมา: หลังจากปรับแก้เสร็จ เราได้ย้อนกลับมาตรวจสอบตัวอย่างในบทความนี้ด้วยตัวเอง และพบว่ามี 4 ข้อที่เกิดข้อผิดพลาดระหว่างกระบวนการเรียบเรียงใหม่ — ตัวเลือกถูกเขียนสลับไปอยู่ที่ช่องว่างอื่นในบทอ่านเดียวกัน ส่งผลให้ข้อสอบ 4 ข้อนั้นไม่มีคำตอบที่ถูกต้อง ปัจจุบันได้ทำการแก้ไขเรียบร้อยแล้ว และเราได้เพิ่มระบบตรวจสอบอัตโนมัติเพื่อให้ข้อผิดพลาดประเภทเดียวกันนี้ถูกบล็อกไว้ก่อนเปิดใช้งานจริงในอนาคต การที่เราพบเรื่องนี้ เป็นเพราะเรานำตัวอย่างที่ตีพิมพ์ในบทความนี้ไปกระทบยอดกับคลังข้อสอบจริง
ทำไมถึงกลายเป็นเช่นนี้
ไม่ใช่เพราะมีใครขี้เกียจ แต่เป็นเพราะแนวโน้มตามธรรมชาติของการออกข้อสอบเป็นเช่นนี้เอง
การเขียนช่องว่างที่ "แก้ได้โดยดูแค่ประโยคนั้นประโยคเดียว" ทำได้ง่ายกว่าและปลอดภัยกว่า: คุณมั่นใจได้ว่ามันมีคำตอบเดียว มั่นใจได้ว่าจะไม่มีข้อถกเถียง และมั่นใจได้ว่าถูกต้องตามหลักไวยากรณ์ แต่การเขียนช่องว่างที่ "ต้องดูประโยคก่อนหน้าจึงจะตัดสินได้" คุณต้องควบคุมความสัมพันธ์ของสองประโยคไปพร้อมกัน และยังต้องแน่ใจว่าทั้งสี่ตัวเลือกเมื่อมองแยกเดี่ยว ๆ แล้วล้วนฟังดูสมเหตุสมผล — ไม่เช่นนั้นมันจะลดทอนกลับไปเป็นข้อสอบ Part 5
ดังนั้น หากไม่มีการวัดผลอย่างเป็นพิเศษ คลังข้อสอบใด ๆ ก็ตามจะเบี่ยงเบนไปในทิศทางของ "จับ Part 5 ยัดใส่บทอ่าน" โดยธรรมชาติ และเราเคยเบี่ยงเบนไปเช่นนั้นจริง ๆ ก่อนที่จะบังบทอ่านไว้ เรื่องนี้ไม่สามารถมองออกได้เลย — เพราะเมื่อดูทีละข้อแยกกัน ทุกข้อล้วนเป็นข้อสอบที่ดี
นี่คือเหตุผลที่เรากำหนดให้การวัดผลนี้เป็นระบบคงที่ และรันซ้ำทุกครั้งที่มีการปรับแก้ข้อสอบ: การเบี่ยงเบนจะไม่หยุดเอง มีเพียงการวัดผลเท่านั้นที่จะหยุดมันได้
ส่วนที่มีประโยชน์ที่สุดสำหรับคุณ: ควรทำข้อสอบ Part 6 อย่างไร
เมื่อรู้ว่า Part 6 มีช่องว่างสองประเภทที่แตกต่างกันโดยสิ้นเชิง กลยุทธ์ในห้องสอบก็ชัดเจนอย่างยิ่ง: จำแนกประเภทก่อน แล้วค่อยตัดสินใจว่าจะย้อนกลับไปอ่านหรือไม่
ขั้นที่ 1: ดูตัวเลือก เพื่อตัดสินว่านี่คือช่องว่างประเภทใด
เมื่อเจอโจทย์ข้อหนึ่ง ให้ดูรูปทรงของสี่ตัวเลือกก่อน:
- ทั้งสี่ตัวเลือกเป็นรูปแปรต่าง ๆ ของคำเดียวกัน (apply / applied / applying / application) → เกือบจะเป็นช่องว่างประโยคเดียวอย่างแน่นอน ดูแค่หน้าและหลังช่องว่างก็พอ ไม่ต้องย้อนกลับไปอ่านบทอ่าน
- ทั้งสี่ตัวเลือกเป็นคำที่มีความหมายเฉพาะที่ไม่เกี่ยวข้องกัน (คำนาม คำกริยา คำคุณศัพท์) → มักจะเป็นช่องว่างประโยคเดียว แต่ต้องระวังกรณีแบบตัวอย่างที่ 3 ที่ "กระทั่งกำลังพูดถึงเรื่องอะไรยังไม่รู้เลย" ให้ลองแก้โดยใช้เพียงประโยคนี้ดูก่อน หากแก้ไม่ได้ค่อยย้อนกลับไปอ่าน
- ทั้งสี่ตัวเลือกเป็นคำเชื่อมต้นประโยค (However, / As a result, / Even so, / In the meantime,) → ต้องย้อนกลับไปอ่านประโยคก่อนหน้าอย่างแน่นอน โจทย์ประเภทนี้ดูแค่ประโยคปัจจุบันไม่มีทางแก้ได้ การฝืนจ้องมันมีแต่เสียเวลา
- ทั้งสี่ตัวเลือกเป็นประโยคสมบูรณ์ → โจทย์แทรกประโยค แบบนี้ต้องดูทั้งประโยคหน้าและประโยคหลัง และโดยทั่วไปควรเก็บไว้ทำเป็นลำดับสุดท้าย
ขั้นที่ 2: โจทย์คำเชื่อม อ่านย้อนกลับไปเพียงประโยคเดียวพอ
นี่คือจุดที่คุ้มค่าแก่การจดจำที่สุด โจทย์คำเชื่อมไม่จำเป็นต้องอ่านซ้ำทั้งบทอ่าน จำเป็นต้องอ่านประโยคก่อนหน้าเพียงประโยคเดียวเท่านั้น แล้วถามตัวเองด้วยคำถามเดียว:
ประโยคก่อนหน้ากับประโยคนี้ มีความสัมพันธ์กันอย่างไร?
- ประโยคหลังเป็นผลลัพธ์ของประโยคหน้า → As a result, / Therefore, / Accordingly,
- ประโยคหลังหักล้างหรือจำกัดขอบเขตของประโยคหน้า → However, / That said, / Even so,
- ประโยคหลังเป็นตัวอย่างของประโยคหน้า → For example,
- ประโยคหลังเป็นผลที่เกิดจากวิธีการในประโยคหน้า → That way, / In this way,
- ประโยคหน้าเป็นเงื่อนไข ประโยคหลังเป็นผลลัพธ์หากไม่ได้ทำ → Otherwise,
เมื่อตัดสินความสัมพันธ์ได้ คำตอบก็จะออกมา ขั้นตอนนี้ควรเสร็จสิ้นภายใน 10 วินาที หากลังเลเกิน 20 วินาที มักเป็นเพราะคุณกำลังพยายามหาเบาะแสจากประโยคปัจจุบัน — ทั้งที่ประโยคปัจจุบันไม่มีเบาะแสเลยแม้แต่น้อย
ขั้นที่ 3: นำเวลาที่ประหยัดได้ไปทุ่มเทให้กับโจทย์แทรกประโยค
Part 6 แต่ละบทอ่านมีช่องว่างสี่ช่อง โดยทั่วไปจะมีโจทย์แทรกประโยคหนึ่งข้อ — นั่นคือประเภทโจทย์ที่เสียเวลามากที่สุดใน Part 6 ทั้งหมด เพราะคุณต้องตรวจสอบให้แน่ใจว่ามันเชื่อมโยงกับทั้งประโยคหน้าและประโยคหลังได้พร้อม ๆ กัน
ประเด็นสำคัญของสามขั้นตอนแรกคือ: อย่าเสียเวลาย้อนกลับไปอ่านบทอ่านในช่องว่างประโยคเดียว แล้วรวบรวมเวลาไปใช้กับหนึ่งหรือสองข้อที่จำเป็นต้องอ่านบทอ่านจริง ๆ
ข้อจำกัดของการวัดผลนี้
บอกตามตรงสามประการ:
ข้อสอบอ้างอิงมีเพียง 72 ช่องว่างเท่านั้น นี่คือช่องว่างทั้งหมดที่ไม่ใช่ประโยคแทรกในข้อสอบจำลองหกชุด ซึ่งเป็นข้อมูลทั้งหมดที่เรามีในมือแล้ว แต่ 72 ช่องยังถือว่าไม่มาก — ดังนั้นช่วงความเชื่อมั่น 48.6% นั้นจึงกว้างถึง 22 จุดเปอร์เซ็นต์ ส่วน 490 ช่องของเราเป็นการสำรวจทั้งหมด จึงแคบกว่ามาก
ผู้ประเมินคือ AI ไม่ใช่ผู้สอบจริง พวกมันตัดสินว่า "มองแยกเดี่ยว ๆ แล้วฟังดูสมเหตุสมผลหรือไม่" ซึ่งเป็นตัวแทนเชิงดรรชนี ไม่ใช่อัตราการตอบถูกจริง ความสัมพันธ์ของมันกับความยากจริงมีความสมเหตุสมผล แต่ไม่ใช่เรื่องเดียวกัน
เราอ้างอิงเฉพาะในระดับการกระจาย ไม่ใช่อ้างอิงในระดับรายข้อ เปรียบเหมือนเครื่องชั่งน้ำหนักที่มีความคลาดเคลื่อน ±5 กิโลกรัม การชั่งคนเดียวไม่มีความหมาย แต่การชั่งค่าเฉลี่ยของคนหนึ่งพันคนสามารถมองเห็นความแตกต่างของกลุ่มได้ การวัดผลนี้สามารถบอกได้ว่า "การกระจายของสองคลังข้อสอบในมิตินี้มีความแตกต่างกันอย่างชัดเจน" แต่ไม่สามารถบอกได้ว่า "ข้อนี้พึ่งพาบริบทมากกว่าข้อนั้น"
ซีรีส์ว่าด้วยความยาก: 〈ภาพรวมความยาก〉 · 〈Part 5〉 · Part 6 (บทความนี้) · 〈Part 7〉