บทความทั้งหมด · เผยแพร่เมื่อ 2026-08-04
ความยากของ Part 3 คือ “ใครพูดอะไร” บวกกับ “คำในคำตอบถูกเปลี่ยนไป” — ผลที่วัดได้ และสองเรื่องที่เราปรับแก้ตามผลนั้น
คำอธิบายเชิงเทคนิคสำหรับคนที่อยากรู้ ซีรีส์เรื่องความยากจะลง Part ละหนึ่งบทความตามลำดับ นี่คือบทความที่สาม ความยากของ Part 5 กระจุกอยู่ในตัวเลือกสี่ข้อ ส่วนความยากของ Part 7 กระจายอยู่ทั่วทั้งบทความ ขณะที่บทสนทนาใน Part 3 อยู่ตรงกลางพอดี: บทสนทนาหนึ่งช่วงยาวไม่ถึง 90 วินาที มีคำถามสามข้อ และความยากมาจากทั้ง “เกิดอะไรขึ้นตอนที่คุณฟัง” กับ “ตัวเลือกถูกเขียนออกมาอย่างไรตอนที่คุณอ่าน” บทความนี้นำคลังข้อสอบของเราไปเทียบกับข้อสอบจำลองเชิงพาณิชย์ชุดหนึ่งจำนวนหกฉบับแบบ<strong>วัดทีละรายการ</strong>—ความยาวบทสนทนา จำนวนช่วงผลัดกันพูด จำนวนผู้พูด และชุดประเภทคำถาม—เพื่ออธิบายว่าส่วนไหนตรงกัน และส่วนไหนที่เราตั้งใจให้ยากกว่า หลังวัดเสร็จ เราพบช่องโหว่สองจุด—คำถามถามตื้นเกินไป และคำตอบเดาง่ายเกินไป—ตอนนี้อุดครบแล้ว: เราเขียนคำถามใหม่ 575 ข้อ ปรับตัวเลือก 434 ชุด และแต่งบทสนทนาใหม่อีก 108 ช่วง ไม่ต้องมีพื้นฐานสถิติใด ๆ ก็อ่านได้
ก่อนอื่น มาดูให้ชัดว่า Part 3 มีหน้าตาอย่างไร
ในการสอบจริง Part 3 มี บทสนทนา 13 ช่วง ช่วงละ 3 ข้อ รวม 39 ข้อ—เป็นส่วนที่มีจำนวนข้อมากที่สุดในพาร์ตการฟังทั้งหมด (39 ข้อจาก 100 ข้อ) บทสนทนาแต่ละช่วงเปิดเพียงครั้งเดียว คำถามสามข้อพิมพ์อยู่ในข้อสอบ และคุณต้องตอบไปพร้อมกับที่ฟัง
ตอนนี้ส่วนนี้ในคลังข้อสอบของเรามี บทสนทนา 694 ช่วง 2,082 ข้อ (ระหว่างเขียนบทความนี้เพิ่มจาก 586 ช่วง 1,758 ข้อมาเป็นจำนวนดังกล่าว เหตุผลอยู่ด้านล่าง) แต่ประเด็นไม่ใช่ “เรามีเท่าไร” ประเด็นคือรูปทรงถูกต้องไหม เราจึงดึงบทถอดเสียงบทสนทนา Part 3 ทั้งหมดจากข้อสอบจำลองเชิงพาณิชย์ชุดหนึ่งจำนวนหกฉบับออกมา (ชุดอ้างอิงนี้คืออะไรและมีข้อจำกัดอย่างไร จะอธิบายเต็ม ๆ ในหัวข้อถัดไป) แล้วใช้ไม้บรรทัดอันเดียวกันวัดทั้งสองฝั่ง:
| รายการ | ข้อสอบอ้างอิง (6 ฉบับ 69 ช่วง) | คลังข้อสอบของเรา (586 ช่วง) |
|---|---|---|
| จำนวนคำต่อช่วง | เฉลี่ย 85 (มัธยฐาน 87 ช่วง 45–110) | เฉลี่ย 87 (มัธยฐาน 89 ช่วง 43–148) |
| จำนวนช่วงผลัดกันพูดต่อบทสนทนา | เฉลี่ย 4.5 ช่วง | เฉลี่ย 5.4 ช่วง |
| บทสนทนาสามคน | 13.0% (ใน 13 ช่วงต่อฉบับมี 1–2 ช่วง) | 25.6% (150 ช่วง) |
แถวแรกทำให้โล่งใจได้: ความยาวแทบเท่ากันทุกประการ 85 เทียบกับ 87 คำ มัธยฐาน 87 เทียบกับ 89 เราไม่ได้เขียนความยาวของบทสนทนา Part 3 ผิดทรง (ข้อแตกต่างเพียงอย่างเดียวคือเพดาน: ของเรายาวที่สุด 148 คำ ส่วนชุดอ้างอิงยาวที่สุด 110 คำ บทสนทนาที่ยาวเป็นพิเศษเพียงไม่กี่ช่วงคือหางยาวของข้อมูลเราเอง ไม่ใช่ส่วนหนึ่งของโครงสร้างการออกข้อสอบ)
แถวที่สองและสามต่างหากคือจุดที่ต่างจริง และทั้งคู่ชี้ไปยังเรื่องเดียวกัน:
- ด้วยจำนวนคำเท่ากัน เราแบ่งเป็นช่วงผลัดกันพูดมากกว่า โดยเฉลี่ยเกือบหนึ่งช่วง จำนวนคำไม่เปลี่ยนแต่ช่วงผลัดกันพูดมากขึ้น หมายความว่าแต่ละช่วงสั้นลง และสลับผู้พูดถี่ขึ้น
- บทสนทนาสามคนของเรามีเกือบสองเท่าของชุดอ้างอิง โครงสร้างข้อสอบจริงใส่บทสนทนาสามคน 1–2 ช่วงใน 13 ช่วงต่อฉบับ แต่คลังของเราใส่ไว้ถึงหนึ่งในสี่
สองอย่างนี้รวมกันคือ “ต้นทุนในการติดตาม” และบทสนทนาสามคนก็ยากกว่าจริง ๆ เรื่องนี้เราวัดมาแล้ว ไม่ได้เดา: คำถามจากบทสนทนาสามคนถูกระบุว่ายาก 29.1% ส่วนบทสนทนาสองคนมีเพียง 19.1% เมื่อมีเพิ่มมาอีกหนึ่งคน คุณก็มีงานเพิ่มอีกอย่าง—ไม่ใช่แค่ฟังเนื้อหา แต่ต้องจำด้วยว่าใครเป็นคนพูด เพราะคำถามจะถามตรง ๆ ว่า “ผู้ชายเสนอแนะอะไร” หรือ “ผู้หญิงคนที่สองกังวลเรื่องอะไร”
พูดอีกอย่างคือ Part 3 ของเรายากตรงการติดตาม ไม่ได้ยากตรงปริมาณข้อมูล จำข้อสรุปนี้ไว้ แล้วตัวเลข “เรายากกว่าชุดอ้างอิง 8 จุดเปอร์เซ็นต์” ด้านล่างจะไม่ใช่ปริศนาค้างคาอีกต่อไป แต่เป็นสิ่งที่อธิบายได้
หมายเหตุเรื่องวิธีดึงข้อมูล: บทถอดเสียงบทสนทนาของข้อสอบอ้างอิงพิมพ์อยู่ในหนังสือเฉลยและไม่มีชั้นข้อความ เราจึงกู้คืนด้วยการรู้จำภาพ (หน้ากระดาษแบบสองคอลัมน์ต้องสร้างใหม่จากพิกัดข้อความ ไม่เช่นนั้นทั้งสองคอลัมน์จะถูกอ่านเป็นบรรทัดเดียวกัน) ทั้งหกฉบับมี 78 ช่วง กู้คืนสำเร็จ 69 ช่วง (88%) ส่วนที่เหลือไม่สามารถแยกได้อย่างน่าเชื่อถือเพราะความผิดพลาดในการรู้จำ ตัวเลขอ้างอิงในตารางข้างต้นเป็นสถิติจาก 69 ช่วงนี้
บทสนทนาหนึ่งช่วงทำให้ยากขึ้นได้จากทางไหนบ้าง
ต่อไปนี้คือคุณลักษณะหลักที่เราคำนวณหรือทำเครื่องหมายให้คำถาม Part 3 ทีละข้อจริง ๆ เช่นเดียวกับบทความอื่นในซีรีส์นี้ อีกเดี๋ยวรายการนี้จะกลับด้านมาเป็นกลยุทธ์ทำข้อสอบของคุณ
1. จำนวนผู้พูดและช่วงผลัดกันพูด—ต้นทุนในการติดตาม
สองคนเทียบกับสามคน รวมถึงบทสนทนาหนึ่งช่วงถูกแบ่งเป็นกี่ช่วงผลัดกันพูด ตามที่กล่าวในหัวข้อแรก ความยากของบทสนทนาสามคนไม่ได้อยู่ที่ปริมาณข้อมูล แต่อยู่ที่การระบุว่าเป็นของใคร: ประโยคเดียวกันถ้าพูดโดยคนละคน ก็เปลี่ยนคำตอบอย่างน้อยหนึ่งข้อในสามข้อได้ ส่วนจำนวนช่วงผลัดกันพูดคือรูปแบบต่อเนื่องของเรื่องเดียวกัน—ทุกครั้งที่ผู้พูดสลับกัน คุณต้องเอาความสนใจไปผูกใหม่อีกครั้ง
2. ประเภทคำถาม—คุณถูกขอให้ทำอะไร
เราเขียนโปรแกรมหนึ่งตัวเพื่ออนุมานย้อนจากข้อความในโจทย์ว่าแต่ละข้อกำลังทดสอบอะไรจริง ๆ โปรแกรมนี้รันทั่วทั้งคลังของเรา และรันกับคำถาม Part 3 ทั้ง 230 ข้อในข้อสอบอ้างอิงหกฉบับด้วย—โปรแกรมเดียวกัน คลังข้อสอบสองชุด การเปรียบเทียบจึงมีความหมาย
| ประเภทคำถาม | ข้อสอบอ้างอิง | ก่อนเขียนใหม่ | หลังเขียนใหม่ | สิ่งที่คุณต้องทำ |
|---|---|---|---|---|
| คำถามรายละเอียด | 35.7% | 52.8% | 35.7% | ระบุตำแหน่งข้อเท็จจริงหนึ่งอย่างที่พูดไว้ |
| คำขอ/ข้อเสนอแนะ | 11.7% | 4.3% | 11.6% | ใครขอให้ใครทำอะไร |
| คำถามประกอบภาพข้อมูล | 7.8% | 2.4% | 7.8% | ฟังเสียงพร้อมดูตาราง ต้องเทียบสองฝั่งจึงได้คำตอบ |
| คำถามเหตุผล (Why…?) | 7.4% | 16.4% | 7.4% | หาเหตุและผล ซึ่งมักคร่อมบทสนทนาสองช่วง |
| คำถามสถานที่ | 6.5% | 2.7% | 6.4% | เหตุการณ์เกิดที่ไหน |
| ขั้นตอนถัดไป (What will… do next?) | 6.5% | 4.4% | 6.5% | สิ่งที่จะเกิดหลังบทสนทนาจบ |
| คำถามอนุมาน | 6.5% | 1.1% | 6.5% | รวมข้อเท็จจริงสองอย่างเป็นข้อสรุปที่ไม่ได้พูดออกมา |
| คำถามเจตนาของผู้พูด | 5.7% | 0.9% | 5.9% | “เขาหมายความว่าอะไรตอนพูดประโยคนี้?” |
| ประเด็นปัญหา (What problem…?) | 4.3% | 6.3% | 4.2% | จับอุปสรรคที่ถูกบ่นถึงหรือชี้ให้เห็น |
| คำถามระบุตัวตน | 3.5% | 1.1% | 3.5% | ผู้พูดคือใคร |
| คำถามใจความสำคัญ | 3.0% | 1.9% | 2.9% | สรุปทั้งช่วง ไม่ใช่ประโยคใดประโยคหนึ่ง |
| คำถามจุดประสงค์ | 1.3% | 1.8% | 1.3% | โทรศัพท์สายนี้/บทสนทนานี้เกิดขึ้นทำไม |
| คำถามเวลา/จำนวน | 0% | 3.8% | 0.3% | ข้อมูลจุดเดียว |
| รวมคำถามที่ใช้เหตุผล | 30.9% | 12.6% | 31.9% |
ตารางนี้สำคัญกว่าตารางในหัวข้อก่อนมาก เพราะสิ่งที่มันบอกไม่ใช่ระดับบนมาตรวัด แต่คือเนื้อหา
ก่อนเขียนใหม่ คำถามรายละเอียดในข้อสอบอ้างอิงมีเพียงหนึ่งในสาม แต่ของเรามีเกินครึ่ง ในทางกลับกัน ประเภทที่ต้องคิดเพิ่มอีกหนึ่งขั้น—การอนุมาน เจตนา ใจความสำคัญ จุดประสงค์ ขั้นตอนถัดไป และภาพข้อมูล—มี 30.9% ในชุดอ้างอิง แต่ของเรามีเพียง 12.6% ไม่ถึงครึ่ง ข้อสรุปตอนนั้นคือ สัดส่วนที่โครงสร้างข้อสอบจริงต้องการให้คุณ “ฟังเข้าใจแล้วคิดต่ออีกขั้น” มีมากกว่าของเราสองเท่า
ฉบับนั้นแก้เสร็จแล้ว คอลัมน์ที่สี่ในตารางคือคลังข้อสอบปัจจุบัน: คำถามทั้งสิบสี่ประเภทอยู่ห่างจากชุดอ้างอิงไม่เกินสองจุดเปอร์เซ็นต์ทั้งหมด รวมประเภทที่ใช้เหตุผล 31.9% เทียบกับ 30.9%
การอุดช่องว่างนี้ใช้วิธีทำงานสองแบบที่ต่างกันโดยสิ้นเชิง จึงควรอธิบายให้ชัด:
- คำถามสิบเอ็ดประเภทเติมได้ด้วย “การเปลี่ยนวิธีถาม” ใช้บทสนทนาเดิม ไฟล์เสียงเดิม แต่เขียนตัวคำถามใหม่—ถามคนละเรื่อง พร้อมตัวเลือกชุดใหม่ทั้งหมด เสียงของบทสนทนาไม่ได้เปลี่ยนแม้แต่คำเดียว เพราะเสียงคำถามเป็นคลิปที่แยกจากกันอยู่แล้ว สิ่งที่ได้จากการแก้แบบนี้คือคำถามอีกข้ออย่างแท้จริง ไม่ใช่แค่เปลี่ยนสำนวนของ “ทำไม…?” เพราะอย่างหลังทำให้ตัวเลขดูดีขึ้น แต่ไม่ได้ทำให้ข้อสอบยากขึ้น
- คำถามประกอบภาพข้อมูลกับคำถามเจตนาของผู้พูดเติมแบบนั้นไม่ได้ ต้องเขียนใหม่เท่านั้น คำถามประกอบภาพข้อมูลต้องให้บทสนทนาพูดข้อมูลที่เทียบกันได้เพียงด้านหนึ่งอย่างพอดี ส่วนคำถามเจตนาต้องมีประโยคที่ความหมายตรงตัวต่างจากความหมายจริง—ในบทสนทนาเดิม 49 หมื่นคำของเรา พบถ้อยคำแบบนี้เพียง 2 จุด ดังนั้นคำถามสองประเภทนี้จึงมาจากบทสนทนาใหม่ 108 ช่วงที่แต่งขึ้น (พร้อมเสียงที่บันทึกใหม่) และนั่นเป็นช่วงที่ช้าที่สุดของงานทั้งหมดด้วย
อีกสองเรื่องที่แก้ไปพร้อมกัน: คำถามเวลา/จำนวนลดจาก 3.8% เหลือ 0.3% (ข้อสอบอ้างอิงหกฉบับไม่มีเลยแม้แต่ข้อเดียว การที่ทั้งหกฉบับไม่ใช้เลยไม่น่าใช่เรื่องบังเอิญ—การฟังจับข้อมูลจุดเดียวอย่าง “พวกเขานัดเจอกันกี่โมง” คล้ายงานของ Part 2 มากกว่า) และตำแหน่งคำตอบที่ถูกในตัวเลือก ข้อใหม่เคยมีถึงเจ็ดในสิบอยู่ที่ A ตอนนี้ตัวอักษรทั้งสี่มีสัดส่วนอย่างละหนึ่งในสี่
สุดท้าย ตัวจำแนกนี้มีคุณสมบัติที่ดีอย่างหนึ่งซึ่งทำให้ควรเชื่อถือ: มันไม่เคยเห็นป้ายกำกับความยาก แต่กลับเรียงประเภทคำถามได้ตรงกับลำดับของป้าย—คำถามเจตนาของผู้พูดถูกระบุว่ายาก 96.7% คำถามอนุมาน 58.6% คำถามเหตุผล 33.6% ขณะที่คำถามจุดประสงค์มีเพียง 0.8% และคำถามจำนวน 0% เมื่อตัวจำแนกที่ไม่เคยเห็นคำตอบสร้างลำดับนี้ซ้ำได้ จึงแปลว่าคุณลักษณะ “ประเภทคำถาม” มีสาระจริง
(คอลัมน์ชุดอ้างอิงก็ได้มาจากการรู้จำภาพเช่นกัน: ทั้งหกฉบับมี 234 ข้อ กู้คืนสำเร็จ 230 ข้อ (98%) หลักฐานยืนยันอิสระสองอย่างทำให้เราเชื่อว่าการดึงข้อมูลนี้ไม่ผิดเพี้ยน—โปรแกรมนับคำถามประกอบภาพข้อมูลได้พอดี 3.0 ข้อต่อฉบับ และคำถามเจตนาประมาณ 2.2 ข้อต่อฉบับ ตรงกับโควตาโครงสร้างข้อสอบที่เราเคยวัดด้วยวิธีซึ่งต่างออกไปโดยสิ้นเชิง)
3. ระยะการถอดความ—ถ้อยคำของคำตอบที่ถูกอยู่ห่างจากต้นฉบับแค่ไหน
นี่คือจุดที่ร้ายแรงที่สุดของ Part 3 และเป็นตัวเอกของช่องโหว่ข้อที่สองด้านล่าง
ในบทสนทนาพูดว่า: I'll revise the interview guide before tomorrow's sessions. ตัวเลือกที่ง่ายเกินไปจะเป็นแบบนี้: Revise the interview guide (คัดมาตรง ๆ) ตัวเลือกในข้อสอบจริงจะเป็นแบบนี้: Update some materials—“revise” เปลี่ยนเป็น “update” และ “interview guide” เปลี่ยนเป็น “materials” ความหมายเดิม แต่เปลี่ยนคำทั้งหมด
ความต่างคือ แบบแรกตอบถูกได้ด้วยการเทียบคำสำคัญ ส่วนแบบหลังต้องฟังเข้าใจเท่านั้น เราคำนวณระดับคำที่ซ้ำกันระหว่างตัวเลือกกับต้นฉบับให้ทุกข้อ
4. ความหนาแน่นของกับดัก—ตัวเลือกผิดที่ดูเหมือนคำตอบ
นี่คือภาพสะท้อนของระยะการถอดความ ตัวเลือกผิดถูกใส่คำที่ปรากฏจริงในบทสนทนาไว้ เพื่อดักคนที่กวาดหาคำสำคัญโดยเฉพาะ ค่าเฉลี่ยปัจจุบันของคลังเราคือ: คำในตัวเลือกที่ถูกซ้ำกับต้นฉบับ 0.72 ส่วนตัวเลือกผิด 0.21 ช่องว่างนี้มากเกินไป—ตรงนี้แหละคือปัญหา จะอธิบายในหัวข้อถัดไป
5. ตำแหน่งหลักฐานและลำดับคำถาม
เราทำเครื่องหมายประโยคหลักฐานให้ทุกข้อ (คำตอบอิงจากประโยคไหนในบทสนทนา) มีครบทุกข้อ ครอบคลุม 100%; นี่จึงเป็นเหตุผลว่าทำไมหลังคุณตอบคำถามใน app บทถอดเสียงจึงไฮไลต์ประโยคนั้นโดยตรง
เมื่อมีตำแหน่งหลักฐาน เราก็วัดเรื่องที่ใช้ได้จริงอย่างหนึ่งได้: หลักฐานของคำถามสามข้อ 94% ปรากฏตามลำดับในไฟล์เสียง คำตอบข้อแรกอยู่ช่วงต้น คำตอบข้อสามอยู่ช่วงท้าย ข้อสอบจริงก็ออกแบบแบบนี้ ดังนั้นนี่ไม่ใช่การทำให้ง่ายลงของเรา—แต่เป็นกฎที่เอาไปใช้ได้ ส่วนกลยุทธ์จะบอกว่าใช้อย่างไร
6. คำถามประกอบภาพข้อมูลและคำถามเจตนา—โควตาคงที่ในโครงสร้าง
ข้อสอบอ้างอิงทั้งหกฉบับกำหนดไว้คงที่แบบไม่มีความแปรปรวน: Part 3 แต่ละฉบับมี คำถามประกอบภาพข้อมูล 3 ข้อ และคำถามเจตนาของผู้พูด 2 ข้อ นี่คือโครงสร้างการออกข้อสอบ ไม่ใช่เรื่องบังเอิญ
เดิมทีคลังข้อสอบของเราไม่มีคำถามสองประเภทนี้เลย ตอนนี้มีแล้ว และ—ที่สำคัญกว่าจำนวนข้อ—ข้อสอบจำลองสุ่มคำถามตามโควตานี้ ไม่ได้อาศัยดวง ถ้าคำถามประเภทหนึ่งมีอยู่ในคลัง แต่คุณไม่เคยเจอในข้อสอบจำลอง ก็เท่ากับไม่มี
เมื่อเทียบกับข้อสอบอ้างอิง เราพบอะไร: เรายากกว่า และเราไม่คิดจะแก้
จะสร้างมาตรวัดขึ้นมาเองไม่ได้ ต้องเทียบกับข้อมูลอ้างอิงภายนอก เราใช้หนังสือ 《全新!新制多益 TOEIC 題庫解析 狠準 6 回》 (เขียนโดย Hackers Academia จัดพิมพ์โดย 國際學村)—ครบทั้งหกฉบับ และทุกข้อพิมพ์ระดับความยากของสำนักพิมพ์เอง (สูง/กลาง/ต่ำ) ทำให้เรามีคำตัดสินจากผู้เชี่ยวชาญที่พร้อมใช้ 1,200 รายการสำหรับเปรียบเทียบ
ผลของ Part 3:
| ต่ำ (ง่าย) | กลาง | สูง (ยาก) | |
|---|---|---|---|
| ข้อสอบอ้างอิง (205 ข้อ) | 41% | 47% | 12% |
| คลังข้อสอบของเรา | 23.8% | 54.5% | 21.7% |
คำถามที่เราระบุว่ายาก มีมากกว่าชุดอ้างอิงประมาณ 8 จุดเปอร์เซ็นต์
เมื่อเห็นช่องว่างแบบนี้ คำถามแรกไม่ควรเป็น “จะปรับไหม” แต่ควรเป็น “นี่คือความต่างของเนื้อหา หรือความต่างของไม้บรรทัด” บทความ Part 5 ในซีรีส์นี้เคยแสดงให้เห็นแล้ว: ป้ายกำกับตรงนั้นดูต่างจากชุดอ้างอิงมาก แต่เมื่อไล่ดู กลับพบว่าโครงสร้างคำถามของเราไม่ได้ง่ายกว่าเลย—สิ่งที่ต่างคือคำนิยามของ “ยาก” สองฝั่ง ไม่ใช่ตัวข้อสอบ แยกเรื่องนี้ให้ชัดก่อน แล้วค่อยตัดสินใจว่าจะขยับเนื้อหาหรือไม่ คือบทเรียนที่ใช้ได้จริงที่สุดข้อหนึ่งจากทั้งซีรีส์
ทิศทางของ 8 จุดใน Part 3 ตรงข้ามกับ Part 5 และวิธีจัดการของเราคือ: เก็บไว้
เหตุผลมีสองชั้น ข้อแรก ไม้บรรทัดสองอันนี้เทียบหน่วยกันโดยตรงไม่ได้อยู่แล้ว—ฝั่งหนึ่งคือคำตัดสินของบรรณาธิการ อีกฝั่งคือวิจารณญาณของผู้ออกข้อสอบ ช่องว่าง 8 จุดอยู่ในขอบเขตที่อธิบายได้ทั้งด้วยสัญญาณรบกวนและความต่างจริง ข้อสองซึ่งใช้ได้จริงยิ่งกว่า: ถ้าคลังแบบฝึกหัดจะเอนออกจากมาตรฐานไปด้านหนึ่ง ด้านที่ยากกว่านั้นปลอดภัยสำหรับผู้เรียน ฝึกยากกว่าข้อสอบจริงทำให้มีระยะเผื่อในสนามสอบ แต่ถ้ากลับกันจะกลายเป็นเรื่องไม่คาดคิด
ส่วนที่ว่าทำไมเราจึงยากกว่า ตารางในหัวข้อแรกให้คำตอบไว้แล้ว และหนักแน่นกว่าคำพูดอย่าง “เราเข้มงวดกว่า” มาก: บทสนทนาของเราไม่ได้ยาวกว่าชุดอ้างอิง แต่มีช่วงผลัดกันพูดมากกว่า และบทสนทนาสามคนมีเป็นสองเท่า ตัวบทสนทนาสามคนเองมีคำถามยากมากกว่า 10 จุดเปอร์เซ็นต์ (29.1% เทียบกับ 19.1%) และมีสัดส่วน 25.6% ในคลังเรา เทียบกับ 13.0% ในชุดอ้างอิง ความต่างด้านสัดส่วนข้อนี้เพียงข้อเดียวก็มากพอจะอธิบายช่องว่าง 8 จุดเปอร์เซ็นต์บนป้ายกำกับได้เกือบทั้งหมด
พูดอีกอย่างคือ ไม่ใช่ว่าเราเขียนทุกข้อให้ซับซ้อนเจ้าเล่ห์กว่าเดิม แต่เป็นเพราะคลังข้อสอบของเราใส่บทสนทนาประเภทที่ยากกว่าอยู่แล้วไว้มากกว่า เมื่อรู้ว่าต้นตอของช่องว่างอยู่ที่ “ส่วนผสม” ไม่ใช่ “กลวิธี” จึงนับว่าตรวจสอบชัดเจนจริง ๆ—หากวันหนึ่งจะปรับกลับ สิ่งที่ควรขยับคือสัดส่วนบทสนทนาสามคน ไม่ใช่ไปแก้คำถามทีละข้อ
แต่ตรงนี้มีความขัดแย้งที่ตอนนั้นจำเป็นต้องพูดออกมา และเป็นทางเข้าของหัวข้อถัดไปด้วย: ป้ายกำกับบอกว่าของเรายากกว่า แต่ชุดประเภทคำถามกลับบอกว่าของเราตื้นกว่า ในคลังเดียวกัน ด้านที่ต้องฟัง (สามคน หลายช่วงผลัดกันพูด) เอนยาก แต่ด้านที่ถาม (เกินครึ่งเป็นคำถามรายละเอียด) เอนง่าย ทั้งสองอย่างวัดมาแล้วและจริงทั้งคู่ นี่แสดงให้เห็นพอดีว่าทำไมเราไม่ถือป้ายความยากเป็นข้อสรุป—มันสะท้อนความรู้สึกของผู้ออกข้อสอบว่า “ฟังดูซับซ้อนแค่ไหน” ไม่ใช่ “ข้อนี้ขอให้คุณทำสิ่งที่ยากแค่ไหน”
หมายเหตุอย่างตรงไปตรงมา
- หนังสืออ้างอิงเป็นข้อสอบจำลองของสำนักพิมพ์ ไม่ใช่เอกสารทางการของ ETS ในด้านรูปแบบมันน่าเชื่อถือมาก (แทบไม่มีความแปรปรวนระหว่างหกฉบับ ซึ่งเป็นลักษณะของการจำลองโครงสร้างทางการอย่างซื่อตรง) แต่ด้านความยาก สิ่งที่บรรทุกมาคือคำตัดสินของบรรณาธิการ ไม่ใช่อัตราการตอบถูกของผู้สอบจริง
- ป้ายความยากของ Part 3 กำหนดโดยผู้ออกข้อสอบ ไม่ได้คำนวณจากกฎ นี่คือความต่างสำคัญระหว่าง Part 3 กับ Part 1: ป้ายทุกอันใน Part 1 ถูกคำนวณใหม่จากตัวคำถามโดยโปรแกรม และตรงกับคำถามทั้ง 335 ข้อในคลังทั้งหมด แต่ Part 3 ยังไม่มีสิ่งแบบนั้น คุณลักษณะในรายการข้างต้นบางอย่าง (จำนวนคน ความยาว ประเภทคำถาม ตำแหน่งหลักฐาน และคำที่ซ้ำกัน) วัดแล้ว แต่ยังไม่ได้รวมเป็นคะแนนความยากที่จะเขียนทับป้ายกำกับ ดังนั้นเมื่อเราพูดถึงการกระจายความยากของ Part 3 เรากำลังพูดถึงการกระจายคำตัดสินของกลุ่มผู้ออกข้อสอบ
- เราเคยพยายามหากรรมการที่เป็นกลางกว่านี้ แต่ล้มเหลว แนวคิดคือให้โมเดล AI เป็น “ผู้สอบจำลอง” ไปทำข้อสอบอ้างอิง แล้วดูว่าอัตราตอบถูกจะสร้างลำดับยากง่ายตามที่สำนักพิมพ์พิมพ์ไว้ได้ไหม—ถ้าได้ เราก็จะมีไม้บรรทัดที่วัดคลังข้อสอบทั้งสองชุดได้พร้อมกัน ผลคือ: โมเดลสองตัวที่ความสามารถต่างกันหนึ่งลำดับขั้น มีอัตราตอบถูก 89.8%/89.9% เหมือนกัน และไม่ตอบสนองต่อความยากง่ายเลย (ค่าสัมประสิทธิ์สหสัมพันธ์ประมาณเท่ากับ 0) เหตุผลเข้าใจได้ไม่ยาก: สิ่งที่ทำให้ผู้เรียนติดคือความรู้คำศัพท์และคำที่ใช้คู่กัน แต่โมเดลใด ๆ ที่พอใช้ได้มีสิ่งเหล่านี้มานานแล้ว ไม้บรรทัดอันนี้จึงถูกทิ้ง และเราคิดว่าควรบันทึกไว้
- ปลายทางที่แท้จริงยังคงเป็นอัตราการตอบถูก เมื่อสถิติการตอบแบบไม่ระบุตัวตนสะสมขึ้น แต่ละข้อจะค่อย ๆ ได้ค่า p จริง ก่อนถึงตอนนั้น นี่คือวิธีวัดที่ซื่อตรงที่สุดที่เราทำได้
ช่องโหว่สองจุดที่เราวัดพบเอง ตอนนี้อุดครบแล้ว
หัวข้อนี้เขียนถึงคนที่อยากเห็นภาพทั้งหมด ช่องว่างบนป้ายกำกับ 8 จุดเปอร์เซ็นต์ข้างต้น ที่จริงเป็นตัวเลขที่สำคัญน้อยที่สุดในบทความนี้—มันเป็นปัญหาเรื่องมาตรวัด ปัญหาจริงมีสองข้อ ทั้งคู่เป็นปัญหาเนื้อหา และเราวัดพบเองทั้งคู่
ช่องโหว่ที่หนึ่ง: ถามตื้นเกินไป—ตอนนี้อุดแล้ว
ก็คือตารางประเภทคำถาม เดิมคำถามรายละเอียดมี 52.8% เทียบกับ 35.7% ในชุดอ้างอิง ส่วนคำถามที่ใช้เหตุผลรวมมี 12.6% เทียบกับ 30.9% ความหมายคือ คนที่ฝึก Part 3 ของเราครบทั้งหมด จะได้ฝึก “ฟังเข้าใจแล้วต้องคิดต่ออีกขั้น” เพียงประมาณสี่ในสิบของปริมาณที่ข้อสอบจริงต้องการ เขาจะเก่งมากในการระบุตำแหน่งข้อเท็จจริงที่พูดไว้ในบทสนทนา แต่ได้ฝึกคำถามแบบอนุมาน เจตนา และแบบบูรณาการอย่าง “ผู้ชายต้องการให้ผู้หญิงทำอะไร” น้อยเกินไปอย่างรุนแรง
ตอนนี้คำถามทั้งสิบสี่ประเภทอยู่ห่างจากชุดอ้างอิงไม่เกินสองจุดเปอร์เซ็นต์ทั้งหมด และประเภทที่ใช้เหตุผลรวมอยู่ที่ 31.9% เทียบกับ 30.9% วิธีทำอธิบายไว้ในหัวข้อ 2 แล้ว: เขียนคำถามใหม่ 575 ข้อ บวกบทสนทนาและเสียงใหม่ 108 ช่วง ด้วยเหตุนี้คลังจึงเพิ่มจาก 1,758 ข้อเป็น 2,082 ข้อ
มีเรื่องหนึ่งที่ต้องระบุอย่างตรงไปตรงมา: เส้นนี้วัดด้วยตัวจำแนกของเราเอง โปรแกรมตัวเดียวกันรันกับข้อสอบอ้างอิงพร้อมกัน ดังนั้นคำนิยามสองฝั่งจึงตรงกัน แต่ท้ายที่สุดมันก็อนุมานย้อนจากข้อความโจทย์ ไม่ได้อนุมานจาก “ข้อนี้ยากจริงแค่ไหน” การจัดประเภทให้ตรงกันไม่ได้แปลว่าความยากตรงกัน—เรื่องนั้นต้องรอข้อมูลการตอบจริงจากผู้ใช้กลับมาจึงจะรู้
ช่องโหว่ที่สอง: คำตอบเดาง่ายเกินไป—จุดนี้ก็อุดแล้ว
ตอนนั้น Part 3 มีคำตอบถูก 653 ข้อ (37%) ที่ตอบได้ด้วยการเทียบคำสำคัญ
นี่คือผลจากโปรแกรมสแกน scripts/option_source_overlap.py: มันเปรียบเทียบคำที่ซ้ำกันระหว่างตัวเลือกถูกกับบทถอดเสียงทีละข้อ และทำเครื่องหมายเมื่อคำในตัวเลือกถูกซ้ำกับต้นฉบับมากกว่าตัวเลือกผิดสามข้ออย่างชัดเจน นี่ไม่ใช่สิ่งที่เพิ่งค้นพบ—ปัญหานี้เริ่มจากรายงานของผู้ใช้คนหนึ่งที่ชี้ว่าบางข้อ “ไม่ต้องฟังเข้าใจ แค่เทียบคำสำคัญก็ทำได้” เราจึงเคยเขียนใหม่ครั้งใหญ่ โดยแก้ตัวเลือกใน Part 3 จำนวน 576 ตัวเลือก (รวมกับ Part 4 และ Part 7 ทั้งหมด 1,511 ตัวเลือก)
ตอนนี้เหลือ 28 ข้อ (1.3%) และทั้ง 28 ข้อนี้ตั้งใจเก็บไว้ทั้งหมด (อธิบายด้านล่าง) ข้อที่ควรแก้จริงไม่เหลือแม้แต่ข้อเดียว
ตัวเลขนี้ลดลงเป็นสองช่วง:
- การเขียน 575 ข้อใหม่จากหัวข้อก่อน กวาดออกไปเกินครึ่งพร้อมกัน คำถามทุกข้อที่เขียนใหม่ต้องผ่านการตรวจของสแกนเนอร์ตัวเดียวกันจึงจะเข้าฐานข้อมูลได้ ดังนั้นระหว่างจัดประเภทคำถามให้ตรงกัน ปัญหานี้ก็ถูกแก้ไปพร้อมกันถึงหนึ่งในห้าของคลัง ตอนเริ่มหัวข้อนี้ ตัวเลขลดเหลือ 462 ข้อ (22.2%) แล้ว
- อีก 434 ข้อที่เหลือแก้ด้วยมือทีละข้อ มีสองวิธี และวิธีที่สองคือหัวใจ: เขียนตัวเลือกถูกใหม่เป็นการถอดความ; เมื่อถอดความแล้วยังไม่พอ ก็ยกคำจากบทถอดเสียงไปให้ตัวเลือกผิด ข้อสอบจริงมีรูปทรงแบบนี้พอดี—ข้อที่ยกต้นฉบับมาตรง ๆ คือกับดัก ไม่ใช่คำตอบ
มาดูตัวอย่างจริง บทสนทนาเรื่องคำสั่งซื้ออาหารช่วงหนึ่ง ผู้ชายพูดตอนท้ายว่า: “ส่งหมายเลขห้องให้ผมก่อนสามโมง แล้วผมจะแก้คำสั่งซื้อได้” คำถามถามว่า “ผู้หญิงถูกขอให้ส่งอะไร?”
ก่อนเขียนใหม่ ตัวเลือกสี่ข้อคือ: หมายเลขห้อง/รายชื่อแขก/ใบเสร็จการชำระเงิน/ราคาบนเมนู มีเพียงคำว่า “หมายเลขห้อง” ที่ปรากฏในเสียง ส่วนอีกสามข้อไม่มีแม้แต่คำเดียว คุณไม่จำเป็นต้องเข้าใจว่าประโยคนั้นพูดเรื่องอะไร ไม่ต้องรู้ด้วยซ้ำว่าใครพูดกับใคร—แค่เทียบคำที่ได้ยินกับตัวเลือกก็จบ
หลังเขียนใหม่ ตัวเลือกถูกคือ “งานจัดขึ้นที่สถานที่ใด” เป็นเรื่องเดียวกันแต่พูดอีกแบบ ส่วนตัวเลือกผิดข้อหนึ่งเปลี่ยนเป็น “จำนวนอาหารมังสวิรัติ”—คำทั้งหมดนี้อยู่ในเสียง (ก่อนหน้านั้นผู้หญิงเพิ่งบอกให้เพิ่มอาหารมังสวิรัติห้าที่) และฟังดูสมเหตุสมผลทุกอย่าง ตอนนี้ข้อที่คำตรงกันคือข้อที่ผิด จะตอบถูก คุณต้องฟังเข้าใจว่าเขาต้องการหมายเลขห้อง ไม่ใช่จำนวนอาหาร
แล้วทำไม 28 ข้อนั้นไม่แก้? เพราะคำตอบเขียนใหม่ไม่ได้อยู่แล้ว ตัวเลือกสี่ข้อของคำถามประกอบภาพข้อมูลก็คือป้ายกำกับแต่ละแถวในภาพ (“กรวยหมายเลขหก” “พื้นที่ขนถ่ายหมายเลขสี่”) จึงต้องพิมพ์ตามนั้น ชื่อสถานที่ ชื่อคน และจำนวนเงินก็เช่นกัน ข้อสอบจริงก็ออกแบบแบบเดียวกัน เราลงทะเบียนข้อเหล่านี้ไว้ใน accepted.json พร้อมเขียนเหตุผลเป็นรายข้อ เพื่อให้ตัวเลขของสแกนเนอร์อ่านแล้วมีความหมาย และไม่บีบให้เกิดการแก้ที่แย่ลงเพียงเพื่อให้โปรแกรมเงียบ
มองในเชิงการวัด: คำที่ซ้ำกันระหว่างตัวเลือกถูกกับต้นฉบับลดจาก 0.72 เหลือ 0.39; ส่วนตัวเลือกผิดอยู่ที่ 0.25 ตัวเลขสองชุดเข้าใกล้กันแล้ว ซึ่งตรงกับ “หน้าตาของ Part 3 ในอุดมคติ” ที่เรากล่าวไว้ตอนต้น
ยังต้องเสริมอย่างตรงไปตรงมาอีกประโยค: การผ่านสแกนเนอร์พิสูจน์เพียงว่า “คำศัพท์ร่วมกันไม่เฉลยคำตอบอีกต่อไป” ไม่ได้แปลว่าคำถามยากขึ้นแล้ว การตรวจสอบที่แท้จริงยังคงเป็นอัตราการตอบถูกของผู้ใช้
เดิมทีช่องโหว่สองจุดนี้เป็นคนละด้านของเรื่องเดียวกัน: ด้านหนึ่งคือเราถามไม่ลึกพอ อีกด้านคือเราปล่อยให้เก็บคำตอบได้ง่ายเกินไป รวมกันแล้วจึงเป็น Part 3 ที่ “ฟังดูยาก แต่ทำจริงค่อนข้างง่าย”—ตรงกับความขัดแย้งในหัวข้อก่อนพอดี เมื่ออุดครบทั้งสองด้าน ความขัดแย้งนั้นก็หายไป
ยังมีข้อจำกัดที่ยากกว่าอีกอย่าง
ระดับภาษาของคลังข้อสอบเราสม่ำเสมอเกินไป ในบทสนทนาและบทพูดเดี่ยวทั้งหมด 1,018 ช่วง (เกือบ 49 หมื่นคำ) มีสำนวนเพียง 2 สำนวน และไม่มีเครื่องหมายภาษาพูดอย่าง “I guess” หรือ “to be honest” เลย เรื่องนี้พบตอนเติมคำถามเจตนาของผู้พูด—คำถามเจตนาต้องมีประโยคที่ “ความหมายตรงตัวไม่เท่ากับความหมายจริง” ให้ยกมาอ้าง แต่เราหาไม่ได้ จึงต้องเขียนใหม่ ดังนั้นสิ่งที่ขาดไม่เคยเป็นคำถามประเภทนั้น แต่เป็นความผ่อนคลายแบบภาษาพูดต่างหาก
นี่อธิบายด้วยว่าทำไมการอุดช่องโหว่แรกจึงช้ามาก: คำถามเจตนาและคำถามอนุมานไม่ได้ต้องการแค่การเปลี่ยนวิธีถาม แต่ตัวบทสนทนาต้องมีบางอย่างให้อนุมานได้เสียก่อน—บทสนทนา 108 ช่วงสุดท้ายนั้นเขียนใหม่ ไม่ใช่ดัดแปลง และนี่ก็ยังเป็นข้อจำกัดที่ใช้กับเนื้อหาใหม่ทุกชุด
เมื่อรู้โครงสร้างแล้ว: Part 3 ควรฟังอย่างไร ตอบอย่างไร
อ่านรายการคุณลักษณะข้างต้นกลับด้าน
คำถามสามข้อคือโครงร่างการฟังของคุณ—ต้องอ่านก่อนเสมอ
นิสัยที่คุ้มค่าที่สุดเพียงข้อเดียวใน Part 3 คือ: อ่านโจทย์ทั้งสามข้อให้จบก่อนเสียงเริ่ม คำถามพิมพ์อยู่ในข้อสอบ กติกาอนุญาต และนี่คือเงื่อนไขตั้งต้นของการออกแบบส่วนนี้ เมื่ออ่านครบสามข้อ คุณจะรู้ว่าต้องฟังชื่อคน เวลา หรือคำแนะนำของใครสักคน—คุณเปลี่ยนจาก “พยายามจำบทสนทนาทั้งหมด” เป็น “รอให้ของสามอย่างที่เจาะจงปรากฏ”
ตอนคำอธิบายของข้อก่อนหน้ากำลังเปิดอยู่และคุณยังมีเวลา ให้อ่านข้อต่อไป นี่คือจังหวะที่สำคัญที่สุดของ Part 3
เชื่อในลำดับ: คำถาม 94% เดินตามไฟล์เสียง
คำตอบข้อแรกแทบจะแน่นอนว่าอยู่ช่วงต้นของบทสนทนา ส่วนข้อสามอยู่ช่วงท้าย ดังนั้นค่อย ๆ เดินหน้าลงไปพร้อมกับที่ฟัง พอได้ยินคำตอบข้อแรกก็เลือกทันที แล้วส่งความสนใจไปข้อสอง อย่ารอจนบทสนทนาจบแล้วค่อยย้อนกลับมาคิดข้อแรก—ตอนนั้นคุณกำลังสู้กับความจำ ไม่ใช่กับข้อสอบ
พร้อมกันนั้น นี่ยังเป็นสัญญาณให้หยุดขาดทุน: ถ้าบทสนทนาพูดถึงตอนท้ายแล้ว แต่คุณยังไม่มีคำตอบข้อแรก ให้ปล่อยข้อนั้นไปและรักษาข้อสองกับสามไว้ เสียหนึ่งข้อในบทสนทนาหนึ่งช่วง ดีกว่าเสียสามข้อไกลโข
ต้องจำ “ใครพูด” ให้เป็นข้อมูลส่วนหนึ่ง
โจทย์จะเขียนว่า the man / the woman / the second speaker โดยเฉพาะในบทสนทนาสามคน ในทางปฏิบัติ: เมื่อได้ยินคำแนะนำ คำบ่น หรือคำสัญญา ให้จำติดไว้ด้วยว่าใครเป็นคนพูด (ผู้ชาย/ผู้หญิง หรือคนที่เท่าไร) จำเนื้อหาถูกแต่จำคนผิด คำตอบก็ยังผิด—และนี่คือต้นเหตุของคำถามยากที่เพิ่มขึ้น 10 จุดเปอร์เซ็นต์ในบทสนทนาสามคน
ระวังตัวเลือกที่ “เหมือนกับสิ่งที่ได้ยินทุกคำ”
นี่คือสิ่งที่คุณลักษณะด้านความหนาแน่นของกับดักสอนเรา: เมื่อคำในตัวเลือกเหมือนสิ่งที่คุณเพิ่งได้ยินทุกคำ ให้สงสัยไว้ก่อน ผู้ออกข้อสอบรู้ว่าคนที่รีบจะพึ่งคำสำคัญ ดังนั้นกับดักที่ทำได้ง่ายที่สุดคือเอาคำเดิมไปจับคู่กับคนผิด เวลาผิด หรือเรื่องผิด ในทางกลับกัน ตัวเลือกที่ถอดความจากต้นฉบับจนหมด มักเป็นคำตอบที่ถูก—คำตอบถูกในข้อสอบจริงมักมีหน้าตาแบบนั้น
(เพราะเหตุนี้ คำถาม 653 ข้อในหัวข้อก่อนจึงสำคัญกับเราจริง ๆ: ตอนนี้คลังข้อสอบของเรายังไม่ได้ทำงานตรงกับข้อสอบจริงในจุดนี้อย่างสมบูรณ์)
คำถามสามประเภทที่ต้องรับมือเป็นพิเศษ
- คำถามขั้นตอนถัดไป (What will the man do next?)—คำตอบแทบจะอยู่ในหนึ่งหรือสองประโยคสุดท้ายเสมอ พอได้ยิน “I'll…” “Let me…” “I'd better…” ก็คือนั่นแหละ ตลอดบทสนทนาคุณอาจผ่อนคลายได้ แต่สองประโยคสุดท้ายต้องตื่นเต็มตา
- คำถามเจตนา (What does the woman mean when she says, "…"?)—ประโยคที่ยกมามักไม่มีพิษภัยในความหมายตรงตัว คำตอบจริงอยู่ในประโยคก่อนหรือหลังมัน อย่าจ้องคำในเครื่องหมายคำพูดแล้วคิด ให้ถามว่า “เธอพูดประโยคนี้เพื่อตอบสนองอะไร”
- คำถามประกอบภาพข้อมูล—ก่อนเสียงเริ่มให้ดูภาพก่อน ทำความเข้าใจว่าคอลัมน์ในตารางคืออะไร (เวลาเทียบกับรอบ? ราคาเทียบกับแผน?) คำตอบจะเป็นแบบ “เสียงให้หนึ่งคอลัมน์ ภาพข้อมูลให้อีกคอลัมน์” เสมอ งานของคุณคือเชื่อมสองฝั่ง อ่านตารางก่อน เท่ากับทำงานไปครึ่งหนึ่งก่อนเริ่ม
สุดท้าย: ที่นี่ไม่มีการเริ่มใหม่
Part 3 ไม่มีการเปิดซ้ำครั้งที่สอง และย้อนกลับไม่ได้ พาร์ตการฟังทั้งหมดเดินหน้าเป็นเวลา 45 นาทีตายตัว ถ้าตามไม่ทันหนึ่งช่วง ก็จะตามไม่ทันทั้งช่วง ดังนั้นกลยุทธ์ทุกข้อข้างต้นมีเป้าหมายร่วมกันเพียงอย่างเดียว: ทำให้คุณอยู่กับข้อต่อไปเสมอ ไม่ใช่ข้อที่ผ่านมา
สรุปในประโยคเดียว
ความยากของ Part 3 มาจากสามจุดที่วัดได้: คุณต้องติดตามกี่คน กี่ช่วงผลัดกันพูด คำถามต้องการให้คุณทำสิ่งที่ยากเพียงใด และคำในคำตอบที่ถูกถูกเปลี่ยนไปมากแค่ไหน
เมื่อรันโปรแกรมชุดเดียวกันกับทั้งคลังข้อสอบของเราและข้อสอบจำลองเชิงพาณิชย์หกฉบับ คำตอบสามข้อคือ: ความยาวบทสนทนาแทบเหมือนโครงสร้างข้อสอบจริงทุกประการ แต่ของเรามีช่วงผลัดกันพูดถี่กว่าและบทสนทนาสามคนเป็นสองเท่า—นี่อธิบายว่าทำไมเราจึงมีคำถามยากมากกว่า 8 จุดเปอร์เซ็นต์ และเราเลือกเก็บไว้; ชุดประเภทคำถามของเราถามตื้นเกินไป คำถามที่ใช้เหตุผลมีเพียงสี่ในสิบของสัดส่วนจริง; ส่วนตัวเลือกยังมี 37% ที่ตอบถูกได้ด้วยการเทียบคำสำคัญ สองข้อหลังคือหนี้ด้านเนื้อหา เราเขียนมันไว้ตรงนี้ ไม่ได้รอให้อุดเสร็จแล้วค่อยบอก
และเมื่ออ่านรายการเดียวกันกลับด้าน มันก็คือกลยุทธ์ทำข้อสอบของคุณ: อ่านสามข้อก่อน เดินตามไฟล์เสียง จำว่าใครพูด และสงสัยตัวเลือกที่เหมือนสิ่งที่ได้ยินทุกคำ