บทความทั้งหมด · เผยแพร่เมื่อ 2026-08-04

ความยากของ Part 3 คือ “ใครพูดอะไร” บวกกับ “คำในคำตอบถูกเปลี่ยนไป” — ผลที่วัดได้ และสองเรื่องที่เราปรับแก้ตามผลนั้น

คำอธิบายเชิงเทคนิคสำหรับคนที่อยากรู้ ซีรีส์เรื่องความยากจะลง Part ละหนึ่งบทความตามลำดับ นี่คือบทความที่สาม ความยากของ Part 5 กระจุกอยู่ในตัวเลือกสี่ข้อ ส่วนความยากของ Part 7 กระจายอยู่ทั่วทั้งบทความ ขณะที่บทสนทนาใน Part 3 อยู่ตรงกลางพอดี: บทสนทนาหนึ่งช่วงยาวไม่ถึง 90 วินาที มีคำถามสามข้อ และความยากมาจากทั้ง “เกิดอะไรขึ้นตอนที่คุณฟัง” กับ “ตัวเลือกถูกเขียนออกมาอย่างไรตอนที่คุณอ่าน” บทความนี้นำคลังข้อสอบของเราไปเทียบกับข้อสอบจำลองเชิงพาณิชย์ชุดหนึ่งจำนวนหกฉบับแบบ<strong>วัดทีละรายการ</strong>—ความยาวบทสนทนา จำนวนช่วงผลัดกันพูด จำนวนผู้พูด และชุดประเภทคำถาม—เพื่ออธิบายว่าส่วนไหนตรงกัน และส่วนไหนที่เราตั้งใจให้ยากกว่า หลังวัดเสร็จ เราพบช่องโหว่สองจุด—คำถามถามตื้นเกินไป และคำตอบเดาง่ายเกินไป—ตอนนี้อุดครบแล้ว: เราเขียนคำถามใหม่ 575 ข้อ ปรับตัวเลือก 434 ชุด และแต่งบทสนทนาใหม่อีก 108 ช่วง ไม่ต้องมีพื้นฐานสถิติใด ๆ ก็อ่านได้

ก่อนอื่น มาดูให้ชัดว่า Part 3 มีหน้าตาอย่างไร

ในการสอบจริง Part 3 มี บทสนทนา 13 ช่วง ช่วงละ 3 ข้อ รวม 39 ข้อ—เป็นส่วนที่มีจำนวนข้อมากที่สุดในพาร์ตการฟังทั้งหมด (39 ข้อจาก 100 ข้อ) บทสนทนาแต่ละช่วงเปิดเพียงครั้งเดียว คำถามสามข้อพิมพ์อยู่ในข้อสอบ และคุณต้องตอบไปพร้อมกับที่ฟัง

ตอนนี้ส่วนนี้ในคลังข้อสอบของเรามี บทสนทนา 694 ช่วง 2,082 ข้อ (ระหว่างเขียนบทความนี้เพิ่มจาก 586 ช่วง 1,758 ข้อมาเป็นจำนวนดังกล่าว เหตุผลอยู่ด้านล่าง) แต่ประเด็นไม่ใช่ “เรามีเท่าไร” ประเด็นคือรูปทรงถูกต้องไหม เราจึงดึงบทถอดเสียงบทสนทนา Part 3 ทั้งหมดจากข้อสอบจำลองเชิงพาณิชย์ชุดหนึ่งจำนวนหกฉบับออกมา (ชุดอ้างอิงนี้คืออะไรและมีข้อจำกัดอย่างไร จะอธิบายเต็ม ๆ ในหัวข้อถัดไป) แล้วใช้ไม้บรรทัดอันเดียวกันวัดทั้งสองฝั่ง:

รายการ ข้อสอบอ้างอิง (6 ฉบับ 69 ช่วง) คลังข้อสอบของเรา (586 ช่วง)
จำนวนคำต่อช่วง เฉลี่ย 85 (มัธยฐาน 87 ช่วง 45–110) เฉลี่ย 87 (มัธยฐาน 89 ช่วง 43–148)
จำนวนช่วงผลัดกันพูดต่อบทสนทนา เฉลี่ย 4.5 ช่วง เฉลี่ย 5.4 ช่วง
บทสนทนาสามคน 13.0% (ใน 13 ช่วงต่อฉบับมี 1–2 ช่วง) 25.6% (150 ช่วง)

แถวแรกทำให้โล่งใจได้: ความยาวแทบเท่ากันทุกประการ 85 เทียบกับ 87 คำ มัธยฐาน 87 เทียบกับ 89 เราไม่ได้เขียนความยาวของบทสนทนา Part 3 ผิดทรง (ข้อแตกต่างเพียงอย่างเดียวคือเพดาน: ของเรายาวที่สุด 148 คำ ส่วนชุดอ้างอิงยาวที่สุด 110 คำ บทสนทนาที่ยาวเป็นพิเศษเพียงไม่กี่ช่วงคือหางยาวของข้อมูลเราเอง ไม่ใช่ส่วนหนึ่งของโครงสร้างการออกข้อสอบ)

แถวที่สองและสามต่างหากคือจุดที่ต่างจริง และทั้งคู่ชี้ไปยังเรื่องเดียวกัน:

  • ด้วยจำนวนคำเท่ากัน เราแบ่งเป็นช่วงผลัดกันพูดมากกว่า โดยเฉลี่ยเกือบหนึ่งช่วง จำนวนคำไม่เปลี่ยนแต่ช่วงผลัดกันพูดมากขึ้น หมายความว่าแต่ละช่วงสั้นลง และสลับผู้พูดถี่ขึ้น
  • บทสนทนาสามคนของเรามีเกือบสองเท่าของชุดอ้างอิง โครงสร้างข้อสอบจริงใส่บทสนทนาสามคน 1–2 ช่วงใน 13 ช่วงต่อฉบับ แต่คลังของเราใส่ไว้ถึงหนึ่งในสี่

สองอย่างนี้รวมกันคือ “ต้นทุนในการติดตาม” และบทสนทนาสามคนก็ยากกว่าจริง ๆ เรื่องนี้เราวัดมาแล้ว ไม่ได้เดา: คำถามจากบทสนทนาสามคนถูกระบุว่ายาก 29.1% ส่วนบทสนทนาสองคนมีเพียง 19.1% เมื่อมีเพิ่มมาอีกหนึ่งคน คุณก็มีงานเพิ่มอีกอย่าง—ไม่ใช่แค่ฟังเนื้อหา แต่ต้องจำด้วยว่าใครเป็นคนพูด เพราะคำถามจะถามตรง ๆ ว่า “ผู้ชายเสนอแนะอะไร” หรือ “ผู้หญิงคนที่สองกังวลเรื่องอะไร”

พูดอีกอย่างคือ Part 3 ของเรายากตรงการติดตาม ไม่ได้ยากตรงปริมาณข้อมูล จำข้อสรุปนี้ไว้ แล้วตัวเลข “เรายากกว่าชุดอ้างอิง 8 จุดเปอร์เซ็นต์” ด้านล่างจะไม่ใช่ปริศนาค้างคาอีกต่อไป แต่เป็นสิ่งที่อธิบายได้

หมายเหตุเรื่องวิธีดึงข้อมูล: บทถอดเสียงบทสนทนาของข้อสอบอ้างอิงพิมพ์อยู่ในหนังสือเฉลยและไม่มีชั้นข้อความ เราจึงกู้คืนด้วยการรู้จำภาพ (หน้ากระดาษแบบสองคอลัมน์ต้องสร้างใหม่จากพิกัดข้อความ ไม่เช่นนั้นทั้งสองคอลัมน์จะถูกอ่านเป็นบรรทัดเดียวกัน) ทั้งหกฉบับมี 78 ช่วง กู้คืนสำเร็จ 69 ช่วง (88%) ส่วนที่เหลือไม่สามารถแยกได้อย่างน่าเชื่อถือเพราะความผิดพลาดในการรู้จำ ตัวเลขอ้างอิงในตารางข้างต้นเป็นสถิติจาก 69 ช่วงนี้


บทสนทนาหนึ่งช่วงทำให้ยากขึ้นได้จากทางไหนบ้าง

ต่อไปนี้คือคุณลักษณะหลักที่เราคำนวณหรือทำเครื่องหมายให้คำถาม Part 3 ทีละข้อจริง ๆ เช่นเดียวกับบทความอื่นในซีรีส์นี้ อีกเดี๋ยวรายการนี้จะกลับด้านมาเป็นกลยุทธ์ทำข้อสอบของคุณ

1. จำนวนผู้พูดและช่วงผลัดกันพูด—ต้นทุนในการติดตาม

สองคนเทียบกับสามคน รวมถึงบทสนทนาหนึ่งช่วงถูกแบ่งเป็นกี่ช่วงผลัดกันพูด ตามที่กล่าวในหัวข้อแรก ความยากของบทสนทนาสามคนไม่ได้อยู่ที่ปริมาณข้อมูล แต่อยู่ที่การระบุว่าเป็นของใคร: ประโยคเดียวกันถ้าพูดโดยคนละคน ก็เปลี่ยนคำตอบอย่างน้อยหนึ่งข้อในสามข้อได้ ส่วนจำนวนช่วงผลัดกันพูดคือรูปแบบต่อเนื่องของเรื่องเดียวกัน—ทุกครั้งที่ผู้พูดสลับกัน คุณต้องเอาความสนใจไปผูกใหม่อีกครั้ง

2. ประเภทคำถาม—คุณถูกขอให้ทำอะไร

เราเขียนโปรแกรมหนึ่งตัวเพื่ออนุมานย้อนจากข้อความในโจทย์ว่าแต่ละข้อกำลังทดสอบอะไรจริง ๆ โปรแกรมนี้รันทั่วทั้งคลังของเรา และรันกับคำถาม Part 3 ทั้ง 230 ข้อในข้อสอบอ้างอิงหกฉบับด้วย—โปรแกรมเดียวกัน คลังข้อสอบสองชุด การเปรียบเทียบจึงมีความหมาย

ประเภทคำถาม ข้อสอบอ้างอิง ก่อนเขียนใหม่ หลังเขียนใหม่ สิ่งที่คุณต้องทำ
คำถามรายละเอียด 35.7% 52.8% 35.7% ระบุตำแหน่งข้อเท็จจริงหนึ่งอย่างที่พูดไว้
คำขอ/ข้อเสนอแนะ 11.7% 4.3% 11.6% ใครขอให้ใครทำอะไร
คำถามประกอบภาพข้อมูล 7.8% 2.4% 7.8% ฟังเสียงพร้อมดูตาราง ต้องเทียบสองฝั่งจึงได้คำตอบ
คำถามเหตุผล (Why…?) 7.4% 16.4% 7.4% หาเหตุและผล ซึ่งมักคร่อมบทสนทนาสองช่วง
คำถามสถานที่ 6.5% 2.7% 6.4% เหตุการณ์เกิดที่ไหน
ขั้นตอนถัดไป (What will… do next?) 6.5% 4.4% 6.5% สิ่งที่จะเกิดหลังบทสนทนาจบ
คำถามอนุมาน 6.5% 1.1% 6.5% รวมข้อเท็จจริงสองอย่างเป็นข้อสรุปที่ไม่ได้พูดออกมา
คำถามเจตนาของผู้พูด 5.7% 0.9% 5.9% “เขาหมายความว่าอะไรตอนพูดประโยคนี้?”
ประเด็นปัญหา (What problem…?) 4.3% 6.3% 4.2% จับอุปสรรคที่ถูกบ่นถึงหรือชี้ให้เห็น
คำถามระบุตัวตน 3.5% 1.1% 3.5% ผู้พูดคือใคร
คำถามใจความสำคัญ 3.0% 1.9% 2.9% สรุปทั้งช่วง ไม่ใช่ประโยคใดประโยคหนึ่ง
คำถามจุดประสงค์ 1.3% 1.8% 1.3% โทรศัพท์สายนี้/บทสนทนานี้เกิดขึ้นทำไม
คำถามเวลา/จำนวน 0% 3.8% 0.3% ข้อมูลจุดเดียว
รวมคำถามที่ใช้เหตุผล 30.9% 12.6% 31.9%

ตารางนี้สำคัญกว่าตารางในหัวข้อก่อนมาก เพราะสิ่งที่มันบอกไม่ใช่ระดับบนมาตรวัด แต่คือเนื้อหา

ก่อนเขียนใหม่ คำถามรายละเอียดในข้อสอบอ้างอิงมีเพียงหนึ่งในสาม แต่ของเรามีเกินครึ่ง ในทางกลับกัน ประเภทที่ต้องคิดเพิ่มอีกหนึ่งขั้น—การอนุมาน เจตนา ใจความสำคัญ จุดประสงค์ ขั้นตอนถัดไป และภาพข้อมูล—มี 30.9% ในชุดอ้างอิง แต่ของเรามีเพียง 12.6% ไม่ถึงครึ่ง ข้อสรุปตอนนั้นคือ สัดส่วนที่โครงสร้างข้อสอบจริงต้องการให้คุณ “ฟังเข้าใจแล้วคิดต่ออีกขั้น” มีมากกว่าของเราสองเท่า

ฉบับนั้นแก้เสร็จแล้ว คอลัมน์ที่สี่ในตารางคือคลังข้อสอบปัจจุบัน: คำถามทั้งสิบสี่ประเภทอยู่ห่างจากชุดอ้างอิงไม่เกินสองจุดเปอร์เซ็นต์ทั้งหมด รวมประเภทที่ใช้เหตุผล 31.9% เทียบกับ 30.9%

การอุดช่องว่างนี้ใช้วิธีทำงานสองแบบที่ต่างกันโดยสิ้นเชิง จึงควรอธิบายให้ชัด:

  • คำถามสิบเอ็ดประเภทเติมได้ด้วย “การเปลี่ยนวิธีถาม” ใช้บทสนทนาเดิม ไฟล์เสียงเดิม แต่เขียนตัวคำถามใหม่—ถามคนละเรื่อง พร้อมตัวเลือกชุดใหม่ทั้งหมด เสียงของบทสนทนาไม่ได้เปลี่ยนแม้แต่คำเดียว เพราะเสียงคำถามเป็นคลิปที่แยกจากกันอยู่แล้ว สิ่งที่ได้จากการแก้แบบนี้คือคำถามอีกข้ออย่างแท้จริง ไม่ใช่แค่เปลี่ยนสำนวนของ “ทำไม…?” เพราะอย่างหลังทำให้ตัวเลขดูดีขึ้น แต่ไม่ได้ทำให้ข้อสอบยากขึ้น
  • คำถามประกอบภาพข้อมูลกับคำถามเจตนาของผู้พูดเติมแบบนั้นไม่ได้ ต้องเขียนใหม่เท่านั้น คำถามประกอบภาพข้อมูลต้องให้บทสนทนาพูดข้อมูลที่เทียบกันได้เพียงด้านหนึ่งอย่างพอดี ส่วนคำถามเจตนาต้องมีประโยคที่ความหมายตรงตัวต่างจากความหมายจริง—ในบทสนทนาเดิม 49 หมื่นคำของเรา พบถ้อยคำแบบนี้เพียง 2 จุด ดังนั้นคำถามสองประเภทนี้จึงมาจากบทสนทนาใหม่ 108 ช่วงที่แต่งขึ้น (พร้อมเสียงที่บันทึกใหม่) และนั่นเป็นช่วงที่ช้าที่สุดของงานทั้งหมดด้วย

อีกสองเรื่องที่แก้ไปพร้อมกัน: คำถามเวลา/จำนวนลดจาก 3.8% เหลือ 0.3% (ข้อสอบอ้างอิงหกฉบับไม่มีเลยแม้แต่ข้อเดียว การที่ทั้งหกฉบับไม่ใช้เลยไม่น่าใช่เรื่องบังเอิญ—การฟังจับข้อมูลจุดเดียวอย่าง “พวกเขานัดเจอกันกี่โมง” คล้ายงานของ Part 2 มากกว่า) และตำแหน่งคำตอบที่ถูกในตัวเลือก ข้อใหม่เคยมีถึงเจ็ดในสิบอยู่ที่ A ตอนนี้ตัวอักษรทั้งสี่มีสัดส่วนอย่างละหนึ่งในสี่

สุดท้าย ตัวจำแนกนี้มีคุณสมบัติที่ดีอย่างหนึ่งซึ่งทำให้ควรเชื่อถือ: มันไม่เคยเห็นป้ายกำกับความยาก แต่กลับเรียงประเภทคำถามได้ตรงกับลำดับของป้าย—คำถามเจตนาของผู้พูดถูกระบุว่ายาก 96.7% คำถามอนุมาน 58.6% คำถามเหตุผล 33.6% ขณะที่คำถามจุดประสงค์มีเพียง 0.8% และคำถามจำนวน 0% เมื่อตัวจำแนกที่ไม่เคยเห็นคำตอบสร้างลำดับนี้ซ้ำได้ จึงแปลว่าคุณลักษณะ “ประเภทคำถาม” มีสาระจริง

(คอลัมน์ชุดอ้างอิงก็ได้มาจากการรู้จำภาพเช่นกัน: ทั้งหกฉบับมี 234 ข้อ กู้คืนสำเร็จ 230 ข้อ (98%) หลักฐานยืนยันอิสระสองอย่างทำให้เราเชื่อว่าการดึงข้อมูลนี้ไม่ผิดเพี้ยน—โปรแกรมนับคำถามประกอบภาพข้อมูลได้พอดี 3.0 ข้อต่อฉบับ และคำถามเจตนาประมาณ 2.2 ข้อต่อฉบับ ตรงกับโควตาโครงสร้างข้อสอบที่เราเคยวัดด้วยวิธีซึ่งต่างออกไปโดยสิ้นเชิง)

3. ระยะการถอดความ—ถ้อยคำของคำตอบที่ถูกอยู่ห่างจากต้นฉบับแค่ไหน

นี่คือจุดที่ร้ายแรงที่สุดของ Part 3 และเป็นตัวเอกของช่องโหว่ข้อที่สองด้านล่าง

ในบทสนทนาพูดว่า: I'll revise the interview guide before tomorrow's sessions. ตัวเลือกที่ง่ายเกินไปจะเป็นแบบนี้: Revise the interview guide (คัดมาตรง ๆ) ตัวเลือกในข้อสอบจริงจะเป็นแบบนี้: Update some materials—“revise” เปลี่ยนเป็น “update” และ “interview guide” เปลี่ยนเป็น “materials” ความหมายเดิม แต่เปลี่ยนคำทั้งหมด

ความต่างคือ แบบแรกตอบถูกได้ด้วยการเทียบคำสำคัญ ส่วนแบบหลังต้องฟังเข้าใจเท่านั้น เราคำนวณระดับคำที่ซ้ำกันระหว่างตัวเลือกกับต้นฉบับให้ทุกข้อ

4. ความหนาแน่นของกับดัก—ตัวเลือกผิดที่ดูเหมือนคำตอบ

นี่คือภาพสะท้อนของระยะการถอดความ ตัวเลือกผิดถูกใส่คำที่ปรากฏจริงในบทสนทนาไว้ เพื่อดักคนที่กวาดหาคำสำคัญโดยเฉพาะ ค่าเฉลี่ยปัจจุบันของคลังเราคือ: คำในตัวเลือกที่ถูกซ้ำกับต้นฉบับ 0.72 ส่วนตัวเลือกผิด 0.21 ช่องว่างนี้มากเกินไป—ตรงนี้แหละคือปัญหา จะอธิบายในหัวข้อถัดไป

5. ตำแหน่งหลักฐานและลำดับคำถาม

เราทำเครื่องหมายประโยคหลักฐานให้ทุกข้อ (คำตอบอิงจากประโยคไหนในบทสนทนา) มีครบทุกข้อ ครอบคลุม 100%; นี่จึงเป็นเหตุผลว่าทำไมหลังคุณตอบคำถามใน app บทถอดเสียงจึงไฮไลต์ประโยคนั้นโดยตรง

เมื่อมีตำแหน่งหลักฐาน เราก็วัดเรื่องที่ใช้ได้จริงอย่างหนึ่งได้: หลักฐานของคำถามสามข้อ 94% ปรากฏตามลำดับในไฟล์เสียง คำตอบข้อแรกอยู่ช่วงต้น คำตอบข้อสามอยู่ช่วงท้าย ข้อสอบจริงก็ออกแบบแบบนี้ ดังนั้นนี่ไม่ใช่การทำให้ง่ายลงของเรา—แต่เป็นกฎที่เอาไปใช้ได้ ส่วนกลยุทธ์จะบอกว่าใช้อย่างไร

6. คำถามประกอบภาพข้อมูลและคำถามเจตนา—โควตาคงที่ในโครงสร้าง

ข้อสอบอ้างอิงทั้งหกฉบับกำหนดไว้คงที่แบบไม่มีความแปรปรวน: Part 3 แต่ละฉบับมี คำถามประกอบภาพข้อมูล 3 ข้อ และคำถามเจตนาของผู้พูด 2 ข้อ นี่คือโครงสร้างการออกข้อสอบ ไม่ใช่เรื่องบังเอิญ

เดิมทีคลังข้อสอบของเราไม่มีคำถามสองประเภทนี้เลย ตอนนี้มีแล้ว และ—ที่สำคัญกว่าจำนวนข้อ—ข้อสอบจำลองสุ่มคำถามตามโควตานี้ ไม่ได้อาศัยดวง ถ้าคำถามประเภทหนึ่งมีอยู่ในคลัง แต่คุณไม่เคยเจอในข้อสอบจำลอง ก็เท่ากับไม่มี


เมื่อเทียบกับข้อสอบอ้างอิง เราพบอะไร: เรายากกว่า และเราไม่คิดจะแก้

จะสร้างมาตรวัดขึ้นมาเองไม่ได้ ต้องเทียบกับข้อมูลอ้างอิงภายนอก เราใช้หนังสือ 《全新!新制多益 TOEIC 題庫解析 狠準 6 回》 (เขียนโดย Hackers Academia จัดพิมพ์โดย 國際學村)—ครบทั้งหกฉบับ และทุกข้อพิมพ์ระดับความยากของสำนักพิมพ์เอง (สูง/กลาง/ต่ำ) ทำให้เรามีคำตัดสินจากผู้เชี่ยวชาญที่พร้อมใช้ 1,200 รายการสำหรับเปรียบเทียบ

ผลของ Part 3:

ต่ำ (ง่าย) กลาง สูง (ยาก)
ข้อสอบอ้างอิง (205 ข้อ) 41% 47% 12%
คลังข้อสอบของเรา 23.8% 54.5% 21.7%

คำถามที่เราระบุว่ายาก มีมากกว่าชุดอ้างอิงประมาณ 8 จุดเปอร์เซ็นต์

เมื่อเห็นช่องว่างแบบนี้ คำถามแรกไม่ควรเป็น “จะปรับไหม” แต่ควรเป็น “นี่คือความต่างของเนื้อหา หรือความต่างของไม้บรรทัด” บทความ Part 5 ในซีรีส์นี้เคยแสดงให้เห็นแล้ว: ป้ายกำกับตรงนั้นดูต่างจากชุดอ้างอิงมาก แต่เมื่อไล่ดู กลับพบว่าโครงสร้างคำถามของเราไม่ได้ง่ายกว่าเลย—สิ่งที่ต่างคือคำนิยามของ “ยาก” สองฝั่ง ไม่ใช่ตัวข้อสอบ แยกเรื่องนี้ให้ชัดก่อน แล้วค่อยตัดสินใจว่าจะขยับเนื้อหาหรือไม่ คือบทเรียนที่ใช้ได้จริงที่สุดข้อหนึ่งจากทั้งซีรีส์

ทิศทางของ 8 จุดใน Part 3 ตรงข้ามกับ Part 5 และวิธีจัดการของเราคือ: เก็บไว้

เหตุผลมีสองชั้น ข้อแรก ไม้บรรทัดสองอันนี้เทียบหน่วยกันโดยตรงไม่ได้อยู่แล้ว—ฝั่งหนึ่งคือคำตัดสินของบรรณาธิการ อีกฝั่งคือวิจารณญาณของผู้ออกข้อสอบ ช่องว่าง 8 จุดอยู่ในขอบเขตที่อธิบายได้ทั้งด้วยสัญญาณรบกวนและความต่างจริง ข้อสองซึ่งใช้ได้จริงยิ่งกว่า: ถ้าคลังแบบฝึกหัดจะเอนออกจากมาตรฐานไปด้านหนึ่ง ด้านที่ยากกว่านั้นปลอดภัยสำหรับผู้เรียน ฝึกยากกว่าข้อสอบจริงทำให้มีระยะเผื่อในสนามสอบ แต่ถ้ากลับกันจะกลายเป็นเรื่องไม่คาดคิด

ส่วนที่ว่าทำไมเราจึงยากกว่า ตารางในหัวข้อแรกให้คำตอบไว้แล้ว และหนักแน่นกว่าคำพูดอย่าง “เราเข้มงวดกว่า” มาก: บทสนทนาของเราไม่ได้ยาวกว่าชุดอ้างอิง แต่มีช่วงผลัดกันพูดมากกว่า และบทสนทนาสามคนมีเป็นสองเท่า ตัวบทสนทนาสามคนเองมีคำถามยากมากกว่า 10 จุดเปอร์เซ็นต์ (29.1% เทียบกับ 19.1%) และมีสัดส่วน 25.6% ในคลังเรา เทียบกับ 13.0% ในชุดอ้างอิง ความต่างด้านสัดส่วนข้อนี้เพียงข้อเดียวก็มากพอจะอธิบายช่องว่าง 8 จุดเปอร์เซ็นต์บนป้ายกำกับได้เกือบทั้งหมด

พูดอีกอย่างคือ ไม่ใช่ว่าเราเขียนทุกข้อให้ซับซ้อนเจ้าเล่ห์กว่าเดิม แต่เป็นเพราะคลังข้อสอบของเราใส่บทสนทนาประเภทที่ยากกว่าอยู่แล้วไว้มากกว่า เมื่อรู้ว่าต้นตอของช่องว่างอยู่ที่ “ส่วนผสม” ไม่ใช่ “กลวิธี” จึงนับว่าตรวจสอบชัดเจนจริง ๆ—หากวันหนึ่งจะปรับกลับ สิ่งที่ควรขยับคือสัดส่วนบทสนทนาสามคน ไม่ใช่ไปแก้คำถามทีละข้อ

แต่ตรงนี้มีความขัดแย้งที่ตอนนั้นจำเป็นต้องพูดออกมา และเป็นทางเข้าของหัวข้อถัดไปด้วย: ป้ายกำกับบอกว่าของเรายากกว่า แต่ชุดประเภทคำถามกลับบอกว่าของเราตื้นกว่า ในคลังเดียวกัน ด้านที่ต้องฟัง (สามคน หลายช่วงผลัดกันพูด) เอนยาก แต่ด้านที่ถาม (เกินครึ่งเป็นคำถามรายละเอียด) เอนง่าย ทั้งสองอย่างวัดมาแล้วและจริงทั้งคู่ นี่แสดงให้เห็นพอดีว่าทำไมเราไม่ถือป้ายความยากเป็นข้อสรุป—มันสะท้อนความรู้สึกของผู้ออกข้อสอบว่า “ฟังดูซับซ้อนแค่ไหน” ไม่ใช่ “ข้อนี้ขอให้คุณทำสิ่งที่ยากแค่ไหน”

หมายเหตุอย่างตรงไปตรงมา

  • หนังสืออ้างอิงเป็นข้อสอบจำลองของสำนักพิมพ์ ไม่ใช่เอกสารทางการของ ETS ในด้านรูปแบบมันน่าเชื่อถือมาก (แทบไม่มีความแปรปรวนระหว่างหกฉบับ ซึ่งเป็นลักษณะของการจำลองโครงสร้างทางการอย่างซื่อตรง) แต่ด้านความยาก สิ่งที่บรรทุกมาคือคำตัดสินของบรรณาธิการ ไม่ใช่อัตราการตอบถูกของผู้สอบจริง
  • ป้ายความยากของ Part 3 กำหนดโดยผู้ออกข้อสอบ ไม่ได้คำนวณจากกฎ นี่คือความต่างสำคัญระหว่าง Part 3 กับ Part 1: ป้ายทุกอันใน Part 1 ถูกคำนวณใหม่จากตัวคำถามโดยโปรแกรม และตรงกับคำถามทั้ง 335 ข้อในคลังทั้งหมด แต่ Part 3 ยังไม่มีสิ่งแบบนั้น คุณลักษณะในรายการข้างต้นบางอย่าง (จำนวนคน ความยาว ประเภทคำถาม ตำแหน่งหลักฐาน และคำที่ซ้ำกัน) วัดแล้ว แต่ยังไม่ได้รวมเป็นคะแนนความยากที่จะเขียนทับป้ายกำกับ ดังนั้นเมื่อเราพูดถึงการกระจายความยากของ Part 3 เรากำลังพูดถึงการกระจายคำตัดสินของกลุ่มผู้ออกข้อสอบ
  • เราเคยพยายามหากรรมการที่เป็นกลางกว่านี้ แต่ล้มเหลว แนวคิดคือให้โมเดล AI เป็น “ผู้สอบจำลอง” ไปทำข้อสอบอ้างอิง แล้วดูว่าอัตราตอบถูกจะสร้างลำดับยากง่ายตามที่สำนักพิมพ์พิมพ์ไว้ได้ไหม—ถ้าได้ เราก็จะมีไม้บรรทัดที่วัดคลังข้อสอบทั้งสองชุดได้พร้อมกัน ผลคือ: โมเดลสองตัวที่ความสามารถต่างกันหนึ่งลำดับขั้น มีอัตราตอบถูก 89.8%/89.9% เหมือนกัน และไม่ตอบสนองต่อความยากง่ายเลย (ค่าสัมประสิทธิ์สหสัมพันธ์ประมาณเท่ากับ 0) เหตุผลเข้าใจได้ไม่ยาก: สิ่งที่ทำให้ผู้เรียนติดคือความรู้คำศัพท์และคำที่ใช้คู่กัน แต่โมเดลใด ๆ ที่พอใช้ได้มีสิ่งเหล่านี้มานานแล้ว ไม้บรรทัดอันนี้จึงถูกทิ้ง และเราคิดว่าควรบันทึกไว้
  • ปลายทางที่แท้จริงยังคงเป็นอัตราการตอบถูก เมื่อสถิติการตอบแบบไม่ระบุตัวตนสะสมขึ้น แต่ละข้อจะค่อย ๆ ได้ค่า p จริง ก่อนถึงตอนนั้น นี่คือวิธีวัดที่ซื่อตรงที่สุดที่เราทำได้

ช่องโหว่สองจุดที่เราวัดพบเอง ตอนนี้อุดครบแล้ว

หัวข้อนี้เขียนถึงคนที่อยากเห็นภาพทั้งหมด ช่องว่างบนป้ายกำกับ 8 จุดเปอร์เซ็นต์ข้างต้น ที่จริงเป็นตัวเลขที่สำคัญน้อยที่สุดในบทความนี้—มันเป็นปัญหาเรื่องมาตรวัด ปัญหาจริงมีสองข้อ ทั้งคู่เป็นปัญหาเนื้อหา และเราวัดพบเองทั้งคู่

ช่องโหว่ที่หนึ่ง: ถามตื้นเกินไป—ตอนนี้อุดแล้ว

ก็คือตารางประเภทคำถาม เดิมคำถามรายละเอียดมี 52.8% เทียบกับ 35.7% ในชุดอ้างอิง ส่วนคำถามที่ใช้เหตุผลรวมมี 12.6% เทียบกับ 30.9% ความหมายคือ คนที่ฝึก Part 3 ของเราครบทั้งหมด จะได้ฝึก “ฟังเข้าใจแล้วต้องคิดต่ออีกขั้น” เพียงประมาณสี่ในสิบของปริมาณที่ข้อสอบจริงต้องการ เขาจะเก่งมากในการระบุตำแหน่งข้อเท็จจริงที่พูดไว้ในบทสนทนา แต่ได้ฝึกคำถามแบบอนุมาน เจตนา และแบบบูรณาการอย่าง “ผู้ชายต้องการให้ผู้หญิงทำอะไร” น้อยเกินไปอย่างรุนแรง

ตอนนี้คำถามทั้งสิบสี่ประเภทอยู่ห่างจากชุดอ้างอิงไม่เกินสองจุดเปอร์เซ็นต์ทั้งหมด และประเภทที่ใช้เหตุผลรวมอยู่ที่ 31.9% เทียบกับ 30.9% วิธีทำอธิบายไว้ในหัวข้อ 2 แล้ว: เขียนคำถามใหม่ 575 ข้อ บวกบทสนทนาและเสียงใหม่ 108 ช่วง ด้วยเหตุนี้คลังจึงเพิ่มจาก 1,758 ข้อเป็น 2,082 ข้อ

มีเรื่องหนึ่งที่ต้องระบุอย่างตรงไปตรงมา: เส้นนี้วัดด้วยตัวจำแนกของเราเอง โปรแกรมตัวเดียวกันรันกับข้อสอบอ้างอิงพร้อมกัน ดังนั้นคำนิยามสองฝั่งจึงตรงกัน แต่ท้ายที่สุดมันก็อนุมานย้อนจากข้อความโจทย์ ไม่ได้อนุมานจาก “ข้อนี้ยากจริงแค่ไหน” การจัดประเภทให้ตรงกันไม่ได้แปลว่าความยากตรงกัน—เรื่องนั้นต้องรอข้อมูลการตอบจริงจากผู้ใช้กลับมาจึงจะรู้

ช่องโหว่ที่สอง: คำตอบเดาง่ายเกินไป—จุดนี้ก็อุดแล้ว

ตอนนั้น Part 3 มีคำตอบถูก 653 ข้อ (37%) ที่ตอบได้ด้วยการเทียบคำสำคัญ

นี่คือผลจากโปรแกรมสแกน scripts/option_source_overlap.py: มันเปรียบเทียบคำที่ซ้ำกันระหว่างตัวเลือกถูกกับบทถอดเสียงทีละข้อ และทำเครื่องหมายเมื่อคำในตัวเลือกถูกซ้ำกับต้นฉบับมากกว่าตัวเลือกผิดสามข้ออย่างชัดเจน นี่ไม่ใช่สิ่งที่เพิ่งค้นพบ—ปัญหานี้เริ่มจากรายงานของผู้ใช้คนหนึ่งที่ชี้ว่าบางข้อ “ไม่ต้องฟังเข้าใจ แค่เทียบคำสำคัญก็ทำได้” เราจึงเคยเขียนใหม่ครั้งใหญ่ โดยแก้ตัวเลือกใน Part 3 จำนวน 576 ตัวเลือก (รวมกับ Part 4 และ Part 7 ทั้งหมด 1,511 ตัวเลือก)

ตอนนี้เหลือ 28 ข้อ (1.3%) และทั้ง 28 ข้อนี้ตั้งใจเก็บไว้ทั้งหมด (อธิบายด้านล่าง) ข้อที่ควรแก้จริงไม่เหลือแม้แต่ข้อเดียว

ตัวเลขนี้ลดลงเป็นสองช่วง:

  1. การเขียน 575 ข้อใหม่จากหัวข้อก่อน กวาดออกไปเกินครึ่งพร้อมกัน คำถามทุกข้อที่เขียนใหม่ต้องผ่านการตรวจของสแกนเนอร์ตัวเดียวกันจึงจะเข้าฐานข้อมูลได้ ดังนั้นระหว่างจัดประเภทคำถามให้ตรงกัน ปัญหานี้ก็ถูกแก้ไปพร้อมกันถึงหนึ่งในห้าของคลัง ตอนเริ่มหัวข้อนี้ ตัวเลขลดเหลือ 462 ข้อ (22.2%) แล้ว
  2. อีก 434 ข้อที่เหลือแก้ด้วยมือทีละข้อ มีสองวิธี และวิธีที่สองคือหัวใจ: เขียนตัวเลือกถูกใหม่เป็นการถอดความ; เมื่อถอดความแล้วยังไม่พอ ก็ยกคำจากบทถอดเสียงไปให้ตัวเลือกผิด ข้อสอบจริงมีรูปทรงแบบนี้พอดี—ข้อที่ยกต้นฉบับมาตรง ๆ คือกับดัก ไม่ใช่คำตอบ

มาดูตัวอย่างจริง บทสนทนาเรื่องคำสั่งซื้ออาหารช่วงหนึ่ง ผู้ชายพูดตอนท้ายว่า: “ส่งหมายเลขห้องให้ผมก่อนสามโมง แล้วผมจะแก้คำสั่งซื้อได้” คำถามถามว่า “ผู้หญิงถูกขอให้ส่งอะไร?”

ก่อนเขียนใหม่ ตัวเลือกสี่ข้อคือ: หมายเลขห้อง/รายชื่อแขก/ใบเสร็จการชำระเงิน/ราคาบนเมนู มีเพียงคำว่า “หมายเลขห้อง” ที่ปรากฏในเสียง ส่วนอีกสามข้อไม่มีแม้แต่คำเดียว คุณไม่จำเป็นต้องเข้าใจว่าประโยคนั้นพูดเรื่องอะไร ไม่ต้องรู้ด้วยซ้ำว่าใครพูดกับใคร—แค่เทียบคำที่ได้ยินกับตัวเลือกก็จบ

หลังเขียนใหม่ ตัวเลือกถูกคือ “งานจัดขึ้นที่สถานที่ใด” เป็นเรื่องเดียวกันแต่พูดอีกแบบ ส่วนตัวเลือกผิดข้อหนึ่งเปลี่ยนเป็น “จำนวนอาหารมังสวิรัติ”—คำทั้งหมดนี้อยู่ในเสียง (ก่อนหน้านั้นผู้หญิงเพิ่งบอกให้เพิ่มอาหารมังสวิรัติห้าที่) และฟังดูสมเหตุสมผลทุกอย่าง ตอนนี้ข้อที่คำตรงกันคือข้อที่ผิด จะตอบถูก คุณต้องฟังเข้าใจว่าเขาต้องการหมายเลขห้อง ไม่ใช่จำนวนอาหาร

แล้วทำไม 28 ข้อนั้นไม่แก้? เพราะคำตอบเขียนใหม่ไม่ได้อยู่แล้ว ตัวเลือกสี่ข้อของคำถามประกอบภาพข้อมูลก็คือป้ายกำกับแต่ละแถวในภาพ (“กรวยหมายเลขหก” “พื้นที่ขนถ่ายหมายเลขสี่”) จึงต้องพิมพ์ตามนั้น ชื่อสถานที่ ชื่อคน และจำนวนเงินก็เช่นกัน ข้อสอบจริงก็ออกแบบแบบเดียวกัน เราลงทะเบียนข้อเหล่านี้ไว้ใน accepted.json พร้อมเขียนเหตุผลเป็นรายข้อ เพื่อให้ตัวเลขของสแกนเนอร์อ่านแล้วมีความหมาย และไม่บีบให้เกิดการแก้ที่แย่ลงเพียงเพื่อให้โปรแกรมเงียบ

มองในเชิงการวัด: คำที่ซ้ำกันระหว่างตัวเลือกถูกกับต้นฉบับลดจาก 0.72 เหลือ 0.39; ส่วนตัวเลือกผิดอยู่ที่ 0.25 ตัวเลขสองชุดเข้าใกล้กันแล้ว ซึ่งตรงกับ “หน้าตาของ Part 3 ในอุดมคติ” ที่เรากล่าวไว้ตอนต้น

ยังต้องเสริมอย่างตรงไปตรงมาอีกประโยค: การผ่านสแกนเนอร์พิสูจน์เพียงว่า “คำศัพท์ร่วมกันไม่เฉลยคำตอบอีกต่อไป” ไม่ได้แปลว่าคำถามยากขึ้นแล้ว การตรวจสอบที่แท้จริงยังคงเป็นอัตราการตอบถูกของผู้ใช้

เดิมทีช่องโหว่สองจุดนี้เป็นคนละด้านของเรื่องเดียวกัน: ด้านหนึ่งคือเราถามไม่ลึกพอ อีกด้านคือเราปล่อยให้เก็บคำตอบได้ง่ายเกินไป รวมกันแล้วจึงเป็น Part 3 ที่ “ฟังดูยาก แต่ทำจริงค่อนข้างง่าย”—ตรงกับความขัดแย้งในหัวข้อก่อนพอดี เมื่ออุดครบทั้งสองด้าน ความขัดแย้งนั้นก็หายไป

ยังมีข้อจำกัดที่ยากกว่าอีกอย่าง

ระดับภาษาของคลังข้อสอบเราสม่ำเสมอเกินไป ในบทสนทนาและบทพูดเดี่ยวทั้งหมด 1,018 ช่วง (เกือบ 49 หมื่นคำ) มีสำนวนเพียง 2 สำนวน และไม่มีเครื่องหมายภาษาพูดอย่าง “I guess” หรือ “to be honest” เลย เรื่องนี้พบตอนเติมคำถามเจตนาของผู้พูด—คำถามเจตนาต้องมีประโยคที่ “ความหมายตรงตัวไม่เท่ากับความหมายจริง” ให้ยกมาอ้าง แต่เราหาไม่ได้ จึงต้องเขียนใหม่ ดังนั้นสิ่งที่ขาดไม่เคยเป็นคำถามประเภทนั้น แต่เป็นความผ่อนคลายแบบภาษาพูดต่างหาก

นี่อธิบายด้วยว่าทำไมการอุดช่องโหว่แรกจึงช้ามาก: คำถามเจตนาและคำถามอนุมานไม่ได้ต้องการแค่การเปลี่ยนวิธีถาม แต่ตัวบทสนทนาต้องมีบางอย่างให้อนุมานได้เสียก่อน—บทสนทนา 108 ช่วงสุดท้ายนั้นเขียนใหม่ ไม่ใช่ดัดแปลง และนี่ก็ยังเป็นข้อจำกัดที่ใช้กับเนื้อหาใหม่ทุกชุด


เมื่อรู้โครงสร้างแล้ว: Part 3 ควรฟังอย่างไร ตอบอย่างไร

อ่านรายการคุณลักษณะข้างต้นกลับด้าน

คำถามสามข้อคือโครงร่างการฟังของคุณ—ต้องอ่านก่อนเสมอ

นิสัยที่คุ้มค่าที่สุดเพียงข้อเดียวใน Part 3 คือ: อ่านโจทย์ทั้งสามข้อให้จบก่อนเสียงเริ่ม คำถามพิมพ์อยู่ในข้อสอบ กติกาอนุญาต และนี่คือเงื่อนไขตั้งต้นของการออกแบบส่วนนี้ เมื่ออ่านครบสามข้อ คุณจะรู้ว่าต้องฟังชื่อคน เวลา หรือคำแนะนำของใครสักคน—คุณเปลี่ยนจาก “พยายามจำบทสนทนาทั้งหมด” เป็น “รอให้ของสามอย่างที่เจาะจงปรากฏ”

ตอนคำอธิบายของข้อก่อนหน้ากำลังเปิดอยู่และคุณยังมีเวลา ให้อ่านข้อต่อไป นี่คือจังหวะที่สำคัญที่สุดของ Part 3

เชื่อในลำดับ: คำถาม 94% เดินตามไฟล์เสียง

คำตอบข้อแรกแทบจะแน่นอนว่าอยู่ช่วงต้นของบทสนทนา ส่วนข้อสามอยู่ช่วงท้าย ดังนั้นค่อย ๆ เดินหน้าลงไปพร้อมกับที่ฟัง พอได้ยินคำตอบข้อแรกก็เลือกทันที แล้วส่งความสนใจไปข้อสอง อย่ารอจนบทสนทนาจบแล้วค่อยย้อนกลับมาคิดข้อแรก—ตอนนั้นคุณกำลังสู้กับความจำ ไม่ใช่กับข้อสอบ

พร้อมกันนั้น นี่ยังเป็นสัญญาณให้หยุดขาดทุน: ถ้าบทสนทนาพูดถึงตอนท้ายแล้ว แต่คุณยังไม่มีคำตอบข้อแรก ให้ปล่อยข้อนั้นไปและรักษาข้อสองกับสามไว้ เสียหนึ่งข้อในบทสนทนาหนึ่งช่วง ดีกว่าเสียสามข้อไกลโข

ต้องจำ “ใครพูด” ให้เป็นข้อมูลส่วนหนึ่ง

โจทย์จะเขียนว่า the man / the woman / the second speaker โดยเฉพาะในบทสนทนาสามคน ในทางปฏิบัติ: เมื่อได้ยินคำแนะนำ คำบ่น หรือคำสัญญา ให้จำติดไว้ด้วยว่าใครเป็นคนพูด (ผู้ชาย/ผู้หญิง หรือคนที่เท่าไร) จำเนื้อหาถูกแต่จำคนผิด คำตอบก็ยังผิด—และนี่คือต้นเหตุของคำถามยากที่เพิ่มขึ้น 10 จุดเปอร์เซ็นต์ในบทสนทนาสามคน

ระวังตัวเลือกที่ “เหมือนกับสิ่งที่ได้ยินทุกคำ”

นี่คือสิ่งที่คุณลักษณะด้านความหนาแน่นของกับดักสอนเรา: เมื่อคำในตัวเลือกเหมือนสิ่งที่คุณเพิ่งได้ยินทุกคำ ให้สงสัยไว้ก่อน ผู้ออกข้อสอบรู้ว่าคนที่รีบจะพึ่งคำสำคัญ ดังนั้นกับดักที่ทำได้ง่ายที่สุดคือเอาคำเดิมไปจับคู่กับคนผิด เวลาผิด หรือเรื่องผิด ในทางกลับกัน ตัวเลือกที่ถอดความจากต้นฉบับจนหมด มักเป็นคำตอบที่ถูก—คำตอบถูกในข้อสอบจริงมักมีหน้าตาแบบนั้น

(เพราะเหตุนี้ คำถาม 653 ข้อในหัวข้อก่อนจึงสำคัญกับเราจริง ๆ: ตอนนี้คลังข้อสอบของเรายังไม่ได้ทำงานตรงกับข้อสอบจริงในจุดนี้อย่างสมบูรณ์)

คำถามสามประเภทที่ต้องรับมือเป็นพิเศษ

  • คำถามขั้นตอนถัดไป (What will the man do next?)—คำตอบแทบจะอยู่ในหนึ่งหรือสองประโยคสุดท้ายเสมอ พอได้ยิน “I'll…” “Let me…” “I'd better…” ก็คือนั่นแหละ ตลอดบทสนทนาคุณอาจผ่อนคลายได้ แต่สองประโยคสุดท้ายต้องตื่นเต็มตา
  • คำถามเจตนา (What does the woman mean when she says, "…"?)—ประโยคที่ยกมามักไม่มีพิษภัยในความหมายตรงตัว คำตอบจริงอยู่ในประโยคก่อนหรือหลังมัน อย่าจ้องคำในเครื่องหมายคำพูดแล้วคิด ให้ถามว่า “เธอพูดประโยคนี้เพื่อตอบสนองอะไร”
  • คำถามประกอบภาพข้อมูล—ก่อนเสียงเริ่มให้ดูภาพก่อน ทำความเข้าใจว่าคอลัมน์ในตารางคืออะไร (เวลาเทียบกับรอบ? ราคาเทียบกับแผน?) คำตอบจะเป็นแบบ “เสียงให้หนึ่งคอลัมน์ ภาพข้อมูลให้อีกคอลัมน์” เสมอ งานของคุณคือเชื่อมสองฝั่ง อ่านตารางก่อน เท่ากับทำงานไปครึ่งหนึ่งก่อนเริ่ม

สุดท้าย: ที่นี่ไม่มีการเริ่มใหม่

Part 3 ไม่มีการเปิดซ้ำครั้งที่สอง และย้อนกลับไม่ได้ พาร์ตการฟังทั้งหมดเดินหน้าเป็นเวลา 45 นาทีตายตัว ถ้าตามไม่ทันหนึ่งช่วง ก็จะตามไม่ทันทั้งช่วง ดังนั้นกลยุทธ์ทุกข้อข้างต้นมีเป้าหมายร่วมกันเพียงอย่างเดียว: ทำให้คุณอยู่กับข้อต่อไปเสมอ ไม่ใช่ข้อที่ผ่านมา


สรุปในประโยคเดียว

ความยากของ Part 3 มาจากสามจุดที่วัดได้: คุณต้องติดตามกี่คน กี่ช่วงผลัดกันพูด คำถามต้องการให้คุณทำสิ่งที่ยากเพียงใด และคำในคำตอบที่ถูกถูกเปลี่ยนไปมากแค่ไหน

เมื่อรันโปรแกรมชุดเดียวกันกับทั้งคลังข้อสอบของเราและข้อสอบจำลองเชิงพาณิชย์หกฉบับ คำตอบสามข้อคือ: ความยาวบทสนทนาแทบเหมือนโครงสร้างข้อสอบจริงทุกประการ แต่ของเรามีช่วงผลัดกันพูดถี่กว่าและบทสนทนาสามคนเป็นสองเท่า—นี่อธิบายว่าทำไมเราจึงมีคำถามยากมากกว่า 8 จุดเปอร์เซ็นต์ และเราเลือกเก็บไว้; ชุดประเภทคำถามของเราถามตื้นเกินไป คำถามที่ใช้เหตุผลมีเพียงสี่ในสิบของสัดส่วนจริง; ส่วนตัวเลือกยังมี 37% ที่ตอบถูกได้ด้วยการเทียบคำสำคัญ สองข้อหลังคือหนี้ด้านเนื้อหา เราเขียนมันไว้ตรงนี้ ไม่ได้รอให้อุดเสร็จแล้วค่อยบอก

และเมื่ออ่านรายการเดียวกันกลับด้าน มันก็คือกลยุทธ์ทำข้อสอบของคุณ: อ่านสามข้อก่อน เดินตามไฟล์เสียง จำว่าใครพูด และสงสัยตัวเลือกที่เหมือนสิ่งที่ได้ยินทุกคำ

← บทความทั้งหมด