記事一覧 · 公開日 2026-08-04
Part 6 の難しさは、「その文書が本当に必要か」にある——文章を伏せて行った測定
好奇心旺盛なあなたに贈る技術解説です。難易度シリーズは各 Part につき1本ずつ、順番に公開しています。これはその第6回です。Part 5 の難易度は4つの選択肢がどう並んでいるかに集中しており、Part 7 の難易度は文章全体に散らばっています。Part 6 はその中間に挟まれており、その難易度は非常に見落とされやすい場所から生じています。<strong>「この空所は、本当にその文章を読む必要があるのか?」</strong> この記事では、この問題をどのようにして計測可能な数値へと変換したのか、この測定が単なる「個人の感覚」に終わらないようどのような方法を用いたのか、測定によって判明した結果(最初の測定結果は私たち自身にとって非常に厳しいものであり、それに基づいて問題バンクを全般的に改修しました)、そしてあなたに最も役立つ情報——Part 6 には2つの全く異なる空所が存在することを知った上で、試験本番で時間をどう配分すべきかについて解説します。統計の予備知識は不要です。
Part 6 は何をテストすべきなのか
Part 6 はリーディングセクションの第 131 〜 146 題:4つの短文で構成され、1つの文章につき4つの空所があり、各空所には4つの選択肢が用意されています。
一見すると、これは「Part 5 を文章の中に詰め込んだもの」のように思えるかもしれません。しかし、本来そうあるべきではありません。Part 5 は孤立した1つの文を与えるため、答えは必然的にその文の中から探すしかありません。一方、Part 6 は1つの文章全体を与えます——つまり答えは「他の文の中に隠れている可能性がある」ということです。
これこそが Part 6 が存在する理由です。もしすべての空所が自分自身の1文だけで解決できるとしたら、その文章はただの飾りにすぎず、この Part が独立して存在する意味もなくなってしまいます。
シンプルなテスト法:文章を伏せてみる
ある空所が本当に「文章」をテストしているかどうかを判断するには、極めて明確な方法があります:
文章全体を伏せて隠し、空所のある1文と4つの選択肢だけを残す。 そして問いかける:この時点で、意味が通る選択肢はいくつ残っているか?
もし意味が通る選択肢が1つしか残っていないなら、その空所には文章など端から不要だったということです——それは文章の中に潜んだ Part 5 の問題にすぎません。
もし2つ以上の選択肢が意味を通せるなら、それは文章だけが答えを決定できることを意味します。その空所は、真の意味で Part 6 をテストしています。
私たちは後者に該当する空所を「文脈依存の空所」と呼んでいます。この記事でこれから登場するすべての数値は、この文脈依存の空所を数えたものです。
3つの具体例を見る
例1:文章を伏せても影響がない場合
Before entering, all staff must put on a full protective suit, gloves, and a face mask in the ------- room. (A) checking (B) changing (C) charging (D) chilling
文章を読む必要はありません。防護服、手袋、マスクを着用する場所は changing room(更衣室)です。他の3つの選択肢は、前後関係に何が書かれていようと正解になりえません。この問題は、文章全体を削除したとしても難易度は一切変わりません。
例2:文章を伏せると答えることができない場合
Bring your friends. ------- groups of six or more should book ahead. (A) Because of this, (B) That said, (C) For that reason, (D) In the meantime,
4つの選択肢はすべて文法的に正しく、単独の文としても意味が通る文頭の表現です。この1文だけを見ても、A ではなく B を選ぶ理由はどこにもありません。
直前の「Bring your friends.(お友達を連れてきてください)」という文があって初めて、後ろの文が条件の限定をしていることがわかります——大人数歓迎、ただし六人以上は事前予約が必要。「ただし」に当たるのが That said です。
この問題において、文章は解題の必要条件です。
例3:文章を伏せると何について話しているのかさえわからない場合
Even stubborn ------- don't stand a chance against our gentle, modern process. (A) sprains (B) strains (C) stains (D) streams
この文を単独で見ると、これがクリーニング店の広告なのか理学療法クリニックの広告なのかさえ判断できません。sprains(扭傷)と stains(汚漬)はこの文単体の中では等しく意味が通ってしまいます。
何について書かれた文章なのかを教えてくれるのは、文章全体だけです。これは文脈依存の最も極端な例です。

「意味が通る」をいかに信頼できる数値に変換するか
ここまでの話は、まだ「個人の主観」の域を出ていません。そして「主観」は測定ではありません。
テスト理論において、難易度には正式な定義が存在します:1問の難易度とは、実際の受験者がその問題に正解した割合。これにはあらかじめ何千何万人もの受験者が解答している必要があり、ETS 以外の誰もそのようなデータを持っていません。詳細な解説は〈難易度概要〉に譲りますが、ここで取り組むべきは、より小規模でありながら一層厄介な問題です:「伏せた状態で意味が通る選択肢がいくつ残るか」という判定を、いかに一人の主観的判断に陥らせないかという点です。
私たちは以下の3つのステップを実行しました。
1. 問題をまず「その1文だけ」に切り出す
プログラムを用いて、各問題の空所が含まれる文だけを単独で抽出します。同じ文章内の他の空所には正解を直接あてはめておきます(こうすることで文全体の構造が保たれます)。全 490 個の空所すべてを正常に抽出しました。
この段階で、すでに1つの大きな問題タイプが除外されています:文章中に1文を丸ごと挿入する「文挿入問題」(選択肢が4つの完全な文になっているタイプ)。この種の問題は定義上、確実に文脈に依存するため、これを集計に含めると数値が底上げ(水増し)されてしまいます。また、当社の文挿入問題の比率はもとから実際の試験の構成(4問に1問)と一致しています。したがって、ここで測定しているのは残りの3つの空所です。
2. 互いに結果を見られない2つの評価者に委ねる
「抽出した1文 + 4つの選択肢」を、独立した2つの AI 評価者に渡しました。両者には全く同一の書面による評価基準が与えられ、かつ、どちらが正解であるかは一切伝えません(正解を知っていると判定に強いバイアスがかかるためです)。彼らに求めたのはただ1つ:この4つの選択肢のうち、単独で見ても意味が通るものはいくつあるか?
1つではなく2つの評価者を使ったのは、評価者が1つだけでは検証が不可能だからです。2つあれば、両者がどれくらい一致しているかを算出できます:
| 一致率 | Cohen's κ | |
|---|---|---|
| 当社の問題バンク(490 題) | 80.4% | 0.51 |
| 参照試題(72 題) | 90.3% | 0.81 |
κ(kappa)は、「偶然の一致」の要素を差し引いた後に残る実質的な一致度を表します。参照試題の 0.81 は非常に高い一致度ですが、当社の 0.51 は中程度にとどまります——これは当社の問題の中に、境界線上のあいまいなケースが比較的多く含まれていたことを意味しており、この事実自体が貴重なデータです。
3. 両者が合致したデータのみを採用する
2つの評価者の意見が食い違った部分については、私たちが手作業で分析しました。ランダムに 16 題を抽出して一問ずつ判定したところ、一方の評価者が明らかに基準が甘く、「実際には1つしか意味が通らない」問題まで含めてしまっていることがわかりました(例えば前述の更衣室の問題で、2つの選択肢が成立すると判定するなど)。しかもその基準の甘さは両者のコーパスで不均等であり、当社の問題では 18% 過剰に判定し、参照試題では 10% しか過剰判定していませんでした。
これは極めて重要です:もしこの甘い方の判定だけを採用すれば、一方のデータを不当に美化してしまうことになります。そのため、最終的な数値には両方の評価者が同意した問題のみを採用することにしました。
(なお、どちらか一方でも「文脈依存」と判定すればカウントする緩やかな基準でも再計算を行いましたが、結論は完全に同じでした。これについては後述します。)
測定結果
最初の測定を行った際、その結果は私たちにとって非常に手厳しいものでした:
| 文脈依存の空所 | 95% 信頼区間 | |
|---|---|---|
| 当社の問題バンク(初回測定) | 82 / 490 = 16.7% | 13.7%–20.3% |
| 参照模擬試題 | 35 / 72 = 48.6% | 37.4%–59.9% |
参照試題ではおよそ空所2つに1つが本当に文章を必要としていたのに対し、当社ではおよそ6つに1つにすぎませんでした。
2つの信頼区間にはまったく重なりがありません(当社の上限 20.3% に対し、相手の下限 37.4%)。したがって、これはサンプリング誤差で説明できるような格差ではありません。緩やかな基準で再計算しても、当社 36.3%、相手 58.3% と重なりはなく、計算方法を変えても結論は変わらないことが示されました。
一つの裏付けとして、私たちが意図的に文脈依存へと改稿した空所を、2つの評価者は一切の事前情報なしにすべて正確に検出しました。もし自作の物差しが自分自身の作ったものさえ測定できないなら、その物差しで何を測っても信用できません。
そして、私たちはこれを修正しました
測定結果が出た後、私たちはその数値をお蔵入りにすることなく、データに基づいて問題を修正しました。修正の方法は「新しい文章を何本も追加する」ことではありません——それでは意味がないからです。文章が1本増えるごとに空所も3つ増え、分母も一緒に大きくなってしまうからです。比率を上げるには、既存の空所を1つずつ、真に文章を必要とする形へと改稿していくしかありません。
改稿後に再測定を実施しました。使用したのは全く同じ物差し、同じ互いに結果の見えない2つの評価者、そして同じく両者が同意したデータのみを集計する方法です:
| 文脈依存の空所 | 95% 信頼区間 | 1文章あたりの平均 | |
|---|---|---|---|
| 当社の問題バンク(初回測定) | 82 / 490 = 16.7% | 13.7%–20.3% | 0.50 |
| 当社の問題バンク(現在) | 239 / 490 = 48.8% | 44.4%–53.2% | 1.46 |
| 参照模擬試題 | 35 / 72 = 48.6% | 37.4%–59.9% | 1.46 |
両者の点推定の差はわずか 0.2 ポイントであり、1文章あたりの平均密度はまったく同じ 1.46 となりました。信頼区間も大きく重なり合っています。
率直に言えば:「この空所が本当に文章を必要としているか」という点において、現在では当社と参照試題との差を測定によって検出することはできなくなりました。
ここで言い過ぎないよう注意が必要です。これは当社の問題が「本番の試験と同じくらい難しい」ことを意味するものではありません——難易度には多くの側面があり、ここで測定したのはそのうちの1つにすぎないからです。また、当社が相手より優れていることを意味するものでもありません:48.8% と 48.6% の差は測定誤差よりもはるかに小さく、どちらかが勝っているとは言えません。言えるのはただ一つ:この側面における格差は、かつては統計的に明白だったものが、今や消滅したということです。
一つ誠実な補足を加えておきます:改稿後、私たちがこの記事に掲載した例題を実際のデータベースと照合したところ、改稿作業の過程で4つの問題にミスが生じていたことが判明しました——選択肢が同じ文章内の別の空所に誤って割り当てられ、結果として正解が存在しない状態になっていたのです。これらはすでに修正済みであり、同様のミスがリリース前に自動でブロックされるよう検査システムを追加しました。このミスを発見できたのも、まさにこの記事に印刷した例題を実際の問題バンクと突合したからこそでした。
なぜこのようなことが起きたのか
誰かが手を抜いたからではなく、問題を製作する際の自然な傾向がまさにこうだからです。
「その1文だけ見れば解決できる」空所を作るのは、より簡単で、より安全です:解が1つであることを確信でき、物議を醸す心配がなく、文法的に成立することを保証しやすいからです。一方、「直前の文を見て初めて決定できる」空所を作るには、2つの文の間の関係性を同時にコントロールし、さらに4つの選択肢が単独で見てもすべて意味が通ることを確認しなければなりません——さもなければ、単なる Part 5 の問題へと退化してしまうからです。
したがって、特別に測定を行わない限り、どのような問題バンクも自然と「Part 5 を文章の中に詰め込んだ」状態へと漂流(偏向)していきます。私たちもまさに漂流していたのです。 そして文章を伏せてみるまで、この問題はまったく見えてきませんでした——1問ずつ単独で見れば、どれも素晴らしい問題だったからです。
これこそが、私たちがこの測定を定例化し、問題を改稿するたびに再実行している理由です:漂流は自然に止まることはなく、測定することによってのみ止めることができるのです。
あなたに最も役立つ解法:Part 6 はどう解くべきか
Part 6 には全く異なる2つの空所が存在することを知った以上、試験本番での戦略はきわめて明確です:先に分類し、それから文脈にさかのぼって読むかどうかを決める。
ステップ 1:選択肢を見て、どのタイプの空所か判断する
問題に向き合ったら、まず4つの選択肢の形を確認します:
- 4つとも同じ単語の語形変化(apply / applied / applying / application)→ ほぼ間違いなく単一文の空所です。空所の前後だけを見れば十分であり、文章を遡って読み返さないでください。
- 4つとも無関係な内容語(名詞、動詞、形容詞など)→ 通常は単一文の空所ですが、例3のような「何について話しているかさえわからない」ケースには注意が必要です。まずその1文だけで解いてみて、解けなければ文脈に遡ります。
- 4つとも文頭の接続詞(接続副詞)(However, / As a result, / Even so, / In the meantime,)→ 必ず直前の1文に遡って読んでください。この種の問題は、この文だけを見ても絶対に解けず、にらめっこしても時間を無駄にするだけです。
- 4つとも完全な文 → 文挿入問題です。これは前後両方の文を確認する必要があり、通常は最後に回して解答します。
ステップ 2:接続詞問題は、直前の1文だけを読み返す
これこそが最も覚えておくべきポイントです。接続詞問題は文章全体を読み直す必要はなく、直前の1文だけを読み返し、自分にこう問いかけるだけです:
前の文とこの文は、どのような関係にあるか?
- 後ろが前の結果である場合 → As a result, / Therefore, / Accordingly,
- 後ろが前を打ち消す・制限する場合 → However, / That said, / Even so,
- 後ろが前の具体例である場合 → For example,
- 後ろが前の手段によってもたらされる効果である場合 → That way, / In this way,
- 前が条件で、後ろが実行しなかった場合の結果である場合 → Otherwise,
論理関係さえ特定できれば、直ちに正解が導き出せます。このステップは 10 秒以内に完了すべきです;もし 20 秒以上迷っているなら、それはこの文の中にヒントを探しようとしている証拠です——しかし、この文の中には最初からヒントなど存在しないのです。
ステップ 3:節約した時間を文挿入問題に投入する
Part 6 は1つの文章につき4つの空所があり、そのうち通常1問が文挿入問題です——これは Part 6 全体で最も時間を要する題型です。なぜなら、前後の文の両方とスムーズにつながるかを同時に確認しなければならないからです。
前述の手順の肝は次の点に尽きます:単一文の空所で無駄に文章を読み返す時間を省き、本当に文章を読む必要がある1〜2問に時間を集中させること。

本測定における限界
正直に3つの点を挙げます:
参照試題には 72 個の空所しかありません。 これは全6回の模擬試題に含まれるすべての非文挿入問題の空所であり、手元にある完全なデータですが、72 個という数は決して多くありません——そのため、48.6% に対する信頼区間は 22 ポイントもの幅を持っています。一方、当社の 490 個は全数調査(全量データ)であるため、区間はずっと狭くなります。
評価者は AI であり、実際の受験者ではありません。 彼らが判定しているのは「単独で見て意味が通るか」であり、これはあくまで代替指標であって実際の正答率ではありません。実際の難易度との相関は合理的ですが、両者は同一の概念ではありません。
主張できるのは分布レベルにとどまり、個別の問題レベルではありません。 誤差 ±5 kg の体重計のようなもので、1人を測定しても意味はありませんが、1,000 人の平均を取れば集団間の差を検出できます。この測定は「2つの問題バンクがこの側面における分布において明確に異なる」ことを説明できますが、「この問題はあの問題よりも文脈に依存している」といった判定を下すことはできません。