記事一覧 · 公開日 2026-08-01
難易度総論:「本番の試験と同じ難しさ」とはどういう意味か?——どのように測定し、何と比較し、何を主張しないのか
好奇心を抱くあなたへの技術的説明。これは難易度シリーズの総論であり、以降の各 Part の個別解説に先立つものです。本記事では、今後のすべての記事で共通する内容を扱います:テスト学における難易度の正式な定義、なぜ誰も(私達を含め)それを直接測定できないのか、私たちが何を外部参照として用いているのか、そして私たちが主張できることと主張できないことの線引きについてです。本記事をお読みいただければ、各 Part の記事ではその Part 独自の難易度の要因について直接読み進めることができます。統計に関する専門知識は一切不要です。
なぜ「難易度」は感覚に頼れないのか
問題集にある一題一題の練習問題には、問題バンク内で「簡単」「中等」「困難」といったラベルが付けられています。この項目は一見当たり前のようですが、実は問題バンク全体の中で最も問題が発生しやすい場所です。なぜなら、それが間違っていても何の警報も鳴らないからです。
問題の正解が間違っていれば、ユーザーから報告があります。音声ファイルが破損していれば、再生ボタンを押した瞬間に分かります。しかし、「困難」とラベル付けされた問題が実際には非常に簡単であったとしても、何の兆候も現れません。それは通常通り出題され、通常通り採点され、見た目も難問のままです。
そして、このラベルは2つの重要な役割を果たしています。第一に、学習者が解く問題の組み合わせを決定すること——練習や模試が意味を持つためには、難易度の段階的なグラデーションが必要です。そしてそれは、「難しい」が本当に難しいことを意味している場合にのみ成立します。第二に、「難問にどう対策するか」を明確に説明できるようになること——ある問題がなぜ難しいのかを説明できなければ、「しっかり練習しましょう」という、正しいけれど役に立たないアドバイスしか提供できません。逆に、難易度を具体的かつ識別可能な複数の要因に分解できれば、それらの要因自体がそのまま対策チェックリストになります。
難易度の正式な定義と、一つの残酷な前提
計量心理学(サイコメトリクス)における難易度の定義は実に明解です:
1つの問題の難易度とは、実際の受験者がそれを正解した割合(正答率)である。
専門用語では p値 と呼ばれます。正答率 85% の問題は簡単な問題、正答率 40% の問題は難しい問題、ただそれだけです。専門家が難しいと感じるかどうかではなく、実際にどれだけの人が間違えたかという事実です。
しかし、この定義には1つの残酷な前提が存在します。あらかじめ大量の受験者に navigation その問題を解いてもらわなければならないということです。ETS はそのようなデータを保持しています。正式な問題は出題される前にすべてプレテスト(事前試験)が行われているからです。しかし、第三者の誰もそのデータを持っていません。私たちが隠しているわけではなく、すべての出版社、すべての予備校、すべての アプリ も同様に持っていないのです。
したがって、問題の横に「難易度:高」と印字している者は誰しも、実際には何らかの代替指標を使用しています。これ自体には何の問題もありません。代替指標の利用はこの分野における常態です。真の違いはただ1点にあります:
その代替指標は、個人の主観的な判断なのか、それとも再実行可能で、検証可能で、反証も可能な一連のルールなのか?
私たちが選んだのは後者です。その方法は、誰かが付けた難易度ラベルを一切考慮せず、問題文そのもののテキストから構造的に問題を難しくさせる一連の特徴量を算出し、一題ずつ測定するというものです。特徴量はテキストから計算されるため、同じプログラムを使って私たちの問題バンクを測定することも、紙に印刷された任意の試験問題を測定することも可能です。この点が次の節のキーポイントとなります。
「本番の試験と同じ難しさ」が誠実に意味し得る3つのこと
このフレーズはしばしば単一の表現として使われますが、実際には3つのレベルが混在しており、現時点で誰でも検証できるのは最初の2つだけです。
| 主張 | 検証可能性 | |
|---|---|---|
| 1 | 同一の出題フレームワーク — 同一の出題形式、同一の比率、全テストフォーム共通の同一構造 | 可能(客観的) |
| 2 | 同一の難易度分布 — 外部参照の判定に基づき、簡単/中等/困難の比率が同一 | 可能(ただし「誰による判定か」の但し書きが必要) |
| 3 | 同一の正答率 — 実際の受験者が各問題を正解する比率が同一 | 不可能(公式データまたは大量の解答サンプルを保持している場合を除く) |
私たちは (1) を強力に支持し、明確な但し書きのもとで (2) を支持し、(3) については未確立であることを明確に説明します。
大量の解答データがない状況で (3) を主張する者は、誰であれ推測に過ぎません。 これには私たち自身も含まれます——本シリーズのすべての記事の締めくくりで、この点に再び言及します。
何と比較しているのか:市販の6回分模試セット
目盛りを独自に発明することはできず、外部参照に合わせる必要があります。私たちが使用しているのは《全新!新制多益 TOEIC 題庫解析 狠準 6 回》(台湾のHackers Academia著、國際學村出版)という、全6回分の完成度が市場で高く評価されている模擬試題セットです。
これを選んだのには非常に実用的な理由があります。書籍内のすべての問題に出版社独自の難易度評価(高/中/低)が記載されていることです。これにより、専門の編集者による一題ごとの判断という、即座に利用可能なデータが数千件得られます。これこそが、自らの測定器具の精度を評価するために必要なデータなのです。
そして、この手法全体における重要なステップがこちらです:
同一の特徴抽出プログラムを、私たちの問題バンクに対しても、参照書籍の問題に対しても実行する。
1つの測定ツール、2つのコーパス。これこそが、より意味のある比較の前提です。自らの基準で自らを評価するのではなく、両者を同じ定規の上に乗せて評価するのです。

この定規は集団を正確に測れるが、個別の問題を正確に測ることはできない
これは手法全体の中で最も重要であり、同時に見落とされやすい点でもあります。比喩を用いて明確に説明する価値があります。
誤差 ±5 kg の体重計を想像してみてください。これを使って「今週 1 kg 重くなったかどうか」を判断することはできません。誤差が測定したい変化量よりも大きいため、測定された数値にはほとんど意味がないからです。しかし、同じ体重計で 1000 人のグループを測定し、さらに別の 1000 人のグループを測定した場合、両グループの平均値は比較可能です。誤差は上ぶれすることも下ぶれすることもあり、1000 回の測定によって概ね相殺され、残った差は本物だからです。
私たちの構造分類器はまさにその体重計に当たります。個別の単一問題が難しいかどうかを判断する際、それは非常に不確実です——これは謙遜ではなく、私たちが実際にその不確実性を測定した結果です。具体的な数値と手法は Part 5 の記事に記述しています(近日公開)。しかし、同じルールを 1000 題以上の問題に適用すると、個々の誤判定はプラスとマイナスの両方向に分散して互いに相殺され、残った比率は信頼できるものになります。
したがって、境界線はここにあります:
- 主張可能:私たちの Part 5 における「4つの独立した内容語」という分類の割合は 42.3% であり、参照書籍は 33.1% である。✓
- 主張不可:分類器が最も難しいカテゴリに分類したため、この問題は難問である。✗
実務上の結論は非常に明快です。分類結果を使って単一問題の難易度ラベルを上書きすることはしません。 この定規は、それが有効に機能する場所でのみ使用されます。つまり、個々の問題に点数をつけるためではなく、新規コンテンツの全体構成を管理するために使われます。本シリーズにおけるすべての難易度比較は、この制限のもとでお読みいただく必要があります。

この参照基準の限界を、隠すことなく明示します
- これは出版社による模擬試題であり、ETS の公式教材ではありません。 したがって、フォーマット面では強い証拠となりますが(6回分の間のバリエーションはほぼゼロであり、公式の出題構造を忠実に再現しています)、難易度面では比較的弱い証拠にとどまります(問題は出版社自体が作成したものであり、評価は編集者の判断によるためです)。そのため、フォーマットの比較については確信を持ったトーンで報告し、難易度の比較については慎重なトーンで報告しています。
- 全6回分しかありません。 各テストフォームに固定で出現する構造的特徴については6回分で十分確認できますが、比率のわずかな違いを検証するには6回分では不十分です。
現時点での結果:私たちの問題は参照書籍よりも簡単ではない
まず、最も誤解されやすい一連の数値から説明します。両者のラベルにおける「困難」の割合だけを見ると、私たちが全体的に簡単に思えます:
| Part | 参照の「高」評価 | 私たちの「難」ラベル |
|---|---|---|
| 2 | 20% | 18.9% |
| 3 | 12% | 21.7% |
| 4 | 18% | 16.2% |
| 5 | 33% | 10.3% |
| 6 | 28% | 25.8% |
| 7 | 29% | 21.6% |
6つの Part のうち4つは数パーセンテージポイント以内に収まっています。Part 5 における 23 パーセンテージポイントの差は非常に大きく見えます——しかし、これこそがシリーズ全体で最も重要な教訓です。なぜなら、両者のラベルを比較するのではなく、構造に基づいて測定し直すと、結論が逆転するからです:
| Part 5 選択肢の配列形式 | 私たち | 参照 |
|---|---|---|
| 同一語族かつヒントあり(最平易) | 3.6% | 2.9% |
| 同一語族・ヒントなし | 29.4% | 28.4% |
| 機能語/コロケーション選択 | 24.7% | 25.6% |
| 4つの独立した内容語(最難) | 42.3% | 33.1% |
私たちの問題に含まれる「最難の配列形式」は、参照書籍より約 9 パーセンテージポイント少ないのではなく、多いのです。 中間の2カテゴリはほぼ完全に重なっています。
言い換えれば、23 パーセンテージポイントの開きはラベル付けが生み出した錯覚であり、内容自体の差ではありません。私たちの問題作成者は文法的にひねりのある問題を難問とラベル付けする傾向があり、参照書籍の評価基準は単語やコロケーションの負荷を最も難しいとみなしています——両者は異なる定規で同じ事象を測定していたのです。保守的なのは私たちのラベルであり、内容ではありません。
これが現時点で導き出せる結論であり、これは個別の問題ではなく全体に対して適用されます。私たちが唯一客観的に測定できる軸において、私たちの問題は参照書籍と同等以上であり、最も難しいカテゴリにおいては参照書籍よりも多く含まれています。 だからといって「私たちの問題は本番のTOEICより難しい」と主張することはありません——それを言うには (3) が必要であり、(3) を証明できた者はまだ誰もいないからです。
私たちが主張しないこと
- 私たちには正答率データがありません。 ここにある内容のいずれも、ある特定の問題が実際の受験者にとって本番の試験問題と同じ難しさであることを確定させるものではありません。
- 参照は出版社による模試であり、ETS ではありません。 フォーマットに関する結論は強力ですが、難易度に関する結論は編集者の判断に依存します。
- 私たちのリスニング音声は本番の試験よりもクリアです。 リスニング音声はニューラルネットワーク TTS により生成されており、話速やアクセントの分布は制御および測定可能です。しかし、実際の録音における脱落音(リダクション)、発話の重複、環境ノイズなどは現時点では再現できません。これにより、私たちのリスニング問題は独自の指標では検出できない形で、本番の試験よりわずかに容易になっています——試験当日に初めて気づくくらいなら、ここで正直にお伝えすることを選びます。
- 個別の問題の難易度判定は行いません。 理由は前述の体重計の比喩と同じです。この定規は集団の測定には信頼できますが、個別の測定には信頼できません。すべての比較は「2つの問題バンクの構成」であり、「この一題がどれだけ難しいか」ではありません。
- 2つの尺度は結局のところ同一の尺度ではありません。 参照の 高/中/低 は編集者の判断であり、私たちのものは作成者の判断です。行動の根拠とし得る大きな差のみが意味を持ち、小さな差はノイズに過ぎません。
何によってこの検証の確実性が高まるのか
価値の高さ順:
- 学習者からの正答率データ。 これこそが真の測定です。一題ごとの回答結果は匿名で蓄積され続けており、不足しているのはデータ量だけです。そのデータが揃ったとき、この構造定規は実際のデータによって再較正されるか、あるいは置き換えられることになります。
- 推定スコアと公式スコアの差。 学習者が公式スコアを入力してくれるたびに、「私たちの推定スコアが公式スコアを何点以内の精度で追尾できているか」を検証できます。これに関しては数十件のサンプルが集まるだけでも引用価値が生まれます。
今後の展開
共通の基礎が整ったところで、各 Part の個別記事ではそれぞれのテーマに直接入ることができます:その Part の難易度が具体的にどこから生じているのか、そしてそれを知った上でどのように解答すべきか。
- Part 1:写真描写問題。難易度は文の「アスペクト(相)」——状態と動作の最小の対立にあります。
- Part 2:応答問題。難易度は設問のパターンと応答の間接性にあります。
- Part 3/Part 4:会話問題・説明文問題。難易度は推論問題、図表問題、意図問題にあります。
- Part 5:短文穴埋め問題。難易度はほぼすべて4つの選択肢の配列形式に依存します。
- Part 6:長文穴埋め問題。難易度は文脈の展開と文挿入問題にあります。
- Part 7:読解問題。難易度は言い換えの距離にあります——正解選択肢が本文と同じ語彙を繰り返すことはほぼありません。
各記事の後半では、その Part の難易度の要因を逆算し、解答戦略へと昇華させます:問題を難しくさせる手法のすべてが、正解がどこに隠されているかを予告しています。