記事一覧 · 公開日 2026-08-28
TOEICスコア予測の精度は?受験者4人が本番の公式スコアを送ってくれたので、数字を並べて計算してみました
8/16実施分のTOEICスコアが発表された当日、4人の受験者が本番の公式スコアを報告してくれました——これはハンディ990のスコア予測が、複数の本番スコアを使って初めて検証を受けた記録です。結論から言うと、リスニングは驚くほど正確で(4人中2人はわずか5点差)、リーディングにはそれぞれ名前のつく3つの系統的バイアスが存在し、4人のスコアの順位付けは完全に的中していました。この記事では、4人の日々の推定軌跡と4通の公式スコアレポートを突き合わせて徹底検証し、あわせてさらに難しい問い——予測が「収束する」とは、一体何を保証しているのか?——にもお答えします。
〈ハンディ990はどうやってTOEICスコアを推定しているのか〉の結びで、私たちはひとつの約束を掲げました。このスコア推定アルゴリズムは、自らの持つ不確実性に対して常に誠実である、と。約束を書くこと自体は簡単でした。なぜなら当時はまだ、誰もそれを検証できなかったからです。しかし、状況は変わりました——試験日を過ぎると、アプリは「手応えはどうでしたか?」と尋ねます。そして8/28の公式スコア発表日の朝、2時間足らずの間に4通の本番スコアが次々と届いたのです。4人とも創設メンバーで、全員が8/16の試験を受験していました。サンプルはわずか4人であり、この記事はその事実を最初から最後まで忘れません。しかし、4人という数字であっても、隠しようのないいくつかのパターンを浮かび上がらせるには十分でした。
4通のスコアレポート、1枚の表
「受験前推定」は、各受験者が試験前日に記録した推定スコアのスナップショット——つまり、試験会場に入る直前にアプリの画面に表示されていた数字です。
| 受験者 | 練習量 | 受験前推定(リスニング/リーディング) | 本番スコア(リスニング/リーディング) | 誤差 |
|---|---|---|---|---|
| A | 1,477 題 | 540(310/230) | 495(315/180) | 45点高く推定 |
| B | 731 題 | 685(395/290) | 760(400/360) | 75点低く推定 |
| C | 307 題 | 795(395/400) | 855(430/425) | 60点低く推定 |
| D | 2,697 題 | 815(460/355) | 895(495/400) | 80点低く推定 |
まずは全体像から:合計スコアの平均絶対誤差は65点(990点満点)、4人全員が80点以内の誤差に収まりました。そして4人のスコア順位——誰が誰より高く、どの程度の差があるかという順序——は完全に一致していました。当てずっぽうで4人の順位をすべて的中させる確率は1/24です。私たちはこの結果でシャンパンを開けるつもりはありませんが、少なくとも推定モデルが「相対的な位置関係」を正しく測定できていることを示しています。そして相対的な位置こそが、「目標スコアまであとどれくらい離れているか」という問いに対して真に求められている情報なのです。
しかし、本当に興味深い現象は、合計スコアをリスニングとリーディングに分解したときに現れました。
リスニングはなぜ「わずか5点差」と言えるほど正確だったのか?
4人のリスニングの誤差はそれぞれ+5、+5、+35、+35——平均絶対誤差は20点でした。参考までに、ETS自身の《TOEIC Listening and Reading Score User Guide》には、公式試験の各セクションの測定の標準誤差(SEM)は約25点であると明記されています——つまり、同じ人が翌週に公式試験を再受験しただけでも、単一セクションのスコアには元々これくらいの変動が生じるということです。私たちのリスニング予測の誤差は、公式試験が自らに対して持つ測定誤差と同程度です。
受験者Aは特筆に値します:推定リスニングスコア 310 に対し、本番スコアは 315 でした。さらに本人からの報告によると、前回受験した 7/28 の試験でも「リスニングのスコアが近かった」とのことでした。同一人物が2回受験し、2回ともほぼピンポイントで的中したことになります——これは単なる運とは言えないでしょう。
なぜリスニングはこれほど正確に予測できるのでしょうか? 私たちの出した答えは、少々拍子抜けするほどシンプルです:練習の条件と本番の条件が一致しているからです。リスニングのペースは音声ファイルによって決められており、自分ではコントロールできません。アプリでPart 3を解くときと、本番の試験会場でPart 3を解くときとで、受ける時間的プレッシャーは完全に同じです。推定スコアが測定しているのは「この条件下でのあなたの正答率」であり、本番の試験もまさにその条件そのものなのです。
【8/29 追記】 記事公開の翌日、5通目のスコアレポートが届きました:受験前推定810(リスニング435/リーディング375)に対し、本番スコアは805(リスニング405/リーディング400)。合計はわずか5点差、5人の順位付けも引き続き全員的中です——しかし、リスニングの祝杯はまだ早い:今回は初めてリスニングを30点も高く見積もっていました。原因は本人が先に言い当てていました。報告には「リスニングは何度か聞き直すことがあるので、スコアが不正確になるかもしれない」とあり——まったくその通りです。繰り返し再生がリスニングに与える影響は、時間無制限がリーディングに与える影響と同じ:練習条件が本番より緩ければ、推定は緩い側へ偏ります。合計が完璧に見えたのは、同時にリーディングが25点低く見積もられていたからです(この受験者の推定は試験前3週間で475から830まで駆け上がり、遅行指標は例によって追いつけませんでした)。2つのバイアスがちょうど相殺されたのです。というわけで、本節の「練習の条件と本番の条件が一致している」という一文には、但し書きが必要になりました:各クリップを1回だけ再生するなら、の話です。
一方、リーディングはまったく逆でした。

リーディングにおける3つの誤差、それぞれに名前がある
4人のリーディングの誤差は−50、+70、+25、+45——平均絶対誤差は48点でした。これはリスニングの2倍半近くに達し、誤差の方向も上下にばらついています。4人のデータを詳細に分析すると、3つの系統的なバイアスがそれぞれ姿を現しました。
1つ目:時間無制限の実力 ≠ 時間制限下のパフォーマンス。 受験者Aのリーディングスコアは50点高く見積もられていました。そして7/28の試験でも全く同じ展開(「リーディングはかなり差があった」という本人の言葉)を辿っていました。普段のアプリ学習では時間を気にせず解けるため、Part 7の長文であってもじっくりと腰を据えて最後まで読むことができます。しかし本番のリーディングセクションは75分で100問を解かなければならず、解き終わらなければ容赦なく失点します。受験者Dもフィードバックの中で、リーディングは「少し急いだ(もう少しで解き終わらないところだった)」と書いていました——895点を取った本人でさえ焦ったのです。推定スコアが測定しているのは「時間無制限での正答率」であり、本番が試すのは「時間制限下での正答率」です。この2つの間には、「処理速度(スピード)」という独立したスキルが横たわっています。
2つ目:弱点を集中的に解けば、推定スコアも弱点に引っ張られる。 受験者Bは75点低く推定されていました。そして本人が報告の中で見事な自己分析をしてくれていました:「苦手な部分(Part 4・5・6)を集中的に練習していたので、スコアが少し低く出たのだと思います。」まさにその通りです。本人は試験前の演習を最も苦手な問題形式に集中させていました。その結果、スコア推定器に入力された解答履歴は、意図的に弱点ばかりを集めたサンプルになっていたのです——しかし本番の試験は苦手な問題ばかりが出るわけではありません。これは選択バイアス(selection bias)の教科書通りの事例であり、今回はその教科書を受験者本人が書いてくれました。(ちなみに、本人は別のスコア予測アプリも併用しており、そちらでは640と推定されていました。どちらのアプリもこの受験者を過小評価しており、当アプリは75点低く、もう一方は120点低かったことになります。真面目に試験対策をしている学習者を過小評価してしまうのは、どうやらこの業界全体の持病のようです。)
3つ目:推定スコアは構造上「遅行指標」であり、学習者は日々成長している。 受験者Cの演習量は307題と4人の中で最も少なかったにもかかわらず、誤差は2番目に小さい結果となりました。さらに興味深いのは、本人の持つ2つの本番スコアというアンカーです:6月の無対策での受験が720、8月の本番が855——2か月で135点アップしています。当アプリの日々の推定スコアは、この期間に735から795へと上昇していました:スタート地点は正確で(2か月前の実スコア720に対し735)、方向性も正しいものの、急激な伸びの傾きには追いつけませんでした。これはシステムの欠陥に対する言い訳ではなく、設計上必然的に生じる動作です。推定器は古いデータを時間経過とともに減衰させるため、「直近数週間のあなたの平均的な実力」を測定します。しかし試験会場に入るのは、「試験当日のベストなあなた」です。成長スピードが速い人ほど、この2つの乖離は大きくなります。さらに受験者Dには、4つ目の小さなバイアスである天井付近での圧縮(ceiling compression)が重なりました。そのリスニング推定スコアは、直前1週間にわたって460に張り付いたままでした(途中で一度だけ455まで下がりました)。90%以上の正答率領域では、サンプリングノイズがスコアの刻み幅を上回ってしまい、それ以上数値を上げられなくなるためです。そして本番のリスニングスコアは495。満点でした。
それで、推定スコアは「収束」したのか?
これこそが、私たちが最も答えたかった問いです。そして誠実な答えはこうです:「収束」には2つの意味があり、私たちは1つ目を達成し、2つ目は半分しか達成できていません。
1つ目の意味は、統計的な収束です:推定値のブレが収まること。この点については、4人全員が達成しました。試験直前の2週間における4人の日次推定合計スコアの標準偏差は、それぞれ19、34、20、22点でした——そして34だった受験者Bの数値はノイズによるものではなく、本人のリスニング推定スコアが2週間で320から395へと着実に上昇したため、その上昇トレンドが標準偏差に含まれた結果です。比較として、〈ハンディ990はどうやってTOEICスコアを推定しているのか〉で解説した旧方式(固定EMA)では、常に約±11パーセントポイントのブレが残り続けます。しかし現在の手法では、数百問解いた後は日ごとの変動がわずか数点にとどまります。アプリが表示する不確実性の範囲も実際に狭まり、受験者Bの受験前の画面には「リスニング395±28」「リーディング290±20」と表示されていました。
2つ目の意味は、真の値への収束です。リスニングはこれを達成しました:4つの誤差はすべて不確実性区間の妥当な範囲内に収まっています。しかしリーディングは達成できませんでした:受験者Bの本番リーディングスコア360は、290±20の範囲をまるまる50点も外れていました。ここで明確にしておかなければならない点があります——アプリが表示する±が測定しているのはサンプリングの不確実性に過ぎません。「もし本番の問題が普段解いている問題と似ていて、あなたの実力が直近数週間と同じなら、スコアはこの範囲に収まる」という意味です。時間制限のプレッシャーや、弱点に特化した練習、そしてあなたが日々進歩しているという事実について、モデルは何ひとつ把握していません。収束は正しさを意味しません。それは前提条件が満たされているときの正しさを保証しているに過ぎず、今回の4人の受験者は、奇しくも全員がその前提条件のどれかひとつを破っていたのです。

私たちが変更すること(そして変更しないこと)
リスニングは変更しません。練習と本番の条件が一致しており、誤差も公式の SEM と同水準であるため、これ以上の結果は望めないからです。
リーディングの3つのバイアスのうち、2つについてはすでに対応するツールが存在しています。私たちがこれまで十分に説明しきれていなかっただけです:時間制限の問題については、タイマー付きの模擬試験で練習し、Part 7の読解スピードそのものを専用メニューで鍛えることができます(〈速読を学べば、私のリーディングは救われるのか?〉)。成長による遅行問題については、試験後に本番のスコアをアプリに入力することで、公式スコアレポートをもとに推定値を再較正できます(〈TOEIC公式認定証はスコアだけではない〉)。最も対処が難しいのは、弱点特化によるバイアスです——試験対策としてもっとも正しい行動(弱点の克服)をとったユーザーにペナルティを与えるのは本末転倒ですから、修正は演習側ではなくスコア推定側で行わなければなりません。私たちは存在しないデータを捏造することなく、このバイアスを補正する方法を研究しています。それまでの間、ここで率直にお伝えしておきます:もし試験直前の数週間を弱点補強に費やしていたなら、あなたの真の実力は推定スコアよりも高い可能性が高いです。
ちょっと待って——この数字を鵜呑みにする前に
第一に、n=4であること。これは少数の事例集であり、検証研究ではありません。私たちはこの4件のデータをもとにパラメータをひとつも変更していません。第二に、スコア報告は任意であるため、サンプルは本質的に「言いたいことがある人」に偏ります——推定より良いスコアを取った人の方が、喜んで報告に戻ってきやすい傾向があります(4人中3人がそうでした)。そのため、「推定スコアが控えめに出る」という傾向自体が、報告バイアスの反映である可能性があります。第三に、4人全員が同じ日程の試験を受験したこと。異なる実施回ごとの難易度等化(equating)による誤差は、今回のデータからは全く見えません。第四に、仮にモデルが完璧だったとしても、ETS自身のセクションごとのSEM自体が25点あります——公式試験以上に正確に公式試験の結果を予測することは、数学的に勝ち目のないゲームです。私たちの目標はスコアを予言することではなく、「自分の現在地はどのあたりか、目標まであとどれくらいか、次に何を練習すべきか」に誠実に答えることです。この基準に照らし合わせれば、4通のスコアレポートは私たちに合格点と、2つの明確な宿題、そして今後もスコアレポートを集め続ける理由を与えてくれました。
もしあなたも 8/16 またはそれ以降のTOEICを受験されたなら——結果が出たとき、アプリが手応えを尋ねてきます。ぜひ結果を教えてください。この記事の続編を書くのは、あなたのスコアレポートです。
スコア推定カードはハンディ990のホーム画面にあります。「推定スコアの計算方法」をタップすると、各セクションの不確実性区間と日々の推移グラフを確認できます。推定アルゴリズムの完全な解説は〈ハンディ990はどうやってTOEICスコアを推定しているのか〉をご覧ください。受験後に本番スコアを入力して再較正する仕組みについては〈TOEIC公式認定証はスコアだけではない〉を、リーディングの時間制限トレーニングについては〈速読を学べば、私のリーディングは救われるのか?〉をご覧ください。