BrainRank IQテストIQテストBrainRankログイン

AIのIQはいくつ?140超のスコアが人間と比較できない理由

AIのIQはいくつ?140超のスコアが人間と比較できない理由

要点: AIのIQとして報告される数値は、人間向けに標準化されたIQテストをAIに解かせ、人間の基準集団に照らして換算した値です。公開されているテストでは140を超えるモデルもありますが、同じ形式でも非公開の問題に差し替えるとスコアは20〜40ポイント下がると報告されています。IQは人間集団内での相対位置を表す指標であり、AIに当てはめても人間と同じ意味は持ちません。

AIのIQとして報じられる数値は、人間向けに作られたIQテストをAIに解かせ、人間の基準集団に照らして換算したものです。公開されているテストでは140台のスコアも報告されていますが、同じ形式でも非公開の問題に差し替えるとスコアは大きく下がります。この記事では、その数値が何を表していて、何を表していないのかを切り分けます。

AIのIQスコアはどうやって出しているのか

代表的なのはTracking AIが継続している測定です。メンサ・ノルウェーが一般公開している35問の図形パターン問題を各モデルに解かせ、正答数を人間の基準データでIQ相当の数値に換算しています。問題形式はレーヴン漸進的マトリックスと同系統で、言語に依存しない流動性推理を測る設計です。

2026年8月時点では、複数のモデルが140以上を記録したと報告されています。人間の分布に当てはめればIQ140は上位0.4%前後の位置です(IQ140の割合)。この「上位◯%」という表現がそもそも人間集団を前提にしている点が、後で効いてきます。

557085100115130145
IQ140以上の位置(平均100・SD15): 上位約0.38%。

公開テストと非公開テストで20〜40ポイントの差

同じサイトは、インターネット上に存在しない非公開の問題セット(メンサ会員が作成したもの)でも同じモデルを測っています。こちらでは上位モデルでも120台にとどまり、公開テストとのあいだに20〜40ポイントの差が報告されています。

この差を説明する最も自然な仮説は、学習データへの露出です。公開されている問題と解説はモデルの学習データに含まれている可能性があり、その状態で高いスコアが出ても、初見の問題を推論で解いた証拠にはなりません。ベンチマークが訓練データに混入する現象は汚染(contamination)と呼ばれ、AI評価全体で共通の課題です。

人間のIQテストでも事情は同じです。事前に同じ問題を解いた人のスコアは上がりますが、それは知能が上がったのではなく測定が壊れただけです。この点は無料IQテストは当たるのかでも扱っています。

IQをAIに当てはめられない3つの理由

  • 基準集団がない: IQは同年齢の人間集団の中での相対位置を表す設計です(IQとは何か)。AIはその集団の一員ではないため、換算値は「人間ならこの位置」という比喩以上の意味を持ちません。
  • プロフィールの形が違う: 人間では分野ごとの成績が互いに相関し、その共通部分がg因子としてまとまります。AIは得意・不得意の落差が人間と大きく異なり、ひとつの数値に集約してよいという前提が成り立ちません。
  • 測っているのは1形式だけ: 35問の図形問題は流動性推理の一側面にすぎません。WAISのような臨床検査が複数の下位検査を組み合わせるのは、単一形式では全体を代表できないからです。

この3つは、国別平均IQの単純比較が難しい理由(国別平均IQの読み方)とほぼ同じ構造です。標準化の前提が崩れた瞬間に、数値は意味を失います。

それでもスコアの推移は情報になる

人間との比較が成立しないからといって、測定そのものが無意味なわけではありません。同じ問題セットで同じ手順を続ければ、モデル間の比較や時期による変化は追えます。実際、公開テストと非公開テストの差そのものが、汚染の度合いを見積もる手がかりになっています。

問題は読み方です。「AIのIQは140」を人間との比較として読むと誤りですが、「この形式の35問でこのモデルはこれだけ正答した」という事実として読むなら有効な情報です。数値そのものより、何を測った数値かを常に添えて読むことが必要です。

AIのスコアは人間のスコアの意味を変えない

AIが図形問題を解けることは、人間がその問題を解く意味を減らしません。IQテストは人間の認知の相対的な位置を知るための道具であり、機械との勝敗を決める競技ではないからです。

むしろ実務で問われるのは、AIの出力を自分で検証できるかどうかです。この論点はAIと認知的オフローディングと批判的思考の鍛え方で詳しく扱っています。

自分の数値を人間の基準で確かめる

BrainRankの無料IQテストは空間推理・パターン認識・論理的推論・分類能力の4分野・20問(約10分)を項目反応理論(IRT)で採点し、平均100・SD15スケールの推定IQと分野別の傾向を返します。基準集団は人間なので、この記事で扱った換算の問題は生じません。結果は娯楽・自己理解のための推定値であり、医療・診断目的の検査ではありません。

よくある質問

ChatGPTのIQはいくつですか?
公開されているメンサ・ノルウェーのテストでは140台のスコアが報告されています。ただしこれは35問の図形パターン問題の正答数を人間の基準で換算した値で、非公開の問題に差し替えると大きく下がります。「そのモデルの知能が140」という意味ではありません。
AIのIQが人間より高いなら、AIのほうが賢いのですか?
その比較は成立しません。IQは同年齢の人間集団の中での相対位置を表すよう設計された指標で、AIはその基準集団の一員ではないためです。数値が並んでいても、同じ物差しで測った値ではありません。
なぜ非公開のテストだとスコアが下がるのですか?
公開された問題とその解説は、モデルの学習データに含まれている可能性があるためです。ベンチマークが訓練データに混入することは汚染(contamination)と呼ばれ、AI評価全般で共通の課題になっています。

この記事をシェア

関連記事

編集・免責事項

BrainRank編集部

本記事はBrainRank編集部が、CHC理論・項目反応理論(IRT)など心理測定に関する学術文献を参照して執筆・編集しています。記載している統計・割合は、平均100・標準偏差15の正規分布モデルに基づく算出値です。

本サイトのテストは娯楽・自己理解を目的とした推定値を提供するものであり、医療・臨床目的の検査や公式な心理検査(知能検査)ではありません。

出典の基準・訂正方針 →