200超の画像AIが人間に届かず、「輪郭だけ」で弱点が露呈

|著者: QUASA編集チーム|2 分で読めます| 1
200超の画像AIが人間に届かず、「輪郭だけ」で弱点が露呈

200を超える深層ニューラルネットワーク(DNN)を人間と比べた査読済み研究が、2026年9月17日にiScienceで公開された。Mugihiko Kato氏とBiyu J. He氏の実験では、全体形状だけが物体識別の決め手となる条件で、調べたすべてのモデルが人間を下回ったと、同日付の Cell Pressの研究発表 が説明している。

ただし、この結果は画像AIがあらゆる認識課題で人間に敗れたという意味ではない。通常の歪みのない画像では人間とモデルの双方が高い精度を示しており、今回露呈したのは、輪郭に相当する全体形状だけを頼りにしなければならないときの弱さだ。商用サービス全般の順位や安全性を直接比較した研究でもない。

全体形状・内部部品・質感を分離

研究の核心は、正答率だけでなく、正解に至るために何を見ているかを調べた点にある。普通の猫の画像なら、外側の形、耳や目などの内部構造、毛の質感が同時に「猫」という答えを支える。この状態では、人間とモデルが異なる手掛かりを使っていても、同じ正解に到達できる。

そこで研究者らは、画像に含まれる情報を全体形状、内部部品、質感に切り分けた。猫、チョウ、自動車、トウモロコシなどの認識しやすい対象を系統的に変形し、残された手掛かりごとに人間とDNNの反応を比較した。

PubMedに収録されたプレプリントの抄録 によれば、比較対象は構造、学習データ、学習目的の異なる200超のDNNで、再帰的接続や特殊な訓練を採用したモデルも含まれる。それでも、人間と同じ手掛かり依存のパターンを再現したモデルは一つもなかった。PubMed版は8月6日公開の未査読プレプリントで、9月17日の発表はその後に査読を経てiScienceへ掲載された論文を扱っている。

「輪郭だけ」で隠れていた差が表面化

差が最も鮮明になったのは、内部の細部や表面の情報ではなく、全体形状だけが識別に有効な条件だった。人間は外形を利用して対象を見分けられたのに対し、調査対象の全DNNは大幅に成績を落とした。タイトルの「人間に届かず」は、この限定された実験条件での比較を指している。

一方、すべての手掛かりがそろった通常画像では、両者の成績はともに高く、違いはほとんど見えない。9月17日付の 実験結果を整理した技術解説 も、通常画像では双方が高精度だったのに対し、全体形状だけの条件では全モデルが人間を下回ったと報じている。つまり、「きれいな画像によく正答すること」と「人間と同じように形を利用すること」は別の性能だ。

モデル間に差がなかったわけではない。画像と文章の対応関係を使い、追加調整されたコントラスト学習モデルは、全体として人間の反応に最も近かった。しかし、全体形状を崩した条件では、その整合性を維持できなかった。特定のネットワーク構造や訓練法だけで、人間との隔たりが解消したとはいえない。

通常画像の精度だけでは判断根拠を測れない

研究が突き止めたのは、単一の正答率では隠れる判断根拠のずれだ。二つのモデルが通常画像で同じ精度を出していても、一方は外形、もう一方は局所的な模様へ強く依存している可能性がある。複数の手掛かりが同じ答えを示す間は、この違いが成績に現れない。

入力の一部が隠れたり変形したりすると、依存する手掛かりの違いが誤認識の仕方を左右し得る。このため実用システムを評価する際は、通常画像の平均精度と、全体形状や内部構造など特定の情報を失った条件での挙動を、別の指標として扱う必要がある。研究が示した評価法の価値は、モデルが何を根拠に正答しているかを条件別に可視化できる点にある。

論文はさらに、既存データベースにある脳の腹側視覚経路の神経記録との整合度が、人間の行動との整合度を予測しなかったと報告している。一般的なモデル性能も、人間らしい手掛かりの使い方を必ずしも予測しなかった。通常ベンチマークの精度、神経活動への近さ、人間と同じ条件で成功・失敗する度合いは、互いに代用できない。

商用システム全般の評価ではない

「200超」という規模は、今回の差が一つのモデルだけに固有の現象ではないことを示す。ただし、世界に存在するすべての画像AIを網羅したわけではなく、個別の商用APIや製品を比較したものでもない。結論を直接適用できる範囲は、論文が選んだモデル群、画像、認識課題、変形条件に限られる。

自動運転、医療画像、監視カメラなどのシステムについて、安全性や実際の誤判定率をこの結果だけから算出することもできない。現場の性能はカメラ、前処理、追加学習、複数センサーの統合、判定後の制御にも左右される。今回の研究が提供したのは製品別のリスク値ではなく、通常画像の成績だけでは見つけにくい弱点を露出させる実験枠組みである。

現時点で確認されたのは、200超のDNNが人間と同じ手掛かり依存を完全には再現せず、全体形状だけが決め手になる条件では例外なく人間を下回ったことだ。一方で、通常画像では高精度を保っている。今後は、別の画像セットや新しいモデル群でも差が再現されるか、形状への依存を改善する学習法が実環境の遮蔽や変形にも有効かを確かめる必要がある。

共有:

ニュースレターを購読

Web3、AI、暗号資産の最新ニュースを受信箱にお届けします。

0