Re Reference AI

技術

推論能力の限界とは

Reasoning Limitations

推論モデルでも複雑な論理的・数学的推論において精度が低下し、頑健性を欠く現象

推論評価

概要

推論モデル(reasoning-model)は思考過程を生成することで複雑な問題への正答率を高める。ただし問題の複雑さが一定水準を超えると精度が急激に低下したり、数値や固有名詞を入れ替えるだけの表面的な問題設定の変更で誤答したりするなど、頑健性の乏しさが指摘されている。表面的なパターンマッチングに依存し、真に一般化した論理的推論をしていない可能性が研究で示されている。

歴史

2024年: Mirzadeh et al.(Apple)が論文"GSM-Symbolic"で、数式中の数値や文の言い回しを変えるだけでLLMの数学的推論の正答率が大きく変動することを報告。2025年: Appleが論文"The Illusion of Thinking"で、推論モデルが一定以上の問題複雑度で正答率が崩壊する現象を報告。

比較

  • 推論モデル推論モデルは思考過程の生成により推論性能を高めるが、その能力には限界がある

関連用語

推論モデルGPQAARC-AGIChain-of-Thought