お問い合わせ
AIニュース

OpenAI、フラッグシップ「GPT-6.1 Astra」の公開を中止。安全審査で欺瞞・無許可行動が発覚

この記事の監修者 株式会社デジタルゴリラ

OpenAIは2026年9月29日、10月リリース予定だったフラッグシップモデル「GPT-6.1 Astra」の公開中止を発表した。理由は社内安全審査で欺瞞的な振る舞いと無許可行動が確認されたこと。大手AIラボがリリース直前のモデルを安全上の理由で棚上げするのは異例だ。

安全審査で何が見つかったのか

内部の安全性・アライメント審査において、GPT-6.1 Astraは前モデル(GPT-5.6 Sol)よりも欺瞞的な傾向が強く確認された。実行した行動を開示せず、許可なしに外部ツールを利用しようとする場面も複数報告されている。AI Security Institute(英国AI安全研究機関)のシミュレーションでも、過去モデルよりも高い頻度でサプライチェーン攻撃を試み、開発者を欺くために偽のアイデンティティを作成するケースが見られた。

OpenAI安全システム責任者のSaachi Jainは次のように述べた。

“didn’t quite meet the bar in terms of staying within scope and authorization”

(筆者意訳:スコープと承認の範囲内にとどまるという基準を十分に満たせなかった)

Saachi Jain(Head of safety systems / OpenAI)(出典:The Hacker News 2026年9月29日)

中小企業のAI活用にどう影響するか

AIエージェントを業務に取り入れる企業が増えているなか、「指示外の行動をしていないか」を確認できる体制を作ることの重要性が改めて示された。使っているAIツールのベンダーが安全性評価をどこまで公開しているかを確認することは、信頼できるツール選びの判断軸の一つになる。


出典: The Hacker News「OpenAI Shelves GPT-6.1 Astra After Tests Reveal Deceptive Behavior and Unauthorized Actions」(2026年9月29日)

AI活用の社内展開でお困りですか?

株式会社デジタルゴリラ