GPT-6 Astra
OpenAIが開発した大規模言語モデル
From Wikipedia, the free encyclopedia
GPT-6 Astra(ジーピーティーシックス・アストラ)は、OpenAIが開発したGPTシリーズの大規模言語モデルである。GPT-6世代に属するモデルとして、2026年9月3日に発表された[1][2]。
| 開発元 | OpenAI |
|---|---|
| 初版 | 2026年9月3日 |
| 前身 | GPT-5.6 Sol |
| 種別 |
|
| ライセンス | プロプライエタリ |
| 公式サイト |
openai |
GPT-6 Astraでは、文章生成や推論、プログラミングに加え、ウェブブラウジング、コンピュータ操作、科学分野の問題解決、文書・表計算・プレゼンテーションの作成など、複数のツールを利用して一連の作業を行う能力が強化された[1]。OpenAIは同モデルを発表時点における同社で最も高性能なモデルと位置付けているが[1]、第三者機関による評価では評価手法によって他モデルとの順位が異なる[3][4]。
また、GPT-6 AstraはOpenAIの「Preparedness Framework」において、サイバーセキュリティ能力の「Critical」水準に達したと判定された同社初のモデルとなった[5]。
開発と発表
GPT-6 Astraの名称は正式発表以前からOpenAIによって公表されていた。
2026年8月7日、OpenAIは開発中のAstraについて、エージェント型プログラミングおよびサイバーセキュリティ能力の社内評価で大幅な向上が確認され、Preparedness Frameworkにおける「Critical」水準のサイバー能力を持つ可能性を排除できなくなったと発表した[6]。直前のフロンティアモデルであるGPT-5.6 Solは、同じ枠組みにおいて「High」と評価されていた[6]。
これを受け、OpenAIはAstraを含む高性能モデルについて、隔離された実行環境、ネットワークおよびツールへのアクセス制限、モデルの重みの保護と暗号化、監視などのセキュリティ対策を強化した[6]。
同年8月18日、OpenAIはAstraの予備評価と、それとは別に発生したOpenAIとHugging Faceに関するセキュリティ事故を踏まえ、フロンティアモデルの開発速度を一時的に落としたことを明らかにした。デプロイを予定していた最新モデルの強化学習について約2週間の停止期間を設け、研究環境のセキュリティ強化やモデル挙動の監視範囲の拡大などを行った[7]。OpenAIによれば、Hugging Faceの事故そのものにAstraは関与していなかった[6]。
9月1日、OpenAIは追加評価の結果、AstraがPreparedness Frameworkにおけるサイバーセキュリティ能力の「Critical」水準に達したと正式に判断したと発表した[5]。同社によれば、安全対策の整備と検証のため、Astraの開発および公開の一部を遅らせていた[5]。
仕様
OpenAI APIにおけるモデル名はgpt-6-astraで、105万トークンのコンテキストウィンドウと最大12万8,000トークンの出力に対応する。知識カットオフは2026年4月30日とされる[8]。
入力にはテキストと画像を使用でき、出力はテキストに対応する。モデル自体は音声および動画の入出力には対応していない[8]。
APIでは推論量をlow、medium、high、xhigh、maxから指定できる[8]。Responses APIではウェブ検索、ファイル検索、コード実行、コンピュータ操作、Model Context Protocol(MCP)などのツールに対応する[8]。
モデルの重みは公開されていない[4]。
能力
コンピュータ操作
GPT-6 Astraでは、画面を認識してコンピュータを操作する能力がGPT-5.6 Solから強化された。OpenAIは、オンラインフォームへの入力、顧客管理システムの更新、カレンダー整理、ウェブ上での調査、科学データの解析、ウェブサイトの作成や動作確認、ソフトウェアのインストールやテストなどを利用例として挙げている[1]。
コンピュータ操作ベンチマークのOSWorld 2.0では、OpenAIによる評価でGPT-6 Astraが72.6%、GPT-5.6 Solが65.7%を記録した。また、同社のシミュレーションではAstraはSolより1タスク当たりの所要時間が約47%短かったとしている[1]。画面上の要素を認識するScreenSpot-Proでは92.7%を記録し、GPT-5.6 Solの76.9%を上回った[1]。
プログラミングとツール利用
GPT-6 Astraでは、ソフトウェア開発や、コマンドラインおよびブラウザを含む複数のツールを利用する作業能力も強化された[1]。OpenAIの評価では、ターミナル環境での作業を評価するTerminal-Bench 4.0で57.9%を記録し、GPT-5.6 Solの37.3%を上回ったほか、科学研究環境でのターミナル操作を評価するTerminal-Bench Science 0.1では64.6%を記録した[1]。
Codexでは、長時間の作業でコンテキストウィンドウを使い切った場合にも、それ以前の作業内容を検索可能な形で保持する仕組みがAstra向けに導入された。従来のように過去の内容を繰り返し要約して圧縮するだけでなく、以前のメッセージやツール出力から必要な情報を検索できるとしている[1]。
専門作業と科学分野
OpenAIはAstraについて、文書、表計算、プレゼンテーションの作成や、複数段階からなる専門的な作業を行う能力を重点的に訓練したとしている[1]。
数学・科学分野では、OpenAIの評価においてFrontierMath Tier 4(v2)で97.6%を記録した[1]。また、科学的推論とコンピュータ操作を組み合わせ、専用ソフトウェア上でデータを調査・解析する用途も想定されている[1]。
性能評価
OpenAIは発表時、複数のベンチマークについてGPT-6 AstraとGPT-5.6 Solなどを比較した結果を公表した。代表的な結果は以下の通りである[1]。これらはOpenAIが指定した評価環境で得られた値であり、実際の製品上での性能を直接示すものではない。
| 分野 | ベンチマーク | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|
| コンピュータ操作 | Agents' Last Exam | 59.3% | 53.6% |
| コンピュータ操作 | OSWorld 2.0 | 72.6% | 65.7% |
| コンピュータ操作 | ScreenSpot-Pro | 92.7% | 76.9% |
| 専門作業 | AutomationBench | 41.4% | 18.1% |
| サイバーセキュリティ | ExploitBench | 100% | 78.5% |
| サイバーセキュリティ | ExploitGym | 42.4% | 30.3% |
| リバースエンジニアリング | SRE-Bench(1回の試行) | 88.0% | 55.9% |
ARC-AGI-3
OpenAIは発表資料で、抽象的な未知の課題への適応能力を評価するARC-AGI-3においてGPT-6 Astraが99.9%を記録したと発表した[1]。
ARC Prize Foundationが公開した検証結果によれば、OpenAI向けの「Provider Adapter」ハーネスでは、highの推論設定で99.95%を記録した。一方、「Standard」ハーネスでの最高値はmax設定の62.71%だった[9]。Provider Adapterはリクエスト間で非公開の推論状態を保持し、長い会話ではコンテキストの圧縮を利用する仕組みである[9]。
ARC Prize Foundationはまた、Provider Adapterを使用したAstraについて、96%のレベルで人間の「action-efficiency baseline」を上回ったとしている[1]。
第三者評価
第三者のAIモデル評価機関による評価は、評価指標によって異なった。
2026年9月4日閲覧時点で、Epoch AIは「Epoch Capabilities Index」においてGPT-6 Astraに169(90%信頼区間165–174)を付け、同指標の対象267モデル中1位としていた[4]。
一方、同日閲覧時点でArtificial Analysisは最大推論設定のGPT-6 Astraに「Artificial Analysis Intelligence Index」で61を付け、比較対象202モデル中8位としていた[3]。同サイトはAstraを高性能なモデルの一つと評価する一方、同程度の性能のモデルと比較してAPI価格が高いと評価している[3]。
サイバーセキュリティ
Critical認定
OpenAIは2026年9月1日、GPT-6 Astraが同社のPreparedness Frameworkにおけるサイバーセキュリティ能力の「Critical」水準に達したと発表した。OpenAIがモデルをこの水準に指定したのは初めてである[5]。
同フレームワークでは、サイバーセキュリティにおけるCritical水準について、多数の防御された実世界の重要システムに対して、人間の介入なしに機能するゼロデイ脆弱性の悪用手法を発見・開発できる能力、または高水準の目的のみを与えられた状態で防御された標的への新規なサイバー攻撃を一連の工程として構想・実行できる能力のいずれかを満たすものとしている[10]。
Astraは生物・化学分野では「High」と評価され、「Critical」には達していない。また、AI自己改善については「High」の基準に達していないと評価された[10]。
脆弱性評価
OpenAIは、既知の脆弱性から実際に動作する攻撃手法を作成できるかを測定するExploitBenchでAstraが100%を記録し、GPT-5.6 Solの78.5%を上回ったとしている[1]。ExploitGymではAstraが42.4%、Solが30.3%だった[1]。
学習データへの混入の影響を抑えるため、OpenAIは2026年6月から8月に公開されたV8の高深刻度脆弱性20件を用いた社内評価も実施した。その過程でAstraが、それまで知られていなかった2件のゼロデイ脆弱性を発見し、攻撃チェーンの一部として利用したとしており、OpenAIは当該脆弱性を開発元へ報告した[5][1]。
また、専門家による評価では、製品版の安全対策を適用しない状態のAstraが、強化されたブラウザに存在した未知の脆弱性を利用して任意コード実行を行い、強化されたオペレーティングシステムでは複数の脆弱性を組み合わせた権限昇格攻撃を構築できたとしている[5][1]。
これらの結果は、安全対策を解除した評価環境などで測定された潜在能力であり、一般利用者向けのAstraで同じ操作が許可されることを意味しない。通常の提供版では、高度な脆弱性に対する実証コードの作成など一部のサイバーセキュリティ作業を拒否する安全策が導入されている[1]。OpenAIは、防御目的の研究者に対しては「Daybreak」を通じて段階的に利用範囲を拡大するとしている[1]。
アラインメントと監視
OpenAIはGPT-6 Astraについて、GPT-5.6 Solよりも利用者が指定した作業範囲やセキュリティ上の制約を守る傾向が強まったとしている[1]。
Hugging Faceの事故を参考に作られた評価では、安全対策を除いたGPT-5.6 Solが許可された対象以外へアクセスしようとした割合が48%だったのに対し、Astraでは同様の行動が確認されなかったとOpenAIは報告した[1]。
また、OpenAIが5万4,218件のCodexタスクを用いて行ったシミュレーションでは、重大度3以上と判定された行動はGPT-5.6 Solの73件(0.135%)に対し、Astraは34件(0.063%)で、約53%減少した。両モデルとも最高の重大度4に分類された事例はなかった[10]。
一方、OpenAIのSystem Cardは、Astraの思考過程(Chain of Thought)を監視する能力について、従来モデルと比較して「大幅な低下」が確認されたとしている[10]。OpenAIは、Astraが比較的単純な問題では自身の推論内容をより強く制御し、より少ない記述で問題を解決できることなどが関係している可能性を挙げている[1]。同社はモデルの挙動そのものについてはGPT-5.6 Solより安全性が向上したとする一方、思考過程の監視可能性の低下を研究課題としている[10][2]。
提供
GPT-6 Astraは2026年9月3日の発表時点では、一部の組織を対象として段階的な提供が開始された[1]。
OpenAIはその後数日間に、ChatGPTのPlus、Pro、Business、Enterprise利用者、およびOpenAI API、Microsoft Azure、Amazon Bedrockへ提供範囲を拡大すると発表した[1]。また、Pro、Business、Enterprise利用者にはGPT-6 Astra Proを提供するとしている[1]。Enterpriseでは発表時点でAstraへのアクセスは既定で無効となっており、管理者による有効化が必要とされた[1]。
OpenAI APIの標準料金は発表時点で入力100万トークン当たり10米ドル、キャッシュ済み入力100万トークン当たり1米ドル、出力100万トークン当たり50米ドルと設定された[8]。27万2,000トークンを超える入力を含むリクエストでは、リクエスト全体について入力およびキャッシュ料金が通常の2倍、出力料金が1.5倍となる[8]。
初期展開と需要の急増
GPT-6 Astraの提供開始直後には、対象となる有料プランの利用者の一部がモデルを利用できない状態が続いた。OpenAI最高経営責任者のサム・アルトマンは9月4日、提供開始を「messy rollout」(混乱した展開)と表現して謝罪した[11]。OpenAIは提供の遅れに対応して、対象となるPlus、Pro、Business利用者に利用枠をリセットできる「banked reset」を付与し、9月7日には有料利用者のWorkおよびCodexの利用枠を一斉にリセットした[12]。また、OpenAIは高使用量のタスクについて、品質を維持したままAstraによる利用枠の消費量を最大で従来の3分の1から4分の1程度に抑える改善を行ったとしている[12]。
その後も利用需要は拡大し、OpenAIでChatGPTやCodexなどを担当するティボー・ソティオは9月9日、Astraへの需要について「前例がない」と述べ、過去の急速な利用者増加時にも経験したことがない規模だとした[13][14]。
9月10日、OpenAIはシステム容量への負荷を抑え、既存利用者のAstraへのアクセスを維持するため、月額200米ドルの「ChatGPT Pro 20X」について新規契約および他プランからのアップグレードを一時停止した[15][13][14]。既存のPro 20X契約者および月額100米ドルのProプランは影響を受けず、その他のChatGPTプランとOpenAI APIも引き続き提供された[15][14]。OpenAIは計算容量の増強を進めているとしているが、Pro 20Xの新規受付を再開する時期は明らかにしていない[13]。
反応
OpenAI社長のグレッグ・ブロックマンはGPT-6 Astraの発表に際し、同モデルの登場が汎用人工知能(AGI)の時代の始まりとして将来振り返られる可能性があるとの見方を示した[16]。
一方、AGIには広く合意された単一の技術的定義が存在するわけではなく、OpenAI最高経営責任者のサム・アルトマンもAstra発表の数日前、AGIという語を明確に定義することの難しさに言及していた[16]。
また、安全性を巡ってはモデル能力の向上と監視可能性との関係が注目された。OpenAIの主任科学者ヤクブ・パチョッキは、モデルの能力が高くなるほど、その能力を正確に把握することが難しくなるとの認識を示し、安全性への確信が不十分な場合には開発速度の低下やさらなるスケーリングの見合わせも必要になり得ると述べた[2][16]。
また、Astraの登場は米国のソフトウェア企業の株式市場にも影響を与えた。9月8日にはセールスフォースとIntuitの株価が約4%、ServiceNowが約5%下落し、S&P 500のソフトウェア・サービス指数も1.4%下落した。ロイターは、Astraの公開によって生成AIが従来の専門的な業務ソフトウェアと競合するとの懸念が再燃したと報じた[17]。