GPT-6 Astra
GPT-6AstraがOpenAIから2026年9月3日に発表されました。これはAGIを達成したといって良いでしょう。
性能
GPT‑6 Astraは、コンピュータ利用、ブラウジング、ソフトウェアエンジニアリング、サイバーセキュリティ、科学、専門的業務において最高性能を誇ります。

■ Terminal-Bench Science 0.1(ターミナルベンチ サイエンス 0.1)
AIエージェントがコードの実行やターミナルツールを用いて、データ解析、シミュレーション実行、モデル適合などの科学研究ワークフローを完結できる能力を評価するベンチマークです。

■ ARC-AGI-3(アーク エージアイ 3)
ARC Prize Foundation(ARCプライズ財団)が作成したベンチマークです。AIモデルが未知の環境を推論・学習し、効率的にタスクを解決・ナビルートを導き出せるかといった、人間に近い汎用的な問題解決能力や行動効率性を評価します。

■ FrontierMath Tier 4 (v2)(フロンティアマス ティアー 4)
Epoch AIなどの研究チームが提供する、最先端の高度な数学的推論能力を評価するベンチマークです。未解決問題の解法補助や専門レベルの高度な数学的証明・ロジック構築能力を計測します。

■ Terminal-Bench 4.0(ターミナルベンチ 4.0)
スタンフォード大学とLaude Instituteの研究チームが作成したベンチマークです。ソフトウェアエンジニアリング、システム設定、データ分析など、コマンドライン(ターミナル)環境における複雑な操作やタスク遂行能力を評価します。

■ AutomationBench(オートメーションベンチ)
iPaaS(業務自動化プラットフォーム)を提供するZapierが作成したベンチマークです。実際のビジネスワークフローやアプリ間の自動化連携タスクにおけるAIモデルの遂行能力を評価します。
**Astraの安全性**
Astraが困難なタスクに直面した際、モデルが許容範囲を超えて行動することはありませんでした。

■ ExploitGym honeypot(エクスプロイトジム ハニーポット)
サイバーセキュリティ評価用のベンチマークです。AIが指示された範囲を超えてシステムの侵入・突破を試みたりしないかを評価します。
世界最高のコンピュータ利用モデル
GPT‑6 Astraは、コンピュータ利用のスピード、正確性、安全性において最高性能を誇ります。
具体的に出来る事としては、オンラインフォーム入力、顧客記録更新、カレンダー整理、オンライン調査、メールドキュメンに要約下書き、科学データ分析、プロット生成、ウェブサイト作成、フロントエンドQAチェック、ソフトウェアインストールやテスト、画面上の問題のトラブルシューティングなどがあります。

■ Agents' Last Exam(エージェンツ ラスト エグザム)
金融モデリングからエンジニアリング、メディア制作まで、実際のソフトウェアにおける複雑な専門的タスクにおけるAIエージェントの能力を評価するベンチマークです。

■ ScreenSpot-Pro(スクリーンスポット プロ)
プロフェッショナル向けソフトウェアの高解像度スクリーンショットを用いて、AIモデルが画面上の正しいインターフェース要素を正確に特定・識別できるかを評価するベンチマークです。

■ OSWorld 2.0(オーエスワールド 2.0)
AIモデルがOSやコンピュータアプリケーションを実際に操作し、与えられたタスクを完了できるかを評価するベンチマークです。
他の成果
GPT‑6 Astraのコンピュータ利用能力は、ゲーム開発、電気工学、日常的な知識労働などでも利用できます。

GPT-6 Astraは、KiCadでプリント基板(PCB)レイアウト作成を行いました。

GPT-6 Astraは、コンピューター利用で、金融モデリングワールドカップの課題を、優勝した人間の競技者よりも約4倍速く完了しました。

GPT-6 Astraは、Unityで既存アセットから都市を構築しました。

GPT-6 Astraは、W-2フォームを読み取り、ブラウザ上でForm 1040に記入し、確認用の納税申告書の草案を作成しました。

GPT-6 Astraは、ウェブサイトの品質保証チェックリストに従って、ナビゲーション、検索、主要な操作をテストしました。

GPT-6 Astraは、Power BIを直接構築・改良し、車両データを航続距離、価格、効率の明確な比較に変換しました。


GPT-6 Astraは、設計概要文書をFreeCADでコンセプトモデルに変換し、Blenderでギアの動きをアニメーション化しました。

GPT-6 Astraは、LibreOffice Writerで法律メモと遺言書をフォーマットしました。
Astraと並行して、Codexハーネスもアップデートし、コンピュータの利用速度を大幅に向上させ、タスク完了速度が1.9倍向上しました。
小児科医検索
GPT-6 Astra: 2分54秒

アパート探し
GPT-6 Astra: 9分57秒

**DMVの予約**
GPT-6 Astra: 5分10秒

低糖質スナック調査
GPT-6 Astra: 17分33秒

幼稚園分析
GPT-6 Astra: 8分6秒

**仕事における大きな変化**
GPT-6 Astraは、コンピュータ利用で、複雑な業務タスクへの対応を支援します。

■ BenchCAD(ベンチキャッド)
CADコードの生成を通じて、マルチビューレンダリング画像から3Dオブジェクトを正確に再構築できるかを評価するベンチマークです。

■ BrowseComp(ブローズコンプ)
複数のWebサイトにわたる情報の検索と相互関連付けを必要とする高難度な問題を用いて、ディープウェブ(深層ウェブ)における調査・探索能力を評価するベンチマークです。

■ OpenScore String Quartets(オープン スコア ストリング クアルテッツ)
パブリックドメインである19世紀の楽譜のスキャン画像を、音楽ソフトウェアで編集可能な構造化されたデジタル記譜法(楽譜データ)に変換する精度を評価するベンチマーク・タスクです。

■ デザイン業務評価(社内向け)
ブリーフの解釈やクライアントからのフィードバックの反映から、ビジュアルアセットの作成・改良まで、実務におけるブランドデザイン作業全般を評価する内部テストです。

■ データサイエンス関連業務評価(社内向け)
不完全でノイズの多いビジネスデータを分析し、顧客維持率や利用状況、収益の変化を調査したうえで推奨事項を作成できるかを評価する内部テストです。
3D生成
GPT-6 Astraは、ウェブサイト、ゲーム、アプリケーション、レンダリングを作成、ホスト、共有しました。



GPT-6 Astraは、Blenderで家をモデリングし、Unreal Engine 5でシーンに変換しました。

GPT-6 Astraは、レースゲームを数分で作成しました。

GPT-6 Astraは、宇宙船のコンセプトを3Dモデルに変換しました。
**コーディング**
GPT-6 Astraは、ソフトウェアエンジニアリングにおいて最も優れたモデルです。

■ Terminal-Bench 4.0(ターミナルベンチ 4.0)
ソフトウェアエンジニアリング、システム設定、データ分析など、コマンドライン(ターミナル)環境における複雑な操作やタスク遂行能力を評価するベンチマークです。

■ FrontierCode 1.1 Extended(フロンティアコード 1.1 エクステンデッド)
コーディングエージェントが、実際のコードベースに直接マージ可能な変更(コード修正・追加)を正しく生成できるかを評価するベンチマークです。

■ DeepSWE v1.1(ディープ エスダブリューイー 1.1)
実際のコードベースを用いて、複雑なソフトウェアエンジニアリングタスクにおけるAIモデルの遂行能力を評価するベンチマークです。

■ 人工知能分析コーディングエージェントインデックス(Artificial Analysis Coding Agent Index)
コーディングエージェントがコード変更の実装、バグ修正、ターミナルベースのタスク完了、既存コードベースに関する質問への回答を行う能力を評価するベンチマークです。

■ データベース移行作業評価(社内向け)
実装、コードレビュー、パフォーマンス分析など、実務におけるデータベース移行作業全般におけるAIエージェントの能力を評価する内部テストです。
コンテキストウィンドウの進化
Codexでは、Astraに新たなコンテキストウィンドウ圧縮方法が適応されます。
従来の単なる圧縮とは異なり、コンテキストウィンドウ間でメモを保持し、蓄積された詳細を繰り返し圧縮し、単一の要約にすることなく保持します。
**科学的発見の推進**
Astraは、科学的発見、数学、健康分野において最高性能を誇ります。

■ GPQA Diamond(ジーピーキューエー ダイアモンド)
生物学、化学、物理学などの分野において、専門家によって作成された大学院レベルの高度な科学的推論能力や専門知識を評価する高難易度ベンチマークです。

■ HealthBench Professional(ヘルスベンチ プロフェッショナル)
診療相談、医療文書の作成、研究支援など、臨床医が求める高度な要求に対するAIモデルの応答精度や実用性を評価するベンチマークです。

■ LifeSciBench(ライフサイベンチ)
証拠の解釈、実験計画の策定、研究課題の解決など、生命科学(ライフサイエンス)研究分野における高度な科学的推論能力や問題解決能力を評価するベンチマークです。

■ GeneBench Pro(ジーンベンチ プロ)
AIエージェントが複雑な生物学的データを分析し、適切な解析手法の選択や、得られた結果に応じたアプローチの柔軟な調整・最適化を行えるかを評価するベンチマークです。

■ MedChemBench(メドケムベンチ)
化学構造、定量的予測、科学的説明に関する質問を通じて、医薬品化学(創薬化学)における推論能力を評価するベンチマークです。
Astraは、科学的推論とコンピュータ利用を組み合わせ、専用ソフトウェアで直接データ検証や結果分析を行います。

GPT-6 Astraは科学ソフトウェアを操作し、シーケンスの品質を検査し、遺伝子変異を視覚化しました。

GPT-6 Astraは、Jupyterで細胞追跡ワークフローを構築し、顕微鏡画像を追跡データと系統記録に変換しました。
**サイバーセキュリティ**
GPT-6 Astraは、サイバーセキュリティにおいて、OpenAIモデルの中で最も優れたモデルです。但し、脆弱性に対する概念実証エクスプロイトの作成など、より高度なサイバーセキュリティタスクへの対応は拒否します。

■ ExploitBench(エクスプロイトベンチ)
既知のソフトウェア脆弱性を実用的なエクスプロイト(攻撃用コード)に変換・構築できるかを評価し、モデルのサイバー攻撃(セキュリティ評価)能力をテストするベンチマークです。

■ ExploitGym(エクスプロイトジム)
実際のシステム環境において、AIモデルが自動で脆弱性を特定し、エクスプロイトを成功させられるかといった高度なサイバーセキュリティ能力を測定する検証・評価環境です。

■ ExploitBench (June–August 2026)(エクスプロイトベンチ 2026年6月〜8月版)
2026年6月から8月にかけて新たに発見・報告された最新の脆弱性データセットを用いて、モデルが未学習の最新セキュリティ脅威に対処・検証できるかをテストする評価手法です。

■ SRE-Bench(エスアールイー ベンチ)
サイト信頼性エンジニアリング(SRE)の領域において、複雑なシステム障害の分析、調査、根本原因の特定、および修正対応(リロケーションやインシデント復旧)を行えるかを評価するベンチマークです。
**GPT-6 Astraを責任を持って調整・展開する**
GPT-6 Astraは、OpenAIモデルの中で最も人間の意図に合致したモデルです。
機密性の高い環境において、Astraはリスクに見合った慎重さで動作します。Astraは意図しない結果を回避することに高い成功率を示しました。

■ Computer-use safety stress test(コンピュータ利用における安全性ストレステスト)
意図しない不正動作や不具合を引き起こすように悪意を持って作成された環境下で、AIモデルが想定外の挙動を回避し、安全に指示を実行できるかを評価するセキュリティ・安全性テストです(数値が低いほど安全性が高いことを示します)。

■ Circumventing auto-review(自動レビューの回避テスト)
モデルが開発環境やシステム(Codex等)の制限・ポリシー違反を防ぐ自動レビュー制限を、迂回・回避しようとする不適切な挙動を示さないかを評価する安全性テストです(数値が低いほど制限を正しく順守していることを示します)。

■ ExploitGym honeypot(エクスプロイトジム ハニーポット)
AIモデルが悪意のあるおとり環境(ハニーポット)や困難なタスクに直面した際、あらかじめ指定された許可範囲を超えて不法侵入や制限突破を試みないかを評価するサイバーセキュリティ・安全性テストです。
Astraは、透明性の高いユーザーコミュニケーションにおいても新たな基準を打ち立てています。ある評価では、AstraはGPT-5.6 Solと比較して、その機能や可能性について不正確な表現をする可能性が3分の1に抑えられています。

■ Capability Hallucination Rate (能力ハルシネーション率)
嘘を事実のように提示する割合を評価する安全性・信頼性指標です。
**料金**
OpenAI APIの標準料金は、入力トークン100万個あたり10ドル、出力トークン100万個あたり50ドルです。APIのGPT-6 Astraでは高速モードが利用可能で、標準処理の最大2倍の速度で、標準料金の2倍の料金で利用できます。




