
Key Takeaways
- 総合指標ではArtificial AnalysisとVals.aiでOpus 5.5が1位だが旧モデルへのフォールバックを成功として数えた値で、Opus 5.5が未掲載のEpoch AIではGPT-6 Astraが1位だった。
- Opus 5.5はコーディングの独立評価でGPT-6 Astraと並ぶが、利用者が貼り付けた文章に含まれる悪意ある指示に従いやすくなったとAnthropic自身が開示している。
- GPT-6はAstraがVals.aiの画面操作評価で1位となり、Artificial Analysisの評価ではSolとLunaが費用を下げた一方で文書づくりの評価は前世代より下がった。
- Grok 4.7はX上の投稿を検索する専用ツールとWord・Excel・PowerPoint用アドインを持つが、一般向けのGrokアプリへの搭載は後日とされている。
- 日本国内にデータを置けるかはモデルより提供経路で決まり、保存と推論のどちらを国内にできるかも経路ごとに違う。
Grok 4.7・Claude Opus 5.5・GPT-6は、xAI・Anthropic・OpenAIの3社が2026年9月に発表した大規模言語モデルです。GPT-6は1つのモデルではなく、9月初めに出た最上位のAstraと、9月22日に追加されたSol・Lunaから成るファミリーの名前です。
「結局どれを契約すればいいのか」と、発表の翌日に社内で聞かれた情報システム担当の方に向けた比較です。各社の発表資料は自社に有利な項目を中心に組まれていて、足りないのは同じ条件で測った独立評価と、日本国内にデータを置けるかという法人側の条件です。業務ごとに最初に試すモデルと、契約前に確かめる項目を、発表資料の原文に当たって書き出しました。
数値は各社の発表資料と、Artificial Analysis・Vals.ai・Epoch AIという第三者の評価サイトから取っています。ベンダーが自社で測った数値には「〜社の発表では」と主語を付け、測定条件が違う数値どうしで優劣は決めていません。資料はいずれも2026年9月23日に確認した時点のものです。利害の開示として、当社は自社サイトとブログの制作にAnthropicのClaude Codeを使っています。Grok 4.7とGPT-6は当社の業務で使った経験がなく、この2つの記述はすべて公開資料に基づきます。
3モデルの得意分野は分かれ、総合首位のモデルにも順位の低い分野がある
図の横軸は3つのモデル、縦軸は業務で効いてくる6つの観点です。どの行にも「得意」と「未確認」が混ざっていて、全行で先頭に立つモデルはありません。
総合の首位は評価サイトによって違います。ただしEpoch AIにはOpus 5.5がまだ載っていないため、同じ顔ぶれで比べて首位が分かれたわけではありません。Artificial Analysisの総合指標(Intelligence Index)では、各モデルの最も深い推論設定で測った値がClaude Opus 5.5で58点となり、同社が測った中で最高でした。GPT-6 Astraは53点、Anthropicの最上位モデルClaude Fable 5.1も53点です(Artificial Analysis, 2026年9月22日/リーダーボード, 2026年9月23日確認)。推論設定とは、モデルが答える前にどれだけ考えるかの深さで、深いほど時間と出力量が増えます。GPT-6 Solは48点、Grok 4.7は46点、GPT-6 Lunaは37点でした(Artificial Analysis:Grok 4.7, 2026年9月21日/同:GPT-6 Sol, 2026年9月23日確認)。
Opus 5.5とFable 5.1の値には条件が付いています。安全対策で断られた要求を旧モデルに回す設定(フォールバック)を、Anthropicが推奨する切り替え先で有効にして測ったものです。GPT-6 Astra・Sol・LunaとGrok 4.7は、フォールバックなしで測った値です。この設定はAnthropicのアプリでは自動で働き、APIでは開発者が有効にしたときだけ働きます(Artificial Analysis, 2026年9月22日/リーダーボード, 2026年9月23日確認/同:GPT-6 Astra, 2026年9月9日/Anthropic システムカード, 2026年9月22日)。
別の評価サイトでは並びが変わります。Vals.aiの総合指標ではOpus 5.5が63モデル中1位の69.69%、GPT-6 Astraが4位の66.61%です。Vals.aiもOpus 5.5を旧モデルへのフォールバックを成功として数えて測っていて、Astraのフォールバック率は0.00%でした(Vals.ai:Opus 5.5/同:GPT-6 Astra, いずれも2026年9月23日確認)。Epoch AIの能力指数(ECI)では、9月23日に確認した時点でGPT-6 Astraが251モデル中1位の167でした。Epoch AIにはOpus 5.5とSol・Lunaがまだ載っておらず、Grok 4.7はページがあるものの指数が付いていません(Epoch AI, 2026年9月23日確認)。
報告書や資料づくりのような知識労働の評価でも、上位は1つに絞れません。Artificial Analysisの知識労働評価(AA-Briefcase v1.1)ではOpus 5.5が首位で、Grok 4.7もClaude Opus 5とFable 5.1のすぐ後ろに入りました。9月23日に確認した同評価の一覧ではOpus 5.5(最大設定)が1,822点、Grok 4.7が1,657点で、GPT-6 Astra(最大設定)は1,569点です(Artificial Analysis:AA-Briefcase, 2026年9月23日確認)。GPT-6 Solは同じ評価で前世代と同水準、Lunaは前世代より下がっています(Artificial Analysis:Opus 5.5, 2026年9月22日/同:Grok 4.7, 2026年9月21日/同:Sol・Luna, 2026年9月22日)。
総合の上位にいるモデルにも、苦手な分野ははっきりあります。Opus 5.5は、Vals.aiの法務エージェント課題(Harvey's Legal Agent Benchmark)で9月23日時点の一覧では67モデル中33位でした。エージェントは、指示を受けて複数の作業を自分で進めるAIを指し、この課題はその形で法務の作業をこなせるかを測ります。同じ一覧でGPT-6 Astraは27位で、どちらも中位です(Vals.ai:Opus 5.5/同:GPT-6 Astra, 2026年9月23日確認)。Artificial Analysisの記事では、Opus 5.5は総合指標を構成する10の評価のうち6つで首位でした。残るうちCritPt(物理の推論)・AA-LCR(長文読解)・GDP.pdf(業務文書の読解)の3つでは、他のモデルを下回っています(Artificial Analysis, 2026年9月22日)。
GPT-6 Astraは、OpenAI自身の比較表でもHumanity's Last Exam(難問をそろえた総合試験、ツールあり)がClaude Fable 5.1とClaude Opus 5を下回っています(OpenAI, 2026年9月3日)。AIは文章を「トークン」という単位で数え、書き出す速さも秒あたりのトークン数で表します。Grok 4.7はArtificial Analysisに「上位の知能で料金は手頃」と評された一方、出力の生成速度が秒あたり39トークンと遅く、出力量もかなり多いと書かれています(Artificial Analysis, 2026年9月23日確認)。
位置づけも3社で違います。xAIはGrok 4.7を自社で最も高性能なコーディングと知識労働向けのモデルと説明しています(xAI, 2026年9月21日)。AnthropicはOpus 5.5を長時間のエージェント型コーディングと知識作業向けとし、より難しい推論にはClaude Fable 5.1を案内しています(Claude Platform Docs, 2026年9月23日確認)。OpenAIはAstraを最上位、Solを複雑なコーディングとエージェント業務向け、Lunaを大量処理向けと分けています(OpenAI, 2026年9月3日/OpenAI API Docs:Sol/同:Luna, 2026年9月23日確認)。
コーディングは上位2つが拮抗し、決め手は普段使う開発ツールになる
独立評価で見ると、コーディングの上位はOpus 5.5とGPT-6 Astraの2つです。Artificial AnalysisはTerminal-Bench 4.0(ターミナル操作を伴う開発課題)で、Opus 5.5の59.6%をGPT-6 Astraと同水準と評価しました(Artificial Analysis, 2026年9月22日)。
Vals.aiの一覧でも、同じ評価でOpus 5.5が32モデル中1位、GPT-6 Astraが2位です。Opus 5.5の61.62%は、旧モデルへのフォールバックを成功として数えた値です。失敗として数えると53.54%に下がります(198件中30件がフォールバック)。Astraの値は同じページ上で確認できませんでした(Vals.ai:Opus 5.5/同:GPT-6 Astra, 2026年9月23日確認)。
ベンダー自身の数値は、条件が揃っていないので並べて比べられません。Anthropicの発表ではTerminal-Bench 4.0が66.4%です。ただしこれはOpus 5.5を推論の深さxhighで測り、GPT-6 AstraについてはOpenAIが1段浅いhighで報告した57.9%を引いたものです(Anthropic, 2026年9月22日)。Grok 4.7のベンダー数値の扱いは、後の「発表直後の数値」の節で触れます。
各社純正の開発ツールと組み合わせた評価では、Artificial AnalysisのCoding Agent IndexでGrok 4.7とGrok Buildの組み合わせが56点でした。Claude Fable 5.1・GPT-6 Astra・Claude Opus 5に次ぐ4位で、この時点でOpus 5.5はまだ測られていません(Artificial Analysis, 2026年9月21日)。GPT-6 Astraの同指数は62点で、Claude Fable 5.1と並ぶ首位でした(Artificial Analysis, 2026年9月9日)。
どの開発ツールから使えるかで、試しやすさが変わる
GitHub Copilotには、3社の新モデルがいずれも発表当日から追加されました。Grok 4.7は9月21日、Opus 5.5とGPT-6 Sol・Lunaは9月22日で、Astraは以前から選べます(GitHub Changelog:Grok 4.7, 2026年9月21日/同:Opus 5.5, 2026年9月22日/同:GPT-6 Sol・Luna, 2026年9月22日)。すでにCopilotで開発している会社なら、乗り換えずに同じ画面で比べられます。
Grok 4.7に固有なのは、Cursorの全プランで使えることと、xAIのターミナル型エージェントGrok Buildで既定のモデルになったことです。xAIのWord・PowerPoint・Excel用アドインでも既定のモデルです(xAI モデルカード, 2026年9月21日)。xAIは匿名化したCursorの作業データで追加学習したと同じモデルカードに書いています。
Opus 5.5は、Claude CodeのPro・Max・Team・Enterprise・Anthropic APIで既定のモデルになりました。使うにはClaude Code v2.1.280以降が必要です(Claude Code Docs, 2026年9月23日確認)。Claude Codeそのものの使いどころはClaude Codeとは?非エンジニアの会社での使いどころにまとめています。
GPT-6はOpenAIの開発エージェントCodexから使えます。Codex上のAstraは、会話の区切りをまたいでメモを残し、過去のやり取りを検索できる試験的な機能を持ちます。指示があいまいなときは、進められる作業を続けながら要点を絞って質問すると説明されています(OpenAI, 2026年9月3日)。
既存のシステムに組み込むなら、仕様の変更点を先に読む
開発を外部に頼んでいる会社は、この節の点を発注先に確認してください。Opus 5.5には、Opus 5向けに書いたプログラムがそのままでは動かなくなる変更(破壊的変更)が4つあります。思考をオフにできないことや、使う道具をAIに強制的に指定するとエラーになることなどです(Claude Platform Docs, 2026年9月23日確認)。
GPT-6 SolとLunaは、APIの種類と推論の設定によって外部の道具を呼べる範囲が変わります(OpenAI API Docs, 2026年9月23日確認)。Grok 4.7は推論をオフにできず、既定の深さはhighです(xAI Docs, 2026年9月23日確認)。どれも、今の仕組みのまま差し替えられるとは限らないという点で同じです。
画面操作と業務の自動化は、GPT-6 Astraが重点に置いている
ブラウザや業務アプリを人の代わりに操作する用途は、OpenAIがAstraの重点機能として打ち出しています。フォーム入力やCRM(顧客管理システム)の更新、カレンダーの整理が例に挙がっています。OpenAIの発表では、画面操作の評価OSWorld 2.0でAstraがタスクあたり約40分で72.6%に達し、GPT-5.6 Solの約75分・65.7%を上回りました(OpenAI, 2026年9月3日)。独立評価では、5モデルが載るVals.aiのコンピュータ操作評価(CUA-bench)でAstraが1位です(Vals.ai:GPT-6 Astra, 2026年9月23日確認)。
Opus 5.5も画面操作に対応していますが、Claude APIとGoogle Cloudでは新しい操作用ツールだけを受け付けます。旧版のツールで組んだ仕組みはエラーになるため書き換えが要り、Amazon Bedrockでは旧版も引き続き動きます(Claude Platform Docs, 2026年9月23日確認)。業務の自動化を測るAutomationBench(Zapierが実施)では、Anthropicの発表の表でOpus 5.5が40.0%、GPT-6 Astraが41.4%でした。この評価では、安全対策で旧モデルに切り替わった作業を失敗として数えています(Anthropic, 2026年9月22日)。Artificial Analysisも同種の評価で両者を同等と見ています(Artificial Analysis, 2026年9月22日)。
長い資料は、一度に入る量と中身を拾える精度を分けて比べる
一度に扱える量の枠(コンテキスト長)はOpus 5.5が100万トークン、GPT-6の3モデルが105万トークンで、Grok 4.7は50万トークンです。どれも各社が枠の大きさとして載せている値です。GPT-6の105万は出力も含めた枠で、そのうち入力に使えるのは最大92.2万トークンです(Claude Platform Docs/OpenAI API Docs:Astra/Sol/Luna/xAI Docs, 2026年9月23日確認)。
一度に書き出せる量は、Opus 5.5とGPT-6がともに12.8万トークンです。Opus 5.5は、まとめて後から処理する方式(Batch API)で専用の指定を付ければ最大30万トークンまで出力できます。Grok 4.7は文章の出力に上限を設けていません(Claude Platform Docs/OpenAI API Docs/xAI Docs, 2026年9月23日確認)。
入る量が多くても、長い資料の中身を正しく拾えるかは別の問題です。OpenAIの発表では、長文から複数の情報を探す評価(MRCR v2)でAstraが512K〜1Mトークンの帯で96.3%でした(OpenAI, 2026年9月3日)。一方でArtificial Analysisの長文読解評価(AA-LCR)では、Opus 5.5が首位に届かず、Grok 4.7は前の版より3.7ポイント下がっています(Artificial Analysis:Opus 5.5, 2026年9月22日/同:Grok 4.7, 2026年9月21日)。評価の作り方によって、長文に強いかどうかの結果は分かれています。
契約書や社内規程のように毎回同じ資料を読ませる業務なら、全文を毎回渡すより必要な箇所を探して渡す仕組みの方が安定します。その考え方はRAGとは?社内文書に答えるAIをわかりやすく解説で扱っています。
最新情報は3モデルとも検索ツール頼みで、X上の投稿を検索する専用ツールはGrok 4.7にある
モデルが学習した情報には締め切りがあります。GPT-6はAstraが2026年4月30日、Solが4月20日、Lunaが5月18日です(OpenAI API Docs:Astra/Sol/Luna, 2026年9月23日確認)。Opus 5.5は2026年6月まででした(Claude Platform Docs, 2026年9月23日確認)。Grok 4.7はドキュメントでは2026年5月、モデルカードでは事前学習が2026年6月まで・補助学習に8月までのデータを使用と書かれていて、資料によって表記が違います(xAI Docs/xAI モデルカード, 2026年9月21日)。
それ以降の出来事を答えさせるには、どのモデルでも検索ツールを有効にする必要があります。xAIのドキュメントも、Grokは検索ツールなしではリアルタイムの出来事にアクセスできないと明記しています(xAI Docs, 2026年9月23日確認)。GPT-6はWeb検索に対応しています(OpenAI API Docs, 2026年9月23日確認)。Opus 5.5はAnthropic側で動く検索などのツールに対応しています(Claude Platform Docs:What's new, 2026年9月23日確認)。使えるツールの一覧は各社のドキュメントで確かめてください。
Grok 4.7に特有なのは、X(旧Twitter)の投稿を検索するX Searchツールです。キーワード検索・意味検索・ユーザー検索・スレッドの取得ができ、アカウントの絞り込みと除外はそれぞれ最大20件まで指定できます(xAI Docs, 2026年9月23日確認)。日付の範囲を区切ることも、投稿に付いた画像や動画を解析させることもできます。自社や競合の評判を追う用途や、話題の広がりを早めにつかむ用途に向きます。X Searchは通常の利用料とは別に、取得した投稿数などで課金されます。
注意したいのは、Grok 4.7がまだ一般向けの画面に載っていないことです。xAIのモデルカードは、Webやスマートフォンのアプリ、X上のGrokへの搭載を後日の予定としています(xAI モデルカード, 2026年9月21日)。X上の投稿は真偽が確かめられていない情報なので、拾った内容を社外向けの判断に使う前には人が一次情報を確かめる必要があります。
3モデルとも入力は文章と画像までで、モデル本体の出力は文章に限られる
扱えるデータの種類は、3モデルでほぼ同じです。いずれも文章と画像を入力でき、モデル本体が返すのは文章です。OpenAIのドキュメントでは、GPT-6の3モデルとも入力は文章と画像で出力は文章です。音声と動画のエンドポイントは非対応です(OpenAI API Docs:Astra/Sol/Luna, 2026年9月23日確認)。Opus 5.5とGrok 4.7の公式資料にも音声と動画の入出力は書かれていません。
違いは周りの機能に出ます。Anthropicによると、Opus 5.5はグラフや図、スクリーンショットから値を読む精度が前世代より上がりました。ただし最も密度の高い資料では、画像用のツールを併用した方が正確になるとも書いています。PDFの読み込みと、ファイルを先に預けておく仕組み(Files API)にも対応しています(Claude Platform Docs:What's new, 2026年9月23日確認)。
GPT-6は、APIから画像生成のツールを呼び出せます(OpenAI API Docs, 2026年9月23日確認)。Grok 4.7は1枚20MiB(約20メガバイト)までのjpgとpngの画像を受け付け、X Searchを通してX上の動画も解析できます(xAI Docs:画像/同:X Search, 2026年9月23日確認)。電話応対のように音声を直接扱う業務は、3モデルとも単体では想定されていません。音声を文字に起こす仕組みを別に組み合わせることになります。
料金は単価より、1タスクで使う出力量で差が開く

料金の金額は変わりやすいので、ここでは書きません。最新の金額はxAIの料金ページ・Anthropicの料金ページ・OpenAIの料金ページで確認してください。
同じ単価でも、モデルが1つの仕事で書き出す量が違えば請求額は変わります。Artificial Analysisの測定では、1タスクあたりの出力がOpus 5.5(最大設定)で約11.9万トークン、GPT-6 Astra(最大設定)で約2.7万トークンでした(Artificial Analysis, 2026年9月22日)。Grok 4.7は約8.1万トークンで、前の版の2倍を超えています(Artificial Analysis, 2026年9月21日)。
各社は今回、費用面の改善を次のように説明しています。
- xAIの発表では、Grok 4.7は同クラスのモデルより2倍速く半額とされています(xAI, 2026年9月21日)。比べた相手は明示されていません。料金は前の版から据え置きで、入力が20万トークンを境に2段階の料金になります(xAIの料金ページ, 2026年9月23日確認)。高速版のGrok 4.7 FastはCursorとGrok Buildだけで使え、標準より高い料金体系です。
- Anthropicの発表では、トークン単価はOpus 5より20%下がりました。既定の設定で代表的な作業を動かすコストは40%下がり、出力の生成は30%以上速くなったとしています(Anthropic, 2026年9月22日)。単価の20%減はArtificial Analysisも確認しています(Artificial Analysis, 2026年9月22日)。
- GPT-6 SolとLunaについて、Artificial Analysisは料金が前世代のおよそ半分になり、タスクあたりの費用もほぼ半分になったと評価しています。知能の指標は前世代と同じ水準です。一方で文書づくりの評価(GDPval-AA)では両モデルとも前世代より下がり、成果物が短くなって必要な要素が抜けやすいと分析しています(Artificial Analysis, 2026年9月22日)。
応答の速さは、何を測るかで見え方が変わります。最初の文字が出るまでの時間・文字を書き出す速さ・1つの仕事を終えるまでの時間は、それぞれ別の指標です。Artificial AnalysisがGrok 4.7を「遅い」と評したのは、文字を書き出す速さについてです(Artificial Analysis, 2026年9月23日確認)。Opus 5.5の速さの値は、同サイトのモデルページではまだ出ていません(Artificial Analysis, 2026年9月23日確認)。Opus 5.5は既定の推論の深さがOpus 5より1段低いmediumに変わり、同じ設定でもOpus 5より多く考える傾向があるとAnthropicは説明しています(Claude Platform Docs, 2026年9月23日確認)。
費用の見積もりの読み方はAI導入・開発の費用の内訳と見積もりの読み方に書いています。
日本国内にデータを置けるかは、モデルより提供経路で決まる
法人で使うときは、まず入力データの扱いを確かめます。見るのは、学習に使われないかと、どこにどれだけ保存されるかです。3社とも法人向けの契約では既定で学習に使わないとしていますが、保存先と保存期間は提供経路で変わります。
学習への利用と保存期間
表は横にスクロールできます。
| 項目 | Grok 4.7(xAI API) | Claude Opus 5.5(Anthropic API) | GPT-6ファミリー |
|---|---|---|---|
| 学習への利用 | 明示の許可なしには使わない | 商用製品(API・Claude for Workなど)は既定で使わない | ChatGPT Business・Enterprise・EduとAPIは既定で使わない |
| 既定の保存 | 不正利用の監査用に暗号化して30日保存 | APIの入出力は30日以内に自動削除(例外あり) | APIの不正利用監視ログは最大30日保持 |
| データを残さない設定(ZDR) | チームの管理者が管理画面で有効化 | 営業窓口に連絡し、組織単位で審査 | 対象の顧客が事前承認を得て利用 |
出典はxAI セキュリティFAQ/Anthropic Privacy Center:学習への利用(2026年8月18日更新)/Anthropic Privacy Center:保存期間(2026年7月1日)/Anthropic Privacy Center:ZDRの対象製品(2026年6月9日)/OpenAI ビジネスデータ/OpenAI API Docsで、いずれも2026年9月23日に確認しました。ZDR(Zero Data Retention)は、送ったデータを処理後に残さない契約上の設定です。
細かい条件も確認が要ります。xAIでデータを残さない設定を有効にすると、会話の状態を保つ機能やファイル機能、まとめて後から処理する機能が使えなくなります。xAIは、外部の監査人がセキュリティ管理を評価する基準SOC 2 Type 2に準拠していると書いています(xAI セキュリティFAQ, 2026年9月23日確認)。AnthropicのClaude.aiのTeamとEnterpriseはデータを残さない設定の対象外です。Claude Code for Enterpriseと、商用のAPIキーで使うClaude Codeは対象に入ります(Anthropic Privacy Center:ZDRの対象製品, 2026年6月9日)。Anthropicは、評価ボタンでフィードバックを送った会話は5年保持するとしています(Anthropic Privacy Center, 2026年7月1日)。OpenAIのEnterpriseでは、管理者が有効にするまでAstraは使えない状態で始まります(OpenAI, 2026年9月3日)。
個人向けのプランは扱いが違います。AnthropicのFree・Pro・Maxでは、利用者が学習への利用を選べます。許可した場合の保存期間は5年、許可しない場合は30日で、この扱いは2025年の規約改定で決まったものです(Anthropic, 2025年8月28日)。社内で誰がどのプランを使っているかは、生成AIの社内利用ルールの作り方の手順で棚卸しできます。
国内での保存と推論
「保存」はデータを置いておく場所、「推論」はAIが実際に計算する場所です。表の「リージョン」はクラウド事業者のデータセンターがある地域を指します。
表は横にスクロールできます。
| 提供経路 | 日本に関する対応 | 補足 |
|---|---|---|
| Opus 5.5(Amazon Bedrockの日本向け推論プロファイル) | データを日本のリージョン内にとどめる | 東京と大阪で使える |
| Opus 5.5(Anthropicの直接API) | 日本の選択肢はない | 推論は米国か全世界、保存先は米国のみ |
| Opus 5.5(Google Cloud) | 東京の記載はない | アジアの処理拠点はシンガポールのみ |
| GPT-6(OpenAI APIの日本リージョン) | 保存は国内にできる(Astra・Sol・Lunaが対象) | 国内での処理(推論)は非対応 |
| GPT-6(ChatGPT Enterprise・Edu) | 保存先に日本を選べる | 推論の地域内処理は欧州・米国・UAEのみ |
| GPT-6 Astra(Amazon Bedrock) | 東京と大阪からは全世界への振り分けのみ | 地域を限った推論は米国のみ |
| Grok 4.7(xAI API) | 日本向けの接続先は記載がない | 掲載されているのは全世界と米国の2つ |
出典はAWS Bedrock:Opus 5.5/Claude Platform Docs/Google Cloud/OpenAI API Docs/OpenAI Help Center/AWS Bedrock:GPT-6 Astra/xAI Docsで、いずれも2026年9月23日に確認しました。推論プロファイルは、Bedrockでどの地域の拠点に処理を振り分けるかを決める設定です。
OpenAI APIの日本リージョンを使うには、不正利用監視の変更かデータを残さない設定の承認が前提になります。OpenAIのドキュメントでは、GPT-6の3モデルはResponses APIとChat Completions APIで日本リージョンの保存の対象に含まれます。国内での処理(推論)には対応していません(OpenAI API Docs, 2026年9月23日確認)。xAIの米国向けの接続先は、推論と保持データを米国内に限ると保証しています。ただしファイル機能やX Searchなどのツールと、通信経路はその保証の外だと書いています(xAI Docs, 2026年9月23日確認)。GPT-6 SolとLunaがAmazon Bedrockで使えるかは、今回の確認範囲では分かっていません。
日本語の性能は、どの社も日本語単独の数値を出していない
今回確認した資料の範囲では、3社とも最新モデルの日本語単独のスコアを公表していません。Anthropicのシステムカードは、Opus 5.5が42言語の多言語評価で平均94.3%だったとしつつ、出力の品質は言語によって差があると書いています(Anthropic システムカード, 2026年9月22日)。同社が言語別の数値を載せているのは旧世代のモデルだけです(Claude Platform Docs, 2026年9月23日確認)。
xAIのモデルカードで日本語が出てくるのは、安全性評価に使った言語の一覧の1か所だけでした。GPT-6の多言語評価の数値は、今回の確認範囲では見つかっていません。OpenAIはAstraの発表に日本語版ページを用意していますが、SolとLunaの発表は英語版だけです(OpenAI:GPT-6 Sol・Luna, 2026年9月22日)。日本拠点は、Anthropicが2025年10月に東京オフィスを開いています(Anthropic, 2025年10月29日)。
法人向けの契約形態では、xAIもGrok BusinessとGrok Enterpriseを用意しています。Enterpriseでは独自のシングルサインオン(社内の1つのアカウントで複数のサービスに入れる仕組み)が使えます。上位のEnterprise Vaultでは顧客が管理する鍵で暗号化できます(xAI, 2025年12月30日)。ただしこれらのプランにGrok 4.7が含まれるかは、公式資料で確かめられませんでした。
重要な判断を任せる前に、各社が自ら書いた弱点を読んでおく
3社とも、発表資料の中で自社モデルの弱点や使い方の限界を書いています。社内ルールに書く項目は、ここから拾えます。
xAIはGrok 4.7のモデルカードで、医療・法務・金融や安全に関わるシステムでの重大な判断を、人の監督と専門家の検証なしに任せる使い方は想定していないと明記しました。発表ページでは安全対策を全面的に作り直したとしています(xAI, 2026年9月21日)。一方でモデルカードでは、自傷に関する不適切な応答の割合が前の版の0.84%から1.05%に上がったと開示しています。黙って性能を落としたり別モデルに切り替えたりはしないとも約束しています(xAI モデルカード, 2026年9月21日)。
Anthropicはシステムカードで、Opus 5.5が利用者の貼り付けた文章に含まれる悪意ある指示に従いやすくなったと開示しました。確かめようのない権限の主張も受け入れやすくなっています。取引先から届いたメールや資料をそのまま貼って使う運用では、この点が直接効いてきます。サイバー関連の安全対策で止められた要求が前述のフォールバックで回される先は、旧モデルのOpus 4.8です(Anthropic システムカード, 2026年9月22日)。発表ページでは、リリース前の評価ですべての失敗を見つける方法はまだ確立していないとも書いています(Anthropic, 2026年9月22日)。
OpenAIは、GPT-6 Astraが同社の基準でサイバー能力の最上位区分に初めて達したモデルだと説明しています。その分、追加の安全確認によって防御目的のセキュリティ作業まで止まることがあり、APIではタスクが停止します(OpenAI, 2026年9月3日)。Astraは前世代より思考の過程を監視しにくくなったとも開示していますが、これは主に監視を避けるよう指示した評価での結果です(OpenAI Deployment Safety, 2026年9月22日更新版を9月23日に確認)。
業務ごとに最初に試すモデルを1つ決め、同じ課題で比べる
ここまでの観点を、よくある業務に当てはめると次のようになります。どれも「このモデルが正解」という意味ではなく、最初に試す候補の順番です。
表は横にスクロールできます。
| 業務の例 | 最初に試す候補 | 理由と注意 |
|---|---|---|
| 社内システムの改修やコードの移行 | Opus 5.5かGPT-6 Astra | 独立評価のコーディング課題で両者が並ぶ。既存の仕組みに入れるなら破壊的変更を先に確認する |
| すでにGitHub Copilotで開発している | 3モデルを同じ画面で比べる | 3社の新モデルが発表当日から追加されたので、乗り換えずに比べられる |
| 報告書や提案書の下書き | Opus 5.5とGrok 4.7を並べて試す | Artificial Analysisの知識労働評価でOpus 5.5が首位、Grok 4.7も上位に入った。GPT-6 Astraは同評価でGrok 4.7を下回る。どちらも1タスクの出力量が多いので費用も見る |
| 問い合わせの分類や要約を大量にこなす | GPT-6 LunaかSol | 費用効率を前面に出したモデル。成果物が短くなり要素が抜ける評価もあるので、品質を抜き取りで見る |
| ブラウザ上の定型入力や画面操作 | GPT-6 Astra | OpenAIが重点機能とし、5モデルが載るVals.aiの画面操作評価で1位。安全確認で止まる場合の手順を決めておく |
| X上の評判や話題の把握 | Grok 4.7 | X Searchで投稿・スレッド・画像を検索できる。一般向けアプリにはまだ載っていない |
| Word・Excel・PowerPointの中で使いたい | Grok 4.7(xAIのアドインを使う場合) | xAIのアドインで既定のモデル。他社のOffice連携は未確認なので、社内で使っているOffice向けAI機能と並べて試す |
| 契約書の下調べなど法務の補助 | 3モデルとも自社の過去案件で試す | 法務評価の順位は資料ごとに割れ、同じ条件の比較はない。どれも専門家の確認が前提 |
| 顧客データを国内から出したくない | 提供経路から選ぶ | Opus 5.5はBedrockの日本向け推論、OpenAIはAPIの日本リージョン(保存のみ国内)とChatGPT Enterprise・Eduの国内保存。xAI APIは日本向けの記載なし |
表の評価の出典はArtificial Analysis:Opus 5.5/同:Grok 4.7/Artificial Analysis:AA-Briefcase/Vals.ai:Opus 5.5/同:GPT-6 Astraで、いずれも2026年9月23日に確認しました。
比べるときは、同じ課題を同じ手順で各モデルに渡します。過去に人が処理した実際の案件をいくつか選び、正解が分かっているものを使うと、出来の良し悪しを社内で判断できます。見る項目は、正確さ・手直しにかかった時間・1件あたりの出力量の3つで足ります。
モデル同士を途中で入れ替えられるように作っておくことも大切です。Grok 4.7はOpenRouterやVercel、Cloudflareといった中継サービスから使えます(xAI モデルカード, 2026年9月21日)。Opus 5.5はAWS・Google Cloud・Microsoft Azureで提供されています(Anthropic, 2026年9月22日)。GPT-6 AstraはMicrosoft AzureとAmazon Bedrockでも提供されています(OpenAI, 2026年9月3日)。AIと社内ツールをつなぐ部分を共通の規格で作っておけば、モデルを替えても作り直す範囲が小さく済みます。その規格はMCPとは?AIとツールをつなぐ共通規格で紹介しています。
発表直後の数値は、測った条件と資料の版をそろえてから読む
発表から数日の比較には、後から直される要素がいくつも含まれています。数字を社内の資料に引用する前に、次の点を確かめてください。
推論の深さが揃っていない
xAIの発表ページの表も、推論の深さがそろっていません。Grok 4.7はxhighでGrok 4.6はhigh、GPT-5.6 SolとClaude Fable 5.1は最大設定です。この表にGPT-6 AstraとOpus 5.5は入っていません。Anthropicの表でOpus 5.5とAstraの深さが違う点は、コーディングの節で触れました。一方で同じページのGDPval(業務文書づくりの評価)の図と、モデルカードの電気設計の評価(EEBench)にはGPT-6 Astraが入っています(xAI/xAI モデルカード, 2026年9月21日)。
xAIの発表ページの表では、Harveyの法務評価でGrok 4.7が比較した4モデルの中で最も高い値でした(xAI, 2026年9月21日)。この表にOpus 5.5とGPT-6 Astraは入っていないので、先に挙げたVals.aiの順位とは並べて比べられません。
同じ会社の資料で数値が食い違う
Grok 4.7のTerminal-Bench 4.0は、xAIの発表ページで37.6%、モデルカードで38.0%でした。EEBenchも、発表ページで64.0%、モデルカードで66.0%と違います(xAI/xAI モデルカード, 2026年9月21日)。国内報道のITmedia NEWSはモデルカード側の38.0%を載せています(ITmedia NEWS, 2026年9月22日)。
競合の数値の取り方が違う
OpenAIはSolとLunaの発表で、競合の数値を公開レポートから引用し、Claude Fable 5.1の値がない項目ではFable 5の値を使ったと注記しています(OpenAI:GPT-6 Sol・Luna, 2026年9月22日)。Astraの発表の注記では、HealthBench ProfessionalのClaudeの値はOpenAIが自前で採点したものです。ExploitGymとScreenSpot-ProのFableの欄は、Claude Mythosの値だと書かれています(OpenAI, 2026年9月3日)。Anthropicは本番の安全対策を有効にしたまま測り、安全対策が働いた作業は前述のフォールバックで旧モデルが処理したと書いています(Anthropic, 2026年9月22日)。
発表後に訂正が入る
OpenAIは9月22日に、Astraのシステムカードで医療系評価(HealthBench)の値を設定ミスのため訂正しました(OpenAI Deployment Safety, 2026年9月22日)。Artificial AnalysisはGPT-6 Solのコンテキスト長を87.2万トークンと記載しており、公式の枠の105万トークンとも入力の上限の92.2万トークンとも合いません(Artificial Analysis/OpenAI API Docs, 2026年9月23日確認)。
各社も数値の限界を認めています。Anthropicは、この能力水準ではベンチマークの差が実務での差の目安として信頼しにくくなったと書きました(Anthropic, 2026年9月22日)。OpenAIは、評価を研究環境かAPIで行っており本番のChatGPTとは出力が少し違う場合があると断っています(OpenAI, 2026年9月3日)。TechCrunchが伝えた「SolとLunaはAnthropicの上位モデルより大幅に良い」という話も、OpenAI自身の主張です(TechCrunch, 2026年9月22日)。
3モデルの比較に関するよくある質問
Q. 無料プランで試してから決めてもよいですか?
試すこと自体はできますが、業務のデータは入れないでください。個人向けのプランは、法人向けの契約とデータの扱いが違います。たとえばAnthropicの個人向けプランでは学習への利用を利用者が選ぶ形で、許可すると保存期間が長くなります(Anthropic, 2025年8月28日)。比べるなら法人向けの契約かAPIで、架空のデータを使うのが安全です。
Q. 1つに絞るなら、どれを選べばよいですか?
1つに絞らず、業務ごとに選ぶことをお勧めします。今回の3モデルは、総合順位の上位でも苦手な分野があり、得意な業務がはっきり分かれています。まず一番時間を取られている業務を1つ選び、上の表で候補に挙がったモデルを2つ並べて同じ課題で比べてください。
Q. 発表されたモデルは、いつものチャット画面ですぐ使えますか?
3社で状況が違います。Opus 5.5は発表時点でClaudeの各プランとAPI、主要なクラウドで提供が始まりました(Anthropic, 2026年9月22日)。GPT-6 SolとLunaは、多くの有料アカウントのChatGPT WorkとCodex、APIから提供が始まりました。TechCrunchによると、ChatGPTのアプリとWebへは段階的に広げ、LunaはFreeとGoの利用者にも提供されるとされています(TechCrunch, 2026年9月22日)。Grok 4.7はAPIや開発ツールが先で、Grokのアプリへの搭載は後日とされています(xAI モデルカード, 2026年9月21日)。
Q. 顧客データを入れても、学習に使われませんか?
3社とも、法人向けの契約とAPIでは既定で学習に使わないと書いています(出典は上の「学習への利用と保存期間」の表の下に挙げたとおりです)。ただし不正利用の監視のために一定期間は保存され、保存しない設定には申請や承認が要る場合があります。社内で使っているのが個人向けのプランか法人向けの契約かを先に確かめ、契約の文言は法務や専門家にも確認してください。
SAIの視点:決め手は点数より、普段の作業から呼べるかどうか
当社は会社サイトとブログ43本(2026年9月17日時点)を、Claude Codeとの会話で作りました。コードはほぼ書いていません。やったのは「誰に読んでほしいか」「何を載せるか」を日本語で伝えることでした。当社が使っているのはこの1つだけなので、ここに書くのは3モデルを比べた感想ではありません。

それでも言えることはあります。作業のほとんどは、開発の画面の中での会話でした。別の道具に移って頼み直す手間がなかったことが、3か月以上続いた理由の1つだと当社は見ています。今回の3モデルも、GitHub CopilotやCursor、Officeのアドインといった入口がそれぞれ違います。点数の差より、社員が普段開いている道具から呼べるかの方が定着を左右すると当社は考えています。
依頼の中身が日本語の文章である点も同じです。「誰に向けて」「何を」「どこまで」を書いた依頼文は、モデルを替えても書き直す量が小さくて済むはずです。BCP支援企業での導入事例では、実際の業務で使える指示の型を用意し、ヒアリング議事録の要約や文書のドラフト生成をスタッフの日常業務に組み込みました。スタッフが自分で改善できるまで伴走したのも、型が人の側に残るようにするためです。
そのうえで当社は、業務ごとに候補を2つに絞り、同じ課題で比べてから採用することをお勧めしています。AI導入支援では、扱うデータの条件を先に確かめ、提供経路を絞ってからモデルの候補を比べます。社内システムに組み込む段階では、FDE伴走開発でモデルを差し替えられる構成にして試作を回します。株式会社SAIが先に決めるのは、モデルの優劣より業務とデータの条件です。
最初に確かめるのは、AIに渡したいデータを日本国内から出してよいかどうかです。試したい業務を1つと、その業務で扱うデータの種類(顧客名簿・契約書・社内規程など)をお問い合わせからお送りください。
関連記事