ニュース
Grok 4.7発表、コーディング性能を強化しても価格はGrok 4.6据え置き
価格を上げずに性能を伸ばすAIモデルの登場は、コーディングや文書作成を外部AIに任せている企業にとって、導入コストの見直し材料になります。SpaceXAIが発表した新モデルの中身と、業務にどう関わるかを整理します。
何が起きたか
米SpaceX傘下のSpaceXAIは9月21日(現地時間)、新しいAIモデル「Grok 4.7」を発表しました。コーディングと知識労働向けのモデルとして、同社でこれまでで最も高い性能だとしています。価格と速度は前モデル「Grok 4.6」と同じ水準を維持し、同等クラスの他社モデルと比べて処理速度は2倍、価格は半分になるといいます。
ベンチマーク結果も公開されました。長時間のコーディング作業を評価する「CursorBench 4.0」ではGrok 4.7が46.3%を記録し、Grok 4.6の40.4%やOpenAIの「GPT-5.6 Sol」の41.7%を上回りました。電気工学分野の「EEBench」では64.0%、法務分野の「Harvey Legal Agent Benchmark」では19.6%となり、比較対象4モデルの中で最高だったといいます。一方、長時間のターミナル作業を測る「Terminal-Bench 4.0」や臨床推論の「HealthBench Professional」では、Anthropicの「Claude Fable 5.1」などに及びませんでした。
Grok 4.7は同日から開発ツール「Cursor」や同社のコーディングツール「Grok Build」で利用できるようになりました。API料金は100万トークンあたり入力2ドル、出力6ドルからで、比較対象のGPT-5.6 SolやClaude Fable 5.1より低い価格設定です。
背景・解説
まず用語を整理します。Grokは、SpaceXの傘下組織であるSpaceXAIが開発する大規模言語モデルで、対話や文章生成に加えてコーディング支援にも使われています。ベンチマークとは、複数のAIモデルの性能を同じ課題で比較するための評価指標です。「CursorBench」や「Harvey Legal Agent Benchmark」のように分野ごとに用意され、点数が高いほどそのタスクを正確にこなせることを示します。
Grok 4.7は、Grok 4.6より規模の大きな新しいベースモデルを採用し、完了までに時間のかかる難しいタスクを組み合わせて強化学習の期間を延ばしたとされています。これにより、自分の作業を後から確認する能力や、長い文脈を扱う能力が高まったといいます。加えて、自社のAIエージェント「Grok Bot」の実行環境を学習に取り込んだことで、会話型の作業や一般的な知識労働の性能も伸びたとしています。安全面では拒否応答やジェイルブレイク耐性の仕組みを刷新し、悪用されやすいプロンプトの通過率を抑えたと説明しています。
仕事や業務への影響 — AI Topicaの見方
外部AIにコーディングや文書作成を任せている企業ほど、費用を増やさずに処理速度と精度の両方が上がる恩恵を受けます。今回の発表のポイントは、性能を強化しながら価格をGrok 4.6と同じ水準に据え置いた点です。例えば、社内に開発者5人を抱えるIT企業が、これまでGrok系のAPIで月間1000万トークン規模のコーディング支援を利用していた場合、同じ費用のまま処理速度が上がり、長時間かかる開発タスクの完了率も高まります。
法務や電気工学など専門分野のベンチマークで高い数値が出ている点も見逃せません。契約書のレビューを外部委託している企業の法務部門なら、AIによる一次チェックの精度が上がることで、担当者1人あたりの確認作業を減らせます。ただし、ターミナル作業や臨床推論のように他社モデルが上回る分野もあるため、業務内容によって使い分ける判断が必要です。看護師や金融アナリストの業務を想定した「GDPval」の評価では、Grok 4.7のスコアがGrok 4.6やOpenAIの「GPT-6 Astra」を上回った一方、Claude Fable 5.1には届いていません。
価格を据え置いたまま性能を上げるという方針は、API利用料でコストを管理している情シス担当者にとって扱いやすい材料です。予算を変えずに導入効果を測れるため、既存の契約を維持したまま性能向上分だけを享受できます。
不確かな点・注意
今回の発表内容は、SpaceXAIが自社で実施したベンチマーク結果に基づいています。第三者機関による独立した検証結果は明らかにされていません。比較対象のGPT-5.6 SolやClaude Fable 5.1についても、どのような条件で試験を行ったかの詳細は公開されていない点に注意が必要です。
また、価格が「同等クラスのモデルと比べて半分」とする根拠や比較条件の詳細も示されていません。日本国内での提供時期や、日本語での性能については記事内で言及がなく、わかっていません。安全性に関するベンチマークも自社独自の指標が含まれており、外部からの再現性は不明です。導入を検討する際は、自社の用途に近いタスクで実際の挙動を確かめてから判断するのが望ましいでしょう。