知識がなくても始められる、AIと共にある豊かな毎日。
AIコーディング

2026年7月、AIモデルが一斉に動いた — 19日間で4社が出したものを時系列で追う

ゲンキ

2026年7月、AIモデルが一斉に動いた — 19日間で4社が出したものを時系列で追う

2026年7月、主要なAIモデルの発表が異常な密度で続きました。7月9日から27日までのわずか19日間に、OpenAI・Moonshot AI・Google DeepMind・Anthropic の4社が、それぞれ最上位クラスの新モデルを世に出しています。1社あたり数ヶ月に一度という従来の感覚からすると、明らかに様子が違いました。

問題は、これだけ立て続けに来ると個々のニュースを追えても全体像が結べないことです。名前だけが増え、どれが何で、自分の仕事に関係があるのかが判断できない。実際、この期間に登場したモデル名は少なく数えて8つあります。しかも同じ会社の中で価格帯も役割も違う。

この記事では、19日間に起きたことを1本の時系列に通し直します。各社が何を出し、そして何を出さなかったのか。数字と日付はすべて一次情報または一次報道で確認したものだけを使い、性能の主張については誰の主張なのかを必ず明記します。読み終えたとき、少なくとも「いま自分が使っている道具を替えるべきか」の判断材料が手元に残るはずです。

忍者AdMax

7月に何が起きたのか — 19日間の時系列

まず全体を1枚に収めます。日付はすべて公開日であり、発表日とウェイト公開日が異なる場合は分けて記載しています。

日付出来事
6月26日OpenAI が GPT-5.6 を限定プレビューとして公開(信頼できるパートナー限定)
7月9日GPT-5.6 が一般公開。Luna・Terra・Sol の3階層
7月16日Moonshot AI が Kimi K3 を発表
7月21日Google DeepMind が Gemini 3.6 Flash・3.5 Flash-Lite・3.5 Flash Cyber を公開
7月24日Anthropic が Claude Opus 5 を公開
7月27日Moonshot AI が Kimi K3 のウェイトを公開
7月30日OpenAI が GPT-5.6 Luna・Terra を値下げ(Luna は8割引、Sol は据え置き)

この表を眺めて最初に気づくのは、間隔の短さです。7月9日の GPT-5.6 一般公開から7月24日の Claude Opus 5 まで15日。その間に Kimi K3 の発表と Gemini の3モデルが挟まっています。競合の発表を見てから自社の計画を組み替える余裕は、この間隔では物理的にありません。つまり4社はそれぞれ独立に準備を進め、たまたま同じ月に着地したことになります。偶然の一致というより、開発サイクルが揃ってきたと見るほうが自然でしょう。

もうひとつ、背景として押さえておきたい事実があります。Anthropic はこの7月24日以前にも動いていました。Claude Opus 4.8 が5月28日、Claude Fable 5 が6月9日の公開です。つまり同社は2ヶ月足らずのうちに複数の新モデルを重ねており、7月24日の Claude Opus 5 はその連続投入の最後に位置します。この経緯はClaudeの最新情報に一気に追いつく (2026-07-27 公開)に詳しくまとめています。

OpenAIが3つの階層で出したGPT-5.6

7月9日、OpenAI が GPT-5.6 を一般公開しました。特徴的なのは単一モデルではなく、能力順に Luna・Terra・Sol という3つの階層で構成されている点です。

公開時の価格は100万トークンあたりで、Luna が入力1ドル・出力6ドル、Terra が入力2.50ドル・出力15ドル、Sol が入力5ドル・出力30ドルでした。その後7月30日に値下げが入り、現在は Luna が入力0.20ドル・出力1.20ドル、Terra が入力2ドル・出力12ドルです(Sol は据え置き)。最下位と最上位の入力価格差は、公開時の5倍から25倍に広がりました。

ここで注目したいのは、名前の付け方そのものです。従来は「GPT-4」「GPT-4 Turbo」のように世代と派生で区別していたものが、同一世代の中に明確な3階層を切る形に変わりました。利用者は「新しいモデルに乗り換えるか」ではなく「どの階層を使うか」を日常的に判断することになります。これは後述する4社共通の潮流の、最もわかりやすい表れです。

OpenAI 自身は Sol を「これまでで最良のコーディングモデル」と位置づけ、加えて「これまでで最も強力なサイバーセキュリティモデル」でもあるとしています。コーディング用途では従来より54パーセント高いトークン効率を達成した、というのも同社の主張です。いずれも第三者による独立検証ではないため、数字そのものより「同社がどの用途を主戦場と見ているか」の表明として読むのが妥当でしょう。中間層の Terra については、前世代の GPT-5.5 と競合する性能を半額で提供する、という位置づけが示されています。公開時の Terra は入力2.50ドルで GPT-5.5 の半額にあたり、この主張と整合しています(7月30日の値下げでさらに安くなりました)。

GPT-5.6 の詳しい仕様や、前世代からの移行についてはChatGPT 完全ガイド 2026年5月版 (2026-05-04 公開)で扱った GPT-5.5 時代の構成と比較すると、階層化の意図がより鮮明になります。

Moonshotが2度に分けて出したKimi K3

7月16日、中国の Moonshot AI が Kimi K3 を発表しました。そして11日後の7月27日、モデルのウェイトを Hugging Face 上で公開しています。発表とウェイト公開が分かれているため、日付を混同しないよう注意が必要です。

規模の数字が目を引きます。総パラメータ数は2.8兆。ただしこれは Mixture-of-Experts と呼ばれる構造で、推論時に実際に働くパラメータは1,040億です。総数だけを見て「2.8兆のモデルが手元で動く」と考えると見誤ります。文脈長は1,048,576トークン、つまり約100万トークンです。ダウンロードの総量は1.56テラバイトに達します。

価格は100万トークンあたり入力3ドル・出力15ドル、キャッシュヒットした入力は0.30ドルです。この水準は、後述する性能と照らすと相当に安い部類に入ります。

ここで慎重に扱うべきなのがライセンスです。Moonshot はウェイトを公開していますが、これはオープンウェイトであって、いわゆるオープンソースではありません。Hugging Face 上のライセンス識別子も標準的なものではなく、独自の Kimi K3 License が指定されています。条件を読むと、個人・スタートアップ・多くの企業は利用・改変・ファインチューン・再配布ができる一方で、収益に連動した2つの制限があります。ひとつは、これをホスティングして推論を販売するモデル提供事業として使い、その用途の収益が12ヶ月で2,000万ドルを超える場合、Moonshot との個別契約が必要になること。もうひとつは、自社製品に組み込む場合、月間アクティブユーザーが1億人または月間収益が2,000万ドルを超えると「Kimi K3」の明示が求められることです。

大半の読者にとって実害のない条件ではありますが、「重みが公開されている」ことと「自由に使える」ことは同じではない、という区別は押さえておく価値があります。

なお、推論の深さを指定する reasoning_effort というパラメータが用意されており、モデルカードには low・high・max の3つが記載されています。既定値は max です。ローカル実行の現実性については、オープンウェイトのモデルを自宅環境で動かす話をオープンソース 3D生成 実践 2026 (2026-07-08 公開)で扱っていますが、1.56テラバイトという規模は個人環境の常識からは外れています。現実的にはAPIかホスティング事業者経由での利用になるでしょう。

GoogleがFlashだけを出した日

7月21日、Google DeepMind が3つのモデルを同時に公開しました。Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、そして Gemini 3.5 Flash Cyber です。

主力となる 3.6 Flash について、Google はコーディング・ナレッジワーク・マルチモーダル性能を改善しつつ、トークン使用量を最大17パーセント削減したと説明しています。同じ仕事をより少ないトークンで終えられれば、実質的な値下げになるという理屈です。この17パーセントという数字は Google 自身の主張であり、独立検証ではない点は留意してください。Flash-Lite はこのクラスで最も安価な選択肢という位置づけです。

3つ目の Flash Cyber は性格が異なります。セキュリティ上の脆弱性を発見し修正することに特化してファインチューンされたモデルで、政府および信頼できるパートナーに限定した、限定アクセスのパイロットプログラムとして提供されます。誰でも使えるモデルではありません。

そして、この発表で最も語られたのは出なかったものでした。フラッグシップである Gemini Pro の更新が含まれていなかったのです。Pro の最終更新は2026年2月であり、7月21日の時点で5ヶ月間据え置かれていたことになります。Bloomberg は7月16日、Google が 3.5 Pro の投入にあたって社内の性能目標を満たせず遅延していると報じました。発表当日、Google DeepMind のプロダクトリードである Logan Kilpatrick 氏は、Gemini 3.5 Pro を現在パートナーとテスト中であり、近いうちに着地することを期待していると述べています。

4社が最上位モデルを次々に出す月に、1社だけがフラッグシップを出せなかった。この対比は、開発競争の速度が各社に等しく味方しているわけではないことを示しています。前世代の Pro についてはGemini 3.1 Pro 完全ガイド 2026年5月版 (2026-05-18 公開)にまとめてあります。

AnthropicのOpus 5が動かした価格と性能の関係

7月24日、Anthropic が Claude Opus 5 を公開しました。この発表が興味深いのは、性能の絶対値よりも、価格と性能の関係を組み替えた点にあります。

価格は100万トークンあたり入力5ドル・出力25ドルで、前世代の Claude Opus 4.8 から据え置きです。一方で同社の最上位である Claude Fable 5 は入力10ドル・出力50ドル、つまり Opus 5 のちょうど2倍にあたります。Anthropic は、この半額の Opus 5 が多くのタスクで Fable 5 に迫ると位置づけました。値段を上げずに上位機に近づける、という提案です。

仕様面では、文脈長100万トークンが既定かつ最大、出力の上限が128,000トークンとなっています。運用上の変更点として見逃せないのは、思考(thinking)が既定でオンになったことです。Opus 4.8 では指定を省略すると思考なしで動いていたため、この挙動は反転しました。出力上限は思考と本文の合計に対してかかるので、思考なしを前提に上限を切り詰めていた設定は、そのままでは途中で切れる可能性があります。

もうひとつ、安全性まわりの変更が発表されています。Anthropic によれば、安全分類器が作動する頻度は Fable 5 と比べて85パーセント少ないとのことです。あわせて Automatic Fallbacks というベータ機能が導入され、分類器が作動した場合にエラーを返すのではなく、より制約の緩い下位モデルへ自動的に振り分けて応答を返せるようになりました。拒否そのものを減らし、拒否が起きたときの受け皿も用意する、という二段構えです。この設計思想の背景についてはAIへの依存リスクが現実になった日 (2026-07-29 公開)で扱ったフォールバック設計の議論と地続きです。

独立した物差しで並べ直す

ここまで各社の主張を紹介してきましたが、ベンダー自身のベンチマークだけを並べても比較にはなりません。それぞれが自社の得意な指標を選んで提示するからです。異なる企業のAIモデルを同じ土俵で見るには、測定する側が中立である必要があります。そこで、独立した第三者による横断指標を1つ置いておきます。

Artificial Analysis が公開している Intelligence Index の2026年8月時点の値は次のとおりです。

モデルスコア
Claude Opus 5(max)63
Claude Fable 5(max)62
GPT-5.6 Sol(max)61
Kimi K360
Claude Opus 4.8(max)57

この表から読み取れることは3つあります。第一に、上位4モデルは63から60の範囲に収まっており、差は数字にして3ポイントです。「圧倒的な1強」という構図ではなく、団子状態と表現するほうが実態に近いでしょう。第二に、Claude Opus 5 が最上位の Claude Fable 5 をわずかに上回っています。半額のモデルが自社の最上位に並んだ、という Anthropic の主張は、少なくともこの指標の上では裏付けられています。第三に、オープンウェイトである Kimi K3 が60で、商用クローズドの Claude Opus 4.8(57)を上回りました。無償で重みが手に入るモデルが、有償の上位モデルと同じ土俵に立っています。

ただし、この種の順位は時点によって動きます。Kimi K3 が公開された時期には同指標で3位と報じられており、その後の各社の更新で入れ替わっています。あくまで2026年8月時点の1枚のスナップショットとして扱ってください。単一の指標で優劣を断じるのは危険で、用途ごとに見え方は変わります。

潮流その1 — 「どれだけ考えさせるか」を利用者に選ばせる

4社の発表を並べると、共通する設計思想が浮かび上がります。どのモデルを使うかではなく、同じモデルにどれだけ計算を割かせるかを利用者側が決める構造への移行です。

Anthropic の Claude Opus 5 は effort という設定を持ち、low・medium・high・xhigh・max の5段階から選べます。Moonshot の Kimi K3 は reasoning_effort として low・high・max を用意しています。OpenAI は Luna・Terra・Sol という階層そのものでこれを表現し、さらに上位階層の中にも深さの指定があります。Google は Flash と Flash-Lite という軽量側の刻みで同じことをしています。実装の形は違いますが、狙いは同じです。

これは利用者にとって、良い知らせと厄介な知らせの両方を含んでいます。良い面は、簡単な仕事に高い料金を払わずに済むことです。定型的な整形や分類に最上位の思考深度を使うのは無駄で、その無駄を削る手段が公式に用意されました。

厄介な面は、設定の責任が利用者に移ったことです。深く考えさせすぎれば請求が膨らみ、浅くしすぎれば品質が落ちる。しかもどちらの失敗も、静かに起きます。エラーは出ません。従来は「上位モデルを選べば安心」という一次元の判断で済んでいたものが、タスクごとの見極めを要する作業に変わりました。この使い分けの実務はClaude Opus 4.8を選ぶ理由はまだあるか (2026-07-30 公開)で具体的に扱っています。

潮流その2 — サイバー能力への正反対の判断

もうひとつ、同じ月に真逆の判断が並んだ論点があります。セキュリティ分野の扱いです。

OpenAI は GPT-5.6 Sol を「これまでで最も強力なサイバーセキュリティモデル」と自ら位置づけ、能力の高さを売りにしました。Google は Flash Cyber という専用モデルを作りましたが、提供先を政府と信頼できるパートナーに絞り、限定アクセスのパイロットとしています。Anthropic は逆方向で、該当領域では安全分類器を作動させて応答を拒否する設計を採っており、Opus 5 ではその頻度を Fable 5 より下げたことを改善点として説明しています。

同じ能力向上に対して、「特化して売る」「相手を選んで出す」「出さずに拒否する」という3通りの答えが、19日間のうちに並んだことになります。どれが正しいかを論じるのはこの記事の役目ではありませんが、実務者にとって重要な含意がひとつあります。モデルによって、通る依頼と通らない依頼が違うということです。

セキュリティに直接関係のない作業でも、分類器が誤って作動することはあります。そのときエラーで処理が止まるのか、下位モデルに振り替わって答えが返るのかは、選んだモデルと設定で決まります。業務に組み込むなら、拒否されたときにどうするかをあらかじめ決めておく必要があります。

規制という、性能とは別の変数

最後に、技術以外の要因に触れておきます。7月の動きには、規制が可用性を左右した例が複数含まれていました。

GPT-5.6 は6月26日に信頼できるパートナー限定で先行公開され、一般公開は7月9日でした。TechCrunch の報道によれば、米政権が6月にロールアウトの制限を求めており、悪用への懸念が理由とされています。Gemini 3.5 Flash Cyber の提供先が政府と限られたパートナーに絞られたことも、同じ文脈で理解できます。

ここから引き出せる実務的な教訓は単純です。あるモデルが使えるかどうかは、性能だけでは決まらない。技術的に優れていても、規制や提供方針で手が届かない期間が生じます。特定のモデルに業務を密結合させると、その事情が自分の業務に直接跳ね返ってきます。輸出規制によって実際に提供が一時停止した事例と、そこから導かれる備え方についてはAIへの依存リスクが現実になった日 (2026-07-29 公開)で詳しく扱っています。

なお、政策の是非やその背景については、この記事では踏み込みません。報道された事実として、可用性に影響が出た例があった、という範囲に留めます。

メイカーの実務にどう効くか

ここまでは業界全体の話でした。3Dプリントや設計の作業に落とすと、何が変わるのでしょうか。

結論から言えば、いま使っている道具を慌てて替える必要はありません。新しいAIモデルが出たという情報そのものは、乗り換えの理由になりません。理由は独立指標の団子状態にあります。上位4モデルのスコア差は61対57で、日常のCAD補助や設定相談で体感できるほどの開きではないからです。乗り換えには、プロンプトの作り直しと勘所の学び直しというコストがかかります。4ポイントの差はそのコストを正当化しません。

一方で、効く変化も確実にあります。ひとつは思考深度の設定です。パラメトリックな箱の寸法を1つ変えるだけの作業に最上位の深度を使うのは明確な無駄で、こうした軽い依頼を低い設定に落とすだけで請求は目に見えて下がります。逆に、干渉を検算させるような幾何の詰めでは深度を上げる価値があります。この線引きの実例はClaudeを3Dプリント設計に活用する (2026-08-01 公開)の実走記録が参考になります。

もうひとつは100万トークン級の文脈が標準になったことです。Claude Opus 5 も Kimi K3 も約100万トークンを扱えます。これはプロジェクト単位の使い方に効きます。設計メモ・過去の失敗記録・使用中のフィラメントの物性表・スライサー設定の履歴をまとめて渡し、その全体を踏まえた助言を求める、という運用が現実的になりました。1ファイルずつ小分けに相談していた頃とは、返ってくる答えの質が変わります。

そして価格の下がり方も無視できません。GPT-5.6 Luna は7月30日の値下げ後、入力0.20ドル・出力1.20ドルです。写真からの寸法読み取りや、印刷ログの一次仕分けのような量の出る単純作業を、この価格帯に逃がす選択肢が増えました。設計の中核は上位モデル、周辺の反復作業は下位階層、という役割分担が組みやすくなっています。工程ごとのAI活用の全体像はAI 3D設計 完全ガイド 2026 (2026-07-19 公開)に地図としてまとめてあります。

まとめ — 19日間が残した3つの問い

2026年7月に起きたことを整理してきました。最後に、この19日間が私たちに残した問いを3つ挙げます。

第一に、どの階層を使うかという問いです。4社が揃って知能量のダイヤルを利用者に渡しました。契約するモデルを決めれば終わりだった時代は終わり、タスクごとの割り当てが日常の判断項目になります。まずは自分の頻出タスクを3つ選び、それぞれに適した深度を決めてしまうのが近道です。

第二に、拒否されたらどうするかという問いです。セキュリティ能力への各社の判断が割れた結果、モデルごとに通る依頼が違う状況が生まれました。業務に組み込むなら、止まったときの代替経路を先に用意しておく必要があります。

第三に、性能以外で選ぶ基準は何かという問いです。規制や提供方針で可用性が変わる以上、ベンチマークの数字だけで一社に寄せるのは危うい。AIモデルを業務の土台に据えるなら、性能の順位より供給の安定性を先に評価すべき場面があります。この視点は、世代交代が速いほど重要になります。

数字は動きます。この記事の順位表も、2026年8月時点のスナップショットにすぎません。変わらないのは、道具の性能ではなく道具の使い分けを設計した人が結果を出す、という構図のほうです。19日間の熱狂が落ち着いたあとに残るのは、その設計だと思います。

ブラウザだけでできる本格的なAI画像生成【ConoHa AI Canvas】
ABOUT ME
swiftwand
swiftwand
AIを使って、毎日の生活をもっと快適にするアイデアや将来像を発信しています。 初心者にもわかりやすく、すぐに取り入れられる実践的な情報をお届けします。 Sharing ideas and visions for a better daily life with AI. Practical tips that anyone can start using right away.
記事URLをコピーしました