OpenAI、GPT-5.6の効率化を公開 Codexの反復作業を軽く
OpenAIは2026年7月29日、GPT-5.6を高性能なだけでなく、実際のAIエージェント運用で軽く動かすための設計を公開しました。焦点はモデル単体のベンチマークではありません。CodexやChatGPT Workのように、モデルが何度もツールを呼び、長い文脈を抱え、同じ指示を繰り返す仕事で、待ち時間と計算量をどう減らすかです。

反復する仕事ほど、文脈が膨らむ
OpenAIは、GPT-5.6の効率化を、単純なモデル小型化や低価格化として説明していません。エージェントが複数ステップの作業を進めると、古い指示、長いツール結果、使われなかった候補、反復ログが文脈に残り、次の推論を遅くします。賢いモデルほど、一回の返答ではなく、何十回もの判断を積み重ねるため、この膨張が製品体験に効いてきます。
記事は、効率を「品質を落として安くする」話ではなく、同じ品質の仕事をより少ない計算で返す話として置いています。これはCodexにとって重要です。コード調査、差分生成、テスト、修正、再実行が続くと、費用だけでなく、ユーザーが待つ時間、レビューへ戻る速度、タスクを並列に進める余裕まで変わります。
Codexのハーネスは、キャッシュを壊さないよう整える
OpenAIが具体例として挙げているのが、CodexとChatGPT Workのエージェント用ハーネスです。システムプロンプトや長期記憶のように変わりにくい情報を前方に置き、ユーザー固有の入力や最新の観測を後ろに足す。こうすると、前半の共通部分をprompt cachingで再利用しやすくなります。
さらにOpenAIは、ツール出力の上限設定、要約、決定的なツール順序、append-onlyの履歴管理を挙げています。見た目には地味ですが、これはAIエージェントの操作面そのものです。ユーザーから見えるのは「Codexが速く返る」「長い作業でも失速しにくい」という結果でも、裏側では、同じ文脈をどこまで再利用できるかが体験を決めています。

GPT-5.6 Solが推論基盤の最適化にも使われる
もう一つの興味深い点は、OpenAIがGPT-5.6 Solを、自社の推論インフラを改善する作業にも使っていることです。記事では、Solが実トラフィックを解析し、ルーティングやGPUカーネル、推論パスを最適化するコードを提案し、20%以上のコスト削減や15%以上のspeculator効率改善につながった例が示されています。
ここは宣伝として読み流すより、AI製品の循環として見たほうがいい。強いモデルを出すだけでなく、そのモデルに提供基盤を観察させ、待ち時間と計算コストを削らせる。OpenAIが売ろうとしているのは、モデル名そのものではなく、長い仕事を現実の速度と費用で回すための運用面です。
GPT-5.6の効率化記事は、派手な新機能発表ではありません。ただ、CodexやChatGPT Workを毎日の仕事に使うなら、こうした裏側の設計がそのまま体験になります。AIエージェントの品質は、どれだけ賢く考えるかだけでなく、同じ指示を無駄に読み直さず、長い作業を止めず、必要なところだけ深く考えられるかで決まります。
