GPT-5.6 и новый Codex: модели Sol, Terra, Luna и новые функции
Обновлено: 12 июля 2026 года.
Оглавление
- Короткий ответ
- Что такое GPT-5.6 и при чём здесь Codex
- Sol, Terra и Luna: какую модель выбрать
- Что улучшилось в GPT-5.6
- Что нового появилось в Codex
- Как выбирать режим работы
- Практические сценарии
- Цена и экономика
- Ограничения и безопасность
- Как внедрить Codex в команду
- FAQ
Короткий ответ
GPT-5.6 — новое семейство моделей OpenAI, а Codex — агентная рабочая среда, в которой эти модели могут читать файлы, писать и проверять код, пользоваться инструментами, работать с приложениями и доводить длинные задачи до результата. 9 июля 2026 года OpenAI объявила общую доступность трёх вариантов GPT-5.6: Sol, Terra и Luna — в ChatGPT, Codex и API.
Sol рассчитана на самые сложные задачи, Terra предлагает баланс качества и стоимости, Luna — максимальную скорость и минимальную цену. Одновременно Codex стал заметно шире обычного coding assistant: появились плагины для ролей и инструментов, аннотации прямо на результате, Sites для публикации интерактивных приложений, hooks, мобильный доступ, Remote SSH, автоматизации и новые многоагентные режимы.
Главный вывод для бизнеса и разработки прост: выбирать нужно не «самую умную модель», а связку задача → уровень reasoning → контур контроля. Для массовой классификации и простых правок подходит Luna, для ежедневной инженерной работы — Terra, а Sol имеет смысл подключать к архитектуре, сложной отладке, исследованиям и длинным автономным задачам.
Что такое GPT-5.6 и при чём здесь Codex
GPT-5.6 — это не одна модель, а семейство из трёх уровней. OpenAI называет флагманскую модель Sol, сбалансированную — Terra, а самую быструю и доступную — Luna. По состоянию на 12 июля 2026 года семейство разворачивается в ChatGPT, Codex и Responses API. Официальный анонс OpenAI датирован 9 июля 2026 года.
Codex — продуктовый слой вокруг моделей. Если обычный чат в первую очередь отвечает текстом, Codex может исследовать репозиторий, менять файлы, запускать команды и тесты, сравнивать результат с требованиями и возвращать проверяемый артефакт. В новых сценариях он также работает с документами, таблицами, презентациями, браузером, корпоративными приложениями и визуальными материалами.
Поэтому фраза «новый Codex на GPT-5.6» объединяет два изменения:
- Модель стала сильнее в coding, tool use, computer use, дизайне и длинных задачах.
- Сам Codex получил новые способы подключения контекста, управления агентами, проверки результата и публикации артефактов.
Это важное различие. Модель отвечает за рассуждение и генерацию, а Codex — за рабочий цикл: доступ к среде, инструменты, разрешения, параллельные задачи, файлы, review и передачу результата человеку.
Sol, Terra и Luna: какую модель выбрать
| Модель | Для чего создана | Где использовать | Цена API за 1 млн токенов, input/output |
|---|---|---|---|
| GPT-5.6 Sol | Самые сложные и длинные задачи | Архитектура, глубокая отладка, research, security, автономная реализация | $5 / $30 |
| GPT-5.6 Terra | Баланс качества, скорости и стоимости | Ежедневная разработка, анализ, документы, стандартные агентные workflow | $2.50 / $15 |
| GPT-5.6 Luna | Скорость и большой объём | Классификация, извлечение, простые правки, быстрые подзадачи | $1 / $6 |
Цены приведены по официальной странице релиза GPT-5.6 и актуальны на дату обновления статьи. Они не включают стоимость вашей инфраструктуры, инструментов и повторных запусков.
Когда выбирать Sol
Sol оправдана, когда ошибка или недоделанный результат стоят дороже дополнительных токенов. Типичные примеры: миграция большого приложения, поиск редкого race condition, проектирование системы прав, аудит сложной кодовой базы, подготовка финансовой модели или создание интерфейса с многократной визуальной проверкой.
На Terminal-Bench 2.1 Sol показала 88,8%, а Sol Ultra — 91,9%. На SWE-Bench Pro результат Sol составил 64,6%. Эти цифры полезны как сигнал общей способности, но не гарантируют аналогичный процент успеха на вашем стеке. Бенчмарк измеряет определённый набор задач, а production добавляет legacy-код, неполные требования и внутренние инструменты.
Когда выбирать Terra
Terra — разумная отправная точка для большинства команд. Она дешевле Sol в два раза по input и output, при этом OpenAI позиционирует её как модель с качеством, конкурентным GPT-5.5. В официальных тестах Terra набрала 63,4% на SWE-Bench Pro и 87,4% на Terminal-Bench 2.1 — близко к Sol в задачах, где не требуется максимальный запас рассуждения.
Terra стоит назначить моделью по умолчанию для feature work, рефакторинга среднего размера, тестов, SQL, анализа логов, подготовки технических документов и работы с задачами в трекере. Затем сложные или застрявшие задачи можно эскалировать на Sol.
Когда выбирать Luna
Luna предназначена для скорости и объёма. Она стоит в пять раз дешевле Sol на входе и выходе, но всё равно показала 62,7% на SWE-Bench Pro и 84,7% на Terminal-Bench 2.1 в опубликованной OpenAI конфигурации.
Luna подходит для первичной сортировки issue, генерации однотипных тестов, форматирования данных, коротких запросов к базе знаний, извлечения полей и простых преобразований. Но экономия исчезнет, если лёгкая модель часто ошибается и требует нескольких повторных прогонов. Считать нужно не цену одного вызова, а цену принятого результата.
Что улучшилось в GPT-5.6
Длинные агентные задачи
Главное изменение находится не в эффектных ответах на один prompt, а в способности удерживать цель через много шагов. Модель должна прочитать контекст, выбрать инструменты, сделать изменения, проверить их, заметить неудачу и скорректировать план. Именно такой цикл нужен Codex.
В длинном контексте GPT-5.6 Sol получила 91,5% на OpenAI MRCR v2 для диапазона 256K–512K и 73,8% в диапазоне 512K–1M. Однако большое окно не означает идеальную память: структуру репозитория, решения и критерии приёмки всё равно лучше фиксировать в файлах проекта.
Работа с компьютером и браузером
Sol набрала 62,6% на OSWorld 2.0, а в BrowseComp с Ultra — 92,2%. Это делает модель полезнее для задач, где нужно не только написать код, но и открыть приложение, проверить интерфейс, собрать данные из нескольких источников или пройти workflow целиком.
Практическое следствие: тестирование результата становится частью выполнения задачи. Агент может создать страницу, открыть её, обнаружить переполнение или неработающую кнопку, исправить код и повторить проверку. Это ближе к работе инженера, чем к автодополнению.
Дизайн и готовые рабочие артефакты
OpenAI отдельно подчёркивает рост качества интерфейсов, презентаций, документов и таблиц. GPT-5.6 лучше следует референсам, замечает визуальные проблемы и умеет дорабатывать результат после рендера. Для Codex это важно: агент оценивает не только исходный код, но и то, что увидит пользователь.
Programmatic Tool Calling
В Responses API модель может написать и выполнить программу в памяти, которая координирует инструменты и обрабатывает промежуточные результаты. Это называется Programmatic Tool Calling. Подход уменьшает необходимость возвращать каждый промежуточный объект в основной контекст и помогает строить эффективные сложные workflow. OpenAI также заявляет совместимость механизма с Zero Data Retention.
Multi-agent и ultra
Multi-agent позволяет запускать несколько подагентов параллельно и синтезировать их работу в одном запросе. Режим ultra использует параллельные рабочие потоки для особенно сложных задач. В Codex ultra доступен пользователям Plus и более высоких планов, имеющим доступ к GPT-5.6; max доступен всем пользователям Codex с доступом к семейству.
Параллельность полезна, если работу действительно можно разделить: один агент исследует API, второй анализирует тесты, третий проверяет безопасность. Для маленькой линейной задачи multi-agent только добавит накладные расходы и усложнит проверку.
Что нового появилось в Codex
Плагины: роль, инструкции и инструменты одним пакетом
Плагины адаптируют Codex под конкретную роль и рабочую среду. Они могут объединять skills, инструкции, MCP-серверы и подключения к приложениям. 2 июня 2026 года OpenAI представила шесть ролевых плагинов и описала применение Codex за пределами разработки — для аналитиков, маркетологов, исследователей, юристов и операционных команд. Официальный обзор новых функций Codex.
Для компании плагин — это способ упаковать повторяемый процесс: где брать данные, какие шаблоны использовать, какими инструментами пользоваться и в каком формате возвращать результат. Это надёжнее, чем хранить огромный prompt в корпоративной wiki.
Skills: воспроизводимые рабочие процедуры
Skill содержит инструкции, ресурсы и скрипты для определённого типа работы. Например, отдельный skill может описывать создание презентации, обработку таблицы, внедрение дизайна из Figma или деплой приложения. Skills можно использовать в приложении Codex, CLI и IDE, а командные навыки — хранить в репозитории.
Сильная сторона skills — версионирование. Команда может изменить процесс review или формат отчёта в одном месте, проверить изменение через pull request и дать всем агентам новую версию процедуры.
Annotations: правки прямо на результате
Аннотации позволяют указать на конкретный элемент артефакта и попросить Codex изменить именно его: блок интерфейса, фрагмент документа или часть визуального результата. Это сокращает разрыв между фразой «сделай заголовок лучше» и точным контекстом, где находится заголовок и что с ним не так.
Sites: от результата к доступному URL
Sites — preview-возможность создавать интерактивные сайты и приложения, которыми можно поделиться с рабочим пространством по ссылке. Это меняет финальную точку агентной работы: результатом может быть не архив с кодом, а работающий внутренний инструмент, калькулятор, дашборд или объясняющая визуализация.
Sites не отменяет production-инженерию. Для публичного сервиса всё равно нужны домен, мониторинг, безопасность, резервирование и процесс релиза. Но для прототипов и внутренних инструментов путь от идеи до обратной связи становится короче.
Hooks: контроль до и после действий
Hooks стали общедоступны и могут проверять prompts на секреты, запускать валидаторы, записывать события, создавать память или применять правила репозитория. Это важная enterprise-функция: качество и безопасность нельзя оставлять только на усмотрение модели.
Хук можно поставить перед опасным действием, после изменения файла или перед завершением задачи. Например, организация способна запретить отправку ключей, автоматически запускать линтер и security scan, а затем прикладывать результат к отчёту агента.
Мобильный Codex и Remote SSH
Codex появился в мобильном приложении ChatGPT в preview. Пользователь может ответить на вопрос агента, скорректировать задачу или подтвердить следующий шаг, пока работа идёт на ноутбуке, devbox или удалённой машине. Remote SSH позволяет работать с удалёнными средами, не перенося весь проект на локальный компьютер. OpenAI описала эти возможности 14 мая 2026 года.
Automations и фоновые задачи
Automations запускают инструкции и skills по расписанию, а результат отправляют в очередь review. Подход подходит для triage issue, сводок по CI, release briefs и регулярной проверки ошибок. Автоматизация должна завершаться проверяемым артефактом, а не бесконтрольным изменением production.
Память и подключённые приложения
Новый Codex может использовать контекст из рабочих инструментов и учитывать предпочтения пользователя. Это помогает собирать документы, отчёты и задачи из разрозненных источников. Одновременно растёт цена ошибки доступа: агент должен видеть только те данные, которые нужны для конкретной работы.
Как выбирать режим работы
Мы предлагаем фреймворк AI рассвет «Три контура выбора».
Контур 1. Задача
Сначала определите сложность и цену ошибки.
- Низкая сложность, низкий риск: Luna.
- Средняя сложность, обычный feature work: Terra.
- Высокая сложность или дорогая ошибка: Sol.
- Несколько независимых сложных направлений: Sol с max или ultra.
Контур 2. Reasoning
Не повышайте reasoning автоматически. Начните со стандартного режима и усиливайте его при наличии сигнала: задача застряла, много ограничений, требуется глубокое исследование или модель должна согласовать несколько систем.
max даёт модели больше вычислительного бюджета. ultra координирует параллельные рабочие потоки. Это полезно для архитектурного исследования или большого плана миграции, но избыточно для переименования поля.
Контур 3. Контроль
Чем больше автономность, тем строже guardrails:
- ограниченная файловая область;
- сеть только по необходимости;
- минимальные права в приложениях;
- hooks для секретов и проверок;
- тесты и статический анализ;
- human approval перед деплоем, удалением и внешней отправкой;
- журнал команд, ссылок и изменений.
Правильная модель без контроля остаётся риском. Более простая модель с хорошими тестами и ясными критериями часто приносит бизнесу больше пользы.
Практические сценарии
Разработка функции
Terra читает задачу и репозиторий, предлагает план, реализует изменение и запускает тесты. Sol подключается, если затронута архитектура, данные или сложная совместимость. Luna может подготовить механические тестовые случаи и документацию.
Миграция большого проекта
Sol Max исследует зависимости и формирует карту миграции. Параллельные агенты анализируют frontend, backend и CI. Человек утверждает план, после чего изменения делятся на небольшие проверяемые этапы. Ultra полезен на стадии исследования, но не заменяет последовательную интеграцию.
Аналитика и knowledge work
Codex собирает контекст из документов и приложений, обрабатывает данные скриптами, формирует таблицу или презентацию и проверяет соответствие шаблону. Terra подходит для большинства таких задач; Sol — для сложной финансовой, юридической или научной аналитики.
Внутренний инструмент
Команда описывает процесс на естественном языке, Codex строит интерфейс, проверяет его в браузере и публикует preview через Sites. Аннотации ускоряют обратную связь: владелец процесса указывает на конкретный элемент и формулирует правку без длинного технического задания.
Операционная автоматизация
Automation по расписанию собирает ошибки CI, группирует их и создаёт краткий отчёт. Hooks проверяют отсутствие секретов и корректность ссылок. Luna подходит для сортировки, Terra — для анализа причин, Sol — для редких сложных инцидентов.
Цена и экономика
Сравнение тарифов по токенам — только первый уровень. Полная стоимость задачи включает:
- входные и выходные токены;
- повторные попытки;
- вызовы внешних инструментов;
- время человека на постановку и review;
- стоимость ошибки;
- инфраструктуру исполнения;
- поддержку skills, плагинов и интеграций.
Простой пример: если Luna стоит в пять раз дешевле Sol, но требует четырёх повторных прогонов и часа ручной правки, она может оказаться дороже. И наоборот, запуск Sol на тысяче простых классификаций — ненужная переплата.
Полезная метрика — cost per accepted task, стоимость принятого результата. Для её расчёта запишите стоимость всех попыток и проверок, а затем разделите на количество задач, прошедших критерии качества. Маршрутизация моделей должна опираться на эту метрику, а не на впечатления от одного красивого ответа.
GPT-5.6 также вводит более предсказуемое кэширование prompts: явные точки разрыва кэша и минимальную жизнь кэша 30 минут. Запись кэша для GPT-5.6 и более новых моделей тарифицируется по 1,25 от обычной цены input, а чтение получает скидку 90%. Для длинных стабильных инструкций это может снижать стоимость повторных задач.
Ограничения и безопасность
Бенчмарк не равен вашему production
Опубликованные результаты измерены OpenAI или указанными авторами тестов на конкретных наборах данных. Они не доказывают, что модель решит 64,6% ваших задач. Проведите собственный eval на 30–100 типовых кейсах, включая неудачные и пограничные примеры.
Агент может ошибаться убедительно
Codex способен написать рабочий тест, который проверяет неправильное поведение, или сослаться на неверную предпосылку. Требуйте evidence: diff, команды, результаты тестов, ссылки на документацию и описание ограничений.
Инструменты расширяют поверхность атаки
Доступ к браузеру, shell, CRM и облаку превращает текстовую ошибку в потенциальное действие. Используйте sandbox, allowlist доменов, минимальные роли и подтверждение опасных операций. Контент из интернета и документов следует считать недоверенными данными: внутри него может находиться prompt injection.
Multi-agent увеличивает сложность управления
Несколько агентов быстрее исследуют независимые области, но могут дублировать работу, противоречить друг другу или изменить пересекающиеся файлы. Нужен владелец интеграции, чёткие границы задач и единый критерий готовности.
Доступность функций зависит от плана и rollout
OpenAI разворачивает функции постепенно. Sol, Terra, Luna, max, ultra, Sites или мобильный доступ могут отличаться по планам, регионам и типам workspace. Перед внедрением сверяйте интерфейс и официальную документацию, а не только статью.
Как внедрить Codex в команду
- Выберите один процесс. Не начинайте с цели «внедрить AI». Возьмите feature triage, обновление тестов или подготовку отчёта.
- Зафиксируйте baseline. Измерьте время, число ошибок и долю задач, проходящих review с первого раза.
- Создайте критерии приёмки. Команды проверки, тесты, структура отчёта и запретные действия должны быть записаны.
- Назначьте Terra по умолчанию. Luna используйте для дешёвых подзадач, Sol — для эскалации сложных кейсов.
- Упакуйте процесс в skill или plugin. Так инструкция станет версионируемой и повторяемой.
- Добавьте hooks и минимальные права. Проверяйте секреты, форматирование, тесты и безопасность автоматически.
- Запустите ограниченный пилот. Сравните 30–100 задач с baseline, а не один демонстрационный пример.
- Считайте cost per accepted task. Включайте повторные попытки и время review.
- Расширяйте автономность поэтапно. Сначала чтение и рекомендации, затем изменения в ветке, после — действия с обязательным approval.
FAQ
GPT-5.6 уже доступна всем?
OpenAI объявила общую доступность 9 июля 2026 года и постепенный глобальный rollout. Доступ зависит от продукта и плана. В Codex пользователи Free и Go получают Terra, а Plus, Pro, Business и Enterprise могут выбирать Sol, Terra и Luna; конкретная доступность может появляться постепенно.
Чем GPT-5.6 отличается от Codex?
GPT-5.6 — семейство моделей, которые рассуждают и генерируют результат. Codex — агентная среда, которая даёт модели файлы, инструменты, приложения, permissions, выполнение команд, параллельную работу и интерфейс review.
Что лучше для программирования: Sol или Terra?
Для большинства ежедневных задач начните с Terra. Sol выбирайте для сложной архитектуры, длинных автономных изменений, глубокой отладки и случаев с высокой ценой ошибки. Решение следует подтвердить собственным eval и стоимостью принятой задачи.
Для чего нужна Luna?
Luna полезна для быстрых и массовых операций: классификации, извлечения данных, простых правок и механических подзадач. Она самая дешёвая в семействе, но требует контроля качества, если задача неоднозначна.
Что такое max и ultra в Codex?
Max выделяет больше reasoning-бюджета сложной задаче. Ultra координирует несколько параллельных агентных потоков. Ultra имеет смысл, когда задачу можно разделить на независимые исследования; для линейной небольшой работы он избыточен.
Заменит ли новый Codex разработчиков?
Codex автоматизирует всё более крупные части разработки и knowledge work, но production всё ещё требует постановки задачи, архитектурных решений, управления доступом, проверки, ответственности и понимания бизнеса. Практическая модель — не «агент вместо команды», а команда, которая делегирует агентам проверяемые участки работы.
Безопасно ли давать Codex доступ к корпоративным системам?
Только с минимальными правами, sandbox, журналированием, hooks, allowlist сети и подтверждением опасных действий. Не выдавайте агенту широкие production-права ради удобства. Начинайте с read-only и тестовой среды.
Какие новые функции Codex самые важные?
Для индивидуального пользователя — skills, annotations, мобильный доступ и улучшенная проверка результата. Для команды — плагины, hooks, Remote SSH, Automations и programmatic access tokens. Для сложных проектов — max, ultra и multi-agent.
Итог
GPT-5.6 усиливает Codex именно там, где агентные системы обычно ломались: в длинных задачах, работе с инструментами, браузером, интерфейсами и сложным контекстом. Но более важное изменение — продуктовая зрелость самого Codex. Плагины, skills, annotations, Sites, hooks, автоматизации и удалённый доступ превращают его из генератора кода в среду выполнения работы.
Практичная стратегия на 2026 год: Terra как модель по умолчанию, Luna для дешёвого масштаба, Sol для сложных и дорогих задач; max и ultra — только там, где дополнительное reasoning и параллельность окупаются. Качество следует измерять на собственных задачах, а автономность увеличивать вместе с тестами, правами и human review.