Переход с GPT-5.6 на Astra
четыре подводных камня
Официальное руководство OpenAI по переходу перечисляет для gpt-6-astra четыре жёстких ограничения: убрать temperature, top_p и top_logprobs (а на Chat Completions ещё и logprobs); уровень рассуждений none не поддерживается, поэтому с none или minimal начинают с low; вызов инструментов требует эндпоинта Responses; и потолок вывода 128 000 включает токены рассуждений. Третий пункт чаще всего принимают за ошибку в собственном коде.
Обновлено 2026-10-08
Claude, GPT и китайские модели по одному ключу, оплата по токенам; доступные модели — на /models.
- Оплата по токенам — актуальные цены на /models
- Оплата через СБП, российскими картами, картами Visa / Mastercard / AMEX или криптовалютой
- Самообслуживание: после пополнения тариф активируется мгновенно
Четыре жёстких ограничения
Нужно убрать
temperature, top_p, top_logprobs — и logprobs, если вы на Chat Completions. Прямо из официального руководства.
Только пять уровней рассуждений
low, medium, high, xhigh, max. Руководство советует всем, кто был на none или minimal, начать с low и сравнить.
Единственный эндпоинт для инструментов
Официальная формулировка: Astra поддерживает Chat Completions, но вызов инструментов требует Responses. Диалог идёт, инструменты не вызываются.
Потолок вывода включает рассуждения
Токены рассуждений идут в вывод, поэтому max_tokens по длине видимого ответа приводит к раннему обрыву.
Тот пункт, что выглядит как ваша ошибка
Большинство проблем перехода выглядит как дефект в собственном коде: тот же путь function calling работает на GPT-5.6, а на gpt-6-astra инструменты просто не вызываются, и явной ошибки нет. Официальное руководство говорит об этом прямо: Astra поддерживает Chat Completions, но вызов инструментов требует эндпоинта Responses. На Chat Completions она нормально ведёт диалог и лишь никогда не вызывает инструмент. Проверьте эндпоинт, прежде чем отлаживать схему.
Почему параметры сэмплирования должны уйти
Руководство требует убрать temperature, top_p и top_logprobs, а при использовании Chat Completions — ещё и logprobs. Обычно эти параметры проставляются по умолчанию в обёртке команды, поэтому дешевле фильтровать по имени модели на выходе, чем править каждое место вызова. Заодно: если ваша обёртка по умолчанию ставит уровень рассуждений none или minimal, обработайте это в том же проходе — у Astra такого уровня нет.
Хронология
Выходит GPT-6 Astra с идентификатором gpt-6-astra: контекст 1 050 000, максимум входа 922 000, выхода 128 000, срез знаний 2026-04-30.
Одновременно публикуется официальное руководство по переходу: убрать параметры сэмплирования, уровня none нет, вызов инструментов через Responses. Поддерживаемые эндпоинты — Chat Completions, Responses и Batch.
Страница сверена построчно с официальной документацией по модели и руководством по переходу; пересказы параметров из вторых рук не использовались.
Что написано и чего нет
✅ Прямо из официального руководства
Убрать temperature, top_p и top_logprobs (на Chat Completions ещё logprobs); none не поддерживается, начинать с low и сравнивать; Astra поддерживает Chat Completions, но вызов инструментов требует Responses; уровни рассуждений — low, medium, high, xhigh, max; поддерживаемые эндпоинты — Chat Completions, Responses, Batch; контекст 1 050 000, максимум входа 922 000, выхода 128 000. Правило для длинного контекста есть на той же официальной странице модели: при входе свыше 272K весь запрос, а не только превышение, идёт по 2x для входа и кэша и по 1.5x для выхода (сверено 2026-09-29).
⚠️ Чего в официальной документации нет
Число параметров и оценка SWE-bench Verified — вот чего в официальной документации по-прежнему нет. А вопрос, пересчитывается ли при входе свыше 272 000 весь запрос или только превышение, закрыт: в официальной модели это записано, и после дословной сверки 2026-09-29 эта строка перенесена в левую колонку. Числа из сети по этим двум пунктам не считаются официальными и здесь не используются.
Два пути перехода
Фильтровать в слое обёртки
Убирать неподдерживаемые параметры по имени модели на выходе и отображать none/minimal в low. Одно изменение — выигрывают все места вызова, и откат тоже одно изменение. Подходит, когда вызовы разбросаны.
Править каждое место вызова
Точно, но медленно, и легко пропустить умолчания обёртки. Оправдано лишь при малом числе мест вызова или когда им действительно нужна разная обработка.
Разумный порядок
Сначала переведите путь вызова инструментов на эндпоинт Responses и убедитесь, что он работает: это единственный пункт, который отказывает молча. Затем уберите четыре параметра сэмплирования в слое обёртки и отобразите none/minimal в low. Дальше пересчитайте max_tokens по новому учёту — в 128 000 входят токены рассуждений. Наконец прогоните одни и те же реальные запросы через gpt-5.6-sol и gpt-6-astra и решите по разнице в качестве и стоимости, сколько переносить.
В QCode
gpt-6-astra есть в таблице моделей QCode, и за последние 30 дней по ней были реальные вызовы. Она использует тот же ключ и ту же квоту, что три уровня GPT-5.6 и Claude, поэтому сравнение при переходе делается легко: тот же эндпоинт, тот же ключ, меняете поле model и прогоняете один и тот же набор запросов через обе модели. Разница в стоимости и качестве видна в тот же день. И ещё одно разграничение: по сообщению CNBC (первым сообщил WSJ) OpenAI решила не выпускать GPT-6.1 Astra; ни на сайте OpenAI, ни в её официальных аккаунтах такого заявления нет, поэтому эта строка — публикация СМИ. По состоянию на 2026-10-08 из выпущенных моделей GPT-6 на QCode доступны gpt-6-astra, gpt-6-sol и gpt-6.1-sol. QCode пока не поддерживает gpt-6-luna и gpt-5.6-luna (обе удалены из /models); используйте другую модель GPT, например gpt-6.1-sol, gpt-6-sol или gpt-5.6-terra.
Частые вопросы
Почему function calling не работает на Astra?
Обычно дело в эндпоинте. Официальное руководство прямо указывает: Astra поддерживает Chat Completions, но вызов инструментов требует Responses. На Chat Completions она нормально ведёт диалог и просто не вызывает инструмент. Переведите этот путь на Responses, прежде чем отлаживать схему.
Какие параметры нужно убрать?
temperature, top_p и top_logprobs — плюс logprobs, если вы на Chat Completions. Именно эти четыре перечисляет официальное руководство.
Я использовал reasoning effort = none. Что теперь?
Astra не поддерживает none. Руководство советует начать с low и сравнить. Учтите, что токены рассуждений идут в вывод, поэтому более высокий уровень дороже по выходной части.
Как задавать max_tokens?
Помните, что в потолок вывода 128 000 входят токены рассуждений. Если задавать его по длине видимого ответа, модель может израсходовать лимит на этапе рассуждений и оборваться раньше. При переходе пересчитайте этот потолок по новому учёту.
Сколько контекста доступно?
Официальная документация даёт окно 1 050 000 при максимуме входа 922 000 и выхода 128 000. Правило для длинного контекста там же записано: при входе свыше 272K «for the full request», то есть весь запрос идёт по 2x для входа и кэша и по 1.5x для выхода, а не только превышение (сверено 2026-09-29). На QCode действует это же правило.
Как переключиться с минимальным риском?
В QCode отправьте один и тот же набор реальных запросов на gpt-5.6-sol и gpt-6-astra — один ключ, одна квота, меняется только поле model. Решите, оправдывает ли разница в качестве разницу в стоимости, прежде чем выбирать между распределением по задачам и полным переходом.
Источники
Официальное руководство OpenAI по переходу (параметры сэмплирования, уровни рассуждений, эндпоинт для инструментов) и официальная документация по модели (контекст, потолок вывода, поддерживаемые эндпоинты, срез знаний). Оба получены 2026-09-09. То, чего документация не сообщает, помечено как неопубликованное и не заполнено числами из третьих рук. Объёмы вызовов в QCode взяты из собственной 30-дневной статистики сайта.
Один ключ — прогоните обе модели на одном наборе
gpt-6-astra использует тот же ключ QCode и ту же квоту, что GPT-5.6 Sol / Terra и Claude; сравнение при переходе — это смена поля model. Тарифы от ¥60 в месяц, ключ активен сразу после оплаты. QCode пока не поддерживает gpt-6-luna и gpt-5.6-luna (обе удалены из /models); используйте другую модель GPT, например gpt-6.1-sol, gpt-6-sol или gpt-5.6-terra.
Читайте также
GPT-6 Astra: полное руководство
Характеристики, цены и то, чего в документации по-прежнему нет.
Расход квоты Astra
Официальная таблица credits: ровно 2,5× от GPT-5.6 Sol.
Включение GPT-5.6 в Codex
Как включалось и переключалось прошлое поколение — полезно как ориентир при переходе.
Все ограничения на этой странице взяты из официального руководства OpenAI по переходу и документации по модели, получены 2026-09-09; OpenAI может их обновить, ориентируйтесь на официальные страницы. То, что документация не публикует, не заполняется числами из третьих рук.