Мой блог
AWS открывает доступ к OpenAI GPT-5.6 в Amazon Bedrock из австралийских регионов AWS
Глобальный кросс-региональный доступ к GPT-5.6 в Сиднее и Мельбурне
Облачный провайдер Amazon Web Services объявил о расширении возможностей платформы Amazon Bedrock для австралийских пользователей. Теперь разработчики и корпоративные клиенты в регионах Asia Pacific (Sydney, код ap-southeast-2) и Asia Pacific (Melbourne, код ap-southeast-4) могут задействовать передовые языковые модели OpenAI линейки GPT-5.6 — модификации Sol, Terra и Luna.
Доступ реализован через механизмы глобального кросс-регионального инференса (global cross-Region inference). С практической точки зрения это означает, что пользовательские приложения отправляют вызовы на локальный эндпоинт Amazon Bedrock Runtime в Сиднее или Мельбурне, а инфраструктура Bedrock автоматически перенаправляет запрос в коммерческий регион AWS с доступными вычислительными мощностями. Такой подход позволяет масштабировать нагрузки и гибко утилизировать ресурсы без необходимости самостоятельно настраивать сложную маршрутизацию между регионами на стороне клиента.
Для обращения к моделям используются три глобальных профиля инференса:

global.openai.gpt-5.6-solglobal.openai.gpt-5.6-terraglobal.openai.gpt-5.6-luna
Три модификации модели GPT-5.6 и интерфейсы взаимодействия
AWS распределила версии GPT-5.6 по трем ключевым профилям в зависимости от требований к производительности, задержкам и стоимости вычислительных ресурсов:
- GPT-5.6 Sol: флагманская модификация, созданная для решения наиболее сложных задач, требующих глубокого логического анализа, написания и отладки кода, а также работы автономных AI-агентов.
- GPT-5.6 Terra: сбалансированное решение по соотношению цены и скорости, ориентированное на повседневные продуктивные сценарии использования.
- GPT-5.6 Luna: высокоскоростная и наиболее экономичная версия, спроектированная для обработки больших объемов запросов и сервисов, критичных к задержкам отклика.
Все три варианта GPT-5.6 поддерживают мультимодальный ввод (текстовые запросы и изображения), генерируют текст и обладают контекстным окном объемом до 1 миллиона токенов.
Разработчики из австралийских локаций могут обращаться к эндпоинту Bedrock Runtime через три различных API-интерфейса:
- OpenAI Responses API;
- OpenAI Chat Completions API;
- Amazon Bedrock Converse API.
При использовании совместимых с OpenAI интерфейсов вызовы направляются по пути /openai/v1 на эндпоинте вместо стандартных AWS SDK. Для авторизации поддерживается как подпись AWS Signature Version 4 (SigV4), так и специальные API-ключи инференса моделей Amazon Bedrock.
Кэширование промптов: неявный и явный режимы
В GPT-5.6 реализована поддержка кэширования промптов (Prompt Caching), позволяющая существенно снизить затраты и задержки при повторяющихся запросах. Доступны два режима:
- Неявное кэширование (Implicit caching): активировано по умолчанию и не требует внесения каких-либо изменений в исходный код приложений.
- Явное кэширование (Explicit caching): предоставляет разработчикам ручной контроль над префиксами, границами кэша (cache boundary) и ключами кэширования (cache key).
В AWS подчеркивают, что доступность моделей и состав профилей могут корректироваться со временем, поэтому перед развертыванием систем в продакшен я рекомендую сверяться с официальной документацией по кросс-региональному инференсу.
Интеграция с инструментом Codex и OIDC-аутентификация
Интерфейс командной строки Codex CLI от OpenAI способен использовать описанные глобальные профили инференса благодаря встроенному провайдеру моделей Bedrock Runtime. Специалисты AWS подтвердили корректную работу конфигурации на базе codex-cli 0.149.1 при запуске модели GPT-5.6 Sol из региона Сидней.
Для компаний, использующих федерацию учетных записей через внешние провайдеры идентичности (Okta, Auth0, Microsoft Entra ID, Amazon Cognito или AWS IAM Identity Center), предложен вспомогательный модуль авторизации. Он обменивает маркер OpenID Connect (OIDC) на временные учетные данные AWS. Codex считывает их через стандартную цепочку credentials, а сами запросы подписываются с помощью SigV4. Это полностью исключает хранение и передачу статических API-ключей в тракте выполнения запросов.
Если профиль подключен через IAM Identity Center, применяются кратковременные сессионные ключи, которые автоматически ротируются при каждом входе в систему Single Sign-On (SSO).
Предварительные требования для развертывания
Для запуска инфраструктуры из австралийских регионов необходимо выполнение следующих условий:
- Активный аккаунт AWS с включенными исходными регионами Сидней (
ap-southeast-2) или Мельбурн (ap-southeast-4). - Настроенные роли или пользователи IAM с разрешениями на вызов глобальных профилей инференса GPT-5.6.
- Среда выполнения Python версии 3.9 или выше с установленными библиотеками
openai,boto3иaws-bedrock-token-generator. - Проверка политик управления службами (Service Control Policies, SCP), которые не должны блокировать использование глобальных профилей в выбранном исходном регионе.
Администраторы могут проверить список активных и доступных профилей через интерфейс AWS CLI или в консоли управления Amazon Bedrock.
Квоты использования, учет токенов и мониторинг
Управление ресурсами GPT-5.6 в режиме On-Demand осуществляется через лимиты запросов в минуту (RPM) и токенов в минуту (TPM). Обработка токенов происходит по следующему алгоритму сгорания квоты (token burndown):
- Входные токены (input tokens) и токены записи в кэш (cache-write tokens) списываются из расчета 1 к 1.
- Каждый сгенерированный выходной токен (output token) списывает из доступной TPM-квоты сразу 10 токенов.
Запросы на увеличение квот подаются через консоль Service Quotas в том исходном регионе, где зарегистрировано приложение. Разработчикам рекомендуется запрашивать расширение лимитов заранее, а также проводить предварительное нагрузочное тестирование с эмуляцией потокового ответа (streaming), высокой параллельности и пиковых объемов трафика.
Логирование и аналитика в CloudWatch
Поскольку все операции выполняются через Bedrock Runtime API, данные о вызовах фиксируются в журналах инференса моделей наряду с другими On-Demand запросами. Каждая запись содержит ID профиля и метаданные вызова.
Для отслеживания метрик Codex отправляет телеметрию по протоколу OpenTelemetry. Визуализация доступна в дашборде CloudWatch Coding Agent Insights, который отображает расход токенов, количество вызовов API, активных пользователей, динамику сессий и процент попадания в кэш (cache hit rate).
Интеграция дашборда возможна в двух вариантах:
- С использованием API-ключа CloudWatch Metrics: авторизация по Bearer-токену, классифицируемая AWS как долгосрочная учетная запись (рекомендуется только при невозможности использования временных токенов).
- Корпоративное развертывание (Enterprise rollout): сбором данных занимается локальный коллектор, подписывающий экспорт метрик с помощью SigV4 и федеративных учетных записей разработчика. Данный метод является предпочтительным стандартом безопасности для организаций.
Источник: www.unite.ai
