Responses API

Нативный endpoint для агентных сценариев, инструментов и моделей с глубоким рассуждением. Все цены ниже — итоговые цены MegaAPI в USDT с учётом наценки.

Быстрый старт

curl https://megaapi.ru/v1/responses \
  -H "Authorization: Bearer $MEGAAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.5-pro",
    "input": "Проведи глубокую проверку архитектуры",
    "max_output_tokens": 2048,
    "store": false
  }'

В ответе текст можно взять из output_text, а точное списание — из объекта usage.

Для синхронного запроса можно добавить Idempotency-Key. Повтор с тем же ключом и тем же телом вернёт сохранённый результат без второго обращения к модели и без двойного списания. Для stream: true этот заголовок пока не поддерживается.

Модели и тарифы

МодельВходВыходКэшированный входОграничение
gpt-5.4-pro$45 / 1M$270 / 1M$4.50 / 1Mдо 278 528 входных токенов
gpt-5.5-pro$45 / 1M$270 / 1M$4.50 / 1Mдо 278 528 входных токенов
Длинный контекст (> 278 528 входных токенов): вход $90 / 1M, выход $405 / 1M, кэшированный вход $9 / 1M.

Тариф выбирается по полному usage.input_tokens одного запроса. Кэшированные токены являются частью input и берутся из usage.input_tokens_details.cached_tokens.

Параметры запроса

Потоковая выдача

При stream: true MegaAPI передаёт события без преобразования: response.created, response.output_text.delta и response.completed. Финальный usage находится внутри response.completed.response.usage. Не завершайте расчёт до этого события.

data: {"type":"response.output_text.delta","delta":"Готово"}

data: {"type":"response.completed","response":{"usage":{"input_tokens":12,"output_tokens":31}}}

История и безопасность

Серверное состояние не используется. Параметры previous_response_id, conversation и store: true отклоняются, чтобы не создавать ложное ощущение сохранённой истории. Передавайте полную историю в input и явно оставляйте store: false.

background: true пока отключён: без безопасного получения результата нельзя корректно финализировать биллинг. Для долгих задач используйте потоковый режим и увеличенный timeout.

ИИ-Студия

Pro-модели отображаются в едином каталоге Studio и автоматически отправляются через Responses API. В интерфейсе сохраняется удобный формат сообщений; преобразование в input выполняется сервером. Для дорогих запросов задавайте max_output_tokens заранее.

Ошибки и списания

При HTTP-ошибке, отключённой модели или ошибке потока холд полностью возвращается. При успешном ответе списание выполняется только по фактическому usage; недостающий usage не подменяется нулём — используется консервативная оценка входа, чтобы не терять стоимость запроса.

Не смешивайте протоколы: Pro-модели намеренно отклоняются на /v1/chat/completions с подсказкой перейти на /v1/responses.