Qwen Alibaba

Tongyi Qianwen от Alibaba. В каталоге четыре поколения: новый флагман 3.8, 3.7, основная рабочая 3.6 и экономичная 3.5 — в ней же живут omni-модели с приёмом изображений и модели с открытыми весами, размещённые у нас (арендовать GPU не нужно). Все идут через единый OpenAI-совместимый эндпоинт /chat/completions, отличается только поле model.

Без кода — в MegaAPI Chat. Любую модель Qwen можно протестировать во вкладке Чат — выберите её в списке и задайте вопрос.

Qwen3.8-Max — флагман

МодельКраткоКонтекстВход
qwen3.8-max Флагман линейки: разреженная MoE на 2.4 трлн параметров, сильна в коде и сложных рассуждениях 1M, выход до 131 072 токенов Текст, изображение, видео
Размышление включено по умолчанию, и лимит ответа его не ограничивает. Проверено вживую: с max_tokens=1 модель всё равно израсходовала 838 токенов вывода, из них 829 — на обдумывание. Параметр max_tokens обрезает только видимый ответ, а платится всё. Для коротких запросов и высокой частоты выключайте размышление: "enable_thinking": false — ответ приходит сразу и заметно дешевле.

Глубину обдумывания можно ограничить числом: "thinking_budget": 128 даёт ровно 128 токенов размышления. Параметр reasoning_effort модель принимает, но на наших замерах уровни между собой не различаются — полагаться на них не стоит, для экономии используйте выключатель. Температура принимается строго меньше 2 (ровно 2 вернёт ошибку), а n больше единицы работает только с выключенным размышлением.

Поколение 3.7

МодельКраткоВход
qwen3.7-maxФлагман поколения: код и сложные рассужденияТекст
qwen3.7-plusРабочая модель поколения, ступенчатый тариф по длине запросаТекст

Обе размышляют по умолчанию — включать ничего не нужно. Если размышление не требуется, его можно снять: "enable_thinking": false обнуляет обдумывание (проверено вживую на обеих моделях).

Поколение 3.6 — основное

МодельКраткоКонтекстВход
qwen3.6-max-previewФлагман по коду и сложным рассуждениям; #1 на ряде coding-бенчмарков262KТекст
qwen3.6-flashБыстрый мультимодал (MoE 35B-A3B)256K → 1MТекст / изображение / видео
qwen3.6-plusСбалансированный «рабочий конь» (72B / 18B активных)1MТекст
qwen3.6-27bOpen-weight, 27B dense — мощный по кодусм. карточку весовТекст
qwen3.6-35b-a3bOpen-weight MoE (3B активных) — дёшево и быстросм. карточку весовТекст

Все модели поддерживают стриминг и function calling. max-preview — Preview-сборка (веса ещё дорабатываются), для критичных задач прогоните канареечный A/B-тест перед переключением основного трафика.

Цены

Часть моделей тарифицируется ступенями по длине запроса: ступень определяется суммарным числом входных токенов, и весь запрос — вход и выход — считается по ставке этой ступени, без пропорционального деления.

qwen3.8-maxВходВыход
любая длина$2.475 / 1M$7.425 / 1M
qwen3.7-maxВходВыход
любая длина$2.571 / 1M$7.713 / 1M
qwen3.7-plusВходВыход
до 256K входных токенов$0.9 / 1M$3.6 / 1M
свыше 256K входных токенов$2.7 / 1M$3.6 / 1M
qwen3.6-max-previewВходВыход
до 131K входных токенов$1.92 / 1M$11.52 / 1M
свыше 131K входных токенов$3.18 / 1M$19.08 / 1M
qwen3.6-flashВходВыход
до 262K входных токенов$0.255 / 1M$1.53 / 1M
свыше 262K входных токенов$1.02 / 1M$6.12 / 1M
qwen3.6-plusВходВыход
до 262K входных токенов$0.45 / 1M$2.7 / 1M
свыше 262K входных токенов$1.8 / 1M$10.8 / 1M
qwen3.6-27bВходВыход
любая длина$0.63 / 1M$3.78 / 1M
qwen3.6-35b-a3bВходВыход
любая длина$0.39 / 1M$2.34 / 1M
qwen3.5-plusВходВыход
до 131K входных токенов$0.171 / 1M$1.026 / 1M
131K – 262K входных токенов$0.42 / 1M$2.52 / 1M
свыше 262K входных токенов$0.84 / 1M$5.04 / 1M
qwen3.5-flashВходВыход
до 131K входных токенов$0.042 / 1M$0.42 / 1M
131K – 262K входных токенов$0.171 / 1M$1.71 / 1M
свыше 262K входных токенов$0.255 / 1M$2.55 / 1M
qwen3.5-omni-plusВходВыход
любая длина$1.8 / 1M$9 / 1M
qwen3.5-omni-flashВходВыход
любая длина$0.525 / 1M$3 / 1M
qwen3.5-397b-a17bВходВыход
любая длина$0.27 / 1M$1.62 / 1M
qwen3.5-122b-a10bВходВыход
любая длина$0.18 / 1M$1.44 / 1M
qwen3.5-27bВходВыход
любая длина$0.135 / 1M$1.08 / 1M
qwen3.5-35b-a3bВходВыход
любая длина$0.09 / 1M$0.72 / 1M

Ставки указаны итоговые — именно столько списывается с баланса. Обратите внимание на ступени: запрос на 300 000 входных токенов целиком считается по верхней ставке, поэтому длинные документы выгоднее резать на части. Полный каталог — в разделе Модели и цены.

Как выбрать

СценарийМодель
Рутинный диалог, классификация, мультимодальные батчиqwen3.6-flash (по умолчанию)
Средняя сложность, корпоративная база знанийqwen3.6-plus
Coding-агент, сложное планирование, олимпиадная математикаqwen3.6-max-preview
Дёшево + нужны открытые веса (compliance)qwen3.6-27b / qwen3.6-35b-a3b
Самое сложное: код, длинные документы, картинки и видео на входеqwen3.8-max
Предыдущее поколение, код и сложные задачиqwen3.7-max / qwen3.7-plus
Картинки на входеqwen3.5-omni-plus / qwen3.5-omni-flash в этом поколении; кроме них изображения понимают семейства qwen-vl-* и qwen3-vl-* — всего в каталоге таких моделей семнадцать
Максимальная экономия на объёмеqwen3.5-flash — самая дешёвая модель каталога

Стратегия: Flash по умолчанию → Plus на эскалации → Max как потолок; open-weight — для ультра-экономии.

Примеры

from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://megaapi.ru/v1")

# Plus — повседневный диалог
resp = client.chat.completions.create(
    model="qwen3.6-plus",
    messages=[{"role": "user", "content": "Представься одним предложением."}],
)
print(resp.choices[0].message.content)

Flash — мультимодальный ввод (изображение)

resp = client.chat.completions.create(
    model="qwen3.6-flash",
    messages=[{"role": "user", "content": [
        {"type": "text", "text": "Опиши ключевое на изображении."},
        {"type": "image_url", "image_url": {"url": "https://.../image.png"}}
    ]}],
)

Ошибки и таймауты

400Ошибка параметра / неизвестная модель / превышен контекст
429Лимит частоты или недостаточно баланса — retry с экспоненциальной задержкой
TimeoutСтавьте таймаут клиента ≥ 120с (длинный контекст и CoT отвечают дольше)

Открыть в MegaAPI Chat → Текстовая генерация Все модели