Qwen Alibaba
Tongyi Qianwen от Alibaba. В каталоге четыре поколения: новый флагман
3.8, 3.7,
основная рабочая 3.6 и экономичная 3.5 — в ней же
живут omni-модели с приёмом изображений и модели с открытыми весами, размещённые
у нас (арендовать GPU не нужно). Все идут через единый OpenAI-совместимый эндпоинт
/chat/completions, отличается только поле model.
Без кода — в MegaAPI Chat. Любую модель Qwen можно протестировать во вкладке
Чат — выберите её в списке и задайте вопрос.
Qwen3.8-Max — флагман
| Модель | Кратко | Контекст | Вход |
qwen3.8-max |
Флагман линейки: разреженная MoE на 2.4 трлн параметров, сильна в коде
и сложных рассуждениях |
1M, выход до 131 072 токенов |
Текст, изображение, видео |
Размышление включено по умолчанию, и лимит ответа его не ограничивает.
Проверено вживую: с max_tokens=1 модель всё равно израсходовала
838 токенов вывода, из них 829 — на обдумывание. Параметр
max_tokens обрезает только видимый ответ, а платится всё.
Для коротких запросов и высокой частоты выключайте размышление:
"enable_thinking": false — ответ приходит сразу и заметно дешевле.
Глубину обдумывания можно ограничить числом: "thinking_budget": 128
даёт ровно 128 токенов размышления. Параметр reasoning_effort
модель принимает, но на наших замерах уровни между собой не различаются —
полагаться на них не стоит, для экономии используйте выключатель.
Температура принимается строго меньше 2 (ровно 2 вернёт ошибку),
а n больше единицы работает только с выключенным размышлением.
Поколение 3.7
| Модель | Кратко | Вход |
qwen3.7-max | Флагман поколения: код и сложные рассуждения | Текст |
qwen3.7-plus | Рабочая модель поколения, ступенчатый тариф по длине запроса | Текст |
Обе размышляют по умолчанию — включать ничего не нужно. Если размышление не
требуется, его можно снять: "enable_thinking": false обнуляет
обдумывание (проверено вживую на обеих моделях).
Поколение 3.6 — основное
| Модель | Кратко | Контекст | Вход |
qwen3.6-max-preview | Флагман по коду и сложным рассуждениям; #1 на ряде coding-бенчмарков | 262K | Текст |
qwen3.6-flash | Быстрый мультимодал (MoE 35B-A3B) | 256K → 1M | Текст / изображение / видео |
qwen3.6-plus | Сбалансированный «рабочий конь» (72B / 18B активных) | 1M | Текст |
qwen3.6-27b | Open-weight, 27B dense — мощный по коду | см. карточку весов | Текст |
qwen3.6-35b-a3b | Open-weight MoE (3B активных) — дёшево и быстро | см. карточку весов | Текст |
Все модели поддерживают стриминг и function calling. max-preview — Preview-сборка (веса ещё
дорабатываются), для критичных задач прогоните канареечный A/B-тест перед переключением основного трафика.
Цены
Часть моделей тарифицируется ступенями по длине запроса: ступень
определяется суммарным числом входных токенов, и весь запрос — вход и выход —
считается по ставке этой ступени, без пропорционального деления.
qwen3.8-max | Вход | Выход |
| любая длина | $2.475 / 1M | $7.425 / 1M |
qwen3.7-max | Вход | Выход |
| любая длина | $2.571 / 1M | $7.713 / 1M |
qwen3.7-plus | Вход | Выход |
| до 256K входных токенов | $0.9 / 1M | $3.6 / 1M |
| свыше 256K входных токенов | $2.7 / 1M | $3.6 / 1M |
qwen3.6-max-preview | Вход | Выход |
| до 131K входных токенов | $1.92 / 1M | $11.52 / 1M |
| свыше 131K входных токенов | $3.18 / 1M | $19.08 / 1M |
qwen3.6-flash | Вход | Выход |
| до 262K входных токенов | $0.255 / 1M | $1.53 / 1M |
| свыше 262K входных токенов | $1.02 / 1M | $6.12 / 1M |
qwen3.6-plus | Вход | Выход |
| до 262K входных токенов | $0.45 / 1M | $2.7 / 1M |
| свыше 262K входных токенов | $1.8 / 1M | $10.8 / 1M |
qwen3.6-27b | Вход | Выход |
| любая длина | $0.63 / 1M | $3.78 / 1M |
qwen3.6-35b-a3b | Вход | Выход |
| любая длина | $0.39 / 1M | $2.34 / 1M |
qwen3.5-plus | Вход | Выход |
| до 131K входных токенов | $0.171 / 1M | $1.026 / 1M |
| 131K – 262K входных токенов | $0.42 / 1M | $2.52 / 1M |
| свыше 262K входных токенов | $0.84 / 1M | $5.04 / 1M |
qwen3.5-flash | Вход | Выход |
| до 131K входных токенов | $0.042 / 1M | $0.42 / 1M |
| 131K – 262K входных токенов | $0.171 / 1M | $1.71 / 1M |
| свыше 262K входных токенов | $0.255 / 1M | $2.55 / 1M |
qwen3.5-omni-plus | Вход | Выход |
| любая длина | $1.8 / 1M | $9 / 1M |
qwen3.5-omni-flash | Вход | Выход |
| любая длина | $0.525 / 1M | $3 / 1M |
qwen3.5-397b-a17b | Вход | Выход |
| любая длина | $0.27 / 1M | $1.62 / 1M |
qwen3.5-122b-a10b | Вход | Выход |
| любая длина | $0.18 / 1M | $1.44 / 1M |
qwen3.5-27b | Вход | Выход |
| любая длина | $0.135 / 1M | $1.08 / 1M |
qwen3.5-35b-a3b | Вход | Выход |
| любая длина | $0.09 / 1M | $0.72 / 1M |
Ставки указаны итоговые — именно столько списывается с баланса. Обратите внимание
на ступени: запрос на 300 000 входных токенов целиком считается по верхней ставке,
поэтому длинные документы выгоднее резать на части. Полный каталог —
в разделе Модели и цены.
Как выбрать
| Сценарий | Модель |
| Рутинный диалог, классификация, мультимодальные батчи | qwen3.6-flash (по умолчанию) |
| Средняя сложность, корпоративная база знаний | qwen3.6-plus |
| Coding-агент, сложное планирование, олимпиадная математика | qwen3.6-max-preview |
| Дёшево + нужны открытые веса (compliance) | qwen3.6-27b / qwen3.6-35b-a3b |
| Самое сложное: код, длинные документы, картинки и видео на входе | qwen3.8-max |
| Предыдущее поколение, код и сложные задачи | qwen3.7-max / qwen3.7-plus |
| Картинки на входе | qwen3.5-omni-plus / qwen3.5-omni-flash
в этом поколении; кроме них изображения понимают семейства qwen-vl-*
и qwen3-vl-* — всего в каталоге таких моделей семнадцать |
| Максимальная экономия на объёме | qwen3.5-flash — самая дешёвая модель каталога |
Стратегия: Flash по умолчанию → Plus на эскалации → Max как потолок; open-weight — для ультра-экономии.
Примеры
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://megaapi.ru/v1")
# Plus — повседневный диалог
resp = client.chat.completions.create(
model="qwen3.6-plus",
messages=[{"role": "user", "content": "Представься одним предложением."}],
)
print(resp.choices[0].message.content)
Flash — мультимодальный ввод (изображение)
resp = client.chat.completions.create(
model="qwen3.6-flash",
messages=[{"role": "user", "content": [
{"type": "text", "text": "Опиши ключевое на изображении."},
{"type": "image_url", "image_url": {"url": "https://.../image.png"}}
]}],
)
Ошибки и таймауты
400 | Ошибка параметра / неизвестная модель / превышен контекст |
429 | Лимит частоты или недостаточно баланса — retry с экспоненциальной задержкой |
| Timeout | Ставьте таймаут клиента ≥ 120с (длинный контекст и CoT отвечают дольше) |
Открыть в MegaAPI Chat →
Текстовая генерация
Все модели