Kimi Moonshot AI
Семейство Moonshot AI: контекст 256K без доплаты, сильный визуальный кодинг
(превращает скриншоты и макеты в рабочий код) и оркестрация агентов.
Эндпоинт OpenAI-совместимый, отличается только значение model.
Рассуждения включаются по-разному.
kimi-k2.5 по умолчанию
работает в режиме Instant, и рассуждения нужно попросить явно —
enable_thinking: true. Более новые модели семейства рассуждают
всегда, отдельный флаг им не нужен.
Какую выбрать
| Модель | Для чего | Картинки на входе | Рассуждения |
|---|---|---|---|
kimi-k2.5 |
Универсальная. Единственная, у которой рассуждения выключены по умолчанию — удобно, когда нужен быстрый ответ | да | по флагу enable_thinking |
kimi-k2.6 |
Самая выгодная в семействе: вход как у K2.5, выход дешевле | да | всегда |
kimi-k2.7-code |
Заточена под код: рефакторинг, разбор больших репозиториев | нет | всегда |
kimi-k3 |
Флагман семейства — для задач, где K2.6 ошибается | да | всегда |
Характеристики
| Параметр | Значение |
|---|---|
| Model ID | kimi-k2.5, kimi-k2.6,
kimi-k2.7-code, kimi-k3 |
| Контекст | 256 000 токенов (без доплаты) |
| Режимы | Instant / Thinking / Agent / Agent Swarm |
| Включение Thinking | У kimi-k2.5 — enable_thinking: true
(по умолчанию false). У остальных включено всегда |
| Вход | Текст + изображение. Исключение — kimi-k2.7-code: только текст |
| Выход | Текст |
| Стриминг / Tool use | ✓ Поддерживаются |
Цены
| Модель | Вход | Выход | Чтение из кеша |
|---|---|---|---|
kimi-k2.5 |
$0.9 / 1M | $4.725 / 1M | $0.15 / 1M |
kimi-k2.6 |
$0.9 / 1M | $3.6 / 1M | $0.1516 / 1M |
kimi-k2.7-code |
$1.425 / 1M | $5.985 / 1M | — |
kimi-k3 |
$4.5 / 1M | $22.5 / 1M | — |
Ставки указаны итоговые — именно столько списывается с баланса. Полный каталог — в разделе Модели и цены.
Когда включать Thinking
| Сценарий | enable_thinking |
|---|---|
| Быстрый диалог / короткие ответы | false (по умолчанию) — минимальная задержка |
| Сложные рассуждения, планирование кода, RCA | true — модель выдаёт трассу рассуждений |
Агент со встроенным $web_search | false — web_search и Thinking взаимоисключающи |
Примеры
Instant (по умолчанию)
curl https://megaapi.ru/v1/chat/completions \ -H "Authorization: Bearer sk-..." \ -H "Content-Type: application/json" \ -d '{ "model": "kimi-k2.5", "messages": [{"role": "user", "content": "Представься одним предложением."}] }'
Thinking (через extra_body)
from openai import OpenAI client = OpenAI(api_key="sk-...", base_url="https://megaapi.ru/v1") response = client.chat.completions.create( model="kimi-k2.5", messages=[ {"role": "system", "content": "Ты — полезный ассистент."}, {"role": "user", "content": "Проанализируй сложность кода и предложи оптимизации."} ], extra_body={"enable_thinking": True}, ) print(response.choices[0].message.content)
В openai-python поле enable_thinking передаётся внутри extra_body; в Node.js SDK —
как поле верхнего уровня тела запроса.
Лучшие практики
- Переключайте режим под задачу. Instant — для чата и коротких генераций; Thinking — для сложных рассуждений, ревью кода и планирования агентов.
- Используйте 256K контекста. Целый средний репозиторий, документация или длинный транскрипт встаёт в один запрос — без доплаты.
- Визуальный кодинг. Отправьте скриншот UI / макет — K2.5 «прочитает → спланирует → напишет код».
- Помните про web_search. Встроенный
$web_searchнесовместим с Thinking — используйте их в разных запросах. - Стоимость Thinking. Трасса рассуждений считается как output-токены — включайте только когда нужна глубина.