🔄
Актуальность: проверено 7 сентября 2026 года по официальному релизу MiniMax M3, документации MiniMax API и карточке модели MiniMaxAI/MiniMax-M3. Тарифы и условия доступа меняются, поэтому перед запуском сверяйтесь с официальной страницей Pricing.

MiniMax M3 — модель с открытыми весами для программирования, работы с инструментами и длинными агентными задачами. Она принимает текст, изображения и видео, поддерживает контекст до 1 000 000 токенов и доступна через API, MiniMax Code и локальное развёртывание открытых весов.

📌
Коротко: M3 выпущена 1 июня 2026 года. Модель использует разреженное внимание MiniMax Sparse Attention, содержит около 428 млрд параметров, из которых около 23 млрд активируются при обработке токена, и поддерживает три режима рассуждения: enabled, adaptive и disabled.

Содержание

  1. Что представляет собой MiniMax M3
  2. Основные возможности и ограничения
  3. Результаты тестов MiniMax
  4. Подключение через API
  5. Локальный запуск открытых весов
  6. Полезные сценарии
  7. Как проверить результат
  8. Официальные ссылки

Что представляет собой MiniMax M3

M3 — текущая модель M-серии MiniMax для агентного программирования, вызова инструментов и работы с большим контекстом. В официальной документации для MiniMax-M3 указано окно в 1 000 000 токенов. Это общий предел для входных и выходных токенов, а не отдельный миллион токенов только для промпта.

Модель нативно мультимодальна: смешанное обучение на тексте, изображениях и видео начиналось с первого этапа. На выходе она формирует текст и может инициировать вызовы инструментов.

MiniMax Sparse Attention

MiniMax Sparse Attention (MSA) — механизм разреженного внимания для длинного контекста. По измерениям разработчика при длине контекста в 1 млн токенов M3:

  • расходует примерно в 20 раз меньше вычислений на токен, чем модель предыдущего поколения;
  • ускоряет предварительную обработку входа более чем в 9 раз;
  • ускоряет декодирование более чем в 15 раз.

Это результаты MiniMax для конкретной архитектуры и условий тестирования. Они не гарантируют такое же ускорение на любом сервере или в стороннем инференс-фреймворке.

Размер модели

Карточка MiniMaxAI/MiniMax-M3 указывает:

  • около 428 млрд параметров всего;
  • около 23 млрд активных параметров;
  • архитектуру Mixture of Experts, где на каждом токене работает только часть модели.

Открытые веса опубликованы под лицензией minimax-community. Перед коммерческим использованием проверьте актуальный текст лицензии и его совместимость с вашим продуктом.


Основные возможности и ограничения

ВозможностьЧто подтвержденоПрактическое ограничение
Длинный контекстДо 1 000 000 входных и выходных токенов суммарноПри входе свыше 512K токенов применяется повышенный тариф; фактический объём нужно контролировать
МультимодальностьТекст, изображения и видео на входеКачество на конкретных данных зависит от входных материалов и постановки задачи, поэтому его нужно проверять самостоятельно
ПрограммированиеГенерация и изменение кода, работа с терминалом и длинными задачамиРезультат требует тестов и просмотра изменений человеком
Вызов инструментовTool calls через APIАргументы нужно проверять по схеме до выполнения
Работа за компьютеромЗаявлена поддержка управления настольными приложениямиНужны изоляция, минимальные права, журнал действий и подтверждение рискованных операций
Режим рассужденияenabled, adaptive, disabledВыбор режима влияет на задержку и характер ответа
⚠️
Внимание: миллионный контекст не отменяет отбор данных. Большой репозиторий или архив документов лучше заранее очистить от сгенерированных файлов, секретов, дублей и нерелевантных материалов.

Результаты тестов MiniMax

В официальном релизе приведены следующие результаты M3:

ТестРезультат M3Что измеряет
SWE-Bench Pro59,0%Исправление ошибок в реальных репозиториях
Terminal-Bench 2.166,0%Работа с задачами в терминале
SWE-fficiency34,8%Эффективность программного агента
KernelBench Hard28,8%Оптимизация вычислительных ядер
MCP Atlas74,2%Работа с MCP-инструментами

Большая часть этих оценок получена MiniMax на собственной инфраструктуре и с разными агентными оболочками. Используйте их как ориентир для отбора модели, затем запускайте собственные тесты на ваших репозиториях, инструментах и правилах приёмки.

Разработчик также описывает два длительных эксперимента:

  • почти 12 часов автономной репликации научной статьи: 18 коммитов и 23 экспериментальных графика;
  • около 24 часов оптимизации FP8 GEMM: 147 отправок в тест и 1959 вызовов инструментов, рост заявленной утилизации с 7,6% до 71,3%.

Это демонстрации MiniMax, а не независимая гарантия автономной работы в производственной среде.


Подключение через API

MiniMax API поддерживает HTTP, Anthropic SDK и OpenAI SDK. В документации Anthropic SDK отмечен как рекомендуемый вариант, но существующую интеграцию с OpenAI-совместимым интерфейсом можно сохранить.

Минимальный пример:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ['MINIMAX_API_KEY'],
    base_url='https://api.minimax.io/v1',
)

response = client.chat.completions.create(
    model='MiniMax-M3',
    messages=[
        {'role': 'system', 'content': 'You are a senior code reviewer.'},
        {'role': 'user', 'content': 'Review this diff and list blocking issues.'},
    ],
)

print(response.choices[0].message.content)

Храните ключ в переменной окружения, не вставляйте его в код или историю команд. Для сложной задачи включайте рассуждение, для автодополнения и диалогов с жёстким требованием к задержке проверяйте режим disabled. Точное поле и допустимые значения сверяйте с документацией выбранного API-интерфейса.

Тарифы

MiniMax разделяет запросы по длине входа:

  • до 512K входных токенов применяется стандартная ставка;
  • при входе свыше 512K действует повышенная ставка длинного контекста;
  • стандартный и приоритетный уровни обслуживания имеют разные условия обработки запросов, которые нужно сверять в актуальной документации.

Точные суммы в этом справочнике не фиксируются: доступный снимок страницы Pricing не содержит проверяемой тарифной таблицы. Перед расчётом бюджета откройте действующую страницу тарифов и проверьте цену входа, выхода, кэширования и приоритетного обслуживания.


Локальный запуск открытых весов

Карточка модели рекомендует SGLang, vLLM, Transformers, KTransformers, Unsloth и ATOM. Скачать веса можно командой:

hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3

Пример запуска через vLLM:

vllm serve MiniMaxAI/MiniMax-M3

После запуска сервер предоставляет OpenAI-совместимый интерфейс. Для мультимодальных запросов используйте формат сообщений, который поддерживает установленная версия vLLM.

Универсальную оценку требуемой видеопамяти дать нельзя: она зависит от формата весов, квантизации, длины контекста, размера кэша, параллелизма и версии инференс-фреймворка. Полные веса модели слишком велики для одной обычной потребительской видеокарты. Перед закупкой оборудования проведите пробный запуск выбранной сборки и измерьте память на целевой длине контекста.

⚖️
Практический выбор: API подходит для быстрого теста и переменной нагрузки. Локальное развёртывание имеет смысл, когда требования к контролю данных или постоянный объём запросов оправдывают обслуживание крупной модели.

Полезные сценарии

Проверка большого изменения в репозитории

Передайте агенту репозиторий, требования и критерии приёмки. Попросите сначала составить план, затем внести изменения, запустить тесты и отдельно проверить итоговый diff. Наблюдаемый результат: изменения проходят заданные проверки, а отчёт связывает каждый пункт требований с файлами и тестами. Сценарий не подходит для автоматического выпуска без человеческой проверки.

Анализ большого корпуса документов

Подготовьте очищенный набор документов и сформулируйте вопросы, для которых нужны ссылки на конкретные фрагменты. Наблюдаемый результат: модель выдаёт структурированный ответ с проверяемыми указателями на исходные материалы. Если документы часто меняются или превышают бюджет контекста, используйте поиск и выборочную подачу данных вместо загрузки всего архива.

Длинная агентная задача с инструментами

Дайте агенту ограниченный набор инструментов, машиночитаемые схемы аргументов и явные условия остановки. Проверяйте промежуточные артефакты и отклоняйте вызовы, которые не проходят валидацию. Наблюдаемый результат: задача завершается с журналом действий, тестами и воспроизводимым итогом. Не предоставляйте агенту неограниченный доступ к рабочему компьютеру или производственным данным.

MiniMax Code для существующего проекта

В MiniMax Code можно подключить рабочую папку, передать архитектурные правила и критерии приёмки, а затем выполнять планирование, правки файлов, команды терминала и просмотр результата в одном контексте. Agent Team распределяет сложную задачу между специализированными агентами. Remote Control позволяет следить за запущенным настольным приложением с телефона и отвечать на запросы разрешений. Финальное решение о готовности изменений остаётся за пользователем.


Как проверить результат

  1. Запустите короткий текстовый запрос к MiniMax-M3 и убедитесь, что API возвращает непустой ответ без ошибки модели или авторизации.
  2. Выполните один вызов тестового инструмента с жёсткой JSON-схемой. Проверьте имя функции и типы всех аргументов до исполнения.
  3. Для задачи по коду сохраните исходное состояние, запустите автоматические тесты и просмотрите diff.
  4. Для длинного контекста измерьте число входных и выходных токенов, задержку, стоимость и качество поиска фактов.
  5. Для локального сервера зафиксируйте версии модели и рантайма, расход памяти, скорость предварительной обработки и генерации.
  6. Повторите один и тот же набор задач на текущей рабочей модели. Решение о миграции принимайте по собственным критериям качества, стоимости и надёжности.

Официальные ссылки

Следующий шаг

Контекст-инжиниринг — как собирать рабочий контекст для моделей нового поколения

Если вы выбираете M3 для продукта или команды, полезно заранее сопоставить требования к данным, длине контекста, инструментам и процедуре проверки результата.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov