MiniMaxAI/MiniMax-M3. Тарифы и условия доступа меняются, поэтому перед запуском сверяйтесь с официальной страницей Pricing.MiniMax M3 — модель с открытыми весами для программирования, работы с инструментами и длинными агентными задачами. Она принимает текст, изображения и видео, поддерживает контекст до 1 000 000 токенов и доступна через API, MiniMax Code и локальное развёртывание открытых весов.
enabled, adaptive и disabled.Содержание
- Что представляет собой MiniMax M3
- Основные возможности и ограничения
- Результаты тестов MiniMax
- Подключение через API
- Локальный запуск открытых весов
- Полезные сценарии
- Как проверить результат
- Официальные ссылки
Что представляет собой MiniMax M3
M3 — текущая модель M-серии MiniMax для агентного программирования, вызова инструментов и работы с большим контекстом. В официальной документации для MiniMax-M3 указано окно в 1 000 000 токенов. Это общий предел для входных и выходных токенов, а не отдельный миллион токенов только для промпта.
Модель нативно мультимодальна: смешанное обучение на тексте, изображениях и видео начиналось с первого этапа. На выходе она формирует текст и может инициировать вызовы инструментов.
MiniMax Sparse Attention
MiniMax Sparse Attention (MSA) — механизм разреженного внимания для длинного контекста. По измерениям разработчика при длине контекста в 1 млн токенов M3:
- расходует примерно в 20 раз меньше вычислений на токен, чем модель предыдущего поколения;
- ускоряет предварительную обработку входа более чем в 9 раз;
- ускоряет декодирование более чем в 15 раз.
Это результаты MiniMax для конкретной архитектуры и условий тестирования. Они не гарантируют такое же ускорение на любом сервере или в стороннем инференс-фреймворке.
Размер модели
Карточка MiniMaxAI/MiniMax-M3 указывает:
- около 428 млрд параметров всего;
- около 23 млрд активных параметров;
- архитектуру Mixture of Experts, где на каждом токене работает только часть модели.
Открытые веса опубликованы под лицензией minimax-community. Перед коммерческим использованием проверьте актуальный текст лицензии и его совместимость с вашим продуктом.
Основные возможности и ограничения
| Возможность | Что подтверждено | Практическое ограничение |
| Длинный контекст | До 1 000 000 входных и выходных токенов суммарно | При входе свыше 512K токенов применяется повышенный тариф; фактический объём нужно контролировать |
| Мультимодальность | Текст, изображения и видео на входе | Качество на конкретных данных зависит от входных материалов и постановки задачи, поэтому его нужно проверять самостоятельно |
| Программирование | Генерация и изменение кода, работа с терминалом и длинными задачами | Результат требует тестов и просмотра изменений человеком |
| Вызов инструментов | Tool calls через API | Аргументы нужно проверять по схеме до выполнения |
| Работа за компьютером | Заявлена поддержка управления настольными приложениями | Нужны изоляция, минимальные права, журнал действий и подтверждение рискованных операций |
| Режим рассуждения | enabled, adaptive, disabled | Выбор режима влияет на задержку и характер ответа |
Результаты тестов MiniMax
В официальном релизе приведены следующие результаты M3:
| Тест | Результат M3 | Что измеряет |
| SWE-Bench Pro | 59,0% | Исправление ошибок в реальных репозиториях |
| Terminal-Bench 2.1 | 66,0% | Работа с задачами в терминале |
| SWE-fficiency | 34,8% | Эффективность программного агента |
| KernelBench Hard | 28,8% | Оптимизация вычислительных ядер |
| MCP Atlas | 74,2% | Работа с MCP-инструментами |
Большая часть этих оценок получена MiniMax на собственной инфраструктуре и с разными агентными оболочками. Используйте их как ориентир для отбора модели, затем запускайте собственные тесты на ваших репозиториях, инструментах и правилах приёмки.
Разработчик также описывает два длительных эксперимента:
- почти 12 часов автономной репликации научной статьи: 18 коммитов и 23 экспериментальных графика;
- около 24 часов оптимизации FP8 GEMM: 147 отправок в тест и 1959 вызовов инструментов, рост заявленной утилизации с 7,6% до 71,3%.
Это демонстрации MiniMax, а не независимая гарантия автономной работы в производственной среде.
Подключение через API
MiniMax API поддерживает HTTP, Anthropic SDK и OpenAI SDK. В документации Anthropic SDK отмечен как рекомендуемый вариант, но существующую интеграцию с OpenAI-совместимым интерфейсом можно сохранить.
Минимальный пример:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ['MINIMAX_API_KEY'],
base_url='https://api.minimax.io/v1',
)
response = client.chat.completions.create(
model='MiniMax-M3',
messages=[
{'role': 'system', 'content': 'You are a senior code reviewer.'},
{'role': 'user', 'content': 'Review this diff and list blocking issues.'},
],
)
print(response.choices[0].message.content)Храните ключ в переменной окружения, не вставляйте его в код или историю команд. Для сложной задачи включайте рассуждение, для автодополнения и диалогов с жёстким требованием к задержке проверяйте режим disabled. Точное поле и допустимые значения сверяйте с документацией выбранного API-интерфейса.
Тарифы
MiniMax разделяет запросы по длине входа:
- до 512K входных токенов применяется стандартная ставка;
- при входе свыше 512K действует повышенная ставка длинного контекста;
- стандартный и приоритетный уровни обслуживания имеют разные условия обработки запросов, которые нужно сверять в актуальной документации.
Точные суммы в этом справочнике не фиксируются: доступный снимок страницы Pricing не содержит проверяемой тарифной таблицы. Перед расчётом бюджета откройте действующую страницу тарифов и проверьте цену входа, выхода, кэширования и приоритетного обслуживания.
Локальный запуск открытых весов
Карточка модели рекомендует SGLang, vLLM, Transformers, KTransformers, Unsloth и ATOM. Скачать веса можно командой:
hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3Пример запуска через vLLM:
vllm serve MiniMaxAI/MiniMax-M3После запуска сервер предоставляет OpenAI-совместимый интерфейс. Для мультимодальных запросов используйте формат сообщений, который поддерживает установленная версия vLLM.
Универсальную оценку требуемой видеопамяти дать нельзя: она зависит от формата весов, квантизации, длины контекста, размера кэша, параллелизма и версии инференс-фреймворка. Полные веса модели слишком велики для одной обычной потребительской видеокарты. Перед закупкой оборудования проведите пробный запуск выбранной сборки и измерьте память на целевой длине контекста.
Полезные сценарии
Проверка большого изменения в репозитории
Передайте агенту репозиторий, требования и критерии приёмки. Попросите сначала составить план, затем внести изменения, запустить тесты и отдельно проверить итоговый diff. Наблюдаемый результат: изменения проходят заданные проверки, а отчёт связывает каждый пункт требований с файлами и тестами. Сценарий не подходит для автоматического выпуска без человеческой проверки.
Анализ большого корпуса документов
Подготовьте очищенный набор документов и сформулируйте вопросы, для которых нужны ссылки на конкретные фрагменты. Наблюдаемый результат: модель выдаёт структурированный ответ с проверяемыми указателями на исходные материалы. Если документы часто меняются или превышают бюджет контекста, используйте поиск и выборочную подачу данных вместо загрузки всего архива.
Длинная агентная задача с инструментами
Дайте агенту ограниченный набор инструментов, машиночитаемые схемы аргументов и явные условия остановки. Проверяйте промежуточные артефакты и отклоняйте вызовы, которые не проходят валидацию. Наблюдаемый результат: задача завершается с журналом действий, тестами и воспроизводимым итогом. Не предоставляйте агенту неограниченный доступ к рабочему компьютеру или производственным данным.
MiniMax Code для существующего проекта
В MiniMax Code можно подключить рабочую папку, передать архитектурные правила и критерии приёмки, а затем выполнять планирование, правки файлов, команды терминала и просмотр результата в одном контексте. Agent Team распределяет сложную задачу между специализированными агентами. Remote Control позволяет следить за запущенным настольным приложением с телефона и отвечать на запросы разрешений. Финальное решение о готовности изменений остаётся за пользователем.
Как проверить результат
- Запустите короткий текстовый запрос к
MiniMax-M3и убедитесь, что API возвращает непустой ответ без ошибки модели или авторизации. - Выполните один вызов тестового инструмента с жёсткой JSON-схемой. Проверьте имя функции и типы всех аргументов до исполнения.
- Для задачи по коду сохраните исходное состояние, запустите автоматические тесты и просмотрите diff.
- Для длинного контекста измерьте число входных и выходных токенов, задержку, стоимость и качество поиска фактов.
- Для локального сервера зафиксируйте версии модели и рантайма, расход памяти, скорость предварительной обработки и генерации.
- Повторите один и тот же набор задач на текущей рабочей модели. Решение о миграции принимайте по собственным критериям качества, стоимости и надёжности.
Официальные ссылки
Следующий шаг
Контекст-инжиниринг — как собирать рабочий контекст для моделей нового поколения
Если вы выбираете M3 для продукта или команды, полезно заранее сопоставить требования к данным, длине контекста, инструментам и процедуре проверки результата.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov


