Ollama и LM Studio запускают языковые модели на собственном компьютере и предоставляют локальный API. Главное различие для старта: Ollama ориентирована на команды и автоматизацию, а LM Studio предлагает графический интерфейс для поиска, загрузки и запуска моделей.
Оглавление
- Что нужно знать о локальных моделях: базовые термины и оценка памяти.
- Как устроена Ollama: команды, локальный API и ограничения совместимости.
- Как устроена LM Studio: загрузка моделей, сервер и версии API.
- Основные возможности и общие черты: общие функции и ограничения совместимости.
- Ключевые различия: таблица для выбора инструмента.
- Что выбрать новичку: рекомендации по стартовым сценариям.
- Как проверить локальный API: команды для Ollama и LM Studio.
- Как использовать оба инструмента: общий клиент и импорт GGUF.
- Полезные сценарии: локальный чат, подключение приложения и эмбеддинги.
- Чеклист быстрого старта: последовательность первых действий.
- Официальные ссылки: документация и страницы продуктов.
Что нужно знать о локальных моделях
Локальная модель работает на вашем устройстве. После загрузки её можно использовать без отправки запросов внешнему API, если выбранный инструмент и сценарий не обращаются к облачным функциям.
Основные понятия:
- RAM и VRAM. Оперативная и видеопамять ограничивают размер модели и доступную длину контекста.
- GGUF. Распространённый формат моделей для локального запуска.
- MLX. Экосистема для запуска моделей, оптимизированная под Apple Silicon. Поддержка конкретных вариантов зависит от инструмента и модели.
- Квантизация. Сжатие весов модели с компромиссом между размером, скоростью и качеством. Обозначения вроде Q4 и Q8 указывают на варианты квантизации.
Официальная документация LM Studio рекомендует выбирать вариант с разрядностью 4 бита или выше, если компьютер справляется с ним. Точный расход памяти зависит не только от числа параметров, но и от квантизации, длины контекста, архитектуры и распределения вычислений между CPU и GPU.
lms load --estimate-only показывает предполагаемое потребление GPU и общей памяти с учётом выбранной длины контекста.Как устроена Ollama
Ollama — рантайм с командным интерфейсом и HTTP API. Команда ollama run <модель> запускает модель и открывает диалог в терминале. Локальный OpenAI-совместимый адрес по умолчанию имеет вид http://localhost:11434/v1/.
Ollama заявляет совместимость с отдельными частями OpenAI API, а не с API целиком. В актуальной документации перечислены:
POST /v1/chat/completions;POST /v1/completions;GET /v1/models;GET /v1/models/{model};POST /v1/embeddings;POST /v1/responses.
Поддержка Responses API появилась в Ollama 0.13.3. Реализация не хранит состояние между запросами: параметры previous_response_id и conversation не поддерживаются.
Как устроена LM Studio
LM Studio — десктопное приложение с графическим интерфейсом. Встроенный загрузчик ищет поддерживаемые модели на Hugging Face по ключевому слову, идентификатору user/model или полной ссылке. Перед загрузкой можно выбрать вариант квантизации.
Локальный OpenAI-совместимый сервер в примерах официальной документации доступен по адресу http://localhost:1234/v1. Официальная документация перечисляет следующие точки доступа:
GET /v1/models;POST /v1/responses;POST /v1/chat/completions;POST /v1/completions;POST /v1/embeddings.
LM Studio 0.3.29 добавила OpenAI-совместимый POST /v1/responses с продолжением взаимодействия через previous_response_id. В версии 0.4.0 появился собственный REST API по пути /api/v1/*, включая точки доступа для скачивания, загрузки и выгрузки моделей. Версия 0.4.1 добавила совместимый с Anthropic POST /v1/messages.
Основные возможности и общие черты
- Локальный запуск поддерживаемых открытых моделей.
- Работа с квантизированными вариантами моделей.
- OpenAI-совместимые точки доступа для чата, списка моделей и эмбеддингов.
- Подключение существующих OpenAI-клиентов через замену базового URL.
- Возможность использовать API из скриптов, редакторов кода и других клиентов.
Ключевые различия
| Критерий | Ollama | LM Studio |
| Основной способ работы | Команды и API | Графическое приложение, CLI и API |
| Первый запуск модели | ollama run <модель> | Поиск и загрузка во вкладке Discover |
| Локальный адрес API | http://localhost:11434/v1/ | http://localhost:1234/v1 |
| Поиск моделей | Реестр Ollama или ручной импорт | Встроенный поиск поддерживаемых моделей на Hugging Face |
| Импорт GGUF | Через Modelfile и ollama create | Загрузка и управление моделями средствами приложения |
| OpenAI Responses API | Без состояния между запросами | Поддерживает previous_response_id |
| Anthropic-совместимый API | Проверяйте поддержку нужного клиента по актуальной документации | POST /v1/messages начиная с версии 0.4.1 |
| Подходящий стартовый сценарий | Автоматизация и работа из терминала | Визуальный подбор и сравнение моделей |
Что выбрать новичку
LM Studio даёт более наглядный первый запуск. Ollama удобна, когда команды должны повторяться в сценариях автоматизации или на машине без постоянной работы с графическим интерфейсом.
Выбор не окончательный: оба инструмента можно установить на одном компьютере и подключать к ним один клиент через разные базовые URL.
Как проверить локальный API
Перед проверкой загрузите модель и запустите локальный сервер соответствующего инструмента. Ниже приведены документированные примеры; имя модели и состояние сервера должны соответствовать вашей конфигурации.
Проверка Ollama
Официальная документация приводит llama3.2 как пример локальной модели:
ollama pull llama3.2После запуска Ollama запросите список доступных моделей:
curl http://localhost:11434/v1/modelsОжидаемый результат: JSON-ответ со списком локальных моделей. Для запроса к чату передайте реальное имя загруженной модели:
curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"llama3.2","messages":[{"role":"user","content":"Ответь одним словом: работает?"}]}'Проверка LM Studio
Запустите локальный сервер LM Studio и запросите список моделей:
curl http://localhost:1234/v1/modelsОжидаемый результат: JSON со списком моделей, доступных серверу. Идентификатор из ответа можно передать в POST /v1/chat/completions:
curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"MODEL_IDENTIFIER","messages":[{"role":"user","content":"Ответь одним словом: работает?"}]}'Замените MODEL_IDENTIFIER на идентификатор модели из LM Studio.
Как использовать оба инструмента
Один клиент с двумя адресами
Если клиент позволяет менять базовый URL, для Ollama укажите http://localhost:11434/v1/, а для LM Studio — http://localhost:1234/v1. Отдельно проверьте, какую точку доступа и какие параметры использует клиент.
Визуальный подбор и последующая автоматизация
Модель можно сначала подобрать в LM Studio, сравнив доступные квантизации, а затем запустить совместимый GGUF-файл через Ollama. Файл потребуется импортировать вручную.
Создайте Modelfile:
FROM /path/to/file.ggufЗатем выполните:
ollama create my-model
ollama run my-modelollama create. Поддержка конкретной архитектуры должна быть проверена до импорта.Полезные сценарии
Приватный локальный чат
Задача: работать с запросами на собственном компьютере.
Что делать: загрузить подходящую модель, отключить необязательные облачные функции и запустить локальный чат.
Проверка: при доступном локальном рантайме запрос должен получить ответ; отсутствие внешних подключений нужно проверять по всему контуру, включая клиент, плагины и подключённые инструменты.
Подключение приложения к локальной модели
Задача: заменить удалённую точку доступа в совместимом прототипе.
Что делать: изменить базовый URL OpenAI-клиента на адрес Ollama или LM Studio и указать идентификатор локальной модели.
Проверка: endpoint /v1/models должен вернуть модель, а /v1/chat/completions — корректный ответ.
Ограничение: отдельные параметры OpenAI API могут отсутствовать или вести себя иначе.
Локальные эмбеддинги
Задача: получать векторные представления текстов для поиска по своим данным.
Что делать: загрузить совместимую модель эмбеддингов и использовать POST /v1/embeddings.
Проверка: сервер должен вернуть массив числовых векторов для переданного текста.
Ограничение: качество поиска зависит от модели, языка данных и способа разбиения документов.
Чеклист быстрого старта
/v1/models: порт 11434 у Ollama или 1234 у LM Studio./v1/chat/completions.Официальные ссылки
- Документация Ollama
- OpenAI-совместимость Ollama
- Импорт моделей в Ollama
- Каталог моделей Ollama
- LM Studio
- Загрузка моделей в LM Studio
- OpenAI-совместимость LM Studio
- Журнал изменений API LM Studio
Следующий шаг
Если вы выбираете локальные модели для личного или командного контура, сначала определите требования к интерфейсу, автоматизации и приватности.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov


