Ollama и LM Studio запускают языковые модели на собственном компьютере и предоставляют локальный API. Главное различие для старта: Ollama ориентирована на команды и автоматизацию, а LM Studio предлагает графический интерфейс для поиска, загрузки и запуска моделей.

📌
Материал поможет выбрать первый инструмент, запустить модель и проверить локальный API. Данные об API и импорте моделей проверены по официальной документации 6 сентября 2026 года. Материал основан на официальной документации; примеры ниже не являются отчётом о запуске на конкретном компьютере.

Оглавление

  1. Что нужно знать о локальных моделях: базовые термины и оценка памяти.
  2. Как устроена Ollama: команды, локальный API и ограничения совместимости.
  3. Как устроена LM Studio: загрузка моделей, сервер и версии API.
  4. Основные возможности и общие черты: общие функции и ограничения совместимости.
  5. Ключевые различия: таблица для выбора инструмента.
  6. Что выбрать новичку: рекомендации по стартовым сценариям.
  7. Как проверить локальный API: команды для Ollama и LM Studio.
  8. Как использовать оба инструмента: общий клиент и импорт GGUF.
  9. Полезные сценарии: локальный чат, подключение приложения и эмбеддинги.
  10. Чеклист быстрого старта: последовательность первых действий.
  11. Официальные ссылки: документация и страницы продуктов.

Что нужно знать о локальных моделях

Локальная модель работает на вашем устройстве. После загрузки её можно использовать без отправки запросов внешнему API, если выбранный инструмент и сценарий не обращаются к облачным функциям.

Основные понятия:

  • RAM и VRAM. Оперативная и видеопамять ограничивают размер модели и доступную длину контекста.
  • GGUF. Распространённый формат моделей для локального запуска.
  • MLX. Экосистема для запуска моделей, оптимизированная под Apple Silicon. Поддержка конкретных вариантов зависит от инструмента и модели.
  • Квантизация. Сжатие весов модели с компромиссом между размером, скоростью и качеством. Обозначения вроде Q4 и Q8 указывают на варианты квантизации.

Официальная документация LM Studio рекомендует выбирать вариант с разрядностью 4 бита или выше, если компьютер справляется с ним. Точный расход памяти зависит не только от числа параметров, но и от квантизации, длины контекста, архитектуры и распределения вычислений между CPU и GPU.

💡
Для первой проверки выбирайте небольшую модель и ориентируйтесь на оценку памяти до загрузки. В LM Studio CLI команда lms load --estimate-only показывает предполагаемое потребление GPU и общей памяти с учётом выбранной длины контекста.

Как устроена Ollama

Ollama — рантайм с командным интерфейсом и HTTP API. Команда ollama run <модель> запускает модель и открывает диалог в терминале. Локальный OpenAI-совместимый адрес по умолчанию имеет вид http://localhost:11434/v1/.

Ollama заявляет совместимость с отдельными частями OpenAI API, а не с API целиком. В актуальной документации перечислены:

  • POST /v1/chat/completions;
  • POST /v1/completions;
  • GET /v1/models;
  • GET /v1/models/{model};
  • POST /v1/embeddings;
  • POST /v1/responses.

Поддержка Responses API появилась в Ollama 0.13.3. Реализация не хранит состояние между запросами: параметры previous_response_id и conversation не поддерживаются.

Как устроена LM Studio

LM Studio — десктопное приложение с графическим интерфейсом. Встроенный загрузчик ищет поддерживаемые модели на Hugging Face по ключевому слову, идентификатору user/model или полной ссылке. Перед загрузкой можно выбрать вариант квантизации.

Локальный OpenAI-совместимый сервер в примерах официальной документации доступен по адресу http://localhost:1234/v1. Официальная документация перечисляет следующие точки доступа:

  • GET /v1/models;
  • POST /v1/responses;
  • POST /v1/chat/completions;
  • POST /v1/completions;
  • POST /v1/embeddings.

LM Studio 0.3.29 добавила OpenAI-совместимый POST /v1/responses с продолжением взаимодействия через previous_response_id. В версии 0.4.0 появился собственный REST API по пути /api/v1/*, включая точки доступа для скачивания, загрузки и выгрузки моделей. Версия 0.4.1 добавила совместимый с Anthropic POST /v1/messages.

Основные возможности и общие черты

  • Локальный запуск поддерживаемых открытых моделей.
  • Работа с квантизированными вариантами моделей.
  • OpenAI-совместимые точки доступа для чата, списка моделей и эмбеддингов.
  • Подключение существующих OpenAI-клиентов через замену базового URL.
  • Возможность использовать API из скриптов, редакторов кода и других клиентов.
⚖️
OpenAI-совместимость не означает полного совпадения поведения. Поддерживаемые поля, работа с состоянием, инструменты и формат рассуждений зависят от продукта, его версии и выбранной модели.

Ключевые различия

КритерийOllamaLM Studio
Основной способ работыКоманды и APIГрафическое приложение, CLI и API
Первый запуск моделиollama run <модель>Поиск и загрузка во вкладке Discover
Локальный адрес APIhttp://localhost:11434/v1/http://localhost:1234/v1
Поиск моделейРеестр Ollama или ручной импортВстроенный поиск поддерживаемых моделей на Hugging Face
Импорт GGUFЧерез Modelfile и ollama createЗагрузка и управление моделями средствами приложения
OpenAI Responses APIБез состояния между запросамиПоддерживает previous_response_id
Anthropic-совместимый APIПроверяйте поддержку нужного клиента по актуальной документацииPOST /v1/messages начиная с версии 0.4.1
Подходящий стартовый сценарийАвтоматизация и работа из терминалаВизуальный подбор и сравнение моделей

Что выбрать новичку

💡
Выбирайте LM Studio, если хотите найти модель, сравнить варианты квантизации и начать диалог в графическом приложении. Выбирайте Ollama, если модель сразу требуется подключить к скрипту, IDE или другому локальному клиенту.

LM Studio даёт более наглядный первый запуск. Ollama удобна, когда команды должны повторяться в сценариях автоматизации или на машине без постоянной работы с графическим интерфейсом.

Выбор не окончательный: оба инструмента можно установить на одном компьютере и подключать к ним один клиент через разные базовые URL.

Как проверить локальный API

Перед проверкой загрузите модель и запустите локальный сервер соответствующего инструмента. Ниже приведены документированные примеры; имя модели и состояние сервера должны соответствовать вашей конфигурации.

Проверка Ollama

Официальная документация приводит llama3.2 как пример локальной модели:

ollama pull llama3.2

После запуска Ollama запросите список доступных моделей:

curl http://localhost:11434/v1/models

Ожидаемый результат: JSON-ответ со списком локальных моделей. Для запроса к чату передайте реальное имя загруженной модели:

curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"llama3.2","messages":[{"role":"user","content":"Ответь одним словом: работает?"}]}'

Проверка LM Studio

Запустите локальный сервер LM Studio и запросите список моделей:

curl http://localhost:1234/v1/models

Ожидаемый результат: JSON со списком моделей, доступных серверу. Идентификатор из ответа можно передать в POST /v1/chat/completions:

curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"MODEL_IDENTIFIER","messages":[{"role":"user","content":"Ответь одним словом: работает?"}]}'

Замените MODEL_IDENTIFIER на идентификатор модели из LM Studio.

Как использовать оба инструмента

Один клиент с двумя адресами

Если клиент позволяет менять базовый URL, для Ollama укажите http://localhost:11434/v1/, а для LM Studio — http://localhost:1234/v1. Отдельно проверьте, какую точку доступа и какие параметры использует клиент.

Визуальный подбор и последующая автоматизация

Модель можно сначала подобрать в LM Studio, сравнив доступные квантизации, а затем запустить совместимый GGUF-файл через Ollama. Файл потребуется импортировать вручную.

Создайте Modelfile:

FROM /path/to/file.gguf

Затем выполните:

ollama create my-model
ollama run my-model
⚠️
Загрузка модели в LM Studio сама по себе не регистрирует её в Ollama. Для GGUF-файла нужно создать отдельную модель командой ollama create. Поддержка конкретной архитектуры должна быть проверена до импорта.

Полезные сценарии

Приватный локальный чат

Задача: работать с запросами на собственном компьютере.

Что делать: загрузить подходящую модель, отключить необязательные облачные функции и запустить локальный чат.

Проверка: при доступном локальном рантайме запрос должен получить ответ; отсутствие внешних подключений нужно проверять по всему контуру, включая клиент, плагины и подключённые инструменты.

Подключение приложения к локальной модели

Задача: заменить удалённую точку доступа в совместимом прототипе.

Что делать: изменить базовый URL OpenAI-клиента на адрес Ollama или LM Studio и указать идентификатор локальной модели.

Проверка: endpoint /v1/models должен вернуть модель, а /v1/chat/completions — корректный ответ.

Ограничение: отдельные параметры OpenAI API могут отсутствовать или вести себя иначе.

Локальные эмбеддинги

Задача: получать векторные представления текстов для поиска по своим данным.

Что делать: загрузить совместимую модель эмбеддингов и использовать POST /v1/embeddings.

Проверка: сервер должен вернуть массив числовых векторов для переданного текста.

Ограничение: качество поиска зависит от модели, языка данных и способа разбиения документов.

Чеклист быстрого старта

Проверьте доступную RAM и VRAM.
Для визуального старта выберите LM Studio, для команд и автоматизации — Ollama.
Начните с небольшой 4-битной или более точной квантизации, которую выдерживает компьютер.
Загрузите модель до первого API-запроса.
Проверьте /v1/models: порт 11434 у Ollama или 1234 у LM Studio.
Выполните тестовый запрос к /v1/chat/completions.
Проверьте поддержку нужных полей API и возможностей выбранной модели.
Для чувствительных данных проверьте весь контур на внешние подключения.

Официальные ссылки


Следующий шаг

Если вы выбираете локальные модели для личного или командного контура, сначала определите требования к интерфейсу, автоматизации и приватности.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov