Ollama — рантайм для запуска языковых моделей локально или через Ollama Cloud. Он доступен на macOS, Windows и Linux, поднимает локальный HTTP API (программный интерфейс) на localhost:11434, загружает модели из реестра и подключается к приложениям и кодинг-агентам, включая Codex CLI и Codex App.
- Как устроена Ollama — локальный и облачный режимы работы.
- Основные возможности — API, инструменты, изображения, эмбеддинги и Modelfile.
- Установка и быстрый старт — базовые команды и проверка локального API.
- Нативный и OpenAI-совместимый API — основные эндпоинты, SDK и Responses API.
- Вызов инструментов — безопасный цикл работы с функциями.
- Modelfile и размер контекста — собственные параметры запуска модели.
- Ollama Cloud — облачный запуск и ограничения приватности.
- Интеграция с Codex CLI — быстрый и постоянный профиль.
- Codex App через Ollama — настройка, выбор модели и восстановление конфигурации.
- Тарифы и лимиты Ollama Cloud — кредиты, цены и одновременные запросы.
- Полезные сценарии — кодинг, RAG, Modelfile и Cloud.
- Когда Ollama может не подойти — ограничения совместимости, оборудования и инфраструктуры.
- Официальные ссылки — документация, API, интеграции и тарифы.
Как устроена Ollama
Ollama можно рассматривать как менеджер моделей и единый рантайм для LLM. Команда ollama run <model> загружает модель при необходимости и открывает интерактивный чат в терминале. Параллельно клиентские приложения могут обращаться к локальному API.
Основные режимы работы:
- локальные модели на вашей машине;
- облачные модели Ollama;
- подключение приложений через нативный API Ollama или совместимые части OpenAI API.
Локальный запуск сохраняет данные на вашей инфраструктуре, но доступный размер модели и скорость зависят от памяти, процессора и GPU. При использовании Ollama Cloud запросы обрабатываются на инфраструктуре провайдера и тарифицируются по условиям аккаунта.
Основные возможности
| Возможность | Что даёт |
| Локальный рантайм | Запуск моделей на собственном CPU или GPU без внешнего модельного API |
| Ollama Cloud | Доступ к моделям, которые неудобно или невозможно запускать на локальном оборудовании |
| Нативный HTTP API | Эндпоинты для чата, генерации, эмбеддингов и управления моделями |
| OpenAI-совместимый API | Подключение части приложений на OpenAI SDK через замену base_url |
| Совместимость с Anthropic | Отдельный раздел совместимости в справочнике API для клиентов, ожидающих формат Anthropic |
| Вызов инструментов | Function calling для моделей, которые поддерживают работу с инструментами |
| Потоковая выдача | Получение ответа частями по мере генерации |
| Работа с изображениями | Передача изображений мультимодальным моделям, в том числе через OpenAI-совместимый /v1/chat/completions |
| Эмбеддинги | Генерация векторов через нативный API и OpenAI-совместимый /v1/embeddings |
| Modelfile | Создание собственной конфигурации поверх базовой модели с системным промптом и параметрами |
| Интеграции | Запуск и настройка поддерживаемых приложений через ollama launch <tool> |
Установка и быстрый старт
Скачайте установщик с ollama.com/download. После установки в системе появляется команда ollama и локальный сервис API.
Базовые команды:
# скачать и запустить модель
ollama run llama3.2
# скачать модель без запуска
ollama pull llama3.2
# показать локальные модели
ollama ls
# показать запущенные модели
ollama ps
# остановить модель
ollama stop llama3.2Названия моделей в примерах могут измениться. Перед копированием команды проверьте нужный тег в реестре моделей.
Проверка результата через локальный API
Запустите модель, затем отправьте запрос:
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [{"role": "user", "content": "Ответь одним словом: работает"}],
"stream": false
}'Успешный результат — JSON-ответ без ошибки, в котором есть сообщение модели. Если соединение с localhost:11434 не устанавливается, проверьте, запущено ли приложение или сервис Ollama. Если API сообщает, что модель не найдена, выполните ollama pull <model> с существующим тегом.
Нативный и OpenAI-совместимый API
Нативный локальный API доступен по адресу http://localhost:11434/api. В справочнике Ollama перечислены эндпоинты для генерации, чата, эмбеддингов, просмотра и управления моделями, включая /api/generate, /api/chat, /api/embed, /api/tags, /api/ps, /api/pull и /api/push.
OpenAI-совместимый слой работает через http://localhost:11434/v1/. Ollama заявляет совместимость с частями OpenAI API, поэтому перед переносом приложения нужно проверить используемые эндпоинты и поля.
Пример с Python SDK:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1/",
api_key="ollama", # поле обязательно для SDK, локально значение игнорируется
)
response = client.chat.completions.create(
model="gpt-oss:20b",
messages=[
{"role": "user", "content": "Объясни TCP за минуту"}
],
)
print(response.choices[0].message.content)Для /v1/chat/completions официальная документация перечисляет потоковую выдачу, JSON mode, изображения, инструменты и управление рассуждением. Реальная поддержка зависит от модели.
Ollama также поддерживает OpenAI Responses API по адресу /v1/responses. По состоянию на проверку поддерживается только вариант без сохранения серверного состояния: previous_response_id и conversation использовать нельзя.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1/",
api_key="ollama",
)
response = client.responses.create(
model="qwen3:8b",
input="Напиши короткое объяснение DNS",
)
print(response.output_text)base_url подходит приложениям, которые используют реализованные Ollama эндпоинты и поля. Код, зависящий от серверных разговоров Responses API или других неподдерживаемых функций OpenAI, потребует адаптации.Официальные SDK Ollama доступны для Python и JavaScript/TypeScript:
pip install ollama
npm install ollamaВызов инструментов
Модели с поддержкой инструментов могут возвращать структурированный запрос на выполнение функции. Сам рантайм не выполняет произвольную функцию за приложение: клиентский код должен проверить вызов, выполнить разрешённый инструмент и передать результат модели.
В примере указан тег gpt-oss:20b; если он отсутствует или не поддерживает инструменты в вашей сборке, замените его на доступную модель с такой поддержкой.
Минимальный пример с Python SDK:
from ollama import chat
def get_temperature(city: str) -> str:
"""Возвращает тестовое значение температуры для примера."""
values = {"New York": "22°C", "London": "15°C"}
return values.get(city, "Unknown")
messages = [
{"role": "user", "content": "Какая температура в Нью-Йорке?"}
]
response = chat(
model="gpt-oss:20b",
messages=messages,
tools=[get_temperature],
think=True,
)
if response.message.tool_calls:
call = response.message.tool_calls[0]
result = get_temperature(**call.function.arguments)
messages.append(response.message)
messages.append({
"role": "tool",
"tool_name": call.function.name,
"content": result,
})
final = chat(
model="gpt-oss:20b",
messages=messages,
tools=[get_temperature],
think=True,
)
print(final.message.content)Этот фрагмент показывает механику, а не обращается к реальному погодному сервису. В рабочем приложении проверяйте имя инструмента и аргументы перед выполнением, ограничивайте разрешённые операции и обрабатывайте ошибки внешнего API.
Modelfile и размер контекста
Modelfile — текстовый рецепт собственной конфигурации модели. Через него можно зафиксировать базовую модель, системный промпт и параметры запуска.
# Modelfile
# Базовая модель.
FROM gemma4
SYSTEM """Ты — спокойный технический ассистент. Отвечай по делу."""
# Температура генерации.
PARAMETER temperature 0.4
# Размер окна контекста в токенах.
PARAMETER num_ctx 8192Сборка и запуск:
ollama create my-assistant -f Modelfile
ollama run my-assistantOpenAI API не содержит отдельного стандартного поля для изменения размера контекста модели в Ollama. Если приложению требуется другое окно контекста, официальная документация рекомендует создать модель через Modelfile с PARAMETER num_ctx, а затем обращаться к новому имени модели.
Ollama Cloud
Облачную модель можно запустить через тот же клиент после входа в аккаунт:
ollama signin
ollama run gpt-oss:120b-cloudCloud полезен, когда модель не помещается в локальную память или нужна облачная вычислительная мощность. При этом запросы покидают локальную машину.
По состоянию на 6 сентября 2026 года Ollama размещает основные вычислительные ресурсы в США и может направлять запросы в Европу и Сингапур. Ollama также заявляет, что тексты запросов и ответов не журналируются и не используются для обучения. Для регулируемых данных одной публичной формулировки недостаточно: проверьте договорные условия и требования вашей организации.
Интеграция с Codex CLI
Codex CLI устанавливается через npm:
npm install -g @openai/codexОфициальная инструкция Ollama рекомендует для Codex окно контекста не меньше 64 тысяч токенов. Фактически доступный контекст зависит от модели и её конфигурации.
Быстрый запуск
ollama launch codexПри таком запуске Ollama обновляет каталог моделей и использует отдельный профиль Codex для сессии.
Настроить профиль без запуска:
ollama launch codex --configУдалить созданный Ollama профиль и каталог моделей:
ollama launch codex --restoreРучной запуск
# запуск с провайдером открытых моделей
codex --oss
# конкретная локальная модель
codex --oss -m gpt-oss:120b
# облачная модель Ollama
codex --oss -m gpt-oss:120b-cloudПостоянный профиль
Актуальная инструкция Ollama предлагает создать отдельный файл ~/.codex/ollama-launch.config.toml:
model = "gpt-oss:120b"
model_provider = "ollama-launch"
model_catalog_json = "/Users/you/.codex/model.json"
[model_providers.ollama-launch]
name = "Ollama"
base_url = "http://localhost:11434/v1/"
wire_api = "responses"Замените /Users/you/ на путь к домашнему каталогу своего пользователя. Запуск профиля:
codex --profile ollama-launchВеб-поиск для локальных и облачных моделей в этом профиле выполняет Ollama. Для сервиса веб-поиска требуется вход через ollama signin. Отключить его для конкретной сессии можно так:
codex --profile ollama-launch -c 'web_search="disabled"'Проверка связки
После запуска попросите Codex прочитать небольшой тестовый файл или ответить на вопрос без изменения репозитория. Успешная проверка означает, что сессия открылась с профилем Ollama и вернула ответ модели. Если Codex не видит модель, повторите ollama launch codex --config, проверьте каталог моделей и убедитесь, что локальная модель загружена либо выполнен вход для облачной модели.
Codex App через Ollama
Codex App — десктопный кодинг-агент OpenAI для macOS и Windows. Поддержка интеграции доступна в Ollama v0.24.0 и новее.
Быстрый запуск:
ollama launch codex-appЯвный выбор модели:
# облачная модель
ollama launch codex-app --model kimi-k2.6:cloud
# локальная модель
ollama launch codex-app --model gemma4:31bВыбор сохраняется для следующих запусков Codex App. Вернуть предыдущую конфигурацию приложения можно командой:
ollama launch codex-app --restoreПеред перезаписью конфигурации Ollama сохраняет резервные копии в ~/.ollama/backup/codex-app/. В Windows ~ означает каталог профиля пользователя. Профиль Codex CLI, которым управляет ollama launch codex, хранится отдельно от профиля Codex App.
Codex App поддерживает встроенный браузер для локальных серверов и сайтов, аннотации страниц и режим проверки изменений.
ollama launch codex-app. Если уже открытое приложение не сменило модель, разрешите Ollama перезапустить его или закройте приложение перед повторным запуском команды.Тарифы и лимиты Ollama Cloud
Тарифы проверены 6 сентября 2026 года по официальной странице Ollama Pricing. Облачное использование измеряется в токенах по ставке выбранной модели. Включённые кредиты обновляются ежемесячно и не переносятся на следующий период; дополнительные кредиты можно подключить на любом тарифе.
| Тариф | Стоимость | Основные условия |
| Free | $0 | Стартовые кредиты, стартовый набор моделей, 1 одновременный запрос; дополнительные кредиты открывают остальные модели |
| Pro | $20 в месяц или $200 в год | $60 облачных кредитов в месяц, доступ к более крупным Pro-моделям, 3 одновременных запроса |
| Max | $100 в месяц | $300 облачных кредитов в месяц, ранний доступ к новым моделям, 10 одновременных запросов |
| Team | $500 в месяц | Неограниченное число пользователей, $1 000 общих кредитов в месяц, централизованное управление, 10 одновременных запросов |
| Enterprise | Индивидуальная цена | Контроль доступа к моделям, бюджеты пользователей и API-ключей, условия для крупных организаций |
| Локальный запуск | Без платы Ollama за токены | Использование на собственном оборудовании не ограничивается облачными кредитами; остаются расходы на инфраструктуру и электричество |
Запросы сверх лимита одновременности ставятся в очередь. Если очередь заполнена, новый запрос отклоняется до освобождения слота. Точные ставки различаются по моделям и указаны за миллион входных, кешированных входных и выходных токенов. Для некоторых моделей действует повышенная цена в пиковый период с 12:00 до 18:00 UTC по будням, поэтому перед расчётом нагрузки проверяйте текущую таблицу цен.
Полезные сценарии
Локальный помощник для работы с кодом
Задача: использовать Codex с моделью на собственной машине.
Что сделать: загрузить подходящую модель, обеспечить рекомендованный для Codex контекст и запустить ollama launch codex.
Проверка: Codex открывает сессию с профилем Ollama и отвечает на тестовый запрос.
Ограничение: качество, скорость и доступный контекст зависят от модели и оборудования. Сам факт локального запуска не гарантирует качество облачных кодинговых моделей.
Локальный RAG-пайплайн
RAG (поиск релевантных фрагментов с последующей генерацией ответа) подходит для работы с документами без внешнего модельного API.
Задача: получать эмбеддинги документов и генерировать ответы локально.
Что сделать: выбрать модель эмбеддингов, вызвать /api/embed или /v1/embeddings, сохранить векторы в подходящем хранилище и передавать найденные фрагменты чат-модели.
Проверка: API возвращает числовой вектор, а повторный поиск по тестовому документу находит ожидаемый фрагмент.
Ограничение: Ollama выполняет инференс, но не заменяет разбиение документов, векторное хранилище и оценку качества поиска.
Своя конфигурация через Modelfile
Задача: закрепить системный промпт и размер контекста для повторяемого сценария.
Что сделать: создать Modelfile, выполнить ollama create my-assistant -f Modelfile и обращаться к my-assistant как к обычной модели.
Проверка: модель отображается в ollama ls и отвечает через CLI или API.
Ограничение: Modelfile меняет конфигурацию запуска, но не обучает базовую модель новым знаниям.
Тяжёлая модель через Cloud
Задача: запустить модель, которая не помещается на локальном оборудовании.
Что сделать: войти через ollama signin, выбрать облачный тег и выполнить команду запуска.
Проверка: модель отвечает через CLI, а использование отражается в аккаунте Ollama.
Ограничение: действуют токенные ставки, включённые кредиты и лимит одновременных запросов выбранного тарифа; данные обрабатываются облачной инфраструктурой.
Когда Ollama может не подойти
- Если приложению нужна полная совместимость со всеми функциями OpenAI API, частичного совместимого слоя может быть недостаточно.
- Если локальное оборудование не соответствует размеру модели и облачный режим использовать нельзя, производительность будет ограничена.
- Если организация запрещает обработку данных за пределами согласованной инфраструктуры, Ollama Cloud требует отдельной проверки.
- Если нужен управляемый сервис с фиксированными гарантиями доступности и поддержки, условия следует отдельно сверить с текущим тарифом или Enterprise-предложением.
Официальные ссылки
- Документация Ollama
- Загрузка Ollama
- Реестр моделей
- Репозиторий Ollama на GitHub
- Интеграция с Codex CLI
- Интеграция с Codex App
- Список интеграций
- Справочник API
- Совместимость с OpenAI API
- Modelfile
- Тарифы Ollama Cloud
Следующий шаг
Если вы настраиваете Ollama для кодинг-агента, продолжите с материалом Контекст-инжиниринг — как собирать рабочий контекст для моделей нового поколения.
Если вы выбираете между локальным запуском и облачными моделями или собираете связку Ollama с кодинг-агентами, можно обсудить требования к данным, моделям и инфраструктуре.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov


