🕐
Актуальность: проверено 6 сентября 2026 года по официальной документации Ollama. Обновлены тарифы Ollama Cloud, конфигурация Codex CLI и сведения об OpenAI-совместимом API. Названия, теги и доступность моделей меняются быстро — перед запуском сверяйтесь с ollama.com/library и docs.ollama.com.

Ollama — рантайм для запуска языковых моделей локально или через Ollama Cloud. Он доступен на macOS, Windows и Linux, поднимает локальный HTTP API (программный интерфейс) на localhost:11434, загружает модели из реестра и подключается к приложениям и кодинг-агентам, включая Codex CLI и Codex App.

📌
Коротко: Ollama управляет моделями, запускает их локально или в облаке и предоставляет нативный и частично OpenAI-совместимый API. Поддержка конкретных возможностей — изображений, инструментов, рассуждений и потоковой выдачи — зависит от выбранной модели и эндпоинта.
⚠️
Проверка примеров: команды и конфигурации ниже сверены с официальными документами Ollama, но фактический запуск в рамках этого редакторского прохода не выполнялся. Перед применением проверьте версию Ollama, доступность тега модели и ограничения своей среды.
  1. Как устроена Ollama — локальный и облачный режимы работы.
  2. Основные возможности — API, инструменты, изображения, эмбеддинги и Modelfile.
  3. Установка и быстрый старт — базовые команды и проверка локального API.
  4. Нативный и OpenAI-совместимый API — основные эндпоинты, SDK и Responses API.
  5. Вызов инструментов — безопасный цикл работы с функциями.
  6. Modelfile и размер контекста — собственные параметры запуска модели.
  7. Ollama Cloud — облачный запуск и ограничения приватности.
  8. Интеграция с Codex CLI — быстрый и постоянный профиль.
  9. Codex App через Ollama — настройка, выбор модели и восстановление конфигурации.
  10. Тарифы и лимиты Ollama Cloud — кредиты, цены и одновременные запросы.
  11. Полезные сценарии — кодинг, RAG, Modelfile и Cloud.
  12. Когда Ollama может не подойти — ограничения совместимости, оборудования и инфраструктуры.
  13. Официальные ссылки — документация, API, интеграции и тарифы.

Как устроена Ollama

Ollama можно рассматривать как менеджер моделей и единый рантайм для LLM. Команда ollama run <model> загружает модель при необходимости и открывает интерактивный чат в терминале. Параллельно клиентские приложения могут обращаться к локальному API.

Основные режимы работы:

  • локальные модели на вашей машине;
  • облачные модели Ollama;
  • подключение приложений через нативный API Ollama или совместимые части OpenAI API.

Локальный запуск сохраняет данные на вашей инфраструктуре, но доступный размер модели и скорость зависят от памяти, процессора и GPU. При использовании Ollama Cloud запросы обрабатываются на инфраструктуре провайдера и тарифицируются по условиям аккаунта.

Основные возможности

ВозможностьЧто даёт
Локальный рантаймЗапуск моделей на собственном CPU или GPU без внешнего модельного API
Ollama CloudДоступ к моделям, которые неудобно или невозможно запускать на локальном оборудовании
Нативный HTTP APIЭндпоинты для чата, генерации, эмбеддингов и управления моделями
OpenAI-совместимый APIПодключение части приложений на OpenAI SDK через замену base_url
Совместимость с AnthropicОтдельный раздел совместимости в справочнике API для клиентов, ожидающих формат Anthropic
Вызов инструментовFunction calling для моделей, которые поддерживают работу с инструментами
Потоковая выдачаПолучение ответа частями по мере генерации
Работа с изображениямиПередача изображений мультимодальным моделям, в том числе через OpenAI-совместимый /v1/chat/completions
ЭмбеддингиГенерация векторов через нативный API и OpenAI-совместимый /v1/embeddings
ModelfileСоздание собственной конфигурации поверх базовой модели с системным промптом и параметрами
ИнтеграцииЗапуск и настройка поддерживаемых приложений через ollama launch <tool>

Установка и быстрый старт

Скачайте установщик с ollama.com/download. После установки в системе появляется команда ollama и локальный сервис API.

Базовые команды:

# скачать и запустить модель
ollama run llama3.2

# скачать модель без запуска
ollama pull llama3.2

# показать локальные модели
ollama ls

# показать запущенные модели
ollama ps

# остановить модель
ollama stop llama3.2

Названия моделей в примерах могут измениться. Перед копированием команды проверьте нужный тег в реестре моделей.

Проверка результата через локальный API

Запустите модель, затем отправьте запрос:

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [{"role": "user", "content": "Ответь одним словом: работает"}],
  "stream": false
}'

Успешный результат — JSON-ответ без ошибки, в котором есть сообщение модели. Если соединение с localhost:11434 не устанавливается, проверьте, запущено ли приложение или сервис Ollama. Если API сообщает, что модель не найдена, выполните ollama pull <model> с существующим тегом.

💡
Для мультимодального запроса выбирайте модель с поддержкой изображений. Наличие модели в реестре само по себе не означает, что она поддерживает vision или вызов инструментов.

Нативный и OpenAI-совместимый API

Нативный локальный API доступен по адресу http://localhost:11434/api. В справочнике Ollama перечислены эндпоинты для генерации, чата, эмбеддингов, просмотра и управления моделями, включая /api/generate, /api/chat, /api/embed, /api/tags, /api/ps, /api/pull и /api/push.

OpenAI-совместимый слой работает через http://localhost:11434/v1/. Ollama заявляет совместимость с частями OpenAI API, поэтому перед переносом приложения нужно проверить используемые эндпоинты и поля.

Пример с Python SDK:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1/",
    api_key="ollama",  # поле обязательно для SDK, локально значение игнорируется
)

response = client.chat.completions.create(
    model="gpt-oss:20b",
    messages=[
        {"role": "user", "content": "Объясни TCP за минуту"}
    ],
)

print(response.choices[0].message.content)

Для /v1/chat/completions официальная документация перечисляет потоковую выдачу, JSON mode, изображения, инструменты и управление рассуждением. Реальная поддержка зависит от модели.

Ollama также поддерживает OpenAI Responses API по адресу /v1/responses. По состоянию на проверку поддерживается только вариант без сохранения серверного состояния: previous_response_id и conversation использовать нельзя.

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1/",
    api_key="ollama",
)

response = client.responses.create(
    model="qwen3:8b",
    input="Напиши короткое объяснение DNS",
)

print(response.output_text)
⚖️
Совместимость частичная. Смена base_url подходит приложениям, которые используют реализованные Ollama эндпоинты и поля. Код, зависящий от серверных разговоров Responses API или других неподдерживаемых функций OpenAI, потребует адаптации.

Официальные SDK Ollama доступны для Python и JavaScript/TypeScript:

pip install ollama
npm install ollama

Вызов инструментов

Модели с поддержкой инструментов могут возвращать структурированный запрос на выполнение функции. Сам рантайм не выполняет произвольную функцию за приложение: клиентский код должен проверить вызов, выполнить разрешённый инструмент и передать результат модели.

В примере указан тег gpt-oss:20b; если он отсутствует или не поддерживает инструменты в вашей сборке, замените его на доступную модель с такой поддержкой.

Минимальный пример с Python SDK:

from ollama import chat


def get_temperature(city: str) -> str:
    """Возвращает тестовое значение температуры для примера."""
    values = {"New York": "22°C", "London": "15°C"}
    return values.get(city, "Unknown")


messages = [
    {"role": "user", "content": "Какая температура в Нью-Йорке?"}
]

response = chat(
    model="gpt-oss:20b",
    messages=messages,
    tools=[get_temperature],
    think=True,
)

if response.message.tool_calls:
    call = response.message.tool_calls[0]
    result = get_temperature(**call.function.arguments)

    messages.append(response.message)
    messages.append({
        "role": "tool",
        "tool_name": call.function.name,
        "content": result,
    })

    final = chat(
        model="gpt-oss:20b",
        messages=messages,
        tools=[get_temperature],
        think=True,
    )
    print(final.message.content)

Этот фрагмент показывает механику, а не обращается к реальному погодному сервису. В рабочем приложении проверяйте имя инструмента и аргументы перед выполнением, ограничивайте разрешённые операции и обрабатывайте ошибки внешнего API.

Modelfile и размер контекста

Modelfile — текстовый рецепт собственной конфигурации модели. Через него можно зафиксировать базовую модель, системный промпт и параметры запуска.

# Modelfile
# Базовая модель.
FROM gemma4
SYSTEM """Ты — спокойный технический ассистент. Отвечай по делу."""
# Температура генерации.
PARAMETER temperature 0.4
# Размер окна контекста в токенах.
PARAMETER num_ctx 8192

Сборка и запуск:

ollama create my-assistant -f Modelfile
ollama run my-assistant

OpenAI API не содержит отдельного стандартного поля для изменения размера контекста модели в Ollama. Если приложению требуется другое окно контекста, официальная документация рекомендует создать модель через Modelfile с PARAMETER num_ctx, а затем обращаться к новому имени модели.

Ollama Cloud

Облачную модель можно запустить через тот же клиент после входа в аккаунт:

ollama signin
ollama run gpt-oss:120b-cloud

Cloud полезен, когда модель не помещается в локальную память или нужна облачная вычислительная мощность. При этом запросы покидают локальную машину.

⚖️
Компромисс: локальный режим не требует оплаты модельных токенов провайдеру, но расходует ресурсы вашего оборудования. Cloud снимает аппаратное ограничение, однако использует облачную инфраструктуру и оплачиваемые кредиты. Для чувствительных данных заранее проверьте требования вашей организации и актуальную политику Ollama.

По состоянию на 6 сентября 2026 года Ollama размещает основные вычислительные ресурсы в США и может направлять запросы в Европу и Сингапур. Ollama также заявляет, что тексты запросов и ответов не журналируются и не используются для обучения. Для регулируемых данных одной публичной формулировки недостаточно: проверьте договорные условия и требования вашей организации.

Интеграция с Codex CLI

Codex CLI устанавливается через npm:

npm install -g @openai/codex

Официальная инструкция Ollama рекомендует для Codex окно контекста не меньше 64 тысяч токенов. Фактически доступный контекст зависит от модели и её конфигурации.

Быстрый запуск

ollama launch codex

При таком запуске Ollama обновляет каталог моделей и использует отдельный профиль Codex для сессии.

Настроить профиль без запуска:

ollama launch codex --config

Удалить созданный Ollama профиль и каталог моделей:

ollama launch codex --restore

Ручной запуск

# запуск с провайдером открытых моделей
codex --oss

# конкретная локальная модель
codex --oss -m gpt-oss:120b

# облачная модель Ollama
codex --oss -m gpt-oss:120b-cloud

Постоянный профиль

Актуальная инструкция Ollama предлагает создать отдельный файл ~/.codex/ollama-launch.config.toml:

model = "gpt-oss:120b"
model_provider = "ollama-launch"
model_catalog_json = "/Users/you/.codex/model.json"

[model_providers.ollama-launch]
name = "Ollama"
base_url = "http://localhost:11434/v1/"
wire_api = "responses"

Замените /Users/you/ на путь к домашнему каталогу своего пользователя. Запуск профиля:

codex --profile ollama-launch

Веб-поиск для локальных и облачных моделей в этом профиле выполняет Ollama. Для сервиса веб-поиска требуется вход через ollama signin. Отключить его для конкретной сессии можно так:

codex --profile ollama-launch -c 'web_search="disabled"'

Проверка связки

После запуска попросите Codex прочитать небольшой тестовый файл или ответить на вопрос без изменения репозитория. Успешная проверка означает, что сессия открылась с профилем Ollama и вернула ответ модели. Если Codex не видит модель, повторите ollama launch codex --config, проверьте каталог моделей и убедитесь, что локальная модель загружена либо выполнен вход для облачной модели.

Codex App через Ollama

Codex App — десктопный кодинг-агент OpenAI для macOS и Windows. Поддержка интеграции доступна в Ollama v0.24.0 и новее.

Быстрый запуск:

ollama launch codex-app

Явный выбор модели:

# облачная модель
ollama launch codex-app --model kimi-k2.6:cloud

# локальная модель
ollama launch codex-app --model gemma4:31b

Выбор сохраняется для следующих запусков Codex App. Вернуть предыдущую конфигурацию приложения можно командой:

ollama launch codex-app --restore

Перед перезаписью конфигурации Ollama сохраняет резервные копии в ~/.ollama/backup/codex-app/. В Windows ~ означает каталог профиля пользователя. Профиль Codex CLI, которым управляет ollama launch codex, хранится отдельно от профиля Codex App.

Codex App поддерживает встроенный браузер для локальных серверов и сайтов, аннотации страниц и режим проверки изменений.

💡
Если Codex App не открывается после настройки, запустите приложение вручную один раз и повторите ollama launch codex-app. Если уже открытое приложение не сменило модель, разрешите Ollama перезапустить его или закройте приложение перед повторным запуском команды.

Тарифы и лимиты Ollama Cloud

Тарифы проверены 6 сентября 2026 года по официальной странице Ollama Pricing. Облачное использование измеряется в токенах по ставке выбранной модели. Включённые кредиты обновляются ежемесячно и не переносятся на следующий период; дополнительные кредиты можно подключить на любом тарифе.

ТарифСтоимостьОсновные условия
Free$0Стартовые кредиты, стартовый набор моделей, 1 одновременный запрос; дополнительные кредиты открывают остальные модели
Pro$20 в месяц или $200 в год$60 облачных кредитов в месяц, доступ к более крупным Pro-моделям, 3 одновременных запроса
Max$100 в месяц$300 облачных кредитов в месяц, ранний доступ к новым моделям, 10 одновременных запросов
Team$500 в месяцНеограниченное число пользователей, $1 000 общих кредитов в месяц, централизованное управление, 10 одновременных запросов
EnterpriseИндивидуальная ценаКонтроль доступа к моделям, бюджеты пользователей и API-ключей, условия для крупных организаций
Локальный запускБез платы Ollama за токеныИспользование на собственном оборудовании не ограничивается облачными кредитами; остаются расходы на инфраструктуру и электричество

Запросы сверх лимита одновременности ставятся в очередь. Если очередь заполнена, новый запрос отклоняется до освобождения слота. Точные ставки различаются по моделям и указаны за миллион входных, кешированных входных и выходных токенов. Для некоторых моделей действует повышенная цена в пиковый период с 12:00 до 18:00 UTC по будням, поэтому перед расчётом нагрузки проверяйте текущую таблицу цен.

Полезные сценарии

Локальный помощник для работы с кодом

Задача: использовать Codex с моделью на собственной машине.

Что сделать: загрузить подходящую модель, обеспечить рекомендованный для Codex контекст и запустить ollama launch codex.

Проверка: Codex открывает сессию с профилем Ollama и отвечает на тестовый запрос.

Ограничение: качество, скорость и доступный контекст зависят от модели и оборудования. Сам факт локального запуска не гарантирует качество облачных кодинговых моделей.

Локальный RAG-пайплайн

RAG (поиск релевантных фрагментов с последующей генерацией ответа) подходит для работы с документами без внешнего модельного API.

Задача: получать эмбеддинги документов и генерировать ответы локально.

Что сделать: выбрать модель эмбеддингов, вызвать /api/embed или /v1/embeddings, сохранить векторы в подходящем хранилище и передавать найденные фрагменты чат-модели.

Проверка: API возвращает числовой вектор, а повторный поиск по тестовому документу находит ожидаемый фрагмент.

Ограничение: Ollama выполняет инференс, но не заменяет разбиение документов, векторное хранилище и оценку качества поиска.

Своя конфигурация через Modelfile

Задача: закрепить системный промпт и размер контекста для повторяемого сценария.

Что сделать: создать Modelfile, выполнить ollama create my-assistant -f Modelfile и обращаться к my-assistant как к обычной модели.

Проверка: модель отображается в ollama ls и отвечает через CLI или API.

Ограничение: Modelfile меняет конфигурацию запуска, но не обучает базовую модель новым знаниям.

Тяжёлая модель через Cloud

Задача: запустить модель, которая не помещается на локальном оборудовании.

Что сделать: войти через ollama signin, выбрать облачный тег и выполнить команду запуска.

Проверка: модель отвечает через CLI, а использование отражается в аккаунте Ollama.

Ограничение: действуют токенные ставки, включённые кредиты и лимит одновременных запросов выбранного тарифа; данные обрабатываются облачной инфраструктурой.

Когда Ollama может не подойти

  • Если приложению нужна полная совместимость со всеми функциями OpenAI API, частичного совместимого слоя может быть недостаточно.
  • Если локальное оборудование не соответствует размеру модели и облачный режим использовать нельзя, производительность будет ограничена.
  • Если организация запрещает обработку данных за пределами согласованной инфраструктуры, Ollama Cloud требует отдельной проверки.
  • Если нужен управляемый сервис с фиксированными гарантиями доступности и поддержки, условия следует отдельно сверить с текущим тарифом или Enterprise-предложением.

Официальные ссылки


Следующий шаг

Если вы настраиваете Ollama для кодинг-агента, продолжите с материалом Контекст-инжиниринг — как собирать рабочий контекст для моделей нового поколения.

Если вы выбираете между локальным запуском и облачными моделями или собираете связку Ollama с кодинг-агентами, можно обсудить требования к данным, моделям и инфраструктуре.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov