Перейти к содержимому

Локальные модели (Ollama)

Ollama позволяет запускать языковые модели полностью на вашем устройстве — запросы не покидают машину и не требуют внешнего API-ключа. Kodik автоматически обнаруживает запущенный Ollama-сервер и предлагает все загруженные модели для выбора.

Image

Параметр Включить Ollama в настройках определяет, доступны ли локальные модели в чате. Если выключить его, модели Ollama сразу исчезнут из списка выбора модели; после повторного включения Kodik вернёт уже обнаруженные модели без перезагрузки.

Если Ollama ещё не установлена, Kodik предложит установить её прямо из интерфейса. Вы также можете сделать это вручную.

ОСКоманда
Linuxcurl -fsSL https://ollama.com/install.sh | sh
macOSbrew install ollama
Windowswinget install -e --id Ollama.Ollama

Kodik умеет запускать и останавливать Ollama-сервер через встроенный интерфейс:

  • Запустить — Kodik выполняет ollama serve в фоне. Процесс остаётся живым даже после закрытия терминала.
  • Остановить — Kodik отправляет команду завершения, подходящую для текущей ОС.

Можно также запустить сервер самостоятельно командой ollama serve в терминале.

По умолчанию Kodik обращается к http://localhost:11434. Если вы запускаете Ollama на другом хосте или порту — например, в Docker или на удалённой машине — укажите нужный URL в настройках провайдера Ollama.

Для Ollama в Docker, на удалённой машине или за прокси Kodik использует настроенный HTTP-эндпоинт для обнаружения моделей и действий управления через API. Установка моделей из настроек запускает локальную команду ollama, поэтому CLI должен быть установлен на том же компьютере, что и Kodik, даже если настроен удалённый эндпоинт.

Поле Таймаут запроса в настройках провайдера Ollama задаёт, сколько миллисекунд Kodik ждёт, пока модель начнёт отвечать, прежде чем прервать запрос. Крупная модель при «холодном» старте или длинный промпт, обрабатываемый на CPU, могут не уложиться в значение по умолчанию до первого токена — увеличьте таймаут, чтобы Kodik ждал столько, сколько нужно. По умолчанию — 60000 (60 секунд); значение указывается в миллисекундах.

В разделе настроек Ollama доступны два способа установки модели:

  • Установить у рекомендованной модели — открывает видимый встроенный терминал и запускает ollama pull <модель>.
  • Установить по имени модели — открывает тот же терминал с введённым идентификатором модели, например ollama pull qwen3.5.
  • Delete — удаляет модель с диска через API Ollama.

В терминале отображаются штатный прогресс загрузки и ошибки Ollama. Оба способа обращаются к настроенному базовому URL через OLLAMA_HOST.

Если нужной модели нет среди рекомендованных, найдите её имя на ollama.com/library и введите его в поле Установить по имени модели.

Кнопка Протестировать модель отправляет короткое тестовое сообщение выбранной модели и показывает ответ и время отклика. Это удобно для проверки корректности настройки перед началом работы.

Kodik получает список установленных моделей через /api/tags, а поддерживаемый архитектурой контекст — через /api/show. Эти метаданные модели служат источником истины для меню использования контекста, настроек модели, бюджета запросов и автоматического сжатия.

Kodik также проверяет /api/ps для диагностики запущенной модели, но меньшее выделенное окно не заменяет размер контекста, успешно полученный через /api/show. Например, модель с заявленным контекстом 40 960 продолжает отображать и использовать 40 960, даже если /api/ps сообщает 4 096.

Kodik также читает возможности модели из /api/show. Если выбранная модель объявляет tools, Kodik отправляет активные схемы инструментов Harness и связанные инструкции. Если эта возможность явно отсутствует, Kodik отправляет запрос чата без инструментов. При создании Goal Kodik переходит на проверяемый JSON, а выбранный на такой модели субагент переднего плана всё ещё может выполнить делегированную задачу, не требующую инструментов.

Поле Окно контекста в Kodik настраивает нативные функции Ollama, например автодополнение; для чата контекст выбранной модели определяется автоматически. Чтобы изменить выделение памяти Ollama во время выполнения, измените настройку контекста в Ollama, задайте OLLAMA_CONTEXT_LENGTH для сервера или создайте модель с PARAMETER num_ctx в Modelfile.

Модели с возможностью thinking (например, семейство Qwen3) получают переключатель Рассуждение в выборе модели чата — отдельно для каждой модели. Вкл. сохраняет поведение Ollama по умолчанию: модель размышляет перед ответом, ход мыслей показывается в сворачиваемом блоке. Выкл. отправляет think: false — модель отвечает сразу, без этапа размышления: быстрее и экономнее по токенам для простых задач. Моделям без этой возможности флаг не отправляется никогда.

Если ваш Ollama-сервер требует Bearer-токена (например, при использовании Ollama Cloud или закрытого корпоративного экземпляра), введите его в поле API Key в настройках провайдера Ollama. Для стандартной локальной установки оставьте это поле пустым.