Ollama — локальный ИИ-сервер, который позволяет запустить языковые модели на собственном ПК без облачных сервисов и ограничений. Настройка занимает 15–20 минут и не требует специальных знаний программирования.
Зачем это нужно
- Генерация кода без отправки данных на удалённые серверы
- Полная приватность: все вычисления происходят локально
- Работа без интернета после первоначальной загрузки модели
- Бесплатное использование без ограничений по количеству запросов
- Интеграция с локальными IDE и текстовыми редакторами
Системные требования и предварительная подготовка
- Windows 10/11, macOS 11+ или Linux (Ubuntu 20.04+)
- Минимум 8 ГБ оперативной памяти (рекомендуется 16 ГБ)
- Видеокарта NVIDIA (опционально, для ускорения CUDA) или AMD Radeon
- Минимум 10–15 ГБ свободного места на диске
- Установленный Docker (опционально) или встроенная поддержка Windows
Пошаговая инструкция
Шаг 1: Загрузка и установка Ollama
- Откройте браузер и перейдите на официальный сайт
ollama.ai - Нажмите кнопку
Download - Выберите версию для вашей операционной системы (Windows, macOS или Linux)
- Запустите скачанный установщик
OllamaSetup.exe(или.dmgдля macOS) - Следуйте инструкциям мастера установки, оставляя параметры по умолчанию
- После завершения установки Ollama будет автоматически добавлена в переменную окружения
PATH
Шаг 2: Проверка установки
- Откройте командную строку (нажмите
Win+R, введитеcmdи нажмитеEnter) - Введите команду:
ollama --version - Если установка успешна, отобразится номер версии (например,
0.1.45)
Шаг 3: Загрузка модели для генерации кода
- В командной строке введите:
ollama pull codellama - Система начнёт загружать модель CodeLlama (размер ~4–7 ГБ в зависимости от версии)
- Дождитесь завершения загрузки (это займёт 5–15 минут в зависимости от скорости интернета)
- После завершения введите:
ollama listи проверьте, что модельcodellamaотображается в списке
Шаг 4: Запуск сервера Ollama
- В командной строке введите:
ollama serve - Сервер запустится на локальном адресе
http://localhost:11434 - Оставьте это окно открытым (закрытие остановит сервер)
- Проверьте доступность: откройте браузер, перейдите на
http://localhost:11434— должна появиться страница с информацией о сервере
Шаг 5: Настройка интеграции с IDE
Для Visual Studio Code:
- Откройте VS Code и перейдите в
Extensions(Ctrl+Shift+X) - Найдите расширение
Ollama(автор: jmorganca или похожее) - Нажмите
Install - После установки откройте
Settings(Ctrl+,) и найдитеOllama: Endpoint - Убедитесь, что значение установлено на
http://localhost:11434 - В палитре команд (
Ctrl+Shift+P) введитеOllama: Startдля активации
Для PyCharm:
- Перейдите в
Settings→Plugins - Найдите
Ollamaи установите плагин - В
Settings→Tools→Ollamaукажите адресhttp://localhost:11434 - Перезагрузите IDE
Шаг 6: Тестирование генерации кода
- Откройте терминал/командную строку
- Введите команду:
ollama run codellama "Напиши функцию на Python для сортировки массива" - Модель обработает запрос (первый запрос займёт 10–30 секунд) и выведет сгенерированный код
- Если VS Code интегрирован, используйте встроенный чат или горячие клавиши расширения для генерации прямо в редакторе
Оптимизация производительности
- Если у вас видеокарта NVIDIA, установите CUDA Toolkit из официального репозитория NVIDIA
- Ollama автоматически обнаружит CUDA и будет использовать GPU для ускорения
- Для проверки введите:
ollama run codellamaи посмотрите в окно сollama serve— должна быть строкаGPU detected - Если нужна экономия памяти, используйте облегчённую модель:
ollama pull codellama:7bвместо базовой версии
Часто задаваемые вопросы
Какую модель лучше использовать для генерации кода? CodeLlama — оптимальный выбор (специализирована на коде), но также подходят Mistral, Neural Chat или Orca для универсальных задач.
Как остановить Ollama и сэкономить ресурсы? Закройте окно командной строки с ollama serve или введите Ctrl+C — сервер остановится; модели останутся сохранены на диске и загружать повторно не потребуется.
Почему модель медленно работает на слабом ПК? Уменьшите размер модели (используйте 7b вместо 13b), установите GPU-поддержку или увеличьте оперативную память.