Local AI / Voice / Урок 03

Runtime и формат модели

Подбираем движок, формат весов и параметры запуска под CPU или GPU.

Видео · 1:01Материалы · 11 минутРусскийОбновлён 02 августа 2026
Для кого
Разработчики локальных AI-приложений на ноутбуках, рабочих станциях и edge-устройствах.
Перед началом
Выбранная модель и измеренный бюджет устройства.
01:01 Озвучка · встроенный текст

Моё обучение

Прогресс и заметка

Войдите, чтобы сохранять прогресс, закладки и личные заметки.

Войти

Материалы / 11 минут

Подобрать runtime и параметры запуска, которые стабильно используют доступные CPU, GPU и память.

01

Формат и runtime образуют контракт

Runtime должен понимать архитектуру, tokenizer, metadata и конкретный тип квантизации. Факт загрузки файла ещё не доказывает корректность генерации.

Фиксируйте commit или release runtime рядом с моделью. Обновление движка может менять шаблон диалога, kernels и профиль памяти.

02

Backend выбирается измерением

CPU, CUDA, Metal, Vulkan и гибридный offload имеют разные накладные расходы. Максимальное число слоёв на GPU не всегда даёт лучший первый ответ.

Начните с консервативного контекста и одного потока запросов. Затем меняйте только один параметр: threads, batch, context или offload.

03

Стабильность важнее рекордного прогона

Проверьте десять последовательных запросов, длинный контекст и отмену генерации. Runtime должен освобождать состояние и возвращаться к одинаковому объёму памяти.

Для приложения используйте серверный режим с health endpoint и ограничением конкурентности, а не запускайте CLI-процесс для каждого запроса.

Контролируемый запуск llama-server bash
llama-server \
  -m ./models/model-q4_k_m.gguf \
  -c 4096 \
  -t 8 \
  -ngl 0 \
  --host 127.0.0.1 \
  --port 8081

Практика

Постройте профиль runtime

Сравните два backend или два режима offload, не меняя модель и набор запросов.

  1. 01

    Зафиксируйте одну модель, контекст и sampling.

  2. 02

    Измерьте cold start и три запроса после прогрева.

  3. 03

    Повторите тест с другим backend или offload.

  4. 04

    Проверьте отмену запроса и восстановление памяти.

Критерии готовности

  • Версии runtime и модели зафиксированы.
  • Процесс слушает только loopback-интерфейс.
  • Десять запросов проходят без роста памяти.
  • Отмена запроса не ломает следующий inference.