Local AI / Voice / Урок 02

Квантизация без магии

Сравниваем форматы и понимаем, где экономия памяти начинает стоить качества.

Видео · 1:10Материалы · 12 минутРусскийОбновлён 02 августа 2026
Для кого
Инженеры, запускающие языковые или speech-модели на CPU, GPU и edge-устройствах.
Перед началом
Целевая модель, устройство и набор реальных запросов.
01:10 Озвучка · встроенный текст

Моё обучение

Прогресс и заметка

Войдите, чтобы сохранять прогресс, закладки и личные заметки.

Войти

Материалы / 12 минут

Сравнить квантизации по памяти, скорости и качеству на одной задаче, не ориентируясь только на размер файла.

01

Квантизация меняет представление весов

Меньшая разрядность сокращает размер модели и трафик памяти, но ошибка округления распределяется по слоям неравномерно. Два файла одинакового размера могут давать разное качество.

Сначала сохраните baseline в исходной или более точной форме. Без него невозможно понять, что именно потеряно после преобразования.

02

Размер модели не равен рабочей памяти

К весам добавляются KV-кэш, контекст, буферы вычислений и память backend. Пиковое значение измеряется на реальном запросе после прогрева.

Сравнивайте варианты одной семьи и версии. Иначе разница tokenizer, prompt template или обучения будет сильнее самой квантизации.

  • Одинаковые контекст, sampling и prompt template.
  • Одинаковый набор задач и метод оценки.
  • Отдельные метрики для TTFT, tokens/s и peak memory.
03

Решение принимает продуктовая граница

Выбирайте самую компактную конфигурацию, которая проходит минимальное качество и latency. Среднее значение не должно скрывать критический провал отдельного класса запросов.

Результат benchmark сохраняется вместе с версией модели, runtime, устройством и параметрами запуска.

Матрица сравнения text
variant   size   peak_ram   ttft   tok/s   task_score
FP16      ...    ...        ...    ...     baseline
Q8_0      ...    ...        ...    ...     ...
Q5_K_M    ...    ...        ...    ...     ...
Q4_K_M    ...    ...        ...    ...     ...

Практика

Сравните четыре представления

Возьмите один checkpoint и проверьте baseline плюс три квантизации на одном устройстве.

  1. 01

    Зафиксируйте версии модели, runtime и prompt template.

  2. 02

    Сделайте прогрев перед измерением.

  3. 03

    Запишите peak memory, TTFT, tokens/s и ответы на десять задач.

  4. 04

    Выберите вариант по заранее заданному порогу, а не после просмотра цифр.

Критерии готовности

  • Baseline и квантизации относятся к одной модели.
  • Все варианты проверены с одинаковыми параметрами.
  • Память измерена во время inference.
  • Решение связано с порогом качества и latency.