Материалы / 12 минут
Сравнить квантизации по памяти, скорости и качеству на одной задаче, не ориентируясь только на размер файла.
Квантизация меняет представление весов
Меньшая разрядность сокращает размер модели и трафик памяти, но ошибка округления распределяется по слоям неравномерно. Два файла одинакового размера могут давать разное качество.
Сначала сохраните baseline в исходной или более точной форме. Без него невозможно понять, что именно потеряно после преобразования.
Размер модели не равен рабочей памяти
К весам добавляются KV-кэш, контекст, буферы вычислений и память backend. Пиковое значение измеряется на реальном запросе после прогрева.
Сравнивайте варианты одной семьи и версии. Иначе разница tokenizer, prompt template или обучения будет сильнее самой квантизации.
- Одинаковые контекст, sampling и prompt template.
- Одинаковый набор задач и метод оценки.
- Отдельные метрики для TTFT, tokens/s и peak memory.
Решение принимает продуктовая граница
Выбирайте самую компактную конфигурацию, которая проходит минимальное качество и latency. Среднее значение не должно скрывать критический провал отдельного класса запросов.
Результат benchmark сохраняется вместе с версией модели, runtime, устройством и параметрами запуска.
variant size peak_ram ttft tok/s task_score
FP16 ... ... ... ... baseline
Q8_0 ... ... ... ... ...
Q5_K_M ... ... ... ... ...
Q4_K_M ... ... ... ... ...