Local AI / Model selection
Модель под бюджет устройства
Выбираем не самую большую модель, а минимальную конфигурацию, которая проходит требования продукта.
Моё обучение
Прогресс и заметка
Войдите, чтобы сохранять прогресс, закладки и личные заметки.
ВойтиКарта урока / 05
От ограничения к выбору
Параметры модели важны только после того, как определены устройство, сценарий и критерии качества.
- 01
Ограничения
Зафиксируйте RAM или VRAM, время первого ответа, длину контекста и офлайн-режим.
- 02
Память
Оцените веса, KV-кэш, рабочий контекст и накладные расходы runtime.
- 03
Кандидаты
Возьмите одну семью моделей, два размера и две квантизации.
- 04
Benchmark
Измерьте прогрев, TTFT, скорость, пиковую память и качество на своих запросах.
- 05
Решение
Выберите самую маленькую модель, которая проходит заданные критерии.
Правило выбора
Минимальная модель, прошедшая критерии.
Большая модель не компенсирует нехватку памяти, медленный первый ответ или нестабильный runtime. Сначала задайте бюджет, затем докажите пригодность на целевом устройстве.
Constraints → Memory budget → Device benchmark → Decision
Практика / 30 минут
Проведите короткий отбор
- Запишите четыре ограничения целевого устройства и сценария.
- Составьте таблицу из четырёх конфигураций одной семьи моделей.
- Измерьте TTFT, tokens/s и пиковую память после прогрева.
- Проверьте ответы на десяти реальных запросах и зафиксируйте решение.
Текст урока
Локальную модель часто выбирают по названию или числу параметров. Но на реальном устройстве выигрывает не самая большая модель, а та, которая укладывается в бюджет.
Сначала зафиксируйте задачу и четыре ограничения: доступную RAM или VRAM, допустимое время первого ответа, длину контекста и требование работать полностью офлайн.
Затем оцените память. Веса в четырёхбитной квантизации требуют примерно полбайта на параметр, но сверху добавляются KV-кэш, контекст и накладные расходы рантайма.
Теперь соберите короткий список кандидатов: одна семья моделей, два размера и две квантизации. Не сравнивайте всё со всем. Сначала отсекайте варианты, которые не запускаются стабильно.
Каждого кандидата проверяйте на самом устройстве: прогрев, время до первого токена, скорость генерации, пиковая память и качество на десяти реальных запросах вашей задачи.
Выбирайте самую маленькую модель, которая проходит ваши критерии. Если качества не хватает, увеличивайте размер. Если не хватает скорости, сокращайте контекст или меняйте квантизацию. Так выбор становится инженерным решением.