Local AI / Voice / Урок 04

Speech input: Whisper

Строим устойчивое распознавание речи и измеряем задержку полного контура.

Видео · 0:59Материалы · 13 минутРусскийОбновлён 02 августа 2026
Для кого
Разработчики голосовых интерфейсов и локальных ассистентов.
Перед началом
Доступ к микрофону, выбранная Whisper-модель и набор записей для проверки.
00:59 Озвучка · встроенный текст

Моё обучение

Прогресс и заметка

Войдите, чтобы сохранять прогресс, закладки и личные заметки.

Войти

Материалы / 13 минут

Построить устойчивый speech-input и измерить полный путь от микрофона до подтверждённого текста.

01

Сначала определите аудиоконтракт

Приведите вход к ожидаемой частоте дискретизации, числу каналов и диапазону амплитуды. Сохраняйте исходный фрагмент для воспроизводимого анализа ошибок.

Микрофон, браузер и системный capture могут добавлять автоматическое усиление и шумоподавление. Эти параметры являются частью эксперимента.

02

Сегментация влияет на задержку и смысл

VAD уменьшает пустые вычисления, но агрессивная граница обрезает начало и конец слова. Добавляйте небольшой pre-roll и объединяйте короткие паузы.

Для длинной речи используйте перекрывающиеся окна и сохраняйте временные метки. Интерфейс должен отличать промежуточный текст от подтверждённого.

03

Оценивайте продуктовый контур

WER полезен для фиксированного набора, но пользователю также важны время до первого текста, финальная задержка и исправление имён или терминов.

Соберите отдельные группы: тихая комната, шум, дальний микрофон, разные темпы и языки. Средняя цифра не должна скрывать провал одной группы.

Запись одного прогона json
{
  "audio_id": "sample-014",
  "model": "whisper-small",
  "first_text_ms": 420,
  "final_text_ms": 1380,
  "reference": "...",
  "transcript": "..."
}

Практика

Соберите speech benchmark

Подготовьте десять коротких записей и сравните качество и задержку одного pipeline.

  1. 01

    Зафиксируйте формат записи и параметры микрофона.

  2. 02

    Добавьте VAD с pre-roll и временными метками.

  3. 03

    Запишите first-text и final-text latency.

  4. 04

    Разберите ошибки по условиям, а не только по среднему WER.

Критерии готовности

  • Аудиоформат нормализован до inference.
  • Исходные записи и эталонные тексты сохранены.
  • Промежуточный и финальный transcript различаются.
  • Latency и качество измеряются на одном наборе.