Материалы / 13 минут
Построить устойчивый speech-input и измерить полный путь от микрофона до подтверждённого текста.
Сначала определите аудиоконтракт
Приведите вход к ожидаемой частоте дискретизации, числу каналов и диапазону амплитуды. Сохраняйте исходный фрагмент для воспроизводимого анализа ошибок.
Микрофон, браузер и системный capture могут добавлять автоматическое усиление и шумоподавление. Эти параметры являются частью эксперимента.
Сегментация влияет на задержку и смысл
VAD уменьшает пустые вычисления, но агрессивная граница обрезает начало и конец слова. Добавляйте небольшой pre-roll и объединяйте короткие паузы.
Для длинной речи используйте перекрывающиеся окна и сохраняйте временные метки. Интерфейс должен отличать промежуточный текст от подтверждённого.
Оценивайте продуктовый контур
WER полезен для фиксированного набора, но пользователю также важны время до первого текста, финальная задержка и исправление имён или терминов.
Соберите отдельные группы: тихая комната, шум, дальний микрофон, разные темпы и языки. Средняя цифра не должна скрывать провал одной группы.
{
"audio_id": "sample-014",
"model": "whisper-small",
"first_text_ms": 420,
"final_text_ms": 1380,
"reference": "...",
"transcript": "..."
}