R.06 / Research

Real-time Digital Humans

Pipeline аудио -> STT -> LLM -> TTS -> lip-sync для интерактивных интерфейсов.

VoiceAvatarReal-time
Research questionКак удержать естественный диалог при жёстком бюджете end-to-end latency?
01 / Гипотеза

Потоковая передача и корректное прерывание важнее максимального качества каждого отдельного этапа.

02 / Метод

Измерять STT, TTFT модели, первый аудиофрейм TTS, lip-sync и end-to-end latency раздельно, затем оптимизировать критический путь.

Среда
Streaming STT · LLM · TTS · lip-sync · browser playback

03 / Результат

Сформирован end-to-end pipeline и матрица измерений; публичные production-цифры пока не заявлены.

Следующий эксперимент

Измерить задержку каждого этапа и качество прерываний.

Статус и вывод будут обновлены только после повторяемой проверки.

Все исследования