lct-02: замер задержки голосового контура, make latency

Замер на машине разработки (Ryzen 7 8845HS, WSL2), не на демо-машине —
там make latency надо прогнать трижды, разброс между прогонами до 20%.

Распознавание — GigaAM v3 RNNT int8: фраза на 2 с за ~285 мс, WER 0%
на 99 словах живой речи Golos. CTC не быстрее ни в одном из двух прогонов
и ошибается чаще: время съедает общий энкодер, поэтому ступень деградации
«RNNT не успевает → CTC» по скорости ничего не даёт.

Синтез — Silero v5: в 10 раз быстрее реального времени, а не в 40, как
заложено в STACK.md; первая фраза 100–250 мс в зависимости от длины.
Частота синтеза на скорость не влияет, без профилирующего компилятора —
на 13% быстрее.

Сквозной бюджет: 600 мс endpointing + ~285 STT + ~150 TTS = ~1 с без LLM.
Цель ≤ 1.5 с держится, только если LLM отдаёт первое предложение быстрее
~465 мс. Вопрос, считается ли филлер «алло?..» первым звуком, записан
в LATENCY.md для людей.

make models качает GigaAM и Silero VAD с Hugging Face. Silero TTS лежит
на российском хосте, недоступном из-под VPN: скрипт не лезет на зеркала
(.pt грузится через pickle — это чужой код) и честно говорит, откуда
скачать вручную.
This commit is contained in:
Ivan Gerasimov 2026-09-17 14:44:02 +03:00
commit dcdec56779
5 changed files with 335 additions and 256 deletions

View file

@ -30,7 +30,7 @@ test: ## Тесты бэкенда
typecheck: ## Проверить фронтенд компилятором
npm --prefix frontend run typecheck
models: ## Скачать модели в backend/models/ (сейчас — эмбеддинги; GigaAM и Silero — lct-02)
models: ## Скачать модели в backend/models/: эмбеддинги, GigaAM, Silero VAD; Silero TTS — вручную
cd backend && $(UV) run python scripts/models.py
seed: ## Залить сценарии из /scenarios в БД
@ -39,6 +39,9 @@ seed: ## Залить сценарии из /scenarios в БД
lesson: ## Запустить занятие и напечатать ссылки: make lesson s=<сценарий> m=<режим>
cd backend && $(UV) run --no-project --with websockets python scripts/start_lesson.py "$(s)" "$(m)"
latency: ## Замер задержки голосового контура по этапам — запускать на демо-машине
cd backend && $(UV) run --extra voice python scripts/latency.py
migrate: ## Накатить миграции
cd backend && $(UV) run alembic upgrade head
@ -54,4 +57,4 @@ pregen: ## Дерево диалога и WAV первых реплик для
demo: ## Поднять всё в демо-режиме: офлайн, прогретые модели
@echo "не реализовано — карточка tasks/lct-21-demo-readiness.md"; exit 1
.PHONY: help dev down back front types test typecheck lesson migrate revision models seed repl pregen demo
.PHONY: help dev down back front types test typecheck lesson latency migrate revision models seed repl pregen demo