lct-06: голосовой контур VAD → STT → звонящий → TTS, с перебиванием

Контур замкнут без LLM: звонящий отвечает заготовками через слот-автомат.
Живой диалог через WebSocket прошёл 5 раз подряд без сбоев: первая
реплика после снятия трубки — 87–154 мс, ход — 1.2–1.4 с, перебивание —
88–90 мс. На LLM до цели 1.5 с остаётся 100–300 мс.

Задача ответа живёт, пока у курсанта доигрывает звук: перебивание —
это отмена одной задачи, и tts.end приходит, когда звонящий
действительно замолчал.

Что нашлось при сборке:
- Silero молча выбрасывает цифры: «улица Ленина, дом… квартира…» без
  номеров. Числа и сокращения разворачиваются в слова до синтеза.
- onnxruntime брал все 16 ядер и вытеснял синтез, первый вызов был
  холодным: распознавание 576 мс вместо ~210. Прогрев на старте и по
  4 потока на модель.
- Весь адрес одним предложением — ~455 мс синтеза до первого звука.
  Длинное предложение режется по запятым, номер от улицы не отрывается:
  ~250 мс.
- Первая реплика «Алло! Помогите!» запускалась мимо задачи ответа и не
  перебивалась вовсе.

Отдельно: сломал make dev — num2words попал в pyproject, а Dockerfile
ставил зависимости ручным списком, и бэкенд в контейнере упал на
импорте. Образ теперь ставит зависимости из pyproject.toml.

Голоса в контейнере нет: под WSL модели работают нативно, make back.
This commit is contained in:
Ivan Gerasimov 2026-09-17 15:04:17 +03:00
commit 456f3cd34d
18 changed files with 933 additions and 15 deletions

View file

@ -15,8 +15,8 @@ dev: ## Поднять стенд: postgres + backend --reload + frontend
down: ## Погасить стенд
$(COMPOSE) down
back: ## Только бэкенд, локально, без докера
cd backend && $(UV) run uvicorn app.main:app --reload --port 8000
back: ## Бэкенд нативно, с голосовым контуром (порт 8000: сначала docker compose stop backend)
cd backend && $(UV) run --extra voice uvicorn app.main:app --reload --port 8000 --workers 1
front: ## Только фронтенд, локально
npm --prefix frontend install && npm --prefix frontend run dev
@ -24,9 +24,12 @@ front: ## Только фронтенд, локально
types: ## domain/events.py → frontend/src/shared/types/generated.ts
cd backend && $(UV) run --no-project --with 'pydantic>=2.7' python scripts/export_types.py
test: ## Тесты бэкенда
test: ## Тесты бэкенда (голосовой контур пропускается)
cd backend && $(UV) run --extra dev pytest -q
test-voice: ## Тест голосового контура на настоящих моделях: задержка и перебивание
cd backend && $(UV) run --extra dev --extra voice pytest tests/test_voice_pipeline.py -q -s
typecheck: ## Проверить фронтенд компилятором
npm --prefix frontend run typecheck
@ -57,4 +60,4 @@ pregen: ## Дерево диалога и WAV первых реплик для
demo: ## Поднять всё в демо-режиме: офлайн, прогретые модели
@echo "не реализовано — карточка tasks/lct-21-demo-readiness.md"; exit 1
.PHONY: help dev down back front types test typecheck lesson latency migrate revision models seed repl pregen demo
.PHONY: help dev down back front types test test-voice typecheck lesson latency migrate revision models seed repl pregen demo