None
RU
PVAD: как научить ИИ слышать нужного человека в шумной комнате
[]
Все публикации подряд на Хабре
Над этим мы с коллегами работали в проекте PVAD (Personal Voice Activity Detection) — технологии для определения того, когда в общем аудиопотоке говорит конкретный человек.
По сути, нужно было решить классическую задачу: в общем аудиопотоке определить и выделить голос одного конкретного человека среди других голосов и шума.
В качестве основы использовали Demucs, дополнив модель эмбеддингами голоса целевого спикера.
В ряде экспериментов мы дополнительно делали предобработку, конвертацию и аугментацию данных, а обучение могло идти по нескольку дней на нескольких машинах одновременно.
Это был не один «счастливый запуск», а длинная серия проверок гипотез: от архитектуры до настроек обучения и подготовки данных.