Над этим мы с коллегами работали в проекте PVAD (Personal Voice Activity Detection) — технологии для определения того, когда в общем аудиопотоке говорит конкретный человек. По сути, нужно было решить классическую задачу: в общем аудиопотоке определить и выделить голос одного конкретного человека среди других голосов и шума. В качестве основы использовали Demucs, дополнив модель эмбеддингами голоса целевого спикера. В ряде экспериментов мы дополнительно делали предобработку, конвертацию и аугментацию данных, а обучение могло идти по нескольку дней на нескольких машинах одновременно. Это был не один «счастливый запуск», а длинная серия проверок гипотез: от архитектуры до настроек обучения и подготовки данных.