Как мы сделали production ASR для новых языков на 10 часах данных

10 подписчиков

12+
12+

день назад

ПожаловатьсяНарушение авторских прав

10 подписчиков

12+
12+

день назад

ПожаловатьсяНарушение авторских прав
12+
12+

день назад

Спикер: Андрей Кузьменко Выпускник МГТУ им. Н. Э. Баумана, аспирант МИФИ. Преподаватель машинного обучения в МИФИ. Senior ML Engineer, Sber Расскажу, как нам удалось сделать систему распознавания речи на десятках часов размеченных данных. Какие вызовы нас ждали, и как мы смогли их решить. Поделюсь нашими экспериментами, как удачным, так и неудачными. И главное, расскажу рецепт, к которому мы пришли. Рассмотрим: где можно взять данные под свой язык; классическое решение двухэтапного обучения; перенос знаний с моделей родственных языков; обогащение данных за счёт синтетики и псевдосинтетики; как подготовить эффективную модель, которая держит сотни соединений на одном cpu сервере

Название:

Как мы сделали production ASR для новых языков на 10 часах данных

Категория:

Разное