Intelligent voice transcription based on iFLYTEK WEBAPI (Интеллектуальная транскрипция голоса на основе платформы iFLYTEK WEBAPI)

Лю, Илэ

Please use this identifier to cite or link to this item: http://earchive.tpu.ru/handle/11683/71805

Title:	Intelligent voice transcription based on iFLYTEK WEBAPI (Интеллектуальная транскрипция голоса на основе платформы iFLYTEK WEBAPI)
Authors:	Лю, Илэ
metadata.dc.contributor.advisor:	Ботыгин, Игорь Александрович
Keywords:	транскрипция голоса; авторегрессионные сквозные модели; генерация нетекстовой речи; неавторегрессионные сквозные модели; распознавание речи; voice transcription; autoregressive and non-autoregressive end-to-end models; non-text speech generation; iFlytek; speech recognition
Issue Date:	2022
Citation:	Лю, Илэ. Intelligent voice transcription based on iFLYTEK WEBAPI (Интеллектуальная транскрипция голоса на основе платформы iFLYTEK WEBAPI) : магистерская диссертация / Лю, Илэ ; Национальный исследовательский Томский политехнический университет (ТПУ), Инженерная школа информационных технологий и робототехники (ИШИТР), Отделение информационных технологий (ОИТ) ; науч. рук. И. А. Ботыгин. — Томск, 2022.
Abstract:	Эта работа посвящена проектированию и разработке полного интеллектуального алгоритма транскрипции речи на основе API iFLYTEK.В дополнение к базовому приложению интеллектуального распознавания речи и преобразования текста мы добавили новую функцию синтеза речи. Используется в различных случаях, когда требуется интеллектуальная транскрипция и слияние речи. В исследовании предложена сквозная модель синтеза речи, на этапе обучения модели обучается авторегрессионная сквозная модель, для повышения качества - неавторегрессивная сквозная модель. вводится для эффективного повышения точности распознавания. This paper is dedicated to designing and developing a total intelligent speech transcription algorithm based on iFLYTEK API, which can realize the basic application of basic intelligent speech recognition and text conversion, and we have added a new function of speech synthesis. Used in a variety of occasions requiring intelligent speech transcription and fusion. In the research, an end-to-end speech synthesis model is proposed. In the model training stage, the autoregressive end-to-end model is trained. In order to improve the quality, a non-autoregressive end-to-end model is introduced to effectively improve the recognition accuracy.
URI:	http://earchive.tpu.ru/handle/11683/71805
Appears in Collections:	Магистерские диссертации

Files in This Item:

File	Description	Size	Format
TPU1369692.pdf		2,53 MB	Adobe PDF	View/Open

Show full item record Google Scholar