Please use this identifier to cite or link to this item:
http://earchive.tpu.ru/handle/11683/71805
Title: | Intelligent voice transcription based on iFLYTEK WEBAPI (Интеллектуальная транскрипция голоса на основе платформы iFLYTEK WEBAPI) |
Authors: | Лю, Илэ |
metadata.dc.contributor.advisor: | Ботыгин, Игорь Александрович |
Keywords: | транскрипция голоса; авторегрессионные сквозные модели; генерация нетекстовой речи; неавторегрессионные сквозные модели; распознавание речи; voice transcription; autoregressive and non-autoregressive end-to-end models; non-text speech generation; iFlytek; speech recognition |
Issue Date: | 2022 |
Citation: | Лю, Илэ. Intelligent voice transcription based on iFLYTEK WEBAPI (Интеллектуальная транскрипция голоса на основе платформы iFLYTEK WEBAPI) : магистерская диссертация / Лю, Илэ ; Национальный исследовательский Томский политехнический университет (ТПУ), Инженерная школа информационных технологий и робототехники (ИШИТР), Отделение информационных технологий (ОИТ) ; науч. рук. И. А. Ботыгин. — Томск, 2022. |
Abstract: | Эта работа посвящена проектированию и разработке полного интеллектуального алгоритма транскрипции речи на основе API iFLYTEK.В дополнение к базовому приложению интеллектуального распознавания речи и преобразования текста мы добавили новую функцию синтеза речи. Используется в различных случаях, когда требуется интеллектуальная транскрипция и слияние речи. В исследовании предложена сквозная модель синтеза речи, на этапе обучения модели обучается авторегрессионная сквозная модель, для повышения качества - неавторегрессивная сквозная модель. вводится для эффективного повышения точности распознавания. This paper is dedicated to designing and developing a total intelligent speech transcription algorithm based on iFLYTEK API, which can realize the basic application of basic intelligent speech recognition and text conversion, and we have added a new function of speech synthesis. Used in a variety of occasions requiring intelligent speech transcription and fusion. In the research, an end-to-end speech synthesis model is proposed. In the model training stage, the autoregressive end-to-end model is trained. In order to improve the quality, a non-autoregressive end-to-end model is introduced to effectively improve the recognition accuracy. |
URI: | http://earchive.tpu.ru/handle/11683/71805 |
Appears in Collections: | Магистерские диссертации |
Files in This Item:
File | Description | Size | Format | |
---|---|---|---|---|
TPU1369692.pdf | 2,53 MB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.