МЕТОДИ ПІДВИЩЕННЯ ЯКОСТІ ПЕРЕТВОРЕННЯ МОВИ НА ТЕКСТ В СИСТЕМАХ БІОМЕТРИЧНОЇ АУТЕНТИФІКАЦІЇ
DOI:
https://doi.org/10.36994/2788-5518-2023-01-05-13Ключові слова:
перетворення мови на текст, мовні моделі, моделі прихованого марківського процесу, захист інформації, біометрична аутентифікаціяАнотація
У статті розглянуто методи та алгоритми перетворення мови на текст, сучасні відкриті та комерційні системи для створення систем, а також використання цих технологій у сфері кібербезпеки. Пропонується створити систему перетворення мови на текст високої якості. Проведено аналіз математичних алгоритмів, які використовуються для скорочення коефіцієнта помилок, що дає змогу створювати унікальні голосові відбитки та підвищити захист від підроблення. Описана структура сучасних систем перетворення мови на текст. Внаслідок зміни дата сетів, параметрів прихованих Марківських моделей, якісного словника фонем, використання мовних моделей існує можливість зменшити процент помилок при розпізнаванні мови, також використання системи для багатомовності типу “Суржик”. Розглянуто математичні методи оцінки якості системи перетворення мови на текст(WER), а також різні методи розрахунку, що важливо для їхнього подальшого вдосконалення і оптимізації. Розглянуто структуру сучасних систем, а саме попередня обробка сигналу, витягування ознак, акустичне моделювання, моделювання мови, декодування, пост-обробка. Для кожного з этапів запропоновані вектори дослідження, які можуть зменшити коефіцієнт помилок системи в цілому. Зменшення помилок розпізнавання мови та можливості підробити голос досягається за допомогою різних методів: глибокі нейронні мережі, приховані Марківські моделі, алгоритм Баума-Велша, N-gram моделі, Моделі з увагою, створення якісного словника фонем, датасету, філерів. Технологія перетворення мови в текст може бути використана в системах біометричної аутентифікації для виявлення та аналізу унікальних особливостей голосу користувача. Однак сучасні системи перетворення мови на текст для української, російської та “суржику” потребує вдосконалення, як акустичного, так і мовного блоку. Наукові роботи, які присвячені дослідженню та оптимізації цих систем для біометричної аутентифікації, не повною мірою висвітлюють ці питання. Це стало приводом для подальшого дослідження в цьому напрямку, тому метою цієї роботи є розробка системи розпізнавання мови з мінімальним коефіцієнтом помилок.
Посилання
A.Gaydhani, V.Doma, S.Kendre, L.Bhagwat Виявлення зневажливих та образливих слів у Twitter за допомогою машинного навчання: підхід на основі n-грам та статистичного показника (tf–idf). URL: https://arxiv.org/pdf/1809.08651.pdf
M.Suzuki, N.Itoh, T.Nagano, G.Kurata Удосконалення моделі мови n-грам з використанням тексту, згенерованого з моделі нейронної мови. URL: https://ieeexplore.ieee.org/document/8683481
R.Shadiev, WY.Hwang, NS.Chen, YM.Huang Огляд технології розпізнавання мовлення в текст для покращення навчання.URL: https://www.researchgate.net/publication/267811277_Review_of_Speech-to-Text_Recognition_Technology_for_Enhancing_Learning
DA.Jones, F.Wolf, E.Gibson, E.Williams, E.Fedorenko Вимірювання читабельності автоматичних розшифровок мовлення в текст. URL: https://www.researchgate.net/publication/221489176_Measuring_the_readability_of_automatic_speech-to-text_transcripts
BH.Juang, LR.Rabiner Приховані марковські моделі для розпізнавання мовлення. URL: https://www.jstor.org/stable/1268779
J.Picone - журнал IEEE Assp Безперервне розпізнавання мови з використанням прихованих марковських моделей. URL: https://ieeexplore.ieee.org/document/54527
Підходи до глибокого навчання в системі синтезу мовлення: систематичний огляд і перспектива останніх досліджень. URL: https://www.researchgate.net/publication/363982582_A_deep_learning_approaches_in_text-tospeech_system_a_systematic_review_and_recent_research_perspective
Y.Kumar, A.Koul, C.Singh - Мультимедійні засоби та програми, 2023 – Springer. URL: https://link.springer.com/article/10.1007/s11042-022-13943-4
Джерела та документи Sphinx. URL: https://www.sphinx-doc.org/en/master/
Lawrence Rabiner , Biing-Hwang Juang Основи розпізанавання мови. URL: https://www.academia.edu/4924307/Fundamental_of_Speech_Recognition_Lawrence_Rabiner_Biing_Hwang_Juang_

