АДАПТАЦІЯ АУДІОСПЕКТРОГРАМНИХ ТРАНСФОРМЕРІВ ДЛЯ ВИЗНАЧЕННЯ ЧАСТОТИ ДИХАННЯ

Автор(и)

  • Д. А. Ткаченко Відкритий міжнародний університет розвитку людини «Україна» https://orcid.org/0000-0003-2804-7305
  • С. П. Одрібець Відкритий міжнародний університет розвитку людини «Україна»

DOI:

https://doi.org/10.36994/2788-5518-2024-01-07-16

Ключові слова:

аудіоспектрограмний трансформер, передавальне навчання, визначення частоти дихання, апное уві сні

Анотація

Ця стаття досліджує застосування аудіоспектрограмних трансформерів (AST) для задачі визначення частоти дихання з аудіозаписів, що є критичним показником під час скринінгу на апное уві сні. Традиційні методи, такі як полісомнографія, що використовуються для діагностики апное уві сні, є ресурсоємними та не широко доступними, що робить автоматизоване визначення частоти дихання цінною альтернативою. Останні досягнення в галузі глибокого навчання, зокрема моделі на основі трансформерів, пропонують перспективні рішення. Це дослідження адаптує попередньо навчену модель AST, первісно розроблену для задач класифікації аудіо, для визначення частоти дихання шляхом додавання механізмів уваги та регресійного шару. Ми донавчаємо модель AST на наборі даних ICBHI 2017 challenge, застосовуючи передавальне навчання для використання стійких представлень ознак, отриманих із великих наборів аудіоданих, таких як AudioSet. Наша методологія включає передискретизацію аудіофайлів, застосування смугових фільтрів та перетворення аудіосигналів у мел-спектрограми. Щоб вирішити проблему обмеженого розміру набору даних ICBHI, ми використовуємо методи нарощення даних, такі як SpecAugment, які вносять варіації у спектрограми для покращення узагальнюваності моделі. Ми пропонуємо два підходи до агрегації: агрегування з механізмом уваги та згорткове агрегування – для ефективного врахування часових залежностей у дихальних звуках. Експериментальні результати демонструють, що наша модель зі згортковим агрегуванням досягає середньої абсолютної похибки (MAE) 0,8320 та середньої відносної похибки (MRE) 12,56% на наборі даних ICBHI, перевершуючи попередню модель на 16,8% за MAE. Ці результати підкреслюють ефективність моделей на основі трансформерів в обробці складних аудіопатернів і висвітлюють потенціал моделей AST для ширшого застосування в аналізі дихальних звуків. Наше дослідження робить внесок у галузь машинного навчання, пропонуючи ефективний метод визначення частоти дихання з використанням моделей на основі трансформерів. Подальші дослідження будуть спрямовані на вдосконалення архітектури моделі та інтеграцію додаткових фізіологічних сигналів для підвищення точності.

Посилання

Rocha, B. M., Filos, D., Mendes, L., Serbes, G., Ulukaya, S., Kahya, Y. P., Jakovljevic, N., Turukalo, T. L., Vogiatzis, I. M., Perantoni, E., Kaimakamis, E., Natsiavas, P., Oliveira, A., Jácome, C., Marques, A., Maglaveras, N., Pedro Paiva, R., Chouvarda, I., & de Carvalho, P. (2019). An open access database for the evaluation of respiratory sound classification algorithms. Physiological measurement, 40(3). https://doi.org/10.1088/1361-6579/ab03ea

Harvill, J., Wani, Y., Alam, M., Ahuja, N., Hasegawa-Johnsor, M., Chestek, D., & Beiser, D. G. (2022). Estimation of Respiratory Rate from Breathing Audio. Annual International Conference of the IEEE Engineering in Medicine and Biology Society, 2022, 4599–4603. https://doi.org/10.1109/EMBC48229.2022.9871897

Gong, Y., Chung, Y., & Glass, J.R. (2021). AST: Audio Spectrogram Transformer. Interspeech. https://doi.org/10.21437/interspeech.2021-698

Bae, S., Kim, J., Cho, W., Baek, H., Son, S., Lee, B.H., Ha, C.W., Tae, K., Kim, S., & Yun, S. (2023). Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification. Interspeech. https://doi.org/10.21437/interspeech.2023-1426

Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2020). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. International Conference on Learning Representations (ICLR). https://doi.org/10.48550/arXiv.2010.11929

Gong, Y., Chung, Y.-A., & Glass, J. (2021). Checkpoint of Audio Spectrogram Transformer (AST) model fine-tuned on AudioSet (0.4593 mAP) [Model checkpoint]. Hugging Face. https://huggingface.co/MIT/ast-finetuned-audioset-10-10-0.4593

Reichert, S., Gass, R., Brandt, C., & Andrès, E. (2008). Analysis of respiratory sounds: state of the art. Clinical medicine. Circulatory, respiratory and pulmonary medicine, 2, 45–58. https://doi.org/10.4137/ccrpm.s530

Park, D.S., Chan, W., Zhang, Y., Chiu, C., Zoph, B., Cubuk, E.D., & Le, Q.V. (2019). SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition. Interspeech. https://doi.org/10.21437/interspeech.2019-2680

Loshchilov, I., Hutter, F. (2017). Decoupled Weight Decay Regularization. International Conference on Learning Representations (ICLR). https://doi.org/10.48550/arXiv.1711.05101

##submission.downloads##

Опубліковано

2024-11-04

Як цитувати

Ткаченко, Д. А., & Одрібець, С. П. (2024). АДАПТАЦІЯ АУДІОСПЕКТРОГРАМНИХ ТРАНСФОРМЕРІВ ДЛЯ ВИЗНАЧЕННЯ ЧАСТОТИ ДИХАННЯ. Інфокомунікаційні та комп’ютерні технології, 1(07), 110-115. https://doi.org/10.36994/2788-5518-2024-01-07-16