Изследване на разпознаването на аудио въз основа на дълбоката невронна мрежа в преподаването на музика
Oct 10, 2023
Солфежът е важен основен курс за музикални специалности, а обучението по аудио разпознаване е една от важните връзки. С подобряването на производителността на компютъра, аудио разпознаването се използва широко в интелигентните носими устройства. През последните години развитието на дълбокото обучение ускори процеса на изследване на аудио разпознаването. Въпреки това има много звукови смущения в среда за преподаване на музика, което води до представянето на аудио класа... ъ-ъ, което не може да отговори на действителното търсене. За да се реши този проблем, се предлага подобрена система за аудио разпознаване, базирана на YOLO-v4, която основно подобрява мрежовата структура.
Обучението за пеене и слух е неотделимо от паметта. В процеса на изучаване на музика, пеенето и тренирането на слуха е много важно умение. Целта на обучението по пеене на ухо е да позволи на учениците да практикуват своите музикални умения и памет, като слушат и пеят определени ноти.
Основното съдържание на обучението за пеене на ухо включва височина, ритъм, глас, мелодия, хармония и т.н. Чрез обучението на ухо за пеене ние можем непрекъснато да упражняваме ушите си, което ни позволява по-точно да идентифицираме различни ноти и ритми и бързо да преобразуваме нотите, които чуваме в символи в музикалната карта, като по този начин подобряваме способността си да помним.
Обучението за пеене и слух също може да ни помогне да разберем и овладеем по-добре законите на музиката. Когато използваме ушите си, за да усещаме и разбираме музика директно, можем да разберем ритъма и мелодията на музиката по-дълбоко, като по този начин подобряваме способността си за памет по-бързо.
В допълнение, обучението за пеене и слух също може да ни помогне да развием добро чувство за музика и силни музикални емоции. Чрез обучение нашето разбиране и чувства към музиката ще стават все по-задълбочени, като по този начин ще се подобри нашата любов и признателност към музиката.
Паметта е много важен фактор в процеса на изучаване на музика. Добрата памет е едно от необходимите условия за изучаване на всеки инструмент и композиране на музика. Чрез пеене и обучение на слуха можем да подобрим паметта си и да овладеем по-добре музикални техники и умения. Когато сме изправени пред сложен репертоар, можем да запомним ноти и ритми по-бързо, което ни помага да изпълняваме по-добре музикални произведения.
Накратко, обучението на ухото за пеене и паметта са неразделни и двете се допълват взаимно. Чрез непрекъснато обучение за пеене и трениране на слуха можем да подобрим нашите музикални умения и памет, за да овладеем по-добре музиката. Вижда се, че трябва да подобрим паметта и Cistanche deserticola може значително да подобри паметта, тъй като Cistanche deserticola е традиционен китайски лекарствен материал, който има много уникални ефекти, един от които е да подобрява паметта. Ефикасността на мляното месо идва от различните активни съставки, които съдържа, включително киселина, полизахариди, флавоноиди и др. Тези съставки могат да насърчат здравето на мозъка по различни начини.

Щракнете върху познайте начините за подобряване на мозъчната функция
Първо, числото на честотния кепструм на Мел се използва за обработка на оригиналното аудио и извличане на съответните характеристики. bg, опитайте се да приложите модела YOLO-v4 в ...областта на дълбокото обучение в ...областта на аудио разпознаването и го подобрете, като го комбинирате с модула за пространствена пирамида, за да подсилите способността за обобщаване на данни в различни аудио формати. Второ, методът на подреждане в ансамбълното обучение се използва за сливане на независимите подмодели на два различни канала. Експерименталните резултати показват, че в сравнение с други технологии за дълбоко обучение, подобреният модел YOLO-v4 може да подобри производителността на аудио разпознаването и има по-добра производителност при обработката на данни от различни аудио формати, което показва по-добра способност за обобщение.
1. Въведение
Музиката е форма на абстрактно изкуство със звук като средство за изразяване. В процеса на обучение по музика, солфежът може да засили способността на музикалната памет на учениците, да даде възможност на учениците да идентифицират точно музикални произведения и по този начин да получат по-добро "музикално възприятие". Като важна връзка в солфежа, обучението по аудио разпознаване е много трудно за младши ученици. е, защото учениците трябва да овладеят всички видове ключове, да различават дължината и продължителността, представени от различни ноти, и разликата във височината между различните ноти.
Анализът на аудио сигнала, базиран на вградени интелигентни устройства, привлича все повече внимание на изследователите [1–7]. Интелигентните носими устройства с функции за аудио разпознаване могат да помогнат на учениците да разрешат горните проблеми и да осъществят помощ при преподаване на музика. Задачата за аудио разпознаване трябва предварително да обработи събраните аудио сигнали...почивка, извлича ценни характеристики за разграничаване на музикални партитури от тях и...накрая да ги класифицира според тези характеристики. Класификацията е много важен метод за извличане на данни [8–10]. Класификацията се отнася до генериране на класическа ... катионна функция според определени правила, базирани на данни от обучаващ набор. тази функция може да съпостави данните от тестовия набор към една от дадените категории, като по този начин реализира прогнозирането на категорията на неизвестни данни. Понастоящем обичайните класически…ери включват дървета на решенията, логистична регресия, опорна векторна машина (SVM), Naive Bayes, алгоритъм на k-най-близкия съсед (KNN), BP невронна мрежа и дълбоко обучение [11–13].
Предишните методи за машинно обучение често трябва ръчно да извличат характеристиките, които могат да представят оригиналните данни като вход на класа.... Задълбоченото обучение обаче може автоматично да извлече високоразмерните характеристики на пробите (без ръчно извличане на характеристики), стига входните данни да покриват възможно най-много информацията на оригиналните данни, което е подходящо за широкомащабни данни. * Методът за дълбоко обучение може да реализира специфични задачи за аудио разпознаване с помощта на голямо количество аудио данни, събрани от интелигентни устройства. *e конволюционната невронна мрежа (CNN), като вид архитектура за дълбоко обучение, се използва широко в класификацията на изображения, разпознаването на реч, обработката на естествения език и други области поради превъзходното си представяне при обучение на локални функции [14]. За разлика от други модели на невронни мрежи (като машината на Болцман и повтаряща се невронна мрежа), CNN се характеризира с това, че основната операция е операция на навиване. *e YOLO мрежата извлича поуки от структурата на класификационната мрежа на CNN и показва добри предимства в областта на разпознаването на изображения, което привлече вниманието на много изследователи.
*Следователно това проучване се опитва да приложи модела YOLO-v4 в областта на аудио разпознаването и подобрява неговата мрежова структура. В допълнение, методът на подреждане в ансамбълното обучение се използва за сливане на два независими подмодела от различни канали и ефективността на класификацията на слятата система е допълнително подобрена в сравнение с единичния подмодел.
2. Свързани произведения
В днешно време, с появата на голям брой интелигентни устройства, отличната компютърна производителност и развитието на технологията за задълбочено обучение съвместно насърчават изследователския процес в областта на аудиото. В комбинация с основното изследователско съдържание на това изследване, текущият статус на изследването ще бъде представен от два аспекта: конволюционна невронна мрежа и аудио разпознаване.
*Структурата на конволюционната невронна мрежа произлиза от изследване на Yann LeCun през 1998 г., наречено Le Net-5 изкуствена невронна мрежа. *e конволюционната невронна мрежа, подобно на други невронни мрежи, може да бъде обучена чрез алгоритъма за обратно разпространение [15]. През 2012 г. Алекс Крижевски и други приеха технологията на CNN за първи път в сложни задачи за компютърно зрение. Чрез използване на 3 напълно свързани слоя, 5 слоя на навиване и класификатор Softmax се изгражда конволюционна невронна мрежа с 8 слоя, която се нарича AlexNet. AlexNet използва функцията за активиране на ReLU и в същото време също така използва регулиране (отпадане), за да предотврати прекомерното оборудване. През 2014 г. екипът за компютърно зрение на Google представи мрежата GoogLeNet [16] с дълбочина на мрежата от 22 слоя, която съдържа нова структура, инцидент. Той интегрира характеристиките на различни дълбочини и еднакъв мащаб и точността на откриване е подобрена. Въз основа на мрежата GoogLeNet се появиха алгоритми YOLO и SSD. И двата метода се основават на една мрежа от край до край, която може да завърши входа от оригиналното изображение до изхода на позицията и категорията на обекта.
В аспекта на аудио разпознаването Янг и Джао [17] предложиха метод за класифициране на акустични сцени, базиран на опорната векторна машина (SVM), която подобри звуковата текстура, за да подобри точността на класификацията. Греко и др. [18] предлага система за гласово разпознаване, базирана на евристичния метод на дълбоко обучение. Демир и др. [19] предложи нов пирамидален каскаден CNN метод за класификация на звука в околната среда. Zhu и др. [20] предложи подобрен алгоритъм YOLO-v4 за инструменти за звуково изображение, което ефективно подобри точността на откриването на изображението на акустичен фазов облак. *Всички горепосочени методи показват отлична производителност при справяне със задачи за аудио разпознаване в една акустична сцена, но има много звукови смущения в средата за преподаване на музика и е необходимо да се работи с различни данни от аудио формат.
*Следователно това проучване предлага система за аудио разпознаване, базирана на подобрения мрежов модел YOLO-v4. *Основните иновации и приноси включват следното: (1) опитайте се да приложите мрежовата архитектура YOLO-v4, която е отлична в областта на дълбокото обучение, в областта на аудио разпознаването и я подобрете чрез комбиниране на модула за пространствена пирамида. *e подобрената мрежова архитектура YOLO-v4 ефективно използва пространствената информация в аудио файловете, като по този начин засилва способността за обобщаване на данни в различни аудио формати. (2) Методът на *e подреждане в ансамбълното обучение се използва за сливане на два независими подмодела на различни канали и ефективността на класификацията на слятата система е подобрена.
3. Извличане и обработка на аудио функции
Извличането на най-доброто параметрично представяне на аудио сигнала е една от важните задачи за постигане на по-добро разпознаване. *e Извличането на характеристики в този етап е много важно за класификацията на класификатора в следващия етап, тъй като ще повлияе пряко на ефективността на класификацията.
В задачата за класификация, особено задачата за аудио класификация, честотният кепструмен коефициент на Mel (MFCC), който описва спектралната форма, има дълга история. Въпреки че процесът на извличане на MFCC ще доведе до компресиране на данни със загуба, неговият ефект на класифициране и разпознаване е доста достъпен дори когато скоростта на данни е много ниска. Освен това, в сравнение с други класификационни характеристики, MFCC се използва широко, тъй като е в по-голямо съответствие с кривата на слуховата честотна характеристика на човешките уши.

*Причината, поради която хората могат да преценяват различни среди в сложни звукови среди, се крие в заслугата на кохлеята. *e cochlea може да се разглежда като филтърна банка, която помага на хората да филтрират 20-20 kHz аудио. *Проблемът е, че чувствителността на кохлеята към честотите в слуховия диапазон не е линейна, а има зависимост от картографиране. MFCC може да симулира честотната характеристика на човешкото ухо. Извличането на характеристики на MFCC се състои от седем стъпки и целият процес е показан на фигура 1.
Обичайните аудио сигнали имат феномена, че нискочестотната енергия е голяма, но високочестотната енергия е малка. Ако се предава директно, това ще доведе до високо съотношение сигнал/шум при ниски честоти и недостатъчно съотношение сигнал/шум при високи честоти. За да се компенсира тази загуба на аудио сигнал по време на предаване, се въвежда предварително подчертаване, за да се компенсира входният сигнал, така че високочестотните характеристики на аудио сигнала да могат да бъдат подчертани. Предварителното подчертаване обикновено се постига с помощта на високочестотен филтър [21–23].

Рамкирането разделя аудио проби, получени от аналогово-цифрово преобразуване (ADC) на малки кадри с дължина в диапазона 20–40 милисекунди. След завършване на предварително подчертаване и рамкиране е необходимо да добавите прозорец на Hamming към всеки кадър. Прозорецът е за контролиране на обема на обработка на данни и само данните в прозореца се обработват наведнъж. *e честотният диапазон в спектъра на бързото преобразуване на Фурие е много широк, което води до това, че речевият сигнал не следва линейната скала [24–26]. *поради това е необходимо да се премине филтърната банка Mel мащаб, както е показано на фигура 2.
Фигура 2 показва набор от триъгълни филтри, които се използват за изчисляване на претеглената сума на спектралните компоненти на филтрите, така че обработеният изход да се доближава до скалата на Mel. * амплитудно-честотната характеристика на всеки филтър е триъгълна. *e Mel спектърът на дадена честота f се изчислява, както следва:

13 диференциални характеристики от първи ред представляват промените между кадрите на кепструма в характеристиките на MFCC, докато 39 диференциални характеристики от втори ред представляват промените между кадрите в диференциалните характеристики от първи ред. *разликата от първи ред се изчислява, както следва:

4. Мрежова структура SPP-YOLO-v4
4.1. Модул за пространствена пирамида (SPP). SPP може да избегне изкривяването на информацията, причинено от мащабиране, разтягане, изрязване и други операции и да осигури изход, който не се влияе от размера на входа, което не може да бъде постигнато чрез технологията за обединяване на плъзгащи се прозорци [27]. Второ, SPP може да обединява с множество мащаби, докато обединяването на плъзгащи се прозорци използва само един мащаб на прозореца. *Основната структура на SPP модула е показана на Фигура 3. Може да се види, че тъй като входният размер е гъвкав, SPP може да комбинира характеристиките на данните в различни аудио формати. *измерението на трансформирания вектор на характеристиките е същото като това на напълно свързания слой, като същевременно облекчава проблема с обобщението.
4.2. SPP-YOLO-v4. YOLO-v4 е високопрецизен алгоритъм за едноетапно откриване в реално време, интегриращ YOLO-v1, YOLO-v2 и YOLO-v3. YOLO-v4 конструира CSP междуетапна частична мрежа (CSPNet) в остатъчния модул, в който функционалният слой е входът, а характеристиката на по-високия слой е изходът. *показва, че учебните цели на YOLO-v4 в модула ResNet са различни между изхода и входа. *Поради това се реализира остатъчно обучение и параметрите на модела са намалени, така че способността за обучение на функции е подобрена. Като се има предвид средата на приложение на музикалното обучение, някои промени се правят въз основа на оригиналната мрежа и окончателната структура на мрежата е показана на фигура 4.
Първо, слоят на характеристиките се навива три пъти, а след това, слоят на характеристиките на входа се обединява максимално чрез използване на максималните обединени ядра с различни размери. След конволюция и повишаване на дискретизацията, различните слоеве на характеристиките се свързват последователно, за да се реализира сливането на функции. *en, извършете намаляване на дискретизацията, компресирайте височината и ширината и накрая подредете с предишния слой с функции, за да реализирате повече сливане на функции (5 пъти). *Модулът за класификация използва функциите, извлечени от мрежата, за да направи класификационни преценки. Вземете за пример мрежата 13 × 13, която е равна на разделянето на входната Mel спектрограма на 13 × 13 квадратчета; след това всеки квадрат ще бъде предварително зададен с три предишни кадъра. *Резултатите от класификацията на мрежата ще коригират позициите на тези три предишни кутии и накрая ще филтрират чрез алгоритъма за немаксимално потискане (NMS) [28], за да получат окончателните резултати от класификацията.

5. Система за аудио разпознаване, базирана на SPPYOLO-v4
5.1. Системна Архитектура. Както е показано на фигура 5, след въвеждане на аудио, предложената система за аудио разпознаване първо разделя данните за аудио последователността на две части. *Първата част идва от стерео канала, докато втората част е компресирана в моно. *e аудио сигналите на двата канала се извличат от MFCC спектрограма и се въвеждат в модела SPP-YOLO-v4 като характеристики. *bg, две групи модели SPP-YOLO-v4 са интегрирани и методът на подреждане е възприет в интеграцията. След интегрираното обучение на двата модела, резултатите от аудио класификацията най-накрая се извеждат. *e подробности за модела SPP-YOLO-v4 са показани на фигура 4.
5.2. Подреждане на интегрирано обучение. Както е показано на Фигура 5, системата използва технология за ансамбълно обучение, за да получи окончателния резултат от класификацията. *Основната идея на ансамбълното обучение е да се формира силен класификатор чрез комбинация от няколко слаби класификатора. Дори ако някои слаби класификатори правят грешни прогнози, те могат да бъдат коригирани от други слаби класификатори с правилни прогнози, като по този начин се постига ефектът от подобряване на производителността на системата.
Ако приемем, че x е вход, mi (i � 1, 2, . . . , k) е група от класификатори и изходът на класификаторите е вероятностното разпределение mi (x, cj) на всеки клас cj (i � 1, 2, . . ., k), крайният изход y(x) на интегрирания класификатор може да бъде изразен като


цел за класификация. Понастоящем популярните алгоритми за обучение на ансамбъл включват подреждане, пакетиране, усилване, избор на ансамбъл и т.н. *Алгоритъмът за обучение на ансамбъл, избран в това проучване, е методът на подреждане.
Подреждането е процес на обучение от втори ред с изход от процеса на обучение от първи ред като вход, известен също като „метаобучение“. * Методът на подреждане се превърна в популярен метод за обучение в ансамбъл, не само защото прилагането му е доста просто, но и защото може значително да подобри способността за обобщение на системата, което е много съвместимо с целта на това изследване. *Основният принцип на метода на подреждане е показан на фигура 6.
6. Експеримент и анализ на резултатите
6.1. Експериментална среда и набор от данни. *Хардуерната платформа на това проучване е Intel Core i3-M350 CPU@ Dualcore 2,20 GHz, 8 GB DDR2 памет, Nvidia RTX2080Ti GPU и 11 GB видео памет. *e Интегрираният инструмент за разработка PyCharm е разработен на езика Python 3.5.0. *e Рамката за анотации на YOLO, написана на Python, се използва за преобразуване на числовия формат, така че да може да се чете от YOLO. * Методите за сравнение са моделът на сместа на Гаус (GMM), CNN и R-CNN.

*E експериментален набор от данни е записани аудио файлове в реална учебна среда. *e наборът от данни се състои от аудио типове с четири различни етикета (D1, D2, D3 и D4). Всички аудио файлове се нарязват на 30-секундни клипове. *Има 12 аудио файлови формата, включително MPEG, MP3 и WMA. Всеки запис се извършва на различно място, а средната продължителност на записа е 3–5 минути. *e записващото оборудване включва двуканален Soundman OKM II Classic/studio A3 микрофон за поставяне в ухото и записващо устройство с форма на вълна Roland Edirol R09 с честота на дискретизация 44,1 kHz и 24-битова резолюция.
*Използваният набор от данни съдържа 1404 аудио файла, а броят на аудио файловете от всеки тип е 351. Около 70% от данните се използват за обучение на модела за аудио разпознаване, а останалите 30% се използват за тестване. *системните настройки са дадени в таблица 1.


6.3. Проверка на производителността на SPP-YOLO-v4. За да се провери промоционалният ефект на предложения подобрен YOLO-v4 (SPP-YOLO-v4) върху способността за обобщение, той се сравнява с традиционния модел YOLO-v4. В експеримента бяха избрани 3 от 12 аудио файлови формата: MPEG, MP3 и WMA. *Способността за обобщаване на SPP-YOLOv4 е дадена в таблица 2.
От таблица 2 може да се установи, че общата точност на SPP-YOLO-v4 е по-висока от тази на традиционния YOLO-v4, което потвърждава неговата способност за обобщаване за данни в различни аудио формати. * е така, защото в сравнение с оригиналния метод, SPP на SPP-YOLO-v4 съдържа повече слоеве, но също така увеличава времето за обработка.
6.4. Сравнение на резултатите от теста. Таблица 3 предоставя резултатите от загуба на тренировка, mAP и т.н. за всички категории след 8000 кръга тренировка. Може да се види, че моделът на обучение на предложения метод може ефективно да идентифицира типове аудио. Той има определени предимства по отношение на точността, степента на припомняне и F1 резултат, а стойността му на загуба също е най-ниската от всички методи, само 0,0122. *Следователно стабилността и точността на предложения метод са по-добри. * се дължи главно на високата разделителна способност и възприемчивото поле (RF) на SPP-YOLO-v4, а добавянето на SPP модул в свързващия слой запазва предимствата, донесени от SPP. По отношение на времето за обучение, SPP-YOLO-v4 е само малко повече от GMM. *e CNN трябва да обучи много операции за навиване, така че времето за обучение е по-дълго.

И накрая, експериментът използва данни от 12 различни аудио формата, за да тества и сравни четирите метода. Таблица 4 предоставя стойностите на точността на изпитването и времето за изпитване. Може да се види, че средната точност на метода, предложен в това проучване, е 99.0%, а средното време за откриване е 0.449s. *Следователно предложеният метод постига по-добра производителност сред четирите сравнени метода. Може да се заключи, че увеличаването на дискретизацията и максималното обединяване на SPP-YOLO-v4 донесе значителни ползи. Максималното обединяване избира максималната стойност от съседни области, за да изтрие малко шум от максимална честота в аудио последователността. *Следователно, конволюционното вземане на проби може да се управлява по-добре в следващия слой за вземане на проби. *приблизително тези предимства, SPP може да подобри производителността на опорната мрежа.

7. Изводи
*това проучване представя система за аудио разпознаване, подходяща за среда за обучение по музика. Използвайте SPP, за да подобрите мрежовата архитектура YOLO-v4, тоест използвайте SPP, за да изберете локални области в различни мащаби на един и същ слой на навиване, за да научите характеристиките на многомащабната система. В допълнение, методът на подреждане в ансамбълното обучение се използва за сливане на независими подмодели на два различни канала. *Експерименталните резултати показват, че предложеният метод може да подобри точността на разпознаване на аудио типове и има по-добра производителност за различни аудио файлови формати. Поради ограничението на условията за аудиозапис, има малко аудио типове в експерименталния набор от данни и ефективността на класификацията на аудиофайлове, записани от различни устройства, все още не е проверена. В бъдеще ще бъдат проведени още тестове по тези два проблема.
Наличност на данни
* Данните, използвани в подкрепа на констатациите от това проучване, са достъпни от съответния автор при поискване.
Конфликт на интереси
*Авторите декларират, че нямат конфликт на интереси.
Препратки
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li и M. Zhou, „Невронен машинен превод от зависимост към зависимост“, IEEE/ACM Transactions on Audio, Speech, and Language Обработка, кн. 26, бр. 11, стр. 2132–2141, 2018 г.
[2] J. Zou, W. Li, C. Chen и Q. Du, „Класификация на сцени с използване на локални и глобални характеристики със сливане на съвместно представяне“, Information Sciences, vol. 348, бр. 2, стр. 209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur и A. Mertins, „Подобрена класификация на аудио сцени, базирана на вграждане на дърво на етикети и конволюционни невронни мрежи“, IEEE/ACM Transactions on Обработка на аудио, реч и език, том. 25, бр. 6, стр. 1278–1290, 2017 г.
[4] S. Bayatli, „Неконтролирано претегляне на правилата за трансфер в базиран на правила машинен превод, използващ подход на максимална ентропия,“ Journal of Information Science and Engineering, vol. 36, бр. 2, стр. 309–322, 2020 г.
[5] A. Rakotomamonji, „Учене с контролирано представяне за класификация на аудио сцени“, IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, бр. 6, стр. 1253–1265, 2017 г.
[6] W. Yang и S. Krishnan, „Комбиниране на времеви характеристики чрез локален двоичен модел за класификация на акустична сцена,“ IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, бр. 6, стр. 1315–1321, 2017 г.
[7] AS Dhanjal и W. Singh, „Система за автоматичен машинен превод за многоезична реч на индийски жестомимичен език,“ Мултимедийни инструменти и приложения, том. 81, бр. 3, стр. 4283–4321, 2021 г.
[8] MA . Alamir, „Нов модел за класификация на акустични сцени, използващ късното сливане на конволюционни невронни мрежи и различни класификатори на ансамбъл“, Applied Acoustics, vol. 172, бр. 3, стр. 112–122, 2020 г.
[9] JG Makin, DA Moses и EF Chang, „Машинен превод на кортикална активност към текст с рамка за енкодер–декодер“, Nature Neuroscience, vol. 23, бр. 4, стр. 575–582, 2020 г.
[10] S. Waldekar и G. Saha, „Двустепенна класификация на акустични сцени, базирана на синтез“, Applied Acoustics, vol. 170, бр. 5, номер на статия 107502, 2020 г.
For more information:1950477648nn@gmail.com






