Разпознаване на гласна реч от електроенцефалография на плъх с помощта на невронна мрежа с дълга краткосрочна памет Част 1

Dec 27, 2023

Резюме

През годините са проведени значителни изследвания за изследване на механизмите за възприемане и разпознаване на речта.

Съществува неразривна връзка между речта и паметта. Възприемането на речта е важна способност, за да сме наясно с аудио сигналите, а паметта е важен начин, който използваме за съхраняване и извличане на информация. Когато сме по-способни да възприемаме речта, ние също сме по-способни да запомним информацията, която чуваме.

Изследванията показват, че връзката между възприемането на речта и паметта е двупосочна. От една страна, лошото възприятие на речта може да доведе до увреждане на паметта. Това е така, защото когато не чуваме ясно речта, не можем да си спомним точно информацията, която сме чули. От друга страна, силното възприятие на речта може да подобри паметта ни. Когато можем правилно да възприемаме и разбираме речта, ние също можем да запомним това, което чуваме по-лесно.

Следователно трябва да се съсредоточим върху култивирането на уменията си за възприемане на речта, за да подобрим паметта си. Това може да се постигне чрез трениране на нашите умения за слушане и разбиране на речта. Можем да подобрим възприемането на речта и паметта си с дейности като слушане на записи, гледане на филми и посещаване на езикови курсове.

Накратко, има тясна връзка между възприемането на речта и паметта и трябва да се съсредоточим върху култивирането на нашите умения за възприемане на реч, за да подобрим паметта си. Чрез активно обучение и практика можем непрекъснато да подобряваме нивото си на възприятие на речта и да разбираме и запомняме по-добре това, което чуваме. Вижда се, че трябва да подобрим паметта и Cistanche deserticola може значително да подобри паметта, тъй като Cistanche deserticola може също да регулира баланса на невротрансмитерите, като например повишаване на нивата на ацетилхолин и растежни фактори. Тези вещества са много важни за паметта и ученето. В допълнение, месото може също да подобри притока на кръв и да насърчи доставката на кислород, което може да гарантира, че мозъкът получава достатъчно хранителни вещества и енергия, като по този начин подобрява мозъчната жизненост и издръжливост.

increase brain power

Кликнете върху Know, за да подобрите краткосрочната памет

Електроенцефалографията (ЕЕГ) е мощен инструмент за идентифициране на мозъчната активност; следователно, той е бил широко използван за определяне на невронната основа на разпознаването на реч.

По-специално, за класификацията на разпознаването на реч, подходите, базирани на задълбочено обучение, са в светлината на прожекторите, защото те могат автоматично да учат и извличат представителни характеристики чрез обучение от край до край.

Това проучване имаше за цел да идентифицира конкретни компоненти, които са потенциално свързани с представянето на фонемите в мозъка на плъхове и да разграничи мозъчната активност за всеки гласен стимул на базата на един опит, използвайки двупосочна мрежа за краткосрочна памет (BiLSTM) и класически методи за машинно обучение.

Използвани са деветнадесет мъжки плъхове Sprague-Dawley, подложени на операция за имплантиране на микроелектроди за запис на ЕЕГ сигнали от двустранните предни слухови полета. Бяха избрани пет различни стимула за гласна реч, /a/, /e/, /i/, /o/ и /u/, които имат силно различни честоти на форманти. ЕЕГ, записано при произволно дадени гласни стимули, беше минимално предварително обработено и нормализирано чрез трансформация на z-резултат, за да се използва като вход за класификацията на разпознаването на реч.

Мрежата BiLSTM показа най-доброто представяне сред класификаторите чрез постигане на обща точност, f{{0}}резултат и стойности на κ на Коен съответно от 75,18%, 0,75 и 0,68, използвайки 10-подход за кръстосано валидиране на сгъване.

Тези резултати показват, че LSTM слоевете могат ефективно да моделират последователни данни, като ЕЕГ; следователно, информативни характеристики могат да бъдат извлечени чрез BiLSTM, обучен с обучение от край до край, без никакви допълнителни ръчно изработени методи за извличане на функции.

Въведение

Речта носи огромни количества информация към мозъка и една от типичните характеристики на мозъка е да разпознава и категоризира звуците на животните, които се държат.

Като се има предвид важността му, опитите да се изследват механизмите за разпознаване на звука на речта се провеждат повече от 100 години. Едно от първите невролингвистични изследвания на разпознаването на речта е проведено чрез обсервационно изследване през 1870-те години от немски невропсихиатър, който открива решаващата роля на горния темпорален извивка във възприятието на речта, като заключава, че дефицитите в разпознаването на речта са свързани с увреждане на левия горен темпорален извивка [ 1].

Вече е известно, че разпознаването на реч разчита предимно на дорзолатералните темпорални лобове, включително горния темпорален гирус, който съдържа първичната слухова кора (A1) и предното слухово поле (AAF) [2].

increase memory

Въпреки че начинът, по който фонемите се кодират и интерпретират в мозъка, остава спорен, широко се приема, че разпознаването на звука е категорично. Тоест, разграничаването е по-добро за стимули, принадлежащи към различни фонетични категории, отколкото за стимули, принадлежащи към една и съща категория, дори ако акустичните разлики са еквивалентни [3, 4].

Не само хората, но и системите за възприятие на животните сортират непрекъснато променящите се звукови стимули в набор от отделни категории [5].

С напредъка в неврофизиологичните изследвания, електроенцефалографията (ЕЕГ) се използва широко в изследвания, включващи невронауки и невронно инженерство [6].

Високата времева разделителна способност и чувствителността към различни функционални състояния на мозъка правят ЕЕГ мощен инструмент за изследване на мозъчната активност в реално време и има нарастващ интерес към осветляването на невралната основа за категорично възприятие. Традиционно ЕЕГ сигналите се записват неинвазивно от скалпа при изследвания върху хора. На нивото на звуково или речево възприятие негативността на несъответствието (MMN), компонент на слуховия предизвикан потенциал (AEP), който се предизвиква от странни звуци, се използва широко за изследване на невронните корелати на категоричното възприятие [7, 8]. Naatanen и др. намери доказателства за езиково-зависими гласни представяния в човешкия мозък [9].

Друго проучване изследва категоричното възприятие на лексикалните тонове и установи, че контрастът между категориите предизвиква по-голям MMN, отколкото разграничението в рамките на категорията [10]. При експерименти с животни по-точни ЕЕГ сигнали са получени чрез инвазивни процедури.

Например, невронни корелати на категорично възприятие и невронни представяния на различни звуци са били изследвани с помощта на извънклетъчен запис на потенциал за действие.

Стриатум-проектиращите неврони на пойните птици показват категорични слухови реакции и са силно чувствителни към промени в продължителността на нотите [11]. В допълнение, Kilgard et al.изследва различни невронни представяния на съгласни и гласни звуци, използвайки интрапаренхимни записи в мозъка на плъх. Записвайки отговорите с множество и единични единици от долния коликулус и A1, те предполагат, че шиповото броене кодира гласни звуци, докато шиповото време кодира съгласни звуци [12, 13].

Ефектите от обучението за разграничаване на звука при модел на аутизъм при плъх също бяха изследвани въз основа на предишни констатации, корелиращи невронните реакции към звукови стимули със способността за възприемане на звук [14].

Освен това, скорошно проучване показа, че електрокортикографията, записана с многоканален решетка, корелира с пасивното излагане на специфичен звук дори в слуховата кора на анестезирани плъхове [15].

Подходите за машинно обучение са използвани за практическо използване на ЕЕГ в голямо разнообразие от изследвания. Използването на методи за машинно обучение дава възможност за изследване на богата информация, която е присъща и трудна за разкриване от ЕЕГ сигнали [6].

Следователно класификацията, базирана на ЕЕГ, може да бъде извършена в следните области чрез конвенционални алгоритми за машинно обучение (напр. машина за поддържащи вектори (SVM), k-най-близки съседи (KNN) и наивен Bayes (NB)): двигателни изображения, разпознаване на емоции, откриване на психични заболявания, откриване на потенциал, свързан със събития (ERP) и т.н. [16, 17].

improve your memory

Освен това, през последните години, поради нарастващия напредък в графичните процесори и наличието на големи набори от данни, стана възможно да се проведе класификация, базирана на ЕЕГ, като се използват различни мрежи за дълбоко обучение [6, 18, 19]. В сравнение с конвенционалните методи за машинно обучение , мрежите за дълбоко обучение могат автоматично да откриват и извличат подходящи представяния от входни данни [20, 21].

Следователно, дори при недостатъчни предварителни експертни познания, обещаващи резултати могат да бъдат получени чрез алгоритми за задълбочено обучение, които не изискват допълнителен ръчно изработен процес на извличане на функции [22, 23].

Например в областта на речта, изображенията и видеото резултатите бяха значително подобрени чрез прилагане на алгоритми за дълбоко обучение [24–26]. Не е ясно обаче дали такива превъзходни резултати винаги придружават ЕЕГ-базираната класификационна област, когато се използват подходи за дълбоко обучение вместо традиционни методи за машинно обучение [27].

Roy et al. показаха, че в повечето от проучванията (с изключение на четири от 102 проучвания), подходът за задълбочено обучение е довел до по-висока производителност от традиционния подход за машинно обучение, а най-високото подобрение на точността е 35,3% [18, 28].

Освен това, сред различните области на класификационни изследвания, базирани на ЕЕГ, ERP класификационните изследвания се провеждат активно чрез прилагане на конвенционални методи за машинно обучение и задълбочено обучение.

В едно ранно проучване традиционният метод за голямо осредняване беше използван за подобряване на ниското съотношение сигнал/шум (SNR), едно от ограниченията на EEG сигналите, и за получаване на ERP сигнали.

В тези проучвания няколко компонента на ERP бяха третирани като набори от характеристики за класификация [29, 30]. При проучвания върху животни, ERP характеристики като пикова амплитуда и латентност също се използват за разграничаване на ERP сигнали [31, 32].

Въпреки това класификацията, базирана на ЕЕГ с един опит, също получи много внимание, тъй като е известно, че ЕЕГ данните на ниво с един опит притежават по-функционална и богата информация от ERP сигналите, получени чрез традиционния метод на голямо осредняване [33, 34].

Следователно, в последващи проучвания, характеристиките са извлечени от различни алгоритми, като алгоритми, базирани на вълни [35], модели на гаусова смес [36] и пространствено филтриране [37] за класификация с помощта на конвенционални методи за машинно обучение [38, 39]. Въпреки това, извличането на оптималния ръчно изработените характеристики от ЕЕГ с един опит отнемат време и са трудоемки, тъй като трябва да се изпълнят допълнителни стъпки на обработка. В този контекст методите за дълбоко обучение могат да облекчат този проблем, като позволят обучение от край до край.

Най-разпространената архитектура за дълбоко обучение е конволюционна невронна мрежа (CNN), последвана от повтаряща се невронна мрежа (RNN). CNN е специален тип архитектура за дълбоко обучение, широко използвана за класификация, базирана на ЕЕГ с един опит [6]. Входящите данни на CNN се извличат от необработени или предварително обработени ЕЕГ данни, предимно в следната форма: брой канали × брой времеви точки в един опит.

Освен това са демонстрирани значителни резултати от класификацията и е известно, че се представя най-добре, когато използва спектрограмни изображения като входни данни [40–44]. За разлика от CNN, RNN е много предпочитана архитектура, особено когато се обработват последователни данни (както в приложенията за обработка на естествен език), тъй като повтарящата се връзка на архитектурата за обучение на RNN прави възможно рекурсивното използване на предишната информация на мрежата като текущи входни данни [45]. ].

Дългата краткосрочна памет (LSTM) е вид RNN архитектура, предложена от Hochreiter и Schmidhuber за преодоляване на проблемите с експлодиращия и изчезващия градиент на RNN [46]. Двупосочният LSTM (BiLSTM) е по-нататъшно развитие на LSTM, което комбинира предния и обратния скрити слоеве за достъп както до предходната, така и до следващата информация.

Въпреки че моделът BiLSTM е много по-сложен и може да се нуждае от допълнителна изчислителна мощност, се очаква да реши задачата за последователно моделиране и класификация по-добре от LSTM [47].

По-рано се опитахме да класифицираме ЕЕГ сигнали на базата на един опит за три гласни звука, /a/,/o/ и /u/, използвайки техники за машинно обучение за човешкия мозък.

След прилагането на подходящи алгоритми за обработка на сигнали, включително разлагане на многовариантен емпиричен режим (MEMD), ЕЕГ отговорите бяха ефективно класифицирани според всеки гласен звук, като се използва класификатор за линеен дискриминантен анализ (LDA). От честотно-времевото представяне (TFR) на ЕЕГ сигналите беше установено също, че компонентите на алфа лентата са най-свързаните невронни отговори на възприятието на гласния звук [48].
Въпреки това, поради ниското SNR на човешки ЕЕГ сигнали, представянето на фонемите в мозъка трябва да бъде допълнително оценено с по-инвазивна техника на запис, позволяваща получаването на по-надеждни ЕЕГ сигнали.

Освен това е необходимо да се проведат по-нататъшни проучвания върху ефективността на класификацията на всеки алгоритъм за машинно обучение при класифицирането на ЕЕГ отговорите на различни фонеми.

Основната цел на това проучване беше да се определят специфични компоненти на ЕЕГ, които биха могли да бъдат свързани с представянето на речта в мозъка на плъх, за да се осветят допълнително реакциите на мозъка към разпознаването на звука на речта.

За получаване на по-точни ЕЕГ сигнали, епидуралните ЕЕГ сигнали в отговор на слухови стимули бяха записани в AAF, за който е известно, че играе съществена роля в слуховото възприятие и категоризация [2]. В допълнение, това проучване се опита да разграничи различните реакции на мозъка за всеки звук на речта на базата на един опит, използвайки LSTM мрежи и други конвенционални техники за машинно обучение.

Предполага се, че мрежата BiLSTM би била подходяща за класифициране на ЕЕГ отговорите на гласни стимули и би превъзхождала другите класически класификатори, тъй като мрежата може да работи стабилно при моделиране на дългосрочни зависимости на последователни данни като ЕЕГ. Доколкото е известно на автора, мрежите LSTM не са били прилагани за класифицирането на ЕЕГ отговорите на слухови стимули и това е първото проучване, което използва алгоритъм за дълбоко обучение за анализиране на епидурални ЕЕГ сигнали от AAF.

improving brain function

Освен това, използвайки алгоритъма за дълбоко обучение, ЕЕГ отговорите бяха класифицирани като слухови стимули, използвайки обучение от край до край с минимално предварително обработени ЕЕГ сигнали без допълнителни методи за извличане на характеристики.


For more information:1950477648nn@gmail.com


Може да харесаш също