Ново пространствено-времево непрекъснато разпознаване на езика на знаците с помощта на внимателна мрежа с много функции (2)
Jun 01, 2023
3.5. Последователно обучение
Обучение на последователност След като получим резултатите от инструмента за извличане на пространствени и времеви характеристики под формата на бляскава характеристика, трябва да ги подредим в пълно изречение. Следователно трябва да използваме обучение на последователност, за да гарантираме, че гланцът се управлява, за да формира добро изречение. Най-разпространеният метод в настоящите изследвания се отнася до двупосочната дългосрочна краткосрочна памет (Bi-LSTM) и конекционистката времева класификация (CTC) [17,23] за проблеми, които могат да бъдат решени с помощта на CTC и няколко скорошни разработки [17,23] предлагат CTC като процес на обучение от край до край за CSLR.

Екстракт от цистанче на прах
Щракнете тук, за да видите продуктите на Cistanche
【Попитайте за повече】 Имейл:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Дългата краткосрочна памет (LSTM) [44] е вариант на повтарящата се невронна мрежа (RNN) и се използва широко при моделиране на последователности. LSTM отлично моделира дългосрочни зависимости; той може да обработва цели поредици от входове и да използва вътрешното им състояние, за да моделира преходите на състоянията. Въпреки това, недостатъкът на тези предни RNN е, че скритите състояния се научават само от еднопосочна посока. RNN създава скрито състояние, както е описано от уравнението по-долу, след като получи последователността от характеристики като вход.
ht=RNN(ht−1,ot),
където ht представлява скритото състояние, където началното състояние h0 е фиксиран изцяло нулев вектор, а t е времевата стъпка. RNN се използва за предсказване на отблясъците на знаците според входа на последователността на пространствените характеристики.
Освен това задачите на SL са доста сложни. Следователно той не само изисква характеристики, получени от еднопосочен контекст, но също така се нуждае от помощ при използването на двупосочна информация, за да научи появата на думи, които идват преди и след другите думи в изречението. Следователно, ние използваме Bi-LSTM [45], за да научим сложните динамични зависимости на последователностите от изображения, като ги трансформираме с помощта на пространствени и времеви представяния в последователности от гланцови характеристики. Съгласно обяснението, дадено по-рано, методът Bi-LSTM може да извършва двупосочна работа с метода LSTM. Това означава, че методът Bi-LSTM може по-добре да класифицира последователни данни. Изчислението на Bi-LSTM, което използва двупосочни скрити състояния, може също да се разглежда като повтарящи се изчисления на LSTM, което се обработва отпред назад и след това отзад напред. След това скритото състояние на всяка времева стъпка се предава през напълно свързан слой и слой softmax [17].

Цистанче на прах
при=W(ht плюс b),
yt,j=e at,j ∑ke at,j,
където b е вектор на отклонение и y(t,j) представлява вероятността за етикет j на времева стъпка t. В нашата TSL задача етикетът j е речникът, който се получава от изречението. На практика Bi-LSTM значително подобрява количеството информация, до която мрежата може да има достъп, което от своя страна подобрява контекста на информацията, която е налична в алгоритъма. Информацията съдържа знанието коя дума идва след или преди текущия кадър във входната последователност от характеристики на изречението.
Bi-LSTM изпраща скрити състояния като изход към CTC слоя за всяка времева стъпка. Тъй като резултатите от този Bi-LSTM не обръщат внимание на подреждането на блясъка, ние използваме CTC, за да се справим с картографирането на видео последователност o={ot} T 0 t=1, за да създадем знак гланцова последователност `={` i} IL =1 (L По-малко или равно на T) с по-добра подредба. CTC се използва в много области, включително разпознаване на ръкописен текст [46], разпознаване на реч [47] и разпознаване на жестомимичен език [17,23]. В този домейн той се използва като функция за оценяване без подравняване на входните и изходните последователности. В CSLR CTC е известен като модул, разработен за задачи от край до край, включващи класифициране на времеви данни без сегментиране. Чрез динамично програмиране CSLR може да реши проблема с подравняването чрез създаване на празен етикет (-), който позволява на системата да произвежда оптимални резултати за представяне на данни, които нямат етикети (като данни за епентезис и сегменти от данни без жестове). По-специално, CTC генерира празен етикет "-", за да разшири речника V, където V=Vorigin ∪ {-}. Целта на този празен етикет е да представи прехода и да уведоми за съществуването на празен гланц, който не предоставя информация за процеса на обучение, като π={πt} T 0 t{{20 }}, където πt ∈ V. В резултат на това CTC може да управлява изходните параметри от инструмента за извличане на пространствени и времеви характеристики, а също и Bi-LSTM като модул за подравняване чрез обобщаване на вероятностите на всички възможни пътища. Целият път на подравняване π има вероятност, която се дава на входната последователност, както следва [17]:

Експеримент Cistanche deserticola
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt
В следващата стъпка дефинираме операция за картографиране много към едно B, която премахва всяко празно пространство и дублира думи от пътя за подравняване. Например B (II-съм- -a- -лекар)=I, am, a, doctor. В резултат на това можем да изчислим условната вероятност на знаковата гланцова последователност l като сумата от вероятностите на всички маршрути, които могат да се съпоставят към l от B, по начина, описан по-долу [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
където B −1 (l)={π|B(π)=l} е обратната операция на B. Накрая, CTC загубите на последователността от характеристики се дефинират както следва [17]:
Lctc=− ln p(` |o)
Условната вероятност p(π|X) може да бъде изчислена съгласно предположението за условна независимост.
4. Експериментални резултати и дискусия

Добавка Cistanche близо до мен-Подобряване на паметта
В този раздел ще обясним подробностите за нашия експеримент с предложената конфигурация, както е обяснено в предишния раздел.
4.1. Набори от данни
В този раздел обясняваме наборите от данни, които използвахме по време на този експеримент. Използвахме два набора от данни, първият е наборът от данни CSL [8,40,41], а вторият е наборът от данни RWTH-PHOENIX [33,39]. И двата набора от данни са непрекъснати набори от данни на езика на знаците, които се използват за превод на някои серии от жестове в пълно изречение.
4.1.1. CSL набор от данни
Наборът от данни CSL е използван от няколко работи [8,40,41]. В този набор от данни има общо 100 изречения и 178 думи, които обикновено се използват в ежедневната комуникация. Този набор от данни съдържа средно 5 думи на изречение. Всяко изречение беше изпълнено от 50 подписващи се 5 пъти. По този начин общият брой видеоклипове е 25, 000, което прави това един от най-големите набори от данни. За да обучим нашия CSL модел, разделихме набора от данни на данни за обучение с 20000 видеоклипа и за тестване с 5000 видеоклипа от едно и също изречение, но с различни подписващи лица.
4.1.2. Набор от данни RWTH-PHOENIX
Наборът от данни RWTH-PHOENIX [33,39] е набор от данни на немски жестомимичен език, който е запис на обществени метеорологични предавания от телевизионни станции в Германия. Това видео е обработено така, че да има размер 210 × 260. Има 6841 различни изречения, подписани от 9 различни подписващи. Всички подписали се бяха с тъмни дрехи на светъл фон. Общо има 1232 думи с около 80,000 глосове. Този набор от данни е разделен според предварително определен формат, състоящ се от 5672 проби за обучение, 540 проби за валидиране/разработване и 629 проби за тестване.
4.2. Предварителна обработка на данни
Първото нещо, което трябваше да направим, беше предварително да обработим нашия набор от данни, за да отговаря на предложения от нас модел. Извършихме преоразмеряване и изрязване, както е показано на фигура 3; от лявата страна можем да видим, че оригиналните данни са оразмерени с пълна HD или 1920 × 1080 резолюция. Трябваше да го изрежем и преоразмерим до разделителна способност 224 × 224, тъй като нашият пространствен модул получава вход, който е със същия размер като входа ResNet50. След това подадохме данните в нашия пространствен модел, който ще произведе тензора 7 × 7 от едно изображение.
Предварително обработеното пълнокадрово изображение след това беше използвано за генериране на характеристиките на ключови точки. Използвахме модела HRNet, за да предвидим 133 ключови точки от тези RGB изображения. Ние обаче използваме само 27 ключови точки от горната част на тялото в предложения от нас модел. Входящият размер за характеристиките на ключови точки е 27 × 3, тъй като имаме 3-данни за координати на ос (x, y и z) за всяка точка. Входното измерение на модела е N × 224 × 224 × 3 за функцията на цял кадър и N × 1 × 27 × 3 за въвеждане на ключова точка, където N е броят на кадрите. За да подобрим вариацията на набора от данни, следваме разширението от [12], включително произволно изрязване, хоризонтално обръщане и произволно времево мащабиране. Произволното изрязване също се използва като част от стъпка на предварителна обработка за изрязване на оригиналното изображение.

Добавка Cistanche близо до мен-Подобряване на паметта
4.3. Метрика за оценка
За да оценим ефективността на разпознаването на предложения от нас модел, ние използваме метрика за процент на грешка в думата (WER), която е метрика, често използвана в CSLR за оценка на точността на разпознаване на предвидено изречение, както е показано от уравнението по-долу [17]:
WER=S плюс I плюс DT=S плюс I плюс DS плюс C плюс D
където S е броят на заместванията на оригиналната дума, I е броят на вмъкванията, които не са в оригиналното изречение, D е броят на изтриванията, които е трябвало да има в оригиналното изречение, C е броят на правилните думи, които съвпадат оригиналното изречение, а T е общият брой думи в изречението или който може да бъде получен от общия брой замествания, изтривания и правилни думи. За CSL всеки знак се използва за представяне на дума.
4.4. Експериментирайте с входни потоци
Този експеримент се фокусира главно върху сравняването на еднопоточен и многопоточен вход на нашия модел. Целта е да се намери най-добрата конфигурация на входния поток. В този експеримент използваме само набора от данни RWTH-PHOENIX. Нашият модел ще получи два отделни входа, пълен кадър и вход на ключова точка. Входът за единичен поток използва само RGB функцията от пълноформатното изображение. Има два експеримента за въвеждане на един поток. Първият използва само функцията за пълен кадър от RGB изображението, а вторият използва функции на ключови точки от входа на ключови точки. Многопоточният вход, който предлагаме, се състои от RGB и ключови точки. Резултатът от сравнението при използване на единичен поток и множество потокове е показан в таблица 1. Тук можем да видим, че с помощта на функцията за множество потокове можем да получим по-добър резултат, отколкото с помощта на единичен поток. Основният поток се получава от пълнокадрова RGB функция, а допълнителният поток използва функциите на ключови точки. Допълнителният поток от ключови точки помага на модела да се учи по-добре, особено за улавяне на детайлите от формата на ръката.
Таблица 1. Сравнение на производителността на WER при използване на единичен поток и многопоточен вход.

4.5. Експериментирайте върху модула за внимание
Целта на този експеримент беше да се избере най-добрата конфигурация на модула за внимание. В този експеримент използваме конфигурацията на най-добрия резултат от резултата от предишния експеримент и същия набор от данни. Ние обозначаваме пространственото внимание като модел със слой за самовнимание в края на пространствения модул за всяка характеристика. Ранното времево внимание е слоят на самовниманието след първото времево обединяване, а късното времево внимание е слоят на самовниманието след второто времево обединяване. Тук ще сравним всички конфигурации по-горе и комбинацията от пространствено и времево внимание. Резултатът е показан в таблица 2. Резултатът от пространственото внимание е по-лош от темпоралното. Пространственото ниво съдържа последователност от характеристики за всеки кадър. Както се споменава в [20], слоят за самовнимание е по-лесен за научаване на по-краткия път между дългите зависимости. Следователно, пространственото внимание не успява да намали WER поради дългата последователност. От друга страна, успяхме да получим подобрен резултат, използвайки темпоралното внимание, като го поставихме след обединяването, така че да получи по-къса дължина на последователността. Късното внимание, което има най-къса дължина на последователността, получава най-добър резултат. Освен това комбинацията от модула за внимание в пространствено и времево е по-лоша от използването само на едно внимание. Въз основа на тези резултати ние прилагаме най-добрата конфигурация за експериментите по-нататък.
Таблица 2. Сравнение на производителността на WER при използване на различна конфигурация на вниманието

4.6. Експеримент за аблация в мрежата STAMF
Освен това извършваме експеримент за аблация, използвайки същия набор от данни и най-добрата конфигурация на входния поток и модула за внимание. Таблица 3 за експеримент, използващ късно темпорално внимание без обединяване, доказва, че дължината на последователността влияе на ефективността на вниманието. Експериментите, които използват обединени слоеве с по-къси дължини на последователност, дават по-добри резултати. Ние също извършваме експеримент за аблация, за да знаем ефективността, използвайки различни модели за обучение на последователност. Резултатът в Таблица 4 показва, че използването на LSTM, който има само еднопосочна информация, има по-ниска производителност от използването на Bi-LSTM, който има двупосочна информация.
Таблица 3. Сравнение на производителността на WER при използване на различни конфигурации на късно времево внимание.

Таблица 4. Сравнение на производителността на WER при използване на различна конфигурация за обучение на последователност.

4.7. Експериментирайте в мрежата STAMF
В този раздел обясняваме пълния процес на обучение за предложения от нас модел, наречен пространствено-временна многофункционална функция (STAMF). Това ще обхване как вписваме нашите входни данни в пространствения модул, времевия модул и модула за обучение на последователност стъпка по стъпка. В този раздел използваме многопоточно въвеждане и конфигурация на късно времево внимание.
4.7.1. Подробности за изпълнението
Извършваме обучение и тестване от край до край, като използваме входни кадри с размери 224 × 224. За оптимизатора използваме оптимизатор на Adam с 10−4 като скорост на обучение и го разделяме на 2 в епохи 10 и 15 за CSL и епохи 30, 40 и 60 за RWTH ФЕНИКС. Задаваме размера на партидата на 4 и изпълняваме 80 епохи за RWTH-PHOENIX и 20 епохи за CSL. Обучението и тестването бяха проведени на NVIDIA Tesla V100 и 128G RAM.
Първоначално извлякохме функцията от RGB потоци с помощта на ResNet50 и използвахме HRNet, за да получим ключовата точка и след това извлечехме характеристиките на ключовата точка с помощта на ResNet50. Имайте предвид, че имахме работа с последователни данни или видео. Следователно трябваше да конфигурираме нашия входен размер в зависимост от дължината на видеоклипа. Поради технически причини входният размер за всички данни трябваше да бъде еднакъв. Следователно трябва да знаем най-дългия видеоклип в нашия набор от данни, след което допълнихме дължината на входния кадър, за да съответства на най-големия номер на кадър
Тези последователно извлечени функции бяха използвани от темпоралния модул. Всеки последователен поток премина през две подредени времеви обединения. Всяко времево обединяване се състоеше от 1-дименсионална конволюционна мрежа и максимален обединяващ слой, което намалява дължината на последователността наполовина. Изходът от времевото обединяване от двата потока след това беше свързан към слоя за внимание и за последното времево обединяване, след слоя за внимание, той беше конкатениран в края като изход на временния модул.
Времевият изход беше обработен от модула за обучение на последователност. Процесът използва слоя Bi-LSTM, свързан с CTC, за да получи окончателното подравняване и да състави блясъка в последно изречение.
4.7.2. Количествен резултат
Последните изречения бяха сравнени с основната истина, за да се изчисли резултатът WER като количествен резултат. За CSL разделяме набора от данни на 80 процента за данните за обучение и 20 процента за данните за тестване. Както е показано в таблица 5, предложеният от нас многофункционален модел (STMF), използващ функциите на пълен кадър и ключови точки, може да постигне по-добър резултат и да намали WER до 0,8 в сравнение с модела, използващ само функцията на пълен кадър [23]. Нашият най-добър резултат беше получен от предложения многофункционален модел, използващ механизма за внимание (STAMF), който постигна 0,7 за WER. Слоят за внимание все пак леко подобри резултата, въпреки че наборът от CSL данни нямаше дефектни рамки. Това доказва, че нивото на внимание оказва влияние върху модела. Предложеният многофункционален модел сам по себе си превъзхожда най-съвременните методи и нивото на вниманието допринася за намаляване на WER резултата на набора от данни на CSL. Ключовата точка на CSL дава значително въздействие, защото може да даде ефективна информация в сравнение с другия многофункционален метод [17], който използва ръце, лице и поза на тялото.
За набора от данни RWTH-PHOENIX използвахме изкуствената конфигурация, за да разделим данните за обучение и тестване. Наборът от данни беше разделен на 5672 примерни видеоклипа за обучение, 540 примерни видеоклипа за самопроверка и 629 примерни видеоклипа за тестване. Както е показано в таблица 6, нашият предложен модел с много функции (STMF) резултат, използващ функциите на цял кадър и ключовите точки, имаше 24 процента WER, а най-добрият ни резултат беше 20,5 процента, получен от предложения модел, използващ модула за внимание (STAMF) в резултата от обучението. Резултатите от теста са вторите най-добри в сравнение с [17], тъй като използват повече функции като вход. Въпреки това, модулът за внимание е доказал, че има значителен принос за намаляване на резултата WER за набора от данни RWTHPHOENIX. За разлика от нашия резултат за набора от данни CSL, предложеният от нас модел с многопоток не постигна оптимален резултат. Това е така, защото наборът от данни RWTH-PHOENIX има много дефектни рамки; имат замъглена част, особено в областта на ръцете. Тази рамка дава непоследователна информация за ключови точки поради липсваща или неправилна позиция на ключови точки и прави модела по-малко оптимален. Този проблем се решава чрез добавяне на слоя за внимание към нашия предложен многофункционален модел, което помага да се избере правилната информация и води до значително подобрение в сравнение с предложения многофункционален модел без внимание.
Таблица 5. Сравнение на производителността на WER в набора от данни на CSL.

Таблица 6. Сравнение на производителността на WER в набора от данни RWTH-PHOENIX.

4.7.3. Качествен резултат
Извършихме и качествена оценка на нашия модел, използвайки визуализация на резултата от разпознаването. Фигура 8 показва детайлите на нашата качествена оценка, използвайки три проби от изречения. Първото изречение се състои от 10 думи и общият брой на кадрите е 220. Второто изречение се състои от 12 думи и общият брой на кадрите е 168. Третото изречение се състои от 9 думи и общият брой на кадрите е 135.
Примерният резултат показва, че някои гланцове не са правилно предвидени от моделите и ние го обозначаваме с червен знак. Въпреки това, той все още може да предвиди повечето правилни думи. Най-много грешки има в първото изречение, което има най-дълъг номер на рамка. В това изречение началото на изречението има повече грешки, поради няколко жеста за ранните думи, които са само малко различни, така че е трудно да се разграничат границите. Въпреки това, предложеният модел с много функции и внимание (STAMF) може да идентифицира повече думи, но те са неправилно етикетирани. Освен това конфигурацията на модела с внимание постига по-добър резултат при разпознаване за други две проби в сравнение с предложения модел без внимание.

Фигура 8. Качествена оценка на резултата от разпознаването, използвайки различна конфигурация на набора от данни RWTH-PHOENIX [33,39]. Грешно предвидените гланцове са маркирани в червено.
5. Изводи
В тази статия представяме нова пространствено-времева внимателна многофункционална функция (STAMF) за CSLR, която има за цел да научи пространствено-времевите корелации и важната информация от последователността от визуални характеристики и характеристики на ключови точки в подхода от край до край. В нашата рамка беше разработен пространствен модул с функция за пълен кадър от RGB данни и ключови точки от ключовите точки на тялото, включително ръцете като мулти-функции. Тези комбинации, използвани като многопоточен вход за функция, дадоха превъзходна производителност в сравнение с най-съвременния подход, който използва само цял кадър или в сравнение с метода Фигура 8. Качествена оценка на резултата от разпознаване, използвайки различна конфигурация на RWTH -PHOENIX набор от данни [33,39]. Грешно предвидените гланцове са маркирани в червено. 5. Заключения В тази статия представяме нова пространствено-времева многофункционална функция (STAMF) за CSLR, която има за цел да научи пространствено-времевите корелации и важната информация от последователността от визуални характеристики и характеристики на ключови точки в края до- краен подход. В нашата рамка беше разработен пространствен модул с функция за пълен кадър от RGB данни и ключови точки от ключовите точки на тялото, включително ръцете като мулти-функции. Тези комбинации, използвани като въвеждане на многопоточни функции, дадоха превъзходна производителност в сравнение с най-съвременния подход, който използва само цял кадър или в сравнение с метода, който използва друга комбинация от много функции, особено за набора от данни CSL. След това предлагаме временен модул, съставен от времево обединяване и времево внимание, за да улови важната информация във времевия домейн. Добавянето на късно времево внимание е в състояние да получи важната характеристика от последователността, която има неправилна информация и дава значително подобрение в сравнение с предложения от нас модел с много функции. Той също така помага на обучението на последователността да се учи по-добре и подобрява производителността, както в експеримента с набора от данни CSL. Обширните експерименти върху често използвани набори от данни демонстрират превъзходството на предложения от нас модел над най-съвременния модел с WER резултати, намаляващи с повече от 50 процента за набора от данни CSL и намаляващи с 5 процента за набора от данни RWTH-PHOENIX. В бъдеще планираме да внедрим техниката за трансфер на обучение с настоящия ни модел, както и да приложим нашата текуща работа в реална индустрия.
Препратки
1. Дрю, П.; Рибач, Д.; Deselaers, T.; Захеди, М.; Ней, Х. Техники за разпознаване на реч за система за разпознаване на жестомимичен език. В сборника на INTERSPEECH 2007, 8-ма годишна конференция на Международната асоциация за речева комуникация, Антверпен, Белгия, 27–31 август 2007 г.; стр. 2513–2516.
2. Ong, SCW; Ранганат, С. Автоматичен анализ на езика на знаците: Проучване и бъдещето отвъд лексикалното значение. IEEE Trans. модел анален. Мах. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]
3. Vogler, C.; Метаксас, Д. Рамка за разпознаване на едновременните аспекти на американския жестомимичен език. Изчисл. Vis. Image Underst. 2001, 81, 358–384. [CrossRef]
4. Боудън, Р.; Windridge, D.; Кадир, Т.; Зисерман, А.; Брейди, М. Вектор на лингвистични характеристики за визуална интерпретация на езика на знаците. В докладите на Европейската конференция по компютърно зрение (ECCV), Прага, Чешка република, 11–14 май 2004 г.; стр. 390–401.
5. Касукурти, Н.; Рокад, Б.; Бидани, С.; Dennisan, DA Разпознаване на азбука на американски жестомимичен език чрез задълбочено обучение. arXiv 2019, arXiv:1905.05487.
6. Колър, О.; Заргаран, С.; Ney, H.; Bowden, R. Deep Sign: Активиране на стабилно статистическо непрекъснато разпознаване на езика на знаците чрез хибридни CNN-HMM. Вътр. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]
7. Pu, J.; Джоу, В.; Li, H. Разширена конволюционна мрежа с итеративна оптимизация за непрекъснато разпознаване на жестомимичен език. В сборника на двадесет и седмата международна съвместна конференция за изкуствен интелект, Стокхолм, Швеция, 13–19 юли 2018 г.; стр. 885–891.
8. Pu, J.; Джоу, В.; Li, H. Итеративна мрежа за подравняване за непрекъснато разпознаване на езика на знаците. В сборника на конференцията на IEEE Computer Society за компютърно зрение и разпознаване на образи, Лонг Бийч, Калифорния, САЩ, 15–20 юни 2019 г.; стр. 4160–4169.
9. Кумар, Н. Проследяване на човешко лице и ръце, базирано на траектория на движение за разпознаване на езика на знаците. В сборника на 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Матхура, Индия, 26–28 октомври 2017 г.; стр. 211–216.
10. Буян, MK; Ghoah, D.; Bora, PK Рамка за разпознаване на жестове с ръце с приложения към езика на знаците. В сборника на годишната индийска конференция за 2006 г., INDICON, Ню Делхи, Индия, 15–17 септември 2006 г.; стр. 1–6.
11. Дас, SP; Талукдар, Аляска; Сарма, К. К. Разпознаване на езика на знаците чрез изражението на лицето. В сборника на Procedia Computer Science, Керала, Индия, 10–13 август 2015 г.; стр. 210–216.
12. Растгу, Р.; Киани, К.; Ескалера, С.; Sabokrou, M. Продукция на езика на знаците: преглед. В сборника от конференцията IEEE/CVF за 2021 г. за семинари за компютърно зрение и разпознаване на образи (CVPRW), Нешвил, Тенеси, САЩ, 19–25 юни 2021 г.; стр. 3446–3456.
13. Донг, С.; Wang, P.; Абас, К. Проучване за дълбокото обучение и неговите приложения. Изчисл. Sci. Rev. 2021, 40, 100379. [CrossRef]
14. Атицос, В.; Needle, C.; Sclaroff, S.; Nash, J.; Стефан, А.; Юан, Q.; Тангали, А. Набор от видео данни за лексикона на американския жестомимичен език. В сборника от конференцията на IEEE Computer Society през 2008 г. за семинари за компютърно зрение и разпознаване на образи, семинари CVPR, Анкоридж, Аляска, 23–28 юни 2008 г.; стр. 1–8.
15. Bungeroth, J.; Щайн, Д.; Dreuw, P.; Ney, H.; Morrissey, S.; Уей, А.; Zijl, LV Корпусът на жестовия език ATIS. В сборника на 6-та международна конференция за езикови ресурси и оценка, LREC 2008, Маракеш, Мароко, 28–30 май 2008 г.; стр. 2943–2946.
16. Папастратис, И.; Chatzikonstantinou, C.; Константинидис, Д.; Димитропулос, К.; Дарас, П. Технологии с изкуствен интелект за езика на знаците. Сензори 2021, 21, 5843. [CrossRef] [PubMed]
17. Джоу, Х.; Джоу, В.; Zhou, Y.; Li, H. Пространствено-времева мрежа с множество реплики за непрекъснато разпознаване на езика на знаците. В сборника на AAAI 2020—Тридесет и четвъртата конференция на AAAI за изкуствен интелект, Ню Йорк, Ню Йорк, САЩ, 7–12 февруари 2020 г.; стр. 13009–13016.
18. Gündüz, C.; Полат, Х. Разпознаване на турски жестомимичен език въз основа на сливане на многопоточни данни. Турски J. Electr. инж. Изчисл. Sci. 2021, 29, 1171–1186. [CrossRef]
19. Бохачек, М.; Хруз, М. Трансформатор, базиран на жестомимична поза за разпознаване на жестомимичен език на ниво дума. В сборника от Зимната конференция на IEEE/CVF за приложения на компютърно зрение през 2022 г. Семинари, WACVW, Waikoloa, HI, САЩ, 4–8 януари 2022 г.; стр. 182–191.
20. Vaswani, A. Вниманието е всичко, от което се нуждаете. В сборника на конференцията за системи за обработка на невронна информация, Лонг Бийч, Калифорния, САЩ, 4–9 декември 2017 г.; стр. 1–11.
21. Джоу, М.; Ng, М.; Cai, Z.; Cheung, KC Мрежи с пълно начално базиране на самовнимание за непрекъснато разпознаване на езика на знаците. Отпред. Artif. Intell. Приложение 2020, 325, 2832–2839.
22. Камгьоз, Северна Каролина; Koller, O.; Hadfifield, S.; Боудън, Р. Трансформатори на жестомимичен език: Съвместно разпознаване и превод на жестомимичен език от край до край. В сборника на конференцията на IEEE Computer Society за компютърно зрение и разпознаване на образи, Сиатъл, Вашингтон, САЩ, 14–19 юни 2020 г.; стр. 10020–10030.
23. Мин, Й.; Хао, А.; Чай, X.; Чен, X. Ограничение за визуално подравняване за непрекъснато разпознаване на жестомимичен език. В сборника на Международната конференция на IEEE за компютърно зрение (ICCV), Монреал, Британска Колумбия, Канада, 10–17 октомври 2021 г.; стр. 11542–11551.
24. Гуо, Д.; Джоу, В.; Уанг, М.; Li, H. Разпознаване на жестомимичен език, базирано на адаптивни HMM с увеличаване на данните. В сборника на Международната конференция на IEEE за обработка на изображения (ICIP), Финикс, Аризона, САЩ, 25–28 септември 2016 г.; стр. 2876–2880.
25. Хуанг, Дж.; Джоу, В.; Li, H.; Li, W. Разпознаване на езика на знаците с помощта на 3D конволюционни невронни мрежи. В сборника на IEEE International Conference on Multimedia and Expo (ICME), Торино, Италия, 29 юни–3 юли 2015 г.; стр. 1–6.
26. Гуо, Д.; Джоу, В.; Li, H.; Wang, M. Онлайн ранно-късно сливане, базирано на адаптивен HMM за разпознаване на езика на знаците. ACM Trans. Мултимед. Изчисл. Общ. Приложение 2017, 14, 1–18. [CrossRef]
27. Ал-Хамади, М.; Мохамед, Г.; Член, S. Разпознаване на жестове с ръце за жестомимичен език с помощта на 3DCNN. IEEE Access 2020, 8, 79491–79509. [CrossRef]
28. Реза, Х.; Joze, V. MS-ASL: Широкомащабен набор от данни и показател за разбиране на американския жестомимичен език. arXiv 2019, arXiv:1812.01053.
29. Ли, Д.; Opazo, CR; Ю, X.; Li, H. Дълбоко разпознаване на жестомимичен език на ниво дума от видео: нов широкомащабен набор от данни и сравнение на методи. В сборника от Зимната конференция на IEEE за приложения на компютърното зрение през 2020 г., WACV, Сноумас Вилидж, Колорадо, САЩ, 1–5 март 2020 г.; стр. 1448–1458.
30. Pu, J.; Джоу, В.; Li, H. Разпознаване на жестомимичен език с мултимодални функции. В сборника на Тихоокеанската конференция за мултимедия, Сиан, Китай, 15–16 септември 2016 г.; стр. 252–261.
31. Дзян, С.; Сън, Б.; Wang, L.; Бай, Й.; Ли, К.; Fu, Y. Мултимодално разпознаване на жестомимичен език, съобразено със скелета. В сборника на конференцията на IEEE Computer Society за семинари за компютърно зрение и разпознаване на образи, Нешвил, TN, САЩ, 19–25 юни 2021 г.; стр. 3408–3418.
32. Сидиг, AAI; Luqman, H.; Махмуд, С.; Мохандес, М. KArSL: База данни на арабски жестомимичен език. ACM Trans. Азиатски с ниски ресурси. Ланг. Инф. Обработка 2021, 20, 1–19. [CrossRef]
33. Колър, О.; Forster, J.; Ней, Х. Непрекъснато разпознаване на езика на жестовете: Към системи за статистическо разпознаване с голям речник, работещи с множество подписващи. Изчисл. Vis. Image Underst. 2015, 141, 108–125. [CrossRef]
34. Колър, О.; Камгоз, Северна Каролина; Ney, H. Слабо контролирано обучение с многопоточни CNN-LSTM-HMM за откриване на последователен паралелизъм във видеоклипове на жестомимичен език. IEEE Trans. модел анален. Мах. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]
35. Камгоз, Северна Каролина; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: Форма на ръката от край до край и непрекъснато разпознаване на жестомимичен език. В сборника от 2017 г. IEEE International Conference on Computer Vision (ICCV), Венеция, Италия, 22–29 октомври 2017 г.; стр. 3075–3084.
36. Dong, C.; Loy, CC; Той, К.; Tang, X. Супер разделителна способност на изображението с помощта на дълбоки конволюционни мрежи. IEEE Trans. модел анален. Мах. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]
37. Бресем, К.К.; Адамс, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Сравняване на различни архитектури за дълбоко обучение за класифициране на рентгенографии на гръдния кош. Sci. Rep. 2020, 10, 13590. [CrossRef]
38. Сън, К.; Xiao, B.; Лиу, Д.; Wang, J. Deep High-resolution Representation Learning for Human Pos Estimation. В сборника на конференцията на IEEE Computer Society за компютърно зрение и разпознаване на образи, Лонг Бийч, Калифорния, САЩ, 15–20 юни 2019 г.; стр. 5686–5696.
39. Колър, О.; Заргаран, С.; Ney, H. Re-Sign: Повторно подравнено моделиране на последователност от край до край с дълбоко повтарящи се CNN-HMM. В докладите на Конференцията на IEEE за 2017 г. за компютърно зрение и разпознаване на образи (CVPR), Хонулулу, Хайхай, САЩ, 21–26 юли 2017 г.; стр. 3416–3424.
40. Джоу, Х.; Джоу, В.; Li, H. Динамично декодиране на псевдоетикети за непрекъснато разпознаване на езика на знаците. В сборника от 2019 IEEE International Conference on Multimedia and Expo (ICME), Шанхай, Китай, 18–21 юли 2019 г.; стр. 1282–1287.
41. Xiao, Q.; Чанг, X.; Джан, X.; Liu, X. Видео базирано разпознаване на езика на знаците без времева сегментация. В сборника на Тридесет и втората конференция на AAAI за изкуствен интелект, Ню Орлиънс, Лос Анджелис, САЩ, 2–7 февруари 2018 г.; стр. 2257–2264.
42. Грейвс, А.; Фернандес, С.; Gomez, F.; Schmidhuber, J. Connectionist Temporal Classification: етикетиране на несегментирани последователни данни с повтарящи се невронни мрежи. В Доклади на ICML '06: Доклади от 23-та международна конференция за машинно обучение, Питсбърг, Пенсилвания, САЩ, 25–29 юни 2006 г.; стр. 369–376.
43. Грейвс, А.; Liwicki, М.; Фернандес, С.; Бертолами, Р.; Bunke, H.; Шмидхубер, Дж. Нова система за свързване за неограничено разпознаване на ръкописен текст. IEEE Trans. модел анален. Мах. Intell. 2009, 31, 855–868. [CrossRef]
44. Гуо, Д.; Джоу, В.; Li, H.; Уанг, М. Йерархичен LSTM за жестомимичен превод. В сборника на конференцията на AAAI за изкуствен интелект, Ню Орлиънс, Лос Анджелис, САЩ, 2–7 февруари 2018 г.; стр. 6845–6852.
45. Рахман, ММ; Watanobe, Y.; Накамура, К. Двупосочен LSTM езиков модел за оценка и поправка на код. Симетрия 2021, 13, 247. [CrossRef]
46. Ху, В.; Кай, М.; Чен, К.; Динг, Х.; Сън, Л.; Liang, S.; Mo, X.; Huo, Q. Разграничително обучение по последователност за офлайн разпознаване на ръкописен текст чрез интерполиран CTC и функция MMI без решетка. В сборника на Международната конференция за анализ и разпознаване на документи, ICDAR, Киото, Япония, 9–15 ноември 2017 г.; Том 1, стр. 61–66.
47. Йошимура, Т.; Хаяши, Т.; Такеда, К.; Watanabe, S. Автоматично разпознаване на реч от край до край, интегрирано с CTC-базирано откриване на гласова активност. В сборника на ICASSP, Международна конференция на IEEE по акустика, реч и обработка на сигнали, Барселона, Испания, 4–8 май 2020 г.; стр. 6999–7003.
48. Гуо, Д.; Wang, S.; Tian, Q.; Wang, M. Dense Temporal Convolution Network за жестомимичен превод. В сборника на двадесет и осмата международна съвместна конференция за изкуствен интелект (IJCAI-19), Макао, Китай, 10–16 август 2017 г.; стр. 744–750.
49. Уанг, С.; Гуо, Д.; Джоу, В.; Zha, Z.; Wang, M. Connectionist Temporal Fusion за жестомимичен превод. В сборника на 26-та международна конференция за мултимедия на ACM, Сеул, Корея, 22–26 октомври 2018 г.; стр. 1483–1491.
50. Янг, З.; Shi, Z. SF-Net: Мрежа със структурирани функции за непрекъснато разпознаване на жестомимичен език. arXiv 2019, arXiv:1908.01341.
51. Cheng, KL; Янг, З.; Чен, Q.; Tai, Y. Напълно конволюционни мрежи за непрекъснато разпознаване на жестомимичен език. В сборника на Европейската конференция за компютърно зрение, Глазгоу, Обединеното кралство, 23–28 август 2020 г.; стр. 697–714.
52. Колър, О.; Ney, H.; Bowden, R. Deep Hand: Как да обучим CNN на 1 милион изображения на ръце, когато вашите данни са непрекъснати и слабо етикетирани. В сборника от 2016 IEEE конференция за компютърно зрение и разпознаване на образи (CVPR), Лас Вегас, Невада, САЩ, 27–30 юни 2016 г.; стр. 3793–3802.
53. Слиман, FB Контекстът има значение: Самовниманието за разпознаване на езика на знаците. arXiv 2021, arXiv:2101.04632.
54. Ниу, З.; Мак, Б. Стохастично фино етикетиране на блясъци на знаци с много състояния за непрекъснато разпознаване на езика на знаците. В сборника на Европейската конференция за компютърно зрение, Глазгоу, Обединеното кралство, 23–28 август 2020 г.; стр. 1–16.
55. Cui, R.; Liu, H.; Zhang, C. Дълбока невронна рамка за непрекъснато разпознаване на езика на знаците чрез итеративно обучение. IEEE Trans. Мултимед. 2019, 21, 1880–1891. [CrossRef]
56. Pu, J.; Джоу, В.; Hu, H.; Li, H. Увеличаване на непрекъснатото разпознаване на езика на знаците чрез кръстосано разширяване на модалността. В сборника на 28-ата международна конференция на ACM за мултимедия, Сиатъл, Вашингтон, САЩ, 12–16 октомври 2020 г.; стр. 1497–1505.






