Проучване на самоконтролируеми зрителни трансформатори за разпознаване на походка в дивата природа, част 3
Nov 24, 2023
Ние използваме проста семплиране, за да интерполираме между съседни стави (Фигура 3). Въпреки това, наивното правене на това върху скелета води до фалшиви фуги в скелета, независимо от избора на формати на скелета (напр. OpenPose или COCO), тъй като съвместното подреждане не запазва никакво семантично значение.
Секвенирането на ставите се отнася до движение на ставите на тялото в определен ред. Този тип упражнения играят важна роля за поддържане на физическото здраве и подобряване на телесната памет.
На първо място, секвенирането на ставите може да насърчи координираното движение на различни части на тялото, да увеличи мускулната сила и да подобри сърдечно-белодробната функция, което спомага за поддържане на добро здраве. В същото време редовното подравняване на ставите може да намали сковаността на тялото и болката, да подобри стойката и баланса и да забави намаляването на физическата функция, причинено от възрастта.
Второ, съвместното секвениране може също да подобри паметта. Изследванията показват, че упражненията могат да стимулират растежа и връзките на мозъчните неврони, като по този начин насърчават обмена на информация между невроните, което може да помогне за подобряване на паметта и способностите за учене. Последователното движение на ставите изисква мозъкът да дава точни инструкции за движенията на различните части на тялото, което е от голяма полза за развитието на координацията и паметта на мозъка.
И накрая, съвместното секвениране може също да облекчи стреса и безпокойството и да подобри емоционалната стабилност. Упражнението може да освободи някои вещества в тялото, като допамин и ендорфини, които могат да помогнат за облекчаване на емоционалните проблеми и да подобрят усещането на тялото за щастие и удовлетворение. Тези фактори също имат положително въздействие върху подобряването на паметта.
В обобщение, има положителна връзка между последователността на ставите и паметта. Чрез редовни упражнения за последователност на ставите можете да насърчите здравословното развитие на тялото и мозъка, да подобрите паметта и способностите за учене и да подобрите емоционалната стабилност. Нека се грижим за доброто здраве и заедно да се наслаждаваме на красотата на живота! Вижда се, че трябва да подобрим паметта и Cistanche deserticola може значително да подобри паметта, тъй като Cistanche deserticola е традиционен китайски лекарствен материал, който има много уникални ефекти, един от които е да подобрява паметта. Ефикасността на мляното месо идва от различните активни съставки, които съдържа, включително киселина, полизахариди, флавоноиди и др. Тези съставки могат да насърчат здравето на мозъка по различни начини.

Щракнете върху познайте добавките за подобряване на паметта
Това наблюдение е в съответствие с работата на Yang et al. [44], който предлага скелетно изображение на дървовидна структура (TSSI), за да предложи пространствените взаимоотношения между ставите. Той се основава на подреждане на ставите при обхождане на първо дърво в дълбочина, което запазва структурната информация на скелета. Фигура 3 (вдясно) показва ефектите от различните скелетни формати и методите за вземане на проби. За този метод за преоразмеряване използвахме TSSI формат и бикубична интерполация.
Освен това експериментирахме с два метода за мащабиране, които можеха да се научат по време на обучението. Използвахме прост линеен слой, нанесен върху всеки сплескан скелет, за да увеличим броя на ставите. Това е най-простият начин за трансформиране на всеки скелет, но той не отчита никакви пространствени отношения между ставите. За да се справим с това, ние също използваме набор от 2D деконволюционни слоеве върху скелетната последователност за преоразмеряване, като същевременно вземаме предвид структурната информация; за този метод ние също използваме формата TSSI.
Таблица 1 показва резултатите за всеки метод за преоразмеряване за всички архитектури. Моделите бяха обучени и оценени на CASIA-B за 200 епохи и ние показваме резултати за нормално ходене. За останалите ни експерименти избрахме да семплираме нагоре скелетната последователност с бикубична интерполация.


Въпреки че има няколко възможни самоконтролирани процедури за предварително обучение, ние избрахме контрастен подход за предварително обучение, тъй като това е същата процедура за действителната задача за възстановяване на разпознаването на походката. Контрастните подходи насърчават представянията, принадлежащи към един и същ клас, да бъдат близки в латентното пространство, като същевременно са отдалечени от представянията, принадлежащи към различни класове.
По-специално, ние използваме Supervised Contrastive [45] за предварително обучение. Загубата на SupCon работи върху партида с множество прегледи: всяка проба в партидата има множество разширени версии на себе си. Доказано е, че естествено е по-стабилен спрямо повредата на данните, той облекчава необходимостта от внимателен подбор на триплети, тъй като градиентът насърчава ученето от трудни примери и е по-малко чувствителен към хиперпараметри.

3.4. Увеличаване на данни
Обучението по самоконтролиран контрастен начин със загуба на SupCon предполага използването на увеличаване на данните за осигуряване на множество разширени „изгледи“ на една и съща скелетна последователност. Увеличенията, използвани за нашите ходещи скелетни последователности, са в съответствие с други разработки в тази област [10,12, 30]. Основното използвано увеличение е произволно временно изрязване с дължина на периода от T=64 кадъра.
Като се има предвид, че скелетите се проследяват за променлива продължителност от време, ние използваме изрязване, за да гарантираме, че всички последователности имат еднаква дължина. Нещо повече, ходещ човек може да промени посоката и да извърши други действия през проследяваното времетраене; следователно, изрязването предизвиква повече променливост за една и съща последователност.
Освен това променяме темпото на ходене, като забавяме или ускоряваме ходенето. Използвахме модификатори на скоростта на {{{0}}.5, 0.75, 1, 1.25, 1.5, 1.75, 2.0}. Това е адаптирано от работата на Wang et al. [48] за самоконтролирано обучение на видео представяния. Освен това пейсмодификацията е била използвана в анализа на походката в миналото [33].
Ние също така използваме произволно обръщане с вероятност от {{0}}.5, обръщане на последователността с вероятност от 0.5, адитивен шум на Гаус за всяка връзка със σ=0.005, и произволно отпадане на 5% от ставите с вероятност от 0,01 за симулиране на липсващи стави от модела за оценка на позицията.

3.5. Методи за инициализация
За да преценим въздействието на самоконтролираното предварително обучение върху предложените архитектури, ние изследваме три различни метода за инициализация. Таблица 2 показва различните набори от данни, използвани в литературата. Докато CASIA-B [6] и FVG [29] са контролирани набори от данни, използвани най-вече за оценка, ние използваме DenseGait [12] и GREW [7] за самоконтролирано предварително обучение за петте архитектури. DenseGait и GREW са две от най-големите реалистични бази данни за походка, събрани на открито, които вероятно съдържат повечето вариации на походката, поведение и сложности, присъстващи в ежедневието. Избираме тези набори от данни да имат по-общи представяния на походката, за да позволят удостоверяване на походката в общи сценарии за наблюдение.

Предварително обучение на DenseGait DenseGait е широкомащабен набор от данни за походката „в дивата природа“, събран автоматично от потоци за наблюдение. Той съдържа 217 K проследени поредици от скелети, извлечени с помощта на AlphaPose [22], в различни среди и ъгли на камера от множество географски местоположения. Тъй като DenseGait се събира автоматично, анотациите му по отношение на идентификатора за проследяване са шумни и наборът от данни може да съдържа последователности за същия предмет, въпреки че това е рядко явление. Това обаче е случаят с повечето широкомащабни немаркирани набори от данни, които съдържат проби, принадлежащи към един и същ семантичен клас, който се счита за несвързан по време на обучението. Ние обучаваме предварително всяка архитектура на DenseGait и използваме обучените параметри за по-нататъшна оценка на производителността надолу по веригата на контролираните набори от данни.
GREW Pretraining GREW е друг набор от данни на открито „в дивата природа“, но е внимателно анотиран, така че да съдържа ходещи субекти през няколко дни и различни видове дрехи. Въпреки това, за да отговаряме на изискванията на режима на самоконтрол, ние отхвърляме анотациите и третираме всяка последователност на ходене като отделно лице. GREW е 2 пъти по-малък от DenseGait, съдържащ 128 K скелетни последователности, като същевременно всеки пешеходец се проследява за по-малка средна продължителност [12]. Ние също обучаваме всяка архитектура на GREW и използваме обучените параметри за оценка на производителността надолу по веригата.
Случайна инициализация Този метод на инициализация съответства на липса на предварително обучение (т.е. обучение от нулата). Всяка архитектура се обучава с инициализация на произволно тегло върху наборите от данни надолу по веригата. Този метод е базова линия за сравняване на подобренията в производителността чрез предварително обучение.
3.6. Оценка
Изпълнението на задачата надолу по веригата се оценява по два различни начина за разпознаване на походката. Ние директно тестваме възможностите за извличане на предварително обучени архитектури, без фина настройка за конкретна задача. Този метод съответства на нулев изстрел трансфер. Освен това, ние прецизираме всяка архитектура, като използваме 10 пъти по-малка скорост на обучение, отколкото по време на предварителното обучение, с прогресивно по-малка скорост на обучение в началото на мрежата, съответстваща на политиката за затихване на скоростта на обучение по слой (LLRD) [50].
Оценката на ефективността надолу по веригата се извършва на два популярни набора от данни за разпознаване на походка: CASIA-B [6] и FVG [29]. И двата набора от данни включват малък брой субекти под строги протоколи за ходене, които се контролират от различни смущаващи фактори: ъгъл на камерата, облекло, аксесоари и скорост на ходене.
CASIA-B е набор от данни на закрито, съдържащ 124 обекта, заснети от 11 синхронизирани камери. Всеки индивид ходи в три различни условия: нормално ходене, смяна на дрехи и носене на чанта. От пускането си на пазара, той е основен елемент за сравнителен анализ на модели за гайтанализ, като е един от най-използваните набори от данни в тази област. Ние използваме първите 62 субекта като комплект за обучение и останалите 62 за оценка на представянето. За разпознаване на походка избираме да оценяваме ефективността на базата на ъгъл в настройка „оставете един извън“, при която наборът от галерия съдържа всички ъгли на ходене, с изключение на ъгъла на сондата.
Front-View Gait е друг популярен набор от данни за разпознаване на походка, включващ 226 субекта, ходещи на открито по различни протоколи. За разлика от CASIA-B, FVG включва допълнителни объркващи фактори: скорост на ходене, разхвърлян фон и изминалото време (т.е. някои субекти имат регистрирани разходки, които обхващат една година). Освен това, всички субекти са заснети с ъгъл на предната камера, който се счита за най-трудния ъгъл за разпознаване на походката, тъй като съдържа най-малко количество възприемани вариации на движението на ставите. Използвахме първите 136 предмета за обучение, а останалите за оценка на представянето. Оценката на ефективността за разпознаване на походка се придържа към протоколите, очертани от авторите, в които използваме нормалната последователност на ходене в комплекта от галерия и другите условия в комплекта на сондата.

За всички сценарии за оценка ние използваме детерминистично изрязване в центъра на последователността на ходене и не използваме никакви увеличения на тестовото време.
4. Експерименти и резултати
4.1. Оценка на CASIA-B
Ние обучаваме предварително всяка архитектура съответно на DenseGait и GREW и оценяваме производителността на CASIA-B и FVG. В първия набор от експерименти, ние се интересуваме от оценката на ефективността на CASIA-B в сценарий за фина настройка след предварително обучение, с прогресивно по-големи проби за обучение. Обучихме всяка мрежа на първите 62 самоличности, с всички налични варианти на ходене, а останалите запазихме за тестване. Оценката на разпознаване беше извършена с помощта на първите 4 проби от нормално ходене като набор от галерия, а останалите като набор от сонда. Фигура 4 показва точността за всеки от трите варианта на ходене (нормално—NM, облекло—CLm и чанта—BG) за CASIA-B. За този сценарий взехме произволна извадка от K={1, 2, 3, 5, 7, 10} разходки за обект, за ъгъл и обучихме модела. Въпреки че производителността е относително сходна между архитектурите, ясно е, че pretraining предлага значително подобрение на производителността в сравнение с произволната инициализация, независимо от избора на набор от данни преди обучението.
Освен това SimpleViT, CrossFormer и Twins-SVT изглежда имат сходна висока производителност, докато Token2Token леко изостава. Това предполага, че методът на прогресивно токенизиране, използван в Token2Token, който е специално проектиран за подобни на изображения структури, не улавя ефективно характеристиките на последователностите от походки. Има забележима разлика между наборите от данни преди тренировката: DenseGaits изглежда предлага постоянно увеличение на производителността в двата варианта на ходене (CL и BG) в сравнение с GREW. Това е показателно за факта, че DenseGait включва по-предизвикателни и реалистични сценарии, които по-добре подготвят модела за условия, при които моделът на ходене се влияе от външни фактори.



Архитектурите са обучени да картографират последователностите на ходене към пространство за вграждане, където близостта между точките отразява сходството на съответните последователности на ходене. Това означава, че вгражданията на невидими последователности на походка от една и съща идентичност трябва да са близо едно до друго в пространството за вграждане и да образуват клъстери, докато вгражданията на различни идентичности трябва да са по-далеч едно от друго и да образуват различни клъстери. Това е важно, тъй като позволява на модела да се обобщи до невидими последователности на походка и да идентифицира точно индивида чрез използване на подхода на най-близкия съсед. На Фигура 5 представяме групирането за вграждания за всяка идентичност в тестовия набор от намаляване на размерността на CASIA-Bafter с t-SNE [51]. Използвахме 256-дименсионалния вектор за вграждане и го проектирахме в две измерения. SimpleViT и CrossFormer изглежда имат най-доброто разделяне на самоличностите, независимо от гледната точка на камерата.

4.2. Оценка на FVG
По подобен начин ние оценихме производителността на всяка архитектура на FVG, която е качествено различна от CASIA-B, тъй като съдържа само един ъгъл на гледане. Ние прецизираме всяка предварително обучена мрежа на дроб f={0.1, 0.2, 0.3, {{10 }}.5, 0.7, 1.0} от 12-те бягания на човек в набора за обучение. Резултатите от фината настройка са представени на Фигура 6. Резултатите следват тенденция, подобна на тези за CASIA-B: SimpleViT и CrossFormer имат постоянно висока производителност и използването на набор от данни за предварително обучение е полезно за производителността надолу по веригата. Освен това, предварителното обучение на DenseGait изглежда води до постоянно подобрение на точността. Както отбелязват Cosma и Radoi [12], DenseGait съдържа субекти, проследявани за по-дълъг период от време и това осигурява повече вариации в целта на контрастното обучение, подобно на произволно изрязване за самоконтролирано предварително обучение за естествени изображения. Подобно на резултатите при CASIA-B, вариантът на облеклото силно изостава от нормалния сценарий за ходене.
В таблица 4 представяме по-подробни резултати от набора за тестване на FVG между предварително обучени модели, подобно на сценария CASIA-B. Резултатите от предварителната тренировка са последователни: предварителната тренировка на DenseGait пряко корелира с подобряването на точността надолу по веригата. Въпреки че предварителното обучение и на двата набора от данни подобрява производителността във всички сценарии, подобрението е особено значително в сценария CBG (Cluttered Background), който обикновено се състои от повече хора във видеото, подобно на това, което би се очаквало в реалистични настройки. Това подобрение вероятно идва от факта, че DenseGait и GREW са събрани в естествени, неконтролирани среди, което ги прави по-реалистични и предизвикателни, като по този начин подготвя по-добре модела за условия, подобни на тези в сценария CBG. Класирането между моделите е подобно на CASIA-B: SimpleViT, CrossFormer и Twins-SVT постоянно превъзхождат CaiT и Token2Token. Както за CASIA-B, така и за FVG, CaiT леко изостава от другите модели.

4.3. Тест за пространствено-времева чувствителност
Една особеност на визуалните трансформатори е произволният избор на размери на пластира, което може да се окаже решаващо за крайното изпълнение. В случай на обработка на изображения, размерите на пластира не са особено важни, поради транслационната инвариантност на семантичното съдържание в изображението.
За скелетни последователности обаче размерите на пластира съответстват на специфични и интерпретируеми характеристики на входа: височината на пластира представлява количеството пространствена информация, съдържаща се в пластира (т.е. броя на включените скелетни стави), докато времевите измерения представляват количеството включена времева информация ( т.е. брой рамки). Балансът между двете трябва да бъде внимателно обмислен при използването на адаптирани зрителни трансформатори за анализ на походката. На фигура 7 показваме топлинна карта, в която всяка клетка е представянето на обучен модел (инициализиран на случаен принцип) на CASIA-B за нормално ходене. Ние обучаваме всеки модел за 50 епохи за справедливо сравнение и за измерване на скоростта на конвергенция при фиксиран брой стъпки.
Създадохме две топлинни карти, една за SimpleViT и една за CaiT, тъй като те имат подобен основен гръбнак и е лесно да се променят размерите на корекцията. Същият процес може да се извърши за другите тествани архитектури. Ние заключаваме, че по-малките размери на кръпките съответстват на положително увеличение на производителността на моделиране за скелетни последователности, докато компромисът между пространствените и времевите измерения не е от решаващо значение, тъй като производителността е подобна - матрицата на топлинната карта е сравнително симетрична на втория диагонал. Следователно по-малките квадратни размери като (2, 4) в пространствени и времеви измерения са най-подходящи за тази задача, докато по-големите размери на кръпки като (32, 32) съдържат твърде малко дискриминираща информация. По-малкият размер на корекцията обаче просто увеличава броя на корекциите, което изисква повече изчислителна мощност. За нашата настройка на два графични процесора NVIDIA RTX 3060 ние съобщихме за грешки при недостиг на памет за някои комбинации от по-малки размери на корекция.

Най-вероятната причина за подобрената производителност с по-малки размери на кръпките е, че архитектурата може по-добре да улови сложността на модела на ходене чрез изчисляване на по-сложни взаимодействия между кръпките. Пластири с възможно най-големи пространствени размери и възможно най-малки времеви размери могат да се считат за пълно представяне на скелети, докато петна с възможно най-големи времеви размери и най-малки възможни пространствени размери улавят цялостните движения на отделната става. Както може да се види, най-високата точност се постига, когато размерът на пластира включва баланс както на пространствена, така и на времева информация, които съответстват на малки движения на тясно свързани стави.
5. Дискусия и заключения
В тази работа предоставихме цялостна оценка на пет популярни варианта на трансформатора за зрение, адаптиран за обработка на скелетна последователност. Нашите усилия са в съответствие с неотдавнашния напредък в дълбокото обучение, за да обединим по същество различните модалности под архитектурата на трансформатора. Ние предложихме метод за пространствено повишаване на дискретизацията за скелети (bicubicupsampling с TSSI скелетен формат) за изкуствено увеличаване на броя на ставите, така че последователността да може да бъде правилно консумирана от трансформаторните енкодери. Освен това, всяка архитектура беше обучена съгласно парадигмата за обучение за самоконтрол върху два общи и широкомащабни набора от данни за походката (т.е. DenseGait и GREW) и впоследствие оценена върху два набора от данни за разпознаване на походката в контролирани среди (т.е. CASIA-B и FVG). Избрахме да възприемем парадигмата за самоконтролирано обучение, за да получим общи характеристики на походката, неограничени от конкретна вариация на ходене или гледна точка на камерата.
Нашите резултати предполагат необходимостта от голямо количество, високо качество и разнообразни набори от данни за модели за анализ на походката преди тренировка. Ние показахме, че предварителното обучение на DenseGait предлага постоянни подобрения на точността спрямо GREW, поради увеличаването на размера, броя на вариациите и средната продължителност на ходенето [12]. Най-значимата полза обаче е в ситуации с малко налични данни за обучение. Нашите резултати показват, че обучението от нулата води до значително по-лоши резултати от фината настройка дори при скромни количества данни (т.е. 10 последователности на човек). Понастоящем повечето подходи към походката се изпълняват на закрито в строго контролирана среда, която не може да се обобщи до сложността на взаимодействията в реалния свят. Разнообразните набори от данни за обучение са от решаващо значение за извършване на точен анализ на поведението в дивата природа, особено след като походката е биометрична характеристика, която лесно се влияе от външни фактори на околната среда, както и от вътрешни и емоционални компоненти.

Нашето проучване за аблация показва, че по-малките пространствено-времеви петна са от полза за по-добри резултати надолу по веригата. Това прозрение информира бъдещите разработки на архитектури за скелетни последователности, които преди са разчитали на обработка на индивидуален скелет на един пач [12].
Наред с едновременните усилия за привеждане на анализа на походката в реалистични настройки, нашата работа допълнително позволява прехода на автентификация на походката и поведенчески анализ от закрита, контролирана среда към външна, реална среда. Разпознаването на походката в дивата природа ще стане повсеместно с развитието на интелигентни сензори и ефективни невронни архитектури, които обработват поведение, управлявано от движение, в реално време.


Препратки
1. Кьонг, С.; Ким, SM; Юнг, С.; Kim, DH Анализ на модела на походката и идентифициране на клинична подгрупа: ретроспективно наблюдение. Медицина 2020, 99, e19555. [CrossRef] [PubMed]
2. Михалак, Й.; Трое, NF; Fischer, J.; Волмар, П.; Хайденрайх, Т.; Шулте, Д. Въплъщение на тъга и депресия - модели на походка, свързани с дисфорично настроение. Психосома. Med. 2009, 71, 580–587. [CrossRef] [PubMed]
3. Willems, ТМ; Witvrouw, E.; De Cock, A.; De Clercq, D. Свързани с походката рискови фактори за свързана с упражнения болка в долната част на крака по време на shodrunning. Med. Sci. Спортни упражнения. 2007, 39, 330–339. [CrossRef] [PubMed]
4. Сингх, Дж.П.; Jain, S.; Арора, С.; Singh, UP Разпознаване на походка, базирано на зрението: Анкета. IEEE Access 2018, 6, 70497–70527. [CrossRef]
5. Макихара, Й.; Никсън, MS; Yagi, Y. Разпознаване на походка: Бази данни, представяния и приложения. Изчисл. Vis. Реф. Ръководство 2020,1–13.
6. Ю, С.; Тан, Д.; Тан, Т. Рамка за оценка на ефекта от зрителния ъгъл, облеклото и състоянието на носене върху разпознаването на походката. В сборника на 18-та международна конференция за разпознаване на образи (ICPR'06), Хонконг, Китай, 20–24 август 2006 г.; Том 4, стр. 441–444.
7. Джу, З.; Гуо, X.; Янг, Т.; Huang, J.; Deng, J.; Хуанг, Г.; Ду, Д.; Lu, J.; Джоу, Дж. Разпознаване на походката в дивата природа: Еталон. В сборника на Международната конференция на IEEE за компютърно зрение (ICCV), Монреал, Британска Колумбия, Канада, 11–17 октомври 2021 г.
8. Чао, Х.; Хей.; Джан, Дж.; Feng, J. Gaitset: Относно походката като набор за разпознаване на походка в кръстосан изглед. В сборника на AAAIConference on Artificial Intelligence, Хонолулу, Хай, САЩ, 27 януари–1 февруари 2019 г.; Том 33, стр. 8126–8133.
9. Фен, С.; Peng, Y.; Cao, C.; Лиу, X.; Hou, S.; Chi, J.; Huang, Y.; Li, Q.; Той, Z. Gaitpart: Темпорален част базиран модел за разпознаване на походка. В сборника на конференцията IEEE/CVF за компютърно зрение и разпознаване на образи, Сиатъл, Вашингтон, САЩ, 13–19 юни 2020 г.; стр. 14225–14233.
10. Косма, А.; Радой, IE WildGait: Учене на представяния на походката от необработени потоци за наблюдение. Сензори 2021, 21, 8387. [CrossRef][PubMed]
For more information:1950477648nn@gmail.com






