Проучване на самоконтролируеми зрителни трансформатори за разпознаване на походка в дивата природа, част 1
Nov 24, 2023
Резюме:
Начинът на ходене (походката) е мощен биометричен показател, който се използва като уникален метод за пръстови отпечатъци, позволяващ извършването на ненатрапчиви поведенчески анализи от разстояние без съдействие на субекта.
Всички знаем, че упражненията помагат за добро здраве. В допълнение към това упражненията също помагат за подобряване на паметта. Ходенето е най-простата и лесна форма на упражнение за практикуване и много хора обичат да релаксират, докато вървят или бягат. Сега повече изследвания показват, че ходенето прави мощни неща за мозъка.
Първо, ходенето стимулира нервната система на мозъка, което спомага за укрепване на мозъчната функция. Когато тялото се движи, сърдечната ни честота и кръвният поток се увеличават, което също стимулира мозъка да произвежда повече неврони и синапси. Връзките между тези неврони и синапси могат да създадат нови невронни мрежи и по-бързи мисловни процеси.
Второ, ходенето може да облекчи стреса и безпокойството, което е много важно за подобряване на паметта. Когато умът и тялото са в състояние на напрежение, депресия или тревожност, мозъкът освобождава хормон, наречен кортизол. Кортизолът уврежда невроните и синапсите в мозъка, което може да доведе до загуба на паметта. Ходенето облекчава стреса и безпокойството, намалява производството на кортизол в тялото и помага за поддържането на здрави неврони и синапси.
И накрая, ходенето увеличава кръвообращението в мозъка. Някои изследвания показват, че доброто кръвообращение може да помогне за подобряване на паметта. С напредване на възрастта кръвоносните съдове в мозъка постепенно се запушват, което води до недостатъчно снабдяване на мозъка с кислород. Ходенето може да подобри здравето на сърцето, позволявайки на сърцето да доставя кислород и хранителни вещества на мозъка по-ефективно, като по този начин насърчава паметта и мозъчната функция.
Следователно ходенето е чудесна форма на упражнения както за млади, така и за възрастни. В допълнение към подобряването на физическото здраве, ходенето може да помогне и за подобряване на паметта. Нека изминаваме разстояние всеки ден, за да бъдем по-здрави и по-добри! Вижда се, че трябва да подобрим паметта и Cistanche deserticola може значително да подобри паметта, тъй като Cistanche deserticola е традиционен китайски лекарствен материал, който има много уникални ефекти, един от които е да подобрява паметта. Ефикасността на мляното месо идва от различните активни съставки, които съдържа, включително киселина, полизахариди, флавоноиди и др. Тези съставки могат да насърчат здравето на мозъка по различни начини.

Щракнете върху познайте 10 начина за подобряване на паметта
За разлика от по-традиционните методи за биометрично удостоверяване, анализът на походката не изисква изрично сътрудничество на субекта и може да се извърши в настройки с ниска разделителна способност, без да се изисква лицето на субекта да бъде безпрепятствено/видимо. Повечето настоящи подходи са разработени в контролирана среда, с чисти анотирани данни със златен стандарт, които задвижват развитието на невронни архитектури за разпознаване и класифициране.
Едва наскоро анализът на походката се осмели да използва по-разнообразни, мащабни и реалистични набори от данни за предварително обучени мрежи по самоконтролиран начин. Режимът на самоконтролирано обучение дава възможност за изучаване на разнообразни и стабилни представяния на походката без скъпи ръчни човешки пояснения. Подтикнати от повсеместното използване на трансформаторния модел във всички области на дълбокото обучение, включително компютърното зрение, в тази работа ние изследваме използването на пет различни архитектури на трансформатор на зрението, директно приложени към самоконтролирано разпознаване на походката.
Ние адаптираме и преобучаваме простите ViT, CaiT, CrossFormer, Token2Token и TwinsSVT на два различни масива от данни за походката: GREW и DenseGait. Предоставяме обширни резултати за нулев изстрел и фина настройка на два набора от данни за разпознаване на походка, CASIA-B и FVG, и изследваме връзката между количеството пространствена и времева информация за походката, използвана от визуалния трансформатор.
Нашите резултати показват, че проектирането на трансформаторни модели за обработка на движение използва йерархичен подход (т.е. CrossFormer модели) на по-фини панаири за движение сравнително по-добре от предишните цели скелетни подходи.
Ключови думи:
разпознаване на походката; биометрично удостоверяване; трансформатор на зрението; оценка на поза; самоконтролирано обучение; контрастно обучение.
1. Въведение
Начинът, по който се движим, съдържа важни улики за нас самите. По-специално, нашата походка (начин на ходене) е внимателно изследвана в медицината [1], психологията [2] и спортната наука [3]. Напоследък анализът на походката получи повишено внимание [4,5] от общността на компютърните науки, което съвпада с експоненциалния напредък на дълбокото обучение и широко разпространената наличност на компютърен хардуер.
Задвижваните от изкуствен интелект системи за анализ на походката са успели успешно да разпознаят субекти [6–10], да оценят демографски данни като пол и възраст [11] и да оценят външни атрибути като облекло [12], без да използват каквито и да било външни знаци. Тези резултати не са изненадващи, като се има предвид голямото количество индивидуални разлики в походката, които се дължат на разликите в мускулно-скелетната структура, генетичните фактори и факторите на околната среда, както и емоционалното състояние и личността на ходещия [13].
Настоящите системи са наистина обучени и тествани само в контролирана вътрешна среда. Повечето методи използват набора от данни CASIA-B [6] като стандартен еталон за модели за разпознаване на походка, съдържащи 124 субекта, ходещи на закрито по строго контролиран начин, заснети с множество камери. Сложността в реалния свят не може да бъде напълно моделирана от такива сдържани сценарии. Едва наскоро фокусът беше върху моделирането на походката "в дивата природа", с набори от данни като DenseGait [12], GREW [7] и Gait3D [14].

Събирането на широкомащабен набор от данни, който е чист и напълно анотиран, представлява огромно усилие по отношение както на финансови ресурси, така и на отделено време. Съобщава се, че наборът от данни GREW [7] отне 3 месеца непрекъсната работа, за да бъде събран и анотиран. Въпреки че такива подходи са били полезни при разработването на невронни архитектури за обработка на походката [8, 9], те не са достатъчно разнообразни, за да бъдат правилно използвани в по-спокойна среда от реалния свят.
Общността на изкуствения интелект бавно се отдалечава от този подход в други области, като методите за самоконтролирано обучение както за зрението [15], така и за езика [16] придобиват значителна сила и често надминават традиционните контролирани методи. Скорошният напредък в самоконтролираното обучение показа, че самоконтролируемите модели са по-стабилни и проявяват възникващи поведения, които не са изрично дефинирани по време на обучението.
Например DINO [17], визуален трансформатор, обучен в режим на самоконтрол, научи специфични за клас характеристики, позволяващи неконтролирано сегментиране на обекти, без да използва такива етикети по време на обучението. Cosmaand Radoi [10] предложи първия контрастен метод за самоконтролирано обучение за анализ на гейтанализ, чрез обучение на ST-GCN [18] на по-малка версия на DenseGait [12]. Техният метод получи разумни резултати при задачи за разпознаване на походка надолу по веригата и показа, че има силна връзка между размера на предварително обучения набор от данни и производителността на нулевия изстрел.
Въпреки че много подходи за анализ на походката използват силуети, извлечени от изваждане на фона [6,8,9], извличането на силуети в реални сценарии за наблюдение предполага използването на по-усъвършенствани техники, като например сегментиране на екземпляри [19], което изисква висока изчислителна цена. Последователностите от силуети заемат значително място за съхранение и не са достатъчно гъвкави, за да бъдат използвани в други съседни задачи, като например разпознаване на дейности. Освен това, силуетите кодират фини знаци за външния вид, което прави неясно до каква степен движението се използва при идентификацията [20].
От друга страна, 2D моделите за оценка на пози стават все по-точни и изчислително ефективни [21,22]. Скелетите са евтини за извличане и в момента са по-надеждни от 3D мрежи и 3D пози, особено на разстояние. Освен това 2D скелетите са значително по-леки от силуетите по отношение на дългосрочно съхранение.
Настоящите архитектури за обработка на последователности от скелети използват естественопространствената графична структура, присъстваща в човешкия скелет, въвеждайки индуктивно отклонение в дизайна на модела. Модели като популярните ST-GCN [18] и MS-G3D [23] имат впечатляващи резултати за скелетно базирано разпознаване на действия.
Едновременно с това се наблюдава експлозия в използването на трансформаторни модели в почти всички области на задълбочено обучение след първоначалното им приложение за обработка на естествен език.
Трансформаторите се считат за по-обща архитектура, с малко индуктивни отклонения. Първоначално трансформаторите се бореха да съответстват на моделите на CNN за класифициране на изображения [24], но в момента надминават други модели и показват обещаващи резултати в сценарии със самоконтрол, повече от други типове архитектури, трансформаторите показаха впечатляващ капацитет за учене и възникващи поведения при себе си -надзор [17].
Cosma и Radoi [12] бяха първите, които предложиха GaitFormer, директна адаптация на модела на кодиращ трансформатор за разпознаване на походка, използвайки индивидуални скелети като въведени „кръпки“, по същество извършвайки само темпорално внимание, игнорирайки връзките на пространственото внимание.
GaitFormer беше обучен по самоконтролиран начин и надмина другите методи за разпознаване на походката дори без никаква фина настройка. Подобна предишна работа е окуражаваща и проправя пътя за по-задълбочено проучване на потенциалното приложение на трансформаторни архитектури за анализ на походката. Могат ли моделите на трансформатор на зрението да бъдат адаптирани за самоконтролирано обучение на представяне на скелетна походка?
Основният архитектурен проблем във визуалните трансформатори е определянето на правилните връзки между изображенията, които определят локалната и глобалната информация. Когато се прилага към походката, изборът на размери на пластира съответства на количеството кодирана времева и пространствена информация на последователността на скелета.
В тази работа представяме обширно проучване на пет различни трансформатора на зрението, адаптирани за разпознаване на походка. Ние изследваме класическия ViT модел [24], CaiT [25], CrossFormer [26], TwinsSVT [27] и ViT от токен към токен [28].

Всяка архитектура се обучава отделно по контрастиращ самоконтролиран начин върху два мащабни набора от данни „в дивата природа“ на 2D скелетни последователности на походката: DenseGait – автоматично събран набор от данни от необработени потоци за наблюдение и GREW, по-малък набор от данни, който съдържа чисти човешки анотации.
Ние изследваме възможностите за прехвърляне в два контролирани набора от данни за разпознаване на походка, CASIA [6] и FVG [29]. За всеки набор от данни анализираме директен (нулев изстрел) трансфер и ефективност на данните по време на фина настройка чрез обучение с прогресивно по-големи подмножества от наборите от данни. Освен това провеждаме аблационно проучване на връзката между пространствените и времевите измерения за размерите на пластирите за SimpleViT и CaiT , стандартните опори за повечето от трансформаторите за визуализация до момента.
Останалата част от хартията е организирана по следния начин. Ние извършваме преглед на високо ниво на свързани произведения относно модели за разпознаване на походка и трансформатори на зрението. Ние наблюдаваме, че моделите за представяне на походката имат голяма полза от самоконтролирано обучение, за да имат по-стабилни и общи вграждания, а трансформаторните модели са показали голям капацитет за моделиране в режими на самоконтролирано обучение.
Освен това, ние математически описваме петте архитектури, които сравняваме, и описваме предварителната обработка на данни и скелетните трансформации, които трябва да бъдат извършени, така че трансформаторите на визията да работят безпроблемно върху скелетни последователности. Ние също така описваме увеличения на данни, набори от данни за обучение и сравнителен анализ и експериментални настройки.
Ние демонстрираме резултати на CASIA-B и FVG за всяка от петте архитектури и двата набора от данни за „предварително обучение в дивата природа“. И накрая, ние правим аблационно изследване на връзката между пространствените и времевите размери на петна и предоставяме кратко обсъждане на нашите резултати. Ние правим нашия изходен код публично достъпен в GitHub (https://github.com/cosmaadrian/gait-vit, достъпен на 28 февруари 2023 г.) за прозрачност и възпроизводимост.
2. Свързана работа
В този раздел правим кратък преглед на съществуващите методи за разпознаване на походката в контролирана среда и „в дивата природа“. По-нататък ние описваме основните разработки на трансформаторни модели и по-специално тяхното приложение в областта на зрението.
2.1. Разпознаване на походката
Подобно на идентификацията по лицето, разпознаването на походката разчита на метрично обучение. За разлика от традиционните методи за биометрично удостоверяване, които разчитат на едно изображение (напр. разпознаване на лице) и изискват широко сътрудничество (напр. биометрично удостоверяване на базата на ириса), характеристиките на походката се обработват като последователност от моментни снимки на движение. Такава динамика на жестовете изисква повече сложност при определянето на най-информативната подпоследователност, но позволява използването на ненатрапчиво удостоверяване от разстояние.
В този контекст задачата предполага обучение на мрежа от енкодери за картографиране на последователности на ходене към пространство за вграждане, където сходството на вграждане съответства на сходството на походката. Вгражданията на разходки, които принадлежат на едно и също лице, трябва да са близо до пространството за вграждане, а тези, които идват от различни идентичности, трябва да са по-отдалечени. В това пространство за вграждане може да се направи извод чрез получаване на вграждането на последователността на походката и използване на най-близкия съсед подход върху база данни с известни разходки.
Настоящите подходи в разпознаването на базата на походка са разделени на две категории: базирани на външен вид [8,9] и базирани на модел [10,12,30]. Методите, базирани на външния вид, първо получават силуетите на ходещите субекти с алгоритми за изваждане на фона или сегментиране от всеки видео кадър.
След това последователността от силуети се подава в базирани на CNN архитектури, които извличат пространствени и времеви характеристики, които се агрегират в окончателно вграждане за разпознаване. Подходите, базирани на модели, извличат скелетите от RGB видеоклипове с модели за оценка на поза [21,22]. Последователностите от скелети обикновено се обработват от модели, които разчитат на навивки на графиката [10,30] за получаване на вграждането на походката.
GaitSet, работата на Chao et al. [8], разглежда походката като неподреден набор от силуети. Авторите твърдят, че това представяне е по-гъвкаво от последователността на силует, тъй като е устойчиво на различни подредби на рамки или комбинация от множество посоки и вариации на ходене. Те използват конволюционни слоеве за всеки силует, за да получат характеристики на ниво изображение и да ги комбинират в функция на ниво набор със Set Pooling. Те получават крайния резултат, като използват своята версия на HorizontalPyramid Matching [31].
Фен и др. [9] забелязаха факта, че специфични части от човешкия силует трябва да имат своето пространствено-времево изражение, тъй като всяка от тях има уникален модел. Тяхната архитектура, GaitPart, използва слоеве на фокална конволюция (FConvs), които са специализиран тип конволюция с по-ограничено възприемчиво поле. Авторите твърдят, че FConvs помагат на тяхната архитектура при изучаването на по-фини функции за различни части на движещото се тяло. Те също така въвеждат модулите за улавяне на микро движение, които се използват за извличане на характеристиките на малки времеви последователности.
Teepe и др. [30] предлагат GaitGraph, който използва адаптирана графична конволюционна мрежа, наречена ResGCN [32] за кодиране на пространствено-времевите характеристики, получени от последователността от скелети. Li et al. [33] предлагат PTP, което е структура, която агрегира множество времеви характеристики от един цикъл на походка въз основа на техния анализ на най-важните етапи на ходене.
Те също така използват графична конволюционна мрежа за извличане на пространствени характеристики, която работи заедно с PTP. Авторите въвеждат нов метод за увеличаване на данните, който променя походката, за да има множество стъпки в по-реалистичен цикъл.
Въпреки това, за разлика от предишните работи, ние се стремим да изследваме ефективността на архитектурите за разпознаване на походката в сценарии за самоконтрол. Вдъхновени от огромния напредък в областта на компютърното зрение, ние предлагаме да адаптираме съществуващите архитектури на трансформатори на зрението, за да работят върху скелетни последователности вместо изображения и да тестваме техния капацитет за моделиране в сценарии със самоконтрол. Повечето други разработки [8,9,30] съсредоточават усилията си върху разработването на невронни архитектури, които постигат впечатляващи резултати при разпознаването на походката върху контролирани набори от данни.
Ние обаче възнамеряваме да премахнем необходимостта от много скъпи ръчни анотации за набори от данни за походката и да проучим начините, по които самоконтролираното обучение е подходящо за анализ на походката.

Предишни работи в тази област [10,12] показаха потенциал за изучаване на добри представяния на походката от слабо анотирани масиви от данни. Cosmaand Radoi [12] предложи GaitFormer, първата базирана на трансформатор архитектура за обработка на скелетни последователности, вдъхновена от модела ViT [24]. Подобно на [12], ние се опитваме да изследваме производителността на други модели трансформатори на зрението, с различна пространствена и времева динамика в механизма за обработка на кръпки. В миналото бяха предложени широкомащабни набори от данни за разпознаване на походка [7,12], което позволява разработването на общи архитектури за обучение на представяне.
For more information:1950477648nn@gmail.com






