Разпознаване на пътни знаци, базирано на алгоритъма YOLOv3, част 2
Jan 19, 2024
2. Основи на алгоритъма
2.1. Алгоритъмът YOLOv3
YOLOv3 [14] е подобреният, едноетапен алгоритъм за откриване на цели на Redmon, базиран на YOLOv2, който има подобрена точност на откриване и производителност в реално време и превъзхожда други алгоритми по отношение на скорост и точност.
През последните години бързото развитие на технологията за изкуствен интелект даде възможност различни интелигентни системи за откриване да бъдат приложени в различни области. Точността на откриване е важен показател за оценка на качеството на една интелигентна система, а паметта е една от основните възможности, които поддържат работата на една интелигентна система. И така, каква е връзката между двамата?
На първо място, трябва да изясним, че точността на откриване и паметта не са проста „положителна корелация“ или „отрицателна корелация“. Между тях има висока степен на взаимодействие и координация. В много случаи точността на откриване на интелигентна система зависи от нейната памет, тоест способността й да разбира и научава примерни данни.
Например, в областта на разпознаването на лица, добрата система за разпознаване на лица трябва да може точно да идентифицира различни лица и да ги съпоставя с информацията за лицето в базата данни с известни лица. Това изисква интелигентната система да има силна памет, да може да съхранява информацията за познати лица в базата данни и да я използва гъвкаво при последващи задачи за разпознаване.
По подобен начин в областта на медицината интелигентните системи трябва да разберат и запомнят голямо количество медицински знания, за да помогнат на лекарите при диагностицирането на заболяването и плана за лечение. Това също така изисква интелигентната система да има силна памет и способности за учене, непрекъснато да усвоява нови медицински знания и да извършва кръстосана проверка и надграждане със съществуващата база от знания.
Разбира се, връзката между точността на откриване и паметта не е еднопосочна. Напротив, добрата точност на откриване може също да насърчи подобряването на паметта на интелигентните системи. Например, при някои задачи за класифициране и разпознаване, интелигентните системи трябва непрекъснато да предоставят обратна връзка и оптимизация, за да подобряват непрекъснато своята точност и прецизност, като по този начин допълнително укрепват способността за разбиране и запомняне на примерни данни.
Като цяло, точността на откриване и паметта са два незаменими елемента за работата на интелигентните системи. Те имат сложни взаимодействия и взаимоотношения, които трябва да бъдат напълно обмислени и координирани. Само чрез непрекъснато подобряване на точността на откриване и непрекъснато укрепване на паметта и възможностите за учене на интелигентната система може наистина да се реализира цялостното развитие и прилагане на интелигентната система. Вижда се, че трябва да подобрим паметта и Cistanche deserticola може значително да подобри паметта, тъй като Cistanche deserticola може също да регулира баланса на невротрансмитерите, като например повишаване на нивата на ацетилхолин и растежни фактори. Тези вещества са много важни за паметта и ученето. В допълнение, месото може също да подобри притока на кръв и да насърчи доставката на кислород, което може да гарантира, че мозъкът получава достатъчно хранителни вещества и енергия, като по този начин подобрява мозъчната жизненост и издръжливост.

Щракнете върху познайте добавките за увеличаване на паметта
YOLOv3 в момента е най-популярният алгоритъм в семейството YOLO и се използва широко в реални сценарии за откриване [15]; структурата на мрежата YOLOv3 е показана на фигура 1.

Пълната конволюционна структура, използвана от YOLOv3, не е ограничена от размера на входното изображение.
Слоевете за обединяване и напълно свързаните слоеве се премахват от цялата структура на мрежата и се използва конволюционен слой с размер на стъпката 2 вместо слоя за обединяване за операцията за намаляване на дискретизацията, което предотвратява загубата на целева информация по време на обединяване и улеснява откриването на малки цели [ 16].
Освен това YOLOv3 заменя мрежовата структура DarkNet-19 на YOLOv2 със слоя за извличане на функции DarkNet-53.
Мрежата DarkNet-53, която успешно разрешава проблема с градиента на дълбоката мрежа и загубата на оригинална информация по време на многослойната конволюционна операция за по-добро извличане на характеристики и подобряване на откриването и класифицирането [17], заимства остатъчната мрежова структура на ResNet [ 18] и използва оригиналния изход на предишния слой като част от входа в последния слой на мрежата.
Както е показано на фигура 2, остатъчният модул в YOLOv3 се състои от два конволюционни слоя и слой за бърз достъп.

Освен това, YOLOv3 използва понятието мрежа от пирамида на функции (FPN) (19] и въвежда мрежата от пирамида на функции за прогнозиране на карти на характеристики в три мащаба, със скали за откриване от 13 x 13, 26 x 26 и 52 x 52.
Методът за извличане на характеристики от конволюционната невронна мрежа е отдолу нагоре в FPN мрежата, а процесът на повишаване на дискретизацията на картите на характеристиките на конволюционния слой е отгоре надолу, както е показано на фигура 3.
2.2. Пространствена пирамидална обединяваща структура
Структурата за пространствено пирамидално обединяване (SPP) (20) решава проблема с многократното извличане на характеристиките на изображението чрез конволюционни невронни мрежи и значително подобрява ефективността на откриване; структурата на мрежата SPPNet е показана на фигура 4.

За да се гарантира, че разделителната способност на входното изображение съответства на измерението на функцията на напълно свързания слой в невронна мрежа с напълно свързан слой, са необходими операции за изрязване и мащабиране на региона на входното изображение.
Процесите на мащабиране и изрязване ще доведат до загуба на информация за характеристиките на картината, намалявайки точността на откриване и засягайки резултатите от откриването: процесите на мащабиране и изрязване обаче ще доведат до загуба на точността на откриване на информацията за характеристиките на картината и ще повлияят на резултатите от откриването, докато SPPNet може да преодолее ограниченията на фиксиран размер на входното изображение, спестявайки изчислителните разходи 21.

3. Подобрен YOLOv3
3.1. Подобрена YOLOv3 мрежова структура
Мрежата за извличане на основна характеристика обикновено се намалява пет пъти, с честота на намаляване на дискретизацията 2, а кратността на петкратното намаляване на дискретизацията е 32 на пета степен от две, според описанието на набора от данни на COCO.
Ако намаляването на дискретизацията продължи, получената карта на характеристиките ще бъде една и целевата информация ще бъде загубена. Малките цели са по-малко от 32 × 32 пиксела, средните цели са 32 × 32–96 × 96 пиксела, а гигантските цели са по-големи от 96 × 96 пиксела [22].
Както е показано на Фигура 5, наборът от данни за пътни знаци TT100K, използван в тази работа, се състои предимно от малки и средни цели, като големите цели представляват само 7,4% от общия набор от данни, а малките цели представляват 42,5% [23].

Наборът от данни TT100K има висока разделителна способност, като всяко изображение има разделителна способност от 2048 × 2048 пиксела, а най-големите пътни знаци сред малките цели представляват по-малко от 0,1% от цялото изображение, което представлява значително предизвикателство за целта алгоритъм за откриване.
Малките цели имат ограничени функции и изискват голяма прецизност на локализирането.
Въпреки въвеждането на FPN структурата в YOLOv3 за използване на многомащабно сливане на функции за създаване на прогнози чрез сливане на констатациите на различни слоеве на характеристики, което е критично за идентификация на малки цели, резултатите все още бяха незадоволителни.
В мрежата YOLOv3 плиткият слой съдържа по-малко семантична информация за характеристиките, но точно целево местоположение, докато дълбокият слой има повече, но грубо целево местоположение.
В резултат на това плитките конволюционни слоеве се използват за прогнозиране на малки цели, а дълбоките конволюционни слоеве се използват за прогнозиране на големи цели. Четвърта скала за прогнозиране на функции с размер 152 × 152 беше добавена към трите скали за прогнозиране на функции на YOLOv3network структурата, за да се използват напълно плитките характеристики в мрежата за предвиждане на малки цели.
С размер на входното изображение от 608 × 608, размерът на характеристиката на изходното изображение беше 152 × 152 след свиване и двукратно повишаване на дискретизацията на входното изображение, а слоят на характеристиките беше индуциран чрез слоя за маршрутизиране; това извличане на характеристики беше слято с функцията на 11-ия слой, за да се увеличи скалата за прогнозиране на четвъртата характеристика.
Освен това модулът SPP беше добавен, за да се реализира сливането на локални и глобални характеристики чрез заимстване на понятието SPPNet и комбинирането му с YOLOv3.
Преди слоя за откриване на YOL, модулът SPP беше интегриран между петия и шестия конволюционен слой, а картите на характеристиките на модула SPP и обединените карти на характеристики бяха повторно свързани и предадени на следващия мрежов слой за откриване.

За да се постигне сливането на ниво карта на характеристики на локални и глобални функции, максималното ядро за обединяване на SPP модула трябва да бъде възможно най-близко до размера на картата на функциите, която ще бъде обединена.
За да се сведат до минимум изчислителните усилия, причинени от SPP модула, да се обогати възможността за изразяване на картата на характеристиките и да се увеличи въздействието на откриването, SPP модулът в това изследване беше съставен от два паралелни клона, всеки от които беше съставен от 19 × 19 максимален обединяващ слой и ajump Връзка. Фигура 6 изобразява подобрената структура на мрежата YOLOv3.

3.2. Подобрена функция за загуба
Функцията за загуба на YOLOv3 се състои от загуба на централна координата (загуба), загуба на координата ширина-височина (загуба), загуба на доверие (lossconf) и загуба на класификация (загуба). Централната загуба на координата е представена от:

където λcoord означава теглото на загубата на координати; λnoobj обозначава теглото на загубата на доверие без обект; Iobjij обозначава дали j-тото анкерно поле на i-тата клетка е отговорно за обекта (1 или 0); Inobbyij обозначава j-тата анкерна кутия на i-тата мрежа, която не е отговорна за обекта; (xi,yi,wji,hjI, CjI, Pji) обозначава прогнозираните координати на целевата кутия, увереност и категория; и (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) обозначава реалните координати на целевата кутия, увереност и категория
Функцията на загуба на YOLOv3 е представена от уравнение (5), където функцията на загуба на средна квадратична грешка (MSE) се използва за регресия на ограничителната кутия, а кръстосаната ентропия се използва като функция на загуба в lossconf и locals.
загуба=lossxy + losswh − losscon f − losscls (5)
Въпреки това, използването на MSE като регресионна функция на загубата на ограничаващата кутия е неблагоприятно за откриване на малки цели, чувствително към мащаба на обекта и се фокусира върху големи цели, като същевременно е неблагоприятно за малки обекти.
За да се балансира загубата на големи и малки цели и да се максимизират резултатите от откриването чрез отслабване на влиянието на размера на ограничителната кутия върху функцията за загуба на ширина и височина, функцията на загуба от тип IoU беше използвана в тази статия, а метричната загуба, генерирана от IoU, беше използвана като уравнение за ефективност (6).
IoU+%7b%7b0%7d%7d%7cA+%e2%88%a9+B%7c%7cA+%e2%88%aa+B%7c(6)
Когато ограничителната кутия и целевата кутия не се припокриват, IoU=0 не отразява разстоянието между двете кутии; когато полето за прогнозиране и означеното поле се припокриват напълно, IoU=1, централната точка на ограничаващото поле не може да бъде определена и разликата в размера с целевото поле не може да бъде допълнително оптимизирана.
DIoU загуба [24] не зависи от размера; по този начин големите размери няма да доведат до големи загуби. Тъй като малък размер води до малка загуба, която може да реши проблема, тази работа използва загубата DIoU, чиято формула за изчисление е представена в уравнение (7).
D IoU загуба=1 − IoU +ρ2 b, bgt c2(7)
където b и bgt означават централните точки, ρ е евклидовото разстояние, а c е дължината на диагонала на най-малката ограждаща кутия, покриваща двете кутии.
Загубата на DIoU минимизира разстоянието между два целеви кадъра директно, конвергира бързо и е по-в съответствие с регресионния механизъм на целевия кадър, който отчита разстоянието между целта и котвата, степента на припокриване и мащаба, което прави регресията на целевия кадър по-голяма стабилен, като същевременно осигурява посоката на градиента за ограничаващата кутия, когато не се припокрива с целевата рамка.

For more information:1950477648nn@gmail.com






