Класификационна прогноза за рак на гърдата въз основа на машинно обучение

Sep 12, 2023

Ракът на гърдата е най-често срещаният и смъртоносен вид рак в света. Въз основа на алгоритми за машинно обучение като XGBoost, произволна гора, логистична регресия и K-най-близък съсед, тази статия установява различни модели за класифициране и прогнозиране на рак на гърдата, за да предостави справка за ранна диагностика на рак на гърдата. Припомнянето показва вероятността за откриване на ракови клетки при медицинска диагноза, което е от голямо значение за класификацията на рака на гърдата, така че тази статия приема припомнянето като първичен индекс за оценка и разглежда прецизността, точността и оценката на F1-скора индикатори за оценка и сравняване на прогнозния ефект на всеки модел. За да се елиминира влиянието на различните размерни концепции върху ефекта на модела, данните са стандартизирани.

Алгоритъмът за най-близък съсед K е един от най-основните алгоритми в областта на машинното обучение. Неговата основна идея е да намери K проби, които са най-близо до целевата проба, и след това да предскаже етикета на целевата проба въз основа на етикетите на тези K проби. В човешкото ежедневие често използваме подобни методи за вземане на решения. Например, когато се сблъскаме с определен проблем, ние си спомняме подобни ситуации, които сме срещали преди, след което търсим най-сходните ситуации и вземаме решения въз основа на техните резултати. Разработване на решения. Следователно алгоритъмът за K най-близък съсед е тясно свързан с човешката памет.

На първо място, K алгоритъмът за най-близък съсед изисква голям брой набори за обучение, за да научи и установи структура от данни на графиката на най-близкия съсед. По същия начин хората трябва постоянно да изпитват различни неща и да съхраняват тези преживявания в паметта. Само чрез натрупване на голямо количество опит и знания можем да вземаме по-точни решения и преценки.

Второ, алгоритъмът за K най-близък съсед подчертава влиянието на сходството върху прогнозата. По същия начин, когато вземат решения, хората често първо вземат предвид минали преживявания и се опитват да намерят преживявания, подобни на текущата ситуация, за справка. Този процес на намиране на прилики също е една от важните характеристики на паметта.

И накрая, в K алгоритъма за най-близък съсед, стойността на K има голямо влияние върху резултатите от прогнозата. Различните стойности на K ще доведат до различни резултати при прогнозиране. По същия начин, когато хората си припомнят минали преживявания, те трябва да изберат различни отправни точки и методи в зависимост от текущата ситуация. Тази гъвкавост и адаптивност също е важна характеристика на паметта. Вижда се, че трябва да подобрим паметта си. Cistanche deserticola може значително да подобри паметта, тъй като Cistanche deserticola е традиционен китайски лекарствен материал с много уникални ефекти, един от които е да подобрява паметта. Ефикасността на мляното месо идва от различните активни съставки, които съдържа, включително киселина, полизахариди, флавоноиди и др. Тези съставки могат да насърчат здравето на мозъка по различни начини.

increase memory power

Кликнете върху Know, за да подобрите краткосрочната памет

За да се намери оптималното подмножество и да се подобри точността на модела, 15 характеристики бяха отсеяни като входни данни към модела чрез корелационния тест на Pearson. Моделът на K-най-близкия съсед използва метода за кръстосано валидиране, за да избере оптималната k стойност, като използва извикване като индекс за оценка. За проблема с дисбаланса на положителната и отрицателната извадка се използва методът на йерархична извадка за извличане на набора за обучение и набора от тестове пропорционално според различните категории. Експерименталните резултати показват, че при различни разделения на набора от данни (8: 2 и 7: 3), прогнозният ефект на един и същ модел ще има различни промени. Сравнителният анализ показва, че моделът XGBoost, установен в тази статия (който разделя набора за обучение и набора от тестове на 8: 2) има по-добри ефекти и неговото припомняне, прецизност, точност и F1-резултат са 1.{{ 11}}, 0.960, 0.974 и 0,980, съответно.

1. Въведение

През последните десет години заболеваемостта от рак на гърдата в Китай се е увеличила с 47%, като заболеваемостта се увеличава от година на година, а честотата на рака на гърдата постепенно намалява [1]. Патогенезата на рака на гърдата е свързана с личните хормони, семейната история, брака и историята на раждаемостта [2]. Ракът на гърдата не се открива лесно в ранен стадий и има характеристиките на ранна възраст на начало, но късно представяне [3, 4]. Понастоящем основната диагноза на рака на гърдата се основава на три метода: пункционна цитология [5], ултразвуково сканиране [6] и рентгенова мамография [7]. Ако пациентът бъде хванат рано за рак на гърдата, толкова по-вероятно е той да бъде излекуван и толкова по-добра е прогнозата. Ето защо редовният преглед и ранната диагностика са много необходими за профилактиката и навременното откриване на рака на гърдата.

В областта на медицината създаването на модели чрез методи за машинно обучение може да помогне на лекарите да подобрят степента на откриване на рак, за да постигнат целта за ранно откриване и ранно лечение. Методите за машинно обучение са дали добри резултати при диагностицирането на рак [8, 9]. Wu и др. [10] наблюдават морфологията на клетките под микроскоп и откриват, че има очевидни разлики между клетките на рака на гърдата и параметрите на нормалните здрави клетки. Това откритие предоставя теоретична основа за много изследвания. Въпреки че в момента има много методи за машинно обучение, прилагани за класифициране на клетки от рак на гърдата, нито един алгоритъм не може да се приложи към всички проблеми. Всеки тип алгоритъм за машинно обучение има свои области на експертиза, така че изборът на алгоритъм е различен в различните сценарии.

Шен и др. [11] използва модела XGBoost за класифициране и прогнозиране на рака на гърдата и точността достига 97.86%, а припомнянето достига 95,83%. Deng и др. [12] използва алгоритъма XGBoost за класифициране и прогнозиране на рак на гърдата с точност 0.96 и припомняне на 0.97. Monirujjaman Khan и др. [13] използва множество модели за машинно обучение за идентифициране на рак на гърдата и произволна гора, дърво на решенията, K-най-близък съсед и логистична регресия бяха алгоритмите с по-висок F1-резултат, 96%, 95%, 90%, и съответно 98%. Bhardwaj и др. [14] използва многослоен перцептрон (MLP), K-най-близък съсед (KNN), генетичен алгоритъм (GP) и произволна гора (RF), за да класифицира доброкачествени и злокачествени клетки от рак на гърдата и експерименталните резултати показват, че оптималният класификатор е RF с точност на класификация от 96,24%. Донг и Ма [15] изследваха възможните маркери за тройно отрицателен рак на гърдата и бяха използвани алгоритми за машинно обучение, за да предскажат дали хората имат тройно отрицателен рак на гърдата. Резултатите показват, че точността на модела за прогнозиране на класификацията на опорната векторна машина (SVM) достига 97,8%.

За да подобрят точността на методите за идентифициране на рак на гърдата и да подобрят алгоритмите за машинно обучение, Wang et al. [16] предложи претеглен AUC ансамбъл модел за обучение, базиран на SVM за диагностициране на рак на гърдата, използвайки C-SVM и V-SVM с 6 функции на ядрото за увеличаване на разнообразието на набора от базови модели и сравняване на различни резултати от решения с Area Integration (WAUCE ) модел под претеглената приемна работна характеристична крива. Резултатите показват, че върху малкия набор от данни предложената WAUCE структура намалява дисперсията на диагностичната точност с до 69,23% и подобрява точността с 0.94%. Zheng и др. [17] тестваха набора от данни за рака на гърдата в Уисконсин (WDBC) според K-средните и хибридният алгоритъм на машината за поддържащ вектор извлича туморни характеристики и диагностицира рак на гърдата и резултатите показват, че хибридният алгоритъм подобрява точността до 97,38%. Jia и др. [18] предложи нов алгоритъм за оптимизиране на популацията, алгоритъм за оптимизация на китове (WOA), който интелигентно настройва параметрите на SVM модела, а експерименталните резултати показват, че производителността на WOA-SVM модела е значително по-добра от тази на традиционния модел за разпознаване на рак на гърдата, с точност от 97,5%.

За да решат проблема с пренастройването на техниките за машинно обучение в класификацията на рака на гърдата, Singh et al. [19] предложиха функционално свързана изкуствена невронна мрежа (FLANN) и експериментално установиха, че моделът има висока точност за ранна диагностика на рак на гърдата. Махеш и др. [20] предлагат ансамбълна техника за прогнозиране на рак на гърдата XGBoost, базирана на известни модели на характеристики, като първо се използва технология за свръхсемплиране на синтетично малцинство (SMOTE) за справяне с дисбаланса на данните и проблемите с шума и след това с помощта на класификатора на Bayes, класификатора на дървото на решенията и съответно произволната гора , комбиниран с XGBoost и класифициране на данните. Според експериментален анализ ансамбълният класификатор XGBoost-Random Forest има процент на точност от 98,20% при ранното откриване на рак на гърдата.

Въз основа на XGBoost, произволна гора, логистична регресия, K-най-близкия съсед и други методи за машинно обучение, този документ установява различни модели за класифициране и прогнозиране на рак на гърдата, което предоставя справка за ранна диагностика на рак на гърдата. Когато повечето проучвания прилагат модели на машинно обучение за диагностициране на клетки от рак на гърдата, те се фокусират върху използването на прецизността, точността и F1-резултата на модела като индикатори за оценка на качеството на модела, като същевременно пренебрегват медицинското диагностично значение на припомнянето на модела, което показва съотношението на прогнозираните злокачествени клетки от рак на гърдата и колкото по-високо е припомнянето, толкова по-голяма е вероятността злокачествените клетки да бъдат предсказани в клетките на рака на гърдата. Следователно тази статия приема припомнянето като основен индекс и взема предвид прецизността, точността и F1-резултат, за да оцени използвания модел.

В процеса на моделиране предварителната обработка на данни е много важна част и ефектът от прогнозния модел е различен в зависимост от метода на обработка. За да се елиминира влиянието на различните размерни концепции върху ефекта на модела, данните са стандартизирани. За да се намери оптималното подмножество и да се подобри точността на модела, изборът на характеристики беше направен според коефициента на корелация на Pearson между променливата на характеристиките и целевата променлива. За проблема с дисбаланса на положителната и отрицателната извадка се използва методът на йерархична извадка за извличане на набора за обучение и набора от тестове пропорционално според различните категории. Като се има предвид, че ефектът на прогнозиране на моделите за машинно обучение варира при различните разделения на набори от данни, тази статия ще използва различни разделения на набори от данни (8: 2 и 7: 3) като два набора от експерименти, за да наблюдава ефекта на прогнозиране на модела, установен в тази статия.

2. Предварителна обработка на данни

2.1. Въвеждане на данни. Наборът от данни, използван в тази статия, е данните за рака на гърдата в набора от данни на UCI, предоставен от известния д-р Уилям от Изследователския институт по клинична медицина на Университета на Уисконсин [21]. Характеристиките се изчисляват от дигитализирано изображение на аспират с тънка игла (FNA) на гръдна маса. Те описват характеристиките на клетъчните ядра, присъстващи в изображението. Наборът от данни съдържа 569 експериментални проби, включително 357 доброкачествени проби и 212 злокачествени проби от рак на гърдата. За клетките, извлечени от всеки експериментален обект, се събират основно следните десет характеристики на неговото ядро: радиус (средно на разстоянието от центъра до точките по периметъра), периметър, гладкост (локални вариации в дължините на радиуса), площ, компактност ( периметър ∗ ∗ 2/област-1.0), вдлъбнатина (сериозност на вдлъбнати части от контура), симетрия, текстура (стандартно отклонение на стойностите в сивата скала), вдлъбнати точки (брой вдлъбнати участъци на контура) и фрактално_измерение („приближение на бреговата линия“-1). Средната стойност, стандартната грешка и "най-лошата" или най-голямата (средна от трите най-големи стойности) на тези характеристики бяха изчислени за всяко изображение, което доведе до 30 характеристики. Класификационният етикет представлява вида рак на гърдата. Следователно наборът от примерни данни съдържа общо 30 характеристики и една примерна характеристика на етикета (злокачествени и доброкачествени).

2.2. Стандартизация на данните.

Чрез наблюдение на обхвата на стойността на всяка характеристика се установява, че стойностите на данните за различните характеристики се различават значително. В някои модели различните измерения оказват голямо влияние върху ефекта на прогнозиране. Например алгоритъмът за k-най-близък съсед, базиран на разделяне на разстояние, трябва да поддържа измерението на данните последователно, така че данните трябва да бъдат стандартизирани преди моделиране. Въпреки това, някои модели са по-малко засегнати от размерността, като алгоритъма за произволна гора. За да бъде експериментът сравнителен, данните от различни модели се третират по един и същи начин.

За проблеми с различни размери на примерни данни, често използваните методи за безразмерна обработка включват стандартизация на данни, а методите за стандартизация на данни включват стандартизация Min-max и стандартизация Z-score. Сред тях, когато използваните данни имат отклонения извън обхвата на стойността или максималните и минималните стойности на някои индикатори са неизвестни, може да се използва стандартизацията на Z-скор.

increase memory

В тази статия, според характеристиките на WDBC набора от данни за рак на гърдата, стандартизацията на Z-резултат беше избрана за обработка на данните. Данните, обработени от стандартизацията на Zscore [22] следват стандартно нормално разпределение, тоест средната стойност е 0 и дисперсията е 1. Формулата за стандартизация на Z-score е както следва:

improve memory

2.3. Избор на функция. Като важна част от процеса на предварителна обработка на данни, изборът на функции е да се намери оптималното подмножество. Изборът на функции може да намали излишните и безполезни функции, за да подобри точността на модела. Методът за избор на характеристики обикновено се разделя на метод на преосмисляне, метод на капсулиране и метод на вграждане. Методът на филтриране може да бъде независим от алгоритъма, използван по-късно в изследването, и има висока изчислителна ефективност и силна способност за обобщение [23], така че методът за избор на характеристики в тази статия използва метода на филтриране, а общото обобщение на метода в метода на филтриране е показано в таблица 2.

Данните за рак на гърдата след 0 средна нормализация отговарят на изискванията на теста за корелационен коефициент на Pearson при метода на филтриране; така че в тази статия корелационният коефициент на Пиърсън [24] се използва за тестване на корелацията между всяка характеристика и целевата променлива. Формулата на корелационния коефициент на Пиърсън е както следва:

boost memory


3. Моделна конструкция
В тази статия категориите рак на гърдата се прогнозират въз основа на XGBoost, произволна гора, логистична регресия и K-най-близкия модел на съсед, съответно. Злокачественият рак на гърдата се счита за положителна проба, докато доброкачественият рак на гърдата се счита за отрицателна проба

За да се реши проблемът с дисбаланса на извадката, тази статия използва метод на стратифицирана извадка [25] за извличане на набора за обучение и набора от тестове пропорционално на всички видове данни за извадки. Стратифицираната извадка се нарича още типова извадка. Извадката от съвкупността е разделена на субпопулации, които са независими една от друга. Произволното вземане на проби беше извършено пропорционално на всяка субпопулация. Стратифицираната извадка извлича по-представителна извадка и е по-подходяща за небалансирани извадки.

Различното разделяне на набор от данни може да доведе до различни ефекти на модела. Следователно тази статия извършва две групи експерименти според различно разделение на набора от примерни данни. Първата група раздели набора от данни на набор за обучение и набор за тестване в съотношение 8:2, а втората група раздели набора от данни на набор за обучение и набор за тестване в съотношение 7:3. Наблюдавайте производителността на модела на четирите алгоритъма при различно разделяне на набор от данни.

3.1. Индикатори за оценка. В това проучване точността, прецизността, припомнянето и F1-резултатът [26, 27] бяха използвани за оценка на прогнозния ефект на модела. Като се има предвид спецификата на медицинската диагноза, се очаква, че всеки злокачествен рак на гърдата може да бъде предвиден. Следователно припомнянето се приема като важен индекс за оценка тук. Колкото по-голямо е припомнянето, толкова по-голям е делът на злокачествения рак на гърдата, който може да бъде предвиден. Резултатите от класификацията на модела могат да генерират матрица на объркване [28], както е показано в таблица 4

Тук TP е истински положителен, указващ броя на положителните проби, прогнозирани като положителни проби. TN е истински отрицателен, показващ броя на отрицателните проби, прогнозирани като отрицателни проби. FP е фалшиво положително, което показва броя на положителните проби, прогнозирани от отрицателните проби, което се нарича грешка тип 1. FN е фалшиво отрицателен, показващ броя на положителните проби, прогнозирани като отрицателни проби, което се нарича грешка тип 2

Прецизност, съкратено като P. За предвидените резултати прецизността представлява колко от положителните прогнозирани проби са положителни проби и формулата е:

10 ways to improve memory

short term memory how to improve

3.2. Модел за прогнозиране на рак на гърдата, базиран на XGBoost. XGBoost, съкращение от extreme gradient boosting, е алгоритъм за усилване [29]. Както XGBoost, така и произволната гора са интеграционни алгоритми, базирани на дървото на решенията. За разлика от алгоритъма за пакетиране, алгоритъмът за повишаване изгражда слаби обучаеми един по един, натрупвайки множество слаби обучаеми чрез непрекъсната итерация [30]. Целевата функция е

ways to improve memory

. (9) Добавянето на регулярни термини може да намали дисперсията на модела и да направи модела, получен от набора за обучение, по-опростен, за да се предотврати появата на преобразуване. Алгоритъмът XGBoost се използва за обучение на модела върху набора от данни за обучение. В процеса на обучение на модела параметрите се коригират, за да се получи по-добър набор от параметри и накрая се получава оптималният прогнозен модел. Моделът е използван за прогнозиране на категории рак на гърдата в

настройка. Когато наборът от данни беше разделен на обучителен набор и тестов набор с 8:2, точността, прецизността, припомнянето и F1-резултатът на модела XGBoost бяха 0.974, {{5} }.960, 1.00 и 0.980, съответно. Когато моделът XGBoost беше разделен на набор за обучение и набор за тестване в съотношение 7:3, точността, прецизността, припомнянето и F1-резултатът на модела XGBoost бяха 0.959, {{20} }.946, 0.991 и 0.968, съответно. Резултатите показват, че моделът XGBoost има по-добра производителност при прогнозиране, когато наборът от данни е разделен на 8: 2. Степента на припомняне от 1 показва, че моделът XGBoost правилно е предвидил всички злокачествени ракови заболявания на гърдата в пробата, което е много важно за медицинската диаграма

осис. 3.3. Модел за прогнозиране на рак на гърдата, базиран на случайна гора. Случайната гора е алгоритъм за контролирано обучение, който интегрира множество дървета чрез идеята за Bagging [31–33]. Методът на първоначално зареждане се използва за извличане на обучителния набор от извадки от оригиналните примерни данни и съответният модел на дървото на решенията се обучава за всеки обучителен набор. Накрая се гласува за всички базови класификатори и този с най-много гласове е крайната категория.

ways to improve brain function

кървав. Когато наборът от данни беше разделен на тренировъчен набор и тестов набор с 8: 2, точността, прецизността, припомнянето и F1-резултатът на произволния горски модел бяха 0.965, {{5 }}.947, 1.00 и 0.973, съответно. Когато наборът от данни беше разделен на обучителен набор и тестов набор от 7 : 3, точността, прецизността, припомнянето и F1- резултатът бяха 0.953, 0.946, { {18}}.981 и 0.963, съответно. Резултатите показват, че произволният горски модел има по-добра производителност на прогнозиране, когато наборът от данни е разделен на 8: 2. Степента на припомняне на този модел също е 1, което показва, че произволният горски модел също правилно е предсказал всички злокачествени гърди.

memory enhancement

но л. Трите основни елемента на алгоритъма за k-най-близък съсед са измерване на разстоянието, избор на k-стойност, решаване на класификация. Трите основни елемента на алгоритъма за k-най-близък съсед са измерване на разстоянието, избор на k-стойност и правило за вземане на решение за класификация.

За проблема с избора на стойност на K в алгоритъма на най-близкия съсед, тази статия използва метода на десетократно кръстосано валидиране (38, 39) и приема скоростта на извикване като индекс за оценка на модела, за да избере подходяща стойност на k. Нека диапазонът на стойността на k е 1–40 и за всяко k се извършва десетократно кръстосано валидиране. Стойността k с максимална скорост на извикване е оптималната k стойност. Извикването на различни k стойности при десетократно кръстосано валидиране е показано на фигура 1.

Може да се види от Фигура 1, че с увеличаване на стойността на k, извикването намалява. Когато k �3 и k �5, извикването е най-голямо. Тъй като стойността на k е зададена твърде малка, е лесно да се пренастрои, така че стойността на k е зададена като 5 тук.

Когато наборът от данни беше разделен на тренировъчен набор и тестов набор с 8: 2, точността, прецизността, припомнянето и F1-резултатът на k-най-близкия модел Neighbor бяха 0.912, { {6}}.888, 0.986 и {{10}}.934, съответно. Когато наборът от данни беше разделен на тренировъчен набор и тестов набор със 7 : 3, точността, прецизността, припомнянето и F1-резултатът бяха 0.930, {{21} }.906, 0.991 и 0.946, съответно. Резултатите показват, че моделът на k-най-близкия съсед има по-добра производителност на прогнозиране, когато наборът от данни е разделен на 7:3.

4. Сравнение и анализ

За по-добро разбиране на ефективността на модела, установен в тази статия, тази статия се основава на средата за разработка на Python 3.9.7 и използва данните за рак на гърдата, предоставени от д-р Уилям от Института за клинични медицински изследвания на Университета на Уисконсин за експерименти.

Експерименталната среда е операционна система Windows 11, процесорът е Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GHz, а паметта е 8.00 GB.

Експерименталните параметри на всеки модел са показани в таблица 5 и ще бъдат извършени следните три резултата от сравнителен анализ: (1) сравнение на производителността на всеки модел в тази статия, когато наборът от данни е разделен на обучителен набор и тестов набор в 8 : 2. (2) Сравнение на производителността на всеки модел в тази статия, когато наборът от данни е разделен на набор за обучение и тестов набор в 7 : 3. (3) Сравнение с някои модели в литературата [11–14].

(1) Когато наборът от данни е разделен на обучителен набор и тестов набор от 8:2, производителността на всеки модел е показана в таблица 6.

Както може да се види от таблица 4, при разделяне на набора за обучение и набора от тестове в съотношение 8: 2, точността на четирите метода за машинно обучение е над 0.9, сред които XGBoost и RF са над { {5}}.95. Точността на прогнозиране на XGBoost е 0.974, което показва висока точност на прогнозиране. За прецизност, прецизността на модела KNN не е висока, под 0.9, само 0.888. XGBoost има най-високата точност, която е 0.960. Що се отнася до извикването, извикването на алгоритмите за XGBoost, произволна гора и логистична регресия е 1. Алгоритъмът за k-най-близък съсед има най-ниското извикване, но също така е над 0.95. За това проучване нивата на припомняне представляват дела на пробите от злокачествен рак на гърдата, които са били правилно диагностицирани. В медицината заболяването трябва да бъде диагностицирано. Последствието от липсата на диагноза е забавено лечение, което може да доведе до това пациентите да пропуснат най-доброто време за лечение. Това е много по-сериозно, отколкото да ви диагностицират заболяване, без да имате такова. Следователно честотата на припомняне е много важен показател в областта на диагностиката на заболяванията. Тук извикването на XGBoost, произволна гора и алгоритъм за логистична регресия са 1, което показва, че всички злокачествени ракови заболявания на гърдата в пробите са диагностицирани. За F{{20}}резултата може да се види, че F1-резултатът на XGBoost, произволната гора и логистичната регресия са над 0.95. F1-резултатът на алгоритъма XGBoost е най-висок, достигайки 0.980. Моделът на K-най-близкия съсед има най-ниския F1-резултат от 0,934. Като се вземат предвид четирите индикатора, може да се каже, че когато наборът от данни е разделен на обучителен набор и тестов набор от 8: 2, общият моделен ефект на алгоритъма XGBoost е по-добър от другите три модела. XGBoost не само постигна припомняне от 1, но също така постигна припомняне от 0,95 или повече за другите три показателя.

(2) Когато наборът от данни е разделен на набор за обучение и набор за тестване в 7:3, производителността на всеки модел е показана в таблица 7.

Както може да се види от Таблица 7, когато наборът за обучение и наборът за тестване са разделени на 7 : 3, моделният ефект на XGBoost и RF не е толкова добър, колкото този на 8 : 2. Първо, по отношение на важния индекс Спомнете си, когато разделите набора от данни на 8: 2, извикването на XGBoost и RF беше 1, но сега те са намалели съответно до 0.991 и {{10}}.981 . Двата модела също имат лек спад в останалите три индекса. Въпреки това, промяната в ефекта на прогнозиране на логистичната регресия и модела на K-най-близкия съсед е различна от тези два алгоритъма. За логистичния регресионен модел четирите индикатора почти не се променят, когато наборът за обучение и наборът от тестове бяха разделени съответно на 7: 3 и 8: 2. Това показва, че логистичният регресионен модел почти не се влияе от различни дялове на набор от данни. В случай на разделяне 7:3 между набора за обучение и набора за тестване, логистичната регресия показа по-ниска точност, прецизност и F1- резултат от XGBoost и произволна гора. Обаче припомнянето на модела на логистична регресия е 1, което показва, че всички злокачествени ракови заболявания на гърдата са предвидени, което е от голямо значение за диагностицирането на заболяването. Следователно може да се каже, че прогнозният ефект на логистичния регресионен модел е по-добър от останалите три алгоритъма. За модела KNN, когато наборът за обучение и тестовият набор бяха разделени на 7: 3, всичките четири индекса се увеличиха. Спомнянето се увеличи до 0.991, което беше по-високо от това на произволната гора. Резултатът за точност, прецизност и F1- се увеличи от 0.912, {{30}}.887 и 0.934 на 0 0,930, 0,906 и 0,946, съответно. Следователно, моделът KNN се представя по-добре в случай на набора за обучение и набора от тестове, разделени на 7 : 3, отколкото модела, разделен на 8: 2. Анализът показва, че разделянето на наборите от данни не е фиксирано. За различните модели различните разделения водят до различни промени в ефекта на прогнозиране на модела.
(3) Съгласно сравнителния анализ на таблици 6 и 7 моделът XGBoost, установен в тази статия (разделяне на набора за обучение и набора от тестове на 8: 2) има най-добър ефект, а следното го сравнява с представянето на модела в литература [11–14] и специфичните резултати са показани в таблица 8.

Както може да се види от таблица 8, по-добре представящите се модели от петте модела са логистичният регресионен модел от литературата [13] и моделът XGBoost, установен в тази статия. Припомнянето и точността на модела в литературата [13] са съответно 0.99 и 0.98, а припомнянето и точността на модела в тази статия са 1.{{8} } и 0.974, съответно, в сравнение с литературата [13], припомнянето на модела е високо, а припомнянето в медицинската диагноза показва вероятността за откриване на ракови клетки, което е от голямо значение за класификацията клетки от рак на гърдата, така че моделът XGBoost, установен в тази статия, има по-добър ефект на прогнозиране и може да се използва като медицински инструмент за подпомагане на лекарите да правят планове за лечение на пациенти с рак на гърдата.

increase brain power

5. Заключение

Този документ предвижда главно категориите рак на гърдата, от предварителната обработка на данни до избора на характеристики и след това до установяването на модела. Накрая резултатите от прогнозите бяха сравнени и анализирани от много аспекти.

В тази статия припомнянето се приема като важен индекс за прогнозиране на проби от злокачествен рак на гърдата възможно най-точно. Оригиналният набор от данни съдържаше 30 характеристики и 15 характеристики бяха избрани като вход на модела чрез корелационния тест на Pearson. Преди изграждането на модела данните бяха стандартизирани, за да се елиминира влиянието на различните измерения върху ефектите на модела. За проблема с небалансираните положителни и отрицателни проби се използва методът на стратифицирана извадка за извличане на набори за обучение и набори от тестове пропорционално според различни категории данни. Когато се избира оптималната k стойност в k-най-близкия съсед, извикването се използва като индекс за оценка на модела, така че k стойността с най-висок процент на извикване е оптималната стойност.

Моделите са сравнени и анализирани от три аспекта. Резултатите са показани както следва:

печалби. Резултатите са показани, както следва: (1) В случай на разделяне на набора за обучение и набора от тестове на 8: 2, извикването на XGBoost, произволна гора и логистична регресия е 1, което може да предскаже всички злокачествени ракови заболявания на гърдата K - припомнянето на най-близкия съсед е малко по-ниско от 0.986 в сравнение с другите три модела. За точността на прогнозиране, прецизността и F1-резултата на модела, резултатите от модела XGBoost са по-добри от резултатите от произволна гора и логистична регресия, които са 0.974, {{1 0}}.96 и 0,98, съответно, така че моделът XGboost е избран като окончателен модел за прогнозиране при условие за разделяне 8: 2 на набора за обучение и набора за тестване.

(2) В случай на разделяне на набора за обучение и тестовия набор при 7: 3, стойностите на четирите индикатора за оценка за XGBoost и случайна гора намаляват, докато стойностите на четирите индикатора за оценка за модела K-най-близък съсед са подобрено, но за припомнянето, само припомнянето на модела на логистична регресия беше 1, а другите модели бяха над 0.98, така че ефектът от прогнозирането на модела на логистичната регресия беше най-добрият, а точността на прогнозата, прецизността , и F1-резултатът на логистичната регресия беше съответно 0.947, {{10}}.922 и 0.96.

improve your memory

(3) От експериментите може да се види, че при различни разделения ефектът на прогнозиране на модела има различни промени. Сравнявайки оптималните модели в двата набора от различни експерименти, може да се види, че точността на прогнозиране, прецизността и F1-резултатът на модела XGBoost (който разделя набора за обучение и набора за тестване с 8: 2) са по-високи от тези на логистичния регресионен модел (който разделя набора за обучение и набора от тестове на 7:3), когато припомнянето е 1, така че моделът XGBoost (който разделя набора за обучение и набора от тестове на 8:2) работи най-доброто в модела, установен в този документ. Освен това, в сравнение с моделите в литературата [11–14], моделът XGBoost, установен в тази статия, има по-добър ефект и може точно да идентифицира злокачествени клетки от рак на гърдата. Това изследване обаче е ограничено до набори от числени данни и в бъдеще ще се опитаме да използваме алгоритми за задълбочено обучение, за да приложим различни техники за извличане на характеристики към данни за изображения (като рентгенови изображения), за да получим по-добри резултати от класификацията.

Наличност на данни

Данните, които подкрепят констатациите от това проучване, са открито достъпни в UCI Machine Learning Repository на https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29.

Конфликт на интереси

Авторите декларират, че нямат конфликт на интереси.

Благодарности

Тази работа беше подкрепена от Националната природонаучна фондация на Китай (Грант № 61502156), Преподавателския и изследователски проект на Комитета по образование в Хубей (Грант № 282) и Докторската фондация на Технологичния университет в Хубей (Грант № BSQD13051).


Препратки

[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi и L. Chanderkant, „Познаване на рисковите фактори за рак на гърдата и методите за ранното му откриване сред работниците от първичното здравеопазване в Шимла, Химачал Pradesh," Journal of Education and Health Promotion, vol. 8 стр. 265, 2019 г.

[2] MS Simon, TA Hastert, A. Barac и др., „Кардиометаболични рискови фактори и преживяемост след рак в инициативата за здраве на жените“, Cancer, vol. 127, бр. 4, стр. 598–608, 2021 г.

[3] HF Pasha, RH Mohamed, MM Toam и AM Yehia, "Генетични и епигенетични модификации на адипонектиновия ген: p", The Journal of Gene Medicine, vol. 21, бр. 10, стр. e3120, 2019 г.

[4] D. Hong, AJ Fritz, SK Zaidi, et al., „Епителните към мезенхимните преходни и раковите стволови клетки допринасят за хетерогенността на рака на гърдата“, Journal of Cellular Physiology, vol. 233, бр. 12, стр. 9136–9144, 2018 г.

[5] J. Zhong, D. Sun, W. Wei, et al., „Тънкоиглена аспирация с ултразвук с усилен контраст за биопсия на сентинелен лимфен възел при рак на гърдата в ранен стадий,“ Ултразвук в медицината и биологията, том . 44, бр. 7, стр. 1371–1378, 2018 г.

[6] K. Babic, C. Siguan-Bell, M. Hee и SC Lin, „Ocular g: ултразвукова B-сканираща оценка на задържана хирургична гъба след операция на Ahmed клапа: случай r,“ Journal of Glaucoma, том. 26, бр. 10, стр. e239–e241, 2017.

[7] A. Yala, PG Mikhael, F. Strand и др., „Към стабилни базирани на мамография модели за риск от рак на гърдата“, Science Translational Medicine, том. 13, бр. 578, ИД на статия eaba4373, 2021 г.

[8] G. Zheng, X. Liu и G. Han, „Преглед на системата за компютърно откриване и диагностика на медицински изображения,“ Journal of Software, том. 29, бр. 5, стр. 1471–1514, 2018 г.

[9] EY Huang, S. Knight, CR Guetter и др., „Телемедицина и теленаставничество в хирургическите специалности: наративен преглед, The American Journal of Surgery, том 218, № 4, стр. 760–766, 2019 г.

[10] Q. Wu, BT Wang, HR Rao, Y. Jiang и C. Liu, „Ракът на гърдата и доброкачествените болестни клетки формират метрологични изследвания,“ Journal of Anhui Medical University, vol. 31, бр. 02, стр. 91–93, 1996.

[11] Q. Shen, F. Shao и R. Sun, „Модел за прогнозиране на рак на гърдата, базиран на xgboost“, Journal of Qingdao University (Natural Science Edition), vol. 32, бр. 1, 2019 г.

[12] Z. Deng, B. Su и K. Zhan. g, „Класификация на рака на гърдата въз основа на обучение в ансамбъл,“ China Medical Devices, vol. 35, бр. 12, 2020 г.

[13] M. Monirujjaman Khan, S. Islam, S. Sarkar и др., „Сравнителен анализ, базиран на машинно обучение за прогнозиране на рак на гърдата“, Journal of Healthcare Engineering, vol. 2022 г., номер на артикул 4365855, 15 страници, 2022 г.

[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle и W. Ibrahim, „Анализ на алгоритъм, базиран на дърво и машинно обучение за класификация на рака на гърдата“, Computational Intelligence and Neuroscience, vol. 2022 г., номер на артикул 6715406, 6 страници, 2022 г.

[15] H. Dong и L. Ma, „Модел за прогнозиране на тройно отрицателен рак на гърдата, базиран на машинно обучение,“ Journal of Yunnan University, vol. 39, бр. 1, стр. 111–115, 2017 г.


For more information:1950477648nn@gmail.com


Може да харесаш също