<?xml version='1.0' standalone='no' ?>
<journal xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JournalArticulus.xsd">
    <operCard>
        <operator>ИПМ им. М.В.Келдыша РАН|Publicator</operator>
        <date>2026-04-08 20:01:06</date>
        <cntArticle>1</cntArticle>
        <cs>0</cs>
    </operCard>
    <titleid>32018</titleid>
    <issn>2071-2901</issn>
    <codeNEB>20712901</codeNEB>
    <journalInfo lang="RUS">
        <title>Препринты ИПМ им. М.В.Келдыша</title>
    </journalInfo>
    <issue>
        <volume/>
        <number>72</number>
        <altNumber/>
        <part/>
        <dateUni>2022</dateUni>
        <issTitle/>
        <pages>1-12</pages>
        <articles>
            <article>
                <pages>1-12</pages>
                <artType>RAR</artType>
                <authors>
                    <author num="001">
                        <authorCodes>
                            <orcid>0000-0002-5279-8005</orcid>
                        </authorCodes>
                        <individInfo lang="RUS">
                            <surname>Гавриков</surname>
                            <initials>Борис Михайлович</initials>
                            <orgName>Институт прикладной математики им. М.В.Келдыша РАН</orgName>
                            <email>bmgavrikov@gmail.com</email>
                        </individInfo>
                        <individInfo lang="ENG">
                            <surname>Gavrikov</surname>
                            <initials>B.M.</initials>
                            <orgName>Keldysh Institute of Applied Mathematics RAS</orgName>
                        </individInfo>
                    </author>
                    <author num="002">
                        <authorCodes>
                            <spin>2392-7621</spin>
                            <orcid>0000-0001-7165-8318</orcid>
                        </authorCodes>
                        <individInfo lang="RUS">
                            <surname>Гавриков</surname>
                            <initials>Михаил Борисович</initials>
                            <orgName>Институт прикладной математики им. М.В.Келдыша РАН</orgName>
                            <email>mbgavrikov@yandex.ru</email>
                        </individInfo>
                        <individInfo lang="ENG">
                            <surname>Gavrikov</surname>
                            <initials>M.B.</initials>
                            <orgName>Keldysh Institute of Applied Mathematics RAS</orgName>
                        </individInfo>
                    </author>
                    <author num="003">
                        <authorCodes>
                            <orcid>0000-0002-7227-2094</orcid>
                        </authorCodes>
                        <individInfo lang="RUS">
                            <surname>Пестрякова</surname>
                            <initials>Надежда Владимировна</initials>
                            <orgName>ИСА РАН ФИЦ ИУ РАН</orgName>
                            <email>pestryakova@isa.ru</email>
                        </individInfo>
                        <individInfo lang="ENG">
                            <surname>Pesryakova</surname>
                            <initials>N.V.</initials>
                            <orgName>ISA RAS FRC CSC RAS</orgName>
                        </individInfo>
                    </author>
                </authors>
                <artTitles>
                    <artTitle lang="RUS">Статистический подход для диагностики онкологических заболеваний по параметрам крови</artTitle>
                    <artTitle lang="ENG">Statistical approach for diagnosing oncological diseases by blood parameters</artTitle>
                </artTitles>
                <abstracts>
                    <abstract lang="RUS">Предложен математический метод для предварительной диагностики онкологических заболеваний человека различной локализации по параметрам крови. Авторами разработан статистический классификатор, основанный на полиномиально-регрессионном подходе и имеющий вероятностные оценки. Обучение осуществлялось на базах данных анализа периферической крови онкобольных по различным системам организма.</abstract>
                    <abstract lang="ENG">A mathematical method is proposed for the preliminary diagnosis of human oncological diseases of various localization by blood parameters. The authors have developed a statistical classifier based on a polynomial-regression approach and having probabilistic estimates. Training was carried out on databases of analysis of peripheral blood of cancer patients in various body systems.</abstract>
                </abstracts>
                <text lang="RUS">Введение
    В основе математической модели, рассматриваемой в данной работе, лежит концепция крупнейших гематологов, согласно которой многие заболевания человека вносят изменения в состав его крови. При оценке состояния здоровья человека (СЗЧ) гематологи предлагают использовать не менее пяти показателей периферической крови [1]. В рамках предлагаемой модели организм представляется как совокупность систем органов.
    Авторы ранее показали, что статистический метод классификации может успешно применяться для оценивания СЗЧ по показателям периферической крови [2-8]. 
    СЗЧ включает четыре градации – от практически здорового состояния до максимальной степени поражения организма: 
    1 класс – здоровые;
    2 класс – начальные отклонения состояния здоровья;
    3 класс – выраженные отклонения;
    4 класс – тяжелое заболевание (онкология).
    По каждой системе организма (СО) – пищеварения, дыхания и пр. – проводилось самостоятельное исследование СЗЧ при помощи отдельного классификатора, обученного на  профильной выборке. Эти базы, включающие восемь параметров периферической крови, были созданы на основе диагнозов, поставленных врачами высокой классификации.
    Для мужчин и женщин строили различные классификаторы, поскольку диапазоны вариации показателей крови среди множества людей существенно зависят от пола. 
    В настоящей работе рассматривается подход, позволяющий определить область локализации онкологии. Для этого обучение статистического классификатора предлагается проводить на наборах параметров периферической крови четвертого класса (онкологических больных), относящихся к нескольким различным СО. 
    Нет необходимости проводить классификацию по всем СО, вполне допустимо ограничиться только проблемными. Был построен и обучен классификатор для четырех СО. Аналогичная уточняющая процедура проведена также для возможных комбинаций, включающих по три либо по две СО из имеющегося набора.
    В данной постановке не возникает вопрос о «чистоте эксперимента», хотя этот анализ практически всегда имеет место при численном моделировании на основе измеренных данных. Дело в том, что наборы параметров крови онкобольных получены одним и тем же способом и имеют достаточный (сопоставимый) объем. Результаты, относящиеся к структуре наборов крови, на основе которых строились обучающие выборки, были подробно описаны [3, 4, 7, 8].  
    Отсутствуют также вырожденные случаи по отдельным признакам. Вследствие этого проводимое здесь моделирование предварительной диагностики является даже более обоснованным, по сравнению с оцениванием состояния здоровья [1-3].
Метод классификации
    Общепринятые обозначения и размерность используемых восьми показателей крови: RBC [L-1] – эритроциты, HGB [gL-1] – гемоглобин, PLT [L-1] – тромбоциты, WBC [L-1] – лейкоциты, LIMPH [L-1], [%] – лимфоциты, GRAN   [L-1], [%] – гранулоциты (GRAN=NEUT+EOS+BASO, где NEUT[L-1],[%] – нейтрофилы, EOS[L-1],[%] – эозинофилы, BASO[L-1],[%] – базофилы).
    Рассматриваем K определенных перенумерованных СО человека, 1?k?K. Вводим вектор v?RN,   i-я компонента которого – отнормированная на отрезок, не выходящий за пределы [0,1], величина i-го показателя крови онкобольных, где N=8. 
    Отождествляем k-й элемент множества СО с базисным вектором из RK: ek=(0…1…0), причем 1 находится на k-м месте, 1?k?K. Обозначим Y={e1,…,eK}. 
    Пусть существует pk(v) – вероятность того, что набор отнормированных показателей крови онкобольных соответствует k–му элементу СО, где 1?k?K. Искомый элемент СО будет иметь порядковый номер r, получивший максимальное значение вероятности:
    pr(v)= {pk(v)},  1?k?K.(1)    Приближенные значения p1(v),…,pK(v) представляются в виде конечных многочленов от координат v=(v1,…,vN) и определяются выбором базисных мономов:
    pk(v) ? c+ ++…, 1 ? k ? K.(2)    Представим упорядоченные базисные мономы из (2) в виде вектора размерности L:
x(v)=(1,v1, … ,vN, … )T.
Тогда (2) можно записать в векторном виде:
    p(v) = (p1(v),…,pK(v))T ? ATx(v),(3)где A – матрица размера L?K, столбцами которой являются векторы а(1),…, а(K). Каждый такой вектор составлен из коэффициентов при мономах соответствующей строки (2) (с совпадающим верхним индексом), упорядоченных так же, как в векторе x(v).  
    Значение А вычисляется приближенно в процессе обучения с использованием базы данных: [v(1),y(1)], …, [v(J),y(J)]. Здесь v(j) – набор параметров крови, соответствующий элементу СО с номером k (1?k?K), y(j)= (0…1…0) – его базисный вектор, где 1 стоит на k-м месте, 1?j?J): 
    А ? ()-1().(4)    Поскольку проблема обращения заполненной матрицы большой размерности до сих пор не решена [9], правую часть (4) получаем посредством рекуррентной процедуры [10]. 
    В данной работе рассмотрены четыре СО для мужчин: пищеварительная система (С1), органы дыхания (С2), опорно-двигательный аппарат (С3), урологическая система (С4). 
    Нормирование проводим следующим образом. Рассмотрим все четыре обучающие выборки исследуемых СО. Для каждого i-го показателя крови находим минимальное и максимальное значение vimin, vimax, где i = 1,..., N. 
     vimin  =  {vij}, j= 1, …, J,
     vimax = {vij}, j= 1, …, J ,
где J – объем выборки по данной совокупности СО. 
    Затем выполняем следующее преобразование:
     vi?( vi - vimin)/( vimax - vimin).
    Использовалась следующая модификация x(v): 
      x = (1,{vi},{vi vj},{vi vj vk},{vi vj vk vl},{vi vj vk vl vm},
  {vi vj vk vl vm vn }), 
  1?i?8, i?j?8, j?k?8, k?l?8, l?m?8, m?n?8.   (5)    В (5) выражения в фигурных скобках соответствуют цепочкам элементов вектора, вычисляемым по всем показателям крови из имеющегося набора. Длина полинома 3003. Имеются мономы первого, второго, третьего, четвертого, пятого и шестого порядка. Перекрестные произведения используются для мономов второго, третьего, четвертого, пятого и шестого порядка.
    Исследование проведено на классификаторе из четырех классов. Обучающее множество С1UС2UС3UС4 имеет следующий объем (количество наборов крови), дифференцированный по классам: |С1| = |С3| = 33, |С2| = 21, 
|С4| = 32. Классификатор обеспечил точность 93,3% на обучающем множестве из 119 элементов (сохраняется восемь ошибок). 
    Также рассматривались классификаторы, основанные на объединениях по три класса из четырех имеющихся. На таких комбинациях была получена более высокая  точность уже на полиномах пятого порядка с длиной полинома 1287, без комбинации элементов в последней паре фигурных скобок (5).
    Множества из двух классов классифицируются безошибочно, причем в ряде случаев достаточно использовать модификацию вектора x(v) четвертого порядка с длиной полинома 495.
    Проведем анализ структуры обучающего множества С1UС2UС3UС4 [4, 8].
Расстояние между «своими» и «чужими» элементами
    Для каждого из четырех рассматриваемых классов С1, С2, С3, С4 в отдельности найдем минимальное, максимальное и среднее расстояние между своими векторами (принадлежащими данному классу). Для множества векторов k-го класса определяем их следующим образом. 
    Минимальное расстояние:
    U_kmin = {||vk- uk||}, vk?Vk, uk?Vk, vk?uk.(6)    Максимальное расстояние:
    U_kmax = {||vk- uk||}, vk?Vk, uk?Vk,(7)где vk и  uk – пары различных векторов, принадлежащих множеству элементов k-го класса Vk.
    Среднее расстояние определим с приведением алгоритма нахождения этой величины:
     U_kср = , wk,,j?Vk, j = 1, …, Jk,(8)где {wk,,j, j = 1, …, Jk}=Vk – представление совокупности элементов k-го класса в виде множества перенумерованных векторов.
    Аналогично получим соответствующие значения для пар свой–чужой по каждому из классов. Чужой вектор – не принадлежащий рассматриваемому классу. Для обучающего множества, содержащего элементы всех четырех классов, V = { С1UС2UС3UС4}.
    Минимальное расстояние:
    U_kzmin = {||vk- u¬k||} , vk?Vk, u¬k ?V¬k.(9)    Максимальное расстояние:
    U_kzmax = {||vk- u¬k||} , vk?Vk, u¬k ?V¬k,(10)где vk и  u¬k – пары векторов, из которых vk принадлежит множеству элементов k-го класса Vk, а  u¬k принадлежит множеству чужих элементов V¬k классов, отличных от k-го: V¬k = V \Vk. 
    
     
  а) класс С1     б) класс С2
     
  в) класс С3     г) класс С4

Рис. 1. Минимальное, максимальное и среднее расстояние между парами векторов: свой–свой, свой–чужой, центр масс–свой, центр масс–чужой.
   
    Среднее расстояние:
      U_kzср = , wk,,j?Vk, j = 1, …, Jk ,                         w¬k,,j1?V¬k, j1= 1, …, J¬k,(11)
где {wk,,j, j = 1, …, Jk}=Vk – представление совокупности своих элементов k-го класса в виде множества перенумерованных векторов, аналогично для множества чужих элементов классов, отличных от k-го: {w¬k,,j1, j1 = 1, …, J¬k}= =V¬k, V¬k = V \Vk.
    Продемонстрируем, какие значения принимают перечисленные величины. Расстояние между векторами определяем в метрике L2.
     Для классов С1, С2, С3 и С4 соответственно представлены (рис.1а, б, в, г) минимальное, среднее и максимальное расстояние (значения ординат для точек 1, 2, 3 по оси абсцисс) между своими векторами (Ряд 1), аналогичные величины для пар свой-чужой (Ряд 3). 
    Для всех четырех классов (рис. 1) Ряд 1 немного превышает Ряд 3 по минимальным значениям (причем обе малы); кроме того, первая величина меньше второй для максимальных значений. Для средних имеются оба варианта различия, но оно небольшое. 
Отклонение от центра масс своих и чужих элементов 
    Для каждого из четырех рассматриваемых классов С1, С2, С3, С4 в отдельности получим среднестатистический вектор длины 8, принадлежащий исходному векторному пространству R8. Иногда такой вектор называют центром масс.
    Для центра масс k-го класса значение i-го параметра крови равно среднему арифметическому значений i-х параметров крови по всем Jk, имеющимся в базе наборам показателей крови, относящихся к данному классу:
      ,(12)где  vk,j – перенумерованные элементы k-го класса: {vk,j=(vk,j1,…,vk,jN), j = 1, …, Jk} = Vk. 
    Для каждого из классов С1, С2, С3 и С4  найдем минимальное, максимальное и среднее расстояние между  центром масс и своими векторами. 
    Указанные величины для множества векторов k-го класса определяем следующим образом. Минимальное расстояние:
    D_kmin = {||vk,ср- uk||}, uk?Vk.(13)    Максимальное расстояние:
    D_kmax = {|| vk,ср – uk||}, uk?Vk,(14)где uk – вектор, принадлежащий множеству элементов k-го класса Vk, vk,ср – среднестатистический вектор этого класса. 
    Среднее расстояние определим более детально с приведением алгоритма нахождения этой величины:
     D_kср = , wk,,j?Vk, j = 1, …, Jk,(15)где {wk,,j, j = 1, …, Jk}=Vk – представление совокупности элементов k-го класса в виде множества перенумерованных векторов.
    Аналогично получим соответствующие значения по каждому из классов между центром масс и чужими векторами. Эти результаты зависят от количества классов, входящих в обучающее множество. 
    Минимальное расстояние:
    D_kzmin = {|| vk,ср - u¬k||} , u¬k ?V¬k.(16)    Максимальное расстояние:
    D_kzmax = {|| vk,ср – u¬k||} , u¬k ?V¬k,(17)где u¬k –вектор, принадлежащий множеству чужих элементов V¬k классов, отличных от k-го: V¬k = V \Vk, vk,ср – среднестатистический вектор k-го класса. 
    Среднее расстояние:
      D_kzср = , w¬k,,j?V¬k, j = 1, …, J¬k,(18)где {w¬k,,j, j = 1, …, J¬k}= V¬k, V¬k = V \Vk – представление совокупности чужих элементов классов, отличных от k-го в виде множества перенумерованных векторов. 
    Для каждого класса соответственно (рис. 1)  из объединения С1UС2UС3UС4 представлено минимальное, среднее и максимальное расстояние (значения ординат для точек 1, 2, 3 по оси абсцисс) между  центром масс и своими векторами (Ряд 2), аналогично между парами центр масс–чужой вектор (Ряд 4). 
    Для класса С1 (рис. 1а) Ряд 4 всюду превышает Ряд 2, причем для минимальных и средних значений разница небольшая, а для максимальных – существенная. Аналогичная картина наблюдается для класса С3, исключая практически равные минимальные значения (рис. 1в). Для С2 соотношения противоположные (при малом различии) для минимальных и максимальных значений, а средние – почти равны (рис. 1б). В классе С4 (рис. 1г) Ряд 2 немного превышает Ряд 4 для минимальных и средних значений, а для максимальных – ситуация противоположная при незначительном различии.
   Распределение числа своих и чужих элементов при
удалении от центра масс
    Диапазон расстояний между центром масс k-го класса СО и векторами этого же класса («своими», vk?Vk) по рассматриваемой базе, согласно формулам (13), (14), находится на отрезке [D_kmin, D_kmax]. Диапазон расстояний между центром масс k-го класса СО и векторами всех других классов («чужими», zk ?{V \ Vk}), согласно формулам (16), (17), – на отрезке [D_kzmin,  D_kzmax]. Пусть
      Dkmin = min(D_ kmin , D_kzmin),
 Dkmax = max(D_ kmax , D_kzmax).(19)     
  а) класс С1     б) класс С2
     
  в) класс С3     г) класс С4
Рис. 2. Распределение числа своих и чужих элементов при удалении 
от центра масс (С1UС2UС3UС4)
    Делим отрезок [Dkmin, Dkmax] (оси абсцисс на рис. 2а, б, в, г) на десять равных по длине частей – один отрезок и девять полуинтервалов: [Dkmin, Dkmin + d], (Dkmin + d, Dkmin + 2d], … , (Dkmin + 9d, Dkmin + 10d], где d = (Dkmax - Dkmin)/10. Определим, какое количество своих векторов попало в каждый такой участок (аналогично для чужих векторов).  Затем рассмотрим распределение числа своих (чужих) векторов на отрезке [Dkmin, Dkmax].  
    Для каждого класса (рис. 2) соответственно из объединения С1UС2UС3UС4 представлено распределение количества своих (Ряд 1) и чужих (Ряд 2) элементов на отрезке [Dkmin, Dkmax]. 
    В характере полученных распределений числа своих (чужих) элементов имеется структурное сходство между всеми четырьмя классами. Эта же аналогия наблюдается в отношении распределений своих–чужих элементов. Отметим, что для классов С1, С3 получены результаты (рис. 2а, в), отличающиеся от С2, С4 (рис. 2б, г). Для С2, С4 (рис. 2б, г) свои элементы имеются до конца отрезка [Dkmin, Dkmax], в отличие от С1 и С3 (рис. 2а, в).
   Заключение
    Разработан классификатор, позволяющий уточнить область локализации онкологии по показателям периферической крови с использованием статистического метода распознавания, основанного на полиномиальной регрессии.
    Проведено исследование структуры обучающего множества, состоящего из четырех классов (С1, С2, С3, С4), соответствующих следующим СО для мужчин: пищеварительная система, органы дыхания, опорно-двигательный аппарат, урологическая система. Аналогичная процедура проведена для комбинаций, составленных из трех классов из имеющегося набора, а также из пар элементов.
    Для каждого из четырех классов С1, С2, С3, С4 в отдельности найдено минимальное, максимальное и среднее расстояние между своими векторами (принадлежащими данному классу). 
    Также получены соответствующие значения для пар свой–чужой (элемент, не относящийся к рассматриваемому классу).
    Для классов С1, С2, С3, С4 вычислили среднестатистический вектор, принадлежащий исходному векторному пространству R8 (центр масс). Найдено минимальное, максимальное и среднее расстояние между центром масс и своими (чужими) векторами. 
    Получено распределение количества своих и чужих элементов на отрезке их нахождения при удалении от центра масс. 
    Проведенный анализ позволил выявить сходство и различие в структуре множеств С1, C2, C3, C4.
</text>
                <codes>
                    <doi>10.20948/prepr-2022-72</doi>
                </codes>
                <keywords>
                    <kwdGroup lang="RUS">
                        <keyword>онкологическое заболевание</keyword>
                        <keyword>система организма</keyword>
                        <keyword>периферическая кровь</keyword>
                        <keyword>классификация</keyword>
                        <keyword>полиномиальная регрессия</keyword>
                        <keyword>обучающее множество</keyword>
                    </kwdGroup>
                    <kwdGroup lang="ENG">
                        <keyword>cancer</keyword>
                        <keyword>body system</keyword>
                        <keyword>peripheral blood</keyword>
                        <keyword>classification</keyword>
                        <keyword>polynomial regression</keyword>
                        <keyword>training set</keyword>
                    </kwdGroup>
                </keywords>
                <references>
                    <reference>Cтавицкий Р.В., Лебедев Л.А., Лебедев А.Л., Смыслов А.Ю. Количественная оценка гомеостатической активности здоровых и больных людей. - М.: ГАРТ. 2013. 131 с.</reference>
                    <reference>Гавриков Б.М., Лебеденко И.М., Пестрякова Н.В., Ставицкий Р.В. Об одном статистическом методе оценивания состояния здоровья человека // Труды ИСА РАН, 2016. Т. 66. № 2. С. 54-59.</reference>
                    <reference>Гавриков Б.М., Пестрякова Н.В. О построении признакового пространства в задаче обучения // Информационные технологии и вычислительные системы. 2018. №1. С. 22-29. DOI: 10.14357/20718632180104</reference>
                    <reference>Гавриков Б.М., Пестрякова Н.В., Ставицкий Р.В. О свойствах обучающих множеств  //  Информационные технологии и вычислительные системы. 2018. №4. С.97-107. DOI: 10.14357/207186321804010</reference>
                    <reference>Гавриков Б.М., Гавриков М.Б., Пестрякова Н.В. Статистический метод распознавания на основе нелинейной регрессии // Математическое моделирование. 2020. Т.32. №4. С.116-130. DOI: 0.20948/mm-2020-04-09</reference>
                    <reference>Гавриков Б. М., Гавриков М. Б., Пестрякова Н. В. О способности статистического классификатора к обобщениям// Информационные технологии и вычислительные системы. 2021. № 4. С. 38-50. DOI: 10.14357/20718632210404.</reference>
                    <reference>Гавриков Б.М., Гавриков М.Б., Пестрякова Н.В. О структуре базы обучения классификатора для оценивания состояния здоровья человека // Препринты ИПМ им. М.В.Келдыша. 2018. №126. 18с. DOI:10.20948/prepr-2018-126</reference>
                    <reference>Гавриков Б.М., Гавриков М.Б., Пестрякова Н.В., Ставицкий Р.В. Структура базы обучения статистического классификатора состояний систем организма человека // Препринты ИПМ им. М.В.Келдыша. 2018. №255. 40с. DOI:10.20948/prepr-2018-255</reference>
                    <reference>Гавриков М.Б.,  Локуциевский О.В. Начала численного анализа. — М.: Янус, 1995.</reference>
                    <reference>Schürmann J. Pattern Сlassification. — New York: John Wiley&amp;Sons, Inc., 1996.</reference>
                </references>
                <files>
                    <furl>https://keldysh.ru/papers/2022/prep2022_72.pdf</furl>
                </files>
            </article>
        </articles>
    </issue>
</journal>
