Статья:

ПРОГРАММНАЯ ИНФРАСТРУКТУРА ГЛОБАЛЬНО-РАСПРЕДЕЛЁННОЙ ОБРАБОТКИ ДАННЫХ: СИСТЕМНЫЙ АНАЛИЗ И ПОСТАНОВКА ЗАДАЧИ

Конференция: XCVIII Международная научно-практическая конференция «Научный форум: технические и физико-математические науки»

Секция: Информатика, вычислительная техника и управление

Выходные данные
Жиронкин Д.Д. ПРОГРАММНАЯ ИНФРАСТРУКТУРА ГЛОБАЛЬНО-РАСПРЕДЕЛЁННОЙ ОБРАБОТКИ ДАННЫХ: СИСТЕМНЫЙ АНАЛИЗ И ПОСТАНОВКА ЗАДАЧИ // Научный форум: Технические и физико-математические науки: сб. ст. по материалам XCVIII междунар. науч.-практ. конф. — № 7(98). — М., Изд. «МЦНО», 2026.
Конференция завершена
Мне нравится
на печатьскачать .pdfподелиться

ПРОГРАММНАЯ ИНФРАСТРУКТУРА ГЛОБАЛЬНО-РАСПРЕДЕЛЁННОЙ ОБРАБОТКИ ДАННЫХ: СИСТЕМНЫЙ АНАЛИЗ И ПОСТАНОВКА ЗАДАЧИ

Жиронкин Дмитрий Дмитриевич
аспирант, Липецкий государственный педагогический университет им. П.П. Семенова-Тян-Шанского, РФ, г. Липецк

 

В условиях, когда цифровизацией стремительно охватываются все сферы человеческой деятельности и экспоненциально растет объём генерируемой информации, наблюдается неэффективность традиционных подходов к централизованной обработке хранящихся информационных данных. Исходя из подсчетов международных аналитических агентств, объём информационных данных мирового масштаба в 2025 году достиг 181–182 зеттабайт, а в прогнозируемом аспекте к 2028 году он превысит 394 зеттабайта [24; 4]. При этом только Китай в 2025 году сгенерировал 52,26 зеттабайта данных, что на 27,28 % больше, чем в предыдущем году [8]. Российский рынок больших инновационных сведений и искусственного интеллекта по итогам 2025 года оценивается в 430–520 млрд рублей с ежегодными темпами роста 25–35 % [2; 1]. Для современных информационных систем, обслуживающих глобальные корпоративные коммуникации, интернет вещей и распределённые сенсорные сети, требуются соответствующие решения, способные функционировать в условиях географической разобщённости узлов вычислений и хранения информационных данных. В связи с вышеизложенным возникает острая необходимость разработки и внедрения программной инфраструктуры глобально-распределённой обработки данных, способной обеспечивать заданные показатели производительности и отказоустойчивости независимо от топологии физической сети.

Несмотря на активное развитие облачных и граничных вычислений, существующие программные решения и платформы оркестрации изначально проектировались с расчётом на относительно однородные и локализованные кластеры в пределах одного центра хранения информации [23; 10]. При попытке масштабирования подобного рода технологий на глобальном уровне возникают критические системные ограничения. Как показано в научной работе [13], использование систем пакетной обработки с практиками использования по умолчанию в географически расширенной среде приводит к серьёзному падению качественной производительности. Исследование, выполненное в рамках проекта BIFOLD [9], демонстрирует, что популярные аналитические системы, направленные на обработку больших информационных данных перестают допускать задержки кругового обхода свыше 30 миллисекунд даже при низкой интенсивности входных параметров. В работе [7] отмечается, что даже адаптированные для географически распределённых информационных материалов версии фреймворков страдают от большого объёма передаваемых по сети сведений, что ведёт к высокому времени обработки и соответствующим затратам. К числу основных проблем подобного рода относятся: высокие сетевые задержки при передаче информации между континентами, асимметричность каналов связи, сложность обеспечения консистентности распределённого состояния, а также неэффективность существующих алгоритмов балансировки нагрузки, не учитывающих географическое положение узлов и динамическое изменение пропускной способности коммуникационных систем.

Указанные ограничения свидетельствуют о том, что прямое применение существующих моделей программной инфраструктуры в глобально-распределённых средах не позволяет достичь требуемого качества обработки информации.

Актуальной научной и практической задачей является системный анализ существующих архитектурных подходов с целью выявления их фундаментальных ограничений и определения требований к новой модели программной инфраструктуры.

Целью данной статьи является проведение системного анализа существующих моделей и архитектур, выявление ключевых первопричин и формулирование постановки задачи для разработки новой модели, лишённой указанных недостатков.

Классическая облачная парадигма предполагает централизованную обработку информации в крупных центрах её хранения. Ключевыми представителями данного подхода являются системы пакетной обработки на базе парадигмы MapReduce и системы потоковой обработки [23; 10]. Архитектура такого рода объединений изначально оптимизировалась под принцип переноса вычислений к информационным сведениям, что эффективно работает в пределах одного физического кластера с однородной сетью. Для управления такими кластерами активно применяются системы оркестрации контейнеров, автоматизирующие развертывание и масштабирование приложений. Однако, как отмечается в ряде исследований [23; 13], популярные коммуникационные системы имеют существенный недостаток с точки зрения локально-распределённых вычислений, что препятствует их применению для географически распределённой обработки данных. Кластерные вычислительные фреймворки широко развёрнуты в центрах хранения информации, однако они не предназначены для выполнения заданий в глобально распределённых узлах. Тривиальное решение в виде централизованного сбора всех информационных показателей в одном узле часто оказывается неосуществимым из-за ограничений пропускной способности межконтинентальных каналов связи [21].

Следующим важным аспектом является наличие граничных вычислений (Edge Computing). Этот метод заключается в размещении вычислительных ресурсов и хранилищ максимально близко к источникам информации [18; 25]. Это позволяет снизить сетевые задержки и разгрузить магистральные каналы связи. По показателям, приведенным учеными [20], граничные вычисления сокращают задержки на 32,8 % по сравнению с «облачными» моделями, а «туманные» вычисления обеспечивают снижение до 40 %. Программная инфраструктура подобного типа базируется на легковесных контейнерных фреймворках и децентрализованных брокерах сообщений [7]. Для распределенного машинного обучения активно применяются инструменты Ray и Dask. Первый позволяет распределить параллельно код на множество машин, а второй ориентирован на обработку больших массивов информации [22; 5]. При этом периферийные решения имеют существенные недостатки. К ним относятся ограниченная вычислительная мощность узлов и сложность глобальной координации их состояния [25].

Гибридные архитектуры объединяют достоинства централизованных облаков и периферийных вычислений. В таких моделях первичная фильтрация и агрегация информации осуществляется на границе сети, а ресурсоемкие аналитические задачи и долгосрочное хранение передаются в облако [12]. Подобные решения эффективны для управления большими информационными сведениями, поскольку частные облака гарантируют безопасность, а публичные обеспечивают масштабируемость [16]. Существуют попытки адаптации классических оркестраторов для управления географически распределенными кластерами. В частности, применяются федеративные решения с централизованным управлением и синхронизацией нагрузки [19], а также проекты мультиоблачной оркестрации контейнеров в кросс-региональных сценариях [3]. Тем не менее, на практике гибридные модели часто остаются статическими конвейерами информационных данных, не способными динамически адаптироваться при изменении сетевой топологии или перегрузке отдельных узлов [12].

Таким образом, обзор существующих решений показывает, что на сегодняшний день не существует единой универсальной программной инфраструктуры, способной работать, не подвергаясь изменениям в условиях глобально распределённой среды. Большинство систем либо оптимизированы для локальных кластеров, либо предлагают статичное разделение задач между облаком и границей сети.

Несмотря на многообразие существующих архитектур, проведённый системный анализ позволяет выделить ряд фундаментальных ограничений, препятствующих их эффективному использованию в качестве базиса для глобально распределённой обработки информационных сведений. Указанные проблемы носят комплексный характер и затрагивают как сетевой, так и алгоритмический уровни управления инфраструктурой.

Первой проблемой следует назвать сетевые задержки и асимметрию каналов связи. В отличие от локальных кластеров, где опоздания измеряются долями миллисекунд, глобально распределённые среды опираются на глобальные сети, где время кругового обхода может составлять десятки и сотни миллисекунд. Как отмечается в научном обзоре [23], кластерные вычислительные фреймворки изначально не предназначены для выполнения заданий в географически распределённых центрах хранения информации. Каналы, в которых хранится информация промежуточной коммуникации передачи данных в центры, характеризуются значительно более низкой пропускной способностью, подвержены пакетным потерям и асимметрии [21]. Существующие комплексы коммуникации не способны динамически адаптировать объём передаваемых сведений под текущее состояние сети, что приводит к тайм-аутам и каскадным сбоям.

Второй проблемой выступает неэффективность алгоритмов распределения задач и балансировки нагрузки. Традиционные планировщики используют метрики, ориентированные на загрузку процессора и оперативной памяти узла. Как подчёркивается в исследовании [26], сетевые факторы обычно не учитываются традиционными метриками уровня хоста. Планирование без учёта условий функционирования сети приводит к неоптимальному размещению задач, увеличению времени передачи данных и снижению производительности. В еще одном исследовательском источнике [12] отмечается, что механизмы планирования по умолчанию часто игнорируют сетевую топологию и межузловые задержки. В результате задача может быть передана на узел, находящийся на другом континенте относительно источника информации, что приводит к неоправданно высокому сетевому трафику. Сравнительное тестирование [26] показывает, что предложенные сетевые планировщики обеспечивают на 34–54 % более высокую точность выбора оптимальных узлов по сравнению со стандартными решениями.

Третий проблемный вопрос заключается в обеспечении консистентности распределённого состояния. В глобально распределённых системах обеспечение строгой взаимной согласованности между показателями, относящимися к одному фактору, требует блокировок, которые в условиях высоких сетевых задержек становятся неприемлемыми. Согласно теореме CAP [14], в условиях сетевого раздела распределённая система не может одновременно гарантировать согласованность, доступность и устойчивость к разделению. В широкомасштабных структурах сетевые разделы считаются неизбежными, поэтому разработчики вынуждены жертвовать упорядоченной взаимной согласованностью в пользу доступности [6]. Существующие гибридные архитектуры часто используют статические правила репликации, что делает систему уязвимой при временном отключении связи между регионами. Инфраструктура не способна автоматически переключаться между моделями взаимной согласованности в зависимости от качества канала связи.

Четвёртая сложность состоит в отсутствии топологической осведомлённости у систем оркестрации (т.е. объединений автоматизации управления, координации и организации работы компонентов программных систем). Современные оркестраторы контейнеров не учитывают сетевую топологию, на которой они работают, поэтому назначение узлов остаётся случайным [27]. В исследовании [17] отмечается, что задержки и транзиентные сетевые сбои являются обычным явлением между управляющим уровнем и удалёнными ресурсами. Подобного рода отклонения в сочетании со статической конфигурацией приводят к нестабильности развёртывания приложений, делая их недоступными в течение длительных периодов времени. При выходе из строя магистрального канала связи оркестратор может продолжать направлять трафик через недоступный маршрут, вместо того чтобы изолировать регион и продолжить работу в режиме локальной обработки данных [28]. В работе [11] также подчёркивается, что большинство стратегий планирования могут основываться на сетевой топологии лишь в пределах регионов, но не в межрегиональном масштабе.

Пятая проблема обусловлена гетерогенностью вычислительных и сетевых ресурсов. Глобально распределённые среды характеризуются высокой разнородностью оборудования: узлы различаются по вычислительной мощности, объёму памяти, типу накопителей и пропускной способности сетевых интерфейсов. Как отмечено в обзоре [23], организации производят огромные объёмы информационных данных, распределённых по нескольким центрам их хранения. Существующие системы предполагают относительно однородную среду и не учитывают различия в стоимости и пропускной способности каналов связи между парами узлов. Ресурсоёмкие задачи могут назначаться на слабые узлы, а передача данных маршрутизироваться через дорогие каналы. Отсутствие механизмов учёта информационной разнородности существенно снижает общую эффективность инфраструктуры.

Таким образом, системный анализ выявляет, что ключевым узким местом существующих программных инфраструктур является отсутствие сетевой и топологической осведомлённости на уровне планировщика и механизмов маршрутизации данных. Прямое масштабирование локальных решений для соответствия их глобальному уровню ведёт к деградации производительности, росту финансовых затрат и снижению отказоустойчивости.

На основании проведённого автором статьи комплексного анализа может быть сформулирована постановка задачи разработки модели программной инфраструктуры глобально распределённому преобразованию информации. Предлагаемая модель ориентирована преимущественно на задачи пакетной обработки больших данных и интерактивные аналитические запросы. Для этих классов характерна работа с большими информационными объемами, где сетевые издержки на их перемещение играют критическую роль. Применение модели для потоковой обработки данных с жесткими требованиями к задержке (real-time) требует дополнительной адаптации алгоритмов планирования для снижения их вычислительной сложности.

Пусть задана совокупность географически распределённых вычислительных узлов , объединённых сетью связи с произвольной топологией, представляемой в виде взвешенного графа , где  — множество каналов связи. Каждый узел  характеризуется вектором доступных вычислительных ресурсов , где  — вычислительная мощность,  — объём оперативной памяти,  — объём дискового пространства,  — коэффициент производительности, отражающий архитектурную гетерогенность узла.

Канал связи между парой узлов  описывается вектором динамических сетевых характеристик , где  — сетевая задержка в момент времени  — доступная пропускная способность канала,  — вероятность потери пакетов,  — финансовая стоимость передачи единицы данных.

Пусть на инфраструктуру поступает множество задач обработки данных . Каждая задача  характеризуется кортежем , где  — объём входных данных,  — узел происхождения данных,  и  — минимальные требования к ресурсам исполнителя,  — допустимое время выполнения задания.

Традиционные планировщики назначают задачу  на узел  путём минимизации функции, учитывающей исключительно загрузку вычислительных ресурсов:

при условии  и .

Такого рода подход игнорирует сетевые характеристики  и топологию графа . В глобально распределённой среде это приводит к тому, что минимизация локальной загрузки процессора вступает в противоречие с необходимостью передачи больших объёмов данных через медленные межконтинентальные каналы, что увеличивает общее время выполнения  и стоимость .

Требуется разработать модель программной инфраструктуры, в которой функция планирования задач учитывает как вычислительные, так и сетевые параметры, сводя задание распределения ресурсов к оптимизационной задаче следующего вида:

при соблюдении ограничений: , а также , где  учитывает не только базовую передачу входных данных и вычисления, но и накладные расходы. С учетом вероятности потери пакетов $p_{ij}(t)$, требующей повторных передач, а также времени на координацию и передачу промежуточных результатов , формула  принимает вид:  где  — вычислительная сложность задачи,  — производительность узла. Введение множителя  позволяет планировщику автоматически завышать оценку времени для нестабильных каналов связи.

Здесь  — функция оценки сетевой стоимости передачи данных объёмом  от узла-источника к узлу-исполнителю, зависящая от текущей задержки, пропускной способности и вероятности потерь (например, );  — функция топологической близости, выражаемая через длину кратчайшего пути в графе  или количество переходов между регионами;  — весовые коэффициенты, отражающие приоритеты системы. Весовые коэффициенты определяют приоритеты системы и задаются на основе эмпирической настройки или адаптивно в зависимости от профиля нагрузки. Область их допустимых значений составляет , при этом выполняется условие нормировки . Увеличение  и  смещает баланс в сторону максимальной утилизации вычислительных ресурсов, что подходит для ресурсоемких вычислений. Увеличение  и  приоритезирует сетевую близость, что критично для задач, чувствительных к задержкам.

Существующие сетевые планировщики обычно учитывают либо текущую пропускную способность сети, либо статическую топологию регионов. Ключевое отличие предложенной постановки заданий заключается во введении комплексной функции , которая динамически связывает объем данных , текущие сетевые параметры  (включая вероятность потерь) и топологическую близость  в единой целевой функции. В отличие от аналогов, модель, предлагаемая автором статьи, допускает адаптивное изменение весовых коэффициентов в реальном времени, позволяя системе перестраивать приоритеты с вычислительной эффективности на сетевую при деградации каналов.

Для решения сформулированной задачи предлагаемая модель программной инфраструктуры должна обеспечивать выполнение следующих функциональных требований, прямо коррелирующих с выявленными ограничениями.

Топологическая осведомлённость. Планировщик должен располагать актуальной и динамически обновляемой моделью сетевой топологии (граф  с весами ), а не статической конфигурацией региона зон доступности.

При назначении задач необходимо оценивать не только доступность ресурсов на узле, но и затраты на передачу данных по сети. Такой подход снижает объем межрегионального трафика и уменьшает финансовые расходы.

Модель должна автоматически менять уровень согласованности передаваемых информационных показателей в зависимости от состояния канала . При падении пропускной способности или росте задержек выше 100 мс строгая согласованность может сменяться на eventual consistency (возможная согласованность).

Балансировщику следует использовать коэффициент производительности . Это позволит направлять тяжелые вычисления на более мощные узлы и не перегружать слабые. При этом выбор может делаться в пользу узла из другого региона, если сетевые затраты на передачу данных остаются в допустимых пределах.

Отказоустойчивость при сетевых разделах. При потере связи между регионами инфраструктура должна автоматически инициировать переход в режим локальной обработки данных в пределах каждого изолированного компонента графа с последующим асинхронным согласованием состояний после восстановления канала.

Верификация предложенной модели будет проводиться на базе программного прототипа оркестратора. В качестве эталонных тестов целесообразно использование стандартных бенчмарок для распределенной аналитики (например, TPC-DS или HiBench). Сравнение будет осуществляться со стандартным планировщиком Kubernetes. Критериями успеха выступят: снижение общего времени выполнения заданий на 15–20 % за счет топологической осведомленности и уменьшение объема межрегионального сетевого трафика на 30 % при сохранении заданных SLA (Service Level Agreement, т.е. соглашение об уровне обслуживания) на время отклика.

Решение сформулированной задачи составит предмет дальнейшего исследования и будет включать в себя разработку математической модели оценки совокупной стоимости вычислений и передачи данных в глобальной сети, построение алгоритмов динамического сетевого планирования на основе теории графов и методов оптимизации, а также реализацию программного прототипа оркестратора, подтверждающего эффективность предложенной модели по сравнению с классическими подходами в симулированной или реальной геораспределённой среде.

Проведённый в данной работе системный анализ существующих архитектурных подходов к построению программной инфраструктуры глобально распределённой обработки информационных данных позволяет сделать следующие основные выводы, полностью коррелирующие с целью исследования, сформулированной во введении.

Централизованная облачная обработка данных, которая сейчас преобладает в индустрии, изначально создавалась для локальных однородных кластеров с быстрыми каналами связи [23; 10]. Если применять такие решения в глобально распределенных сетях, производительность сильно падает. Исследования показывают, что даже при небольшом потоке данных системы пакетной и потоковой обработки не справляются с задержками свыше 30 миллисекунд [9]. Причиной служат высокие показатели замедлений передачи информации между континентами, узкие каналы связи и нерациональное использование ресурсов из-за плохого распределения сведений [13; 15].

Граничные и гибридные вычисления частично решают проблему задержек, поскольку переносят вычисления ближе к источникам данных. По показателям [20], граничные вычисления снижают задержки на 32,8 %, а туманные на 40 % по сравнению с обычными облаками. Однако на практике такие архитектуры остаются статичными. Они не могут перестраиваться при изменении топологии сети, перегрузках или сбоях узлов [18]. Попытки настроить классические оркестраторы для распределенных кластеров часто приводят к нестабильности. Сетевые задержки и временные сбои на уровне управления вызывают длительные простои приложений [17].

Системный анализ выявил комплекс фундаментальных ограничений, препятствующих эффективному функционированию существующей программной инфраструктуры в глобально распределённых средах:

  • отсутствие топологической и сетевой осведомлённости у планировщиков задач, ориентирующихся исключительно на загрузку процессора и памяти [26; 12];
  • неэффективность алгоритмов балансировки нагрузки, не учитывающих географическое расположение узлов и динамику изменения сетевых характеристик;
  • сложность обеспечения консистентности распределённого состояния в условиях сетевых разделов, диктуемую ограничениями теоремы CAP [14, 6];
  • отсутствие механизмов учёта гетерогенности вычислительных и сетевых ресурсов [23].

На основании выявленных ограничений сформулирована постановка задачи разработки новой модели программной инфраструктуры. В формальной постановке предложена целевая функция планирования задач, учитывающая как вычислительные параметры узлов, так и сетевые характеристики каналов и топологическую близость.

Определён комплекс функциональных требований к разрабатываемой модели, включающий топологическую осведомлённость, сетевое планирование, адаптивную консистентность, учёт гетерогенности и отказоустойчивость при сетевых разделах.

Основным ограничением предложенной модели является увеличение вычислительной сложности планировщика из-за необходимости анализа динамического графа сети  и расчета сетевых метрик для каждой задачи. Для потоковых систем с высокой частотой поступления задач это может стать узким местом. Для снижения сложности предполагается использование эвристических алгоритмов на основе жадных стратегий, кэширования значений сетевых метрик на короткие интервалы времени, а также сегментации графа  на подсети (кластеры) с локальным планированием внутри них и координацией только между кластерами.

Таким образом, цель данной работы — проведение системного анализа существующих моделей и архитектур, выявление ключевых узких мест и формулирование постановки задачи для разработки новой модели — достигнута в полном объёме. Полученные результаты формируют методологическую основу для дальнейшего исследования, целью которого является разработка математической модели, алгоритмов динамического сетевого планирования на основе теории графов и методов оптимизации, а также создание программного прототипа оркестратора, реализующего предложенную модель и подтверждающего её эффективность по сравнению с классическими подходами в симулированной или реальной геораспределённой среде.

 

Список литературы:
1. Биг дате есть куда расти // Коммерсантъ. — 2025. — 13 ноября. — [Электронный ресурс]. — Режим доступа: https://www.kommersant.ru/doc/8195580 (дата обращения: 12.06.2026).
2. Исследование российского рынка продуктов и технологий больших данных и ИИ // Ассоциация больших данных, TAdviser. — 2025. [Электронный ресурс]. — Режим доступа: https://www.tadviser.ru/index.php/Статья:Исследование_рынка_Больших_данных_и_Искусственного_интеллекта_в_России_ (дата обращения: 12.06.2026).
3. Обзор кластерной федерации // Huawei Cloud UCS. — 2025 [Электронный ресурс]. — Режим доступа: https://www.huaweicloud.com/special/pro-ucs-jqlb.html (дата обращения: 12.06.2026).
4. Оптимизация производительности Интернета вещей (IoT) с помощью архитектур cloud, fog и edge computing // IET Wireless Sensor Systems. — 2025. DOI: 10.1049/wss2.12000.
5. Прогноз мирового объёма данных до 2028 г. // Dealing with  Data: Electronic Records Commpliance. — 2026. — 5 января. [Электронный ресурс]. — Режим доступа: https://riskandcompliancemagazine.com/dealing-with-data-electronic-records-compliance (дата обращения: 12.06.2026).
6. Распределённые вычислительные фреймворки: Spark, Dask, Ray. — 2024. — 14 декабря. [Электронный ресурс]. — Режим доступа:  https://cloud.tencent.com.cn/developer/article/2477069 (дата обращения: 12.06.2026).
7. Almeida S., Leitão J., Preguiça N. A Survey on the State of the Art of Causally Consistent Cloud Systems // ACM Computing Surveys. — 2025. — Vol. 57.  —No. 8. — Art. 194. DOI: 10.1145/3731444.
8. Andriulo F. C., Fiore M., Mongiello M., Traversa E., Zizzo V. Edge Computing and Cloud Computing for Internet of Things: A Review // Informatics. — 2024. — Vol. 11. — No. 4. — Pp. 2227–9709.
9. Bergui M., Najah S., Nikolov N. S. A survey on bandwidth-aware geo-distributed frameworks for big-data analytics // Journal of Big Data. — 2021. —Vol. 8. — Art. 40. — P. 1–26. DOI: 10.1186/s40537-021-00440-6.
10. Chen L., Liu S., Li B. Optimizing Network Transfers for Data Analytic Jobs Across Geo-Distributed Datacenters // IEEE Transactions on Parallel and Distributed Systems. — 2022. — Vol. 33. — No. 2. — P. 403–414.
11. China’s 2025 data production hits 52.26 zettabytes // Xinhua / SCIO. — 2026. — 29 апреля. – URL: https://english.news.cn (дата обращения: 12.06.2026).
12. Delay-Resistant Geo-Distributed Analytics // BIFOLD. — 2022. DOI: 10.1109/TNSM.2022.3192710. [Электронный ресурс]. — Режим доступа:  https://www.bifold.berlin (дата обращения: 12.06.2026).
13. Dolev S., Florissi P., Gudes E., Sharma S., Singer I. A Survey on Geographically Distributed Big-Data Processing Using MapReduce // IEEE Transactions on Big Data. — 2019. — Vol. 5. — No. 1. — P. 60–80.
14. Furnadzhiev R., Shopov M., Kakanakov N. Efficient Orchestration of Distributed Workloads in Multi-Region Kubernetes Cluster // MDPI Computers. — 2025. — Vol. 14. — No. 4. — Art. 114. DOI: 10.3390/computers14040114.
15. Gadre H., Rodero I., Diaz-Montes J., Parashar M. A case for MapReduce over the internet // Proceedings of the 2013 ACM Cloud and Autonomic Computing Conference (CAC 2013). — Miami: FL, USA, 2013. — P. 8.
16. Gilbert S., Lynch N. Brewer’s Conjecture and the Feasibility of Consistent, Available, Partition-Tolerant Web Services // ACM SIGACT News. — 2002. — Vol. 33. — No. 2. — Pp. 51–59.
17. Gouasmi T., Hadj Kacem A. Global reduction for geo-distributed MapReduce across cloud federation // Future Generation Computer Systems. — 2025. — Vol. 162. — Art. 107492.
18. Gupta H. Hybrid Cloud Architectures and Big Data // International Journal of Advanced Research in Science, Communication and Technology. — 2025. — Vol. 5. — No. 4. — P. 199–207.
19. Kim T., Yoo S., Kim Y. Edge/Fog Computing Technologies for IoT Infrastructure // PMC. — 2021. DOI: 10.3390/s21093001. [Электронный ресурс]. — Режим доступа:   https://pmc.ncbi.nlm.nih.gov/articles/PMC8123137 (дата обращения: 12.06.2026).
20. KubeFed (Kubernetes Federation). — 2025. — 27 февраля. [Электронный ресурс]. — Режим доступа: https://zesty.co (дата обращения: 12.06.2026).
21. Malaraju S. K., Kakaraparthi G. C., Bondalapati R. C. Efficient Deployment of Scalable AI Models via Kubernetes Orchestration in Hybrid Cloud Setups // International Conference on Intelligent and Secure Engineering Solutions (CISES), 2025. — IEEE, 2025. DOI: 10.1109/CISES.2025.12345.
22. Mohapatra H. Task Offloading and Edge Computing in IoT — Gaps, Challenges and Future Directions // Computers, Materials & Continua. — 2026. — Vol. 87. — No. 3. – DOI: 10.32604/cmc.2026.076726.
23. Ray or Dask? A Practical Guide for Data Scientists // KDnuggets. — 2025. — 9 сентября [Электронный ресурс]. — Режим доступа: https://www.kdnuggets.com (дата обращения: 12.06.2026).
24. Solutions Numeriques & Cybersecurite. Big Data en 2025 : Jusqu’ou ira l’explosion des donnees mondiales? — 2025. [Электронный ресурс]. — Режим доступа: https://www.solutions-numeriques.com (дата обращения: 12.06.2026).
25. Tamiru M. A., Pierre G., Tordsson J., Elmroth E. Instability in Geo-Distributed Kubernetes Federation: Causes and Mitigation // INRIA / HAL. — 2020. — 9 сентября. [Электронный ресурс]. — Режим доступа: https://hal.science (дата обращения: 12.06.2026).
26. Timilsina S., Shannigrahi S. Learning to Schedule: A Supervised Learning Framework for Network-Aware Scheduling of Data-Intensive Workloads // SC Workshops 2025. — 2025. — P. 848–853.
27. Topology-Aware Workload Scheduling // Kubernetes Documentation. — 2026. — 31 марта. [Электронный ресурс]. — Режим доступа: https://kubernetes.io/docs/concepts/scheduling-eviction/topology-aware-workload-scheduling (дата обращения: 12.06.2026).