Статья:

СРАВНИТЕЛЬНЫЙ АНАЛИЗ ЛЕГКОВЕСНЫХ СВЕРТОЧНЫХ НЕЙРОСЕТЕЙ ДЛЯ КЛАССИФИКАЦИИ БОЛЕЗНЕЙ РАСТЕНИЙ

Конференция: XCVIII Международная научно-практическая конференция «Научный форум: инновационная наука»

Секция: Технические науки

Выходные данные
Бушуев Д.В. СРАВНИТЕЛЬНЫЙ АНАЛИЗ ЛЕГКОВЕСНЫХ СВЕРТОЧНЫХ НЕЙРОСЕТЕЙ ДЛЯ КЛАССИФИКАЦИИ БОЛЕЗНЕЙ РАСТЕНИЙ // Научный форум: Инновационная наука: сб. ст. по материалам XCVIII междунар. науч.-практ. конф. — № 7(98). — М., Изд. «МЦНО», 2026.
Конференция завершена
Мне нравится
на печатьскачать .pdfподелиться

СРАВНИТЕЛЬНЫЙ АНАЛИЗ ЛЕГКОВЕСНЫХ СВЕРТОЧНЫХ НЕЙРОСЕТЕЙ ДЛЯ КЛАССИФИКАЦИИ БОЛЕЗНЕЙ РАСТЕНИЙ

Бушуев Дмитрий Владимирович
студент, Нижегородский государственный технический университет им. Р.Е. Алексеева, РФ, г. Нижний Новгород

 

A COMPARATIVE ANALYSIS OF LIGHTWEIGHT CONVOLUTIONAL NEURAL NETWORKS FOR PLANT DISEASE CLASSIFICATION

 

Bushuev Dmitry Vladimirovich

student, Nizhny Novgorod State Technical University named after. R.E. Alekseeva, Russian, Nizhny Novgorod

 

1. Введение

На текущий день выявление заболеваний сельскохозяйственных культур является ключевым фактором продовольственной безопасности. Ошибка, которую может допустить специалист ввиду человеческого фактора может повлечь как репутационные, так и экономические потери для предприятия. Внедрение системы на основе искусственного интеллекта позволило бы снизить вероятность такого рода возникновения ошибки. Также использование автоматизированной системы позволяет оптимизировать затраты на инфраструктуру и средства защиты растений.

Наиболее эффективным способом классификации заболеваний растений является использование технологий компьютерного зрения. Зачастую модели решающие эту задачу являются крупными и требующие высоких вычислительных ресурсов. Такие модели не подойдут для специалистов в области агрокультур, так как им требуется переносимое решение, позволяющее классифицировать растение на ходу. Поэтому на ряду с большими моделями существуют специализированные, рассчитанные на работу на переносных устройствах.

Именно поэтому целью исследования является сравнение легковесных архитектур моделей по ключевым критериям: точность предсказания (Accuracy), задержка предсказания одного кадра и время обучения модели на фиксированном количестве эпох.

2. Описание набора данных и применяемой аугментации

Эксперимент проводился на открытом наборе данных PlantVillage. Данный набор имеет порядка 54 314 цветных изображений разделенных на 38 классов растений, таких как: яблоко, черника, вишня, кукуруза, виноград, апельсин, персик, перец, картофель, малина, клубника, томат и прочие. Разрешение изображений составляет 256 на 256 пикселей, что позволяет детализировать признаки для предсказания, но значительно увеличивает требуемую видеопамять для классификации. В случае если модель поддерживает только 224 на 224 пикселей, то применяется случайная обрезка изображения.

Набор данных был разделен на 3 выборки - тренировочная, валидационная и тестирующая выборка с соотношением разделения 80/10/10 соответственно. Такой подход позволил улучшить обучаемость модели благодаря валидационному этапу.

Для борьбы с переобучением моделей, был использован подход с динамической аугментацией входных данных. Аугментация данных это процесс создания новых входных данных на основе текущих с применением к ним случайных преобразований в случайный момент времени.

К исходному набору данных проводились следующие случайные преобразования: случайное отражение изображение по горизонтали с вероятностью 50%, случайное отражение изображение по вертикали с вероятностью 20%, случайный поворот изображения на 20 градусов, случайное изменение цвета имитирующее разные условия освещения, размытие по Гауссу имитирующее расфокусировку камеры или движение в кадре.

Это позволило адаптировать модели к разным условиям работы, что снизило количество неверно предсказанных изображений.

3. Описание используемых моделей и параметров к ним

В качестве основных используемых моделей было выбрано три ключевых: MobileNetV4 medium, EfficientNet B0 и EfficientNetV2 S. Эти модели рассчитаны на достижение высокой производительности и низкому потреблению ресурсов, что является отличным выбором для задач классификации на системах с ограниченными ресурсами, таких как переносные устройства.

MobileNetV4 представляет собой новейшую линейку высокопроизводительных моделей, рассчитанную в первую очередь на мобильные устройства. Использование специализированных операций, таких как depth-wise separable convolutions, и высокооптимизированная архитектура UIF позволяют выполнять вычисления с минимальным расходом энергии. Модель типа medium имеет 8.48 миллионов параметров, обеспечивающий баланс производительности и точности.

EfficientNet B0 начальная и самая производительная модель из семейства EfficientNet первого поколения. Такая модель позиционируется, как легковесная альтернатива таким моделям как ResNet18 имеющая примерно в 2.5 раза больше количества параметров, чем EfficientNet B0 (11.6 миллионов параметров против 4 миллиона параметров).

Второе поколение EfficientNetV2 была разработана, как улучшение оригинальной линейки моделей, направленное на ускорение обучения и повышение производительности выполнения модели. Выбранная модель EfficientNetV2 S имеет 20 миллионов параметров, что теоретически позволяет ей быть самой точной моделью из всех представленных. Из-за своего большего количества параметров и более сложной архитектуры, EfficientNetV2 S, скорее всего, будет самым требовательным из трех моделей. Больше параметров означает больше данных для чтения и обработки операций из памяти, что ведет к более низкой производительности и высокому энергопотреблению.

Все представленные модели были инициализированы с предобученными весами ImageNet. Так как используются предобученные веса, был использован подход с дифференциальной скоростью обучения. При обучении на обычной скорости предобученные веса могут разрушаться, что снизит эффективность итоговой модели. В случае дифференцирующей скорости обучения предобученные веса обучаются на скорости в 10 раз меньшей скорости обучения классификатора модели. Также используется динамический планировщик ReduceLROnPlateau, что позволяет динамически изменять скорость обучения.

4. Квантование

После выбора оптимальной легковесной архитектуры для развертывания на устройствах с ограниченными ресурсами необходимо применить квантование весов. Квантование - процесс уменьшения точности представления данных для экономии ресурсов. Обычно в модели веса храняться в формате 32-битных чисел с плавающей запятой FP32. Уменьшение точности весов приносит уменьшение размера модели, а в случае если есть аппаратная поддержка ускорение выполнения модели.

Квантование может привести к потере точности, но квантование после обучения позволяет минимизировать этот эффект для большинства задач.

5. Исследовательский эксперимент

Эксперимент выполнялся на компьютере с видеоускорителем Nvidia Geforce GTX 1650 Super для этапа обучения и тестирования, имеющим 4 гигабайт встроенной видеопамяти. Все модели обучались 10 эпох с квантованием FP16 и с учетом итерации разогрева. Также размер батча моделей соответствует 64, кроме EfficientNetV2 S (32) из-за ограничений количества видеопамяти. Обучение проводилось с использованием фреймворка Pytorch Lightning.

Так как исследование направлено в первую очередь на портативные устройства, была сформирована формула расчета производительности для мобильных процессоров - , где  - время обработки на GPU мобильного Soc,  - время обработки на GPU,  - производительность GPU в FP16 и  – производительность GPU мобильного SoC (System on chip) в FP16. Стоит отметить, что данный результат является теоретическим (оценочным) и не учитывает различия в архитектуре, пропускной способности дискретных и мобильных GPU. В качестве целевого мобильного Soc был выбран Mediatek Dimensity 9500.

MobileNetV4 medium показала превосходные результаты, показав точность 0.991 на тестовом наборе данных. График обучения модели не имеет признаков переобучения.

 

Рисунок 1. График обучения модели MobileNetV4 medium

 

Модель хорошо справляется с классификацией, что видно исходя из матрицы путаницы. Единственная проблема это встречающаяся путаница с классами фитофтороз и альтернарией у томатов и картофеля, что может привести к некорректной профилактике

 

Рисунок 2. Матрица путаницы модели MobileNetV4 medium

 

MobileNetV4 показывает отличную задержку времени обработки кадра 0.19 секунды.

EfficientNet B0 значительно превосходит MobileNetV4 практически по всем ключевым метрикам, несмотря на то, что является в два раза более компактной моделью. Модель показывает точность 0.995 и справляется лучше с предсказанием классов.

 

Рисунок 3. График обучения модели EfficientNet B0

 

Данная модель еще лучше справляется с классификацией, однако, проблема распознавания фитофтороза и альтернарии у томатов сохраняется.

 

Рисунок 4. Матрица путаницы EfficientNet B0

 

EfficientNet B0 показывает более высокую производительность обработки кадра на 0.16 секунды, что также является ключевым аспектом данной модели.

EfficientNetV2 S показала схожий результат с EfficientNet B0, показав точность 0.96 на тестовом наборе данных без явного переобучения.

 

Рисунок 5. График обучения EfficientNetV2 S

 

Анализ матрицы путаницы выявил ухудшение классификации болезней кукурузы из-за визуального сходства симптомов.

 

Рисунок 6. Матрица путаницы EfficientNetV2 S

 

При этом, из-за большего количества параметров, EfficientNetV2 требует больше времени на обработку одного кадра, чем все предыдущие модели (на 0.032 в отличие от EfficientNet B0 и 0.025 в отличии от MobileNetV4). Это делает нерациональным выбор данной модели в качестве основной.

Таблица 1.

Итоговое сравнение моделей

 

MobileNetV4

EfficientNet B0

EfficientNetV2 S

Точность

0.991

0.995

0.995

Время обработки кадра (с.)

0.049

0.042

0.074

Теоретическое время обработки кадра на Dimensity 9500 (с.)

0.041

0.035

0.063

Время обучения модели (ч.)

2.75

4.07

6.13

Количество параметров (м)

8.48

4.05

20.2

 

6. Выводы исследования

Исходя из проведенного исследования все модели успешно справляются с поставленной задачей, демонстрируя точность определения выше 0.99 и высокую производительность обработки кадра на мобильном SoC (System on chip). Необходимо отметить, что достигнутая высокая точность во многом является ожидаемым результатом при работе с датасетом PlantVillage, который известен своей относительной простотой. Но, несмотря на это, все три рассмотренные модели, продемонстрировали способность к распознаванию заболеваний растений на основе визуальных признаков на уровне более тяжелых моделей, что подтверждает общую пригодность современных легковесных моделей для решения задач в области земледелия.

Однозначным лидером среди моделей является EfficientNet B0, так как она обеспечивает баланс между качеством предсказания, минимальным временем выполнения и компактным размером.

С экономической точки зрения внедрение подобных ИИ-систем является высокорентабельным шагом. Оно позволяет агробизнесу минимизировать риски потери урожая, существенно снизить расходы на химическую обработку и оптимизировать штат специалистов, обеспечивая быстрый возврат инвестиций за счет использования доступных переносных устройств и отсутствия необходимости в дорогой серверной инфраструктуре.

В заключение стоит отметить, что полученные результаты открывают широкие перспективы для дальнейших исследований. В частности, представляет интерес апробация методов квантования и дистилляции для ещё большего ускорения выполнения без существенной потери точности. Кроме того, эволюционным продолжением работы может стать интеграция выбранной модели в полноценное мобильное приложение с функциями геолокации, ведения истории наблюдений, что позволит создать комплексный инструмент поддержки принятия решений для современного агробизнеса.

 

Список литературы:
1. MobileNetV4 -- Universal Models for the Mobile Ecosystem / Danfeng Qin, Chas Leichner, Manolis Delakis, Marco Fornoni, Shixin Luo, Fan Yang, Weijun Wang, Colby Banbury, Chengxi Ye, Berkin Akin, Vaibhav Aggarwal, Tenghui Zhu, Daniele Moro, Andrew Howard. // arXiv preprint. – 2024. - arXiv:2404.10518. – URL: https://arxiv.org/abs/2404.10518 (дата обращения: 13.07.2026)
2. M. Tan, Q. V. Le. EfficientNetV2: Smaller Models and Faster Training // arXiv preprint. – 2021. - arXiv:2104.00298. – URL: https://arxiv.org/abs/2104.00298 (дата обращения: 15.07.2026)
3. A Survey of Quantization Methods for Efficient Neural Network Inference / A. Gholami, S. Kim, Z. Dong, Z. Yao, M. W. Mahoney, K. Keutzer. // arXiv preprint. – 2021. - arXiv:2103.13630. – URL: https://arxiv.org/abs/2103.13630 (дата обращения 17.07.2026)