Hybrid Knowledge Transfer through Attention and Logit Distillation for On-Device Vision Systems in Agricultural IoT
Chuyển giao kiến ​​thức kết hợp thông qua quá trình chắt lọc sự chú ý và logit cho các hệ thống thị giác trên thiết bị trong IoT nông nghiệp

Author: Stanley Mugisha, Rashid Kisitu, Florence Tushabe | Year: 2025

Keywords: Computer Vision, Artificial Intelligence, Machine Learning

Abstract / Summary

Integrating deep learning applications into agricultural IoT systems faces a serious challenge of balancing the high accuracy of Vision Transformers (ViTs) with the efficiency demands of resource-constrained edge devices. Large transformer models like the Swin Transformers excel in plant disease classification by capturing global-local dependencies. However, their computational complexity (34.1 GFLOPs) limits applications and renders them impractical for real-time on-device inference. Lightweight models such as MobileNetV3 and TinyML would be suitable for on-device inference but lack the required spatial reasoning for fine-grained disease detection. To bridge this gap, we propose a hybrid knowledge distillation framework that synergistically transfers logit and attention knowledge from a Swin Transformer teacher to a MobileNetV3 student model. Our method includes the introduction of adaptive attention alignment to resolve cross-architecture mismatch (resolution, channels) and a dual-loss function optimizing both class probabilities and spatial focus. On the lantVillage-Tomato dataset (18,160 images), the distilled MobileNetV3 attains 92.4% accuracy relative to 95.9% for Swin-L but at an 95% reduction on PC and < 82% in inference latency on IoT devices. (23ms on PC CPU and 86ms/image on smartphone CPUs). Key innovations include IoT-centric validation metrics (13 MB memory, 0.22 GFLOPs) and dynamic resolution-matching attention maps. Comparative experiments show significant improvements over standalone CNNs and prior distillation methods, with a 3.5% accuracy gain over MobileNetV3 baselines. Significantly, this work advances real-time, energy-efficient crop monitoring in precision agriculture and demonstrates how we can attain ViT-level diagnostic precision on edge devices. Code and models will be made available for replication after acceptance.


Bản dịch tiếng Việt:

Việc tích hợp các ứng dụng deep learning vào hệ thống IoT nông nghiệp phải đối mặt với thách thức nghiêm trọng trong việc cân bằng độ chính xác cao của Vision Transformers (ViT) với nhu cầu hiệu quả của các thiết bị biên bị hạn chế về tài nguyên. Các mô hình máy biến áp lớn như Swin Transformers vượt trội trong việc phân loại bệnh thực vật bằng cách nắm bắt được sự phụ thuộc toàn cầu-địa phương. Tuy nhiên, độ phức tạp tính toán của chúng (34,1 GFLOP) hạn chế các ứng dụng và khiến chúng không thực tế để suy luận trên thiết bị theo thời gian thực. Các mô hình nhẹ như MobileNetV3 và TinyML sẽ phù hợp để suy luận trên thiết bị nhưng thiếu khả năng suy luận không gian cần thiết để phát hiện bệnh chi tiết. Để thu hẹp khoảng cách này, chúng tôi đề xuất một khung chắt lọc kiến ​​thức kết hợp giúp chuyển tải một cách tổng hợp kiến ​​thức logit và sự chú ý từ giáo viên Swin Transformer sang mô hình sinh viên MobileNetV3. Phương pháp của chúng tôi bao gồm việc giới thiệu tính năng căn chỉnh chú ý thích ứng để giải quyết sự không khớp giữa các kiến ​​trúc (độ phân giải, kênh) và chức năng mất kép tối ưu hóa cả xác suất của lớp và trọng tâm không gian. Trên tập dữ liệu lantVillage-Tomato (18.160 hình ảnh), MobileNetV3 chắt lọc đạt độ chính xác 92,4% so với 95,9% của Swin-L nhưng giảm 95% trên PC và < 82% độ trễ suy luận trên thiết bị IoT. (23 mili giây trên CPU PC và 86 mili giây/hình ảnh trên CPU điện thoại thông minh). Những cải tiến quan trọng bao gồm các chỉ số xác thực tập trung vào IoT (bộ nhớ 13 MB, 0,22 GFLOP) và bản đồ chú ý phù hợp với độ phân giải động. Các thử nghiệm so sánh cho thấy những cải tiến đáng kể so với các CNN độc lập và các phương pháp chưng cất trước đó, với mức tăng độ chính xác 3,5% so với đường cơ sở MobileNetV3. Điều đáng chú ý là công việc này thúc đẩy việc giám sát cây trồng tiết kiệm năng lượng, theo thời gian thực trong nông nghiệp chính xác và chứng minh cách chúng ta có thể đạt được độ chính xác chẩn đoán ở cấp độ ViT trên các thiết bị biên. Mã và mô hình sẽ được cung cấp để nhân rộng sau khi được chấp nhận.

Full Document

Open in new tab
Document Ready

Click below to load the full PDF document natively.