AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding
AgriChat: Mô hình ngôn ngữ lớn đa phương thức để hiểu hình ảnh nông nghiệp
Author: Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed | Year: 2026
Keywords: Computer Vision, Artificial Intelligence
Abstract / Summary
The deployment of Multimodal Large Language Models (MLLMs) in agriculture is currently stalled by a critical trade-off: the existing literature lacks the large-scale agricultural datasets required for robust model development and evaluation, while current state-of-the-art models lack the verified domain expertise necessary to reason across diverse taxonomies. To address these challenges, we propose the Vision-to-Verified-Knowledge (V2VK) pipeline, a novel generative AI-driven annotation framework that integrates visual captioning with web-augmented scientific retrieval to autonomously generate the AgriMM benchmark, effectively eliminating biological hallucinations by grounding training data in verified phytopathological literature. The AgriMM benchmark contains over 3,000 agricultural classes and more than 607k VQAs spanning multiple tasks, including fine-grained plant species identification, plant disease symptom recognition, crop counting, and ripeness assessment. Leveraging this verifiable data, we present AgriChat, a specialized MLLM that presents broad knowledge across thousands of agricultural classes and provides detailed agricultural assessments with extensive explanations. Extensive evaluation across diverse tasks, datasets, and evaluation conditions reveals both the capabilities and limitations of current agricultural MLLMs, while demonstrating AgriChat's superior performance over other open-source models, including internal and external benchmarks. The results validate that preserving visual detail combined with web-verified knowledge constitutes a reliable pathway toward robust and trustworthy agricultural AI. The code and dataset are publicly available at https://github.com/boudiafA/AgriChat .
Bản dịch tiếng Việt:
Việc triển khai Mô hình ngôn ngữ lớn đa phương thức (MLLM) trong nông nghiệp hiện đang bị đình trệ do một sự đánh đổi quan trọng: tài liệu hiện có thiếu bộ dữ liệu nông nghiệp quy mô lớn cần thiết để phát triển và đánh giá mô hình mạnh mẽ, trong khi các mô hình tiên tiến hiện tại thiếu kiến thức chuyên môn về lĩnh vực đã được xác minh cần thiết để suy luận về các nguyên tắc phân loại khác nhau. Để giải quyết những thách thức này, chúng tôi đề xuất quy trình Từ Tầm nhìn đến Kiến thức được xác minh (V2VK), một khung chú thích dựa trên AI tổng quát mới tích hợp chú thích trực quan với truy xuất khoa học được tăng cường trên web để tự động tạo điểm chuẩn AgriMM, loại bỏ hiệu quả ảo giác sinh học bằng cách căn cứ dữ liệu đào tạo vào tài liệu về bệnh thực vật đã được xác minh. Điểm chuẩn AgriMM bao gồm hơn 3.000 lớp nông nghiệp và hơn 607 nghìn VQA trải rộng trên nhiều nhiệm vụ, bao gồm xác định loài thực vật chi tiết, nhận biết triệu chứng bệnh thực vật, đếm cây trồng và đánh giá độ chín. Tận dụng dữ liệu có thể xác minh này, chúng tôi giới thiệu AgriChat, một MLLM chuyên biệt trình bày kiến thức rộng về hàng nghìn lớp nông nghiệp và cung cấp các đánh giá chi tiết về nông nghiệp cùng với các giải thích sâu rộng. Đánh giá mở rộng trên các nhiệm vụ, bộ dữ liệu và điều kiện đánh giá khác nhau cho thấy cả khả năng và hạn chế của MLLM nông nghiệp hiện tại, đồng thời chứng minh hiệu suất vượt trội của AgriChat so với các mô hình nguồn mở khác, bao gồm các điểm chuẩn bên trong và bên ngoài. Các kết quả xác nhận rằng việc lưu giữ chi tiết hình ảnh kết hợp với kiến thức đã được xác minh trên web sẽ tạo thành một lộ trình đáng tin cậy hướng tới AI nông nghiệp mạnh mẽ và đáng tin cậy. Mã và tập dữ liệu được cung cấp công khai tại https://github.com/boudiafA/AgriChat.
Full Document
Open in new tabDocument Ready
Click below to load the full PDF document natively.