AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark
AgMMU: Tiêu chuẩn hiểu biết đa phương thức nông nghiệp toàn diện

Author: Aruna Gauba, Irene Pi, Yunze Man, Ziqi Pang, Vikram S. Adve, Yu-Xiong Wang | Year: 2025

Keywords: Computer Vision

Abstract / Summary

We present AgMMU, a challenging real-world benchmark for evaluating and advancing vision-language models (VLMs) in the knowledge-intensive domain of agriculture. Unlike prior datasets that rely on crowdsourced prompts, AgMMU is distilled from 116,231 authentic dialogues between everyday growers and USDA-authorized Cooperative Extension experts. Through a three-stage pipeline: automated knowledge extraction, QA generation, and human verification, we construct (i) AgMMU, an evaluation set of 746 multiple-choice questions (MCQs) and 746 open-ended questions (OEQs), and (ii) AgBase, a development corpus of 57,079 multimodal facts covering five high-stakes agricultural topics: insect identification, species identification, disease categorization, symptom description, and management instruction. Benchmarking 12 leading VLMs reveals pronounced gaps in fine-grained perception and factual grounding. Open-sourced models trail after proprietary ones by a wide margin. Simple fine-tuning on AgBase boosts open-sourced model performance on challenging OEQs for up to 11.6% on average, narrowing this gap and also motivating future research to propose better strategies in knowledge extraction and distillation from AgBase. We hope AgMMU stimulates research on domain-specific knowledge integration and trustworthy decision support in agriculture AI development.


Bản dịch tiếng Việt:

Chúng tôi giới thiệu AgMMU, một tiêu chuẩn thực tế đầy thách thức để đánh giá và nâng cao các mô hình ngôn ngữ tầm nhìn (VLM) trong lĩnh vực nông nghiệp thâm dụng tri thức. Không giống như các bộ dữ liệu trước đây dựa vào lời nhắc từ cộng đồng, AgMMU được chắt lọc từ 116.231 cuộc đối thoại xác thực giữa những người trồng trọt hàng ngày và các chuyên gia Khuyến nông Hợp tác xã được USDA ủy quyền. Thông qua quy trình ba giai đoạn: trích xuất kiến ​​thức tự động, tạo QA và xác minh con người, chúng tôi xây dựng (i) AgMMU, một bộ đánh giá gồm 746 câu hỏi trắc nghiệm (MCQ) và 746 câu hỏi mở (OEQ) và (ii) AgBase, một kho dữ liệu phát triển gồm 57.079 dữ kiện đa phương thức bao gồm năm chủ đề nông nghiệp quan trọng: nhận dạng côn trùng, nhận dạng loài, phân loại bệnh, mô tả triệu chứng và hướng dẫn quản lý. Việc so sánh 12 VLM hàng đầu cho thấy những lỗ hổng rõ rệt trong nhận thức chi tiết và nền tảng thực tế. Các mô hình nguồn mở theo sau các mô hình độc quyền với khoảng cách rộng. Tinh chỉnh đơn giản trên AgBase giúp tăng hiệu suất mô hình nguồn mở trên các OEQ đầy thử thách với mức trung bình lên tới 11,6%, thu hẹp khoảng cách này và cũng thúc đẩy nghiên cứu trong tương lai đề xuất các chiến lược tốt hơn trong việc khai thác và chắt lọc kiến ​​thức từ AgBase. Chúng tôi hy vọng AgMMU sẽ thúc đẩy nghiên cứu về tích hợp kiến ​​thức theo từng lĩnh vực cụ thể và hỗ trợ ra quyết định đáng tin cậy trong phát triển AI nông nghiệp.

Full Document

Open in new tab
Document Ready

Click below to load the full PDF document natively.