GPT-4 as Evaluator: Evaluating Large Language Models on Pest Management in Agriculture
GPT-4 với tư cách là Người đánh giá: Đánh giá các mô hình ngôn ngữ lớn về quản lý dịch hại trong nông nghiệp
Author: Shanglong Yang, Zhipeng Yuan, Shunbao Li, Ruoling Peng, Kang Liu, Po Yang | Year: 2024
Keywords: Computation and Language
Abstract / Summary
In the rapidly evolving field of artificial intelligence (AI), the application of large language models (LLMs) in agriculture, particularly in pest management, remains nascent. We aimed to prove the feasibility by evaluating the content of the pest management advice generated by LLMs, including the Generative Pre-trained Transformer (GPT) series from OpenAI and the FLAN series from Google. Considering the context-specific properties of agricultural advice, automatically measuring or quantifying the quality of text generated by LLMs becomes a significant challenge. We proposed an innovative approach, using GPT-4 as an evaluator, to score the generated content on Coherence, Logical Consistency, Fluency, Relevance, Comprehensibility, and Exhaustiveness. Additionally, we integrated an expert system based on crop threshold data as a baseline to obtain scores for Factual Accuracy on whether pests found in crop fields should take management action. Each model's score was weighted by percentage to obtain a final score. The results showed that GPT-3.4 and GPT-4 outperform the FLAN models in most evaluation categories. Furthermore, the use of instruction-based prompting containing domain-specific knowledge proved the feasibility of LLMs as an effective tool in agriculture, with an accuracy rate of 72%, demonstrating LLMs' effectiveness in providing pest management suggestions.
Bản dịch tiếng Việt:
Trong lĩnh vực trí tuệ nhân tạo (AI) đang phát triển nhanh chóng, việc áp dụng các mô hình ngôn ngữ lớn (LLM) trong nông nghiệp, đặc biệt là trong quản lý dịch hại, vẫn còn non trẻ. Chúng tôi nhằm mục đích chứng minh tính khả thi bằng cách đánh giá nội dung của lời khuyên quản lý dịch hại do LLM tạo ra, bao gồm chuỗi Máy biến áp được đào tạo trước (GPT) sáng tạo từ OpenAI và chuỗi FLAN từ Google. Xem xét các đặc tính theo ngữ cảnh cụ thể của lời khuyên nông nghiệp, việc tự động đo lường hoặc định lượng chất lượng văn bản do LLM tạo ra trở thành một thách thức đáng kể. Chúng tôi đã đề xuất một cách tiếp cận đổi mới, sử dụng GPT-4 làm công cụ đánh giá, để chấm điểm nội dung được tạo về Tính mạch lạc, Tính nhất quán logic, Tính trôi chảy, Tính liên quan, Tính dễ hiểu và Tính toàn diện. Ngoài ra, chúng tôi đã tích hợp một hệ thống chuyên gia dựa trên dữ liệu ngưỡng cây trồng làm cơ sở để đạt được điểm về Độ chính xác thực tế về việc liệu các loài gây hại được tìm thấy trên cánh đồng trồng trọt có nên áp dụng biện pháp quản lý hay không. Điểm của mỗi mô hình được tính theo tỷ lệ phần trăm để có được điểm cuối cùng. Kết quả cho thấy GPT-3.4 và GPT-4 vượt trội hơn các mô hình FLAN ở hầu hết các hạng mục đánh giá. Hơn nữa, việc sử dụng lời nhắc dựa trên hướng dẫn có chứa kiến thức về lĩnh vực cụ thể đã chứng minh tính khả thi của LLM như một công cụ hiệu quả trong nông nghiệp, với tỷ lệ chính xác là 72%, chứng tỏ tính hiệu quả của LLM trong việc đưa ra các đề xuất quản lý dịch hại.
Full Document
Open in new tabDocument Ready
Click below to load the full PDF document natively.