Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment
Các mô hình khuếch tán sáng tạo cho AI nông nghiệp: tạo hình ảnh thực vật, dịch từ trong nhà ra ngoài và căn chỉnh ưu tiên chuyên gia

Author: Da Tan, Michael Beck, Christopher P. Bidinosti, Robert H. Gulden, Christopher J. Henry | Year: 2025

Keywords: Computer Vision

Abstract / Summary

The success of agricultural artificial intelligence depends heavily on large, diverse, and high-quality plant image datasets, yet collecting such data in real field conditions is costly, labor intensive, and seasonally constrained. This paper investigates diffusion-based generative modeling to address these challenges through plant image synthesis, indoor-to-outdoor translation, and expert preference aligned fine tuning. First, a Stable Diffusion model is fine tuned on captioned indoor and outdoor plant imagery to generate realistic, text conditioned images of canola and soybean. Evaluation using Inception Score, Frechet Inception Distance, and downstream phenotype classification shows that synthetic images effectively augment training data and improve accuracy. Second, we bridge the gap between high resolution indoor datasets and limited outdoor imagery using DreamBooth-based text inversion and image guided diffusion, generating translated images that enhance weed detection and classification with YOLOv8. Finally, a preference guided fine tuning framework trains a reward model on expert scores and applies reward weighted updates to produce more stable and expert aligned outputs. Together, these components demonstrate a practical pathway toward data efficient generative pipelines for agricultural AI.


Bản dịch tiếng Việt:

Sự thành công của trí tuệ nhân tạo nông nghiệp phụ thuộc rất nhiều vào bộ dữ liệu hình ảnh thực vật lớn, đa dạng và chất lượng cao, tuy nhiên việc thu thập dữ liệu đó trong điều kiện thực tế rất tốn kém, tốn nhiều công sức và bị hạn chế theo mùa. Bài viết này nghiên cứu mô hình tổng quát dựa trên khuếch tán để giải quyết những thách thức này thông qua tổng hợp hình ảnh thực vật, dịch từ trong nhà ra ngoài trời và tinh chỉnh phù hợp với sở thích của chuyên gia. Đầu tiên, mô hình Khuếch tán ổn định được tinh chỉnh trên hình ảnh thực vật trong nhà và ngoài trời có chú thích để tạo ra hình ảnh thực tế, được điều chỉnh bằng văn bản về cải dầu và đậu nành. Đánh giá bằng cách sử dụng Điểm khởi đầu, Khoảng cách khởi động Frechet và phân loại kiểu hình xuôi dòng cho thấy hình ảnh tổng hợp giúp tăng cường hiệu quả dữ liệu đào tạo và cải thiện độ chính xác. Thứ hai, chúng tôi thu hẹp khoảng cách giữa bộ dữ liệu trong nhà có độ phân giải cao và hình ảnh hạn chế ngoài trời bằng cách sử dụng tính năng đảo ngược văn bản dựa trên DreamBooth và khuếch tán hướng dẫn bằng hình ảnh, tạo ra các hình ảnh đã dịch giúp nâng cao khả năng phát hiện và phân loại cỏ dại bằng YOLOv8. Cuối cùng, khung tinh chỉnh theo hướng dẫn ưu tiên đào tạo mô hình khen thưởng dựa trên điểm số của chuyên gia và áp dụng các cập nhật có trọng số phần thưởng để tạo ra kết quả đầu ra ổn định hơn và phù hợp với chuyên gia hơn. Cùng với nhau, các thành phần này thể hiện một lộ trình thực tế hướng tới các quy trình tạo dữ liệu hiệu quả cho AI nông nghiệp.

Full Document

Open in new tab
Document Ready

Click below to load the full PDF document natively.