تحقیقات آب و خاک ایران

تحقیقات آب و خاک ایران

مقایسه برخی مدل های یادگیری ماشین در برآورد و نقشه برداری رقومی کربن آلی خاک (مطالعه موردی: شرق استان خوزستان)

نوع مقاله : مقاله پژوهشی

نویسندگان
1 گروه علوم و مهندسی خاک، دانشکده کشاورزی، دانشگاه شهید چمران اهواز، خوزستان، ایران
2 استاد تمام گروه علوم و مهندسی خاک، دانشکده کشاورزی، دانشگاه شهید چمران اهواز، خوزستان، ایران
3 گروه علوم محیط ‌زیست، دانشگاه گوئلف، آنتاریو، کانادا
چکیده
با توجه به تغییرپذیری مکانی بالای کربن آلی خاک (SOC) به‌عنوان شاخصی کلیدی در ارزیابی کیفیت خاک، پهنه‌بندی دقیق این ویژگی در مقیاس منطقه‌ای ضروری است. هدف این پژوهش مقایسه کارایی مدل‌های جنگل تصادفی (RF)، رگرسیون کریجینگ (RK) و گرادیان تقویت شده (XGBoost) و تعیین مهمترین عومل کنترل‌کننده SOC در حوضه آبخیز سد کارون ۳ بود. بر این اساس، 158 نمونه خاک سطحی مرکب (۰ تا ۵ سانتی‌متر) با روش ابرمکعب لاتین مشروط (cLHS) برداشت شد. پس از آماده‌سازی نمونه‌ها، برخی ویژگی‌های فیزیکی و شیمیایی خاک شامل فراوانی ذرات شن، سیلت و رس، قابلیت هدایت الکتریکی (EC)، pH، کربنات کلسیم معادل (CCE) و جرم مخصوص ظاهری (BD) به روش‌های استاندارد آزمایشگاهی اندازه‌گیری شدند. همچنین، مجموعه‌ای از 31 متغیر کمکی اعم از شاخص‌های توپوگرافی، طیفی، اقلیمی و ویژگی‌های خاک پس از حذف متغیرهای با واریانس نزدیک به صفر، دارای همبستگی بالا (8/0 ≤ r) و با مقدار 10 < VIF، برای مدل‌سازی تغییرپذیری مکانی SOC استفاده شدند. نتایج نشان داد که مدل XGBoost با بیشترین ضریب تبیین ( 628/0 = R2)، کمترین میزان خطا (473/0 = RMSE و 316/0 = MAE) و بالاترین نسبت عملکرد به بازه چارکی (98/1 = RPIQ) کارایی بهتری نسبت به دو مدل دیگر داشت. متغیرهای BD، CCE، شاخص کربنات (Carb.Ind)، شاخص رطوبت تفاوت نرمال شده (NDMI) و فاکتور طول شیب (LS-Factor) بیشترین اهمیت را در توزیع SOC نشان دادند. نقشه‌های پراکنش SOC در منطقه نشان داد که شمال و شمال غربی منطقه بیشترین مقادیر و مناطق مرکزی، جنوبی و جنوب شرقی کمترین مقادیر SOC را دارند. نقشه‌های عدم قطعیت نشان داد که پیش‌بینی-های ارائه شده در بخش‌هایی از شمال‌غرب، شرق و جنوب منطقه، عدم‌قطعیت بیشتری برخوردارند. به‌طورکلی، می‌توان نتیجه‌گیری نمود که استفاده همزمان از نقشه‌های پیش‌بینی و عدم قطعیت آن‌ها علاوه برای آگاهی از مقدار برآوردشدۀ SOC، برای ارزیابی میزان اعتماد به نتایج ضروری است. ‌
کلیدواژه‌ها
موضوعات

عنوان مقاله English

Comparative Assessment of Selected Machine Learning Algorithms for Soil Organic Carbon Prediction and Mapping (Case Study: East of Khuzestan Province)

نویسندگان English

Farideh Karimi Dehkordi 1
Saeid Hojati 2
Asim Biswas 3
1 Department of Soil Science, Faculty of Agriculture, Shahid Chamran University of Ahvaz, Khuzestan, Iran.
2 Department of Soil Science, Faculty of Agriculture, Shahid Chamran University of ,Ahvaz, Khuzestan, Iran
3 School of Environmental Sciences, University of Guelph, Ontario, Canada
چکیده English

Given spatial variability of soil organic carbon (SOC) as a key indicator of soil quality, its precise regional mapping is essential. This study compared random forest (RF), regression kriging (RK), and extreme gradient boosting (XGBoost) algorithms to identify the most influential factors controlling SOC distribution in the Karun-3 watershed. 158 composite surface soil samples (0–5 cm) were collected using a conditioned Latin Hypercube Sampling (cLHS) design. Standard laboratory methods measured SOC, sand, silt, clay, electrical conductivity (EC), pH, calcium equivalent carbonate (CCE), and bulk density (BD). Additionally, 31 auxiliary variables—topographic, spectral, climatic indices, and soil characteristics—were used to model SOC spatial variability. These variables were pre-processed by removing those with near-zero variance and those highly intercorrelated (r ≥ 0.8) with a variance inflated factor (VIF) > 10. The XGBoost algorithm outperformed the others, demonstrating the highest coefficient of determination (R2 = 0.628), the lowest error metrics (RMSE = 0.473 and MAE = 0.316), and the highest ratio of performance to interquartile range (RPIQ = 1.98). BD, CCE, Carbonate Index (Carb.Ind), Normalized Difference Moisture Index (NDMI), and Length-Slope Factor (LS-Factor) contributed most significantly to SOC distribution. SOC distribution maps indicated that the northern and northwestern parts of the area contain the highest levels, while the central, southern, and southeastern parts have the lowest. Uncertainty maps revealed that predictive map values are less reliable in parts of the northwestern, eastern, and southern study area. Overall, simultaneous application of predictive and uncertainty maps is necessary to understand both predicted values and their reliability.

کلیدواژه‌ها English

Random Forest
XGBoost
Regression Kriging
Auxiliary Variables
Uncertainty Analysis

مقالات آماده انتشار، پذیرفته شده
انتشار آنلاین از 10 شهریور 1405