
دانشآموخته و استاد دانشگاه تهران در پژوهشی که در نشریه معتبر IEEE Transactions on Automatic Control منتشر شده است، روشی کاملاً توزیعشده برای حل مسائل یادگیری تقویتی چندعامله مقیدشده (Constrained Multi-Agent Reinforcement Learning) ارائه دادهاند. این دستاورد میتواند زمینهساز پیشرفت در حوزههایی نظیر رباتیک، شبکههای هوشمند انرژی، حملونقل و اقتصاد محاسباتی شود.
جزئیات انتشار مقاله و اعتبار علمی
این مقاله با عنوان «A Distributed Primal-Dual Method for Constrained Multi-Agent Reinforcement Learning With General Parameterization» توسط علی کاه، دانشآموخته رتبه اول کارشناسی ارشد مهندسی برق دانشگاه تهران، و حامد کبریایی، عضو هیأت علمی دانشکده فنی دانشگاه تهران، نگاشته شده است. این پژوهش در سال ۲۰۲۶ در نشریه IEEE Transactions on Automatic Control منتشر شده که طبق آخرین رتبهبندی پایگاه استنادی SCImago، جایگاه نخست را در میان ۳۸۲ نشریه بینالمللی حوزه سیستم و کنترل با شاخص اعتبار علمی SJR=۳.۹۲۹ دارا است.
نوآوری در یادگیری تقویتی توزیعشده
در سامانههای هوشمند، عاملها (Agents) باید بهصورت همزمان و مستقل تصمیمگیری کنند و در عین حال به اهداف مشترک برسند. چالش اصلی در روشهای موجود، نیاز به یک واحد کنترلکننده مرکزی یا هماهنگی متمرکز است که اجرای آنها را در محیطهای واقعی و مقیاس بزرگ با محدودیت مواجه میکند.
ویژگیهای کلیدی این پژوهش عبارتند از:
- رویکرد توزیعشده: هر عامل تنها با استفاده از اطلاعات محلی خود و عاملهای همسایه، قادر به یادگیری و تصمیمگیری است.
- ساختار الگوریتم: این روش مبتنی بر الگوریتم «اولیه دوگان (Primal-Dual)» و ساختار «Actor-Critic» طراحی شده است.
- رعایت محدودیتها: عاملهای هوشمند میتوانند ضمن رعایت محدودیتهای مشترک سیستم، بهصورت آنلاین و مستقل فرآیند یادگیری را انجام دهند.
- همگرایی نظری: پژوهشگران نشان دادهاند که متغیرهای دوگان یا ضرایب لاگرانژ میان عاملها به اجماع میرسند و الگوریتم از لحاظ نظری به یک نقطه تعادل همگرا میشود.