نظارت انسانی در هوش مصنوعی (Human in the Loop یا به اختصار HITL) به سیستم یا فرآیندی اشاره دارد که در آن انسان به طور فعال در عملکرد، نظارت یا تصمیمگیری یک سیستم خودکار مشارکت میکند. در حوزه هوش مصنوعی، HITL بدین معناست که انسانها در بخشهایی از جریان کاری هوش مصنوعی حضور دارند تا از دقت، ایمنی، پاسخگویی یا تصمیمگیری اخلاقی اطمینان حاصل کنند.
یادگیری ماشین (ML) در سالهای اخیر پیشرفتهای شگفتانگیزی داشته است، اما حتی پیشرفتهترین مدلهای یادگیری عمیق نیز ممکن است با ابهام، سوگیری یا موارد خاصی که با دادههای آموزشی آنها مغایرت دارد، دستوپنجه نرم کنند. بازخورد انسانی میتواند هم به بهبود مدلها کمک کند و هم به عنوان یک سوپاپ اطمینان در زمانی که سیستمهای هوش مصنوعی عملکرد مطلوبی ندارند، عمل کند. HITL بینش انسان را وارد این «حلقه» (یعنی چرخه مداوم تعامل و بازخورد میان سیستمهای هوش مصنوعی و انسانها) میکند.
هدف از نظارت و قضاوت انسانی (HITL) یا همان نظارت انسانی در هوش مصنوعی این است که به سیستمهای هوش مصنوعی اجازه دهد بدون قربانی کردن دقت، ظرافتها و استدلال اخلاقیِ حاصل از نظارت انسانی، به کارایی خودکارسازی دست یابند.

مزایای Human in the loop
یادگیری ماشینی با نظارت انسانی به انسانها اجازه میدهد تا بر جریانهای کاری هوش مصنوعی نظارت داشته باشند و در آنها مشارکت کنند. در ادامه مزایای اصلی استفاده از روش نظارت انسانی در هوش مصنوعی آورده شده است:
- دقت و قابلیت اطمینان
- تصمیمگیری اخلاقی و مسئولیتپذیری
- شفافیت و تبیینپذیری
دقت و قابلیت اطمینان
هدف از خودکارسازی جریانهای کاری این است که زمان و تلاشی که انسانها باید صرف مدیریت آنها کنند، به حداقل برسد. با این حال، جریانهای کاری خودکار ممکن است به روشهای مختلفی دچار خطا شوند. گاهی اوقات مدلها با موارد نادری (edge cases) مواجه میشوند که در آموزشهایشان آمادگی لازم برای مدیریت آنها را کسب نکردهاند. رویکرد HITL به انسانها اجازه میدهد تا ورودیهای نادرست را اصلاح کنند و به مدل این فرصت را بدهند که در طول زمان بهبود یابد. انسانها میتوانند با استفاده از تخصص موضوعی خود، رفتارهای ناهنجار را شناسایی کرده و سپس این دانش را در درک مدل بگنجانند.
در کاربردهای حساس و پرخطر، انسانها میتوانند هشدارها، بازبینیهای انسانی و مکانیزمهای حفاظتی (failsafes) را اعمال کنند تا اطمینان حاصل شود که تصمیمات خودکار تایید شدهاند. آنها میتوانند خروجیهای سوگیرانه یا گمراهکننده را شناسایی کرده و از پیامدهای منفی در مراحل بعدی جلوگیری کنند. بازخورد مداوم انسانی به مدلهای هوش مصنوعی کمک میکند تا با محیطهای در حال تغییر سازگار شوند.
سوگیری الگوریتمی یک نگرانی همیشگی در یادگیری ماشینی است؛ و با وجود اینکه میدانیم هوش انسانی نیز گاهی میتواند کاملاً سوگیرانه عمل کند، لایه اضافهای از مداخله انسانی میتواند به شناسایی و کاهش سوگیریهای نهفته در دادهها و خود الگوریتمها کمک کند، که این امر موجب تقویت عدالت در خروجیهای هوش مصنوعی میشود.
تصمیمگیری اخلاقی و مسئولیتپذیری
وقتی یک انسان در تایید یا رد خروجیهای هوش مصنوعی نقش دارد، مسئولیت صرفاً بر عهده مدل یا توسعهدهندگان آن نخواهد بود.
برخی تصمیمات نیازمند استدلالهای اخلاقی هستند که ممکن است فراتر از تواناییهای یک مدل باشد. به عنوان مثال، توصیههای یک پلتفرم استخدامی مبتنی بر الگوریتم ممکن است به ضرر گروههایی تمام شود که از نظر تاریخی به حاشیه رانده شدهاند. اگرچه مدلهای یادگیری ماشینی در چند سال اخیر پیشرفتهای چشمگیری در توانایی درک جزئیات و ظرایف در استدلالهای خود داشتهاند، اما گاهی اوقات نظارت انسانی همچنان بهترین رویکرد است. نظارت و قضاوت انسانی به افرادی که درک بهتری از هنجارها، بافتهای فرهنگی و نقاط خاکستری اخلاقی دارند، اجازه میدهد تا در صورت بروز دوراهیهای پیچیده، خروجیهای خودکار را متوقف کرده یا آنها را تغییر دهند.
رویکرد نظارت انسانی میتواند سابقهای از چرایی لغو یک تصمیم را به همراه یک گزارش بازرسی (audit trail) ارائه دهد که از شفافیت و بررسیهای خارجی پشتیبانی میکند. این مستندسازی اجازه دفاع قانونی مستحکمتر، ممیزی انطباق و بازبینیهای مسئولیتپذیری داخلی را میدهد.
برخی مقررات هوش مصنوعی سطوح خاصی از HITL را الزامی میکنند. به عنوان مثال، ماده ۱۴ قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) بیان میکند که «سیستمهای هوش مصنوعی با ریسک بالا باید به گونهای طراحی و توسعه یابند – از جمله با ابزارهای مناسب رابط انسان و ماشین – که در دوره استفاده، بتوانند بهطور موثر توسط اشخاص حقیقی نظارت شوند.»
طبق این مقررات، این نظارت باید از خطرات مربوط به سلامت، ایمنی یا حقوق اساسی جلوگیری کرده یا آنها را به حداقل برساند؛ با روشهایی که شامل عملیات دستی، مداخله، ابطال تصمیم و پایش در لحظه میشود. افرادی که در این فرآیند درگیر هستند باید برای انجام این کار «صلاحیت» داشته باشند، تواناییها و محدودیتهای سیستم را درک کنند، در زمینه استفاده صحیح از آن آموزش دیده باشند و از اختیارات لازم برای مداخله در صورت نیاز برخوردار باشند. هدف از این نظارت، تشویق به اجتناب از آسیب و اطمینان از عملکرد صحیح است.
شفافیت و تبیینپذیری
نظارت انسانی در هوش مصنوعی با شناسایی خطاها قبل از اینکه منجر به آسیب شوند، به عنوان یک تور ایمنی عمل میکند؛ به ویژه در بخشهای پرخطر یا دارای مقررات سختگیرانه مانند مراقبتهای بهداشتی یا امور مالی. رویکردهای HITL به کاهش اثر «جعبه سیاه» (black box) کمک میکنند، یعنی همان وضعیتی که در آن استدلال پشت خروجیهای هوش مصنوعی نامشخص است. گنجاندن نظارت و کنترل انسانی در فرآیندهای توسعه و استقرار در کنار توسعه هوش مصنوعی توضیح پذیر یا Explainable AI به متخصصان کمک میکند تا ریسکها را شناسایی و کاهش دهند، خواه این ریسکها فنی، اخلاقی، قانونی یا عملیاتی باشند.

معایب Human in the loop
رویکرد نظارت انسانی (HITL) روشی فوقالعاده برای ارتقای عملکرد سیستمهای یادگیری ماشینی است، اما این روش بدون چالش و ایراد نیست.
- مقیاسپذیری و هزینه
- خطای انسانی و عدم ثبات
- حریم خصوصی و امنیت
مقیاسپذیری و هزینه
برچسبگذاری دادهها توسط انسان میتواند فرآیندی کند و گران باشد، بهویژه در مورد مجموعهدادههای بزرگ یا چرخههای بازخورد تکرارپذیر. با افزایش حجم دادهها یا پیچیدگی سیستم، تکیه بر نیروی انسانی میتواند به یک گلوگاه تبدیل شود. برای مثال، برچسبگذاری میلیونها تصویر برای یک مدل بینایی کامپیوتری با دقت بالا، ممکن است به هزاران ساعت کار انسانی نیاز داشته باشد. برخی حوزهها مانند هوش مصنوعی در پزشکی ممکن است به متخصصان موضوعی گرانقیمتتری در چرخه نظارت نیاز داشته باشند. یک تومور که در اسکن تصویربرداری پزشکی به اشتباه برچسبگذاری شده باشد، میتواند منجر به خطایی جبرانناپذیر شود.
خطای انسانی و عدم ثبات
اگرچه انسانها میتوانند دقت بالاتری را فراهم کنند، اما از جهاتی ممکن است نسبت به ماشینها دارای سوگیری بیشتر و مستعد خطا باشند. انسانها ممکن است دادهها یا وظایف را بهگونهای متفاوت تفسیر کنند، بهویژه در حوزههایی که پاسخ درست یا غلطِ قطعی برای آنها وجود ندارد. برچسبگذاران انسانی، به دلیل ماهیت انسانی خود، ممکن است هنگام برچسبگذاری دادهها دچار خستگی، حواسپرتی یا سردرگمی شوند. آنها همچنین دیدگاههای متفاوتی نسبت به مسائل ذهنی (Subjective) دارند که میتواند منجر به ناهماهنگی و عدم ثبات در برچسبگذاری شود.
حریم خصوصی و امنیت
دخالت دادن انسانها در فرآیندهای بازبینی داخلی میتواند نگرانیهایی را در مورد حریم خصوصی ایجاد کند؛ حتی برچسبگذارانی با حسن نیت نیز ممکن است بهطور ناخواسته دادههای حساسی را که در طول فرآیند بازخورد به آنها دسترسی دارند، افشا کرده یا از آنها سوءاستفاده کنند.

نظارت انسانی در هوش مصنوعی (HITL) چگونه کار میکند؟
ارائه بازخوردهای انسانی هدفمند و باکیفیت قبل، حین و بعد از آموزش، یک حلقه بازخورد ایجاد میکند که یادگیری را تسریع کرده و مدلهای یادگیری ماشینی را قدرتمندتر، تبیینپذیرتر و با نیازهای دنیای واقعی همسوتر میسازد. در اینجا چند روش برای ادغام تعامل انسانی در جریانهای کاری هوش مصنوعی آورده شده است.
- یادگیری نظارتشده
- RLHF
- یادگیری فعال
یادگیری نظارتشده
کاربردهای یادگیری نظارتشده مستلزم آن است که دانشمندان داده، دادهها را بهدرستی برچسبگذاری کنند. این حاشیهنویسی دادهها منجر به ایجاد مجموعهدادههایی میشود که سپس برای آموزش الگوریتم یادگیری ماشینی به کار میروند. این جریانی کاری است که در آن ورودی انسانی، ضروری و در اولویت قرار دارد.
بهعنوان مثال، یک رویکرد نظارتشده در بافت پردازش زبان طبیعی ممکن است شامل برچسبگذاری متنها توسط انسان به عنوان «اسپم» یا «غیر اسپم» باشد تا به ماشین آموزش دهد که چنین تشخیصهایی را با موفقیت انجام دهد. در یک مورد استفاده از بینایی کامپیوتری، رویکرد نظارتشده میتواند شامل برچسبگذاری مجموعهای از تصاویر توسط انسان به عنوان «ماشین»، «اتوبوس» یا «موتورسیکلت» باشد تا مدل بتواند وظایف تشخیص اشیا را انجام دهد.
RLHF
در مثالی دیگر، یادگیری تقویتشده از بازخورد انسانی (RLHF) از یک «مدل پاداش» استفاده میکند که با بازخورد مستقیم انسانی آموزش دیده است؛ این مدل سپس برای بهینهسازی عملکرد یک عامل هوش مصنوعی از طریق یادگیری تقویتشده به کار میرود. RLHF بهطور منحصربهفردی برای وظایفی با اهداف پیچیده، بدتعریفشده یا دشوار برای تعیین دقیق، مناسب است. تسلط بر روش های یادگیری تقویتی نیازمند گذراندن یک دوره یادگیری تخصصی AI به صورت عملی و پروژه محور است.
یادگیری فعال
در یادگیری فعال، مدل پیشبینیهای نامطمئن یا با اطمینان پایین را شناسایی کرده و تنها در موارد مورد نیاز، درخواست ورودی انسانی میکند. این کار تلاش برای برچسبگذاری را روی سختترین یا مبهمترین مثالها متمرکز میکند که منجر به یادگیری سریعتر و دقیقتر میشود.
سوالات متداول در مورد Human in the loop
نظارت انسانی (HITL) در هوش مصنوعی به چه معناست؟
این اصطلاح به فرآیندی اطلاق میشود که در آن انسانها با ارائه دادههای آموزشی، بازبینی خروجیها و اصلاح خطاها، در چرخه تصمیمگیری سیستمهای هوشمند مشارکت میکنند تا دقت و ایمنی آنها تضمین شود.
تفاوت RLHF با یادگیری نظارتشده کلاسیک چیست؟
در یادگیری نظارتشده، انسان مستقیماً دادهها را برچسبگذاری میکند، اما در RLHF (یادگیری تقویتشده از بازخورد انسانی)، انسانها به کیفیت پاسخهای مدل امتیاز میدهند تا یک مدل پاداش برای هدایت هوش مصنوعی ساخته شود.
آیا نظارت انسانی بر هوش مصنوعی هزینهبر است؟
بله، تکیه بر تخصص انسانی بهویژه در حوزههای تخصصی مانند پزشکی و حقوق میتواند زمانبر و گران باشد و به عنوان یک گلوگاه در مقیاسپذیری سیستمهای هوش مصنوعی عمل کند.
چرا قانون هوش مصنوعی اتحادیه اروپا بر HITL تاکید دارد؟
برای اطمینان از اینکه سیستمهای پرریسک تحت نظارت اشخاص حقیقی باشند تا از خطرات احتمالی علیه سلامت، ایمنی و حقوق اساسی افراد جلوگیری شده و مسئولیتپذیری حفظ شود.

