تخفیف تابستانی تا 35 درصد روی تمام دوره ها
روز
ساعت
دقیقه
ثانیه

یادگیری تقویتی از بازخورد انسانی (RLHF) چیست؟

یادگیری تقویتی از بازخورد انسانی (RLHF)
آنچه می خوانید:

هوش مصنوعی در ابتدا تنها بر اساس احتمالات آماری عمل می‌کرد، اما RLHF به آن می‌آموزد که چگونه مانند یک انسان فکر و رفتار کند. این تکنیک به جای تکیه بر فرمول‌های ریاضی پیچیده برای تعریف مفاهیم ذهنی مانند «ادب» یا «خلاقیت»، از قضاوت مستقیم ما استفاده می‌کند تا خروجی‌هایی دقیق‌تر، اخلاقی‌تر و مفیدتر ارائه دهد.

در این مقاله از بخش آموزش هوش مصنوعی، ما به بررسی عمیق این موضوع می‌پردازیم که یادگیری تقویتی از بازخورد انسانی (RLHF) چگونه می‌تواند مدل‌های زبانی بزرگ را از ماشین‌های تولید متن ساده به دستیاران هوشمندی تبدیل کند که هدف و مقصود واقعی کاربران را به درستی درک می‌کنند.

 

RLHF چیست؟

یادگیری تقویتی از بازخورد انسانی (RLHF) یک تکنیک یادگیری ماشین است که در آن یک «مدل پاداش» با بازخورد مستقیم انسانی آموزش می‌بیند و سپس برای بهینه‌سازی عملکرد یک عامل هوش مصنوعی از طریق یادگیری تقویتی استفاده می‌شود.

RLHF که یادگیری تقویتی از ترجیحات انسانی نیز نامیده می‌شود، به‌طور منحصربه‌فردی برای انجام وظایفی با اهداف پیچیده، مبهم یا دشوار برای تعریف، مناسب است. برای مثال، برای یک راهکار الگوریتمی، تعریف «خنده‌دار بودن» با اصطلاحات ریاضی غیرعملی (یا حتی غیرممکن) است؛ اما رتبه‌بندی جوک‌های تولیدشده توسط یک مدل زبانی بزرگ (LLM) برای انسان‌ها کار آسانی است. آن بازخورد انسانی که در قالب یک تابع پاداش خلاصه شده است، می‌تواند برای بهبود توانایی‌های جوک‌نویسی LLM مورد استفاده قرار گیرد.

در مقاله‌ای در سال ۲۰۱۷، پل اف. کریستیانو (Paul F. Christiano) از OpenAI به‌همراه سایر محققان OpenAI و DeepMind، جزئیات موفقیت RLHF را در آموزش مدل‌های هوش مصنوعی برای انجام کارهای پیچیده مانند بازی‌های آتاری و حرکت شبیه‌سازی‌شده رباتیک شرح دادند. با تکیه بر این پیشرفت، بازی‌های ویدئویی همچنان به عنوان میدان آزمایش مهمی برای RLHF باقی ماندند: تا سال ۲۰۱۹، سیستم‌های هوش مصنوعی آموزش‌دیده با RLHF مانند OpenAI Five و AlphaStar متعلق به DeepMind، موفق شدند به ترتیب بازیکنان حرفه‌ای برتر انسان را در بازی‌های بسیار پیچیده‌تر Dota 2 و StarCraft شکست دهند.

شاید مهم‌تر از همه، مقاله سال ۲۰۱۷ شرکت OpenAI اشاره کرد که متدولوژی آن — به‌ویژه معرفی الگوریتم بهینه‌سازی سیاست پروگزیمال (PPO) برای به‌روزرسانی وزن‌های مدل — هزینه جمع‌آوری و استخراج بازخوردهای انسانیِ لازم را به‌شدت کاهش داد. این امر راه را برای ادغام نهایی RLHF با حوزه پردازش زبان طبیعی (NLP) هموار کرد و پیشرفت‌های حاصل از آن به قرارگیری هر دو مورد LLMs و RLHF در خط مقدم تحقیقات هوش مصنوعی کمک کرد.

اولین انتشار کد مربوط به جزئیات استفاده از RLHF در مدل‌های زبانی در سال ۲۰۱۹ توسط OpenAI انجام شد که در ادامه، مدل آموزش‌دیده با RLHF یعنی InstructGPT را در اوایل سال ۲۰۲۲ عرضه کرد. این یک گام حیاتی در پر کردن شکاف بین GPT-3 و مدل‌های GPT-3.5-turbo بود که زیربنای راه‌اندازی ChatGPT قرار گرفتند.

از آن زمان تاکنون، RLHF در آموزش مدل‌های زبانی بزرگ پیشرفته در شرکت‌های OpenAI، DeepMind، Google و Anthropic. استفاده شده است.

یادگیری تقویتی از بازخورد انسانی

 

یادگیری تقویتی چگونه کار می‌کند

از نظر مفهومی، یادگیری تقویتی (RL) با هدف شبیه‌سازی روش یادگیری انسان‌ها عمل می‌کند: عامل‌های هوش مصنوعی به‌صورت کل‌نگر و از طریق آزمون و خطا، با انگیزه دریافت پاداش‌های قوی برای موفقیت، یاد می‌گیرند.

برای عملیاتی کردن این استراتژی، یک چارچوب ریاضی برای یادگیری تقویتی شامل اجزای زیر است:

فضای حالت

فضای حالت (state space) شامل تمام اطلاعات موجود درباره وظیفه در حال انجام است که به تصمیم‌گیری‌های عامل هوش مصنوعی مربوط می‌شود؛ این فضا متغیرهای شناخته‌شده و ناشناخته را در بر می‌گیرد. فضای حالت معمولاً با هر تصمیمی که عامل می‌گیرد، تغییر می‌کند.

فضای عمل

فضای عمل (action space) شامل تمامی تصمیماتی است که عامل هوش مصنوعی می‌تواند اتخاذ کند. برای مثال، در فضای یک بازی رومیزی، فضای عمل گسسته و مشخص است: شامل تمامی حرکات قانونی است که بازیکن هوش مصنوعی در یک لحظه خاص می‌تواند انجام دهد. در حوزه تولید متن، فضای عمل بسیار گسترده است و کل «واژگان» توکن‌های در دسترس یک مدل زبانی بزرگ (LLM) را در بر می‌گیرد.

تابع پاداش

پاداش (Reward) معیاری برای سنجش موفقیت یا پیشرفت است که به عامل هوش مصنوعی انگیزه می‌دهد. در برخی موارد، مانند بازی‌های رومیزی، تعریف موفقیت (در اینجا پیروزی در بازی) عینی و سرراست است. اما زمانی که تعریف «موفقیت» مبهم باشد، طراحی یک تابع پاداش موثر می‌تواند چالش بزرگی باشد. در یک چارچوب ریاضی، این بازخورد باید به یک سیگنال پاداش (reward signal) ترجمه شود: یک کمیت عددی (اسکالر) از بازخورد مثبت یا منفی.

محدودیت‌ها

یک تابع پاداش می‌تواند با جریمه‌ها (پاداش‌های منفی) برای اقداماتی که برای انجام وظیفه مضر تشخیص داده می‌شوند، تکمیل شود. به عنوان مثال، یک سازمان ممکن است بخواهد چت‌بات را از به‌کار بردن الفاظ رکیک یا زبان نامناسب منع کند؛ یا یک مدل خودروی خودران ممکن است برای تصادفات یا انحراف از مسیر جریمه شود.

خط‌ مشی

یک خط‌ مشی (policy) در اصل همان استراتژی یا «فرآیند فکری» است که رفتار عامل هوش مصنوعی را هدایت می‌کند. به زبان ساده ریاضی، یک خط‌مشی («π») تابعی است که یک حالت («s») را به عنوان ورودی می‌گیرد و یک عمل («a») را برمی‌گرداند: π(s)→a.

هدف یک الگوریتم یادگیری تقویتی (RL)، بهینه‌سازی خط‌مشی برای کسب حداکثر پاداش است. در یادگیری تقویتی عمیق، خط‌مشی به صورت یک شبکه عصبی نمایش داده می‌شود که در طول فرآیند آموزش، مطابق با تابع پاداش به طور مداوم به‌روزرسانی می‌شود. عامل هوش مصنوعی درست مانند انسان‌ها، از تجربه یاد می‌گیرد.

در حالی که یادگیری تقویتی (RL) مرسوم به نتایج دنیای واقعی چشمگیری در بسیاری از زمینه‌ها دست یافته است، اما می‌تواند در ایجاد موثر تابع پاداش برای وظایف پیچیده که تعریف مشخصی از موفقیت در آن‌ها دشوار است، با مشکل مواجه شود. مزیت اصلی یادگیری تقویتی از بازخورد انسانی (RLHF) توانایی آن در درک ظرافت‌ها و ذهنیت‌های انسانی با استفاده از بازخورد مثبت انسان به جای اهداف رسمی تعریف شده است.

یادگیری تقویتی

 

RLHF برای مدل‌های زبانی بزرگ

یکی از برجسته‌ترین کاربردهای RLHF، ارتقای مرتبط بودن، دقت و اخلاق‌مداری در مدل‌های زبانی بزرگ (LLM) به‌ویژه برای استفاده از آن‌ها به عنوان چت‌بات هوش مصنوعی بوده است.

LLMها، مانند تمام مدل‌های هوش مصنوعی مولد، به دنبال بازتولید توزیع احتمالی داده‌های آموزشی هستند. اگرچه پیشرفت‌های اخیر، استفاده از LLMها را به عنوان موتورهای محرک چت‌بات‌ها یا حتی موتورهای استدلال برای هوش مصنوعی همه‌منظوره گسترش داده است، این مدل‌های زبانی صرفاً از الگوهای آموخته‌شده از داده‌های آموزشی خود برای پیش‌بینی کلمه یا کلمات بعدی در یک دنباله خاص که با یک پرامپت آغاز شده، استفاده می‌کنند. در یک سطح بنیادی، این مدل‌ها در واقع به یک پرامپت پاسخ نمی‌دهند، بلکه در حال افزودن متن به آن هستند.

بدون دستورالعمل‌های بسیار دقیق، مدل‌های زبانی توانایی کمی در درک قصد کاربر دارند. اگرچه مهندسی پرامپت (prompt engineering) می‌تواند به فراهم کردن بافتار (context) لازم برای یک LLM جهت تطبیق پاسخ خود با نیازهای کاربر کمک کند، اما الزام به استفاده از مهندسی پرامپت برای هر نوبت گفت‌وگو با یک چت‌بات، امری غیرعملی است.

علاوه بر این، در حالی که LLMهای پیش‌فرض و خام با روش‌های متداول برای تولید خروجی‌های از نظر دستوری منسجم آموزش دیده‌اند، آموزش آن‌ها برای تولید خروجی «خوب» مسئله‌ای پیچیده و مبهم است. مفاهیمی مانند حقیقت، مفید بودن، خلاقیت یا حتی آنچه که باعث می‌شود یک قطعه کد قابل اجرا باشد، بسیار بیشتر از معنای کلمات و ساختار زبانی، به بافتار بستگی دارند.

برای بهبود تعامل مدل‌های زبانی با انسان، دانشمندان داده به سراغ یادگیری تقویتی از بازخورد انسانی (RLHF) رفتند. مدل‌های InstructGPT که با RLHF تقویت شده بودند، به‌طور معناداری از پیشینیان خود یعنی GPT-3 بهتر عمل کردند؛ به‌ویژه در زمینه پیروی از دستورالعمل‌ها، حفظ دقت واقع‌گرایانه و اجتناب از توهم‌های مدل (model hallucinations). به همین ترتیب، تحقیقات منتشر شده توسط OpenAI هنگام عرضه GPT-4 نشان داد که RLHF دقت را در مواجهه با سوالات خصمانه (adversarial questions) دو برابر کرده است.

مزایای RLHF حتی می‌تواند از ارزش مجموعه‌داده‌های آموزشی بزرگ‌تر نیز پیشی بگیرد و امکان توسعه مدل‌هایی با بهره‌وری بالاتر از داده‌ها را فراهم کند: OpenAI اشاره کرد که ارزیابان این شرکت، خروجی‌های نسخه 1.3B-parameter InstructGPT را حتی به خروجی‌های نسخه 175B-parameter GPT-3 ترجیح دادند.

 

RLHF چگونه کار می‌کند؟

آموزش یک مدل زبانی بزرگ (LLM) با استفاده از یادگیری تقویتی از بازخورد انسانی (RLHF) معمولاً در چهار مرحله انجام می‌شود:

پیش‌آموزش مدل‌ها

RLHF عموماً برای تنظیم دقیق و بهینه‌سازی یک مدل پیش‌آموزش‌دیده به کار می‌رود، نه به عنوان یک روش آموزش سرتاسری (end-to-end). برای مثال، InstructGPT از RLHF برای ارتقای مدل از پیش موجود GPT — یعنی ترنسفورمر پیش‌آموزش‌دیده مولد (Generative Pre-trained Transformer) — استفاده کرد. OpenAI در اطلاعیه انتشار InstructGPT بیان کرد که «یکی از راه‌های نگاه به این فرآیند این است که این کار توانمندی‌هایی را که GPT-3 از قبل داشت اما استخراج آن‌ها تنها از طریق مهندسی پرامپت دشوار بود، “آزاد” می‌کند.»

پیش‌آموزش همچنان با اختلاف، پرهزینه‌ترین مرحله RLHF از نظر منابع است. OpenAI اشاره کرد که فرآیند آموزش RLHF برای InstructGPT شامل کمتر از ۲ درصد از محاسبات و داده‌های مورد نیاز برای پیش‌آموزش GPT-3 بوده است.

تنظیم دقیق نظارت‌شده

پیش از شروع یادگیری تقویتی صریح، از تنظیم دقیق نظارت‌شده (SFT) برای آماده‌سازی مدل جهت تولید پاسخ‌ها در قالبی که کاربران انتظار دارند، استفاده می‌شود.

همان‌طور که پیش‌تر اشاره شد، فرآیند پیش‌آموزش LLM مدل‌ها را برای تکمیل متن بهینه می‌کند: پیش‌بینی کلمات بعدی در دنباله‌ای که با پرامپت کاربر شروع شده، از طریق بازتولید الگوهای زبانی آموخته‌شده در طول پیش‌آموزش مدل. گاهی اوقات، LLMها دنباله را به شکلی که کاربر می‌خواهد تکمیل نمی‌کنند: برای مثال، اگر پرامپت کاربر این باشد که «به من یاد بده چطور رزومه بسازم»، ممکن است LLM پاسخ دهد «با استفاده از مایکروسافت ورد.» این یک راه معتبر برای تکمیل جمله است، اما با هدف کاربر همسو نیست.

بنابراین، SFT از یادگیری نظارت‌شده برای آموزش مدل‌ها جهت پاسخگویی مناسب به انواع مختلف پرامپت‌ها استفاده می‌کند. متخصصان انسانی نمونه‌های برچسب‌گذاری‌شده‌ای را در قالب (پرامپت، پاسخ) ایجاد می‌کنند تا نحوه پاسخگویی به پرامپت‌ها را برای موارد استفاده مختلف، مانند پاسخ به سوالات، خلاصه‌سازی یا ترجمه، نشان دهند.

این داده‌های نمایشی، با وجود قدرتمند بودن، زمان‌بر و گران‌قیمت هستند. DeepMind به جای ایجاد نمونه‌های جدید و سفارشی، روش «اعمال یک فیلتر اکتشافی بر اساس فرمت رایج دیالوگ‌های مکتوب (سبک متن مصاحبه)» را معرفی کرد تا جفت‌نمونه‌های مناسب پرامپت/پاسخ را از مجموعه داده MassiveWeb خود جدا کند.

آموزش مدل پاداش

برای اینکه بازخورد انسانی بتواند یک تابع پاداش را در یادگیری تقویتی هدایت کند، به یک مدل پاداش نیاز است تا ترجیحات انسانی را به یک سیگنال پاداش عددی ترجمه کند. طراحی یک مدل پاداش موثر، مرحله‌ای حیاتی در RLHF است، زیرا هیچ فرمول ریاضی یا منطقی مستقیمی برای تعریف عملی ارزش‌های ذهنی انسان وجود ندارد.

هدف اصلی این مرحله، فراهم کردن داده‌های آموزشی کافی برای مدل پاداش است که شامل بازخورد مستقیم ارزیابان انسانی می‌شود، تا به مدل کمک کند تقلید کند که چگونه ترجیحات انسانی به انواع مختلف پاسخ‌های مدل، پاداش اختصاص می‌دهند. این کار اجازه می‌دهد تا آموزش به‌صورت آفلاین و بدون حضور انسان در چرخه (human in the loop) ادامه یابد.

یک مدل پاداش باید دنباله‌ای از متن را به عنوان ورودی بگیرد و یک مقدار پاداش اسکالر (عددی) خروجی دهد که به صورت عددی پیش‌بینی کند یک کاربر انسانی چقدر به آن متن پاداش می‌دهد (یا جریمه می‌کند). اسکالر بودن این خروجی برای ادغام خروجی مدل پاداش با سایر اجزای الگوریتم RL ضروری است.

در حالی که ممکن است بصری‌ترین راه این باشد که ارزیابان انسانی نظر خود را درباره هر پاسخ مدل به صورت اسکالر بیان کنند — مثلاً رتبه‌بندی پاسخ در مقیاس یک (بدترین) تا ده (بهترین) — اما همسو کردن همه رتبه‌دهندگان انسانی بر روی ارزش نسبی یک نمره خاص بسیار دشوار است، چه برسد به اینکه بخواهیم آن‌ها را بر سر اینکه چه چیزی در خلاء یک پاسخ «خوب» یا «بد» محسوب می‌شود، هم‌نظر کنیم. این موضوع می‌تواند رتبه‌بندی اسکالر مستقیم را پر از نویز و کالیبره کردن آن را چالش‌برانگیز کند.

در عوض، معمولاً یک سیستم رتبه‌بندی با مقایسه بازخوردهای انسانی برای خروجی‌های مختلف مدل ساخته می‌شود. یک روش رایج این است که از کاربران خواسته شود دو دنباله متنی مشابه — مانند خروجی دو مدل زبانی مختلف که به یک پرامپت پاسخ می‌دهند — را در رقابت‌های رو در رو با هم مقایسه کنند، سپس از سیستم رتبه‌بندی Elo برای ایجاد یک رتبه‌بندی کلی از هر بخش متن تولید شده نسبت به یکدیگر استفاده شود. یک سیستم ساده ممکن است به کاربران اجازه دهد به هر خروجی «لایک» یا «دیس‌لایک» بدهند و سپس خروجی‌ها بر اساس مطلوبیت نسبی‌شان رتبه‌بندی شوند. سیستم‌های پیچیده‌تر ممکن است از برچسب‌گذاران بخواهند که یک رتبه کلی بدهند و به سوالات دسته‌بندی‌شده درباره نقص‌های هر پاسخ پاسخ دهند، سپس این بازخوردها را به‌صورت الگوریتمی در یک نمره کیفیت وزن‌دار تجمیع کنند.

نتایج هر سیستم رتبه‌بندی که استفاده شود، در نهایت به یک سیگنال پاداش اسکالر برای آموزش مدل پاداش نرمال‌سازی می‌شود.

بهینه‌سازی خط‌مشی

آخرین مانع در RLHF، تعیین این است که چگونه — و تا چه حد — باید از مدل پاداش برای به‌روزرسانی خط‌مشی عامل هوش مصنوعی استفاده کرد. یکی از موفق‌ترین الگوریتم‌های مورد استفاده برای تابع پاداش که مدل‌های یادگیری تقویتی را به‌روز می‌کند، بهینه‌سازی خط‌مشی پروگزیمال (PPO) است.

برخلاف اکثر معماری‌های مدل‌های یادگیری ماشین و شبکه عصبی که از گرادیان کاهشی استفاده می‌کنند تا تابع زیان خود را کمینه کرده و به کمترین خطای ممکن برسند، الگوریتم‌های یادگیری تقویتی اغلب از گرادیان افزایشی برای بیشینه‌سازی پاداش استفاده می‌کنند.

با این حال، اگر تابع پاداش برای آموزش LLM بدون هیچ‌گونه حفاظی استفاده شود، مدل زبانی ممکن است وزن‌های خود را به شدت تغییر دهد تا جایی که برای «فریب دادن» (game) مدل پاداش، خروجی‌های نامفهوم تولید کند. PPO با محدود کردن میزان به‌روزرسانی خط‌مشی در هر تکرار آموزشی، روش پایدارتری برای به‌روزرسانی خط‌مشی عامل هوش مصنوعی فراهم می‌کند.

ابتدا یک کپی از مدل اولیه ایجاد شده و وزن‌های قابل آموزش آن منجمد می‌شوند. الگوریتم PPO محدوده‌ای به صورت [1-ε, 1+ε] را محاسبه می‌کند که در آن ε یک هایپرپارامتر است که تقریباً تعیین می‌کند خط‌مشی جدید (به‌روز شده) تا چه حد مجاز است از خط‌مشی قدیمی (منجمد شده) منحرف شود. سپس، یک نسبت احتمال را محاسبه می‌کند: نسبت احتمال انجام یک عمل خاص توسط خط‌مشی قدیمی در مقابل احتمال انجام همان عمل توسط خط‌مشی جدید. اگر نسبت احتمال بزرگ‌تر از 1+ε (یا کمتر از 1-ε) باشد، ممکن است میزان به‌روزرسانی خط‌مشی قطع (clip) شود تا از هرگونه تغییر شدیدی که ممکن است کل مدل را ناپایدار کند، جلوگیری شود.

معرفی PPO جایگزین جذابی برای پیش‌نیاز خود یعنی بهینه‌سازی خط‌مشی ناحیه اعتماد (TRPO) فراهم کرد که مزایای مشابهی دارد اما پیچیده‌تر و از نظر محاسباتی پرهزینه‌تر از PPO است. در حالی که چارچوب‌های دیگر بهینه‌سازی خط‌مشی مانند مزیت بازیگر-منتقد (A2C) نیز قابل استفاده هستند، PPO اغلب به عنوان یک روش ساده و مقرون‌به‌صرفه ترجیح داده می‌شود.

فرایند یادگیری تقویتی از بازخورد انسانی (RLHF)

 

محدودیت‌های RLHF

اگرچه مدل‌های RLHF نتایج چشمگیری در آموزش عوامل هوش مصنوعی برای وظایف پیچیده، از رباتیک و بازی‌های ویدئویی گرفته تا NLP، نشان داده‌اند، اما استفاده از RLHF بدون محدودیت نیست.

  • داده‌های ترجیحات انسانی گران‌قیمت هستند. نیاز به جمع‌آوری مستقیم ورودی‌های انسانی می‌تواند یک گلوگاه هزینه‌بر ایجاد کند که مقیاس‌پذیری فرآیند RLHF را محدود می‌سازد. هم Anthropic و هم Google روش‌هایی برای یادگیری تقویتی از بازخورد هوش مصنوعی (RLAIF) پیشنهاد داده‌اند؛ در این روش، با جایگزینی تمام یا بخشی از بازخوردهای انسانی از طریق یک LLM دیگر برای ارزیابی پاسخ‌های مدل، نتایجی قابل مقایسه با RLHF به دست آمده است.
  • ورودی‌های انسانی بسیار ذهنی و سلیقه‌ای هستند. دستیابی به یک اجماع قطعی در مورد اینکه چه چیزی خروجی «با کیفیت» محسوب می‌شود، دشوار و یا حتی غیرممکن است؛ چرا که ارزیابان انسانی اغلب نه تنها بر سر واقعیت‌های ادعایی، بلکه بر سر اینکه رفتار «مناسب» مدل باید به چه معنا باشد نیز با هم اختلاف‌نظر دارند. بنابراین، اختلاف‌نظر انسان‌ها مانع از تحقق یک «حقیقت غایی» (ground truth) واقعی می‌شود که بتوان عملکرد مدل را بر اساس آن قضاوت کرد.
  • ارزیابان انسانی ممکن است دچار خطا شوند یا حتی به‌طور عمدی رفتار خصمانه و مخرب داشته باشند. راهنمایی‌های انسانی به مدل همیشه با حسن نیت ارائه نمی‌شوند، چه این موضوع منعکس‌کننده دیدگاه‌های مخالفِ واقعی باشد و چه تلاشی عمدی برای به انحراف کشاندن فرآیند یادگیری. در مقاله‌ای در سال ۲۰۱۶، ولف (Wolf) و همکارانش مطرح کردند که رفتارهای سمی باید به عنوان یک انتظار اساسی در تعاملات انسان و ربات در نظر گرفته شود و بر نیاز به روشی برای سنجش اعتبار ورودی‌های انسانی تأکید کردند. در سال ۲۰۲۲، Meta AI مقاله‌ای درباره ورودی‌های انسانی خصمانه (PDF) منتشر کرد که در آن روش‌های خودکاری برای «کسب حداکثر بازدهی یادگیری از داده‌های با کیفیت بالا، در حالی که هم‌زمان بیشترین مقاومت را در برابر داده‌های بی‌کیفیت و خصمانه داشته باشند» مورد مطالعه قرار گرفت. این مقاله کهن‌الگوهای مختلف «ترول» و روش‌های مختلفی را که آن‌ها باعث تغییر شکل داده‌های بازخورد می‌شوند، شناسایی می‌کند.
  • RLHF با خطر بیش‌برازش و سوگیری همراه است. اگر بازخوردهای انسانی از یک گروه جمعیتی بیش از حد محدود جمع‌آوری شود، مدل ممکن است در هنگام استفاده توسط گروه‌های مختلف یا در مواجهه با موضوعاتی که ارزیابان انسانی نسبت به آن‌ها سوگیری‌های خاصی دارند، با مشکلات عملکردی مواجه شود.

 

سوالات متداول

کاربرد اصلی RLHF در مدل‌های زبانی بزرگ چیست؟

RLHF برای همسو کردن خروجی‌های مدل با قصد کاربر، افزایش دقت واقع‌گرایانه، پیروی بهتر از دستورالعمل‌ها و کاهش پاسخ‌های نامناسب یا توهمات مدل (Hallucinations) استفاده می‌شود.

چرا در آموزش هوش مصنوعی به جای فرمول‌های ریاضی از بازخورد انسانی استفاده می‌شود؟

برخی مفاهیم مانند «خنده‌دار بودن»، «مفید بودن» یا «لحن مودبانه» معیار ریاضی دقیقی ندارند. انسان‌ها به راحتی می‌توانند این ویژگی‌ها را تشخیص دهند و با رتبه‌بندی آن‌ها، یک مدل پاداش برای آموزش هوش مصنوعی ایجاد کنند.

آیا یادگیری تقویتی از بازخورد انسانی باعث حذف کامل سوگیری‌ها می‌شود؟

خیر، RLHF می‌تواند سوگیری‌های ذهنی ارزیابان انسانی را به مدل منتقل کند. به همین دلیل تنوع گروه ارزیاب و کیفیت داده‌های بازخورد برای جلوگیری از سوگیری‌های جدید بسیار حیاتی است.

الگوریتم PPO چه نقشی در فرآیند RLHF ایفا می‌کند؟

الگوریتم PPO برای به‌روزرسانی پایدار خط‌مشی مدل استفاده می‌شود. این الگوریتم با محدود کردن میزان تغییرات در هر مرحله، از ناپایداری مدل و تولید خروجی‌های نامفهوم برای «فریب دادن» مدل پاداش جلوگیری می‌کند.

 

آموزش هوش مصنوعی را از کجا شروع کنیم؟

درک سازوکار RLHF و نحوه همسوسازی ماشین با ترجیحات انسانی، تنها نوک کوه یخ در اقیانوس بیکران هوش مصنوعی است. برای اینکه از یک ناظرِ تحولات تکنولوژی به یک متخصصِ اجرایی تبدیل شوید که می‌تواند پیچیده‌ترین مدل‌های زبانی را هدایت و بهینه‌سازی کند، به چیزی فراتر از مطالعه مقالات نیاز دارید؛ شما به یک نقشه راه منسجم و مهارت‌های فنیِ عمیق نیاز دارید.

ما در دیتایاد، با تحلیل نیازهای روز بازار کار جهانی، در بخش آموزش هوش مصنوعی، جامع ترین آموزش ها را از صفر تا فوق‌تخصص طراحی کرده‌ایم تا شما را برای ورود به دنیای حرفه‌ای علم داده، یادگیری عمیق و مدل‌های زبانی پیشرفته آماده کنیم.

  • تسلط بر ریاضیات و آمار پیشرفته؛ پیش‌نیاز حیاتی برای درک مدل‌های پاداش و توابع بهینه‌سازی سیاست (Policy Optimization).
  • آموزش تخصصی پردازش زبان طبیعی (NLP) و یادگیری عمیق جهت پیاده‌سازی و تنظیم دقیق مدل‌های هوشمند.
  • مهارت در پایتون و کتابخانه‌های تخصصی برای تبدیل تئوری‌های پیچیده مانند PPO به پروژه‌های واقعی و کاربردی.
  • نقشه راه گام‌به‌گام از سطح مقدماتی تا رسیدن به جایگاه مهندس ارشد هوش مصنوعی و علم داده.
مقالات هوش مصنوعی
دوره جامع

هوش مصنوعی

دوره جامع نخبگان پایتون
دوره جامع متخصص علم داده
دوره جامع بینایی کامپیوتر و پردازش تصویر
دوره جامع مدل زبانی بزرگ و پردازش زبان طبیعی
قیمت اصلی: ۵۸,۰۰۰,۰۰۰ تومان بود.قیمت فعلی: ۳۷,۷۰۰,۰۰۰ تومان.
مقالات مشابه
نظرات

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *