در این مطلب از بخش آموزش هوش مصنوعی دیتایاد، به بررسی نقش آمار در یادگیری ماشین میپردازیم. این حوزه به مطالعهی جمعآوری، تحلیل و تفسیر دادهها میپردازد تا به ساخت مدلهای یادگیری ماشین دقیقتر و کارآمدتر کمک کند.
آمار مبانی ریاضی لازم برای درک الگوهای داده، انجام پیشبینیها و ارزیابی عملکرد مدل را فراهم میکند. این علم به درک توزیع دادهها، تغییرپذیری و انتخاب مفیدترین ویژگیها (Features) کمک شایانی میکند. علاوه بر این، از مفاهیم آماری برای اعتبارسنجی نتایج مدل و تصمیمگیری در شرایط عدم قطعیت با استفاده از تکنیکهایی مانند آزمونهای فرض، فواصل اطمینان و روشهای بیزی استفاده میشود.
نگاهی ساده به نقش آمار در یادگیری ماشین
اگر یادگیری ماشین و هوش مصنوعی را مثل ساختن یک ساختمان در نظر بگیریم، آمار حکم فونداسیون و پی آن را دارد. بدون آمار، ما فقط مجموعهای از دادههای بیمعنی داریم؛ اما با کمک ابزارهای آماری میتوانیم الگوهای پنهان را کشف کنیم و به ماشینها بیاموزیم که از تجربیات گذشته برای پیشبینی دقیق آینده استفاده کنند.
در واقع، آمار به ما زبان مشترکی میدهد تا با دادهها صحبت کنیم. این علم به مدلهای هوشمند کمک میکند تا بین «نویز» یا دادههای مزاحم و «سیگنال» یا اطلاعات واقعی تمایز قائل شوند و در نهایت، ضریب اطمینان تصمیمگیریهای خود را در دنیای واقعی و شرایط عدم قطعیت بالا ببرند.
آمار مبانی ریاضی لازم برای درک الگوهای داده، انجام پیشبینیها و ارزیابی عملکرد مدل را فراهم میکند. این علم به درک توزیع دادهها، تغییرپذیری و انتخاب مفیدترین ویژگیها (Features) کمک شایانی میکند. علاوه بر این، از مفاهیم آماری برای اعتبارسنجی نتایج مدل و تصمیمگیری در شرایط عدم قطعیت با استفاده از تکنیکهایی مانند آزمونهای فرض، فواصل اطمینان و روشهای بیزی استفاده میشود. اگر میخواهید این پیشنیازها را از پایه و به صورت اصولی یاد بگیرید، استفاده از یک آموزش ریاضی هوش مصنوعی گام نخست و ضروری برای شما خواهد بود.

چرا آمار را برای یادگیری ماشین یاد بگیریم؟
- درک دادهها پیش از آموزش مدلها.
- انتخاب الگوریتمهای مناسب برای مسائل خاص.
- ارزیابی دقت و عملکرد مدل.
- مدیریت عدم قطعیت و تغییرپذیری در دادههای دنیای واقعی.
کاربردهای آمار در یادگیری ماشین
آمار یکی از اجزای کلیدی یادگیری ماشین است که کاربرد گستردهای در حوزههای مختلف دارد.
- مهندسی ویژگی: انتخاب و تبدیل متغیرهای مفید.
- پردازش تصویر: تحلیل الگوها، شکلها و بافتها.
- تشخیص ناهنجاری: شناسایی تقلب یا خرابی تجهیزات.
- مطالعات محیطی: مدلسازی پوشش زمین، اقلیم و آلودگی.
- کنترل کیفیت: شناسایی نقصها در تولید.
انواع آمار
معمولاً دو نوع آمار وجود دارد که در ادامه به آنها پرداخته میشود:
- آمار توصیفی: “آمار توصیفی” به ما کمک میکند تا بخشهای بزرگی از دادهها را سادهسازی و سازماندهی کنیم. این کار درک حجم زیاد دادهها را آسانتر میکند.
- آمار استنباطی: “آمار استنباطی” کمی متفاوت است. این روش از دادههای کوچکتر برای نتیجهگیری درباره یک گروه بزرگتر استفاده میکند. این آمار به ما کمک میکند تا در مورد یک جامعه آماری پیشبینی کرده و نتیجهگیری کنیم.
آمار توصیفی
آمار توصیفی ویژگیهای یک مجموعه داده را خلاصه و توصیف میکند و پایهای برای تحلیلهای آماری بیشتر فراهم میسازد.
- میانگین (Mean):میانگین یکی از رایجترین شاخصهای مرکزی در آمار است و نشان میدهد مقدار کلی دادهها بهطور متوسط چقدر است. برای بهدست آوردن آن، همه مقادیر با هم جمع میشوند و سپس حاصل بر تعداد کل دادهها تقسیم میشود.
- میانه (Median):میانه مقداری است که اگر دادهها بهترتیب از کوچک به بزرگ مرتب شوند، در وسط مجموعه قرار میگیرد. این شاخص بهویژه زمانی مفید است که دادهها دارای مقادیر خیلی بزرگ یا خیلی کوچک باشند، چون کمتر از میانگین تحت تأثیر دادههای پرت قرار میگیرد.
- نما (Mode):نما مقداری است که در یک مجموعه داده بیشتر از بقیه تکرار شده باشد. به بیان ساده، پرتکرارترین عدد یا مقدار در دادهها را نما میگویند.
شاخصهای پراکندگی
- دامنه (Range): تفاوت بین مقادیر حداکثر و حداقل.
- واریانس (Variance): میانگین مجذور انحراف از میانگین که نشاندهنده پراکندگی دادههاست.
- انحراف معیار (Standard Deviation): ریشه دوم واریانس که نشاندهنده میزان پراکندگی دادهها نسبت به میانگین است.
- دامنه میانچارکی (Interquartile Range): فاصله بین چارک اول و سوم که میزان پراکندگی دادهها را حول میانه اندازهگیری میکند.
شاخصهای شکل
چولگی (Skewness): نشاندهنده عدم تقارن دادهها است.

کشیدگی (Kurtosis): میزان بلندای قله (نوکتیز بودن) توزیع دادهها را اندازهگیری میکند.

آمار استنباطی
آمار استنباطی شامل انجام پیشبینیها یا استنتاجهایی درباره یک جامعه آماری بر اساس نمونهای از دادهها است.
جامعه و نمونه
- جامعه (Population): کل گروهی که مورد مطالعه قرار میگیرد.
- نمونه (Sample): زیرمجموعهای از جامعه که برای تحلیل استفاده میشود.
برآورد
- برآورد نقطهای (Point Estimation): یک مقدار واحد را به عنوان برآوردی از پارامتر جامعه ارائه میدهد.
- برآورد فاصلهای (Interval Estimation): محدودهای از مقادیر (فاصله اطمینان) را ارائه میدهد که احتمالاً پارامتر در آن قرار دارد.
- فواصل اطمینان (Confidence Intervals): میزان پایایی یک برآورد را نشان میدهند.
آزمون فرضیه
آزمون فرضیه روشی است که دو فرض متضاد را درباره یک جامعه با هم مقایسه کرده و از دادههای یک نمونه برای تعیین اینکه کدام فرض به احتمال زیاد درست است، استفاده میکند.
- فرضیه صفر و فرضیه مقابل (Null and Alternative Hypotheses): فرضیه صفر فرض میکند هیچ اثر یا رابطهای وجود ندارد، در حالی که فرضیه مقابل خلاف آن را پیشنهاد میکند.
- خطاهای نوع اول و نوع دوم (Type I and Type II Errors): خطای نوع اول رد کردن فرضیه صفرِ درست است، در حالی که خطای نوع دوم عدم رد کردن فرضیه صفرِ غلط است.
- مقادیر p (p-Values): احتمال بهدست آوردن نتایج مشاهدهشده را تحت فرض فرضیه صفر اندازهگیری میکنند.
- آزمونهای t و آزمونهای z: میانگینها را برای ارزیابی معناداری آماری مقایسه میکنند.
- ANOVA (تحلیل واریانس): میانگینها را در چندین گروه مقایسه میکند تا تعیین کند آیا تفاوت معناداری با هم دارند یا خیر.
- آزمونهای کای اسکوئر (Chi-Square Tests): ارتباط بین متغیرهای طبقهبندیشده را ارزیابی میکنند.
کوواریانس و همبستگی

- ضریب همبستگی پیرسون (Pearson Correlation Coefficient): قدرت رابطه خطی بین دو متغیر را اندازهگیری میکند.
- همبستگی رتبهای اسپیرمن (Spearman Rank Correlation): قدرت و جهت رابطه یکنوا (Monotonic) بین متغیرها را ارزیابی میکند.
تکنیکهای بصریسازی آمار در یادگیری ماشین
- هیستوگرامها (Histograms): توزیع دادهها را نشان میدهند.
- نمودارهای جعبهای (Box Plots): پراکندگی دادهها و نقاط پرت احتمالی را مشخص میکنند.
- نمودارهای پراکندگی (Scatter Plots): روابط بین متغیرها را نشان میدهند.
تحلیل رگرسیون
درک روابط بین متغیرها در یادگیری ماشین اهمیت زیادی دارد.
- رگرسیون خطی ساده (Simple Linear Regression): رابطه بین دو متغیر را مدلسازی میکند.
- رگرسیون خطی چندگانه (Multiple Linear Regression): مدل را به چندین متغیر پیشبین تعمیم میدهد.
- مفروضات رگرسیون خطی: خطی بودن، استقلال، همگونی واریانس (Homoscedasticity)، نرمال بودن.
- تفسیر ضرایب رگرسیون: تأثیر متغیر پیشبین بر متغیر پاسخ را توضیح میدهد.
- معیارهای ارزیابی مدل: ضریب تعیین (R-squared)، ضریب تعیین تعدیلشده، RMSE.
نظریه احتمال در یادگیری ماشین
نظریه احتمال ستون فقرات استنباط آماری را تشکیل میدهد و به کمّیسازی عدم قطعیت و انجام پیشبینیها بر اساس دادهها کمک میکند.
مفاهیم پایه
- متغیرهای تصادفی: متغیرهایی با نتایج تصادفی.
- توزیعهای احتمال: احتمال وقوع نتایج مختلف را توصیف میکنند.
- قانون اعداد بزرگ: بیان میکند که با افزایش اندازه نمونه، میانگین نمونه به میانگین جامعه نزدیک میشود.
- قضیه حد مرکزی: نشان میدهد که با افزایش اندازه نمونه، توزیع میانگینهای نمونه بدون توجه به توزیع جامعه، به توزیع نرمال نزدیک میشود.
توزیعهای احتمال رایج
- توزیع دوجملهای: نشاندهنده تعداد موفقیتها در تعداد ثابتی از آزمایشها است.
- توزیع پواسون: تعداد رویدادهایی را که در یک بازه ثابت رخ میدهند، توصیف میکند.
- توزیع نرمال: دادههای پیوستهای را که به طور متقارن حول میانگین توزیع شدهاند، مشخص میکند.
آمار بیزی
آمار بیزی دانش پیشین (آنچه از قبل باور داریم) را با دادههای جدید (شواهد فعلی) ترکیب میکند تا درک ما را بهروزرسانی کند.
قضیه بیز یک مفهوم بنیادی در نظریه احتمال است که احتمالات شرطی را به هم مرتبط میسازد. این قضیه به نام توماس بیز نامگذاری شده است که اولین بار آن را معرفی کرد. قضیه بیز یک فرمول ریاضی است که روشی برای بهروزرسانی احتمالات بر اساس شواهد جدید ارائه میدهد.
فرمول:
![]()
که در آن:
- P(A∣B): احتمال وقوع پیشامد A به شرط وقوع پیشامد B (احتمال پسین).
- P(B∣A): احتمال وقوع پیشامد B به شرط وقوع پیشامد A (درستنمایی یا Likelihood).
- P(A): احتمال وقوع پیشامد A (احتمال پیشین).
- P(B): احتمال وقوع پیشامد B.
سوالات متداول
آیا برای یادگیری ماشین باید حتماً در آمار متخصص باشیم؟
نیازی نیست که یک ریاضیدان محض باشید، اما درک مفاهیم کلیدی مثل توزیعها، آزمون فرضیه و احتمال برای انتخاب الگوریتم صحیح و تحلیل درست نتایج ضروری است.
تفاوت اصلی آمار توصیفی و استنباطی در پروژههای واقعی چیست؟
آمار توصیفی برای درک و خلاصهسازی دادههای موجود (مثلاً میانگین سن مشتریان) استفاده میشود، در حالی که آمار استنباطی برای پیشبینی رفتار مشتریان جدید بر اساس دادههای قبلی به کار میرود.
چرا توزیع نرمال در یادگیری ماشین اهمیت زیادی دارد؟
بسیاری از الگوریتمهای یادگیری ماشین (مانند رگرسیون خطی) فرض میکنند که دادهها توزیع نرمال دارند. همچنین به دلیل قضیه حد مرکزی، بسیاری از پدیدههای واقعی به سمت این توزیع میل میکنند.
آمار و احتمال برای یادگیری هوش مصنوعی کافی نیست!
اگر میخواهید یادگیری ماشین، علم داده و هوش مصنوعی را عمیق و کاربردی یاد بگیرید، باید بدانید که مسیر یادگیری فقط به آمار و احتمال محدود نمیشود. در کنار آن، جبر خطی، حساب دیفرانسل و انتگرال و سایر مباحث ریاضی هم برای درک درست الگوریتمها، بهینهسازی مدلها و تحلیل دادهها ضروری هستند.
برای اینکه این مفاهیم تئوریک را به مهارتهای عملیاتی و پولساز تبدیل کنید، ما آموزش یادگیری ماشین و علم داده را فراهم کردهایم که شما را از سطح صفر به یک تحلیلگر و مدلساز ارشد تبدیل میکند. در این راه، نه تنها بر آمار و ریاضیات، بلکه بر تمامی ابزارهای مدرن صنعت علم داده مسلط خواهید شد.
- آموزش صفر تا صد پایتون، آمار کاربردی و یادگیری ماشین برای حل مسائل واقعی
- اجرای پروژههای عملی جهت آمادگی کامل برای ورود به بازار کار داخلی و بینالمللی

