تخفیف تابستانی تا 35 درصد روی تمام دوره ها
روز
ساعت
دقیقه
ثانیه

برگه تقلب Scikit-Learn؛ Scikit-Learn Cheat Sheet

برگه تقلب Scikit-Learn
آنچه می خوانید:

اکثر کسانی که دوره هوش مصنوعی با پایتون را شروع می‌کنند، خیلی زود با نام scikit-learn روبه‌رو می‌شوند؛ کتابخانه‌ای متن‌باز و بسیار پرکاربرد در پایتون که مجموعه بزرگی از الگوریتم‌های یادگیری ماشین، ابزارهای پیش‌پردازش، اعتبارسنجی متقابل و قابلیت‌های بصری‌سازی را در قالب یک رابط یکپارچه در اختیار شما می‌گذارد. به همین دلیل برگه تقلب Scikit-Learn یکی از برگه تقلب های جذاب این حوزه است.

اگر در ابتدای مسیر هستید، خوب است بدانید که یادگیری ماشین و در ادامه، کار با این کتابخانه، از مهارت‌های پایه و ضروری برای هر کسی است که می‌خواهد به‌صورت جدی وارد دنیای علم داده شود.

به همین خاطر، دیتایاد یک برگه تقلب Scikit-Learn آماده کرده است؛ منبعی کاربردی برای افرادی که تازه کار با این پکیج پایتون را شروع کرده‌اند و هنوز به یک مرجع سریع و دم‌دستی نیاز دارند. حتی اگر هنوز تصویر روشنی از نحوه کار scikit-learn ندارید، این برگه تقلب می‌تواند در مدت کوتاهی دید مناسبی از مفاهیم اولیه و چیزهایی که برای شروع باید بدانید به شما بدهد.

در هر صورت، بعید است وقتی با مسائل یادگیری ماشین سروکار پیدا می‌کنید، این برگه برایتان بی‌استفاده بماند!

برگه تقلب Scikit-Learn

این برگه تقلب Scikit-Learn با مهم‌ترین مراحلی که برای پیاده‌سازی موفق الگوریتم‌های یادگیری ماشین باید طی کنید آشنایتان می‌کند: از بارگذاری داده‌ها و پیش‌پردازش آن‌ها گرفته تا ساخت مدل، برازش روی داده‌ها، پیش‌بینی برچسب‌های هدف، اعتبارسنجی مدل و در نهایت تنظیم آن برای رسیدن به عملکرد بهتر. همچنین ما در دیتایاد یک آموزش متنی رایگان از یادگیری ماشین با پایتون داریم که scikit-learn در آن جایگاه مهمی دارد.

خلاصه اگر بخواهیم بگوییم، این برگه تقلب می‌تواند شروع پروژه‌های علوم داده را برایتان بسیار سریع‌تر کند؛ چون با چند مثال کد، به شما کمک می‌کند در زمان کوتاهی مدل‌های یادگیری ماشین‌تان را بسازید، اعتبارسنجی کنید و بهینه‌سازی انجام دهید.

 

برگه تقلب Scikit-Learn برای علوم داده در پایتون

Scikit-learn یک کتابخانه متن‌باز پایتون است که مجموعه گسترده‌ای از الگوریتم‌های یادگیری ماشین، ابزارهای پیش‌پردازش، اعتبارسنجی متقابل و بصری‌سازی را از طریق یک رابط یکپارچه ارائه می‌دهد.

یک مثال پایه

from sklearn import neighbors, datasets, preprocessing
from sklearn.model_selection import train_test_split
from sklearn.metrics import accuracy_score
iris = datasets.load_iris()
X, y = iris.data[:, :2], iris.target
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=33)
scaler = preprocessing.StandardScaler().fit(X_train)
X_train = scaler.transform(X_train)
X_test = scaler.transform(X_test)
knn = neighbors.KNeighborsClassifier(n_neighbors=5)
knn.fit(X_train, y_train)
y_pred = knn.predict(X_test)
accuracy_score(y_test, y_pred)

بارگذاری داده‌ها

داده‌های شما باید عددی بوده و به صورت آرایه‌های NumPy یا ماتریس‌های پراکنده SciPy ذخیره شده باشند. سایر انواع داده که قابلیت تبدیل به آرایه‌های عددی را دارند، مانند Pandas DataFrame نیز قابل قبول هستند.

import numpy as np
X = np.random.random((10,5))
y = np.array(['M','M','F','F','M','F','M','M','F','F','F'])
X[X < 0.7] = 0

 

پیش‌پردازش داده‌ها

استانداردسازی (Standardization)

from sklearn.preprocessing import StandardScaler
scaler = StandardScaler().fit(X_train)
standardized_X = scaler.transform(X_train)
standardized_X_test = scaler.transform(X_test)

نرمال‌سازی (Normalization)

from sklearn.preprocessing import Normalizer
scaler = Normalizer().fit(X_train)
normalized_X = scaler.transform(X_train)
normalized_X_test = scaler.transform(X_test)

دودویی‌سازی (Binarization)

from sklearn.preprocessing import Binarizer
binarizer = Binarizer(threshold=0.0).fit(X)
binary_X = binarizer.transform(X)

کدگذاری ویژگی‌های طبقه‌بندی‌شده (Encoding Categorical Features)

from sklearn.preprocessing import LabelEncoder
enc = LabelEncoder()
y = enc.fit_transform(y)

جایگذاری مقادیر مفقود (Imputing Missing Values)

from sklearn.preprocessing import Imputer
imp = Imputer(missing_values=0, strategy='mean', axis=0)
imp.fit_transform(X_train)

تولید ویژگی‌های چندجمله‌ای (Generating Polynomial Features)

from sklearn.preprocessing import PolynomialFeatures
poly = PolynomialFeatures(5)
oly.fit_transform(X)

داده‌های آموزش و تست

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X,y,random_state=0)

 

ساخت مدل

مدل های یادگیری نظارت‌شده

رگرسیون خطی (Linear Regression)

from sklearn.linear_model import LinearRegression
lr = LinearRegression(normalize=True)

ماشین‌های بردار پشتیبان (SVM)

from sklearn.svm import SVC
svc = SVC(kernel='linear')

نایو بیز (Naive Bayes)

from sklearn.naive_bayes import GaussianNB
gnb = GaussianNB()

الگوریتم KNN

from sklearn import neighbors
knn = neighbors.KNeighborsClassifier(n_neighbors=5)

مدل های یادگیری بدون نظارت

تحلیل مؤلفه‌های اصلی (PCA)

from sklearn.decomposition import PCA
pca = PCA(n_components=0.95)

الگوریتم K Means

from sklearn.cluster import KMeans
k_means = KMeans(n_clusters=3, random_state=0)

 

برازش مدل (Model Fitting)

یادگیری نظارت‌شده

lr.fit(X, y)
knn.fit(X_train, y_train)
svc.fit(X_train, y_train)

یادگیری بدون نظارت

k_means.fit(X_train)
pca_model = pca.fit_transform(X_train)

پیش‌بینی

روش نظارت‌شده

y_pred = svc.predict(np.random.random((2,5)))
y_pred = lr.predict(X_test)
y_pred = knn.predict_proba(X_test))

روش بدون نظارت

y_pred = k_means.predict(X_test)

 

ارزیابی عملکرد مدل

معیارهای طبقه‌بندی

امتیاز دقت (Accuracy Score)

knn.score(X_test, y_test)
from sklearn.metrics import accuracy_score
accuracy_score(y_test, y_pred)

گزارش طبقه‌بندی (Classification Report)

from sklearn.metrics import classification_report
print(classification_report(y_test, y_pred)))

ماتریس درهم‌ریختگی (Confusion Matrix)

from sklearn.metrics import confusion_matrix
print(confusion_matrix(y_test, y_pred)))

معیارهای رگرسیون

میانگین خطای مطلق (Mean Absolute Error)

from sklearn.metrics import mean_absolute_error
y_true = [3, -0.5, 2])
mean_absolute_error(y_true, y_pred))

میانگین توان دوم خطا (Mean Squared Error)

from sklearn.metrics import mean_squared_error
mean_squared_error(y_test, y_pred))

امتیاز R2

from sklearn.metrics import r2_score
r2_score(y_true, y_pred))

معیارهای خوشه‌بندی

شاخص (Adjusted Rand Index)

from sklearn.metrics import adjusted_rand_score
adjusted_rand_score(y_true, y_pred))

همگنی (Homogeneity)

from sklearn.metrics import homogeneity_score
homogeneity_score(y_true, y_pred))

معیار V-measure

from sklearn.metrics import v_measure_score
metrics.v_measure_score(y_true, y_pred))

اعتبار‌سنجی متقابل (Cross-Validation)

print(cross_val_score(knn, X_train, y_train, cv=4))
print(cross_val_score(lr, X, y, cv=2))

 

تنظیم مدل

جستجوی شبکه‌ای (Grid Search)

from sklearn.grid_search import GridSearchCV
params = {"n_neighbors": np.arange(1,3), "metric": ["euclidean", "cityblock"]}
grid = GridSearchCV(estimator=knn,param_grid=params)
grid.fit(X_train, y_train)
print(grid.best_score_)
print(grid.best_estimator_.n_neighbors)

بهینه‌سازی تصادفی پارامترها

from sklearn.grid_search import RandomizedSearchCV
params = {"n_neighbors": range(1,5), "weights": ["uniform", "distance"]}
rsearch = RandomizedSearchCV(estimator=knn,
param_distributions=params,
cv=4,
n_iter=8,
random_state=5)
rsearch.fit(X_train, y_train)
print(rsearch.best_score_)

 

از برگه تقلب Scikit-Learn تا تسلط بر جادوی علم داده

داشتن برگه تقلب Scikit-Learn مثل داشتن یک نقشه در جیب است؛ اما برای رانندگی در جاده‌های پرپیچ‌وخم پروژه‌های واقعی، شما به چیزی بیشتر از یک راهنمای سریع نیاز دارید. دنیای واقعی علم داده، فراتر از فراخوانی چند تابع ساده در Scikit-Learn است و نیازمند درکی عمیق از استراتژی‌های حل مسئله، تحلیل دقیق رفتار داده‌ها و انتخاب هوشمندانه الگوریتم‌هاست.

اگر آماده‌اید تا از مرحله کپی کردن کدها فراتر رفته و به متخصصی تبدیل شوید که پروژه‌های پیچیده را از صفر تا مرحله عملیاتی‌سازی مدیریت می‌کند، آموزش جامع علم داده و یادگیری ماشین با پایتون دقیقا همان مسیری است که مهارت‌های فنی شما را به ابزاری قدرتمند برای حل چالش‌های تجاری و ورود به بازار کار حرفه‌ای تبدیل می‌کند.

  • تسلط بر پیاده‌سازی پروژه‌های واقعی یادگیری ماشین و یادگیری عمیق با رویکرد حل مسئله.
  • آموزش جامع از مفاهیم پایه ریاضیات و آمار تا پیشرفته‌ترین متدهای مدل‌سازی در پایتون.
  • آمادگی کامل برای ورود به بازار کار Data Science با اجرای پروژه‌های کاربردی و رزومه‌ساز.
  • درک عمیق منطق پشت پرده کتابخانه‌هایی مثل Scikit-Learn برای بهینه‌سازی دقیق‌تر عملکرد مدل‌ها.

 

بیشتر بخوانید: سایر برگه‌ تقلب‌های دیتایاد

مقالات هوش مصنوعی
دوره جامع

هوش مصنوعی

دوره جامع نخبگان پایتون
دوره جامع متخصص علم داده
دوره جامع بینایی کامپیوتر و پردازش تصویر
دوره جامع مدل زبانی بزرگ و پردازش زبان طبیعی
قیمت اصلی: ۵۸,۰۰۰,۰۰۰ تومان بود.قیمت فعلی: ۳۷,۷۰۰,۰۰۰ تومان.
مقالات مشابه
نظرات

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *