اکثر کسانی که دوره هوش مصنوعی با پایتون را شروع میکنند، خیلی زود با نام scikit-learn روبهرو میشوند؛ کتابخانهای متنباز و بسیار پرکاربرد در پایتون که مجموعه بزرگی از الگوریتمهای یادگیری ماشین، ابزارهای پیشپردازش، اعتبارسنجی متقابل و قابلیتهای بصریسازی را در قالب یک رابط یکپارچه در اختیار شما میگذارد. به همین دلیل برگه تقلب Scikit-Learn یکی از برگه تقلب های جذاب این حوزه است.
اگر در ابتدای مسیر هستید، خوب است بدانید که یادگیری ماشین و در ادامه، کار با این کتابخانه، از مهارتهای پایه و ضروری برای هر کسی است که میخواهد بهصورت جدی وارد دنیای علم داده شود.
به همین خاطر، دیتایاد یک برگه تقلب Scikit-Learn آماده کرده است؛ منبعی کاربردی برای افرادی که تازه کار با این پکیج پایتون را شروع کردهاند و هنوز به یک مرجع سریع و دمدستی نیاز دارند. حتی اگر هنوز تصویر روشنی از نحوه کار scikit-learn ندارید، این برگه تقلب میتواند در مدت کوتاهی دید مناسبی از مفاهیم اولیه و چیزهایی که برای شروع باید بدانید به شما بدهد.
در هر صورت، بعید است وقتی با مسائل یادگیری ماشین سروکار پیدا میکنید، این برگه برایتان بیاستفاده بماند!

این برگه تقلب Scikit-Learn با مهمترین مراحلی که برای پیادهسازی موفق الگوریتمهای یادگیری ماشین باید طی کنید آشنایتان میکند: از بارگذاری دادهها و پیشپردازش آنها گرفته تا ساخت مدل، برازش روی دادهها، پیشبینی برچسبهای هدف، اعتبارسنجی مدل و در نهایت تنظیم آن برای رسیدن به عملکرد بهتر. همچنین ما در دیتایاد یک آموزش متنی رایگان از یادگیری ماشین با پایتون داریم که scikit-learn در آن جایگاه مهمی دارد.
خلاصه اگر بخواهیم بگوییم، این برگه تقلب میتواند شروع پروژههای علوم داده را برایتان بسیار سریعتر کند؛ چون با چند مثال کد، به شما کمک میکند در زمان کوتاهی مدلهای یادگیری ماشینتان را بسازید، اعتبارسنجی کنید و بهینهسازی انجام دهید.
برگه تقلب Scikit-Learn برای علوم داده در پایتون
Scikit-learn یک کتابخانه متنباز پایتون است که مجموعه گستردهای از الگوریتمهای یادگیری ماشین، ابزارهای پیشپردازش، اعتبارسنجی متقابل و بصریسازی را از طریق یک رابط یکپارچه ارائه میدهد.
یک مثال پایه
from sklearn import neighbors, datasets, preprocessing from sklearn.model_selection import train_test_split from sklearn.metrics import accuracy_score iris = datasets.load_iris() X, y = iris.data[:, :2], iris.target X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=33) scaler = preprocessing.StandardScaler().fit(X_train) X_train = scaler.transform(X_train) X_test = scaler.transform(X_test) knn = neighbors.KNeighborsClassifier(n_neighbors=5) knn.fit(X_train, y_train) y_pred = knn.predict(X_test) accuracy_score(y_test, y_pred)
بارگذاری دادهها
دادههای شما باید عددی بوده و به صورت آرایههای NumPy یا ماتریسهای پراکنده SciPy ذخیره شده باشند. سایر انواع داده که قابلیت تبدیل به آرایههای عددی را دارند، مانند Pandas DataFrame نیز قابل قبول هستند.
import numpy as np X = np.random.random((10,5)) y = np.array(['M','M','F','F','M','F','M','M','F','F','F']) X[X < 0.7] = 0
پیشپردازش دادهها
استانداردسازی (Standardization)
from sklearn.preprocessing import StandardScaler scaler = StandardScaler().fit(X_train) standardized_X = scaler.transform(X_train) standardized_X_test = scaler.transform(X_test)
نرمالسازی (Normalization)
from sklearn.preprocessing import Normalizer scaler = Normalizer().fit(X_train) normalized_X = scaler.transform(X_train) normalized_X_test = scaler.transform(X_test)
دودوییسازی (Binarization)
from sklearn.preprocessing import Binarizer binarizer = Binarizer(threshold=0.0).fit(X) binary_X = binarizer.transform(X)
کدگذاری ویژگیهای طبقهبندیشده (Encoding Categorical Features)
from sklearn.preprocessing import LabelEncoder enc = LabelEncoder() y = enc.fit_transform(y)
جایگذاری مقادیر مفقود (Imputing Missing Values)
from sklearn.preprocessing import Imputer imp = Imputer(missing_values=0, strategy='mean', axis=0) imp.fit_transform(X_train)
تولید ویژگیهای چندجملهای (Generating Polynomial Features)
from sklearn.preprocessing import PolynomialFeatures poly = PolynomialFeatures(5) oly.fit_transform(X)
دادههای آموزش و تست
from sklearn.model_selection import train_test_split X_train, X_test, y_train, y_test = train_test_split(X,y,random_state=0)
ساخت مدل
مدل های یادگیری نظارتشده
رگرسیون خطی (Linear Regression)
from sklearn.linear_model import LinearRegression lr = LinearRegression(normalize=True)
ماشینهای بردار پشتیبان (SVM)
from sklearn.svm import SVC svc = SVC(kernel='linear')
نایو بیز (Naive Bayes)
from sklearn.naive_bayes import GaussianNB gnb = GaussianNB()
الگوریتم KNN
from sklearn import neighbors knn = neighbors.KNeighborsClassifier(n_neighbors=5)
مدل های یادگیری بدون نظارت
تحلیل مؤلفههای اصلی (PCA)
from sklearn.decomposition import PCA pca = PCA(n_components=0.95)
الگوریتم K Means
from sklearn.cluster import KMeans k_means = KMeans(n_clusters=3, random_state=0)
برازش مدل (Model Fitting)
یادگیری نظارتشده
lr.fit(X, y) knn.fit(X_train, y_train) svc.fit(X_train, y_train)
یادگیری بدون نظارت
k_means.fit(X_train) pca_model = pca.fit_transform(X_train)
پیشبینی
روش نظارتشده
y_pred = svc.predict(np.random.random((2,5))) y_pred = lr.predict(X_test) y_pred = knn.predict_proba(X_test))
روش بدون نظارت
y_pred = k_means.predict(X_test)
ارزیابی عملکرد مدل
معیارهای طبقهبندی
امتیاز دقت (Accuracy Score)
knn.score(X_test, y_test) from sklearn.metrics import accuracy_score accuracy_score(y_test, y_pred)
گزارش طبقهبندی (Classification Report)
from sklearn.metrics import classification_report print(classification_report(y_test, y_pred)))
ماتریس درهمریختگی (Confusion Matrix)
from sklearn.metrics import confusion_matrix print(confusion_matrix(y_test, y_pred)))
معیارهای رگرسیون
میانگین خطای مطلق (Mean Absolute Error)
from sklearn.metrics import mean_absolute_error y_true = [3, -0.5, 2]) mean_absolute_error(y_true, y_pred))
میانگین توان دوم خطا (Mean Squared Error)
from sklearn.metrics import mean_squared_error mean_squared_error(y_test, y_pred))
امتیاز R2
from sklearn.metrics import r2_score r2_score(y_true, y_pred))
معیارهای خوشهبندی
شاخص (Adjusted Rand Index)
from sklearn.metrics import adjusted_rand_score adjusted_rand_score(y_true, y_pred))
همگنی (Homogeneity)
from sklearn.metrics import homogeneity_score homogeneity_score(y_true, y_pred))
معیار V-measure
from sklearn.metrics import v_measure_score metrics.v_measure_score(y_true, y_pred))
اعتبارسنجی متقابل (Cross-Validation)
print(cross_val_score(knn, X_train, y_train, cv=4)) print(cross_val_score(lr, X, y, cv=2))
تنظیم مدل
جستجوی شبکهای (Grid Search)
from sklearn.grid_search import GridSearchCV
params = {"n_neighbors": np.arange(1,3), "metric": ["euclidean", "cityblock"]}
grid = GridSearchCV(estimator=knn,param_grid=params)
grid.fit(X_train, y_train)
print(grid.best_score_)
print(grid.best_estimator_.n_neighbors)
بهینهسازی تصادفی پارامترها
from sklearn.grid_search import RandomizedSearchCV
params = {"n_neighbors": range(1,5), "weights": ["uniform", "distance"]}
rsearch = RandomizedSearchCV(estimator=knn,
param_distributions=params,
cv=4,
n_iter=8,
random_state=5)
rsearch.fit(X_train, y_train)
print(rsearch.best_score_)
از برگه تقلب Scikit-Learn تا تسلط بر جادوی علم داده
داشتن برگه تقلب Scikit-Learn مثل داشتن یک نقشه در جیب است؛ اما برای رانندگی در جادههای پرپیچوخم پروژههای واقعی، شما به چیزی بیشتر از یک راهنمای سریع نیاز دارید. دنیای واقعی علم داده، فراتر از فراخوانی چند تابع ساده در Scikit-Learn است و نیازمند درکی عمیق از استراتژیهای حل مسئله، تحلیل دقیق رفتار دادهها و انتخاب هوشمندانه الگوریتمهاست.
اگر آمادهاید تا از مرحله کپی کردن کدها فراتر رفته و به متخصصی تبدیل شوید که پروژههای پیچیده را از صفر تا مرحله عملیاتیسازی مدیریت میکند، آموزش جامع علم داده و یادگیری ماشین با پایتون دقیقا همان مسیری است که مهارتهای فنی شما را به ابزاری قدرتمند برای حل چالشهای تجاری و ورود به بازار کار حرفهای تبدیل میکند.
- تسلط بر پیادهسازی پروژههای واقعی یادگیری ماشین و یادگیری عمیق با رویکرد حل مسئله.
- آموزش جامع از مفاهیم پایه ریاضیات و آمار تا پیشرفتهترین متدهای مدلسازی در پایتون.
- آمادگی کامل برای ورود به بازار کار Data Science با اجرای پروژههای کاربردی و رزومهساز.
- درک عمیق منطق پشت پرده کتابخانههایی مثل Scikit-Learn برای بهینهسازی دقیقتر عملکرد مدلها.
بیشتر بخوانید: سایر برگه تقلبهای دیتایاد
- برگه تقلب پایتون
- برگه تقلب NumPy
- برگه تقلب Pandas
- برگه تقلب Matplotlib
- برگه تقلب Keras
- برگه تقلب PyTorch
- برگه تقلب TensorFlow

