Pas encore de compte ?
Comment créer un ensemble de données pour un problème de regroupement ?
Testé sous Anaconda et Python 3.7
from sklearn.datasets import make_blobs import matplotlib.pyplot as plt # How to create a dataset for a clustering problem X, y = make_blobs( n_samples = 1000, n_features = 2, centers = 5, cluster_std = 0.5, shuffle = True, random_state = 9) plt.scatter(X[:,0], X[:,1], c = ["#006c4b"]) plt.figure(figsize=(16,10)).show()
n_samples : le nombre d'échantillons/lignes. Passé sous la forme d'un entier, il divise les différents points de manière égale entre les clusters. Et passé sous forme de tableau, chaque élément indique le nombre d'échantillons par cluster.
n_features : le nombre de fonctionnalités / colonnes
centers : le nombre de centres (fixed center locations) pour générer vos clusters.
clusters_std : l'écart type de chaque cluster shuffle : mélange les différentes lignes/échantillons
shuffle : mix les samples et les features.
random state : définit le nombre aléatoire utilisé pour la génération du jeu de données
Comment créer un jeu de données pour un problème de classification ?
Testé sous Anaconda et Python 3.7
from sklearn.datasets import make_classification import matplotlib.pyplot as plt # How to create a dataset for a classification problem variables, target = make_classification( n_samples = 1000, n_features = 12, n_informative = 7, n_redundant = 3, n_repeated = 2, n_classes = 4, # Distribution of classes 20% Output1 # 20%> output 2, 30% output 3 and 4 weights = [.2,.2, .3, .3], random_state = 8) plt.scatter(variables[:,0], variables[:,1], c = ["#006c4b"]) plt.figure(figsize=(16,10)).show()
n_samples : le nombre d'échantillons/lignes.
n_features : le nombre de fonctionnalités / colonnes.
n_informative : le nombre de caractéristiques qui ont un rôle dans la prédiction de la sortie.
n_redundant : le nombre de fonctionnalités qui ne sont pas liées à la classe de sortie.
n_classes : le nombre de classes/étiquettes pour le problème de classification.
weights : la proportion d'échantillons pour chaque sortie / classe. L'insertion de None signifie des classes équilibrées.
Comment créer un jeu de données pour un problème de régression ?
Testé sous Anaconda et Python 3.7
from sklearn.datasets import make_regression import matplotlib.pyplot as plt # How to create a dataset for a regression problem variables, target = make_regression(n_samples = 1000, n_features = 10, n_informative = 8, n_targets = 1, noise = .5, random_state = 8 ) plt.scatter(variables[:,0], variables[:,1], c = ["#006c4b"]) plt.figure(figsize=(16,10)).show()
n_samples : le nombre d'échantillons/lignes
n_features : le nombre de fonctionnalités / colonnes
n_informative : le nombre de variables informatives
n_target : le nombre de cibles de régression/sortie. Ainsi, une valeur de 2 signifie que chaque échantillon aura 2 sorties.
Noise : l'écart type du bruit gaussien sur la sortie
shuffle : mixe les samples et les feature.
coef : Renvoie ou non les coefficients du modèle linéaire sous-jacent. état aléatoire : indiquez la graine pour le générateur de nombres aléatoires, afin de reproduire le même ensemble de données en cas de réutilisation
Numpy : Créer son propre ensemble de données d'images réelles
Testé sous Anaconda et Python 3.7
#importing the libraries import os import cv2 import numpy as np from matplotlib import pyplot as plt #setting the path to the directory containing the pics path = 'Dataset-images' #appending the pics to the training data list training_data = [] for img in os.listdir(path): pic = cv2.imread(os.path.join(path,img)) pic = cv2.cvtColor(pic,cv2.COLOR_BGR2RGB) pic = cv2.resize(pic,(256,256)) training_data.append([pic]) #converting the list to numpy array and saving it to a file using #numpy.save np.save(os.path.join(path,'features'),np.array(training_data)) #loading the saved file once again saved = np.load(os.path.join(path,'features.npy')) for i in range(4): #subplot plt.subplot(5, 5, i+1) # plotting pixel data plt.imshow(np.array(training_data[i]).reshape(256,256,3)) # show the figure plt.show() plt.imshow(saved[0].reshape(256,256,3)) plt.imshow(np.array(training_data[0]).reshape(256,256,3)) plt.show() plt.imshow(np.array(training_data[1]).reshape(256,256,3)) plt.show() plt.imshow(np.array(training_data[2]).reshape(256,256,3)) plt.show() plt.imshow(np.array(training_data[3]).reshape(256,256,3)) plt.show()
Source : https://medium.com/analytics-vidhya/create-your-own-real-image-dataset-with-python-deep-learning-b2576b63da1e
Images de la bibliothèque
Dataset
Ensembles de données TensorFlow : une collection d'ensembles de données prêts à l'emploi.
Testé sous Anaconda et Python 3.7
# -*- coding: utf-8 -*- """ Created on Sat Jun 18 12:35:28 2022 @author: https://www.tensorflow.org/datasets """ import tensorflow.compat.v2 as tf import tensorflow_datasets as tfds # Construct a tf.data.Dataset ds = tfds.load('mnist', split='train', shuffle_files=True) # Build your input pipeline ds = ds.shuffle(1024).batch(32).prefetch(tf.data.experimental.AUTOTUNE) for example in ds.take(1): image, label = example["image"], example["label"]
tensorflow/datasets - GitHub
Bienvenu, je m’appelle Eric Soupet et je suis l'administrateur du site elodees.com. elodees.com est un état de l'art de l'Intelligence Artificielle et se veut collaboratif, vous pouvez dès à présent proposer du contenu tels que des articles, des événements, des tutoriels, ... alors n'hésitez pas !
Crédit des images de la plate-forme : Pixabay - Pixabay License | Pexels - Pexels License