Logo elodees  elodees

Une IA bien-veillante pour un monde meilleur













Seuls les caractères alphabétiques accentués ou non ainsi que l'espace sont acceptés

Logo IA




Base de données





Pas encore de compte ?

Inscrivez-vous pour accéder à tous les contenus


Comment créer un ensemble de données pour un problème de regroupement ?

Testé sous Anaconda et Python 3.7

from sklearn.datasets import make_blobs
import matplotlib.pyplot as plt
 
# How to create a dataset for a clustering problem
X, y = make_blobs(
        n_samples = 1000,
        n_features = 2,
        centers = 5,
        cluster_std = 0.5,
        shuffle = True,
        random_state = 9)
 
plt.scatter(X[:,0],
            X[:,1],
            c = ["#006c4b"])
plt.figure(figsize=(16,10)).show()
 


n_samples : le nombre d'échantillons/lignes. Passé sous la forme d'un entier, il divise les différents points de manière égale entre les clusters. Et passé sous forme de tableau, chaque élément indique le nombre d'échantillons par cluster.

n_features : le nombre de fonctionnalités / colonnes

centers : le nombre de centres (fixed center locations) pour générer vos clusters.

clusters_std : l'écart type de chaque cluster shuffle : mélange les différentes lignes/échantillons

shuffle : mix les samples et les features.

random state : définit le nombre aléatoire utilisé pour la génération du jeu de données



Image gratuite et libre de droits fournie par pexel.com


Comment créer un jeu de données pour un problème de classification ?

Testé sous Anaconda et Python 3.7

from sklearn.datasets import make_classification
import matplotlib.pyplot as plt
 
# How to create a dataset for a classification problem
variables, target  = make_classification(
                    n_samples = 1000,
                    n_features = 12,
                    n_informative = 7,
                    n_redundant = 3,
                    n_repeated = 2,
                    n_classes = 4,
                    # Distribution of classes 20% Output1
                    # 20%> output 2, 30% output 3 and 4        
                    weights = [.2,.2, .3, .3],
                    random_state = 8)
 
plt.scatter(variables[:,0],
            variables[:,1],
            c = ["#006c4b"])
plt.figure(figsize=(16,10)).show()
 


n_samples : le nombre d'échantillons/lignes.

n_features : le nombre de fonctionnalités / colonnes.

n_informative : le nombre de caractéristiques qui ont un rôle dans la prédiction de la sortie.

n_redundant : le nombre de fonctionnalités qui ne sont pas liées à la classe de sortie.

n_classes : le nombre de classes/étiquettes pour le problème de classification.

weights : la proportion d'échantillons pour chaque sortie / classe. L'insertion de None signifie des classes équilibrées.



Image gratuite et libre de droits fournie par pexel.com


Comment créer un jeu de données pour un problème de régression ?

Testé sous Anaconda et Python 3.7

from sklearn.datasets import make_regression
import matplotlib.pyplot as plt
 
# How to create a dataset for a regression problem
variables, target = make_regression(n_samples = 1000,
                                    n_features =  10,
                                    n_informative = 8,
                                    n_targets = 1,
                                    noise = .5,
                                    random_state = 8
                                    )
 
plt.scatter(variables[:,0],
            variables[:,1],
            c = ["#006c4b"])
plt.figure(figsize=(16,10)).show()
 


n_samples : le nombre d'échantillons/lignes

n_features : le nombre de fonctionnalités / colonnes

n_informative : le nombre de variables informatives

n_target : le nombre de cibles de régression/sortie. Ainsi, une valeur de 2 signifie que chaque échantillon aura 2 sorties.

Noise : l'écart type du bruit gaussien sur la sortie

shuffle : mixe les samples et les feature.

coef : Renvoie ou non les coefficients du modèle linéaire sous-jacent. état aléatoire : indiquez la graine pour le générateur de nombres aléatoires, afin de reproduire le même ensemble de données en cas de réutilisation



Image gratuite et libre de droits fournie par pexel.com








Numpy : Créer son propre ensemble de données d'images réelles



Testé sous Anaconda et Python 3.7

#importing the libraries
import os 
import cv2
import numpy as np
from matplotlib import pyplot as plt
 
#setting the path to the directory containing the pics
path = 'Dataset-images'
 
#appending the pics to the training data list
training_data = []
for img in os.listdir(path):
    pic = cv2.imread(os.path.join(path,img))
    pic = cv2.cvtColor(pic,cv2.COLOR_BGR2RGB)
    pic = cv2.resize(pic,(256,256))
    training_data.append([pic])
 
#converting the list to numpy array and saving it to a file using #numpy.save
np.save(os.path.join(path,'features'),np.array(training_data))
 
#loading the saved file once again
saved = np.load(os.path.join(path,'features.npy'))
 
for i in range(4):
 
    #subplot
 
    plt.subplot(5, 5, i+1)
 
    # plotting pixel data
 
    plt.imshow(np.array(training_data[i]).reshape(256,256,3))
 
# show the figure
 
plt.show()
 
plt.imshow(saved[0].reshape(256,256,3))
plt.imshow(np.array(training_data[0]).reshape(256,256,3))
plt.show()
plt.imshow(np.array(training_data[1]).reshape(256,256,3))
plt.show()
plt.imshow(np.array(training_data[2]).reshape(256,256,3))
plt.show()
plt.imshow(np.array(training_data[3]).reshape(256,256,3))
plt.show()
 


Source : https://medium.com/analytics-vidhya/create-your-own-real-image-dataset-with-python-deep-learning-b2576b63da1e



Images de la bibliothèque



Image gratuite et libre de droits fournie par pexel.com
Image gratuite et libre de droits fournie par pexel.com
Image gratuite et libre de droits fournie par pexel.com
Image gratuite et libre de droits fournie par pexel.com


Dataset



Image gratuite et libre de droits fournie par pexel.com

Image gratuite et libre de droits fournie par pexel.com
Image gratuite et libre de droits fournie par pexel.com
Image gratuite et libre de droits fournie par pexel.com
Image gratuite et libre de droits fournie par pexel.com








Ensembles de données TensorFlow : une collection d'ensembles de données prêts à l'emploi.



Testé sous Anaconda et Python 3.7

# -*- coding: utf-8 -*-
"""
Created on Sat Jun 18 12:35:28 2022
 
@author: https://www.tensorflow.org/datasets
"""
 
import tensorflow.compat.v2 as tf
import tensorflow_datasets as tfds
 
# Construct a tf.data.Dataset
ds = tfds.load('mnist', split='train', shuffle_files=True)
 
# Build your input pipeline
ds = ds.shuffle(1024).batch(32).prefetch(tf.data.experimental.AUTOTUNE)
for example in ds.take(1):
  image, label = example["image"], example["label"]
 


tensorflow/datasets - GitHub











Classification


Apprentissage profond

Apprentissage automatique












Bienvenu, je m’appelle Eric Soupet et je suis l'administrateur du site elodees.com. elodees.com est un état de l'art de l'Intelligence Artificielle et se veut collaboratif, vous pouvez dès à présent proposer du contenu tels que des articles, des événements, des tutoriels, ... alors n'hésitez pas !

Crédit des images de la plate-forme : Pixabay - Pixabay License | Pexels - Pexels License