Comment LAION a créé un jeu d’images d’entraînement à partir de zéro

laion

LAION, pour Large-scale Artificial Intelligence Open Network, tel est le nom du projet lancé par le professeur de lycée allemand Christoph Schuhmann.

Deux ans après avoir commencé à traîner sur des forums Discord d’adeptes de l’IA, alors que la première version de Dall-E, le modèle d’OpenAI dédié à la génération d’image, est dévoilée au public, cet enseignant de physique et d’informatique décide de créer une banque de données d’entraînement gratuite et ouverte.

Une ONG allemande demande la création d’un CERN de l’IA

Avec un petit groupe d’autres bénévoles, ils réunissent trois millions de couples images-textes en quelques semaines, rapporte Bloomberg. Au bout de trois mois, ils publient un jeu de 400 millions de paires, un nombre qui a depuis grimpé à 5 milliards, ce qui fait de LAION le jeu d’images d’entraînement gratuit le plus gros du monde.

Le projet a grossi sans financement, si ce n’est une donation ponctuelle de la start-up Hugging Face, en 2021, puis le don d’un ancien gestionnaire de fonds d’investissement, Emad Mostaque, qui avait déclaré vouloir son propre business d’IA générative.

Mostaque a depuis créé Stable Diffusion, que LAION a permis d’entraîner. Difficile de savoir qui d’autres l’a utilisé, sauf quand les constructeurs des modèles concernés le disent ouvertement : Google a par exemple déclaré s’être servi de LAION pour entraîner ses modèles Imagen et Parti AI.

Même si elle est ouverte, LAION pose une série de questions et d’enjeux éthiques et juridiques, la majeure partie de son contenu ayant été scrappée depuis le web et ses constructeurs ayant fait des choix comme celui de ne pas supprimer les contenus violents, au motif qu’ils pourraient servir à entraîner des algorithmes de détection de ce type d’images.

Les plaintes pour violation des droits d’auteurs qui visent Stable Diffusion et MidJourney pourraient, par extension, toucher le jeu de données.

Getty poursuit un éditeur d’algorithme en justice pour violation des droits d’auteurs

Pour la plupart des experts interrogés par Bloomberg, cela dit, ce ne sont pas les données d’entraînement qui devraient être régulées, mais plutôt les usages finaux et/ou les activités des constructeurs de modèles.

Source

Veille-cyber

Next Les arnaques de l’amour en ligne : signaux d’alarme et conseils »

Previous « L'Europe s'oppose à la Chine et la Russie au sujet de la lutte contre la cybercriminalité

Published by

Veille-cyber

2 ans ago

Les 7 menaces cyber les plus fréquentes en entreprise

Introduction La cybersécurité est devenue une priorité stratégique pour toutes les entreprises, grandes ou petites.…

2 mois ago

cybersécurité

Cybersécurité : Vers une montée en compétence des établissements de santé grâce aux exercices de crise

Cybersécurité : les établissements de santé renforcent leur défense grâce aux exercices de crise Face…

2 mois ago

Règlementation

Règlement DORA : implications contractuelles pour les entités financières et les prestataires informatiques

La transformation numérique du secteur financier n'a pas que du bon : elle augmente aussi…

2 mois ago

cybersécurité

L’IA : opportunité ou menace ? Les DSI de la finance s’interrogent

L'IA : opportunité ou menace ? Les DSI de la finance s'interrogent Alors que l'intelligence…

2 mois ago

cybersécurité

Telegram menace de quitter la France : le chiffrement de bout en bout en ligne de mire

Telegram envisage de quitter la France : le chiffrement de bout en bout au cœur…

2 mois ago

cybersécurité

Sécurité des identités : un pilier essentiel pour la conformité au règlement DORA dans le secteur financier

Sécurité des identités : un pilier essentiel pour la conformité au règlement DORA dans le…

2 mois ago

This website uses cookies.

Comment LAION a créé un jeu d’images d’entraînement à partir de zéro

Recent Posts

Les 7 menaces cyber les plus fréquentes en entreprise

Cybersécurité : Vers une montée en compétence des établissements de santé grâce aux exercices de crise

Règlement DORA : implications contractuelles pour les entités financières et les prestataires informatiques

L’IA : opportunité ou menace ? Les DSI de la finance s’interrogent

Telegram menace de quitter la France : le chiffrement de bout en bout en ligne de mire

Sécurité des identités : un pilier essentiel pour la conformité au règlement DORA dans le secteur financier