Apple accusée de voler des vidéos youtube pour son ia : la confidentialité remise en question ?
Le géant de Cupertino, habituellement porté sur la question de la confidentialité, se retrouve dans la tourmente. Apple est accusé d'avoir mis en œuvre une méthode de collecte de données particulièrement intrusive : le scraping massif de millions de vidéos YouTube, une pratique qui soulève des questions éthiques et légales.

Un procès qui menace l'image d'apple
Trois créateurs de chaînes YouTube – Ted Entertainment, Matt Fisher et Golfholics – ont intenté une action collective contre Apple, alléguant que l'entreprise a contourné les protections anti-scraping de YouTube pour télécharger des quantités astronomiques de vidéos. Le but ? Former un modèle d'IA générative, dont les détails ont été publiés dans un article de recherche de fin 2024. Le cœur du problème réside dans ce qu'Apple appelle “Panda-70M”, un index colossal de vidéos YouTube, organisé par URL, identifiant de la vidéo et horodatage. Les plaignants affirment que leur contenu apparaît plus de 500 fois dans cette base de données.
Ce qui rend cette affaire particulièrement préoccupante, c'est que Panda-70M ne contient pas les vidéos elles-mêmes, mais plutôt une sorte de “carte routière” détaillée vers le contenu d'autrui. Cependant, le simple fait de télécharger et d'utiliser ces vidéos pour l'entraînement d'une IA contourne les protections de YouTube, et c'est précisément ce que dénonce la plainte.
Ironie du sort : Apple n'est pas la seule entreprise à se retrouver dans cette situation. Amazon et OpenAI font également face à des poursuites similaires concernant l'utilisation de ce même ensemble de données. Il semble que la course à l'IA ait conduit les entreprises technologiques à considérer le contenu des créateurs comme une source de données gratuite, dans l'espoir de ne pas susciter de réactions. Ce n'est pas la première fois qu'Apple est pointé du doigt pour une utilisation non autorisée de contenu en ligne ; en 2024, l'entreprise avait déjà été accusée d'utiliser des sous-titres YouTube pour entraîner des modèles d'IA open-source.
Au-delà des considérations juridiques, cette affaire met en lumière une question plus vaste : où tracer la ligne entre l'utilisation de contenu public pour l'entraînement de l'IA et le respect des droits des créateurs ? Faut-il exiger un consentement explicite des créateurs ? Ou est-ce que, si le contenu est public, il est de facto accessible à tous ?
Avec Apple Intelligence, l’entreprise peine à s’imposer dans le domaine de l’IA, confrontée à des retards, des promesses non tenues et même des poursuites de la part d'actionnaires. L'entreprise a admis être en retard sur la courbe de l'IA et a vu de nombreux chercheurs talentueux rejoindre ses concurrents. Cette stratégie agressive de collecte de données, tout en proclamant la confidentialité comme un droit fondamental, rend l'affaire particulièrement embarrassante. La contradiction est flagrante. La question est de savoir si Apple peut se sortir de ce mauvais pas sans compromettre davantage son image et la confiance de ses utilisateurs.