Vue lecture

☕️ Thinking Machines publie Inkling, un modèle généraliste à poids ouverts



Thinking Machines sort du bois. Dix-huit mois après sa levée de fonds record de 2 milliards de dollars, soutenue par la notoriété de son équipe fondatrice et notamment de sa dirigeante Mira Murati, ex CTO d’OpenAI, le laboratoire a annoncé mercredi 15 juillet son premier modèle à poids ouvert.

Baptisé Inkling, il ne prétend pas révolutionner les performances de l’IA générative, mais constitue selon l’entreprise une base solide, avec un compromis satisfaisant entre latence, coûts de fonctionnement, et qualité des résultats en sortie.

Inkling prend la forme d’un modèle de type Mixture-of-Experts (MoE) doté d’un total de 975 milliards de paramètres, dont 41 milliards actifs à chaque requête. Il gère une fenêtre de contexte pouvant atteindre 1 million de tokens, et son entraînement a été réalisé sur un volume de 45 000 milliards de tokens composés de texte, d’images, d’audio et de vidéo.

« Inkling n’est pas le modèle le plus performant actuellement disponible, qu’il soit ouvert ou fermé. En revanche, sa combinaison de qualités en fait une excellente base pour la personnalisation : capacités multimodales, conception efficace et disponibilité sur Tinker pour un réglage précis », écrit le laboratoire.

Inkling se veut un bon modèle généraliste, performant sur le chat, l’audio et la vision, mais en retrait sur les missions agentiques – capture d’écran

Tinker fait référence au premier produit présenté par Thinking Machines en octobre dernier et lancé en accès anticipé début 2026: il s’agit pour mémoire d’un service dédié au fine tuning ou à la personnalisation de modèles d’IA. Destiné notamment aux chercheurs, le service permet de contrôler les jeux de données et la boucle d’entraînement associée, sans avoir à se soucier de l’infrastructure qui sous-tend la démarche. 

Thinking Machines propose déjà une première déclinaison de son modèle, une version Inkling-Small à 12 milliards de paramètres actifs, entraînée selon la même recette que la version complète.

L’entreprise indique par ailleurs qu’Inkling nourrira les travaux déjà engagés autour d’une autre annonce récente : TLM-Interaction-Small, un modèle à très faible latence dédié, entre autres, aux interactions vocales. 

Inkling est dès à présent proposé à l’essai via Tinker, avec des fenêtres de 64 000 et 256 000 tokens. La tarification débute à 1,87 dollar le million de tokens en entrée (prefill) et 4,68 dollars en sortie, avec une promotion agressive sur la période de lancement. 

  •  

☕️ Thinking Machines publie Inkling, un modèle généraliste à poids ouverts



Thinking Machines sort du bois. Dix-huit mois après sa levée de fonds record de 2 milliards de dollars, soutenue par la notoriété de son équipe fondatrice et notamment de sa dirigeante Mira Murati, ex CTO d’OpenAI, le laboratoire a annoncé mercredi 15 juillet son premier modèle à poids ouvert.

Baptisé Inkling, il ne prétend pas révolutionner les performances de l’IA générative, mais constitue selon l’entreprise une base solide, avec un compromis satisfaisant entre latence, coûts de fonctionnement, et qualité des résultats en sortie.

Inkling prend la forme d’un modèle de type Mixture-of-Experts (MoE) doté d’un total de 975 milliards de paramètres, dont 41 milliards actifs à chaque requête. Il gère une fenêtre de contexte pouvant atteindre 1 million de tokens, et son entraînement a été réalisé sur un volume de 45 000 milliards de tokens composés de texte, d’images, d’audio et de vidéo.

« Inkling n’est pas le modèle le plus performant actuellement disponible, qu’il soit ouvert ou fermé. En revanche, sa combinaison de qualités en fait une excellente base pour la personnalisation : capacités multimodales, conception efficace et disponibilité sur Tinker pour un réglage précis », écrit le laboratoire.

Inkling se veut un bon modèle généraliste, performant sur le chat, l’audio et la vision, mais en retrait sur les missions agentiques – capture d’écran

Tinker fait référence au premier produit présenté par Thinking Machines en octobre dernier et lancé en accès anticipé début 2026: il s’agit pour mémoire d’un service dédié au fine tuning ou à la personnalisation de modèles d’IA. Destiné notamment aux chercheurs, le service permet de contrôler les jeux de données et la boucle d’entraînement associée, sans avoir à se soucier de l’infrastructure qui sous-tend la démarche. 

Thinking Machines propose déjà une première déclinaison de son modèle, une version Inkling-Small à 12 milliards de paramètres actifs, entraînée selon la même recette que la version complète.

L’entreprise indique par ailleurs qu’Inkling nourrira les travaux déjà engagés autour d’une autre annonce récente : TLM-Interaction-Small, un modèle à très faible latence dédié, entre autres, aux interactions vocales. 

Inkling est dès à présent proposé à l’essai via Tinker, avec des fenêtres de 64 000 et 256 000 tokens. La tarification débute à 1,87 dollar le million de tokens en entrée (prefill) et 4,68 dollars en sortie, avec une promotion agressive sur la période de lancement. 

  •  

Les datacenters IA, un sujet électoral incontournable aux États-Unis

Le courant passe mal dans les urnes
Les datacenters IA, un sujet électoral incontournable aux États-Unis

L’État de New York a mis en place un moratoire pour interdire la construction de datacenters. Un signe supplémentaire de l’opposition grandissante des Américains à l’installation de ces infrastructures énergivores près de chez eux.

« Le progrès ne devrait pas s’accompagner d’une hausse de la facture d’énergie, d’une réduction de l’approvisionnement en eau ou de nuisances sonores », a affirmé Kathy Hochul, la gouverneure de l’État de New York, en signant un décret imposant le moratoire interdisant pendant un an la construction d’un datacenter dans l’État. Une première aux États-Unis.

Dans le détail, ce moratoire suspend la délivrance d’autorisations pour les nouveaux centres de données ; il charge les autorités de mettre au point des normes portant sur les conséquences de ces infrastructures sur l’environnement, la consommation d’eau et d’énergie. L’État de New York n’étant pas la destination première pour les constructeurs de datacenters, l’impact du décret devrait être assez modeste.

Un des lobbys du secteur, la Data Center Coalition, déplore tout de même chez AP un moratoire qui garantira que les investissements, les emplois et l’activité économique liés à la construction et à la production « iront ailleurs qu’à New York, avec des répercussions qui dépasseront largement le seul secteur des centres de données ».

Les datacenters font l’unanimité contre eux

Des moratoires du même genre sont en discussion dans une dizaine d’États américains, mais aucun n’est allé aussi loin que New York. Il y a néanmoins des comtés et des municipalités qui ont imposé leurs propres interdictions. Les considérations politiques ont aussi leur place : la démocrate Kathy Hochul va se représenter l’année prochaine et les datacenters n’ont pas la cote chez de plus en plus d’électeurs.

Les élections de mi-mandat (midterms) sont également en approche : le 3 novembre, les électeurs devront notamment renouveler la Chambre des représentants, un tiers du Sénat, sans oublier de nombreux scrutins locaux. Plusieurs primaires désignant les candidats du Parti républicain pour des élections locales et régionales ont montré que même les supporters de Donald Trump ne sont forcément fans des datacenters.


Il reste 73% de l'article à découvrir.
Vous devez être abonné•e pour lire la suite de cet article.
Déjà abonné•e ? Générez une clé RSS dans votre profil.

  •  

☕️ Suno a aspiré des millions de chansons pour entraîner son IA



Suno, la start-up spécialisée dans la génération de musique par IA, ne fait plus mystère de la provenance de ses données d’entraînement : elle a moissonné « pratiquement tous les fichiers musicaux de qualité raisonnable accessibles sur l’internet ouvert ». L’entreprise l’avait admis en 2024, à l’occasion d’une procédure en justice menée aux États-Unis par l’industrie du disque. On ignorait en revanche l’ampleur de cet « emprunt ».

Illustration : Flock

Un hacker a partagé avec 404media des données internes de Suno qui détaillent la manière dont l’entreprise a constitué ses bases de données. Elle a en fait mangé à tous les râteliers : YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound ou encore IMSLP. Les volumes sont considérables : il y a par exemple plus de deux millions d’extraits provenant de YouTube Music, ou encore des dizaines de milliers d’heures issues du catalogue de Deezer.

Le code subtilisé par le pirate montre aussi que Suno cherchait spécifiquement des versions a cappella sur YouTube, probablement pour mieux isoler et analyser les voix. Pour mener ses opérations à grande échelle, la start-up aurait fait appel aux infrastructures de Bright Data, spécialiste de la collecte automatisée de données.

Les documents et données présentés par le hacker semblent confirmer les accusations des maisons de disques selon lesquelles Suno aurait pillé absolument tout ce qu’il était possible de voler, sans s’occuper de la légalité du procédé. Le puissant lobby musical américain RIAA soutenait ainsi que Suno avait procédé à de l’extraction directe de fichiers audio depuis YouTube, en contournant les mécanismes anti-copie de la plateforme.

« Comme nous l’avons indiqué dans des documents publics, les modèles d’IA de Suno ont été entraînés à partir de fichiers musicaux accessibles au public et de métadonnées associées, disponibles sur des sites tiers sur l’internet ouvert », a expliqué un porte-parole à 404media. Son moissonnage du « web ouvert » s’arrête aux paywalls et aux protections par mot de passe, assurait aussi l’entreprise durant une procédure judiciaire.

Elle reprend aussi la défense classique des labos IA qui affirment que l’entraînement de leurs modèles relève du « fair use », l’exception américaine au droit d’auteur. Ce piratage pourrait en tout cas renforcer les arguments des ayants droit, en particulier s’il est prouvé que la jeune pousse a contourné des verrous techniques, siphonné des catalogues commerciaux ou enfreint les conditions d’utilisation des plateformes.

Le pirate explique également avoir eu accès aux coordonnées de centaines de milliers de clients de Suno, ainsi qu’à des informations liées à des paiements Stripe en pénétrant les systèmes de la société avec les identifiants compromis d’un salarié. L’entreprise a reconnu un incident survenu en novembre dernier, mais elle assure qu’aucune information personnelle sensible n’a été compromise. Elle indique également n’avoir aucun accès aux numéros complets des cartes bancaires stockées par Stripe.

Sur le front judiciaire, l’horizon s’est éclairci pour Suno, qui a signé en novembre dernier un accord avec Warner. Cela va lui permettre d’utiliser le catalogue de la major.

  •  

☕️ Suno a aspiré des millions de chansons pour entraîner son IA



Suno, la start-up spécialisée dans la génération de musique par IA, ne fait plus mystère de la provenance de ses données d’entraînement : elle a moissonné « pratiquement tous les fichiers musicaux de qualité raisonnable accessibles sur l’internet ouvert ». L’entreprise l’avait admis en 2024, à l’occasion d’une procédure en justice menée aux États-Unis par l’industrie du disque. On ignorait en revanche l’ampleur de cet « emprunt ».

Illustration : Flock

Un hacker a partagé avec 404media des données internes de Suno qui détaillent la manière dont l’entreprise a constitué ses bases de données. Elle a en fait mangé à tous les râteliers : YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound ou encore IMSLP. Les volumes sont considérables : il y a par exemple plus de deux millions d’extraits provenant de YouTube Music, ou encore des dizaines de milliers d’heures issues du catalogue de Deezer.

Le code subtilisé par le pirate montre aussi que Suno cherchait spécifiquement des versions a cappella sur YouTube, probablement pour mieux isoler et analyser les voix. Pour mener ses opérations à grande échelle, la start-up aurait fait appel aux infrastructures de Bright Data, spécialiste de la collecte automatisée de données.

Les documents et données présentés par le hacker semblent confirmer les accusations des maisons de disques selon lesquelles Suno aurait pillé absolument tout ce qu’il était possible de voler, sans s’occuper de la légalité du procédé. Le puissant lobby musical américain RIAA soutenait ainsi que Suno avait procédé à de l’extraction directe de fichiers audio depuis YouTube, en contournant les mécanismes anti-copie de la plateforme.

« Comme nous l’avons indiqué dans des documents publics, les modèles d’IA de Suno ont été entraînés à partir de fichiers musicaux accessibles au public et de métadonnées associées, disponibles sur des sites tiers sur l’internet ouvert », a expliqué un porte-parole à 404media. Son moissonnage du « web ouvert » s’arrête aux paywalls et aux protections par mot de passe, assurait aussi l’entreprise durant une procédure judiciaire.

Elle reprend aussi la défense classique des labos IA qui affirment que l’entraînement de leurs modèles relève du « fair use », l’exception américaine au droit d’auteur. Ce piratage pourrait en tout cas renforcer les arguments des ayants droit, en particulier s’il est prouvé que la jeune pousse a contourné des verrous techniques, siphonné des catalogues commerciaux ou enfreint les conditions d’utilisation des plateformes.

Le pirate explique également avoir eu accès aux coordonnées de centaines de milliers de clients de Suno, ainsi qu’à des informations liées à des paiements Stripe en pénétrant les systèmes de la société avec les identifiants compromis d’un salarié. L’entreprise a reconnu un incident survenu en novembre dernier, mais elle assure qu’aucune information personnelle sensible n’a été compromise. Elle indique également n’avoir aucun accès aux numéros complets des cartes bancaires stockées par Stripe.

Sur le front judiciaire, l’horizon s’est éclairci pour Suno, qui a signé en novembre dernier un accord avec Warner. Cela va lui permettre d’utiliser le catalogue de la major.

  •  
❌