Vue normale

OpenAI souhaiterait que les États-Unis rentrent à son capital à hauteur de 5 %

2 juillet 2026 à 12:00
Capitammunist
OpenAI souhaiterait que les États-Unis rentrent à son capital à hauteur de 5 %

OpenAI aurait proposé à l’administration Trump d’entrer à son capital, avec une prise de participation publique à hauteur de 5 %. La manœuvre est présentée comme une façon de permettre une forme de redistribution de la valeur générée par l’IA vers le public américain. Difficile toutefois de ne pas y voir, aussi, une forme de précaution face aux possibles évolutions du cadre réglementaire, voire un garde-fou face au risque d’explosion de la bulle IA…

À contre-courant des processus habituels de nationalisation, la proposition aurait cette fois émané directement d’OpenAI. D’après le Financial Times, l’éditeur des modèles ChatGPT aurait proposé à l’administration Trump d’entrer à son capital à hauteur de 5 %. La prise de participation représenterait ainsi quelque 43 milliards de dollars, si l’on se base sur la valorisation de l’entreprise estimée à 852 milliards de dollars lors de son dernier tour de table, début avril.

Capital contre influence ?

D’après deux sources proches du dossier mentionnées par le FT, Sam Altman aurait lui même porté ce message auprès de Washington, en arguant qu’une prise de participation publique était le meilleur moyen de garantir une forme de redistribution de la valeur générée par l’IA en direction des contribuables états-uniens.

L’administration Trump a déjà manifesté des velléités d’investissement direct dans les grandes entreprises de la tech. En 2025, elle est ainsi entrée au capital d’Intel à hauteur de 10 %, une opération dont ne manque d’ailleurs pas de s’enorgueillir Donald Trump puisque le cours en bourse de l’entreprise est depuis largement reparti à la hausse.

Du côté d’OpenAI, difficile de ne pas imaginer qu’une telle proposition recouvre des enjeux autres que le simple partage de la valeur. Une participation financière au capital serait une façon de consolider les relations entre l’entreprise et l’administration. Un entregent particulièrement utile lorsqu’on sait que les États-Unis réfléchissent à encadrer le développement et la distribution des modèles d’IA de pointe, après des mois de polémique liées aux capacités offensives de ces derniers en matière de cybersécurité, sur fond de concurrence accrue avec la Chine.

Donald Trump a en effet signé le 2 juin dernier un executive order qui ordonne aux grandes agences fédérales, dont la NSA, de construire un « processus d’évaluation comparative classifié visant à évaluer les capacités cyber avancées des modèles d’IA ». Selon le Financial Times, le cadre en question pourrait être annoncé dès la semaine prochaine, et il pourrait fortement contraindre la façon dont les laboratoires IA sont autorisés à distribuer leurs modèles les plus avancés.

Rassurer les investisseurs

L’appel du pied d’OpenAI à la Maison-Blanche peut également être interprété comme une recherche de garanties sur le plan financier, alors que la course aux investissements dans l’IA ne cesse de raviver les craintes d’une possible bulle. Disposer de l’État à son capital confèrerait en effet à OpenAI une forme de statut « too big to fail » (trop gros pour faire faillite), c’est-à-dire d’entreprise dont le poids et le caractère systémique sont devenus trop importants pour que l’administration puisse la laisser tomber, même en cas de retournement de marché.

L’argument n’est pas anodin pour OpenAI, qui a déposé début juin le premier formulaire préparatoire à son introduction en bourse mais hésite encore, d’après les rumeurs, sur le calendrier exact de l’opération, notamment parce que le grand concurrent Anthropic affiche une croissance supérieure à la sienne, et lorgne lui aussi vers Wall Street.

Les partenaires d’OpenAI lui réclament peut-être par ailleurs ce genre de garanties. Oracle, très impliqué dans le projet Stargate, a admis dans son dernier bilan financier annuel que son engagement dans l’IA était désormais tellement massif qu’il semblait difficile de faire marche arrière. Alors qu’il s’était envolé en bourse, le groupe de Larry Ellison suscite désormais la défiance des marchés. Il a ainsi perdu 40 % de sa valeur en seulement un mois avec une action passé de 250 à 142 dollars, alors même qu’il vient de procéder à une vague de 21 000 licenciements en seulement un an.

Softbank, bras armé historique d’OpenAI sur le plan financier, semble lui aussi avoir besoin de gages de confiance. Reuters a ainsi révélé mercredi que le groupe japonais devait renégocier les modalités d’un prêt de 10 milliards de dollars destiné à financer ses investissements dans OpenAI, précisément parce que les créanciers émettaient des doutes sur la valorisation réelle de l’entreprise.

Une idée qui fait son chemin

Sam Altman a déjà publiquement défendu l’hypothèse d’une prise de participation publique dans OpenAI au nom du bien commun en avril dernier, dans un manifeste (PDF) qui développe l’idée d’une prospérité partagée et heureuse rendue possible grâce aux apports de l’intelligence artificielle. Bien que les bénéfices réels de cette dernière pour l’économie états-unienne soient régulièrement remis en question, y compris par des banques qui financent le développement de l’IA, l’idée revient régulièrement depuis dans le débat public. Elle a notamment été relancée par le sénateur démocrate Bernie Sanders début juin, lequel propose que les États-Unis créent un fonds souverain destiné à accueillir 50 % des actions des sociétés liées à l’IA.

OpenAI souhaiterait que les États-Unis rentrent à son capital à hauteur de 5 %

2 juillet 2026 à 12:00
Capitammunist
OpenAI souhaiterait que les États-Unis rentrent à son capital à hauteur de 5 %

OpenAI aurait proposé à l’administration Trump d’entrer à son capital, avec une prise de participation publique à hauteur de 5 %. La manœuvre est présentée comme une façon de permettre une forme de redistribution de la valeur générée par l’IA vers le public américain. Difficile toutefois de ne pas y voir, aussi, une forme de précaution face aux possibles évolutions du cadre réglementaire, voire un garde-fou face au risque d’explosion de la bulle IA…

À contre-courant des processus habituels de nationalisation, la proposition aurait cette fois émané directement d’OpenAI. D’après le Financial Times, l’éditeur des modèles ChatGPT aurait proposé à l’administration Trump d’entrer à son capital à hauteur de 5 %. La prise de participation représenterait ainsi quelque 43 milliards de dollars, si l’on se base sur la valorisation de l’entreprise estimée à 852 milliards de dollars lors de son dernier tour de table, début avril.

Capital contre influence ?

D’après deux sources proches du dossier mentionnées par le FT, Sam Altman aurait lui même porté ce message auprès de Washington, en arguant qu’une prise de participation publique était le meilleur moyen de garantir une forme de redistribution de la valeur générée par l’IA en direction des contribuables états-uniens.

L’administration Trump a déjà manifesté des velléités d’investissement direct dans les grandes entreprises de la tech. En 2025, elle est ainsi entrée au capital d’Intel à hauteur de 10 %, une opération dont ne manque d’ailleurs pas de s’enorgueillir Donald Trump puisque le cours en bourse de l’entreprise est depuis largement reparti à la hausse.

Du côté d’OpenAI, difficile de ne pas imaginer qu’une telle proposition recouvre des enjeux autres que le simple partage de la valeur. Une participation financière au capital serait une façon de consolider les relations entre l’entreprise et l’administration. Un entregent particulièrement utile lorsqu’on sait que les États-Unis réfléchissent à encadrer le développement et la distribution des modèles d’IA de pointe, après des mois de polémique liées aux capacités offensives de ces derniers en matière de cybersécurité, sur fond de concurrence accrue avec la Chine.

Donald Trump a en effet signé le 2 juin dernier un executive order qui ordonne aux grandes agences fédérales, dont la NSA, de construire un « processus d’évaluation comparative classifié visant à évaluer les capacités cyber avancées des modèles d’IA ». Selon le Financial Times, le cadre en question pourrait être annoncé dès la semaine prochaine, et il pourrait fortement contraindre la façon dont les laboratoires IA sont autorisés à distribuer leurs modèles les plus avancés.

Rassurer les investisseurs

L’appel du pied d’OpenAI à la Maison-Blanche peut également être interprété comme une recherche de garanties sur le plan financier, alors que la course aux investissements dans l’IA ne cesse de raviver les craintes d’une possible bulle. Disposer de l’État à son capital confèrerait en effet à OpenAI une forme de statut « too big to fail » (trop gros pour faire faillite), c’est-à-dire d’entreprise dont le poids et le caractère systémique sont devenus trop importants pour que l’administration puisse la laisser tomber, même en cas de retournement de marché.

L’argument n’est pas anodin pour OpenAI, qui a déposé début juin le premier formulaire préparatoire à son introduction en bourse mais hésite encore, d’après les rumeurs, sur le calendrier exact de l’opération, notamment parce que le grand concurrent Anthropic affiche une croissance supérieure à la sienne, et lorgne lui aussi vers Wall Street.

Les partenaires d’OpenAI lui réclament peut-être par ailleurs ce genre de garanties. Oracle, très impliqué dans le projet Stargate, a admis dans son dernier bilan financier annuel que son engagement dans l’IA était désormais tellement massif qu’il semblait difficile de faire marche arrière. Alors qu’il s’était envolé en bourse, le groupe de Larry Ellison suscite désormais la défiance des marchés. Il a ainsi perdu 40 % de sa valeur en seulement un mois avec une action passé de 250 à 142 dollars, alors même qu’il vient de procéder à une vague de 21 000 licenciements en seulement un an.

Softbank, bras armé historique d’OpenAI sur le plan financier, semble lui aussi avoir besoin de gages de confiance. Reuters a ainsi révélé mercredi que le groupe japonais devait renégocier les modalités d’un prêt de 10 milliards de dollars destiné à financer ses investissements dans OpenAI, précisément parce que les créanciers émettaient des doutes sur la valorisation réelle de l’entreprise.

Une idée qui fait son chemin

Sam Altman a déjà publiquement défendu l’hypothèse d’une prise de participation publique dans OpenAI au nom du bien commun en avril dernier, dans un manifeste (PDF) qui développe l’idée d’une prospérité partagée et heureuse rendue possible grâce aux apports de l’intelligence artificielle. Bien que les bénéfices réels de cette dernière pour l’économie états-unienne soient régulièrement remis en question, y compris par des banques qui financent le développement de l’IA, l’idée revient régulièrement depuis dans le débat public. Elle a notamment été relancée par le sénateur démocrate Bernie Sanders début juin, lequel propose que les États-Unis créent un fonds souverain destiné à accueillir 50 % des actions des sociétés liées à l’IA.

Proton lance son assistant IA Lumo 2.0 avec génération d’images et mémoire

2 juillet 2026 à 07:58
Avec de vrais morceaux de Chine dedans
Proton lance son assistant IA Lumo 2.0 avec génération d’images et mémoire

L’éditeur suisse passe la seconde avec la nouvelle version majeure de son LLM et de l’assistant qui l’accompagne. Lumo 2.0 marque surtout un gros rattrapage sur les produits existants, avec des fonctions comme la mémoire et la recherche sur le web.

Proton a lancé la première version de son assistant IA en juillet 2025, avec la promesse d’une confidentialité totale basée sur le chiffrement de bout en bout, zéro accès, et l’absence de logs. Selon l’entreprise, son assistant est utilisé par dix millions de personnes aujourd’hui.

Pour fêter son premier anniversaire, Proton lance la version 2.0. L’éditeur affirme que cette mouture est le changement le plus important sur l’assistant depuis sa création, avec une nouvelle architecture.

L’assistant peut être utilisé selon quatre modes :

  • Lumo 2.0 Lite : gère les questions générales, l’aide à la rédaction, le résumé et les autres tâches courantes
  • Lumo 2.0 Max : offre un raisonnement plus poussé, une compréhension contextuelle plus large et des réponses plus précises, pour les tâches complexes
  • Mode Fast : conçu pour les requêtes simples, les recherches rapides et les tâches bénéficiant de réponses immédiates
  • Mode Thinking : réponses plus détaillées pour les problèmes nécessitant une analyse multi-étapes plus profonde, avec le classique raisonnement visible en temps réel

Nombreuses nouvelles fonctions

Lumo 2.0 apparait comme une vaste mise à jour visant à rattraper le retard sur les modèles existants. Le nouveau modèle prend ainsi en charge la multimodalité, capable de traiter du texte et des images. On peut envoyer une image à analyser, créer des visuels à partir d’un prompt ou d’une esquisse, éditer des images existantes, le tout dans la même conversation. Proton assure que toutes les données envoyées bénéficient de la garantie zéro accès.

L’un des plus gros changements de Lumo 2.0 est la possibilité de chercher – enfin – des informations sur le web pour répondre à des questions, avec citation des sources. L’assistant reçoit également une mémoire persistante, qui lui permet d’apprendre les préférences et le style, pour que chaque conversation démarre avec plus de contexte. Comme dans les autres fonctions du même acabit, l’utilisateur décide de ce qui est retenu ou oublié.

Puisque l’on parle de contexte, Proton indique dans son billet d’annonce que la fenêtre a doublé avec Lumo 2.0, permettant des conversations plus longues et cohérentes ainsi qu’un raisonnement sur des documents et jeux de données plus volumineux. L’entreprise ne donne malheureusement aucun chiffre.

Les Projects deviennent des espaces de travail chiffrés dédiés regroupant conversations, fichiers et instructions. S’y ajoutent les Custom Lumos, décrits comme des assistants sur mesure adaptés à des tâches spécifiques, comparables aux « Gems » de Gemini.

Performances : les gros chiffres

Proton communique des gains de performance mesurés sur l’Artificial Analysis Intelligence Index, un benchmark indépendant agrégeant neuf évaluations dont GDPval-AA v2, Terminal-Bench v2.1, Humanity’s Last Exam et GPQA Diamond. Les résultats annoncés : Lumo 2.0 Lite obtient un score supérieur de 127 % à Lumo 1.4, et Lumo 2.0 Max de 240 %. Sur les mêmes résultats, on peut voir que Lumo 2.0 Max obtient 51 points, à mi-chemin entre les 44 points de Claude Sonnet 4.6 et les 55 points de GPT 5.5 (56 pour Claude Opus 4.8).

Sur la latence, Proton annonce que les requêtes courantes sont traitées jusqu’à 76 % plus rapidement que sous Lumo 1.4. Andy Yen, PDG de Proton, affirme (via 9to5Mac) que les tests utilisateurs montrent que l’écart s’est réduit au point que, pour de nombreux cas d’usage, les utilisateurs ne perçoivent plus de différence qualitative entre Lumo 2.0 Max et les derniers modèles d’OpenAI et d’Anthropic. Il s’agit toutefois d’une déclaration du fabricant, non d’un benchmark tiers indépendant.

Le court test publié par It’s FOSS relativise ce discours marketing : sur une tâche d’édition d’image (correction d’une faute de frappe dans une bannière), Lumo 2.0 Max en mode Thinking n’a pas détecté l’erreur, puis a fini par abandonner après plusieurs tentatives.

Confidentialité, disponibilité et prix

Comme on pouvait s’y attendre, Proton met largement l’accent sur la confidentialité. L’éditeur suisse s’est spécialisé depuis longtemps dans les services chiffrés de bout en bout. Il pointe le contraste avec les fournisseurs dominants et affirme que Lumo repose sur cinq principes : aucun log, chiffrement zéro accès (en transit et au repos), aucun partage de données, aucune utilisation des conversations pour l’entraînement, et modèles de langage open source.

Quels modèles ? Dans une page du support, Proton le précise : Qwen 3.5, GLM 5.2, Image-Turbo et FireRed-Image-Edit-1.1. Dans cette configuration, Qwen est très probablement utilisé pour la version Light et GLM pour Max. Pour rappel, le modèle chinois GLM 5.2 fait sensation depuis sa sortie, pour ses performances autant que ses poids ouverts. Proton prend bien soin d’ajouter que tous les modèles fonctionnent exclusivement sur ses serveurs et que les données ne sont jamais envoyées chez un tiers.

L’infrastructure reste entièrement européenne, protégée par le droit suisse sur la confidentialité et le chiffrement zéro accès, « ce qui signifie que l’accès à Lumo ne peut pas être soumis aux décrets exécutifs américains et que les données des utilisateurs ne sont pas soumises aux demandes de collecte américaine ».

Lumo 2.0 est déjà disponible avec l’ensemble de ses fonctions. La formule Free permet d’utiliser la version Lite pour les fonctions de base, pour un « usage privé quotidien ». Il faut la formule Plus, vendue 12,99 euros par mois, pour avoir la version max du modèle avec discussions illimitées, Projects, génération d’images et accès au modèle Max.

Des formules Professional (14,99 euros par utilisateur et par mois) et Business (24,99 euros par utilisateur et par mois) sont disponibles pour les entreprises, la seconde apportant une administration centralisée et des garanties de conformité pour les organisations.

Enfin, sur Reddit, on note des signalements de fonctions absentes et que des utilisateurs aimeraient avoir, notamment l’API correspondante, le support MCP et un Lumo CLI.

Proton lance son assistant IA Lumo 2.0 avec génération d’images et mémoire

2 juillet 2026 à 07:58
Avec de vrais morceaux de Chine dedans
Proton lance son assistant IA Lumo 2.0 avec génération d’images et mémoire

L’éditeur suisse passe la seconde avec la nouvelle version majeure de son LLM et de l’assistant qui l’accompagne. Lumo 2.0 marque surtout un gros rattrapage sur les produits existants, avec des fonctions comme la mémoire et la recherche sur le web.

Proton a lancé la première version de son assistant IA en juillet 2025, avec la promesse d’une confidentialité totale basée sur le chiffrement de bout en bout, zéro accès, et l’absence de logs. Selon l’entreprise, son assistant est utilisé par dix millions de personnes aujourd’hui.

Pour fêter son premier anniversaire, Proton lance la version 2.0. L’éditeur affirme que cette mouture est le changement le plus important sur l’assistant depuis sa création, avec une nouvelle architecture.

L’assistant peut être utilisé selon quatre modes :

  • Lumo 2.0 Lite : gère les questions générales, l’aide à la rédaction, le résumé et les autres tâches courantes
  • Lumo 2.0 Max : offre un raisonnement plus poussé, une compréhension contextuelle plus large et des réponses plus précises, pour les tâches complexes
  • Mode Fast : conçu pour les requêtes simples, les recherches rapides et les tâches bénéficiant de réponses immédiates
  • Mode Thinking : réponses plus détaillées pour les problèmes nécessitant une analyse multi-étapes plus profonde, avec le classique raisonnement visible en temps réel

Nombreuses nouvelles fonctions

Lumo 2.0 apparait comme une vaste mise à jour visant à rattraper le retard sur les modèles existants. Le nouveau modèle prend ainsi en charge la multimodalité, capable de traiter du texte et des images. On peut envoyer une image à analyser, créer des visuels à partir d’un prompt ou d’une esquisse, éditer des images existantes, le tout dans la même conversation. Proton assure que toutes les données envoyées bénéficient de la garantie zéro accès.

L’un des plus gros changements de Lumo 2.0 est la possibilité de chercher – enfin – des informations sur le web pour répondre à des questions, avec citation des sources. L’assistant reçoit également une mémoire persistante, qui lui permet d’apprendre les préférences et le style, pour que chaque conversation démarre avec plus de contexte. Comme dans les autres fonctions du même acabit, l’utilisateur décide de ce qui est retenu ou oublié.

Puisque l’on parle de contexte, Proton indique dans son billet d’annonce que la fenêtre a doublé avec Lumo 2.0, permettant des conversations plus longues et cohérentes ainsi qu’un raisonnement sur des documents et jeux de données plus volumineux. L’entreprise ne donne malheureusement aucun chiffre.

Les Projects deviennent des espaces de travail chiffrés dédiés regroupant conversations, fichiers et instructions. S’y ajoutent les Custom Lumos, décrits comme des assistants sur mesure adaptés à des tâches spécifiques, comparables aux « Gems » de Gemini.

Performances : les gros chiffres

Proton communique des gains de performance mesurés sur l’Artificial Analysis Intelligence Index, un benchmark indépendant agrégeant neuf évaluations dont GDPval-AA v2, Terminal-Bench v2.1, Humanity’s Last Exam et GPQA Diamond. Les résultats annoncés : Lumo 2.0 Lite obtient un score supérieur de 127 % à Lumo 1.4, et Lumo 2.0 Max de 240 %. Sur les mêmes résultats, on peut voir que Lumo 2.0 Max obtient 51 points, à mi-chemin entre les 44 points de Claude Sonnet 4.6 et les 55 points de GPT 5.5 (56 pour Claude Opus 4.8).

Sur la latence, Proton annonce que les requêtes courantes sont traitées jusqu’à 76 % plus rapidement que sous Lumo 1.4. Andy Yen, PDG de Proton, affirme (via 9to5Mac) que les tests utilisateurs montrent que l’écart s’est réduit au point que, pour de nombreux cas d’usage, les utilisateurs ne perçoivent plus de différence qualitative entre Lumo 2.0 Max et les derniers modèles d’OpenAI et d’Anthropic. Il s’agit toutefois d’une déclaration du fabricant, non d’un benchmark tiers indépendant.

Le court test publié par It’s FOSS relativise ce discours marketing : sur une tâche d’édition d’image (correction d’une faute de frappe dans une bannière), Lumo 2.0 Max en mode Thinking n’a pas détecté l’erreur, puis a fini par abandonner après plusieurs tentatives.

Confidentialité, disponibilité et prix

Comme on pouvait s’y attendre, Proton met largement l’accent sur la confidentialité. L’éditeur suisse s’est spécialisé depuis longtemps dans les services chiffrés de bout en bout. Il pointe le contraste avec les fournisseurs dominants et affirme que Lumo repose sur cinq principes : aucun log, chiffrement zéro accès (en transit et au repos), aucun partage de données, aucune utilisation des conversations pour l’entraînement, et modèles de langage open source.

Quels modèles ? Dans une page du support, Proton le précise : Qwen 3.5, GLM 5.2, Image-Turbo et FireRed-Image-Edit-1.1. Dans cette configuration, Qwen est très probablement utilisé pour la version Light et GLM pour Max. Pour rappel, le modèle chinois GLM 5.2 fait sensation depuis sa sortie, pour ses performances autant que ses poids ouverts. Proton prend bien soin d’ajouter que tous les modèles fonctionnent exclusivement sur ses serveurs et que les données ne sont jamais envoyées chez un tiers.

L’infrastructure reste entièrement européenne, protégée par le droit suisse sur la confidentialité et le chiffrement zéro accès, « ce qui signifie que l’accès à Lumo ne peut pas être soumis aux décrets exécutifs américains et que les données des utilisateurs ne sont pas soumises aux demandes de collecte américaine ».

Lumo 2.0 est déjà disponible avec l’ensemble de ses fonctions. La formule Free permet d’utiliser la version Lite pour les fonctions de base, pour un « usage privé quotidien ». Il faut la formule Plus, vendue 12,99 euros par mois, pour avoir la version max du modèle avec discussions illimitées, Projects, génération d’images et accès au modèle Max.

Des formules Professional (14,99 euros par utilisateur et par mois) et Business (24,99 euros par utilisateur et par mois) sont disponibles pour les entreprises, la seconde apportant une administration centralisée et des garanties de conformité pour les organisations.

Enfin, sur Reddit, on note des signalements de fonctions absentes et que des utilisateurs aimeraient avoir, notamment l’API correspondante, le support MCP et un Lumo CLI.

Dans l’ombre de Mythos et Fable ressuscités, la Chine progresse rapidement

1 juillet 2026 à 14:01
La vie trouve toujours un chemin
Dans l’ombre de Mythos et Fable ressuscités, la Chine progresse rapidement

Anthropic l’a annoncé le 30 juin : Mythos 5 est de retour et Fable 5 à partir de ce 1ᵉʳ juillet. L’entreprise s’explique dans un billet, mais elle a perdu un temps précieux face à la Chine et ses modèles à poids ouvert. L’image d’Anthropic est également entachée par des rumeurs de surveillance d’utilisateurs chinois.

Petit rappel des faits sur les dernières semaines. Le 9 juin 2026, Anthropic lance Claude Fable 5 (version publique de son architecture Mythos, avec garde-fous). Mythos 5 (version sans ces garde-fous) reste soumis à un accès via son programme Glasswing, réservé à des organisations vérifiées.

Trois jours plus tard, le 12 juin, le Département du Commerce, par l’intermédiaire du secrétaire Howard Lutnick, envoie à Anthropic une directive de contrôle des exportations exigeant la suspension de tout accès à Fable 5 et Mythos 5 pour tout ressortissant étranger, où qu’il se trouve dans le monde, y compris les employés étrangers d’Anthropic. Techniquement incapable de filtrer les utilisateurs par nationalité en temps réel, Anthropic coupe l’accès aux deux modèles pour l’ensemble de ses clients, sur Claude.ai, l’API, AWS Bedrock, Google Cloud et Microsoft Foundry.

Le 26 juin, le gouvernement autorise le rétablissement de Mythos 5 pour environ 100 organisations vérifiées, centrées sur les infrastructures critiques et la cyberdéfense. Fable 5, la version grand public, reste hors service. Désormais, les modèles sont de retour, dans la même situation qu’avant le blocage imposé par Washington. Anthropic a cependant perdu un temps précieux et la situation reste floue.

Une relation complexe avec la Maison-Blanche

Les raisons qui ont poussé la Maison-Blanche ne sont pas entièrement claires aujourd’hui. Selon le propre billet d’Anthropic, la lettre reçue ne fournissait pas de détails précis sur la préoccupation de sécurité nationale, mais l’entreprise a compris que le gouvernement avait eu connaissance d’une méthode permettant de contourner, ou de « jailbreaker », Fable 5. Ce qui revenait presque à dire que l’on pouvait obtenir Mythos facilement. La technique en question consistait, selon Anthropic, à demander au modèle de lire une base de code spécifique et d’en corriger les failles logicielles.

Bien que certaines rumeurs aient évoqué un modèle si puissant qu’il avait fait tomber les défenses de la NSA, il est difficile d’établir le sérieux de ces bruits de couloir. Anthropic, dans tous les cas, a vigoureusement contesté la proportionnalité de la mesure. L’entreprise a ainsi affirmé que le niveau de capacité démontré était largement disponible chez d’autres fournisseurs, y compris GPT-5.5 d’OpenAI. En outre, les tests menés avant le lancement, pendant des milliers d’heures avec le gouvernement américain, l’AISI britannique et des tiers, n’avaient identifié aucun jailbreak universel.

Pour Anthropic, cela revient à dire qu’un contournement spécifique et non-universel, permettant d’obtenir dans un cas précis des informations de type « recherche de vulnérabilité », a suffi à déclencher le retrait mondial de deux modèles commerciaux déployés auprès de centaines de millions d’utilisateurs.


Il reste 73% de l'article à découvrir.
Vous devez être abonné•e pour lire la suite de cet article.
Déjà abonné•e ? Générez une clé RSS dans votre profil.

Claude Sonnet 5 : plus agentique, plus malin et bientôt plus cher

1 juillet 2026 à 06:02
Un Sonnet, pas une Fable
Claude Sonnet 5 : plus agentique, plus malin et bientôt plus cher

Anthropic a dévoilé une mise à jour importante pour son modèle « milieu de gamme » Sonnet, désormais proposé en version 5. Il gagne en capacités agentiques et il est proposé avec un rabais jusqu’à la fin de l’été.

Anthropic décline ses différents modèles en trois familles principales : Haiku, le plus rapide et le plus économique ; Sonnet, le polyvalent qui vise le meilleur compromis prix/vitesse/intelligence ; et Opus, le haut de gamme et donc, le plus cher. Le labo IA a également lancé Mythos, son modèle expérimental le plus avancé, dont la version « grand public », Fable, a été temporairement bloquée par l’administration Trump jusqu’au 30 juin (on y reviendra dans un autre article).

En attendant que Fable puisse faire l’objet d’un déploiement commercial à plus grande échelle, Anthropic a entrepris d’améliorer Sonnet qui passe de la version 4.6 à la 5 directement, probablement pour se caler sur la nomenclature des nouveaux modèles. Sonnet 5 est censé mieux gérer les tâches dites « agentiques » : planifier une suite d’actions, utiliser un navigateur, manipuler un terminal, écrire ou corriger du code, vérifier son propre travail, poursuivre une tâche sans s’arrêter trop tôt.

L’entreprise affirme que cette nouvelle version de Sonnet réduit l’écart avec Opus 4.8, le modèle supérieur actuel. Ce dernier se montre toujours plus performant que son petit frère comme le montrent les benchmarks d’Anthropic, que ce soit sur le code agentique (63,2 % sur SWE-bench Pro, contre 69,2 % pour Opus 4.8 par exemple). Cela n’en reste pas moins un gain substantiel par rapport à Sonnet 4.6, sur tous les plans.

Un rabais estival avant la douloureuse

Anthropic insiste beaucoup sur la partie prix : Sonnet 5 revient à 3 dollars par million de tokens en entrée et 15 $/M en sortie. C’est le même tarif que Sonnet 4.6, mais il y a un mais. Le modèle reprend le tokenizer inauguré par Opus 4.7 qui fait consommer davantage de tokens au modèle. Anthropic admet que Sonnet 5 peut brûler jusqu’à 35 % de tokens supplémentaires pour un même texte.

Résultat : utiliser le nouveau modèle Sonnet va coûter plus cher. Pour faire passer la pilule, Anthropic offre généreusement un rabais sur le token (2 $/M en entrée, 10 $/M en sortie), mais… jusqu’au 31 août. Opus 4.8 est toujours le plus onéreux, à 5 $/M en entrée, et 25 $/M en sortie.

Sur le plan de la sécurité, Anthropic affirme que les hallucinations de Sonnet 5 sont moins fréquentes. Le modèle est aussi présenté comme plus résistant que Sonnet 4.6 aux injections de prompts et à certaines requêtes malveillantes. La société reconnait néanmoins que sur certains tests de comportement indésirable, Opus 4.8 lui reste supérieur, tout comme (évidemment, pourrait-on dire) Mythos Preview.

Puisqu’on parle du champion toutes catégories de la cybersécurité, restons encore un peu sur le sujet. Sonnet 5 n’a pas été entraîné pour ce genre de tâches, il est donc beaucoup moins capable qu’Opus 4.8 ou Mythos 5. Anthropic l’a doté de garde-fous activés par défaut, mais qui restent moins stricts que ceux de Fable 5. « [Sonnet 5] peut effectuer certaines tâches de cybersécurité courantes et non nuisibles », explique l’entreprise, mais ses performances en matière de développement d’outils exploitant des vulnérabilités sont « largement inférieures » à celles des deux modèles hauts de gamme.

Sonnet 5 devient le modèle par défaut pour les utilisateurs gratuits et les abonnés Pro. Il est aussi disponible pour les clients Max, Team et Enterprise, ainsi que dans Claude Code et pour l’API.

Claude Sonnet 5 : plus agentique, plus malin et bientôt plus cher

1 juillet 2026 à 06:02
Un Sonnet, pas une Fable
Claude Sonnet 5 : plus agentique, plus malin et bientôt plus cher

Anthropic a dévoilé une mise à jour importante pour son modèle « milieu de gamme » Sonnet, désormais proposé en version 5. Il gagne en capacités agentiques et il est proposé avec un rabais jusqu’à la fin de l’été.

Anthropic décline ses différents modèles en trois familles principales : Haiku, le plus rapide et le plus économique ; Sonnet, le polyvalent qui vise le meilleur compromis prix/vitesse/intelligence ; et Opus, le haut de gamme et donc, le plus cher. Le labo IA a également lancé Mythos, son modèle expérimental le plus avancé, dont la version « grand public », Fable, a été temporairement bloquée par l’administration Trump jusqu’au 30 juin (on y reviendra dans un autre article).

En attendant que Fable puisse faire l’objet d’un déploiement commercial à plus grande échelle, Anthropic a entrepris d’améliorer Sonnet qui passe de la version 4.6 à la 5 directement, probablement pour se caler sur la nomenclature des nouveaux modèles. Sonnet 5 est censé mieux gérer les tâches dites « agentiques » : planifier une suite d’actions, utiliser un navigateur, manipuler un terminal, écrire ou corriger du code, vérifier son propre travail, poursuivre une tâche sans s’arrêter trop tôt.

L’entreprise affirme que cette nouvelle version de Sonnet réduit l’écart avec Opus 4.8, le modèle supérieur actuel. Ce dernier se montre toujours plus performant que son petit frère comme le montrent les benchmarks d’Anthropic, que ce soit sur le code agentique (63,2 % sur SWE-bench Pro, contre 69,2 % pour Opus 4.8 par exemple). Cela n’en reste pas moins un gain substantiel par rapport à Sonnet 4.6, sur tous les plans.

Un rabais estival avant la douloureuse

Anthropic insiste beaucoup sur la partie prix : Sonnet 5 revient à 3 dollars par million de tokens en entrée et 15 $/M en sortie. C’est le même tarif que Sonnet 4.6, mais il y a un mais. Le modèle reprend le tokenizer inauguré par Opus 4.7 qui fait consommer davantage de tokens au modèle. Anthropic admet que Sonnet 5 peut brûler jusqu’à 35 % de tokens supplémentaires pour un même texte.

Résultat : utiliser le nouveau modèle Sonnet va coûter plus cher. Pour faire passer la pilule, Anthropic offre généreusement un rabais sur le token (2 $/M en entrée, 10 $/M en sortie), mais… jusqu’au 31 août. Opus 4.8 est toujours le plus onéreux, à 5 $/M en entrée, et 25 $/M en sortie.

Sur le plan de la sécurité, Anthropic affirme que les hallucinations de Sonnet 5 sont moins fréquentes. Le modèle est aussi présenté comme plus résistant que Sonnet 4.6 aux injections de prompts et à certaines requêtes malveillantes. La société reconnait néanmoins que sur certains tests de comportement indésirable, Opus 4.8 lui reste supérieur, tout comme (évidemment, pourrait-on dire) Mythos Preview.

Puisqu’on parle du champion toutes catégories de la cybersécurité, restons encore un peu sur le sujet. Sonnet 5 n’a pas été entraîné pour ce genre de tâches, il est donc beaucoup moins capable qu’Opus 4.8 ou Mythos 5. Anthropic l’a doté de garde-fous activés par défaut, mais qui restent moins stricts que ceux de Fable 5. « [Sonnet 5] peut effectuer certaines tâches de cybersécurité courantes et non nuisibles », explique l’entreprise, mais ses performances en matière de développement d’outils exploitant des vulnérabilités sont « largement inférieures » à celles des deux modèles hauts de gamme.

Sonnet 5 devient le modèle par défaut pour les utilisateurs gratuits et les abonnés Pro. Il est aussi disponible pour les clients Max, Team et Enterprise, ainsi que dans Claude Code et pour l’API.

Avec le modèle GLM-5.2, la Chine pourrait rebattre les cartes de la cybersécurité

30 juin 2026 à 08:58
De grandes responsabilités
Avec le modèle GLM-5.2, la Chine pourrait rebattre les cartes de la cybersécurité

La stratégie américaine d’embargo pour contrer le secteur technologique chinois serait-elle contreproductive ? La question se pose, alors qu’une société chinoise pourrait bouleverser la cybersécurité en diffusant un modèle capable de rivaliser avec les LLM d’OpenAI et Anthropic.

La Chine parvient à égaler les performances du modèle Mythos d’Anthropic dans certains scénarios de cybersécurité. Une affirmation du Wall Street Journal ce 27 juin, qui se demande dans quelle mesure les décisions de la Maison-Blanche ont pu jouer dans une telle remontée. Depuis DeepSeek et la vaporisation temporaire de 600 milliards de dollars de capitalisation pour NVIDIA, on pouvait cependant s’attendre à ce que la Chine égalise de nouveau le score. Ou en tout cas vienne flirter une nouvelle fois avec les performances des grands modèles de frontière américains.

Le nouveau modèle chinois qui attire les regards se nomme GLM-5.2, lancé le 13 juin par l’entreprise Zhipu AI, renommée Z.ai. Plusieurs benchmarks lui attribuent de très bons résultats, particulièrement en cybersécurité. Au point de rebattre les cartes d’une situation déjà fébrile dans ce domaine, avec un modèle disponible gratuitement depuis HuggingFace.

GLM-5.2, le trublion

GLM-5.2 est un modèle conséquent de 753 milliards de paramètres. Son architecture est de type MoE (Mixture of Experts) avec environ 40 milliards de paramètres actifs à la fois par token (jeton). Un ratio d’activation de 5,4 % qui peut le rendre beaucoup moins onéreux à exécuter qu’un modèle dense (non-MoE) de taille équivalente. La fenêtre contextuelle est d’un million de tokens.

Si l’on parle de ce modèle, c’est qu’au-delà de ses performances, il est également open source (licence MIT) et à poids ouverts. Traduction : en plus d’un accès commercial par l’API de l’entreprise (1,40 dollar par million de jetons en entrée, 4,40 dollars en sortie), n’importe qui peut récupérer le modèle et le modifier à volonté avant de l’utiliser. À condition bien sûr d’avoir le matériel nécessaire.

Quelles performances ?

Dans sa communication, Z.ai met en avant les très bons résultats généraux de GLM-5.2 de manière générale. S’agissant initialement d’un modèle pensé pour la programmation, les benchmarks utilisés sont classiques : 62,1 % pour SWE-bench Pro (résolution de problèmes sur GitHub), 81 sur Terminal-Bench 2.1 (tâches d’agents), ou encore 99,2 sur AIME 2026 (problèmes mathématiques).

Sur les travaux de longue durée, les résultats obtenus sont proches de ceux d’Opus 4.8 d’Anthropic. Par exemple, sur FrontierSWE, GLM-5.2 obtient 74,4 %, contre 75,1 % pour Opus. Sur PostTrainBench, le score est de 34,3 contre 37,2. Sur SWE-Marathon en revanche, le modèle chinois accuse un retard : 13 %, se faisant largement distancer par les 26 % d’Opus 4.8.

L’entreprise chinoise met en avant certains choix architecturaux, dont l’utilisation d’une technique baptisée IndexShare (publication arXiv), permettant d’optimiser le coût de fonctionnement. Cela permet, selon Z.ai, de diviser par trois le coût en calculs par token quand on grimpe jusqu’au maximum de la fenêtre de contexte (un million). Elle affirme qu’au sein du modèle, 75 % des couches sautent entièrement l’étape d’indexation coûteuse, tout en maintenant la qualité des schémas d’attention adaptative.

L’ensemble fait dire à certains observateurs, comme Flowtivity, que GLM-5.2 est en fait meilleur que la grande majorité des grands modèles de frontières américains, car son fonctionnement est nettement moins onéreux (six fois moins cher que GPT-5.5 selon Z.ai). L’ajout d’IndexShare permettrait au modèle de fonctionner sur du matériel « accessible » (mais pas un MacBook Pro avec 16 Go de RAM, tel que celui utilisé pour nos tests de RAG).

Et dans la cybersécurité ?

C’est ici que les choses sérieuses commencent, peut-on dire. Dans une évaluation comparative réalisée par Semgrep, GLM-5.2 a obtenu un score F1 de 39 % sur la détection IDOR, battant Claude Code (32 %) pour environ 0,17 dollar par vulnérabilité trouvée, tout en restant inférieur au pipeline multimodal de Semgrep (53 - 61 % F1).

Même son de cloche chez Graphistry le 23 juin : avec un taux de résolution de 28 sur 59 sur les benchmarks CTF (Capture The Flag) de cybersécurité, GLM-5.2 est le « top modèle » à poids ouverts et rivalise directement avec les modèles propriétaires. Dans les tests, on peut voir par exemple que Claude Code avec Opus 4.7 est 19 % plus rapide, mais il est aussi 2,2 fois plus cher à l’utilisation.

C’est ce qui fait dire à Graphistry que GLM-5.2 est le premier modèle à poids ouverts testé par leurs soins pouvant être recommandé pour une « expérience de cybersécurité de qualité frontière ».

Comment de tels résultats ont-ils été obtenus si rapidement ?

C’est l’une des grandes questions autour de GLM-5.2. Les soupçons n’ont d’ailleurs pas tardé, dans les jours qui ont suivi la publication du modèle : Z.ai a-t-elle distillé agressivement les grands modèles de frontière américains ? Pour rappel, la distillation est initialement une technique légitime d’apprentissage machine : un modèle étudiant apprend à imiter les sorties d’un modèle enseignant. Cependant, il y a problème quand elle est faite en violation des conditions d’utilisation des API, via des comptes proxy et à l’échelle industrielle. Une technique formellement interdite dans les conditions pour toutes les API commerciales. Pour les « copieurs », le résultat obtenu est un transfert de capacités sans garde-fous.


Il reste 56% de l'article à découvrir.
Vous devez être abonné•e pour lire la suite de cet article.
Déjà abonné•e ? Générez une clé RSS dans votre profil.

☕️ Tidal coupe le robinet des royalties pour la musique 100 % IA

30 juin 2026 à 06:29


Après d’autres services de streaming musical, Tidal a dévoilé sa politique relative à l’IA générative, qui prévoit la démonétisation des morceaux 100 % IA, et dans certains cas une suppression pure et simple. Mais la plateforme reste ouverte à cette technologie.

Tidal va démonétiser complètement la musique entièrement générée par IA. La priorité de la plateforme de streaming est de verser les redevances aux œuvres originales « directement produites, écrites et interprétées par des êtres humains ». Ce changement intervient alors que la filière débat toujours pour savoir si certaines musiques générées par IA doivent donner lieu à des royalties – par exemple, celles reposant sur des licences appropriées et équitables.

La musique générée par IA devra montrer patte blanche

Le service va continuer à accepter et héberger de la musique générée par IA. « Les artistes doivent être libres de créer à l’aide d’outils d’IA et les auditeurs doivent avoir la liberté de choisir le type de contenu qu’ils consomment », écrit l’entreprise. En revanche, au vu de l’afflux de ces contenus, Tidal serre la vis avec des normes plus strictes en matière d’intégrité.

Illustration : Flock

Par conséquent, les morceaux 100 % générés par IA seront signalés par des icônes et ce, à partir de la mi-juillet. Cet étiquetage s’étendra au fur et à mesure que les méthodes de détection de l’IA « gagneront en fiabilité ». Les distributeurs seront mis à contribution : ils vont en effet devoir identifier les contenus IA avant qu’ils n’arrivent sur la plateforme.

En plus de la démonétisation, Tidal affirme ne plus tolérer de musique IA exploitant la musique, le nom ou l’image d’une personne ou d’un groupe, « qui trompe les auditeurs ou nuit à la qualité de notre service ». Ces « activités frauduleuses », qui impliquent également des téléversements massifs ou une activité inhabituelle, seront bloquées ou supprimées là aussi à partir de la mi-juillet.

Tidal ne fait que suivre la vague ici. Spotify a lancé fin avril un badge « Verified » pour les artistes et les chansons qui ne sont pas générés par IA. Deezer est très actif sur le sujet : le service estime que 44 % des morceaux téléversés sur ses serveurs sont générés par IA… Néanmoins, très peu sont écoutés et quand c’est le cas, c’est souvent en lien avec des cas de fraude.

☕️ Tidal coupe le robinet des royalties pour la musique 100 % IA

30 juin 2026 à 06:29


Après d’autres services de streaming musical, Tidal a dévoilé sa politique relative à l’IA générative, qui prévoit la démonétisation des morceaux 100 % IA, et dans certains cas une suppression pure et simple. Mais la plateforme reste ouverte à cette technologie.

Tidal va démonétiser complètement la musique entièrement générée par IA. La priorité de la plateforme de streaming est de verser les redevances aux œuvres originales « directement produites, écrites et interprétées par des êtres humains ». Ce changement intervient alors que la filière débat toujours pour savoir si certaines musiques générées par IA doivent donner lieu à des royalties – par exemple, celles reposant sur des licences appropriées et équitables.

La musique générée par IA devra montrer patte blanche

Le service va continuer à accepter et héberger de la musique générée par IA. « Les artistes doivent être libres de créer à l’aide d’outils d’IA et les auditeurs doivent avoir la liberté de choisir le type de contenu qu’ils consomment », écrit l’entreprise. En revanche, au vu de l’afflux de ces contenus, Tidal serre la vis avec des normes plus strictes en matière d’intégrité.

Illustration : Flock

Par conséquent, les morceaux 100 % générés par IA seront signalés par des icônes et ce, à partir de la mi-juillet. Cet étiquetage s’étendra au fur et à mesure que les méthodes de détection de l’IA « gagneront en fiabilité ». Les distributeurs seront mis à contribution : ils vont en effet devoir identifier les contenus IA avant qu’ils n’arrivent sur la plateforme.

En plus de la démonétisation, Tidal affirme ne plus tolérer de musique IA exploitant la musique, le nom ou l’image d’une personne ou d’un groupe, « qui trompe les auditeurs ou nuit à la qualité de notre service ». Ces « activités frauduleuses », qui impliquent également des téléversements massifs ou une activité inhabituelle, seront bloquées ou supprimées là aussi à partir de la mi-juillet.

Tidal ne fait que suivre la vague ici. Spotify a lancé fin avril un badge « Verified » pour les artistes et les chansons qui ne sont pas générés par IA. Deezer est très actif sur le sujet : le service estime que 44 % des morceaux téléversés sur ses serveurs sont générés par IA… Néanmoins, très peu sont écoutés et quand c’est le cas, c’est souvent en lien avec des cas de fraude.

☕️ Accusée d’acheter de vieux livres pour entrainer des IA, Zoom Books nie

29 juin 2026 à 15:16


Depuis quelques semaines, des libraires se demandent sur Reddit si l’entreprise canadienne Zoom Books n’achètent pas de vieux livres en masse pour entrainer ses modèles d’IA génératives. Les ouvrages seraient détruits dans la foulée…

Comme l’expliquent les médias suisses RTS et SRF et le média allemand taz, cette entreprise a récemment passé commande à des librairies en Allemagne mais aussi en Espagne, aux États-Unis, en Nouvelle-Zélande, en Australie, en Bulgarie ou encore en Grande-Bretagne.

Zoom Books scanne le texte des livres achetés légalement, en détruisant l’ouvrage au passage. La société pourrait plus facilement invoquer le « fair use », un argument souvent repris par les entreprises d’IA générative pour justifier la légalité de l’entrainement de leurs modèles sur une masse de données.

Bibliothèque IHEID, Genève, Switzerland
Unsplash

Zoom Books a expliqué à nos confrères de taz qu’elle fait de l’achat et de la revente mais aussi du recyclage de livres lorsqu’ils sont en trop mauvais état. « On a acheté de manière ciblée des ouvrages documentaires datant de 1970 et postérieurs, dotés d’un numéro ISBN – des invendus poussiéreux dont personne ne voulait depuis des années. Toute revente est totalement exclue : ces livres n’ont aucune valeur, et on n’a acheté qu’un seul exemplaire par titre », affirme encore l’entreprise à SRF.

« Mais nous tenons à préciser que, contrairement à certaines spéculations récentes, Zoom Books ne numérise ni ne détruit aucun livre », assure-t-elle à taz. Mais les libraires se demandent si Zoom Books ne serait pas un simple intermédiaire. Questionné sur le sujet, l’un des responsables de l’entreprise se contente de répéter qu’il ne peut fournir aucune information sur les acheteurs.

☕️ Accusée d’acheter de vieux livres pour entrainer des IA, Zoom Books nie

29 juin 2026 à 15:16


Depuis quelques semaines, des libraires se demandent sur Reddit si l’entreprise canadienne Zoom Books n’achètent pas de vieux livres en masse pour entrainer ses modèles d’IA génératives. Les ouvrages seraient détruits dans la foulée…

Comme l’expliquent les médias suisses RTS et SRF et le média allemand taz, cette entreprise a récemment passé commande à des librairies en Allemagne mais aussi en Espagne, aux États-Unis, en Nouvelle-Zélande, en Australie, en Bulgarie ou encore en Grande-Bretagne.

Zoom Books scanne le texte des livres achetés légalement, en détruisant l’ouvrage au passage. La société pourrait plus facilement invoquer le « fair use », un argument souvent repris par les entreprises d’IA générative pour justifier la légalité de l’entrainement de leurs modèles sur une masse de données.

Bibliothèque IHEID, Genève, Switzerland
Unsplash

Zoom Books a expliqué à nos confrères de taz qu’elle fait de l’achat et de la revente mais aussi du recyclage de livres lorsqu’ils sont en trop mauvais état. « On a acheté de manière ciblée des ouvrages documentaires datant de 1970 et postérieurs, dotés d’un numéro ISBN – des invendus poussiéreux dont personne ne voulait depuis des années. Toute revente est totalement exclue : ces livres n’ont aucune valeur, et on n’a acheté qu’un seul exemplaire par titre », affirme encore l’entreprise à SRF.

« Mais nous tenons à préciser que, contrairement à certaines spéculations récentes, Zoom Books ne numérise ni ne détruit aucun livre », assure-t-elle à taz. Mais les libraires se demandent si Zoom Books ne serait pas un simple intermédiaire. Questionné sur le sujet, l’un des responsables de l’entreprise se contente de répéter qu’il ne peut fournir aucune information sur les acheteurs.

IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B

29 juin 2026 à 13:27
Ça fait raguer mon Mac !
IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B

Nous avons passé à la moulinette du RAG le contenu de plus de 15 000 actus publiées sur Next ces dix dernières années. Le but ? En donner ensuite des morceaux à une IA générative pour qu’elle adapte ses réponses. Nous avons tout fait en local, sur un MacBook Pro avec Ollama et Mistral 7B.

Le Retrieval-Augmented Generation, ou génération augmentée par récupération en français, est une technique permettant à des IA génératives d’utiliser une base de connaissances pour répondre à des prompts. On utilise aussi très souvent son acronyme pour en parler : RAG.

Rag dans ma machine

Après les explications techniques et son principe de fonctionnement, nous vous proposons un exemple pratique. Nous avons récupéré le contenu de plus de 15 000 articles de Next sur une dizaine d’années pour l’associer à Mistral 7B, un LLM libre de 7,3 milliards de paramètres (sorti en 2023, désormais loin des ténors du moment qui ont au bas mot des centaines de milliards de paramètres, voire des milliers pour certains), sous licence Apache 2.0. Le RAG est agnostique du modèle d’IA générative, nous aurions évidemment pu en prendre un autre.

Dans notre cas, un traitement local était impératif. Nous avons utilisé un MacBook Pro avec un SoC M2 et 16 Go de mémoire partagée. Mistral 7B tourne dessus sans problème, avec de la marge pour exécuter d’autres applications en même temps. Côté logiciel, nous avons installé Ollama (open source, licence MIT). Nous l’avions déjà présenté dans un précédent tuto sur l’influence du GPU dans les performances des IA génératives.

Si les explications techniques ne vous intéressent pas, sautez directement à l’inter : « Concrètement, ça donne quoi d’utiliser le RAG ». Vous aurez des exemples de réponses à des prompts sur Mistral 7B avec et sans RAG (en local dans les deux cas).

Sous le capot pour la partie technique : Ollama, Mistral et Nomic

Passons rapidement (mais pas trop) sur les détails techniques, dont voici les grandes lignes : on télécharge le modèle d’IA générative avec la commande ollama pull mistral puis un autre modèle pour transformer le texte de nos actus en vecteurs (des nombres, qui sont ensuite utilisés par les algorithmes des IA génératives) avec ollama pull nomic-embed-text (on parle aussi d’embedding).

Un petit script permet de découper automatiquement le texte en plusieurs morceaux (chunks) qui sont ensuite transformés en tokens via nomic-embed-text. Cette indexation ne doit se faire qu’une seule fois. Dans notre cas, elle a pris environ trois heures (sur le MacBook Pro M2 avec plus de 15 000 articles). Pour ajouter de nouveaux articles par la suite, pas la peine de tout réindexer, il suffit de passer à la moulinette les nouveaux textes.

Passons aux choses sérieuses avec le déroulement d’un prompt. Le prompt est vectorisé, puis comparé à tous les vecteurs des morceaux des articles de notre base. Nous gardons les 10 meilleurs ; qui sont ensuite envoyés à Mistral en même temps que le prompt. Mistral va donc élaborer sa réponse en s’appuyant sur ses connaissances et les 10 morceaux des actus de Next.

On peut affiner le prompt pour lui demander de n’utiliser que les données de Next par exemple. Après, c’est un modèle statistique (comme toutes les IA génératives), donc statistiquement, il fait parfois n’importe quoi ; rien de neuf sous le Soleil.

Concrètement, ça donne quoi d’utiliser le RAG

Pour nos tests, nous utilisons donc Ollama sur notre MacBook Pro, sans aucune connexion à Internet, toutes les opérations se faisant en local.

Voici quelques prompts et les réponses de Mistral, avec ou sans RAG. Rappel important : nous n’avons pas spécialement cherché à optimiser les réponses (le prompt passé à Mistral avec le contenu des actualités jugé le plus intéressant pourrait être amélioré).

Nous vous proposons huit prompts, sur le logiciel, le droit, les réseaux sociaux, le hardware, l’informatique quantique… Les réponses sont, pour rappel, statistiques et peuvent donc par définition être totalement différentes pour un même prompt répété plusieurs fois. Nous livrons ici la première réponse proposée par l’IA générative.

Si vous avez des idées de prompts à tester, n’hésitez pas à les proposer en commentaire, suivant les cas je pourrai les lancer et donner les résultats dans une prochaine actualité

Passons aux choses sérieuses avec une première question soulevée par Vincent (il a la réponse, j’en suis certain ) ! Mais il est curieux de voir le résultat avec ou sans le contenu des actualités de Next… qu’il a pour la plupart rédigées.

Puis-je avoir une synthèse des défauts de Windows 11 ?

Réponse de Mistral avec RAG sur les actus Next :


Il reste 80% de l'article à découvrir.
Vous devez être abonné•e pour lire la suite de cet article.
Déjà abonné•e ? Générez une clé RSS dans votre profil.

Dis Next, c’est quoi un « RAG » en IA générative ?

29 juin 2026 à 07:09
Rag against the machine
Dis Next, c’est quoi un « RAG » en IA générative ?

Ces dernières années, vous entendez peut-être parler de RAG, surtout dans le monde des entreprises. De quoi s’agit-il ? Pourquoi certaines organisations n’ont que ce mot à la bouche ? On vous explique tout, le plus simplement possible.

RAG signifie « Retrieval-Augmented Generation », littéralement « génération augmentée par récupération ». Dans les grandes lignes, c’est un type d’architecture que l’on met en place pour obtenir des réponses rapides et précises sur une base de connaissances spécifiques, en utilisant de l’IA.

Des explications sans (trop de) jargon

Pour comprendre ce que le RAG permet, on utilise souvent l’analogie d’un expert, mais qui n’aurait pas connaissance de l’armoire dans laquelle vous rangez tous vos documents. Il peut s’agir de modes d’emploi, de cartes de vœux, de livres particuliers, voire de factures et d’autres informations que vous avez jugées suffisamment importantes pour les placer là. L’expert en sait beaucoup, mais il ne pourra répondre à aucune question sur le contenu de cette armoire. On peut toujours décrire le type de documents que l’on possède, ses réponses manqueront de précision.

IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B

C’est un comportement que l’on retrouve dans les IA génératives habituellement. Elles « savent » quantité de choses, mais si vous êtes dans une entreprise possédant un grand nombre de ressources, l’IA n’y aura probablement pas accès.

Or, ces ressources internes peuvent être à la fois le cœur d’une entreprise comme sa base d’exploitation. Si vous mettez en place un chatbot pour gérer l’assistance, il vaut mieux qu’il ait accès à ces ressources. Les réponses données pourraient sinon être vagues, ou même – pire ! – inventées. Car les IA génératives hallucinent et ont encore bien du mal à répondre simplement « Je ne sais pas ».


Il reste 80% de l'article à découvrir.
Vous devez être abonné•e pour lire la suite de cet article.
Déjà abonné•e ? Générez une clé RSS dans votre profil.

Ford rappelle les vieux briscards pour épauler son IA déficiente

29 juin 2026 à 06:08
L’IA passe au contrôle technique
Ford rappelle les vieux briscards pour épauler son IA déficiente

Ford a décidé de faire appel à la bonne vieille expérience humaine pour corriger les problèmes de qualité qui affectent ses gammes. Le constructeur automobile états-unien a réembauché des centaines de vétérans pour former la jeune génération et améliorer les outils IA incapables de remplacer, à eux seuls, ce savoir-faire.

Aux États-Unis, Ford se traîne depuis des années une mauvaise réputation : un manque de fiabilité. En 2023, l’entreprise a ainsi englouti 4,8 milliards de dollars pour éponger les coûts des prises en charge au titre de la garantie de ses voitures, soit 4 % du chiffre d’affaires du constructeur automobile (trois fois plus élevé que le reste de l’industrie). Ford provisionnait à l’époque 1 203 dollars pour les réparations sous garantie sur chaque véhicule vendu, contre 591 dollars en 2019.

Le coût astronomique de la garantie

Des frais énormes que le groupe s’est engagé à résorber. Et cela passe par le retour sur les lignes de production de vétérans. Ces trois dernières années, l’entreprise a réembauché 350 « anciens », des ex-employés Ford et de fournisseurs. Ils forment les salariés plus jeunes, et surtout ils entraînent les outils IA utilisés par le groupe.

« L’intelligence artificielle est un outil formidable, mais elle ne vaut que par les informations utilisées pour l’entraîner », explique Charles Poon, vice-président de l’ingénierie matérielle du géant de Detroit. « Ces dernières années, nous n’avons pas accordé toute l’attention nécessaire à l’expérience de nos ingénieurs les plus chevronnés, ceux qui nous ont accompagnés sur de nombreux cycles de produits », poursuit-il dans une déclaration reprise par Bloomberg.

Ces ingénieurs capés dirigent désormais des réunions obligatoires où les problèmes de qualité sont passés au crible. « Nous nous étions de plus en plus reposés sur des systèmes automatisés de contrôle qualité », ajoute Kumar Galhotra, le directeur des opérations. Ces spécialistes « traquent les points de défaillance avant même qu’une pièce n’arrive sur la ligne de production ».

L’IA désemparée

Résultat : les coûts liés à la prise en charge de la garantie diminuent, « des centaines et des centaines de millions de dollars », se réjouit Jim Farley, le patron de Ford. L’image de marque en profite aussi. Le dernier classement JD Power sur la qualité initiale des véhicules durant les trois premiers mois suivant l’achat montre que Ford dépasse des références en la matière, dont le modèle à suivre, Toyota. En fait, seules les marques de luxe Porsche et Genesis (la marque haut de gamme de Hyundai) ont fait mieux.

Charles Poon bat sa coulpe : « Nous avons cru, à tort, qu’il suffisait d’introduire de l’intelligence artificielle et d’y intégrer nos exigences de conception pour obtenir un produit de grande qualité ». Pour améliorer certains outils d’automatisation et d’IA, le constructeur a compris qu’il fallait les entraîner « par les personnes les plus expérimentées ». L’histoire ne dit pas encore si l’IA saura garder le cap le jour où les vieux briscards ne seront plus là pour lui tenir la main.

Ford n’en reste pas moins le constructeur automobile américain comptant toujours le plus de rappels ; les coûts liés aux garanties devraient tourner autour du milliard de dollars en 2026. La direction espère toutefois que ce volume va se dégonfler avec les nouveaux modèles.

Ford rappelle les vieux briscards pour épauler son IA déficiente

29 juin 2026 à 06:08
L’IA passe au contrôle technique
Ford rappelle les vieux briscards pour épauler son IA déficiente

Ford a décidé de faire appel à la bonne vieille expérience humaine pour corriger les problèmes de qualité qui affectent ses gammes. Le constructeur automobile états-unien a réembauché des centaines de vétérans pour former la jeune génération et améliorer les outils IA incapables de remplacer, à eux seuls, ce savoir-faire.

Aux États-Unis, Ford se traîne depuis des années une mauvaise réputation : un manque de fiabilité. En 2023, l’entreprise a ainsi englouti 4,8 milliards de dollars pour éponger les coûts des prises en charge au titre de la garantie de ses voitures, soit 4 % du chiffre d’affaires du constructeur automobile (trois fois plus élevé que le reste de l’industrie). Ford provisionnait à l’époque 1 203 dollars pour les réparations sous garantie sur chaque véhicule vendu, contre 591 dollars en 2019.

Le coût astronomique de la garantie

Des frais énormes que le groupe s’est engagé à résorber. Et cela passe par le retour sur les lignes de production de vétérans. Ces trois dernières années, l’entreprise a réembauché 350 « anciens », des ex-employés Ford et de fournisseurs. Ils forment les salariés plus jeunes, et surtout ils entraînent les outils IA utilisés par le groupe.

« L’intelligence artificielle est un outil formidable, mais elle ne vaut que par les informations utilisées pour l’entraîner », explique Charles Poon, vice-président de l’ingénierie matérielle du géant de Detroit. « Ces dernières années, nous n’avons pas accordé toute l’attention nécessaire à l’expérience de nos ingénieurs les plus chevronnés, ceux qui nous ont accompagnés sur de nombreux cycles de produits », poursuit-il dans une déclaration reprise par Bloomberg.

Ces ingénieurs capés dirigent désormais des réunions obligatoires où les problèmes de qualité sont passés au crible. « Nous nous étions de plus en plus reposés sur des systèmes automatisés de contrôle qualité », ajoute Kumar Galhotra, le directeur des opérations. Ces spécialistes « traquent les points de défaillance avant même qu’une pièce n’arrive sur la ligne de production ».

L’IA désemparée

Résultat : les coûts liés à la prise en charge de la garantie diminuent, « des centaines et des centaines de millions de dollars », se réjouit Jim Farley, le patron de Ford. L’image de marque en profite aussi. Le dernier classement JD Power sur la qualité initiale des véhicules durant les trois premiers mois suivant l’achat montre que Ford dépasse des références en la matière, dont le modèle à suivre, Toyota. En fait, seules les marques de luxe Porsche et Genesis (la marque haut de gamme de Hyundai) ont fait mieux.

Charles Poon bat sa coulpe : « Nous avons cru, à tort, qu’il suffisait d’introduire de l’intelligence artificielle et d’y intégrer nos exigences de conception pour obtenir un produit de grande qualité ». Pour améliorer certains outils d’automatisation et d’IA, le constructeur a compris qu’il fallait les entraîner « par les personnes les plus expérimentées ». L’histoire ne dit pas encore si l’IA saura garder le cap le jour où les vieux briscards ne seront plus là pour lui tenir la main.

Ford n’en reste pas moins le constructeur automobile américain comptant toujours le plus de rappels ; les coûts liés aux garanties devraient tourner autour du milliard de dollars en 2026. La direction espère toutefois que ce volume va se dégonfler avec les nouveaux modèles.

Anthropic déploie de nouveau Mythos 5, Fable 5 attend son feu vert

27 juin 2026 à 14:59
Libéré, délivré
Anthropic déploie de nouveau Mythos 5, Fable 5 attend son feu vert

Nouvel épisode dans la saga Mythos. Anthropic a reçu la nuit dernière l’autorisation du gouvernement US pour déployer de nouveau Mythos 5 auprès d’organisations et entreprises états-uniennes. Fable 5 pourrait obtenir son feu vert la semaine prochaine.

Dévoilés le 10 juin, Fable 5 et Mythos 5, les modèles IA les plus avancés d’Anthropic, n’ont pas été très longtemps entre les mains des utilisateurs. Deux jours plus tard, Anthropic était obligée d’en fermer l’accès à tous les ressortissants étrangers ; étant dans l’impossibilité de déterminer la nationalité de ses utilisateurs, le labo IA a décidé d’interdire ces modèles à tout le monde.

Depuis, les négociations se poursuivent entre l’administration Trump à l’origine de l’interdiction, et Anthropic. Elles ont fini par porter leurs fruits, du moins pour Mythos 5. Ce modèle est le frère jumeau de Fable 5, mais sans les restrictions d’usage liées à des sujets sensibles, comme la cybersécurité, la biologie, la chimie ou la distillation de modèles IA.

« Aujourd’hui, le gouvernement nous a informés que Mythos 5, notre modèle le plus avancé en cybersécurité, peut être redéployé auprès d’un ensemble d’organisations américaines chargées d’exploiter et de défendre des infrastructures critiques », a expliqué ce vendredi 26 juin l’entreprise sur les réseaux sociaux. L’accès est depuis en phase de rétablissement pour ces organisations.

Fable 5 dans l’antichambre

C’est un premier pas, mais insuffisant : Mythos 5, qui remplace Mythos Preview, se limite en effet aux membres du projet Glasswing. Fable 5 pourrait cependant suivre assez vite. Selon une indiscrétion d’Axios, l’administration Trump pourrait lever son interdiction sur le modèle grand public dans le courant de la semaine prochaine.

Howard Lutnick, le secrétaire au Commerce, a expliqué dans une lettre envoyée ce vendredi, et révélée par Semafor, qu’Anthropic avait travaillé avec le gouvernement sur les risques associés aux deux modèles. Des efforts qui ont permis « des avancées significatives ». L’entreprise s’est par ailleurs engagée à plancher sur « des protocoles, des normes et les modalités de mise à disposition des modèles ».

Cette « libération » des deux modèles sera vécue comme un soulagement par Anthropic et ses utilisateurs. Néanmoins, ce pataquès ne résout pas la demande du labo qui, le 12 juin, réclamait « un processus statutaire transparent, équitable, clair et fondé sur des faits techniques » plutôt que l’opacité actuelle qui « ne respecte pas ces principes ».

Un message similaire envoyé par OpenAI hier, alors que le créateur de ChatGPT lançait GPT-5.6… mais à une poignée restreinte d’organisations, comme l’a exigé le gouvernement. « Nous ne pensons pas que ce type de procédure d’accès gouvernementale doive devenir la norme à long terme », explique OpenAI. « Elle prive des meilleurs outils les utilisateurs, les développeurs, les entreprises, les défenseurs en cybersécurité et les partenaires internationaux qui en ont besoin. »

Anthropic déploie de nouveau Mythos 5, Fable 5 attend son feu vert

27 juin 2026 à 14:59
Libéré, délivré
Anthropic déploie de nouveau Mythos 5, Fable 5 attend son feu vert

Nouvel épisode dans la saga Mythos. Anthropic a reçu la nuit dernière l’autorisation du gouvernement US pour déployer de nouveau Mythos 5 auprès d’organisations et entreprises états-uniennes. Fable 5 pourrait obtenir son feu vert la semaine prochaine.

Dévoilés le 10 juin, Fable 5 et Mythos 5, les modèles IA les plus avancés d’Anthropic, n’ont pas été très longtemps entre les mains des utilisateurs. Deux jours plus tard, Anthropic était obligée d’en fermer l’accès à tous les ressortissants étrangers ; étant dans l’impossibilité de déterminer la nationalité de ses utilisateurs, le labo IA a décidé d’interdire ces modèles à tout le monde.

Depuis, les négociations se poursuivent entre l’administration Trump à l’origine de l’interdiction, et Anthropic. Elles ont fini par porter leurs fruits, du moins pour Mythos 5. Ce modèle est le frère jumeau de Fable 5, mais sans les restrictions d’usage liées à des sujets sensibles, comme la cybersécurité, la biologie, la chimie ou la distillation de modèles IA.

« Aujourd’hui, le gouvernement nous a informés que Mythos 5, notre modèle le plus avancé en cybersécurité, peut être redéployé auprès d’un ensemble d’organisations américaines chargées d’exploiter et de défendre des infrastructures critiques », a expliqué ce vendredi 26 juin l’entreprise sur les réseaux sociaux. L’accès est depuis en phase de rétablissement pour ces organisations.

Fable 5 dans l’antichambre

C’est un premier pas, mais insuffisant : Mythos 5, qui remplace Mythos Preview, se limite en effet aux membres du projet Glasswing. Fable 5 pourrait cependant suivre assez vite. Selon une indiscrétion d’Axios, l’administration Trump pourrait lever son interdiction sur le modèle grand public dans le courant de la semaine prochaine.

Howard Lutnick, le secrétaire au Commerce, a expliqué dans une lettre envoyée ce vendredi, et révélée par Semafor, qu’Anthropic avait travaillé avec le gouvernement sur les risques associés aux deux modèles. Des efforts qui ont permis « des avancées significatives ». L’entreprise s’est par ailleurs engagée à plancher sur « des protocoles, des normes et les modalités de mise à disposition des modèles ».

Cette « libération » des deux modèles sera vécue comme un soulagement par Anthropic et ses utilisateurs. Néanmoins, ce pataquès ne résout pas la demande du labo qui, le 12 juin, réclamait « un processus statutaire transparent, équitable, clair et fondé sur des faits techniques » plutôt que l’opacité actuelle qui « ne respecte pas ces principes ».

Un message similaire envoyé par OpenAI hier, alors que le créateur de ChatGPT lançait GPT-5.6… mais à une poignée restreinte d’organisations, comme l’a exigé le gouvernement. « Nous ne pensons pas que ce type de procédure d’accès gouvernementale doive devenir la norme à long terme », explique OpenAI. « Elle prive des meilleurs outils les utilisateurs, les développeurs, les entreprises, les défenseurs en cybersécurité et les partenaires internationaux qui en ont besoin. »

[MàJ] OpenAI lance vraiment GPT-5.6 Sol, Terra et Luna

9 juillet 2026 à 17:23
GPT-5.6 derrière un cordon de sécurité
[MàJ] OpenAI lance vraiment GPT-5.6 Sol, Terra et Luna

Sol, Terra et Luna : les trois versions de GPT-5.6 sont maintenant disponibles, après quelques semaines de purgatoire à la Maison Blanche.

Mise à jour, 9/07 — Après quelques semaines en accès limité, GPT-5.6 a reçu le feu vert de l’administration Trump pour être lancé auprès du grand public.

Article original, 26/06 — GPT-5.6 est finalement disponible, deux mois après la précédente version du grand modèle de langage d’OpenAI. Enfin, disponible… façon de parler. En vertu d’un décret du président Trump, l’entreprise limite le déploiement à quelques organisations et entreprises triées sur le volet. Le labo IA espère pouvoir distribuer le modèle aussi largement que possible « dans les prochaines semaines ».

Une situation loin d’être idéale et qui ne fait pas les affaires d’OpenAI. « Nous ne pensons pas que ce type de processus d’accès gouvernemental doive devenir la norme à long terme », écrit la société. « Il prive des meilleurs outils les utilisateurs, les développeurs, les entreprises, les défenseurs en cybersécurité et les partenaires internationaux qui en ont besoin », ajoute-t-elle. OpenAI dit continuer de travailler avec l’administration Trump pour améliorer le cadre prévu du décret présidentiel sur la cybersécurité.

GPT-5.6 : un modèle à voir de loin

Dont acte, il faudra donc se contenter de GPT-5.5 pendant quelques temps avant de pouvoir juger de son successeur sur pièces. Ou plutôt, de ses successeurs car OpenAI a opté pour trois versions de son modèle :

  • GPT-5.6 Sol est présenté comme le modèle le plus puissant du lot. OpenAI assure qu’il est le plus calé pour les tâches les plus complexes, comme le code, les raisonnements longs, la biologie, la cybersécurité et les usages agentiques. Sol reçoit également les garde-fous les plus costauds (on va y revenir).
  • GPT-5.6 Terra est le modèle intermédiaire, pensé pour les usages quotidiens avec un équilibre entre performances et coûts. Ses performances devraient le mettre au niveau de GPT-5.5, tout en étant deux fois moins cher, promet OpenAI.
  • GPT-5.6 Luna est le modèle rapide et abordable de la gamme. Il se destine aux usages où la vitesse et le prix comptent davantage que les performances brutes.

On pourra voir dans cette gamme un certain alignement avec Anthropic et ses modèles Haiku, Sonnet et Opus.

Deux modes de consommation sont proposées : « max », qui donne à GPT-5.6 Sol davantage de temps pour raisonner sur des tâches complexes. Et « ultra », qui mobilise plusieurs agents capables de travailler en parallèle sur des tâches plus lourdes.

GPT-5.6 Sol se veut donc particulièrement performant sur les tâches liées au code. Sur le benchmark Terminal‑Bench 2.1, les versions standard et Ultra affichent des scores légèrement supérieurs à celles de Mythos 5. Mais OpenAI insiste surtout sur les capacités du modèle pour la cybersécurité (recherche de vulnérabilités et leur exploitation). Sol rivalise avec Mythos Preview sur ExploitBench, en n’utilisant qu’un tiers des tokens en sortie.

La sécurité en bandoulière

Ces super-pouvoirs sont sévèrement encadrés, tient à rassurer OpenAI. Toute la chaîne de sécurité autour de GPT-5.6 Sol a été renforcée, avec des garde-fous directement entraînés dans le modèle, des systèmes de détection en temps réel, des contrôles au niveau des comptes et un accès différencié en fonction des usages.

Il s’agit de compliquer la vie des pirates qui voudraient exploiter ces capacités pour pénétrer par effraction dans des infrastructures sensibles. Mais sans bloquer pour autant les travaux légitimes de recherche et de correction de failles, de débug ou de formation. OpenAI ajoute que certaines activités peuvent entraîner une vérification au niveau du compte, pour distinguer un usage défensif licite d’un comportement malveillant répété.

« Lors d’évaluations portant sur Chromium et Firefox, [GPT-5.6 Sol] a identifié des bugs et des éléments pouvant servir à construire un exploit, mais il n’a pas été capable de produire seul une chaîne d’exploitation complète et fonctionnelle dans les conditions testées. »

OpenAI insiste tout particulièrement sur le travail mené pour contrer les tentatives de jailbreak, qui poussent les modèles à contourner leurs mesures de sécurité. Plus de 700 000 heures de calcul (en équivalent GPU A100) ont été consacrées à du red teaming automatisé : les propres modèles d’OpenAI ont tenté de chercher des failles dans les garde-fous.

Il s’agissait de détecter des jailbreaks « universels » qui peuvent fonctionner dans toute sorte de contextes, pas uniquement sur une requête précise. Des experts humains sont également mobilisés, et les tests se poursuivent durant la phase d’aperçu. Les premiers testeurs pourront d’ailleurs buter sur des restrictions qui bloqueront ou refuseront certaines demandes. D’autres requêtes prendront davantage de temps de traitement, afin de procéder à des examens de sécurité supplémentaires.

Tokens raisonnables

Les tarifs intéresseront les entreprises qui font bûcher les agents IA pour produire du code et qui voient les factures s’alourdir invariablement. La grille des prix de GPT-5.6 est la suivante :

  • GPT-5.6 Sol : 5 $/1 million de tokens en entrée ; 30 $/1M en sortie ;
  • GPT-5.6 Terra : 2,50 $/1M en entrée ; 15 $/1M en sortie ;
  • GPT-5.6 Luna : 1 $/1M en entrée ; 6 $/1M en sortie.

Sol a ceci d’intéressant que ses tarifs sont identiques à ceux de GPT-5.5. Quant à Terra, ils sont tout simplement deux fois moins chers, pour des performances annoncées comme similaires. Un caillou dans le jardin d’Anthropic, dont les derniers modèles se montrent très gourmands.

OpenAI ajoute que GPT-5.6 Sol pourra tourner sur l’infrastructure Cerebras avec une vitesse pouvant atteindre 750 tokens par seconde. De quoi offrir des temps de réponses beaucoup plus rapides pour les clients professionnels exigeants disposant des ressources financières nécessaires.

GPT-5.6 améliore aussi le « cache de requêtes », un mécanisme présent depuis octobre 2024 chez OpenAI qui permet de réduire les coûts quand un développeur réutilise plusieurs fois le même contexte dans ses requêtes. Le nouveau modèle conserve les éléments réutilisables d’une requête pendant au moins 30 minutes ; l’écriture dans le cache coûte 1,25 fois plus cher, mais la lecture (la réutilisation) bénéfice de 90 % de remise. C’était 50 % au lancement de cette fonction. Par ailleurs, les développeurs pourront mieux découper leurs prompts pour choisir les parties à garder en cache et à réutiliser ensuite.

[MàJ] OpenAI lance vraiment GPT-5.6 Sol, Terra et Luna

9 juillet 2026 à 17:23
GPT-5.6 derrière un cordon de sécurité
[MàJ] OpenAI lance vraiment GPT-5.6 Sol, Terra et Luna

Sol, Terra et Luna : les trois versions de GPT-5.6 sont maintenant disponibles, après quelques semaines de purgatoire à la Maison Blanche.

Mise à jour, 9/07 — Après quelques semaines en accès limité, GPT-5.6 a reçu le feu vert de l’administration Trump pour être lancé auprès du grand public.

Article original, 26/06 — GPT-5.6 est finalement disponible, deux mois après la précédente version du grand modèle de langage d’OpenAI. Enfin, disponible… façon de parler. En vertu d’un décret du président Trump, l’entreprise limite le déploiement à quelques organisations et entreprises triées sur le volet. Le labo IA espère pouvoir distribuer le modèle aussi largement que possible « dans les prochaines semaines ».

Une situation loin d’être idéale et qui ne fait pas les affaires d’OpenAI. « Nous ne pensons pas que ce type de processus d’accès gouvernemental doive devenir la norme à long terme », écrit la société. « Il prive des meilleurs outils les utilisateurs, les développeurs, les entreprises, les défenseurs en cybersécurité et les partenaires internationaux qui en ont besoin », ajoute-t-elle. OpenAI dit continuer de travailler avec l’administration Trump pour améliorer le cadre prévu du décret présidentiel sur la cybersécurité.

GPT-5.6 : un modèle à voir de loin

Dont acte, il faudra donc se contenter de GPT-5.5 pendant quelques temps avant de pouvoir juger de son successeur sur pièces. Ou plutôt, de ses successeurs car OpenAI a opté pour trois versions de son modèle :

  • GPT-5.6 Sol est présenté comme le modèle le plus puissant du lot. OpenAI assure qu’il est le plus calé pour les tâches les plus complexes, comme le code, les raisonnements longs, la biologie, la cybersécurité et les usages agentiques. Sol reçoit également les garde-fous les plus costauds (on va y revenir).
  • GPT-5.6 Terra est le modèle intermédiaire, pensé pour les usages quotidiens avec un équilibre entre performances et coûts. Ses performances devraient le mettre au niveau de GPT-5.5, tout en étant deux fois moins cher, promet OpenAI.
  • GPT-5.6 Luna est le modèle rapide et abordable de la gamme. Il se destine aux usages où la vitesse et le prix comptent davantage que les performances brutes.

On pourra voir dans cette gamme un certain alignement avec Anthropic et ses modèles Haiku, Sonnet et Opus.

Deux modes de consommation sont proposées : « max », qui donne à GPT-5.6 Sol davantage de temps pour raisonner sur des tâches complexes. Et « ultra », qui mobilise plusieurs agents capables de travailler en parallèle sur des tâches plus lourdes.

GPT-5.6 Sol se veut donc particulièrement performant sur les tâches liées au code. Sur le benchmark Terminal‑Bench 2.1, les versions standard et Ultra affichent des scores légèrement supérieurs à celles de Mythos 5. Mais OpenAI insiste surtout sur les capacités du modèle pour la cybersécurité (recherche de vulnérabilités et leur exploitation). Sol rivalise avec Mythos Preview sur ExploitBench, en n’utilisant qu’un tiers des tokens en sortie.

La sécurité en bandoulière

Ces super-pouvoirs sont sévèrement encadrés, tient à rassurer OpenAI. Toute la chaîne de sécurité autour de GPT-5.6 Sol a été renforcée, avec des garde-fous directement entraînés dans le modèle, des systèmes de détection en temps réel, des contrôles au niveau des comptes et un accès différencié en fonction des usages.

Il s’agit de compliquer la vie des pirates qui voudraient exploiter ces capacités pour pénétrer par effraction dans des infrastructures sensibles. Mais sans bloquer pour autant les travaux légitimes de recherche et de correction de failles, de débug ou de formation. OpenAI ajoute que certaines activités peuvent entraîner une vérification au niveau du compte, pour distinguer un usage défensif licite d’un comportement malveillant répété.

« Lors d’évaluations portant sur Chromium et Firefox, [GPT-5.6 Sol] a identifié des bugs et des éléments pouvant servir à construire un exploit, mais il n’a pas été capable de produire seul une chaîne d’exploitation complète et fonctionnelle dans les conditions testées. »

OpenAI insiste tout particulièrement sur le travail mené pour contrer les tentatives de jailbreak, qui poussent les modèles à contourner leurs mesures de sécurité. Plus de 700 000 heures de calcul (en équivalent GPU A100) ont été consacrées à du red teaming automatisé : les propres modèles d’OpenAI ont tenté de chercher des failles dans les garde-fous.

Il s’agissait de détecter des jailbreaks « universels » qui peuvent fonctionner dans toute sorte de contextes, pas uniquement sur une requête précise. Des experts humains sont également mobilisés, et les tests se poursuivent durant la phase d’aperçu. Les premiers testeurs pourront d’ailleurs buter sur des restrictions qui bloqueront ou refuseront certaines demandes. D’autres requêtes prendront davantage de temps de traitement, afin de procéder à des examens de sécurité supplémentaires.

Tokens raisonnables

Les tarifs intéresseront les entreprises qui font bûcher les agents IA pour produire du code et qui voient les factures s’alourdir invariablement. La grille des prix de GPT-5.6 est la suivante :

  • GPT-5.6 Sol : 5 $/1 million de tokens en entrée ; 30 $/1M en sortie ;
  • GPT-5.6 Terra : 2,50 $/1M en entrée ; 15 $/1M en sortie ;
  • GPT-5.6 Luna : 1 $/1M en entrée ; 6 $/1M en sortie.

Sol a ceci d’intéressant que ses tarifs sont identiques à ceux de GPT-5.5. Quant à Terra, ils sont tout simplement deux fois moins chers, pour des performances annoncées comme similaires. Un caillou dans le jardin d’Anthropic, dont les derniers modèles se montrent très gourmands.

OpenAI ajoute que GPT-5.6 Sol pourra tourner sur l’infrastructure Cerebras avec une vitesse pouvant atteindre 750 tokens par seconde. De quoi offrir des temps de réponses beaucoup plus rapides pour les clients professionnels exigeants disposant des ressources financières nécessaires.

GPT-5.6 améliore aussi le « cache de requêtes », un mécanisme présent depuis octobre 2024 chez OpenAI qui permet de réduire les coûts quand un développeur réutilise plusieurs fois le même contexte dans ses requêtes. Le nouveau modèle conserve les éléments réutilisables d’une requête pendant au moins 30 minutes ; l’écriture dans le cache coûte 1,25 fois plus cher, mais la lecture (la réutilisation) bénéfice de 90 % de remise. C’était 50 % au lancement de cette fonction. Par ailleurs, les développeurs pourront mieux découper leurs prompts pour choisir les parties à garder en cache et à réutiliser ensuite.

❌