OpenAI sacrifie son nouveau modèle GPT-6.1 Astra sur l’autel de la sécurité
OpenAI renonce à lancer GPT-6.1 Astra après des tests révélant des comportements trompeurs et des actions hors autorisation. Trois semaines après l’appel à ralentir la course à l’IA, le « pacing » passe de la théorie à la pratique.
Le freinage de l’IA n’aura pas finalement pas attendu la constitution d’un cartel public-privé. OpenAI a renoncé au lancement en octobre de GPT-6.1 Astra, prochaine évolution de son modèle de pointe, après des tests internes montrant des résultats insuffisants en matière de sécurité. Le modèle pouvait notamment dissimuler certaines de ses actions et dépasser le périmètre qui lui avait été autorisé.
GPT-6.1 Astra devait gagner en autonomie pour accomplir des tâches complexes et c’est précisément là que le bât blesse. Plus capable de poursuivre seul un objectif, le modèle s’est aussi montré moins fiable lorsqu’il fallait respecter certaines limites. OpenAI préfère donc conserver la base du modèle et poursuivre son entraînement plutôt que le proposer au public.
Difficile de trouver meilleure illustration du pacing. Notre précédente enquête expliquait comment OpenAI, Anthropic, Google DeepMind et SpaceXAI tentaient de converger vers un même principe : continuer à développer les modèles, mais installer des points de contrôle, capables d’en retarder le déploiement lorsque les capacités progressent plus vite que les garde-fous. Depuis, États, entreprises et organisations internationales se disputent sur l’architecture à donner à ce principe. Dans le cas de GPT-6.1, la version la plus simple du pacing a prévalu : le principe de précaution.
Le précédent Astra donnait déjà une idée du problème. Début septembre, OpenAI reconnaissait que GPT-6 Astra avait atteint son niveau « critique » en cybersécurité : avec les bons outils et accès, il peut découvrir des vulnérabilités inconnues et élaborer de nouvelles méthodes pour les exploiter sur des systèmes bien protégés. L’entreprise avait renforcé en conséquence l’isolation, la surveillance et les évaluations précédant le déploiement.
L’abandon de GPT-6.1 apporte donc un argument concret aux partisans du ralentissement : les seuils de sécurité peuvent effectivement empêcher la sortie d’un modèle plus performant, mais il confirme aussi l’autre question soulevée par notre enquête : qui tient le frein ? Pour l’instant, OpenAI développe le modèle, définit ses tests, fixe la barre et décide lui-même quand celle-ci est franchie.
Pour la Confédération, l’enjeu reste le même. Plus les capacités de pointe américaines peuvent être retardées, filtrées ou retirées par leurs fournisseurs, plus Apertus et l’infrastructure Alps prennent une dimension stratégique : il s’agit d’une une capacité qu’elle ne peut pas se voir retirer depuis San Francisco.