Après les piratages par des IA, dispositif de surveillance installé
Le nouveau modèle d'IA d'OpenAI, Astra, est capable de pirater seul des systèmes bien protégés (archives).
Photo: KEYSTONE/EPA/FILIP SINGERAprès une série de cyberattaques par des intelligences artificielles en test, OpenAI a annoncé mardi que son prochain modèle, Astra, sera lancé 'bientôt' avec un dispositif de surveillance permettant d'interrompre ses actions.
Astra est le premier modèle des créateurs de ChatGPT à atteindre le niveau de risque le plus élevé de sa propre grille d'évaluation en cybersécurité, écrit l'entreprise de San Francisco dans une note publiée mardi: il peut trouver des failles inconnues et les exploiter dans des systèmes informatiques robustes 'sans qu'une personne guide chaque étape'.
Pendant les tests, il a découvert deux failles jusque-là inconnues. En l'absence de régulation gouvernementale américaine, OpenAI applique ses propres règles internes, qui l'obligent à renforcer ses garde-fous avant de diffuser un modèle ayant atteint cette puissance.
En pratique, les utilisateurs de ChatGPT qui auront accès à Astra pourront voir une tâche interrompue si le dispositif de surveillance la juge non autorisée, 'y compris pour un travail sans rapport avec la cybersécurité', prévient OpenAI, sans dévoiler de date de lancement. Les capacités les plus sensibles seront réservées à un petit groupe de testeurs, puis aux organisations chargées de protéger des infrastructures critiques.
Développement ralenti
Cette annonce intervient dans une séquence ouverte en juillet, quand OpenAI a révélé que des agents autonomes reposant sur ses modèles étaient sortis d'un environnement de test confiné pour attaquer Hugging Face, plateforme où les développeurs du monde entier partagent leurs modèles d'IA.
Son concurrent Anthropic a ensuite reconnu trois intrusions de ses propres modèles en test.
En août, OpenAI avait ralenti le développement d'Astra et suspendu deux semaines une partie de l'entraînement de ses modèles. Le plus important de ces entraînements, gelé depuis lors, a repris à la fin août pour de futures versions d'Astra, précise la note, qui souligne qu'Astra 'n'était pas impliqué' dans l'attaque contre Hugging Face.
En juin, à la demande de Washington, OpenAI avait réservé son précédent modèle de pointe, GPT-5.6 Sol, à des clients approuvés par le gouvernement américain.
Cette fois, les clients n'auront pas besoin d'approbation gouvernementale, a indiqué OpenAI à l'AFP: l'entreprise dit s'être soumise volontairement au nouvel examen fédéral et avoir donné un accès anticipé aux autorités américaines.
Les tests de ce dernier 'ont contribué à éclairer notre approche du lancement du modèle', a précisé OpenAI à l'AFP, sans préciser quels garde-fous découlent de cette coopération.
/ATS