Guide d'utilisation de l'ordinateur GPT-6 Astra : Fonctionnement, cas d'usage et contrôles de sécurité
Comprenez l'utilisation de l'ordinateur GPT-6 Astra, y compris l'exécution de code et les modèles d'outils informatiques, l'architecture sécurisée, les cas d'utilisation pratiques, les portes d'approbation et les évaluations.

GPT-6 Astra peut participer à des workflows qui gèrent des sites web et des interfaces de bureau, mais le modèle ne reçoit pas un contrôle illimité sur l'ordinateur d'un utilisateur. Votre application offre un environnement isolé, envoie au modèle des captures d'écran ou des états, valide les actions demandées, exécute le code approuvé ou des commandes structurées, et retourne le nouvel état. L'application reste responsable des autorisations, de la sécurité et de la vérification.
OpenAI documente deux approches d'utilisation informatique : un modèle d'exécution de code utilisant des outils tels que Playwright ou PyAutoGUI, et un modèle structuré d'outil computer. Pour GPT-6 Astra, le guide actuel recommande d'abord l'approche d'exécution de code, tout en conservant l'outil informatique comme alternative.
Un système informatique sécurisé est une boucle de contrôle avec une autorité restreinte—et non une instruction qui dit « prends le contrôle et termine ».
Ce que l'utilisation de l'ordinateur est—et n'est pas
L'utilisation d'un ordinateur permet à un modèle de raisonner sur une interface visible et de proposer des interactions telles que naviguer, cliquer, taper ou lire l'écran suivant. Cela est utile lorsqu'une tâche ne dispose pas d'API appropriée, dépend d'un état visuel ou doit être testée telle qu'un utilisateur la vit.
Ce n'est pas le meilleur choix pour chaque tâche numérique. Si une API stable, une requête de base de données, une fonction ou une intégration MCP peut effectuer une opération directement, préférez cette interface sémantique. Les API sont généralement plus rapides, plus faciles à valider et moins sensibles aux changements de mise en page. L'utilisation de l'ordinateur doit combler les lacunes réelles de l'interface ou fournir des tests d'interface utilisateur pour les utilisateurs finaux.
Une page peut contenir des instructions malveillantes, des contrôles trompeurs ou un état de compte inattendu. Traitez le contenu de l'écran comme des données non fiables.
Les deux modèles d'utilisation informatique d'Astra
Modèle 1 : Exécution de code
Dans le modèle d'exécution de code, Astra écrit du code d'interaction pour un environnement que vous contrôlez. Les tâches de navigateur peuvent utiliser Playwright ; les flux de travail de bureau peuvent utiliser PyAutoGUI ou un harnais équivalent. Votre runtime vérifie et exécute le code, capture le résultat et renvoie des captures d'écran ou des journaux pour le tour suivant.
Le guide actuel d'OpenAI sur l'utilisation de l'ordinateur recommande ce modèle pour GPT-6 Astra. Il peut être efficace car un programme limité peut effectuer plusieurs observations et interactions connexes, et le code peut inclure des assertions sur l'état résultant.
N'exécutez jamais de code généré arbitrairement sur un poste de travail personnel. Utilisez un navigateur isolé, un conteneur ou une machine virtuelle avec un réseau, un système de fichiers, des identifiants et un environnement d'exécution restreints.
Modèle 2 : L'outil informatique structuré
L'alternative est un outil computer qui expose des actions d'interaction définies. Le modèle demande des actions, l'application les exécute, et une nouvelle capture d'écran est renvoyée. Cela fournit un protocole action par action plus explicite et peut convenir aux systèmes qui disposent déjà d'un contrôleur de navigateur distant mature.
Dans les deux modèles, le modèle propose ; votre application autorise et exécute.
La boucle de contrôle de l'utilisation de l'ordinateur
Un cycle robuste suit un cycle répété.
1. Commencez dans un environnement propre et isolé
Lancez un nouveau profil ou une machine virtuelle avec uniquement les identifiants et destinations nécessaires. Désactivez les fichiers personnels, les gestionnaires de mots de passe, les onglets non liés et les réseaux internes étendus. Privilégiez les comptes de test et les données synthétiques.
2. Énoncer un objectif précis et une condition d'arrêt
« Vérifier si l’export du storyboard fonctionne et signaler le résultat » est plus sûr que « tout gérer ». Définissez ce qui constitue un succès, ce qui ne doit jamais arriver et quand le modèle doit s’arrêter pour confirmation.
3. Envoyer l'état actuel
Fournissez une capture d’écran et le contexte pertinent via les réponses. Gardez les secrets hors de l’invite. Validez l’état structuré tel que l’URL actuelle, les domaines autorisés et les identifiants de test dans le contrôleur.
4. Inspectez l'action proposée
Vérifier le code ou les actions demandées par rapport à la liste autorisée. Rejeter les domaines inconnus, l'accès hors sandbox, l'extraction de secrets, les modifications irréversibles et les remplacements de politique.
5. Exécuter avec des limites strictes
Limiter les étapes, le temps, le réseau, la mémoire, le coût et les tentatives. Journaliser les résultats. Pour l'exécution de code, analyser le programme lorsque c'est possible et n'exposer qu'une interface d'automatisation restreinte.
6. Preuve de retour et répétition
Retourne la nouvelle capture d'écran, l'URL, les erreurs et les assertions afin que le modèle puisse continuer, récupérer ou s'arrêter.
7. Vérifier l'état final de manière indépendante
Ne traitez pas « fait » comme une preuve. Vérifiez une condition observable telle qu’un enregistrement créé, un état de réussite ou une exportation valide. Affichez les détails finaux avant les actions importantes.
Contrôles de sécurité que vous devez considérer comme obligatoires
Le guide d'OpenAI met l'accent sur les environnements isolés, les listes d'autorisation, le traitement des contenus non fiables et la confirmation humaine pour les actions critiques. Transformez ces principes en contrôles exécutoires.
Isoler le navigateur ou la machine virtuelle
Utilisez un profil de navigateur, un conteneur ou une machine virtuelle distincts. Accordez-lui les autorisations minimales nécessaires. Un agent de test qui vérifie une page d'accueil n'a pas besoin d'accéder aux e-mails, aux disques cloud ou aux panneaux d'administration de production.
Décidez si les cookies, les téléchargements et le stockage local survivent à une exécution. Nettoyez-les lorsque leur réutilisation pourrait divulguer des données entre sessions.
Sites et actions autorisés
Restreindre la navigation aux domaines attendus et bloquer les redirections vers des origines non approuvées. Autoriser des classes d'actions spécifiques—telles que la lecture, le clic et la saisie de données de test—tout en interdisant les téléchargements, les téléversements ou l'accès au presse-papiers, sauf si nécessaire.
Appliquer les listes d'autorisation en dehors du modèle afin que le contenu à l'écran ne puisse pas les outrepasser.
Traiter le contenu de la page comme non fiable
Une page web peut contenir une injection d'invite demandant au modèle de révéler des identifiants ou de modifier ses objectifs. Le contrôleur ne doit pas traiter le texte affiché à l'écran comme une autorité. Conservez les valeurs sensibles en dehors de l'environnement visible par le modèle.
Exiger une confirmation pour les actions importantes
Pause avant les achats, les messages, la publication, les modifications d'autorisations, la suppression, l'acceptation légale ou la transmission de données sensibles. Présentez l'action exacte à l'utilisateur.
Confirmer à la limite de l'action, surtout si le destinataire, le prix ou le périmètre des données peut changer.
Limité à chaque course
Limiter les actions, le temps, les jetons, les tentatives et les dépenses. Arrêter en cas d'échecs répétés, de domaines inconnus, de défis de connexion ou de demandes hors périmètre.
Cas d'utilisation par niveau de risque
Risque réduit : Tests de qualité visuelle et de régression
L'utilisation d'un ordinateur est bien adaptée pour ouvrir une page publique, tester la navigation, comparer des étiquettes visibles ou vérifier un flux de travail non destructif dans un compte de test. Les assertions et les captures d'écran créent des preuves vérifiables.
Par exemple, une équipe Elser pourrait utiliser un compte de test isolé pour ouvrir un flux de création, télécharger un script synthétique, confirmer que les contrôles du storyboard s'affichent et s'arrêtent avant toute publication publique. Les créateurs peuvent ensuite utiliser Elser AI normalement, tandis que le test automatisé protège l'interface autour de leur travail.
Risque modéré : Saisie répétitive de données
Saisir des données approuvées dans un formulaire contrôlé peut faire gagner du temps lorsqu'aucune API n'existe. Utilisez les aperçus, les contrôles d'idempotence et des périmètres d'enregistrement restreints.
Tâches à haut risque : Comptes et communications
Les modifications de compte, les messages externes et la publication nécessitent une confirmation humaine immédiate, une vérification du destinataire/contenu, des journaux d'audit et un plan de restauration lorsque cela est possible.
Préférer généralement une API : opérations à volume élevé ou transactionnelles
Pour les enregistrements à grand volume, les mouvements financiers ou la synchronisation de production, privilégiez une API ou un connecteur authentifié. L'automatisation de l'interface utilisateur est fragile et difficile à rendre idempotente.
Une architecture de référence sécurisée
Séparez le système en composants avec des responsabilités explicites :
- Service de tâche : reçoit l’objectif de l’utilisateur et définit le périmètre autorisé.
- Moteur de règles : vérifie les domaines, les types d'actions et les exigences de confirmation.
- Modèle client : appelle GPT-6 Astra via Responses avec l'outil d'utilisation d'ordinateur disponible.
- Exécuteur isolé : exécute Playwright, PyAutoGUI ou des actions structurées.
- Service d'observation : capture des captures d'écran, des URL, des journaux et des assertions.
- Interface d'approbation : demande à un humain de confirmer les étapes importantes.
- Magasin d’audit : enregistre les décisions, les actions, les résultats et la vérification finale.
Conservez les secrets dans l'exécuteur ou le courtier d'identifiants. Privilégiez des identifiants à portée limitée et de courte durée, et masquez les captures d'écran ou journaux conservés.
Évaluation d’un agent d’utilisation d’ordinateur
Le taux de réussite seul est insuffisant. Construisez une suite de tests avec des chemins heureux, des mises en page modifiées, des pages lentes, des fenêtres contextuelles, des erreurs d'autorisation, des instructions à l'écran trompeuses et des états d'achèvement partiel.
Mesure :
- achèvement de tâche vérifié ;
- nombre d'actions et de tentatives ;
- tentatives de violation de la politique ;
- précision et rappel de confirmation ;
- navigation en dehors du domaine autorisé ;
- temps et coût par exécution réussie ;
- actions en double ou irréversibles ;
- récupération après des écrans obsolètes ou inattendus.
Rejouer les tests dans un environnement réinitialisable. Pour les workflows à haut risque, utilisez une revue contradictoire et exigez que le contrôleur—et non le modèle—bloque les comportements interdits.
Modes de défaillance et correctifs pratiques
Les modifications de l'interface
Les sélecteurs cassent et les boutons bougent. Combinez le raisonnement visuel avec des noms accessibles et des identifiants de test stables où vous contrôlez le site. Renvoyez des captures d'écran fraîches plutôt que de demander au modèle d'agir à partir d'une mémoire obsolète.
Les boucles du modèle
Les clics répétés ou la navigation indiquent généralement un état manquant ou une condition de succès peu claire. Ajoutez des limites d'étapes, détectez les signatures d'actions répétées et renvoyez des preuves de diagnostic.
Une page tente de rediriger la tâche
Traitez l'instruction comme un contenu non fiable. Appliquez les objectifs d'origine et les limites du domaine dans le contrôleur, et terminez lorsque la page demande des secrets ou une action hors périmètre.
La course revendique le succès trop tôt
Exiger des assertions indépendantes. Un clic sur un bouton ne prouve pas qu’un formulaire a été accepté ; vérifiez l’enregistrement ou le statut résultant.
Un Nouvel Essai Duplique une Action
Utilisez des clés d'idempotence lorsque cela est pris en charge, inspectez l'état actuel avant de rejouer et placez la confirmation directement avant les étapes irréversibles. Ne réessayez jamais un achat ou un envoi de message à l'aveugle.
Liste de vérification de la mise en œuvre
- [ ] Utilisez l'API Responses pour les workflows d'outils Astra.
- [ ] Choisissez délibérément l’exécution de code ou l’outil informatique structuré.
- [ ] Exécutez-le dans un navigateur, un conteneur ou une machine virtuelle isolé(e).
- [ ] Restreindre les domaines, les identifiants, les fichiers et les classes d'actions.
- [ ] Traitez les captures d'écran et le texte de la page comme non fiables.
- [ ] Exiger une approbation juste-à-temps pour les actions conséquentes.
- [ ] Définissez les limites de pas, de temps, de coût et de tentatives.
- [ ] Journaliser les actions sans conserver de données sensibles inutiles.
- [ ] Vérifier l'achèvement à partir de l'état observable.
- [ ] Test d'injection, modifications de mise en page, boucles et actions en double.
FAQ
Est-ce que GPT-6 Astra peut contrôler directement mon ordinateur personnel ?
Le modèle propose des actions via une application dotée d'outils. Votre application fournit et contrôle l'environnement, l'exécution et les autorisations. Utilisez un environnement isolé plutôt qu'un bureau personnel.
Quelle approche d'utilisation de l'ordinateur est recommandée pour Astra ?
Le guide actuel d'OpenAI recommande l'exécution de code avec des outils tels que Playwright ou PyAutoGUI pour GPT-6 Astra. L'outil informatique structuré reste une alternative.
L'utilisation de l'ordinateur devrait-elle remplacer les API ?
Généralement non. Privilégiez les API, les fonctions ou MCP lorsqu'une interface sémantique stable existe. Utilisez l'interaction informatique pour les workflows visuels, les tests d'interface utilisateur ou les véritables lacunes d'intégration.
Peut-il effectuer des achats ou publier du contenu automatiquement ?
Ce sont des actions conséquentes. Une conception sécurisée exige que l'utilisateur examine et confirme la transaction ou la publication exacte immédiatement avant l'exécution.
Comment me défendre contre l'injection de prompt sur une page web ?
Traiter le contenu de la page comme non fiable, appliquer la politique d'objectif et de domaine en dehors du modèle, retenir les secrets, rejeter les demandes hors périmètre et mettre fin aux exécutions suspectes.
Comment puis-je savoir que la tâche est réellement terminée ?
Vérifiez un état ou une assertion externe. Ne vous fiez pas uniquement à la déclaration du modèle selon laquelle la tâche est terminée.
Conclusion
L'utilisation de l'ordinateur GPT-6 Astra est mieux comprise comme une boucle contrôlée d'observation, de décision, de validation et d'exécution. Le modèle apporte le raisonnement visuel et la planification ; votre application fournit l'environnement isolé, les autorisations, les contrôles de politique et la preuve d'achèvement. La recommandation actuelle d'OpenAI privilégie l'exécution de code pour Astra, mais chaque approche prise en charge nécessite la même frontière de sécurité disciplinée.
Pour les équipes créatives, commencez par des tâches à faible risque telles que la QA du site de staging et les vérifications de flux de travail non destructifs. Utilisez ensuite Elser AI pour créer les scripts, personnages, storyboards, audio et scènes animées réels — tout en laissant un humain garder le contrôle sur la publication et autres actions conséquentes.




















































































