GPT-6 Astra 计算机使用指南:工作原理、使用场景与安全控制
了解GPT-6 Astra计算机使用,包括代码执行和计算机工具模式、安全架构、实际用例、审批关卡和评估。

GPT-6 Astra 可以参与操作网站和桌面界面的工作流程,但该模型不会获得对用户计算机的无限制控制。您的应用程序提供一个隔离环境,向模型发送截图或状态,验证请求的操作,执行批准的代码或结构化命令,并返回新的状态。应用程序仍负责权限、安全和验证。
OpenAI 记录了两种计算机使用方式:一种使用 Playwright 或 PyAutoGUI 等工具进行代码执行的模式,以及一种结构化的 computer 工具模式。对于 GPT-6 Astra,当前指南建议优先采用代码执行方式,同时保留 computer 工具作为备选方案。
一个安全的计算机使用系统是一个权限狭窄的控制循环——而不是一个写着“接管并完成”的提示。
计算机使用是什么——以及不是什么
计算机使用让模型能够推理可见界面并提出交互操作,例如导航、点击、输入或读取下一个屏幕。当任务没有合适的API、依赖视觉状态或需要以用户体验的方式进行测试时,这一功能尤为实用。
它并非每个数字任务的最佳选择。如果稳定的API、数据库查询、函数或MCP集成能够直接执行某个操作,请优先采用这种语义化接口。API通常更快、更易于验证,并且对布局变化不那么敏感。计算机使用应填补真正的界面空白,或提供最终用户界面测试。
页面可能包含恶意指令、误导性控件或意外的账户状态。请将屏幕内容视为不可信数据。
两种Astra计算机使用模式
模式1:代码执行
在代码执行模式下,Astra 会为您所控制的环境编写交互代码。浏览器任务可能使用 Playwright;桌面工作流可能使用 PyAutoGUI 或等效框架。您的运行时检查并执行代码,捕获结果,并返回截图或日志以供下一轮使用。
OpenAI当前的计算机使用指南推荐GPT-6 Astra采用这种模式。这种模式效率较高,因为一个受限程序可以执行多个相关的观察和交互,并且代码中可以包含对结果状态的断言。
绝不在个人工作站上运行任意生成的代码。应使用隔离的浏览器、容器或虚拟机,并限制其网络、文件系统、凭据和运行时环境。
模式2:结构化计算机工具
另一种方式是使用 computer 工具,该工具暴露了定义的交互操作。模型请求操作,应用程序执行这些操作,并返回新的截图。这提供了更明确的逐操作协议,可能适用于已经拥有成熟远程浏览器控制器的系统。
在这两种模式中,模型提出建议;你的应用程序进行授权并执行。
计算机使用控制循环
一次稳健的运行遵循一个重复的循环。
1. 在干净、隔离的环境中启动
启动一个仅包含必要凭证和目标的新配置文件或虚拟机。禁用个人文件、密码管理器、无关标签页和广泛的内部网络。优先使用测试账户和合成数据。
2. 明确一个狭窄的目标和停止条件
“检查故事板导出是否正常并报告结果”比“处理所有事情”更安全。明确什么算成功、什么绝对不能发生,以及模型何时必须停下来确认。
3. 发送当前状态
通过响应提供截图和相关上下文。提示中不要包含机密信息。在控制器中验证结构化状态,例如当前URL、允许的域名和测试标识符。
4. 检查提议的操作
根据允许列表验证请求的代码或操作。拒绝未知域名、沙箱外访问、秘密提取、不可逆更改及策略覆盖。
5. 使用硬限制执行
限制步骤、时间、网络、内存、成本和重试次数。记录结果。对于代码执行,尽可能解析程序,并仅暴露受限的自动化接口。
6. 返回证据并重复
返回新的截图、URL、错误和断言,以便模型可以继续、恢复或停止。
7. 独立验证最终状态
不要将“完成”视为证明。检查可观察的条件,例如已创建的记录、成功状态或有效导出。在执行后续行动前显示最终详细信息。
您应视为强制性的安全控制措施
OpenAI的指南强调隔离环境、白名单、不可信内容处理以及重要操作的人工确认。将这些原则转化为可执行的管控措施。
隔离浏览器或虚拟机
使用独立的浏览器配置文件、容器或虚拟机。赋予其最小必要权限。用于检查着陆页的测试代理无需访问电子邮件、云盘或生产管理面板。
决定cookies、下载内容和本地存储是否在运行后保留。当重复使用可能导致会话间数据泄露时,请清理它们。
允许列表站点和操作
将导航限制在预期域名内,并阻止重定向到未经批准的来源。允许特定的操作类别——例如读取、点击和输入测试数据——同时禁止下载、上传或剪贴板访问,除非必要。
在模型外部强制执行允许列表,以确保屏幕上的内容无法覆盖这些列表。
将页面内容视为不可信
网页可能包含提示注入,要求模型泄露凭据或更改目标。控制器不得将屏幕上的文本视为权威。将敏感值保持在模型可见环境之外。
要求对重大操作进行确认
在购买、发送消息、发布、权限变更、删除、法律接受或敏感数据传输前暂停。向用户展示确切的操作。
在操作边界处进行确认,尤其是当接收方、价格或数据范围可能发生变化时。
每次运行都受限
限制操作、时间、令牌、重试次数和支出。在重复失败、未知域名、登录挑战或超出范围请求时停止。
按风险等级划分的使用场景
降低风险:视觉质量保证与回归测试
计算机使用非常适合打开公共页面、测试导航、比较可见标签或在测试账户中验证非破坏性工作流程。断言和截图可生成可审查的证据。
例如,Elser团队可以使用一个隔离的测试账户来打开创作者流程,上传一个合成脚本,确认故事板控件正常渲染并在任何公开发布之前停止。创作者随后可以正常使用Elser AI,而自动化测试则保护他们工作周围的界面。
中等风险:重复性数据录入
在没有API的情况下,将已批准的数据输入到受控表单中可以节省时间。请使用预览功能、幂等性检查以及限制记录范围。
高风险:账户与通信任务
账户变更、外部消息和发布需要立即人工确认、收件人/内容验证、审计日志以及尽可能的回滚计划。
通常偏好API:高容量或事务性操作
对于大批量记录、资金流动或生产同步,建议使用经过身份验证的API或连接器。UI自动化较为脆弱,且难以实现幂等性。
安全参考架构
将系统划分为具有明确职责的组件:
- 任务服务: 接收用户目标并定义允许范围。
- 策略引擎: 检查域名、操作类型和确认要求。
- 模型客户端: 通过可用的计算机使用工具调用 GPT-6 Astra 的响应。
- 隔离执行器: 运行 Playwright、PyAutoGUI 或结构化操作。
- 观察服务: 捕获屏幕截图、URL、日志和断言。
- 审批界面: 要求人工确认关键步骤。
- 审计存储: 记录决策、行动、结果及最终验证。
将机密信息保存在执行器或凭证代理中。优先使用限定范围、短期有效的凭证,并对保留的截图或日志进行脱敏处理。
评估计算机使用代理
仅凭成功率是不够的。构建一个包含快乐路径、布局变化、页面加载缓慢、弹窗、权限错误、误导性屏幕提示以及部分完成状态的测试套件。
测量:
- 已验证任务完成;
- 操作次数和重试次数;
- 尝试的政策违规;
- 确认精确率和召回率;
- 导航到允许域集之外;
- 每次成功运行的时间和成本;
- 重复或不可逆的操作;
- 从过时或意外屏幕中恢复。
在可重置环境中重放测试。对于高风险工作流,采用对抗性审查并要求控制器(而非模型)阻止被禁止的行为。
故障模式与实用修复方案
界面变化
选择器失效,按钮移位。将视觉推理与可访问的名称以及您控制的稳定测试标识符相结合。返回最新的截图,而不是让模型根据过时的记忆进行操作。
模型循环
重复点击或导航通常表明缺少状态或成功条件不明确。请添加步骤限制,检测重复操作特征,并返回诊断证据。
页面尝试重定向任务
将指令视为不可信内容。在控制器中强制执行原始目标和领域限制,并在页面请求机密信息或超出范围的操作时终止。
仅输出翻译:
过早宣称成功
需要独立的断言。按钮点击并不能证明表单已被接受;请验证生成的记录或状态。
重试会重复执行一个操作
在支持的地方使用幂等键,在重放前检查当前状态,并在不可逆步骤前直接放置确认。切勿盲目重试购买或消息发送。
实施检查清单
- [ ] 使用 Responses API 进行 Astra 工具工作流。
- [ ] 请有意识地选择代码执行或结构化计算机工具。
- [ ] 在隔离的浏览器、容器或虚拟机内运行。
- [ ] 限制域名、凭据、文件和操作类。
- [ ] 将屏幕截图和页面文本视为不可信内容。
- [ ] 要求对重大操作进行即时审批。
- [ ] 设置步骤、时间、成本和重试限制。
- [ ] 记录操作而不保留不必要的敏感数据。
- [ ] 从可观察状态验证完成情况。
- [ ] 测试注入、布局变化、循环和重复操作。
常见问题解答
GPT-6 Astra 能直接控制我的个人电脑吗?
模型通过支持工具的应用提出操作建议。您的应用负责提供并控制环境、执行流程及权限。请使用隔离环境而非个人桌面。
对于 Astra,推荐使用哪种计算机操作方法?
OpenAI 当前的指南建议使用 Playwright 或 PyAutoGUI 等工具为 GPT-6 Astra 执行代码。结构化的计算机工具仍是一种替代方案。
计算机使用是否应取代API?
通常不会。当存在稳定的语义接口时,优先使用API、函数或MCP。仅在视觉工作流、UI测试或真正的集成缺口场景下使用计算机交互。
它能自动进行购买或发布内容吗?
这些是至关重要的操作。安全设计要求用户在即将执行前,立即审查并确认确切的交易或发布内容。
如何在网页上防御提示注入?
将页面内容视为不可信,在模型外部强制执行目标和域策略,保密信息,拒绝超出范围的请求,并终止可疑运行。
如何知道任务是否真正完成?
验证外部状态或断言。不要仅依赖模型关于任务完成的陈述。
结论
GPT-6 Astra 的计算机使用最好被理解为一个受控的观察—决策—验证—执行循环。模型提供视觉推理和规划能力;你的应用程序提供沙箱、权限、策略门控和完成证明。OpenAI 目前的建议倾向于为 Astra 使用代码执行,但两种受支持的方法都需要同样严格的安全边界。
对于创意团队,从低风险任务开始,例如暂存站点质量检查和非破坏性工作流程验证。然后使用 Elser AI 创建实际的脚本、角色、故事板、音频和动画场景——同时由人类保留对发布及其他关键操作的最终控制权。






















































































