我把 GPT-6 Astra 用进了真实工作

GPT-6 Astra 发布后,我看到不少游戏、3D 场景和 Blender 建模的演示。漂亮的画面很容易让人停下来:原来 AI 已经能做到这个程度了。
这几天,我把它用在了另一类事情上:一个涉及 Azure、Linux、Windows 和数据库连接的复杂部署任务,以及自己的日常写作。这些工作没有那么适合剪成几十秒的炫技视频,却决定了我的项目能不能继续往前走。
用下来,我的感受很明确:我开始愿意把更完整的一段工作交给 Astra。 部署时,它能沿着问题继续排查;写作时,文字读起来更顺、更自然。我感受到的变化,正在进入每天的工作,而不只发生在演示里。
结合自己的经历、官方文档和早期使用者的反馈,我想谈六点。
1. 复杂部署,接得住
先交代这件事的背景。一个业务系统运行在 Linux 上,但它需要的报表引擎只能在 Windows 上运行。我要把这两部分接起来:应用发出请求,Windows 服务读取数据库、生成 PDF,再把报表交回业务系统。任务是在已有系统里加入一个可以使用的能力,不能把原来的连接、权限和业务流程弄坏。
展开以后,工作远比“写一个 Windows Worker”复杂。它涉及 Azure 虚拟机和相关资源、私有网络和访问规则、新子网接入已有的 NAT Gateway、Windows 服务安装,以及 SQL 连接的证书信任问题。Astra 在我授权的范围内,自主推进了这些配置、排错和测试。我仍然决定环境范围、批准会影响服务的变更,但不需要自己切进每个工具,一步步把部署做完。
过程当然遇到了问题。早期网络规则被 Azure 拒绝过;连通数据库以后,又要处理证书校验。后来报表生成了,保存附件的环节还出现过错误。它需要继续追查,并把报表读回、重试等验证补齐。最终,Linux 到 Windows 的报表链路在 Dev 环境跑通,真实 PDF 生成后也完成了附件验证。让我印象深刻的是,代码、云资源、网络和验证,开始可以放在同一个任务里交给它推进。 对一个做产品的人来说,这比某一段代码写得漂亮有用得多。
2. 工具之间,连起来了
那些游戏和 3D 演示也值得看,只是我会多看一步:它调用了什么工具,怎样把中间结果接下去?OpenAI 的发布页展示了 Blender 房屋模型、Unreal 场景和可交互的赛车游戏;另一个演示则在 Google Maps 上比较诊所的位置和路线。下方两张截图来自官方展示,呈现的是展示内容,并非我的独立复现。官方演示

房屋模型出现在实际 Blender 工作界面中。来源:OpenAI Astra 发布页,Blender model 展示。

地图演示把地点与车程放在同一个操作流程里。来源:OpenAI,Pediatrician search 演示。
公开使用者的经历提供了另一种视角。Matt Shumer 写到,他让 Astra 通过浏览器处理 newsletter、邮箱和广告后台;一位做飞行游戏的开发者则说,模型使用 Godot 和 Blender,把素材与游戏拼起来,但过程也包括多轮人工反馈。这里有浏览器操作,有代码,有专业软件和工具连接,不能简单归结成“AI 更会点鼠标了”。Shumer 的使用记录、游戏作者原帖
对真实工作而言,我期待的是这些能力整合起来:研究完资料,继续打开工具;生成完文件,再检查文件;做完页面,再去页面上验证。工具切换的地方,往往正是工作掉回人手里的地方。 Astra 如果能接住更多这样的交接,电脑操作的价值就会出现在很多普通工作中。具体能做到哪一步,仍取决于所用产品提供的工具和访问权限。
3. 长任务,接着做
这次有一个很值得关注的功能:Codex 的实验性上下文管理。它可以用笔记保留细节,也能搜索之前的历史。理解起来并不复杂:一次工作太长,当前窗口放不下所有内容时,AI 还有地方找回前面做过什么。按目前的配置文档,这个功能默认关闭。配置文档
举一个假设的例子。你让它改造一个老项目,前半段已经发现某个依赖不能升级,也试过一种迁移方案,知道它会破坏兼容性。几个小时以后,工作继续到了另一个模块。这时有用的记忆应当包括当初为什么放弃那条路,以及测试给出了什么结果。能找回这些信息,就有机会避免再走一遍弯路。
这也是我觉得它值得关注的原因。部署、重构、资料研究,都需要把很多零散发现积累成后面的判断。如果每隔一段时间就得重新交代背景,工作很难真正连续。这里谈的是文档描述的能力和它可能带来的用途;它让我看到了一条更适合长任务的路线:一次投入的上下文,能在后续工作里继续发挥作用。

4. 更自主,也要听劝
我希望 AI 主动把事情向前推,也希望我随时能改变方向。比如部署进行到一半,我补充一句“先只在测试环境做”;接下来它应该沿着这个新条件继续工作。自主性越强,理解这种调整就越重要。我需要一个有主动性的协作者,也需要自己的意见能够改变它接下来做什么。
我的观点是:升级模型时,值得一起重审旧 skills。 OpenAI 的使用指导明确建议检查 skills 和 AGENTS.md 等文件,因为 Astra 对这些指令更敏感,含糊或冲突的规则可能让工作过早停下。过去为了让模型少犯错而加上的一些细碎要求,到了今天,可能已经妨碍它完成整件事。官方使用指导
我会把“每完成一步都回来问我”,改成写清楚目标、验收标准、可以自主处理的范围,以及真正需要我决定的节点。比如整理资料、准备草稿、补充相关验证,可以在已经授权的任务里继续推进;改变部署环境、扩大项目范围,则要明确问清楚。一位开发者就报告过 Astra 为已有项目提出额外基础设施、过早开始实施的经历。这个反例提醒我,好的自主性需要对任务范围的准确理解;更新 skills 是改善协作方式,也不能替模型的误判开脱。开发者原帖
5. 文字更自然
写作是另一个让我有感的地方。这几天拿它写文章,我觉得文字比以前更顺了:句子衔接更自然,观点容易展开,读的时候也更容易顺着意思往下走。这种变化很难用一张跑分图表示,但对需要经常写东西的人,它非常直接。
我写文章通常从一些并不整齐的想法开始。有事实,有项目里的感受,也有还没想清楚的判断。好的写作帮助,是让这些东西逐渐成为一篇读者愿意看下去的文章。一个具体经历能够自然引出观点,下一段又接住上一段留下的问题。文字有了这种连贯性,我更容易把注意力放在自己到底想说什么。
所以这里我最想强调的,就是阅读感受:我更喜欢和它一起写出来的文字了。 这是我在现有写作流程里的体验,模型、上下文和我们积累的写作习惯都有影响。我仍会明确告诉它读者是谁、语气怎样、哪些说法不像我;官方指导也提到,需要主动指定想要的文风和结构。对我而言,这些设定是在帮助它把表达做得更贴切。写作指导

6. 值不值,算总账
体验积极,不代表每件事都适合交给 Astra。前面那位做飞行游戏的开发者说,项目用了大约三小时,消耗了他 Pro 计划周额度的 45%。这是他的单次使用记录,不能照搬成别人的预算,却把漂亮结果背后的代价摆了出来。另有用户报告,任务尚未完成,额度就已经耗尽。游戏作者记录、额度反馈
截至 9 月 6 日,标准 API 价格是每百万输入 Token 10 美元、输出 Token 50 美元,缓存和长上下文另有条件。订阅额度采用另一套规则,不能直接换算成可以聊多少轮。模型与价格
我会按任务算这笔账。改一句文案、查一个简单问题,用更轻的模型可能已经足够。涉及几个系统、需要排错和验证的工作,我更愿意用强模型。要比较的是:模型花了多少、我投入了多久,以及最后得到了什么。我的部署体验让我觉得,Astra 在复杂任务上很值得继续用;这还不是一个我测量过的效率提升百分比。

这些体验放在一起,让我对 Astra 的信任又往前走了一步。我更愿意把需要长时间推进、跨越多个产品和系统的复杂任务交给它,让它在明确的目标和授权范围内,把工作持续做下去。从部署到写作,这份信任开始有了具体的依据。
我需要面对的问题也在变化:当它越来越自主,一次完成的事情越来越多,我该怎样验证结果、追溯关键决定,确认整条工作链值得信任?验证和审计,会成为更需要花心思的地方。更高的价格也得认真算。我甚至动了再多开一个高额度订阅的念头——已经在工作里尝到了甜头,就很想多用一些。至于多花的钱值不值,要看它能为我完成多少真正有价值的工作。
这些新问题并没有削弱我的期待。Astra 已经改变了我愿意交给 AI 的工作范围,我也开始期待,那些今天还需要我紧盯着的任务,以后能够完成得更稳、更好。AI 的惊喜远没有结束。下一次进步,我希望继续在真实工作里感受到它。
资料核对于 2026 年 9 月 6 日。文中区分个人使用感受、公开作者自述和官方展示;这些案例不构成统一条件下的模型对比。
