ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

OpenAI 发布 GPT-6 Astra:新旗舰从“会聊天“到“会操作电脑“

OpenAI 发布 GPT-6 Astra:新旗舰从“会聊天“到“会操作电脑“ 9 月 3 日OpenAI 正式发布新一代旗舰模型 GPT-6 Astra9 月 4 日向付费用户开放。按官方口径这一代的卖点不再是聊天更聪明、考试分更高而是换成了更实在的词会操作电脑、能自己把多步任务干完。这次发布事实是什么先把时间线捋清楚都是公开报道里能查到的9 月 3 日limited preview先给一批可信合作方试用同日对外公开9 月 4 日向付费用户开放但据报道是受限版本会拒绝网络安全等特定领域的部分提示词前代是 GPT-5.6闭源、延续订阅 API 的商业路径。按 OpenAI 的说法Astra 在网络安全、专业工作、软件工程、科学几个方向上是代际提升更强的地方在于保持专注、遵守任务边界、理解用户意图、处理繁琐任务、完成多步工作流。官方举的例子很生活化填税表、搭游戏场景、订餐、找工作。一个背景值得注意据报道OpenAI 总裁 Greg Brockman 在发布时说了句这可能被视为 AGI 的到来。宣传归宣传AGI 到现在也没有公认的测试标准这句话当发布会的氛围组听就好别当成技术结论。技术本质模型竞争从会答转向会干这一代有两个技术点比那些能力描述更值得琢磨。一是新推理技术 recurrent depth递归深度。据 The Information、TechCrunch 等报道这种推理方式会遮蔽模型部分甚至全部的思维链chain of thought让外部很难观察它到底怎么想的。带来的直接问题是可监控性以前模型答错了还能看推理过程找原因现在这一层变黑了出错排查会更难。安全专家对此有担忧这大概是它被做成受限版本的原因之一——能力越强越需要边界。二是训练规模。OpenAI 研究副总裁对媒体透露这是公司迄今最大的一次预训练首次在得州 Stargate 站点用超过 10 万块 GPU 跑。算力军备竞赛到这个量级基本宣告小团队自己训前沿模型这条路彻底关上了。和之前比变了什么、没变什么变了的是竞争维度两三年前大家比的是 MMLU 分数后来比推理题现在直接比能不能替人把活干完。Astra 主打的 computer use操作电脑和长程任务执行就是奔着数字杂活自动化去的。没变的是套路还是厂商自报 benchmark、媒体跟进解读、用户排队试用的循环。就在同一周谷歌也发布了 Gemini 3.8 Flash主打软件工程和 Agent 任务——头部厂商的发布节奏和营销话术跟上一代没什么两样。对普通开发者意味着什么说点实际的。如果官方描述大体成立最先被 Astra 这类模型接管的大概率不是写代码而是**点鼠标型的数字杂活**填表单、录数据、整理文件夹、在系统间搬运信息。做过企业软件的都懂这类活在公司里数量巨大以前靠人肉现在有了会操作电脑的模型流程自动化的门槛会明显降低。对写代码的人来说影响分成两面利好Codex 这类编程 Agent 有了更强的大脑多文件改造、跑测试、修 bug 的完整链条更可能自动跑通人盯关键节点就行压力当填表、整理、搬运这类岗位技能被模型覆盖靠这些技能吃饭的岗位会先被压缩。不用恐慌但可以提前想一步自己手里哪些活是模型短期内替不了的。怎么用、怎么选、有哪些坑想尝鲜的话据报道 Astra 已向 ChatGPT 的 Pro、Enterprise、Business Premium 用户在 Work 和 Codex 中开放API 也已经上线。具体调用方式和模型标识以官方文档为准别信二手教程里的隐藏参数。几个建议从低风险任务试起。让它整理文档、生成代码草稿、填标准格式的表单涉及付款、发消息、删文件这类不可逆操作先别放手。关键任务留人工复核。思维链被遮蔽之后它为什么这么做可能说不清楚出错的排查成本比以前高。重要输出人得看一眼。等独立评测再下结论。目前第三方系统性评测还不多厂商自报的成绩先打折看。等 SWE-bench 这类榜单的独立复测出来再决定要不要换。做安全研究的朋友注意边界。受限版本会拒绝部分网络安全类请求高级安全能力据报道只向特定测试组开放别在合规边缘试探。一句话总结Astra 把AI 替你干活从演示推向了产品化这对打工人是效率工具也是岗位边界的重新划分。只是干活出了错、责任算谁的目前还没有答案。你怎么看评论区聊聊。
返回列表