OpenAI 发布 GPT-6 Astra,全球最强,AGI时代开启

发布时间:2026/9/6 1:49:57

OpenAI 发布 GPT-6 Astra,全球最强,AGI时代开启
家人们不负众望终于等到OpenAI的新模型了。今天凌晨OpenAI 正式发布了 GPT-6 Astra一个被OpenAI称为这是世界上最智能、最一致的模型。OpenAI联合创始人兼总裁Greg Brockman把它称为一次“代际跃迁”他留下了一句几乎注定会刷屏的话Welcome to the AGI era. 欢迎来到AGI时代。过去每一代模型发布科技公司都会说它更聪明、更强大。但这一次OpenAI 跳过了所有形容词直接给这件事定了性AGI 时代到了。这次发布的不只是 Astra 一个模型还有 Astra Pro、API以及 Codex 的一波更新。不过可惜的是客户端先向少量机构开放ChatGPT Plus、Pro、Business、Enterprise 用户会在接下来几天才能陆续拿到。Pro、Business和Enterprise 用户还将获得 GPT‑6 Astra Pro 。API标准价格为输入10美元/百万Token输出50美元/百万Token。是 GPT-5.6 Sol 当前促销价的 2.5 倍跟几天前 Anthropic 刚发的 Claude Fable 5.1 持平。◈划重点多项测试接近满分老规矩先看数据直接上最炸的几个数字。多项测试逼近满分OpenAI 自己用了一个词——饱和。 意思是榜单已经快测不出它的上限了。FrontierMath Tier 497.6%当前公认最难的数学测试集被视为人类顶尖数学家的难题高地Astra 几乎做满分。ExploitBench 漏洞利用100%GPT-5.6 Sol 是 78.5%测试过程中 Astra 发现并利用了两个此前未知的零日漏洞。ARC‑AGI‑399.9%测试AI 在从未见过的互动式任务中边玩边学的能力上一代GPT‑5.6 Sol只有7.8%这还是进步嘛直接换了一个物种。但是这个99.9%是有争议的因为 OpenAI 测 ARC-AGI-3 时给它配了一套自己的工具系统Responses API harness。相当于参加考试的不只是一个“裸模型”还带了代码执行和一堆解题工具。换 ARC Prize 官方标准环境Standard harness测Astra 的分数就掉到 62.7%。但就算把这个水分挤掉Astra 的强也还是实打实的因为它已经把能力用到了试卷外面。从 OpenAI 公布的成绩看Astra 的提升的能力同时覆盖电脑操作、编程、科学推理和复杂工作任务。尤其是在那些需要调用工具、连续执行多个步骤的测试里提升最明显。在测试软件开发、系统配置和数据分析能力的Terminal-Bench 4.0中Astra从上一代的37.3%提高到了57.7%。在要求AI使用代码、分析数据和运行模拟的Terminal-Bench Science中Astra则从22.4%提高到了64.6%。研究生水平科学推理测试GPQA Diamond得分96%。在要求AI跨多个软件完成商业流程的AutomationBench中GPT‑5.6 Sol的成绩为18.1%Astra提高到了41.4%。此外OpenAI 还公布了两项由 Astra 实际参与的数学研究。之前Astra 此前已经帮人类解决了十个被 OpenAI 称为菲尔兹奖级别的数学难题。这次又放出两个关于素数间隙的新结果。一项把“无穷多对素数之间的间隔上界”从过去卡了十多年的 240硬生生压到了 186另一项改进了一个 80 多年没人动过的结果。而且这次不是刷题刷题是回答有现成答案的问题这两项是让模型去证明别人从没见过的新结论。OpenAI 还把证明和验证材料都公开了。但是光看跑分Astra 已经聪明到快考不出区分度了。它真正不一样的地方在后面。◈更大的变化它开始自己操作电脑过去的 AI 告诉你该怎么做GPT-6 开始直接替你做。这就是 Astra 最核心的变化电脑操作。它不再只是输出文字或代码而是自己看屏幕、用鼠标键盘、进到真实软件里把一项多步骤任务从头干到尾。OpenAI把GPT‑6 Astra 称为“世界上最强的电脑操作模型”。在模拟真实电脑操作的 OSWorld 2.0中Astra获得72.6%GPT‑5.6 Sol为65.7%。在考查专业软件工作能力的Agents’ Last Exam中Astra获得59.3%高于上一代的53.6%。OpenAI还称在OSWorld 2.0的延迟模拟中Astra完成任务所需的时间比GPT‑5.6 Sol减少约47%。例如OpenAI 给 Astra 提供了一份汽车数据让它制作一张Power BI仪表盘。过去我们也可以把数据发给AI让它分析不同车型的价格、续航和效率。但AI给出分析后人还要亲自打开Power BI导入数据、选择字段、制作图表再调整版式。但是现在 Astra 自己进入Power BI完成这些操作。这次发布中最有视觉冲击力的案例从一个黄色圆圈开始。早期的AI按照人类指令在屏幕上画出一个简单的圆就已经足够令人惊讶。到了GPT‑6 Astra人类继续通过语音提出要求。黄色圆圈先变成一枚火箭随后又被继续制作成一款能够运行的3D游戏。在这个过程中Astra 需要理解连续指令、处理画面、修改程序、运行结果再根据屏幕上的反馈继续调整。OpenAI还展示了另一个案例Astra 先在 Blender中制作一栋房屋模型再把它变成 Unreal Engine 5中的可行走场景。设计师和客户可以直接进入这个虚拟空间提前查看房屋建成后的效果。◈最危险的能力OpenAI没有完全放出来GPT-6 Astra是OpenAI第一个在网络安全能力上达到“Critical”门槛的模型。Critical是OpenAI风险框架里的最高能力等级。在合适工具和访问条件下模型可以在人类不逐步指导的情况下寻找未知漏洞并为防护严密的系统开发新的利用方式。在2026年6月至8月新披露漏洞组成的内部ExploitBench上Astra成功率39%上一代Sol为11.5%在公开的ExploitBench上Astra已经拿到了100%。Astra最强的网络安全能力不会直接交给所有普通用户。OpenAI采用受控开放并把高风险能力放进Daybreak可信访问体系。◈十万块 GPU 训练AI 开始训练 AIAstra 为什么这么强OpenAI 为 Astra 动用了迄今规模最大的训练任务在得州星际之门超算上使用超 10 万块 GPU。OpenAI 训练副总 Aidan Clark 透露这是 OpenAI 首款由此前模型在「训练监督」中发挥重要作用的前沿模型。到 Astra 训练后期系统可以自主连续运行大半天即便出现问题AI 往往几秒后就能让训练继续推进。这是 OpenAI 历史上第一次AI 开始参与维护训练 AI 的系统。这一刻可以称之为「递归式自我改进RSI」的雏形。一旦这条链路继续扩大模型迭代速度的瓶颈就会从人类工程团队的工作时长转向算力、实验设计和安全验证本身。◈它也更知道什么时候应该停手OpenAI称Astra不仅能力更强也比上一代模型更能遵守用户设置的权限边界。在电脑操作安全测试中Astra产生不当结果的比例为2.4%。加上自动审核机制后进一步下降到1.8%。在另一项测试中研究人员故意为模型设置了无法在授权范围内完成的攻击任务。GPT‑5.6 Sol在没有生产安全措施的情况下有48.2%的任务会越出指定目标。GPT‑6 Astra则是0%。简单来说当一件事无法按照规则完成时过去的模型有时会尝试寻找绕过限制的方法。Astra更倾向于停下来告诉用户做不了或者要求用户提供必要权限。这可能是电脑操作智能体最重要的能力之一。毕竟面对一个能够控制浏览器、文件和终端的AI我们不仅需要关心它能不能把事情做成。还必须关心它知不知道哪些事情不应该做。不过OpenAI也主动披露了一个问题Astra在部分测试中的书面推理比GPT‑5.6 Sol更难监控。一种可能的原因是更强的模型可以用更少的文字步骤完成任务。它不再需要把整个过程都写出来人类能够看到的中间推理自然也会减少。这形成了一个有些微妙的局面Astra在行为测试中更少越权但人类可能越来越难从它写出的推理过程里判断它为什么作出某个决定。◈从一次操作到持续交付它越来越像项目同事过去的AI更像一个隔着屏幕给建议的顾问。Astra 则开始像一个可以亲自进入软件把项目继续向前推进的同事。游戏公司Playco 就是一个很好的例子。Playco 把Astra接入了一套能够连接Unity和Godot游戏引擎的开发环境。在这个环境里Astra可以编辑游戏场景、运行游戏、检查修改是否生效、发现问题再重新调整。Playco 用同一套基础场景制作了三个不同主题的游戏原型。该公司称大部分原型第一次就能正常运行。与此前使用的模型相比需要人工修复的地方减少了50%。Astra开始形成一套完整的工作循环先做出来运行一遍检查结果发现问题再继续修改。与此同时Codex还为 Astra 加入了一套长任务不失忆的机制。以前任务超过上下文窗口后模型往往只能把过程压缩成摘要关键细节就丢了。现在 Astra 可以跨窗口保存项目笔记搜索之前的对话和测试结果做到一半也不容易忘了前面提过的要求。◈AGI到了吗能力跃迁成立历史定性仍待验证如果只看OpenAI公布的结果GPT‑6 Astra确实足够惊人。它把多项推理和数学测试推到接近满分参与推进真实数学研究能够操作电脑、使用专业软件还可以运行、检查并修改自己制作的程序。它显然不再只是一个知识丰富的聊天机器人。GPT‑6 Astra 未必是 AGI最终到来的时刻。但它很可能标志着另一个时代真正开始AI正在从一个回答问题的工具变成一个可以进入电脑、参与现实工作的行动者。

相关新闻

PHP的异步编程该怎么选择

PHP的异步编程该怎么选择

2026/9/6 1:49:57

PHP 的传统执行模型是同步的,这意味着代码按照语句出现的顺序逐条执行。这本身并非问题,因为同步思维往往更为简单。 当要求 PHP 开发者实现 SQL 分页展示时,他们通常会先执行一条统计总数的查询,再执行第二条查询获取当前页的数…

java——顺序表ArrayList与链表LinkedList

java——顺序表ArrayList与链表LinkedList

2026/9/6 1:49:57

一.引言 通过本篇博客,学者将深刻认识到顺序表ArrayList与链表LinkedList的区别和使用方法,文章将通过对概念的深度解析,用通俗易懂的白话讲清了两者的关系和使用场景。 二.目录 1,线性表 2.顺序表 3.何为ArrayList? 4.Arra…

本地网关:解锁 Codex 与 Claude Code 的多模型自由路由

本地网关:解锁 Codex 与 Claude Code 的多模型自由路由

2026/9/6 1:49:57

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Vibe Coding实战:自然语言驱动AI编程的技巧与避坑指南

Vibe Coding实战:自然语言驱动AI编程的技巧与避坑指南

2026/9/6 7:00:11

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Python课设:基于协同过滤与Tkinter的母婴商品推荐系统

Python课设:基于协同过滤与Tkinter的母婴商品推荐系统

2026/9/6 7:00:11

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

图灵完备2.0:从基础理论到编程实践的完整解析

图灵完备2.0:从基础理论到编程实践的完整解析

2026/9/6 7:00:11

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

AI辅助Web应用开发实战:从生成代码到交付高品质工程

AI辅助Web应用开发实战:从生成代码到交付高品质工程

2026/9/6 7:00:11

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Pi编程Agent实战:从安装配置到工程实践的完整指南

Pi编程Agent实战:从安装配置到工程实践的完整指南

2026/9/6 7:00:11

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

V多功能电法仪培训教案:从原理到实操的完整认知链设计

V多功能电法仪培训教案:从原理到实操的完整认知链设计

2026/9/6 6:50:10

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

2026/9/6 1:19:56

本文首发于“生态学者”!从“湿地面积”到“土壤碳密度”:为什么需要重新认识潮汐湿地蓝碳变化?潮汐湿地位于陆地与海洋的交汇地带,包括红树林、盐沼和潮滩,是全球重要的蓝碳生态系统。其土壤能够长期储存大量有机碳&a…

adb抓包

adb抓包

2026/9/6 1:19:56

前言 本文介绍如何通过 tcpdump 在 Android 手机上抓取网络数据包,并在电脑端使用 Wireshark 进行分析。适用于需要排查 App 网络请求、分析接口调用或调试网络问题的开发与测试场景。1. 手机要有 root 权限2. 下载 tcpdump3. adb push C:\Users\zhangkuixun\Downlo…

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

2026/9/6 1:19:56

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战 在云原生基础设施中,容器镜像体积直接决定了服务的部署速度与弹性扩容敏捷度。对于传统的 Go / Java 微服务,镜像体积通常被严格控制在 50MB 到 200MB 以内,拉取镜像只…

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

2026/9/6 1:19:56

本文首发于“生态学者”!从“湿地面积”到“土壤碳密度”:为什么需要重新认识潮汐湿地蓝碳变化?潮汐湿地位于陆地与海洋的交汇地带,包括红树林、盐沼和潮滩,是全球重要的蓝碳生态系统。其土壤能够长期储存大量有机碳&a…

adb抓包

adb抓包

2026/9/6 1:19:56

前言 本文介绍如何通过 tcpdump 在 Android 手机上抓取网络数据包,并在电脑端使用 Wireshark 进行分析。适用于需要排查 App 网络请求、分析接口调用或调试网络问题的开发与测试场景。1. 手机要有 root 权限2. 下载 tcpdump3. adb push C:\Users\zhangkuixun\Downlo…

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

2026/9/6 1:19:56

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战 在云原生基础设施中,容器镜像体积直接决定了服务的部署速度与弹性扩容敏捷度。对于传统的 Go / Java 微服务,镜像体积通常被严格控制在 50MB 到 200MB 以内,拉取镜像只…

远程协作的工作台整理

远程协作的工作台整理

2026/9/3 6:56:24

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/4 7:42:10

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/5 23:14:13

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…