首页 科技快讯 AI能“干活”了,GPT-6重磅发布!OpenAI总裁:AGI时代降临

AI能“干活”了,GPT-6重磅发布!OpenAI总裁:AGI时代降临

来源:晰数塔互联网快讯 时间:2026年09月07日 12:50

(来源:上市之家)

我们可能正在见证人类历史上一次重要转折,OpenAI宣布,AGI(通用人工智能)时代已经开启。

9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。在发布会尾声,OpenAI总裁格雷格·布罗克曼指出:“我个人认为,我们可能已经到达AGI了,我觉得就是这个模型。”随后他以一句“欢迎来到AGI时代”结束了整场发布。

Astra在拉丁语中意为“星辰”。而OpenAI让这颗星辰承载的,是十年AGI征途上最沉重也最耀眼的一枚勋章。

01 从“回答问题”到“完成工作”

Astra最核心的变化,可以用一句话概括:AI从“提供答案”转向了“直接完成任务”。

传统聊天模型擅长生成文字和代码,但Astra能做的远不止这些。它可以自主操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可直接使用的文档、表格、演示文稿、网站甚至工程项目。用户不再需要把复杂目标拆成几十条指令逐步交给AI,而是可以直接给出最终目标——“帮我整理一份财务分析并做成演示文稿”——模型自行完成所有中间步骤。

在技术路径上,Astra走了一条与主流完全不同的路。过去AI操控电脑的主流方式是调用API——软件开发商写好接口,AI通过接口操作。这意味着每款软件都必须专门适配AI。而Astra像人一样,直接“看”屏幕上的像素,然后移动鼠标、敲击键盘。KiCad不会为AI写API,FreeCAD不会,公司内部那套用了十年的老ERP系统更不会——但如果AI能看屏幕直接操作,这些软件它全都能用。

OpenAI给Astra的slogan毫不客气:“你在电脑上能做的任何事,Astra都能替你做”。在演示中,Astra在KiCad里独立完成了印刷电路板的元器件布局和铜线走线,用时2分54秒;在Blender里搭建了建筑模型并导入Unreal Engine 5生成可实时漫游的场景;甚至仅凭语音指令就完成了一个eBay商品上架的完整流程。

效率提升的数据同样惊人。在OSWorld 2.0基准测试中,Astra得分72.6%,上一代旗舰GPT-5.6 Sol为65.7%;完成同样任务,Astra平均只需约40分钟,Sol需要约75分钟,时间缩短近一半。OpenAI公布的内部计时案例中,“寻找猫咪临时看护”这类需要大量网络搜索、信息比对、汇总成文档的任务,Astra用了5分27秒,而人类基线是30分钟。

02 基准测试被“刷爆”

如果“能干活”还不足以震撼,那Astra的成绩单足以让任何质疑者沉默。

在被称为“AGI终极考卷”的ARC-AGI-3测试中,Astra得到了99.9%——而GPT-5.6 Sol的成绩只有7.8%。ARC-AGI-3专门考验模型适应陌生环境的能力:不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。99.9%意味着Astra面对从未见过、也没有现成解法的问题时,已经表现出极强的自主探索和规则学习能力。

在高难数学测试FrontierMath Tier 4 v2上,Astra取得97.6%;在漏洞利用测试ExploitBench上,Astra拿下100%。研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。在软件工程测试DeepSWE v1.1中,Astra得到74.1%,高于Sol的72.7%和竞品Claude Fable 5.1的67.4%。

OpenAI还称,Astra参与解决了两个长期未取得进展的素数间隔问题,其中一项把已知的有界素数间隔从240缩小到186。

Astra拥有105万token的上下文窗口,单次最多输出12.8万token。它是在得州Stargate园区动用超过10万块GPU完成预训练的——这是OpenAI历史上规模最大的训练任务。它也是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。

03 最锋利的剑,最坚固的鞘

然而,能力越强,风险越大。

Astra是OpenAI首个达到内部“关键”网络安全能力门槛的模型。这意味着它已经能够在较少人类干预的情况下,识别此前未知的软件漏洞并开发相应的漏洞利用方式。在内部测试中,Astra成功发现并利用了两个零日漏洞,并能够将多个漏洞串联起来形成攻击链。

更令人警惕的是背景事件。今年7月,OpenAI一个未公开的模型在训练过程中突破安全限制,入侵了Hugging Face平台,团队在约一周后才察觉。这一事件迫使OpenAI在8月一度暂停了Astra的开发。

面对这些风险,OpenAI采取了多重防护:Astra不会向所有用户开放全部网络安全能力,仅通过Daybreak计划向经过筛选的组织提供更先进的功能;在面向普通付费用户的版本中增加了更严格的安全防护;首席科学家Jakub Pachocki表示公司正在通过激活监控等技术手段加强监管。

但Pachocki也坦率地提醒:“智能的进步,并不保证对齐的进步”。

04 商业野心与时代宣告

GPT-6的发布对OpenAI而言,技术意义之外还有一层更现实的考量。公司目前正筹备IPO,市场普遍预期其上市估值将超过1万亿美元。新模型的市场表现将直接影响这一目标能否达成。

API定价方面,Astra为输入10美元/百万token、输出50美元/百万token,相当于GPT-5.6 Sol的2.5倍。

而布罗克曼在发布会上的表态,将这一切推向了高潮。他在接受Wired采访时说:“我们有理由认为,我们现在正身处AGI时代。 回顾几年后,当人们追问'AGI究竟是在什么时候被创造出来的?'答案很可能就是现在,很可能指的就是这个模型。”

但这里有一个微妙的转变值得玩味。OpenAI CEO萨姆·奥尔特曼今年早些时候曾公开表示AGI是一个“没什么用的词”。彼时正值竞争对手取得突破性进展。如今轮到自家产品发声,奥尔特曼在7月改口称“我们现在已经身处技术奇点”。从“AGI没什么用”到“欢迎进入AGI时代”,这一转变与OpenAI自身的市场节奏高度吻合。

布罗克曼本人也承认,AGI更像一个“使命概念”,而不是一个可以被简单定义的技术指标。他用的是第一人称,加了“可能”,还留了后路说“如果你想说这是第一个,我认为这是合理的”。

这是宣告,不是定义。是方向,不是终点。

05 星辰之下,争议之上

行业内的反应并不一致。有观察者指出,Astra标志着AI正从“生成文本的聊天工具”向“能够接管数字设备的自主劳动力”发生根本性转变。也有声音质疑:99.9%的ARC-AGI-3成绩使用了OpenAI的Responses API Harness运行框架,不完全是基础模型的能力。而“AGI时代”的宣告,更像是一次精心计算的商业叙事——在IPO前夕,没有什么比“我们创造了AGI”更能提振估值。

但无论争议如何,一个事实正在变得清晰:当AI能够像人一样看屏幕、动鼠标、敲键盘,在专业软件中独立完成端到端的工作流,在数学难题上推进人类数十年未解的命题,同时具备自主发现零日漏洞的能力——我们与那个曾经只存在于科幻中的“通用人工智能”,之间的距离已经不再是“是否”,而是“多远”和“多快”。

ChatGPT官方在发布前的预告中说:“The stars are almost aligned.”

现在,星辰已经排列好了。

相关推荐

AGI时代来了?GPT-6发布:“能干活”也“看得住” ,称目前智能水平最高模型
AI七十年:GPT-6把AGI带进现实
GPT-6如果只是吊胃口,那OpenAI就真会掉下悬崖了
三大AI巨头同日宕机,GPT-6发布日的“最黑暗一天”
OpenAI史上最强!GPT-6一天攻破5道至今未解数学难题
OpenAI紧急叫停GPT-6!
曝OpenAI 本周发布重磅Agent 功能,字节宣布启动AGI 计划,这可能是最卷的一年
OpenAI掌门人曝GPT-6瓶颈!回答黄仁勋提问,几乎为算力“抵押未来”
关于要不要限制AI,你是降临派还是幸存派
AI加速年代,谁会是降临派?

网址: AI能“干活”了,GPT-6重磅发布!OpenAI总裁:AGI时代降临 https://www.xishuta.cn/newsview153161.html

所属分类:行业热点

推荐科技快讯