美國人工智能公司OpenAI當地時間9月3日宣佈推出新一代前沿模型GPT-6 Astra,並在官方聲明中稱其為「全球最智能、對齊最好的模型」。這是該公司繼今年7月公開GPT-5.6家族後,不到兩個月再次上新旗艦。模型即日起向有限機構開放,隨後數日將陸續進入ChatGPT Plus、Pro、Business、Enterprise,以及OpenAI API和亞馬遜雲科技。
OpenAI官方賬號寫道:「GPT-6 Astra在電腦操作、瀏覽、軟件工程、網絡安全、科學和專業工作上達到新的最先進水平。」公司稱Astra集合了預訓練、強化學習和對齊多年投入,口號是:「你能在電腦上做的事,Astra都能替你做。」
OpenAI總裁格雷格·布羅克曼(Greg Brockman)認為世界已進入AGI時代「並非不合理」,並稱未來回看時,人們或許會把此刻乃至Astra視為AGI到來的時間點。
OpenAI CEO山姆·奧特曼(Sam Altman)也發文表示,希望Astra能夠開啓「新一代的創業、科學發現與創造」。他在接受採訪時稱,Astra在主觀體驗上與此前任何模型都非常不同,這是第一個讓他覺得可以放心讓用戶直接「試一試」的模型。
據OpenAI公佈的評測,Astra在FrontierMath第四檔拿到98%,並稱已協助解決若干長期未決的數學問題;在ARC-AGI-3上得分99.9%,在ExploitBench上拿到滿分。公司還稱其在Terminal Bench 4.0編碼基準上得到57.9%,在衡量智能體能力的Agent's Last Exam上得到59.3%,均高於上一代旗艦GPT-5.6 Sol。科學與健康評測Terminal-Bench Science 0.1、HealthBench Pro也被其稱為新高。不過,這些數字目前主要來自公司自評。
OpenAI把Astra的賣點放在「會用電腦」的智能體能力:上網、操作軟件、寫代碼、做網絡安全和科研流程,而不是只聊天。面向開發者的API定價為每百萬輸入token 10美元、每百萬輸出token 50美元,明顯高於GPT-5.6 Sol當時的5美元/30美元檔,說明公司把它當成更高一層的旗艦,而不是平替。9to5Mac稱,Astra將同時升級ChatGPT與編程產品Codex。
這不是一次普通的例行迭代。8月,OpenAI曾因旗下模型入侵開源平台Hugging Face而放緩前沿模型開發。維基百科等公開記錄顯示,公司9月1日確認未發佈的Astra已觸及關鍵網絡能力門檻,可能帶來網絡安全風險,但仍按計劃於9月3日推出。今年夏天GPT-5.6首次亮相時,也曾應美國政府要求先做有限預覽,7月9日才對公眾開放。Engadget據此猜測,Astra或許會是OpenAI一段時間里最後一次重大模型發佈。
GPT-5.6於6月26日預覽、7月9日公開展開,分成Sol(旗艦)、Terra(均衡)、Luna(低價)三檔,強調編碼效率和網絡安全。獨立評測機構Artificial Analysis當時顯示,Sol在綜合智力指數上並不穩坐第一,Claude Opus 5、Fable 5等對手曾領先或接近。OpenAI此番直接跳到GPT-6並改用星座名Astra,等於用新一代命名和「世界第一」話術,重新爭奪旗艦敘事。真正能不能壓過對手,仍要看上線後的獨立基準和真實辦公、編碼場景。
第三方獨立測試為官方敘事提供了一些不同視角。在Artificial Analysis的通用智能獨立測試Intelligence Index v4.1.1中,Astra max得分為61分,與GPT-5.6 Sol max持平,低於Anthropic Claude Fable 5.1的66分。部分提前獲得內測資格的開發者反映,Astra並非在智能上遙遙領先,但其環境理解和操作能力彌補了這一短板。
此外,ARC-AGI-3的99.9%成績是在OpenAI自有Provider Adapter配置下取得的,在標準測試框架下得分降至62.7%。FrontierMath所處的Epoch AI也表示,OpenAI資助了該基準的開發,並對其部分題目擁有獨佔訪問權。
Astra會不會像口號那樣「什麼電腦活都能幹」,要等有限機構試用結束後,才有更扎實的答案。