NILE尼羅財經
張美妮

OpenAI發布GPT-6 Astra,程式碼能力宣稱超車Claude,但獨立測試現分歧

OpenAI於9月3日向部分企業用戶開放GPT-6 Astra,執行長Sam Altman稱其為「世界上最好的模型」。官方公布的基準測試成績亮眼,但第三方機構Artificial Analysis的獨立測試顯示,Astra僅在程式碼相關任務上領先,綜合智力指數仍落後Claude Fable 5.1。發布首波僅開放少數企業,付費Pro用戶未被優先納入,Altman隨後公開道歉。

Advertisement728×90

發布:時隔多月的旗艦更新,先給企業用戶

OpenAI於9月3日向部分受邀企業(Daybreak organizations)開放GPT-6 Astra,執行長Sam Altman在X上稱其為「世界上最好的電腦操作、專業工作、科學、程式與資安模型」,並表示這次發布「多花了一些時間」,是為了讓模型的能力等級符合公司內部的安全與對齊標準,而非單純比拼算力。這是OpenAI繼GPT-5.6 Sol之後,時隔多月的首次重大旗艦更新。

官方基準測試:成績單亮眼

OpenAI公布的自家測試結果包括:FrontierMath Tier 4達98%,ARC-AGI 3達99.9%,ExploitBench達100%。在程式碼能力方面,OpenAI稱在DeepSWE v1.1(衡量真實程式碼庫複雜任務的基準)上,Astra排名領先GPT-5.6 Sol與Claude Fable 5.1,並將其定位為「至今最擅長軟體工程的模型」。

第三方測試:程式碼領先,綜合能力仍落後Claude

獨立評測機構Artificial Analysis的結果則呈現分歧局面。在其Coding Agent Index(程式碼代理能力指數)上,Astra取得67.0分,優於GPT-5.6 Sol的65.1分,確實有進步。但在涵蓋更廣泛能力的Intelligence Index(綜合智力指數)上,Astra僅拿下61.2分,與舊款GPT-5.6 Sol的60.9分幾乎持平,不僅落後Meta的Muse Spark 1.3,也落後目前排名居前的Claude Fable 5.1。換句話說,Astra在特定的程式任務基準上確有優勢,但尚未如OpenAI官方敘事般全面超車。

發布爭議:付費用戶反而排在後面

Astra首波僅開放給少數受邀企業客戶,付費訂閱的Pro用戶並未被優先納入,引發不小反彈。Sam Altman隨後在X上為「混亂的開放節奏」公開道歉,承諾後續擴大開放時Pro用戶將優先取得存取權;團隊成員Tibo Sottiaux並宣布,Pro帳號每多等一天才拿到Astra存取權限,將補償一次額度重置作為彌補。目前OpenAI尚未公布Astra全面開放的明確時間表。

Advertisement300×250

你可能也想讀

免責聲明

本文內容由 AI 輔助生成或人工整理發布,僅供資訊參考與教育用途,不構成任何投資建議、招攬或保證。文中提及之個股、市場數據或趨勢分析,可能因時效性、資料來源誤差而與實際情況有所出入,NILE market(尼羅財經)不保證其正確性、完整性或即時性。投資人應自行判斷並承擔投資風險,於做出任何投資決策前,請諮詢專業財務顧問。本站不對任何因使用或依賴本文內容所導致之損失負責。