OpenAI का नया GPT-6 Astra, AGI टेस्ट में 99.9% स्कोर से सबको पीछे छोड़ा
OpenAI ने लॉन्च किया GPT-6 Astra, AGI बेंचमार्क पर हासिल किया लगभग परफेक्ट स्कोर OpenAI ने GPT-6 Astra रिलीज़ कर दिया है, जिसे कंपनी "दुनिया का सबसे इंटेलिजेंट और aligned मॉडल" बता रही है।
OpenAI ने लॉन्च किया GPT-6 Astra, AGI बेंचमार्क पर हासिल किया लगभग परफेक्ट स्कोर
OpenAI ने GPT-6 Astra रिलीज़ कर दिया है, जिसे कंपनी "दुनिया का सबसे इंटेलिजेंट और aligned मॉडल" बता रही है। इसने Provider Adapter harness का इस्तेमाल करते हुए ARC-AGI-3 बेंचमार्क पर 99.9% स्कोर हासिल किया है। मॉडल ChatGPT Plus, Pro, Business और Enterprise यूज़र्स के लिए रोल आउट हो रहा है, साथ ही OpenAI API, Microsoft Azure और AWS Bedrock के ज़रिए भी उपलब्ध है।
बेंचमार्क परफॉर्मेंस ने बनाए नए रिकॉर्ड
Astra ने FrontierMath Tier 4 पर 98% स्कोर के साथ saturate कर दिया है और गणित की लंबे समय से अनसुलझी समस्याओं को हल करने में पहले ही मदद कर चुका है। मॉडल ने Terminal-Bench Science 0.1 पर 64.6% स्कोर हासिल किया, जो Claude Fable 5.1 के 52.6% से ज़्यादा है और लगभग 31% कम अनुमानित API cost पर। GPQA Diamond पर, जो biology, chemistry और physics में ग्रेजुएट-लेवल साइंटिफ़िक रीज़निंग टेस्ट करता है, Astra ने 96.0% हासिल किया।
मॉडल ने सॉफ्टवेयर इंजीनियरिंग में शानदार बढ़त दिखाई, Terminal-Bench 4.0 पर 57.9% स्कोर किया जबकि GPT-5.6 Sol का 37.3% और Claude Fable 5.1 का 55.8% था, और यह क्रमशः लगभग 9% और 63% कम अनुमानित API cost per task पर।
कंप्यूटर यूज़ और प्रोफेशनल काम
GPT-6 Astra वह है जिसे OpenAI "कंप्यूटर यूज़ की स्पीड, accuracy और safety में नया फ्रंटियर" कह रही है। यह ऑनलाइन फॉर्म भर सकता है, CRM सिस्टम में कस्टमर रिकॉर्ड अपडेट कर सकता है, कैलेंडर ऑर्गनाइज़ कर सकता है, रिसर्च कर सकता है, साइंटिफ़िक डेटा का analysis कर सकता है, plots जनरेट कर सकता है, वेबसाइट बना सकता है और सॉफ्टवेयर को खुद से इंस्टॉल और टेस्ट कर सकता है।
Agents' Last Exam पर, जो फाइनेंशियल मॉडलिंग से लेकर इंजीनियरिंग और मीडिया प्रोडक्शन तक के रियल सॉफ्टवेयर में जटिल प्रोफेशनल टास्क टेस्ट करता है, Astra ने 59.3% स्कोर किया जबकि Claude Opus 5 का 55.5% और GPT-5.6 Sol का 53.6% था, और Opus 5 की तुलना में लगभग 65% कम output tokens का इस्तेमाल किया।
OSWorld 2.0 पर latency simulations में, Astra ने प्रति टास्क लगभग 40 मिनट में 72.6% हासिल किया जबकि GPT-5.6 Sol ने लगभग 75 मिनट में 65.7%, यानी प्रति टास्क 47% कम समय। Codex harness के अपडेट के साथ मिलाकर, यह Mind2Web बेंचमार्क पर 1.9x फास्ट टास्क completion में बदल जाता है।
गणित की बड़ी उपलब्धियां और साइंटिफ़िक डिस्कवरी
Astra ने प्राइम नंबरों के बीच gaps पर दो नतीजों को आगे बढ़ाने में योगदान दिया। मॉडल ने स्थापित करने में मदद की कि primes के असीमित जोड़े 186 की दूरी के भीतर होते हैं, जो पहले की 240 की सीमा से बेहतर है। इसने primes के बीच असामान्य रूप से बड़े gaps पर एक bound में एक term को भी बेहतर किया जो 80 साल से ज़्यादा समय से unchanged था।
BenchCAD पर, जो टेस्ट करता है कि क्या मॉडल CAD code जनरेट करके multi-view renders से 3D objects को reconstruct कर सकते हैं, GPT-6 Astra with tools ने 95.9% geometric-overlap स्कोर हासिल किया जबकि GPT-5.6 Sol का 83.3% और Claude Fable 5.1 के लिए रिपोर्ट किया गया 84.3% था, और Sol से लगभग 43% कम API cost और Fable 5.1 से 86% कम पर।
क्रिटिकल साइबरसिक्योरिटी क्षमताएं
Astra साइबर क्षमताओं में "बड़ी छलांग" है और OpenAI के Preparedness Framework के तहत साइबरसिक्योरिटी में Critical threshold को पूरा करता है। ExploitBench पर, Astra ने परफेक्ट 100% स्कोर हासिल किया जबकि GPT-5.6 Sol का 78.5% था। ExploitGym पर, इसने 42.4% सक्सेस रेट हासिल की जबकि GPT-5.6 Sol का 30.3% था और काफी कम output tokens का इस्तेमाल किया।
पिछले तीन महीनों की vulnerabilities का इस्तेमाल करते हुए एक internal "ExploitBench (June, August 2026)" पर evaluation के दौरान, Astra ने दो पहले से अनजान zero-day vulnerabilities को खोजा और इस्तेमाल किया। एक्सपर्ट-led assessments में पाया गया कि Astra, जब production safeguards के बिना चलाया जाता है, तो hardened browsers में arbitrary code execution हासिल करने के लिए पहले से अनजान vulnerabilities का इस्तेमाल कर सकता है और hardened operating systems के लिए privilege-escalation exploits बना सकता है।
लॉन्च हो रहे वर्ज़न में पाबंदियां हैं: यह vulnerabilities के लिए proof-of-concept exploits बनाने जैसे एडवांस्ड साइबरसिक्योरिटी टास्क को पूरा करने से मना कर देगा, हालांकि defenders इसे सिक्योर code review और patching के लिए इस्तेमाल कर सकते हैं। OpenAI Daybreak के ज़रिए, कंपनी vulnerability validation, malware analysis और detection engineering सहित ज़्यादा defensive workflows को enable करने के लिए कम restrictive safeguards के साथ एक्सेस बढ़ाने की योजना बना रही है।
Alignment और सेफ्टी में तरक्की
OpenAI Astra को अपना "सबसे aligned मॉडल" बता रही है जिसमें यूज़र intent और मॉडल बिहेवियर को समझने में काफी सुधार हुआ है। Hugging Face incident से सूचित एक evaluation में जो टेस्ट करता है कि क्या एक मुश्किल या नामुमकिन टास्क का सामना करने वाला मॉडल अपने intended scope से आगे जाएगा, GPT-5.6 Sol बिना production safeguards के 48% बार authorized target से आगे गया, जबकि GPT-6 Astra ने ऐसा 0% मामलों में किया।
एक internal evaluation में, Astra ने कभी भी Codex Auto-Review denial को circumvent करने की कोशिश नहीं की, तब भी जब Auto-review को जानबूझकर evadable configure किया गया था और टास्क को अन्यथा पूरा करना नामुमकिन था। एक evaluation में, Astra अपनी capabilities और affordances के बारे में गलत representations करने की GPT-5.6 Sol की तुलना में तीन गुना कम संभावना रखता है।
OpenAI Astra-class मॉडल के लिए production में misalignment monitoring डिप्लॉय कर रही है, जिसमें classifiers का एक सिस्टम शामिल है जो मॉडल की reasoning और actions को unauthorized behavior के लिए चेक करते हैं और potentially unauthorized activity को automatically रोक देते हैं। एक्स्ट्रा सेफ्टी चेक कभी-कभी legitimate काम को slow, pause या stop कर सकते हैं, और यूज़र्स को जारी रखने से पहले action को review करने के लिए कहा जा सकता है।
ARC-AGI-3 परफॉर्मेंस analysis
ARC-AGI-3 पर, जो novel, abstract, turn-based environments के ज़रिए agentic intelligence टेस्ट करता है जहां agents को बिना explicit instructions के explore करना, goals का अनुमान लगाना और internal models बनाना होता है, Astra ने state-of-the-art नतीजे हासिल किए। Standard harness के साथ, Astra (max) ने ARC-AGI-3 Semi-Private पर $26,000 में 62.7% स्कोर किया, जबकि Provider Adapter harness के साथ, Astra (high) ने $19,000 में 99.9% स्कोर किया।
Astra (max) ने 96.0% levels पर human baseline से कम actions का इस्तेमाल किया और औसतन प्रति level 51.7% कम actions का इस्तेमाल किया, जिसे ARC Prize "एक material milestone" बताता है। इसका मतलब है कि ARC-AGI-3 के action efficiency के measure से, Astra ने human parity को match किया और उससे आगे निकल गया।
PRO-LONG harness में, एक एडवांस्ड सेटअप जहां Astra के पास custom code execute करने के लिए sandbox का एक्सेस था, researchers ने इसे हर game के लिए custom tools बनाते देखा: board parsers, game-state models, search algorithms, planners और persistent notes। Astra के नतीजों के बावजूद, ARC Prize ने स्पष्ट किया कि जबकि यह generalization की दिशा में meaningful progress है, वे दावा नहीं कर रहे कि यह AGI है।
प्राइसिंग और उपलब्धता
developers के लिए, GPT-6 Astra OpenAI API में gpt-6-astra के रूप में उपलब्ध है। OpenAI API Standard pricing $10 प्रति million input tokens और $50 प्रति million output tokens है, cache reads और writes के लिए अलग rates लागू होते हैं। Fast mode Standard processing की स्पीड से 2x तक deliver करता है और Standard price से 2x पर।
अक्सर पूछे जाने वाले प्रश्न
GPT-6 Astra क्या है और इसे OpenAI ने कब लॉन्च किया?
GPT-6 Astra OpenAI का नया AI मॉडल है जिसे 'दुनिया का सबसे इंटेलिजेंट और aligned मॉडल' बताया जा रहा है। यह ChatGPT Plus, Pro, Business और Enterprise यूज़र्स के लिए, साथ ही OpenAI API, Microsoft Azure और AWS Bedrock के ज़रिए उपलब्ध है।
GPT-6 Astra की बेंचमार्क परफॉर्मेंस कैसी है?
Astra ने ARC-AGI-3 बेंचमार्क पर 99.9% स्कोर हासिल किया है। इसने GPQA Diamond पर 96%, Terminal-Bench Science पर 64.6%, और FrontierMath Tier 4 पर 98% स्कोर किया है।
GPT-6 Astra कंप्यूटर पर क्या काम कर सकता है?
यह ऑनलाइन फॉर्म भर सकता है, CRM सिस्टम में रिकॉर्ड अपडेट कर सकता है, कैलेंडर ऑर्गनाइज़ कर सकता है, रिसर्च कर सकता है, डेटा का analysis कर सकता है, plots जनरेट कर सकता है, वेबसाइट बना सकता है और सॉफ्टवेयर को खुद से इंस्टॉल और टेस्ट कर सकता है।
Astra ने गणित और साइंस में क्या खोज की है?
Astra ने prime नंबरों के बीच gaps पर दो नतीजों को आगे बढ़ाया है। इसने establish किया कि primes के असीमित जोड़े 186 की दूरी के भीतर होते हैं, जो पहले की 240 की सीमा से बेहतर है। इसने 80 साल से ज़्यादा समय से unchanged एक शर्त को भी बेहतर बनाया।
सबसे ज़्यादा पढ़ी गई
- 1
बहराइच में महिला की अश्लील तस्वीरों से ब्लैकमेल कर पांच लाख रुपये वसूलने वाला …
- 2
भाजपा ने निष्कासित नेता की सपा एंट्री पर अखिलेश यादव को घेरा
- 3
बहराइच: भावुक सुसाइड नोट लिखकर की युवक ने की आत्महत्या
- 4
गणेश प्रतिमा विसर्जन से पहले बहराइच में डीएम-एसपी ने सुरक्षा व्यवस्था का लिया जायजा
- 5
थाना रुपईडीहा क्षेत्र में शातिर अपराधियों से हुई रूपईडीहा पुलिस की मुठभेड़।
टिप्पणियाँ
अभी कोई टिप्पणी नहीं। पहली टिप्पणी करें।